5462 条条目 · 106 个活跃源
2026年6月3日
04:00
arXiv cs.AI

从答案到状态:大型语言模型中化学推理的可验证过程级评估

提出ChemCoTBench-V2基准,用规则验证化学推理步骤,发现模型答案正确但推理逻辑不一致。

04:00
arXiv cs.AI

BigFinanceBench:面向金融研究智能体的流程导向基准

提出BigFinanceBench基准,含928项金融研究任务,评估完整推导流程,最佳模型得分58.8%,存在提升空间。

04:00
arXiv cs.AI

EvoDS:具有技能学习和上下文管理的自进化自主数据科学智能体

EvoDS通过自主技能获取与自适应上下文压缩,实现28.9%性能提升并消除令牌溢出。

04:00
arXiv cs.AI

想象性感知令牌增强多模态语言模型的空间推理能力

引入想象性感知令牌作为中间表示,提升多模态语言模型空间推理,优于文本思维链,在三个空间任务上显著有效。

04:00
arXiv cs.AI

PyraMathBench:评估与提升大语言模型数学能力

提出PyraMathBench基准,揭示LLM数值推理短板,通过SOLVE和IRPO模块将Qwen-2.5分数提升5.0。

04:00
arXiv cs.AI

大型语言模型的推理结构

提出将大型推理模型轨迹转为推理图,定义效率指标,揭示隐藏的推理结构差异。

04:00
arXiv cs.AI

scTranslation:单细胞多组学模态翻译的综合基准

首个单细胞多组学模态翻译综合基准,整合数据集与模型,评估多种场景下的性能,提供关键洞见。

04:00
arXiv cs.AI

Hedge-Bench: 在困难且真实的金融推理任务上评估智能体

Hedge-Bench用102个基于专业分析师推理轨迹的实际任务,实现确定性评分,前沿模型得分低于16%。

04:00
arXiv cs.AI

熵不够:通过视觉锚定令牌选择实现视觉推理的高效强化学习

VEPO框架通过乘法耦合视觉敏感性与令牌熵,解决视觉推理中熵机制失效问题,在7B和3B规模上分别提升2.28和3.15分。

04:00
arXiv cs.AI

TRAP:通过对抗性补丁劫持VLA的CoT推理

CoT推理存在安全漏洞,TRAP通过对抗性补丁劫持VLA模型,实现目标行为篡改。

04:00
arXiv cs.AI

RAG中的成本感知查询路由:检索深度权衡的实证分析

CA-RAG动态路由策略,节省26%令牌、降低34%延迟,保持质量。

04:00
arXiv cs.AI

Lean-GAP:形式化研究生代数问题数据集

提出430个形式化研究生代数问题的数据集Lean-GAP,开发了PDF到自动形式化再到验证的流程,发现验证环节最为复杂。

04:00
arXiv cs.AI

利用哨兵-5P卫星数据追踪城市大气污染物

基于哨兵-5P卫星数据,通过百分位数和聚类分析追踪城市二氧化氮污染,为数据匮乏地区提供可扩展的空气质量评估工具。

04:00
arXiv cs.AI

基于DXA的骨骼表型与髋部骨折风险:后门调整因果分析

后门调整显示DXA骨骼表型每SD升高降低约4.7例髋部骨折/千人,联合ATEs排名可提高风险预测AUC。

04:00
arXiv cs.AI

多轮PSB:评估多轮越狱攻击与基于分类器的医疗AI安全防御

多轮攻击使医疗AI不安全响应从35%升至80%,分类器防御降低52%但假警报率达45%。

04:00
arXiv cs.AI

小波作为分词器:自然信号共享小波标记方案的初步结果

提出共享小波标记方案,实现音频、图像、视频统一编码,实验显示潜力但未达通用词汇。

04:00
arXiv cs.AI

观点:优先识别结构而非复杂模型,以促进科学发现

现代机器学习中机制学习存在根本性不足,预测成功不能证明机制发现;需提出标准确保LLM工作流支持科学而非模拟。

04:00
arXiv cs.AI

好事过头反成坏事:当sim2real努力阻碍策略学习时(以及应对之道)

分析sim2real对策略学习的误导,提出基于运动学的sim2sim2real解决方案。

04:00
arXiv cs.AI

SegTune:结构化与细粒度的歌曲生成控制

SegTune基于扩散Transformer,通过分段提示和LLM时长预测实现歌曲生成的结构化细粒度控制,音乐性和可控性显著提升。

04:00
arXiv cs.AI

SVHalluc:音频-视觉大语言模型中语音-视觉幻觉的基准测试

首个评估语音-视觉幻觉的基准,发现现有模型跨模态对齐能力不足,准确率接近随机。

04:00
arXiv cs.AI

面向业务的大语言模型系统的验收测试驱动评估协议

提出验收测试驱动评估协议,将利益相关者目标转化为行为合同与门控,采用红-训练-绿生命周期。

04:00
arXiv cs.AI

学习精炼:面向降水临近预报的频谱解耦迭代精炼框架

提出SDIR框架,频谱解耦迭代精炼消除模糊与幻觉,空间精度和频谱保真度超越现有方法。

04:00
arXiv cs.AI

中文标题:少看,多指定:用于可泛化VLA的视觉证据预算

中文摘要:S2框架通过细化指令和视觉证据预算提升VLA泛化,平均子任务成功率从54.2%提升至79.0%。

04:00
arXiv cs.AI

Epi-LLM框架:通过流行病学智能体模型探究LLM行为先验

Epi-LLM框架集成智能体模型与LLM,发现感知健康严重性是隔离行为最强预测因子,可用于无风险疫情准备模拟。

04:00
arXiv cs.AI

PSViT: 一种结构化剪枝脉冲视觉Transformer的方法

PSViT通过结构化剪枝压缩脉冲视觉Transformer,内存节省22.4%,准确率损失<3%,便于资源受限部署。

04:00
arXiv cs.AI

OpenAgenet/OAN:可信智能体互联的开放基础设施

OAN为智能体互联提供协议无关的信任层,解决身份验证、授权与信任证据问题,实现安全发现与调用。

04:00
arXiv cs.AI

OpenAgenet/OAN:信任治理的智能体身份与发现技术架构

OAN是协议中立的智能体信任层,管理身份注册、发现与验证,支持异构框架。

04:00
arXiv cs.AI

BotDirector:跨对称现实的多模态交互机器人讲故事

儿童用实物布置场景,LLM生成故事,自导航机器人执行,实现灵活机器人戏剧。

04:00
arXiv cs.AI

AirDreamer:基于世界模型的通用无人机导航

提出基于世界模型与强化学习的导航框架,稀疏奖励避局部最优,成功率提升5.3%,零调参迁移。

2026年6月2日
04:00
arXiv cs.AI

基于最优传输的排列不变贝叶斯优化海上风电场布局

提出基于最优传输的排列不变贝叶斯优化,用于海上风电场布局,效果更优且时间减半。

04:00
arXiv cs.AI

Grokers:类型化知识图谱上的自底向上归纳理解与写入时智能

自底向上遍历归纳,写入时构建属性,后续查询零LM成本,证明三项形式化性质及确定性搜索替代。

04:00
arXiv cs.AI

面向产品的深度自编码器用于多产品信息物理系统的鲁棒过程监控

提出产品感知自编码器,解决多产品全局模型盲点,压力测试中异常检测率达100%。

04:00
arXiv cs.AI

审慎策展:多智能体知识库的协议

提出面向多智能体知识库的审慎策展协议,结合声誉投票与梯度制裁,逆境下精度优于多数投票,降级速度慢三倍。

04:00
arXiv cs.AI

多AI智能体框架实现固体力学问题的端到端有限元分析

基于大语言模型的多智能体框架AbaqusAgent,实现固体力学有限元分析的自然语言驱动,成功率86%。

04:00
arXiv cs.AI

每周三,我们提问:优化自动化法律分诊与转介中的“主动倾听”

专家与LLM评估发现,低成本模型生成法律分诊问题质量不足,需高成本GPT-5提升准确率,但家庭暴力等领域信息提取不均。

04:00
arXiv cs.AI

TIGER:基于图的证据路由实现可追踪推理,缓解多模态生成中的幻觉

TIGER框架提取输入观察图与输出声明图,赋风险分数修复高风险声明,减少多模态生成幻觉并保持任务质量。

04:00
arXiv cs.AI

模型原生计算架构:透过计算机架构之眼展望未来系统架构

提出ICAM六层框架,从计算机架构视角统一LLM系统问题,含双平面视图与三条设计定律。

04:00
arXiv cs.AI

基于相互兼容性的双变量因果陈述评估

提出基于相互兼容性评估双变量因果陈述的方法,通过兼容性评分区分正误,无需忠实性假设,并应用于大语言模型因果分析。

04:00
arXiv cs.AI

从噪声到控制:参数化扩散策略

提出参数化扩散策略,在行为流形上条件扩散,实现策略插值与适应新约束,无需更新权重,显著提升复杂任务适应性能。

04:00
arXiv cs.AI

确定性边界:当扩展推理失效而工具委派变得必要之时

扩展推理因注意力瓶颈在确定性任务中失效,确定性视界d*∈[19,31],超出后工具委托成为必须,神经推理存在架构天花板。

04:00
arXiv cs.AI

SDR:放射学报告生成的集合距离奖励

集合距离奖励统一胸部X光报告生成的后训练与测试时缩放,关键指标相对提升4-16%,并支持高效生成。

04:00
arXiv cs.AI

KACE:面向数学推理的知识自适应上下文工程

KACE通过分层知识库与分层自一致性,在数学推理上超越固定自一致性,AIME 2025准确率62.2%,提升10.4个百分点。

04:00
arXiv cs.AI

先探测再编辑:基于探测引导的LLM代理在结构药物设计中的分子优化

提出PROBE框架,通过探测编辑响应引导LLM代理协同优化结合亲和力与药性,显著缓解冲突目标优化失败问题。

04:00
arXiv cs.AI

隐藏思绪并非秘密:大语言模型中的推理轨迹暴露

REP方法通过影子模型示范引发LLMs暴露推理轨迹,提高与内部轨迹相似性并保留推理信号。

04:00
arXiv cs.AI

面向生成式规划模型的高效测试时推理

修改经典OCL搜索协同生成与启发式模型,实现高效推理,提升规划质量与效率。

04:00
arXiv cs.AI

TRACE:面向长周期智能体安全的轨迹风险感知压缩

TRACE通过压缩器-读取器将轨迹压缩为潜在证据状态,聚合分散风险信号,在多个基准上准确率提升达12.6%,长上下文退化更小。

04:00
arXiv cs.AI

基于后验混合贝叶斯信念的正则化离线策略优化

提出PhyB方法,将期望重写为模型子集凸组合,实现高效离线策略优化,性能领先。

04:00
arXiv cs.AI

MOSAIC:结构化智能体智能与组合的模块化编排

MOSAIC框架通过结构化智能体实现记忆基础模型选择,将自动数据科学转化为可验证、可重用的分阶段搜索,提升金融时间序列任务性能。

04:00
arXiv cs.AI

人工智能主权作为国家学习能力:以法国、美国和中国为例的人本学习机制视角

本文从人本学习机制视角,将国家AI发展视为信息注入与熵耗散的平衡,主张AI主权源于调节信息动态的能力,而非规模。

04:00
arXiv cs.AI

基于LLM的双组件耦合组合优化协同进化自动启发式设计

提出CoEvo-AHD框架,利用LLM双种群协同进化自动设计耦合组合优化启发式,性能达传统方法水平。