小型推理模型是函数调用中的指令跟随者
提出IFFC框架,将函数调用委派给专用小模型,在指令跟随情境中提升准确性,优于原生/提示基线,且量化下性能稳健。
CausalCache:面向长时程GUI代理的条件式高保真恢复
CausalCache将固定预算用于恢复高价值历史截图而非最近帧,提升长时程GUI代理成功率。
当 AI 用于偏微分方程时,何时能产出科学证据?
现有AI-for-PDE基准只评估预测精度,不评估证据支持;研究表明数值精度与证据支持排序不同,需弥合评估与使用错位。
HANSARD:面向自主多智能体AI系统的取证就绪、运行时见证与分级归因参考架构
针对多智能体系统问责难,HANSARD参考架构通过就绪配置、多点捕获与因果分析,实现分级归因,使责任可见。
ClawProBench:面向AI代理的轨迹感知评估,含运行时覆盖与冻结工作场景式保留集
提出轨迹感知基准,覆盖运行时与冻结保留集;最终答案排行掩盖原生缺陷与局部失败。
ExecRubrics:可执行的工具增强型评分细则,用于可验证且高效的长文本评估
将评分细则编码为可执行Python程序,替代黑盒评委,评估速度提升320倍,偏好准确率最高达92%,更可解释、可审计。
STAGE:策略作用域上下文与确定性控制下的有状态智能体图执行转换
提出可执行图框架,将模型判断限制于策略作用域节点,以确定性代码控制流程,显著提升任务成功率与重复运行可靠性。
CAI-DLLM:扩散语言模型的收敛感知推理
提出无训练推理法,用首步置信度引导去噪,提前稳定易词元、增加难词元步数,推理提速最高44.8倍,精度小幅波动。
面向自进化智能体的联盟感知技能可靠性
揭示技能库存在联盟污染和跨域效用反转,提出CASS与u-SMCO干预,提升任务性能与跨域泛化。
你的AI,一旋即调:用单个神经元控制LLM的投资偏差
通过干预单个神经元,可连续调节大模型整体买卖倾向,不修改提示或参数,且随上下文增长保持稳定控制。
超越工具链:企业文本转SQL中上下文工件的端到端优化
优化从历史查询构建的上下文工件,比优化检索框架提升更大,在5176条生产查询上AST相似度提升约12–25%。
让子弹飞:时间对齐生成式弹幕的多模态假新闻检测
提出生成式弹幕框架,模拟用户实时互动,并设计多模态检测模型,提升假新闻识别鲁棒性,超越现有基准。
精神病学领域专用大语言模型回答患者问题的性能
精神科药物问答中,专用模型MIND客观评分最优,医生认为其完整安全,但更偏好通用模型的回答。
面向大语言模型的忠实知识图谱问答的组合关系链
针对知识图谱问答中实体剪枝不可靠与约束处理无依据的问题,提出以关系为搜索单元的双链框架CCoR,提升复杂查询的准确性与忠实性。
GSAR:面向移动GUI智能体的目标状态锚点奖励与自演进数据合成
GSAR自进化数据合成生成多样任务,目标状态锚点提供可靠奖励,离线验证准确率超九成,性能接近规则法。
TailSieve:部分展开引导的LLM展开尾部路由
TailSieve用部分展开识别长尾并隔离路由,提升LLM rollout效率,最高加速2.59倍。
FinixDoc:重新思考金融文档解析——超越饱和基准
提出金融文档解析系统,结合对比学习与强化学习,在自建基准获81.43分,超开源模型5.13分。
可解释的线性判别树集成多模态分类
提出线性判别树集成框架,兼顾多模态分类精度与可解释性,改进特征重要性,性能超越Transformer及可解释基线。
真相深藏:基于潜在意图验证的语义伪装对抗
发现模型早期层保留有害特征,提出LIV探测防御,无需重训即可识别语义伪装攻击,检测率提升20-50%。
表示影响检索:多模态智能体工具中技能发现与路由的案例研究
技能上下文选择与嵌入检索对应;完全自动加载最优,部分暴露引发词汇竞争,抑制正确选择。
Nexus:面向统一内存上智能体大语言模型的深度自适应KV缓存拼接与检索解耦工具路由
Nexus用检索解耦与深度自适应KV拼接,在统一内存上提速智能体LLM,保真且省令牌。
当检索未启先败:智能体记忆中结构间接前置驱逐的保留失败
提出“结构间接前置驱逐”这一检索前保留失败,DSGC规则显著提升全链保留率,识别预算与规模边界。
环境可持续的慢AI:生成式系统的设计原则
主张以环境可持续为核心,提出慢人工智能五原则,将解释性反思融入设计,恢复被默认设置消除的人类决策。
终端智能体:命令行环境中AI智能体综述
综述终端AI智能体,提出七维能力模型,分析架构与评估,强调系统组件共同作用,呼吁明确报告与可复现轨迹。
翻译之失:普遍伦理价值为何无法跨越全球情境
AI伦理价值观非普适,专家按本地情境重新诠释,存在翻译鸿沟,需多元治理。
StateSight:视觉语言模型中潜在空间状态重建的基准测试
StateSight评估VLM从单图重建空间状态的能力,人类准确率远超GPT-5.5等模型,揭示格式有效但空间推理失效。
智能洪水响应的时态规划方法
提出智能洪水响应框架,用时态规划协调行动与资源分配,支持重规划,实验验证可行性与可扩展性。
FL-MAESTRO:面向资源受限联邦学习的多智能体LLM编排
提出FL-MAESTRO多智能体编排器,联合优化联邦学习拓扑、资源分配与聚合,减少浪费能耗并保持精度。
多模态大语言模型时代的容积放射学AI
多模态大模型用于容积放射学需原生三维表示与智能体;综述200余篇,提出声明-设计-验证框架保临床可信。
FlavourBench:基于可执行烹饪真值的前沿语言模型排名基准
提出FlavourBench,用可执行的烹饪系统提供真值,评估27个模型在534个任务上的表现,消除基准缺失,结果可复现。
在大型企业应用Anthropic原语:知识工作的Harness范式
Harness范式:企业知识工作免定制,审查仅读指令文件,弥合治理差距。
DirEAG:用于数学推理中言语化置信度校准的狄利克雷证据聚合方法
提出狄利克雷证据聚合法,将置信度观察转为软证据,校准数学推理置信度,优于启发式聚合。
DreamBench-SWE:软件代理的多会话记忆卫生基准
DreamBench-SWE多会话记忆卫生基准:审计显示可区分记忆配置,但未证实外部机制或优势。
ForeTime-VLA:面向传送带操作的世界动作模型因果未来令牌蒸馏
从世界动作模型蒸馏未来感知表示,提升传送带抓取成功率,误差降低,延迟代价小。
基于连续时间量子游走的图神经网络
提出CTQW-GNN,利用连续时间量子游走的酉传播子同时解决GNN的低通滤波与过平滑问题,融合三种聚合模块,具有理论保证。
多模态投机解码能否用于基于扩散的并行草拟?综述与实证诊断
系统综述多模态投机解码,评估扩散式并行草拟适用性,提出统一分类法并跨基准实证诊断。
Automated Trajectory Evaluation for Mobile Agents via Step-Level Consequence Reasoning and Aggregation
超越端点增益:医学专业化的权重增量审计
提出权重增量审计法,验证两个医学专精模型对基准测试的复现,但更新定位不明,区分整体重构与组件解释。
CAS:基于自适应检索与策略加权的共形化智能体搜索
提出共形化智能体搜索,通过自适应预测集与动态共形推断保障检索与训练可靠性,提升推理准确率并减少冗余搜索。
神经地理空间建模:基于文献环境背景的EEG情感状态分类
结合EEG与环境数据(空气污染、绿度)进行情感分类,多模态模型准确率76.2%优于EEG单独67.4%,但增益不全是环境信息所致,暂未建立因果关联。
多轮认证鲁棒性框架MTCR:通过组合界限与安全性持续性,显著提升LLM对抗多轮越狱攻击的认证下界。
提出MTCR框架,用状态对抗MDP建模多轮安全,组合认证与安全性持续性改进下界,实验验证理论紧致性。
SPARC:用于运动预测的单遍缩放与共形贝叶斯末层
SPARC提出贝叶斯-共形层,解析扩展协方差并校准预测带,无需采样,NLL及综合指标第一。
阅读用结构,写作用散文:多智能体文档创作中的非对称结构条件化
多智能体标书生成接近人工,缺信息是主因;结构助读但损写作,明令禁止反增错误。
部分因果识别的基础模型
因果基础模型:用规范先验界定干预与反事实效应,将部分可识别因果效应估计转为学习数据到因果查询的函数分布。
物理先验代价受消融差距约束
物理先验的代价受消融差距约束,且依赖验证协议;约束模型不应被自身消融击败。
科学论断能否从大型语言模型中移除?论断级遗忘的系统评估
现有遗忘方法仅表面抑制,无法有效删除大模型中的过时科学论断,新基准SciUnlearn揭示需专门方法。
跨材料刚度与几何形状的软组织变形及力预测泛化
提出经校准的等变图神经网络,实现跨刚度与几何的软组织变形和力预测,亚毫米精度,10毫秒推理。
深度学习模型也能回忆特征
提出“特征回忆”:线性投影按激活缩放检索存储信息,普适多种架构,为机制可解释性研究提供新方向。
只比较不求解:LLM智能体运行时干预的微型顾问
提出只比较的微型顾问COTA,通过成对比较决定干预,提升LLM智能体可靠性。
评估大型语言模型在国际海运危险货物规则合规中的表现
首个基准DGEval测评13个模型对IMDG规则的掌握,最佳模型超人类基线,但积载、隔离等安全关键领域薄弱,需人工监督。