A knowledge-guided agentic framework for mitigating patient-context ambiguity in health queries
Stopping and Routing LLM Judge Panels
Interrupting the Loop: Periodic Subject Changes Raise Judged Surprise and Connection in Base Language Models
Dynamic Gated Cross-Modal Fusion with Sarcastic-aware Contrastive Regularization for Multimodal Sarcasm Detection
Natural Language Code Retrieval for 1C:Enterprise: An Open Benchmark and Efficient Bi-Encoder
Robust Incomplete Multimodal Sentiment Analysis via Iterative Proxy Correction
HealMed: Multilingual Evaluation of Large Language Models in Medicine
G-CARL:面向患者的医学报告解读的基于证据的检查表对齐奖励学习
提出面向患者的医学报告解读任务,构建奖励学习框架与基准,提升事实准确性和需求契合度。
作为AI代理上下文获取的主动推理
将上下文获取视为主动推理,在默认与澄清间权衡代价,提出最优提问框架并验证于前沿模型。
注入、对齐、恢复:面向无检索文档知识内化的分阶段后训练
提出IAR三阶段后训练框架,分离知识注入、行为对齐与能力恢复,显著提升无检索问答的领域与通用性能。
概念卫士:面向大型语言模型上下文敏感遗忘的基准测试
提出概念级遗忘基准ConceptGuard,基于双重用途概念评估有害/良性上下文区分;现有方法表现差,遗忘与效用难以平衡。
Task-CoEvolve:通过自适应验证任务选择实现高效的智能体框架优化
提出方法使验证任务与框架协同进化,基于分歧采样聚焦信息量大任务,估计全量性能,评估降80%且性能相当。
SABET-QA:时序知识图谱问答
提出SABET-QA,通过迭代细化与双向实体-时间评分处理时序知识图谱多步问答,在多数据集上超越基线。
OenoBench:葡萄酒领域基于知识的大语言模型评估基准
葡萄酒领域基准OenoBench含3266题,评估16模型,准确率53%-84%,o3以83.6%领先。
当文本与数字相悖:大语言模型中的证据仲裁
研究发现大语言模型仲裁冲突证据有系统偏好:重近因、轻可靠性线索、过度依赖外部预测,为失败模式。
FormalTCS:大语言模型端到端前沿形式化理论计算机科学研究的基准评测
提出形式化TCS基准:175个前沿问题;大模型端到端研究远未可靠,形式化是最陡瓶颈,研究品味亦受限。
从计算机使用轨迹中归纳任务模型
提出TMI,从无约束轨迹中发现交错任务并构建分层任务模型,恢复74.9%执行步骤,下游准确率提升30%。
结果监视器:针对静默工具故障的恢复可供性
结果监视器检测结果契约违规,保留结果并附恢复工具提示,在工具故障评测中显著提升任务完成率。
奖励引导的自回归图生成用于高效多智能体通信拓扑设计
提出奖励引导的自回归图生成方法(RGA-Designer),在保持任务准确率的同时,平均减少20.5%的令牌消耗。
HARP:面向查询式CVE优先级排序的层次自适应排名与偏好自适应融合
HARP基于知识图谱多视图融合,结合历史标注示例,实现无需显式偏好的查询式CVE优先级排序,优于基线。
度量规格说明所确定的内容:形式化语义块模型与执行判定基准
提出语义块模型与执行判定基准,以收敛性估计确定性;应用于迁移规范,但实验表明确定性不宜作为独立质量指标。
倾听重要吗?AI克隆中的附和与点头
AI克隆加入附和与点头等倾听行为,显著提升临场感与真实性。
智能体记忆系统能否追踪演化状态?
提出状态追踪基准及StateMem方法,显著提升智能体记忆跟踪演化状态准确率。
EnvHarness:唤醒静态世界以训练智能体
提出EnvHarness,可编程插件层包装静态环境,自动诊断智能体弱点并生成组件,提升性能并减少训练步骤。
从检索上下文到运行时控制:面向边缘RAG的自适应压缩
边缘RAG应据遥测动态调压缩率:中间压缩率可降GPU/SoC能耗约50%,质量损失可忽略。
PolicyGuide:从守护单个动作到引导整个工作流——面向策略合规的LLM智能体
PolicyGuide将策略编译为工作流图,在用户边界主动校验,使合规Pass^4由0.42升至0.62,抗攻击最强。
拆解并传递:LLM智能体的跨任务技能迁移
研究发现子任务级和文本技能迁移更可靠,提出技能效用分数可预测迁移成功。
基于LLM常识推理能力的多智能体自动驾驶编排
提出LLM常识推理协调多智能体混合框架,结合强化学习与PID控制,迭代优化奖励函数,CARLA验证有效。
AI4AI-Bench:递归自改进算法设计中的LLM智能体基准测试
提出递归自改进基准,含10个算法重写任务;智能体最优仅达0.25,多数未改进学习算法,增加推理可提升。
HiFi-KPI:从财报中提取层级化KPI的数据集
构建165万段落、19.8万标签的财报KPI数据集,LLM结构化抽取F1=0.44,错误主因日期。
基于智能体的主动数据收集、出行行为建模与天气敏感需求预测方法
提出三智能体流程,融合对话调查与多模态大模型预测。视觉配置最优准确率71.5%,优于传统模型,展示可审计的多智能体工作流。
ContractScrub:法律合同最终审查基准
首个法律合同终审基准;前沿模型表现差,仅一个达0.75宏平均召回,凸显领域评测必要性。
幻影增益:以实测零模型审计自我改进
自训练改进多为测量伪影;用实测零模型审计发现七类错误,外部蒸馏有效而自训练无效,且损害基线问题。
MemTrapBench:大语言模型记忆使用中的认知陷阱基准测试
记忆基准忽视记忆对推理的影响;新基准揭示认知陷阱,所有记忆策略均不如无记忆;AdaptiveMem可缓解。
可解释的多模态抑郁症识别:基于PHQ对齐症状摘要的临床访谈方法
提出Explain-MDRC框架,用PHQ-8症状摘要结合非语言线索提升抑郁识别,增强可解释性与临床可用性。
Daedalus-150M:为CPU推理设计的卷积-注意力混合模型
为CPU推理设计的混合模型,仅1/3用注意力,训练599亿词元,胜同尺寸,解码速度随上下文增长提升。
大型音频语言模型中的音频令牌压缩探索
通过分割与池化压缩音频令牌,用低秩适配器缓解退化,在语音识别和翻译上接近帧级性能,令牌数减少三倍。
EvoSelect:面向目标任务适配的数据高效大语言模型演化
提出生成-选择-训练迭代框架,用最优传输对齐任务相关性并兼顾多样性,高效提升大模型目标任务适配。
Qworld:面向大语言模型的特定问题评估标准
Qworld递归扩展树生成问题专属评估标准,覆盖89%专家标准,发现粗粒度标准忽略的能力差异。
DiverValue-Bench:面向多样化人类价值观的大语言模型对齐基准与微调框架
提出DiverValue-Bench多国价值观对齐基准,揭示人群差异,轻量微调提升对齐。
TS-Reasoner:对齐时间序列基础模型与LLM推理
TS-Reasoner对齐时序基础模型与LLM推理,合成数据两阶段训练,冻结模型,数据高效性能优越。
当上下文推断失败:交互式指令跟随中的可取消性
提出BWIM基准,探究交互式指令跟随中的上下文推断:LLMs虽识别不可靠,行动上仍过度澄清或盲目猜测。
Doc-V*:多页文档VQA的由粗到精交互式视觉推理
提出OCR-free智能体框架Doc-V*,概览粗筛、检索精读、记忆聚合证据;经模仿学习和组相对策略优化,域外性能较RAG提升47.9%。
超越回忆:行为规范作为AI个性化的解释层
定义表征准确性,用行为规范作解释层,压缩数据为上下文,提升预测并消除模棱两可,低基线提升最大,超越原始语料。
缓解生成式AI证据污染以检测脱离语境 misinformation
提出两种策略,缓解GenAI证据污染对脱离语境检测的影响,提升鲁棒性。
重掩码而非替换:扩散语言模型中的词元到掩码精炼
提出T2M:训练无关的推理时修正,基于当前词概率重掩码低置信位置,优于替换,提升扩散语言模型一致性。
询问以求确信:面向自信多轮LLM推荐的信息性交互
提出以推荐熵减为奖励,无需真值,微调LLM以生成信息性交互,提升推荐质量与对话效率。
基于切比雪夫多项式和黎曼度量学习的说话人特征解耦用于深度伪造源验证
提出SDML框架,用切比雪夫多项式稳定解耦优化,黎曼度量距离减少说话人信息,提升深度伪造源验证效果。
从反弹到补救:通过表示工程理解与缓解奖励黑客
发现奖励黑客三阶段反弹,用表示工程提取捷径方向检测,提出优势修正惩罚黑客行为。
Transformer看,Transformer做:复制作为学习类比推理的中间步骤
以元学习组合性训练Transformer学字母串类比,复制任务引导注意力提升泛化,三层模型媲美前沿