自由能启发式:不确定精度下的快速节俭认知作为主动推理
链式思考效果取决于元不确定性:高不确定性下长推理有害,证明快速节俭与主动推理等价。
SciOrch:学习编排专家级大语言模型以解决前沿多模态科学推理任务
SciOrch训练8B模型编排多专家LLM,结合MCTS与GRPO,科学推理准确率56.66%,超越最强模型且成本减半。
Formalize Once, Edit the Rest: Efficient Lean-Based Answer Selection for Math Reasoning
Interactor:面向智能体强化学习的迭代创建方法用于付费搜索广告描述生成
提出Interactor框架,基于智能体强化学习迭代生成广告描述,通过多奖励模型评估反馈,提升知识丰富度和一致性,已上线应用。
大语言模型在法律领域推理中的神经元级分析
对七个模型进行神经元级分析,发现法律推理存在共享与特定神经元,抑制关键神经元导致准确率崩溃,且分布受输入格式影响。
BALTO:面向幻觉缓解的平衡令牌级策略优化
BALTO通过平衡令牌级信用分配重分配概率,缓解幻觉,实现最优忠实性。
校准分诊,而非自主:医学视觉-语言模型的置信度估计
医学VLM因语言先验易自信犯错;校准置信度可实现安全分诊,最佳探针错误率仅1-4%,但仅自动化安全案例。
控制平面位置塑造遗忘:十三种系统配置下智能体记忆的架构研究
控制平面位置影响遗忘恢复;变异时钩子综合最优(91.7-93.2%);现有基准仅测回忆,新基准ForgetEval补缺。
FinBalance:一个多文档会计对账基准
提出多文档会计对账基准FinBalance,评估显示LLM最高仅46%准确率,存在文档绑定和汇总一致性问题。
受污染的协作:衡量LLM辅助学生写作中的性别偏见迁移
LLM辅助写作中性别偏见会迁移至学生文章,导致能动性差距与刻板职业建议,且影响不对称。
超越自然语言到代码:多模态代码智能的结构化综述
结构化综述多模态代码智能,按代码角色分四领域,提出多信号验证等未来方向。
SAG:查询时动态超边的SQL检索增强生成
SAG利用SQL连接查询动态构建局部超边,避免全局图维护,在多跳推理基准上8/9指标最优,支持大规模生产部署。
ROMPAR:面向罗马尼亚口音语音识别的形态学补全与人口统计学去偏
提出ROMPAR数据集与多任务对抗训练框架,通过指数衰减机制和LLM引导解码实现形态补全,WER降低,F1达96.6%。
面向对话摘要的大规模多维度LLM实证研究
提出OmniCSEval基准,多维度评估28个LLM,揭示跨场景挑战及推理与规模影响。
长上下文建模:基于可学习混合的GSS-Transformer混合架构
提出并行混合架构(PHA),并行融合门控状态空间、注意力和前馈网络,通过可学习混合实现高效长上下文建模,困惑度达16.51。
领域内监督病理报告分类:从数据整理到生产匹配评估的可复现流程
提出领域内监督流程,通过标准化数据整理与盲审,将假阴性率降至0.003,F1提升至0.922,并揭示标签噪声问题。
扩展人工与G2P监督实现稳健语音转录
G2P监督仅当人工标注少于20-30小时有效,超阈值后ASR预训练更优,误差率降低2.3倍。
GRACE-DS:数据科学中的受保护奖励引导智能体修正环境
GRACE-DS评估LLM驱动的AutoML智能体,通过隐藏验证器衡量性能,其灵活迭代交互模式显著优于其他基线。
从论证组件到图:一种带置信门控的多智能体辩论用于论证关系
多智能体辩论框架引入置信门控,选择性辩论在论证关系识别中取得最优性能,提供可解释性。
PVminerLLM2:通过偏好优化改进患者声音的结构化提取
提出PVminerLLM2,用偏好优化和门控稳定项改进患者声音提取,在代码、子代码和跨度上分别提升4.43%、3.50%、1.55%。
谁在摇摆?自我与跨模型反论点揭示LLM答案不稳定性
提出评估LLM答案稳定性的协议,发现翻转率17.5%-97.3%,自我归因平均增加7.1pp,跨模型构造的MaxFlip挑战集放大翻转达23.6pp。
桥接可用性差距:口译研究对机器口译设计的启示
机器口译标准成绩优异但实际体验差,需基于主体性、基础性和体验性设计,缩小可用性差距。
PaperJury: 有限LaTeX修订的正当程序审阅
PaperJury是面向LaTeX论文的闭环审阅系统,通过确定性编排与语义代理分离,实现安全、可终止的修订,支持无效丢弃、有效修复等终局判定。
创意碰撞:导演人格引导与大型语言模型中的竞争
叠加斯皮尔伯格与斯科塞斯导演人格向量,发现前者方向压制后者,中间碰撞点提升连贯性,两者在28层共享道德基调基底。
PACT:面向多轮工具使用智能体的特权轨迹协同训练
PACT利用专家轨迹作为训练监督信号,结合RL和SFT损失优化,提升多轮工具使用智能体性能。
现在谁该主导解码?追踪可靠轨迹以集成掩码扩散语言模型
提出TIE框架,通过追踪答案相关位置的置信动态,在掩码扩散语言模型间接力可靠轨迹,实现知识融合,提升推理性能。
AuAu:用于审计大语言模型中威权对齐的基准
提出AuAu基准评估大模型威权倾向,测试17个模型均有高回应率,且易被系统提示操纵。
迈向帕累托最优的工具集成智能体:帕累托排名策略优化
提出ParetoPO框架,通过超体积引导和帕累托排名优势计算,实现准确率与工具使用效率的权衡优化。
XAI驱动的无训练多模态大模型生成语音深度伪造检测的可信解释
提出无训练框架,融合XAI证据与多模态大模型,生成可信解释,内部准确率提升超45%。
HiMPO:基于后见信息的记忆策略优化——长周期智能体的低纠缠信用分配
HiMPO通过后见信息滤波和局部效用估计,减少记忆更新信用纠缠,提升长周期智能体表现。
融合多源证据的生物医学推理:BioMedHop基准与BioWeave框架
提出多源证据推理基准BioMedHop与框架BioWeave,融合知识图谱、文献与网络证据,成绩领先,小模型性能可媲美GPT-4-Turbo。
GRACE:基于上下文的忠实推理的步骤级基准
GRACE首个步骤级忠实性基准,通过数据驱动错误分类法标注推理步骤,识别推理与事实错误,提升下游准确性和可靠性。
大型语言模型中代词忠实性的机制理解
代词不忠实源于组绑定、近因和刻板印象三个因果子空间竞争,组合解释91-99.5%。
LecturaAgents:一种用于自适应个性化AI辅助学习和具身教学的多智能体框架
提出LecturaAgents多智能体框架,通过层次架构与自适应具身教学实现个性化学习,教学效果优于现有方法。
末尾迷失:多模态检索增强问答中的首因偏差
多模态KB-VQA中检索上下文呈现“末尾丢失”,黄金段首位比末位准确率高16-26点,需读器侧干预。
跨男性态度与语音语料库
推出跨男性多模态语料库,含196人问卷与66段录音,支持嗓音健康及群体特征研究。
通过语义约束验证评估LLM个性化
提出NLICV框架,用NLI模型语义约束验证LLM个性化,高效可解释,降低延迟成本。
以效率超越规模:原生适配孟加拉语的紧凑型1.35亿参数基础大语言模型
紧凑135M参数孟加拉语LLM,零样本多任务媲美1B级模型。
Tyler:面向语言模型的类型化隐式推理——何时思考、计算什么、分配多少
Tyler提出类型化潜在推理框架,动态决策思考时机、计算类型与预算分配,准确率提升14.49点且泛化性强。
ACCORD:面向语言智能体的动作条件情境基础
ACCORD框架在动作前主动探测环境并整合轨迹上下文,无需训练即显著提升智能体任务完成度。
PathRouter:在智能体图检索增强生成中对齐奖励与检索质量
PathRouter通过轨迹分类和KL指导,缓解奖励混淆,提升图RAG检索质量与答案准确性。
从意识到遵从:通过上下文感知解码弥合口语对话系统中的上下文鸿沟
提出CAD方法,隔离关键历史轮次并对比输出分布,放大上下文信号,有效提升对话系统上下文遵循能力。
REFLEX: 基于大语言模型经验的反思性进化
REFLEX框架解耦视觉诊断与代码生成,实现样本高效、可审计的策略进化,数轮调用即可解决复杂控制任务。
VeriGraph:迈向可验证的数据分析智能体
VeriGraph通过构建可追踪证据图实现数据分析智能体可验证性,基准测试取得87.61%接地率。
SkillWiki:面向智能体技能的活态知识基础设施
SkillWiki作为活态知识基础设施,支持智能体技能的组织、落地与持续演化,将异构知识转化为可复用技能资产。
LLM编程智能体能否推理时间序列?
LLM编程智能体处理时间序列比原始数据高10%准确率,但仍22-34%错误;编程智能体能选检验但缺细节,原始数据模型可估算得结论。
快速时机,谨慎谁接:基于扩散增强的双过程多方轮换
提出快速扫描与轻量验证的两阶段多方轮换方法,扩散数据增强提升切换检测性能。
不确定性不是临床VQA的安全网,但它能预判模型失败吗?
UE虽非可靠安全网,但可预判模型脆弱性,指引临床部署。
BD-LSC数据集:促进俚语与标准用法中词汇语义变化检测模型的基准测试
推出BD-LSC及ST-WSD数据集,评估词汇语义双向变化(获得/丢失义项)检测模型,GPT-4o最优,但稀有俚语义仍是核心挑战。
LLM智能体能否推断世界模型?来自智能自动机学习的证据
通过交互发现隐藏DFA的智能自动机学习测试表明,LLM智能体性能随DFA增大下降,推理模型较强但仍不如经典算法。