AgentHop:面向智能体多跳科学问答的诊断基准
AgentHop诊断基准以1011道题及七工具沙箱,从检索、综合、工具调用、资源管理四维剖析模型失败模式。
互惠引导:编排草稿与验证预算,推进扩散-AR自推测前沿
提出互惠引导(RecGuide),动态编排草稿与验证预算,适配不同并发负载,吞吐最高提升1.8倍。
零样本线索锚定的口语文档主题分割
免训练框架CGS以显式话题起始线索句划定边界,线索不足则依文档结构做语义分割;六项基准超越基线,抗ASR噪声且低成本。
当言语力有不逮:LLM置信度估计中言语化推理与隐藏特征的迭代协同
专用估计器优于言语化;IPoET交替优化策略与估计器,协同言语化推理与隐藏特征,提升LLM置信度估计。
面向在线策略蒸馏的无偏Top-k估计
提出TT-OPD:结合top-k与采样token,补偿丢弃概率质量,无偏估计反向KL梯度,性能更优。
以问促记:面向 LLM 智能体的检索诱导记忆演化。
提出RIME检索诱导记忆框架:以自问检索证据整合演化记忆,推理不足时回溯源对话,性能领先且省查询token。
即时智能体记忆:结合运行时智能体式研究
提出JAM框架,运行时按查询构建记忆,保留原始历史并迭代检索整合证据,性能超越AOT记忆且更高效。
三思而后选:重新审视在线策略蒸馏中的词表稀疏化
SparseOPD 先按全词表教师纠正幅度选词再做稀疏反传,大幅降低显存,精度超越采样与 TopK 方法。
当系统编排胜过模型规模,阅读质量又胜过二者
DocSem:系统编排胜规模,阅读质量又胜二者;但栅格水印PDF致崩溃,评测输入决定成败。
CRISP:面向隐性情境得体性的文化奖励建模
提出CRISP-RM文化情境奖励模型与NGS监督,构建NormCompass,提升开放社交文化得体性
游戏内毒性检测:基于注意力残差的双向表示
提出游戏内毒性检测共享任务与BRAR模型,用注意力残差双向表示捕获全局语境,槽填充优于基线。
ReMCTS:面向代码生成的反思增强蒙特卡洛树搜索
ReMCTS以执行反馈与记忆增强的MCTS搜索代码,跨分支复用失败经验,多数测试优于直接生成。
模型自知何时停止:面向长上下文阅读的免训练早停机制
提出免训练早停规则ACS,依据模型答案的置信度与稳定性判断是否停止,精度不降且过早停止率低。
奖励新颖推导:求解器引导的逻辑推理过程奖励
SPRING以SMT求解器验证中间推理步骤,奖励新颖有效推导、惩罚矛盾冗余,在三大逻辑基准上显著超越基线。
使用大语言模型检测大语言模型生成的文本:一项跨代分析
评估15个大模型跨三代:检测效果取决于检测器而非生成来源,自我检测无优势,各代存在漏检、误报偏差。
公平事实核查:以 RoSh 弥合大语言模型事实判断的跨语言鸿沟
提出免训练RoSh,按语言平移旋转残差流,平均弥合75%跨语言事实判断差距,小模型提升最大。
RGDT-Bench:面向规则约束决策及其论证的大语言模型推理基准
RGDT-Bench评测规则约束决策及论证;正确回答理由不完整约四成,现有评估难检测,奖励模型提升。
CARDAMOM:面向自动语音识别的微方言阿拉伯语语音数据集
发布约40小时、覆盖6国21种微方言的阿拉伯语语音数据集,含转写与标注,并评测ASR系统。
无代码的论文:*CL会议论文中链接的GitHub仓库可用性
CL期刊及ACL等会议论文的GitHub仓库可用性研究:新论文失效率与旧论文相当,空仓库增多。
RoPE已死,RoPE万岁:迈向可扩展的数据感知位置编码
提出DaRoPE:慢频段用数据学习有界坐标替代绝对位置,缓解近因偏差,非文本领先,语言建模与外推持平。
超越词元对齐:跨分词器同策略蒸馏中的事件补全
提出事件集补全蒸馏,用补全集监督补充跨分词器概率对齐,免额外采样,在数学、代码与科学推理蒸馏中稳定提升。
调整语义而非结构:面向科学PDF抽取的少样本模式校准
提出CPSE框架,用少量标注校准字段语义与提示并保留结构契约,在聚合物文档上较基线提升9.93分。
Draft-KV:学习语言模型间有用的潜在通信
Draft-KV 以起草答案的 KV 状态做潜在通信,冻结模型仅训 1.05M 参数,显著提升接收器准确率。
TQTS-Bench:面向时序数据库的多语法文本到查询基准
含6125个问答对、97个时序数据库与23种语法;最佳模型准确率仅48.98%,人类达87.34%。
LongPuzzleBench:评估 GUI 智能体在长程视觉谜题上的表现
LongPuzzleBench评估GUI智能体长程视觉谜题:114关六款游戏,强智能体在更难长局骤败,因其只看当前进展、不顾未来选择。
InfiMed2:基于上下文证据与稳定性感知监督的通用医学多模态基础模型
InfiMed2为4B/27B通用医学多模态基础模型,阶段感知数据设计与稳定性监督,医疗基准超越开源同类。
从弱任务规范到科学抽取智能体:优化任务构建
针对科学抽取智能体,提出从简短目标与未标注文献的弱规范出发,自动构建并持续优化任务模式、抽取指令与评估标准。
面向指令遵循泰英机器翻译的参考锚定数据整理
提出参考锚定数据整理法,构建197万条数据训练泰英翻译模型ChindaMT,各规模均超同尺寸基线。
OpenWhistle:大规模纵向宽吻海豚发声数据集与基准
发布首个公开宽吻海豚哨声数据集,含五年约18万条录音、专家标注及评测基准。
及格还是不及格?在两项希腊考试基准上评估大语言模型
发布两项希腊考试基准,评测多款大模型;本地化小模型媲美大模型,少样本提示反致结构化任务性能下降。
在正确的步骤给予正确的教训:为自演化智能体推导控制更新
EvoCUE 将智能体建模为状态机,在精确位置学习并评估控制更新,提升长工具链任务成功率。
行为之回响:道德历史能够塑造并引导大语言模型的行为选择
道德账本框架显示,大模型道德史按效价与强度影响选择,其潜表征可线性提取并干预,实现推理时可控制。
神经语言模型学习依存结构的语境分布:一种走向组合性的统计学习理论
神经语言模型将习得的依存结构作为新的分布学习单元,先掌握依存关系,再学到其语境分布,从而解释组合性。
语义不确定性量化需要事实等价性
语义不确定性量化瓶颈在现成比较器难判事实等价;训练对比编码器隔离事实可显著提升并改进词元估计。
Nürnberg NLP 在 ChildSafeAds 2026:四种数据访问级别下的结构相异投票者集成
为儿童向视频商业内容监测构建九投票者集成,在四种数据访问级别下评估,三子任务中两夺冠,均值列第三。
SignFLIP:基于大规模分阶段对齐的手语翻译与生成统一模型
提出统一框架SignFLIP,以LLM为核心,经大规模分阶段对齐实现手语翻译与生成,媲美专用模型。
语言模型内省的机制研究
固定输入下注入概念向量,发现中层门控头决定是否报告,后层路由头定位扰动,准确率依赖概念向量对齐。
从规范框架到对齐数据:构建与评估SFT与偏好数据
七位专家依伊斯兰伦理构建2.8K SFT与5.4K偏好数据;SFT显著提升对齐,偏好数据增益不显著。
理解同策略蒸馏:基于稀疏交叉编码器的机制可解释性视角
借助稀疏交叉编码器与交换读出法发现:同策略蒸馏不创造新特征,只是重新加权学生已有的共享特征。
当置信度过早上升:通过过早答案承诺检测捷径推理
提出ConfLens追踪答案置信度演化,用DACS分布熵检测过早自信捷径,改善奖励模型偏好。
多轮大模型污染中的认知策略分歧:一项协议梯度研究
多轮对话中虚假前提可被LLM当作事实采纳;五种污染协议沿权威梯度揭示模型采纳率与恢复能力的显著分化。
大语言模型能在多大程度上模拟真实学习者对教育反馈的评价?
LLM模拟真实学习者评价能力仍有限;提供画像与示例可改善分数校准和个体模拟,但难提升群体一致性。
从输入到输出:面向稀疏自编码器特征双端解读的灵活智能体
提出DAFI智能体,从输入端与输出端双向采集证据并迭代解读稀疏自编码器特征,兼顾准确率与效率。
神经科学中的深度学习方法:从分子机制建模到意识状态分类
综述深度学习在意识状态分类、麻醉脑建模与意识标志物识别中的应用,指出现有模型可解释性与标准化不足。
决策而非生成:基于Jev类型化决策的竞争性维度ABSA
冻结Jev以类型化决策完成维度ABSA三任务,无需生成微调;回归RMSE最低,抽取F1超微调大模型。
MemoReason:评估参数记忆对大语言模型上下文推理的影响。
提出配对真实与虚构推理的基准,发现大模型存在记忆偏差,性能降达15.7%,但非直接参数捷径。
衡量同质面板LLM辩论中的崩溃与纠正
提出可审计协议,追踪同质辩论的崩溃与纠正,揭示防崩溃可能以损失纠正为代价。
SCBO:面向基于大语言模型的社会调查的语义连贯批处理与排序
SCBO为免训练框架,用语义批处理、共享参考库与难易排序,降低token消耗与推理时间并提升准确率。
评分标准感知的同策略自蒸馏:面向大语言模型个性化
提出GRASP框架,用评分标准感知的同策略自蒸馏将用户偏好转为token级监督,并验证教师质量,在LaMP-QA上达最优。
当文字比图像更响亮:理解视觉语言模型中的语言偏见
VLM易受语言偏见,本文基于词补全分四阶段追踪传播,揭示语言先验与跨模态覆盖交互。