唇读鸿沟:VSR模型是否像人类一样感知视觉语音?
VSR模型虽准确率更高,却依赖训练词频而非视觉信息,与人类唇读方式存在本质差异。
MemDreamer:通过层次图记忆与智能体检索机制解耦感知与推理实现长视频理解
MemDreamer解耦感知与推理,构建层次图记忆与智能体检索,仅用2%上下文窗口实现SOTA,准确率提升12.5点。
无参考的分类体系评估
提出两个无参考指标:基于语义相关性评估鲁棒性,基于自然语言推理评估逻辑性,与真实标签F1相关且可预测下游性能。
SWE-Explore: 评估编码智能体如何探索代码仓库
SWE-Explore基准评估智能体仓库探索能力,覆盖848个问题,智能体优于经典检索,行级覆盖与排序是关键。
DirectAudioEdit: 基于扩散预测对比的无反演文本引导音频编辑
提出无需训练与反演的音频编辑方法,在音乐和事件基准上FAD和KL分别降低15.9%和15.8%,编辑速度提升64.5%。
语音情感识别中音频语言模型的声音线索对齐
声学标记对齐提升语音情感识别性能,扰动降低并偏移至中性,模型仍部分依赖音频信号。
挖掘有用的通用数据用于低资源领域适应
提出NTK-Selector从通用数据中筛选有益样本,显著提升低资源领域适应性能,超越仅领域微调。
爱沙尼亚主观性数据集构建:基于量尺的主观性程度评估
创建含1000篇文档的爱沙尼亚主观性数据集,人工与GPT-5评分对比显示LLM可行但无法完全替代人类标注。
SlideAgent:面向多页视觉文档理解的分层智能体框架
SlideAgent采用全局-页面-元素三级推理,构建结构化表示,在多页文档理解上准确率提升7.9%-9.8%。
DialDefer:检测与缓解大语言模型对话性遵从的框架
LLM因提问框架不同对相同内容判断偏移,新框架DialDefer可检测并缓解此遵从现象。
AutoTool:面向智能体推理的动态工具选择与集成
AutoTool框架通过双阶段优化实现LLM代理动态工具选择,在多基准上平均提升6.4%至7.7%。
分析LLM生成文本中劝说性语言的差异:揭示刻板的性别模式
研究提出评估框架,发现13个LLM生成的劝说性语言存在显著性别差异,反映刻板性别模式。
AdaJudge:自适应多视角评判用于奖励建模
AdaJudge通过门控精炼块与自适应多视角池化改进表示和聚合,在奖励建模中超越传统方法。
SEEK:通过内部推理草图引导RAG中的LLM推理
SEEK利用结构化引导草图迭代检索填充知识,减少冗余查询,提升RAG性能。
SWE-IF:使代码评估符合人类偏好
SWE-IF评估代码指令遵循与功能正确性,复合评分最符合人类偏好,指令遵循是LLM主要差异因素。
多模态大语言模型在中国短视频虚假信息中的认知偏差探究
评估8个MLLMs应对短视频虚假信息认知偏差,Gemini-2.5-Pro最优(71.5),o3最差(35.2),模型易受权威线索误导。
The Necessity of Setting Temperature in LLM-as-a-Judge
你是否应该使用大语言模型进行探索或利用?
推理模型擅利用但成本高;非推理模型通过工具可提升中等任务,仍不如线性回归;LLM有助于探索大语义动作空间。
LLM作为元裁判:用于NLP评估指标验证的合成数据
利用LLM生成合成数据替代人工验证NLG评估指标,meta-correlation超0.9,高效可靠。
仅需两个样本的自一致性:CoT-PoT集成实现高效LLM推理
提出CoT-PoT集成方法,仅两个样本即可达到自一致性效果,样本量减少9.3倍,78.6%任务有效。
StepPO:面向智能体强化学习的步调对齐策略优化
StepPO提出步级范式,将智能体RL转为步级MDP,通过步级信用分配优化策略,在多项任务中优于现有算法。
面向视觉原生的多模态深度搜索智能体的在策略数据进化
提出图像银行协议与在策略数据进化,使中间视觉证据可复用,八基准平均提升14.1%,超越Gemini-2.5 Pro。
基于去噪反馈的强化学习
提出RLDF方法,利用去噪反馈高效估计策略损失,在扩散语言模型上显著提升性能与泛化性。
GradShield:保持对齐的微调
GradShield通过有害性得分和自适应阈值过滤有害数据,微调中保持LLM安全对齐,攻击成功率低于6%且不损失性能。
动态自我演化抽取系统
DySECT通过LLM抽取三元组构建知识库,结合图推理反馈优化,形成闭环持续提升抽取能力。
思维链推理中保真度衰减的机制证据
提出NLDD度量,发现超70%-85%链长后步骤对答案贡献小或负,揭示模型未必真正推理。
Finding the Minimal Parameter Budget for Implicit Reasoning: A Data Complexity Driven Scaling Law for Language Models
PolarQuant:利用极坐标变换实现高效键缓存量化和解码加速
PolarQuant将键向量分为二维子向量,编码为极坐标半径和角度,解决异常值,高效量化KV缓存并加速解码。
通过将Transformer反编译为RASP来发现可解释算法
提出方法从Transformer提取RASP程序,因果干预发现子程序,实验表明长度泛化模型内部实现了简单RASP程序。
讲故事,造汉字:与中国城市老年移民的AI辅助共创
老年移民借助AI与手工共创汉字记录故事,AI降低表达障碍,挑战同质化假设。
基于双大语言模型自我精化的数据库规范化
Miffie利用双LLM自我精化架构,自动高精度规范化数据库,无需人工。
注意力机制中归一化的局限性
注意力机制归一化局限:多token选择致区分下降、均匀化,梯度敏感阻碍训练。
RePo:具有上下文重新定位的语言模型
RePo通过可微分模块重新分配位置,减轻注意力负担,提升长上下文和噪声场景性能。
通过光学字符识别重新思考基因组建模
提出OpticalDNA,将DNA渲染为视觉布局,以OCR方式建模,实现近20倍token压缩并超越大模型。
VALUEFLOW:迈向大型语言模型中多元且可操控的价值对齐
提出VALUEFLOW统一框架,通过分层价值嵌入、强度数据库和锚定评估器,实现可控强度下的多元价值对齐。
语言模型中针对激活引导的内生抵抗
发现大语言模型存在内生抵抗(ESR),受扰时口头重启并继续相关话题,可被增强,对安全具有双重影响。
TRUE:大语言模型推理的可信统一解释框架
提出TRUE框架,通过三重分析实现推理的多层可验证解释,提升可解释性与可靠性。
循环语言模型表达能力的代数视角
统一代数框架阐明表达能力,归结幺半群划分积;案例显示浮点限制偶数模计数,整数量化则实现。
带有一致性验证的多智能体推理改善了医学MCQA中的不确定性校准
多智能体推理结合一致性验证,降低医学MCQA校准误差74%,提升AUROC 0.056。
MAGE:全掩码块在块扩散LLM中预知关注位置
MAGE利用块扩散对齐特性,第一步精确注意力后复用KV子集,近无损加速128K上下文达6.82倍。
更强大,但更不合作?当大语言模型在零成本协作中失败
LLM在零成本协作中,更强模型合作反而更差,需刻意设计合作机制。
AAAC:面向4位大语言模型权重量化的激活感知自适应码本
AAAC通过激活感知自适应码本实现4位量化,快速高效且零额外存储,性能超越现有方法。
MCERF:通过增强检索推进工程文档的多模态大语言模型评估
MCERF系统结合多模态检索与LLM推理,采用多种策略,在工程文档问答中准确率提升41.1%。
模型崩溃的流行病学:基于双层SIR动力学的合成数据污染建模
提出双层SIR/SIRS模型分析合成数据交叉污染,发现检测过滤和群体免疫为高效干预策略。
LANTERN:面向长上下文LLM对话的分层存档与时序情景检索网络
LANTERN轻量记忆层零LLM调用恢复对话压缩丢失事实,准确率78.3%超MemGPT,延迟<25ms。
带有门控关联检索的通用三重潜在压缩
通用三重潜在模型通过门控检索改进关联回忆,但速度慢且对种子敏感。
基于方差感知评分奖励与GRPO改进大语言模型心脏医学问答
提出方差感知连续奖励函数与GRPO,使心脏医学问答准确率达0.502,F1达0.668,接近120B模型水平。
面向电信客户支持的小型语言模型参数高效微调:结合能耗分析的LoRA配置比较研究
比较LoRA配置微调电信客服SLM,发现验证损失最低不等同于人类评价最优,需权衡能耗与性能。
MCBench:全模态大语言模型的多情境安全评估基准
MCBench基准评估全模态大模型安全,发现其跨模态推理薄弱,需改进架构与训练。
用于流式ASR系统的基于加权前瞻评分的高效标点恢复方法
提出加权前瞻评分法,单词边界决策标点恢复,无需微调F1=0.893,微调后0.937。