Macro:通过对齐即偏好优化增强多语言反事实解释
Macro框架运用DPO偏好优化增强多语言反事实解释,有效性提升12.55%且保持最小性,平衡两者权衡。
时间不是标签:面向时序知识图谱与智能体记忆的连续相位旋转
RoMem用语义速度门控与相位旋转区分持久与演化事实,无需删除即按时间排序,时序补全SOTA,记忆推理准确率提升2-3倍。
弥合推理差距:基于机制回路的大语言模型知识编辑
提出MCircKE,识别因果回路并仅更新其参数,弥合知识编辑中的推理差距,增强多跳推理能力。
利用对比解码合成指令微调数据集
提出CoDIT,用对比解码生成指令数据,抑制预训练共享知识、突出指令遵循,提升微调效果。
当情绪成为触发器:寄生大语言模型的情绪风格动态后门攻击
提出情绪风格动态后门攻击,触发条件编码于情感,攻击成功率逾百分之九十八,词级防御难以识别,去情绪化可缓解。
从偏好到原则:基于评分标准的证据知识答案对齐
提出基于评分标准的奖励框架,为开放域问答提供细粒度监督,结合检索证据与多维度分解,显著提升生成质量。
什么能进入专家评审?AI辅助题目开发中的表征、结构筛选与候选形式依赖
计算评估器并非中性,其表征与筛选决定进入专家评审的题目;全局稳定掩盖了内容的不稳定。
当青年进入对话:验证基于大语言模型的学生话语测量中的认识论转向
现有验证法忽视青年视角,需让青年参与研究以正确定义其话语,案例显示模型测量与青年自述不符。
开放文本多维度评估中的维度间依赖性
提出CorrGap衡量LLM评委的维度间依赖,发现其普遍存在;提出DimCheck缓解依赖,性能超强基线,小模型可低成本近似大模型。
从分诊到出院:急诊科自然语言处理任务、方法与开放挑战综述
综述46篇急诊科NLP论文,覆盖分诊、诊断、处置三阶段,总结任务、趋势与开放挑战,强调临床评估。
ADE:面向以人为中心目标的智能体数据演化框架
提出ADE框架用观测变异选择闭环与稳态准入提升数据快照内在胜率升至75.81%外在升至68.86%
Giga-Embeddings:面向高吞吐文本嵌入的专家混合编码器
提出Giga-Embeddings系列,含稀疏10B MoE(1.8B激活)、稠密3B及蒸馏480M模型,吞吐量高,480M模型以少42%参数超越FRIDA。
大语言模型中创造力自动评估的局限性
自动评估与人类判断严重错位,LLM评委偏好AI文本,现有指标相关性近零,难以衡量创造力。
乌尔都语主要动词与轻动词区分的上下文嵌入证据
用多模型分析乌尔都语七动词,主/轻动词语义分离但同词元相近,轻动词身份可预测,支持Butt理论。
驯服视觉忽视:多模态上下文学习中自适应注意力的变分信息瓶颈框架
提出变分信息瓶颈框架,以跨模态信息增益判定视觉冗余,动态重分配注意力,提升精度并减少示例需求。
名称可能伤人:识别本地编码大模型中包名幻觉引发的投毒抢占风险
提出双层检测器识别代码模型伪造的PyPI包名,结合随机森林分类器与回退机制,在300提示词下76%运行无幻觉,对抗性提示下幻觉率升至40-73%。
PARTAB:分区感知推理与结构化证据实现可扩展表格理解
该框架利用语义分区和分层证据选择,精简上下文,提升多种表格推理任务性能。
缓解多指令遵循强化学习中的探索偏差
强化学习提升多指令遵循时存在偏向简单指令的探索偏差,提出行为引导与稀缺感知奖励两阶段框架,显著超越基线。
SAGE:从直接作答到基于证据的推理——中国古代文献理解
SAGE多智能体框架将文献理解转为证据推理,经规划、取证、验证与重规划,超越直接回答,小模型胜过大型模型。
情节记忆是否有助于弥合句法对比敏感性中的词汇频率差距?基于检索增强语言模型的测试
检索增强记忆可缩小语言模型在高、低频词汇句法对比中的表现差距,验证情景记忆补偿参数表征,但未能完全消除差距。
超越静态与线性:何种注意力约束最适合人类阅读时间?
内容敏感约束优于距离,最拟合阅读时间;动态课程下心理与语法分离,模型非通用认知模型。
探究交互式对话游戏中的知识迁移
微调大模型研究对话游戏知识迁移:某些游戏迁移优于微调,视觉空间类最佳,任务向量难预测迁移。
曲线推理II:潜伏代理几何——将可解释性扩展到探针之外
提出无监督几何方法,无需探针或后门即可检测欺骗,几何结构可预测分类,高精度时更显著。
少即是多:咨询对话中最小回应与大语言模型行为的实证研究
咨询中最小回应常见且重要,但大语言模型生成少、难判时机,评估也易低估。
AgentSpec:面向LLM智能体批量推理的推测解码
AgentSpec面向LLM智能体以结构隔离草稿降拒绝率用冗余感知预算分配提升批量推理性能超现有方法
MC-CXR:用于视觉-语言模型中上下文引发干扰的多情境胸部X光基准
提出MC-CXR基准,评估十种VLM,误导文本切换率45.6-78.1%,视觉更稳健,揭示文本上下文显著干扰图像判断。
TrustDABench:针对结构化数据分析的LLM可靠性与鲁棒性基准测试
新基准评估LLM数据分析:可靠性与鲁棒性最高仅24.21%和9.10%,需加强证据边界与不变性推理。
数字语义评分衡量劳动力市场数字化转型:应用于荷兰劳动力市场的人工智能方法论
基于人工智能方法构建数字语义分数分析荷兰劳动力市场发现数字化不均衡及技能多维性职业转换依赖路径
该责怪哪个智能体?定位智能体深度研究中的忠实性与引用错误
提出定位多智能体深度研究错误的方法,发现AI-Q中84.7%最终错误源于编排器,多为引文问题;简单干预提升引文召回5%。
《“Ghāib” 之译:看不见的伤害》——LLM 仇恨言论检测中跨文字安全不一致性的“乌尔都语漏检”评分
乌尔都语被主流安全评测忽视,五款LLM在乌尔都语及英语间分类不稳定,漏检率最高9.9%,安全保证不均。
ROBE:反转顺序偏置专家,用于从历史文本中提取极端长尾事件
提出ROBE方法,分组训练专家分类器并反转偏置以保护长尾,从17-18世纪荷兰语语料中提取50余种事件,F1提升0.10。
RecurSE:用于LLM评分裁判的有界递归自评估
提出RecurSE,让LLM裁判以自身评估能力闭环自改进,解耦检查器评分与裁判判定,用PAV监控早停,在多个基准上提升泛化性能。
MemUse:记忆评估从直接问答转向长期人机对话中的自然整合
直接问答评估与用户满意度无关;新法评估自然融入,高直接问答分仅不足一成用于对话,自然融入才与满意度相关。
SENSESHIFT:基于编码器的掩码填充实现连续情感控制文本生成
SenseShift用双向注意力和迭代掩码填充实现句子级连续情感控制,在故事和评论生成中优于解码器基线,保持文本质量。
FireRedAudio:面向理解与生成的解耦连续表征通用水音频语言模型
FireRedAudio用9B大模型解耦连续表征,统一理解与生成,支持ASR/TTS/编辑。
超越语义准确率:面向安全关键语言理解的后果感知评估
安全关键场景中语义指标高估可靠性,后果感知评估揭示差距,应作为标准NLP指标的必要补充。
SteerCheck:激活引导审计中的归因特异性与对齐泄漏
提出SteerCheck审计,揭示符号随机化方向的对齐泄漏,限制对照区分;主门控为负,需报告可交换性假设。
语音到SOAP:医疗对话的端到端摘要——KIT@BeTraC 2026
提出可扩展数据增强管道,以合成语音和自动SOAP标签统一医疗对话数据,实现端到端语音到SOAP摘要。
捷径先于回路:文档统计决定上下文冲突消解时机
合成数据中线索重合使机制不可辨,干预后归因翻转但时序可复制
超越信息获取:面向主动医疗对话的严重性感知问题监督
提出期望严重性风险目标,通过严重性感知监督选择问题,使主动医疗对话优先降低高风险漏诊,将高危漏诊率降29.5%,准确率提升至93.2%。
数据集稀缺制约多语言嵌入模型的稳健评估:斯拉夫语言案例研究
提出二维评估框架分析斯拉夫语MTEB,发现数据稀缺制约稳健结论,少数模型跨任务表现优异。
离散难度是否足够?利用连续难度提升LLM自一致性效率
提出柔性自一致性方法,用连续难度动态调整推理路径数,保精度且节省最多76%的令牌。
词语、空间与生成式AI:当代建筑中的语言层次
语言是建筑设计材料,生成式AI中交织话语、编程语言与注释,需研究隐喻、语料库及语言差异。
大语言模型中量化对孟加拉语理解的影响:一项系统性评估
孟加拉语量化影响因模型而异:GPT-OSS损失大,Qwen/LLaMA稳定,架构与方法比位宽更重要。
FARCA:事实监督强化学习中事实对齐的可靠性感知信用分配
提出FARCA,将事实监督转为可靠性加权的令牌级训练信号,解决信用分配歧义,提升事实性并保持推理。
迷失于语音:跨音频与文本的三语口语幻觉检测
首个三语口语幻觉基准(英俄哈,1.2万样本):文本检测优于音频,合成训练可迁移至真实虚假新闻。
线性探测为机器生成文本检测提供稳健高效的方法
线性探针以极少样本超越多种检测器,跨域提升AUC,因共享潜在“机器性”方向,可细粒度估计AI编辑文本。
期待、反弹、复苏与兴奋:模型发布如何塑造Reddit对对话式AI系统的看法
分析Reddit长期讨论,发现对话式AI用户看法随模型发布动态变化:Anthropic获好评,OpenAI现反弹复苏,Grok-3受政治影响,DeepSeek-R1毁誉参半。
从局部核到全局形式:建模音乐内容的涌现
用滑动窗口从单序列估计局部转移核,在德彪西《Syrinx》中边界处达峰值,但宽平台表明难作自动分段器。
SkillForge:为强化学习智能体演化可验证技能
提出SkillForge框架,通过环境交互验证技能并持续演化,使技能库保持有效,显著提升强化学习智能体性能。