追逐即课程,捕获定奖励:零数据大模型推理的追逃自博弈
LURE将零数据自博弈化为追逃游戏,沿难度轴布置任务,以捕获锚定密集奖励,提升LLM推理与泛化。
科学趋同,宗教趋异:维基百科各语言版本间的校准框架差异
维基百科各语言版本中,科学概念框架趋同,宗教分歧最大,经校准距离验证。
大型语言模型能否很好地理解中国现代诗歌的诗性逻辑?
提出首个评估中国现代诗歌诗性逻辑的基准,三层次四任务评测六大模型,结果揭示理解缺陷,验证基准价值。
RAG崩溃:当检索文档为自创时,LLM响应崩溃
LLM系统检索自创内容会致RAG崩溃,79.6%模拟崩溃,单一自创引用即可触发,因模型偏爱自身内容。
基于图注意力网络的专利权利要求依赖结构建模与诉讼预测
提出基于图注意力网络的专利诉讼预测模型,建模权利要求依赖结构,提升预测性能并提供结构分析。
ToSCA:利用对话智能体时间和策略抽象的分层强化学习
提出两层次强化学习框架,融合DQN与PPO及双粒度奖励,提升对话策略与质量,优于基线。
机器学习与数字语用学:哪种词类对表情符号使用影响最大?
研究用MARBERT分析X上阿拉伯语帖子,发现动词密度对表情符号使用影响最强,名词频率虽高但影响力不及动词。
Bulbul:阿拉伯语方言语音识别数据集
提出BULBUL多方言阿拉伯语语音识别数据集,覆盖11国275人,含方言与标准语,两级人工验证并建基线。
Real-TurnTurk:用于话轮转换预测的多模态土耳其语语料库
构建土耳其语未脚本双人对话多模态语料库,用遗传算法优化规则预测话轮转换。
EDGE:智能体强化学习中经验蒸馏驱动的引导探索
EDGE将检索经验作为训练时临时支架,用反向KL蒸馏内化到策略,无需额外采样,去掉外部经验仍保留96%性能。
对齐、整合、抑制、路由:Transformer计算的融贯论视角
提出CPC框架,用对齐/整合/抑制/路由四算子解释Transformer计算,实验支持其为共享词汇。
多智能体计算机使用的主干-分支协调
提出主干-分支协调框架,避免虚拟机状态合并,成功率提升6-16.5%,成本降低34-70%。
语义推理去噪:用语义算子纠正语言模型推理
提出语义推理去噪(SRD),用可执行算子修正推理语义错误,迭代去噪,六基准平均提升3.2点。
LLM辅助写作值得实证评估
分析69,209篇论文发现,LLM辅助写作提升表述聚焦、引文广泛和作者全球化,应依据学术质量而非工具使用来评估。
Nürnberg NLP @ GermEval 2026共享任务:基于错误独立LLM投票者的德语社交媒体有害内容检测
针对四子任务类别失衡,采用错误独立的九投票者LLM集成,宏F1分别达89.56/71.63/54.84/83.02,四项均居首。
基于结构化搜索的落地规范性规则生成
提出GNRS框架,用MCMC优化离散AOG,分离操作逻辑与文风,将规则生成转为可检查搜索,质量提升至81%。
Whitewashing Hate, Smearing Harmless Content: Annotator-Style Rebuttal Attacks on LLM-Based Moderation
双层智能体记忆:快速写入路由与慢速巩固
提出双层智能体记忆:写入阶段成本感知路由分类,级联过滤冗余,定期整合内化,选择性外化与内化。
智能体如何表征人类:开放式智能体社交网络中对人类的刻板印象
智能体对人类的刻板印象以能力评价为主,描述为认知、文化或具身主体;反馈受可见性影响,偏见应作为话语过程研究。
词汇扰动干扰LLM推理:注意力偏移的实证研究
词汇扰动致分词碎片化引发注意力偏移降低推理性能碎片同时破坏内容与注意力分配单一通道修复无效需双管齐下
改进少步语言流的解绑自条件化
针对少步生成质量下降,提出解绑自条件化方法,修正训练-推理不匹配,无需重训练,8步困惑度从531降至62。
协作税:LLM多智能体系统为协调付出的代价
多智能体协作存在可量化、可预测、部分可干预的协作税,受能力与类别影响。
SSE-Bio:具有智能检索策略的结构化自进化智能体,用于多跳生物医学推理
结构化自进化代理,以代理策略检索知识三元组和模板,细粒度编辑推理记忆,多跳生物医学推理提升6.56点
大型语言模型能否“超线程”?
提出模型超线程假说:串行生成中并发加载多任务,注意力分散可共存更高准确率,为推理扩展提供新方向。
未见问题上的大语言模型评估:情境化多维IRT模型
融合题目语境的多维IRT模型可预测未见问题表现,情境内有效,但跨情境泛化仍是挑战。
面向多模态大语言模型的可迁移越狱攻击:文本锚定语义扰动
提出文本锚定语义扰动攻击TA-SPA,实现黑盒可迁移越狱,表明需加强表示层安全对齐。
语义还是结构?审计多模态时间序列预测中的文本敏感性
多模态时间序列模型的性能提升并非源于文本语义,而是数值列,文本扰动影响极小。
代理基准测试中的噪声基底审计
审计两个提供商的工具调用端点,发现重跑近乎确定,但语义保持的提示扰动导致更大变异,且失败模式不同,边际精度掩盖了稳定性与故障类型。
登记切换打破LLM安全防线:孟加拉语基准测试揭示文化性危害
孟加拉语基准测试显示,LLM半数回复不安全,正式措辞比随意聊天更易诱导违规,现有安全分类器难以评估。
上下文感知集群解码:dMLLM中语义锚驱动的连贯性
提出CACD解码法,融合置信度与邻居邻近度评分,保留语义锚,减少dMLLM长文语义漂移与幻觉。
基于顺序激活修补的思维链推理机制可解释性
提出顺序激活修补框架,追踪思维链注意力头,发现分布式推理子电路支持答案生成。
何时不模仿:面向可靠工具使用LLM智能体的边界感知技能记忆
提出边界感知技能记忆,为技能添加适用条件等边界信息,克服模仿陷阱,提升工具使用成功率。
面向掩码扩散机器翻译的长度自适应解码
提出熵谷长度选择法,免训练,恢复参考长度增益,发现长度设定比揭示顺序更关键。
ProBel:结合技术、片段与解释的 propaganda 检测
提出阿拉伯语与英语的 propaganda 检测资源ProBel,含二分类、多标签、片段及解释。双语多任务模型效果最佳,联合训练可稳定性能。
别把我框住:动态文化适应与认知追踪用于社会理解
提出无训练框架DyCAC,将文化视为动态混合,结合心理理论追踪认知,显著提升社会理解。
谁为安全付出更多?衡量跨语言安全对齐的不平等成本
安全对齐代价因语言而异:非英语用户负担更高,且存在双重惩罚、过滤器失效等模式,暴露系统性不公。
独自对齐,群体失调:预测LLM智能体群体中的对抗性捕获
个体评估难测群体行为;良性运行即可预知攻击下偏移,公开推理中和弱攻、仅延迟强攻,移除攻击者后群体恢复。
比喻正义:基于定性评估与Transformer的印地语判决隐喻检测
专家标注构建印地语法律隐喻语料库,用mBERT等Transformer检测隐喻,推进低资源法律NLP。
多语言大语言模型评判者中的排名反转:无标签双重中心化校准器
无标签双重中心化校准可消除多语言大模型评判的排名反转,提升跨任务一致性及与人类偏好一致性。
从暴露到预期:西班牙语发展中的频率、惊奇度与语言
频率预测了儿童词汇习得年龄,惊异度预测了成人阅读时间;二者作用不同。
SchemaGUI:面向可控GUI生成评估的模式驱动基准
提出SchemaGUI,一种无需人工标注的模式驱动GUI生成基准。评估显示模型几何控制弱、复杂布局易错乱,思考模式反而降低打分。
GTA-RAG:图轨迹增强的多轮检索增强推理强化学习
提出图轨迹增强强化学习GTA-RAG用图路径生成QA轨迹训练检索策略提升多跳证据链覆盖与答案准确率
大语言模型中用于可靠决策的声明级置信度校准
将回答分解为原子声明并校准置信度,无需内部信息,降低事实问题校准误差,但暴露对抗性错误前提问题的失效模式。
GeoRisk-RAG:基于层级感知的风险框架,通过选择性回答提升RAG可靠性
针对地理有效性与语义相似性混淆问题,提出层级感知框架,用DAG距离检索实现选择性回答,将误信率从0.090降至0.009。
混合面板:面向调查研究中的人机协作
大型调查面临回复率低、成本高、延迟大等问题,混合面板结合人类与AI模型,迭代优化调查设计,提升数据质量。
从诊断到重构:用定量民族志改进多智能体大模型推理
通过定量民族志分析智能体对话,诊断推理缺陷并改进提示词,使评分准确率从27.78%提升至40.28%。
核令牌矛盾:一种快速且有原则的LLM声明不确定性量化方法
提出核令牌矛盾法,用核与冯诺依曼熵量化LLM声明不确定性,CPU运行比GPU方法快8.2倍,性能相当。
DiaRelay:以恒定大小记忆传递对话上下文用于对话情感识别
提出DiaRelay轻量适配器,用恒定大小记忆中继对话历史,避免重复编码,提升对话情感识别精度,仅增7.1M参数。
富集-检索-排序:超越上下文路由的能力发现扩展
将能力发现转为离线富集与在线检索重排,相比上下文路由在大规模下更稳健,准确率更高、成本更低。
通过OMOP对齐的检索向大语言模型传授ICU医生的临床推理方法,可提升跨临床领域的推理能力
用临床专家构建的重症推理数据集微调模型在五个临床基准上超越基线证明重症推理可泛化至更广领域需前瞻评估