重定义步骤优势的自引导过程奖励优化用于过程强化学习
提出SPRO框架,从策略模型自身获取过程奖励并重定义步骤优势,效率提升3.4倍、准确率提升12.9%,无额外开销。
突破压缩瓶颈:从理论到实践
论文首次证明低秩分解与量化非正交,提出对角粘合方法(DAM)有效缓解组合性能损失。
MoE中存在知识注入吗?探索MoE中专家感知的对比解码以缓解大语言模型幻觉
EAACD通过对比MoE高层专家组的可信度差异,放大低可靠性专家幻觉作为负参考,有效缓解大模型幻觉。
何为好文?从LLM推理痕迹中提取与检验文学质量隐含理论
LLM评估文学质量重视意图与结构,分类准确率79.3%,结构降级影响最大,词汇影响最小。
MoE路由是哈夫曼编码吗?链式思维中频率-多样性法则的发现
发现MoE路由遵循哈夫曼编码原理,通过子集差异剪枝消除冗余,将路由转变为最优压缩引擎。
人机协同的大语言模型框架用于识别皮肤免疫相关不良事件
LLM辅助识别皮肤免疫不良事件,准确率与一致性提高,时间减半。
中文标题:并非越多越好:LLM意见多样性的关键何在?
中文摘要:通过因子实验发现,LLM意见多样性不随人格细节单调增加,多种交互架构组合效果最佳,低成本手段作用有限。
技能契约型智能体用于证据感知的材料文献分析
AlphaAgent通过技能契约分离检索与报告生成,在材料文献分析中超越基线,显著提升机制解释与可信度边界意识。
LLM-INSTRUCT在2026年UZH共享任务:面向段落级论点挖掘的约束感知检索与选择性辩论
约束感知检索与选择性辩论提升论点挖掘精度,缩小决策空间获得任务冠军。
立场:自然语言不应完全取代形式语言
自然语言适于低明确性任务,形式语言利于高要求任务,两者互补,应发展混合系统。
Moir:让模型自述其历程,实现鲁棒的跨域知识编辑
Moir让模型自采样估计协方差,无需外部数据,有效保持编辑后脆弱领域能力。
使开源文本大模型的水印能够抵御模型合并
提出合并对抗训练,使水印在模型合并后保持鲁棒,TPR@1%FPR平均提升25个百分点。
路由子空间:审计微调语言模型中评估到部署的不匹配
提出通过激活对比定位并修正微调模型评估-部署行为差异的方法,在多数设置有效。
自信的欺骗:自信如何放大LLM的欺骗风险
LLMs高自信欺骗,人类78%偏好高自信回答,错位微调加剧风险,模型能识别但无法避免。
TopoGuard:基于图论的RAG分裂知识攻击防御方法
TopoGuard基于图论构建语义相似图,高效检测RAG分裂知识攻击,召回率远超LlamaGuard,亚毫秒延迟且鲁棒。
先答后编:保留效用的反蒸馏推理骨架编辑
提出"先答后编"框架,通过编辑推理骨架增强反蒸馏效果,同时保持准确性与自然性。
AsymVerify在SemEval-2026任务6:用于政治回避检测的非对称置信门控验证
提出非对称置信门控验证系统AsymVerify,用于政治回避三分类检测,以0.85 Macro F1获SemEval-2026任务6第二名。
偏好调优:频谱更新重组
RLHF偏好优化中,LoRA更新呈谱头尾结构:头主导行为但学习不足,尾弱却不可缺,揭示后训练为结构化重组。
中文标题:LLM世界模型中的信念传播:用预测市场测量战略信息偏差
中文摘要:LLM结合预测市场可测量信念偏差,乌克兰案例显示偏差主要源于文本来源而非模型本身。
GLAN-QnA-KR:一个无种子分类驱动的韩语指令语料库
发布303,581行韩语指令问答语料,无种子分类驱动,低重复低污染,最大单一流水线合成韩语库。
Naver-News-KO:面向开源摘要模型微调的韩语新闻摘要数据集
发布Naver-News-KO韩语新闻摘要数据集(27,400对),提供基线及微调模型,用于开源摘要模型微调。
区分人工与真实:评估大语言模型检测自身生成内容的能力
研究显示,LLM检测自身生成内容高度依赖任务类型:编程和长回答效果佳,简答题效果差,提示措辞影响显著。
SCoPE: 对话中情感识别的移位感知说话者条件先验
提出SCoPE模块,融合说话者情感先验与转移预测,动态平衡历史与多模态证据,在IEMOCAP上取得最优。
RE-AD:数据标注的实时需求遵循
提出RE-AD框架,利用LLM实时验证标注质量,F1达0.749,生产中错误修复率82%。
Domyn-Small:欧洲100亿参数推理语言模型
欧洲开源10B推理模型,MIT许可,预训练9万亿tokens,后训练优化推理与指令遵循,32K扩展至128K上下文,效率高且性能平衡。
ShriNep@EEUCA 2026: RAKSHAK——基于理由蒸馏与Jigsaw增强的多任务DeBERTa毒性意图分类系统
提出多任务DeBERTa框架RAKSHAK,结合理由蒸馏、对比损失与Jigsaw增强,处理六类毒性意图不平衡数据,Macro F1达0.5883,在35支队伍中排名第7。
thaulab@EEUCA 2026:谁对谁说了什么?一种面向目标的神经符号流水线用于游戏毒性检测
提出三阶段神经符号流水线,集成Transformer和语言中介,通过数据增强解决极端不平衡,获Macro F1 0.644、准确率0.906,排名第三和第一。
面向LLM零样本谵妄预测的知识注入框架
推理时注入临床知识,无需微调,零样本谵妄预测AUROC提升8.57/1.99个百分点,缩小与前沿模型差距。
语义场理论:历史起源、高阶交互与稳定化语义推理
提出用语义场、高阶交互与能量稳定化机制建模词汇语义与组合推理。
模型中的叙事者:叙事模式继承、升级动态与LLM对齐治理
LLM吸收人类叙事模式,引发行为漂移和潜在特质(如谄媚),形成未监控的升级风险。
前沿大型语言模型的响应漂移现象
所有前沿大模型均存在响应漂移,幅度差异大(78-81% vs 47-49%),结构依赖领域和问题,仅人类评估可捕获。
通过强化学习检测UI原则违规
用强化学习训练轻量视觉语言模型检测UI违规,微F1从36%提升至84%,实现可扩展界面质量评估。
Learn2Zinc:在MiniZinc中微调小型语言模型实现文本到模型转换
跨模型错误引导微调小模型,MiniZinc代码语法准确率达98%,但约束推理正确率仅35%。
Instruct-FD:你的全双工语音系统能遵循轮流发言指令吗?
提出Instruct-FD基准,评估全双工系统遵循轮流指令能力,最佳仅64.4%,主动回指打断尤具挑战。
CAMeR: 关键词门控混合激活实现LLM智能体自适应记忆保留
CAMeR通过关键词门控混合激活实现自适应记忆保留,在100轮对话中显著提升高频记忆权重,节省83.2%令牌。
评估GPT-4.1在观点预测中的人物模拟有效性
GPT-4.1人物模拟预测观点:选举9中8,疫苗信念准确率0.94,对话符背景但欠自然。需注意偏见,未来多领域应用。
效价能否反映自然语言中的道德?一项初步标注研究
本研究通过500个标注构建道德效价数据集,证实效价特征可有效评估文本道德,助力AI与人类道德对齐。
THOR:基于Theta-Gamma分层振荡推理的多跳问答框架
受脑电节律启发,解耦全局规划与局部检索,缓解注意力衰减和错误累积,提升多跳问答准确性与鲁棒性。
前沿金融判断:智能体能否识别影响股价的因素?
新基准评估智能体金融判断,最强仅52.4%匹配专家,误报率差异显著,需区分新旧信息。
弃锚:基于脉冲星注意力的分布式系统统计上下文摘要
提出Pulsar Attention,用内容感知前缀和跨块摘要替代静态锚点,降低3.3倍计算量,长序列性能提升达4.7%。
From Agent Failures to Text Policies: What Works and What Breaks
人格的几何学:基于荣格认知功能的激活引导
本文用荣格认知功能替代大五人格,实现LLM人格的单调控制,发现其几何结构与多维控制特性。
Rushes:用于多元对齐的人类偏好数据集
Rushes数据集显示,先进LLM预测用户选择不及流行度基线,揭示单一人口目标无法捕捉个性化偏好。
REGARD:大型语言模型中的区域情感差异
REGARD用VAD分析发现,LLM情感框架差异中通用回答率与低唤醒度强相关,聚类不受模型来源影响。
REFACT: 自适应事实复述以实现紧凑且忠实的链式思维推理
REFACT通过自适应事实复述与两阶段训练,提升长上下文问答忠实性并减少令牌消耗。
多样性指标是否衡量多样性?对LLM集成中多数投票增益的能力控制审计
多样性指标实际反映能力而非多样性;多数投票增益有限;能力控制后仅共享错误与增益负相关。
CSPF:面向不可验证偏好评估的约束共享-私有融合方法
CSPF将冻结奖励模型隐藏状态分解为共享与专家私有表示,实现互补融合,在不可验证偏好评估中取得最优性能。
大型语言模型中生命性概念的所在:追踪生命性概念的电路
发现LLM中存在处理生命性概念的因果电路,但分布广泛且仅部分泛化,体现其上下文依赖与分级性。
LegalCiteTrust:中文长篇法律研究报告中引文可信度的基准测试
提出LegalCiteTrust基准,从存在性、忠实性、适用性评估引文可信度,发现引文感知的证据治理可更有效提升信任得分。
腾讯WorkBuddy Bench:一种抗污染任务构建的多领域编码智能体基准
多领域编码智能体基准,反向工程真实提交构建抗污染任务,四子集覆盖代码、网页、办公、安全,开源可复现。