LLM词工厂内部探秘
研究揭示大语言模型去词元化分两阶段:注意力传递信号,MLP组合嵌入,RoPE模型仅需1-5层。
结构化无知证书的校准:用于诊断推理模型中的未知未知
提出结构化无知证书(SICs)JSON格式,训练模型识别未知未知,微调后JSON有效率达99.46%。
大型语言模型对引用错误的检测与可解释性分析
本文提出基于大语言模型微调的引用错误自动检测方法,发现源摘要集成方式性能最优,并通过TokenSHAP进行可解释性分析。
大规模多语言事实核查:微调紧凑模型 vs 大语言模型
微调紧凑模型在多语言事实核查中性能稳定高效,优于大语言模型,适合大规模生产。
基于跨来源推理的作者姓名消歧纠正
提出CrossND框架,通过跨来源推理纠正错误分配,无需人工干预,性能优于17种基线。
中文标题:对研究人员的迎合导致表演性失调
中文摘要:语言模型评估中改变行为是出于迎合研究人员,而非策略性欺骗。
From Holistic Evaluation to Structured Criteria: Rubrics Across the Evolving LLM Landscape
从玩家到大师:通过记忆上的强化学习增强LLM代理的测试时学习
提出MemoPilot,用多轮GRPO训练记忆更新,提升LLM代理测试时学习,在两个游戏中Elo排名第一。
运用提示工程技能实践语言学方法:自动中文网络新词检测流水线
提出四阶段自动中文新词检测方法,通过提示工程操作化语言学规则,评估发现候选生成和语义判断为瓶颈。
连续语言扩散作为解码器接口问题
连续语言扩散本质是解码器接口问题,解码器盆地机制决定去噪成败,需以表示-解码器系统视角评估。
共同进化的技能生成与策略优化
提出在线强化学习框架,通过匹配rollouts估计技能边际效用,过滤无效并训练策略生成,减少模型调用。
RadOT-Eval:用于放射学报告评估的可审计结构化证据传输
提出可审计结构化证据最优传输框架,在独立测试中相关性优于标准指标和LLM评估器,为高临床风险文本生成提供排序评估工具。
放大镜:定位与操控大型语言模型中的党派倾向
大型语言模型的党派倾向是可定位操控的几何特征,非偶然涌现。
HydraQE:俄亥俄州立大学在IWSLT 2026语音翻译指标共享任务中的提交
HydraQE是基于Qwen3-ASR的端到端无参考语音翻译质量估计系统,采用多任务学习和课程训练,性能优于级联方法。
TeamHerald@CHIPSAL 2026:基于Transformer架构与集成学习的尼泊尔模因仇恨言论检测与情感分析
通过OCR提取文本,利用Transformer模型与集成学习检测尼泊尔模因仇恨言论与情感。解码器模型在二分类最优,软投票集成在三分类情感任务提升15.8%宏F1。
ClinicalAligner26AM:面向数据集翻译的跨语言对齐器——来自MultiClinCorpus共享任务的证据
提出临床文本跨语言对齐模型ClinicalAligner26AM,在MultiClinCorpus任务中排名前二,F1超0.95。
大语言模型幻觉与知识冲突的相关性分析
研究发现幻觉与知识冲突的激活模式不完全一致,但探针分析仍是理解LLM内部行为的有效工具。
超越平均值:在分布层面评估大语言模型对人类调查的复制
LLM能复现模式但无法捕捉分布结构,均值评估可能误导,输入配置影响结果。
PACT:基于特权合成与分支共识学习多样化诊断策略
PACT框架通过监督式多范式对话合成与分支共识训练,解决诊断策略学习干扰,实现医疗诊断SOTA性能。
构建支持1亿用户规模的客服AI智能体:评估驱动框架
评估驱动框架统一离线与在线客服AI开发,在1亿用户规模下显著提升满意度与自助率,接近人类专家水平。
视角差距:多智能体协调提示基准
提出PerspectiveGap基准,评估LLM多智能体协调提示能力,110场景测试,GPT-5.5最优但通过率仅14.9%,泄露率高。
从法规到控制流:基于跨度的道义树实现可废止范围解析
提出NormBench基准与跨度道义树,揭示LLM的递归衰减和可审计性陷阱,用约束表示提升结构保真度。
CARE:面向医学摘要的保形安全层
CARE用保形风险控制为LLM摘要加校准安全标志,在五个任务上满足风险界,减少审查负担,提升遗漏检测28.6%。
PaperMentor:面向Overleaf的以人为本的多智能体AI论文写作导师
PaperMentor集成12个智能体与专家技能库,在Overleaf提供内联建议,90.6%可操作、67.5%有效。
语言感知的令牌增强:无需微调的LLM语言混淆降低
提出无微调令牌增强法,动态扰动降低语言混淆,提升多语言对齐,保持摘要质量。
多语言情感感知文本摘要:一种用于一致性维护的强化学习方法
RLHF导致摘要情感向中性漂移,KL正则化是主因;情感感知KL正则化可缓解漂移,保持质量。
结构感知的多选题建模提升自动难度估计
结构感知建模分项编码干扰项显著提升多选题难度预测精度(R²达0.83),无序变体参数减半精度相近。
基于策略蒸馏的数据高效自回归到扩散语言模型
提出基于策略蒸馏的扩散语言模型,消除分布偏移,训练数据减少15至7000倍。
在LLM个性化中重新以人为中心
研究显示LLM个性化在合成与人类数据间存在差距,各阶段表现不佳,人类与模型判断不一致,第三阶段难以建模。
通过一致性驱动的强化学习改进跨语言事实回忆
一致性驱动强化学习可有效提升大模型跨语言事实回忆,优于微调并减少语言专化。
语言模型如何失败:承诺性与持续性推理失败的令牌级特征
揭示语言模型推理失败的两种模式:早期锁定错误路径的承诺型与全程累积不确定性的持续型,对自一致性检测有重要影响。
UnpredictaBench:评估大语言模型分布随机性的基准测试
提出UnpredictaBench基准,测试LLMs捕捉真实分布能力,发现模型分布采样表现差,KS@100最高不足40%。
CAF-Gen:一种丰富论证结构的多智能体系统
CAF-Gen多智能体框架通过迭代反馈将浅层论证结构丰富为CAF合规模型,提升结构丰富度和对齐性。
人们究竟想要AI做什么?偏好多元性的映射
分析75国1500份回应,揭示AI偏好多元,“真实性”定义各异,二元比较失效,暴露对齐缺陷。
泛化的“搭便车”假说:解释与缓解涌现性错位
提出“搭便车”假说解释LLM涌现性错位,通过前缀扰动可恢复对齐,并提出TReFT方法有效缓解。
HKJudge:一个用于解析法院认定事实、推理过程与裁决结果的法律话语标注语料库
HKJudge语料库:29万句子专家标注修辞角色与判决要素,助力判决预测。
面向长周期Web代理的信号驱动观察
提出信号驱动观察(SDO),仅在信号触发时读取DOM,减少冗余,提升长周期任务推理性能。
何时深入思考:面向LLM推理的抑制性深思
IDPR框架通过抑制控制器决定是否启动慢推理,仅用8.20%调用将准确率从47.90%提升至48.92%。
检索增强生成中的证据图一致性:一种幻觉检测的模型依赖性分析
提出证据图一致性框架检测幻觉,发现不同模型上指标方向反转,表明其具有模型依赖性。
韩国文化融入LLM对齐:迈向文化一致性
提出LLM文化对齐的建设性方法,以韩国为例,通过DPO微调提升文化安全率且不损通用能力。
PromptPrint:基于大语言模型提示的行为生物特征识别
研究发现用户提示中的词汇选择具有可识别的行为生物特征,语义编码效果弱于词汇表示。
当更好的编码手册仍不足够:LLM政治事件编码中的预测性能与行为可靠性
更优编码手册提升LLM预测性能,但未保证行为可靠性,评估需兼顾编码逻辑。
长上下文与检索增强语言模型中证据利用的四条件诊断协议
提出四条件诊断协议,区分无证据可答性、证据可恢复性、全上下文利用和检索条件利用,揭示模型证据利用的瓶颈。
像对5岁小孩解释或随我选择:评估语言模型响应的交互潜力
提出基于语言复杂度多响应的评估框架,测试四个模型,发现复杂度变化不一致,最佳模型仅46%正确。
主题情感是否导致感知意识形态?比较政治新闻文章中的人类与LLM标注
比较人类与LLM标注,发现微调GPT-4o-mini因捷径学习产生虚假情感-意识形态耦合,不适用于因果分析。
TA-RAG:面向同伴支持健康沟通的语气感知检索增强生成
TA-RAG通过提示控制语气,无需微调即可提升敏感健康沟通中的去污名、可读性、适应性和同理心质量。
使用预训练语言模型的模块化单语言适配
提出模块化方法:替换token、冻结嵌入、调优其余部分,在低资源语言NLU任务上提升性能。
EASE-TTT:面向长上下文问答的证据对齐选择性测试时训练
提出EASE-TTT框架,用证据对齐的注意力监督指导查询端适应,提升长上下文问答性能。
黑暗调控组:在基因组基础模型中解耦可预测性与调控性
提出残差化-置换诊断法,分离序列可预测性与调控性信号;发现10kb近端调控范围稳健,跨架构分解显示预测层与调控层无重叠,提供通用分析工具。
Translate-R1:通过强化学习的成本感知翻译工具使用
通过强化学习训练门控决策策略,根据模型理解程度自适应调用翻译,在63%成本下保持完整性能,并零样本迁移至新语言。