HiMed:激励医疗大语言模型中的印地语推理
提出HiMed语料与模型,用衰减奖励提升印地语医疗推理,缩小英印差距。
路径至关重要:为扩散语言模型学习令牌提交策略
TraceLock轻量控制器通过未来稳定性自监督学习令牌提交策略,提升扩散语言模型质量与速度权衡,跨设置部署稳定。
TS-Skill:用于评估时间序列问答中分析技能的基准
TS-Skill基准评估三种时间序列分析技能,发现跨区间整合(SK3)对非智能体模型最难,工具增强智能体有优势,揭示聚合评分掩盖的缺陷。
StepGap:多跳问答中步骤级证据缺口的混合NLI-LLM检测器
StepGap混合NLI-LLM检测多跳问答步骤级证据缺口,结构可分解避免LLM-only误差抵消,用作过程奖励提升EM 3.3%。
面向神经符号交互式故事叙述的世界状态转换
LLM预测规则系统的状态转换,可保持世界一致性并激发玩家创意互动。
欧洲25种语言的分词器代价:领域不变性、跨语言少样本效应与乌克兰语惩罚
测量25种欧洲语言分词代价,英语最低,乌克兰语比同源语高15-18%,领域不变,少样本效应模型内在。
Mix-MoE:通过混合专家模型提升大语言模型的多语言机器翻译
提出Mix-MoE框架,分设语言与翻译专家,结合傅里叶特征路由,缓解参数干扰,显著提升多语言翻译效果。
基于ROC分析的翻译质量估计系统评估
ROC分析评估翻译质量估计系统,与现有方法结果一致,且提供支持业务决策的实用性能洞察。
知人方可言:面向多轮对话中LLM个性化的用户状态建模
PUMA框架基于自由能原理,通过隐式用户状态建模与期望自由能最小化,实现个性化对话决策,提升长期对话效果。
CP-Agent: 用于反馈驱动竞赛编程的校准风险控制代理
建模校准停止过程量化风险,实例化三个机制,无需参数更新,Pass@1从25.8%提升至48.5%
Lngram:潜空间中的N-gram条件记忆
提出潜空间N-gram条件记忆模块Lngram,摆脱分词器依赖,降低长上下文困惑度,联合训练超越全微调,提升多模态性能。
BioNLP 2026 PsyDefDetect共享任务综述:支持性对话中心理防御机制水平检测
PsyDefDetect任务基于DMRS框架分类七层防御机制,最佳系统宏F1为0.420,面临类别不平衡挑战,理论感知及LLM方法展现潜力。
谁来评判评判者?基于指标的治理:一个用于持续LLM合规监控的运行时框架
提出基于指标的持续合规治理原则,开发govllm框架,用多模型评委小组检测分歧并触发人工仲裁。
重复序列揭示大语言模型与自然语言之间的差距
通过重复子序列熵分析,发现GPT输出在长程结构上与自然语言存在系统性差异。
译者作为AI的隐形教师:版权、翻译记忆库与语言数据的政治经济学
论文揭示译者劳动被转化为AI训练数据,并失去署名与报酬,沦为隐形“教师”,呼吁数据再分配设计。
超越目标:从模仿到协作的推测解码
CoSpec通过强化学习仲裁草稿与目标令牌选择,在加速同时提升正确率,将推测解码从模仿转向协作。
DTO:面向有效反事实故事重写的可微训练目标
提出可微训练目标DTO,联合优化忠实度与语义一致性,有效提升反事实故事重写性能。
迈向通用因果推理器
提出UniCo框架生成因果数据训练LLM,覆盖18种查询类型,提升分布内外基准22.9%和8.1%,增强真实场景推理忠实度20.2%。
当推理适得其反:面向源感知的前沿大语言模型临床SOAP笔记生成评估
推理增强型LLM在SOAP笔记生成中可能适得其反,非推理配置的GPT-5.4质量最高。
量化翻译错误对多语言大语言模型评估的影响
机器翻译基准中的错误降低评估可靠性,本文量化了自动标注与专家标注的匹配度及翻译错误导致的准确率下降。
研究优化下上下文与参数化思维链忠实性的相互作用
提出FaithMate研究两种忠实性相互作用,发现正相关但不对称,上下文内指标不一致,需多面优化。
TRACE:一种基于分类法的合成数据集,用于应用行为分析中的教学程序生成和会话解读
提出2999例合成指令微调数据集,涵盖教学程序生成与多会话行为解读,基于行为分析分类法生成。
MultiHaluDet: 通过LLM隐状态探测实现多语言幻觉检测
提出通过探测LLM隐状态轨迹检测多语言幻觉,无需微调,英文AUROC达98.55%,跨语言泛化强。
NITP:面向大语言模型预训练的下一隐式令牌预测
NITP在表示空间增加密集连续监督,优化表征几何,提升大模型性能,计算开销极小。
SEP攻击:一种简单有效的基于迁移的文本对抗攻击范式
利用行列式点过程生成多样集成权重,计算词重要性选择高可迁移性对抗样本,显著优于现有方法。
H²MT: 语义层次感知的分层记忆Transformer
H²MT构建语义层次结构,离线聚合节点记忆,推理时粗到细路由剪枝,降低GPU内存和首令牌延迟,实现高效长文本问答。
探索与心理健康障碍相关的认知扭曲特征
心理健康群体认知扭曲高于对照,疾病间模式相似,简单词汇方法有效。
有限标注下的大语言模型选择
提出SELECT-LLM框架,通过预期信息增益主动选择少量查询识别最佳模型,减少标注成本最高达84.78%。
更好、更快:驾驭大型推理模型的自我改进
提出HSIR方法,通过验证后退出采样和内在多样性评分,解决数据不平衡与过度思考,提升推理性能10.9%,减少推理开销42.4%。
LVLMs中的语言偏见:从深入分析到简单有效的缓解方法
揭示语言偏见根源于模态错配,提出LBR与LBP两种方法,有效缓解偏见并提升模型性能与可靠性。
证据关联的放射学报告:面向结构化影像智能的人机协同参考架构
提出人机协同证据关联的报告架构,结合模板与AI辅助,作为结构化智能层支持审核与数据复用。
澄清还不够:澄清后的回答仍是多轮问答的瓶颈
多轮问答中,微调可提升澄清策略,但澄清后作答仍是瓶颈,正确理解用户回应是关键。
忠诚度指标并不衡量忠诚度:基于真实标注的元评估
现有忠诚度指标近乎随机,有偏差,最佳AUROC仅0.70/0.59,暴露评估基本缺陷,需更可靠指标。
在音频-语言模型中,局部性对免训练音频令牌压缩至关重要
提出LTBM,通过局部时间窗口合并相似音频令牌实现免训练压缩,实验显示局部性合并对字幕任务更有利。
基于LLM代理的可再生能源预测:利用边缘和物联网数据——太阳能、风能、天气及电网感知决策支持综述
综述LLM代理整合异构数据增强能源预测,提出六层分类法,指出12项挑战并推荐研究议程。
STREAM:一个以数据为中心的框架,用于从流媒体中挖掘高价值的面向任务的对话
提出Stream框架,从流媒体合成大规模任务型对话数据集StreamDial(87k会话),显著提升对话质量和状态跟踪。
Re-defining Humor Data Objects for AI Humor Research
凭其果实认识它们:通过编码的决策比较法律形式化
提出比较LLM生成的法律形式化方法,通过SAT求解枚举边缘案例,发现行为分歧与结构无关,揭示真实争议。
知识图谱驱动的神经科学专家级推理
仅用单本教科书构建知识图谱,微调小模型实现神经科学专家级推理,参数少但超越大模型。
GroupTravelBench:多人群组旅行规划中的LLM智能体基准测试
首个多用户多轮旅行规划基准,评估智能体偏好引导、冲突协调和规划能力,前沿模型仍显不足。
They Are Not the Same: Direct Causes Are Not Grounded Emotion Explanations
P1SCO:从视角主义透镜看社会维度
P1SCO数据集:多平台社交媒体评论十维标注及元数据,支持社会感知的跨平台与个体差异分析。
从自动化到协作:面向安全可信NLP的人机协同方法
该综述考察人机协同方法,推动NLP从自动化转向协作,提升安全可信,指出可扩展探针、低资源等漏洞及方向。
置信度动态下的推理时优化
正确推理置信度递增,错误递减;置信动态增益投票法显著提升LLM答案选择。
JudgmentBench:评分量规与偏好评估的质量评价比较
发布法律任务评估数据集,比较判断排序准确率0.908远超评分量规0.150,耗时减半。
Mimir:大规模多语言概念建模
Mimir是1.6B参数的大规模多语言概念模型,在46种语言预训练和35种语言指令微调后,与同类模型对比表现优异。
READER:基于推理增强的AI生成文本检测器
提出READER方法,通过结构化推理输出标签与依据,仅1.5B参数即超越百倍规模大模型。
知道但不显露:LLM能识别歧义但很少提出澄清问题
大模型能识别歧义,但很少主动提问澄清,检索上下文反而加剧这一行为差距。
Eureka:面向企业AI云资源需求预测的智能特征工程
Eureka通过LLM生成特征代码和强化学习优化,在云资源预测中提升需求满足率16%、降低迁移率33%。
中文标题
工具调用依赖结构在LLM智能体残差流中可线性解码,表示具传播性,首次探针揭示。