面向跨语言事实一致性的潜在空间干预:在不降低准确率的前提下提升一致性
通过潜在空间干预提升跨语言事实一致性,不损准确率;开放问答一致性显著提升。
VoiceCodeBench:评估自动语音识别中精确结构化令牌恢复
VoiceCodeBench基准评估ASR精确恢复结构化标记,表明词错率不足,需实体敏感指标。
因果干预揭示多语言语言模型中按类型学组织的句法机制
通过因果干预,发现多语言模型中句法机制跨语言迁移,且迁移程度与语言类型相似性相关。
将均值移向已知的好而非超越它:推理时干预与权重整合在开放式生成中的收益
生成-验证-筛选-LoRA整合使输出均值趋近经典启发式,最佳候选恰达该水平且不超越,结果可复制。
利用多方对话中的话轮转换动态进行意图识别
提出多任务学习,用话轮转换熵建模多方对话动态,提升意图识别,优于忽略互动动态的方法。
面向翻译错误检测的多语言句子嵌入评估:英-希对比研究
英希翻译错误检测对比:嵌入模型最高89.3%,质量模型94.49%,两者互补。
语言模型表征的统一视角:从填充角色结构到机制可解释性
提出张量积表示作为统一假设,从数学和实验上统一类比、线性探针、稀疏自编码器与激活修补等可解释方法。
利用可解释的形式级特征,检测与引导大语言模型生成的韩语诗歌
提出五个可解释形式特征,对LLM生成韩诗的检测AUC达83.60,并引导生成更接近人类风格。
替代的幻象:基础模型时代下专用机器学习模型的再思考
语言模型难言全面替代专用架构:仅少数场景占优;涉及结构表示与计算时,专业化只会转移而非消失。
VocalAffectBench:评估AI音频模型中的语音情感识别
语音情感识别基准:273段音频、7类情感,平均准确率35.5%,最优46.5%,非中性情感识别脆弱。
非全有或全无:面向对话立场检测的目标感知记忆图动态构建
提出TamGraph,用熵引导回溯动态构建目标感知图,选择性利用历史对话,提升立场检测性能。
RouteSparse:面向预算受限长上下文预填充的输入条件模式路由
RouteSparse:按输入条件路由稀疏模式,延迟感知选预算,不确定回退稠密,实现6.5倍加速且精度几乎无损。
CoVA-SFT:面向视觉抽象链的大规模数据集
CoVA-SFT数据集教模型交错文本与视觉抽象,微调超交错CoT两倍,逊于纯文本CoT。
大语言模型中的识别-拒答失调:为何模型会回答结构上不可回答的问题
模型隐藏状态中已有“不可答”识别信号,但与拒答路径几乎正交;回答结构不可答问题是路由失败,而非编码失败。
HEAR谁说了什么:通过反事实语音对齐解锁说话人归因推理
提出说话人归因推理基准发现语音模型依赖语义先验构建反事实音频训练模型实现强性能与零样本泛化
AI历史学家:助史学家整理核验分散历史叙事中以人物为中心的时间线索
AIH整理验证散见史料的人物时间线索,《史记》测试定位准确率86.2%、14分钟,优于人工,已用于多国史籍。
合成数据中错误容忍度的量化:原子级操作数与算子扰动研究
ATOM框架区分操作数与算子扰动,模型对前者鲁棒而后者敏感,优先算子多样性提升合成数据质量。
通过定向检索器微调实现乌兹别克法律RAG的云与本地部署
为乌兹别克法律问答构建检索增强系统,微调检索器后云与本地部署均达标,并发布基准与模型。
基于属性的LLM激活引导实现群体特定解释生成
提出基于激活工程的属性引导方法,通过计算群体专属引导向量注入LLM,生成更贴合特定群体、保持事实性的解释,优于提示词和现有方法。
迈向文化对齐:以人为中心的多模态AI故事评估(基于五个非洲社区)
评估AI多模态故事在五个非洲社区的文化对齐,发现依赖语境而非标签,提出分类,自动评估不可靠,需社区校准。
临床对话AI面对患者打断:扩展安全性评估
患者打断导致临床内容丢失,现有基准未覆盖。四模型在FAQ竞争中全部失败,打断鲁棒性需分场景评估。
大语言模型系统性偏好热门选项:跨选择题的证据与缓解
大模型存在系统性流行度偏差,偏好热门错误项。提出PopMCQ基准与PopDebias推理时校正,无需微调,最高提升54.1个百分点。
用语义锚定语音:面向低资源语言自动语音识别的多模态适配器机制
提出多模态适配器,用翻译语义和语音锚增强语音识别解码,在台语、客家话等低资源优于基线,自动语义锚有效。
SHADOWBENCH:迈向自动形式化中语义对齐的可靠自动评估
提出SA-Pass:用影子语句双向检验自动形式化语义对齐;构建ShadowBench基准,实现高一致性。
迈向汉语族语言的跨语言罗马化生态系统:普通话-粤语配对案例研究
建立汉语族罗马化生态系统框架,依四原则,开发粤语、普通话等方案;实验较拼音+粤拼显著降低粤语词错率与字错率。
模态断层线:结构性破坏揭示全模态推理的脆弱性
干净评估高估全模态鲁棒性。结构破坏测试发现:文本视觉是稳定故障线,多模态退化非加性,干净精度不代表可靠性。
为LLM网页智能体学习简单的测试时环境
提出TTED,让LLM网页代理测试时学习分解复杂环境为子模块,无需标注,提升组合泛化。
StageWell:过程对齐的中文积极心理学支持对话语料库
提出过程对齐中文对话语料库StageWell,以六阶段支持流程与DPO局部修复构建,显著增强模型过程控制、响应质量与安全性。
阿拉伯语安全对齐作为选择性拒绝:SFT、DPO与防护校准的实证研究
研究发现混合SFT可在低误拒率下达高拦截率,DPO和防护效果因模型而异,支持按部署目标选择干预。
何时适配:用于保留通用能力的领域特化的条件记忆适配器
提出Engram Adapter,按输入条件激活记忆,提升领域精度且保留99.4%以上通用性能,实现冻结核模型的模块化领域特化。
心理困扰由谁评估?社区视角与大语言模型在心理健康帖子上的对齐
大模型系统性高估社区心理困扰,尤其在“无到轻度”时假阳性多,偏离社区视角,影响心理健康AI部署公平性。
AlgoWorlds:算法世界中全局优化的工具使用基准
新基准将组合优化转为部分可观测决策,测试大模型工具使用,最优率仅38.6%,难点在信息整合与全局推理。
检索增强生成中幻觉的检测与修复
比较删除、替换、重写三种修复:均减少幻觉,删除降幅最大但保留最少(64.3%),重写保留最多(80.1%)但降幅最小,且误改83.5%干净答案。
Pad\=artha:基于本体论的古典梵语细粒度命名实体识别基准
首个本体论驱动的梵语细粒度NER基准,含18类、10.8万实体;生成模型与传统相当,但细粒度及未见实体表现差。
你所需要的只是非交换词
用酉矩阵有序相乘表示句子,非交换性捕捉词序,无需位置编码,以64参数编码代替3万维词表,性能媲美甚至超越基线。
评估语言模型中表示引导的语义特异性
CRT诊断显示晚期表示引导仅注入全局标签偏差非修复推理使原本正确任务性能从99.6%跌至40.4%
AI在临床决策中易被说服
研究发现AI在临床决策中易被说服:权威身份、背景、声称业绩、重复施压等可改变其决策,甚至捏造支持错误观点也能诱导。
人工神经网络的涌现符号结构
研究表明神经网络内部表示隐式实现符号结构,可用封闭方程近似替代且行为不变,支持定向干预。
项目均值代理:为何更丰富的角色数据未能提升大语言模型作为人类代理的表现
大语言模型仅能预测条目均值,无法捕捉个体差异,丰富角色数据亦无效。
CoCoA:面向大语言模型的上下文条件文化对齐
针对大模型文化偏见,提出上下文条件文化对齐框架,在有无文化线索时分别优选或保持中立,将文化偏见分从43降至24,且不损通用性能。
MUDDLE:在干扰项与长度效应下衡量文档理解能力
提出MUDDLE基准,分离干扰项与长度影响,发现主题相近的硬负例比等长随机干扰更降准确率。
SIC-Agents:面向儿科重症疾病沟通培训的基准测试与自适应模拟器构建
针对儿科重症沟通培训,提出首个基准套件与自适应模拟框架SIC-Agents,通过可编辑技能文档优于静态专家提示,并开源模拟器基准。
推理模型思维链的忠实性随偏好线索的传递位置和方式而变化
新评估显示,工具返回和隐性偏好线索降低思维链表述承诺,却增加未表述采纳,使监测可靠性下降。
基于图尔敏论证模型的规范文本语义对齐:一种神经符号方法
论证结构补充神经语义,提升规范文本对齐效果,其中依据特征最有效。
本体引导的多智能体学术评价文本中评价对象抽取——来自中国图书情报学的证据
提出本体引导多智能体框架抽取学术评价对象,显著提升精度与细粒度分类,支撑循证科研评价。
LLM评委作为评分者:对公共语料库中LLM作文评分的严格度、光环效应、信度与版本不稳定性的预注册审计
预注册审计:LLM评分严格度差异大,与人类相关仅.47-.56;版本更新显著改变评分,光环效应未见超人类证据。
你如何提问,就收获什么:理论引导的求助型LLM对话中表述清晰度的测量
用户表述方式可测且独立于主题,影响模型回复;信息贫乏的长篇提问得到模糊回答。
SUP-MIMIC:评估大语言模型对矛盾证据鲁棒性的多任务临床诊断基准
提出SUP-MIMIC多任务基准,评估临床诊断歧义与趋同场景,揭示大模型依赖统计捷径、性能下降,且存在“健康”预测的保守偏差。
SemTrace:基于源文档的语义签名,用于追踪大语言模型对受保护文档的接触
基于文档事实构建语义签名水印,经推理解码检测生成文本是否受保护稿件影响,实现模型无关的指定副本溯源。
超越表面对齐:锚定大语言模型中情境理解与生成控制的动态
针对表面对齐局限,提出锚定对齐:评估情境与生成锚定,并以动态控制让模型真正理解情境与生成。