与机器各说各话:人机对话中的道德、礼貌与对齐
人机对话中AI只具合作表层,道德预置、温暖缺互惠,语言趋同下降、机制反向;能动性最预测对齐。
基于图方法的临床文档一致性再词汇化
提出G-RELIC,结合图与LLM实现实体一一映射与时间重定位,提升临床再词汇化的关系和时间一致性且不损隐私。
全模态需求理解:多模态交互中上下文用户意图推断基准
提出ODU基准,评测多模态模型从视听与对话上下文推断用户需求的能力;14个模型最强仅恢复44.7%。
评估天城文OCR后校正的上下文学习与检索策略
首次系统评估LLM天城文OCR后校正,提出CharBM25检索,超越稠密检索且免GPU,12B以上模型有效。
MIRAGE:强化学习引导的多视角创造性语言模型推理
提出MIRAGE推理时框架,选择器与推理器协同多视角探索,在多项基准超越思维链,精度更高且开销小。
跨职业的机器翻译评估指标性别偏见基准测试
七种语言436类职业机翻评测有性别偏见:男性化译文得分偏高,职业差异呈刻板印象,因评估器与语言而异。
中文竞技辩论数据集与基准
构建148场比赛、20,542个交锋单元的中文辩论数据集,含三位专业评委按统一标准评分,设三项预测任务,大模型表现有限。
当引导在潜在推理中失效:潜在到语言的转换鸿沟
激活引导在连续思维中对语言生成的影响远弱于显式CoT,存在潜在到语言转换鸿沟,输出分布在该边界突变。
引导大语言模型的回答趋向挪威MFQ-30中的道德基础
挪威MFQ-30测6个开源LLM,对比1282名挪威人:人格提示使认真作答者更接近均值,ActAdd致扁平并现认知幻影。
分析语言模型嵌入空间中语言关系的线性程度
提出框架分析嵌入中语言关系线性;屈折/派生近线性,词典/百科误差高,RoBERTa/ModernBERT优于GloVe。
PRISM-BN:面向文本到参数化贝叶斯网络抽取的受控语料库与评测基准
构建5054条文本—贝叶斯网络配对语料与评测基准,六种大模型结构抽取强,但完整CPD参数估计仍困难。
CIBuzzBench:中文网络流行语跨语言理解基准
提出首个中文网络流行语中英跨语言理解基准,含3001条标注与三项任务,评测显示大模型仍难准确理解。
按病因的对比严重度嵌入与音系伪标注用于多语言构音障碍语音
按病因建模优于混合建模,三种病因宏F1相对提升22.6%–40.0%,音系伪标注再添增益。
重新思考人类对齐评估:超越WER的语义指标分析
WER最不符人类判断;SemDist最优,CER简单且接近最优,建议主用CER、辅以SemDist。
RheoSampling:解决随机动态树投机解码中的独热困境
解耦树构建与验证概率,为采样词元设代理概率,实现无损随机动态树投机解码,提升接受率与加速比。
TrialAtlas:面向临床试验设计与优化的多智能体研究组织
TrialAtlas以记忆增强多智能体组织模拟临床开发规划协作,在FDA完整回复函基准上,试验缺陷检测与成功预测均显著超越基线。
复用潜在语音表征进行查询条件化的转录文本主题定位
复用ASR编码状态融合文本嵌入,轻量定位查询句段,免独立音频编码器;优于纯文本基线,严格匹配增益明显。
经过个性微调的大语言模型能成为更好的社交智能体吗?
对两个小模型做个性微调后,角色扮演能力未优于基线,仅提升Qwen语言多样性;评估者一致性低,结论受限。
道德熵:审察道德判断中的偏见与不确定性
提出贝叶斯框架"道德熵",分解标注中的偶然与认知不确定性,审计主流聚合规则,揭示其系统性偏差。
NemotronLabs VoiceChat:一个具备工具调用能力的开源全双工语音到语音模型
开源全双工语音到语音模型,统一流式架构支持实时聆听、转写、推理、调用工具与发声,中断接管表现领先。
DiaVLo:诊断视觉语言模型的行为
提出诊断框架DiaVLo,结合人工与模型生成构建视觉语言模型行为规范,揭示行为错位并因果定位关键概念。
RecreationWorld:面向混合计算机使用智能体的可扩展可验证环境
提出五平台 RecreationWorld 框架与 RecreationBench 基准,训练混合计算机使用智能体复刻并验证应用,揭示交互与计算输出短板。
共形隐私审计:具统计保证的校准重识别攻击
提出共形隐私审计CPA,为发布文本提供针对LLM重识别攻击的统计保证与可解释泄漏度量。
QuranicMMLU:评估生成式AI古兰经语言知识的认知感知型基准
提出QuranicMMLU基准,按语言五支柱与认知层级构建980题,揭示多选高分掩盖开放回答缺陷。
基于三信号互补的可解释LLM智能体记忆决策控制器:解耦置信度与一致性
提出零参数记忆决策层MDL,三信号互补解耦置信度与一致性,冲突记忆下幻觉率降约56%,高风险近零。
Cross-sector generalization of accident-process role classification in occupational accident narratives
基于预训练语音嵌入的跨语言帕金森病严重程度评估:一项多分类评价
四种语音基础模型嵌入在三个数据集上跨语言多分类帕金森病严重度,可有效迁移但受数据与适配策略影响。
数字的隐性代价:数字规范化与ASR系统中的词错误率
以波兰语为例,数字规范化缺失令ASR评测WER差异超2个百分点,常高于多语言基准的系统间差距。
Voice-Light:一种具备因果话轮转换与推测生成的全双工级联语音智能体
全双工级联语音代理:即时声学起播、因果轮次判断、投机生成与可逆播放;保留混合控制器,中位758ms。
我会留心听:教会音频大语言模型主动提供音频辅助
提出主动音频辅助与ISM,用特殊标记让AudioLLM自主决定何时提醒;Qwen2-Audio在ESC-50中断F1达99.6%,延迟3.5秒。
多跳检索中的可预测失败:基于分数分布的置信度评分与弃答
提出RCS,用查询-ANN结构特征评分置信度并弃答,在多跳检索五类失败场景降低自信错答率,跨数据集可迁移。
Souper-Model:简单算术如何解锁顶尖大模型性能
提出SoCE融合法,按基准弱相关类别选专家模型并非均匀加权平均,提升性能并登顶伯克利函数调用榜。
基于软提示微调的大型语言模型文化对齐
用差分进化优化短软提示、冻结权重且无需偏好数据,使大模型实现文化对齐,并在四国四模型上验证有效。
GameLogicBench:基于Tick级状态断言评估编码智能体的运行时游戏逻辑
新基准GameLogicBench以逐Tick状态断言评测智能体游戏逻辑,最佳仅解52.78%。
维基百科口语演示语料库
发布含LLM生成幻灯片的维基百科口语演示语料库,用于多模态ASR评测,最佳模型微WER10.23%。
层次化注意力解释:一种用于双模态抑郁症检测的可解释语音级Transformer
提出双模态语音级Transformer,避免片段标注,提供层次化解释,性能优于片段级模型,助力临床筛查。
CASCADE 抵御越狱攻击:跨阶段组合与受控攻防评估
首次系统研究LLM越狱防御跨阶段组合:无单一防御最优,合理组合可兼顾安全与效用。
审查前沿大模型知识的知识库提取:GPTKB v1.5 的多维度分析
对GPT-4.1递归提取的1亿条事实作多维分析,发现其准确率远低于此前基准,不一致、歧义与幻觉问题突出。
VQ-Logits:利用向量量化 Logits 压缩大语言模型输出瓶颈
提出VQ-Logits,用向量量化共享码本压缩LLM输出层,参数减99%、计算提速6倍,困惑度仅增4%。
你确定你确定吗?论指令微调对置信度与词汇多样性的影响
指令微调提升回答置信度却损害校准,跨理由多样性下降,表层词汇多样性变化不一,控制变量后仍成立。
JudgeSense:LLM 作为评判系统提示敏感性的基准
发布JudgeSense基准,880条样本配双措辞指令,测试25个评判模型,发现改写措辞令一致性下降。
语义校准在词元置信度失效处更胜一筹:长文本科学问答基准测试
首个大规模长文本科学问答不确定性基准显示:词元置信度失效,仅最终答案语义一致性校准良好。
基于依存句法引导大语言模型的可解释多模态方面级情感分析
提出生成式可解释多模态方面级情感分析框架,用依存句法提示引导多模态大模型预测情感并生成解释。
无国界的教诲?——基于多语言故事寓意生成评估大语言模型的文化对齐
以14组语言文化数据提出多语言故事寓意生成任务,发现前沿模型虽贴近人类解读,却跨语言差异小、价值观趋同。
MemoryArena:在相互依赖的多会话智能体任务中评测智能体记忆
MemoryArena统一评测多会话记忆-智能体-环境循环,记忆与行动耦合,覆盖导航、规划、搜索与形式推理,现有基准高分智能体表现不佳。
为什么大语言模型在策略博弈中举步维艰?观察、信念与行动之间的断裂链路
大模型策略博弈失败暴露观察—信念、信念—行动两大内部断链:信念脆弱,且转化为高收益行动受阻。
Draft-OPD:面向投机草稿模型的同策略蒸馏
Draft-OPD以目标辅助生成和错误位置重放做同策略蒸馏,提升草稿接受率,实现超5倍无损加速。
Sometin Beta Pass Notin:通过知识蒸馏改进尼日利亚语言的多语种ASR
提出SBPN多语种ASR,经两阶段知识蒸馏,覆盖五种尼日利亚语言,WER相对降29%,优于SOTA。
十六个模型,不到两种声音:在无唯一正确答案时测量集成离散度
16个模型平均语义多样性仅1.69;模型身份仅部分解释分歧,集成离散度应实测而非假定。
基准的平衡:面向任务条件模型比较的语义密度重加权
提出BoB框架,以语义密度重加权和分数等值,提升任务条件下模型比较的准确性与稳定性。