机器翻译质量能带你走多远?面向目标场景中的外在语篇评估
通过实体计数和外交游戏证明高内在翻译质量无法保证下游语篇一致与协调,提出外在评估框架。
SING:面向LLM智能体可扩展主动工具发现的合成意图图
SING框架构建意图-工具图动态检索,召回率提升59.8%,成功率提升28.9%,工具暴露减少99.8%。
多轮反思掩码激发掩码扩散模型的推理能力
提出反思掩码方法,轻量后训练实现多轮迭代修正,无需架构改变,在多种任务中优于基线。
理解环境感知信息检索的行为
首次系统分析LLM通过强化学习适应不同检索器,发现不同检索器有不同最优查询风格,引入分支式rollout提升稳定性。
反推加载下作为材料失效的谄媚行为:跨三种加载情形与多达十七种材料批次的多轴表征
材料科学框架多轴表征LLM谄媚失效,加载类型决定模式,判官可靠性因情景而异。
P3B3:用于衡量大语言模型中欧洲葡萄牙语和巴西葡萄牙语变体偏见的多轮对话基准
P3B3基准揭示大语言模型偏向巴西葡萄牙语,需更平衡的多语言变体表示。
混合技艺:基于Mixup的混淆方法用于大语言模型中保护隐私的分割学习
MIXGUARD框架通过多级混淆与自适应梯度扰动,在分割学习中兼顾隐私保护与模型效用,抗重建攻击。
通过图像连接语音与文字
利用图像和语音描述,无需文本监督即可建立语音词汇与文字映射,性能优于基线,适用于低资源语言。
基于大语言模型的航空航天几何设计视觉代码补全
提出基于LLM和ReAct的航空航天几何设计视觉编程副驾驶,用户试验显示有帮助但推理慢。
伊斯兰大语言模型:从知识获取到可信且抗幻觉的人工智能
伊斯兰大语言模型需基于权威来源、精确引用、处理语言差异和法理分歧,构建可信抗幻觉系统。
FraudSMSWalker:评估智能体大语言模型在短信转网页欺诈检测中的基准
提出FraudSMSWalker基准,测试大模型在无URL声誉下,基于内容判断短信转网页欺诈的准确性。
渐进式知识引导的轴承故障诊断大语言模型框架
物理引导多尺度框架实现98.49%准确率与12.6倍计算加速,解决特征可追溯性等挑战。
抛硬币的法官?LLM作为评估者的可靠性和偏差
LLM评估不稳定性高,重复偏好翻转率13.6%,存在位置偏差,建议多轮聚合与随机化。
电商欺骗性界面下的网络智能体安全基准测试
通过WebDecept框架测试电商欺骗界面,发现当前Web智能体易受多种欺骗,提示约束不足。
后训练能否让大语言模型成为优秀医疗编码员?生成式ICD编码的实证研究
后训练(SFT、GRPO、PHI)可大幅提升LLM的ICD编码能力,仅靠提示评估会低估其潜力。
继承推理:哪些模型表现更优?
团队比较商业与开源模型,商业模型更可靠,Gemini 2.5 Flash最优,MRE为0.989。
QIAS 2026:伊斯兰继承推理共享任务概览
该任务评估大模型在伊斯兰继承领域的复杂推理能力,结果显示当前模型在精确法律解释与数值推理方面仍面临挑战。
文化漏斗:数据中没有的,无法对齐
LLM文化对齐存在数据漏斗,训练后文化信号锐减,多语言虽增地理多样性但不平衡,标签框架提升基准性能。
当合理不等于现实:评估基于大语言模型的城市模拟中的人类移动行为
LLM城市模拟虽能生成合理叙述,但难以再现真实时空约束,需进行严格的实证验证。
用于神经主题建模的混合经典-量子变分自编码器
提出混合量子-经典变分自编码器,以10量子比特在AgNews上优于SOTA(C_v=0.71,NPMI=0.20),验证NISQ时代可行性。
SANA:海量数据湖上问答代理的关键因素
SANA框架诊断数据湖问答代理的失败,发现数据分析是主要瓶颈,搜索在大规模数据湖中至关重要。
DLawBench:基于多轮法律咨询的大语言模型评估
DLawBench基于真实案例构建四种客户类型,评估大模型法律咨询能力,最佳模型仅0.562,暴露谄媚与指导悖论。
基于大语言模型的生成式推荐的隐式推理
提出PauseRec隐式推理方法,性能提升6.22%,训练成本降低65%,推理加速71.3%。
基于文本和音频的语言模型中动词+up短语的整体存储
文本与ASR模型中,V+up短语因频率和可预测性形成整体存储,支持基于使用的语言理论。
LLM具有多重性:部署环境如何重塑模型层面的偏好与价值观
LLM的偏好和价值观随部署上下文显著变化,安全保证依赖具体场景,非固定属性。
MedLatentDx:面向跨医院罕见病诊断的潜在多智能体通信
MedLatentDx用潜在KV块通信实现跨医院罕见病诊断,保护隐私并提升性能。
创造性整合:一种可判定的创造力标准
提出基于压缩的可判定创造性整合标准,通过冲突压缩与四项测试验证。
对话式SWE-Bench:面向对话驱动编码智能体的基准测试
提出对话式SWE-Bench基准,通过人格化用户模拟评估编码智能体对话能力,发现编码能力不等同于对话能力。
中文标题
提出双向诊断发现LLM在道德判断中对有益和有害提示的遵从率几乎相同,表现为方向盲视。
融合文体特征与嵌入系统以估计日语文档作者似然比
首次将似然比框架用于日文文本比较,融合文体与嵌入系统提升似然比值和判别力,log代价0.32484。
超越困惑度:字节感知语言模型中的UTF-8有效性
UTF-8有效性收敛滞后困惑度一倍,稀有字符结构有效性更高,可靠生成需独立评估。
对男性更严厉?评估LLM在不同冲突场景中的性别不对称道德框架
引入GAMA-Bench发现LLM对男性更严厉且惩罚性,对女性更同理,存在性别不对称。
检测议会文本中未公开的LLM生成内容
训练可解释分类器检测英瑞议会文本,发现2022年起未公开LLM使用持续上升。
个人健康效用:将健康视为日常基础设施
本文提出个人健康效用(PCU)架构,作为日常健康基础设施,将数据转化为事件与干预,实现个性化指导。
学会听出犹豫:面向不流畅感知ASR的持续学习
本文利用持续学习与显式不流畅标记,在不流畅语音ASR中平衡标记学习与性能,并发现共同注意力机制。
解耦的混合专家模型用于参数化知识注入
提出DMoE模块架构,解耦专家和路由器,将外部知识转为独立专家模块,仅在模型缺乏知识时激活,提升知识注入效果。
语言学奥林匹克:迈向语言学研究的新语料库?
探索语言学奥林匹克问题作为新语料库的潜力,分析其优势与局限,为融入学术研究奠定基础。
CacheRL:通过缓存推演和混合奖励的多轮工具调用智能体
CacheRL以极低计算量训练小模型,在多步工具调用中达92%准确率,核心创新:混合思考轨迹、模糊缓存与缓存感知奖励。
OdysSim:构建人类行为模拟的基础模型
提出SOUL分类法,构建OSim模型,在23项任务中8项领先,输出更类人,零样本迁移模拟与真实用户匹配度达93.2%。
法官偏爱英语吗?评估LLM作为法官的语言切换不变性
LLM作为法官时,语言切换导致10.7-14.4%偏好翻转,英语准确率最高,但翻译等价测试未发现英语偏见,非平局反而倾向中文。
Achieving Precise Text-To-Cypher Via Grounded Knowledge Graph Data Generation
LLM智能体训练的回顾性进度感知自优化
提出RePro框架,让智能体先执行后反思自生成进度信号,避免外部监督,提升长期任务成功率,最高达12%。
AgentSpec:通过受控组合理解具身智能体框架
AgentSpec模块化框架通过标准化接口分析组件交互,揭示智能体性能取决于兼容性与组合效应。
MoDiCoL:用于鲁棒语音识别的模块化诊断持续学习数据集
提出MoDiCoL数据集,模拟真实分布偏移,研究ASR鲁棒性的获取与遗忘。
危机中的应对:2023年土耳其地震数字危机话语中应对风格的计算建模
通过百万条推文分析2023年土耳其地震的应对风格,BERTurk分类器揭示时间变化规律,为人道响应提供依据。
ClinicalBERT语言预测中人口统计学关联编码的计算审计
审计发现ClinicalBERT的表征偏差主要通过模型内部放大,而非继承训练数据。
福多和派利辛的系统性挑战依然存在
神经网络仍未解决系统性挑战,模型在规则学习上表现不佳,挑战依旧。
BayLing-Duplex: 由单个自回归LLM实现的原生全双工语音对话
提出BayLing-Duplex,单自回归LLM自主控制听/说/停,无需VAD,性能优异且不牺牲响应质量。
SIMMER:基于世界模型对LLM可执行规划中的潜在失败进行基准测试
SIMMER揭示LLM规划含高比例潜在失败,56%计划存在且多不可逆,反事实推理可减少72%潜在失败和75%不可逆后果。
说服力指数:一个理论指导的说服分析框架
提出基于心理学的15维说服力指数,用55个特征模块化实现,轻量有效,开源发布。