评估大语言模型在内容审核中标准条件行为
现有基准用聚合标签掩盖了模型按具体标准审核的缺陷。引入DECO后,发现模型在依赖特定内容维度而非整体有害性时失败率高,需明确评估标准条件行为。
合成数据增强对话语语用功能分类的影响
合成示例位置与数量同等重要:近端样本宏F1增益最大,平衡混合准确率最高,但增强仅移动决策边界。
增强金融问答:银行财务报表的新型基准数据集
面向银行财报问答构建基准,近千问覆盖多机构年报,分块增强与检索优化使检索及答案准确率大幅提升。
Sequential Beats Joint: On the Interplay between On-Policy Distillation and RLVR
CROCODIL: Cross-Model Code Editing with LLMs
Two-Stage Reinforcement Learning for Sound and Adversarial Test Generation in Code LLMs
Fixed Suffix Dependency Ratio: Quantifying the Dual-Track Mechanism of Gender Assignment in Latvian Loanwords
RuleMem: Active Rule Memory for Long-Term Conversational Agents
Beyond Majority Vote: Multi-Perspective Adjudication for Medical Hallucination Detection
Alignment-Free Text-Audiobox for Voice Dubbing and Full-Duplex Dialogue Synthesis
Investigating the Ability of Large Language Models to Analyze Recipes for Diabetes
Representational alignment yields generalizable safety in language models
Translation as a Decision Space: A Multi-Agent Perspective on Low-Resource Dialect Generation
预训练中的知识获取?大语言模型凭借辅助视角学习效果更佳
预训练中,重复是知识获取所需,但把重复的词元用于辅助视角更能提升学习,甚至事实回忆,且不依赖教师模型强度。
可读性并非可解释性:思维链推理中评判重要性与实际重要性的比较
思维链步骤重要性仅能部分从文本恢复,语言模型判断与微调批评者未达上限,可读性不等于可解释性。
终极翻译基准
提出终极翻译基准,含人类撰写并评审的多模态示例,能让领先翻译模型失败;每条附验证规则,支持可靠可操作评估。
将自然语言规范编译为本地神经函数
用教师模型生成示例训练小型适配器,将自然语言规范编译为可复用函数,无需远程调用,FuzzyBench-Hard准确率达83.6%。
ESPO:基于诊断、多样化和稳定化的错误结构化提示优化
ESPO三阶段优化提示,准确率提升3.76个百分点,提示缩短47%,全面超越GEPA。
谱相位可容许性证书:复线性映射的新判据
将量子引力的Kontsevich-Segal-Witten准则引入机器学习,通过限制谱集体相位评估复线性映射,并提供可微分的行列式、子集包络等证书,但无法处理深度传播和幅值目标。
SISER:基于熵对抗训练的说话人不变语音情感识别
SISER结合wav2vec2.0与ECAPA-TDNN,经熵对抗训练消除说话人差异,在IEMOCAP上UA达60.63%,优于基线。
面向认知诊断的隐私保护异构多LLM联邦推理
提出异构多模型联邦推理框架,各推理方本地加噪实现本地差分隐私,残差聚合消除异质性,兼顾隐私与诊断精度。
VoxReason:合成前对有源文依据的语音规划的无听者评估
VoxReason合成前无听者验证语音规划的源文依据;槽位准确率不安全,SFT+CF修复显著提升。
披露贝塔:大语言模型读取风险披露所得制度条件贝塔的测量通道理论
价格历史过短时,将LLM视为噪声测量通道,证明制度条件贝塔的可识别性与一致性,给出误差下界及自适应组合
CAE 仿真智能体在通用框架之外还需什么?
通用框架加执行反馈即可超越专用多智能体系统,最大增益来自求解器教程提供的领域知识。
掷骰子法:大语言模型品牌推荐重复查询审计的标准化协议
提出掷骰子法,基于方差分解确立重复查询审计大模型品牌推荐的迭代三档。
Rent-a-RAG:面向第三方RAG审计的嵌入空间水印
提出一种嵌入空间语义水印方案,用于审计第三方RAG中的文档复用,黑盒检测准确且抗后处理。
抛硬币而非洗牌:以推理速度实现大语言模型水印
无状态伯努利水印:每个词元一次随机判定,开销低于百分之一,支持全词汇自加盐,检测保证不变,速度更快。
ALRA:自回归语言模型基于Logit的预训练蒸馏的自适应局部关系对齐
自适应局部关系对齐法,结合学生候选与教师锚点动态调整,分区域匹配分布,优于现有蒸馏,显著提升零样本准确率。
智能体继承记忆的预算验证中的计划指针与记录指令形式
在智能体继承记忆的预算验证中,指针与准则等记录指令可引导智能体选择,但效应因模型而异且不稳定,为描述性结果。
基于意图感知提示的对话心理操纵检测
提出意图感知提示检测对话心理操纵,通过捕捉参与者意图降低漏报,优于其他提示策略。
当模型过度编辑:论最小代码编辑的忠实性
大模型普遍过度编辑代码;保留指令可减少多余改动并提升通过率。强化学习比监督微调更能学会最小编辑。
人类心理测量问卷误述大语言模型行为
问卷得分不能反映LLM真实交互倾向,因其含显性线索致迎合,且人口统计提示仅在问卷中生效;应用生态效度生成概率测量补充。
因果反事实RAG:将因果反事实推理融入检索增强生成
提出因果反事实检索增强生成,融合因果图与反事实推理,提升答案准确鲁棒,减少幻觉。
评估大语言模型在乌尔都语习语上的表现
构建乌尔都语习语基准,发现大模型优于传统机器翻译,但罗马化拼写影响一致性;提示工程对保留比喻义至关重要。
EasySteer:高性能可扩展大语言模型操控统一框架
该框架基于vLLM,具备模块化扩展与八领域预计算向量,性能提升10.8-22.3倍,显著缓解过度思考与幻觉。
LDC:动态控制下的研究想法生成学习
提出结合监督微调与可控强化学习的框架,用多维奖励和动态控制平衡研究想法的新颖性、可行性与有效性。
AgentRM:利用奖励建模提升智能体泛化能力
提出AgentRM通用奖励模型,引导策略模型测试时搜索,九类智能体任务平均提升8.8分。
大语言模型时代的医学推理:增强技术与应用的系统综述
综述大语言模型医学推理增强技术,分类训练/测试期策略,分析多模态应用与评估演进,指出忠实性与原生多模态需求。
IDRBench:探究大语言模型在跨学科研究中的能力
首个IDRBench基准,用三项任务评估十个主流大语言模型的跨学科研究能力。
用户感知 vs. 代理 LLM 评判:LLM 对隐私敏感场景响应的隐私性与有用性
用户评估LLM隐私响应时彼此分歧大,而五个代理LLM虽一致却与用户评价相关性低,无法替代真实用户感知,需更多以用户为中心的研究。
超越可解码性:用编码探针重构语言模型表示
提出编码探针,用可解释特征重构模型内部表示,克服传统解码探针局限;发现说话人效应随训练变化,句法和词汇特征独立贡献。
先想象后规划:基于世界模型的自适应前瞻智能体学习
提出Imagine-then-Plan框架,用自适应前瞻生成多步想象轨迹,融合观测优化策略,显著超越基线。
HOMURA:用强化学习驯服“沙漏”,实现时间受限的大语言模型翻译
提出Sand-Glass基准与Homura强化学习框架,用动态音节奖励平衡语义与时长约束,实现精确长度控制。
迈向多模态多轮安全:从智能体交互到战略对齐
提出面向多模态多轮对话安全的数据集与对齐框架,动态识别风险轮次,攻击成功率降超10%,安全性与有用性提升。
想象有助于视觉推理,但尚不在潜空间
潜空间推理因果链断裂:输入与潜状态脱节,潜状态不影响答案;显式文本想象CapImagine更优。
基于大语言模型的阿拉伯语形态句法标注与依存分析
评估大语言模型在阿拉伯语形态句法标注与依存分析中的表现,检索增强提示接近监督系统,但依赖数据和计算。
当思维链失效时,解决方案藏在隐藏状态中
通过激活修补发现,思维链令牌隐藏状态含可恢复解题信息,即使原链错误也能提升准确率,完整推理链并非必需。
一个模型翻译所有?多语言模型合并的末日火山之旅
研究发现多语言模型合并带来方向性偏差:共享目标语言时较有效,否则性能剧跌。失败源于共享神经元上目标表征几何错位,挑战现有假设。
面向中文社交媒体文本的机器翻译基准测试
提出中文社交媒体文本机器翻译基准,含趣味帖与社交片段,测俚语翻译及风格保留,克服数据稀缺与指标局限。
CoMAP:LLM智能体的世界模型与智能体策略协同演化
提出COMAP框架,闭环交互协同演化世界模型与智能体策略,在任务规划、网页导航和工具使用基准上超越基线。