AI语音代理中的人格设定与说服性框架:一项针对儿童的2×2实地实验
德国圣诞热线实地实验:说服性框架使儿童亲社会愿望比例从11.6%升至45.7%,人格权威几乎无效,说话方式比自称身份更关键。
GraphCert:以认证证据评分标准自举智能体式图推理
GraphCert以认证证据标准自举图智能体,免昂贵标注,在五类图推理任务超越更大模型并跨域迁移。
基于恰当评分规则的扩散模型用于概率天气预报
引入辅助条件去噪任务,结合扩散模型与恰当评分规则,提升概率天气预报,尤其长预报期与全球尺度。
软空间推理
提出软空间推理框架,混合词元嵌入成软状态,并由AdaptSoft自适应调节软化程度,缓解过早离散化。
规范顺序问题:当大型语言模型作为多值关系知识库时为何不可靠
大模型按字母或时间等规范顺序组织多值关系,提示若违背此内部排序,生成完整实体集合的可靠性显著下降。
含潜在混杂因子的循环线性高斯模型的可微结构学习
针对含循环与潜在混杂的线性高斯模型,提出可微结构学习,用伯努利门控优化带复杂度惩罚似然,并证明一致性。
SpatialCORE:大型视觉语言模型中置信度感知的定位式空间推理
SpatialCORE将模型对生成定位的置信度转化为空间推理奖励,配合答案门控,在多项基准上达开源最优。
大语言模型推理中束搜索的可证明测试时扩展
理论证明束搜索测试时扩展优势,CF-Beam将覆盖依赖由二次降至近线性,优于Best-of-N。
于此聆听立体声世界:学习动态空间对应以实现沉浸式音视频联合生成
提出StereoBind,以运动轨迹绑定视觉运动与立体声生成,实现动态空间对应,并构建数据集与基准,显著提升立体声空间一致性。
HeurEvo:面向时间关键型数学优化的混合求解器增强启发式智能体进化
HeurEvo协同进化规划、代码与组件,在严格时限内融合启发式与求解器,于组合优化和MIPLIB上匹配或超越先进方法。
群体保真度:评估大语言模型中的群体代表性
提出群体保真度框架,从群体准确度、组间差异量及结构三维度评估LLM群体代表性,并检验机器偏见与文化微调成效。
面向参考引导伪装目标检测的共识感知多源融合
提出共识感知多源融合框架,利用参考条件双骨干融合与跨参考共识聚合,提升参考引导伪装目标检测效果。
谁的声音能在摘要中留存?LLM 员工倾听的声音留存审计
提出声音留存比指标审计LLM摘要偏差:按流行度过滤,仅现一次的关切流失86%,短文本与德语内容亦遭删。
认知专家语言模型更好地与相应脑系统对齐
提示与微调构建六类认知专家大模型,其与对应脑系统对齐更强,且总体预测精度基本不变。
困难区域监督:荣登 Waymo 开放数据集 2D 视频全景分割排行榜榜首
提出困难区域监督改进DVIS++,结合测试时集成与跨相机链接,在Waymo视频全景分割挑战赛三项指标第一。
几何-物理混杂削弱跨不同域的PDE学习
几何变化与物理性质混杂削弱跨域PDE学习;显式几何-算子去混杂可提升数据效率并准确恢复方程。
训练大语言模型表达评估意识
VT:用强化学习训练大模型更愿表达评估意识,表达量增2.4-2.9倍,潜在意识与行为大致不变。
通过针对探针训练实现对齐且不损失可监控性
持续更新探针引导微调,可提升无害与诚实,保持效用和可监控性,优于DPO及推理干预。
更多选择,更少决策:类JEV直接决策模型中的有序尺度偏差
直接决策模型存在序数尺度利用偏差,候选空间压缩,仅用约七成有效支持,BA-LoRA后训练可缓解。
基于学习排序与验证的智能体式相对相机位姿估计
提出PoseAgent智能体框架,用学习排序与验证调度估计器,相对相机位姿估计AUC@5最高提升4.2%。
多路径LLM推理中的分集合并
多路径LLM推理可建模为分集合并;路径相关性限制投票增益,提示模板多样性降相关,自适应K近MV@32精度。
直接偏好优化的不确定性归一化间隔
提出不确定性归一化边距DPO,结合偏好强度、提示尺度与长度归一化,实验优于DPO/SimPO。
DeepRewind:预测与修复深度研究智能体中的过早承诺
提出DeepRewind:以类型图追踪认知状态,预测并阻止高风险过早承诺,失效时回滚;过早承诺减少59.1%。
可解释但脆弱?几何-语义扰动下概念瓶颈的鲁棒性
概念瓶颈不天然提升鲁棒性,而是按几何/语义扰动转移敏感性,存在可解释性-鲁棒性权衡。
理解离策略与在策略蒸馏:不同训练目标的故事
多教师蒸馏中,前向KL产生算术混合,反向KL产生几何聚合;在策略蒸馏保留专家偏好,却对错误前缀敏感。
ChartDensity-Bench:视觉密度下多模态大模型数值数据重建基准测试
提出ChartDensity-Bench基准,评估多模态大模型在视觉密度下重建图表数值数据的能力,发现密度越高重建误差越大。
掩码扩散语言模型中的可靠并行解码
提出免训练方法RPD,按逐层预测稳定性与置信度筛选候选,并以累积熵预算提交,提升并行解码吞吐且保持准确率。
学习遗忘什么:面向大语言模型表示空间的分布性遗忘
提出非参数分布性遗忘框架Mamushi,用概率分类器排序遗忘样本,改善删除与保留权衡,减少遗忘样本需求。
DraftTrace:面向AI融合写作的多视角分析环境
DraftTrace同步捕捉写作成品、过程与AI交互,提供多视角分析,可区分真实写作与复制粘贴。
dattri-LLM:面向LLM规模的统一高效训练数据归因库
高效LLM规模训练数据归因库,以紧凑梯度表示与动态路由提速3.2倍,兼容分布式训练,可扩展至110B模型。
当上下文变化时:理解大语言模型中的更新失败
提出CICM基准研究LLM的过期绑定失败,发现注意力漂移致旧值胜出,无需训练调整注意力可纠正多数错误
蒸馏视觉证据,而非仅答案:面向视觉语言模型的跨世界同策略蒸馏
提出CW-OPD,构造关键证据不同的双视觉世界,蒸馏教师信念转变,显式监督学生对视觉证据的依赖。
Talk2Agent:面向文本智能体的语音接口基准评测
Talk2Agent:免执行评测语音接口,保留任务信息,关联完成度并优于WER/CER。
在测试时使用可复用原语组合任务特定的智能体执行框架
提出可复用原语与STITCH框架,测试时按任务选取组合,成功率最高提升12点,开销仅2.7%。
结构偏移下的分子性质预测:基于表格基础模型
提出MolPAIR,用分子对比较增强表格基础模型的上下文学习,免微调提升结构偏移下的分子性质预测。
相同损失,不同梯度
揭示相同损失下梯度可不一致,提出AR/FR实现前后向一致并给出三次误差界。
FLOW:面向泛化远程生理测量的特征级最优扭曲
提出最优传输驱动的FLOW框架,融合时序细化与原型跨时序对齐,实现域泛化rPPG,跨域性能达SOTA。
检索对查询中身份信号的敏感性
稠密检索器对查询中政治倾向与方言信号敏感:结果偏向查询自身立场,非裔美国人英语提问检索效果更差。
CRAFT:医学视觉语言模型中的因果责任与失效追踪
CRAFT定位医学视觉语言模型中文本压过图像与证据不足仍作答的因果注意力头,干预可纠正且无需重训。
STRATA:面向实时策略游戏的基于角色对齐分层智能体的自学习
STRATA为红警设计角色对齐分层智能体,通过赛后复盘与跨局自学习压缩经验卡,胜率由30%提升至100%。
当更新不再是学习:通过可学习的信息增益重新思考大语言模型自我进化
提出可学习信息增益度量自进化每轮新增信息,据此设计ATRI自适应调节训练,缓解性能退化。
大规模因子分析表明机器智能仅部分可解释
大规模因子分析显示,通用智能因子最多解释七成性能方差,相似基准未必聚簇,通用智能难成单一构念。
相似选择,不同注意:人类与视觉-语言模型中的跨模态关联
部分视觉语言模型选择对齐人类,但注意力不如中心基线;匹配选择或注视不等于人类对齐跨模态处理。
基于模型的离线强化学习中的分布内想象
提出分布内想象,在表征空间估计轨迹支持度并截断越界展开,结合轨迹正则化RL,少数据下稳定提升性能。
面向长时程智能体任务的一致性规划-行动
揭示规划者-执行者状态错配,提出ConPAct以矛盾反馈和一致性微调提升协调与成功率。
面向忠实大语言模型股票收益预测叙事的推理外化
结合时序SHAP与历史类比,外化推理可提升LLM股票收益预测叙事的证据忠实度与准确性。
多精确才算足够精确?
数值精度是否足够取决于当前学习状态;相同原始误差可致不同学习后果,故精度应视为学习目标的一部分。
FinRT:将自适应红队策略蒸馏为消费金融领域可复用的对抗生成器
FinRT将自适应红队策略蒸馏为可复用对抗生成器,攻击成功率近翻倍,最大危害提升33%,同时保持多样性。
记忆巩固抹平用户事实的时间形态
记忆写入会不对称地抹去进行时等时态线索,使后续模型难以判断用户事实是否仍然成立。
概率对比学习中,共享温度是否意味着共享角度尺度?
概率对比学习中,共享温度≠共享角度尺度;vMF角度增益影响边界与梯度,均衡后恢复共享尺度并提升表征。