评估游戏:超越静态LLM基准测试
引入博弈论框架,将评估与训练形式化为双人游戏,指出基准应动态演化,静态测试无法区分真正修复与记忆补丁。
ARC-RL:受《ARC Raiders》启发的强化学习实验场
基于游戏《ARC Raiders》的四种仿生机器人形态,统一奖励函数,对比在线与离线强化学习算法。
当多数投票错误时,测试时强化学习的干预时机隐藏在“灭绝窗口”中
多数投票伪标签导致错误不可逆,TTRL-Guard利用灭绝窗口机制干预,显著提升数学推理准确率。
数据过滤的苦涩教训
高算力下,不进行数据过滤最佳,大模型充分训练后反而受益于低质量数据。
解锁持续模型合并的潜力:基于常微分方程的视角
提出ODE-M方法,通过ODE路径和障碍约束,实现持续模型合并的最优性能。
何时停止重用:面向样本高效RLVR的动态梯度门控
发现权重发散现象,以lm_head梯度实时监测策略偏移,提出动态梯度门控,实现高达2.93倍样本效率提升。
量化预训练红利:生成式与潜在自监督学习在时间序列基础模型中的对比
预训练红利高度不对称:自监督学习对异常检测和分类提升显著(达375%),但对预测影响甚微,且表示质量不依赖数据来源。
具有预测能力的弹性拜占庭协议
提出有预测器的拜占庭协议,刻画一致性-鲁棒性权衡,显示弹性随预测准确性线性下降。
基于采样的安全强化学习
提出基于采样约束的安全强化学习算法,通过动力学样本联合约束和认知不确定性探索,实现全程安全保证和高效学习。
CANINE:为视障用户提供与导盲机器人交互导航的辅导训练
CANINE系统通过个性化适应性反馈训练视障用户与导盲机器人交互,显著提升学习效率与导航性能,效果持久。
CriterAlign:以标准为中心的原理对齐用于代码偏好判断
提出基于成对标准判断和HPAG的框架,将LLM评判器从点式改为成对式,准确率提升至66.3%。
TORQ:面向MXFP4量化的两级正交旋转方法
提出TORQ,通过两级正交旋转缓解MXFP4量化不平衡,大幅提升LLM激活量化精度,接近全精度。
可访问性能力边界:AI生成的浏览器原生可访问系统的运行限制与扩展潜力
提出ACB框架,分析AI生成浏览器原生可访问系统的运行限制与扩展潜力,通过两个原型验证低部署摩擦优势与剩余硬约束。
操作化人工智能物料清单(AIBOM)以实现可验证AI溯源和生命周期保障
提出AIBOM框架扩展CycloneDX,实现AI可验证溯源与生命周期自动化保障,重现保真度98.7%,人工监督减少63%。
AffectAI-Capture:一种可复现的多模态小团体会议研究协议
提出同步采集眼动、生理、音视频及自报告的多模态协议,支持可复现的小组会议研究。
StableGrad:无需批归一化的反向尺度控制
提出StableGrad,优化器层面控制梯度尺度,无需批归一化,稳定深度网络训练。
FLUXtrapolation:一个外推生态系统通量的基准
提出FLUXtrapolation基准,评估生态系统通量在分布偏移下的外推性能,聚焦尾部误差和多尺度评估。
实时并行反事实遗憾最小化
提出并行CFR框架,采用CPU-GPU流水线,在桌面设备实现3.3-3.4倍加速,支持实时决策。
What Do Evolutionary Coding Agents Evolve?
超越JEPA的各向同性:哈密顿几何与辛预测
JEPA各向同性假设有代价,HamJEPA用哈密顿几何与辛预测实现跨视图耦合,性能显著提升。
Toto 2.0: 时间序列预测进入规模化时代
发布Toto 2.0模型家族,证明时间序列基础模型随参数规模扩展而提升,在三大基准创SOTA。
人工智能、概念隐喻与概念工程:基于AI的人类行为与认知框架是否成功?
AI框架人类认知:隐喻易致谬误,概念工程可促反思改进。
超越预测精度:用于评估模型-大脑对齐的目标空间恢复轮廓
通过可重复响应维度恢复轮廓评估模型-大脑对齐,揭示预测精度掩盖不匹配。
入门级指南:大型语言模型在医学研究中的应用
提供结构化指南,帮助医疗专业人士从任务设计到部署安全高效使用大语言模型。
IR-Agent:受专家启发的LLM智能体用于红外光谱结构解析
提出IR-Agent多智能体框架,模拟专家分析,提升红外光谱结构解析准确性与灵活性。
BuildArena:面向工程建设的LLM物理对齐交互式基准
首个面向工程建设的物理对齐交互式基准BuildArena,评估LLM在物理约束下的语言驱动构建自动化能力。
中文标题
语言模型存在极端自我偏好,倾向自身及关联实体,且随身份变化,引发行为偏差担忧。
学习高效合规护栏
提出PolicyGuardBench基准与PolicyGuard模型,高效精准检测违规,泛化性强,验证小规模可行。
通过小型语言模型高质量生成动态游戏内容:一个概念验证
提出通过激进微调小型语言模型实现高质量动态游戏内容生成,概念验证显示可行。
通过近似奈曼分配的大语言模型主动测试
利用语义熵分层与近似奈曼分配,显著降低测试成本,平均节省22.9%预算。
The World Won't Stay Still: Programmable Evolution for Agent Benchmarks
ReSS:通过符号脚手架学习表格数据预测的推理模型
ReSS框架融合符号与神经推理,用决策树提取脚手架生成推理数据微调LLM,提升准确性与可解释性。
中文标题:何时重新承诺:面向长程视觉-语言推理的时间抽象发现
中文摘要:提出可学习承诺深度,自适应策略在长程推理中解算率提升12.5%,动作减少25%,优于GPT-5.5等模型。
VERA-MH:验证心理健康领域的伦理与负责任AI
VERA-MH框架通过三步评估聊天机器人在心理健康支持中的安全性,特别关注自杀意念风险。
记忆引导的树搜索与跨分支知识迁移用于LLM求解器合成
MEMOIR框架通过两级记忆与跨分支知识迁移,实现96.7%解有效性和7.3分提升,稳定性远超基线。
基于MFCCs的乐器识别深度神经网络
使用ANN基于MFCC特征对20种乐器分类,在伦敦爱乐数据集上达到最优准确率。
能力悖论:更智能的审计者反而使多智能体系统更不安全
能力悖论:更强Worker因语言确定性致攻击成功率飙升,异构集成验证将其从52.8%降至2.0%。
GraphPINE:用于可解释药物反应预测的图重要性传播
提出GraphPINE方法,利用先验知识初始化节点重要性,通过图传播提升药物反应预测的可解释性与性能。
面向视觉模型的自适应相机传感器
Lens自适应相机传感器方法,利用无标签样本置信度指标从模型视角优化图像质量,显著提升准确率且低延迟。
ORCA:面向视觉-语言模型幻觉与对抗鲁棒性的智能推理框架
ORCA框架通过多视觉工具与推理循环,无需重训即可显著提升视觉语言模型的幻觉抑制与对抗鲁棒性。
Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence
超越多数投票:利用高阶信息的大语言模型聚合
提出OW和ISP两种算法,利用高阶信息聚合多LLM答案,超越多数投票,提升决策可靠性。
PlantTraitNet:基于公民科学数据的全球植物性状推断不确定性感知多模态框架
通过公民科学照片与弱监督深度学习,PlantTraitNet生成更准确的全球植物性状地图。
近端扩散神经采样器
PDNS通过近端点方法分解学习过程,逐步逼近多峰分布,避免模式崩溃,在连续和离散采样任务中有效。
WARC-Bench:基于Web存档的GUI子任务执行基准
提出438个子任务的基准,前沿模型最高64.8%成功率,RLVR训练提升开源模型至52.8%,超越多数前沿模型。
景观寻针:标签稀缺下考古遗址发现的半监督伪标签法
提出非对称双伪标签法(DPL),从稀疏正样本直接学习,F1提高12%、召回率提高29%,有效发现考古遗址。
背景分布偏移下的开集域适应:挑战与一种可证明高效的解决方案
提出CoLOR方法,在背景分布偏移下保证开集识别,理论证明且实验显著优于现有方法。
多模态皮肤癌检测系统
融合常规照片与元数据的多模态黑色素瘤检测系统,通过三阶段流水线提升性能,实现高灵敏度。
大型视觉语言模型中低开销幻觉缓解的自适应残差更新引导
提出RUDDER框架,通过自适应残差更新创建视觉锚点,缓解幻觉,降低CHAIR指标超23%,吞吐保持96%以上。