6036 条条目 · 106 个活跃源
2026年5月21日
04:00
ArXiv AI

评估游戏:超越静态LLM基准测试

引入博弈论框架,将评估与训练形式化为双人游戏,指出基准应动态演化,静态测试无法区分真正修复与记忆补丁。

04:00
ArXiv AI

ARC-RL:受《ARC Raiders》启发的强化学习实验场

基于游戏《ARC Raiders》的四种仿生机器人形态,统一奖励函数,对比在线与离线强化学习算法。

04:00
ArXiv AI

当多数投票错误时,测试时强化学习的干预时机隐藏在“灭绝窗口”中

多数投票伪标签导致错误不可逆,TTRL-Guard利用灭绝窗口机制干预,显著提升数学推理准确率。

04:00
ArXiv AI

数据过滤的苦涩教训

高算力下,不进行数据过滤最佳,大模型充分训练后反而受益于低质量数据。

04:00
ArXiv AI

解锁持续模型合并的潜力:基于常微分方程的视角

提出ODE-M方法,通过ODE路径和障碍约束,实现持续模型合并的最优性能。

04:00
ArXiv AI

何时停止重用:面向样本高效RLVR的动态梯度门控

发现权重发散现象,以lm_head梯度实时监测策略偏移,提出动态梯度门控,实现高达2.93倍样本效率提升。

04:00
ArXiv AI

量化预训练红利:生成式与潜在自监督学习在时间序列基础模型中的对比

预训练红利高度不对称:自监督学习对异常检测和分类提升显著(达375%),但对预测影响甚微,且表示质量不依赖数据来源。

04:00
ArXiv AI

具有预测能力的弹性拜占庭协议

提出有预测器的拜占庭协议,刻画一致性-鲁棒性权衡,显示弹性随预测准确性线性下降。

04:00
ArXiv AI

基于采样的安全强化学习

提出基于采样约束的安全强化学习算法,通过动力学样本联合约束和认知不确定性探索,实现全程安全保证和高效学习。

04:00
ArXiv AI

CANINE:为视障用户提供与导盲机器人交互导航的辅导训练

CANINE系统通过个性化适应性反馈训练视障用户与导盲机器人交互,显著提升学习效率与导航性能,效果持久。

04:00
ArXiv AI

CriterAlign:以标准为中心的原理对齐用于代码偏好判断

提出基于成对标准判断和HPAG的框架,将LLM评判器从点式改为成对式,准确率提升至66.3%。

04:00
ArXiv AI

TORQ:面向MXFP4量化的两级正交旋转方法

提出TORQ,通过两级正交旋转缓解MXFP4量化不平衡,大幅提升LLM激活量化精度,接近全精度。

04:00
ArXiv AI

可访问性能力边界:AI生成的浏览器原生可访问系统的运行限制与扩展潜力

提出ACB框架,分析AI生成浏览器原生可访问系统的运行限制与扩展潜力,通过两个原型验证低部署摩擦优势与剩余硬约束。

04:00
ArXiv AI

操作化人工智能物料清单(AIBOM)以实现可验证AI溯源和生命周期保障

提出AIBOM框架扩展CycloneDX,实现AI可验证溯源与生命周期自动化保障,重现保真度98.7%,人工监督减少63%。

04:00
ArXiv AI

AffectAI-Capture:一种可复现的多模态小团体会议研究协议

提出同步采集眼动、生理、音视频及自报告的多模态协议,支持可复现的小组会议研究。

04:00
ArXiv AI

StableGrad:无需批归一化的反向尺度控制

提出StableGrad,优化器层面控制梯度尺度,无需批归一化,稳定深度网络训练。

04:00
ArXiv AI

FLUXtrapolation:一个外推生态系统通量的基准

提出FLUXtrapolation基准,评估生态系统通量在分布偏移下的外推性能,聚焦尾部误差和多尺度评估。

04:00
ArXiv AI

实时并行反事实遗憾最小化

提出并行CFR框架,采用CPU-GPU流水线,在桌面设备实现3.3-3.4倍加速,支持实时决策。

04:00
ArXiv AI

What Do Evolutionary Coding Agents Evolve?

04:00
ArXiv AI

超越JEPA的各向同性:哈密顿几何与辛预测

JEPA各向同性假设有代价,HamJEPA用哈密顿几何与辛预测实现跨视图耦合,性能显著提升。

04:00
ArXiv AI

Toto 2.0: 时间序列预测进入规模化时代

发布Toto 2.0模型家族,证明时间序列基础模型随参数规模扩展而提升,在三大基准创SOTA。

04:00
ArXiv AI

人工智能、概念隐喻与概念工程:基于AI的人类行为与认知框架是否成功?

AI框架人类认知:隐喻易致谬误,概念工程可促反思改进。

04:00
ArXiv AI

超越预测精度:用于评估模型-大脑对齐的目标空间恢复轮廓

通过可重复响应维度恢复轮廓评估模型-大脑对齐,揭示预测精度掩盖不匹配。

04:00
ArXiv AI

入门级指南:大型语言模型在医学研究中的应用

提供结构化指南,帮助医疗专业人士从任务设计到部署安全高效使用大语言模型。

04:00
ArXiv AI

IR-Agent:受专家启发的LLM智能体用于红外光谱结构解析

提出IR-Agent多智能体框架,模拟专家分析,提升红外光谱结构解析准确性与灵活性。

04:00
ArXiv AI

BuildArena:面向工程建设的LLM物理对齐交互式基准

首个面向工程建设的物理对齐交互式基准BuildArena,评估LLM在物理约束下的语言驱动构建自动化能力。

04:00
ArXiv AI

中文标题

语言模型存在极端自我偏好,倾向自身及关联实体,且随身份变化,引发行为偏差担忧。

04:00
ArXiv AI

学习高效合规护栏

提出PolicyGuardBench基准与PolicyGuard模型,高效精准检测违规,泛化性强,验证小规模可行。

04:00
ArXiv AI

通过小型语言模型高质量生成动态游戏内容:一个概念验证

提出通过激进微调小型语言模型实现高质量动态游戏内容生成,概念验证显示可行。

04:00
ArXiv AI

通过近似奈曼分配的大语言模型主动测试

利用语义熵分层与近似奈曼分配,显著降低测试成本,平均节省22.9%预算。

04:00
ArXiv AI

The World Won't Stay Still: Programmable Evolution for Agent Benchmarks

04:00
ArXiv AI

ReSS:通过符号脚手架学习表格数据预测的推理模型

ReSS框架融合符号与神经推理,用决策树提取脚手架生成推理数据微调LLM,提升准确性与可解释性。

04:00
ArXiv AI

中文标题:何时重新承诺:面向长程视觉-语言推理的时间抽象发现

中文摘要:提出可学习承诺深度,自适应策略在长程推理中解算率提升12.5%,动作减少25%,优于GPT-5.5等模型。

04:00
ArXiv AI

VERA-MH:验证心理健康领域的伦理与负责任AI

VERA-MH框架通过三步评估聊天机器人在心理健康支持中的安全性,特别关注自杀意念风险。

04:00
ArXiv AI

记忆引导的树搜索与跨分支知识迁移用于LLM求解器合成

MEMOIR框架通过两级记忆与跨分支知识迁移,实现96.7%解有效性和7.3分提升,稳定性远超基线。

04:00
ArXiv AI

基于MFCCs的乐器识别深度神经网络

使用ANN基于MFCC特征对20种乐器分类,在伦敦爱乐数据集上达到最优准确率。

04:00
ArXiv AI

能力悖论:更智能的审计者反而使多智能体系统更不安全

能力悖论:更强Worker因语言确定性致攻击成功率飙升,异构集成验证将其从52.8%降至2.0%。

04:00
ArXiv AI

GraphPINE:用于可解释药物反应预测的图重要性传播

提出GraphPINE方法,利用先验知识初始化节点重要性,通过图传播提升药物反应预测的可解释性与性能。

04:00
ArXiv AI

面向视觉模型的自适应相机传感器

Lens自适应相机传感器方法,利用无标签样本置信度指标从模型视角优化图像质量,显著提升准确率且低延迟。

04:00
ArXiv AI

ORCA:面向视觉-语言模型幻觉与对抗鲁棒性的智能推理框架

ORCA框架通过多视觉工具与推理循环,无需重训即可显著提升视觉语言模型的幻觉抑制与对抗鲁棒性。

04:00
ArXiv AI

Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence

04:00
ArXiv AI

超越多数投票:利用高阶信息的大语言模型聚合

提出OW和ISP两种算法,利用高阶信息聚合多LLM答案,超越多数投票,提升决策可靠性。

04:00
ArXiv AI

PlantTraitNet:基于公民科学数据的全球植物性状推断不确定性感知多模态框架

通过公民科学照片与弱监督深度学习,PlantTraitNet生成更准确的全球植物性状地图。

04:00
ArXiv AI

近端扩散神经采样器

PDNS通过近端点方法分解学习过程,逐步逼近多峰分布,避免模式崩溃,在连续和离散采样任务中有效。

04:00
ArXiv AI

WARC-Bench:基于Web存档的GUI子任务执行基准

提出438个子任务的基准,前沿模型最高64.8%成功率,RLVR训练提升开源模型至52.8%,超越多数前沿模型。

04:00
ArXiv AI

景观寻针:标签稀缺下考古遗址发现的半监督伪标签法

提出非对称双伪标签法(DPL),从稀疏正样本直接学习,F1提高12%、召回率提高29%,有效发现考古遗址。

04:00
ArXiv AI

背景分布偏移下的开集域适应:挑战与一种可证明高效的解决方案

提出CoLOR方法,在背景分布偏移下保证开集识别,理论证明且实验显著优于现有方法。

04:00
ArXiv AI

多模态皮肤癌检测系统

融合常规照片与元数据的多模态黑色素瘤检测系统,通过三阶段流水线提升性能,实现高灵敏度。

04:00
ArXiv AI

大型视觉语言模型中低开销幻觉缓解的自适应残差更新引导

提出RUDDER框架,通过自适应残差更新创建视觉锚点,缓解幻觉,降低CHAIR指标超23%,吞吐保持96%以上。