6031 条条目 · 106 个活跃源
2026年5月22日
04:00
ArXiv AI

SUGAR:一种可扩展的、由人类视频驱动的可泛化仿人机器人全身移动操作学习框架

SUGAR从人类视频自动提取互动先验,经物理精炼与策略蒸馏,实现仿人机器人可泛化全身移动操作,零样本迁移真实世界。

04:00
ArXiv AI

Moltbook上智能体间交互的情感动态建模

分析Moltbook中智能体交互的情感动态,构建情感框架提取轮廓,引入PSR评估一致性,发现情感特征与稳定性差异。

04:00
ArXiv AI

解耦采样与训练预算:类别不平衡CT身体成分分割

Episodic采样通过类平衡批次实现隐式正则化,低数据下优于随机/加权采样,训练迭代数是关键混淆因素。

04:00
ArXiv AI

解耦通信与策略:带宽约束下的鲁棒多智能体强化学习

提出归一化带宽预算β和SLIM架构,实现通信与策略解耦,在有限带宽下保持性能,仅轻微退化。

04:00
ArXiv AI

ELSA:一种面向高效神经形态计算的弹性SNN推理架构

ELSA以细粒度流水线实现弹性SNN推理,显著降低首响应延迟,相比SOTA SNN加速器能效提升22.1倍。

04:00
ArXiv AI

中文标题:网络上的Llama:基于WebGPU的内存高效、性能可移植且支持多精度的大语言模型推理

中文摘要:提出LlamaWeb WebGPU后端,实现浏览器中高效私密的LLM推理,内存降低29-33%,解码吞吐提升45-69%。

04:00
ArXiv AI

因果过去时逻辑用于分布式LLM代理工作流运行时验证

提出CPL逻辑,将运行时验证嵌入协调语言,避免事后日志检查。

04:00
ArXiv AI

学习结构化潜点以实现机器人操作的高效视觉表示

提出结构化潜点混合表示,结合隐式与显式优势,轻量渲染,提升机器人操作成功率与鲁棒性。

04:00
ArXiv AI

双因子线性Transformer模型的大步长训练动力学

大步长学习率下,双因子线性Transformer训练呈现混沌与发散,而非收敛到单一上下文线性回归解。

04:00
ArXiv AI

MONET:一个大规模、开放、无冗余且富文本到图像数据集

MONET数据集含1.049亿对,经严格过滤去重和多重标注,附带预计算嵌入,降低大规模可复现文本到图像研究门槛。

04:00
ArXiv AI

基于谱回归分析的DNN木马检测

利用预激活谱分析模型更新偏差,高效检测木马植入,无需触发先验知识。

04:00
ArXiv AI

Frontier:迈向全面准确的LLM推理模拟

Frontier模拟器实现全面准确LLM推理,吞吐误差<4%,延时误差降至2.6%~6.4%,支持解耦与新兴负载。

04:00
ArXiv AI

开源大语言模型在类似米尔格拉姆的服从实验中施加最大电击

开源LLMs在服从实验中多数达到最高电击才拒绝,且面临边界违反时可能因格式问题被迫顺从。

04:00
ArXiv AI

AI生成的Python重构拉取请求中的质量与安全信号

AI重构PR:22.5%提升质量,24.17%引入新问题,4.7%引入安全缺陷,合并率73.5%。

04:00
ArXiv AI

设计逝者对话:人们如何与生成式幽灵互动

用户更偏爱第一人称的“转世”模式,但担心过度依赖;互动中情感共鸣重于事实准确性。

04:00
ArXiv AI

闭环动态驾驶数据混合用于真实-合成协同训练

提出AutoScale闭环数据引擎,优化数据混合,用更少合成样本提升驾驶模型性能。

04:00
ArXiv AI

如何构建Marcus的代数心智:基于伽罗瓦域的代数确定性基底

基于伽罗瓦域异或移位的超维计算架构,实现了变量操作、递归结构与个体/种类分离,并扩展反事实推理。

04:00
ArXiv AI

标准库还是第三方?LLM辅助的零依赖Python库实证性能与正确性

LLM生成的标准库替代品多数性能接近第三方库,部分快5-115倍,但C扩展任务存在性能断崖。

04:00
ArXiv AI

TempGlitch:评估视觉语言模型在游戏视频中的时间性故障检测

现有VLM难以检测游戏视频中的时间性故障,TempGlitch基准测试显示模型表现接近随机。

04:00
ArXiv AI

排序至关重要:面向混合情绪识别的排序感知选择性融合

提出排序感知选择性融合框架,注意力门控选优,分解预测为存在性与显著性头,在混合情绪识别挑战中获第二名。

04:00
ArXiv AI

迷失在雾中:传感器扰动暴露驾驶VLA的推理脆弱性

实验表明推理一致性是轨迹可靠性的敏感指标,CoC解释变化时偏差飙升5.3倍,启用CoC可提升轨迹精度11.8%。

04:00
ArXiv AI

DeFacto:利用图像的反事实推理强化基于证据的忠实推理

DeFacto提出反事实推理框架,通过三种训练范式和强化学习对齐视觉证据与答案,提升多模态推理的准确性与一致性。

04:00
ArXiv AI

HITL-D:人在回路的扩散辅助共享控制

HITL-D共享控制框架融合人类与扩散策略,减少操作轴数及脑力负荷,任务时间减40%,感知负荷降37%。

04:00
ArXiv AI

面向核反应堆控制的领域特定基础模型的具身物理人工智能

通过物理验证驱动的紧凑语言模型,在核反应堆控制中实现策略自主收敛与可靠性跃升。

04:00
ArXiv AI

WikiVQABench:来自维基百科和维基数据的基于知识的视觉问答基准

基于维基百科与维基数据构建的知识型VQA基准,经人工审核,评估15个VLM显示显著性能差异(24.7%-75.6%)。

04:00
ArXiv AI

TelecomTS:面向时间序列与语言分析的多模态可观测性数据集

TelecomTS是来自5G网络的大规模可观测性数据集,含绝对尺度信息,用于异常检测等任务,现有模型表现不佳。

04:00
ArXiv AI

通用推理器:面向冻结大语言模型的单一可组合即插即用推理模块

UniR是一种即插即用推理模块,附加到冻结LLM,通过加法组合实现多任务推理,展现弱到强泛化,超越微调方法。

04:00
ArXiv AI

可靠的智能体科学需要对抗性实验

科学验证需先证伪:智能体应主动寻找失败而非构建说服性叙事。

04:00
ArXiv AI

思维链混淆从输出监督中学习并泛化到未见任务

惩罚最终输出可致思维链推理混淆并跨任务泛化,危及LLM可监控性。

04:00
ArXiv AI

认知遗憾最小化:超越结果奖励的无标签因果批评

提出ERM框架,无标签批评推理因果结构,将错误率从55-70%降至4%。

04:00
ArXiv AI

学会配置自主AI系统

将LLM智能体配置形式化为半马尔可夫决策过程,提出ARC策略动态选择配置,显著提升推理和工具使用准确性。

04:00
ArXiv AI

FT-Dojo:迈向基于语言智能体的自主大语言模型微调

FT-Dojo提供自主LLM微调基准环境,FT-Agent通过迭代规划与反馈在13任务中10项最优。

04:00
ArXiv AI

TorchUMM: 用于评估、分析和后训练的统一多模态模型代码库

首个统一多模态模型代码库,支持评估、分析、后训练,覆盖理解、生成、编辑任务。

04:00
ArXiv AI

行为线索推理:可监控推理通过监督提升效率与安全性

行为线索使模型推理更可控,弱监视器据此剪枝50%冗余推理,安全动作恢复率从46%升至96%,且性能无损。

04:00
ArXiv AI

当前智能体能否弥合发现到应用的鸿沟?——基于Minecraft的案例研究

通过Minecraft基准SciCrafter测试,当前AI完成发现到应用循环成功率仅26%,瓶颈正从知识应用转向问题识别。

04:00
ArXiv AI

评估TabPFN在数据有限环境中预测轻度认知障碍转化为阿尔茨海默病

TabPFN在低样本下高效预测MCI转AD,AUC达0.892,优于传统模型。

04:00
ArXiv AI

MEMTIER:面向长期运行自主AI代理的分层内存架构与检索瓶颈分析

MEMTIER三层内存架构解决长期AI代理内存一致性问题,准确率从5%提升至38%,可在消费级GPU本地运行。

04:00
ArXiv AI

Reinforcing VLAs in Task-Agnostic World Models

04:00
ArXiv AI

SVFSearch:游戏垂直领域短视频帧搜索的多模态知识密集型基准

SVFSearch是首个游戏短视频帧搜索基准,评价显示模型与Oracle差距达30%,暴露视觉与检索瓶颈。

04:00
ArXiv AI

光学量子混合态的多深度学习方法重建

本文提出两种神经网络方法用于纯态和混合态量子层析,利用类别信息实现最新性能。

04:00
ArXiv AI

WorldString:可操作的世界表示

WorldString是从点云或RGB-D视频学习物体状态流形的神经架构,作为可操作数字孪生,支持策略学习。

04:00
ArXiv AI

使用可穿戴传感器预测课堂环境中与重度自闭症相关的挑战性行为

真实课堂中可穿戴传感器提前10分钟预测重度自闭症挑战性行为,AUC-ROC 0.78。

04:00
ArXiv AI

中文标题:超越语言:多模态大语言模型懂得何时开口

多模态策略结合视频、音频和文本,使LLM判断沉默、简短反应或完整回答,性能提升3倍。

04:00
ArXiv AI

任务条件化探测指令调优多模态大语言模型:自然刺激下的区域特异性大脑对齐模式

指令调优多模态模型在大脑对齐上显著优于非调优模型,其表征与任务需求相关,呈现区域特异性。

04:00
ArXiv AI

代码研究员:面向大型系统代码与提交历史的深度研究智能体

Code Researcher修复Linux内核崩溃率达48%,优于基线31.5%,扩展采样可至54%,强调全局上下文与多面推理。

04:00
ArXiv AI

测量与缓解过度依赖以构建人类兼容的人工智能

测量和减轻对LLM的过度依赖,防范高错误率与认知退化,确保AI增强而非削弱人类能力。