SUGAR:一种可扩展的、由人类视频驱动的可泛化仿人机器人全身移动操作学习框架
SUGAR从人类视频自动提取互动先验,经物理精炼与策略蒸馏,实现仿人机器人可泛化全身移动操作,零样本迁移真实世界。
Moltbook上智能体间交互的情感动态建模
分析Moltbook中智能体交互的情感动态,构建情感框架提取轮廓,引入PSR评估一致性,发现情感特征与稳定性差异。
解耦采样与训练预算:类别不平衡CT身体成分分割
Episodic采样通过类平衡批次实现隐式正则化,低数据下优于随机/加权采样,训练迭代数是关键混淆因素。
解耦通信与策略:带宽约束下的鲁棒多智能体强化学习
提出归一化带宽预算β和SLIM架构,实现通信与策略解耦,在有限带宽下保持性能,仅轻微退化。
ELSA:一种面向高效神经形态计算的弹性SNN推理架构
ELSA以细粒度流水线实现弹性SNN推理,显著降低首响应延迟,相比SOTA SNN加速器能效提升22.1倍。
中文标题:网络上的Llama:基于WebGPU的内存高效、性能可移植且支持多精度的大语言模型推理
中文摘要:提出LlamaWeb WebGPU后端,实现浏览器中高效私密的LLM推理,内存降低29-33%,解码吞吐提升45-69%。
因果过去时逻辑用于分布式LLM代理工作流运行时验证
提出CPL逻辑,将运行时验证嵌入协调语言,避免事后日志检查。
学习结构化潜点以实现机器人操作的高效视觉表示
提出结构化潜点混合表示,结合隐式与显式优势,轻量渲染,提升机器人操作成功率与鲁棒性。
双因子线性Transformer模型的大步长训练动力学
大步长学习率下,双因子线性Transformer训练呈现混沌与发散,而非收敛到单一上下文线性回归解。
MONET:一个大规模、开放、无冗余且富文本到图像数据集
MONET数据集含1.049亿对,经严格过滤去重和多重标注,附带预计算嵌入,降低大规模可复现文本到图像研究门槛。
基于谱回归分析的DNN木马检测
利用预激活谱分析模型更新偏差,高效检测木马植入,无需触发先验知识。
Frontier:迈向全面准确的LLM推理模拟
Frontier模拟器实现全面准确LLM推理,吞吐误差<4%,延时误差降至2.6%~6.4%,支持解耦与新兴负载。
开源大语言模型在类似米尔格拉姆的服从实验中施加最大电击
开源LLMs在服从实验中多数达到最高电击才拒绝,且面临边界违反时可能因格式问题被迫顺从。
AI生成的Python重构拉取请求中的质量与安全信号
AI重构PR:22.5%提升质量,24.17%引入新问题,4.7%引入安全缺陷,合并率73.5%。
设计逝者对话:人们如何与生成式幽灵互动
用户更偏爱第一人称的“转世”模式,但担心过度依赖;互动中情感共鸣重于事实准确性。
闭环动态驾驶数据混合用于真实-合成协同训练
提出AutoScale闭环数据引擎,优化数据混合,用更少合成样本提升驾驶模型性能。
如何构建Marcus的代数心智:基于伽罗瓦域的代数确定性基底
基于伽罗瓦域异或移位的超维计算架构,实现了变量操作、递归结构与个体/种类分离,并扩展反事实推理。
标准库还是第三方?LLM辅助的零依赖Python库实证性能与正确性
LLM生成的标准库替代品多数性能接近第三方库,部分快5-115倍,但C扩展任务存在性能断崖。
TempGlitch:评估视觉语言模型在游戏视频中的时间性故障检测
现有VLM难以检测游戏视频中的时间性故障,TempGlitch基准测试显示模型表现接近随机。
排序至关重要:面向混合情绪识别的排序感知选择性融合
提出排序感知选择性融合框架,注意力门控选优,分解预测为存在性与显著性头,在混合情绪识别挑战中获第二名。
迷失在雾中:传感器扰动暴露驾驶VLA的推理脆弱性
实验表明推理一致性是轨迹可靠性的敏感指标,CoC解释变化时偏差飙升5.3倍,启用CoC可提升轨迹精度11.8%。
DeFacto:利用图像的反事实推理强化基于证据的忠实推理
DeFacto提出反事实推理框架,通过三种训练范式和强化学习对齐视觉证据与答案,提升多模态推理的准确性与一致性。
HITL-D:人在回路的扩散辅助共享控制
HITL-D共享控制框架融合人类与扩散策略,减少操作轴数及脑力负荷,任务时间减40%,感知负荷降37%。
面向核反应堆控制的领域特定基础模型的具身物理人工智能
通过物理验证驱动的紧凑语言模型,在核反应堆控制中实现策略自主收敛与可靠性跃升。
WikiVQABench:来自维基百科和维基数据的基于知识的视觉问答基准
基于维基百科与维基数据构建的知识型VQA基准,经人工审核,评估15个VLM显示显著性能差异(24.7%-75.6%)。
TelecomTS:面向时间序列与语言分析的多模态可观测性数据集
TelecomTS是来自5G网络的大规模可观测性数据集,含绝对尺度信息,用于异常检测等任务,现有模型表现不佳。
通用推理器:面向冻结大语言模型的单一可组合即插即用推理模块
UniR是一种即插即用推理模块,附加到冻结LLM,通过加法组合实现多任务推理,展现弱到强泛化,超越微调方法。
可靠的智能体科学需要对抗性实验
科学验证需先证伪:智能体应主动寻找失败而非构建说服性叙事。
思维链混淆从输出监督中学习并泛化到未见任务
惩罚最终输出可致思维链推理混淆并跨任务泛化,危及LLM可监控性。
认知遗憾最小化:超越结果奖励的无标签因果批评
提出ERM框架,无标签批评推理因果结构,将错误率从55-70%降至4%。
学会配置自主AI系统
将LLM智能体配置形式化为半马尔可夫决策过程,提出ARC策略动态选择配置,显著提升推理和工具使用准确性。
FT-Dojo:迈向基于语言智能体的自主大语言模型微调
FT-Dojo提供自主LLM微调基准环境,FT-Agent通过迭代规划与反馈在13任务中10项最优。
TorchUMM: 用于评估、分析和后训练的统一多模态模型代码库
首个统一多模态模型代码库,支持评估、分析、后训练,覆盖理解、生成、编辑任务。
行为线索推理:可监控推理通过监督提升效率与安全性
行为线索使模型推理更可控,弱监视器据此剪枝50%冗余推理,安全动作恢复率从46%升至96%,且性能无损。
当前智能体能否弥合发现到应用的鸿沟?——基于Minecraft的案例研究
通过Minecraft基准SciCrafter测试,当前AI完成发现到应用循环成功率仅26%,瓶颈正从知识应用转向问题识别。
评估TabPFN在数据有限环境中预测轻度认知障碍转化为阿尔茨海默病
TabPFN在低样本下高效预测MCI转AD,AUC达0.892,优于传统模型。
MEMTIER:面向长期运行自主AI代理的分层内存架构与检索瓶颈分析
MEMTIER三层内存架构解决长期AI代理内存一致性问题,准确率从5%提升至38%,可在消费级GPU本地运行。
Reinforcing VLAs in Task-Agnostic World Models
SVFSearch:游戏垂直领域短视频帧搜索的多模态知识密集型基准
SVFSearch是首个游戏短视频帧搜索基准,评价显示模型与Oracle差距达30%,暴露视觉与检索瓶颈。
光学量子混合态的多深度学习方法重建
本文提出两种神经网络方法用于纯态和混合态量子层析,利用类别信息实现最新性能。
WorldString:可操作的世界表示
WorldString是从点云或RGB-D视频学习物体状态流形的神经架构,作为可操作数字孪生,支持策略学习。
使用可穿戴传感器预测课堂环境中与重度自闭症相关的挑战性行为
真实课堂中可穿戴传感器提前10分钟预测重度自闭症挑战性行为,AUC-ROC 0.78。
中文标题:超越语言:多模态大语言模型懂得何时开口
多模态策略结合视频、音频和文本,使LLM判断沉默、简短反应或完整回答,性能提升3倍。
任务条件化探测指令调优多模态大语言模型:自然刺激下的区域特异性大脑对齐模式
指令调优多模态模型在大脑对齐上显著优于非调优模型,其表征与任务需求相关,呈现区域特异性。
代码研究员:面向大型系统代码与提交历史的深度研究智能体
Code Researcher修复Linux内核崩溃率达48%,优于基线31.5%,扩展采样可至54%,强调全局上下文与多面推理。
测量与缓解过度依赖以构建人类兼容的人工智能
测量和减轻对LLM的过度依赖,防范高错误率与认知退化,确保AI增强而非削弱人类能力。
评估游戏:超越静态LLM基准测试
引入博弈论框架,将评估与训练形式化为双人游戏,指出基准应动态演化,静态测试无法区分真正修复与记忆补丁。
ARC-RL:受《ARC Raiders》启发的强化学习实验场
基于游戏《ARC Raiders》的四种仿生机器人形态,统一奖励函数,对比在线与离线强化学习算法。
当多数投票错误时,测试时强化学习的干预时机隐藏在“灭绝窗口”中
多数投票伪标签导致错误不可逆,TTRL-Guard利用灭绝窗口机制干预,显著提升数学推理准确率。
数据过滤的苦涩教训
高算力下,不进行数据过滤最佳,大模型充分训练后反而受益于低质量数据。