SignVLA:基于注意力LSTM与视觉-语言-动作模型的实时手语引导机器人操作
SignVLA框架通过注意力LSTM实时识别手语,将手势转换为指令,驱动机器人执行操作任务。
PulseCX:打破实时客户体验中的封闭世界假设
PulseCX通过异步代理构建衰减感知知识图谱与层次意图门控,消除搜索瓶颈,提升动态环境下的意图解析与客户满意度。
AI可评估性差距:管理风险与维持价值中缺失的一层
提出AI可评估性差距概念,指组织缺乏充分证据支撑治理决策,需构建系统证据能力以管理风险并维持价值。
自我提升可能导致自我回归:LLM自我训练的上升-崩溃失败模式
LLM自我训练中先升后降,Qwen模型在编程任务上验证了该模式。CARE和ES可提升性能,但GRPO未消除崩溃。
答案工程:面向协议约束决策的大语言模型局部轨迹编辑
提出局部轨迹编辑方法,无需重训练即可提升大语言模型协议合规性,在听力损失基准上平衡准确率从42%升至80.7%。
负面知识:自动研究中的失败感知共享记忆
提出负面知识记忆层,将失败转为结构化记录,使自动研究用更少token解决新任务并跨任务迁移。
AutoRAS:利用原始表示学习鲁棒智能体系统
提出AutoRAS框架,通过符号原语序列设计鲁棒智能体系统,在普通和对抗场景下均表现最佳。
中文标题:注意噪声:基于Transformer的交互感知轨迹预测模型对噪声数据的敏感性
中文摘要:噪声显著降低Transformer交互轨迹预测精度,小噪声降1.3倍,最大降3.9倍,亟需真实数据与降噪策略。
面向终身社交智能的社会世界模型
提出社会世界模型,构建社交闭环学习框架,实现小模型可持续获得竞争性社交能力并零遗忘。
Trip+:个性化交互式旅行规划中的智能体基准测试
Trip+基准测试评估智能体交互式旅行规划,发现模型易生成可行但疲劳且不符偏好的行程。
校准并非控制:为何LLM智能体监督需要干预
LLM智能体监督应从风险评分转向动作条件价值估计,以纠正目标误差。
AgentCAT:通过多智能体大语言模型模拟计算机自适应测试
基于大语言模型的多智能体模拟系统,实现计算机自适应测试的动态评估与能力估计,平衡难度适应与教学连贯性。
Counsel:面向智能体任务的元评估数据集
首个智能体任务元评估数据集,含人类标注的批评质量评估,用于校准和改进LLM评判者。
迈向透明的心理健康洞察:基于结构化数据的可解释AI模型用于大学生职业相关抑郁与焦虑
提出可解释AI与联邦学习融合行为与面部特征,隐私保护下识别大学生职业抑郁焦虑,准确率达92.08%
在GRPO自回归文本到图像后训练中平衡性能与多样性
GRPO中JS散度在文本到图像后训练中兼顾性能与多样性。
通过构建块组合可验证的概念模型:迈向智能体AI工作流的设计时验证
提出设计时验证方法,通过12条规则检查智能体工作流构建块兼容性,可靠检测缺陷。
ChainWorld:从原子OSWorld任务组合成长程桌面工作负载
通过方向兼容搜索将原子任务组链,评估四种代理,最长完成率31%,发现单轮与多轮失败模式不同。
马尔可夫决策过程中的熵目标
针对MDP熵目标策略综合问题,提出结合凸对偶与不变量综合的验证方法,并考察记忆与随机化作用。
训练编排器:一种基于监督学习的端到端PDDL规划与LLM智能体方法
HALO利用验证器轨迹监督训练小型编排策略,大幅降低LLM调用成本与次数,性能接近最强基线。
Nous:一种用于长期代理记忆的预测世界模型
Nous提出基于预测而非存储的记忆架构,通过贝叶斯更新和熵衰减实现遗忘,在长期对话记忆基准测试中取得优异性能。
Holmes:面向工业规模混合语言移动崩溃的多模态智能诊断
Holmes多智能体系统通过多模态信号自动诊断混合语言移动崩溃,准确率87.6%,时间减少98%。
Measuring What Persists: Conditioning Mechanisms and a Geometric Framework for AI Agent Identity
学习自动发现的搜索艺术
提出ARTS方法,用推理模型结合测试时训练提升搜索效率,在MLGym/MLEBench任务上超越基线15.3%,小模型性能比肩前沿模型。
IRumAI:面向印度拉米纸牌的强化学习
IRumAI是首个印度拉米强化学习智能体,仅用弱启发式训练即击败最强搜索对手,速度快7000倍。
CFAgentBench:面向自主建筑财务代理的可复现环境与基准
CFAgentBench是可复现建筑财务代理基准,含1014个任务与40个可执行评估,强调功能正确性与资金流动防护,揭示模型单次准确率虚高。
代码非记忆:编码代理中的结构代码库索引
通过对比实验,结构代码库索引显著提升定位和解锁率,且降低成本,优于无索引和智能grep基线。
吸引子域理论:基于可穿戴PPG验证的心血管吸引子分析数学框架
提出吸引子域理论,将心腔吸引子信息划分为几何、遍历、变分三个必要充分域,PPG验证显示几何域优越性。
面向LLM服务的几何感知在线调度:从理论界到系统实践
提出几何感知SVF算法及高效变体,理论竞争比从48优化至5,集成至vLLM显著降低延迟。
When Does a Video-Language Model Stop Watching? Reward Strength Controls the Formation and Reversal of Visual Shortcuts in Multimodal RLVR
ARIA:一个因果感知框架,用于在可信材料发现中挽救LLM推理
ARIA通过三级级联消除上下文隧穿,实现物理可解释的二维材料AI发现。
MetaPS:面向市场智能体的自适应程序化策略选择
提出MetaPS框架,利用模拟引导选择策略,在0.8B至9B参数模型上一致提升,优于固定策略和直接决策。
通过想象确保分层强化学习的安全性
提出结合可学习世界模型与高低层策略的方法,高层生成安全子目标,低层利用想象减少不安全行为,在长时域任务中显著优于现有方法。
SCOPE:面向开放环境规划的进化符号世界
SCOPE框架通过符号模拟与自适应记忆,在开放环境中进化符号世界,提升规划成功率与跨任务适应性。
肺栓塞风险评估的高效多模态临床问答
研究使用高效多模态大模型评估肺栓塞诊断与预后问答,发现Gemma4结合电子病历表现最佳,诊断优于预后,揭示紧凑模型在早期风险检测中的潜力。
FlowMaps:基于流匹配对长期多模态物体动力学建模
FlowMaps通过流匹配学习物体动态模式,预测未来位置,提升机器人导航性能。
共同噪声中Wasserstein不确定性下的鲁棒平均场控制Q学习
本文提出鲁棒Q学习算法,处理共同噪声Wasserstein不确定性下的平均场控制,证明收敛性,实验展示鲁棒性-性能权衡。
双智能体框架:面向跨模型验证的自然语言协议到机器人实验室平台的转换
提出双智能体框架,通过解析、规则映射和异构LLM验证,将自然语言协议转为机器人命令,实现微孔板实验自主执行。
微调视觉-语言-动作模型所需的层数比你想象的少
无需训练即可压缩VLA模型50%层数,微调时间减少40-50%,推理提速30%,性能持平或超越原模型。
编辑对齐:一种参与式方法,用于在LLM介导的知识传播中调动编辑专业知识
本文提出参与式设计实践,使LLM界面符合编辑标准,赋予编辑在AI知识传播中的主导权。
ELVA:探索排名驱动的通用多模态检索
ELVA提出排名驱动强化学习框架,缓解粒度盲视,多模态检索达SOTA,MRBench提升13.1%。
将语音分类器重新用于引导扩散语音生成
利用预训练语音分类器作扩散主干,仅训练轻量子网络,实现单模型高质量语音生成,降低资源消耗。
主权执行代理:在代理控制平面中强制执行证书绑定权限
通过分离提议、准入和执行,将证书绑定权限转化为短期、可撤销、可审计的运行时能力。
多智能体与一般多体系统的最优秩序
提出基于影响力与响应函数的框架,推导宏观性质,引入风险偏好效用函数,得到平衡增长与韧性的最优秩序。
针对自主AI系统中模型引导自动攻击的防御性误导分析
可控误导响应诱导攻击者误判,将攻击成功率降低两个数量级,几乎消除验证成功的攻击。
面向AI代理的高效且可靠的概率验证
通过分布鲁棒优化计算策略违反概率的严格上界,实现高效可靠验证,优于现有方法。
无理解的校准:诊断微调LLM在系统软件漏洞检测中的局限性
LLM漏洞检测无安全推理,数据污染无优势,微调仅校准输出而非改变决策,检测与理解脱钩,性能低下。
SleepMaMi:整合宏观与微观结构的通用睡眠基础模型
SleepMaMi是整合宏观与微观结构的通用睡眠基础模型,预训练于2万+小时PSG数据,下游任务表现优异。
PCBSchemaGen:奖励引导的LLM代码合成用于PCB原理图设计及结构化验证
无需训练,通过结构化验证和奖励引导,让LLM生成可修复PCB原理图,31B模型任务通过率81.3%。
中文标题:太长,没解出
中文摘要:研究提示长度与解答长度增加,均导致模型在数学问题上更易失败。
TxBench-PP:评估AI智能体在小分子临床前药理学中的性能
首个临床前药理基准测试,最强AI模型决策通过率仅59.3%。