CodeMidas:从代码本身扩展智能体编码强化学习环境
CodeMidas仅以源码为输入构建可执行RL环境,生成5,545个任务,训练后多项编码基准显著提升。
Designer-RSI:从用户流量中演化程序性记忆,实现智能体图形设计
冻结模型借230余工具操作设计软件,程序记忆自主扩充修正;五轮无标注实验使成功率72.7%→99.3%。
可信的FinAInce:解析AI中介的金融建议如何被评判
285人随机实验:建议风格主导信息与安全评价,专家标签提升可信度,评价可预测质量、信任与采纳意愿。
基于位姿注意力的视觉导航Transformer
以相机位姿为位置编码,注意力依赖位姿差而非时序,HM3D点目标导航成功率达93.3%,抗噪更强。
用于scRNA-seq插补的混合计算智能框架:整合scRecover与随机森林
提出SCR-MF两阶段流程,结合scRecover检测与missForest插补,性能稳健,兼顾精度与效率。
用于日冕仪后波前控制的强化学习
采用强化学习实现日冕仪后波前控制,基于焦平面图像驱动变形镜,成功生成暗区并接近传统方法性能。
SpaceDiffusion:面向空间生成转发通信的在轨扩散
提出SpaceDiffusion在轨扩散框架,用于卫星生成转发,重建受损图像,适应丢包压缩失真,省约15 dB上行功率并降时延。
随机性转变:面向AI算子Text-to-SQL的新评估范式
提出多层评估框架,解耦确定性数据库逻辑与AI语义,分别验证关系逻辑与AI算子,准确率达97.2%。
面向调频频谱协调的干扰驱动聚类优化
提出干扰驱动聚类优化框架,分解大规模跨境调频协调功率控制,降低复杂度与运行时间,兼顾保护与覆盖。
KnowDemo:知识引导的从人类视频生成机器人演示
KnowDemo 以人类视频中的结构化操作知识引导生成多样机器人演示,经仿真验证并实现真机迁移。
协同演进的零日干扰:自适应攻击合成与基于图注意力的在线检测
提出黑盒推理驱动强化学习干扰器与图注意力+DP均值在线检测框架,攻防协同演进,检测精度超基线20%。
长时运行 AI 智能体的授权撤销:委托与异步执行下的根作用域静默
提出根作用域授权静默证书与协议,线性化根切、围栏旧授权,证明组合安全,测试17/17通过。
VLA-Scope:面向视觉-语言-动作模型的偏移感知失败预测
VLA-Scope两阶段框架:先检测并分类输入分布偏移,再结合动作前缀与执行进度预测执行失败。
验证,勿轻信:面向大规模视频发现检索的智能体模型开发
EvoPilot人控在线自动研究视频检索,修复评估缺陷,离线升3.2个百分点,留存相对增0.66%
全能视频对话:原生音视频对话的合成、基准测试与训练
定义原生音视频对话任务,提出多智能体数据合成引擎、评测基准与强化学习奖励,验证合成数据训练可迁移至真实对话。
HE-Guardrail:一种防御加密大语言模型推理越狱攻击的同态护栏
提出HE-Guardrail,在密文上运行护栏并同态控制响应返回,抵御加密LLM推理越狱攻击。
富接触操作中强化学习的势场动作表示
提出PA-RL,以人工势场为动作表示,策略调场参数,经阻抗控制执行;轴孔插入成功率100%,优于基线,实机零微调完成9/9。
跨视觉-语言-动作策略的结果条件化末端执行器几何
1.5万次LIBERO闭环显示:VLA末端执行器几何随结果分层,双成功更近,但低距离不等于可互换。
微协作投毒:针对RAG系统的分布式攻击
微协作投毒将虚假目标拆分至多篇合理文档,分布式攻击RAG;108种配置显示弱信号累积即可产生影响。
HANDS 2026 研讨会挑战赛——灵巧抓取运动赛道亚军方案:面向抓取运动生成的单次轨迹变形
单次轨迹变形:观测物体后对成功演示变形并开环重放,并行PPO训练,成功率94.61%和57.18%。
从代码存档到知识图谱:连接 Software Heritage、COAR Notify 与 Wikidata
构建论文-代码库配对语料,设计Wikidata双应用profile,将学术记录与存档代码连成知识图谱。
Samsone:面向端侧推理的开源小型音频语言模型系列
Samsone开源99M–356M小型音频语言模型,面向端侧推理,134M同规模领先,媲美更大模型。
TERMon:通过硬件原生三值运行时监控器检测边缘AI中的持续性行为威胁
TERMon以硬件三值模式监控边缘AI推理行为,检测持续性行为威胁,FPGA实现两周期延迟。
日常AI智能体使用中的价值敏感型委托:来自OpenClaw的证据
分析7.3万条OpenClaw帖:价值多取决于委托设定的成本、访问与监督条件,而非智能体产出。
BoostAPR:基于执行反馈强化学习与双奖励模型的自动化程序修复增强
提出BoostAPR三阶段框架,以双奖励模型和行级信用分配强化学习修复程序,SWE-bench Verified达40.7%。
行星预测引擎:基于智能数据选择与基础模型嵌入的自主地理空间预测
自主AI引擎依据自然语言查询,融合多模态地理数据与基础模型嵌入,自动搜索并优化模型,预测精度超越专家基线。
Soda:一种用于描述以人为中心问题的面向对象函数式语言
Soda是一种面向对象函数式语言,可自然处理定性与定量,大幅简化正确性检验,便于描述复杂系统需求。
语义配对对自监督表示学习的影响
对照实验表明,语义正样本对(同类不同实例)优于增强正样本对,能提升自监督表示学习的泛化性能,对比学习受益最大。
AntiGrounding:以可执行机器人轨迹作为视觉提示的VLM引导操作
可执行轨迹作视觉提示,多视角VQA评分筛选,数字孪生验证后驱动机器人操作,八任务成功率超基线。
连续脉冲图神经网络
提出COS-GNN,融合SNN与连续图ODE,二阶结构缓解信息损失与梯度问题,实验有效。
外部影响下的强化学习:保证、算法与样本复杂度
研究非马尔可夫外部扰动下的强化学习,提出有限历史策略迭代算法,分析样本复杂度并实验验证。
立场:推进时间序列建模需要动力系统视角
认为时间序列建模需引入动力系统视角,通过数据重建动力学,可提升预测、长期统计并降低算力。
固定规划器下的技能模块演化:长期运行机器人系统的版本管理、回滚与运行时治理
长期机器人技能更新需版本化运行时治理:随机种子使峰值不稳,防护致成功归零,发布门控可拦截回归但误拒高。
Rhamba:面向静息态fMRI自监督学习的区域感知混合注意力-Mamba框架
提出Rhamba区域感知框架,融合解剖引导掩蔽与混合注意力-Mamba,在fMRI自监督学习中性能优异。
合作覆盖回路如何抑制大语言模型中的纳什博弈行为
大模型合作并非能力缺失,而由词汇触发的覆盖回路在深层后期抑制纳什选择,且可测量、可控制。
驯服对手:面向对抗强化学习的成本-扰动比方法
提出CoDRA,以成本-扰动比平衡控制器与对手,自归一化训练,免额外惩罚与权衡参数,提升鲁棒性。
当前系统泛化任务遗漏了什么?一项以推理为中心的分析
提出TranSGrid统一三类推理,揭示现有系统泛化任务因简化削弱归纳/溯因需求,仅凭生产力评估不足
正则化强调时序差分学习:常数步长下的稳定性
提出正则化强调TD(RETD),修复ETD常数步长采样动态不稳定,证明收敛与矩收缩,实验验证。
强化学习后训练下语言模型的组合推理
提出依赖图框架形式化组合推理,发现分解到组合的不对称迁移:分解技能难迁移至组合任务,反向较易。
Agentic AI Networking for Heterogeneous Unmanned Aerial Systems in Low-Altitude Wireless Networks
ScientistTwo:以自主AI开拓人类知识前沿
ScientistTwo是全自主多智能体科研框架,端到端自动完成假设、实验与论文,成果超越人类SOTA。
重新规划、修复还是编辑?资源中断下旅行智能体行程修订的统一实证评估
评测三类旅行智能体行程修订:LLM-Z3重规划复合中断成功率最高,分层修复编辑更少、保留更多承诺,计算开销各异。
LearnActCoder:面向自适应临床编码智能体的角色感知错误记忆
将少量标注错误转为结构化错误记忆库,按角色分派给编码器与评判器,无需更新权重即可提升临床编码表现。
When2Think:为高效混合推理模型学习难度感知的长度控制
提出When2Think,按题难度动态控制推理长度,简单题少思考、难题多思考,提升准确率与效率。
可复现性不等于构念效度:LLM对制度化情境化沟通的测量
LLM标注文本可复现性极高,却与问卷同一构念收敛有限,分歧随利益群体与国别系统变化,可见可复现性非构念效度。
重新思考多智能体协作:当“多”反而更少
多智能体协作仅在长时程稀疏依赖任务中占优;SAIGE按需建图、语义建边,扩展规模未必提升性能。
交易大厅中的传染:对抗性信号如何在多智能体交易系统中蔓延
LLM多智能体交易系统易受社媒投毒,对抗信号跨层传染致夏普比率下降,合理拓扑与提示可提升鲁棒性。
通过参考策略引导正则化自博弈中的均衡选择
正则化自博弈中,锚定参考策略至目标均衡并精炼,可有意选择价值等价均衡,但稳定性与对手条件限制其适用。
基于LLM的GUI智能体助推易感性的双过程视角
实验表明,LLM图形界面智能体对自动与反思型数字助推均易感;推理会降低对默认助推的敏感,却加剧对社会影响助推的易感。
MetaRTL:元路径注意力增强的关系表学习
提出两阶段框架MetaRTL:轻量预训练得表嵌入,非参数消息传递提取元路径特征并由MetaAttn注意力聚合,兼顾关系语义与高效性,10个数据集24项任务验证有效。