5276 条条目 · 106 个活跃源
2026年9月25日
04:00
arXiv cs.AI

《PUBG Ally:作为AI队友的对话式具身智能体》

提出具身AI队友PUBG Ally,融合大模型推理与实时游戏控制,经3.9万局实战数据训练,玩家推荐正向反馈高出25.1个百分点。

04:00
arXiv cs.AI

推进 AgentX 中的模型研究:面向工业推荐系统的长时程自主性

AgentX-Model 以双智能体实现工业推荐长时程自主研究,多轮实验闭环,线上 A/B 显著提升。

04:00
arXiv cs.AI

Qwen-Planner-Agent:面向真实世界移动规划智能体的闭环 AI-for-AI 框架

提出 AI-for-AI 闭环框架,贯通数据、训练与模型-框架协同演化,移动规划智能体整体性能最佳。

04:00
arXiv cs.AI

长时程智能体何时可以遗忘其推理?ICLR:面向长时程智能体上下文压缩

提出免训练在线方法ICLR压缩智能体推理历史,提升奖励并大幅降低token消耗,发现推理可外化后更易遗忘。

04:00
arXiv cs.AI

本体中介的多利益相关方神经符号约束获取

以OWL本体统一LLM软偏好与硬件硬约束,用描述逻辑检测冲突并生成解释供再协商,余者按优先级松弛。

04:00
arXiv cs.AI

面向工业配置的神经符号人工智能

大模型难满足工业配置约束;本文梳理神经符号AI三种融合策略,落地配置助手并探讨可信部署与规模化挑战。

04:00
arXiv cs.AI

ENDOPROMPT:面向效用退化的受害者侧伪参考

白盒ENDOPROMPT从无标签指令学降效用前缀,四模型七基准平均效用降26.8个百分点。

04:00
arXiv cs.AI

谁执笔?应由规范而非智能体签核

智能体自评完成不可靠;SpecHarness将规范编译为义务,以版本化状态治理执行与完成,由规范而非智能体签核。

04:00
arXiv cs.AI

Augur:预演产品与政策变更反应的合成决策实验室

Augur离线预演产品政策变更反应并生成决策备忘录;发现前沿与开源模型差距多源于评测设定,而非能力。

04:00
arXiv cs.AI

风格而非自我:表层线索解释大语言模型的零样本代码归属

LLM零样本识别自写代码仅近随机水平(49-58%),归因依赖长度、注释等表层风格,去除后消失。

04:00
arXiv cs.AI

EnigmaForge:问题藏在故事里

将唯一解逻辑谜题藏入旧文档,不给出问题,专测模型直觉;25个前沿模型表现差距达22倍。

04:00
arXiv cs.AI

NNV3:将神经网络验证拓展至新架构与新领域

NNV3发布:扩展星集支持新架构,新增概率可达性与公平性验证,覆盖图网络、视频等新领域基准。

04:00
arXiv cs.AI

零数据自我博弈预训练

零数据自我博弈预训练:生成器与学习器协同搜索可计算结构,零样本损失随计算可预测扩展,并现上下文学习。

04:00
arXiv cs.AI

服务前先筛选:面向1.4亿规模生产级客户体验AI智能体的仿真

用假设驱动仿真在部署前筛选CX智能体,仿真与生产评分高度相关,助力tNPS和自助率显著提升。

04:00
arXiv cs.AI

GRASP:面向战略规划的智能体AI生成、修订与评估

GRASP是策略感知的多阶段规划框架,通过生成、修订、评估模块化协作,大幅提升复杂任务规划准确率并消除多任务性能退化。

04:00
arXiv cs.AI

面向Roblox游戏搜索中多组件查询理解的搜索感知强化学习

提出蒸馏后强化学习框架,按组件用搜索实时反馈奖励优化查询理解,NDCG@20较SFT提升8.9。

04:00
arXiv cs.AI

Jev-Mobile:以Jev作为移动GUI智能体的执行器

Jev-Mobile让VLM低频规划、Jev高频执行GUI动作,成功率79%,成本降73.4%。

04:00
arXiv cs.AI

人工智能在科学中的应用:早期洞察

多源数据显示:科学家广泛使用AI,其与专业模型互补,每周省约7小时,但瓶颈下移、验证需求激增。

04:00
arXiv cs.AI

CrossScale-GLIO:面向弥漫性胶质瘤的 MRI 与全切片组织病理学的拓扑保持视觉-语言对齐

MRI与病理建模为肿瘤生境图与细胞微环境图,用语言锚定的结构感知最优传输对齐,证明拓扑保持驱动跨尺度对应。

04:00
arXiv cs.AI

KathDB-FAO:多模态数据库管理系统中的合成查询计划

多模态数据库查询子系统,将自然语言转为按需合成算子执行计划,成本降58.8%,质量不降。

04:00
arXiv cs.AI

网络智能体何处受阻:多阶段LLM智能体的瓶颈分析

多阶段LLM网络代理瓶颈:验证器乐观,凭证与横向移动任务受阻;需综合结果、证据、资源与适应评估。

04:00
arXiv cs.AI

随机大语言模型的推测性评估

提出HBN推测评估,在固定rollout预算下优化分配,平均降方差12.8%–33.6%,异步版缓解同步开销。

04:00
arXiv cs.AI

NumericJev:基于多路决策树的类Jev大语言模型数值解码

提出免训练数值解码算法NumericJev,以多路决策树递归细化范围,使类Jev大模型输出数值,算术基准优于候选直选2.93个百分点。

04:00
arXiv cs.AI

任务条件下的可认证主动可观测性

形式化任务条件主动可观测复杂度,证明最小充分商不变性,建立区分树与鞅证书,实现零误接受并大幅降低成本。

04:00
arXiv cs.AI

决策劫持:针对Jev类型化概率决策的提示注入攻击

提示注入会改变Jev的概率决策但很少命中攻击目标;自适应攻击使成功率由1.8%升至3.5%。

04:00
arXiv cs.AI

面向空中连续体操作中气动扰动下末端执行器位置估计的时序学习

针对气动扰动下空中连续体机械臂末端位置估计,连续时间CfC网络精度优于MLP和GRU。

2026年9月24日
04:00
arXiv cs.AI

风险感知的在线共形状态探测

提出在线共形状态探测(OCSP),无需分布假设即可控制漏查误差并最小化探测率。

04:00
arXiv cs.AI

RootQuantV2:将视觉基础模型适配于微根管图像的根系性状回归

RootQuantV2以冻结DINOv3 ViT替换CNN骨干,仅训练3.78%参数,实现微根管图像根系性状高精度回归。

04:00
arXiv cs.AI

向高中生教授强化学习与仿人机器人:基于低成本开放平台的专家验证课程设计

提出围绕共享机器人项目的整合课程框架,经五位专家验证,揭示真实性、集成与团队责任等设计张力。

04:00
arXiv cs.AI

可解释AI结合手持便携式视网膜摄影:西非低成本青光眼筛查方案

开发可解释AI,利用低成本手持视网膜照片筛查西非青光眼,性能接近台式相机,支持社区筛查。

04:00
arXiv cs.AI

Video-HopChain:面向视频推理模型的多跳问题与置信度门控探索

构建多跳视频问答数据集,两阶段GRPO训练提升八基准,提出置信度门控探索使均分达59.3。

04:00
arXiv cs.AI

MorphoSHAP:重新思考深度视觉模型解释中的归因单元

MorphoSHAP以形态学形状为Shapley归因单元,解释证据位置、结构类型与贡献强度,性能与用户偏好均优。

04:00
arXiv cs.AI

CricRAG:面向个性化板球训练的检索增强视觉语言模型

以检索相似但更优的动作为参考,为板球选手提供契合自身水平的个性化反馈,专业评估一致率达94%。

04:00
arXiv cs.AI

BAS-OPD:面向细粒度多模态感知的预算感知选择性同策略自蒸馏

BAS-OPD按预算选择性分配教师监督,仅改训练分配、保持单次全图推理,以更低成本提升细粒度多模态感知。

04:00
arXiv cs.AI

通过集成自验证与检索增强生成降低大语言模型幻觉

提出CoVe-RAG+,结合链式验证与检索增强生成,降低工程任务幻觉,事实准确率较基线提升28%。

04:00
arXiv cs.AI

不受控的变量:视觉语言模型的拒绝行为随图像是否存在而变,风险无法解释

空白图像即使VLM拒绝率波动数十点,且仅波及临界良性提问;该行为与风险脱钩,系随权重继承的未受控变量。

04:00
arXiv cs.AI

MGRL-RSCC:面向细粒度遥感变化描述的多粒度奖励强化学习

提出多粒度奖励强化学习,结合双解码与两阶段优化及三种奖励函数,缓解曝光偏差,提升遥感变化描述质量。

04:00
arXiv cs.AI

拒绝却不加区分:编码提示对安全训练模型做了什么

编码攻击评测只看有害样本,掩盖模型区分能力;四模型同形字编码下拒答差异消失,后训练亦无法修复。

04:00
arXiv cs.AI

无配对集合何时支持共享损坏校准:矩几何与双样本精度

面向共享损坏的无配对校准,提出两样本矩校准与秩感知信息状态,实现平面相似校正闭式识别,并报告弱信息而非硬拟合。

04:00
arXiv cs.AI

无声的破坏:内部状态触发的LLM驱动机器人系统后门攻击

首次揭示LLM机器人系统的历史触发后门:由机器人自身动作序列激活,攻击成功率近100%且极难检测。

04:00
arXiv cs.AI

节奏未尽如人意:面向唇形同步配音的语音活动感知语音合成

以二值语音活动信号为条件合成语音,实现精准唇形同步配音;训练时随机遮蔽使该条件可选,兼顾自然韵律与句中停顿。

04:00
arXiv cs.AI

TriWorldBench:具身世界模型的三视角一致性视角

提出TRIWORLDBENCH基准,用同步头与双手腕视频及19项指标,评估具身世界模型的跨视角一致性与任务对齐。

04:00
arXiv cs.AI

移动出行中大型语言模型的安全与隐私

综述移动出行LLM应用,指出研究偏重交通与性能,忽视安全隐私及AI法案合规,亟需安全设计。

04:00
arXiv cs.AI

QuantWM:面向世界模型与视频生成的时序一致2比特KV缓存量化

免训练2比特KV缓存量化,保持注意力并提升世界模型与视频生成画质和时序一致性,压缩达6.2倍。

04:00
arXiv cs.AI

PP-Net:面向嵌入式设备生物医学图像散射光去除的混合物理先验神经网络

提出融合物理先验的PP-Net,去除生物医学图像散射光,显著提升PSNR/SSIM,并可在嵌入式设备部署。

04:00
arXiv cs.AI

GitScholar:基于GitHub参与度预测AI研究影响力的数据集

GitScholar:GitHub互动可提升AI论文影响力早期预测精度达12%,并近乎覆盖高影响力论文。

04:00
arXiv cs.AI

影像组学与基础表征在肾细胞癌分类中的互补作用:2D与3D CT编码的比较研究

比较影像组学、2D/3D MedVAE及其融合用于肾癌分型;3D门控融合AUC达82.7%,表明二者互补。

04:00
arXiv cs.AI

FeatLens:面向仓库级代码生成的特征引导动态代码图构建与检索

FeatLens用特征索引动态构建任务代码图并检索依赖,降低开销并提升仓库级代码生成效果。

04:00
arXiv cs.AI

基于流生成模型的拓扑分层材料发现

提出流生成模型UFO-MGen,学习Wyckoff拓扑生成晶体,SUN率领先,可性质约束逆设计。

04:00
arXiv cs.AI

贪心解码并非精度不变:大语言模型推理中的跨精度输出分歧

贪心解码非精度不变:BF16/FP16输出分歧,系于LM头前二logit间距,选择性FP32重算可提一致性。