5903 条条目 · 106 个活跃源
2026年8月7日
04:00
ArXiv AI

塑造人机交互以提供改进路径并平衡竞争目标

研究如何设计人机交互,帮助用户准确理解AI并改进表现,同时防止投机行为,确保AI达成目标。

04:00
ArXiv AI

RA-CAD:为状态感知的文本到CAD生成学习执行后批评

RA-CAD将执行后批评作为可学习策略,优化状态感知文本到CAD生成,实现最优结果。

04:00
ArXiv AI

DreamGuard:基于风险感知世界模型的高效大语言模型智能体运行时护栏

提出“梦境卫士”护栏,用风险感知世界模型预测未来风险并提前干预,安全效用最佳,延迟25毫秒。

04:00
ArXiv AI

提示侧智能体剧本何时可迁移?智能体部署中的准确性、成本与运行时变化

提示侧剧本迁移需条件验证,非默认复用;部分场景有益,但存在成本激增与兼容性异质性,需目标端验证。

04:00
ArXiv AI

谨慎上下文引导用于语言模型个性化

提出CCS,用轻量适配器按词控制用户上下文影响,单数据集训练即可跨域泛化,免逐用户微调,降低推理成本。

04:00
ArXiv AI

当智能体AI遇上通感一体化

智能体AI将通感一体化转为闭环智能系统,提出六阶段框架与五级成熟度,指出验证缺口和挑战。

04:00
ArXiv AI

AppDeltaWorld:面向移动GUI智能体的过渡锚定增量代码世界模型

提出以代码更新形式预测GUI的世界模型,提升移动端GUI生成保真度,并支持闭循环训练与测试期强化学习,显著增强智能体性能。

04:00
ArXiv AI

当自我进化适得其反:LLM智能体技能污染的提交前门控机制。

技能池过大会引发不可逆污染,致性能下降;VaG门控以三类审查和子集选择,小池实现更高性能。

04:00
ArXiv AI

眼见不等于决策:多模态大模型能成为高效CEO吗?

多模态提升证据推理但破坏资源分配,信号拥挤是主因,视觉增强需谨慎。

04:00
ArXiv AI

改进国防与国家安全本体间的互操作性:分析与评估任务

分析60多个公开本体,为OAEI新增赛道,含8个匹配任务、共识对齐和人工校验的银标准映射。

04:00
ArXiv AI

ChainClaw:面向可靠链上执行的分层智能体框架

提出ChainClaw框架,通过分层架构解决链上执行的反应性、不可逆性与可观测性缺陷,显著提升安全性与任务完成度。

04:00
ArXiv AI

异构注意力内存的运行时可观测性

提出覆盖四类注意力内存运行时可观测契约,三算子组合风险账本,指标类型化分级,千万级实测零违规并定位静默损坏。

04:00
ArXiv AI

基于图支架证据锚定的个性化深度研究查询精化

借助意图引导图将请求精化为个性化研究规格,平衡证据成本,提升加权覆盖度与报告个性化,提问仅为基线三分之一。

04:00
ArXiv AI

OPERA:基于算子残差反馈的语言模型智能体可靠自主光学实验

自主光学实验中,仅用分数反馈的决策有23.6–39.0%无物理改进,而算子残差反馈仅0.9–1.9%,且提升目标达成率、降低预算,并成功迁移至实物仪器。

04:00
ArXiv AI

视觉语言模型用于视频游戏数据标注

研究VLM标注游戏帧奖励信号,发现赛车游戏表现差,用输出混合与提示优化,分析长度、分辨率、批处理影响。

04:00
ArXiv AI

当历史说谎:在多轮误导历史下评估与改进工具使用

历史轨迹虽结构有效但语义过时,会干扰工具调用。提出基准与教师软监督方法,显著提升工具使用准确率并可扩展。

04:00
ArXiv AI

基于图的多示例学习整合隐式与显式关系偏差:皮肤病变诊断案例研究

提出隐式补丁建模与显式图消息传递结合框架,在皮肤病变数据集上平衡准确率分别提升至79.27%和60.67%,优于基线。

04:00
ArXiv AI

评估大型语言模型中的投资逻辑:面向个性化金融智能体的真实世界基准

提出投资逻辑基准,含151位真实投资者20万余条决策;大模型逻辑合理但事件依据弱,仅看收益掩盖缺陷。

04:00
ArXiv AI

弥合差距:混合思维实现人类模拟

提出Anacreon,以混合思维模拟个体,在特定领域达个体级预测,序数对齐0.775,并减少偏差。

04:00
ArXiv AI

PaDoc:基于布局的并行解码文档解析

提出PaDoc,以布局为分支并行解码,减少解码深度,在文档解析基准上取得领先性能,速度提升显著。

04:00
ArXiv AI

大型技能库智能体检索方法的比较研究

混合检索优于知识图谱:图边来自同一嵌入邻域,无法扩展检索范围;作者查询高估命中率44点。

04:00
ArXiv AI

MicroEvo:知识引导LLM采样用于高效微架构设计空间探索

知识引导LLM采样高效探索微架构空间,Pareto质量提升36.2%,效率提升10.6倍。

04:00
ArXiv AI

EnvACE:通过世界预演内化环境动态的智能体强化学习方法

EnvACE用世界预演替代外部环境,自演环境响应并端到端优化,内化动态,提升智能体性能。

04:00
ArXiv AI

TS-RAG:面向时间序列预测的检索增强生成

提出TS-RAG,用检索增强生成提升时间序列预测,通过参考令牌融合检索序列,达到最新最优性能。

04:00
ArXiv AI

静态与演化数据解释方法评估中的挑战

XAI评估不足,以DetoxAI为例,探讨解释适应数据流漂移及数据-模型-解释共同演化的挑战。

04:00
ArXiv AI

超越信息检索:生成式AI作为认知仲裁者促进协作问题解决

生成式AI作为认知仲裁者,重构协作问题解决,引导从冲突到协同推理。

04:00
ArXiv AI

正在关闭的窗口:政府如何失去约束先进AI的能力

随着AI能力提升,风险加剧,政府可能无法再有效约束AI发展,建议尽早采取低成本措施保留控制权。

04:00
ArXiv AI

自主研究智能体:AI科学家综述与验证鸿沟

综述35项研究发现代码开放普遍,但可复现性与论断验证不足;瓶颈在于验证AI生成论断。

04:00
ArXiv AI

ASTELD:自主AI智能体六轴分类框架——设计、评估与OpenClaw案例研究

提出ASTELD六轴分类框架,评估八个平台及OpenClaw案例,揭示安全-可访问性对角线等模式,发现本地优先与企业级安全结合的空缺区域。

04:00
ArXiv AI

IMMENSE:社交网络中的归纳式多视角用户分类

提出IMMENSE,融合内容、社交与空间信息,采用归纳学习识别恶意用户,无需重训练即可分类新用户,优于现有方法。

04:00
ArXiv AI

基于多智能体Transformer的TSN网络队列级XR流量调度

提出MAT调度TSN中XR队列流量,通过注意力建模队列间依赖,时延降71.42%,失效率降83.2%

04:00
ArXiv AI

面向智能体科学的分层服务器架构

提出分层动态架构,自动发现云端、边缘及超算资源,并行模拟验证高谈判准确率,已支撑实际任务。

04:00
ArXiv AI

生命科学中人工智能的伦理:普遍性、文化多样性与关怀架构

AI伦理非特例,基于人脑架构与关怀,平衡普世判断与道德多样性。

04:00
ArXiv AI

时间敏感应用中在线流量调度的多智能体强化学习

提出基于HAPPO的多智能体强化学习调度,每队列为代理,平均等待和最大延迟降26.8%与16.8%

04:00
ArXiv AI

当经验成为指令:自进化智能体技能系统中的轨迹投毒

提出轨迹投毒攻击PoisonedEvolution,以少量支持即可将目标行为嵌入自进化技能系统,成功率高达91%,揭示证据提升是安全边界。

04:00
ArXiv AI

图灵最初的模仿游戏:设计概念与一场近似机器的人类阅读

图灵1948年象棋模仿游戏强调机器会犯错、排除物理特征、人类裁判及搜索为核心,实为“人模仿机器”,考察人类智能何时类机器。

04:00
ArXiv AI

SafeDivertor:利用时频先验从宏观等离子体状态信号忠实重建偏滤器热流

提出在线信号重建范式及数据集DivMPS2HF,SafeDivertor结合物理先验与谱优化,重构偏滤器热流,五项指标全面领先。

04:00
ArXiv AI

搜索辅助的智能体-环境联合强化学习,用于带旋转的鲁棒终身多智能体路径规划

提出SJRL算法,结合搜索与联合强化学习,解决带旋转和鲁棒约束的终身多智能体路径规划,性能优于强基线。

04:00
ArXiv AI

多智能体LLM系统推理时并行的双层级视角

提出双层级并行框架,统一副本与结构并行。实验证提升精度降延迟但增开销,中等难度任务收益最大。

2026年8月6日
04:00
ArXiv AI

BrainBench:全面脑电理解的大语言模型基准测试

提出BrainBench基准,评测大模型指令化EEG理解,涵盖17数据集多任务,比较代码执行与代理分析范式,发现能力因模型和操作而显著不同。

04:00
ArXiv AI

基于预训练Transformer的感知模型的对抗鲁棒溯因融合

提出无领域知识几何标签池方法,实现对抗鲁棒溯因融合,优于多数投票并抗协调攻击。

04:00
ArXiv AI

MatrAIx:用83亿角色代理模拟世界

MatrAIx:83亿角色代理的模拟用户评估基础设施,覆盖多环境多任务,验证中角色遵循率达91.5%。

04:00
ArXiv AI

内感受注意力:觅食智能体中的动态稳态优先级分配

固定感知预算下,将内感受精度动态分配给最需通道,可倍增生存率并加速学习。

04:00
ArXiv AI

SafeCommit:为基于记忆的智能体安全行动时机提供认证

SafeCommit在记忆不确定下为智能体行动提供风险控制认证,确保不安全提交概率不超过设定阈值。

04:00
ArXiv AI

抗泄漏遗忘:评估多跳推理一致性与恢复鲁棒性的新基准

针对多跳推理与恢复攻击的遗忘基准;现有方法脆弱,需权衡遗忘质量、鲁棒性和效用。

04:00
ArXiv AI

CARGO-VL:面向视觉-语言模型的反事实仲裁与风险约束组优化

提出CARGO-VL,以组相对优化处理证据冲突,平衡回答与弃权,提升反事实一致性与可靠性。

04:00
ArXiv AI

技能价值几何?结构感知的智能体技能 Shapley 估值

提出结构感知Shapley技能估值法,评估内部单元,区分内容与上下文成本,支持安全剪枝。

04:00
ArXiv AI

A/B Agent:面向工业A/B测试中策略迭代的自进化智能体

提出A/B智能体闭环,用层级经验树与Tree-RAG生成策略,据在线反馈自进化,GMV提升4.829%

04:00
ArXiv AI

一致性先于多样性:异构语言模型协同的验证优先互补性

ABD规则:锚点答案获两项印证则保留,否则异构合成;理论界定精度差距,实验提升显著。

04:00
ArXiv AI

延迟容忍网络中基于强化学习的无人机飞行与机会路由联合优化

提出JUROR,PPO联合优化无人机飞行与机会路由,集中训练分散执行,优于PRoPHET和MaxProp。