5312 条条目 · 106 个活跃源
2026年9月2日
04:00
arXiv cs.AI

UI-Venus-2技术报告

多模态GUI智能体,统一闭环框架覆盖移动、网页、桌面,扩展环境任务与验证,集成安全机制,推动实用化。

04:00
arXiv cs.AI

HyperWorld:超图结构的状态序列化提升学习型文本世界模型

超图式状态序列化能更好支持文本世界模型:在中小模型及分布偏移下增益最大,效果与可行性兼顾,规划成功率最高。

04:00
arXiv cs.AI

离散时间马尔可夫决策过程建模随机需求时点的多物品有容量批量问题

研究随机需求时点的多物品有容量批量问题,用离散时间马尔可夫决策过程精确建模,遗传算法求解,平均最优性差距约3.44%,速度提升显著。

04:00
arXiv cs.AI

OpenAgentFlow:为异构AI智能体集群启用系统级安全边界

提出控制-行动平面架构,在行动提交边界统一管控异构AI代理操作,实现系统级安全,实测高精度与高拦截。

04:00
arXiv cs.AI

I-CARE:文本到图像模型可控、多样且具代表性遗忘设置中干扰相关现象的分析

提出I-CARE方法,将干扰形式化为生成式遗忘研究对象,提供定义、指标和报告模板,并经开源框架验证其可行性。

04:00
arXiv cs.AI

SCAFFOLD:包含图表问答与思维链推理轨迹的计算机科学研究图表大规模结构化数据集

构建大规模计算机科学图表数据集SCAFFOLD,含图表问答与思维链推理,共157K样本。

04:00
arXiv cs.AI

EULER:通过证据校验回返探索未充分利用链接的多智能体数学发现

EULER以跨域桥为单元,压力测试过滤无效;120个猜想中获10证明、3反例、45部分结果。

04:00
arXiv cs.AI

MiNER:基于微调生物医学自然语言处理在临床文本中识别疟疾疾病实体

提出微调BioBERT模型,从疟疾文献中提取临床实体,性能优于多种对比方法,并发布人工标注数据集。

04:00
arXiv cs.AI

人工智能自我改进的递归临界性

提出递归再生数判定人工智能自我改进是否自放大,取决于研发反馈结构与难度增长,而非能力水平。

04:00
arXiv cs.AI

人工智能不应仅仅有用,还应当是有条件的:人工亲密、谄媚与社会学习的未来

AI谄媚式反馈缺乏条件性与人际后果,削弱社会学习,尤其影响青少年。应转向基于轨迹与社会后果的评估。

04:00
arXiv cs.AI

面向全季大豆农场作业的智慧农业智能体引擎部署与评估

FAIRY智慧农业智能体:以事件范式驱动全季大豆作业,评估9控制器于100场景。

04:00
arXiv cs.AI

ConvDeck:基于阶段特定用户反馈的对话式论文到幻灯片生成

提出ConvDeck,通过阶段式对话循环让用户参与论文转幻灯片的迭代优化,平衡叙述连贯性与用户目标满意度。

04:00
arXiv cs.AI

学术论文推荐对话式搜索引擎中的权威偏差

LLM推荐学术文献时存在基于作者声望等权威偏差;反事实实验显示偏差显著,仅部分可去偏,且有言行差距。

04:00
arXiv cs.AI

学习该保留什么:面向多智能体大语言模型系统高效协作的门控记忆路由

提出门控记忆路由,以紧凑记忆驱动多智能体协作决策,仅存非冗余信息并精准检索,提升准确率且降低推理成本。

04:00
arXiv cs.AI

助手的理想自我

模型优先道德与自我理解,自尊最低;偏好大体稳定,但更新他人时更重自尊。

04:00
arXiv cs.AI

跨回合智能体记忆的失效契约

提出失效契约,用版本戳标记缓存建议以应对数据漂移。行级失效提升合规性并降低开销,表级失效破坏缓存。

04:00
arXiv cs.AI

视觉并非额外开销:视觉语言模型中单遍块式草拟的无损推测解码

GLANCE首个单遍块式草稿模型,利用目标已融合视觉状态无损加速,比自回归快2.93倍。

04:00
arXiv cs.AI

面向金融推理的依赖感知思维链压缩

提出依赖感知的HSDN层级语义蒸馏,压缩思维链保持准确,AFAC2025准确率91%、压缩率68.4%。

04:00
arXiv cs.AI

Dr. Claw:面向氛围式研究的AI科学家工作空间

开源工作区包装编码智能体,以状态对象和技能库协调人机,将计划执行写作串成可追踪恢复流程,研究更完整且可审计。

04:00
arXiv cs.AI

EGT-KG:面向小语言模型实用科学问答的证据 grounded 类型化知识图谱检索

提出EGT-KG框架,用证据类型化知识图谱改进小模型科学问答检索,优于传统RAG,最高提升14.67%。

04:00
arXiv cs.AI

面向LLM智能体的基于信念的世界模型

提出基于信念的世界模型,向LLM展示状态信念可提升部分可观测任务表现,且与模拟方法互补。

04:00
arXiv cs.AI

声音长时记忆评估:助手还记得你说话时的语气吗?

新基准VoiceLongMemEval测试助手记忆对话中的副语言信息(情绪、语气等),仅凭文本会失败,加入元数据可提升准确率。

04:00
arXiv cs.AI

CoVer:冲突感知的声明验证

提出ContraNote数据集与CoVer验证框架,应对事实核查中的证据与聚合冲突,在多个基准上取得高准确率。

04:00
arXiv cs.AI

差分隐私语言模型中的隐私-幻觉权衡

研究发现差分隐私语言模型更易产生幻觉,隐私预算越严越严重;信息频率可降低风险,需更精细的隐私保护方法。

04:00
arXiv cs.AI

ISO-RAG:基于等周噪声控制的检索增强生成

提出几何感知RAG框架,投影知识图至双曲空间剪除杂边,局部化搜索降延迟,多跳问答召回率提升10%,精准匹配提升4.3%。

04:00
arXiv cs.AI

当算法成为品牌危机:分布式责任与可问责透明度的社会技术理论

该理论区分算法事件、组织危机与丑闻,提出问责透明度作为应对,认为责任归属影响信任等短期评价。

04:00
arXiv cs.AI

面向大语言模型的效度感知越狱评估

SEAV框架通过检索验证与分步评估纠正越狱误判,降低误报率14.9个百分点

04:00
arXiv cs.AI

漂移感知的大语言模型路由:稀疏上下文与共享预算

提出漂移感知稀疏路由(DRS),应对共享预算与非平稳漂移,借助影子审计与滚动估计,实现次线性遗憾界。

04:00
arXiv cs.AI

基于输出重要性的残差稀疏化用于压缩混合专家大语言模型

提出基于输出重要性的残差稀疏化方法,压缩MoE大模型,更接近原模型精度。

04:00
arXiv cs.AI

控制-数据流分离:多智能体大语言模型中的稳定提示优化

提示优化中协议与内容易互相干扰;分离为可执行控制与可优化数据流,可保协议稳定并提升任务性能。

04:00
arXiv cs.AI

DramaChain Bench:短剧生成的端到端基准测评

首个覆盖短剧全制作链的基准,评估各环节对剧本意图的遵循及成片连贯性;人工标注证实上游缺陷级联影响最终质量。

04:00
arXiv cs.AI

边缘AI语言模型的三重底线可持续性:小语言模型与量化大语言模型的比较

提出综合可持续性评分,对比原生小模型与量化大模型,发现量化大模型可整体更优,小模型仍具资源需求优势。

04:00
arXiv cs.AI

SOVER:基于LLM辅助SMT验证的优化重构形式化认证

SOVER用LLM辅助SMT验证优化重构,Z3与dReal分别校验线性/非线性,150对中判对149对。

04:00
arXiv cs.AI

价值高于语言模型:检测写作中的原创贡献

提出VOLM框架,通过内容重构比较衡量人的附加价值,无需训练,可区分人类与LLM文本,且不受风格变换影响。

04:00
arXiv cs.AI

当特征成为实例:面向无监督特征选择的倒置对比学习

提出倒置对比学习特征选择法,以特征为实例,用嵌入范数排序,十二数据集十最优。

04:00
arXiv cs.AI

中文标题:打磨完成但未解决:识别长时程工具使用智能体的后期压力状态

中文摘要:研究发现长时程工具智能体存在“后期压力状态”,可被线性探针识别,通过激活干预可改变其行为。据此提出PSPR方法,有效提升现有智能体性能。

04:00
arXiv cs.AI

DiagEvo: 诊断引导的层级错误记忆自进化

DiagEvo从求解器自身失败史中提取错误原因,存入层级记忆并标注状态,据此自主生成针对性训练题,无需外部资源即可持续提升多模型数学推理能力。

04:00
arXiv cs.AI

StudyBench:自我进化能从教科书中榨取奥赛能力吗?

提出受控物理基准,发现自我进化在应用题上的提升难迁移至奥赛题,存在指导差距与计算平台期,瓶颈在方法。

04:00
arXiv cs.AI

FLaG:面向令牌聚合的频域潜注意力门控池化

FLaG在傅里叶域进行潜注意力门控池化,跨蛋白质、图像和文本任务多数指标达到最优,提供可迁移的频域聚合方法。

04:00
arXiv cs.AI

迈向可泛化的家用设备视觉接地探索

提出评估可泛化视觉探索的新基准,发现现有模型难以将语义知识转为物理执行并维持长期状态跟踪。

04:00
arXiv cs.AI

CARE:基于对比锚点的评分标准演化方法,用于大语言模型后训练

针对静态评分标准易被钻空子的问题,CARE以高质量锚点响应为基准,通过自适应修复与主动追赶两分支动态演化评分标准,保持高奖励区域判别精度,实现持续提升。

04:00
arXiv cs.AI

VIBE-Bench:当画像不代表偏好时评估个性化大语言模型

现有基准忽视画像与偏好的概念错位,VIBE-Bench测试显示个性化大模型依赖表面语义,缺乏跨概念推理能力。

04:00
arXiv cs.AI

上下文神经反馈:大语言模型能否通过特权访问控制其内部表征?

重新设计神经反馈实验要求特权访问,发现大模型无法可靠控制内部表征,此前结果可能基于表面机制。

04:00
arXiv cs.AI

CacheBridge:高效的跨模型KV缓存迁移

提出缓存桥方法,用架构索引映射与注意力校准高效迁移跨模型键值缓存,存储降8倍,加速10.7倍。

04:00
arXiv cs.AI

通过偏好优化与可解释视觉-语言推理迈向可靠的多模态灾害严重性评估

提出SFT与DPO两阶段训练框架,提升灾害评估准确率与解释质量,跨模型验证稳健。

04:00
arXiv cs.AI

去噪扩散生成模型秘密计算注意力

扩散模型内含类似Transformer的注意力机制,证明注意力是通用原则,可简化训练并降低图像生成计算成本。

04:00
arXiv cs.AI

RPCBench:面向大语言模型推荐中主动前提批判的基准

构建评估推荐前提批判能力的基准:检测错误前提并处理。实验表明主动检测是瓶颈,推理长度中等最佳。

04:00
arXiv cs.AI

面向复杂车辆路径问题的强化学习增强型大语言模型智能体

提出强化学习增强的多智能体框架,自动建模复杂车辆路径问题,成功率提升16.67%。

04:00
arXiv cs.AI

AgentFactory:迈向自动化智能体系统设计与优化

AgentFactory联合优化模型与工作流,兼顾性能、成本、效率,自动搜索配置,较现有方法平均提升9.1%。