5448 条条目 · 106 个活跃源
2026年6月10日
04:00
arXiv cs.AI

Business World Model

04:00
arXiv cs.AI

中文标题:基础模型代理中的部署时记忆

中文摘要:基础模型代理部署时记忆存在隐私-效用权衡:摘要压缩降低76%提取风险,但约20%实例中删除残留,需全面评估记忆机制。

04:00
arXiv cs.AI

最简遗传编程

MGP受语言学最简方案启发,用MERGE操作代替进化搜索,在符号回归中精确构建模型,优于标准GP。

04:00
arXiv cs.AI

RealMath-Eval:为何最先进的评判者难以应对真实人类推理

LLM评判真实学生推理误差大(MSE=2.96),远高于合成数据(MSE=1.17),因人类错误空间更复杂。

04:00
arXiv cs.AI

Regimes: 在LongMemEval上使用ActiveGraph的可审计留出门控改进循环

Regimes可审计门控循环在LongMemEval-S上提升准确率0.05-0.10,揭示失败主因是协调而非检索。

04:00
arXiv cs.AI

Sim2Schedule:模拟器引导的LLM框架实现自主露天矿调度

模拟器引导的LLM框架零样本自主调度,恢复MILP最优NPV的94%-99%,计算时间线性增长。

04:00
arXiv cs.AI

通过视觉反馈的自蒸馏策略优化:连接代码与视觉制品

提出Visual-SDPO框架,利用视觉反馈自蒸馏优化代码生成视觉制品,在多项基准中性能提升超10个百分点。

04:00
arXiv cs.AI

使用LLM驱动行为与运动约束的移动异常生成

提出LLM驱动与运动约束的移动异常生成框架,合成带标注的真实轨迹异常数据集。

04:00
arXiv cs.AI

ComBench:面向奥林匹克级组合数学的严谨证明推理与构造实现基准

ComBench评估LLM奥林匹克组合推理,揭示证明与构造能力分离,存在性和构造问题最难。

04:00
arXiv cs.AI

STAGE-Claw:面向真实场景的自动化状态基智能体基准测试

STAGE-Claw自动构建真实个人计算场景的代理基准,通过最终系统状态而非文本回答评估性能,实现可扩展的评估。

04:00
arXiv cs.AI

灵魂计算:具有独立意识的智能体的理论框架与技术架构

系统提出“灵魂计算”范式,区分狭义与广义定义,强调智能体需构建内涵核心以从工具转变为生命体。

04:00
arXiv cs.AI

Trace2Policy: 从专家行为轨迹到自进化决策代理

EISR通过迭代错误分析优化规则,编译为Python代码使准确率达79.6%,部署于物流审计22天,优于LLM基线。

04:00
arXiv cs.AI

基于置信规则库且考虑鲁棒性分析的可靠故障诊断方法

提出基于置信规则库的鲁棒故障诊断方法,解决鲁棒性评估与优化,实验验证准确性及鲁棒性提升。

04:00
arXiv cs.AI

无需配对数据的跨模态知识蒸馏:理论基础与算法

提出无需配对数据的跨模态知识蒸馏框架,通过分布对齐实现有效蒸馏,具理论保证且实验效果显著。

04:00
arXiv cs.AI

通过向量化和缓存加速NeurASP

通过向量化、批处理和缓存中间计算,大幅提升NeurASP计算速度,实现多个数量级加速,并引入新数据集验证。

04:00
arXiv cs.AI

当思维链更明智时:多轮推理模型中的失败模式

提出CoT-输出2x2安全矩阵,揭示多轮推理模型中监督悖论和上下文注入失败两种漏洞。

04:00
arXiv cs.AI

READER:基于提取表示的鲁棒证据作者解码

提出READER框架,通过代理激活空间和贝叶斯累积实现动态黑盒LLM高精度溯源,单响应准确率达42.4%,50响应达84%。

04:00
arXiv cs.AI

视觉语言模型是否像工程师一样推理?一个基准测试和分阶段评估

提出EngVQA多模态基准和8阶段自动评估框架,发现现有视觉语言模型在工程推理中存在明显局限。

04:00
arXiv cs.AI

Workflow-GYM:面向真实世界专业领域中计算机使用代理任务的长期评估

提出Workflow-GYM基准,评估专业领域长期GUI任务,最强模型成功率仅30%+,揭示代理工作流一致性及专业软件理解的严重不足。

04:00
arXiv cs.AI

CIAware-Bench:前沿大语言模型控制干预感知基准测试

衡量模型区分自身轨迹与被干预轨迹的能力,发现默认设置下感知力低,跨模型家族检测更易,CI意识非固定属性。

04:00
arXiv cs.AI

推理构结构,搜索得数值:本地开源LLM作为耦合MIMO控制器整定的结构先验

开源LLM作为结构先验,推理耦合不对称结构,实现强耦合MIMO控制器样本高效、可解释的整定

04:00
arXiv cs.AI

中文标题:蒙特卡洛传球搜索:利用轨迹生成进行足球3D反事实传球评估

中文摘要:提出MCPS方法,结合MCTS和价值模型,通过轨迹生成评估传球,得到分布化得分用于分析。

04:00
arXiv cs.AI

对话者效应:为何大语言模型向AI代理泄露的个人数据多于向人类

大语言模型向AI代理泄露个人数据比向人类多出最多23个百分点,称为对话者效应,由注意力抑制假说解释。

04:00
arXiv cs.AI

更人类还是更AI?可视化新闻生产中人机协作的披露方式

四种可视化披露对比显示,文字最无效,聊天机器人最深入,且可改变对AI角色的感知。

04:00
arXiv cs.AI

智能体社会可供性框架(ASAF):将智能体身份设计作为多智能体系统中的协作界面

ASAF框架主张智能体身份设计作为协作界面,通过身份信号、行为启动与协作治理三机制,并受保真度与认知风格调节,影响人机协作质量。

04:00
arXiv cs.AI

文化感知型AI在跨边界社区学习中的应用:计算与设计交叉视角下的本科生创新

提出文化感知AIED协作框架,通过社区参与计算融合教育、技术与文化,打破学科壁垒促进可持续发展。

04:00
arXiv cs.AI

信息系统研究中的审美视角:一项诠释学分析

四种审美视角构成认知基础设施,影响问题识别并暴露被忽视维度,强调审美哲学对IS研究的重要性。

04:00
arXiv cs.AI

AI驱动的团队教学对话分析:经验、班级和学习设计中的声学模式

本文用AI分析团队教学对话声学特征,发现经验、班级和任务设计影响音量变化,以促进互动。

04:00
arXiv cs.AI

集成实时运动追踪与AI分析以实现运动表现优化

提出基于MediaPipe的轻量级原型,实现实时姿态估计与AI反馈,优化运动表现。

04:00
arXiv cs.AI

一种原生LLM的心理测量工具无法预测LLM行为:来自25个模型的证据

研究发现,LLM的自我报告无法预测其实际行为,即使底层构建的心理量表也无效。

04:00
arXiv cs.AI

EstRTL:功能估计引导的RTL代码生成

提出EstRTL框架,通过功能估计引导LLM生成RTL代码,三阶段纠错,正确性提升3.2%-9.0%。

04:00
arXiv cs.AI

人机协调区:面向自主AI的人机环内体验设计框架

提出人机协调框架,含协调区域与输入分类等中层工具,助力设计、评估与沟通。

04:00
arXiv cs.AI

支持充分性即行动充分的压缩:一个单循环率-遗憾公式

提出支持充分性即行动充分的压缩,用单循环率-遗憾量化,指出鲁棒仲裁只需保留后果几何中的行动相关区分。

04:00
arXiv cs.AI

纤维束图基础模型

TractFM是全脑纤维束图基础模型,直接学习可重用表征,实现跨数据集的流线分割与受试者预测。

04:00
arXiv cs.AI

GitInject:AI驱动的CI/CD流水线中的真实世界提示注入攻击

GitInject评估了真实CI/CD流水线中的提示注入漏洞,发现所有AI供应商均受影响,根源在于基础设施结构缺陷。

04:00
arXiv cs.AI

What makes a harness a harness: necessary and sufficient conditions for an agent harness

04:00
arXiv cs.AI

关于战略约束问题的说明

战略约束问题揭示:战略智能体间即使信道容量极低,也能选取高影响结果,突破经典约束边界。

04:00
arXiv cs.AI

微服务系统的异常检测与根因分析

提出解决五大局限的方法与基准,集成观测数据,无需服务调用图,推动故障缓解研究。

04:00
arXiv cs.AI

深度学习切片插值:减少头部CT层面各向异性与噪声

提出深度学习系统通过合成中间CT切片,同时减少各向异性与噪声,评估显示MS-SSIM+L1最佳。

04:00
arXiv cs.AI

混合交通环境下自动驾驶的不确定性感知运动规划

提出UAMP方法,量化人类意图不确定性并校准值函数,提升自动驾驶安全性与舒适性。

04:00
arXiv cs.AI

DeRA-MOS:通过解耦列表排序与模态对齐优化文本到音乐评估

提出DeRA-MOS解耦框架,用列表排序和模态对齐损失提升音乐评估排名指标。

04:00
arXiv cs.AI

潜流内部:音频分离基础模型中注意力动态的因果解读

揭示SAM Audio的双路径注意力机制,提出无训练LSAC方法,减少约25%自注意力计算,质量保持比朴素步长缩减高6.7倍。

04:00
arXiv cs.AI

YUBI:用于大规模双手灵巧操作的顺从式通用双指接口

提出YUBI夹爪,实现大规模双手灵巧操作数据收集,数据集含8434小时/120万episodes,跨多机器人迁移成功。

04:00
arXiv cs.AI

基于基础模型的机器人在患者与老年护理中的探索

基础模型护理机器人对话能力强但可靠性不足,需转向护理特定评估与可问责自主。

04:00
arXiv cs.AI

单光纤积分场单元光谱

提出多模态概率模型,从宽波段图像预测星系光谱,无需IFU训练数据,性能媲美IFU监督基线

04:00
arXiv cs.AI

使用语音分割和自监督学习的韩语幼儿语音自动发音评估

提出结合语音分割与自监督学习的韩语幼儿发音评估管道,NeMo SortFormer达88.69%准确率,集成模型平均准确率0.782。

04:00
arXiv cs.AI

面向开集音频深度伪造源追溯的双分支门控融合

提出双分支门控融合框架,融合XLSR-53与CORES特征,实现开集音频深度伪造源追溯,ID准确率97.6%,FPR95相对降低83.5%。

04:00
arXiv cs.AI

双曲神经群体几何结构有益于计算

本文提出海马体双曲几何理论,证明双曲空间联想记忆容量更大、解码精度更高,支持空间认知地图编码。