5433 条条目 · 106 个活跃源
2026年6月23日
04:00
arXiv cs.AI

ARCO:面向多步LLM智能体的自适应评分规则与协同进化

ARCO通过双头模型与轨迹分解约束,实现无步骤标签的信用分配,协同进化评分规则与策略,显著提升多步推理性能。

04:00
arXiv cs.AI

Don't Blindly Trust It: How Unreliable Feedback Breaks Tool-Using LLM Agents

04:00
arXiv cs.AI

从社会选择角度看AI对齐

从社会选择理论视角,研究人类反馈聚合中的冲突与设计,揭示失败模式与处理分歧的路径。

04:00
arXiv cs.AI

幻觉即上下文漂移:多智能体LLM系统同步协议

多智能体LLM的幻觉源于上下文漂移,提出轻量度量CDS与同步协议SSVP,减少API调用并有效降低幻觉率。

04:00
arXiv cs.AI

ForEx:逻辑谬误检测与标注中可解释推理的形式验证框架

ForEx框架将LLM解释形式化为可验证推理链,揭示形式可推理性与标签一致性的系统性差距。

04:00
arXiv cs.AI

AgentRiskBOM:面向自主AI系统的风险界定安全物料清单

AgentRiskBOM扩展现有物料清单,填补自主AI系统运行时权限与审计空白,实现100%风险类别可见性。

04:00
arXiv cs.AI

REBA:面向连续POMDP在线规划的揭示信念自动机框架

REBA框架通过在线揭示事件动态构建信念自动机,无需预定义抽象,支持形式策略合成,性能提升17%以上。

04:00
arXiv cs.AI

Project Euler上人类与机器数学难度的实验分析

分析AI在Project Euler问题上的表现与人类难度关系,发现机器成本增长慢于人类,成功概率呈指数衰减。

04:00
arXiv cs.AI

假设驱动的LLM智能体技能优化

HDSO框架通过假设验证与审计,无需训练即可优化技能,在ALFWorld上显著提升性能并抵抗噪声反馈。

04:00
arXiv cs.AI

推理模型能否检测其思维链的变化?

推理模型检测思维链干预能力弱,难以识别修改方式,对自身与其他模型修改检测能力相当。

04:00
arXiv cs.AI

基于世界模型的视频生成中物理一致性的无参考评估

提出无参考物理一致性评估方法,相对评估提升任务成功率8%以上,绝对评估实现时空定位。

04:00
arXiv cs.AI

PlanBench-XL:评估大规模工具生态系统中LLM工具使用代理的长期规划

PlanBench-XL基准测试发现,LLM代理在大量工具中规划困难,严重阻塞下准确率从51.90%暴跌至11.36%,凸显自适应规划需求。

04:00
arXiv cs.AI

SVGym (SciVerseGym):一个用于晶体发现中强化学习和贝叶斯优化的环境

SciVerseGym是兼容Gymnasium的晶体发现环境,支持编辑与评估,为强化学习等提供开放测试平台。

04:00
arXiv cs.AI

PRIME:评估大语言模型中不兼容指令下的提示解析

PRIME框架发现,冲突类型比模型规模更影响LLM行为,需培养冲突意识。

04:00
arXiv cs.AI

VADAOrchestra:自适应推理工作流的神经符号编排

神经符号框架VADAOrchestra结合LLM编排与Datalog+/-推理,实现可审计、可扩展的自适应工作流。

04:00
arXiv cs.AI

基于深度学习的视频手语识别和跨语言翻译至印度本土语言

提出两阶段深度学习流水线,识别手语视频并翻译成三种印度语言,13类上验证准确率78%。

04:00
arXiv cs.AI

一个可微分的Atari VCS:用于可解释AI的复杂且完全已知的真值基准

构建可微分Atari VCS,为可解释AI提供完全已知的真值,验证梯度方法可行性。

04:00
arXiv cs.AI

立足实践的扩展:为何智能体AI需要确定性环境

论证环境确定性是智能体AI扩展的关键瓶颈,链式任务失败呈指数级,提出三个形式化结果及量化指标。

04:00
arXiv cs.AI

基于因果世界建模的具身科学智能自演化认知框架

提出自演化因果认知框架,通过干预推理与持续精炼,推动具身智能从预测转向认知演化。

2026年6月20日
04:00
arXiv cs.AI

混合扩散变换器用于基于整流流的指令引导音频编辑

提出混合扩散Transformer,通过粗到细策略高效实现指令引导音频编辑,在复杂任务中显著提升性能。

04:00
arXiv cs.AI

频率感知流匹配:实现连续一致机器人动作生成

FAFM通过离散余弦变换和时域导数正则化生成连续平滑动作,提升成功率与运动一致性。

04:00
arXiv cs.AI

具有局部可塑性的混合ANN-SNN流水线

利用预训练ANN和局部学习规则,混合流水线在ImageNet 64类上达99.09%精度,媲美深度网络。

04:00
arXiv cs.AI

ScholarQuest:面向开放文献环境的基于分类法引导的智能体学术论文搜索基准

提出大规模分类法引导的智能体搜索基准,覆盖千余主题四种意图,智能体Recall仅0.314,提升空间大。

04:00
arXiv cs.AI

DataMagic:将表格数据转化为数据洞察视频

将原始表格数据和自然语言查询转化为可交互的叙事型数据洞察视频。

04:00
arXiv cs.AI

AutoPass:证据引导的LLM智能体用于编译器性能调优

AutoPass利用编译器和运行时证据引导LLM优化,无需训练,在x86和ARM上比-O3加速达1.117x。

04:00
arXiv cs.AI

基于多视角反编译的LLM恶意软件分类

提出多反编译器视角,无需训练即可提升LLM恶意软件分类效果,利用Ghidra和RetDec互补信息提高召回率。

04:00
arXiv cs.AI

LLM智能体安全、多轮红队测试、越狱基准、对抗鲁棒性、安全关键系统

NRT-Bench揭示多轮红队攻击下LLM代理脆弱性不重叠,防御效果模型依赖。

04:00
arXiv cs.AI

结构化与标记化分布式用户兴趣上下文以用于生成式推荐

G2Rec通过统一图协同与语义标记化,捕捉用户兴趣原型,提升生成式推荐性能。

04:00
arXiv cs.AI

UniMM:一种用于多智能体模拟的统一混合模型框架

提出统一混合模型(UniMM)生成多模态智能体行为,引入闭环采样与时间解耦对齐机制,在WOSAC上达到最优。

04:00
arXiv cs.AI

MEAL:持续多智能体强化学习基准

首个持续多智能体RL基准MEAL,利用GPU加速实现百任务训练,揭示长序列的失败模式。

04:00
arXiv cs.AI

AAPA:大型语言模型后训练中的对抗锚定偏好对齐

AAPA框架通过轻量判别器进行对抗性锚定,提升大模型后训练对齐效果,指令遵循任务上显著改进。

04:00
arXiv cs.AI

电力系统保护中故障分类与定位的机器学习模型受控比较

在相同数据与决策窗口下对比多种ML模型,10ms内最佳故障分类F1>0.98,定位误差约10%。

04:00
arXiv cs.AI

重新思考创造力:生成式AI与意图代理问题

放弃意图代理作为创造力必要条件,提出创造力归因于创造能力,解释AI何以具有创造力。

04:00
arXiv cs.AI

一个探针无法一网打尽:迈向有针对性的欺骗检测

欺骗检测具有异质性,单一探针提升有限,针对特定类型匹配探针可显著提升性能,建议按威胁模型部署对应探针。

04:00
arXiv cs.AI

硬约束下的条件扩散引导:一种随机分析方法

基于Doob h变换与鞅理论,提出硬约束下扩散模型的条件生成与离策略学习算法,确保概率为1的约束满足。

04:00
arXiv cs.AI

减轻可读性税:基于解耦的证明者-验证者游戏

提出解耦的证明者-验证者游戏,训练翻译器将求解器输出转为可检查形式,缓解可读性税并保持准确率。

04:00
arXiv cs.AI

原型神经网络架构搜索:面向微控制器单元的深度神经网络快速设计

PrototypeNAS零样本NAS方法,三步搜索快速设计适配MCU的小型DNN,精度媲美大模型。

04:00
arXiv cs.AI

脚手架效应:提示框架如何驱动临床VLM评估中的表面多模态增益

提示框架提及MRI即可提升58%F1,实际未用影像,此“脚手架效应”表明表面评估不可靠。

04:00
arXiv cs.AI

护理过渡审计:高效护理过渡的出院小结审计基准

提出LLM审计出院小结基准,评估11模型,完整度55-74%,与临床中等一致,但难辨模糊文档。

04:00
arXiv cs.AI

委员会智慧:来自大型基础模型和领域专家的多样化蒸馏

提出 DiverseDistill 框架,利用可学习问答机制从多样化教师中蒸馏,动态筛选教师,显著提升学生模型性能。

04:00
arXiv cs.AI

弥合分布偏移与AI安全:概念与方法论的协同

本文建立分布偏移与AI安全的两类协同:偏移方法与安全目标可对应或相互归约,促进研究整合。

04:00
arXiv cs.AI

一种用于静息态脑电图合成与可迁移表示学习的深度生成模型

提出REST-GAN模型,同时实现静息态EEG合成与无监督特征提取,生成信号逼真且表征可迁移至下游任务。

04:00
arXiv cs.AI

Oranits:基于Open RAN的智能交通系统中使用元启发式与深度强化学习的任务分配与任务卸载

提出Oranits模型,结合元启发式和深度强化学习优化任务分配与卸载,考虑依赖与成本,提升完成率与效益。

04:00
arXiv cs.AI

中文标题:克服扫描隧道显微镜中缺陷分类的标记数据稀缺

中文摘要:提出少样本与无监督学习结合,实现STM图像自动分割,少量标记即可高精度识别多种表面缺陷。

04:00
arXiv cs.AI

Assessment of Personality Dimensions Across Situations in Dyadic Role-Play Scenarios

04:00
arXiv cs.AI

双锚点插值求解器:加速生成建模

提出BA-solver,引入轻量SideNet,仅需5-10步即可媲美百步生成质量,训练成本低且即插即用。

04:00
arXiv cs.AI

我的杯子拿来!通过视觉注意力提示实现视觉-语言-动作模型的个性化

提出VAP方法,利用参考图像作为视觉记忆,通过检测匹配实现个性化物品操作,无需训练即可提升成功率与正确性。

04:00
arXiv cs.AI

稳定Q-梯度场以提升Actor-Critic方法中的策略平滑性

策略不平滑源于批判者微分几何,PAVE框架稳定Q-梯度波动,实现平滑性而不改演员。

04:00
arXiv cs.AI

策略嵌入的图扩展:基于扩散驱动网络样本的网络化HIV检测

提出PEGE框架与DDB模型,提升HIV检测效率,实验使折扣奖励提升17.3%、检测率提高15.4%。

04:00
arXiv cs.AI

类增量运动预测

提出类增量运动预测新设置与端到端框架,适应新类别并抵抗遗忘,通过伪标签与投票机制实现。