5474 条条目 · 106 个活跃源
2026年5月22日
04:00
arXiv cs.AI

RealUserSim:通过基于真实数据的用户模拟弥合智能体基准测试中的现实差距

基于1.4万真实对话提取行为特征,将模拟匹配率提升至45.3%,揭示合作模拟器无法发现的失败机制。

04:00
arXiv cs.AI

PrivacyAkinator:借助LLM生成的多选题阐明关键隐私设计决策

该工具通过LLM生成多选题,帮助开发者高效阐明隐私决策,比传统方法多发现47%关键点且耗时减少73%。

04:00
arXiv cs.AI

ProcBench:评估LLM编程智能体的过程级缺陷与控制保持

ProcBench通过过程本体和标准化轨迹评估执行缺陷与控制保持,揭示被忽视的差异。

04:00
arXiv cs.AI

PolycubeNet: 一种用于基于Polycube的六面体网格生成的双潜在扩散模型

提出双潜在扩散模型PolycubeNet,从点云直接生成Polycube,高效生成高质量六面体网格。

04:00
arXiv cs.AI

基于微调本地大语言模型的安全文档分类:基准数据与开源系统

微调本地大模型TorchSight实现安全文档分类准确率95%,优于商业模型,数据本地处理。

04:00
arXiv cs.AI

联合学习谓词和动作实现零样本技能组合

提出PACTS方法,联合建模动作与谓词轨迹,实现零样本技能组合。

04:00
arXiv cs.AI

Agentic Agile-V:从氛围编码到软硬件开发中的可验证工程

提出Agentic Agile-V框架,以过程控制取代提示工程,通过SCOPE-V循环将对话意图转为可验证工程制品,强调需求、约束与独立验证。

04:00
arXiv cs.AI

中文标题:基于差分测试时缩放的代码生成方法

中文摘要:提出DiffCodeGen,通过覆盖引导差异分析生成代码候选,无需测试用例或额外LLM调用,基于行为聚类选择输出,高效节省token。

04:00
arXiv cs.AI

针对音频大语言模型的抗编解码攻击

提出CodecAttack,在编解码潜在空间攻击,实现85.5%成功率,证明有损压缩无法防御对抗音频。

04:00
arXiv cs.AI

Lower Bounds for Advection-Diffusion Equations: An Exploration with AI-Generated Proofs

04:00
arXiv cs.AI

可信权重,险恶优化?LLM上的优化触发后门攻击

编译优化的数值副作用可被利用植入隐蔽后门,编译后触发攻击,成功率90%且干净准确率近100%。

04:00
arXiv cs.AI

AMAR:基于轻量级注意力的Wi-Fi CSI多用户活动识别

AMAR框架通过边缘-云拆分和注意力机制,实现多用户活动识别,准确率近翻倍,F1达53.4%,带宽大幅降低。

04:00
arXiv cs.AI

心跳约束层级凭证:面向AI智能体群的密码学撤销机制

HBHC协议通过心跳绑定凭证,实现无网络依赖的本地验证,将僵尸窗口缩短90倍,并发验证超1.8万次/秒。

04:00
arXiv cs.AI

An Application-Layer Multi-Modal Covert-Channel Reference Monitor for LLM Agent Egress

04:00
arXiv cs.AI

GenAI驱动的威胁检测:与Microsoft Security Copilot集成

动态威胁检测代理(DTDA)在Microsoft Security Copilot中持续发现隐藏攻击,生成可解释告警,精确率80.1%,F1达0.78,中位耗时28分钟。

04:00
arXiv cs.AI

DISC:通过策略生成解耦指令与状态条件控制

DISC用超网络从指令生成策略参数,解耦语言与状态,消除观察泄漏,性能超越基线并支持少样本适应。

04:00
arXiv cs.AI

跨架构视角下的调度开销诊断

实验证伪MoE调度两假设:路由不平衡固有,模拟token失真达2.35倍;五种架构形成稳定带,指导互联设计。

04:00
arXiv cs.AI

人工智能重塑微波光子学

AI全面革新微波光子学的设计、仿真、制造与维护,实现自主高效运行。

04:00
arXiv cs.AI

Deformba:具有自适应状态融合的视觉状态空间模型

Deformba通过自适应状态融合增强空间结构,保持线性复杂度,支持多模态融合,在多种视觉任务上表现优异。

04:00
arXiv cs.AI

On the Complexity of Entailment for Cumulative Propositional Dependence Logics

04:00
arXiv cs.AI

SURGE:基于事件中心的社交媒体情感时间序列基准,集成交互结构

提出SURGE基准,含67个事件80万条帖子,集成时间序列与交互结构,揭示预测挑战。

04:00
arXiv cs.AI

基于量子计算增强的强化学习过程合成

提出量子强化学习框架用于过程合成,状态编码解耦量子比特需求,中等规模下每参数效率优于经典RL。

04:00
arXiv cs.AI

RePCM:区域特异与表型自适应的双心室心脏运动合成

提出RePCM模型,通过两阶段方法实现单帧双心室运动补全,保留区域动态并适应疾病差异,显著提升几何与功能指标。

04:00
arXiv cs.AI

实现监管下的多智能体协作:架构、挑战与解决方案

提出区块链分层架构,通过行为追踪、信誉评估和恶意预测模块,实现多智能体系统的可信监管。

04:00
arXiv cs.AI

TimeRewarder: 通过逐帧时间距离从被动视频中学习密集奖励

TimeRewarder从被动视频中学习帧间时间距离作为密集奖励,极大提升稀疏奖励RL成功率与样本效率,优于手工设计。

04:00
arXiv cs.AI

JanusCoder:迈向代码智能的基础视觉-程序接口

提出大规模多模态代码数据集和统一模型,实现文本/视觉输入生成代码,性能超越商业模型。

04:00
arXiv cs.AI

轨迹扩散:多样化流匹配中的质量保持控制

提出训练自由、推理时控制机制,通过正交扰动与几何解耦引导,在保持质量前提下提升多样性。

04:00
arXiv cs.AI

比较解释不够,要解释变化:需要新标准来解释大语言模型的行为转变

现有可解释AI无法解释大语言模型行为转变,提出比较XAI新范式,要求可比较、有效、可操作、可监控。

04:00
arXiv cs.AI

MARS:面向自动化AI研究的模块化反思搜索智能体

MARS以预算感知规划、模块化构建和比较反思记忆实现自主AI研究SOTA,63%经验来自跨分支迁移。

04:00
arXiv cs.AI

多智能体强化学习中保留次优动作以跟踪动态最优

S2Q算法通过学习多个子值函数保留次优动作,结合Softmax策略持续探索,快速适应变化最优,显著提升MARL性能。

04:00
arXiv cs.AI

当AI出错时:AI辅助用药决策系统的可靠性与风险

AI辅助用药系统即使标准评估优秀,单个错误仍可能造成严重伤害,需关注失败类型与风险感知评估。

04:00
arXiv cs.AI

LIDSA:无信号自主交叉口管理的认知仲裁

提出LIDSA框架,用LLM推理车辆意图,延迟降89.1%,油耗降48.8%,优于传统方法,实现实时无信号管理。

04:00
arXiv cs.AI

AgentEscapeBench:评估LLM智能体的跨领域工具推理能力

AgentEscapeBench测试智能体在长依赖工具推理中的表现,发现深度依赖下性能显著下降。

04:00
arXiv cs.AI

MAP-Law:覆盖度驱动的多轮法律咨询检索控制

本文提出覆盖度驱动的多轮法律咨询检索控制框架,通过要素覆盖度等指标自适应决策,在合成测试中有效减少检索轮次和证据片段。

04:00
arXiv cs.AI

大模型锯齿效应激发科学创造力

研究发现大模型科学创造力呈锯齿状非均衡性,通过组合模型可提升整体表现。

04:00
arXiv cs.AI

ComplexMCP:动态、互联与大规模工具沙箱中的LLM智能体评估

ComplexMCP基准测试显示LLM智能体在复杂工具场景中成功率不足60%,存在三大瓶颈,远低于人类90%水平。

04:00
arXiv cs.AI

RankQ:通过自监督动作排序实现离线到在线强化学习

RankQ用自监督排序损失约束动作偏好,避免高估,在稀疏奖励与视觉机器人任务中性能领先,成功率最高提升42.7%。

04:00
arXiv cs.AI

弥合语言模型与金融分析

综述LLM最新进展,探索其金融数据分析潜力,为研究者提供方向。

04:00
arXiv cs.AI

开放材料2024(OMat24)无机材料数据集与模型

Meta FAIR发布OMat24开放数据集与模型,含1.1亿DFT计算,精度20meV/原子、F1>0.9,助力AI材料科学。

04:00
arXiv cs.AI

网络中的比例选择

提出两种方法,从网络中选择k个代表节点,兼顾影响力与多样性比例。

04:00
arXiv cs.AI

SMILE-UHURA挑战——基于超高分辨率7T磁共振血管造影的中尺度小血管分割

SMILE-UHURA挑战提供7T MRI小血管标注数据集,评估16种深度学习方法,Dice最高达0.838,性能可靠。

04:00
arXiv cs.AI

一个大语言模型相当于多少人类调查受访者?基于不确定性量化的视角

提出自适应模拟样本量法,量化人机偏差,使LLM数据生成可靠置信集,样本量反映其有效人类规模。

04:00
arXiv cs.AI

FineVision:开放数据即所需

FineVision构建2400万样本开放数据集,经半自动人工审核统一来源、去重去污染,显著提升视觉语言模型性能。

04:00
arXiv cs.AI

M3:对话式大语言模型简化安全临床数据的访问、理解与分析

M3系统通过对话式LLM让研究者用自然语言查询MIMIC-IV数据库,准确率达94%,支持本地部署保障隐私。

04:00
arXiv cs.AI

大型语言模型中高效排序的访问路径

提出LLM ORDER BY算子,改进排序算法并设计预算感知优化器,动态选择近优路径实现高效高质排序。

04:00
arXiv cs.AI

InteractScience:交互式科学演示代码生成的程序化与视觉基础评估

提出InteractScience基准,结合程序化与视觉测试评估LLM生成交互式科学演示代码能力,揭示其在领域知识与编码整合上的不足。

04:00
arXiv cs.AI

ATLAS:基于动态提示优化与多智能体协调的LLM智能体自适应交易

提出ATLAS框架,通过动态提示优化与多智能体协调,实现延迟反馈下的自适应交易,提升决策性能。