5425 条条目 · 106 个活跃源
2026年7月1日
04:00
arXiv cs.AI

AI透明度:治理合规还是利益相关者需求?

AI透明度合规普遍,但未校准高风险低控制群体需求,形成“透明度幻觉”。

04:00
arXiv cs.AI

医生专业知识能否改善机器学习对谵妄的识别?

提出医生参与的交互式机器学习谵妄检测框架,优于基线,鲁棒性强,解释有临床意义。

04:00
arXiv cs.AI

中文标题:通过价值敏感的对话式AI提高低识字率人群的问卷参与度

中文摘要:价值敏感对话AI显著提升低识字率女性问卷完成率,文化对齐设计效果最佳。

04:00
arXiv cs.AI

Estimating the Effect of Timing on Coupon Effectiveness

04:00
arXiv cs.AI

AI赋能手术室质量保障

利用AI分析手术视频,实现术中质量持续评估与改进,提升手术安全与效果。

04:00
arXiv cs.AI

ELEVATE:面向可扩展与包容性教育的人本GenAI虚拟导师设计

提出ELEVATE框架,集成本地LLM与3D虚拟形象,实现隐私保护、低成本、多模态交互的包容性虚拟导师。

04:00
arXiv cs.AI

本地信息素网络:具有多尺度突触痕迹、巩固和回放的稀疏局部学习

本文提出一种稀疏局部学习网络,通过信息素加权更新、自适应预算和巩固回放机制,减少任务冲突与遗忘。

04:00
arXiv cs.AI

分子扩散模型的无监督热力学:作用-算子语义与可审计自由能读取

提出作用-算子框架使分子扩散模型无监督读取自由能差异,实验误差约1 k_BT。

04:00
arXiv cs.AI

观点:视觉-语言-动作模型无法被验证执行物理推理

当前评估指标无法区分语义映射与物理推理,性能提升可能源于语义匹配而非真正物理泛化,需设计对照实验验证。

04:00
arXiv cs.AI

ALM2Vec:基于大型音频语言模型学习通用音频检索的音频嵌入

ALM2Vec利用大型音频语言模型学习统一音频嵌入,实现指令感知与可控检索,在标准基准上表现优异。

04:00
arXiv cs.AI

规范驱动开发中的引用纪律:LLM生成代码输出确定性与自动幻觉检测的跨模型实证研究

引用注释降低输出确定性但实现自动幻觉检测,该权衡跨模型一致。

04:00
arXiv cs.AI

人类反馈如何塑造AI生成的社区笔记

分析19万+条反馈,发现事实修正建议最有效,人类反馈提升笔记质量,但协作笔记仍以补充角色为主。

04:00
arXiv cs.AI

曲率引导模块定位用于后门大语言模型的低秩解毒

提出曲率引导模块定位与低秩修复,抑制后门触发行为,保持正常性能,后门移除是局部结构修复。

04:00
arXiv cs.AI

压缩表示空间中的运动规划

在压缩自编码器的分层离散潜在空间搜索,实现灵活高效的运动规划,无需任务特定训练。

04:00
arXiv cs.AI

从计算机系统视角理解与评估类爪代理安全

类比系统构建安全基准,揭示类爪代理70%攻击成功率,现有防御不足。

04:00
arXiv cs.AI

Loc2Repair:评估文件级问题定位在仓库级LLM修复中影响的框架

Loc2Repair证明文件级定位可提升修复率(44.7%至52.4%)并降低平均耗时。

04:00
arXiv cs.AI

安全性与保真度的权衡:提示注入防御的隐性代价

防御LLM提示注入存在安全-保真权衡:抑制注入会损害必须保留文本的任务,无模型能同时兼顾,安全性仅衡量一半鲁棒性。

04:00
arXiv cs.AI

AI生成的PowerShell恶意软件:一个实验框架与数据集

提出评估LLM生成PowerShell恶意软件的框架、沙箱和数据集,发现真实与生成恶意软件事件相似度中位数84.5%,48.4%完全重叠。

04:00
arXiv cs.AI

面向室内环境的模块化视觉-语言-动作机器人框架

提出模块化架构,结合实时语义地图与VLM指令分类,实现自主导航与任务执行。

04:00
arXiv cs.AI

超越"若非"检验:通过实际因果性实现抽象论证中的反事实解释(扩展版)

提出基于干预的反事实推理框架,超越"若非"检验,准确识别预占与超定等因果结构,提升表达性与可靠性。

04:00
arXiv cs.AI

MIRTH:面向视觉-语言-动作智能体的基于时间枢纽的互信息推理

提出MIRTH框架,通过双尺度时间记忆、互信息推理和并行解码,解决VLA模型的短视与低效,实现SOTA性能与错误恢复。

04:00
arXiv cs.AI

SwiftAudio:面向一步式文本到音频扩散生成的数据高效仅文本描述蒸馏

SwiftAudio提出仅用文本描述的无音频蒸馏框架,引入时间平滑正则化,45K描述即达最先进一步式文本到音频生成性能。

2026年6月30日
04:00
arXiv cs.AI

GenMatter:用生成物质模型感知物理对象

提出分层分组运动与外观特征的生成模型,经硬件加速推理,统一处理随机点、纹理和自然视频,实现类人运动感知。

04:00
arXiv cs.AI

带具体域的描述逻辑中约束自动机的鲁棒性

提出约束自动机方法,非空性问题属EXPTIME,本体一致性达此上界,扩展功能仍保持,彰显鲁棒性。

04:00
arXiv cs.AI

HiMu:面向长视频问答的分层多模态帧选择

HiMu无需训练,分层分解查询并融合多模态专家信号,16帧预算下准确率最高,等效均匀采样4倍帧数。

04:00
arXiv cs.AI

IWP:大型视觉语言模型中标记剪枝作为隐式权重剪枝

提出基于注意力对偶形式的无训练标记剪枝,度量标记信息量与重复性,渐进分块选择最优子集,实现性能效率更好权衡。

04:00
arXiv cs.AI

从分散到吸引:Whisper模型规模中幻觉的频谱动力学

提出频谱敏感性定理,预言网络从分散到吸引子相变;Whisper模型实验显示结构解体或压缩吸引子导致幻觉。

04:00
arXiv cs.AI

大语言模型能否推理注意力?多模态课堂行为的零样本分析

提出隐私保护课堂注意力分析流水线,用LLM零样本分析学生行为,但空间推理能力不足。

04:00
arXiv cs.AI

关于在线策略蒸馏的位置偏差

在线策略蒸馏存在位置偏差,后面token监督质量差;提出重要性加权方法,提升学习效率和性能。

04:00
arXiv cs.AI

不确定性感知的奖励折扣方法以缓解奖励欺骗

提出UARD框架,融合认知与偶然不确定性动态调节奖励权重,减少奖励黑客93.6%且保证收敛。

04:00
arXiv cs.AI

一个基于生物医学工具宇宙的治疗推理AI智能体

ATHENA-R1通过强化学习在212个工具上训练,治疗推理准确率94.7%,超GPT-5,获专家青睐。

04:00
arXiv cs.AI

IMCBench:面向图像引导医学对话的多模态大语言模型基准

IMCBench评估多模态模型在图像医学对话中的安全、准确与不确定性,揭示准确描述不确保安全,需多维评估。

04:00
arXiv cs.AI

COMPASS:在统一多模态模型中实现构成意图引导的落地

提出统一多模态框架COMPASS,以共享专家token实现构成感知与生成控制,大幅提升构成理解与生成一致性。

04:00
arXiv cs.AI

BV-Blend:面向稳定无评论家强化学习(带可验证奖励)的不确定性加权历史基线

BV-Blend融合即时与历史奖励统计,稳定无评论家强化学习,提升可验证推理训练稳定性。

2026年6月29日
04:00
arXiv cs.AI

基于基础迭代语言规划:参数化世界模型如何减少LLM代理中的幻觉传播

GILP结合参数化模型与LLM推理,幻觉率从0.176降至0.035,成功率从0.668升至0.838。

04:00
arXiv cs.AI

MER-R1:通过慢速-快速思维协同的多模态情感推理

MER-R1提出快慢思维互补的强化学习框架,联合优化召回与精度,使推理真正提升情感识别性能。

04:00
arXiv cs.AI

迈向可靠且鲁棒的大语言模型规划:符号反馈驱动的迭代自优化框架

提出符号反馈驱动的迭代自优化框架,通过符号验证与规划识别,提升大语言模型长程规划的可行性与正确性。

04:00
arXiv cs.AI

ToE:一种基于动态多源证据检索与聚合的分层可解释声明验证框架

提出ToE分层可解释事实核查框架,融合强化学习检索与论证树聚合,有效对抗生成引擎优化毒化,性能提升4-24%。

04:00
arXiv cs.AI

图世界模型中的展开误差探究

提出统一框架分析图世界模型展开误差,引入Error-Aware模型防止长程发散,提升动态图规划性能。

04:00
arXiv cs.AI

智能体原生免疫系统:架构、分类与工程

提出首个类生物内生防御架构ANIS,包含六层免疫塔、智能体病毒/疫苗分类、自我监控三联体及持续免疫学习,区分模型对齐与动态免疫。

04:00
arXiv cs.AI

提升式因果推断

提出参数化因果因子图与提升因果推断算法,利用提升推理高效计算关系域中的因果效应,并扩展至部分因果知识模型。

04:00
arXiv cs.AI

本体引导的多跳知识图谱问答证据路径推理

提出OPI框架,利用本体引导双向检索与迭代精炼,压缩搜索空间并提升多跳KGQA准确率。

04:00
arXiv cs.AI

京东氧AI商品中心 (Oxygen AIIC) V1:以LLM/VLM为核心的工业级商品理解、管理与应用解决方案

京东Oxygen AIIC基于LLM/VLM实现十亿级SKU知识生产,搜索覆盖80.4%,质量问题降37%,属性填充超80%。

04:00
arXiv cs.AI

可验证奖励的串联强化学习

TRL通过强弱模型交替协作推理,在保持推理能力的同时提升模型间兼容性与人类可读性。

04:00
arXiv cs.AI

使用CNN和ResNet架构的MRI图像脑肿瘤自动检测

基于CNN和ResNet的自动脑肿瘤检测,ResNet18准确率97%,优于ResNet50,支持早期诊断。

04:00
arXiv cs.AI

CalBrief:面向大语言模型证据校准科学简报的初步诊断基准

提出CalBrief基准评估LLM证据校准能力,发现明确强度校准策略过保守,建议分开评估标签级判断与证据组织能力。

04:00
arXiv cs.AI

面向编码大语言模型中隐式软件世界模型的评估

本文通过预测执行资源,评估编码LLM的隐式软件世界模型,发现模型表现脆弱,缺乏对软件执行的理解。

04:00
arXiv cs.AI

使用可解释量子自编码器的压缩驱动脑MRI异常检测

量子自编码器通过压缩驱动实现脑MRI异常检测,ROC-AUC达0.95,优于经典基线,且参数不对称性提供可解释机制。

04:00
arXiv cs.AI

SidConArena:一个在开放式正和谈判博弈中评估智能体的环境

提出SidConArena基准,通过多阶段博弈评估LLM智能体,发现强模型经济成果高,但存在资源误估、谈判被动及长期规划不足。

04:00
arXiv cs.AI

推测性精炼:混合自回归扩散解码策略及其基准表现

混合解码揭示代码基准结构错误、精炼张力及评估排名差异等关键发现。