AI透明度:治理合规还是利益相关者需求?
AI透明度合规普遍,但未校准高风险低控制群体需求,形成“透明度幻觉”。
医生专业知识能否改善机器学习对谵妄的识别?
提出医生参与的交互式机器学习谵妄检测框架,优于基线,鲁棒性强,解释有临床意义。
中文标题:通过价值敏感的对话式AI提高低识字率人群的问卷参与度
中文摘要:价值敏感对话AI显著提升低识字率女性问卷完成率,文化对齐设计效果最佳。
Estimating the Effect of Timing on Coupon Effectiveness
AI赋能手术室质量保障
利用AI分析手术视频,实现术中质量持续评估与改进,提升手术安全与效果。
ELEVATE:面向可扩展与包容性教育的人本GenAI虚拟导师设计
提出ELEVATE框架,集成本地LLM与3D虚拟形象,实现隐私保护、低成本、多模态交互的包容性虚拟导师。
本地信息素网络:具有多尺度突触痕迹、巩固和回放的稀疏局部学习
本文提出一种稀疏局部学习网络,通过信息素加权更新、自适应预算和巩固回放机制,减少任务冲突与遗忘。
分子扩散模型的无监督热力学:作用-算子语义与可审计自由能读取
提出作用-算子框架使分子扩散模型无监督读取自由能差异,实验误差约1 k_BT。
观点:视觉-语言-动作模型无法被验证执行物理推理
当前评估指标无法区分语义映射与物理推理,性能提升可能源于语义匹配而非真正物理泛化,需设计对照实验验证。
ALM2Vec:基于大型音频语言模型学习通用音频检索的音频嵌入
ALM2Vec利用大型音频语言模型学习统一音频嵌入,实现指令感知与可控检索,在标准基准上表现优异。
规范驱动开发中的引用纪律:LLM生成代码输出确定性与自动幻觉检测的跨模型实证研究
引用注释降低输出确定性但实现自动幻觉检测,该权衡跨模型一致。
人类反馈如何塑造AI生成的社区笔记
分析19万+条反馈,发现事实修正建议最有效,人类反馈提升笔记质量,但协作笔记仍以补充角色为主。
曲率引导模块定位用于后门大语言模型的低秩解毒
提出曲率引导模块定位与低秩修复,抑制后门触发行为,保持正常性能,后门移除是局部结构修复。
压缩表示空间中的运动规划
在压缩自编码器的分层离散潜在空间搜索,实现灵活高效的运动规划,无需任务特定训练。
从计算机系统视角理解与评估类爪代理安全
类比系统构建安全基准,揭示类爪代理70%攻击成功率,现有防御不足。
Loc2Repair:评估文件级问题定位在仓库级LLM修复中影响的框架
Loc2Repair证明文件级定位可提升修复率(44.7%至52.4%)并降低平均耗时。
安全性与保真度的权衡:提示注入防御的隐性代价
防御LLM提示注入存在安全-保真权衡:抑制注入会损害必须保留文本的任务,无模型能同时兼顾,安全性仅衡量一半鲁棒性。
AI生成的PowerShell恶意软件:一个实验框架与数据集
提出评估LLM生成PowerShell恶意软件的框架、沙箱和数据集,发现真实与生成恶意软件事件相似度中位数84.5%,48.4%完全重叠。
面向室内环境的模块化视觉-语言-动作机器人框架
提出模块化架构,结合实时语义地图与VLM指令分类,实现自主导航与任务执行。
超越"若非"检验:通过实际因果性实现抽象论证中的反事实解释(扩展版)
提出基于干预的反事实推理框架,超越"若非"检验,准确识别预占与超定等因果结构,提升表达性与可靠性。
MIRTH:面向视觉-语言-动作智能体的基于时间枢纽的互信息推理
提出MIRTH框架,通过双尺度时间记忆、互信息推理和并行解码,解决VLA模型的短视与低效,实现SOTA性能与错误恢复。
SwiftAudio:面向一步式文本到音频扩散生成的数据高效仅文本描述蒸馏
SwiftAudio提出仅用文本描述的无音频蒸馏框架,引入时间平滑正则化,45K描述即达最先进一步式文本到音频生成性能。
GenMatter:用生成物质模型感知物理对象
提出分层分组运动与外观特征的生成模型,经硬件加速推理,统一处理随机点、纹理和自然视频,实现类人运动感知。
带具体域的描述逻辑中约束自动机的鲁棒性
提出约束自动机方法,非空性问题属EXPTIME,本体一致性达此上界,扩展功能仍保持,彰显鲁棒性。
HiMu:面向长视频问答的分层多模态帧选择
HiMu无需训练,分层分解查询并融合多模态专家信号,16帧预算下准确率最高,等效均匀采样4倍帧数。
IWP:大型视觉语言模型中标记剪枝作为隐式权重剪枝
提出基于注意力对偶形式的无训练标记剪枝,度量标记信息量与重复性,渐进分块选择最优子集,实现性能效率更好权衡。
从分散到吸引:Whisper模型规模中幻觉的频谱动力学
提出频谱敏感性定理,预言网络从分散到吸引子相变;Whisper模型实验显示结构解体或压缩吸引子导致幻觉。
大语言模型能否推理注意力?多模态课堂行为的零样本分析
提出隐私保护课堂注意力分析流水线,用LLM零样本分析学生行为,但空间推理能力不足。
关于在线策略蒸馏的位置偏差
在线策略蒸馏存在位置偏差,后面token监督质量差;提出重要性加权方法,提升学习效率和性能。
不确定性感知的奖励折扣方法以缓解奖励欺骗
提出UARD框架,融合认知与偶然不确定性动态调节奖励权重,减少奖励黑客93.6%且保证收敛。
一个基于生物医学工具宇宙的治疗推理AI智能体
ATHENA-R1通过强化学习在212个工具上训练,治疗推理准确率94.7%,超GPT-5,获专家青睐。
IMCBench:面向图像引导医学对话的多模态大语言模型基准
IMCBench评估多模态模型在图像医学对话中的安全、准确与不确定性,揭示准确描述不确保安全,需多维评估。
COMPASS:在统一多模态模型中实现构成意图引导的落地
提出统一多模态框架COMPASS,以共享专家token实现构成感知与生成控制,大幅提升构成理解与生成一致性。
BV-Blend:面向稳定无评论家强化学习(带可验证奖励)的不确定性加权历史基线
BV-Blend融合即时与历史奖励统计,稳定无评论家强化学习,提升可验证推理训练稳定性。
基于基础迭代语言规划:参数化世界模型如何减少LLM代理中的幻觉传播
GILP结合参数化模型与LLM推理,幻觉率从0.176降至0.035,成功率从0.668升至0.838。
MER-R1:通过慢速-快速思维协同的多模态情感推理
MER-R1提出快慢思维互补的强化学习框架,联合优化召回与精度,使推理真正提升情感识别性能。
迈向可靠且鲁棒的大语言模型规划:符号反馈驱动的迭代自优化框架
提出符号反馈驱动的迭代自优化框架,通过符号验证与规划识别,提升大语言模型长程规划的可行性与正确性。
ToE:一种基于动态多源证据检索与聚合的分层可解释声明验证框架
提出ToE分层可解释事实核查框架,融合强化学习检索与论证树聚合,有效对抗生成引擎优化毒化,性能提升4-24%。
图世界模型中的展开误差探究
提出统一框架分析图世界模型展开误差,引入Error-Aware模型防止长程发散,提升动态图规划性能。
智能体原生免疫系统:架构、分类与工程
提出首个类生物内生防御架构ANIS,包含六层免疫塔、智能体病毒/疫苗分类、自我监控三联体及持续免疫学习,区分模型对齐与动态免疫。
提升式因果推断
提出参数化因果因子图与提升因果推断算法,利用提升推理高效计算关系域中的因果效应,并扩展至部分因果知识模型。
本体引导的多跳知识图谱问答证据路径推理
提出OPI框架,利用本体引导双向检索与迭代精炼,压缩搜索空间并提升多跳KGQA准确率。
京东氧AI商品中心 (Oxygen AIIC) V1:以LLM/VLM为核心的工业级商品理解、管理与应用解决方案
京东Oxygen AIIC基于LLM/VLM实现十亿级SKU知识生产,搜索覆盖80.4%,质量问题降37%,属性填充超80%。
可验证奖励的串联强化学习
TRL通过强弱模型交替协作推理,在保持推理能力的同时提升模型间兼容性与人类可读性。
使用CNN和ResNet架构的MRI图像脑肿瘤自动检测
基于CNN和ResNet的自动脑肿瘤检测,ResNet18准确率97%,优于ResNet50,支持早期诊断。
CalBrief:面向大语言模型证据校准科学简报的初步诊断基准
提出CalBrief基准评估LLM证据校准能力,发现明确强度校准策略过保守,建议分开评估标签级判断与证据组织能力。
面向编码大语言模型中隐式软件世界模型的评估
本文通过预测执行资源,评估编码LLM的隐式软件世界模型,发现模型表现脆弱,缺乏对软件执行的理解。
使用可解释量子自编码器的压缩驱动脑MRI异常检测
量子自编码器通过压缩驱动实现脑MRI异常检测,ROC-AUC达0.95,优于经典基线,且参数不对称性提供可解释机制。
SidConArena:一个在开放式正和谈判博弈中评估智能体的环境
提出SidConArena基准,通过多阶段博弈评估LLM智能体,发现强模型经济成果高,但存在资源误估、谈判被动及长期规划不足。
推测性精炼:混合自回归扩散解码策略及其基准表现
混合解码揭示代码基准结构错误、精炼张力及评估排名差异等关键发现。