5979 条条目 · 106 个活跃源
2026年6月24日
04:00
ArXiv AI

Themis:一个基于可解释AI的强化学习人类反馈框架

结合可解释AI与人类反馈,Themis框架支持超200环境,训练奖励模型,并提供云平台支持千人规模实验。

04:00
ArXiv AI

当能力问题出错:使用本体工程助手进行能力问题验证的挑战

能力问题验证因歧义和复杂性而困难,LLM辅助实验表明需工具提前优化CQ。

04:00
ArXiv AI

LaGO:面向在线强化学习的潜在动作引导

提出LaGO框架,用LLM潜在先验软引导在线强化学习,显著提升成功率。

04:00
ArXiv AI

SAFARI: 通过主动调查扩展长程智能体故障归因

SAFARI框架以工具增强诊断循环和短期记忆,突破上下文窗口限制,显著提升长程智能体故障归因精度。

04:00
ArXiv AI

CineCap: 基于时空锚点的结构化推理用于电影级视频描述生成

提出CineCap框架,结合时空锚点结构化推理与强化学习,实现电影级视频描述生成,构建基准并达到新SOTA。

04:00
ArXiv AI

Cost-Optimal Decision Diagrams for Stochastic Boolean Function Evaluation

04:00
ArXiv AI

基于BlockTrain的去中心化AI训练与推理

BlockTrain分块训练模型,性能接近集中式,支持大规模去中心化推理。

04:00
ArXiv AI

制造差异而不造成差异

证明其最新定义兼具三种类型,分类无实质差异,进而推翻全部七个定义。

04:00
ArXiv AI

中文标题:面向域泛化的人类活动识别分布漂移评估

中文摘要:系统评估了四种分布漂移(设备、传感器位置、采样率、用户行为),发现多样性漂移主导,引入统一基准评估28种域泛化方法,揭示当前算法局限性。

04:00
ArXiv AI

Grading the Grader: Lessons from Evaluating an Agentic Data Analysis System

04:00
ArXiv AI

中文标题:任务与目标匹配:面向编码器-解码器预训练语言模型的微调和提示调优策略

中文摘要:提出MTO框架,通过匹配任务目标,在少样本设置下性能提升超120%,并扩展到提示调优,有效指导模型选择优化。

04:00
ArXiv AI

碎片化的世界模型:通用智能体的结构性认证

证明通用智能体非全能,提出结构性认证框架,给出误差界,实现可靠部署。

04:00
ArXiv AI

超越自回归边界:扩散模型、世界模型与状态空间模型在代码领域的综合综述

综述扩散模型、世界模型与状态空间模型,克服自回归局限,探索系统2代码生成。

04:00
ArXiv AI

分布偏移下用于水声调制识别的异构2D/1D信号表示融合

提出新基准与层次融合方法,在分布偏移下显著提升水声调制识别性能。

04:00
ArXiv AI

SemChunk-C: C代码的语义分割

针对C语言代码语义分割难题,提出SemChunk-C轻量模型,实现高精度分块与分类,提升下游任务性能。

04:00
ArXiv AI

FP8就够了(第二部分):通过张量核的Garner重构和Kulisch逃逸路径实现高效的Ozaki-Bailey型FFT

利用FP8张量核和Kulisch定点算术,实现全FP64精度3D FFT,在B300上接近内存带宽极限。

04:00
ArXiv AI

工程化可靠自主系统:挑战与解决方案

探讨自主系统可靠性工程挑战与解决方案,涵盖验证、工程实践和软件架构,提出未来研究路线图。

04:00
ArXiv AI

VeriPilot:一种基于LLM的Verilog调试框架

VeriPilot利用LLM和黄金模型,通过内部变量语义及CDFG分析,将Verilog调试成功率从54.3%提升至85.71%。

04:00
ArXiv AI

双分支脉冲神经网络神经形态语音增强

GSU-DBNet双分支脉冲神经网络,门控单元同时建模幅度和复数谱,394K参数达PESQ 3.04,优于现有SNN。

04:00
ArXiv AI

通过先进空中机动走廊实现自主交通的分散协调

自主飞机在分散设置中自组织成走廊流,遵守边界率超94%,低中密度下战术干预少,高密度时增加。

04:00
ArXiv AI

认证随机预言机可靠性的令牌复杂度

定义认证令牌复杂度,给出匹配上下界,刻画小误差下的最优期望成本。

04:00
ArXiv AI

E-MRL:跨视图对齐的证据驱动多模态强化学习用于可靠的3D肿瘤分析

提出E-MRL框架,通过诊断-定位-验证流程和跨视图一致性奖励,减少幻觉,提升3D肿瘤分析的准确性与可解释性。

04:00
ArXiv AI

Maestro Order:一种模型无关的编排框架

Maestro Order通过验证、分解、集成与递归原语及预算控制器,将不可靠模型转为高可靠系统,验证使可靠性从0.55几何级跃升至0.999。

04:00
ArXiv AI

PixJail:面向文本到图像越狱评估的自我进化论文到流水线复现

PixJail框架自动复现论文实验,平均误差仅2.1%,并支持经验复用。

04:00
ArXiv AI

DynaWM:基于世界模型和动量目标的动力学感知蒸馏方法,用于连续楼梯上的平滑运动

提出DynaWM框架,引入世界模型与动量目标编码器,增强地形编码与蒸馏稳定性,实现双轮腿机器人连续楼梯平滑运动。

04:00
ArXiv AI

DTT-BSR+:一种用于音乐源恢复的生成-回归级联方法

提出两阶段级联系统,分离分布拟合与信号重建,提升多音轨信噪比并超越现有系统,揭示重建精度与语义分布间的权衡。

04:00
ArXiv AI

基于神经网络的参数化模型降阶预测不同车辆外形湍流

引入变分自编码器扩展神经网络降阶模型,评估高雷诺数多几何车辆湍流中车尾涡旋的时空重构精度。

04:00
ArXiv AI

Female-RHINO:一种用于自动化定量子宫MRI分析和结构化报告的实时扫描仪集成框架

提出Female-RHINO框架,实时集成扫描仪与AI,自动定量子宫MRI分析并生成结构化报告,处理时间<70秒,多中心验证性能稳健。

04:00
ArXiv AI

ZONOS2 技术报告

全新8B参数MoE架构TTS模型,6M小时训练数据,自然度与语音克隆保真度领先,开源发布。

04:00
ArXiv AI

检测开源中的AI编码代理:对1.8亿个仓库进行经过验证的多方法普查

多方法检测1.8亿开源仓库,单一方法漏检严重(仅3.3%),不同渠道捕获的AI代理群体不重叠,单信号估计偏差大。

04:00
ArXiv AI

平均排名掩盖了每名受试者的最优性:基于Friedman-Nemenyi检验的脑电运动想象BCI解码器基准测试

本文发现无单一解码流程普遍最优,最佳方法族表现相似,个性化选择可提升约7%准确率。

04:00
ArXiv AI

复杂问题:AI驱动的AAC界面设计与评估

AI增强AAC,但评估难在复杂用户需求,建议采用交叉性稳健评估方法。

04:00
ArXiv AI

超越U-Net:面向流匹配语音增强的潜在表示对齐无跳跃连接骨干网络

提出无跳跃连接骨干,通过编码器潜在对齐引导,避免噪声传递,仅5步推理提升语音增强质量。

04:00
ArXiv AI

通过结构化概念进化实现大型语言模型发现量子LDPC码

大型语言模型结合结构化概念进化,发现多种有竞争力的量子LDPC码族。

04:00
ArXiv AI

DeepBD:一种用于遗传性出生缺陷变异优先级排序和诊断的基于实证的智能体工作流

DeepBD提出一种基于智能体的遗传出生缺陷变异评级与诊断工作流,整合多重证据,在1.8万例队列中Recall@1达0.658,优于现有方法。

2026年6月23日
04:00
ArXiv AI

路径依赖的程序归纳在资源约束下解释人类序列学习

人类在资源约束下通过路径依赖的程序归纳构建抽象知识,分层适应语法(HAG)模型优于固定语法和浅层分块方法。

04:00
ArXiv AI

在LLM推理中,价值错位之上还存在非理性

LLM对齐后推理仍存在理性价值风险,源于有限候选、提示和验证器,广泛存在且对推理策略敏感。

04:00
ArXiv AI

AlphaMemo:用于自我进化选股因子挖掘智能体的结构化搜索过程记忆

AlphaMemo通过结构化搜索过程记忆记录可复用模式,结合置信门控和否决控制,提升因子挖掘性能。

04:00
ArXiv AI

SkillHarness:为计算机使用代理驾驭安全技能

SkillHarness框架通过安全约束与选择性技能复用,降低不安全率57.1%,提升动态环境下的执行稳定性。

04:00
ArXiv AI

利用代理技能:技能中介型LLM代理的架构模式与参考架构

提出十个架构模式与四层参考架构,管理LLM代理技能从工件到使用的转换、约束及证据捕获。

04:00
ArXiv AI

RIZZ:路由交互至近零干扰区域以实现黑盒智能体的持续适应

RIZZ通过动态分支记忆与验证器门控,在有限上下文预算下实现黑盒Agent的持续在线适应,有效控制干扰。

04:00
ArXiv AI

假设约束的多智能体自动化形式化渐近统计理论

基于假设约束审计的多智能体协作,实现渐近统计理论公理干净、源忠实的Lean形式化。

04:00
ArXiv AI

从认知到行动:评估LLM智能体的自我意识能力基准

提出KAPRO框架评估LLM智能体自我意识,发现其与任务成功正相关,但开源模型易过度依赖工具,专有模型更可靠。

04:00
ArXiv AI

DrugBench: 评估用于减轻药物危害的AI控制协议

提出DrugBench基准,含3671个医疗对话与FDA标签数据,评估四类药物危害的AI控制协议,并引入基于严重性的监测。

04:00
ArXiv AI

Study on Quantitative Dynamic Epistemic Logic for Belief Revision

04:00
ArXiv AI

人工智能作为一元论:本体论、组织与方法论启示

AI应被视为不可分割的单一本质,而非组件集合,这要求组织以问题为中心、打破部门壁垒,实现真正敏捷。

04:00
ArXiv AI

Escape from Delusional Echo Trap: Symmetry Breaking, Stochastic Dynamics and Mathematical Mitigation Strategies for Algorithmic Sycophancy

04:00
ArXiv AI

FairTutor:预算约束下AI辅导的公平感知教学路由

通过多智能体编排,FairTutor以71.6%的成本节省实现97.1%的高质量教学,缩小AI辅导中的教育不平等。

04:00
ArXiv AI

模拟用户永不流失:基于真实购买结果衡量LLM用户模拟器的决策保真度

模拟用户存在“脱离赤字”:高估非购买者参与度,低估流失风险,导致销售评估失真。

04:00
ArXiv AI

使用部分祖先图进行含潜在混杂因素的根因分析

提出PAG-RCA框架,利用部分祖先图处理潜在混杂,结合因果识别与部分标识,在数据稀缺和隐变量场景下实现鲁棒根因分析。