6005 条条目 · 106 个活跃源
2026年6月9日
04:00
ArXiv AI

RTL-BenchLS:面向大型语言模型的RTL推理与生成的大规模基准测试

提出含超万个Verilog设计的基准,设三个自监督推理任务,LLM最高仅28%,显著挑战现有基准。

04:00
ArXiv AI

Graph2Idea:基于图结构上下文的检索增强科学想法生成

Graph2Idea利用知识图谱结构化文献关系,提升研究想法的新颖性、可行性和质量。

04:00
ArXiv AI

FF-JEPA:基于潜在规划器的世界模型长程规划

FF-JEPA提出层次化方法,利用无动作潜在规划器分解长程规划为短期优化,无需目标图像,成功克服长程崩溃。

04:00
ArXiv AI

DynaOD: 基于离散到连续时间语义建模的动态起讫点流生成

提出DynaOD框架,通过离散-连续时间语义联合编码生成动态OD流,精度和分布保真度优于基线。

04:00
ArXiv AI

大语言模型中偏好学习的遗憾最小化框架

提出遗憾最小化偏好优化(RePO)框架,将偏好建模为相对次优性评估,在数学推理和人类偏好数据集上取得一致提升。

04:00
ArXiv AI

复杂约束与超越:面向RLVR的专家评分标准

提出专家评分标准作为新评估范式,验证其在指令遵循与智能体任务中可有效提升LLM表现,训练收益显著。

04:00
ArXiv AI

视觉语言模型助力视觉数据中的隐私信息脱敏

提出VisShield框架,通过专用数据集和训练使VLM精准定位并处理敏感文本,隐私保护效果优于现有方法。

04:00
ArXiv AI

MASS:记忆增强社会模拟下的社会科学深度研究

提出MASS范式,通过动态规划、多学科数据集与艾宾浩斯遗忘机制增强社会模拟,提升LLM研究创造性与实证性,整体质量提升6.81%。

04:00
ArXiv AI

面向工具增强大语言模型的能力对齐分层学习

CAHL通过RLVR联合优化分层策略,对齐规划器与执行器,提升LLM工具使用任务性能。

04:00
ArXiv AI

经验成就熟练:通过自我进化的技能记忆实现通用医疗智能体推理

SkeMex框架通过技能记忆与自进化机制,无需更新模型参数,提升医疗智能体的泛化推理和持续进化能力。

04:00
ArXiv AI

从粗到细:时空数据中的时间粒度管理用于细粒度交通预测

提出STRP框架,利用粗粒度采样数据实现高效精准的细粒度交通预测。

04:00
ArXiv AI

WeaveBench:面向混合界面计算机使用智能体的长程真实世界基准

WeaveBench提出114个任务、跨8领域的混合界面基准,最佳通过率仅41.2%,揭示仅结果评分会高估模型性能。

04:00
ArXiv AI

RunAgent SuperBrowser:一种基于人类浏览行为的自主网页导航理论

提出仿人类浏览的SuperBrowser代理,通过视觉优先和三角色脑机制,在Mind2Web Hard基准上以89.47%成功率大幅超越所有公开基线。

04:00
ArXiv AI

关键在能力,不在格式:重新审视结构化推理失败

结构化格式的代价取决于模型剩余容量,高容量模型不受影响,低容量模型性能骤降,建议先思考后格式化。

04:00
ArXiv AI

正确者更优:成对比较揭示准确性排名

成对比较生成的模型排名与准确率排名高度一致(相关>0.9),风格和评判偏见影响小,但“回声”现象影响偏好。

2026年6月8日
04:00
ArXiv AI

基于证据的大语言模型智能诊疗可视化系统:多轮交互与多模态治疗方案生成

该系统通过知识图谱增强可视化与多模态交互,提升中医辨证透明度和治疗可解释性,使诊断信任显著提高、认知负荷降低。

04:00
ArXiv AI

知识基础工具使用工作流中AI代理的声明式技能

知识库工作流中,声明式代理在高质量检索下提升准确率并减少错误,检索质量是关键瓶颈。

04:00
ArXiv AI

工作流到技能:通过路由-工作流-语义-附件分解创建技能

提出RWSA中间表示与W2S框架,从异构痕迹自动构建技能,提升行为回放一致性10.5%。

04:00
ArXiv AI

考虑上下文:塑造价值对齐的道德信念

聚合道德评价需考虑上下文因素,否则将陷入类似辛普森悖论的困境。

04:00
ArXiv AI

量子启发的轨迹增强证据选择用于结构化假设空间推理

提出EP-HUBO方法,将推理证据选择转为组合优化,保留少数正确假设,提升法律推理鲁棒性。

04:00
ArXiv AI

基础模型智能体的仿真到真实差距:一个统一的MDP视角

形式化基础模型智能体仿真到真实差距为MDP四要素问题,倡导现有方案提升可靠性。

04:00
ArXiv AI

教之以法,而非答案:多模态策略优化的特权辅导蒸馏

PTD-PO框架通过特权提示和Top-K JS散度提供无答案泄露的密集指导,提升多模态推理性能。

04:00
ArXiv AI

DuMate-深度研究:基于递归搜索与量规推理的可审计多智能体系统

提出多智能体框架,用图动态规划、递归搜索和量规推理,在深度研究基准上取得最优结果。

04:00
ArXiv AI

StainFlow:面向GUI智能体的实体痕迹追踪与证据链接过程奖励方法

StainFlow通过实体痕迹追踪与证据链接,解决GUI智能体过程奖励稀疏问题,提升RL成功率3.2%和判断准确率1.8%。

04:00
ArXiv AI

层次化语义约束异构图用于音视频事件定位

提出层次化语义约束异构图框架,通过异构图、双阈值融合和双曲空间映射,实现跨尺度音视频一致性和层级语义一致性。

04:00
ArXiv AI

有限标签下哪个解剖结构重要?用于心脏病理预测的数据高效解剖感知基准

有限标签下,解剖结构表示比模型复杂度更关键,识别最相关解剖部位更重要。

04:00
ArXiv AI

以用户参与换取可持续性:面向电子商务推荐的碳感知重排序

提出碳感知重排序,通过估计产品碳足迹权衡用户参与与可持续性,在亚马逊数据集上实现显著碳减排。

04:00
ArXiv AI

多智能体协作何时有效?一个熵的视角

从熵视角研究多智能体系统,发现单智能体在43.3%情况下更好,提出三大观察及Entropy Judger算法提升性能。

04:00
ArXiv AI

基于自进化多智能体数字孪生的自主异相催化剂发现

CatDT系统5-30分钟自主预测催化剂性能,精度与实验一致,并发现非贵金属候选物。

04:00
ArXiv AI

AI代理如何重塑知识工作:自主性、效率与范围

AI代理将单次会话自主工作时间从33秒提升至26分钟,效率提高87%,成本降低94%,并显著拓展工作范围与质量。

04:00
ArXiv AI

平面曲线的几何高斯混合表示

用高斯混合模型对平面曲线进行概率多边形表示,保留局部几何与法向不确定性。

04:00
ArXiv AI

FP8就是一切(第一部分):揭穿硬件FP64作为HPC圣杯的神话

在AI GPU上,FP8结合Ozaki方案可达全FP64精度,性能超越原生FP64,证明FP8足够用于HPC。

04:00
ArXiv AI

FP8注意力中的P值转换精度:注意力汇点导致的坍塌与S=2^8的最优性

研究发现正向KV迭代致P值下溢,反向迭代结合S=256可消除下溢,S=2^8为最优缩放因子。

04:00
ArXiv AI

基于QUBO与混合量子算法的铁路短期集中发车场景下出发序列与区段轨道分配的协同优化

基于QUBO与仿真评估的铁路短时集中发车调度优化,量子混合算法在动态场景中降低综合成本4.28%-26.26%,总延误4.37%-24.25%。

04:00
ArXiv AI

在日常人类视频上共同训练机器人操作策略的关键因素

手部姿态质量影响迁移,但运动差距需网络特化;共训练法在低数据下提升成功率29.7%。

04:00
ArXiv AI

FIGMA:迈向细粒度音乐检索

FIGMA提出多视角对比架构,联合优化全局和帧级对齐,实现细粒度音乐检索,性能提升高达73.3%。

04:00
ArXiv AI

SCOUT:基于不确定性引导遍历的语义场景覆盖

SCOUT在线语义探索框架,通过不确定性引导遍历,平衡语义增益与几何覆盖,实现机器人主动理解场景。

04:00
ArXiv AI

AxisGuide:将机器人动作坐标系锚定在RGB观测中以实现鲁棒的视觉运动操作

AxisGuide通过可视化坐标轴增强RGB观测,弥合语义与动作坐标鸿沟,显著提升视觉运动操作的鲁棒性与泛化能力。

04:00
ArXiv AI

DaX:学习跨尺度的通用病理学表征

DaX病理基础模型采用DINOv3自监督学习,通过跨尺度训练与视图,在161项临床任务基准中取得最优性能。

04:00
ArXiv AI

个性化驾驶舒适性与移动效率的换道轨迹规划

提出神经网络双头规划器,结合多项式与逻辑回归切换,实现换道个性化舒适与效率,数据不足时保可行轨迹。

04:00
ArXiv AI

深度神经网络中的泛化:梯度方法的极小极大速率

本文建立深度网络与核方法的学习动力学联系,首次得到梯度下降与随机梯度下降的极小极大最优泛化速率。

04:00
ArXiv AI

LLM Agent-Assisted Reverse Engineering with Quantitative Readability Metrics

04:00
ArXiv AI

像飞行员一样思考:细粒度长时域无人机导航

提出细粒度长时域基准FLIGHT和异步架构FLIGHT VLA,实现无人机长指令导航与实时控制,性能优于基线。

04:00
ArXiv AI

面向复杂逻辑约束下长程任务规划的神经符号学习

提出双层优化与3R策略解决暴露偏差,故障率降80%,规划时间降57%。

04:00
ArXiv AI

SpectCount:通过合成信号进行频谱时间计数提升大型音频语言模型

提出SpectCount,用合成信号微调解决大语言模型时频谱感知弱点,提升多领域听觉性能。

04:00
ArXiv AI

危险环境中可解释自主性的抽象架构

提出支持自主系统解释行为的抽象架构,为可解释自主系统提供设计模板,以核工业为例增强用户信任。

04:00
ArXiv AI

三环架构:平台组织时代中的智能体治理

三环架构以确定性环2联邦层管控非确定性LLM智能体风险,是平台组织AI治理与合规的必要基础设施。

04:00
ArXiv AI

迈向统一歌曲生成与伴奏协同生成的歌声转换

提出UniSinger,首个统一说话人克隆歌曲生成与伴奏协同歌声转换框架,实现跨任务音色控制与最优性能。

04:00
ArXiv AI

MetaConfigurator:基于JSON数据的AI辅助RDF创作

该工具通过AI辅助RML映射,将JSON等结构化数据转换为RDF,支持查询、可视化和导出,降低语义技术门槛。

04:00
ArXiv AI

人类与DeepSeek-R1大语言模型数学推理的全面剖析

对比人类与DeepSeek-R1推理,模型表面模仿但存真实推理信号,反思需结合演绎。