5397 条条目 · 106 个活跃源
2026年7月14日
04:00
arXiv cs.AI

大型语言模型是否已准备好进行科学发现?面向AI科学家能力导向的基准测试

SDABench评估LLMs科学分析能力:描述性分析表现好,但假设选择、因果推理等任务下降明显。

04:00
arXiv cs.AI

NextFund:代理型投资组合管理的统一性能跟踪平台

NextFund平台实时观察金融代理行为,通过交互式竞技场提升投资组合管理评估的透明度和公平性。

04:00
arXiv cs.AI

PREF-Gate:面向图欺诈检测的受来源约束的关系证据融合与验证门控选择

PREF-Gate通过验证门控选择标签证据,在欺诈检测中实现条件有效性与可审计决策。

04:00
arXiv cs.AI

当谈论LLM规划时我们在谈论什么:两种不同规划能力的证据

LLM规划表现差异源于两种独立能力:操作推理(局部动作评估)与结构枚举(目标可达性),后者对模型规模不敏感。

04:00
arXiv cs.AI

先编译,再分页:面向程序化LLM智能体的可执行SOP程序与能力门控运行时

编译SOP为可执行伪代码,能力门控分页,强模型性能提升,弱模型需先检查状态纪律

04:00
arXiv cs.AI

让规则归纳回归流体智力研究?ARC-AGI基准在人类中的初步验证

ARC-AGI基准在人类中首次验证,心理测量特性良好,与流体智力高度相关(ρ=0.63),初步支持其作为人类流体智力测量工具。

04:00
arXiv cs.AI

高效测试时优化的多智能体证明自动形式化

ToMap多智能体框架通过测试时优化聚焦分解器,使证明自动形式化性能提升19%,成本更低。

04:00
arXiv cs.AI

验证器引导的十二音作曲:用于符号音乐生成的生成-验证-修复框架

提出神经符号框架,通过生成-验证-修复循环提升十二音作曲局部一致性,交付率从13.3%升至48.1%,专家偏好显著。

04:00
arXiv cs.AI

AutoVSR:从电路原理图自动进行视觉到符号推理以生成符号表达式

AutoVSR利用视觉语言模型与符号求解器,自动化生成电路符号表达式,准确率提升30-59%以上。

04:00
arXiv cs.AI

从神经网络决策到训练案例:基于案例决策理论的精确解释

提出通过OLS分解将神经网络决策精确映射到训练案例加权支持,实现高效案例级审计。

04:00
arXiv cs.AI

OpsMem:带跨记忆共振的双记忆推理用于故障诊断

OpsMem双记忆框架协调诊断状态与操作经验,提升故障诊断Match和Relevant最高46.88%和18.39%。

04:00
arXiv cs.AI

多模态关注的潮起潮落:为基于证据的VLM推理调度视觉中继窗口

揭示VLM关注三阶段重分布,提出TRACE框架调度视觉中继窗口,增强证据推理,平均提升4.33点。

04:00
arXiv cs.AI

瓶颈思考:用于严谨归纳的沙漏推理

提出沙漏推理,通过阶段隔离和符号压缩传递,显著提升大模型少样本归纳推理准确率。

04:00
arXiv cs.AI

拉马努金AI挑战

提供数学常数公式集评估AI数学技能,含已知证明(暂加密)与未证明公式,考验AI创新能力。

04:00
arXiv cs.AI

V型梁热传感器的数据驱动正向与逆向建模

提出两阶段数据驱动框架:神经网络正向模型与梯度下降逆向优化,实现目标位移、最小体积与应力,预测MAPE 4.76%。

04:00
arXiv cs.AI

具身视觉与语言导航的综合综述及系统性真实世界评估

综述VLN方法,分类动作与模型范式,真实场景评估显示模拟与真实性能差距大,强调鲁棒性挑战。

04:00
arXiv cs.AI

CSI的通用语言:统一跨设备与环境的无线感知

提出将CSI视为结构化语言的基础模型框架,统一异构信号,实现跨系统感知,性能优于基线且泛化能力强。

04:00
arXiv cs.AI

物理信息驱动结构锚定与捕获感知原型校准的跨环境射频指纹识别

提出PISA-CAPC方法,结合物理信息与无标签校准,跨环境RF指纹识别Macro-F1达0.9257。

04:00
arXiv cs.AI

通过VLAC-CUT引导的流程最大化大规模机器人后训练中的人类效率

提出VLAC-CUT引导的后训练流程,通过角色分工和自动数据筛选,让少量人员监督多机器人,成功率80%-95%,吞吐量提升1.7-4.2倍。

04:00
arXiv cs.AI

暴力狂喜是否终成暴力结局?衡量智能体代码合并后的命运

纵向研究发现,自主代码代理合并后需更多纠错维护,引入更多安全漏洞,且维护负担与低审查率正相关。

04:00
arXiv cs.AI

TS-Mask VLA: 用于视觉-语言-动作模型的有效桥接的二维时空掩码

TS-Mask VLA提出桥接注意力的离散扩散动作专家和二维时空掩码,在LIBERO达95.7%成功率,CALVIN序列长度4.19。

04:00
arXiv cs.AI

Robo-ValueRL:离线到在线强化学习的可靠价值估计

提出可靠价值估计框架,实验证明其影响策略优化,在精密操作中达86%和84%成功率。

04:00
arXiv cs.AI

你训练什么就得到什么:音频深度伪造检测中的性别偏见、训练构成与事后缓解

训练数据性别构成决定模型偏见方向,事后校准无法消除性能差距,需从训练阶段解决公平性。

04:00
arXiv cs.AI

LLM驱动的代理推荐系统:面向联网电视内容发现

提出LLM代理推荐系统,融合非结构化信号,采用混合架构克服推理延迟,提升联网电视内容发现效果。

04:00
arXiv cs.AI

基于知识的多智能体安全控制推荐框架

提出知识驱动的多智能体安全决策系统,以无遗憾在线学习实现高覆盖率与低资源消耗。

04:00
arXiv cs.AI

量子电路视觉:面向量子代码生成的视觉AI智能体的成本感知评估

提出成本感知评估框架,发现中端模型平衡精度与成本,电路深度是失败主因,级联路由策略优化开销。

04:00
arXiv cs.AI

超越贝叶斯纳什:非对称信息下对抗性团队游戏中的最小最大遗憾均衡学习

提出PR-MRE均衡,在高置信度类型子集最小化最坏遗憾,提升对抗性团队博弈的分布鲁棒性。

04:00
arXiv cs.AI

使用手工MFCC主导声学生物标志物的自发言语无转录轻量级阿尔茨海默病检测

基于176条录音提取MFCC等手工特征,轻量SVM实现平均AUC 0.674,表明无转录声学特征可用于AD筛查。

04:00
arXiv cs.AI

面向消费级设备的混合CPU-GPU大语言模型推理的自动张量调度

ATSInfer通过张量粒度调度与负载感知动态传输,在消费设备上将LLM推理吞吐量提升最高3.29倍。

04:00
arXiv cs.AI

通过深度特征锚定的偏好优化打破流式目标说话人提取中的质量-可懂度权衡

提出深度特征锚定DPO,扩大卷积核,打破流式TSE质量-可懂度权衡,可懂度提升10.9%

04:00
arXiv cs.AI

部分契约足够:基于LLM推断的可靠回归验证

首次提出基于部分契约的回归验证,证明调用者充分的契约已足够,检查可靠且无假等价。

04:00
arXiv cs.AI

ActiveFly-Bench:面向空中具身感知的视觉-语言-动作与具身问答对齐基准

首个无人机具身感知基准,分解三层主动感知任务,揭示行为规划与视角调整挑战。

04:00
arXiv cs.AI

程序合成驱动的通用酉算子自动设计

AI程序合成自动发现酉矩阵分解及稀疏优化规则,实现最少MZI并维度无关推广,节省硬件资源。

04:00
arXiv cs.AI

世界模型作为对抗者:多智能体自博弈微调实现鲁棒运动规划

提出AWM框架,将世界模型转为对抗者,通过解耦优化实现多智能体自博弈,提升密集交通场景的鲁棒规划性能。

04:00
arXiv cs.AI

临时授权,持久效果:LLM智能体的提交时授权

LLM代理提交时授权失效致安全风险,CommitGuard可阻挡过期提交。

04:00
arXiv cs.AI

中文标题:何时限制编码代理仅用execute_code有帮助?机制×代理设计消融实验

中文摘要:限制代理仅用execute_code在多数场景更便宜,但效果取决于任务和代理设计,成本差异在缓存调整成本而非通过率。

04:00
arXiv cs.AI

PromptGraph: 图引导的提示清理方法,用于平衡大语言模型推理中的隐私与效用

提出图引导的提示清理方法,通过图结构建模隐私与上下文依赖,显式平衡隐私与效用。

04:00
arXiv cs.AI

覆盖路径规划:经典基础、近期进展与未来方向

综述覆盖路径规划经典与进展,分六类方法分析挑战与方向。

04:00
arXiv cs.AI

动作映射策略:通过像素分类学习3D闭环操作

把3D动作投影到相机图像平面,以像素点作为离散类别,实现高精度、多模态的快速闭环操作策略。

04:00
arXiv cs.AI

MDQEC-QAS:结合硬件感知VQC搜索与置信门控恢复的量子纠错元解码框架

提出元解码框架,硬件感知VQC搜索+置信门控恢复,在高挑战纠错场景下显著降低逻辑失败率。

04:00
arXiv cs.AI

基于确定性策略的扩展平均场控制的演员-评论家学习

提出连续时间扩展平均场控制的无模型强化学习,采用确定性策略推导策略梯度,开发深度确定性策略梯度算法,实验验证有效。

04:00
arXiv cs.AI

面向自动驾驶车辆的异构边缘GPU上视觉Transformer的边缘物理AI部署

提出H-FraDS调度,在异构边缘GPU高效部署视觉Transformer,实现125.93 FPS、92% F1分数,满足实时约束。

04:00
arXiv cs.AI

平衡即初始化:物理结构深度均衡推理中的惰性恒等坍塌

深度均衡模型推理中平衡解恒等于初始值,迭代无效,精度无改善,呈惰性恒等坍塌。

04:00
arXiv cs.AI

CGS:具有有界邻域损失和查询支持的可配置图摘要

CGS可配置图摘要框架,支持有界邻域损失与多查询,实现高压缩高精度。

04:00
arXiv cs.AI

视频大语言模型真的在“看”吗?——长视频角色追踪失败诊断

模型追踪角色依赖性别等浅层线索,未能真正区分个体,基准得分不代表真实能力。

04:00
arXiv cs.AI

Pix2Act: 基于图像空间的操作策略与等变增强

Pix2Act将3D控制简化为2D轨迹预测,利用等变增强提升泛化,在模拟和真实任务中超越现有方法。

04:00
arXiv cs.AI

MusicMark: A Robust Generative Watermarking Framework for Music Generation

MusicMark是首个生成式音乐水印框架,在扩散模型中嵌入水印,鲁棒抗攻击且保持质量。

04:00
arXiv cs.AI

PRISM Edit:一个向量应对所有时间性答案

提出PRISM Edit,利用模型固有调制路径优化多义表示,实现时间正确预测,性能提升超2倍。

04:00
arXiv cs.AI

与智能机器人长期物理共存的初步探索

提出PHILIA多机器人系统,通过统一接口解耦推理与执行,实现插件式集成,完成长期复杂服务任务。

04:00
arXiv cs.AI

纵向多视角乳腺癌风险预测

提出LMV-Net模型,结合纵向对齐的CC和MLO多视角,提升乳腺癌风险预测性能,优于现有方法。