5940 条条目 · 106 个活跃源
2026年7月14日
04:00
ArXiv AI

SCALECUA: 通过可验证任务合成与高效在线强化学习扩展计算机使用代理

ScaleCUA通过可验证任务合成与高效在线RL,实现计算机使用代理开源SOTA。

04:00
ArXiv AI

OS-Pruner:通过最优停止剪枝推理模型的思维链

OS-Pruner将思维链剪枝视为最优停止问题,动态终止推理,减少20-60%生成长度且精度损失小。

04:00
ArXiv AI

NVAITC AI科学家:一种受控的端到端研究系统——高血压GWAS案例研究

NAIS系统在隐私保护下复现高血压GWAS关键位点,并实现肝损伤预测AUC 0.842,证明受控AI可辅助生物医学发现。

04:00
ArXiv AI

隐藏的足迹:将存储作为LLM智能体评估的一级指标

AgentFootprint基准揭示LLM agent存储差异达15.7倍,建议将存储作为与准确性并列的评估指标。

04:00
ArXiv AI

STAMP:面向深度搜索智能体的溯源引导信用分配

STAMP用溯源引导信用分配,提升搜索智能体在三个基准上2-5.5点。

04:00
ArXiv AI

自我进化的临床系统之路:医疗智能体从辅助到自主的扩展

提出医疗智能体从辅助到自主的三级分类,强调临床环境缩放与自我进化,分析放射学等应用及挑战。

04:00
ArXiv AI

异质智能体群组:具有运行时约束记忆的安全开放式探索

通过分离角色与MCTS生成可缓存约束补丁,实现安全开放式探索,令牌消耗降低15.1%,带宽限制降本55.9%。

04:00
ArXiv AI

有效 ≠ 必要:诊断思维链中的潜在低效

指出现有评估器忽略有效但低效步骤,提出CAID指标识别冗余,结合PACE压缩实现31-53% token节省且不损准确率。

04:00
ArXiv AI

量化推理模型的校准e-CUSUM解码:为何令牌对数概率不适合解码监控

令牌对数概率不适用于量化模型监控,校准e-CUSUM方法在GSM8K上使INT4准确率从63%升至69%(p=0.18),但消耗28%令牌预算。

04:00
ArXiv AI

通过预处理提升d-DNNF表示的查询效率

利用保持模型计数的预处理技术提升CNF公式编译为d-DNNF后的模型访问查询效率,实验证明其高效鲁棒。

04:00
ArXiv AI

结构体代理:利用统一因果结构驾驭长时域数字代理

SturctAgent通过统一因果状态和验证驱动工作流,显著提升长时域数字代理任务成功率。

04:00
ArXiv AI

MAGIC:基于大语言模型的过渡感知式可导航多场景游戏世界生成

MAGIC四阶段流水线将自然语言提示转为多场景游戏,实现跨场景一致性,过渡识别F1达0.96。

04:00
ArXiv AI

GAT与BERT在类人游戏测试中的比较分析

提出通用表示减少特征工程,GAT与BERT在Candy Crush Saga上优于CNN,提升类人游戏测试效果。

04:00
ArXiv AI

通过强化学习学习残差运动学修正以实现连续神经解码

提出CNN-LSTM-RL框架,用强化学习离线修正运动学残差,3D运动想象解码相关性提升41.5%,RMSE降低40.2%。

04:00
ArXiv AI

HCRMap:面向3.5D MoE芯片推理的感知压力的热专家驻留映射

HCRMap动态管理热专家副本,缓解通信内存瓶颈,在3.5D MoE推理中降低端到端时延约43%。

04:00
ArXiv AI

Omni-Decision: 一种用于全模态问答的渐进式证据状态智能体系统

提出Omni-Decision系统,以结构化证据状态驱动多步证据获取,在两项基准上准确率分别提升27.3和30.2个百分点。

04:00
ArXiv AI

交互缩放:锚定测试时计算的第三轴

交互通过外部观察反馈突破推理与采样的内部上限,锚定反馈与度量是关键。

04:00
ArXiv AI

合规逆向工程:审计遗留IT安全概念的双图验证框架

ASSERT框架通过本体提取和双图比对,量化文档与基础设施不一致,导出OSCAL合规工件。

04:00
ArXiv AI

模型崩溃:论递归、噪声与未知机器视觉

模型崩溃作为递归镜像,挑战超人类主义,强调噪声与递归的美学视角,揭示AI数据依赖本质。

04:00
ArXiv AI

专业邮件中的趣味AI:关于语气与收件人参与度的实地实验

AI辅助写作改变邮件语气但未直接影响回复率,而是通过语气间接影响收件人行为。

04:00
ArXiv AI

自适应多智能体系统中跨政策制度的迁移学习

制度变化若保留原有关系则迁移有效,否则产生负迁移。

04:00
ArXiv AI

ECG-LDC:一种面向心电图心律失常分类的高效硬件低维计算框架

ECG-LDC采用双编码器与二进制运算,以3.86KB内存实现97.18%准确率,适合资源受限的可穿戴设备。

04:00
ArXiv AI

损伤多模态语言模型重现失语症图片命名模式

损伤多模态语言模型可重现失语症患者的类型及个体化图片命名错误模式,高匹配度达97.8%。

04:00
ArXiv AI

审计分布强化学习的风险主张

审计揭示分布强化学习智能体的风险主张多为训练伪影,而非环境随机性,超40%最强声称被反驳。

04:00
ArXiv AI

SWIFT:面向自动驾驶中流量感知轨迹预测的小世界交互框架

提出SWIFT框架,融合小世界网络与交通流理论,通过结构先验提升轨迹预测准确性与泛化性。

04:00
ArXiv AI

MorphologyFM:一种形态学感知的心电图与脉搏血氧波形表示学习基础模型

基于形态学引导掩码与跨模态对比学习,在心律失常、低氧血症等任务中优于现有自监督方法。

04:00
ArXiv AI

OmniSCS: 通过完全可编辑驾驶世界实现自动驾驶全方位安全关键场景合成

提出OmniSCS,含全可编辑世界构建与场景合成模块,高保真生成安全关键场景,支持实时闭环测试。

04:00
ArXiv AI

听特征说话:基于内容嵌入匹配而非信号重构的语音匿名化

提出内容嵌入匹配的语音匿名化模型,避免重构损失,实现低WER(2.53)和良好匿名化(EER 13.39),情感部分保留。

04:00
ArXiv AI

简单的提示重述绕过谷歌MedGemma-4B安全护栏

研究发现简单重述提示可绕过安全护栏,成功率38%,其中“医学考试”和“医生权威”框架攻击成功率最高,药物相互作用防护薄弱。

04:00
ArXiv AI

基于时空Transformer的高精度无ECG动态冠状动脉路图统一模型

提出统一DRM框架,利用时空Transformer预训练和辅助任务,实现无ECG的高精度相位匹配与导管追踪,适用于实时PCI引导。

04:00
ArXiv AI

基于大型多模态模型的环境感知移动性管理

利用多模态模型从RGB-D图像提取环境信息,预测信道容量并做出切换决策,显著提升信道容量。

04:00
ArXiv AI

更多结构,而非更多容量:面向视觉运动模仿学习的以对象为中心的表示

对象中心表示提升模仿学习成功率22.4%,空间目标定位减少近失误差,遮挡是主要瓶颈。

04:00
ArXiv AI

面向AI驱动科学发现的自主科学知识生成框架

提出自主框架,将科学文献转化为结构化知识库,支撑AI驱动的科学发现。

04:00
ArXiv AI

中文标题:多模态自回归视觉建模中的下一密集步长预测

中文摘要:提出DenseAR,用单尺度分词器实现粗到细的步长并行预测,统一处理多模态任务,性能优异。

04:00
ArXiv AI

基于参考值的几何平均成对比较方法——统计视角

用参考值和几何平均计算替代优先级,同时捕捉不一致性与偏好距离,定义直观可解释的质量指标。

04:00
ArXiv AI

自适应模型压缩(AMC):面向超低功耗Transformer推理的显著性驱动资源分配

提出显著性驱动自适应压缩,动态分配资源,能耗降59.2%,吞吐量升2.24倍,精度仅损3.6%。

04:00
ArXiv AI

盒中机器学习:分析开源ML项目中的容器化实践

1993个ML Dockerfile实证:容器平均10.27GB,构建耗时8.84分钟,44.4%提交触发重建,71%重建工作冗余,识别7种重构模式。

04:00
ArXiv AI

GitHub上MCP实现的大规模数据集

首次大规模收集并验证GitHub上2297个MCP项目,发现Python/TypeScript主导,混合架构最常见。

04:00
ArXiv AI

面向生产的音效生成评估框架

提出面向生产的评估框架,用于参考引导音效变化,通过两阶段协议与主客观指标发现AudioX平衡最优。

04:00
ArXiv AI

Minionese:多语言大语言模型安全的综合基准与机理研究

提出Minionese越狱基准,发现低资源语言通过几何错位子空间绕过安全对齐,仅英语评估不足。

04:00
ArXiv AI

VINE:驯服强化学习的生成控制策略

VINE通过重构插值状态,稳定端到端值梯度优化流匹配策略,在RL基准和真实机器人任务中优于现有方法。

04:00
ArXiv AI

成熟与新兴经济体中社会公平的可再生能源预算分配MDP策略比较

将公平可再生能源分配建模为MDP,滚动时域策略在美、印尼均最优,市场追逐策略在印尼酿灾难。

04:00
ArXiv AI

源提升流匹配实现可干预多模态模仿

SL-FM通过正交源提升将随机性转化为可干预变量,避免路径交叉,实现多模态控制。

04:00
ArXiv AI

从随机到稳定:AI可见性测量中的排名稳定性与结构性充分性

提出顺序收敛框架,以排名稳定性与结构性充分性判断AI可见性测量是否足够,无需预设查询量。

04:00
ArXiv AI

中文标题:AI在纳米粒子电子显微镜中从图像解释到科学推理的演变

AI将纳米粒子电镜从图像分析升级为科学推理平台,整合多模态数据与自主实验,加速材料发现。

04:00
ArXiv AI

大语言模型在错误信息生态系统中的滥用、防御与脆弱性

大语言模型把错误信息从内容问题升级为生态系统安全挑战,本文提出角色-层次框架分析攻击、防御与漏洞,并指出三大开放挑战。

04:00
ArXiv AI

约束非确定性:将AI驱动的研究系统视为DBMS,以实现可靠、无浪费、透明和协作的研究 [愿景]

LLM作为编译器而非执行器,通过确定性版本化数据流引擎组织研究,确保可靠、无浪费、透明和协作。

04:00
ArXiv AI

Spatula:探索按需原位界面与交互实现属性控制

提出Spatula系统,自动生成按需原位属性控制界面,支持动态图形迭代,提供直观细粒度交互,并泛化至网页与3D设计。

04:00
ArXiv AI

将大脑动力学建模为端口-哈密顿系统

将运动皮层建模为端口哈密顿系统,通过度规积积分器拟合EEG,实现临界态和锁相恢复。

04:00
ArXiv AI

基于证据引导推理提示缓解代码异味检测中的大语言模型谄媚偏误

LLM在代码异味检测中谄媚偏误严重,证据引导推理提示(EGDP)将决策翻转率降至12%,假对齐率降至21%。