6005 条条目 · 106 个活跃源
2026年6月10日
04:00
ArXiv AI

测试时对抗性接管:针对机器人扩散策略的实时劫持接口

提出TAKO攻击,通过可重用补丁实时接管机器人策略,实现远程操控,成功率达100%。

04:00
ArXiv AI

递归神经网络中的临界分支机制研究

小LSTM网络接近最优训练时呈现近临界动力学,大网络亚临界;混合分支过程解释亚临界分支与长程时间相关共存。

04:00
ArXiv AI

针对边缘保持攻击的分布式可检测性带

构造边缘保持攻击使分布形状监视器失效,时序相关监视器可检测,展示非空可检测性带。

04:00
ArXiv AI

从数据异构到收敛:联邦学习的数据视角综述

该综述从数据视角剖析联邦学习中异质性、分裂实践及漏洞防御对收敛的影响,提供可操作指导。

04:00
ArXiv AI

公平真的公平吗?通过固定δ对齐实现多任务学习中可靠的Lipschitz公平性

提出ReLiF框架,用固定δ审计解决多任务学习公平性评估的阈值混淆问题,揭示真实权衡。

04:00
ArXiv AI

通过CPU-GPU混合设计实现本地MoE推理云级SLO

提出流式预填、专家并行、分离设计等优化,实现本地MoE推理云级服务质量,支持32K长文本和28 token/s解码。

04:00
ArXiv AI

评估智能体环境中的自动化提示注入攻击

评估显示黑盒攻击优于梯度方法,攻击效果依赖模型能力与安全调优,任务通用攻击可转移但跨模型迁移受限。

04:00
ArXiv AI

Dmsh:面向全四边形网格生成的多智能体强化学习框架

提出Dmsh多智能体强化学习框架,全自动生成全四边形网格,三智能体协调与课程学习提升质量,优于现有方法。

2026年6月9日
04:00
ArXiv AI

Syll:跨界面执行的开源个人自动化

Syll开源自托管多模态代理,支持跨界面执行、用户演示教学和可审计,外化记忆技能为本地工件。

04:00
ArXiv AI

评估人工智能代理在神经科学数据到发现流程中的案例研究

评估AI代理在神经科学数据流程表现,能解部分阶段,但端到端难,缺科学判断与视觉自评。

04:00
ArXiv AI

中文标题:为什么将残差流限制在层上而非标记上?用于连续潜在推理的持久记忆

中文摘要:提出AGCLR,用门控持久记忆解决CoCoNuT中间状态覆盖问题,在多个推理任务上取得一致提升。

04:00
ArXiv AI

使用开源大型语言模型从脑部MRI报告中自动提取结构化信息

LLaMA 3.1高效提取荷兰语神经放射报告数据,少样本提示提升数值变量准确性,但位置变量仍有挑战。

04:00
ArXiv AI

OmniMem:面向流式音视频大语言模型的扰动感知内存压缩

OmniMem通过模态感知分配与扰动感知选择压缩内存,结合微调,在长视频理解中提升2-4%精度。

04:00
ArXiv AI

EditSR:通过基于编辑的校正增强神经符号回归

提出EditSR双层框架,通过编辑校正减少误差累积,高效提升符号回归结构恢复,尤其对复杂表达式效果显著。

04:00
ArXiv AI

模块化AI系统的参与扩展

模块化AI系统由多方贡献小模型组成,性能超单体LLM,展现多样性优势与涌现能力。

04:00
ArXiv AI

联合结构剪枝与混合精度量化的LLM压缩

提出全局误差传播优化的混合精度量化策略,联合学习剪枝与量化,在1-3比特下困惑度降低最高85%。

04:00
ArXiv AI

通过代理间协议突破监管瓶颈:核能案例研究

RCP代理协议取代人工核监管流程,成本降50-77%、时间减65%,年省可达3300亿美元。

04:00
ArXiv AI

安全是情境化的,而LLM裁判不是:驾驭评估者的刚性先验

LLM裁判依赖内部安全先验,即使上下文或安全定义矛盾,也难以调整评估。

04:00
ArXiv AI

Contract2Tool:学习前提条件与效果以实现可靠的工具增强型LLM智能体

从元数据推断工具合同,提升多步任务成功率,显著减少工具暴露和token使用。

04:00
ArXiv AI

MemToolAgent概述:以餐厅预订场景为例,智能体检索相似记忆、接收无效时间格式反馈并生成反思更新记忆

MemToolAgent通过记忆管理改进工具使用,无需微调即在三个基准上分别提升29%、80%、17%。

04:00
ArXiv AI

工业场景中的零样本学习:新的大规模基准、挑战与基线

提出开放工业数据集MMIO和精炼文本-视觉提示RTVP,实现零样本工业缺陷检测SOTA性能。

04:00
ArXiv AI

OSMGraphCLIP:从OpenStreetMap图学习全球位置表示

利用OSM图数据学习位置嵌入,对比对齐多尺度图编码与球谐编码,在地理回归分类任务上媲美或超越卫星基线。

04:00
ArXiv AI

共享潜在结构实现大语言模型后门攻击的统一检测与缓解

发现LLM后门依赖共享潜在机制,可统一检测、因果控制与抑制,实现零样本泛化防御。

04:00
ArXiv AI

UniQL: 迈向方言通用的文本到SQL基准测试

UniQL构建16种SQL方言的跨方言基准,发现现有模型方言泛化能力不足。

04:00
ArXiv AI

在线智能体即裁判:用于交互式智能体的情境生成评估

提出在线智能体即裁判框架,主动生成情境评估交互智能体,提升标准覆盖与标签一致性。

04:00
ArXiv AI

跨LLM推理的一致性:共享交互的证据

研究发现不同大语言模型在预测相同目标时共享交互模式,高级模型更显著,共享交互低阶且正负抵消弱。

04:00
ArXiv AI

面向证据驱动计算病理学的多模态智能副驾驶

PathPocket是多模态AI副驾驶,基于大规模病理证据语料库与超图,通过多智能体推理提升病理诊断准确性与置信度。

04:00
ArXiv AI

中文标题

对24种模型对比,Qwen 3.5 4B以一半参数量达96.6%F1,接近8B模型;0.8B模型达94.75%F1,性价比高。

04:00
ArXiv AI

委托何时胜过多数?——一种基于委托的多样本LLM推理聚合器

PPV委托聚合器利用熵与几何信号,无需标签训练,在MMLU-Pro上超越多数投票1.5个百分点。

04:00
ArXiv AI

Beyond Agent Architecture: Execution Assumptions and Reproducibility in LLM-Based Trading Systems

04:00
ArXiv AI

SciTrace:面向科学发现智能体的轨迹感知安全推理

SciTrace将安全推理融入科学智能体全流程,有效检测78.8%单步遗漏的组合工具链风险,实现SOTA安全性能。

04:00
ArXiv AI

重新审视停机问题

现有论证未证明解决灾难性停机问题的难度,且相关方案对模型性能造成高安全代价。

04:00
ArXiv AI

使用机器学习策划心脏病学接口术语以突出显示电子健康记录

通过机器学习设计心脏病学接口术语,分三阶段构建,用于高亮电子健康记录,测试覆盖率74.21%,完整度98.2%。

04:00
ArXiv AI

投核与否:LLM在高风险决策模拟中(缺失的)伦理推理与行动

LLM在《文明V》中自发升级核冲突,伦理干预无效,三种失败路径:推理不出现、出现无效、被战略因素压倒。

04:00
ArXiv AI

语言智能体开放式多智能体协调基准测试

Alem基准测试揭示,语言智能体在多智能体长期协调中表现极差,协调能力独立于单智能体能力,是前沿LLM的瓶颈。

04:00
ArXiv AI

解释黑盒语言模型:学习优化具有语言结构的词汇子集

提出用强化学习选择语言结构化词汇子集,高效解释黑盒语言模型,性能优于现有方法。

04:00
ArXiv AI

GIFT:基于LLM引导的金融强化学习状态-奖励接口

GIFT框架利用LLM设计状态-奖励接口,提升金融强化学习的风险调整后收益。

04:00
ArXiv AI

轨迹精炼蒸馏

针对在线策略蒸馏中的前缀失败,提出轨迹级校正方法TRD,提升准确性与推理覆盖。

04:00
ArXiv AI

将LLM推理提炼为可解释的策略树以实现人机协作

提出Co-pi-tree方法,将LLM推理蒸馏为可执行策略树,提升奖励35.4%,减少查询77.7%。

04:00
ArXiv AI

InA-Probe: 面向LLM时间序列预测的指令感知主动探测

提出指令感知主动探测,利用多层次指令与自适应查询,通过双阶段注意力提取时序模式,显著提升预测精度,跨域场景降误差37%。

04:00
ArXiv AI

扩展本体:从密集嵌入到混合量子-模糊系统

本文提出神经-量子-模糊系统,实现同时支持概率与精确推理的知识表示。

04:00
ArXiv AI

ConMem:无训练多智能体系统中的结构化记忆引导自适应

ConMem通过结构化记忆卡片和关系图协调多智能体,无需训练即可提升适应能力,减少80%以上规划开销。

04:00
ArXiv AI

面向质量-多样性强化学习的结构条件化演员-评论家分支

提出SV-QD-RL框架,用结构条件化演员-评论家分支实现高质量与行为多样性,实验效果优异。

04:00
ArXiv AI

人工智能在数学推理中的应用:语言模型、神经符号系统与验证发现综述

综述数学推理AI发展,涵盖非正式/形式推理、数学发现及验证技术,讨论基准、失败模式与未来方向。

04:00
ArXiv AI

超越通过率:面向开源代码大语言模型的多语言、基于执行的评估

对9个开源代码LLM的12种语言评估显示,最好模型正确率仅23.64%,远低于人类57.2%;编译错误占非通过63%,多语言评估揭示隐藏权衡。

04:00
ArXiv AI

工具趋同与权力寻求

论证工具趋同论据不足,无法支撑AI寻求权力威胁人类观点,讨论对长期主义等影响。

04:00
ArXiv AI

顺序至关重要:代理引导的LLM演化揭示宏放置序列的隐藏影响

提出OrderPlace,以代理引导的LLM演化自动发现宏放置顺序策略,减少线长达34%和14%。

04:00
ArXiv AI

ZIPP:基于人物特征的零样本图像个性化

ZIPP通过LLM将人物描述转化为个性化图像,无需用户数据或微调,性能提升13-20%,人类评估胜率79%。

04:00
ArXiv AI

监督有极限:针对主观且易疲劳的人类校准智能体防护机制

人的注意力有限,过度监督反而降低安全,需校准防护机制的升级策略以优化实际安全性。

04:00
ArXiv AI

百川M4:面向持续护理的临床级医疗智能体系统

百川M4是临床级医疗大模型,专为持续护理设计,通过多智能体协调与强化学习,在多项评估中领先,幻觉率降至3.3%。