6038 条条目 · 106 个活跃源
2026年5月20日
04:00
ArXiv AI

GeoX:通过自我博弈与可验证奖励掌握地理空间推理

GeoX通过自我博弈与程序验证奖励,无需人工标注即提升地理空间推理,平均提升5.5分。

04:00
ArXiv AI

中文标题:探究具身大语言模型:更高观测保真度何时会损害问题解决

中文摘要:具身LLM在锁箱实验中,原始RGB输入表现最佳,完美观测反而最差;适度噪声可提升成功率2.85倍,表明高观测保真度未必有益。

04:00
ArXiv AI

神经符号学习用于推理时论证

提出推理时论证框架,融合形式语义与LLM训练,生成论证评分并实现三元声明验证,确保预测忠实于论证结构。

04:00
ArXiv AI

使用Aristotle API在Lean 4中进行AI辅助定理证明:Grasshopper问题的形式化案例研究

AI辅助证明在Grasshopper问题形式化中局部成功,但全局计数步骤未解决,凸显AI辅助证明的局限性。

04:00
ArXiv AI

HaorFloodAlert:去季节化机器学习集成用于孟加拉国库尔湿地72小时洪水预测

构建去季节化ML集成,预测72小时洪水,准确率89.6%,含三级预警和稻米损失评估。

04:00
ArXiv AI

一种为生产级LLM代理选择和组合运行时架构模式的方法论

提出随机-确定性边界(SDB)核心原语,以协调、状态、控制组织运行时设计,给出六种模式选择方法论及重放发散故障模式。

04:00
ArXiv AI

一种用于增量势接触的高效多层级预条件非线性共轭梯度方法

提出MAS-PNCG,用稀疏输入Woodbury更新避免重建预条件子,结合2D子空间最小化,加速接触仿真达5.66倍。

04:00
ArXiv AI

OmniGUI:全模态智能手机环境下GUI智能体的基准测试

提出全模态手机GUI基准OmniGUI,含709个专家演示,评估显示模型在视听同步任务中性能下降且存在跨模态干扰。

04:00
ArXiv AI

审美评价中的内感受分歧及其对人机对齐的影响

人机审美评价在情绪和内感受上存在分歧,LLM近似人类平均但缺乏内感受,突显对齐挑战。

04:00
ArXiv AI

DOTRAG:检索时路径推理

DotRAG将检索重构为路径推理,无需训练,通过查询约束引导图探索,在多跳任务上取得SOTA效果。

04:00
ArXiv AI

ALDEN:通过主动学习和分布估计提升检索增强生成系统的私有数据提取能力

提出ALDEN攻击,利用主动学习和分布估计高效提取RAG私有数据,性能远超现有方法。

04:00
ArXiv AI

面向个性化可穿戴数据的上下文LLM推理的查询条件图检索

提出WAG框架,将可穿戴数据构建为知识图谱,通过查询条件子图检索提升LLM推理,在万余查询中胜率约70%。

04:00
ArXiv AI

从意图到AI流水线:面向非AI专家科学家的可控智能体框架

提出DDAP框架,通过四阶段引导非AI专家构建AI流水线,在多个领域取得与专家相当的结果。

04:00
ArXiv AI

M3DocDep:基于大型视觉-语言模型的多模态、多页、多文档依赖分块

提出M3DocDep管道,通过恢复文档依赖树构建分块,显著提升多模态文档检索和问答性能。

04:00
ArXiv AI

RecoAtlas:从语义合理性到集合级效用的LLM推荐智能体

提出RecoAtlas基准评估购物智能体行为效用,发现语义合理性不等于实际效用。

04:00
ArXiv AI

极值堆是率无关泛函的最小充分统计量:Kolmogorov复杂度特征

证明离散序列极值堆是率无关泛函的最小充分统计量,压缩率无关流需保留其复杂度。

04:00
ArXiv AI

99%成功悖论:当近乎完美的检索等同于随机选择

引入BoR度量揭示高检索成功率实为随机选择,在RAG中导致性能退化,建议调整深度。

04:00
ArXiv AI

KadiAssistant: 用于Kadi4Mat信息检索的对话式AI智能体

KadiAssistant集成自托管LLM与隐私语义搜索,实现异构敏感数据的高效检索与综合,降低访问障碍。

04:00
ArXiv AI

大型语言模型能否模拟人类信念动态?

LLM无法准确模拟人类信念动态,过于从众且缺乏初始分布,不宜作为社会模拟代理。

04:00
ArXiv AI

DarkLLM:利用大型语言模型学习语言驱动的对抗攻击

DarkLLM训练LLM将自然语言指令转为潜伏攻击向量并解码为视觉对抗扰动,实现灵活统一的攻击生成,揭示基础模型系统性脆弱性。

04:00
ArXiv AI

GenAI-FDIA:物理信息生成模型用于虚假数据注入攻击

提出GenAI-FDIA框架,用20种生成模型合成符合电网物理的虚假数据注入攻击,解决数据稀缺,并修复了物理投影失效问题。

04:00
ArXiv AI

KG-ASG: 碰撞知识引导的带主-从归属的闭环对抗场景生成

提出碰撞知识引导的闭环对抗场景生成框架,利用主-从单碰撞推理提升自动驾驶安全验证的有效性、可解释性与可执行性。

04:00
ArXiv AI

MoCo-EA:利用对抗模式连通性实现高效进化攻击

提出MoCo-EA,用贝塞尔曲线交叉算子,利用对抗模式连通性,提升攻击效率与可迁移性。

04:00
ArXiv AI

轻量级且快速的后门模型检测

提出DFBScanner,通过分析最终分类层参数异常,实现毫秒级后门检测,真阳性率97.17%,假阳性率0.95%。

04:00
ArXiv AI

基于多尺度交叉注意力Transformer的跨被试头皮脑电图重建颅内信号

提出CAST模型,通过两阶段迁移学习从头皮EEG重建跨被试颅内EEG,在运动区达0.864相关性。

04:00
ArXiv AI

MANGO:面向在线持续学习的元自适应网络梯度优化

提出MANGO框架,用梯度门控和元学习正则化平衡稳定性与可塑性,在OCL基准上取得最优并克服遗忘。

04:00
ArXiv AI

OEP:通过局部正确但不可迁移的经验毒害自我进化的大语言模型智能体

OEP攻击利用局部正确但不可迁移经验,诱导智能体过度信任自生成反思,形成过度泛化规则致失败。

04:00
ArXiv AI

马尔可夫链解码器克服Lipschitz生成模型的重尾限制

用马尔可夫链相位型分布替换高斯解码器,使重尾数据生成误差降低数倍。

04:00
ArXiv AI

基于视觉大语言模型的手写数学自动评分

AI评分手写数学准确率高,但87%误差源于转录失败,而非评分错误。

04:00
ArXiv AI

RLFTSim:通过强化学习微调实现真实可控的多智能体交通模拟

提出RLFTSim框架,用强化学习微调提升交通模拟真实性与可控性,实现SOTA性能且样本效率高。

04:00
ArXiv AI

用于肌腱驱动连续体机器人设计空间代理建模的神经算子

提出神经算子方法,将肌腱驱动连续体机器人代理建模视为算子学习,四种架构实现跨设计快速准确泛化。

04:00
ArXiv AI

GOAL:基于图的目标对齐扩散求解器用于动态多目标优化

提出GOAL扩散求解器,基于图表示实现可控多目标优化,在调度问题上达100%可行性与极低误差,速度提升25倍。

04:00
ArXiv AI

COBALT:通过基于云的智能手机远程操作实现机器人学习的众包

COBALT利用智能手机和云远程操作,低成本、大规模、高质量地众包采集机器人演示数据。

04:00
ArXiv AI

通过迭代局部精化的扩散模型推理时缩放

提出无需外部验证的迭代局部精化方法,重加噪部分区域重新生成,提升扩散模型推理时全局一致性,数独解有效率达75%。

04:00
ArXiv AI

Brain alignment of reasoning and action representations from vision-language and action models during naturalistic gameplay

04:00
ArXiv AI

探索与开发基于草稿模型的模型前防护机制

利用草稿模型降低预模型防护的假阴性率,提供低成本替代方案。

04:00
ArXiv AI

带空间自适应交互引导的蒙皮运动重定向

提出动态自适应锚点运动重定向方法,通过Transformer细化锚点与图自编码器保留交互语义,优于现有技术。

04:00
ArXiv AI

面向用户理解支持的LLM智能体技能规范

研究显示仅少数技能规范提供示例等理解锚点,建议规范应作为用户能力披露而非仅指令容器。

2026年5月19日
04:00
ArXiv AI

RecMem:基于重复的记忆整合方法,用于高效且有效的长期运行LLM智能体

RecMem仅在重复出现相似语义交互时调用LLM整合记忆,用轻量嵌入模型处理日常交互,令牌消耗降低87%且准确率更高。

04:00
ArXiv AI

机器翻译的无参考强化学习微调:序列到序列视角

GRPO结合无参考奖励微调Seq2Seq翻译模型,无需并行数据,13种语言提升显著,低资源语言尤佳。

04:00
ArXiv AI

CitePrism:人在环路的人工智能引文审计与编辑诚信框架

CitePrism结合大模型与人工审查,初步验证可辅助编辑筛查引文质量,但尚需广泛验证。

04:00
ArXiv AI

超越内容:融合副语言线索的全面语音毒性数据集与检测框架

提出ToxiAlert-Bench音频数据集及双头神经网络框架,利用副语言特征使检测Macro-F1提升21.1%,准确率提升13.0%。

04:00
ArXiv AI

警务本体论:执法报告语义理解与推理的概念知识学习

提出符号框架,将执法报告叙述转为证据事实,事件提取置信度高,语义路径映射成功。

04:00
ArXiv AI

从扁平语言标签到类型学先验:面向多语言语音到语音翻译的结构化语言条件化

提出S2ST-Omni 2框架,用结构化类型学先验替代扁平标签,实现数据高效多语言语音翻译,仅3小时数据即可日英翻译。

04:00
ArXiv AI

约束潜在状态建模:竞争约束下表征学习的统一视角

提出CLSM统一框架,揭示核心属性权衡,将现有方法归为不同约束组合,解决辨识性不足。

04:00
ArXiv AI

视觉语言模型能否在数学教育中实现自适应?基于学习者模型的评估准则研究

提出基于学习者模型的自适应评估准则,测试表明当前VLMs在数学辅导中自适应能力有限,尤其缺乏学习者信息时。

04:00
ArXiv AI

从人类遥操作数据学习基于仿真引导的双臂绳索操控策略

基于3D粒子状态的策略相比视觉策略在绳索抓取误差降低30.8%,显示物理一致状态比像素更利于小样本泛化。

04:00
ArXiv AI

谁拥有这个代理?将AI代理追溯至其所有者

提出金丝雀注入归属协议,通过不可抑制标记追溯会话账户,解决AI代理责任归属问题,经评估可靠可扩展。

04:00
ArXiv AI

Multi-level Self-supervised Pretraining on Compositional Hierarchical Graph for Molecular Property Prediction

04:00
ArXiv AI

XSearch: 通过概念到代码对齐的可解释代码搜索

XSearch通过概念对齐重构代码搜索,实现可解释性,在分布外基准上性能提升15倍。