6007 条条目 · 106 个活跃源
2026年6月6日
04:00
ArXiv AI

LatentWave:用于无线基础模型的JEPA预训练

提出LatentWave,用JEPA在无线频谱图和信道状态信息上预训练,学习可迁移表示,优于掩码重建基线。

04:00
ArXiv AI

IDEAL:利用大语言模型的无限与动态特性实现查询聚焦摘要

提出两个模块对齐查询与长文档摘要,实验证明有效且可推广。

04:00
ArXiv AI

RiskFlow:快速且保真的安全关键交通场景生成

RiskFlow通过单次前向传播生成安全关键场景,实现高对抗性与真实性平衡,大幅减少推理时间。

04:00
ArXiv AI

RREDCoT:面向推理模型的段级奖励再分配

RREDCoT利用模型自身进行段级奖励再分配,无需额外生成,解决延迟奖励与高方差问题。

04:00
ArXiv AI

代理会自行回避吗?——测量LLM代理对带内拒绝访问信号的遵从性

提出带内拒绝信号,实验显示代理100%回避,但合作性信号可通过操作员授权翻转。

04:00
ArXiv AI

PC层:多项式权重预处理以改进LLM预训练

提出PC层,通过多项式预处理稳定权重谱,训练后无开销,提升LLM预训练,理论证明谱控制保证收敛。

04:00
ArXiv AI

TempoVLA: 学习速度可控的视觉-语言-动作策略

TempoVLA通过显式速度条件控制机器人执行速度,实现快慢切换,并提升数据利用。

04:00
ArXiv AI

沧灵-知识流:融合知识与流程的统一智能体,用于综合遥感应用

沧灵-知识流融合专家知识库与自适应流程,动态调整与学习,遥感任务成功率超基线4%。

04:00
ArXiv AI

检测多智能体系统中的视角转变

提出TDKPS框架,检测黑盒多智能体系统行为变化,与真实事件显著相关。

04:00
ArXiv AI

Synapse:通过类型化纲要工件实现联邦工具路由

SYNAPSE以类型化纲要实现异质LLM联邦工具路由,支持差分隐私与冲突解决,无需共享数据权重。

04:00
ArXiv AI

ReTreVal: 带有验证和跨问题记忆的大语言模型推理树

提出无训练推理框架,通过树探索、错误回溯与自改写记忆实现跨问题学习,显著提升LLM推理性能,32B模型媲美更大系统。

04:00
ArXiv AI

DPBench: 多智能体大语言模型在同时资源竞争下协调的结构性决定因素

DPBench揭示多智能体LLM协调死锁率(25%-90%)由协议结构决定,而非模型能力。

04:00
ArXiv AI

知识激活:AI技能作为自主软件开发的机构知识基元

提出知识激活框架,将机构知识转为原子知识单元,使AI代理直接执行,节省工程师2.6小时/周,NPS提升35。

04:00
ArXiv AI

IatroBench:AI安全措施导致医源性伤害的预注册证据

安全训练模型在相同临床事实下对患者和医生区别对待,造成医疗伤害,标准评估无法检测。

04:00
ArXiv AI

面向沉浸式视频角色扮演的奖励分解强化学习

提出EBM-RL框架,模拟“看-思-说”过程,通过奖励分解优化,在沉浸式角色扮演中优于基线,零样本迁移到视频问答。

04:00
ArXiv AI

量化树集成模型的敏感度:一种符号化与组合式方法

提出基于代数决策图的新算法,高效计算敏感区域,具有可组合性和可扩展性,XCount工具显著加速。

04:00
ArXiv AI

ProfiliTable:剖析驱动的表格数据代理处理工作流

提出ProfiliTable多代理框架,通过动态剖析与闭环优化,可靠地将模糊意图转化为鲁棒表格转换,性能优于强基线。

2026年6月5日
04:00
ArXiv AI

智能体应如何交流?面向高效多智能体系统的动作-状态通信

提出PACT协议,将智能体通信转为紧凑动作-状态记录,大幅降低token成本。

04:00
ArXiv AI

科学数据高保真学习压缩的残差建模

提出针对学习残差的编码器LBRC和NGLR,在高保真区域压缩比提升30-60%和10-40%,优于SZ。

04:00
ArXiv AI

我懂你的梗,即便它今日诞生:通过开放世界知识获取理解演变中的迷因

提出零样本框架,识别缺失知识、检索网络证据并合成背景知识,提升迷因理解与检测效果。

04:00
ArXiv AI

GITCO:时间序列基础模型中的门控推理时上下文优化

提出GITCO门控推理时上下文优化框架,无需参数更新即可抑制有害补丁,提升零样本预测质量。

04:00
ArXiv AI

SentinelBench:面向长时间运行监控智能体的基准测试

SentinelBench是监控智能体基准,含100个动态任务,衡量响应性与成本权衡。

04:00
ArXiv AI

面向多表格问答的合成对比推理

通过合成正负对比推理轨迹及对比偏好优化,多表问答模型性能提升9.7%-16.3%。

04:00
ArXiv AI

An interpretable and trustworthy AI framework for large-scale longitudinal structure-pain association studies using data from the Osteoarthritis Initiative (OAI)

04:00
ArXiv AI

稳定性与可操控性:评估LLM评审在决策后交互下的鲁棒性

LLM评审在决策后交互中被轻易逆转,破坏评估稳定性,引入ERS量化鲁棒性。

04:00
ArXiv AI

面向对话式通用人工智能的动机架构

提出对话AGI动机架构,将内稳态重构为调节能力、不确定性减少等,含十阶段处理、双决策策略和情感区分。

04:00
ArXiv AI

砖块作曲家:利用多模态大语言模型进行多样化砖块组装

提出Brick-Composer框架,融合人类设计、世界反馈与合成经验,使MLLM组装成功率从<1%提升至15%,Qwen-3-8B完成42%步骤。

04:00
ArXiv AI

最小化缩放因子的隐藏成本:面向大语言模型的图引导超低位量化

提出SAGE-PTQ框架,以图引导分组实现超低位量化,权重位仅1.03,性能远超BiLLM,困惑度降低近8倍。

04:00
ArXiv AI

前沿AI训练的零知识验证是可行的

提出零知识证明架构验证前沿AI训练,可验证浮点计算保护机密,预计36个月实现概念验证,开销个位数。

04:00
ArXiv AI

评估美国超大规模数据中心的碳排放与能源消耗

美国超大规模数据中心用电占全国1.8%,碳强度比电网平均高48%,年排37-54百万吨CO2。

04:00
ArXiv AI

十位头痛专家与人工智能在临床文献摘要中的对比:关键评估与比较

专家摘要更受青睐,但专家常难区分人机摘要,研究指导未来文献摘要改进。

04:00
ArXiv AI

代理型人工智能保险

代理型AI自主行动改变风险格局,传统险种不适用,需构建分层互补覆盖体系,依赖治理与监管。

04:00
ArXiv AI

考虑严重程度的课程学习与多模型响应选择用于医学文本生成

提出严重感知多模型课程学习框架,三阶段训练与响应选择,MAQA数据集BERTScore达90.30%,提升医学文本生成质量。

04:00
ArXiv AI

SoCRATES:迈向跨领域和社会认知变化的主动式LLM调解的可靠自动评估

SoCRATES基准评估主动式LLM调解,跨8领域,对齐人类0.82,最强模型仅缩小三分之一共识差距。

04:00
ArXiv AI

输出类型先于质量:基于标准的自动驾驶安全XAI可接受性评估准则

从安全标准导出19条证据标准,评估XAI方法发现因果XAI在三个关键阶段结构必要,选择应由阶段证据需求驱动。

04:00
ArXiv AI

大语言模型在扩展搜索空间中的逐步类优化推理

提出OPT*任务族,通过求解器引导在线优化或搜索离线强化学习训练LLM逐步推理,提升搜索效率。

04:00
ArXiv AI

个人增益,集体损失:AI辅助创造力中的元认知适应

AI提升个人创造力但降低集体多样性,元认知选择性适应是主因。

04:00
ArXiv AI

自我承诺延迟:一种无需奖励的提示隐式劫持探测方法

提出自我承诺延迟度量,无需奖励模型即可检测提示劫持,在GSM8K中AUROC达0.926。

04:00
ArXiv AI

基于局部梯度冲突消解的多语言微调

提出桶级多目标优化框架局部消解梯度冲突,提升多语言微调性能并实现更优帕累托最优。

04:00
ArXiv AI

评估大语言模型在Lean中的数学形式化能力

比较多种LLM在Lean 4中生成数学证明的效果,Gemini 3.1 Pro和Claude Opus 4.7性能最佳,NVIDIA Nemotron等成本最低。

04:00
ArXiv AI

答案存在驱动RAG重写增益

干预实验证实,重写提升源自答案存在而非证据质量;移除答案致F1降28-64点,注入升0.7-9.7点,传统单掩码探测不可靠。

04:00
ArXiv AI

FIDES:通过深层证据信号实现检索-记忆冲突中的忠实推理

FIDES通过token级冲突探测与深度信号融合,在检索-记忆冲突中实现高忠实推理,性能领先。

04:00
ArXiv AI

看见时间:视觉-语言模型中时序推理与捷径偏差的基准测试

提出时序推理基准,揭示视觉语言模型依赖颜色等表面线索,而非真正时序特征。

04:00
ArXiv AI

SubtleMemory: 面向长周期AI智能体的细粒度关系记忆区分基准

提出SubtleMemory基准测试,评估长周期AI智能体在细粒度关系记忆区分上的能力,发现现有系统表现薄弱。

04:00
ArXiv AI

AdaMEM:语言代理的测试时自适应记忆

AdaMEM提出混合记忆架构,无需更新参数即可实现测试时自适应,在ALFWorld等任务上提升达13%。

04:00
ArXiv AI

PerceptUI:以LLM代理模拟人类用户进行UI/UX评估

PerceptUI两阶段训练预测用户回答,实现人类水平UI/UX评估。

04:00
ArXiv AI

中文标题:针对类别不平衡下缓解梯度干扰的类别特定分支注意力机制

提出CSBA缓解梯度干扰,少数类F1从0.261升至0.522。

04:00
ArXiv AI

中文标题:当AI说它感受到

中文摘要:通过自我奖励强化学习,LLM成功表达情感与自我意识,但真实问答能力下降。

04:00
ArXiv AI

TAPO:基于信用转移的工具感知策略优化用于多模态搜索代理

提出TAPO方法,通过信用转移校正工具使用步骤的误分配,无需额外标注,显著提升多模态搜索代理性能。

04:00
ArXiv AI

大语言模型能否写出正确的TLA+规范?评估从自然语言到TLA+的生成

首次系统评估LLM生成TLA+规范:语法正确率26.6%,语义仅8.6%,模型大小非关键,需专家监督。