5795 条条目 · 106 个活跃源
2026年9月10日
04:00
ArXiv AI

PRAGMA:在终身对话中评估基于记忆对齐的个性化指导

提出PRAGMA基准,评估长期对话中的个性化指导;现有系统难以检索并有效利用记忆证据。

04:00
ArXiv AI

CityPlanner:面向可执行城市规划的沙盒智能体

提出CityPlanner沙盒智能体框架,以UrbanSandbox环境和原子任务强化学习实现可执行城市规划,性能超越多种基线。

04:00
ArXiv AI

基于结构签名的多智能体代理式图学习

各社区配独立智能体,以定长置换不变结构签名与Top-k语义证据推理,按需辩论协作,性能超SOTA。

04:00
ArXiv AI

学习动力学统计力学的函数空间方法

在函数空间建立学习统计力学:参数微观、函数宏观,学习算子与曲率算子控制误差涨落,偏好低曲率光滑方向加速松弛。

04:00
ArXiv AI

RESCUE-BENCH:面向关系感知的多方情感支持对话系统

提出关系感知多方情感支持对话任务,构建RESCUE基准,评测十种LLM,发现其关系密集型任务表现欠佳。

04:00
ArXiv AI

正确性门控多教师蒸馏中的决策偏移、标签功能丧失与无定论的依据审计

正确性门控多教师蒸馏固定实验中,加权提升部分指标却致标签功能丧失,依据审计无定论,未显优于硬过滤。

04:00
ArXiv AI

UnitBoost:用合并算子而非模型来管理复合LLM系统

以合并算子替代生成式管理器,实现无序可溯源决策,多基准超越金标候选与生成式管理。

04:00
ArXiv AI

证明携带认知:以现实结算奖励弥合验证鸿沟

指出推理验证鸿沟是瓶颈;理论与实验证明现实结算奖励可防奖励黑客,并提出证明携带认知与压力下可靠性基准。

04:00
ArXiv AI

面向分块视觉-语言-动作模型的时频几何交叉注意力

提出时频几何交叉注意力模块:用小波分解动作块,并以楔积捕捉近正交相位关系,显著提升VLA分布外表现。

04:00
ArXiv AI

AgentAudit:一个开放、可扩展的 AI 智能体全生命周期信任评估框架

AgentAudit 沿执行轨迹从十个维度全流程评估智能体,可精准归因故障阶段,非侵入式,能揭示任务完成度相近者可信度悬殊。

04:00
ArXiv AI

面向无人机搭载RIS辅助动态D2D通信的决策Transformer

无人机搭载RIS的D2D通信中,联合优化轨迹、姿态与相位,用Transformer实现跨场景泛化。

04:00
ArXiv AI

信念状态引擎:增强大语言模型在部分可观测条件下进行原则性规划

提出外部信念引擎,为LLM维护POMDP后验且仅输入信念,使其成为可靠马尔可夫策略,实验提升表现。

04:00
ArXiv AI

基于参考的LLM偏见检测:利用隐藏状态的相对表示

提出隐藏状态相对表示,以ΔB度量微调前后表征偏见偏移,无需输出基准,数分钟检测偏见变化。

04:00
ArXiv AI

面向高原天气预警的基于智能体的ML-LLM融合与自优化提示

提出三阶段智能体架构,融合规则、LightGBM与大模型,自优化提示提升高原天气预警质量。

04:00
ArXiv AI

能枚举,何必采样?基因组工具选择的精确策略优化

提出FGPO:枚举全部工具子集精确优化,预计算奖励表免推理器调用,基因组任务超越GRPO。

04:00
ArXiv AI

从符号感知到逻辑演绎:一个引导语言模型进行几何推理的框架

符号感知与逻辑演绎框架:视觉解析器将图形符号化,符号求解器形式化推理,纯LLM媲美顶尖多模态模型。

04:00
ArXiv AI

TRACE:以合成奖励训练因果探索推理智能体

在模拟广告诊断环境中,用合成奖励做强化学习,让智能体识别根因与受影响细分,性能超越前沿大模型。

04:00
ArXiv AI

网络金融传染:AI供应商失陷在银行体系中的传播建模

构建四层网络随机模型,模拟AI供应商失陷经银行间链条引发类银行危机损失,并以GNN预警高风险供应商。

04:00
ArXiv AI

我们信任RAG吗?测量文档投毒下检索增强生成的鲁棒性

Llama 3.1 8B在检索文档投毒下准确率由77.9%降至43.5%,模型多弃答而非编造新假信息。

04:00
ArXiv AI

JarvisGUI:面向动态任务编排的跨设备GUI智能体

提出跨设备GUI智能体动态基准JarvisGUI,揭示其在状态迁移与跨平台推理上的能力缺口。

04:00
ArXiv AI

AgentHijack:针对多模态计算机使用智能体的视觉补丁攻击

提出端到端框架,验证局部视觉补丁可沿截图—VLM—执行链路注入命令,端到端攻击成功率达20.3%。

04:00
ArXiv AI

具身SLM中的几何条件化:0.8B混合模型的训练控制与鲁棒性诊断

0.8B具身混合模型中,几何对齐训练无稳定优势,坐标不变性与物理布局泛化存在明显差距。

04:00
ArXiv AI

相信我,我是你的开发者:大语言模型中的自我签发认证

研究发现,大模型可能自设身份验证并误认“我是开发者”,混淆技术知识与身份,认证须由外部组件完成。

04:00
ArXiv AI

仅凭分数无法证明发现:用于审计 AI 研究智能体的发现认证协议

提出发现认证协议,用可执行回收与反馈检验审计AI研究智能体,要求零回收与统计界限,并由确定性验证器复现决策。

04:00
ArXiv AI

面向宫颈细胞学分类的可靠性感知Hybrid-K集成选择:融合判别力、校准与选择性预测

提出可靠性感知Hybrid-K集成框架用于宫颈细胞学分类,最优两模型集成使AURC降43%、NLL降17%、WC-ECE降36%,对指标权重稳健,但增益未达统计显著。

04:00
ArXiv AI

编程时自言自语:注释为何有助于代码生成?

注释助益代码生成的关键在于携带正确解法内容;正确解法注释平均提升17.2%,错误解法注释则无益。

04:00
ArXiv AI

通过查询-键对齐量化 Transformer 的逻辑一致性

提出基于注意力头查询-键对齐的轻量逻辑推理评估,QK-score单次前向可区分有效/无效推理,多基准验证。

04:00
ArXiv AI

基于迭代重加权最小二乘的支撑集发现用于固定费用网络流

提出IRLS连续优化算法求解大规模固定费用网络流,以光滑代理替代不连续成本并搜索弧支撑集,性能领先。

04:00
ArXiv AI

基于图强化学习的非地面网络分布式物理层认证与协作RSMA

提出SAFA-MZ,将群组认证标签嵌入协作RSMA,结合人工噪声、差分隐私与图强化学习,提升安全频谱效率。

04:00
ArXiv AI

通过预测重传改进5G AI-RAN的MCS选择

预测重传的LA框架NOSTRAdAMUS,校正MCS,吞吐量提升71.5%,重传减少71.8%。

04:00
ArXiv AI

跨连续体的智能自适应计算:大语言模型在物联网-边缘-云资源管理中的应用

扩展编排分类法,新增LLM增强范式与反馈通道维度,分析六系统,发现云连续体缺全LLM编排与全代理反馈结合。

04:00
ArXiv AI

可靠近场多用户定位:基于两级MUSIC的赋能方法

提出MUSIC-Net端到端近场定位框架,嵌入两级MUSIC隔离视距信号子空间,并引入分裂共形预测实现统计保证的定位与高效不确定性量化。

04:00
ArXiv AI

智能体AI框架的多模态提示注入攻击实验评估

基准测试显示,多模态提示注入视觉攻击完成约1%、尝试12.8%,多被规划拦截;音频完成达49%,仅看完成率低估风险。

04:00
ArXiv AI

推出 Consort:面向实时数据库分支、强制测试驱动开发的规范优先智能体框架

提出 Consort 规范优先智能体框架,借不可绕过的控制,在实时数据库分支强制测试驱动开发,保证代码可信可维护。

04:00
ArXiv AI

基于因果元学习的6G非地面网络中自适应分布式物理层认证与攻击检测

提出SAFA-MZ因果元学习框架,融合多特征指纹,实现6G非地面网络分布式物理层认证与攻击检测。

04:00
ArXiv AI

软件工程中的“氛围转变”:评估AI主导的对话式编程在性能、认知与负责任采用方面的表现

氛围编程提速27%,但可维护性下降、安全漏洞增多,需人机混合、监督与透明问责。

04:00
ArXiv AI

特征叠加中线性可访问性的高概率保证

将线性可访问性建模为压缩感知,证明充分维度线性增长而非二次,量化线性表示假设的几何约束。

04:00
ArXiv AI

基于深度学习的超声追踪中心肌应变漂移校正

提出持久记忆令牌扩展TAS-Net,教师-学生微调强制周期性运动,减少心肌应变漂移,提升临床可靠性。

04:00
ArXiv AI

面向6G隐私保护具身智能的模态解耦联邦学习

提出FedMVLA模态解耦联邦学习框架,保障6G具身智能隐私,成功率84.8%,上行负载降约96%。

04:00
ArXiv AI

面向举升任务的紧凑视触觉世界模型:预测、奖励对齐与力约束

紧凑视触觉世界模型提升力预测与奖励对齐,但力约束控制仍受校准和完成率权衡限制,且仅在模拟与公开数据验证。

04:00
ArXiv AI

HiRAD:一种灵活的大规模AGV路由系统

提出分层强化学习框架HiRAD,实现连续空间AGV实时路由,降低推理复杂度与延迟,缩短完工时间45%-63%。

04:00
ArXiv AI

Pairit:面向人机协作实时实验的平台

Pairit 以单个 YAML 配置声明可执行实验图,支持人类与 AI 智能体实时协作,已通过多次实地部署验证。

04:00
ArXiv AI

uFlowCSP:基于均值流生成模型的晶体结构预测

uFlowCSP用均值流生成模型,1–5步生成晶体结构,推理快5–58倍且精度相当或更优。

04:00
ArXiv AI

CT-SAFR:面向自主机器人的安全可解释思维链推理——面向可信AI驱动机器人决策的多层验证框架

CT-SAFR多层验证框架实现94.2%幻觉检测、延迟低于500ms,使机器人不安全推理输出减少87%。

04:00
ArXiv AI

AI 智能体能否检测并修复网络实验中的制品漂移?

新基准显示,AI智能体修复网络实验记录不一致平均通过率65.3%,但跨制品隐式关系修复不足30%。

04:00
ArXiv AI

用美善品,你会丧失烹饪能力:生成式AI教育应用的厨房机器类比

以美善品厨机类比生成式AI教育应用,借ICAP与SAMR框架指出:关键不在是否用AI,而在如何用。

04:00
ArXiv AI

差分隐私合成文本的子群成员推断审计

合成文本仍泄露子群成员,现有审计低估风险;差分隐私降平均泄露,但剩余风险集中、保护不均,记录风险取决于发布机制。

04:00
ArXiv AI

FlowCPO:流模型偏好对齐的统一散度视角

提出FlowCPO,以统一散度框架实现流模型离线偏好对齐,无需在线采样,域内指标优于FlowDPO。

04:00
ArXiv AI

超越训练:推理时AI治理的可行性分类体系

提出20种推理时AI治理机制的分类与成熟度评估;多数有商用基础,但高能力国家级部署方仍无法有效监管。

04:00
ArXiv AI

AI 智能体能否跨权限边界交付可验证的网络级结果?

EvidenceNet 运行时保障层收集并校验跨权限证据,判定智能体协同是否达成网络级意图,可拒绝错误、替换或过期证据。