5394 条条目 · 106 个活跃源
2026年7月20日
04:00
arXiv cs.AI

GraphDx:面向顺序诊断的成本感知知识增强多智能体框架

通过知识图谱与多智能体协作,GraphDx将诊断成功率提升至79-93%,同时降低测试成本20-54%。

04:00
arXiv cs.AI

对可信AI工具、认证框架及实施鸿沟的批判性分析

可信AI工具和认证框架存在伦理焦点失衡、生命周期覆盖不均等鸿沟,需扩展目标、嵌入全周期并促进多元参与。

04:00
arXiv cs.AI

因果审计:通过目标感知因果链构建实现显式可审计的图推理

提出显式可审计因果推理框架,用目标感知因果图与路径聚合突破LLM局限,提升可解释性。

04:00
arXiv cs.AI

逻辑、优化与人工智能

逻辑与优化结合提升规则AI透明度,综述合作领域与方法,展望未来。

04:00
arXiv cs.AI

ToolVerse:为智能体强化学习解锁大规模环境与长期任务

ToolVerse框架通过构建大规模工具环境和长期任务,显著提升智能体在动态环境中的推理能力。

04:00
arXiv cs.AI

SeerGuard:基于世界模型预测的移动GUI代理安全框架

通过预执行指令筛选和动作风险评估,SeerGuard框架显著提升移动GUI代理安全性与实用性。

04:00
arXiv cs.AI

面向信息抽取的智能体模型的行为可控性:从固定工作流到反思型智能体

研究LLM智能体在信息抽取中的行为可控性,比较固定工作流与反思型智能体,评估过程行为及任务改进效果。

04:00
arXiv cs.AI

基于隐式神经表示的数据驱动视频编解码器

用SIREN网络联合压缩视频音频,蒸馏量化后压缩比达2.61,视频PSNR超28dB。

04:00
arXiv cs.AI

基于形式化基础的ODRL评估器:实现与比较

首个基于形式语义的ODRL评估器,支持全部规则类型,高效实现访问控制与监控,性能优于现有系统。

04:00
arXiv cs.AI

SciForge:面向科学发现的AI原生多模态工作台

AI原生多模态科学工作台,集成模块化服务与可审计决策,助力基因发现、蛋白质设计等科研场景。

04:00
arXiv cs.AI

协调AI安全阈值

提出协调AI安全阈值方法,针对滥用风险基于预期伤害建模,自动化研发基于进展率,解决阈值不一致与逐底竞争。

04:00
arXiv cs.AI

CRAFT:聚类评分标准以诊断大语言模型薄弱能力并生成针对性微调数据

通过聚类评分标准能力描述,诊断LLM薄弱节点,生成针对性微调数据,在金融法律领域提升模型性能。

04:00
arXiv cs.AI

Empathy as Predictive Misalignment Tolerance: A Co-Regulation Framework and the Regime Structure of Dialogue Repair

04:00
arXiv cs.AI

拓扑斯因果模型的立方体形式化:干预、层黏合与直觉主义do演算

机器验证拓扑斯因果模型核心:干预、层黏合、内语言,修复拓扑缺漏,证明j稳定性及上下文性阻碍。

04:00
arXiv cs.AI

云端可扩展的LLM智能体工具访问

提出MCP网关系统,解决服务集成、协议兼容与工具选择难题,实现98%召回、8.9倍加速及23.8倍降耗。

04:00
arXiv cs.AI

AEGIS:面向开源液体处理机器人的实验感知协议验证与运行时监控

AEGIS双层守护:LLM+规则库验证协议(F1=0.97),PCA模型监控物理错误(F1=0.71),开源首个统一方案。

04:00
arXiv cs.AI

基于反例增强草稿的智能体综合

该方法通过反例修正代码草图,保留审查后的策略,减少重复工作,提升修复效率。

04:00
arXiv cs.AI

地图作为提示:面向跨场景无线定位的多模态空间信号基础模型学习

提出SigMap模型,通过循环自适应掩码与地图提示框架,实现跨场景无线定位零样本泛化,性能显著领先。

04:00
arXiv cs.AI

AuEmoChat:面向对话语音合成的真实情感理解与渲染

AuEmoChat通过离散情感令牌与上下文合并,实现对话语音的真实情感渲染,性能超越现有方法。

04:00
arXiv cs.AI

社会文化对意见形成的影响:口碑传播、大众媒体与行为发展

口碑与媒体影响多元群体意见形成,揭示社会分裂与代沟。

04:00
arXiv cs.AI

用量子Fisher信息重新思考量子持续学习

提出QEWC,用量子Fisher信息正则化,通过量子态几何识别参数重要性,有效缓解遗忘且抗噪。

04:00
arXiv cs.AI

光学相干断层扫描中跨域视网膜层分割的空间归一化

研究空间归一化预处理提升OCT视网膜层分割的跨域泛化性,并提出无标注的拓扑质量评估指标。

04:00
arXiv cs.AI

低压电网中基于强化学习的拥堵管理的鲁棒性

结合随机森林预分类与强化学习控制器,噪声鲁棒,模型不匹配下仍有效缓解违规。

04:00
arXiv cs.AI

当模型合并可与联合多任务强化学习相媲美:任务向量几何分析

模型合并媲美联合多任务RL,专家任务向量近正交且方向支持解耦,合并方法效果无差异。

04:00
arXiv cs.AI

Muon何时助力智能体强化学习?

Muon在智能体强化学习中可显著提升成功率,效果依赖学习率和优势估计器,低学习率下表现更优。

04:00
arXiv cs.AI

RAD: 检索高质量演示以增强决策

提出RAD,通过检索高回报状态生成子轨迹,提升离线强化学习泛化能力。

04:00
arXiv cs.AI

RL-Struct:面向LLM可靠结构化输出的轻量级强化学习框架

提出RL-Struct框架,用GRPO和分层奖励对齐结构约束,减少38%显存,JSON任务达89.7%结构准确率,自组织学习先语法后语义。

04:00
arXiv cs.AI

评估开放权重大语言模型生成自动驾驶汽车漏洞的结构化威胁信息

评估11种开放权重LLM生成CAV漏洞的STIX结构化信息,单模型SDO和CWE的F1达0.94和0.99,但MITRE ATT&CK映射困难,多智能体方案部分提升。

04:00
arXiv cs.AI

通过文本-关卡-草图共享表征的人类对齐过程性关卡生成强化学习

提出VIPCGRL框架,利用多模态共享嵌入与对比学习实现人类对齐,性能优于基线。

04:00
arXiv cs.AI

支付宝支付集成基准测试(Alipay-PIBench):面向编码智能体的真实支付集成评估

支付宝支付集成基准测试Alipay-PIBench评估编码智能体,带技能下平均通过率提升10.31%,最高91.37%。

04:00
arXiv cs.AI

FAIR_XAI: 通过可解释性提升多模态基础模型在健康评估中的公平性

VLM在健康评估中存在性能差异和偏见,XAI干预效果有限,需联合优化准确率、公平性和泛化性。

04:00
arXiv cs.AI

中文标题:为什么CNN擅长特征提取?一个数学解释

中文摘要:通过新数学模型证明,卷积神经网络可零误差解决图像分类任务,因能实现检测特征的分段线性函数。

04:00
arXiv cs.AI

毒化以检测:联邦学习中的目标过拟合检测

提出三种检测方法,能在1-2轮内有效识别协调者诱导的目标过拟合,F1达0.7。

04:00
arXiv cs.AI

CTC:合作多智能体强化学习的复合任务挑战

提出复合任务挑战(CTC),强制分工与合作,现有合作MARL方法全部失效,指导方案可解但次优。

04:00
arXiv cs.AI

MAnchors:基于记忆的锚点加速——规则重用与变换

通过存储和变换规则,大幅缩短解释生成时间,保持保真度和可解释性。

04:00
arXiv cs.AI

AuditVotes: 通过高效增强与条件平滑提升GNN的可证明鲁棒性

AuditVotes框架整合图重连增强与条件平滑,同时提升GNN的干净准确率和认证鲁棒性,理论保证且效果显著。

04:00
arXiv cs.AI

延迟-响应理论模型:通过响应准确性与思维链长度评估大型语言模型

LaRT模型联合建模响应准确性与思维链长度,引入能力与速度相关参数,提升评估准确性

04:00
arXiv cs.AI

PASs-MoE:通过路径激活子空间缓解路由与专家错位共漂移的持续学习新方法

提出PASs-MoE,用路径激活子空间校准路由并稳定专家方向,提升持续学习抗遗忘能力。

04:00
arXiv cs.AI

中文标题:嵌入空间中的捉迷藏:基于几何的大语言模型隐写术与检测

中文摘要:提出低可恢复性隐写术,用嵌入空间替代任意映射,并通过线性探针检测微调后内部签名,准确率提升33%。

04:00
arXiv cs.AI

非弹性本构Kolmogorov-Arnold网络:一种自动发现可解释非弹性材料模型的通用框架

iCKANs自动发现材料弹性与非弹性本构定律,准确捕捉粘弹性行为,保持物理可解释性。

04:00
arXiv cs.AI

GeoRouteNet:面向几何的非自回归神经求解器,用于欧几里得旅行商问题

GeoRouteNet利用几何特征与多候选强化学习,在TSP-50训练后,TSP-100和TSPLIB上分别降至1.26%和3.60%的差距,优于基线方法。