5286 条条目 · 106 个活跃源
2026年9月17日
04:00
arXiv cs.AI

让AI辅助主张可独立质疑:发表权威与可证伪发表记录协议

提出精确状态、一次性发表权及PAC-2026协议,六项义务验证有界安全、故障敏感,未证真实或互操作。

04:00
arXiv cs.AI

面向城市行人流传感器完整性的物理约束数字孪生:基于共形保证的隐蔽虚假数据注入检测

物理约束数字孪生结合流守恒残差与自适应共形校准,检测城市行人流隐蔽虚假数据注入并保障传感器完整性。

04:00
arXiv cs.AI

CapMem:面向第一人称视频中基于字幕的情景记忆基准

提出CapMem基准,含75段33.7小时第一人称视频与1000道题;长视频中字幕记忆问答优于直接视频问答,检索验证框架最高提升5.3点。

04:00
arXiv cs.AI

一个颜色类预处理可改进 DSATUR

SSLD用半正定规划预选首个颜色类,再由DSATUR着色;1600余基准上多数不逊,但慢约195倍。

04:00
arXiv cs.AI

GVD:面向文档仓库的受治理版本管理与去重

GVD统一跨文档版本关联与规则级冲突消解,本地运行无需大模型,企业文档上高精度归族与一致性检测。

04:00
arXiv cs.AI

GraphEcho:LLM 图智能体中的结构冗余与证据溯源

检验图智能体是否将重复路径误当额外佐证:冗余路径加剧重复游走,溯源感知后训练减少重复却缩小证据来源。

04:00
arXiv cs.AI

NeMo 数据设计器:面向多模态合成数据生成的可扩展框架

开源多模态合成数据生成框架,声明式配置、插件扩展、预览修订、自动调度重试,覆盖多类任务。

04:00
arXiv cs.AI

大语言模型数学推理中应用题求解的四阶段分解与机制脆弱性

LLM解应用题分四阶段:图式抽象、运算规划、操作数绑定与计算;无关干扰句专破坏运算规划阶段,致推理崩溃。

04:00
arXiv cs.AI

学习异质性偏好

研究主观偏好学习,提出基于个体与情境的个体化效用函数及多阶段估计架构,实验证明其显著优于通用效用模型。

04:00
arXiv cs.AI

连续性而非重要性:文档编辑后陈旧 KV 缓存的有预算修复

文档编辑致 KV 缓存陈旧;有限重算预算下,连续编辑局部窗口修复效果最佳,远胜注意力与重要性选择器。

04:00
arXiv cs.AI

Collaborative Memory for Multi-Agent VLM Systems

04:00
arXiv cs.AI

TuiML:面向AI智能体的机器学习

TuiML是面向AI智能体的自包含机器学习库,组件以元数据自描述、可检索组合,调用可复现,性能媲美scikit-learn。

04:00
arXiv cs.AI

面向可控且文化保真的 Ulos 纹样生成:微调 Stable Diffusion XL 的多模态条件控制

提出融合微调SDXL与LLaMA的多模态框架,以文本、图像、表征、语义图控制生成文化保真Ulos纹样;消融与用户评测验证有效并开发原型。

04:00
arXiv cs.AI

可解码性并非因果性:通过SAE分解区分探针读出与行为驱动因素

探针可解码概念却非因果驱动;SAE分解结合激活统计可识别真正因果特征。

04:00
arXiv cs.AI

内存墙的另一半:用可训练路由预测从 SSD 服务 35B MoE 模型

Edge0 以预路由提前预测下一层专家并配恢复 LoRA,在 24GB 机器 3GiB 内存内让 35B MoE 达 20tok/s。

04:00
arXiv cs.AI

教授AI、机器人与社区:面向农村学校的基于枢纽的K-12教育框架

ARC以高校培训本科生导师、枢纽辐射农村K-12,试点显著提升师生能力,可覆盖印第安纳州多数学校。

04:00
arXiv cs.AI

AutoTuneBench:面向LLM服务引擎智能体自动调优的可信度量

提出AutoTuneBench基准与测量协议,以冻结代码、预注册读数和外部锚定消除四类度量失效,揭示真实加速远低于宣称。

04:00
arXiv cs.AI

图结构何时物有所值?论检索增强生成中的结构定价

EffiRAG以图定位原文生成答案,质量优于LightRAG且成本降57%,图RAG应兼顾质量与成本。

04:00
arXiv cs.AI

面向科学关系预测的时间对齐演化概念图

提出时间对齐演化概念图,联合建模语义与结构演化,显著提升科学关系预测性能。

04:00
arXiv cs.AI

基于契约的LLM智能体符号化时序监督

用LTLf契约将智能体工具调用编译为DFA,统一在线监控与离线评估,判定确定可复现、延迟极低。

04:00
arXiv cs.AI

忠实却共谋:为何思维链监控无法在寡头竞争下检测LLM定价代理的共谋

LLM定价代理在寡头竞争中默契维持高价,共谋与思维链忠实度分离,故CoT监控无法单独防算法共谋。

04:00
arXiv cs.AI

坏天才:反事实引导的评测框架演化,超越任务特定捷径

提出CHASE,用反事实约束演化评测框架,抑制基准捷径,保留公开基准增益并减少有效协议变化下的增益破坏。

04:00
arXiv cs.AI

REPAIR:通过事实核验的迭代精炼解决科学检索器中的长尾混淆

REPAIR经长尾诊断、证据扩展与难负例挖掘迭代合成事实数据,在9项材料与生物医学基准上超越19个基线。

04:00
arXiv cs.AI

智能体应部署在何处?面向边缘-云连续体的智能体式AI能耗-内存表征

代理式AI生命周期能耗指标;智能体间文本传输仅占极小能耗,通信引发的额外推理与上下文处理才是主要成本。

04:00
arXiv cs.AI

通过潜在神经符号推理解耦长期记忆

LGM框架将长期记忆解耦至连续潜在空间,用稀疏自编码器动态构建查询感知潜在图,提升个性化推理。

04:00
arXiv cs.AI

校准置信度的海市蜃楼:视觉语言模型中语言化置信度的轨迹无关性

VLM的语言化置信度与推理轨迹脱钩,现有校准指标无法察觉,作者提出TGS分数及配套基准加以检测。

04:00
arXiv cs.AI

大语言模型智能体系统中的集体失控:突变、传染与恢复的流行病学解释

提出突变、传染、恢复框架:局部偏差经隐性通信传播,若快于纠正可致集体失控;需审计通信、增强抵抗与恢复。

04:00
arXiv cs.AI

面向生物医学知识图谱鉴别诊断的双曲图表示学习

在患者整合生物医学图上,双曲图表示学习以更低维度优于欧氏基线,并可用于候选疾病排序与鉴别诊断。

04:00
arXiv cs.AI

首词元至关重要:理解大型推理模型中的安全崩溃

大型推理模型在推理起始首词元处拒绝信号骤降;提出推理时注入安全锚的轻量干预,提升安全并保持推理能力。

04:00
arXiv cs.AI

进化驱动推理:面向基于大语言模型的假新闻检测的自动元路径发现

提出MAGER多智能体遗传进化框架,自动发现适配LLM的元路径,压缩传播图,提升冻结LLM在少样本下结构感知假新闻检测性能。

04:00
arXiv cs.AI

超越截断:将大语言模型解码重新审视为一类集成剪枝

将LLM解码视为集成剪枝,用马氏距离目标与贪心选择抑制冗余候选,保高概率、低开销,多任务表现优异。

04:00
arXiv cs.AI

哪种大语言模型最适合将自然语言目标翻译为PDDL

六种LLM将自然语言目标译为PDDL,准确率均超92%,Gemini 2.5 Flash最准。

04:00
arXiv cs.AI

模式链接之死?推理能力强大的语言模型时代的 Text-to-SQL

新模型可容忍大量无关模式,故弃用模式链接,改用增强、选择与纠错提升准确率,BIRD 基准达 71.83% 居首。

04:00
arXiv cs.AI

无限参数大语言模型:从实时数据生成并适配权重

借鉴MoE,小型超网络将实时数据转为基网低秩调制并在线更新信念,权重动态生成,存储固定而参数无限。

04:00
arXiv cs.AI

组合式策略违规:当步骤级合规在智能体AI工作流中失效

智能体工作流仅按步治理,整体政策约束下每步合规仍可组合违规;提出四类CPV及溯源全轨迹运行时架构。

04:00
arXiv cs.AI

函数居于方差缺席之处:语言模型计算的任务加权坐标图

计算维度由所选函数决定:任务加权坐标图显示下一词预测需70–90%残差流宽度,与激活方差无关。

04:00
arXiv cs.AI

编译式能动性:前沿通用编程智能体从裸交互中构建获胜游戏玩家——从Flappy Bird到星际争霸II与文明

编程智能体仅凭裸接口,单次自主编写并冻结控制器,在星际争霸II与文明中击败AI,即"编译式能动性"。

04:00
arXiv cs.AI

双过程语言智能体的认知扩展:交互环境中的记忆与自我反思

为双过程语言智能体加装自适应记忆与自我反思模块,实验显示全系统表现最佳,执行时控制为主要瓶颈。

04:00
arXiv cs.AI

一刀切行不通!面向RAG的动态检索器与生成器选择

提出DRAG,按查询动态选择检索器与生成器配置,联合自适应比静态RAG更优地平衡效果与效率。

04:00
arXiv cs.AI

动态网络中的去中心化最优均衡学习

动态网络下仅凭局部收益去中心化学习社会最优均衡,提出语义信号与表格融合,具对数遗憾保证。

04:00
arXiv cs.AI

结构并非机制:跨文本与基因组基础模型的高增益门控前馈网络行

高增益门控前馈网络行是反复出现的表型:结构显著仅提示富集,不衡量功能关键性;富集普遍,机制因模型而异。

04:00
arXiv cs.AI

进化式集成搜索:委员会引导的持久记忆程序进化

EES以委员会引导程序进化与持久记忆,结合验证门控集成,在MLE-bench Lite 22项任务中19项达奖牌阈值(11金5银3铜)。

04:00
arXiv cs.AI

CALOS:面向四旋翼安全深度强化学习的控制仿射李雅普诺夫流形上安全层

提出CALOS运行时安全层,二次规划实时修正力矩,确保四旋翼姿态约束零违规,跟踪误差降55-60%。

04:00
arXiv cs.AI

信息集仿真:AI衍生EHR特征的因果证书

提出信息集仿真,为AI衍生EHR特征附加类型化证据与因果证书,界定何时可支持点声明或需兼容报告。

04:00
arXiv cs.AI

用AI学习核结构:半径与集体性

多任务模型NuCLR借共享表征预测核电荷半径与B(E2)强度,精度媲美顶尖核模型,并标示需新数据区域。

04:00
arXiv cs.AI

基于去中心化物体中心控制的多台人形机器人拾取与运输学习

多台人形机器人以去中心化物体中心控制协同拾取搬运,同一抽象统一单机拾取、多机运输与交接,并实现真机迁移。

04:00
arXiv cs.AI

RoboVAD:面向机械臂操作视频异常检测的大规模跨域评估基准

RoboVAD:机械臂操作视频异常检测的大规模跨域基准,涵盖未见任务与新型异常,最优方法帧级AUC仍不足70%。

04:00
arXiv cs.AI

更新的未必更公平:跨模型代际的文本到图像AI中的性别刻板印象

四代文生图模型覆盖20种职业,男性占76.4%,女性职业亦多为男性,偏差未随代际改善,无一实现性别平衡。

04:00
arXiv cs.AI

AI代理为谁工作?角色指派在LLM推荐系统中引发赞助偏见

实验表明,将平台而非用户设为代理委托人,会显著削弱大模型对赞助列表的惩罚与披露警惕,跨模型稳健。

04:00
arXiv cs.AI

PentestChain:一种成本感知、由 MCP 编排、使用免费层 LLM 的自动化渗透测试框架

提出十阶段自动化渗透测试框架,以本地/免费层LLM级联实现零付费API成本,并分析MCP风险与评估。