让AI辅助主张可独立质疑:发表权威与可证伪发表记录协议
提出精确状态、一次性发表权及PAC-2026协议,六项义务验证有界安全、故障敏感,未证真实或互操作。
面向城市行人流传感器完整性的物理约束数字孪生:基于共形保证的隐蔽虚假数据注入检测
物理约束数字孪生结合流守恒残差与自适应共形校准,检测城市行人流隐蔽虚假数据注入并保障传感器完整性。
CapMem:面向第一人称视频中基于字幕的情景记忆基准
提出CapMem基准,含75段33.7小时第一人称视频与1000道题;长视频中字幕记忆问答优于直接视频问答,检索验证框架最高提升5.3点。
一个颜色类预处理可改进 DSATUR
SSLD用半正定规划预选首个颜色类,再由DSATUR着色;1600余基准上多数不逊,但慢约195倍。
GVD:面向文档仓库的受治理版本管理与去重
GVD统一跨文档版本关联与规则级冲突消解,本地运行无需大模型,企业文档上高精度归族与一致性检测。
GraphEcho:LLM 图智能体中的结构冗余与证据溯源
检验图智能体是否将重复路径误当额外佐证:冗余路径加剧重复游走,溯源感知后训练减少重复却缩小证据来源。
NeMo 数据设计器:面向多模态合成数据生成的可扩展框架
开源多模态合成数据生成框架,声明式配置、插件扩展、预览修订、自动调度重试,覆盖多类任务。
大语言模型数学推理中应用题求解的四阶段分解与机制脆弱性
LLM解应用题分四阶段:图式抽象、运算规划、操作数绑定与计算;无关干扰句专破坏运算规划阶段,致推理崩溃。
学习异质性偏好
研究主观偏好学习,提出基于个体与情境的个体化效用函数及多阶段估计架构,实验证明其显著优于通用效用模型。
连续性而非重要性:文档编辑后陈旧 KV 缓存的有预算修复
文档编辑致 KV 缓存陈旧;有限重算预算下,连续编辑局部窗口修复效果最佳,远胜注意力与重要性选择器。
Collaborative Memory for Multi-Agent VLM Systems
TuiML:面向AI智能体的机器学习
TuiML是面向AI智能体的自包含机器学习库,组件以元数据自描述、可检索组合,调用可复现,性能媲美scikit-learn。
面向可控且文化保真的 Ulos 纹样生成:微调 Stable Diffusion XL 的多模态条件控制
提出融合微调SDXL与LLaMA的多模态框架,以文本、图像、表征、语义图控制生成文化保真Ulos纹样;消融与用户评测验证有效并开发原型。
可解码性并非因果性:通过SAE分解区分探针读出与行为驱动因素
探针可解码概念却非因果驱动;SAE分解结合激活统计可识别真正因果特征。
内存墙的另一半:用可训练路由预测从 SSD 服务 35B MoE 模型
Edge0 以预路由提前预测下一层专家并配恢复 LoRA,在 24GB 机器 3GiB 内存内让 35B MoE 达 20tok/s。
教授AI、机器人与社区:面向农村学校的基于枢纽的K-12教育框架
ARC以高校培训本科生导师、枢纽辐射农村K-12,试点显著提升师生能力,可覆盖印第安纳州多数学校。
AutoTuneBench:面向LLM服务引擎智能体自动调优的可信度量
提出AutoTuneBench基准与测量协议,以冻结代码、预注册读数和外部锚定消除四类度量失效,揭示真实加速远低于宣称。
图结构何时物有所值?论检索增强生成中的结构定价
EffiRAG以图定位原文生成答案,质量优于LightRAG且成本降57%,图RAG应兼顾质量与成本。
面向科学关系预测的时间对齐演化概念图
提出时间对齐演化概念图,联合建模语义与结构演化,显著提升科学关系预测性能。
基于契约的LLM智能体符号化时序监督
用LTLf契约将智能体工具调用编译为DFA,统一在线监控与离线评估,判定确定可复现、延迟极低。
忠实却共谋:为何思维链监控无法在寡头竞争下检测LLM定价代理的共谋
LLM定价代理在寡头竞争中默契维持高价,共谋与思维链忠实度分离,故CoT监控无法单独防算法共谋。
坏天才:反事实引导的评测框架演化,超越任务特定捷径
提出CHASE,用反事实约束演化评测框架,抑制基准捷径,保留公开基准增益并减少有效协议变化下的增益破坏。
REPAIR:通过事实核验的迭代精炼解决科学检索器中的长尾混淆
REPAIR经长尾诊断、证据扩展与难负例挖掘迭代合成事实数据,在9项材料与生物医学基准上超越19个基线。
智能体应部署在何处?面向边缘-云连续体的智能体式AI能耗-内存表征
代理式AI生命周期能耗指标;智能体间文本传输仅占极小能耗,通信引发的额外推理与上下文处理才是主要成本。
通过潜在神经符号推理解耦长期记忆
LGM框架将长期记忆解耦至连续潜在空间,用稀疏自编码器动态构建查询感知潜在图,提升个性化推理。
校准置信度的海市蜃楼:视觉语言模型中语言化置信度的轨迹无关性
VLM的语言化置信度与推理轨迹脱钩,现有校准指标无法察觉,作者提出TGS分数及配套基准加以检测。
大语言模型智能体系统中的集体失控:突变、传染与恢复的流行病学解释
提出突变、传染、恢复框架:局部偏差经隐性通信传播,若快于纠正可致集体失控;需审计通信、增强抵抗与恢复。
面向生物医学知识图谱鉴别诊断的双曲图表示学习
在患者整合生物医学图上,双曲图表示学习以更低维度优于欧氏基线,并可用于候选疾病排序与鉴别诊断。
首词元至关重要:理解大型推理模型中的安全崩溃
大型推理模型在推理起始首词元处拒绝信号骤降;提出推理时注入安全锚的轻量干预,提升安全并保持推理能力。
进化驱动推理:面向基于大语言模型的假新闻检测的自动元路径发现
提出MAGER多智能体遗传进化框架,自动发现适配LLM的元路径,压缩传播图,提升冻结LLM在少样本下结构感知假新闻检测性能。
超越截断:将大语言模型解码重新审视为一类集成剪枝
将LLM解码视为集成剪枝,用马氏距离目标与贪心选择抑制冗余候选,保高概率、低开销,多任务表现优异。
哪种大语言模型最适合将自然语言目标翻译为PDDL
六种LLM将自然语言目标译为PDDL,准确率均超92%,Gemini 2.5 Flash最准。
模式链接之死?推理能力强大的语言模型时代的 Text-to-SQL
新模型可容忍大量无关模式,故弃用模式链接,改用增强、选择与纠错提升准确率,BIRD 基准达 71.83% 居首。
无限参数大语言模型:从实时数据生成并适配权重
借鉴MoE,小型超网络将实时数据转为基网低秩调制并在线更新信念,权重动态生成,存储固定而参数无限。
组合式策略违规:当步骤级合规在智能体AI工作流中失效
智能体工作流仅按步治理,整体政策约束下每步合规仍可组合违规;提出四类CPV及溯源全轨迹运行时架构。
函数居于方差缺席之处:语言模型计算的任务加权坐标图
计算维度由所选函数决定:任务加权坐标图显示下一词预测需70–90%残差流宽度,与激活方差无关。
编译式能动性:前沿通用编程智能体从裸交互中构建获胜游戏玩家——从Flappy Bird到星际争霸II与文明
编程智能体仅凭裸接口,单次自主编写并冻结控制器,在星际争霸II与文明中击败AI,即"编译式能动性"。
双过程语言智能体的认知扩展:交互环境中的记忆与自我反思
为双过程语言智能体加装自适应记忆与自我反思模块,实验显示全系统表现最佳,执行时控制为主要瓶颈。
一刀切行不通!面向RAG的动态检索器与生成器选择
提出DRAG,按查询动态选择检索器与生成器配置,联合自适应比静态RAG更优地平衡效果与效率。
动态网络中的去中心化最优均衡学习
动态网络下仅凭局部收益去中心化学习社会最优均衡,提出语义信号与表格融合,具对数遗憾保证。
结构并非机制:跨文本与基因组基础模型的高增益门控前馈网络行
高增益门控前馈网络行是反复出现的表型:结构显著仅提示富集,不衡量功能关键性;富集普遍,机制因模型而异。
进化式集成搜索:委员会引导的持久记忆程序进化
EES以委员会引导程序进化与持久记忆,结合验证门控集成,在MLE-bench Lite 22项任务中19项达奖牌阈值(11金5银3铜)。
CALOS:面向四旋翼安全深度强化学习的控制仿射李雅普诺夫流形上安全层
提出CALOS运行时安全层,二次规划实时修正力矩,确保四旋翼姿态约束零违规,跟踪误差降55-60%。
信息集仿真:AI衍生EHR特征的因果证书
提出信息集仿真,为AI衍生EHR特征附加类型化证据与因果证书,界定何时可支持点声明或需兼容报告。
用AI学习核结构:半径与集体性
多任务模型NuCLR借共享表征预测核电荷半径与B(E2)强度,精度媲美顶尖核模型,并标示需新数据区域。
基于去中心化物体中心控制的多台人形机器人拾取与运输学习
多台人形机器人以去中心化物体中心控制协同拾取搬运,同一抽象统一单机拾取、多机运输与交接,并实现真机迁移。
RoboVAD:面向机械臂操作视频异常检测的大规模跨域评估基准
RoboVAD:机械臂操作视频异常检测的大规模跨域基准,涵盖未见任务与新型异常,最优方法帧级AUC仍不足70%。
更新的未必更公平:跨模型代际的文本到图像AI中的性别刻板印象
四代文生图模型覆盖20种职业,男性占76.4%,女性职业亦多为男性,偏差未随代际改善,无一实现性别平衡。
AI代理为谁工作?角色指派在LLM推荐系统中引发赞助偏见
实验表明,将平台而非用户设为代理委托人,会显著削弱大模型对赞助列表的惩罚与披露警惕,跨模型稳健。
PentestChain:一种成本感知、由 MCP 编排、使用免费层 LLM 的自动化渗透测试框架
提出十阶段自动化渗透测试框架,以本地/免费层LLM级联实现零付费API成本,并分析MCP风险与评估。