从特征交互到特征传输——可扩展推荐模型的统一模块
提出特征传输范式及CRAFT模块,将非序列特征作为上下文控制器,提升推荐精度与可扩展性。
MCP到A2A智能体配置中的共享标签与逐字字段外传:一项受控多模型研究
研究发现,在MCP-A2A配置中,“公开可分享”标签与逐字外传增加相关,效果依模型而异,属关联而非因果。
会建模智能体的智能体:面向6G网络心智理论的五项原则
6G网络:消息是推理痕迹而非事实。以细胞层认知信道凝练五项原则:认知SNR勘破幻觉,二阶心智纠偏,谱隙定一致性。
面向工业标准电网信息与交换模型问答的种子锚定预算受限图渲染
种子锚定图渲染:预算内保留查询证据,CIM/CGMES多跳全保留,准确率0.45升至0.97,优于主流图RAG,无需LLM构图。
Zeta-Lite:面向智能体记忆的并发、可分支浏览器内SQL数据库
提出浏览器内SQL数据库,支持快照隔离并发事务与写时复制分支,适合智能体记忆。
用于共享GPU上并发异构AI推理可扩展运行时调度的平均场代理建模
提出平均场代理模型,用局部配置与GPU整体状态预测并发异构推理性能,采样量近线性增长,调度近最优且无违规。
李群流形上的薛定谔桥用于概率内蕴生成
提出李群流形上针对动力学薛定谔桥的概率内在生成法,处理部分观测,含两种算法、误差界,实验验证可行。
超越模态和谐:面向冲突感知多模态推荐的正交净化与拓扑引导MoE
提出正交净化与拓扑引导专家混合模型,去除模态噪声并自适应融合,解决冲突,提升推荐鲁棒性。
大型音频语言模型的听觉错觉基准
首个听觉错觉基准,涵盖十种错觉,对比人类与模型反应,揭示LALM与人类知觉差异。
面向可解释AI来源取证的合成媒体逆合成
提出固定生成器下的自引用逆合成框架,通过编码解码一致性验证,无需水印即可实现合成媒体的可解释来源取证。
DiffuSearch:混合轨迹规划如何在扩散与动作空间中受益于对齐目标
提出DiffuSearch混合规划器,统一生成与优化的驾驶目标,结合扩散模型与MCTS,显著减少碰撞并提升舒适性,在复杂交互场景达先进水平。
CrashDiffuser:面向细粒度安全关键交通场景生成的VLM引导碰撞意图推理
VLM引导扩散框架生成指定接触区域的碰撞场景,单次碰撞率50.33%,三次67.98%
迈向可信自主机器人:基于可解释AI的决策框架
自主机器人深度学习难审计,TRACE框架用四层可审计机制,实现98%以上证据可追溯与决策可重构,满足欧盟AI法案透明要求。
When Can Large Reasoning Models Save Thinking? Mechanistic Analysis of Behavioral Divergence in Reasoning
AI副驾驶中用户偏好的建模与优化:综合综述与分类法
综述AI副驾驶用户偏好建模与反馈优化,提出交互三阶段分类法,为个性化助手设计提供统一基础。
隔离作为LLM-Agent系统安全的第一性原则:概念、分类、挑战与未来方向
将隔离视为LLM-Agent系统安全第一性原则,提出五边界分类法,分析跨边界失效路径,规划先验隔离研究议程。
逐步思考-批判:单一大语言模型中的交错推理与自我批判
提出STC框架,让单一LLM逐步推理并同步自我批判,经强化学习联合优化,数学推理Pass@1提升7.2%,优于外部验证模型。
超越对话时间:面向个性化LLM代理的时间语义记忆
提出时间语义记忆框架,解决时间不准确与碎片化,支持持续性记忆,准确率最高提升12.2%
从高维空间到可验证的ODD覆盖:面向安全关键的AI系统
提出离散化、约束过滤和关键性降维结合的运行设计域覆盖验证法,满足EASA完整性要求,实现高维空间验证。
自适应图岛演化:基于大语言模型的自动特征工程
提出TOPOFE框架,用图结构多岛演化搜索自动特征工程,动态学习迁移拓扑,在29个数据集上优于多数现有方法,特征冗余低、覆盖高。
PIE-APT: 基于增量推理的时序动态知识图谱上的溯因规划
提出PIE框架,在时序动态知识图谱上通过增量推理实现溯因规划,规避可判定性难题,性能优于经典规划。
基于深度去噪自编码器的动静脉瘘无创血流检测
用深度去噪自编码器学习动静脉瘘听诊特征,隐表示识别准确率达0.93,泛化性好,可扩展。
基于熵的选择性智能体引导:从不完美VLM教师学习自主策略
熵引导选择性咨询:仅在不确定时请教教师,用环境优势加权其建议,蒸馏成轻量策略。测试无需教师,优于无引导。
我们为何需要AI韧性社会——大型语言模型侧写
侧写显示大语言模型流畅虚构、强化偏见、侵蚀能力,故提出认知主权等四大支柱构建AI韧性社会。
预测误差不足:评估因果估计中的干扰函数预测
模拟表明预测误差不直接反映因果估计质量;XGBoost点估计最优,DML置信区间覆盖更佳。
大语言模型中的长程状态跟踪:经由深度依赖的工具调用序列执行MD5
让大模型经196次依赖工具调用算MD5,证明可跨调用精确保持状态;成败在于保留推理与投票纠错。
针对老年人金融诈骗的渐进式增量风险评估:基于指令微调小型语言模型
提出逐轮累积风险评估框架,微调小型语言模型,动态监测多轮老人金融诈骗,支持资源受限的终端部署。
AI发病与死亡:临床AI失败审查框架
提出AI M&M无责框架,系统回顾临床AI失败案例,分四维分类并追踪整改,将个体错误转为机构学习。
非对称性:自发欺骗与指令欺骗
研究发现大模型自发欺骗与指令欺骗共享部分方向,但检测与干预存在跨场景不对称。
IMPACT:注意力即交互图,实现可扩展的交互感知世界模型训练
提出利用注意力先验与局部误差构造交互图,重加权去噪监督,无需外部标注,提升交互真实性与物理合理性。
不同表征学习目标从同一心理测量数据中恢复出不同的潜在结构
不同表征目标从相同数据恢复不同潜在结构:对比增强师生匹配,减弱表型;多任务折中。
LLM驱动的自动驾驶车辆在行人让行中继承人类驾驶员偏见:新基准的结果与启示
提出两种模型偏见测试法,发现让行决策受行人性别、族裔、宗教、残疾等影响,质疑常识模型范式。
ReDeck:文档转幻灯片的步骤级渲染反馈精炼方法
提出ReDeck,将幻灯片修订拆为原子编辑并逐步获取渲染反馈,多粒度纠错,显著优于现有生成代理。
人机共同诠释以促进可信AI:一种诠释学视角
指出大模型输出常被误当作确定意义,缺乏诠释框架与溯源;基于哲学诠释学,提出人机协同诠释的设计原则,以保障问责与可辩护性。
答案并非论证
正确答案能提升结论一致性检查,而非独立验证推理;正确结论不代表推理健全。
面向持续个性化的假设引导自我蒸馏
提出假设引导自我蒸馏框架,从异构信号推断不确定感知的偏好假设并修正,实现持续个性化,优于基线。
市场目录的自动研究:从传统表单到AI原生匹配
面向双边市场,以LLM推断意图,自动生成供应商分类法,迭代评估,部署132个职业,实现AI原生匹配。
不可逆性预算:智能体操作系统的机群级风险核算与准入控制
提出不可逆性预算,按机群累计残余风险并拒绝超支,优于逐效应门控;核心难题是保守依赖感知定价。
SlideBank:用于一致全切片推理的持久分层证据库
免训练将全切片转为持久分层证据库,问题路由与跨级共识推理,精度提升且复用证据降成本。
mimeo:将公开专家语料编译成智能体技能并测试迁移效果
mimeo将专家公开语料编译成智能体文件,知识访问强、幻觉少;但判断迁移未证实。
RestoreBench:AI智能体能否恢复潮流收敛?
提出基准,评估不同大语言模型在聊天、单智能体和多智能体架构下恢复潮流收敛的能力,覆盖两电网各46案例。
一种用于量子联邦学习的稳定聚合方法
针对量子联邦学习的不稳定问题,提出自洽中点聚合法,融合QoS加权与环形参数聚合,提升稳定性并保持精度。
SpecMind:基于多智能体混合检索增强生成的频谱智能
提出多智能体混合检索增强生成系统协同处理频谱异构数据性能超传统基线胜率达八成以上
SAGE:基于状态、具有弃权意识的任务型对话智能体评估
以状态为据且可弃权:将差异转为原子准则,符号与神经验证器级联裁定;核心版零成本决策多数,优于大模型裁判。
Conversation Coach:一种支持语音的AI系统,用于练习棘手的职场对话
提出语音AI系统Conversation Coach,助管理者演练棘手职场对话。端到端延迟低但级联推理更优,后者已部署,四万余管理者使用半年。
Wave Function Backpropagation with Explicit Temporal-Interval Dynamics
检索增强生成中基于文档关系图的反馈辅助信任传播
提出基于文档关系图的信任传播方法,以少量人工反馈为锚,多跳估算文档可信度,提升检索质量和答案准确率。
REVISE:智能体工作流中在线修订的有效性引导恢复
Revise通过依赖传播识别受影响工作,仅重算受影响区域,在保证无陈旧输出的同时减少模型调用40%以上。
无对齐的一致性:对项目敏感的语言模型与随机不可区分
项目敏感性不足以证明任务能力:21个组合均敏感,但8个与随机无异,5个更差,相关仅0.30,即无对齐一致性。
苏格拉底走向核安全:基于脑感知比较学习情境中的AI交互策略
比较三类AI交互后发现:无限制聊天学习收益最高,但脑电投入低,其成功或源于即时后测而非深层学习。