视觉Token通信中全预算反事实推理的选择性摊销
提出ACV-Gate,选择性摊销全预算反事实评估,以少量候选评估提升视觉Token通信重建质量并降低编码计算。
HCOE:来自生物医学语言模型的双曲临床本体嵌入
HCOE将生物医学语言模型嵌入映射至庞加莱球,以本体对比学习与路径聚合实现层级感知临床概念表示。
为何扩散语言模型中的越狱能够成功:能量景观分析
提出能量景观框架,将越狱归为初始模糊或中途跨越,导出三个免训练检测信号,实验验证互补有效。
思考有助于公平吗?推理标记解决了一些偏见,却制造了更多
思维对反事实公平有不对称双重效应:在九个模型-数据集组合中,新产生的偏见翻转约为被解决的5倍。
SciHorizon-eLab:面向科学具身智能体可扩展基准测试的智能体式协议到任务编译器
提出协议到任务编译器SciHorizon-eLab,将实验协议编译为可验证具身任务,构建300项基准任务,最强策略成功率仅49.7%。
JevSoup:面向免训练 LoRA 组合的系统一路由
JevSoup 免训练框架分离路由与执行,仅凭输入与专家描述选两专家,正交投影等权合并,14项任务精度最高提升1.21%。
在网页图上训练图基础模型
提出Acacia:在网页图上从头训练,免额外训练支持任意特征与多任务,具上下文学习,不依赖LLM。
从点击到跳转:以应用原生深度链接增强移动GUI智能体
提出混合交互新范式:深度链接直航、GUI操作兜底,构建验证目录GUI-Hopper,提升真机任务成功率。
LLM智能体社会中的金融脆弱性:协调失败与稳定机制
LLM智能体在金融环境中易现集体脆弱;三类承诺机制可缓解,但需早期广泛承诺方能稳定。
MoMHa:面向准确率、安全与Token的LLM外围框架多目标优化
提出MoMHa,用单阶段联合奖励搜索LLM外围框架,在17个领域同步优化准确率、安全与Token成本,效果超越所有基线。
基于因子化轴向卷积门控循环单元与动态自适应池化的滚动轴承剩余使用寿命预测
提出因子化轴向卷积GRU与动态自适应池化,增强时频方向特征,提升轴承剩余寿命预测精度。
廉价开放的智能体使LLM污染更难缓解
廉价开放智能体可免费本地运行、性能近商业模型,却难被单一检测识别;需多层检测并重视开放文本分析。
受治理演绎:超越相关性的基于策略的前提授权
提出受治理演绎;构建匹配授权对,消除捷径后线性模型仅50%,符号策略100%,需泄漏审计。
外化CPDAG摘要提升大语言模型因果推断
两轮结构化思考:先外化模式约束的CPDAG摘要再作答,F1最高提升13.4个百分点。
语言推理向量能提升多模态推理能力吗?
LIFT从基座LLM提取推理向量注入VLM语言侧,无需重训即可部分恢复其退化的推理能力。
面向AI增强的协作工程工作流:欧洲漫游车挑战赛的需求与架构
调研ERC 2025的14支队伍104份问卷,识别协作工程瓶颈,提出AI增强工作流的需求与助手架构。
我们在估计哪种影响?反事实设定在数据归因中的作用
影响取决于行为、干预与反事实训练过程;设定不匹配(而非近似误差)才是归因排名分歧的根源。
神经状态预测:阻断脑电基础模型中的捷径学习
提出神经状态预测框架,通过EMA目标编码与身份残差化约束预测目标和上下文,阻断脑电基础模型的捷径学习,在30个下游数据集上宏平衡准确率达63.94%。
面向代码仓库问题定位的语义导航
SemNav结合确定性检索与LLM智能体,通过语义导航图、语义卡片和候选工作区迭代精化,提升问题定位效果。
将偏差纳入考量,实现可持续的大语言模型评估
提出统一潜变量框架,联合建模成对与序数数据并校正位置、冗长等偏差,以极少比较获得可靠排名,更严谨可持续。
SPO:通过Stackelberg程序优化发现自适应大邻域搜索算子
SPO用LLM与Stackelberg博弈发现自适应销毁-修复算子,跨TSP、CVRP超越基线并泛化。
递归自我改进型人工智能的演化安全:分类体系、风险发现与评估
提出演化安全视角,建立递归自我改进 AI 的分类体系、风险发现与评估及治理原则。
G2MAF:面向多智能体流策略的测试时梯度引导
G2MAF以全局归一化投影评论家梯度在测试时协调修正多智能体联合动作,保持可行且贴近冻结策略,多数任务提升。
分段级智能体主题建模:提升数据探索与资源效率
提出SeLATM,用分段级主题生成与智能体反馈精炼主题,在多数据集上性能更优且显著降低LLM资源消耗。
可变对话记录:通过可编辑的会话状态缓解上下文污染
可变对话记录让用户用自然语言修订先前轮次,缓解上下文污染;用户研究显示其更清晰、更易用,减少重启对话。
正确的信息抽取流水线取决于文档类型:小型本地模型的精度—能耗权衡
批处理可降能耗38%—85%且不损精度;版式丰富文档宜用视觉语言模型,近纯文本宜用小型文本模型加廉价解析器。
从皮层区域视角看大语言模型中的层程序
复现PoLar:层块跳过与重复提升性能,但学得路由器单次推理退化为标准前向,通用程序少而脆弱。
完成配对掩盖了封顶失败:选择性上下文投影的 ReVerPi 案例研究
仅看完成配对会掩盖失败:上下文投影省 25% 逻辑 token,却增加请求与开销,须保留所有边界并独立执行两臂。
压缩所见而非所言:面向潜在观测软件工程智能体的锚定上下文蒸馏
LOHA分离压缩历史与精确文本,ACD蒸馏潜在读取并约束行为漂移,降低上下文、提升软件工程智能体效率。
DeepEdu-v1:面向越南教育的高效可扩展智能体大语言模型
DeepEdu-v1面向越南教育,长上下文推理提速近2倍,智能体准确率由70.0%升至79.5%。
不学停止而学会停止:自监督置信度训练提升推理效率
自监督置信度微调无需优化长度或早停,即可在保持精度下减少最多25%推理token。
软件架构中什么仍将属于人类?一项焦点小组报告
焦点小组探讨AI辅助软件架构,认为架构决策、问责与护栏制定仍属人类,提出治理工程与认知债务概念。
编码智能体还不够!面向智能体化云调查的企业安全大脑评估
Sola安全大脑在28项云安全调查任务中覆盖率达0.693,远超通用编码智能体的0.387,成本更低。
"AI 是(不是)新的……":生成式 AI 文化影响的诊断性类比框架
提出诊断框架,从认知场域、治理逻辑、技术机制三坐标分析生成式AI文化影响,区分结构与偶然后果。
提示词最小化:在不牺牲输出保真度的前提下减少输入冗余
研究提示词最小化,将提示压缩至最简信息密集形式,在保持输出保真度的同时降低计算开销与延迟,揭示输入冗余。
神经表征相异性的流匹配框架
流匹配统一多种神经表征距离度量,将其视为不同速度约束下的杰弗里斯散度,便于复杂分布估计和设计新度量。
自适应多分辨率高斯过程:利用天然数据稀疏协方差矩阵实现可扩展精确推断
提出自适应多分辨率高斯过程,用样本锚定的稀疏协方差矩阵实现精确推断,训练O(n log²n)、预测O(log^d n)。
基于排序偏好的时序投票比例代表制
研究排序偏好时序投票的比例代表,建立公理层级,探讨截止方式与未来信息对保证性的影响。
面向上下文感知 XR 接口的基准测试框架
提出 ContextXR 框架,将 XR 应用建模为功能面片图,构建数据集并定义三项上下文建议任务,以导航搜索代价实现可复现评测。
解剖结构感知与灵巧性驱动的手术连续体机器人设计优化
提出RVDSA指标,兼顾解剖与灵巧性优化连续体机器人设计,结肠手术中灵巧性平均提升78%。
Werracle:面向 EVM 智能合约的亚美分、块内 AI 反射预言机与闪电贷断路器
Werracle 为单槽零存储链上 AI 预言机,21,438 gas、亚毫秒响应,可在块内防闪电贷等攻击。
评估即一切:面向多模态自动驾驶
iDriveVLA以统一评估器和渐进训练缓解生成-评估不对称,NAVSIM达94.95 PDMS。
超越最后一棵绒毛树:SustainAI——一种水感知、闭环、对环境负责的 AI 框架
提出水感知闭环框架SustainAI,以关怀设计强化AI用水问责;实验显示推理水足迹差异达11倍,错误输出耗资巨大。
基于脑记录的被感知语音的主体不变跨模态解码
融合fMRI与MEG,提出主体不变跨模态解码法,跨被试语音解码精度显著提升,训练成本降88.8%。
DynBranch:面向动态智能体 LLM 服务的推测性子图复用
为未决分支预先建立稳定寻址,推测执行候选子图并复用结果,按收益准入,平均延迟最多降低32%。
AgentRecommender:LLM智能体赋能用户侧可定制推荐系统
利用LLM智能体的调研能力与内部知识,无需额外数据即可灵活构建用户侧推荐系统,方便用户按偏好定制。
SPADE:突破流行度-相似度前沿,衡量惊喜性推荐
SPADE:将物品映射至二维空间,计算用户帕累托前沿,以正确推荐项到边界的最小欧氏距离均值衡量惊喜性。
重新思考AI驱动系统的数据质量:来自从业者访谈的证据
访谈16名从业者,揭示AI数据质量在可追溯性、评估循环、合成数据、合法性与代表性上的新挑战。
全双工语音模型的声学到文本 KV 压缩
声学到文本KV压缩:用转录文本记忆替代旧声学KV,峰值缓存降64.6%,任务提升且交互相当。
人工智能时代的认知技能:计算机专业学生与专家的看法
研究调查计算机学生与专家对认知技能重要性的看法:AI环境下多数技能重要性将下降,但批判性思维仍关键。