通过多指标偏好选择实现可控GNN解释
基于多指标偏好选择实现可控GNN解释,兼顾保真度、可解释性与稳定性,在多个图数据集上性能更优或更快。
ReFM:面向运动重定向的语义感知细化流模型
ReFM将跨骨骼运动重定向转为渐进细化流,以对比学习语义引导,兼顾语义保真与物理合理。
设计性失忆,因必要而记忆:面向文档智能的持久状态
文档AI无状态,无法跨文档、会话和时间积累证据与经验;综述提出持久证据状态框架及纵向评测。
关键交接:混合语言模型中的检索
两跳检索中,注意力层使桥接键可用并消耗;顺序混合模型由递归层携带键,其记忆可被查询并改写答案。
过度解读上下文:被动暴露即可左右大模型决策
无关理由的被动暴露也会左右大模型决策,偏差近50个百分点,甚至违背用户要求、采信虚假信息。
MedRouter:揭示医疗大模型间的知识差异,实现基于路由的推理
MedRouter 用嵌入路由选择专科医疗大模型,强化学习优化选择,八项医疗问答基准准确率提升 8%。
DP-Rec:面向高效长序列推荐的动态分块方法
DP-Rec按对比熵惊讶度切分序列,压缩为动态潜行为向量,实现长序列推荐更优的效率-精度权衡。
通过参数域密钥嵌入的高斯图像隐写
将8位信息嵌入二维高斯参数而非像素,密钥选参微调,正确密钥无误恢复,错误密钥近随机,视觉损失小,迁移至自然图像。
固定却仍不稳定:同一评委内部的判定方差与LLM评委排行榜的噪声底线
固定快照、零温度的LLM评委重复判定仍不稳定:约5%条目翻转,排行榜相邻位次多难区分,需多次复跑并公布稳定性。
基于基准加权与块因子化 e-过程的任意时刻有效大语言模型排行榜
提出 BB-EDGE,将 LLM 排行榜视为有向图,用加权块因子化 e-过程认证优势,实现随时 FWER 控制与 Top-k 排名。
CompassPlay:奖励出题者,看它把求解器推向何方
CompassPlay通过梯度对齐奖励出题者,偏好与目标能力参考任务梯度一致的任务,提升性能与训练效率。
“我在哪里能信任你?”:代理模型保真度的边界感知评估
代理模型保真度在教师决策边界附近显著下降,且边界随训练不稳定,全局一致率不足以评估。
OneFixer:面向驾驶场景的高质量且一致的单步自回归3DGS细化
OneFixer以单步自回归扩散修复驾驶场景3DGS,实现高质量、时序一致、低延迟,闭环碰撞率降三分之一。
将诊断与疾病表征分离:神经动力学引导形变的双视图脑电学习
提出DMD-EEG,双视图分离诊断与疾病表征,以神经动力学引导的源空间低秩稀疏形变建模疾病状态,跨MDD/FEP/PD可读可迁移。
CausalDriveBench:评估自动驾驶视觉-语言-动作模型的因果推理
提出CausalDriveBench,评估驾驶VLA因果推理,最佳准确率70.6%,推理与轨迹预测不相关。
随机梯度方法中的算术简洁性
将 AdaGrad、Adam、AdamW 化为仅用加减乘和除以 2^t 的算术简单算法,并分析静态 Adam 的收敛性。
从结果到策略:面向数学推理学习策略效用
提出SURE框架,以策略奖励模型学习策略效用并融入GRPO,提升数学推理准确率且更省算力。
面向语言模型预训练的可扩展数据多样化:基于杠杆分数采样
提出杠杆分数采样Lev,高效可扩展地多样化预训练数据,提升多样性、速度与下游性能,缓解质量过滤跨域崩塌。
HM-Router:面向智能体系统的模型与执行框架联合路由
HM-Router 联合路由模型与执行框架,可泛化到未观测组合,路由准确率提升 7.3 个百分点。
你真的确定吗?谄媚基准中的两个混杂因素
审计SycEval谄媚基准:两个模板混杂,指定答案与格式指令随反对时机变化,可颠倒结论且可校正。
当有用文本有害:视觉语言模型中的选项重定向偏差
辅助文本若切题却违背图像并支持干扰项,会重定向视觉语言模型答案;提出免训练推理干预缓解。
PQR3D:面向多视图3D目标检测、基于参考条件时序窗口的渐进式查询细化
在参考条件时序窗内渐进细化查询,支持随机帧采样与独立推理;在nuScenes上达71.6 NDS、64.9 mAP。
PruneForget:视觉模型的联合遗忘与剪枝
PruneForget以遗忘集指导剪枝,联合遗忘与剪枝;在图像分类与生成模型上降推理成本,性能近重训后剪枝。
双耳视听实例分割
提出双耳视听实例分割任务,利用双耳空间线索分割发声实例,构建两个基准并提出模型,显著优于单耳方法。
让语音语言模型成为多语言倾听者
构建覆盖23种语言、9200小时的1080万条语音问答合成数据集,低成本提升语音语言模型的多语言能力。
面向原始3D点云的保几何盲水印
提出基于八叉树的盲水印框架,直接在xyz坐标嵌入提取,无需原始点云,抗重采样与位姿变化且失真低。
TreeRef-BFN:基于二维拓扑与内部三维几何的免等变性从头分子生成
TreeRef-BFN以树状表示与贝叶斯流网络,免等变地联合生成分子拓扑和局部三维几何,支持变尺寸条件生成,高效灵活。
AmbiModBench:超越共享响应的基因扰动预测基准测试
提出AmbiModBench,从特异性、基因分辨和覆盖度评测基因扰动预测,揭示绝对高分多源于共享背景而非目标特异学习。
DAAF:从故障定位到LLM智能体中的可编辑系统资产
DAAF学习属性替换效应,将故障定位转为可编辑系统资产的修复决策,任务成功率达71.93%。
面向多模态测试时自适应的表征编辑
提出FIRE,用傅里叶表征编辑器逐层校准单模态中间表征,多层目标优化以提升跨模态对齐与预测可靠性。
知道不等于选择:显式验证在生成式偏好之外带来了什么
生成正确答案不等于会选择;显式验证P(True)改善排序与准确率,但收益受实体和正确性定义影响。
LocalProp:神经局部化的内存高效反向传播
提出LocalProp,局部更新权重,结合剪枝与微调,在ImageNet等任务上以更低显存取得良好性能。
给错误的问题打分:受限选项评估中的读出失败
受限选项评分误读模型:其常续写被引题目而非预测,排序近随机;预填答案主干可提升AUC。
通往稳定边缘的旅程
按优化器直流增益归一化学习率后,不同优化器轨迹几乎重合,据此划分低、中、高学习率三区制,揭示稳定边缘成因。
面向高分辨率植物成像稠密表征迁移的可扩展域内自监督基础模型
千万级植物图像上自监督预训练ViT掩码自编码器,稠密预测Dice达0.8686,优于自然图像基线。
污染、先验还是证据?分解并训练全切片视觉语言模型中的证据使用
提出CleanSlide基准与Pair-DPO,剥离污染和先验,显著提升全切片病理模型对图像证据的利用与外部性能。
旧评估何时能认证新模型?评估器漂移下的标签高效发布决策
评估器漂移下,旧评估能否认证新模型取决于历史可信度;提出组合警觉序列认证法,高效省标签且经实验验证。
从异常到失败:为智能体轨迹诊断构建因果错误图
提出CEG-Agent,构建因果错误图诊断智能体轨迹,并建立CEG-Bench,达最优性能。
自重建动力学用于自编码器重建精化
提出SRD引导的重建精化:用冻结自编码器的自重建轨迹预测隐空间校正,无需逐样本优化,六数据集恢复45.3%可恢复MSE差距,PSNR提升1.74dB。
超越“提示词 vs. 技能”?模块化大语言模型程序的归因引导优化
提出SPARO,联合优化提示、技能与路由,经反事实归因定向更新组件,五基准五模型上优于基线。
KeyRec:面向流式与长视频理解的有界视觉记忆
免训练KeyRec以有界视觉记忆压缩流式长视频,仅10%token,15项中13项最佳。
博弈学习:偏斜迁移表格知识以强化图像模型
提出SKT,用两步纳什博弈自适应整合模态梯度,将表格知识非对称迁移至图像模型,提升其单模态性能。
超越校准:类型化决策模型的概率是否遵循概率公理?
免标注检验类型化决策模型的概率一致性;Jev与Qwen3.8-27B均违反概率公理,加和偏离1且失效模式不同。
向他人学习,为你行动:面向大语言模型智能体的跨用户记忆共享
ShareMem 跨用户共享经验、以接收者偏好为准,三类任务上均超越用户本地记忆。
语言模型预训练的泛化动态
预训练中模型在鹦鹉式与智能式计算间突然模式跳变,源于容量竞争,可优选检查点与数据。
双曲 Sombor 指数引导的拓扑自适应双曲图注意力网络
提出HSO-GAT,用双曲Sombor指数引导拓扑自适应曲率与注意力,节点分类和链接预测均达SOTA。
识别转码器中用于时间敏感事实回忆的时间特征
首次用转码器电路追踪特征级时间召回,发现三类MLP节点并行交互,揭示现有方法遗漏的高层时间组件。
评估单组学与多组学可解释人工智能(MOXAI)用于成人型弥漫性胶质瘤分子亚类分类
MOXAI整合甲基化与拷贝数,分类成人型弥漫性胶质瘤分子亚型,多模态准确率达92.98%,可解释关键位点。
STR:减少模型引导副作用的监督式转码器替换
提出监督式转码器替换STR,减少模型引导副作用,在Gemma/Llama上保持目标控制,攻击成功率降至12%–14%。
MemAgent:学习为LLM智能体管理异构记忆提供者
提出MemAgent,将智能体记忆建模为路由问题,管理异构记忆提供者,平均准确率提升10.0%。