黑板智能在全局约束问题上可超越自回归模型
黑板智能:扩散模型在可修改画布上搜索修正解,以平均置信度引导,全局约束任务上超越同规模自回归模型。
面向LLM智能体强化学习后训练的显式轨迹多样性
提出显式轨迹多样性,以任务描述符定义并设计TJPO单策略优化,实验提升多样性且保持性能。
LEARN-TS:基于正常性引导的LLM增强对齐与重建,用于多变量时间序列异常检测
LEARN-TS用冻结语言模型提供观测语义与正常性引导,增强掩码重建与异常评分,提升多变量时序检测。
MeshOctave 通过级联分辨率过渡生成网格
提出MeshOctave,用二进网格分辨率与拆分重连离散扩散并行生成网格,支持自适应细化,几何与拓扑更优。
基于Stackelberg博弈的多LLM协同对齐
提出Stackelberg对齐:以EXP3强盗自适应选指令,模型互评经DPO/GRPO学习,性能显著超越基线。
当积分遇见分解:面向多模态图像融合的信号级自监督特征分解范式
提出积分驱动的信号级自监督特征分解范式,将2D图像级监督转为1D信号优化,在多模态图像融合中达SOTA。
面向视频推理的帧差分同策略自蒸馏
FD-OPSD用token级自蒸馏把稠密帧视觉证据迁移给稀疏帧策略,在多个视频推理基准上超越GRPO等基线。
有依据的修订 vs. 先验注入:探究检索增强的专利权利要求修改
专利权利要求修改中,7,385件USPTO案测四模型,未发现先验注入,检索效应小且方向不一致。
未见混沌而习混沌:自回归Transformer对全局动力学的外推
自回归Transformer仅用局部轨迹训练,即可外推未见参数下的倍周期分岔、混沌与吸引子。
迷失于对话,还是迷失于转译?诊断 RAG 中的多轮退化
多轮使 RAG 相对性能下降达 21%、不可靠性增 47%,失败源于查询改写失真或跨轮证据整合失败。
SparLeak:共享GPU上LLM推理中稀疏注意力引发的隐私泄露
SparLeak利用稀疏注意力的SIMA侧信道,泄露查询属性与模型回复,成功率超87%。
超越预测:以回溯式世界建模引导VLM智能体
提出回溯式世界建模与自洽奖励,让VLM智能体反向归因动作,提升策略鲁棒性与泛化。
文本到图像模型的持久性水印
提出对比式水印目标,使水印模型对触发输入行为异于原模型,可抗下游改动与去水印攻击,检出率近100%。
scTrilemma:在单细胞表示学习中平衡身份性、不变性与保真度
该潜瓶颈变分自编码器将表达变异分流至嵌入、解码器与先验,无需标注即兼顾细胞身份、不变性、基因级保真度。
从图像解读到临床推理:基于因果强化学习的上游医师上下文感知多模态学习
提出因果强化学习框架,融合胸片与病史预测MACE,三队列AUROC达0.720/0.760/0.845,提升推理质量。
ReSCENE:面向联邦持续学习中灾难性遗忘结构性缓解的服务器端回放
客户端上传浓缩数据代理,服务器留存历史代理并与当前任务联合训练,缓解灾难性遗忘,精度提升31.1点。
得分更高,回答更差:通过协议级评分标准缓解基于评分标准的强化学习中的奖励黑客行为
评分标准RL因求和聚合致奖励黑客,提出协议级评分标准ProRubric,适当性提升10.8分。
LAURA:用于法律合同中可解释歧义条款识别的知识蒸馏
LAURA用知识蒸馏和IRAC反学习提示训练小模型,联合分类与理由生成,可解释识别法律合同歧义条款。
Video2Skill:从流式经验到可复用的具身技能
提出流式具身技能发现基准Video2Skill,评测模型定位分组复用/新建技能;模型难扩展技能库。
SEED:基于隐式编码器-解码器的自推测解码
SEED将模型视为隐式编码器-解码器,复用验证缓存表示快速起草,4B模型最高提速2.7倍且保持质量。
ATTUNER:通过查询侧适配实现免重计算的 KV 缓存复用
提出Attuner,用查询侧低秩适配让模型读懂冻结的KV缓存,免重计算即达全上下文预填充质量,提速3.73倍。
RAEGNet:面向危害感知多模态假新闻检测的关系感知证据图网络
提出事件级证据检索框架与关系感知证据图网络,融合新闻-证据立场及证据交互关系,联合建模真实性与危害性。
生成式AI时代下多模态假新闻检测的再思考
构建Weibo26数据集并提出GAHR框架,融合全局判断与局部校正,兼顾假新闻检测与生成内容识别。
BELIEFRAG:在证据持续演化下实现状态感知的自适应RAG
BELIEFRAG以显式信念状态闭环选择检索、改写、验证或作答,六项问答基准上以少39%token超越固定迭代检索。
RefCon:面向上下文演化智能体的迭代精炼与对比记忆提取
RefCon以自精炼与自对比迭代提取记忆,无需标注,在多项智能体基准上稳定提升且更高效。
基于RCDM/WaveMix的MRI超分辨率与任务感知分割
提出物理引导的无配对1.5T脑MRI轻量增强流程,其增益因分割模型与标签可靠性而异。
利用在线蒸馏缓解长度扩展代价
提出长度自蒸馏,缓解强化学习后训练中已解题的冗余问题,保持性能同时抑制长度增长。
K2P:无标签知识到提示蒸馏
K2P从教师解答合成并精炼可复用提示,以答案一致性引导搜索选择,无需标签即可向冻结学生蒸馏推理能力。
MASCRDM:大语言模型训练过程合规风险检测与缓解的多智能体系统
提出多智能体系统MASCRDM,在LLM训练全程实时检测并缓解合规风险,兼顾语义表现。
MultiTalk:将全双工语音模型扩展至长时、多方、双语对话
发布57.6k小时中英多方全双工对话数据与基准,Moshi式模型长时多方双语对话超越开源基线。
学习蛋白质折叠能否泛化到更广泛的推理?
蛋白质折叠数据后训练既提升结构预测,又在10项推理基准上平均涨3.23个百分点。
Schema:通过智能体程序归纳发现未知环境
Schema 让智能体以可执行程序表达环境理解并交互式归纳学习,ARC-AGI-3 提升至 99.2%。
TSMD:面向鲁棒视频高光检测的时序-流模态丢弃
提出TSMD,模拟时序与整段模态缺失,联合MSE、相关性与峰值排序损失,提升视频高光检测鲁棒性。
通过推理状态传播学习过程奖励
提出推理状态传播RSP,以二元有效状态建模推理转移,借结果监督引导中间状态学习,性能超PRM基线。
BadAction:基于动作引导触发器的交互式视频生成后门攻击
首次系统研究交互式视频生成后门攻击,提出动作引导触发器,触发后冻结帧、无视后续动作,成功率91%。
MADBench:多智能体辩论安全性基准评测
MADBench评测多智能体辩论安全;六类攻击下,辩论未必提升推理,且会放大越权读写。
VERA:面向约束多智能体控制的可验证可行性表示与反事实信用
提出VERA,分离可行性估计与信用分配,以VFR与CGRA提升约束多智能体控制的成功率并降低违规。
自演化技能能否泛化到留出任务?
21个提升训练任务的技能中仅5个完全泛化,13个部分,3个全无;据此提出GSO,六项基准最优。
UGOD:不确定性引导的透明度与丢弃机制用于稀疏视角3D高斯泼溅
UGOD为每个高斯估计视角相关不确定性,据此调控透明度并施加软丢弃,抑制过拟合,提升稀疏视角新视图合成。
带有偏见LLM评判器的主动偏好学习最优设计
提出NAOD,将评判器偏差纳入采集设计,优化比较选择,理论达紧致下界,实验遗憾降低29.1%。
答案正确,模型昂贵:基于大语言模型的优化建模效率差距
LLM优化建模常答案正确但求解更慢、开销更高;新基准揭示效率差距,应兼顾正确性与效率。
面向可解释图像伪造检测的智能体工具增强推理
提出ATAR,用22种工具多轮推理,检测定位并解释图像伪造,零样本F1达78.5%,超MLLM基线11.8点。
GeoNest:学习为圆形容器中的不规则背包问题选择失败感知邻域
GeoNest用强化学习图策略选择失败感知邻域,提升圆形不规则背包利用率约0.9%。
DeCoPrune:基于去噪一致性的自回归视频扩散高效 KV 缓存剪枝
DeCoPrune免训练,用去噪一致性剪枝KV缓存,保留高差异token,降低自回归视频扩散推理成本。
BaLEEN:面向上下文感知语音识别的潜在编码实体偏置
BaLEEN以潜在编码实体实现免微调上下文偏置,即插即用,显著降低关键词漏检及识别错误率。
基于令牌级感知锚定优势估计强化多模态推理
提出令牌级感知锚定优势估计TPAE,依据视觉依赖与预测熵细粒度调制序列优势,提升多模态推理。
CamAgent:面向多物种相机陷阱工作流的LLM智能体框架
CamAgent是LLM智能体框架,统一整合红外相机多物种分析工作流,以自然语言驱动物种识别、占据建模等工具,降低编程门槛。
Rep2Skill:表征引导的LLM智能体技能自演化
Rep2Skill利用内部表征定位偏离成功的轮次并生成反馈,引导LLM智能体修订技能实现自演化,优于纯文本法。
超越局部线性:学习型图像编码器的尺度分辨几何
提出尺度分辨统计量,发现编码器特征位移非线性偏离局部预测,形成训练后才出现的凸起,反映学习对表征的塑造。
面向详细图像描述的动量耦合评分标准自适应
提出MoCo Rubric框架,单模型兼任描述、评分标准与评判,动量耦合更新,五基准平均胜率72.83%。