ZK-LLM 下的比特:面向可验证隐私大模型推理的零知识友好量化评估
LLM零知识友好量化研究:激活精度比权重敏感,非线性查表易致效用退化;降位宽未必成比例节省证明开销。
为推理扩展视频生成:代价几何?
研究视频生成扩展能否推理隐藏信息及代价;MSE不保证推理,小模型低算力更准,符号监督显著提升。
用于高鲁棒性车载远程光电容积脉搏波的逐像素曝光
提出PixExpo:按循环曝光序列采集并逐像素非迭代融合,选取最接近rPPG目标强度的观测,大幅提升车载心率监测鲁棒性。
STAMP:无需目标数据预测分布外泛化能力
STAMP无需目标数据,仅用源域图像估计OOD性能:胸片相关性0.85,ImageNet上0.98。
MAS-OPD:面向多智能体系统的同策略蒸馏
MAS-OPD以角色优势特化与特权归因协调,将协作信息转为同策略蒸馏监督,实现清晰分工与高效协作。
同家族同策略蒸馏的缩放特性
研究同家族同策略蒸馏的缩放规律:弱到强迁移中学生峰值可超教师,峰值与迁移斜率服从幂律。
SALMONN-duo:面向全双工语音智能体的自适应双系统协同
提出自适应双系统全双工语音智能体:快系统实时交互并按需委派慢系统,提升推理与多轮任务表现,优化成本。
USA:面向语言智能体跨域在线策略蒸馏的更新感知SAM
USA将预热更新幅度转为逐坐标扰动半径,缓解跨域在线策略蒸馏更新耦合与负迁移,六方向均超单域基线逾4分。
面向开放式文本生成的连贯性感知分布评估
CHORD用冻结大模型隐状态与RBF-MMD比较文本分布,灵敏检测全局连贯缺陷,排名更贴合人类判断。
GUI 并非状态:诊断 GUI 世界模型中的状态混叠
GUI 世界模型仅凭可见界面会导致状态混叠;提出诊断基准与轻量状态恢复,可提升预测与下游性能。
BiasReducer:面向奖励模型的自适应偏差缓解
BiasReducer 轻量编辑奖励模型线性头,自适应选择并消减表面属性偏差,提升鲁棒性,减少冗长与迎合。
过度个性化是一种决策失败:大语言模型中的生成诱发应用偏差
LLM过度个性化是决策失败:生成目标诱发应用偏差,按logit减去偏差标量可减少泄漏并保持满足。
预测AI相关主要半导体企业供应链风险的财务影响:一种异构图补丁Transformer方法
提出异构图补丁Transformer,融合基本面与贸易、事件信号,预测116家AI半导体企业未来1-2季度财务变化,误差最低。
ReScraper:面向高效LLM预训练的统一网页数据抓取与清洗
0.6B模型ReScraper统一抓取与清洗网页,替代启发式规则,显著提升LLM预训练语料质量。
大规模脑电基础模型基准评测:来自两万次评估的经验
EEG-Arena 基准显示,脑电基础模型多数任务优于监督基线,扩大预训练数据是持续提升的关键方向。
Dr.Credit:面向深度研究智能体的基于评分标准的过程信用分配
以评分标准为共享参照,对工具反馈给予过程信用,并结合GRPO结果优势,提升深度研究智能体表现。
LLM智能体评估的可认证选择性自动化
提出任务级自助认证,量化可安全自动化的智能体评估比例,并兼作自训练过滤,实现零标注跨域迁移。
结合情景记忆与在线策略学习的自演化时间序列预测智能体
提出自演化智能体FASE,以情景记忆和在线策略学习将反馈转为经验,无需更新LLM参数,MAE降9.1%。
弱通信下的分布鲁棒平均奖励强化学习:有限样本保证
研究弱通信下分布鲁棒平均奖励强化学习,给出有限样本保证与近优策略样本复杂度,覆盖多种不确定性集。
生物医学问答中的递归式大语言模型退化:一项跨代研究
PubMedQA中递归合成数据训练使生物医学问答指标逐代下降,3B更明显,主为答案变长,未证模型崩溃
一次重编程即足:重新思考视觉重编程中的长时训练
提出YORO,仅需一次前向遍历,用贝叶斯判别映射从冻结响应构建下游预测器,免反向传播,精度显著提升。
MemEvo:流式视频记忆机制的自动发现
提出LLM驱动的MemEvo框架,自动搜索可执行记忆程序,发现免训练的有界记忆机制,提升流式视频理解性能与效率。
超越状态到达:为内在动机的选项发现学习抽象表示
提出一种选项发现算法,为每个子目标仅选取相关特征子集,学得可广泛泛化的抽象选项,加速稀疏奖励环境中的探索。
人机协作:从悖论到模式
本文从自主性与主动性两维度,用悖论视角分析人机协作张力,提炼出指令、委托、辅助与共创四种模式。
BRIDGE:双层检索信用感知的智能体强化学习
BRIDGE将检索增强智能体RL建模为双层优化,联合训练LLM与检索器,在多个QA基准上准确率领先。
通过结构化提示重参数化重编程视觉语言模型
RVP框架:类内聚合多提示、类间残差校正,可重参数化为线性分类器,近乎零开销,11个基准均领先。
MAADBench:面向多智能体系统异常检测的可刷新范式
首个可刷新的多智能体异常检测基准,自动生成步骤级标签,评测25种方法揭示其依赖监督、鲁棒性不足。
视觉敏感性不等于断言可撤回性:面向多模态强化学习的持续性感知信用分配
提出持续性感知信用门控,抑制异常顽固的视觉断言正信用,提升多模态强化学习准确率并增强断言可撤回性。
ReWorld-Track:一种用于语言引导多摄像头跟踪的递归事件世界模型
提出递归事件世界模型,保留关联不确定性以预测后续摄像头,提升语言引导多摄像头跟踪的身份连续性。
DSPO:面向鲁棒情感推理的多样性感知主观策略优化
提出DSPO,融合情感分布先验、多样性奖励与反事实视觉门控,跨域准确率超EMO-R3 10.8%。
在再生公地中学习不崩溃地收获:一个拉格朗日框架
把再生公地建模为枯竭预算约束博弈,用非平稳拉格朗日框架从无约束解构造策略序列,实现可行性与近似最优。
分而注入:智能体能否从碎片中重构间接提示注入?
AdaLCPI把攻击目标拆成碎片藏入长上下文,用重构线索与自适应搜索,攻击成功率达61.4%。
当语义至关重要时:面向共语手势生成的可靠性感知语义-节奏控制
提出可靠性感知语义-节奏控制框架,选择增强语义引导,提升鲁棒性并平衡表达、同步与多样性。
AESplat:通过解耦外观建模推进无位姿前馈3D高斯泼溅
解耦视角相关与无关外观,零阶SH免训练导出、高阶SH由浅层MLP预测,无位姿3DGS渲染质量领先。
AVIO:学习在视听场景中添加和移除发声对象
提出 AVIOBench 数据集与 AVIO 模型,实现视听场景中发声对象的添加与移除编辑。
SafeCoEvo:在测试时为LLM智能体协同演化安全约束与守卫
提出SafeCoEvo,在测试时协同演化安全约束与守卫,利用累积经验同时提升安全与任务成功率。
拖拽即证据:面向拖拽式编辑的运动锚定潜在重组
提出MoRe-Drag:将像素变形作为运动证据注入生成轨迹,区域感知重组,提升拖拽精度与语义一致性。
FastVR:基于一步扩散的高效流式视频修复
FastVR用一步扩散做流式视频修复,轻量VAE配分块因果注意力,1080p单卡11FPS性能领先。
AgentHop:面向智能体多跳科学问答的诊断基准
AgentHop诊断基准以1011道题及七工具沙箱,从检索、综合、工具调用、资源管理四维剖析模型失败模式。
超越高斯假设:面向有效连接的分布感知信道容量
提出分布感知的信道容量有效连接度量,用归一化流双流估计器处理非高斯残差,仿真与多模态数据均优于现有方法。
互惠引导:编排草稿与验证预算,推进扩散-AR自推测前沿
提出互惠引导(RecGuide),动态编排草稿与验证预算,适配不同并发负载,吞吐最高提升1.8倍。
理解并利用后训练中的各向异性
后训练各向异性非缺陷而是分工;提出SphereGate,0.1M参数超越基线并媲美全模型GRPO。
面向视觉-语言类增量学习的双模式低秩学习器与桥接原型集成
提出DuLBE,双模式低秩学习与桥原型集成,用于无样本视觉-语言类增量学习,性能SOTA且参数高效。
NesTok:用于自回归图像生成的嵌套自对齐一维分词器
NesTok嵌套自对齐一维分词器强化短序列重建,ImageNet rFID0.98、gFID1.46。
零样本线索锚定的口语文档主题分割
免训练框架CGS以显式话题起始线索句划定边界,线索不足则依文档结构做语义分割;六项基准超越基线,抗ASR噪声且低成本。
Extender:一种日志结构化的 Transformer
Extender 为日志结构 Transformer,新增拼接通道使 KV 仅读该通道,大幅降低注意力持久内存;短上下文持平,长上下文更优。
当言语力有不逮:LLM置信度估计中言语化推理与隐藏特征的迭代协同
专用估计器优于言语化;IPoET交替优化策略与估计器,协同言语化推理与隐藏特征,提升LLM置信度估计。
面向在线策略蒸馏的无偏Top-k估计
提出TT-OPD:结合top-k与采样token,补偿丢弃概率质量,无偏估计反向KL梯度,性能更优。
学习何时递归:面向不平衡眼科领域增量学习的令牌自适应递归
ToRe:免回放参数高效,令牌自适应递归与参数隔离,缓解不平衡眼科增量学习遗忘,性能领先且近零遗忘。
以问促记:面向 LLM 智能体的检索诱导记忆演化。
提出RIME检索诱导记忆框架:以自问检索证据整合演化记忆,推理不足时回溯源对话,性能领先且省查询token。