FM-ReID:面向目标重识别的选择性竞争令牌路由
提出FM-ReID,以选择性竞争令牌路由挖掘局部判别线索,联合整体表示提升多类目标重识别。
超越可读性:统一视频生成中的视觉文本渲染与原位编辑基准评测
提出VidScribe基准,覆盖四类视频文本生成与编辑,评测11系统,揭示编辑瓶颈并提供训练信号。
并非每次修正都有益:增益引导的持续测试时自适应
GAIN无反向传播,以增益决定历史修正强度,兼顾精度与校准,ImageNet-C达61.9%。
CrossTimeEdit:跨越十年的跨视角数据集与面向历史街景生成的奖励引导编辑
构建跨十年、11城、4.3万组的跨视角街景数据集,提出奖励引导编辑式生成模型,性能提升17.12%。
AffectReveal:超越视觉表象的事件锚定情感识别
提出事件锚定情感识别,构建基准,并推出免调优框架AffectReveal,借事件证据校验提升识别。
超越二元偏好:面向肢体运动描述的分级偏好优化
提出FlexBench与GPA评分,设计GM-DPO分级偏好优化,减少肢体描述错误与幻觉。
OCA:面向图像到点云配准的ODE驱动交叉注意力
提出ODE驱动交叉注意力OCA,缓解图像到点云配准注意力歧义,召回率最高提升15%。
FocusVTC:基于自适应分辨率的高效高性能视觉文本压缩
FocusVTC以自适应分辨率压缩视觉文本,2.9倍压缩下大幅提升性能并保持多模态能力。
VLM4Cluster:视觉-语言预训练时代的深度聚类基准评测
VLM4Cluster基准评测17种方法与20个数据集,语言辅助聚类提升效果与泛化,细粒度场景增益有限。
为推理扩展视频生成:代价几何?
研究视频生成扩展能否推理隐藏信息及代价;MSE不保证推理,小模型低算力更准,符号监督显著提升。
用于高鲁棒性车载远程光电容积脉搏波的逐像素曝光
提出PixExpo:按循环曝光序列采集并逐像素非迭代融合,选取最接近rPPG目标强度的观测,大幅提升车载心率监测鲁棒性。
一次重编程即足:重新思考视觉重编程中的长时训练
提出YORO,仅需一次前向遍历,用贝叶斯判别映射从冻结响应构建下游预测器,免反向传播,精度显著提升。
通过结构化提示重参数化重编程视觉语言模型
RVP框架:类内聚合多提示、类间残差校正,可重参数化为线性分类器,近乎零开销,11个基准均领先。
ReWorld-Track:一种用于语言引导多摄像头跟踪的递归事件世界模型
提出递归事件世界模型,保留关联不确定性以预测后续摄像头,提升语言引导多摄像头跟踪的身份连续性。
DSPO:面向鲁棒情感推理的多样性感知主观策略优化
提出DSPO,融合情感分布先验、多样性奖励与反事实视觉门控,跨域准确率超EMO-R3 10.8%。
当语义至关重要时:面向共语手势生成的可靠性感知语义-节奏控制
提出可靠性感知语义-节奏控制框架,选择增强语义引导,提升鲁棒性并平衡表达、同步与多样性。
AESplat:通过解耦外观建模推进无位姿前馈3D高斯泼溅
解耦视角相关与无关外观,零阶SH免训练导出、高阶SH由浅层MLP预测,无位姿3DGS渲染质量领先。
拖拽即证据:面向拖拽式编辑的运动锚定潜在重组
提出MoRe-Drag:将像素变形作为运动证据注入生成轨迹,区域感知重组,提升拖拽精度与语义一致性。
FastVR:基于一步扩散的高效流式视频修复
FastVR用一步扩散做流式视频修复,轻量VAE配分块因果注意力,1080p单卡11FPS性能领先。
面向视觉-语言类增量学习的双模式低秩学习器与桥接原型集成
提出DuLBE,双模式低秩学习与桥原型集成,用于无样本视觉-语言类增量学习,性能SOTA且参数高效。
NesTok:用于自回归图像生成的嵌套自对齐一维分词器
NesTok嵌套自对齐一维分词器强化短序列重建,ImageNet rFID0.98、gFID1.46。
解码情感细微差别:通过层次化情感推理与对比判别剪枝增强多模态大语言模型
提出免训练框架DAN,融合层次化情感推理链与对比判别视觉剪枝,显著提升多模态大模型细粒度情感辨识能力。
Causal-EVC:通过时空定位与反事实干预打破情感虚假因果
提出Causal-EVC,以时空定位与反事实干预破除情感伪因果,实现可解释的忠实视频描述。
视频扩散模型中的运动概念遗忘
提出免训练运动概念遗忘法MUTE,在CFG前用概念方向与空间门校正,实现视频动作精准擦除且动态自然。
看见本应听见的:诊断与修复全模态大语言模型中的跨模态捷径
发现全模态大模型答音频题时依赖图像,提出DMC-Repair抑制该捷径,图像影响降约六成且不损性能。
场景重定向:基于类比迁移的物体放置学习
将场景重定向定义为跨布局的簇级语义迁移,保留语义上下文并施加物理约束,性能超越现有方法。
MeteoVerse:统一的天气可控视频世界模型
提出天气可控视频世界模型MeteoVerse,显式建模天气转换,统一天气保持、引入与移除的精细控制。
EGSD:面向流式视频理解的事件锚定自蒸馏
提出事件锚定自蒸馏EGSD,以可验证事件增量更新记忆,解决偏好错位与记忆坍缩,流式视频理解性能领先。
CurvSpec:面向部分相关视频检索的自适应多曲率学习
CurvSpec学习内容自适应曲率,融合欧氏与双曲注意力,以语义质心抑制稀释,检索性能最优。
RED:面向可泛化AI生成图像检测的重建演化动力学
RED利用多尺度重建演化中的token可预测性聚合证据,实现可泛化AI生成图像检测,准确率92.5%。
基于自洽性的扩散视频推理学习
提出自洽测试时扩展与拒绝微调,蒸馏多轮共识到扩散视频模型,视觉搜索准确率由48.4%升至99.0%。
ProGuT:面向森林场景的标签高效全景分割
ProGuT借助CLIP特征聚类与结构张量几何先验生成全景伪标签,无需逐图掩码,森林分割性能显著超越无监督基线。
RoXDrive:通过动作忠实推演实现端到端自动驾驶的闭环强化学习
RoXDrive:识别动作忠实世界模型推演,进行闭环强化学习后训练,显著减少自动驾驶安全违规。
无法恢复从未被测量之物:量化超低场MRI超分辨率的信息上限
真实64mT MRI个体信息仅约3–4mm;合成数据高估可恢复性,超分细节难辨恢复与虚构。
社交性锚点:迈向群体边界约束的轨迹预测
提出 Socialality 框架,以可解释锚点和扩展窗口实现个体化、上下文自适应分组与群体轨迹预测。
同策略视觉证据蒸馏
提出ReVuE同策略视觉证据蒸馏,对比学生轨迹诊断获取/读取/对齐失败,反思重加权token蒸馏损失,提升视觉推理。
VGGT 系列模型需要用到所有层吗?
VGGT 系列前馈几何模型的可删层集中于前段与后段,剪枝并经线性校准后可减少44%参数而精度持平。
S4VY:前馈4D视觉几何中的任意分割
提出S4VY,基于前馈4D视觉几何实现类无关4D实例分割,支持提示与语言引导,性能领先。
GlassFormer:基于雷达-深度融合的实时玻璃分割学习
融合雷达与RGB-D,提出GlassFormer,以跨模态注意力实现实时透明表面分割,低光下稳健。
更少监督,更好泛化:扩散编辑图像中的弱监督伪造区域定位
提出弱监督框架ReGFLoW定位扩散编辑伪造区域,仅需图像级标签,以扩散重建误差引导多示例学习,跨域泛化优于全监督。
S2T-Unet:一种面向跨模态MRI转换的结构到风格框架
提出S2T-Unet,分离模态不变结构与风格,量化编码结构并转换风格,IXI实验达或超SOTA。
DiffReID:面向目标重识别的判别式扩散模型
提出判别式扩散模型DiffReID,结合CLIP提示调优与视觉引导去噪,学习身份感知分布并生成身份不变特征,五个重识别基准超越多数SOTA方法。
SafeVantage:面向可靠具身决策的视角感知记忆
视角感知记忆与主动采集框架,记录支持视角,预测可见性指导选视,校准输出是/否/弃权,提升决策可靠性。
用于跨被试EEG到图像检索的结构化视觉目标学习
提出结构化视觉目标学习与免训练细化,提升跨被试EEG到图像检索,Top-1达48.1%。
Seg3DParts:基于分割的可控部件级三维生成
将分割作为显式锚定信号,结合跨部件全局交互,从单图直接生成对齐的部件网格,并发布20万物体、百万部件的大规模数据集。
表征动态揭示多模态大语言模型视觉 Token 剪枝的语义显著性与相似性
视觉token表征动态揭示语义显著性与相似性;据此提出免训练剪枝MSDG-Prune,大幅压缩视觉token并提速。
WeLike2Party!面向多人图像动画的上下文动作迁移
提出免显式姿态的多人动画框架,以参考非对称RoPE与身份绑定监督实现上下文动作迁移,构建MotionTwin数据集与基准。
SFE-VGGT:面向事件相机单目深度估计的无源VGGT蒸馏
无源SFE-VGGT用事件重建代理帧蒸馏VGGT几何先验,可靠性加权,无需配对RGB,夜间误差降15%。
DispFlow-GS:面向单目可变形三维高斯泼溅的位移流监督与运动解耦
提出位移流监督与运动解耦框架,缓解高斯流与光流域差异,并引入形变-渲染一致性指标,显著提升运动定位与一致性。
先验驱动的3D高斯泼溅增强:法线与深度正则化
提出融合表面法线与稠密深度先验的3DGS优化方法,提升几何精度与视觉质量,在复杂场景中表现稳健。