VOCA: 具有编解码感知的视觉里程计
提出VOCA,利用视频编解码信息改进压缩流上的视觉里程计,实现高效高精度。
相信先验(或不):不确定性感知的腹主动脉瘤分割
提出不确定性门控与患者特定归一化,提升腹主动脉瘤分割泛化性与可解释性,达最优性能。
EgoSafetyBench:评估具身VLM作为运行时安全卫士的自我中心视频基准
EgoSafetyBench评估发现,VLM安全卫士易错过上下文危险,误导性文字使脆弱模型漏掉三分之一危险,鲁棒性多为虚假告警。
Does Your ViT Still Need U-Net for Segmentation?
Leveraging Phase Information to Boost Unrolled Network Learning for Image Deblurring
为触觉唤醒!MLLM中的掩码隔离触觉对齐学习
提出Splash框架,通过隔离休眠子空间选择性更新,实现非破坏性触觉扩展,保持视觉语言能力并达到最佳性能。
学习何时倾听:用于人体运动预测的门控情感融合
提出门控情感融合方法,面部情感仅在短中期(<30帧)有预测增益,长期仍依赖运动连续性。
DroneFINE: 面向无人机图像的视觉语言检测器的域感知参数高效微调
提出前景感知自适应和背景抑制机制,高效微调无人机图像检测器,性能媲美全微调且参数更少。
基于字体的单目距离估计方法
利用后车牌字符标准尺寸,通过单目摄像头测量字符高度估算车距,融合多种信息,误差小于0.13米。
CORGI:面向野外单张图像的一致性感知三维狗重建
提出CORGI框架,无需3D监督,从单张野外图像重建高保真可动画3D狗模型,利用CDOG、CA-3DGS和DCGR模块实现一致性感知,达SOTA。
OnPoint: 用于点监督在线时序动作定位的离线到在线多级蒸馏
提出OnPoint框架,通过多级蒸馏将离线教师知识迁移至在线学生,结合点标签与锚点改进,在五数据集上优于基线。
RetailSMV:零售场景下外视角与内视角的基础视频世界模型自适应
仅外视角训练优于结合内外视角;外视角数据提升内视角但反之有害;短预测窗口适应收益最大。
Rosetta:可组合的原生多模态预训练
Rosetta通过模块化专家和动量锚定正交投影,实现无损模态扩展,避免灾难性遗忘。
MVDGC:基于双几何约束的联合3D与2D多视角行人检测
提出MVDGC框架,用3D圆柱查询联合优化BEV定位和2D框,消除投影失真实现精准检测。
AEGIS:用于乳腺X线摄影的多任务联合嵌入预测架构
提出Aegis架构,自监督JEPA预训练,在乳腺癌分诊和密度分类上分别达0.949和0.953 AUC,零样本跨人群验证成功。
MedCAGD:上下文感知门控解码器用于高效医学图像分割
提出上下文感知门控解码器,通过多尺度通道重校准与门控跳跃融合提升医学图像分割准确性,在11个基准上优于基线。
基于视觉语言模型上下文推理的个性化对象识别与定位
提出POIL任务及IPLoc-ID算法,借助VLMs上下文推理实现目标定位与负样本拒识,有效抑制假阳性。
学习组合:重新审视零样本组合图像检索的代理任务设计
FoCo通过聚焦相关视觉与语义补全两阶段学习组合函数,实现零样本组合图像检索最优性能。
SFDA跟踪:恶劣天气下的广义无源域自适应跟踪
提出SFDATrack,利用双交互Mamba和超球原型投影实现无源域自适应恶劣天气跟踪,性能优越。
MEPA:基于专家混合的视觉自回归建模多尺度表示对齐
提出MoE架构与残差特征聚合,提升多尺度表示学习,ImageNet上半轮训、少参数即达更优FID。
面向高效图像到3D扩散变压器的活力感知压缩
首个图像到3D扩散变压器压缩方法,实现66%模型缩减并保持几何保真度。
LIST3R:长序列实例感知的3D重建
提出基于实例锚点的长序列3D重建框架,通过跨子序列锚点匹配实现全局一致重建,显著提升轨迹和重建质量。
DriveVer:自动驾驶的轻量级测试时轨迹验证器
DriveVer是轻量级即插即用测试时验证器,以仅34M参数融合多视角视觉与运动特征,实时提升轨迹规划性能。
径向相互作用层析成像:从单幅扩张范围图像识别非传递性进化博弈
从单幅扩张图像提取几何信号恢复边界流场,识别非传递性进化博弈,并证明端点可观测性和稳定性。
文本到图像扩散模型安全对齐中的高效用幻觉
安全对齐导致语义坍缩,细粒度语义失败;提出SAGE正则化恢复结构化效用,TIFA提升5%。
GenSP:通过学习形状生成模型实现一致的球面参数化
GenSP通过生成模型实现球面参数化的一致性,减少几何失真,提高跨形状对应性。
DroneIQA-VLE:基于视觉语言集成的多任务无人机图像质量评估
提出DroneIQA-VLE框架,集成视觉编码器与多模态大模型,通过算术平均预测全局质量,获挑战赛第二名。
MindAU:基于双流流形对齐的脑电条件面部动作单元编辑
MindAU通过双流流形对齐实现脑电引导的面部动作单元编辑,达成高保真身份保留。
EO-VGGT:基于轨道射线条件的卫星多视图重建三维基础模型
EO-VGGT框架通过几何约束选图、推扫视线编码和适配器,实现卫星多视图3D重建。
信息正则化注意力:面向视觉中心推理
IRA机制通过随机注意力显式控制视觉信息注入,抑制冗余信号,提升VLM稳定性与表示学习。
HyFL-CLIP:双曲微调CLIP以增强鲁棒长上下文理解
HyFL-CLIP通过双曲微调和跨流形蒸馏建模层次关系,增强CLIP长上下文鲁棒性,文本扰动下检索提升19.5%。
VideoSearch-R1: 基于软查询优化的迭代视频检索与推理
提出VideoSearch-R1框架,通过软查询优化在连续潜在空间调整搜索,结合GRPO训练,实现迭代检索与推理,在视频语料时刻检索任务上达到最优性能。
MindEdit-Bench:基于野外照片的VLM物体级反事实空间推理基准测试
新基准测试VLM物体级反事实空间推理,准确率仅8%-31%,远低于人类81%-97%,差距显著。
StochasT:基于随机对话轮次深度的视觉指令微调学习
提出StochasT随机分组任务,解决多轮训练与单轮测试不匹配,提升模型鲁棒性。
通过非对称互变分学习实现多模态连续推理
提出AMVL框架,用双向KL校准解决多模态连续推理中的训练-推理不匹配与答案泄露,在BLINK基准上平均提升+10.83。
ECoSim:面向可控交通模拟的高效数据微调
提出轻量控制适应框架,仅需不到1%数据实现多模态可控交通模拟,保持驾驶真实性与安全性。
通过部分单目观测的生成式重建的鲁棒3D对齐
提出无需训练的几何对齐框架,利用Sim(3)变换和粗到细策略鲁棒对齐,有效抑制生成幻觉,性能超越现有方法。
基于先验锚定的长尾多器官病理报告生成去偏方法
提出PriorAnchored框架,用视觉原型和元报告锚定去偏,提升长尾多器官病理报告生成性能。
AnF-DiffPET:解剖与频率引导的PET/CT去噪扩散模型
提出AnF-DiffPET框架,结合解剖与频率引导,增强多尺度特征及频域一致性,在PET/CT去噪中优于现有方法。
Restore3D: 通过形状与纹理修复为破损物体注入生机
Restore3D框架同时修复破损物体的形状与纹理,利用多视图图像和自感知掩码生成高分辨率一致图像并重建网格。
Cross4D-JEPA: 用于4D点云表示学习的密集跨模态对应蒸馏
提出Cross4D-JEPA,通过密集跨模态对应蒸馏冻结的2D/视频模型到4D点云编码器,在四个基准上超越现有方法。
NoPA:非参数化在线三维场景图生成
NoPA用非参数分布表示对象,保留几何细节,通过最大均值差异合并,实时生成高质量3D场景图。
SPECSIA:基于绘图的3D动画中新颖视角增强的风格化数据集
提出SPECSIA-15K数据集和DraViE模块,消除新颖视角伪影,提升保真度和时间一致性,降低成本。
HieDG:一种层次化离散几何引导的多动物追踪框架
HieDG通过离散几何令牌对齐视觉嵌入,解决连续几何不稳定问题,在多动物追踪基准中取得最优关联性能。
GEAR-Seg: 面向推理分割与数据引擎的可解释基础智能体
GEAR-Seg将推理分割解耦为可追踪逻辑链,零样本推理性能领先,自动构建大规模基准,轻量模型逼近人工标注上限。
EgoGapBench:多智能体场景中自我中心动作选择的基准测试
提出多智能体场景自我中心动作选择基准,人类可靠,多模态大模型表现差且难以从第一人称数据习得。
BrainFIBRE:通过信息分解的脑微结构基础模型
首个脑微结构基础模型,采用自监督部分信息分解与反事实候选构建,从NODDI图中提取可迁移表示,在多任务预测中达最优性能,提供可解释的神经生物学交互模式。
描述瓶颈模型
CaBM用自由文本替代预定义概念集,实现无泄漏架构,自动发现数据集特定概念。
EPO:基于边缘位姿优化提升三维基础模型
EPO通过边缘图对齐实现几何优化,无需特征提取,性能媲美BA,内存更低,适合消费级硬件。
主动空间引导:消除视觉Transformer中注入的位置机制
提出主动空间引导训练目标,无需位置注入,通过坐标回归损失提升ViT性能,优于传统位置编码方法。