Occ-VLM: 基于占据的视觉语言模型用于室内场景理解
Occ-VLM仅用RGB图像和2D编码器,以3D占据先验实现统一场景理解,占据预测最优,3D任务持平。
ParaScale: 通过规范不变的视差数实现尺度校准的相机运动迁移
提出尺度不变视差数Pi,校准视频间相机运动迁移,避免尺度不匹配,无需重训练,降低视差一致性误差3倍以上。
ViCoStream:通过阶段协调推理使流式视频大语言模型运行速度超过100 FPS
ViCoStream实现流式视频大模型134 FPS与<50ms延迟,精度接近全历史基线。
面向内窥镜视频的高斯过程先验变分自编码器
GPVAE框架利用时间高斯过程先验修复内窥镜视频,降低重建RMSE最高26.1%及下游轨迹误差12.7%,提供逐帧不确定性估计。
CSWinUNETR:医学图像中纤细解剖结构的分割
提出CSWinUNETR,采用交叉条形自注意力与动态蛇卷积,无需后处理即可实现纤细结构高精度分割
3D-PLOT-LLM:面向3D大语言模型的部件级对象令牌
提出3D-PLOT-LLM,通过部件级令牌实现部件理解,性能领先且参数量极少。
神经事件:用于事件视觉的离散异步自编码器
提出神经事件框架,将事件流编码为高信息离散码,触发时压缩数据,性能不减且事件率降低2倍。
OTCHA:基于最优传输的置信感知潜在枢纽对齐用于多视图医学图像分类
提出OTCHA模块,通过最优传输对齐视图特征并丢弃无关令牌,提升多视图医学图像分类鲁棒性。
多模态概念瓶颈模型
MM-CBM通过双概念瓶颈层对齐图像与文本,实现可解释零样本分类,准确率平均提升51.26%。
用于图像超分辨率的带语义调制的线性循环单元
提出带语义调制的LRU超分网络,通过原型学习平衡性能与效率,超越最新方法。
SurgVista:具有合理器械-组织动力学的长视界手术世界建模
SurgVista通过变形一致性正则化与漂移适应训练,解决手术世界模型的空间交互不一致和时间保真度崩溃,实现长期稳定预测。
PSCT-Net:通过可微反投影和注意力引导精化的几何感知儿科颅骨CT重建
PSCT-Net用可微反投影建立空间先验,结合注意力引导投影与双向Mamba模块,实现几何感知的儿科颅骨CT重建,缓解深度模糊并高效捕捉长程体积依赖。
解决潜在扩散模型中RGB到SWIR图像翻译的细节瓶颈
提出两种轻量改进解决细节丢失,检测mAP提升2倍,小目标提升3.4倍,FID达最优。
CARE:面向视频多模态大模型的自适应推理长度的能力感知奖励塑造
提出CARE框架,通过能力感知奖励塑造自适应优化推理长度,提升准确性与效率,收敛时推理更短更有效。
SpatialSV:通过任务导向视觉监督内化MLLMs可解释3D空间感知
SpatialSV采用任务导向视觉监督,强制模型将2D特征提升为显式3D表示,实现可解释空间智能,有效提升性能并泛化到半监督场景。
加速语义分割工业应用中的标注过程
无监督算法将标注时间从170小时降至37小时(减少78%),创建最大公开钢显微结构分割数据集。
空间感知缩减框架:迈向高效且忠实的视觉状态空间模型
STORM空间感知缩减框架无需训练,保持二维结构完整性,大幅恢复Mamba变体剪枝性能,最高提升63.3%准确率。
三角一致性:学习光流的通用约束
提出三角一致性作为光流通用约束,组合两流得第三流并强制一致,即插即用提升各种学习性能。
DiffMath:符号和图感知的潜扩散Transformer用于手写数学表达式生成
提出DiffMath,利用LaTeX结构先验,无需位置监督,通过符号和图感知潜扩散生成高质量手写数学表达式,性能优越并提升OCR精度。
Timage:一种用于微调视觉语言模型的生成式文本嵌入图像范式
将文本覆盖层直接绘制到图像上,通过约束薛定谔桥生成布局,增强多模态模型的空间推理能力。
多模态大语言模型的置信度校准:基于医学视觉问答的实证研究
提出新方法将置信度校准误差平均降低40%,提升医学MLLM可靠性。
SketchKeyAnime: 基于参考图像的稀疏关键草图动画合成
提出SketchKeyAnime框架,从稀疏关键草图生成可控动画,双分支条件与自适应损失显著提升质量,EDMD降31.9%,FVD降9.5%。
基于可学习全局合并的扩散Transformer变长分词
通过可学习全局合并实现变长分词,解决跨长度表示对齐问题,提升图像生成效率。
QG-MIL:用于医学影像中领域无关的多实例学习的门控Transformer聚合器
QG-MIL通过四项协同架构实现均匀注意力分布,在6个医学影像基准上平均提升6.1个宏F1点,优于基线。
ROSE:多模态模型中感知到行动差距的基准测试
ROSE基准测试表明,多模态模型在固定场景下依据上下文将视觉证据转化为行动时性能骤降44.5%,揭示感知-行动鸿沟。
语义锚定的证据融合用于域鲁棒全切片生存分析
提出SAEFS框架,通过VQA语义锚和证据融合实现跨域全切片生存分析,零样本测试C-index提升10.2%。
视觉推理引导的光场遮挡移除
提出结合光场集成与视觉语言模型的遮挡移除框架,多视图融合抑制遮挡,VLM恢复细节,多采样融合减少伪影。
CrossFlow:跨越潜在空间与像素空间的单步生成
CrossFlow提出跨空间流,直接映射潜在到像素,无速度单步目标,无需独立解码器,ImageNet上达1.62 FID。
ReA-OVCD:通过语义与空间精炼的可靠性感知开放词汇变化检测
提出无需训练的可靠性感知框架,通过语义推理和边界精炼抑制伪变化,显著提升变化检测性能。
PU-UNet:医学图像分割的稳定乘法交互
PU-UNet通过稳定乘积单元残差块实现乘法特征学习,提升分割Dice和IoU,降低假阳性率,且参数与速度几乎不变。
FUSE:面向多模态目标重识别的频域统一与频谱能量对齐
FUSE通过频域解耦与能量对齐,弥补中高频细节缺失,显著提升多模态重识别性能,如mAP提升9.1%。
看见并到达:无人机视野内的精准视觉语言导航
提出UAV-VLN-FOV任务及3DG-VLN框架,提升无人机视野内目标到达精度,成功率提升13.82%。
面向LiDAR-相机外参标定的三维高斯泼溅保几何方法
通过聚合多视角LiDAR深度监督,阻止光度梯度更新,保持高斯几何,提升标定精度。
拼接与维度对大规模人工生成体数据集的影响
研究发现FID无法检测影响分割的拼接伪影,2D训练更稳定,3D改善微小且成本高。
像素级残差扩散Transformer:可扩展的3D CT体数据生成
PRDiT采用两阶段粗到细策略,局部去噪结合全局残差扩散,高效生成精细3D CT体数据,性能优于现有模型。
WeGenBench:面向文本到图像模型优化的多维度诊断基准
提出WeGenBench多维度诊断基准,含4000个双语提示,结合VLM新指标,精准定位模型缺陷。
Holo-World: 面向视频世界模型的统一相机、物体与天气控制
Holo-World从单图联合控制相机、物体运动和天气转换,实现场景保持或天气转移,性能优于基线。
VLM内部伪装视觉上下文的隐藏演化
视觉token作为伪装上下文进入LLM,其表示受集成范式重塑并决定任务性能,性能取决于每层视觉表示质量。
EFIQA:基于解剖先验的可解释眼底图像质量评估
EFIQA利用解剖先验无监督生成眼底图像空间质量图,优于有监督方法。
EventVLA:面向长时域视觉-语言-动作策略的事件驱动视觉证据记忆
EventVLA通过动态关键帧记忆模块,自主保留稀疏任务关键视觉证据,在17个模拟和4个真实任务中成功率提升40%以上。
FrozenDrive:零样本文本引导的驾驶场景生成与数据增强,基于无参数冻结扩散模型
FrozenDrive保持预训练模型知识,无参数实现多视图时空一致,零样本生成恶劣天气场景,增强数据提升鲁棒性。
MakeupMirror: 提升扩散模型在妆容迁移中人脸属性保持
MakeupMirror扩散模型通过几何条件、区域控制、肤色调制和高效采样,提升妆容迁移中人脸特征与肤色保持,相似度+60%,肤色差-50%,延迟0.7秒。
SAM3自蒸馏用于细粒度GOOSE 2D语义分割
采用SAM3自蒸馏与多尺度测试增强,结合光度失真,在GOOSE 2D分割挑战中达69.73% mIoU获第四名。
图像匹配在艺术技能评估中的应用评价
利用SIFT与Siamese网络匹配手绘与原图,发现SIFT关键点匹配更有效评估绘画技能。
NAMESAKES: Probing Identity Memorization in Text-to-Image Models
SA-VIS: 稀疏帧标注用于训练视频实例分割
提出PFP模块,利用稀疏帧标签高效训练视频实例分割,仅用1/5标注性能仅降0.4%,显著降低标注成本。
TriFlow: 基于最近顶点向量场生成艺术家式三维网格拓扑
TriFlow通过最近顶点向量场生成艺术家级网格拓扑,泛化强、质量高,误差降90%,速度提升8倍。
头颈部肿瘤(HECKTOR)2025:多模态PET/CT中分割、诊断和预后的基准
HECKTOR 2025挑战赛建立头颈癌多模态PET/CT分析基准,1100+患者数据,最佳分割Dice 0.75,生存预测C-index 0.66。
遥感多模态大语言模型中否定理解能力的评估与增强
提出RS-Neg基准评估否定理解,发现模型表现差,NeFo方法用5%未标注样本显著提升。
ARTEMIS:基于代理引导的可靠性感知时间掩码演化用于弱监督视频息肉分割
针对弱监督视频息肉分割,提出ARTEMIS框架,融合代理引导与可靠性感知掩码演化,在多项设置中达到最优性能。