Real2SAM2Real:生成式3D缓存作为视频扩散的补充上下文
通过生成式3D缓存为视频扩散提供几何支撑,实现相机与多物体运动的解耦控制,保持时空一致性。
面向大型视觉-语言模型的双曲与证据优先专家
AsyMoE用双曲几何建模层次关系、证据优先保持上下文,性能提升1.5%-3.8%,参数减少25%。
何处精炼,何时停止:通过潜在差异重新思考冗余以实现高效视觉自回归生成
基于潜在差异的LD-Pruning无需训练,通过区域选择和自适应跳过实现高效生成,最高加速2.35倍。
HiGS:一种面向实时三维高斯泼溅的分层渲染架构
HiGS通过分层平铺架构分离分区与光栅化,加速达15.8倍,并保持精确alpha合成。
无需训练、对象无关的配送中心堵塞检测
提出无需标签的堵塞检测法,利用参考点遮挡信号,精度达100%,F1为93.33%,优于传统方法。
UniVerse:面向无分割、解耦多概念个性化的统一调制框架
无需分割掩码,UniVerse从复杂场景中精确解耦并提取多概念,显著提升定位精度与视觉保真度。
LFA:面向自动驾驶中2D目标检测器运行时自省的分层特征注意力
提出LFA,通过注意力机制聚合多层特征,实现检测错误预测的最优性能。
扩散模型中减少幻觉的分数控制
提出方差引导分数调制(VSM)策略,控制分数雅可比减少幻觉,效果提升约25%,保持高质量与多样性。
非学习的弱光立体视觉
提出非学习立体框架,用FoJ保留粗特征构建代价体,引导边界感知SGM生成稀疏视差图,精度优于最新算法。
通过点云上采样优化3D高斯泼溅
评估多种点云上采样及深度引导方法,提升3DGS初始点质量,不同场景适用不同策略。
Zamba2-VL技术报告
Zamba2-VL是混合架构视觉语言模型,在多项基准中媲美先进Transformer模型,首令牌延迟低近一个数量级,适合边缘部署。
αDepth:学习单次软边界分解实现立体转换
αDepth用分层表示与圆形阿尔法机制分解软边界,消除背景渗色与结构扭曲,实现高保真立体转换。
Physical Object Understanding with a Physically Controllable World Model
4D雷达与激光雷达和相机协同:恶劣天气下的合作感知
集成4D成像雷达与多普勒引导注意力,提升恶劣天气下合作感知的鲁棒性,实验验证显著效果。
高分辨率地形高程数据摊销神经表示的再思考
针对地形高程数据,现有摊销隐式神经表示存在跨域差距,提出HUVR+SIREN超网络,实现高保真度与紧凑存储。
三思而后行:视觉语言模型中的幻象检测
提出TC-LIA方法,利用CLIP ViT-H/14层间对齐追踪视觉证据,结合多特征集成检测,达94.6-94.7%准确率,幻象率低于3%。
使用动态网格-高斯重建的实时物理模拟
提出双表示框架加速物理模拟,发现高质量重建与物理兼容拓扑无法通过后处理调和。
DarkVesselNet:用于暗船检测的多模态遥感与轨迹推理
融合AIS与卫星雷达/光学数据,通过轨迹推理和异常评分实现暗船检测。
GeoSAM-3D:基于测地提示传播的单目视频开放词汇3D场景分割
GeoSAM-3D通过单目视频,利用测地传播核在重建场景图上传播提示,实现开放词汇3D分割,有效保持曲面连续性并减少泄漏。
CVPR 2026第八届UG2+挑战赛赛道3:湍流中动态目标分割的有效解决方案
基于SegAnyMo,通过数据域自适应和时空后处理提升湍流分割性能,获挑战赛第二名。
超越静态高斯:动态3D场景重建架构范式的实证研究
动态3DGS分为结构引导与高斯中心范式,前者保真高模型紧凑,后者渲染快但质量不稳,揭示质量与速度的权衡。
基于视觉Mamba的3D分割一切模型用于诊断胎盘植入谱
提出3DSAMba框架,融合3D SAM与Mamba,通过分割MRI病变区域实现胎盘植入谱诊断,显著提升性能。
基于可解释层次自注意力的时域震颤检测方法
提出可解释两阶段时域震颤检测框架,结合CNN-LSTM与视觉变换器,九体部位平均F1为0.765,提供时间与解剖模式可解释性。
MUSCLE-NET: Predicted-Multiscale-Aware Network for Pedestrian Trajectory Forecasting
CodeCytos:通过代码增强智能体动作空间实现AI辅助空间分子成像分析
提出CodeCytos框架,通过代码增强智能体实现空间分子成像的动态编程交互,提升自动化与定制化,优于基线方法。
OptiWorld:物理约束下视频世界生成的最优控制
OptiWorld将最优控制引入视频生成,通过几何规划实现物理约束下的最优轨迹,生成更优动力学视频。
V-LynX:面向视频+X大语言模型的令牌接口对齐
V-LynX通过令牌接口对齐注意力与分布,无需配对数据即可将新模态高效整合至视频大语言模型,达到最优性能。
基于临床动机的多重损坏增强的CT分割系统部署前鲁棒性压力测试
提出RAMP多损坏增强框架,显著提升CT分割在临床异质条件下的鲁棒性,损坏Dice提高至0.75以上,鲁棒性差距缩小至0.07以内。
复杂介质中基于结构感知一致性先验的偏振形状恢复
提出结构感知偏振先验与双分支网络,解决复杂介质(如冰)表面法线估计难题,MAE达16.01度,优于现有方法。
CAFOSat:一个用于基础设施感知的CAFO制图的高分辨率影像强标注数据集
CAFOSat是含45000+影像块、覆盖20州和4类CAFO的强标注数据集,用于高分辨率遥感CAFO制图。
DeepLatent:通过并行潜在视觉推理进行图像思考
提出DeepLatent并行框架,用LatentFormer和连续空间强化学习优化视觉推理,在多个基准上达最优性能。
FiSeR:面向跨域AI图像检测的细粒度源表示
提出层次对比学习框架,利用生成器身份信息增强特征可迁移性,跨域检测AUROC提升超10%。
面向视觉语言推理的分解式同策略蒸馏:引导梯度实现视觉基础
提出视觉梯度引导法(VGS),通过分解损失优先优化视觉子空间,显著提升视觉基础能力。
响应感知多模态学习用于治疗后视力预测
提出ReVA框架,整合早期OCT及临床数据,预测DME患者多年视力轨迹,误差低。
使用GRPO改进视觉表示对齐生成
提出VRPO强化学习策略,以奖励引导扩散特征与视觉嵌入对齐,提升生成保真度与收敛速度,FID提升1.8、训练加速2.3倍。
透过PRISM:原则感知、可解释与多尺度的视觉设计评估
PRISM基准含11万扰动样本,揭示模型对设计原则不敏感;提出多尺度框架整合定量评估、局部与全局推理,实现可解释布局质量分析。
ASAP:推进医学体积表示学习的解剖感知语义自适应预训练
提出ASAP框架,融合器官先验与语义对齐,在胸部CT多任务中达SOTA,尤其擅长小样本与分布偏移场景。
基于聚类引导的优化与模型集成投票改进遥感图像视觉定位
提出结合RemoteSAM与SAM3的聚类引导优化和模型集成投票方法,显著提升遥感视觉定位的准确性与鲁棒性。
ETC:通过任务感知的视觉信息蒸馏实现VLM中的极端令牌压缩
ETC框架利用变分信息蒸馏与任务感知注意力,以极少数令牌保留关键信息,大幅降低KV缓存开销并保持性能。
基于属性的视频复杂度度量
提出VideoABC框架,通过属性空间量化估计视频问答复杂度,优于其他方法且具有可解释性。
暂停与思考:面向视频辅助动作建议的数据集与基准
提出推理数据集,紧凑模型在视频辅助动作建议上达58%准确率,超越大规模模型。
基于形状先验的点云补全用于单阶段全稀疏3D目标检测
提出基于形状先验的点云补全方法,通过实例选择和对齐补全,显著提升单阶段全稀疏3D检测性能。
FlowNar:长视频的可扩展流式叙述
FlowNar通过动态上下文管理与CLAM模块,实现长视频流式叙述的有界内存和高效计算,质量与吞吐量显著提升。
MM-Snowball:多模态多轮对话中幻觉雪崩的评估与缓解
提出MM-Snowball基准诊断对话幻觉雪崩,发现现有方法无效;提出CAVR方法通过双重视觉修正实现最优性能。
TAP-JEPA:基于冻结的未来潜在探测与两阶段分数融合的EPIC-KITCHENS-100动作预测
利用冻结V-JEPA特征和两阶段分数融合的动作预测方法,获EK-100挑战赛亚军,MT5R达27.91%。
脑肿瘤手术中术中超声到MR图像合成的系统性基准评估
系统比较6种ioUS-MR生成器,发现感知质量(LPIPS)与下游任务密切正相关,SSIM负相关,SynDiff-2.5D分割最优。
Wan2.2双专家视频扩散模型的协同少步蒸馏与低位量化
针对Wan2.2模型,结合少步蒸馏与低位量化,分别校准高、低噪声分支,量化在蒸馏后模型校准,20步实现最佳质量效率权衡。
基于EuroCrops驱动的哨兵2作物分割的建模与评估框架
提出EuroCrops驱动的哨兵2作物分割框架,U-Net达76.65% mIoU,但外部评估显示域迁移差距。
T-CLIP:为对比语言-图像预训练赋能热感知识别
针对CLIP无法对齐热成像的感知差距,提出物理感知描述流水线IR-Cap和解耦双LoRA框架T-CLIP,显著提升跨模态检索。
中文标题:用于多模态脑MRI合成的小波融合扩散模型,具有模态和元数据条件
中文摘要:提出小波融合扩散模型,结合条件潜在扩散与元数据,高效合成多模态脑MRI,实现最佳分布对齐。