11301 条条目 · 106 个活跃源
2026年6月2日
04:00
arXiv cs.CV

Real2SAM2Real:生成式3D缓存作为视频扩散的补充上下文

通过生成式3D缓存为视频扩散提供几何支撑,实现相机与多物体运动的解耦控制,保持时空一致性。

04:00
arXiv cs.CV

面向大型视觉-语言模型的双曲与证据优先专家

AsyMoE用双曲几何建模层次关系、证据优先保持上下文,性能提升1.5%-3.8%,参数减少25%。

04:00
arXiv cs.CV

何处精炼,何时停止:通过潜在差异重新思考冗余以实现高效视觉自回归生成

基于潜在差异的LD-Pruning无需训练,通过区域选择和自适应跳过实现高效生成,最高加速2.35倍。

04:00
arXiv cs.CV

HiGS:一种面向实时三维高斯泼溅的分层渲染架构

HiGS通过分层平铺架构分离分区与光栅化,加速达15.8倍,并保持精确alpha合成。

04:00
arXiv cs.CV

无需训练、对象无关的配送中心堵塞检测

提出无需标签的堵塞检测法,利用参考点遮挡信号,精度达100%,F1为93.33%,优于传统方法。

04:00
arXiv cs.CV

UniVerse:面向无分割、解耦多概念个性化的统一调制框架

无需分割掩码,UniVerse从复杂场景中精确解耦并提取多概念,显著提升定位精度与视觉保真度。

04:00
arXiv cs.CV

LFA:面向自动驾驶中2D目标检测器运行时自省的分层特征注意力

提出LFA,通过注意力机制聚合多层特征,实现检测错误预测的最优性能。

04:00
arXiv cs.CV

扩散模型中减少幻觉的分数控制

提出方差引导分数调制(VSM)策略,控制分数雅可比减少幻觉,效果提升约25%,保持高质量与多样性。

04:00
arXiv cs.CV

非学习的弱光立体视觉

提出非学习立体框架,用FoJ保留粗特征构建代价体,引导边界感知SGM生成稀疏视差图,精度优于最新算法。

04:00
arXiv cs.CV

通过点云上采样优化3D高斯泼溅

评估多种点云上采样及深度引导方法,提升3DGS初始点质量,不同场景适用不同策略。

04:00
arXiv cs.CV

Zamba2-VL技术报告

Zamba2-VL是混合架构视觉语言模型,在多项基准中媲美先进Transformer模型,首令牌延迟低近一个数量级,适合边缘部署。

04:00
arXiv cs.CV

αDepth:学习单次软边界分解实现立体转换

αDepth用分层表示与圆形阿尔法机制分解软边界,消除背景渗色与结构扭曲,实现高保真立体转换。

04:00
arXiv cs.CV

Physical Object Understanding with a Physically Controllable World Model

04:00
arXiv cs.CV

4D雷达与激光雷达和相机协同:恶劣天气下的合作感知

集成4D成像雷达与多普勒引导注意力,提升恶劣天气下合作感知的鲁棒性,实验验证显著效果。

04:00
arXiv cs.CV

高分辨率地形高程数据摊销神经表示的再思考

针对地形高程数据,现有摊销隐式神经表示存在跨域差距,提出HUVR+SIREN超网络,实现高保真度与紧凑存储。

04:00
arXiv cs.CV

三思而后行:视觉语言模型中的幻象检测

提出TC-LIA方法,利用CLIP ViT-H/14层间对齐追踪视觉证据,结合多特征集成检测,达94.6-94.7%准确率,幻象率低于3%。

04:00
arXiv cs.CV

使用动态网格-高斯重建的实时物理模拟

提出双表示框架加速物理模拟,发现高质量重建与物理兼容拓扑无法通过后处理调和。

04:00
arXiv cs.CV

DarkVesselNet:用于暗船检测的多模态遥感与轨迹推理

融合AIS与卫星雷达/光学数据,通过轨迹推理和异常评分实现暗船检测。

04:00
arXiv cs.CV

GeoSAM-3D:基于测地提示传播的单目视频开放词汇3D场景分割

GeoSAM-3D通过单目视频,利用测地传播核在重建场景图上传播提示,实现开放词汇3D分割,有效保持曲面连续性并减少泄漏。

04:00
arXiv cs.CV

CVPR 2026第八届UG2+挑战赛赛道3:湍流中动态目标分割的有效解决方案

基于SegAnyMo,通过数据域自适应和时空后处理提升湍流分割性能,获挑战赛第二名。

04:00
arXiv cs.CV

超越静态高斯:动态3D场景重建架构范式的实证研究

动态3DGS分为结构引导与高斯中心范式,前者保真高模型紧凑,后者渲染快但质量不稳,揭示质量与速度的权衡。

04:00
arXiv cs.CV

基于视觉Mamba的3D分割一切模型用于诊断胎盘植入谱

提出3DSAMba框架,融合3D SAM与Mamba,通过分割MRI病变区域实现胎盘植入谱诊断,显著提升性能。

04:00
arXiv cs.CV

基于可解释层次自注意力的时域震颤检测方法

提出可解释两阶段时域震颤检测框架,结合CNN-LSTM与视觉变换器,九体部位平均F1为0.765,提供时间与解剖模式可解释性。

04:00
arXiv cs.CV

MUSCLE-NET: Predicted-Multiscale-Aware Network for Pedestrian Trajectory Forecasting

04:00
arXiv cs.CV

CodeCytos:通过代码增强智能体动作空间实现AI辅助空间分子成像分析

提出CodeCytos框架,通过代码增强智能体实现空间分子成像的动态编程交互,提升自动化与定制化,优于基线方法。

04:00
arXiv cs.CV

OptiWorld:物理约束下视频世界生成的最优控制

OptiWorld将最优控制引入视频生成,通过几何规划实现物理约束下的最优轨迹,生成更优动力学视频。

04:00
arXiv cs.CV

V-LynX:面向视频+X大语言模型的令牌接口对齐

V-LynX通过令牌接口对齐注意力与分布,无需配对数据即可将新模态高效整合至视频大语言模型,达到最优性能。

04:00
arXiv cs.CV

基于临床动机的多重损坏增强的CT分割系统部署前鲁棒性压力测试

提出RAMP多损坏增强框架,显著提升CT分割在临床异质条件下的鲁棒性,损坏Dice提高至0.75以上,鲁棒性差距缩小至0.07以内。

04:00
arXiv cs.CV

复杂介质中基于结构感知一致性先验的偏振形状恢复

提出结构感知偏振先验与双分支网络,解决复杂介质(如冰)表面法线估计难题,MAE达16.01度,优于现有方法。

04:00
arXiv cs.CV

CAFOSat:一个用于基础设施感知的CAFO制图的高分辨率影像强标注数据集

CAFOSat是含45000+影像块、覆盖20州和4类CAFO的强标注数据集,用于高分辨率遥感CAFO制图。

04:00
arXiv cs.CV

DeepLatent:通过并行潜在视觉推理进行图像思考

提出DeepLatent并行框架,用LatentFormer和连续空间强化学习优化视觉推理,在多个基准上达最优性能。

04:00
arXiv cs.CV

FiSeR:面向跨域AI图像检测的细粒度源表示

提出层次对比学习框架,利用生成器身份信息增强特征可迁移性,跨域检测AUROC提升超10%。

04:00
arXiv cs.CV

面向视觉语言推理的分解式同策略蒸馏:引导梯度实现视觉基础

提出视觉梯度引导法(VGS),通过分解损失优先优化视觉子空间,显著提升视觉基础能力。

04:00
arXiv cs.CV

响应感知多模态学习用于治疗后视力预测

提出ReVA框架,整合早期OCT及临床数据,预测DME患者多年视力轨迹,误差低。

04:00
arXiv cs.CV

使用GRPO改进视觉表示对齐生成

提出VRPO强化学习策略,以奖励引导扩散特征与视觉嵌入对齐,提升生成保真度与收敛速度,FID提升1.8、训练加速2.3倍。

04:00
arXiv cs.CV

透过PRISM:原则感知、可解释与多尺度的视觉设计评估

PRISM基准含11万扰动样本,揭示模型对设计原则不敏感;提出多尺度框架整合定量评估、局部与全局推理,实现可解释布局质量分析。

04:00
arXiv cs.CV

ASAP:推进医学体积表示学习的解剖感知语义自适应预训练

提出ASAP框架,融合器官先验与语义对齐,在胸部CT多任务中达SOTA,尤其擅长小样本与分布偏移场景。

04:00
arXiv cs.CV

基于聚类引导的优化与模型集成投票改进遥感图像视觉定位

提出结合RemoteSAM与SAM3的聚类引导优化和模型集成投票方法,显著提升遥感视觉定位的准确性与鲁棒性。

04:00
arXiv cs.CV

ETC:通过任务感知的视觉信息蒸馏实现VLM中的极端令牌压缩

ETC框架利用变分信息蒸馏与任务感知注意力,以极少数令牌保留关键信息,大幅降低KV缓存开销并保持性能。

04:00
arXiv cs.CV

基于属性的视频复杂度度量

提出VideoABC框架,通过属性空间量化估计视频问答复杂度,优于其他方法且具有可解释性。

04:00
arXiv cs.CV

暂停与思考:面向视频辅助动作建议的数据集与基准

提出推理数据集,紧凑模型在视频辅助动作建议上达58%准确率,超越大规模模型。

04:00
arXiv cs.CV

基于形状先验的点云补全用于单阶段全稀疏3D目标检测

提出基于形状先验的点云补全方法,通过实例选择和对齐补全,显著提升单阶段全稀疏3D检测性能。

04:00
arXiv cs.CV

FlowNar:长视频的可扩展流式叙述

FlowNar通过动态上下文管理与CLAM模块,实现长视频流式叙述的有界内存和高效计算,质量与吞吐量显著提升。

04:00
arXiv cs.CV

MM-Snowball:多模态多轮对话中幻觉雪崩的评估与缓解

提出MM-Snowball基准诊断对话幻觉雪崩,发现现有方法无效;提出CAVR方法通过双重视觉修正实现最优性能。

04:00
arXiv cs.CV

TAP-JEPA:基于冻结的未来潜在探测与两阶段分数融合的EPIC-KITCHENS-100动作预测

利用冻结V-JEPA特征和两阶段分数融合的动作预测方法,获EK-100挑战赛亚军,MT5R达27.91%。

04:00
arXiv cs.CV

脑肿瘤手术中术中超声到MR图像合成的系统性基准评估

系统比较6种ioUS-MR生成器,发现感知质量(LPIPS)与下游任务密切正相关,SSIM负相关,SynDiff-2.5D分割最优。

04:00
arXiv cs.CV

Wan2.2双专家视频扩散模型的协同少步蒸馏与低位量化

针对Wan2.2模型,结合少步蒸馏与低位量化,分别校准高、低噪声分支,量化在蒸馏后模型校准,20步实现最佳质量效率权衡。

04:00
arXiv cs.CV

基于EuroCrops驱动的哨兵2作物分割的建模与评估框架

提出EuroCrops驱动的哨兵2作物分割框架,U-Net达76.65% mIoU,但外部评估显示域迁移差距。

04:00
arXiv cs.CV

T-CLIP:为对比语言-图像预训练赋能热感知识别

针对CLIP无法对齐热成像的感知差距,提出物理感知描述流水线IR-Cap和解耦双LoRA框架T-CLIP,显著提升跨模态检索。

04:00
arXiv cs.CV

中文标题:用于多模态脑MRI合成的小波融合扩散模型,具有模态和元数据条件

中文摘要:提出小波融合扩散模型,结合条件潜在扩散与元数据,高效合成多模态脑MRI,实现最佳分布对齐。