11301 条条目 · 106 个活跃源
2026年6月15日
04:00
arXiv cs.CV

形态感知样本分配:克服IoU不敏感性用于表面缺陷检测

引入形态相似性指标补偿IoU局限,重塑匹配响应分布,提升正样本分配精度,零推理开销。

04:00
arXiv cs.CV

TSA:用于持久对象中心视频表示的时序槽激活

提出TSA机制,通过激活门控更新和注意力偏置抑制状态漂移与重建干扰,提升长视频中对象分解与时间身份保持。

04:00
arXiv cs.CV

自监督遥感视觉模型如何迁移到下游任务?

研究六种自监督遥感模型迁移,发现排名因任务和适应设置而异,中间层比末层更有用,下游设计至关重要。

04:00
arXiv cs.CV

滤波器对之间的连接提升卷积神经网络精度

本文提出可学习参数实现滤波器对间的通用连接,提升CNN精度与适应性。

04:00
arXiv cs.CV

CineOrchestra:面向电影级视频生成的统一实体中心条件控制

提出CineOrchestra统一视频扩散模型,用两项新型旋转位置嵌入同时控制主体、事件、镜头和转场,性能超越专业模型。

04:00
arXiv cs.CV

将图像风格训练压缩为单次模型前向传播

i2L框架基于单次前向传播预测风格LoRA权重,无需逐风格优化,显著提升风格保真度与图像质量。

04:00
arXiv cs.CV

解释RhythmFormer:远程光电容积描记法中周期性稀疏注意力的系统性XAI分析

提出归因方法与忠实性指标,评估rPPG Transformer可解释性,Beyond Intuition在皮肤覆盖和忠实性上最优。

04:00
arXiv cs.CV

Temporal Backtracking Search for Test-time Generative Video Reasoning

04:00
arXiv cs.CV

Avatar V:扩展基于视频参考的虚拟人视频生成

Avatar V以参考视频token序列为条件,通过稀疏参考注意力学习身份与动态特征,生成无限时长1080p视频,性能SOTA。

04:00
arXiv cs.CV

幻象探针:视觉模型如何伪造视觉理解

本文发现视觉语言模型的幻象行为有两种:文本偏见与虚假图像构造,需在表征层面干预才能实现真实视觉接地。

04:00
arXiv cs.CV

ViT-Up:视觉Transformer的忠实特征上采样

ViT-Up用中间隐藏状态构建查询,实现忠实特征上采样,提升密集预测性能。

04:00
arXiv cs.CV

CaricHarmony:身份保持漫画合成的对比扩散路径

提出训练无关的CaricHarmony,通过并行纯净扩散路径解决条件信号污染,快速生成身份保持的漫画。

04:00
arXiv cs.CV

上下文引导的语义对齐用于特征融合网络

提出FINE模块,用高层上下文引导低层语义对齐,降低复杂度,提升检测精度。

04:00
arXiv cs.CV

Prompt2Effect: 通过LoRA生成实现无需训练的图像到视频模型特化

Prompt2Effect超网络直接合成效果LoRA权重,无需训练,性能媲美微调,耗时从56小时降至3.3秒。

04:00
arXiv cs.CV

PMOF:使用顶置鱼眼摄像头的乘客监控数据集与基准

首个移动车辆内顶视鱼眼乘客监控数据集PMOF,含1.9万帧标注,跨域微调AP50达94.8%,提升检测泛化能力。

04:00
arXiv cs.CV

HiLo-Token:面向高效图像编辑的输入自适应高低频令牌压缩

提出HiLo-Token方法,按区域高低频自适应分配令牌,编辑区保留全令牌,非编辑区按频率选择,实现2-3倍DiT加速且质量无损。

04:00
arXiv cs.CV

HARBOR:基于行为观测与雷达的航向分析与重建

HARBOR利用单张SAR图像预测船舶运动,通过骨架几何和离线AIS校准生成概率热图,实现数据缺失环境下的态势感知。

04:00
arXiv cs.CV

空中野生动物定位器(OWL):弱监督学习在航空野生动物调查中的基准测试

提出OWL弱监督密度估计框架,三个变体性能优异,OWL-D在Delplanque上AP达0.934创SOTA。

04:00
arXiv cs.CV

RT-VLA:通过知识蒸馏实现的实时视觉-语言-动作模型

通过知识蒸馏将SimLingo压缩为轻量RT-VLA,推理延迟降低44.8倍,仍保持驾驶与推理性能。

04:00
arXiv cs.CV

自进化视觉提问器

提出自进化框架,使VLM无需外部监督即可持续提升视觉提问质量,生成更难、更丰富的问题,并保持多样性。

04:00
arXiv cs.CV

GarmentSketch:大规模草图至时装基准

提出了含26249张时装草图及详细描述的数据集,用于草图引导的图像生成,推动人机协作设计。

04:00
arXiv cs.CV

ShearFuse-UNet:基于Hadamard、DCT和Shearlet变换融合的次日野火蔓延预测

提出融合WHT、DCT和Shearlet变换的轻量模型ShearFuse-UNet,仅267k参数F1达0.596,超越14M参数模型。

04:00
arXiv cs.CV

Clay-CNN混合模型:利用地理基础模型作为辅助上下文进行滑坡检测

混合U-Net+Clay模型借助地理基础模型辅助上下文,滑坡检测F1达64.5%,优于单独使用GFM或标准U-Net。

04:00
arXiv cs.CV

条件至关重要:稳定扩散图像编辑中的反转与注意力

揭示文本条件精度影响反转稳定性与交叉注意力一致性,提出SimEdit框架,通过条件精炼与令牌级不对称注意力控制提升编辑性能。

04:00
arXiv cs.CV

基于扩散精化的儿童脑肿瘤MRI分割与视觉-语言解释

提出粗到精扩散分割框架,结合视觉语言模型,改善儿童脑肿瘤边界分割并生成结构化放射报告。

04:00
arXiv cs.CV

FEMOT:基于帧相机与事件相机的多目标跟踪

提出FEMOT数据集及FEMOTR多模态框架,融合RGB和事件相机,实现鲁棒多目标跟踪。

04:00
arXiv cs.CV

通过ChordEdit重新思考一步式图像编辑:复现、简化与新见解

ChordEdit通过时间偏移将一步编辑分解为低频粗传输和高频细对齐两阶段,实现自适应图像编辑。

04:00
arXiv cs.CV

基于重聚焦交叉注意力无需微调的扩散模型实现360度室内全景编辑

FocusDiff通过重聚焦交叉注意力无需微调即可精准编辑区域图像,并扩展至360度全景,在LIMB基准上表现优异。

04:00
arXiv cs.CV

一个新的多领域微动作识别与检测基准

提出多领域微动作基准MMA-82(82类、77k实例),涵盖识别与检测任务,揭示现有方法在领域迁移等场景下的不足,并发现微动作与情绪强关联。

04:00
arXiv cs.CV

WAM4D:基于空间注册令牌的快速4D世界动作模型

WAM4D用轻量空间注册令牌注入几何先验,实现高效4D动作建模,兼顾空间一致性与快速推理。

04:00
arXiv cs.CV

Pix2Pix-Hybrid:基于结构引导的朝觐人群图像条件合成,采用多通道条件与弱属性监督

提出P2P-H混合条件GAN,结合多通道与多尺度判别器合成朝觐人群图像,构建CrowdH数据集,有效提升计数模型性能。

04:00
arXiv cs.CV

HiST:用于跨模态空间转录组学建模的分层稀疏Transformer

HiST通过稀疏窗口注意力和滑动校准令牌高效实现H&E到空间转录组推断,性能更优且资源更省。

04:00
arXiv cs.CV

BoRAD:面向多类别异常检测的自举表征方法

BoRAD无标签框架通过原型库和双重正则化解决异常复制与误重构,实现多类别异常检测SOTA性能。

04:00
arXiv cs.CV

编码器冠军无法可靠迁移至不同规模VLA骨干:冻结骨干嫁接诊断法

冻结骨干嫁接诊断揭示编码器在大小VLA骨干上排名不一致,选择需针对目标骨干。

04:00
arXiv cs.CV

基于监督β-VAE与量子核的混合经典量子阿尔茨海默分类

提出混合经典量子管道,监督β-VAE提取特征,量子核SVM分类,阿尔茨海默分类达72.1%准确率。

04:00
arXiv cs.CV

中文标题:VideoWeave:通过联合几何-视频建模解锁视频生成中的几何一致性

中文摘要:提出隐式几何特征约束生成分布的VideoWeave框架,联合建模几何与视频潜空间,提升几何一致性并保持视觉质量。

04:00
arXiv cs.CV

一种面向跨生成器泛化深度伪造检测的多域特征融合框架

提出SGFF-Net,融合空间、梯度与频域特征,跨模型准确率从70.46%提升至79.80%,显著增强检测泛化性。

04:00
arXiv cs.CV

MUSE:基于记忆的增量式需求满足的智能体驱动3D场景创作

MUSE多智能体框架通过增量需求满足实现3D场景可控构建与编辑,大幅提升目标成功率和场景保真度。

04:00
arXiv cs.CV

受初级视觉皮层启发的鲁棒点云分析框架

提出仿初级视觉皮层的DC-CCNN++网络,通过神经调制和渐进训练,高效提升点云分析鲁棒性,性能媲美最先进方法。

04:00
arXiv cs.CV

一层之弃,另一层之宝:LVLMs中的自适应分层视觉令牌选择

提出ALVTS,自适应分层选择令牌,89%压缩率下保持96.7%精度,无需重训。

04:00
arXiv cs.CV

Pano3D:统一的三维重建与全景分割

提出统一框架联合训练3D重建与全景分割,几何与语义损失相互促进,在ScanNet等数据集上达最优。

04:00
arXiv cs.CV

是什么驱动了CLIP的测试时自适应?一项基于更新视角的受控实证研究

从更新视角系统研究CLIP测试时自适应,发现增益源于测试时证据和可靠代理,无万能方案。

04:00
arXiv cs.CV

刮擦镜头,深度偏移:被动相机端光学攻击

提出SLASH攻击:镜头划痕与光源互动产生伪影扭曲深度,单目深度估计误差达32%,揭示硬件缺陷作为隐藏对抗机制。

04:00
arXiv cs.CV

CausalMotion: Structured Physical Reasoning as Keyframe and Trajectory Guidance for Training-Free Video Generation

04:00
arXiv cs.CV

中文标题: ForceForget: 用于增强文本到图像模型安全性的强化概念移除

中文摘要: 通过强化学习优化概念擦除奖励并引入安全适配器,消除不安全内容同时保持模型生成高质量良性图像的能力。

04:00
arXiv cs.CV

基于块状频率叠加的点云上采样

提出无训练优化方法,通过频率叠加估计表面并均匀放置新点,在点对面距离等指标上超越现有最优。

04:00
arXiv cs.CV

MooMIns——多实例单目三维重建与物体姿态估计

利用单目图像中多个物体实例的隐式多视图几何,实现3D重建和6D姿态估计,避免深度估计幻觉。

04:00
arXiv cs.CV

工业基准-MIPU:面向工业产品的多图像属性值提取基准

首创多图像工业产品属性提取基准,揭示模型高精度低召回,多图像完整性是核心瓶颈。

04:00
arXiv cs.CV

面向通才异常检测的值序分解

提出值序分解(VOD),解耦并抑制类别、缺陷类型和域特定信息,实现跨对象、缺陷类型和数据域的泛化异常检测。