11211 条条目 · 106 个活跃源
2026年7月14日
04:00
arXiv cs.CV

面向激光雷达距离图像合成的对抗引导扩散

首次用对抗引导扩散生成LiDAR距离图像无限制对抗样本,保持数据流形并诱导结构化分割错误,可调且可迁移。

04:00
arXiv cs.CV

解缠:特征丰富发丝的创建、编辑与推断框架

提出五维参数空间和中心线映射,结合生成式AI实现发丝纹理独立创建与编辑。

04:00
arXiv cs.CV

MVMGNN:基于结构MRI的多视图掩码图神经网络用于阿尔茨海默病诊断

MVMGNN通过多视图掩码图网络和跨视图融合,提升AD诊断性能并识别关键脑区。

04:00
arXiv cs.CV

面向客观书写障碍检测:一种多分支深度学习的在线笔迹分析方法

提出融合时域信号与图像表示的多分支深度学习框架,实现客观书写障碍检测,在DiaGraMo数据集上效果最优。

04:00
arXiv cs.CV

面向摄像头优先视觉代理的记忆条件化工具调用

个人视觉记忆可提升代理工具调用效果,三层记忆结构使工具查询相关性与端到端效用分别提升11.2%与9.7%。

04:00
arXiv cs.CV

TDSal:基于任务的由上而下显著性预测模型

提出任务驱动显著性模型,根据语言任务描述调节注意力,生成依赖任务的显著性图,更真实建模目标导向视觉注意。

04:00
arXiv cs.CV

ShapKO: 基于Shapley的自适应模态剔除用于鲁棒多模态学习

ShapKO通过Shapley值自适应调整模态剔除概率,抑制主导模态,增强缺失模态下的鲁棒性。

04:00
arXiv cs.CV

Transformer时序头与池化后运动门是否有助于基于CorrNet的连续手语识别?一项实证研究

研究发现Transformer头和运动门未能提升CorrNet性能,MotionGate退化为恒等映射,显式运动注入冗余。

04:00
arXiv cs.CV

眼部活体验证的双流挑战-响应协议

提出双流时空亮度刺激同步矩阵,评估平滑追踪与瞳孔收缩延迟,理论证明可检测深度伪造攻击。

04:00
arXiv cs.CV

UniPose9D:通用类别无关的目标姿态估计

提出类别无关的9D姿态估计基础模型,用点对和RANSAC算法预测NOCS坐标,流匹配处理对称歧义,泛化性强。

04:00
arXiv cs.CV

Banshee:通过声学注入对云台稳定视觉跟踪系统的目标切换攻击

提出Banshee声学注入攻击,利用云台声学漏洞诱导摄像头漂移,使无人机跟踪系统切换目标,成功率超93%。

04:00
arXiv cs.CV

弥合目录与现实差距:基于多阶段对比学习的可扩展商品识别

提出Cat2Real多阶段对比学习框架,将商品识别转为跨域检索,通过困难负样本挖掘实现零样本泛化。

04:00
arXiv cs.CV

模型教你怎么画:面向统一多模态推理的自适应视觉门控

利用模型内部信号自适应门控视觉生成,避免误导并节省计算,提升多模态推理准确性和效率。

04:00
arXiv cs.CV

FlashBEV: 快速且内存高效的IO感知精确BEV变换

FlashBEV通过IO感知全融合执行,消除中间张量,实现峰值内存降低超一个数量级并显著加速推理。

04:00
arXiv cs.CV

CVKD-UDA:面向三维无监督域自适应分割的跨视图知识蒸馏

通过改变体素大小构建域相似表示,利用跨视图知识蒸馏平衡可迁移性与判别性,提升三维无监督域自适应分割性能。

04:00
arXiv cs.CV

无标签目标域自适应:通过双阶段蒸馏实现无约束事件-图像特征匹配

提出双阶段蒸馏无标签自适应方法,实现事件-图像特征匹配,无需标注或传感器标定,在MVSEC和TUM-VIE上达最优。

04:00
arXiv cs.CV

ScratNet:基于Swin的多尺度空洞网络与精度优化用于半导体划痕分割

ScratNet融合Swin Transformer与多尺度空洞解码器,实现半导体划痕高精度分割,优于传统方法。

04:00
arXiv cs.CV

EMBRACE:一种用于卵裂期胚胎综合质量评估的多任务框架

提出EMBRACE多任务深度学习框架,实现碎片分割、发育阶段分类和对称性分级,性能优秀。

04:00
arXiv cs.CV

TextGaze: 利用文本场景线索引导视线目标估计

提出TextGaze,利用大视觉语言模型作为语义指导,通过跨模态融合和层次文本监督,实现高效视线目标估计,跨数据集泛化强。

04:00
arXiv cs.CV

REVA-PO:稳定胸部X光报告生成的强化学习方法

提出REVA-PO框架,通过动态KL正则化和策略重置稳定强化学习,在MIMIC-CXR和IU-Xray上BLEU-4提升5.1%和3.6%,临床指标显著领先。

04:00
arXiv cs.CV

FlowPainter:基于置信度引导补全的光流内绘

提出FlowPainter,通过置信度引导的软补全生成光流,提升大位移和复杂运动估计的准确性与收敛效率。

04:00
arXiv cs.CV

EmoStyle:面向风格专家模型的情感条件调控用于情感图像生成

EmoStyle利用LLM预测情感线索并编码为条件向量,结合风格专属LoRA专家,实现情感图像生成,获挑战赛第一。

04:00
arXiv cs.CV

BiLoG-Net:一种双上下文位置引导网络用于乳腺X线肿块分割及恶性分类

提出双上下文位置引导网络,联合肿块分割与恶性分类,在两项基准上达SOTA,Dice超94%,分类准确率超95%。

04:00
arXiv cs.CV

DynaFilter:云驱动的卫星边缘智能动态过滤技术

DynaFilter实现卫星边缘压缩域内动态RoI推理,数据量降低1.6-7.1倍,带宽节省92%,能耗降低43-88%,推理加速1.6-3倍。

04:00
arXiv cs.CV

LFD:利用大规模数据集实现真实世界的无透镜人脸识别

提出大规模无透镜人脸数据集LFD,包含真实场景多样本与多设备,推动无透镜人脸识别。

04:00
arXiv cs.CV

织地:无训练超高分辨率遥感理解的结构化证据构建与推理

WeaveEarth通过结构化证据构建与推理,无需训练即高效组织局部与全局上下文,实现超高分辨率遥感图像理解。

04:00
arXiv cs.CV

针对视觉语言模型的不可察觉且可逆的对抗样本用于隐私保护

提出CloakDiff框架,通过扩散对抗编辑与可逆网络生成不可察觉的对抗样本,实现高保真可逆隐私保护。

04:00
arXiv cs.CV

弱监督视频异常检测的结构化证据选择

SESAD框架通过语义重组与几何判别缓解场景干扰,提升弱监督视频异常检测的稳定与准确性。

04:00
arXiv cs.CV

ChartSync:一种面向视觉-逻辑级联图表编辑的基准测试

构建ChartSync基准(870个三元组)评估图表级联编辑,发现多数模型几何同步能力差,仅两个专有模型初步具备该能力。

04:00
arXiv cs.CV

PhenoEmbed:用于单树冠物候的自监督多光谱无人机时间序列嵌入

PhenoEmbed自监督模型利用18期无人机多光谱数据学习树冠物候嵌入,256维向量紧凑表征季节动态。

04:00
arXiv cs.CV

InterPet4D:用于宠物运动生成的多模态四维人宠交互数据集

首个大规模人犬交互多模态数据集(680万帧),用于运动生成,模型FID达11.21显著优于基线。

04:00
arXiv cs.CV

动态情感推理基准测试:以观众为中心的视频情感数据集

提出首个动态情感推理基准DAR,含15K视频与36K情感片段,实现细粒度情感因果推理新标杆。

04:00
arXiv cs.CV

通过合成模态实现大型多模态模型对多种视觉模态的泛化

提出VVM-Tuning框架,合成多样图像训练模型,使其零样本适应未见模态,并构建VVM-Bench验证有效性。

04:00
arXiv cs.CV

基于几何感知的高斯先验与轴向注意力用于宫颈细胞学图像分类

提出几何感知高斯先验与轴向注意力框架,在宫颈细胞学分类中达99.48%和96.08%准确率,突出诊断区域。

04:00
arXiv cs.CV

CoSAG: 基于无训练率失真编码的紧凑语义锚点高斯法

CoSAG提出无训练率失真编码,通过空间语义锚点和预测熵编码实现亚兆字节存储,场景大小压缩37-76倍且精度更高。

04:00
arXiv cs.CV

短答案VQA得分究竟衡量了什么?多模态短答案基准中评估器依赖的不稳定性

短答案VQA得分混淆语义正确与形式匹配,近半错误源于形式不匹配,需附带语义审计。

04:00
arXiv cs.CV

GRC-ProbNet:面向心血管疾病分类的不确定性感知特征提取

GRC-ProbNet利用深度集成提取不确定性特征,将心血管疾病分类AUROC提升至92.92%。

04:00
arXiv cs.CV

梯度跳跃相关性传播:用于视觉Transformer的高效可解释性

GradSkip方法通过自适应头加权和跳过感知传播,实现ViT高效可解释性,忠实性最优且计算量降低14倍。

04:00
arXiv cs.CV

GNOCHI: 用于紧密人-人交互的生成式神经模型

提出GNOCHI模型,基于条件变分自编码器生成紧密交互,通过数据增强和碰撞感知损失实现物理正确的交互合成。

04:00
arXiv cs.CV

跨任意角色拓扑的神经运动混合

提出跨异构骨骼的运动混合框架,利用语义编码和扩散解码,通过插值潜变量实现平滑运动合成。

04:00
arXiv cs.CV

ABot-N1:迈向通用视觉语言导航基础模型

提出解耦认知与控制的慢快架构,用像素锚点统一多任务,城市场景导航POI到达率提升35%。

04:00
arXiv cs.CV

垂直融合:压缩内部表示以实现鲁棒ViT分类

VFusion通过垂直聚合ViT内部层级特征,利用中间层冗余纠正最后一层错误,显著提升分类鲁棒性。

04:00
arXiv cs.CV

自监督自动抠图

SSMatte首次实现无需标注的自监督自动抠图,通过分解语义锚定与细节抠图,性能媲美全监督方法。

04:00
arXiv cs.CV

SynthDocBench:面向长上下文视觉文档理解的受控基准

提出合成基准SynthDocBench,系统控制多因素,揭示VLM在长文档中的长度退化、位置敏感性和图表理解崩溃三大失败模式。

04:00
arXiv cs.CV

TVT-PAPD:面向自监督全切片图像分类的病理感知原型蒸馏

提出TVT-PAPD,利用病理感知原型蒸馏学习WSI形态模式,在脑胶质瘤分类中达93%和90%加权F1,跨队列泛化好。

04:00
arXiv cs.CV

乳腺摄影基础模型在域偏移下的鲁棒性基准测试

多数据集评估发现乳腺摄影基础模型鲁棒性参差不齐,数据集级域外评估是关键。

04:00
arXiv cs.CV

物理启发的伪异常生成与原型特征引导的三维异常检测

提出PA3AD框架,通过物理启发生成伪异常和原型特征引导,有效学习分布偏移,实现领先的3D异常检测性能。

04:00
arXiv cs.CV

BOCCHI:基于MSDCT-UNet的更真实、更具挑战性的局部运动模糊检测基准

提出BOCCHI基准与MSDCT-UNet网络,克服梯度捷径,仅用633张训练图像实现跨数据集最优迁移。

04:00
arXiv cs.CV

无标注家具编码:编码内容与迁移能力

自监督FSQ点云编码可替代类别和姿态标注,训练目标控制旋转信号,迁移性因形状而异。

04:00
arXiv cs.CV

SPORT:面向不完整多视图聚类的结构感知原型解耦

提出SPORT框架,通过解耦原型共享与专有成分、结构感知对比学习及混合插补,提升不完整多视图聚类性能。