11251 条条目 · 106 个活跃源
2026年7月9日
04:00
arXiv cs.CV

格式控制的多尺度JPEG压缩响应分析用于图像级伪造筛查

提出轻量级特征工程,用多尺度误差水平分析检测图像压缩历史不一致,格式控制下AUC达0.99。

04:00
arXiv cs.CV

G-PROBE:面向3D点云的跨视场地点识别与确定性耦合定位

G-PROBE提出免学习跨视场定位框架,通过虚拟传感器分解与确定性耦合,在不对称视场下实现高性能全局定位。

04:00
arXiv cs.CV

ROAD-Waymo:面向自动驾驶的大规模动作感知数据集

基于Waymo Open数据集扩展,含198k帧、12.4M标签,用于道路场景智能体、动作、位置和事件检测。

04:00
arXiv cs.CV

从我的视角到你的视角:利用特权自我中心监督从外部视角视频学习自我中心线索

提出Ego2ExoVLM,通过时间同步视频对和特权监督,使VLM从外部视频推断自我中心属性,提升ADL监测性能。

04:00
arXiv cs.CV

T^3S:基于热时间思维的卫星图像时间序列可泛化作物分类

提出T^3S方法,用热时间替代日历时间对齐物候,提升跨年跨区域作物分类的泛化性与不确定性校准。

04:00
arXiv cs.CV

中文标题:当蒸馏破坏运动控制:恢复快速视频生成器的生成轨迹

中文摘要:提出MotionEcho框架,通过自适应教师指导修复蒸馏模型的运动控制,提升保真度与视觉质量,保持生成效率。

04:00
arXiv cs.CV

VOTE:基于轨迹集成投票的视觉-语言-动作优化

提出VOTE框架,通过减少动作token和投票集成策略,实现高效推理与高性能,边缘平台推理达46Hz,成功率优于SOTA。

04:00
arXiv cs.CV

HunyuanVideo-HOMA:多模态驱动人体动画中的通用人-物交互

提出弱条件多模态框架HunyuanVideo-HOMA,通过稀疏运动引导和适配器,实现通用人-物交互视频生成,自然性与泛化性达SOTA。

04:00
arXiv cs.CV

Trexplorer Super:CT体积中管状物体的拓扑正确中心线树跟踪

改进模型Trexplorer Super在管状物体中心线跟踪中优于现有方法,解决重复分支和提前终止,新数据集验证效果。

04:00
arXiv cs.CV

基于视觉物体属性的常识推理研究

提出OPTICS评估框架,12个VLM零样本推理远低于人类(计数<40%,比较70%),在照片、反事实、物理功能、高计数上表现差。

04:00
arXiv cs.CV

先解释再回答:组合视觉推理综述

综述组合视觉推理,梳理五阶段范式演变、60+基准及核心挑战(幻觉、推理偏见),展望世界模型与协作推理。

04:00
arXiv cs.CV

ECHO:以自我为中心的人-物体交互建模

ECHO是首个仅从头腕追踪恢复人-物交互的统一框架,三变量扩散过程实现灵活输入与长序列一致性生成,性能最佳。

04:00
arXiv cs.CV

前瞻思考:多模态大语言模型与世界模型中的预见智能

新数据集FSU-QA评估和提升模型预见未来事件能力,微调后性能显著超越更大模型。

04:00
arXiv cs.CV

T2T-VICL:通过隐式文本驱动视觉语言模型的跨任务视觉上下文学习

提出T2T-VICL框架,利用隐式文本驱动实现跨任务视觉上下文学习,提升任务对齐与图像保真度。

04:00
arXiv cs.CV

VFM-Loc:通过对齐判别性视觉层次实现无需训练的跨视角地理定位

VFM-Loc无需训练,对齐视觉基础模型判别性层次,跨视角定位性能超越监督方法20%以上。

04:00
arXiv cs.CV

面向协同碰撞预测的时空语义V2X框架

提出语义V2X框架,利用V-JEPA生成时空语义嵌入,传输至车辆预测碰撞,通信量降四个数量级,F1提升10%。

04:00
arXiv cs.CV

MMEarth-Bench:通过多模态测试时训练实现全球模型适应

提出MMEarth-Bench多模态环境任务基准,发现模型地理泛化差,通过测试时多模态重构训练提升性能。

04:00
arXiv cs.CV

基于密集轨迹生成的几何感知单图像4D合成

MoGe4D利用密集4D点轨迹扩散,从单图合成几何感知的动态4D场景,实现时空一致和新视角渲染。

04:00
arXiv cs.CV

HART:通过闭环框架的高分辨率无标注推理技术

HART提出闭环框架,无需外部标注即可聚焦高分辨率关键区域,优化推理性能,显著超越强基线。

04:00
arXiv cs.CV

混凝土低对比度XCT图像分割:一种无监督方法

针对混凝土XCT低对比度问题,提出无监督自标注法,结合超像素与CNN,优于灰度阈值,提升骨料-砂浆区分度。

04:00
arXiv cs.CV

如果呢?基于世界模型的情境推理模拟仿真

提出WanderDream数据集,实现无需主动探索的心智模拟,验证世界模型在情境推理中的有效性。

04:00
arXiv cs.CV

EventVGGT: 探索跨模态蒸馏以实现一致的事件深度估计

提出EventVGGT,通过三级跨模态蒸馏从VGGT提取时空与几何先验,事件深度估计误差降低53%以上。

04:00
arXiv cs.CV

G-ZAP: 可泛化的零样本任意尺度全色锐化框架

提出G-ZAP零样本框架,实现任意尺度全色锐化,跨场景泛化,支持权重重用,性能SOTA。

04:00
arXiv cs.CV

雨滴与反射的统一去除:新基准与新流程

定义统一去除雨滴反射任务,构建真实数据集,提出扩散框架实现最优性能。

04:00
arXiv cs.CV

CompDiff:面向公平与零样本交叉医学图像生成的层次化组合扩散

CompDiff通过层次化分解人口条件,实现零样本交叉泛化,提升医学图像生成公平性与质量。

04:00
arXiv cs.CV

从内容到受众:面向广播电视分析的多模态标注框架

提出多模态标注框架,评估九种前沿模型在意大利电视新闻中的语义标注,并整合收视数据揭示受众敏感性与代际差异。

04:00
arXiv cs.CV

FMMC:利用基础模型实现精确的材料分类

提出FMMC框架,通过生成高质量材料图像与融合视觉语言模型先验,突破数据瓶颈,显著提升材料分类精度。

04:00
arXiv cs.CV

MegaFlow:零样本大位移光流

MegaFlow利用预训练全局ViT特征实现全局匹配与轻量细化,在零样本大位移光流上达到SOTA,并具强迁移性。

04:00
arXiv cs.CV

GP-4DGS: 基于变分高斯过程的单目视频概率4D高斯溅射

提出GP-4DGS框架,利用变分高斯过程实现动态场景概率建模,量化运动不确定性并提升重建质量。

04:00
arXiv cs.CV

TIR-Agent:训练探索性与高效的图像恢复智能体

TIR-Agent通过监督微调与强化学习训练,结合随机扰动和自适应奖励,实现高效决策,推理加速2.5倍,超越12个基线。

04:00
arXiv cs.CV

AlloSR²:通过同质异构生成流修正一步超分辨率以保持真实感

提出AlloSR²框架,利用SNR引导初始化与流锚定一致性,实现一步真实超分辨率,平衡保真与真实感。

04:00
arXiv cs.CV

EgoExoMem:基于同步第一人称和第三人称视频的跨视角记忆推理

提出跨视角记忆推理基准EgoExoMem及无训练帧选择法E²-Select,最佳模型仅55.3%,新方法达58.2%。

2026年7月8日
04:00
arXiv cs.CV

CanvasAgent:通过视觉工具编排实现复杂图像创建与编辑

CanvasAgent通过CanvasCraft数据集训练,学习编排多种视觉工具进行多轮交互,实现复杂图像创建与编辑。

04:00
arXiv cs.CV

合成雾霾条件下无人机检测与跟踪的任务驱动评估

合成雾导致无人机检测跟踪性能下降、漏检增多,含雾训练最有效,恢复质量不直接改善下游感知。

04:00
arXiv cs.CV

单摄像头单光源双目视线估计

提出用单摄像头单光源实现视线估计,通过引入虚光源和虚闪烁,利用瞳孔与闪烁距离关系,验证新归一化因子,性能可接受。

04:00
arXiv cs.CV

基于级联特征消除的层次分类:在人类表型本体对齐的面部表型分析中的应用(FaceMesh2HPO)

FaceMesh2HPO采用级联特征消除的层次分类,利用3D面部网格与HPO对齐,实现可解释表型分类,但对罕见叶项性能有限。

04:00
arXiv cs.CV

统计对抗:视觉数据集中的自然后门特征

发现视觉数据中自然存在的统计信号可像后门一样操控模型预测,且跨架构迁移。

04:00
arXiv cs.CV

渲染感知的贝叶斯三维高斯泼溅:原生不确定性与自适应复杂度控制

提出渲染感知贝叶斯3DGS,用正态逆威沙特后验跟踪不确定性,主动视图选择PSNR提升0.453dB,校准误差降17倍。

04:00
arXiv cs.CV

Light-Omni:长期记忆下的智能体视频理解中反射优于推理

提出Light-Omni框架,通过双上下文状态实现反射式视频理解,避免迭代推理,速度提升12倍,准确率提升2.4%。

04:00
arXiv cs.CV

多教师对比蒸馏:面向边缘高效病理基础模型

提出MuCoDi,用多教师对比蒸馏将病理基础模型压缩为轻量编码器,在边缘设备高效推理且性能接近教师。

04:00
arXiv cs.CV

利用生成图像模型实现无需训练的原始形状抽象

无需训练的3D形状基元抽象方法,利用生成图像和视觉语言模型实现零件分割与拟合,类别无关,精度瓶颈在分割。

04:00
arXiv cs.CV

Ground3D-LMM:基于LMM的细粒度3D点指涉与空间推理

Ground3D-LMM实现点指涉与度量对话,ScanNet上强基线(2.5M问答对)

04:00
arXiv cs.CV

补丁知识迁移用于高效AI生成图像质量评估

提出补丁知识迁移框架,通过多级蒸馏实现高效评估,计算成本降低67.7%且性能接近教师模型。

04:00
arXiv cs.CV

关联恢复测试:揭示遗忘后可恢复的快捷关联

提出ART方法,诊断遗忘后快捷关联的功能性可恢复性,揭示输出与表征指标未覆盖的方面。

04:00
arXiv cs.CV

Taxlifier:利用疾病分类学增强胸部X线多标签分类

提出两种层次多标签分类方法,利用疾病层次关系,在三个大型数据集上显著提升准确率、AUC和F1分数。

04:00
arXiv cs.CV

级联扩散反演恢复云微结构

提出两阶段扩散超分辨率框架,逆扩散将云微结构提升4倍,优于现有方法,捕捉关键细小云结构。

04:00
arXiv cs.CV

基于LoRA的跨上下文视觉-语言适应用于临床伤口监测中的个性化严重不良事件检测

提出双流LoRA跨上下文融合与OOD检测的视觉-语言框架,实现临床伤口监测中个性化严重不良事件高效检测。

04:00
arXiv cs.CV

VEIL:视觉编码劫持如何诱导视觉模型中的偏差

VEIL揭示图表编码劫持视觉模型导致偏差,注意训练可部分缓解,提议将图表时间序列分类视为表示与测量问题。

04:00
arXiv cs.CV

REVIVE:面向自动驾驶车辆中破坏行为检测与恢复的多模态框架

提出REVIVE多模态框架,检测并恢复自动驾驶摄像头涂鸦遮挡攻击,采用类型感知修复,显著恢复目标检测性能(召回率从0.588升至0.967)。

04:00
arXiv cs.CV

面向二维高斯图像表示的聚类码本量化

提出聚类引导矢量量化,将高斯参数分组量化,实现比特率降低20%且质量不变。