10951 条条目 · 106 个活跃源
2026年8月27日
04:00
arXiv cs.CV

CoRE:驾驶视频中弱监督由粗到细的风险证据学习

驾驶风险随时间演变且有场景实体支撑,但监督仅限粗粒度视频级标签。

04:00
arXiv cs.CV

Lightweight Machine Learning-Driven Monocular Sidewalk Path Extraction for Embedded Micromobility Navigation

04:00
arXiv cs.CV

OpenCVL:面向细粒度跨视角定位的开放多样大规模数据集

提出OpenCVL,61.7万组跨视角图像对覆盖欧洲4国41城,融合高精传感器及野外图像,纠正噪声标注,提升细粒度定位性能。

04:00
arXiv cs.CV

WAVE:反转引导层级实现从粗到细的引导深度超分辨率

WAVE利用多级小波变换反转粗到细引导层级,分离高低频并语义门控,提升深度超分辨率,尤其高倍率。

04:00
arXiv cs.CV

MulVec:面向免训练零样本组合图像检索的细粒度角色感知匹配

提出角色感知方法MulVec,将查询分解为全局与局部角色向量,分角色匹配后加权排序,无需训练即可提升零样本组合检索精度。

04:00
arXiv cs.CV

V-Link:在动作DiT中恢复视觉-语言-动作模型丢失的视觉表征

V-Link通过空间与语义查询恢复丢失视觉表征并注入动作DiT,大幅提升机器人操作成功率。

04:00
arXiv cs.CV

PointRL:从可验证标注证据中学习点级视觉-语言定位

PointRL用可验证标注作为隐藏证据,通过强化学习训练点级定位,奖励评估覆盖率与数量一致性,在PointArena提升9.5%。

04:00
arXiv cs.CV

并非所有注意力头都有助于关键视觉标记的选择:头感知剪枝更重要

关键视觉标记的选择能力集中在少数注意力头;据此提出头感知剪枝,先按相似度剪冗余再剪,性能效率兼得。

04:00
arXiv cs.CV

医学视觉语言模型在放射学中学到了什么?分布偏移下的迁移、对齐与源代理泄漏

医学VLM在分布偏移下出现盲点:迁移低、配对检索低、源代理泄漏;自监督初始化优于监督,对抗适应不稳定,需压力测试。

04:00
arXiv cs.CV

GraftSR:凭借同实例引导,为真实世界图像超分辨率嫁接真实纹理

提出GraftSR:同实例参考引导嫁接真实纹理,双掩码机制解耦注入,构建数据集,达SOTA,LPIPS降20.2%。

04:00
arXiv cs.CV

VGA-BenchV2:扩展的统一基准与多模型框架,用于评估视频美学与生成质量

扩展视频美学与生成质量基准VGA-BenchV2,含52子维度和3.6万标注,建立混合评估器,并用于强化学习优化生成模型。

04:00
arXiv cs.CV

前瞻高效训练:自回归图像生成中的多令牌辅助监督

提出MTAR:多令牌预测+对比正则+语义丢弃,改善自回归图像生成,FID降0.95,训练快39%。

04:00
arXiv cs.CV

RSFusionDet:水下RGB-声呐多模态目标检测

提出水下RGB-声呐融合检测法RSFusionDet,含跨注意力融合与目标匹配,检测精度超越基线。

04:00
arXiv cs.CV

FlashNormal:基于闪光与无闪光图像的精细表面法线估计

FlashNormal用闪光/无闪光对及曲率引导,提升表面细节,缓解形状-反射率歧义,超越现有方法。

04:00
arXiv cs.CV

看哪里很重要:长视频理解中的在策略自蒸馏

聚焦线索区间而非全视频可提升长视频理解;据此提出线索特权在策略自蒸馏,无需标签与额外模块,持续优于基线。

04:00
arXiv cs.CV

容量溢出:视觉混合专家模型中后门攻击的盲区

利用混合专家模型的容量溢出,按批大小控制后门休眠与激活,实现大型部署时攻击,规避常规审计。

04:00
arXiv cs.CV

AdaptiveEmbed:用于多模态检索的样本自适应多向量表示

提出样本自适应多向量表示SAMVR,以内容自适应嵌入集按需分配容量,提升图像、文本等多模态检索性能。

04:00
arXiv cs.CV

通信塔部件杂波无人机影像零样本分割的显著性-深度条件化方法

提出显著性-深度前景条件化策略,结合显著性与单目深度抑制杂波,改进Grounded-SAM和SAM 3,在通信塔数据集上提升分割精度、减少误检。

04:00
arXiv cs.CV

从视频基础模型自举4D LiDAR标注工具

提出LiDAR-SAM2,利用SAM2自动生成时空一致的4D LiDAR标签,无需人工标注,性能接近全监督,大幅减少标注成本。

04:00
arXiv cs.CV

PIVOT:用于真实世界三维重建中姿态、内参和新视角评估的多轨迹数据集与测试平台

提出多轨迹数据集与评估框架,评估真实三维重建的姿态、内参和新视角,发现未见轨迹及姿态内参来源显著影响性能。

04:00
arXiv cs.CV

水下高斯泼溅:受控跨环境研究

水下高斯泼溅性能由环境设置而非架构决定:浑浊度制约建图,光照几何决定介质模型有效性,基准分数会误导。

04:00
arXiv cs.CV

非对称跨模态细粒度视觉分类:ACF-Net与BirdPro基准

提出ACF-Net:光流引导运动与自适应融合,应对弱匹配音视频,构建BirdPro基准,性能最佳。

04:00
arXiv cs.CV

用于人机协作中低延迟动作预测的姿势锚定光流

提出姿势锚定光流PoseOFF,捕获关节局部运动,提升早期动作预测准确率,无需全帧计算,适合实时人机协作。

04:00
arXiv cs.CV

OpenVeinNet:基于动态蛇形卷积与图学习的鲁棒开集指静脉验证

该网络结合动态蛇形卷积与图学习提取指静脉特征,采用中心角混合损失,实现跨数据集开集验证,降低等错误率。

04:00
arXiv cs.CV

SMART:MLLM引导的时间对齐以统一手语识别与定位

SMART通过MLLM动作描述实现小批量稳定对齐,用多尺度适配器与CSFormer统一手语识别和定位

04:00
arXiv cs.CV

工业质检自动焊缝分割:RGB与偏振成像及CNN与Transformer架构对比

偏振成像在非受控环境下焊缝分割mAP50达0.93,优于受控RGB的0.87;视角偏移时Transformer鲁棒,CNN崩塌。

04:00
arXiv cs.CV

图像分类中视觉语言模型的半监督适配

提出自进化视觉语言模型半监督框架,递归挖掘高置信样本并平衡类别,遥感分类显著超越现有方法,实现少人工干预。

04:00
arXiv cs.CV

PAGS:基于声速自适应高斯溅射的光声断层自动对焦

提出声速自适应高斯溅射框架,以稀疏声源和各向异性声速场实现光声断层盲自动对焦,无先验,提升清晰度。

04:00
arXiv cs.CV

DeCO:面向细粒度数据集蒸馏的判别性证据组合

DeCO利用注意力选取判别性区域并组合成紧凑图像,提升细粒度数据集蒸馏效果。

04:00
arXiv cs.CV

4DStreamCtrl:在线4D控制的交互式视频生成

以3D点轨迹统一相机与物体控制,支持深度编辑/运动迁移,实现实时流式生成,480p达20FPS。

04:00
arXiv cs.CV

MLLMCLIP:面向鲁棒视觉语言表示的多模态大模型特征级蒸馏

提出MLLMCLIP,将多模态大模型知识蒸馏至CLIP,无需合成数据,提升组合性及通用视觉语言表示性能。

04:00
arXiv cs.CV

AdaVDR:面向视频深度研究的自适应工具使用与反思

提出自适应视频深度研究智能体,按需调用工具并反思纠错,结合数据构建与强化学习,提升准确效率。

04:00
arXiv cs.CV

CropCop:从基准重建到量化运行时工件的可审计120类植物健康模型

提出CropCop:审计重建基准,控制泄漏,120类健康识别,量化运行时实测准确98.46%。

04:00
arXiv cs.CV

Video-IFBench:评估多模态大语言模型在视频理解场景中的指令跟随能力

提出视频指令遵循基准,评估多模态大模型在视频理解中的指令遵循,发现复杂约束下表现欠佳。

04:00
arXiv cs.CV

V-Rubrics:基于评分标准的强化学习实现视觉忠实度

提出基于评分标准的强化学习,将答案分解为原子命题,按视觉忠实度等维度评分,提升多模态后训练。

04:00
arXiv cs.CV

CrossMambaTuning:面向机器视觉压缩的空间与跨层协同自适应

新框架融合状态空间与跨层交互,微调预训练压缩模型,机器视觉任务达最优,参数减少72%。

04:00
arXiv cs.CV

网络何时应输出几何,何时应检测几何?——户型图矢量化中的读出、对齐与表示

研究对比户型图矢量化两种输出方式:检测法在真实扫描图上更优,序列解码在小图及风格匹配时更好;双输出融合提升7点F1。

04:00
arXiv cs.CV

可核查的计划:基于验证器的可执行视频编辑开放权重规划器学习

提出一种可执行视频编辑规划器,用验证器重放蒸馏训练,8B模型得分0.924,超越前沿教师。

04:00
arXiv cs.CV

用于多摄像头视角推荐的双Transformer

提出双变换器跨注意力模型,多摄像头编辑大幅超越现有最优,精度达69.65%,少量微调即可适应个人风格。

04:00
arXiv cs.CV

论CLIP嵌入空间中人类与AI生成图像的分离

CLIP中人类与AI生成图像自发分离,源于多尺度结构,对近不可见扰动敏感,揭示AI与人类视觉差异。

04:00
arXiv cs.CV

LongVU-TTT:长视频理解中用于视觉重采样的因果测试时训练

长视频多模态模型在视觉令牌受限前需建模时序变化。LongVU-TTT在视觉编码器与LLM间插入卷积测试时训练重采样器,用分组二维快速权重自适应视频并上下文化帧特征,混合均匀与变化感知选择器保留证据。受控条件下优于多种重采样器,可处理512帧并压缩至128帧,在五个基准上表现优异。

04:00
arXiv cs.CV

扩散加权MRI急性缺血性卒中的深度学习分割:三个数据集上的实用性评估

基线nnU-Net仅用DWI图像、无需预处理,即可快速准确分割急性缺血性卒中,性能优于DeepISLES。

04:00
arXiv cs.CV

用于屋顶图合成与重建的扩散Transformer

提出RoofDiT:扩散Transformer生成2D屋顶图,先顶点后边,支持多种条件,几何保真度高。

04:00
arXiv cs.CV

迈向纯净的多标签视觉语言模型测试时适应

提出PuRF方法,通过区域纯化与缓存纯化解决多标签测试时适应中的共享表征纠缠与标签偏差问题,性能提升4.05% mAP。

04:00
arXiv cs.CV

基于扩散模型的无监督解剖特征学习:利用去噪扩散概率模型增强医学图像分割

无标注CT扩散预训练提取解剖特征,提升肝肾分割(Dice 0.93/0.95),标注减至10%仍稳健。

04:00
arXiv cs.CV

MAMA-FLUX.2:面向MAMA-SYNTH挑战的乳腺DCE-MRI增强后图像合成

提出MAMA-FLUX.2基于流匹配与LoRA联合肿瘤损失合成增强后乳腺MRI兼顾质量与准确性

04:00
arXiv cs.CV

SeVeR:面向三维医学图像问答的选择性视觉暴露与检索

提出乳腺MRI VQA基准BreMRIs-VQA及SeVeR选择视觉暴露,压缩视觉标记,提升判别与生成性能。

04:00
arXiv cs.CV

难度感知样本分配用于语义分割中的自适应数据增强

提出DASA框架,综合多种难度信号自适应分配增强强度,提升语义分割性能,多项实验优于标准训练。

04:00
arXiv cs.CV

CloSeR: 面向类别发现的闭集教师统一关系蒸馏

提出CloSeR,用闭集教师蒸馏全局原型和局部关系,解耦闭集识别与开放发现,提升广义类别发现性能。

04:00
arXiv cs.CV

基于骨架的零样本时空动作定位:通过弱监督预训练

提出弱监督预训练策略,融合语言对齐与场景对比学习,用于骨架零样本时空动作定位,降低高标注成本。