10782 条条目 · 106 个活跃源
2026年9月23日
04:00
arXiv cs.CV

用于活动性沙眼分类的DINOv2比较性能与参数高效适配

DINOv2微调主导活动性沙眼分类,ECA仅5参数即媲美大模型,最高准确率91.66%,其增益依赖训练目标。

04:00
arXiv cs.CV

MotionJEPA:通过在潜在空间中捕捉视觉变化防止时序特征坍缩

MotionJEPA提出DISReg正则化,预测时序差分嵌入以平衡动静特征,防止潜在表征坍缩。

04:00
arXiv cs.CV

重新思考扩散分割:何时依赖其噪声状态,扩散真的重要吗?

审计12种扩散分割法,发现状态依赖取决于监督路径;匹配纯图像基线常不逊色,扩散专有计算未必带来优势。

04:00
arXiv cs.CV

WebMRIQC:面向资源受限环境的可及性MRI图像质量评估的MRIQC网页版实现

开源网页平台WebMRIQC封装MRIQC引擎,零安装实现DICOM转BIDS与自动质控,13项指标验证与原生MRIQC等效。

04:00
arXiv cs.CV

DFD-Lab:模块化音视频深度伪造检测流水线

提出模块化音视频深伪检测流水线DFD-Lab,整合三种检测器与可配置实验流程;跨数据集检测困难,JPEG增强提升AUROC却降低准确率。

04:00
arXiv cs.CV

Colon3R:基于单目结肠镜视频的跨域三维重建

提出Colon3R跨域半监督框架,将标注体模及仿真数据的几何迁移至无标注在体结肠镜,重建更完整一致。

04:00
arXiv cs.CV

Video-STLayout 预训练

提出利用目标检测框的时空布局特征,通过对比学习对齐视频特征,提升复杂场景下的活动识别效果。

04:00
arXiv cs.CV

评估神经影像基础模型在非洲脑MRI上的泛化能力

非洲脑MRI测试中,四个神经影像基础模型冻结后仅输出多数类,端到端ViT3D最优(53.4%)。

04:00
arXiv cs.CV

InterHier:面向开放词汇目标检测的互联层次语义学习

提出以前置可学习上下文替代固定连接器,构建层次感知提示并对齐视觉文本嵌入,提升开放词汇目标检测性能。

04:00
arXiv cs.CV

U-PEN Mamba:面向高效视网膜血管分割的渐进扩展与选择性状态空间建模

提出U-PEN Mamba,融合渐进扩展与选择性状态空间建模,高效分割视网膜血管,mIoU领先。

04:00
arXiv cs.CV

正样本对几何结构至关重要:面向视觉表征对比学习的最优传输方法

提出OTCLR框架,用最优传输生成几何一致的正样本,提升表征质量与迁移性能。

04:00
arXiv cs.CV

弥合重建与生成:评估与改进的潜在分布视角

重建与生成潜分布不匹配;提出GAR轨迹诊断,与gFID强相关,并借中间潜变量适配解码器以提升生成质量。

04:00
arXiv cs.CV

A²Safe:面向安全有效视觉问答的反事实证据对齐自适应智能体协作

提出A²Safe,通过反事实证据对齐与自适应智能体协作,实现安全有效的视觉问答。

04:00
arXiv cs.CV

HDND:面向非侵入式脑记录多语言单词/字符检索的分层动态神经解码

提出HDND分层动态解码框架,融合神经表征、语义预测与字符目标,在多语言EEG/MEG词检索中多数优于基线。

04:00
arXiv cs.CV

面向零样本脑到图像检索的自适应皮层约束脑电-视觉对齐

提出自适应皮层约束脑电-视觉对齐,以ROI源模式与证据加权监督提升零样本脑-图像检索。

04:00
arXiv cs.CV

基于可验证过程奖励的可监控图表推理智能体

提出Chart-RVR,用可验证过程奖励训练可监控图表推理智能体,分解为结构、证据、推导,显著提升可验证性。

04:00
arXiv cs.CV

基于文字系统感知混合专家的一体化多语言场景文本识别

构建千万级多文字数据集,文字系统感知MoE统一多语言场景文本识别,准确率82.06%,轻量超VLM。

04:00
arXiv cs.CV

视觉Transformer与卷积神经网络在物种丰富、数据匮乏植物区系中的细粒度兰科属级识别:新几内亚兰科的受控基准测试

新几内亚兰科数据稀缺下,DINOv2属级识别最佳,嵌入检索与开放集检测有效,并已发布网页应用。

04:00
arXiv cs.CV

从局部块到全局:面向全切片图像全局一致兆像素伪影修复的随机图块扩散

提出RestorePath,用潜在扩散与大核注意力实现兆像素全切片伪影全局一致修复,提升下游任务。

04:00
arXiv cs.CV

面向恶劣条件下鲁棒计算机视觉的配对合成建筑工地图像数据集

发布ConSynth-X配对合成工地图像数据集,含34,199张图和11类恶劣条件,支持鲁棒视觉与视觉语言评测。

04:00
arXiv cs.CV

CoaG:网格上的圆柱体——面向视频生成的粗略三维布局控制

画地面网格、每人一圆柱,即可控制视频中人物站位与相机运镜;自动合成数据训练LoRA实现。

04:00
arXiv cs.CV

LegendBench:面向图例理解与反事实干预的诊断基准

LegendBench以能力分类和反事实变体诊断图例理解,揭示绑定与一致性瓶颈,并指导定向微调。

04:00
arXiv cs.CV

面向安全人车交互的轻量化行人头部朝向识别网络

提出轻量级LRHO-CNN,实现低分辨率行人头部八类朝向识别,精度优于ResNet、VGG基线,并经JAAD、PIE数据集验证。

04:00
arXiv cs.CV

Action-Slot:面向多智能体原子活动理解的结构化以动作为中心表示学习

提出Action-Slot以类别对齐槽、时空并行更新和负槽正则,实现多智能体原子活动识别与弱监督定位

04:00
arXiv cs.CV

SAFe:面向异常感知分割的分段引导式特征密度聚合

用DINOv3特征训练类条件归一化流,融合多尺度特征,借SAM3后处理生成空间一致分割,实现实例级异常检测。

04:00
arXiv cs.CV

基于语义自适应运动-光照响应的可重光照3D头像重建

提出SAMIRA,按面部语义区域自适应建模运动与光照响应,提升3D高斯头像表情重建与重光照真实感。

04:00
arXiv cs.CV

STAR:面向端到端认知雷达的场景与任务感知4D雷达预处理

STAR融合场景与任务目标生成任务相关雷达点,K-Radar达74.3AP,超SOTA5.6AP。

04:00
arXiv cs.CV

视觉目标至关重要:面向脑到图像检索的跨视觉层级学习

提出NeuroGlyph,跨冻结视觉骨干多层学习检索目标,以因子子空间和图像条件深度分配融合,提升脑到图像检索。

04:00
arXiv cs.CV

在患者拍摄的皮肤图像上对现成多模态AI模型与皮肤科医生进行基准评测

多模态AI判读皮肤图像,与皮肤科医生相当或略逊;置信度校准差,元数据影响随模型而异,成本不预示性能

04:00
arXiv cs.CV

一个出人意料的机器人策略:GPT-6 Astra 在 RoboDojo 及更广范围上的早期评估

GPT-6 Astra无需微调即可作为机器人操作策略,在RoboDojo上平均成功率22.48%,超越所有公开策略;但精度与动态控制仍是短板。

04:00
arXiv cs.CV

HappyWorld-Bench:世界模型综合评估基准

提出HappyWorld-Bench,从视频、空间、具身三轨道评估世界模型的交互可靠性与一致性。

04:00
arXiv cs.CV

Document Retrieval-Aware Chunking (D-RAC): Universal Retrieval-Aware Ingestion of Enterprise Documents via PDF Normalization and Multimodal Markdown Conversion

04:00
arXiv cs.CV

DiaSeg:从DTW路径中提取对角片段用于可解释步态分析

DiaSeg从DTW路径提取对角片段,以五种几何特征实现可解释步态分析,定位步态周期中的协调断裂。

04:00
arXiv cs.CV

超越情感提示词:由效价-唤醒-支配度驱动的细粒度文本到图像生成

提出EMOTRANS,将VAD坐标转为独立于内容文本、跨去噪阶段调制的生成条件,并构建EMOVAD数据集,实现细粒度情感控制。

04:00
arXiv cs.CV

IMPLICIT-Bench:衡量中性提示下文本到图像模型的隐性偏见

构建IMPLICIT-Bench基准(11类偏见、5493条提示),揭示文生图模型在中性提示下的系统性隐性偏见,并发现去偏与语义保真度的权衡。

04:00
arXiv cs.CV

看向关键之处:一种免费、免标注的视觉证据信号,助力细粒度视觉语言推理

提出对比证据差信号,无需训练与标注即可定位答案区域,细粒度准确率由70%升至85%,并能识别自信错误。

04:00
arXiv cs.CV

Classifier-Free Guidance in Flow Matching: Non-Autonomous Potentials, Overshoot, and Posterior-Mean Control

04:00
arXiv cs.CV

SRPR-Net:面向自动SAM实例分割的语义与关系提示精炼

提出SRPR-Net,以序贯提示精炼融入视觉语言语义与实例依赖,实现自动SAM实例分割的上下文感知框调整,性能优于现有方法。

04:00
arXiv cs.CV

面向双曲视觉语言模型的分层提示学习

为冻结双曲视觉语言模型引入分层提示学习插件,借父类提示与双曲蕴含正则,提升泛化与迁移。

04:00
arXiv cs.CV

ChartJudgeBench:面向图表到代码生成的LMM评判器评估基准

提出ChartJudgeBench基准,评估发现LMM评判器存在位置偏见、过度接受与宽松偏差。

04:00
arXiv cs.CV

AlignMorph:基于显式语义传输的免调优扩散图像变形

提出免调优扩散图像变形框架AlignMorph,显式解耦几何对齐与去噪,结合语义传输和坐标对齐,消除重影并提升结构一致性。

04:00
arXiv cs.CV

DeCo:面向多任务视觉定位的高效解耦到耦合学习

DeCo通过任务感知解耦与混合先验耦合,解决定位分割冲突,实现轻量高效多任务视觉定位并达SOTA。

04:00
arXiv cs.CV

LiAuto-MindViT:一种具有自适应双向 Mamba 的混合视觉骨干网络

提出混合视觉骨干,核心为自适应双向Mamba与重参数化模块,分类、检测、分割达SOTA且推理高效。

04:00
arXiv cs.CV

AnalogDepth:模拟视频传输下FPV无人机的多视图几何

模拟图传噪声使DA3深度退化;AnalogDepth用LoRA蒸馏与真实噪声库提升FPV几何。

04:00
arXiv cs.CV

拓扑训练使因果回路集中,却不提升神经元单义性

TopoLoss训练ViT使拓扑聚类因果充分性提升2.79倍,但神经元单义性不变,说明其作用于回路层面。

04:00
arXiv cs.CV

剖析代理式取证:分诊、提示与证据仲裁在开放世界虚假图像检测中的作用

开放世界假图像检测中,分诊与提示可过滤不可靠证据,但推理质量最关键;核心挑战是校准信任与仲裁冲突证据。

04:00
arXiv cs.CV

TReViS:面向自监督重复动作计数的时序重复结构感知视频合成

TReViS利用时序自相似矩阵推断视频重复结构,合成伪标签训练序列,实现免标注自监督重复动作计数。

04:00
arXiv cs.CV

NeuIDO:用于物理信息4D世界模型的神经内禀动力学算子

提出NeuIDO,将世界建模为神经算子,从视觉观测学习统一内禀动力学,支持零样本推理与少样本适配。

04:00
arXiv cs.CV

脉冲神经网络能玩弹球吗?面向目标跟踪的神经形态运动检测器

全脉冲神经形态感知—动作管道实时玩弹球,命中率56.1%,反应21.7毫秒,功耗约148微瓦。

04:00
arXiv cs.CV

面向手绘几何图形实时识别的轻量级卷积神经网络

轻量CNN实时识别圆、方、矩形、三角形手绘图形,自建数据集验证准确率96.01%,并公开应用与代码。