11221 条条目 · 106 个活跃源
2026年7月14日
04:00
arXiv cs.CV

利用器官层次报告知识学习基于解剖的CT视觉-语言表示

提出OKA-CT框架,利用器官层次知识增强CT-报告预训练,零样本诊断AUROC达84.9/72.2,优于现有方法。

04:00
arXiv cs.CV

DP-Splat: 高斯泼溅的贝叶斯非参数复杂度控制

用Dirichlet过程先验实现高斯泼溅组件数自适应,保持闭形式更新,理论保证且性能优于固定组件方法。

04:00
arXiv cs.CV

面向与相机无关的转弯运动计数的车辆轨迹入口和出口区域的无监督检测

提出无监督管道,从车辆轨迹自动识别入口/出口区域,无需标注或标定,在25个摄像头下中位误差约3%,比基线更稳定且成本低。

04:00
arXiv cs.CV

EquiFusion: 基于等变潜在扩散的运动学无关人体运动预测

EquiFusion提出运动学无关的等变潜在扩散模型,实现跨数据集泛化与零样本预测,更紧凑高效,达SOTA。

04:00
arXiv cs.CV

MED-DSLC:基于领域监督和逻辑校准的多专家领域分类

MED-DSLC通过领域监督和逻辑缩放恢复全局可比性,解决多专家域分类的跨域干扰,零样本准确率提升15%。

04:00
arXiv cs.CV

MMA-Former:用于3D MRI自适应PNI预测的多窗口混合头注意力Transformer

提出MMA-Former,采用粗-细Transformer和窗口特定混合头注意力,在3D MRI PNI预测中AUC达0.752,优于CNN及Transformer基线。

04:00
arXiv cs.CV

AsySplat: 高效非对称3D高斯泼溅用于长序列场景建模

提出非对称架构解耦几何与外观,减少计算冗余,小模型实现高效长序列新视角合成,速度提升近800倍。

04:00
arXiv cs.CV

DDR-Net:面向单幅图像去雾的雾霾感知双域精化网络

提出DDR-Net,利用雾霾先验、细节增强和空频双域精化模块,高效去雾,真实场景效果优于现有方法。

04:00
arXiv cs.CV

SynCLIP:面向鲁棒开放词汇密集感知的同义词连贯语言-图像预训练

提出SynCLIP框架,通过同义词注意力对齐与精炼,解决空间不一致问题,实现开放词汇密集感知SOTA。

04:00
arXiv cs.CV

RTFVE:实时人脸视频增强

提出可在普通CPU上实时运行的人脸视频增强模型,轻松集成到任何解码器,提升低码率视频感知质量。

04:00
arXiv cs.CV

LoSA-Net:用于3D MRI中神经侵犯边界敏感预测的局部化和尺度自适应网络

LoSA-Net通过局部化与尺度自适应架构实现3D MRI神经侵犯边界敏感预测,AUC达0.7567。

04:00
arXiv cs.CV

体育视频中标签高效精确事件检测的时间特征蒸馏

提出时间特征蒸馏与门控移位,仅用10%标签即提升mAP 4.54点,80%标签匹配全监督。

04:00
arXiv cs.CV

基于参考图像和空间变换器的人脸超分辨率

提出利用空间变换器稳定对齐参考图像,聚合函数自适应取优,小模型实现SOTA人脸超分。

04:00
arXiv cs.CV

FSFVE:少样本压缩人脸视频增强

用10帧人脸和100秒训练模型,实时增强压缩视频通话质量,无需修改应用。

04:00
arXiv cs.CV

WiFi-JEPA:面向WiFi-CSI三维人体姿态估计的自监督学习

WiFi-JEPA自监督框架通过掩蔽潜在嵌入预测与射线追踪仿真,在多人三维姿态估计中取得最优,摆脱相机标记依赖。

04:00
arXiv cs.CV

开放词汇检测中的置信度分数是尺度与语义的有偏混合

检测置信度受尺度偏差与语义偏差干扰,源自CLIP图像级预训练,阈值调整无效,温度缩放可部分校正但牺牲精度。

2026年7月13日
04:00
arXiv cs.CV

视频生成模型是通用视觉学习器

视频生成骨干预训练实现通用视觉模型,综合任务性能超越专用模型,数据效率高,且涌现跨域泛化能力。

04:00
arXiv cs.CV

探针混合:通过探针从多模态大语言模型中的特权模态学习

MoP框架利用结构化探针解耦模态信号,有效利用训练时特权模态,最高相对提升65%。

04:00
arXiv cs.CV

解耦照明先验用于空间可控的多视角室内场景重照明

提出Lume-Palette框架,解耦照明为蒸馏与投射两阶段,实现空间可控、多视角一致的室内场景真实感重照明。

04:00
arXiv cs.CV

安全伪装:机密医学图像建模中图像伪装技术的系统评估

系统评估图像伪装:分类任务有效但分割退化严重,RMT平衡最佳,AES损害效用,重构攻击对医学图像效果有限。

04:00
arXiv cs.CV

视觉Transformer从自然图像中学习类格式塔的图形-背景线索

ViT能从自然图像中学到包围性、凸性等类格式塔线索,对称性仅对均匀颜色有效。

04:00
arXiv cs.CV

HAT超分辨率与PARSeq+CLIP4STR投票集成用于极端场景车牌识别

结合超分辨率与双识别器加权投票,在车牌超分挑战中获高分,运行快速。

04:00
arXiv cs.CV

MultiView-Bench:面向VLM中以世界为中心的多视角整合的诊断基准

新基准诊断VLM多视角整合短板,发现3D空间关系薄弱,提出ViewNavigator框架显著提升性能。

04:00
arXiv cs.CV

可可制图是否需要亚米级分辨率?——基于科特迪瓦景观分层的甚高分辨率影像、十米级地球观测输入与业务化产品评估

研究显示,VHR影像可可制图F1达0.92,优于十米级最佳模型(TESSERA F1=0.86),复杂景观中VHR优势更显著。

04:00
arXiv cs.CV

C-GAP:类别感知与在线提示提升视觉语言模型在不平衡类别上的性能

C-GAP无需重训练,通过复合描述基线和LLM迭代优化提示,大幅提升少数类检测[email protected](COCO上相对提升81%)。

04:00
arXiv cs.CV

StereoSplat+: 前馈立体高斯泼溅与扩散辅助渐进推理

提出扩散增强渐进推理框架,从单立体对重建高质量3DGS,有效处理遮挡与视角外推,性能优于现有前馈方法。

04:00
arXiv cs.CV

STEAM:基于弹性匹配与自适应净化的稳定自训练

STEAM框架通过稳定自训练、弹性匹配和自适应净化,实现无监督跨视角地理定位,性能媲美有监督方法。

04:00
arXiv cs.CV

OmniMapBench:多样化地图文档的视觉中心推理基准

提出OmniMapBench,含2096个地图视觉问答,最佳模型仅75%准确率,验证高视觉依赖性。

04:00
arXiv cs.CV

子令牌视觉Transformer用于细粒度识别

SubViT用子标记为关键区域分配额外容量,提升细粒度识别,在GCD任务上平均准确率提升3.4%,延时仅增0.5ms。

04:00
arXiv cs.CV

关于视觉推理中的局部性与长度泛化

研究发现全局捷径导致视觉模型泛化失败,局部递归策略可缓解,局部注意力对稳健组合泛化至关重要。

04:00
arXiv cs.CV

GeoTrace:面向视频大语言模型的几何感知轨迹令牌压缩

GeoTrace无训练框架将视频令牌压缩为骨架与残差事件,仅用10%令牌实现12.99倍算力降低,性能保持99.1%。

04:00
arXiv cs.CV

面向野外无人机的主动目标检测:大规模数据集、基准与方法

提出首个大规模无人机-地面主动目标检测数据集及基准,发现DRL方法泛化差,进而提出AOD-JEPA方法提升性能。

04:00
arXiv cs.CV

探索扩散去噪动态以进行对比表示学习

D^3CL将对比目标与去噪重建结合,LoRA微调Stable Diffusion,实现生成与判别学习互补,ImageNet-1K线性探针80.1%,FID 5.56。

04:00
arXiv cs.CV

MOSAIC: 自适应层间组合以实现高效异构视觉-语言模型

提出硬件感知搜索方法MOSAIC,自动优化异构VLM架构,实现1.76倍预填充和2.54倍解码加速,性能持平。

04:00
arXiv cs.CV

REBASE:无训练上下文分割中的参考背景子空间消除

REBASE通过消除参考背景子空间,抑制虚假语义匹配,实现无训练上下文分割新SOTA。

04:00
arXiv cs.CV

用于动作分割数据集压缩的自适应潜在轨迹锚定

提出自适应潜在轨迹锚定方法,利用扩散模型实现高效压缩,以2.4%压缩比达到与真实数据训练相当的性能。

04:00
arXiv cs.CV

集成大语言模型与图卷积网络用于半监督图像分类

利用视觉语言模型生成图像描述,由大语言模型优化图边,提升半监督分类准确率。

04:00
arXiv cs.CV

一种结合集成聚合的核心集选择框架用于图像分类

提出SCOSS核心集选择框架,结合集成聚合,在图像分类中实现精度与效率的权衡,效果优于基线。

04:00
arXiv cs.CV

IB-Flow:信息瓶颈引导的CFG蒸馏用于少步文本到图像生成

提出IB引导的CFG蒸馏双轨框架,实例感知与熵感知调度消除过条件伪影,2步生成达到SOTA。

04:00
arXiv cs.CV

超越时间偏移:适配Omni-LLM作为生成式视听模型的无参考评估器

针对生成式视听模型同步评估的参考悖论,提出SynthSync数据集及Omni-LLM适配方法,配合R-GRPO实现无参考连续度量,对齐人类偏好。

04:00
arXiv cs.CV

中文标题:使用事件相机的高性能图像跟踪的等变滤波器

中文摘要:本文提出等变滤波器用于事件相机图像跟踪,利用AEB提取特征,实现高速(7000像素/秒)平滑跟踪。

04:00
arXiv cs.CV

事件突发触发器:针对基于事件的SNN目标检测的可用性后门攻击

提出EBT攻击,通过事件流触发增加NMS延迟38%,精度微降且逃逸检测,揭示新可用性后门威胁。

04:00
arXiv cs.CV

中文标题:基于低重叠拍摄的4D人体-场景重建

中文摘要:提出StudioRecon方法,利用扩散模型合成背景视图并解耦人体,递归增强消除伪影,在四数据集实现新视角合成SOTA。

04:00
arXiv cs.CV

基于事件流的多模态视频异常检测:基准数据集与算法

提出EVAD框架,融合事件流与可见光视频,构建63亿事件与37万帧基准集,通过对比预训练与自适应融合提升鲁棒性。

04:00
arXiv cs.CV

DETRAM:端到端的人体网格检测、跟踪与恢复

DETRAM统一多人体网格恢复与跟踪,利用单一transformer解码器和身份一致查询嵌入,实现自动及用户提示的检测跟踪,取得SOTA效果。

04:00
arXiv cs.CV

超级通才:通过通才-专家协同实现全面准确的医学图像理解

SuG框架融合通才与专家模型,利用分割先验提升病灶感知,在CT诊断和病灶定位任务上达到最先进水平。

04:00
arXiv cs.CV

语义难度非视觉难度:面向手语检索的符号感知难负样本挖掘

提出SAN方法,基于视觉混淆性而非语言相似性挖掘难负样本,解决手语检索中负样本分布不匹配,提升细粒度检索性能。

04:00
arXiv cs.CV

编织光与时间:面向密集RGB-事件解析的统一谐波-几何表征学习

Evita统一骨干通过几何校正、频域纹理迁移及事件驱动注意力实现RGB-事件高效融合,结合混合预训练,在三大基准达新SOTA且实时。

04:00
arXiv cs.CV

HiHR:用于空地行人再识别的层次化双曲表示

提出层次化双曲表示框架,融合文本引导多粒度特征并构建粗细层次,有效聚合视角不变与特定特征。

04:00
arXiv cs.CV

TSR-Ego:面向自我中心三维人体姿态估计的时间引导立体精化框架

提出时间引导立体精化框架,融合短时运动与投影采样,提升遮挡鲁棒性,自我中心姿态估计达SOTA。