11211 条条目 · 106 个活跃源
2026年7月15日
04:00
arXiv cs.CV

图像异常检测的统计非线性重构损失

提出基于sigmoid的统计非线性重构损失,有效抑制异常泄露,在MVTec-AD和VisA上取得99.0%/97.3%及95.3%/99.0%的高AUROC。

04:00
arXiv cs.CV

LARAD: 基于空间逻辑推理的布局感知道路异常检测

LARAD通过空间逻辑推理与违背合成训练,实现高效鲁棒的道路异常检测,刷新最佳性能。

04:00
arXiv cs.CV

度量引导的深度学习合成图像数据渲染,兼容智能体AI

GraNatPy包用度量引导渲染改进,提升检测性能并自动化参数优化。

04:00
arXiv cs.CV

Hy-Embodied-VLM-1.0:高效的物理世界智能体

提出面向物理世界具身智能体的高效基础模型,仅激活3B参数即达32B模型性能,在38项基准中19项最佳。

04:00
arXiv cs.CV

抑制自注意力:增强视觉Transformer的聚焦能力

提出抑制自注意力(ISA),利用负注意力分数抑制无关特征,增强目标聚焦,提升ViT泛化与鲁棒性。

04:00
arXiv cs.CV

UniMedSeg:面向多范式2D/3D医学图像分割的统一上下文内学习

提出统一上下文内学习框架,融合视觉示例、交互与语言指令,线性注意力复杂度,无需微调实现多范式医学图像分割SOTA。

04:00
arXiv cs.CV

秩一身份共识比分数阈值更准确地预测1:N人脸匹配中的库注册状态

1-一致性方法通过多匹配器排名共识,无需阈值即可准确预测库注册状态,性能媲美最优阈值法且更稳健。

04:00
arXiv cs.CV

基于差异引导适应与频率解耦蒸馏的域增量遥感变化检测

提出DG-FDD框架,结合差异引导适应与频率解耦蒸馏,有效缓解域增量遥感变化检测中的灾难性遗忘,实现历史知识与新域适应的平衡。

04:00
arXiv cs.CV

手术中的点追踪——2025年红外手术纹身挑战赛(STIRC2025)

STIRC2025挑战赛评估点追踪算法,七支队伍参赛,数据集与代码公开。

04:00
arXiv cs.CV

GaitSpan: 从行走到奔跑的人形运动成长

GaitSpan框架通过节奏生成、步幅塑造和残差适应,将步行策略扩展到奔跑,实现连续速度、跨形态和零样本部署。

04:00
arXiv cs.CV

ViCo3D: 利用视觉基础模型赋能基于激光雷达的协作式3D目标检测

ViCo3D将点云投影为BEV图像并利用DINOv2提取视觉特征,结合多尺度融合与跨智能体融合,在V2X协作检测中取得SOTA性能,协作增益提升1.8倍。

04:00
arXiv cs.CV

可控多样化皮肤病学图像生成,实现公平与高效的恶性分类

提出cgDDI框架,合成多样化皮肤样本,将罕见病变映射到新肤色,仅需10个样本,显著提升分类准确率与公平性。

04:00
arXiv cs.CV

X-Lens:基于异构相机的实时度量深度估计

X-lens用可学习令牌和畸变偏置实现异构相机实时度量深度估计,参数仅0.04B,精度提升25.4%。

04:00
arXiv cs.CV

DermDepth:面向皮肤科的单目度量尺度三维重建模型

首个皮肤科单目度量3D模型,合成数据训练将尺度误差从16倍降至1.1倍,泛化至真实临床。

04:00
arXiv cs.CV

Enabling 24-hour Agricultural Robotics: Unsupervised Day-to-Night Cross-Modal Image Translation for Nighttime Visual Navigation

04:00
arXiv cs.CV

标题:数据集偏移下基于深度集成的ROI甲状腺结节超声分类的校准选择性预测:回顾性评估

深度集成模型在甲状腺结节分类中内部性能优异,但外部数据集偏移下泛化受限,需局部校准与前瞻性验证。

04:00
arXiv cs.CV

TopCoW挑战——基于拓扑感知的Willis环CT与MR血管成像分割

TopCoW挑战赛基于125对CTA/MRA数据评估Willis环分割与变体分类,最优算法分割Dice>90%,检测F1>80%,分类精度>70%,助力临床下游任务。

04:00
arXiv cs.CV

Compos3D:基于部件交互组合实现生成式3D模型的创意控制

Compos3D提出部件组合重混合流程,用户满意度与创意控制显著提升。

04:00
arXiv cs.CV

地理空间基础模型的新兴范式:从预训练到智能体推理

地理空间基础模型通过预训练分离职责,支持微调与零样本任务,并展望LLM协调的智能体推理。

04:00
arXiv cs.CV

考虑不确定性的多源OCT视网膜积液分割

提出不确定性感知的TransUNet,在四源OCT上分割积液,专家分歧处不确定性高1.34倍,辅助临床分诊。

04:00
arXiv cs.CV

VanillaBench:对抗鲁棒性隐藏的准确率成本

VanillaBench显示对抗训练模型准确率平均下降4-29.5个百分点,建议未来评估报告普通模型参照差距。

04:00
arXiv cs.CV

基于深度活动轮廓和平均曲率损失函数的医学图像分割

提出基于平均曲率的深度活动轮廓损失函数,提升医学图像分割性能,取得新最先进结果。

04:00
arXiv cs.CV

基于视觉的低功耗边缘平台实时跌倒检测

提出物理信息驱动的双LTC网络,以50K参数实现实时跌倒检测与稳定性分析。

04:00
arXiv cs.CV

面向视觉语言导航的实例增强语义地图

提出实例增强语义地图,通过2.5D映射与LLM查询处理,导航成功率提升23%,存储减少96%。

04:00
arXiv cs.CV

数字乳腺断层合成中精确且校准的扩散重建

通过精确投影实现数据一致,校准不确定性,提升有限角DBT重建保真度。

04:00
arXiv cs.CV

FlowWAM:光流作为世界动作模型的统一动作表示

FlowWAM以光流统一表示动作,实现策略预测与世界建模,在操控和建模任务上均达最优性能。

04:00
arXiv cs.CV

深度学习目标检测模型在异构边缘设备上的综合评估

在多种边缘设备上对比YOLOv8、EfficientDet和SSD,揭示准确率、延迟和能耗权衡,Orin Nano综合最优。

04:00
arXiv cs.CV

超越感知距离:基于扩散模型的深度表征差异评估用于分布外检测

提出在分类器表征空间评估特征与logit级差异,辅以子空间策略增强扩散模型生成,显著提升分布外检测性能。

04:00
arXiv cs.CV

注意力缺失视觉风险:面向多模态安全对齐的风险自适应引导

发现视觉注意力不足导致多模态安全缺陷,提出MoRAS方法通过风险自适应引导实现高效泛化防御并降低开销。

04:00
arXiv cs.CV

基于平面及更广方法的图像匹配过滤与优化

评估图像匹配过滤优化方法,提出结合平面约束和互相关的传统策略,与深度方法竞争,提供实用见解。

04:00
arXiv cs.CV

基于秩增强线性注意力的快速准确图像恢复与生成

提出RELA秩增强线性注意力,构建LAformer,在图像恢复与生成中高效超越SOTA。

04:00
arXiv cs.CV

LVMark:面向潜在视频扩散模型的鲁棒水印

提出LVMark,利用帧间一致性与小波域特征嵌入水印,兼顾视觉质量与512位鲁棒解码。

04:00
arXiv cs.CV

多模态大语言模型中视觉归因的证据重组与预测上下文残差化

提出ERCR框架,通过证据重组与残差化,改进多模态大模型视觉归因,减少碎片化与干扰。

04:00
arXiv cs.CV

受生物启发的稀疏对比表示带来的鲁棒性提升

受视网膜启发,用固定预处理提取稀疏对比特征,提升语义分割模型在夜间等光照变化下的鲁棒性,支持稀疏化传输。

04:00
arXiv cs.CV

功能引导的扩散先验用于3D手部重建

利用功能感知描述引导扩散模型,细化严重遮挡的手部姿势,显著提升重建精度。

04:00
arXiv cs.CV

利用扩散模型的先验知识进行行人搜索

DiffPS利用扩散模型先验,通过三模块消除任务冲突,实现行人搜索SOTA性能。

2026年7月14日
04:00
arXiv cs.CV

通过内部潜在分析统一精炼扩散模型骨干网络

提出DUNE无训练框架,检测深层潜在突变并抑制,提升保真度减少幻觉。

04:00
arXiv cs.CV

知识约束的混合专家神经算子形状优化方法实现高置信度设计

提出知识约束优化框架与混合专家神经算子,提升异构数据阻力预测精度,实现车辆阻力降低4%-10%。

04:00
arXiv cs.CV

噪声锚定扩散逆变换中的压缩不对称性与轨迹绑定

扩散反演中元素级压缩优于子空间压缩,轨迹绑定与得分先验是关键;NARC方法以极低存储实现高质量重构。

04:00
arXiv cs.CV

通过图谱对齐的时空标记化实现跨主体宽场钙成像建模

WiCAT模型利用图谱对齐时空标记化和自监督预训练,实现跨主体零样本行为解码与脑区重建,超越单会话模型。

04:00
arXiv cs.CV

RSLoRA:通过表示敏感性探测实现LoRA的无训练秩分配

RSLoRA利用激活空间几何,通过虚拟表示探测自动识别高敏感模块并分配更高秩,无需训练,性能优于现有方法。

04:00
arXiv cs.CV

ReflectWorld-MM:面向实体的开放视频流多媒体记忆系统

提出面向实体的多媒体记忆系统,含感知前端与分层记忆,在六项基准测试中均获最佳准确率。

04:00
arXiv cs.CV

时间印记:在多模态知识图谱中学习时间感知表示

提出时间印记框架,将时间作为实体模态,通过三视图对比对齐多模态,选取紧凑时间戳嵌入,提升链接预测,最高Hits@1提升6.07%。

04:00
arXiv cs.CV

一种用于SAR自动目标识别的广义深度非负矩阵分解方法

提出G-DNMF方法,实现全局最优,消除误差累积,提升SAR目标识别性能与可解释性。

04:00
arXiv cs.CV

基于RISC-V多核MCU视觉系统的低功耗车牌检测与识别

首次实现低功耗MCU边缘车牌识别,9核RISC-V处理器,mAP 38.9%,识别率>99.13%,能效比树莓派高73倍。

04:00
arXiv cs.CV

面向真实世界的可穿戴运动重建

提出使用手机、手表等轻量设备进行全身运动重建,贡献多模态数据集、生成模型WHIP及传感器互补性分析。

04:00
arXiv cs.CV

Prompting-MammAlps:面向相机陷阱数据的细粒度文本到视频检索

提出相机陷阱首个文本视频检索基准及可解释方法,时空定位+LLM解析,F1达34%,远超零样本模型。

04:00
arXiv cs.CV

终身表征:视觉模型连续自监督学习综述

综述视觉连续自监督学习,揭示评估缺陷,解释抗遗忘机制,提出五类缓解策略,指出可扩展性挑战。

04:00
arXiv cs.CV

YOLO26在边缘部署上是否优于前代?一项水产养殖基准研究

YOLO26推理速度最快但数据效率低于前代,选型需综合数据与硬件。

04:00
arXiv cs.CV

类别不平衡下可靠性感知的集成分类:基于液基宫颈细胞学的校准研究

校准显著提升可靠性,集成大小无额外收益;错误仅限HSIL与SCC间。