10802 条条目 · 106 个活跃源
2026年9月21日
04:00
arXiv cs.CV

2D GauSS-MI:兼顾视觉与几何质量的高效主动场景重建

提出基于2DGS的主动重建框架与2D高斯散点互信息度量,高效兼顾视觉与几何质量。

04:00
arXiv cs.CV

检测已解决,勾画未解决:全景X线片牙齿分割性能的主导因素

全景片牙齿分割中分辨率主导边界精度,架构几无影响;跨中心迁移损失集中于勾画,检测已饱和而勾画仍是瓶颈。

04:00
arXiv cs.CV

先精炼后融合:基于优先精炼与多模态知识融合的免训练三维点云适配

提出免训练框架RTF,通过特征通道精炼与可靠性感知多模态融合,实现小样本三维识别,无需梯度优化即达最优性能。

04:00
arXiv cs.CV

从检索到识别:视觉语言模型如何成为OCR专家

全序列OCR非新建回路,而复用通用VLM检索/复制机制,以多模态复制粘贴实现;专业化仅重分配其强度。

04:00
arXiv cs.CV

VidOmni-Bench:跨越复杂度与时长的时空事件验证细粒度视频理解基准

VidOmni-Bench用500个视频做时空事件验证,评测细粒度理解,暴露模型幻觉与验证瓶颈。

04:00
arXiv cs.CV

净化与调控:面向医学图像分类的共病感知多标签小样本学习

提出PPR,通过共病感知原型净化与类间相似度调控,提升医学图像多标签小样本分类。

04:00
arXiv cs.CV

GestureFAR:基于流自回归的流式共语手势生成

提出GestureFAR:因果连续运动潜变量自回归加单头流蒸馏,实现高质量实时流式共语手势生成。

04:00
arXiv cs.CV

四维STEM衍射图案的基准数据集与基线方法

发布4D-ImageNet基准,含17.4万实验与模拟4D-STEM衍射图案,并设抗泄漏重建评测。

04:00
arXiv cs.CV

HAT:面向视频单目航天器位姿估计的假设锚定跟踪

HAT以帧间运动锚定航天器位姿假设并融合SLAM,误差降9.4%-23.9%,帧率升2.42-3.76倍。

04:00
arXiv cs.CV

学习式参数化情绪编辑:端侧社交媒体视频的实时情感滤波

模型3.7毫秒单次前向预测情绪编辑,替代逐图优化,降低唤醒度,安卓端60帧实时处理视频。

04:00
arXiv cs.CV

SignGPT:通过无注记翻译与生成迈向LLM中介的手语交互

SignGPT统一无注记手语翻译与生成,融合身体、手部、面部的分层表示,实现手语双向输入输出并支持手语对话。

04:00
arXiv cs.CV

将解耦注意力扩展至多通道图像的密集预测与掩码训练

用线性分配匹配各通道独立掩码下的保留块,使解耦注意力支持多通道密集预测与掩码训练,性能超越最强基线。

04:00
arXiv cs.CV

DRT:面向高效且具视觉根基的多模态推理的稠密推理轨迹

DRT以紧凑结构化轨迹替代自然语言思维链,token效率提升5.5倍,准确率提高1.3分。

04:00
arXiv cs.CV

ZYT-World:面向闭环自动驾驶仿真的实时可控世界模型

ZYT-World 单架构实时生成四鱼眼三针孔视图,一步流式可控,保真度达教师90%,提速百倍。

04:00
arXiv cs.CV

临床数据稀缺下基于扩散模型肿瘤修复的肾脏分割

提出扩散修复框架合成解剖合理的肾肿瘤,无需额外标注;2.5D增强媲美3D,显著降假阳性且更省算力。

04:00
arXiv cs.CV

可配置的多阶段作物病虫害诊断视觉流水线

基于116万张照片,将病虫害诊断拆为质量门、作物识别、病虫害检测三阶段,专用模型准确率超越生产基线。

04:00
arXiv cs.CV

面向测试时二值分割的抗熵诱导崩溃平衡提示适配

熵最小化在类不平衡二值分割中易崩溃;提出BAPA,结合类平衡锚点与动态提示适配,四域平均Dice最高

04:00
arXiv cs.CV

超越基准分数:审计用于胸部X线结核病筛查的医学视觉语言模型

审计三种医学视觉语言模型:基准分无法保证胸片结核筛查在多队列、提示、阴性谱及阈值下的排名、可靠性和性能。

04:00
arXiv cs.CV

SFVO:基于双向PnP的解耦置信度引导立体光流视觉里程计

提出SFVO,以预训练立体匹配与光流构建几何约束,解耦置信度引导双向PnP,实现精准立体视觉里程计。

04:00
arXiv cs.CV

XCalib:面向密集热成像-可见光视频配准的深度引导几何优化

提出XCalib无监督框架,以相机参数为几何约束,结合单目深度优化位姿内参,用归一化边缘相关度量实现热可见光视频稠密配准。

04:00
arXiv cs.CV

Info3R:面向三维重建的信息自适应测试时训练

提出Info3R,按帧信息量调节状态更新并动态重置状态,提升长序列在线三维重建性能。

04:00
arXiv cs.CV

开放权重视觉语言模型在人脸识别中的解释质量基准评测

提出人脸识别解释质量基准,以相关性和忠实性量化解释,联合评估验证准确率,揭示现有模型缺陷。

04:00
arXiv cs.CV

Catena:面向大规模连接组学的综合软件套件

开源连接组学软件套件Catena,集成分割与突触检测等模块,容器化流程实现可复现的电镜连接组重建。

04:00
arXiv cs.CV

PointLAM:面向高效基于点3D目标检测的局部注意力Mamba

提出PointLAM,融合拉普拉斯采样、局部哈达玛聚合与双向Mamba,实现高效点云3D目标检测。

04:00
arXiv cs.CV

目标检测基准并不完整:标签错误与标注不确定性的作用

重标注显示检测数据集漏标严重,是标签错误主因;提出高召回软标签流程与不确定性基准,检测器高度依赖标注质量。

04:00
arXiv cs.CV

辐射特征在LiDAR点云跨站点叶木分割中的作用

辐射特征可提升跨站点叶木分割F1与木材召回率,增强结构连通性,更利于QSM重建。

04:00
arXiv cs.CV

Chronosphere:局部气候专家的时空剖分

Chronosphere用时空环面自适应剖分与共享局部基函数建模气候,容量随数据调整,在重建和时空迁移上匹配或领先最优位置编码器。

04:00
arXiv cs.CV

面向晶圆缺陷决策支持的形态感知歧义学习

提出形态感知歧义学习框架,以类别歧义矩阵支持单类诊断、双类辅助诊断或全复核,在WM-811K上优于常规方法。

04:00
arXiv cs.CV

无监督异常检测的原理性方法

将无监督异常检测重构为贝叶斯逆问题,以损坏参数能量作异常分数,统一现有方法,MVTec AD提升2.3%。

04:00
arXiv cs.CV

VideoReloc:面向千字节级语义场景图的长期室内视频重定位

VideoReloc用自适应片段与里程计累积证据,在千字节级语义场景图上实现长期室内视频重定位

04:00
arXiv cs.CV

自适应色彩分级

开发开源调色工具并标注视频帧色调区域阈值数据集,实验显示K近邻预测优于先进的端到端图像增强方法。

04:00
arXiv cs.CV

PRIME:VLA模型中基于情境记忆嵌入的感知反馈

PRIME用情境记忆反馈让VLA感知聚焦下游意图,仅增0.41%参数,驾驶得分82.47创最优。

04:00
arXiv cs.CV

MultiHU-TD:基于张量分解的多特征高光谱解混

提出基于张量分解的可解释多特征高光谱解混框架MultiHU-TD,融入丰度和为一约束与形态学特征,实验验证其有效性。

04:00
arXiv cs.CV

基于分支式YOLOv2和几何特征的自动驾驶交通标志识别

提出分支式YOLOv2与几何特征交通标志识别,检测分类兼顾,几何校验提升mAP至0.713。

04:00
arXiv cs.CV

MintAct:面向数字环境的统一视觉智能体

MintAct统一UI定位、跨端导航与视觉工具调用,媲美专用模型,OSWorld达48.9。

04:00
arXiv cs.CV

不确定性驱动的三维校准肺结节分类训练

提出不确定性驱动训练框架,以损失重加权提升三维CT肺结节分类校准,ECE最高降65%。

04:00
arXiv cs.CV

OmniVBench:面向全能参考到视频生成的基准与大规模数据集

提出OmniVBench基准与Omni-R2V大规模数据集,覆盖7类18项细粒度任务,以要素锚定评估揭示现有模型差距。

04:00
arXiv cs.CV

可微光线-波动框架:混合折射-衍射系统的建模与优化

可微光线-波动框架即插即用于光线追踪,支持平面与曲面衍射面,实现混合折射-衍射系统端到端优化。

04:00
arXiv cs.CV

旋转式雷达的多普勒速度测量能否提升车辆检测与跟踪性能?

多普勒去畸变提升检测mAP达2.37点,多普勒速度先验提升MOTA达13.68点,接近真值速度先验。

04:00
arXiv cs.CV

WM-VS:面向闭环视觉伺服的进展对齐世界模型

提出WM-VS进展对齐世界模型,解决闭环视觉伺服预测-控制失配,真实7自由度系统高成功率且可迁移。

04:00
arXiv cs.CV

GALA:面向跨具身视觉-语言-动作模型预训练的几何感知隐动作建模

提出GALA框架与统一末端执行器运动表示,融合视觉与几何隐动作,实现跨具身VLA预训练,RoboCasa-GR1成功率达68.3%。

04:00
arXiv cs.CV

ProTracer:本体感觉引导的机器人操作故障诊断

ProTracer免训练,融合本体感觉与视觉语言模型,实现机器人故障检测、分类、解释及故障起始定位。

04:00
arXiv cs.CV

基于后验采样的面向分类的自适应感知

利用类条件高斯混合后验协方差分解类内与类间不确定性,从扩散后验样本估计并选取判别性感知方向,改善分类与测量的权衡。

04:00
arXiv cs.CV

CASE:面向类别敏感解释的对比激活

提出类别敏感性诊断,发现常用显著性方法多不区分类别;提出CASE,生成更忠实、类别特异的解释。

04:00
arXiv cs.CV

利用线特征与消失点的鲁棒无结构单目视觉惯性初始化

提出SLIM-init:利用线特征与消失点约束,实现无结构单目视觉惯性初始化,提升退化运动下精度与鲁棒性。

04:00
arXiv cs.CV

Uni-PrevPredMap:将PrevPredMap扩展为面向在线矢量化高精地图构建的先验信息建模统一框架

统一框架融合时序预测与地图先验,三模式训练,兼顾无/有/不完美先验鲁棒性,达SOTA。

04:00
arXiv cs.CV

ALINA:先进线条识别与标注算法

提出ALINA自动标注滑行道数据集,结合CIRCLEDAT识别标线像素,已标注60,249帧,检测率98.45%。

04:00
arXiv cs.CV

需要多少后验样本?自适应感知的校准停止

后验样本投票决定停止;阈值非置信保证,校准规则控误报;序贯最省样本,MNIST截断省62%。

04:00
arXiv cs.CV

DNNs隐私泄露:模型反转攻击与防御综述

模型反转攻击可从训练模型重构隐私数据,威胁严重;本文系统综述DNN攻击与防御,提出新分类并探讨未来方向。

04:00
arXiv cs.CV

通过神经渲染优化自动驾驶数据集中的真值位姿

提出基于NeRF的MOISST++,联合精化传感器外参与连续自车轨迹,无需真值验证,在多个数据集显著提升并开源。