11301 条条目 · 106 个活跃源
2026年6月24日
04:00
arXiv cs.CV

UniDrive: 面向自动驾驶可解释风险理解的统一视觉-语言与定位框架

UniDrive融合时间推理与高分辨率感知,生成风险描述和定位框,在自动驾驶风险理解中优于基线,提升可解释性和信任度。

04:00
arXiv cs.CV

面向室内视觉重定位的紧凑物体级表示与开放词汇理解

OpenReLoc系统利用多模态开放词汇理解实现物体级表示驱动室内视觉重定位,达到高精度和高召回率。

04:00
arXiv cs.CV

利用噪声监督从卫星图像中计数树木

提出非平衡最优传输与自校正机制,处理噪声监督的卫星树木计数,在大型基准上表现优异。

04:00
arXiv cs.CV

AerialFusionMapNet: 基于空中-车载BEV融合的在线高精地图构建

提出结构化两阶段训练融合框架,利用空中先验将在线高精地图mAP提升至54.7,较基线提高5.9。

04:00
arXiv cs.CV

Spherical-to-ERP Epipolar Rectification for Single-Axis Disparity in 360 Stereo

04:00
arXiv cs.CV

EG-VQA:基于时间证据的可验证视频问答基准

提出EG-VQA基准和EG-F1指标,揭示模型答案正确但证据定位不足,提出EG-Reasoner模型提升推理能力。

04:00
arXiv cs.CV

Pocket-SLAM: 面向内存高效3DGS-SLAM的渲染区域感知剪枝

提出渲染区域感知剪枝策略,基于高斯点对渲染区域的贡献选择性移除,内存减少60%以上,FPS提升2倍,精度不变。

04:00
arXiv cs.CV

OrbitForge:基于重建锚定的视频合成实现文本到3D场景生成

OrbitForge以3D重建为锚点,从文本视频生成闭环高斯场景,补全缺失视角,无需微调或蒸馏,实现高覆盖度。

04:00
arXiv cs.CV

DDStereo:用于立体3D道路异常检测的高效双解码器Transformer

提出DDStereo双解码器Transformer,首次实现立体3D实时开集检测,精度SOTA且速度媲美单目方法。

04:00
arXiv cs.CV

弥合流形差距:一步图像编辑的黎曼残差线搜索

提出黎曼残差线搜索方法,通过曲率估计与方向投影,平衡图像保真与目标对齐,实现一步扩散编辑最优候选选择。

04:00
arXiv cs.CV

GeoT2V-Bench: 通过3D重建评估文本生成视频模型的3D一致性

提出GeoT2V-Bench,通过3D重建诊断文本生成视频的3D一致性,发现多个指标常不一致,揭示互补失败模式。

04:00
arXiv cs.CV

数据受限半导体计量中基于扩散概率模型的高保真合成TEM图像生成

仅15样本训练DDPM生成高保真合成TEM图像,MS-SSIM>0.98,支持缺陷检测与分割。

04:00
arXiv cs.CV

DiffusionBench:扩散变换器的整体评估

发现DiT在ImageNet与T2I上的性能排名无强相关,提出DiffusionBench作为整体评估基准。

04:00
arXiv cs.CV

EPMF:高效感知感知多传感器融合用于3D语义分割

提出EPMF,通过透视投影融合激光雷达与相机特征,引入感知损失,高效实现3D语义分割,性能优于RangeFormer。

04:00
arXiv cs.CV

IV-CoT: 面向结构感知文本到图像生成的隐式视觉思维链

IV-CoT通过结构-语义级联与草图监督,单次前向推理提升结构感知生成质量。

04:00
arXiv cs.CV

BenchX:面向人口统计和协议偏差的癌症检测与定位AI模型基准测试

基于85,355 CT扫描评估12个肿瘤检测AI模型,发现其在稀有亚组中表现差,强调亚组水平评估。

04:00
arXiv cs.CV

NavWM:一种面向预见性规划的统一导航世界模型

NavWM融合潜在推理与多模态预测,通过锚点框架生成多样动作,实现鲁棒闭环规划,显著提升零样本导航成功率。

04:00
arXiv cs.CV

FLUX3D:基于扩散对齐稀疏表示的高保真3D高斯生成

FLUX3D通过扩散对齐结构化潜变量和稀疏结构感知扩散框架,实现高保真3D高斯生成,性能超越现有方法。

04:00
arXiv cs.CV

卷积、Transformer与混合深度学习模型在结直肠组织学分类中的性能与可解释性

评估12种预训练模型,EVA-02准确率97.1%最优,Transformer整体性能领先,CNN平衡精度与复杂度。

04:00
arXiv cs.CV

FLAT:前馈式潜在三角形泼溅实现几何精确场景生成

FLAT首次从视频扩散潜在编码直接解码三角形泼溅,通过新参数化和窗函数提升几何精度,支持实时渲染。

04:00
arXiv cs.CV

用于可解释糖尿病视网膜病变分级的双边缘空间雅可比图像图

提出双边缘空间雅可比图像图,融合血管、病变等四流证据,实现可解释DR分级,准确率0.8076,AUROC 0.9711。

04:00
arXiv cs.CV

ArtiTwinSplat: 基于高斯溅射的RGB-D视频可交互数字孪生重建

提出从RGB-D视频自动构建可交互数字孪生框架,结合高斯溅射与无监督关节发现,支持实时渲染与操作。

2026年6月23日
04:00
arXiv cs.CV

用于稳定图像重建的黏性半群框架

基于黏性解框架的混合重建算子,利用非扩张扩散实现稳定图像重建,CT分类AUC稳定达0.875。

04:00
arXiv cs.CV

陪审团义务:文化模糊下MLLM作为评判者的校准与定向失败

文化模糊下MLLM评判存在压缩量表与默认文化两种失败,建议分别报告不同文化池对齐。

04:00
arXiv cs.CV

基于投影的神经编解码器封装代理梯度解释

本文证明代理梯度可解释为编解码器局部近似,有效训练全神经封装,在多种编解码器上显著提升压缩性能。

04:00
arXiv cs.CV

超越ROC-AUC:生物特征验证的操作点性能报告

生物特征验证应重点报告低FMR下的DET曲线和FNMR,而非全ROC-AUC。

04:00
arXiv cs.CV

基于无人机的多模态视觉系统用于边坡变形自动监测与灾害检测

提出基于无人机LiDAR的边坡自动检测方法,可提取地面点云、识别危险区并监测厘米级变形,实现智能预警。

04:00
arXiv cs.CV

使用Video Swin混合U-Net和卫星影像的加拿大野火时空蔓延预测

本研究提出集成Video Swin Transformer的U-Net模型,利用卫星数据预测加拿大野火时空蔓延,在2014-2023年数据上表现优异。

04:00
arXiv cs.CV

印度银行支票字段定位的开放标注与合成数据

发布112张支票的字段标注和295张合成图像,实验表明固定布局下合成数据无显著提升。

04:00
arXiv cs.CV

基于球面莫比乌斯提升的无剪切360度视口放大

球面莫比乌斯提升实现无剪切视口放大,保持共形性,PSNR提升+3.26dB,但牺牲全球质量。

04:00
arXiv cs.CV

ARGUSTRACK:面向多目标跟踪的多视图标注系统

基于鸟瞰图的多相机标注系统,自动投影保持身份一致性,显著减少标注时间。

04:00
arXiv cs.CV

中文标题:NeoJaundice-AI:基于双输入深度学习与合成增强的智能手机新生儿黄疸检测系统

中文摘要:提出NeoJaundice-AI手机系统,双分支EfficientNet-B0融合肤色眼白图像与YCbCr特征,离线3秒内黄疸分级与胆红素回归,准确率91.8%。

04:00
arXiv cs.CV

运动金字塔:层次化运动表征与残差接口

构建运动层次表征,残差接口实现粗到细控制,提升学习效率与精度。

04:00
arXiv cs.CV

超越模板:通过元提示重新审视零样本遥感

元提示框架下零样本遥感受文本设计影响,LLM描述可能引入噪声,查询校准可有效提升性能。

04:00
arXiv cs.CV

AEF-Econ:面向城市遥感的即插即用社会经济基础嵌入(源自AlphaEarth)

提出容量自适应重构(CAR)解决多流共享重构瓶颈,社会经济嵌入R²提升至0.848,并发布AEF-Econ。

04:00
arXiv cs.CV

TeleStyle V2:结合自蒸馏与分布匹配蒸馏,超越内容保持风格迁移

TeleStyle V2通过自蒸馏和分布匹配蒸馏,支持多种风格迁移组合并保留通用图像编辑能力,性能媲美商用模型。

04:00
arXiv cs.CV

使用双曲通道优化动态特征的卵巢肿瘤细胞稳健图像驱动表型分析

提出稳定性引导框架,从双曲通道动态特征中消除流体噪声,筛选优化特征,实现卵巢肿瘤细胞稳健表型分析。

04:00
arXiv cs.CV

Video2Code:通过动作感知重访从UI视频生成交互式网页

Video2Code通过动作感知重访恢复UI视频中的可执行状态转换,提升交互网页生成功能正确性,尤其对密集多步交互。

04:00
arXiv cs.CV

GEOPHYS:物理合理性的几何表征

GEOPHYS通过冻结图像编码器的五个几何属性,高效检测视频物理异常(98.3%/93.3%),提升生成对齐(+14.5%),速度更快、内存更低。

04:00
arXiv cs.CV

CDER-SME:多级压力诱导下的跨设备事件-RGB微表情数据集

提出跨设备事件-RGB微表情数据集CDER-SME,多级压力诱导,硬件无关对齐,跨模态融合提升识别性能。

04:00
arXiv cs.CV

Evaluation of Medical Vision Language Models HuluMed and MedGemma, and general purpose chatbots Gemma 3, ChatGPT Plus, and Claude Pro on real previously unseen wound images

04:00
arXiv cs.CV

MIRAGE:面向Web智能体漏洞检测的隐蔽视觉提示注入

提出MIRAGE框架,利用扩散模型生成隐蔽对抗图像,实现视觉提示注入攻击以检测Web智能体漏洞。

04:00
arXiv cs.CV

UniSLAD:一种用于结构与逻辑工业视觉异常检测的统一框架

提出UniSLAD统一框架,无需额外训练即可联合检测结构性与逻辑性异常,采用双特征提取与双粒度表示,性能优异。

04:00
arXiv cs.CV

D2HDMap: 用于在线矢量化高清地图预测的非可见驾驶线地图先验

D2HDMap用轻量非可见驾驶线先验提升在线地图精度与泛化,44.8mAP创新高。

04:00
arXiv cs.CV

你的视频模型记忆能力如何?衡量长视频理解中的记忆-预算权衡

提出经验模型揭示长视频理解中准确率随帧预算和时间距离的衰减规律,精度与对数预算线性相关,模型差异显著。

04:00
arXiv cs.CV

REKEY: 基于元数据的视觉关键再生技术,用于抗污染的VQA评估

ReKey通过随机再生图像中的答案相关视觉关键,构建抗污染VQA基准,在V*Bench上发现原始项得分虚高9.5-18.8个百分点。

04:00
arXiv cs.CV

VTOS:通过联合搜索解决方案与观察器学习编排视觉工具

VTOS框架联合搜索解决方案与观察器,自适应编排视觉工具,在密集计数与病害分割任务中优于基线。

04:00
arXiv cs.CV

XmoPipe:大规模野外人体运动数据集构建流程

提出可扩展管道,从在线视频自动提取3D人体运动与文本描述,训练模型性能媲美传统数据集。

04:00
arXiv cs.CV

Mirage:针对激光雷达3D目标检测的清洁标签后门攻击

提出黑盒清洁标签后门攻击Mirage,仅用0.5%污染样本使模型误分类,攻击成功率73%。

04:00
arXiv cs.CV

基于任务算术的开放词汇动作识别的鲁棒零样本泛化

利用任务算术合并模型,实现无需目标域训练的开放词汇动作识别鲁棒零样本泛化。