11071 条条目 · 106 个活跃源
2026年8月11日
04:00
arXiv cs.CV

无监督低光增强中的结构光照学习

无监督低光增强提出RISE,分离相对光照结构与绝对曝光,从亮区估计,双测光曝光参考自适应调整。

04:00
arXiv cs.CV

忠于本源:具有平滑过渡的连续图像风格化

提出两阶段训练及强度感知样条插值,使DiT模型在保留内容语义的同时,实现连续平滑的风格化强度控制。

04:00
arXiv cs.CV

SUMI:用于3D点云推理的可扩展统一模型

提出扩散增强细化模块SUMI,融合噪声与粗特征,提升点云补全局部细节和全局一致性,优于基线。

04:00
arXiv cs.CV

Ego-OSCAR:开源第一人称视角立体捕捉系统

开源低成本头戴式立体惯性采集设备,单价低于200美元,提供约550小时带标注视频、IMU及3D手部重建,降低规模化第一人称数据采集门槛。

04:00
arXiv cs.CV

VTO:视频异常检测的视觉工具编排

提出基于过程监督强化学习的VTO,用认知评估器提供语义反馈,优化工具编排,视频异常检测准确率提升10.2%。

04:00
arXiv cs.CV

面向计算高效Transformer适配的电路微调

电路微调(CFT)用电路发现预选模块,免预热,减少2.3-6.6倍FLOPs,零参数,适配ViT。

04:00
arXiv cs.CV

基于敏感性建模的开放世界语义分割

提出带敏感性解码器的开放世界语义分割框架,利用局部激活不稳定性检测未知,提升异常分割与新型类发现。

04:00
arXiv cs.CV

自监督视觉表示学习的三个必要原则

提出自监督视觉表示学习需同时满足三个原则:跨视图语义不变性、块级空间预测、表示非退化;缺一不可。

04:00
arXiv cs.CV

测试时原型适配用于开放词汇语义分割

提出无训练输出级插件TPA,利用未标注部署图像构建DINO原型,辅助分数改善开放词汇分割,兼容多模型基准,少量数据有效。

04:00
arXiv cs.CV

你的VLM已知道何时:通过是非提问实现免训练时间定位

多模态大模型时间定位差源于接口而非感知;用是非提问由粗到细排名,无需训练即大幅提升性能,新方法超越基准。

04:00
arXiv cs.CV

频域双分支融合用于医学视觉问答

提出频域双分支融合模块,按问题自适应滤波,结合全局低频与细节高频,在医学VQA基准上提升性能且保持轻量高效。

04:00
arXiv cs.CV

持续可扩展的脑部MRI基础模型

脑磁共振基础模型Alcmaeon可连续扩展至多个临床领域,利用图蓝图剪枝避免遗忘,支持多种任务。

04:00
arXiv cs.CV

不规则性的代价:哈希分块 GPU 工作负载上的 CUDA C++、Rust 与 Triton 对比

在哈希分块的不规则负载上,Rust性能接近手写CUDA,Triton慢一个数量级以上,差距源于语言表达限制。

04:00
arXiv cs.CV

DoRF++:基于多普勒辐射场的球面表示学习,实现鲁棒Wi-Fi感知

将NeRF引入Wi-Fi感知,用球面Transformer学习多普勒辐射场,提升跨用户手势识别泛化能力。

04:00
arXiv cs.CV

InstructionCrafter:生成一致且高保真的视觉指令

提出InstructionCrafter,冻结空间层训练,用双适配器兼顾步骤忠实、跨图一致与画质,减少50%参数,达SOTA。

04:00
arXiv cs.CV

基于潜在修正流的热带气旋预报:融合卫星图像与大气场

提出单次生成模型,联合预测卫星红外图像与四个大气场,采样快30倍,路径误差更低。

04:00
arXiv cs.CV

VOICE:整合直接与检索式预测原位单细胞基因表达的视觉-组学基础模型

VOICE是一种多模态基础模型,从H&E图像预测单细胞基因表达,融合直接回归与参考细胞检索,优于现有方法。

04:00
arXiv cs.CV

学习深度模态共享自表达模型用于图文图像聚类

利用模态共享自表达模型挖掘图文跨模态结构,同时学习多子空间结构化表示,在多个图像聚类基准上提升超3%,并具强迁移性。

04:00
arXiv cs.CV

PARAGraph:病理-解剖感知的糖尿病视网膜病变分级层级图

提出PARAGraph病理-解剖层级图,融合病变证据与全局上下文,提升糖尿病视网膜病变分级性能与可解释性。

04:00
arXiv cs.CV

病理Transformer的门控空间冗余投影

提出门控空间冗余投影,为自注意力轻量降冗余,提升病理图像生存分析与分类性能。

04:00
arXiv cs.CV

FreCast:基于相位保持幅度残差扩散的雷达回波强度细化降水临近预报

两阶段框架:先预测回波结构,再以结构为约束细化强度偏差,提升降水预报准确性。

04:00
arXiv cs.CV

各向异性脑T2加权MRI的解剖一致性跨对比度超分辨率

提出解剖一致的跨对比度超分辨法,提升各向异性脑磁共振下游分割性能。

04:00
arXiv cs.CV

智能体AI驱动的柔性光纤束内窥镜用于高分辨率近红外二区荧光活体成像

AI柔性光纤束内窥镜,光学-计算协同及智能体专家模型消除串扰伪影,实现近红外二区高分辨活体成像。

04:00
arXiv cs.CV

SC-Diff:用于可见光到红外图像翻译的语义校准扩散

提出语义校准扩散框架SC-Diff,通过语义掩码校准自注意力,提升红外生成质量与目标检测性能。

04:00
arXiv cs.CV

RenderMatte:精确Alpha渲染与组相对对齐的图像抠图

提出RenderMatte框架,以精确Alpha渲染和组相对对齐,构建数据集,实现开放世界SOTA抠图。

04:00
arXiv cs.CV

RayLift:利用3D几何先验提取互补逐射线证据用于语义场景补全

提出RayLift,融合立体几何与互补射线证据,建模深度不确定性,自适应采样加权,提升语义场景补全精度,超越现有方法。

04:00
arXiv cs.CV

临床增强医学报告生成中的语言对齐与视觉基础偏好优化

提出临床增强报告生成框架,聚焦临床发现与跨模态对齐,通过实体级诊断与反驳修改提升临床准确性和可靠性。

04:00
arXiv cs.CV

通过测试时自适应实现自适应超分辨率与质量评估

提出测试时自适应统一框架,提升未知退化下的视频超分及质量评估,无需重训或高清监督。

04:00
arXiv cs.CV

基于组合特征的人脸识别系统伪装与欺骗检测框架

提出五种组合特征管线统一应对欺骗与伪装;HOG综合最优,LBP防欺骗最高但姿态鲁棒性较弱。

04:00
arXiv cs.CV

重新思考脉冲Transformer中的注意力局部性

提出局部注意力与边界通路方法,增强脉冲变换器空间局部性,在检测分割等任务上精度显著提升且开销小。

04:00
arXiv cs.CV

ERF-GS:从非重叠事件-RGB视点重建快速运动

提出ERF-GS,将事件信息融入高斯溅射优化与稠密化,利用事件高帧率,在低帧率及运动模糊下重建快速运动,优于现有方法。

04:00
arXiv cs.CV

eBIRD:利用可控扩散模型从事件流重建强度图像

提出一种方法,结合扩散模型与条件控制从事件流重建强度图像。通用模型适数字,专用模型适人脸,验证有效。

04:00
arXiv cs.CV

MotionCraft:基于稀疏注意力的潜世界建模用于视觉上采样

将视频超分重构为运动感知潜状态预测,结合稀疏注意力与可控接口,实现高效、一致的超分重建。

04:00
arXiv cs.CV

VLZip:交错长上下文建模的统一视觉与文本压缩

VLZip统一压缩视觉与文本,分层生成软前缀注入解码器,大幅延长上下文至28万token,推理高效且性能领先。

04:00
arXiv cs.CV

CDGC-Net:基于协作双尺度自注意力与分组通道建模的3D医学图像分割

提出CDGC-Net:协作双尺度自注意力和分组通道建模,多数据集精度最优,计算复杂度较UNETR++显著降低。

04:00
arXiv cs.CV

设备端多物种疟疾检测与不确定性校准的玻片级聚合

面向缺医少药地区,设备端疟疾检测集成多物种识别与不确定度校准,玻片级聚合定量,mAP0.863,离线运行。

04:00
arXiv cs.CV

RobustDefect-LLM:可解释与鲁棒性感知的工业表面缺陷分类,带决策支持和AI辅助报告

提出鲁棒缺陷检测框架,集成分类、证据与决策支持,最优准确率99.26%,退化时性能下降,低置信度转人工,验证可行。

04:00
arXiv cs.CV

可扩展多智能体世界建模

提出可扩展多智能体世界模型,解耦状态与渲染,支持任意数量智能体推理扩展,保持一致性且近线性开销。

04:00
arXiv cs.CV

基于游览视频先验的目标导向导航指令生成

提出视频导航指令生成任务,利用游览视频先验生成指令,采用课程学习提升质量与可执行性。

04:00
arXiv cs.CV

蜜蜂在哪里?基于单一协同头Transformer的微小传粉者检测

针对微小传粉者检测,采用Co-DINO Swin-L,结合裁剪马赛克与类别加权ETF损失,缓解类别不平衡,以0.5062 mAP获第一。

04:00
arXiv cs.CV

VADER:视频大语言模型中缓解幻觉的自适应去偏方法

VADER免训练:重分配视觉焦点+擦除选择性证据,对比解码抑制视频幻觉,提升事件定位与时间一致性。

04:00
arXiv cs.CV

REVEAL:准则引导的长视频问答证据充分性显式验证智能体

提出REVEAL框架,以视觉分组构建记忆,用准则库显式验证证据充分性,缺失定向补检,无需训练即超越现有方法。

04:00
arXiv cs.CV

EvTrajGS:基于无位姿事件流的高精度高效3D高斯溅射

提出EvTrajGS,用连续时间轨迹联合优化位姿与场景,损失重加权采样,实现高效高精度重建,PSNR提升3.8dB,ATE降低超40%。

2026年8月10日
04:00
arXiv cs.CV

有限数据下改进低分辨率人脸识别:合成数据生成如何弥合领域差距

合成数据生成并非越复杂越好:简单插值增强最优,学习型超分不及直接输入,需在真实低分辨率验证。

04:00
arXiv cs.CV

面向下颌骨重建手术的基于表面的虚拟术前切割导板配准方法

基于表面配准的增强现实方法将虚拟切割导板配准至下颌骨,误差4~7毫米,延迟0.8秒,可替代实体导板。

04:00
arXiv cs.CV

SLED:通过蒸馏实现可扩展的位置编码

提出SLED蒸馏式位置编码器,以地理位置绑定模态,支持多模态,小批量高效预训练,性能优于现有方法。

04:00
arXiv cs.CV

当语义饱和或涌现:无源跨域小样本学习中的适应条件语义效用

跨域小样本中,零样本提示质量不能完全预测适应后的语义效用:细描述优势或饱和或涌现。

04:00
arXiv cs.CV

TransSLR:用于手语识别的轻量级Transformer

提出轻量Transformer TransSLR,基于关键点序列训练,在CASL-W60上准确率达80.39%,提升10.46%,且计算开销低。

04:00
arXiv cs.CV

基于在线个性化能量缓存的测试时自适应细粒度视频表情识别

提出EB-CaP,用能量模型为每段视频生成个性化原型缓存,无需更新参数,降低开销,超越现有测试时自适应方法。

04:00
arXiv cs.CV

3D医学基础模型能否看穿MRI伪影?表示鲁棒性的受控研究

研究五种三维医学编码器的MRI伪影鲁棒性:因模型和伪影而异,大规模或领域预训练不保证不变性。