11051 条条目 · 106 个活跃源
2026年8月13日
04:00
arXiv cs.CV

SCOUT:通过结构化思维链与多目标过程奖励解锁增强的空间推理

SCOUT通过结构化思维链和多目标过程奖励,显著提升空间推理,超过GPT-4o。

04:00
arXiv cs.CV

ScaleVid:无网格推理的几何感知视频物体缩放

两阶段训练解耦前景变换与背景保持,免3D重建,实现几何一致、前景保真、背景保留的物体缩放。

04:00
arXiv cs.CV

HSTGFormer:用于三维人体姿态估计的超时空图Transformer

针对时空分离建模局限,提出超时空图变换器,以局部耦合图聚合和双尺度时间图,高效精准做三维姿态估计。

04:00
arXiv cs.CV

GenFAR:基于深度学习从49,246例多队列MRI推导的脑结构广义表征

提出GenFAR,用49,246例多队列MRI训练出通用脑表征,提升下游任务精度与样本效率。

04:00
arXiv cs.CV

M-Net:融合谱特征与物理场算子的医学图像分割深度学习网络

M-Net融合矩阵谱特征与向量微积分算子,经数学注意力门融合,肝/肾/脑肿瘤分割较基线提升12.37%/3.52%/5.55%。

04:00
arXiv cs.CV

HAMP-LIC:面向学习图像压缩的Hessian感知混合精度训练后量化

提出HAMP-LIC,基于Hessian感知的混合精度训练后量化,优化位宽分配,实现4.85倍压缩,BD-rate损失仅0.59%,消除跨平台编解码误差。

04:00
arXiv cs.CV

神经蒙皮的测地线切割单元先验

提出切割单元蒙皮几何先验,以图近似体测地距离,加速计算且鲁棒,提升神经蒙皮模型效果。

04:00
arXiv cs.CV

用于增强左前降支动脉三维分割的邻域注意力Transformer网络

提出NA-UNETR,以邻域注意力和不确定性加权损失提升低对比CT左前降支分割的Dice与边界精度。

04:00
arXiv cs.CV

Diagram-MMU:科学图表的多模态基准

提出Diagram-MMU基准,含3.7k图表与18.3k题,评估12个MLLM,发现解析比问答更难。

04:00
arXiv cs.CV

超越试错:图像到视频一致性的智能体优化

提出智能体自改进框架,两阶段优化提示与参数,结合DSG/CMQ评估,人类偏好胜率高达69%。

04:00
arXiv cs.CV

XYZFlow:高效生成建模的多维捷径流扩展

XYZFlow通过多维缩放流匹配,时空缩放与NSP,实现7.2-8.5倍加速及优秀FID。

04:00
arXiv cs.CV

DreamFly:面向空中视觉语言导航的因果记忆与滚动时域扩散规划

提出DreamFly,融合因果记忆、滚动时域扩散规划与显式终止预测,在OpenFly基准上取得最优导航性能。

04:00
arXiv cs.CV

面向内存高效测试时自适应的曲率感知零阶优化

曲率感知零阶优化:对角Hessian各向异性扰动,仅前向传播优化适配器,内存高效测试时自适应SOTA

04:00
arXiv cs.CV

可解码但不可访问:对解缠皮肤病变表征上基于距离的可靠性估计的审计

解缠表示可解码但可靠性估计失效,距离度量AUROC低于随机,监督探针却可恢复域信息,表明信息可解码但不可用于可靠性估计。

04:00
arXiv cs.CV

可解释计算机视觉中的类别激活映射:以方法为中心的CNN、Transformer与基础模型时代视觉解释综述

综述57种CAM方法,按归因机制分类,涵盖CNN至基础模型时代,指出评估碎片化。

04:00
arXiv cs.CV

StateFlow:为预可视化构建、演化与访问三维世界状态

StateFlow以持久3D世界状态为核心,分构建、演化、访问三阶段,实现可控生成与迭代编辑。

04:00
arXiv cs.CV

基于辅助函数法的相似变换图像傅里叶-梅林配准

提出亚像素级相似变换估计算法,先估尺度旋转再估平移,误差优于离散互相关傅里叶-梅林法。

04:00
arXiv cs.CV

基于几何的全光点云压缩

提出基于KLT和帧内预测的全光点云属性压缩,兼容G-PCC,性能为当前最优。

04:00
arXiv cs.CV

基于色相分割模型树的边界连续跨相机RGB映射

提出色相分割模型树方法,经边界连续混合优化,提升跨相机映射精度并抑制色差。

04:00
arXiv cs.CV

基于公有领域影片库的对话感知视频配乐生成

提出OSSL-v2公有领域影片库,用对话信号提升视频配乐生成,效果优于现有基线。

04:00
arXiv cs.CV

Qwen-MusicAVQA-7B:面向音乐视听问答的多模态模型

轻量方案用冻结编码器,音乐视听问答准确率96%,关键在于保留音频细粒度时序,训练仅数小时。

04:00
arXiv cs.CV

如实测量浏览器摄像头视线:捕获时钟方法论与开放参考实现

针对浏览器摄像头视线追踪延迟测量失真,提出捕获时钟诚实测量法并开源。

04:00
arXiv cs.CV

单视图MRI扫描中阿尔茨海默病检测的CNN架构比较

十种CNN架构对比检测阿尔茨海默病,VGG16最佳(准确率95.33%),非痴呆向极轻痴呆分类最难。

04:00
arXiv cs.CV

Un-EVIMO:无监督事件相机独立运动分割

首个无监督事件相机独立运动分割框架,用几何约束生成伪标签,无需标注,处理任意数量物体,性能媲美监督方法。

04:00
arXiv cs.CV

HandEdit:面向第一视角人手到机器人灵巧手图像编辑的统一基准

HandEdit:具身感知图像编辑基准,将第一视角人手转换为机器人灵巧手,支持可扩展机器人学习。

04:00
arXiv cs.CV

3D场景生成:综述

综述3D场景生成:涵盖程序化、神经3D、图像与视频四种范式,剖析挑战与未来方向。

04:00
arXiv cs.CV

COLORA:卷积模型高效微调方法及光学相干断层扫描图像分类研究案例

提出CoLoRA,将LoRA扩展至卷积层,参数减少80%以上,性能相当且保持模型尺寸,适用于医学及自然图像分类。

04:00
arXiv cs.CV

P2MFDS:面向浴室环境的老年人隐私保护多模态跌倒检测系统

融合毫米波雷达与振动传感,提出隐私保护多模态跌倒检测系统,以双流网络提升精度与召回率。

04:00
arXiv cs.CV

UK Biobank中基于组织掩膜的全身体图像配准方法

提出性别分层全身磁共振配准,用脂肪肌肉掩膜增强,提升Dice分数、减少折叠频率。

04:00
arXiv cs.CV

域感知轻量级光谱分组卷积用于高光谱鱼新鲜度分类

提出轻量级SGNet网络,用光谱分组卷积与双注意力,以4.75M参数达97.8%精度,实时预测鱼新鲜度。

04:00
arXiv cs.CV

基于激光雷达的城市尺度三维变化检测

提出不确定性感知的以对象为中心的城市级LiDAR变化检测方法,通过多分辨率NDT配准、逐点检测水平校准及类别约束匹配,在Subiaco市达到95.3%准确率,优于最强基线。

04:00
arXiv cs.CV

CORE-3D:基于三维嵌入的上下文感知开放词汇检索

提出CORE-3D,利用渐进粒度精化的SemanticSAM和上下文感知CLIP编码,提升三维语义分割与开放词汇检索性能。

04:00
arXiv cs.CV

MicroAUNet:结合知识蒸馏的边界增强多尺度融合用于结肠镜息肉图像分割

提出边界增强多尺度轻量网络MicroAUNet,结合可分离卷积与注意力,经知识蒸馏,以极低复杂度实现实时高精度息肉分割。

2026年8月12日
04:00
arXiv cs.CV

卷积层激活降维用于分布外与对抗攻击检测方法

提出一种可控高压缩的卷积层激活降维法,提升分布外与对抗攻击检测性能,同时降低计算和内存开销。

04:00
arXiv cs.CV

4D-WAM:用于自动驾驶的4D一致世界建模

提出4D-WAM,利用几何基础模型监督训练实现4D一致世界建模,提升自动驾驶轨迹规划。

04:00
arXiv cs.CV

路标水印:视觉水印共存的联合优化

提出联合优化方法,使图像视频水印在不可感知下共存,提升解码鲁棒性与视觉质量,支持分层来源标记。

04:00
arXiv cs.CV

MAD-HOI:从文本生成关节手物交互的掩码自回归扩散

提出MAD-HOI,用掩码自回归扩散从文本生成手物交互,支持变长、复合、补全及终止预测,更逼真多样。

04:00
arXiv cs.CV

P3CA:通过空间探测对视觉基础模型嵌入进行编码器无关解读

提出P3CA,一种编码器无关的空间探测方法,估计局部主方向并投影,无需重训练即可解释视觉基础模型嵌入。

04:00
arXiv cs.CV

LEGO:分层语言高斯泼溅

LEGO实现开放词汇3D场景层次化理解,统一SAM粒度并构建语言场景图,支持空间推理,刷新SOTA。

04:00
arXiv cs.CV

面向运动伪影感知的自监督表示学习用于三维脑MRI运动伪影消除

提出SSRL-MAR无配对自监督框架,三阶段学习减少三维脑MRI运动伪影,效果优于源监督模型。

04:00
arXiv cs.CV

DoseBridge:用于肺部调强质子治疗剂量预测的去噪扩散桥模型

首个去噪扩散桥模型DoseBridge,融合CT与束流几何预测调强质子治疗剂量,性能优于现有模型。

04:00
arXiv cs.CV

人类视觉与计算机视觉

中心标记胜过训练网络;模型存在年龄、种族、意识形态偏差;提出按群体视线学习以覆盖所有人。

04:00
arXiv cs.CV

更准确,却更不人性:视觉模型中的格式塔分组

测试45个视觉模型对格式塔分组的符合度,发现封闭模型虽准确但人性对齐低,提供无需新实验的评估标尺。

04:00
arXiv cs.CV

面向统一动态人脸关键点检测

提出人脸部位锚定关键点位置(FPALP),统一各N点数据集;用动态查询解码器,单模型可预测任意数量关键点,性能优异。

04:00
arXiv cs.CV

冻结的脑MRI基础模型是站点指纹

冻结脑MRI基础模型嵌入主要编码采集站点(约0.9),非预训练所致;移除站点子空间会损害分割。

04:00
arXiv cs.CV

SeFaR:深度神经网络的语义特征感知鲁棒性测试

提出SeFaR框架,用层次概念模型和扩散模型生成语义扰动,发现影响决策的未知特征,生成可解释的失败诱导概念。

04:00
arXiv cs.CV

TRACE-GS:面向稀疏视图3DGS恢复的带特权几何条件的同策略轨迹蒸馏

用特权几何做在线轨迹蒸馏,教师沿学生采样轨迹监督,解决稀疏视图三维高斯恢复的推理失配,仅留学生模型,性能提升。

04:00
arXiv cs.CV

从检测到理解:面向多任务交通异常推理的TAR与TAR-Bench

提出交通异常推理数据集TAR与测试集TAR-Bench,含4.4万思维链标注,多任务微调提升21.4分。

04:00
arXiv cs.CV

MRIComp4Flow:用于训练多模态生成模型的3D脑MRI压缩

JPEG2000压缩可有效训练3D脑MRI生成模型,20:1压缩比下合成质量与未压缩相当。

04:00
arXiv cs.CV

空间思维链:面向视觉语言模型的模态无关空间接地

提出空间令牌框架,蒸馏3D几何与物体属性为连续令牌,无需额外模块提升VLM空间推理,可解释。