11021 条条目 · 106 个活跃源
2026年8月17日
04:00
arXiv cs.CV

Kolmogorov-Arnold网络用于空间独立的多光谱土地分类

评估KAN在Landsat8土地分类中的性能,参数少且可解释性强,精度匹配随机森林并优于多层感知机。

04:00
arXiv cs.CV

ChartProbe:基于感知、定位与简单推理的视觉推理诊断研究

提出ChartProbe诊断框架,证明仅训练感知、定位等基础技能即可显著提升复杂图表推理,无需复杂推理数据。

04:00
arXiv cs.CV

CAST:面向零样本分类器扩展的闭式解析语义迁移

提出无需训练和图像的闭式语义迁移,经权重注入扩展零样本分类器,推导语义外推残差,性能媲美少样本法。

04:00
arXiv cs.CV

PROVE:基于可验证证据的无训练提示恢复

提出无训练黑盒提示反演攻击,用可验证场景描述重构提示,优于现有方法,可审计且无需训练。

04:00
arXiv cs.CV

多相扩散:面向高对比度尖锐界面多相物理系统的扩散生成建模

提出多相扩散模型,结合守恒通量残差、双射表示与雅可比预条件似然,解决高对比度尖锐界面生成难题,优于七个基线。

04:00
arXiv cs.CV

保留什么,何处适应:持续妇科图像分割中遗忘的深度分析

持续妇科图像分割中,遗忘取决于更新发生在编码器-解码器的深度位置,浅层编码器与解码器训练会加剧遗忘。

04:00
arXiv cs.CV

注定永远重新标注:ImageNet的故事

重新标注ImageNet验证集,发现约12%标签错误、33.3%多标签、3.8%无目标,新标注提升准确率,问题具结构性。

04:00
arXiv cs.CV

MedPlex:深度视觉-语言协同适应实现临床落地的医学分割

MedPlex提出双向融合与层级概念对齐,让文本引导贯穿编码器,在CT/MR多器官及肿瘤分割上达到最优。

04:00
arXiv cs.CV

XSA-MAD:跨模态语义对齐的变形攻击检测方法

提出XSA-MAD跨模态框架,分解变形为四属性并语义对齐,增强泛化性,GAN攻击EER达2.92%。

04:00
arXiv cs.CV

OpenBelief-Nav:保留证据的物体记忆用于开放词汇语言引导导航

提出保留证据的物体记忆,融合观察短语为对象信念,提升开放词汇导航的目标确认与成功率。

04:00
arXiv cs.CV

RGBX-Next:迈向基于G缓冲区的真实感生成渲染

提出RGBX-Next,将扩散Transformer微调为基于G-buffer的正反向生成渲染器,实现高质量生成渲染与本征分解。

04:00
arXiv cs.CV

CoANeRV:坐标感知的令牌空间神经视频表示

CoANeRV通过前馈令牌生成与共享坐标解码器,实现高效摊销视频表示,避免逐视频优化,提升重建质量并降低内存消耗。

04:00
arXiv cs.CV

基于几何分解与多分辨率低秩特征的快速隐式神经光场表示

提出几何分解与多分辨率低秩特征的隐式光场表示,快速重建,兼顾质量与效率。

04:00
arXiv cs.CV

CMCNet:将超声图像嵌入与文本TI-RADS表征对齐,用于细粒度甲状腺分类

提出CMCNet,用中心-边缘对比损失对齐图像与文本TI-RADS嵌入,实现高效稳健的细粒度分类。

04:00
arXiv cs.CV

注意力捕获不等于检测:人类如何漏看局部AI图像编辑的两阶段解释

研究表明,AI编辑图像是否被注意与是否被判定为假是两个独立阶段:编辑区域决定注意捕获,语义合理性决定判断准确性。

04:00
arXiv cs.CV

SAFE:纯色场景下基于学习颜色空间的场景感知特征调制颜色恒常性

提出SAFE+LCS解决纯色场景色度坍塌,平均误差降10%,最好25%降20%,最差25%降5.8%

04:00
arXiv cs.CV

面向地震断层分割的共识门控多智能体神经架构搜索

三个大语言模型共识门控搜索,发现425K参数小模型,精度最高,成本约一GPU日。

04:00
arXiv cs.CV

超越控制点:控制场不完整或缺失下视觉测量平台的角秒级相对运动估计

提出控制自适应差分框架,无或少控制点即可从图像位移估计平台运动,免优化,精度角秒级、耗时毫秒级。

04:00
arXiv cs.CV

重新思考多模态零样本异常检测中的辅助模态:从语义融合到条件调制

提出即插即用框架,将辅助模态作为条件信号细化RGB特征,保留原有语义,提升多模态零样本异常检测性能。

04:00
arXiv cs.CV

超越文本条件:MLLM与DiT融合用于视频生成的系统研究

提出BiVidGen:MLLM生成语义视觉token,DiT经多层交叉注意力融合文本与token,提升视频语义对齐与时间连贯性。

04:00
arXiv cs.CV

ProFocus:渐进式视觉聚焦解析艺术图像情感体验

ProFocus以渐进视觉聚焦建模艺术图像情感,引入分层认知引导,在ArtEmis基准上优于现有方法。

04:00
arXiv cs.CV

PPOM:为基于CLIP的可泛化视觉-语言提示调优边缘化补丁网格相位

提出PPOM免训练推理算子,边缘化补丁网格相位,降低预测敏感性,无需重训即提升CLIP提示调优性能。

04:00
arXiv cs.CV

MedClaw:面向长时程手术视频推理的启发式智能体框架

提出新智能体框架,分离推理与感知,以无梯度技能蒸馏积累经验,仅约100样本即可提升长时程手术视频推理。

04:00
arXiv cs.CV

FIRM:面向遥感推理分割的掩码细粒度令牌内表示

提出细粒度令牌内掩码表示,为每个令牌预测子单元模式,保留内部结构,提升遥感推理分割,多基准领先。

04:00
arXiv cs.CV

基于内容的游戏视频解说:视觉语言模型驱动

提出用视觉语言模型为任意游戏录制生成电竞式解说,无需定制训练,通过拼图与上下文提示实现。

04:00
arXiv cs.CV

ForgeWM:少步动作条件视频世界模型的渐进式因果训练

ForgeWM采用渐进式因果训练实现少步动作条件视频世界模型,支持1/2/4步,质量与动作精度领先。

04:00
arXiv cs.CV

E-S2Feat: 事件相机语义引导的脉冲局部特征检测与描述

提出语义引导的脉冲神经网络E-S2Feat,用于事件相机局部特征,精度提升且能效提高4.8倍。

04:00
arXiv cs.CV

SSP:一种面向自动驾驶VLA模型的事件匹配的合成-仿真-物理跨域评估框架

提出事件匹配的跨域评估框架验证自动驾驶模型性能,显示合成仿真物理域能力因场景而异,物理域非普遍最优。

04:00
arXiv cs.CV

PISA:一种用于测试时开放词汇目标检测的伪个体源域特征自适应框架

提出PISA框架,利用CLIP跨损坏图像的不变性生成伪个体源域特征进行监督,无需源域数据,提升开放词汇检测在域偏移下的性能。

04:00
arXiv cs.CV

Owner3D:所有权引导的风格写入,用于免训练的局部3D风格化

提出所有权引导的风格写入,实现免训练局部3D风格化,减少外观泄漏86%以上。

04:00
arXiv cs.CV

固定预算下结构感知的高斯体积编码

固定预算结构感知分配高斯基元编码标量场,提速51倍,压缩比超4万倍,单模型支持各种可视化。

04:00
arXiv cs.CV

CoDS:基于专家驱动的检测与BEV分割的鲁棒协同感知

提出CoDS协同感知框架,通过可靠性图、语义混合专家与双向任务交互,在噪声下实现鲁棒检测与BEV分割。

04:00
arXiv cs.CV

发现并空间刻画多个捷径组以审计视觉模型偏差

通过聚类每图像贡献图,发现多个空间捷径模式,定位子集偏差,并干预抑制以降低性能差异。

04:00
arXiv cs.CV

源无关图像翻译:基于潜在感知自适应掩码

提出源无关框架,用扩散预测差异动态细化掩码,自适应阈值,无需训练即可精准转换图像,性能超SOTA。

04:00
arXiv cs.CV

HiCo-GS:面向八叉树高斯溅射的层次上下文聚合与几何一致性

针对八叉树高斯溅射的跨级特征隔离,提出跨层聚合与深度法线一致性方法,实现城市级高质量渲染。

04:00
arXiv cs.CV

基于体素的地震数据三维相分割:比较研究

现有方法将3D地震体切为2D,损失连续性。本文提出体素3D分割基准,评估三类架构,给出基线结果。

04:00
arXiv cs.CV

InstructVVT:无需辅助空间先验的指令驱动视频虚拟试穿

提出指令驱动视频试穿框架,无需空间先验,通过双级参考条件实现精确换装,并用试穿奖励对齐人类偏好,效果优于现有方法。

04:00
arXiv cs.CV

SPARGen:通过原生多模态生成统一空间感知与推理

提出统一多模态生成框架,将三维重建、稠密对应和空间推理统一为生成任务,共享空间监督,性能优越。

04:00
arXiv cs.CV

从地球观测数据学习预测作物生长

利用遥感时间序列与气象数据,序列模型可预测冬小麦叶面积指数,R²>0.8,优于传统方法。

04:00
arXiv cs.CV

LightTeaNet:一种用于茶叶叶部病害多标签检测与定位的弱监督轻量级CNN

提出轻量级CNN LightTeaNet,基于弱监督多标签与CAM定位茶叶病害,无需手工标注,精度0.96,F1 0.92,高效可解释。

04:00
arXiv cs.CV

CSG-Mamba:用于内镜息肉分割的卷积评分门控视觉状态空间网络

提出CSG-Mamba,以卷积评分门控增强状态空间模型,内镜息肉分割优于基线。

04:00
arXiv cs.CV

概念引导:文本到图像生成的精确、免训练潜在控制

提出概念引导法CoG:利用概念相关层信息加权引导去噪,免训练精确控制,提升图像生成性能。

04:00
arXiv cs.CV

SCVIB:面向多轮个性化定位的可编辑状态条件视觉实例绑定

提出SCVIB与TT-VG,将多轮个性化定位准确率提升至70.27%,揭示利用已解析支持证据是关键。

04:00
arXiv cs.CV

自监督视觉同策略蒸馏

提出自监督视觉同策略蒸馏法,用不对称增强视图构建学习信号,无需特权信息,在六个细粒度基准上显著提升性能。

04:00
arXiv cs.CV

RankT2I:用于发现文本到图像模型中可解释且多样化语义的子模框架

提出RankT2I,一种无需训练、模型无关的框架,用子模目标自动发现可编辑且多样的语义,超越现有方法。

04:00
arXiv cs.CV

基于骨架的零样本动作预判

提出零样本骨架动作预判任务,构建基准与基线模型,通过互信息最大化实现未见类动作识别。

04:00
arXiv cs.CV

手术内镜视频中时序视觉语言模型的鲁棒性研究

提出内镜C6基准,评估时序视觉语言模型鲁棒性,发现严重崩溃,轻量微调显著提升。

04:00
arXiv cs.CV

AppleScab-LT:面向时序病害进展分析的真实田间苹果黑星病纵向数据集

提出苹果黑星病真实田间纵向数据集,重复追踪同一病叶,含21个序列、2101图像,支持时序进展分析。

04:00
arXiv cs.CV

空间语言消息传递用于病理图像解读

提出空间语言消息传递框架,在语言空间中聚合相邻图块的病理描述,提升肿瘤描述准确率3.3-19.6个百分点,无需微调即可增强通用多模态大模型的空间推理能力。

04:00
arXiv cs.CV

哨兵一号SAR影像中极地低压的弱监督分割

提出CREST框架,仅用图像级标签生成分割掩码,通过约束扩展与动态引导损失提升极地低压及类似连通目标的分割质量。