11161 条条目 · 106 个活跃源
2026年7月24日
04:00
arXiv cs.CV

Loss Landscape Topology Reveals Why Simple Baselines are Competitive at 3D Point Cloud Segmentation Under Class Imbalance

04:00
arXiv cs.CV

HalluScope:面向多模态大语言模型的细粒度幻觉诊断

提出细粒度幻觉诊断任务与HalluScope模型,实现检测分类可解释生成,有效指导模型纠正幻觉。

04:00
arXiv cs.CV

第二届LoViF 2026真实世界全能图像恢复挑战赛:方法与结果

第二届LoViF挑战赛推动真实世界全能图像恢复,涵盖模糊、低光等退化,总结有效设计并更新基准。

04:00
arXiv cs.CV

病理视觉-语言模型真的能看见病理吗?

PathBind揭示病理VLM存在答案准确与视觉绑定间的显著差距,视觉证据非必要、领域训练增益有限、注意力扩散等问题。

04:00
arXiv cs.CV

斯托克斯信息引导的扩散模型用于鲁棒线性偏振估计

GenPolar基于扩散模型预测斯托克斯分量,两阶段训练实现高保真偏振估计,提升材料检测与去反射性能。

04:00
arXiv cs.CV

面向安全的手机辅助导航中的人行道与道路分割

提出安全导向分割框架,构建数据集,评估模型发现综合精度、伪安全错误和运行速度是关键。

04:00
arXiv cs.CV

DTIF: 复杂森林中基于Delaunay三角拓扑的鲁棒闭环检测

基于树干提取与Delaunay拓扑的轻量框架,实现森林中鲁棒闭环检测与全局配准,低计算开销,适用于边缘平台。

04:00
arXiv cs.CV

CRAG-MM-Diagnostics:实现知识密集型视觉问答的阶段性分析

提出阶段性诊断基准,揭示KI-VQA中知识检索与推理为主要瓶颈,并通过接地双模态RAG提升准确率。

04:00
arXiv cs.CV

解耦跨模态流形差异:利用可见光扩散先验进行红外超分辨率

提出Shift-IISR双路径扩散框架,用全局调制和局部细化模块提升红外超分辨率的一致性与生成能力。

04:00
arXiv cs.CV

眼不见,心还在:全模态大语言模型的令牌压缩

提出ReMo框架,通过跨模态信息重分配压缩视觉令牌54%,准确率不减反升。

04:00
arXiv cs.CV

用于荧光显微镜跨模态超分辨率的物理信息深度学习模型

提出物理信息GAN,利用点扩散函数先验提升跨模态超分辨的结构保真度与物理合理性。

04:00
arXiv cs.CV

基于学习的缝纫样板缝线对应重建

提出图学习框架,从2D面板重建两级缝线信息,支持复杂拓扑,实现高精度与强泛化。

04:00
arXiv cs.CV

DART:一种面向档案胶片修复的退化感知循环Transformer

提出DART,利用软缺陷掩码显式指导修复,提升档案胶片修复的感知质量和时间一致性。

04:00
arXiv cs.CV

T-STAR:卫星视频中时空全景场景图生成的大规模基准

提出卫星视频TPSG任务及大规模基准T-STAR(含超110万实例掩码和380万三元组),框架提升跨帧一致性与关系预测。

04:00
arXiv cs.CV

Flash EQ-Linear:通过分组离散傅里叶变换加速等变线性层

提出Flash EQ-Linear算法,利用傅里叶卷积定理降低复杂度,实现2倍前向加速和1.7倍端到端加速,全面超越非等变网络。

04:00
arXiv cs.CV

DINOde:面向开放词汇语义分割的连续视觉-文本对齐

DINOde基于ODE连续对齐CLIP文本与DINO视觉流形,含语义文本流和全局上下文流,速度切线投影保持几何,多基准SOTA。

04:00
arXiv cs.CV

检测器学错了:针对物理可实现攻击的抗捷径对抗训练

提出InsCAT框架,阻止检测器将对抗纹理作为独立决策线索,纹理误报率从46.9%降至7.3%。

04:00
arXiv cs.CV

SlerpFlow:用于修正流反转的球形轨迹校正

提出SlerpFlow,用球面线性插值修正流轨迹曲率,实现高保真图像反转与编辑,无需训练。

04:00
arXiv cs.CV

HGeo-TopoMap: 利用分层几何先验增强拓扑地图构建

提出HGeo-TopoMap,通过几何自适应与一致性学习模块分层利用先验地图和空间关系,显著提升拓扑地图构建精度与鲁棒性。

04:00
arXiv cs.CV

不平衡条件下的遗忘:多模态大模型遗忘中的公平性基准测试

提出FAIRGET基准和FAUN算法,解决多模态大模型遗忘中不平衡请求导致的偏见问题,兼顾遗忘质量与公平性。

04:00
arXiv cs.CV

PC-Edit:提示对比区域发现与区域引导编辑

PC-Edit通过提示对比发现编辑区域并保护背景,实现无训练的高质量图像编辑,效果最佳。

04:00
arXiv cs.CV

面向实时人群跟踪的增量最优分配

利用块稀疏结构的增量分配算法,实现与匈牙利算法相同的最优匹配,速度提升3.7至6.5倍。

04:00
arXiv cs.CV

质量感知的多模态融合揭示效价-唤醒特征中的隐含身份

提出质量感知自适应融合(QAAF),利用多模态VA估计学习隐含身份特征,与传统人脸识别互补,降低错误接受率。

04:00
arXiv cs.CV

ASTRA-Net:面向药物诱导睡眠内镜分割的解剖特异性迁移与表示对齐

ASTRA-Net利用虚拟图像特征对齐和少量真实标注实现DISE分割,平均Dice达0.8927。

04:00
arXiv cs.CV

面向数据异构下的隐私保护联邦提示调优:一种子空间分解专家方法

提出FedSEPT,通过子空间分解专家建模和实例感知专家融合,在隐私约束下平衡本地适应与全局泛化。

04:00
arXiv cs.CV

Texture++:利用区域感知扩散模型提升3D资产纹理分辨率

提出Texture++框架,通过多视图渲染与区域感知扩散模型,显著提升3D纹理分辨率与连贯性。

04:00
arXiv cs.CV

基于推理的安全护栏何时效率不高?ResponseGuard:快速视觉-语言实时审核护栏

ResponseGuard无需推理链,单次前向传播检测有害性,速度比推理模型快150倍,性能相当。

04:00
arXiv cs.CV

自适应身份锚定:视频换脸中合成配对监督的闭环关键帧放置

提出闭环反馈放置身份锚点,结合纹理恢复,解决视频换脸的身份漂移和过度平滑问题。

04:00
arXiv cs.CV

SPDCN:基于条带的变形卷积网络用于钢材表面缺陷分割

提出SPDCN,含模糊增强多尺度模块和方向感知变形卷积,高效分割细长缺陷,mIoU达89.60%仅3.54M参数。

04:00
arXiv cs.CV

DAPM:无人机在任意高度、俯仰、滚转和视场角下的单目深度估计

提出DAPM模型,利用几何关系联合估计无人机相机姿态和深度,在UAPD数据集上达到最优性能。

04:00
arXiv cs.CV

GrainGS: 梯度解耦高斯泼溅用于高效动态新视角合成

提出GrainGS框架,结合分层锚点与逐高斯变形,实现高质量实时动态新视角合成,存储紧凑。

04:00
arXiv cs.CV

CLUIE: 聚类感知循环传播与局部结构补偿的水下图像增强

提出CRWKV框架,通过聚类语义重排与暗响应调制,实现内容自适应水下图像增强,显著提升量化指标与视觉质量。

04:00
arXiv cs.CV

未来渲染≠未来表面:超越观察窗口的动态表面重建基准与数据集

提出FutureSurf基准与数据集,评估动态场景未来表面重建,揭示未来渲染与未来表面精度统计解耦,未来误差集中于运动区域。

04:00
arXiv cs.CV

循环正弦隐式神经表示实现高效高保真表示

提出共享正弦块迭代优化隐式表示,实现谐波谱丰富,在图像和3D任务中以更少参数和步骤达到更高保真度。

04:00
arXiv cs.CV

增强自动驾驶全天气自监督深度估计的鲁棒性

提出多教师蒸馏与雷达融合方法,提升恶劣天气下自监督深度估计鲁棒性,达最优性能。

04:00
arXiv cs.CV

弹性TTT:保持先验的测试时调优方法用于视频编辑

提出ElasticTTT框架,通过目标分布正则化、对比CFG和异步噪声调度防止先验坍塌,实现视频编辑最先进性能。

04:00
arXiv cs.CV

通过遮挡识别与条件扩散重建实现鲁棒虹膜识别

提出遮挡识别与扩散重建结合的虹膜识别框架,提升遮挡下性能。

04:00
arXiv cs.CV

SANA-Video 2.0:混合线性注意力与注意力残差实现高效视频生成

混合线性-软注意力与注意力残差设计,单GPU生成720p视频,质量媲美全softmax,速度提升数倍至百倍。

04:00
arXiv cs.CV

UnDA:面向医学影像跨模态知识迁移的无配对域对齐

提出UnDA框架,通过锚点对齐与不确定性加权最优传输,实现无配对跨模态知识迁移,提升医学图像分割精度。

04:00
arXiv cs.CV

通过可微分光传输的场景参数显著性

可微分渲染器生成度量显著性图,通过光传输揭示场景参数对视觉指标的影响,不同指标对应不同显著性。

04:00
arXiv cs.CV

视觉对比自蒸馏

通过图像内容移除构建对比自蒸馏信号,提升多尺寸视觉语言模型性能,无需外部教师。

04:00
arXiv cs.CV

从视频中自监督学习结构化动态

提出SDM模型,通过未来特征预测分离相机与物体运动,结合自监督与弱监督,学习结构化动态表示,性能优于基线。

04:00
arXiv cs.CV

凹版印刷质量控制自动化的合成数据生成框架

针对凹版印刷缺陷图像稀缺,提出合成数据生成框架,生成7533张高保真图像,训练RFDETR模型,真实样本mAP达80.9%,实现零成本快速部署。

04:00
arXiv cs.CV

GraphVid:基于图的交互式可控视频生成

提出图条件视频生成模型GraphVid,利用结构化交互图实现多目标可控生成,性能显著优于传统方法。

04:00
arXiv cs.CV

流式多智能体自回归扩散模型与世界状态寄存器

提出WorldWeaver,利用跨智能体世界状态寄存器增强多智能体视频扩散,提升逻辑一致性与生成质量。

04:00
arXiv cs.CV

通过渐进式种子剪枝实现扩散模型的推理时扩展

提出渐进式种子剪枝(PSP),早期评估多个种子并积极剪枝,固定预算下提升扩散模型生成质量,优于现有方法。

04:00
arXiv cs.CV

具备隐式和显式几何的3D感知视觉语言模型

提出VLM-IE3D框架,利用隐式和显式几何令牌增强3D感知,无需额外3D输入,在多种3D任务中表现优异。

04:00
arXiv cs.CV

PhysCoRe:面向材料感知的可变形动力学的物理校正残差世界模型

PhysCoRe结合物理模拟与残差学习,从视觉推断材料属性并校正动力学偏差,提升预测准确度并引导探索。

04:00
arXiv cs.CV

策略性扩展:通过偏差感知评估与数据收集实现机器人操作的组合泛化学习

提出偏差感知框架量化指令因子偏差,发现颜色主导而动词大小最弱,据此优化数据收集提升组合泛化样本效率。

04:00
arXiv cs.CV

M$^3$-Gen: 利用临床和影像数据的可解释多模态基因表达谱生成

提出M$^3$-Gen框架,融合临床与病理图像生成基因表达,具备内在可解释性。