10732 条条目 · 106 个活跃源
2026年9月30日
04:00
arXiv cs.CV

S2T-Unet:一种面向跨模态MRI转换的结构到风格框架

提出S2T-Unet,分离模态不变结构与风格,量化编码结构并转换风格,IXI实验达或超SOTA。

04:00
arXiv cs.CV

DiffReID:面向目标重识别的判别式扩散模型

提出判别式扩散模型DiffReID,结合CLIP提示调优与视觉引导去噪,学习身份感知分布并生成身份不变特征,五个重识别基准超越多数SOTA方法。

04:00
arXiv cs.CV

SafeVantage:面向可靠具身决策的视角感知记忆

视角感知记忆与主动采集框架,记录支持视角,预测可见性指导选视,校准输出是/否/弃权,提升决策可靠性。

04:00
arXiv cs.CV

用于跨被试EEG到图像检索的结构化视觉目标学习

提出结构化视觉目标学习与免训练细化,提升跨被试EEG到图像检索,Top-1达48.1%。

04:00
arXiv cs.CV

Seg3DParts:基于分割的可控部件级三维生成

将分割作为显式锚定信号,结合跨部件全局交互,从单图直接生成对齐的部件网格,并发布20万物体、百万部件的大规模数据集。

04:00
arXiv cs.CV

表征动态揭示多模态大语言模型视觉 Token 剪枝的语义显著性与相似性

视觉token表征动态揭示语义显著性与相似性;据此提出免训练剪枝MSDG-Prune,大幅压缩视觉token并提速。

04:00
arXiv cs.CV

WeLike2Party!面向多人图像动画的上下文动作迁移

提出免显式姿态的多人动画框架,以参考非对称RoPE与身份绑定监督实现上下文动作迁移,构建MotionTwin数据集与基准。

04:00
arXiv cs.CV

SFE-VGGT:面向事件相机单目深度估计的无源VGGT蒸馏

无源SFE-VGGT用事件重建代理帧蒸馏VGGT几何先验,可靠性加权,无需配对RGB,夜间误差降15%。

04:00
arXiv cs.CV

DispFlow-GS:面向单目可变形三维高斯泼溅的位移流监督与运动解耦

提出位移流监督与运动解耦框架,缓解高斯流与光流域差异,并引入形变-渲染一致性指标,显著提升运动定位与一致性。

04:00
arXiv cs.CV

先验驱动的3D高斯泼溅增强:法线与深度正则化

提出融合表面法线与稠密深度先验的3DGS优化方法,提升几何精度与视觉质量,在复杂场景中表现稳健。

04:00
arXiv cs.CV

超越可读性:评估任务信息可恢复性

可读性≠任务信息可恢复性;提出显式评估框架比较恢复路径,图书封面实验显示实体链接恢复可超越直接视觉读取。

04:00
arXiv cs.CV

World2Motion:将视频世界模型转化为三维人体动作生成器

将视频世界模型改造为单阶段3D人体动作生成器,构建混合数据并提出偏移解耦噪声调度,推理提速约3.3倍。

04:00
arXiv cs.CV

视觉并行搜索:通过并行瓦片检查与自适应缩放学习搜索高分辨率图像

提出VPS视觉并行搜索框架,主智能体并行检查图像瓦片并自适应缩放,提升高分辨率视觉问答,且可训练。

04:00
arXiv cs.CV

VesselBench-800K:面向多模态船舶检测、计数与密度估计的大规模感知基准

迄今最大全球多模态船舶感知基准,含80万张512×512光学/SAR图像,支持检测、计数与密度估计。

04:00
arXiv cs.CV

Back2Struct:让结构化图像重新可编辑

从图像恢复可编辑 SVG/XML 代码,让图表等结构化图像可编辑并保持视觉保真。

04:00
arXiv cs.CV

Salt++:面向少步流式多模态生成的上下文对齐后训练

Salt++以因果自流与上下文对齐自回归DMD两阶段后训练,实现4步流式音视频生成,视觉与运动质量大幅领先。

04:00
arXiv cs.CV

UltraMatch:面向超快与内存高效图像匹配的传输路径路由

UltraMatch以路由少量候选路径替代稠密token匹配,大幅提速省内存,单卡支持6K分辨率推理。

04:00
arXiv cs.CV

面向星上数据缩减的嵌入式双时相建筑损毁评估

基于YOLOX孪生检测器,压缩上行参考并在星上比对,仅下行目标级损毁结果,抗配准误差,嵌入平台验证。

04:00
arXiv cs.CV

面向高效视频生成的参数化条纹注意力

提出参数化条纹注意力PSA,统一刻画视频DiT的周期对角条纹,单内核生成稀疏掩码,提速1.57倍。

04:00
arXiv cs.CV

面向业务化哨兵-2小麦面积估算中地面真值标签噪声消解的双轨数据整理与分类框架

用13期哨兵-2 NDVI与849样本,XGBoost最优;预测面积较官方仅高2.99%,优于空间掩膜25.11%,提出双轨整理分类框架。

04:00
arXiv cs.CV

RBF-GNN:面向伪坐标图卷积的有理基函数

提出RBF-GNN,用有理Padé基函数替代随维度指数增长的B样条,提升关键点匹配等任务性能。

04:00
arXiv cs.CV

MotionInsight:诊断生成视频中的物体运动缺陷

提出VidMotion数据集与MotionInsight评估器,实现物体运动缺陷的三维诊断。

04:00
arXiv cs.CV

NHO:一种用于基于锚点的区域定位与稠密对应的神经哈密顿算子

NHO用稀疏锚点和内蕴几何学习神经哈密顿算子,以局域特征空间互惠细化,实现区域定位与稠密对应,抗缩放旋转。

04:00
arXiv cs.CV

OmniRoute:将时序语义证据映射至音视频令牌预算,实现高效全模态大语言模型

提出免训练两阶段压缩框架OmniRoute,按时序语义证据分配音视频令牌预算,兼顾效率与性能。

04:00
arXiv cs.CV

Real2Gym:从视频构建仿真训练场,让机器人获得技能

提出Real2Gym,将视频演示转为交互仿真训练场,习得技能迁移至真机,真机成功率超GPT-6 Astra 33.3%。

04:00
arXiv cs.CV

无承诺的上下文:非刚性变形下的鲁棒稠密对应

CoCo-Reg以区域块丰富稠密点特征却不限制最终点级搜索,非刚性配准对应误差降低72.6%。

04:00
arXiv cs.CV

Spatial-OPSD:通过无标签自蒸馏实现自我改进的空间推理

无标签自蒸馏,用深度与三维先验由教师对学生轨迹做词元级监督,逐轮递归训练实现多轮自提升并达开源前沿。

04:00
arXiv cs.CV

GleanVID:面向高效视频大语言模型的互补Token选择

GleanVID是免训练的视频大模型推理加速框架,按时间新颖度分配预算并联合代表性与互补性选Token,25%Token保留98.6%性能。

04:00
arXiv cs.CV

UniBuild: Unified Building Mapping From Multi-Source Optical Remote Sensing Imagery With Detail Decoding and Geometry Regularization

04:00
arXiv cs.CV

LDM-is-AE:潜在扩散模型是用于端到端图像生成的自编码器

提出LDM-is-AE,将潜在扩散模型自身视为自编码器,端到端联合学习潜表示与去噪,无需独立分词器,FID达1.80/1.90。

04:00
arXiv cs.CV

盲区中的速度:自动驾驶视觉语言模型动态感知的可解释性分析

VLM车速理解存盲区:潜表征可解码却难表达,时序利用弱,专用模型仍有差距;规划合理≠状态可靠。

04:00
arXiv cs.CV

NRF-GS:面向高表达力与紧凑高斯泼溅的神经残差场

以共享全局神经残差场替代逐高斯球谐,增强视角相关反射建模,高斯数量减少50%仍保持或提升渲染质量。

04:00
arXiv cs.CV

无模态误导的端到端自监督RGB-T跟踪

ESMTrack:端到端自监督RGB-T跟踪,免伪标签与密集标注,缓解模态主导,五基准领先且实时。

04:00
arXiv cs.CV

MSTypography:通过平衡词语可读性与物体可识别性实现多字符语义排版

提出全局到局部的多字符语义排版框架,兼顾字形可读性与物体可识别性,在五种语言上超越SOTA。

04:00
arXiv cs.CV

面向设备-边缘多模态推理的基于残差向量量化的任务导向视觉特征压缩

提出Q-TOFC,用残差向量量化压缩视觉特征,融合查询相关聚合与量化误差补偿;负载较TOFC降53.6%,性能相当,时延更低。

04:00
arXiv cs.CV

改进的分布扩散模型

将粒子扩展推迟至后层并引入时间相关评分规则调度,使分布扩散模型少步生成质量优异且不随采样步数退化。

04:00
arXiv cs.CV

为何多模态大模型难以计数:以ConvStack突破个体化与聚合瓶颈

揭示MLLM计数受分块个体化与聚合压缩双瓶颈制约,提出ConvStack注入局部结构提升密集计数。

04:00
arXiv cs.CV

基于指令分解的多粒度语言引导模仿学习

提出指令分解的多粒度语言引导模仿学习,将整体任务描述拆解为细粒度子任务指令,提升学习效率与性能。

04:00
arXiv cs.CV

TaoFlowForge:基于级联流匹配的渐进式原生网格生成

基于级联流匹配将网格生成分解为顶点与连接预测,两阶段粗到细,图像条件下达开源拓扑生成SOTA。

04:00
arXiv cs.CV

Waypoint-1.5:面向消费级硬件的实时视频世界模型

Waypoint 1.5 是可实时运行于消费级硬件、响应键鼠操控的交互式视频扩散世界模型。

04:00
arXiv cs.CV

EviViT:面向细粒度感知的证据自适应视觉Transformer

EviViT借视觉搜索轨迹预测证据密度,引导区域重读与token分配,冻结主干通用,提升细粒度精度。

2026年9月29日
04:00
arXiv cs.CV

不平衡SAR船舶分类中的跨数据集迁移与未知类检测

六模型在两SAR船舶数据集上评估域内、跨集迁移与未知类检测;跨集泛化差,任务不确定性常优于MC-dropout方差。

04:00
arXiv cs.CV

PalmLeaf-VQA:面向多地区历史贝叶手稿理解的多文种视觉问答基准

多文种贝叶手稿视觉问答基准,覆盖南亚东南亚八类藏品;最强多模态模型准确率仅58%,罕见文字与退化版面理解仍难。

04:00
arXiv cs.CV

一步最优:无条件整流流是 Noise2Noise 去噪器,多步积分可证明有害——低剂量 CT 的基准与基于任务的可检测性研究

无标签去噪单步流最优,多步积分偏离MMSE降保真,配对关键;低剂量CT中PSNR升但病灶可测性反降。

04:00
arXiv cs.CV

一次评估,任意工作点:超网络摊销MeanFlow用于3D MRI重建

超网络将采样模式等运行点映射至单步MeanFlow,一次评估重建3D MRI,学习采样掩膜增益显著,支持自监督。

04:00
arXiv cs.CV

视频扩散训练中时间注意力头的专门化

逐头普查视频扩散训练:整体集中度不升,仅少数头专门化,结构见于首个时间块,注意力呈自帧与邻帧局部路由。

04:00
arXiv cs.CV

Enhancing Foundation Models for Imbalanced SAR Ship Classification via Targeted Oversampling

04:00
arXiv cs.CV

ForensicZoom:基于多模态大语言模型的自适应视觉检查,实现工业级人脸伪造检测

提出自适应视觉检查框架,模型可自主放大可疑区域进行多轮取证推理,工业级检测TPR超97%且可解释。

04:00
arXiv cs.CV

面向长视频理解的查询对齐视频帧选择

面向多项选择题,将答案选项作为语义线索扩展查询,按问题-答案对的余弦相似度评分选帧,同等帧预算下优于均匀采样。

04:00
arXiv cs.CV

稳步学习:累积相对点间隔分数用于人脸图像质量评估

提出CARPM-FIQA,累积训练全程相对点间隔分数,稳定人脸图像质量评估,提升判别与排序稳定性。