10742 条条目 · 106 个活跃源
2026年9月29日
04:00
arXiv cs.CV

SGA-Flow-GRPO:面向Flow-GRPO的空间梯度引导信用分配

提出空间梯度引导的信用分配框架,用奖励梯度构建连续空间信用图,辅以MAD鲁棒归一化,在GenEval上达SOTA对齐质量。

04:00
arXiv cs.CV

RefCompose:基于LoRA条件扩散的多参考图像生成

RefCompose用固定参考画布与双流LoRA解耦布局和外观,实现恒定显存的多参考图像生成。

04:00
arXiv cs.CV

更少词元,更多自教:面向极端视觉词元削减的在线策略自蒸馏

提出LT-OPD:全词元教师对学生自生成轨迹做在线自蒸馏,配预算课程,5%词元下性能升至82.3%。

04:00
arXiv cs.CV

EyeVQA:从识别到空间定位的眼科视觉语言模型基准评测

EyeVQA整合21个眼科数据集,含2万问答、六病七题型,44.5%需跨图推理;14个VLM最佳仅62.8分。

04:00
arXiv cs.CV

Endo-TSR:面向内窥镜重建的外观与运动时域谱建模

提出Endo-TSR,用有界傅里叶颜色残差和平移残差建模时序外观与运动,配Matérn谱先验,内窥镜重建质量最优。

04:00
arXiv cs.CV

基于凸包自适应偏移的骨架动作识别去偏

提出凸包自适应偏移归一化CHASE,减轻骨架实体偏置,提升动作与交互识别性能。

04:00
arXiv cs.CV

面向密集事件视觉的脉冲神经网络片上训练

提出DELL局部学习,面向密集事件视觉,降低脉冲网络训练内存并提升光流与分割性能。

04:00
arXiv cs.CV

StegGNN:面向图像隐写术的图表示学习

提出基于图神经网络的自编码器图像隐写框架StegGNN,将图像建模为图结构,性能与CNN基准相当。

04:00
arXiv cs.CV

CityToolVQA:面向城市低空环境三维空间认知的工具增强视觉问答

几何工具链处理定量问答,零样本适配VLM;准确率67.6%,十个模型提升12.7–36.9个百分点。

04:00
arXiv cs.CV

RefAdapt-DiT:面向参考条件扩散 Transformer 的自适应联合注意力

免训练RefAdapt自适应控制参考-目标联合注意力,超少步生成最高加速3.54倍且画质相当。

04:00
arXiv cs.CV

一种端到端潜空间展开方法:无需 Fréchet 损失,将少步 ImageNet 256×256 生成推进至 FID 1.11

提出先蒸馏后精炼的潜空间端到端 FiST,实现少步 ImageNet-256 生成 FID 1.11,无需 Fréchet 损失。

2026年9月28日
04:00
arXiv cs.CV

ProCAP:面向视觉语言模型的概率交叉注意力提示学习

ProCAP用双向交叉注意力联动视觉与文本提示,高斯参数化加KL/L2正则,配对称InfoNCE对齐,冻结CLIP提升少样本泛化与迁移。

04:00
arXiv cs.CV

MVAgent:通过一致性条件构建与镜头级策略优化实现多智能体视频生成

MVAgent将多镜头视频生成转为条件构建,多智能体协作并优化镜头级策略,提升跨镜头一致性与叙事质量。

04:00
arXiv cs.CV

AlphaEarth 能区分城市,但压缩了城市变异

审计显示AlphaEarth能区分城市、支持跨区域比较,却压缩城市变异,年度层差异未经验证。

04:00
arXiv cs.CV

LiTe-GS:面向3D高斯泼溅的预言机高效下一最佳视角选择

LiTe-GS随机子集评估候选视角,减少信息预言机调用,高效选择下一最佳视角并保持重建质量。

04:00
arXiv cs.CV

什么能提升多模态虚假信息检测?来自大规模实证研究的答案

基于3375余次实验,系统比较预训练视觉语言模型的多模态检测设计选择,提炼指南并回答四个关键问题。

04:00
arXiv cs.CV

CSCWD:面向边缘设备轻量级微小目标检测的跨尺度通道级知识蒸馏

提出CSCWD跨尺度通道蒸馏,将教师P2监督迁移至学生P3,提升边缘轻量模型微小目标检测且不增推理开销。

04:00
arXiv cs.CV

LensDesigner:一种面向光学镜头设计的自我改进智能体

LensDesigner自主智能体,融合镜头库检索与课程自进化,在LensArena基准上显著超越基线。

04:00
arXiv cs.CV

图谱早已内含:从预训练扩散模型中恢复群体模板

无需重训,扩散模型单次推理即可提取内在图谱,跨域适用并能推及亚群。

04:00
arXiv cs.CV

事件的形状:通过跨域蒸馏获得的基于边缘的归纳偏置

事件域向RGB域蒸馏,带来颜色不变性、形状偏置与高频噪声鲁棒性,机制为弱化纹理、强化边缘形状依赖。

04:00
arXiv cs.CV

动作强制:通过恢复底层自运动基在无监督视频上训练世界模型

无需动作标注,用像素位移PCA恢复自运动基,为无监督视频生成可控世界模型训练信号,并评估。

04:00
arXiv cs.CV

StarWM:面向鲁棒世界模型的自监督训练注意力路由

StarWM自监督训练注意力路由决定重建区域,双流解码器隔离目标,动态干扰下性能最优并高保真保留状态

04:00
arXiv cs.CV

MedTokenBudget:面向皮肤镜图像分类的病灶保留Token路由

提出MedTokenBudget有监督Token路由,用病灶掩码与LATS选Top-K,提升皮肤镜分类病灶保留率。

04:00
arXiv cs.CV

面向视觉表征学习的条件预测充分统计量

提出条件预测充分统计量CPSS:用余弦损失预测下一图块嵌入,保留共享因子并丢弃噪声;实验揭示几何特性。

04:00
arXiv cs.CV

EviDETR:为时刻检索与高光检测保留查询相关的时间证据

EviDETR以特征重加权、Top-2专家解码与跨任务融合保留查询相关证据,提升时刻检索与高光检测性能。

04:00
arXiv cs.CV

面向超高分辨率科学图像理解的结构引导掩码自编码器

提出SGMA,用四叉树分词与结构引导掩码处理千兆像素科学图像,多数据集超越MAE,推理提速24.8倍。

04:00
arXiv cs.CV

SAGE:基于频率均衡的源锚定引导,实现分层 RGB-T 对齐与融合

提出SAGE统一框架,融合频率均衡、分层对齐与子带融合,提升弱配准RGB-T对齐与融合性能。

04:00
arXiv cs.CV

结合通用与领域特定前置任务的脑部磁共振图像分割

多任务自监督预训练联合通用图像修复和领域特定脑龄预测,提升多发性硬化、缺血性卒中及皮层分割表现。

04:00
arXiv cs.CV

MM-VeriAgent:借助强化学习学会使用大量工具验证多模态虚假信息

面向混合来源多模态虚假信息,提出MM-VeriAgent,构建专用工具集,以强化学习训练代理调用工具,并用执行缓存提升效率。

04:00
arXiv cs.CV

TrafficImag:面向反事实路侧交通视频生成的基准

首个反事实路侧交通视频生成基准TrafficImag,按四维有效性评估,最佳模型端到端成功率55%。

04:00
arXiv cs.CV

VLALight:面向应急感知交通信号控制的轻量级视觉-语言-动作模型

VLALight轻量端到端视觉-语言-动作模型,直接由路口观测与相位预测动作,应急等待降21.1%。

04:00
arXiv cs.CV

放大你所注视的:文本到图像生成中的目标显著性增强

提出目标显著性增强任务及GazeME框架,用可学习标记token直接提升生成图像中目标物体的视觉显著性。

04:00
arXiv cs.CV

从单目到双目:通过重投影与选择性修补加速双目高斯泼溅

主眼渲染重投影至副眼,缝隙插值,遮蔽区选择性重绘,复用alpha权重省去深度渲染,实现双目加速。

04:00
arXiv cs.CV

基于通用复原先验的偏振图像复原学习

提出双分支一体化偏振复原框架,基于归一化Stokes表示,借通用复原先验与专家混合,并建复合退化基准。

04:00
arXiv cs.CV

面向卷积自编码器的免训练瓶颈宽度规划

MS-SRD无需训练神经网络,即可按NMSE约束估算卷积自编码器瓶颈通道,预测误差低且多数精确。

04:00
arXiv cs.CV

MDSkin-Net:模式分析先验与空间对齐正则化驱动的多任务皮肤病变分析

MDSkin-Net融合模式分析先验与空间对齐正则,提升皮肤病变分割分类的跨队列泛化。

04:00
arXiv cs.CV

Timo:驯服多模态扩散Transformer实现人体运动生成

提出运动学感知多模态扩散Transformer框架Timo,用于人体运动生成,性能显著超越现有方法。

04:00
arXiv cs.CV

少说多"看":面向多模态大语言模型推理分割的潜在推理

LIRSeg以可学习潜在令牌替代显式思维链做推理分割,两阶段训练结合三项信息机制,兼顾精度与效率。

04:00
arXiv cs.CV

动作风格滑块:面向人体动作扩散的端点监督连续风格控制

提出运动风格滑块,以端点监督构造风格方向,用标量强度控制扩散生成,实现平滑单调的连续风格调节。

04:00
arXiv cs.CV

面向跨域小样本学习的查询条件化原型自适应:单查询推理、受控比较与失效模式

WIPT以联合查询-支持变换生成查询专属原型,实现单查询跨域小样本自适应;仅局部提升,收益不普遍,主要改变不确定决策。

04:00
arXiv cs.CV

LLPR:面向单幅图像雨滴去除的位置感知学习与物理重建

提出LLPR框架,融合位置感知学习与物理重建,去除单幅图像雨滴,并发布真实数据集,超越现有方法。

04:00
arXiv cs.CV

UltraG-Bench:评估大型视觉语言模型在超声像素级证据定位上的多任务基准

构建超声像素级证据定位多任务基准,含三类任务,评测14个模型揭示语义与定位差距,并提出改进智能体。

04:00
arXiv cs.CV

ManiVid:统一且可解释的篡改视频取证分析

ManiVid统一可解释视频篡改取证,构建38K数据集与ManiVidLens,检测、定位与解释领先。

04:00
arXiv cs.CV

CCRV-Bench:基于约束的视觉语言模型因果推理评估

提出约束驱动基准CCRV-Bench,四维评估视觉语言模型因果推理,发现约束敏感性因任务与模型而异,单一总分掩盖不同失败。

04:00
arXiv cs.CV

面向渐进式免COLMAP三维高斯泼溅的可靠性调控轨迹优化

可靠性调控轨迹优化框架,以自监督双向循环一致性抑制免COLMAP 3DGS渐进跟踪漂移,提升轨迹与渲染。

04:00
arXiv cs.CV

Spackle:用自适应高斯补全大视角单图新视角合成

Spackle三阶段残差学习缓解容量竞争:预测基础3DGS、定位差区域、学残差高斯,大视角NVS领先。

04:00
arXiv cs.CV

OneWorld:在世界模型中学习跨动作一致的物理规律

提出OneWorld框架,用共享潜在物理机制联合建模多动作未来,提升跨干预物理一致性。

04:00
arXiv cs.CV

MVVBench:面向视觉语言模型的4D推理基准评测

真实多摄像机多视角推理基准,题目单视角或单时刻均不可解,覆盖六类能力,暴露模型时序定位与跨视角身份缺陷。

04:00
arXiv cs.CV

DAPEVO:深度自适应块帧-事件视觉里程计

DAPEVO在共享块位置独立估计图像与事件对应并融合证据,RGB帧稀疏时仍稳健,精度显著优于现有方法

04:00
arXiv cs.CV

IDM-Net:一种用于低光照图像增强的轻量级光照解耦调制网络

IDM-Net用双编码器提取RGB外观与亮度光照先验,经光照引导调制实现亮度与色彩的平衡,轻量高效。