11301 条条目 · 106 个活跃源
2026年7月2日
04:00
arXiv cs.CV

OmniView-Space: 通过多视角空间映射增强空间推理

OmniView-Space框架通过多视角空间映射与认知地图蒸馏,增强多步空间推理,实现SOTA并减少外部依赖。

04:00
arXiv cs.CV

Beyond Pixel Overlap: A Framework for Decomposing Segmentation Evaluation Metrics

04:00
arXiv cs.CV

几何感知跨高度信道知识图谱预测:无人机辅助通信中的不确定性引导三维感知

本文提出几何感知框架,融合场景先验与稀疏观测预测跨高度信道,FPN-Transformer降低RMSE,不确定性引导传感提升主动重建。

04:00
arXiv cs.CV

MG-RWKV:面向时序伪造定位的多粒度上下文感知RWKV

提出MG-RWKV框架,以线性复杂度实现双向时序建模,通过多粒度专家动态路由和跨粒度一致性精准定位伪造片段,在三个数据集上达最优性能。

04:00
arXiv cs.CV

GaussianEmoTalker:基于音频驱动和混合形状的3D高斯泼溅实时情感说话人头合成

提出GaussianEmoTalker,基于3D高斯泼溅和混合形状,通过中性到情感残差变形及注意力模块,实现实时、高保真、可控情感强度的说话人头合成。

04:00
arXiv cs.CV

肺CT中基础模型与影像组学的基准对比:特征提取器、分类头和分割选择

肺CT基准发现:基础模型与影像组学任务依赖,推荐Curia+肿瘤分割+CatBoost头作为安全默认,任务特定选择更优。

04:00
arXiv cs.CV

隐私保护下的仅深度开放词汇三维语义分割:基于不确定性引导的测试时优化

提出UTTO框架,通过不确定性引导测试时优化,无需额外训练,提升仅深度开放词汇3D语义分割的隐私保护性能。

04:00
arXiv cs.CV

斜率引导的Mamba与角度精炼Transformer用于光场超分辨率

提出SMART混合网络,融合斜率Mamba与角度Transformer,实现几何一致的光场超分辨率,PSNR提升0.42dB达SOTA

04:00
arXiv cs.CV

QCA:面向长视频理解的查询与内容感知关键帧选择

提出无需训练的QCA框架,联合建模查询与内容动态分配关键帧,用128帧超越GPT-4o的256帧,达SOTA。

04:00
arXiv cs.CV

AVSR-Diff:尺度无关扩散先验实现时序一致的任意尺度视频超分辨率

提出解耦框架AVSR-Diff,分离潜在去噪与连续渲染,通过TGFR和SAFR模块实现任意尺度高频细节与时间稳定性,超越现有基线。

04:00
arXiv cs.CV

GMO-E$^2$DIT:面向电商图像的基于区域的多操作编辑

提出GMO-E$^2$DIT框架,结合VLM与掩码编辑器,通过反射循环实现多操作电商图像编辑,精确执行并恢复错误,性能超越基线。

04:00
arXiv cs.CV

以最小信息损失直接压缩大规模数据集

CIM框架直接对齐数据分布,最小化信息损失,80分钟蒸馏ImageNet-1K达48.7%准确率,超越SOTA。

04:00
arXiv cs.CV

基于运动的AI生成视频检测中的数据集偏差与捷径学习

运动检测器性能依赖数据偏差,去偏后崩溃;频率方法更稳健。

2026年7月1日
04:00
arXiv cs.CV

GRAPE:用于交互式医学图像诊断的图增强原型解释

GRAPE通过图注意力建模、安全检查和开放词汇锚定,提升F1、捕获错误、支持单图添加新发现。

04:00
arXiv cs.CV

简单监督难以被击败:来自域自适应目标检测中稀疏目标标签的苦涩教训

少量标注下,简单监督损失RTSM显著提升域自适应检测,复杂方法提升有限。

04:00
arXiv cs.CV

GaussLite:在线任务条件式三维高斯泼溅用于实时机器人建图

GaussLite据语言任务动态分配高斯密度,在资源受限硬件上实时建图,ROI PSNR提升2.72dB并支持多任务地图融合。

04:00
arXiv cs.CV

SyncCache:利用非对称动力学实现快速音频驱动的人像动画

提出SyncCache,通过空间非对称探测和模态解耦缓存,实现人像动画近无损加速4.12倍。

04:00
arXiv cs.CV

AVTok:面向整体音视频生成的一维统一标记化

AVTok提出双流transformer统一标记音视频,分层训练解决信息不平衡,实现高效重建与生成。

04:00
arXiv cs.CV

标签模仿游戏:用于零样本伪标签剪枝的图灵测试网络

提出标签模仿游戏框架,用图灵测试网络上下文剪枝伪标签,提升准确率并实现零样本跨任务迁移。

04:00
arXiv cs.CV

基于知识的单图像尺寸估计——面向数字孪生构建的3D资产生成技术

从单目图像分解结构元素,融合设计规则与几何关系估计尺寸,生成匹配真实环境的3D资产,提升数字孪生中车载摄像头验证精度。

04:00
arXiv cs.CV

流式高斯编码用于4D全景占用追踪

提出流式高斯编码器,实现表示级时间连贯性,提升4D全景占用追踪一致性,达到新SOTA。

04:00
arXiv cs.CV

通过潜在场景嵌入揭示轨迹预测中的可迁移性

提出基于潜在场景嵌入的迁移性评估框架,在24个数据集上验证分数与性能强相关,指导数据集选择与预训练。

04:00
arXiv cs.CV

多传感器地面观测的跨模态层级融合

提出AtmoFuseNet,融合多视角图像与雷达数据实现4D云场重建,液态水MAE 0.026,风速MAE 1.18。

04:00
arXiv cs.CV

学习看向何处:用于稳健微型超声前列腺癌检测的强化学习框架

提出Prost-RL框架,结合强化学习与基础模型,生成可解释注意力图,提升微型超声前列腺癌检测鲁棒性,AUROC达79.0。

04:00
arXiv cs.CV

无观测则无适应:面向LiDAR语义分割的观测受限测试时提示微调

提出几何约束测试时提示微调,通过空间感知可靠性加权与局部更新,实现稳定LiDAR语义分割适应。

04:00
arXiv cs.CV

ADAPT:面向忠实多模态大语言模型的注意力动态对齐与偏好调优

ADAPT直接干预交叉注意力,通过注意力对齐与偏好调优降低幻觉率40%-60%。

04:00
arXiv cs.CV

PhotoQuilt: 通过自举分块去噪实现无需训练、任意分辨率的光马赛克

提出PhotoQuilt框架,利用自举分块去噪生成任意分辨率光马赛克,兼顾全局结构与局部真实,无需训练。

04:00
arXiv cs.CV

Auditing Generalization in AI-Generated Video Detection: A Six-Control Protocol and the VidAudit Toolkit

04:00
arXiv cs.CV

稀疏功能标志定位的密集结构先验(用于手术视频)

提出轻量级细化框架,以SAM 3为结构先验,零样本点提示实现手术视频标志定位,无需手动掩码标注,F1达72.4%/58.0%。

04:00
arXiv cs.CV

中文标题:用于多光谱目标检测的双稀疏聚合Transformer

中文摘要:提出DSAFormer,通过空间与通道稀疏注意力减少冗余交互,融合多模态特征,在四个数据集上达到最优检测性能。

04:00
arXiv cs.CV

WarpI2I:用于图像到图像翻译的图像扭曲

提出显著性引导的扭曲-还原框架,改善图像翻译结构保留,无需修改模型架构,计算开销小。

04:00
arXiv cs.CV

TerraDiT-Ω:基于任意地理空间基元的卫星图像合成统一空间控制

TerraDiT-Ω框架利用几何感知注意力,从任意地理基元合成卫星图像,实现统一空间控制,提升下游任务性能。

04:00
arXiv cs.CV

利用预测可微分渲染学习视频动态

提出PDR框架,结合2D高斯表示与可微分渲染器,克服MSE模糊,提升视频预测细节与精度,在多个基准上超越现有方法。

04:00
arXiv cs.CV

基于扩散的材料正则化用于物理逆向渲染

利用扩散模型预测优化正则化,联合重建几何材质光照,生成高保真可重光照资产。

04:00
arXiv cs.CV

AnyMatch:利用大规模单视图图像增强通用多模态图像匹配

提出AnyMatch框架,用单视图图像生成多模态数据,保证3D几何一致性,构建Any-syn数据集,显著提升匹配性能。

04:00
arXiv cs.CV

混合UNet-Transformer模型用于从复合材料几何生成应力应变场

提出混合UNet-Transformer模型,高效预测应力应变场,精度高但稀疏软相网格性能下降。

04:00
arXiv cs.CV

Fleet:少量样本实现高效AI生成图像检测

Fleet框架通过动态少量样本适应,将新型AI图像检测性能从20.4%提升至73.1%。

04:00
arXiv cs.CV

CasaMaestro:用于房屋级三维重建的多视角全景图

CasaMaestro仅需20-50张多视角全景图,直接预测深度与位姿,实现全屋快速三维重建。

04:00
arXiv cs.CV

层级化三维场景图构建与基于信念的语义导航规划

在线构建层级化场景图,基于信念规划进行有限步长估计,实现全局语义导航,长距离场景下成功率提升9.4%。

04:00
arXiv cs.CV

面向灵活、自然、高效的对话式说话人脸生成交互

InterTalk框架实现多参与者实时对话人脸生成,灵活自然,达30 FPS。

04:00
arXiv cs.CV

血管勿损:面向血管图像翻译的结构保持平均流方法

提出结构保持平均流框架,通过拓扑不变传输与正交约束实现血管图像翻译,PSNR分别达24.96dB和24.83dB。

04:00
arXiv cs.CV

Horizon3D:面向自动驾驶远距离3D感知的稀疏雷达-相机融合

提出稀疏雷达-相机融合框架,结合高斯原语实现远距离3D检测,在TruckScenes上NDS提升3.0、mAP提升1.6,达SOTA。

04:00
arXiv cs.CV

锚定现实:突破化妆迁移中的伪目标天花板

提出ART两阶段框架,第二阶段以真实参考为锚点,通过可微循环重建,突破伪目标局限,实现高保真化妆迁移,并发布2K数据集MF2K。

04:00
arXiv cs.CV

WaterGen:水下图像生成中场景与介质的解耦

提出解耦场景与介质的WaterGen方法,生成大规模真实多样水下图像,提升下游任务性能。

04:00
arXiv cs.CV

雅可比化身:从单目视频中重建时间一致性的半刚性化身

利用神经雅可比场和自监督学习,通过约束泊松求解器及正则化,从单目视频重建时间一致、几何可靠的半刚性化身。

04:00
arXiv cs.CV

多视角透视:通过选择性神经元进行参数高效微调以实现一致的放射学报告生成

提出View-PNDF框架,通过选择性神经元实现参数高效微调,提升多视角放射学报告生成的一致性与质量。

04:00
arXiv cs.CV

SkillSpotter:第一人称-第三人称视频中基于姿态感知的多视角熟练动作检测与评分

SkillSpotter通过姿态感知多视角架构,将熟练动作检测与评分mAP提升76%,平衡准确率达60.40%。

04:00
arXiv cs.CV

PiLoT v2:面向自由视角无人机地理定位的像素到正射地图对齐

PiLoT v2用正射地图替代3D渲染,实现轻量级无人机定位,性能相当但存储计算成本大幅降低。

04:00
arXiv cs.CV

WildProp:大规模野生动物身体比例的视觉估计

WildProp无需训练,通过检索与匹配从网络图像估计野生动物体型比例,中位误差10-20%,适用于多物种。

04:00
arXiv cs.CV

TaxoMIL:面向层次化全切片图像分析的分类约束学习

TaxoMIL将全切片诊断重构为多粒度文本生成,通过分类约束实现层次化准确预测。