11151 条条目 · 106 个活跃源
2026年7月27日
04:00
arXiv cs.CV

RadSight:迈向感知可靠的多模态放射影像理解

RadSight提出感知驱动模型,双编码器四阶段学习,在百万级基准六维度超越现有模型,证实低层视觉感知是可靠临床诊断关键。

04:00
arXiv cs.CV

几何2D场景图生成

提出基于Faster R-CNN和注意力图卷积网络的方法,不依赖语义数据,在小数据集上生成装配场景图。

04:00
arXiv cs.CV

SiPhy:单图像物理属性推理

SiPhy框架从单张RGB图像推理物理属性,结合视觉与语言知识,性能超越多视图方法,可用于物理理解数据标注。

04:00
arXiv cs.CV

通过强化数据选择的主动少样本分割

提出强化学习框架优化支持集选择,实现少样本医学图像分割的联合优化,提升分割性能。

04:00
arXiv cs.CV

IR275K:面向高效遥感的多帧红外超分辨率基准

提出红外多帧超分基准IR275K(594视频/27.5万帧),轻量模型CGMamba达33.19dB PSNR,证实2D旋转位置编码的关键作用。

04:00
arXiv cs.CV

时间反演成像:重建过去人类-环境交互的多模态基准与框架

提出时间反演成像,从热、紫外、可见光谱衰退痕迹重建过去交互,构建TRACE-HEI数据集,用多模态扩散模型方法验证可行性。

04:00
arXiv cs.CV

可变形三角形喷射:用于实时辐射场渲染的灵活基元

提出可变形三角形,用边缘控制点实现非凸形状表示,可微分渲染,性能优于现有方法。

04:00
arXiv cs.CV

扩散模型的感知相关性与保持高斯性的鲁棒潜在角度水印方法

提出LAW方法,将水印编码为潜在对的反点角度,保持高斯性并实现鲁棒嵌入。

04:00
arXiv cs.CV

Twins: 用焦点损失学习预测统一表示

Twins通过通道级联ViT和VAE特征形成统一连续token空间,并用焦点回归克服优化不平衡,显著提升生成质量。

04:00
arXiv cs.CV

CARA:面向可解释碰撞预测的概念感知风险注意力

CARA利用事故叙事提取风险概念,通过视觉语言对齐形成动态轨迹,实现可解释碰撞预测,提升准确性与预警及时性。

04:00
arXiv cs.CV

最优传输图像表示与深度协方差对齐(CORAL)用于控制阀粘滞检测

结合最优传输成像与深度协方差对齐,解决域偏移,在20个工业环上准确率90%、F1分数92.86%。

04:00
arXiv cs.CV

SM4RT:学习4D重建的结构化运动几何

SM4RT将场景运动分解为SE(3)运动基,通过稀疏权重恢复稠密运动,实现端到端4D重建与结构化运动感知。

04:00
arXiv cs.CV

Hash-QNeRF:量子神经辐射场的多分辨率哈希编码

用多分辨率哈希编码替代正弦编码,提升QNeRF的效率与噪声鲁棒性。

04:00
arXiv cs.CV

用于头颈癌三维CT到PET合成的热点引导融合双路径框架

提出双路径框架从CT合成PET,回归U-Net与条件GAN结合,热点引导融合,精度高但高代谢区SUV低估。

04:00
arXiv cs.CV

用像素表示程序?——跨提供商对源代码文本与图像输入令牌计费的案例研究

将源代码渲染为图像可减少75-86%输入token,但不同API计费差异大,尤其Gemini小代码下反而更高。

04:00
arXiv cs.CV

提升谱:测量到空间的自适应性如何塑造无图像单像素感知的鲁棒性

重新定义映射(lift)为设计轴,提出STSF+TPLS方法,低采样鲁棒且抗噪,超越重构-分割基线。

04:00
arXiv cs.CV

通过机器人渲染的机器人因子世界模型

提出机器人因子世界模型,将动作实现与机器人渲染外化,利用名义轨迹和渲染几何提升泛化性与视频生成能力。

04:00
arXiv cs.CV

TDiR:基于Transformer的扩散模型用于图像恢复任务

提出TDiR扩散模型,结合Transformer,在图像恢复任务中超越18种现有方法。

04:00
arXiv cs.CV

RAD:面向机器人观测的真实异常检测数据集与基准

RAD是机器人采集的多视角异常检测基准,揭示2D/3D方法在真实场景下的性能差距与挑战。

04:00
arXiv cs.CV

高质量文本,稳健视觉:语言在增强视觉-语言模型视觉鲁棒性中的作用

QT-AFT利用高质量文本引导对抗训练,增强视觉鲁棒性,克服过拟合与语义缺失,实现最优零样本鲁棒性与准确率。

04:00
arXiv cs.CV

正确着色:弥合感知色彩空间与文本嵌入,提升扩散生成

提出无训练框架,利用LLM消除颜色歧义,基于CIELAB空间调整文本嵌入,提升色彩准确性。

04:00
arXiv cs.CV

提升大型视觉语言模型对流场数据的理解

提出FieldLVLM框架,通过场感知语言生成与数据压缩调优,显著提升对流场数据的理解性能,开拓科学领域应用。

04:00
arXiv cs.CV

CARE:基于通道感知区域解缠的超声图像抗纠缠分割

提出CARE框架,通过逐步分离病变证据与干扰上下文,纠正误导激活,提升超声分割精度。

04:00
arXiv cs.CV

隐藏人脸于众目睽睽之下:干扰人脸检测以防御深度伪造

提出通过对抗扰动破坏人脸检测器的防御方法,高效阻碍DeepFake换脸视频生成。

04:00
arXiv cs.CV

取证适配器:释放CLIP实现可泛化人脸伪造检测

提出Forensics Adapter适配器,使CLIP高效检测人脸伪造,仅5.7M参数性能优异;扩展版通过文本模态再提升1.3%。

04:00
arXiv cs.CV

几何引导的表示用于驾驶场景中车道与交通拓扑的连贯推理

提出CoPo框架,通过几何引导的关系建模实现感知与推理联合优化,在OpenLane-V2上取得新SOTA。

04:00
arXiv cs.CV

深入挖掘视频VAE的潜在谱偏置以提升扩散性能

通过谱分析设计正则化,SSVAE实现视频生成3倍加速和10%奖励提升。

04:00
arXiv cs.CV

DeepUrban:基于航拍图像的自动驾驶交互感知轨迹预测与规划

DeepUrban无人机数据集提升稠密交通场景下轨迹预测与规划,在nuScenes上ADE/FDE指标分别提升44.1%/44.3%。

04:00
arXiv cs.CV

SRC-Flow:紧凑语义表示赋能归一化流图像生成

SRC-Flow通过语义表示压缩器降低归一化流建模负担,在ImageNet上取得最优生成质量。

04:00
arXiv cs.CV

面向局部高性能视觉地点识别的自动地图密度选择

提出自动地图密度选择方法,通过参考遍历满足局部召回率与覆盖率要求,避免过度密集地图。

04:00
arXiv cs.CV

DM3D:通过偏移引导特征重采样的动态Mamba用于点云理解

DM3D通过偏移引导特征重采样和3D距离调制状态更新,动态适应局部上下文,实现点云理解领先性能。

04:00
arXiv cs.CV

3D幻象:探秘与驯服3D幻觉

提出3D-Mirage基准、二阶评分和自蒸馏方法,评估并修正单目深度模型的3D幻觉风险。

04:00
arXiv cs.CV

Atlas 2 —— 面向临床部署的基础模型

Atlas 2等模型在80个基准测试中表现最优,用550万张病理图像训练,实现高性能与稳健性。

04:00
arXiv cs.CV

预训练域在设定差分隐私医学图像分析的隐私-效用权衡中胜过训练目标

预训练域决定隐私-效用权衡,域内监督预训练优于ImageNet且域效应超目标效应2-3倍。

04:00
arXiv cs.CV

基于能量的组织流形用于纵向多参数MRI分析

提出基于能量流形的几何框架,无需分割即可纵向评估多参数MRI,以基线能量函数追踪组织变化。

04:00
arXiv cs.CV

PixDLM: 一种用于无人机推理分割的双路径多模态语言模型

定义无人机推理分割三维语义需求,构建含1万张航拍图像与思维链QA的DRSeg数据集,提出PixDLM基线模型。

04:00
arXiv cs.CV

基于大语言模型的视觉解释评估框架:用于评估面部皮肤疾病分类模型的可解释性

提出基于LLM的视觉解释评估框架,结合病变聚焦注意力图与多个LLM评判,评估皮肤疾病分类的可解释性。

04:00
arXiv cs.CV

自梯度强制:原生长视频外推

SGF通过两遍训练恢复历史上下文梯度监督,提升长视频外推的一致性,仅需5秒窗口即可生成数分钟视频。

04:00
arXiv cs.CV

OpenNavMap:基于外观的多会话拓扑度量地图构建,用于可扩展的视觉导航

提出轻量无地标拓扑度量地图系统,动态规划匹配与几何模型结合,多会话融合,精度0.62米,完成12项导航任务。

04:00
arXiv cs.CV

NWaaS:一种非侵入式且保护隐私的水印即服务系统与自适应资源调度

提出NWaaS框架,内含零性能降的非侵入式水印ShadowMark及自适应调度,实现鲁棒所有权验证和隐私保护。

04:00
arXiv cs.CV

基于大语言模型的医学图像无损压缩与隐写联合方法

提出联合框架,用自适应分解和分段隐写,实现高压缩比、效率与安全性。

04:00
arXiv cs.CV

基于扩散模型的潜在插值学习用于心脏体积重建

CaLID框架利用扩散模型在潜在空间插值,高效高质量重建心脏体积,仅需稀疏2D图像。

04:00
arXiv cs.CV

CorVS+:面向仓库中身份感知人员定位的视频轨迹与传感器对应驱动关联方法

基于深度学习关联视频轨迹与传感器测量,提出CorVS+框架,实现仓库工人身份感知定位,效果优于现有方法。

04:00
arXiv cs.CV

GeoDiff-SAR:几何先验引导的扩散模型用于SAR图像生成

用3D几何先验引导扩散模型,从稀疏角度生成SAR图像,显著提升结构相似度和方位一致性。