10911 条条目 · 106 个活跃源
2026年9月2日
04:00
arXiv cs.CV

面向自动化病理诊断与报告生成的视觉语言模型基准评测

构建万余对病理报告数据集及REG2025基准;最佳方法依赖结构化表示与多模态融合,但仍存在数值幻觉和过度诊断。

04:00
arXiv cs.CV

HELIOS:从午夜到正午,连续户外城市场景重光照

提出一种无需配对的重光照方法,利用真实数据与反照率蒸馏,结合太阳角度实现连续昼夜光照,性能领先。

04:00
arXiv cs.CV

超越图像平面:面向多目标跟踪的世界锚定查询

提出PLANET跟踪器,将2D数据提升至3D,用3D几何构建世界锚定查询,辅助位置预测与双分辨率记忆,实现最优性能。

04:00
arXiv cs.CV

ADGNet:用于红外小目标检测的非对称双文本引导网络

针对红外语义不对称,提出非对称双文本提示与双分支交互,分别引导目标与背景特征,抑制噪声和杂波,性能超21种SOTA方法。

04:00
arXiv cs.CV

基于冻结文本到图像扩散模型的免训练跨域修复

冻结文生图扩散模型无需修复训练即可跨域条件修复;通过潜变量反馈与释放调度,性能优于同类免训练基线。

04:00
arXiv cs.CV

On-the-Fly3R:面向大规模无人机场景,基于前馈3R模型的鲁棒在线三维重建

提出免训练的渐进式在线三维重建框架,用检索选图、验证重试及位姿图优化,实现大规模无人机无序影像鲁棒重建。

04:00
arXiv cs.CV

这一时刻能否支撑推荐?面向个性化视频推荐的反事实行为证据检索

提出反事实行为证据检索框架,验证时间定位准确不等于个性化证据可靠,需同时评估“何处”与“是否”。

04:00
arXiv cs.CV

候选扩展路由与置换稳定专家用于混合格式医学VQA

混合格式医学VQA中,候选扩展路由使准确率提升2.78个百分点,并保证开放回答格式有效。

04:00
arXiv cs.CV

ReFlowSET:面向SAR到EO图像翻译的表示对齐潜流匹配

提出ReFlowSET,用潜流匹配框架,经SAR-EO重构审计选码本,训练轻量DiT,引入特征对齐,无需额外推理,达SOTA性能。

04:00
arXiv cs.CV

PredErase:基于预测性潜在引导的无训练对象与效果移除

本方法无需训练,扩展接触带并以预测模型引导填充,去除对象及投影/接触阴影,优于基础模型,但弱于监督式。

04:00
arXiv cs.CV

EvoGS:建模动态高斯泼溅的变形演化

提出EvoGS,将高斯变形视为时间演化,外推历史状态并自适应修正,实现高质量动态新视图合成。

04:00
arXiv cs.CV

基于形态保持和组织病理学真实性约束的半监督虚拟染色

提出半监督框架,以形态保持和病理真实性约束稳定未配对数据,提升染色质量与诊断效果。

04:00
arXiv cs.CV

CQF-HMR:基于连续四元数流的单幅图像概率三维人体网格恢复

提出四元数约束连续归一化流,以二维姿态为条件恢复概率性三维人体网格,在多个基准上达领先水平。

04:00
arXiv cs.CV

CERF:通信高效且免重训练的协同感知

提出基于虚拟模态的协同感知框架,以运动预测补偿延迟,通信开销降低95%且性能相当,无需重训练即可集成异构智能体。

04:00
arXiv cs.CV

ASSERT:模拟存内计算硬件上鲁棒扩散模型的自适应随机采样

扩散模型在模拟CIM硬件上早期去噪更怕噪声,提出ASSERT无训练采样器,先随机后确定,FID降2.58倍/7.68倍。

04:00
arXiv cs.CV

跨场强MRI协调的条件流匹配

条件流匹配用于跨场强脑MRI翻译:三阶段训练,少步求解。单模型覆盖60组合,SSIM0.909,优于基线。

04:00
arXiv cs.CV

低质量人脸识别中的中心对齐表示与局部边界约束

提出统一框架,含局部概率边界、嵌套注意力模块和质量门控协议,兼顾低质识别与高质量泛化,在监控和标准基准上均提升。

04:00
arXiv cs.CV

Fi-ImageNet-1k:源自ImageNet-1k验证集内部的OOD基准

利用ImageNet-1k验证集中被重新标注为无类别的图像,构建了更难的新OOD基准Fi-ImageNet-1k,含655张图,挑战性远超现有数据集。

04:00
arXiv cs.CV

StainPresetNet:用于快速多对多染色归一化的染色预设网络

提出染色预设网络,用预设参考图引导像素级归一化,实现多向染色归一化,精度高且计算量较深度学法降九成。

04:00
arXiv cs.CV

Dyn-3D:揭示并解决视觉语言模型中的自身运动歧义

针对视觉语言模型运动歧义,提出Dyn-3D基准和TempoVista框架,用物理真值优化,缓解运动崩塌,增强3D空间推理。

04:00
arXiv cs.CV

ViTAMINS:利用合成难负样本训练自监督视觉Transformer的实证研究

提出合成难负样本训练自监督视觉变换器,提升表征质量,超越基线且更高效。

04:00
arXiv cs.CV

SinkPruner:面向多模态大语言模型的无汇点视觉标记剪枝

免训练的视觉标记剪枝框架:先滤高范数冗余、缓解注意力汇点,再按文本语义留关键标记,高效推理。

04:00
arXiv cs.CV

P-PatchDiff:用于低光图像增强的渐进式补丁扩散模型

提出渐进式块扩散模型,动态调整块大小并对齐多尺度特征,实现低光图像全局亮度一致与高效增强。

04:00
arXiv cs.CV

不同的变化需不同推理:面向稳健变化描述的变化类型专项专家

提出MEDIC框架,按变化类型分派专家提取视觉线索,生成更精准的描述,效果超越现有方法。

04:00
arXiv cs.CV

IT-TextFusion:退化感知图像融合的迭代文本-图像交互与文本引导残差细化

提出迭代式文本引导图像融合,通过分层交互与残差细化实现退化感知,提升信息保留和感知质量。

04:00
arXiv cs.CV

重新审视同卵双胞胎的人脸识别:Celeb Twins 测试集

为同卵双胞胎识别构建测试集,发现现有深度模型忽视皮肤标记与镜像不对称,拟用生成式人工智能扩充训练数据。

04:00
arXiv cs.CV

HiLRP:迈向视觉Transformer可信解释——基于注意力原语的守恒有效归因

HiLRP将多样化ViT架构分解为四种操作原语,实现守恒归因,是唯一跨窗口、线性注意力等架构保持可靠的方法。

04:00
arXiv cs.CV

S²Prune:面向多模态大语言模型的空间结构化视觉令牌剪枝

提出免训练剪枝法S²Prune,按区域保留覆盖、依拉普拉斯变化分配令牌,用早期表征变化选代表。仅用32个令牌保持79.3%性能。

04:00
arXiv cs.CV

TimeSteer:联合音视频扩散模型中的推理时语音调度

无需微调,通过源区间定位与区域感知重映射,将联合音视频的语音和口型调度到指定时间区间,提升可控性。

04:00
arXiv cs.CV

单目图像深度估计:进展与机遇

综述单目深度估计从早期方法到基础模型的发展,涵盖数据集、判别与生成范式、应用及开放挑战。

04:00
arXiv cs.CV

压缩AI流量:面向分割视觉语言推理的视觉令牌表示标准化神经网络编码

将视觉编码器与语言解码器分离时,中间张量可高度压缩。标准化无训练编解码器可减98%流量,精度仍稳,表明应优化率任务而非率失真。

04:00
arXiv cs.CV

MeRoPE:面向相机可控视频生成的度量旋转位置嵌入

提出度量旋转位置嵌入,保持特征范数,限制注意力对数不随平移尺度增长,实现精确的相机控制。

04:00
arXiv cs.CV

从第一视角视频看见世界与自身

提出RESELF框架,统一重建场景与穿戴者运动,性能优于现有方法。

04:00
arXiv cs.CV

像素文本表示学习的设计基础

四核心设计:变分辨率/字体、自然图文对、布局渲染、两阶段多语;PL-II集成后达SOTA,抗八成压缩。

04:00
arXiv cs.CV

点睛:意图驱动的图像修图智能体,实现视觉焦点增强

提出眼控智能:以点击涂鸦等弱意图增强视觉焦点,结合大模型与扩散执行器,用伪意图图对齐和一致性约束自然修图。

04:00
arXiv cs.CV

一个提示就够了:借助基础图像模型洗白水印

单次重构提示即能让基础图像模型输出的隐形水印失效,效果源于重构路径而非攻击提示词,水印评估应纳入该条件。

04:00
arXiv cs.CV

ExBind:面向视觉到可执行对象对应关系的受控诊断基准

ExBind基准分离视觉定位与执行层,测试模型从视觉指向精确映射到可编辑对象的能力,Qwen3-VL-4B准确率达98.8%。

04:00
arXiv cs.CV

MegaStyle++:通过层级化风格定义扩展图像风格空间

提出层级风格定义,构建含十五万整体风格、一百万细粒度提示、八百万风格图像的数据集,扩展风格空间并精准捕获风格。

04:00
arXiv cs.CV

用于环境高光谱解混的智能体多模态模型

提出大视觉语言模型智能体框架,迭代优化高光谱解混,提升端元与丰度精度,媲美端到端方法。

04:00
arXiv cs.CV

内省一致性:大型视觉-语言模型的事实性保证框架

提出无需训练的框架,利用模型内部信号实现有限样本事实性保证,减少弃权并提升判别力。

04:00
arXiv cs.CV

扩散视觉语言模型中的可靠性挑战

首次系统评估扩散视觉语言模型,发现幻觉、少数族群准确率崩塌及性别/长度偏见等可靠性问题。

04:00
arXiv cs.CV

CMRVision:用于心脏MR图像分析的基础模型

提出心脏MR基础模型CMRVision,基于3600万图像预训练,在分割与分类任务上超越基线。

04:00
arXiv cs.CV

基于3D/2D刚性配准和CT视角优化的燃气轮机叶片几何精确重建

提出多部件3D-2D刚性配准与视角优化,实现燃气轮机叶片亚像素级几何测量。

04:00
arXiv cs.CV

基于尺度的卫星图像主动野火分割方法

针对野火像素稀疏不平衡问题,提出数据驱动尺度分析协议,比较三种分割网络,发现U-Net最稳健,SWIR2波段关键。

04:00
arXiv cs.CV

面向逆问题的基于扩散的未配对数据学习

提出扩散法解决未配对数据逆问题,经弱耦合假设将证据下界解耦为双扩散过程,理论分析误差界,实验验证有效。

04:00
arXiv cs.CV

基于无人机野火分割的多模态RGB-红外组合:FLAME3上的比较研究

热红外信息主导,特征级融合与Transformer架构最佳。

04:00
arXiv cs.CV

CameraEditor:基于视频先验序列建模的相机控制图像编辑

提出相机控制编辑框架,将视角变换重构为时序预测任务,利用视频扩散先验与过渡帧保持内容一致,实现高精度相机控制和源图像身份保持。

04:00
arXiv cs.CV

Pix2Rep-v2:面向密集医学影像应用的高数据效率表示学习

提出密集自监督方法,以像素级冗余削减和等变性实现少样本医学影像表示学习,超越全监督基线。

04:00
arXiv cs.CV

什么、哪里、如何:探测视频基础模型中的时空表征

视频基础模型时空表征:能编码相机运动,异常检测中等,物理推理近随机;特征呈低维轨迹,可几何插值。

04:00
arXiv cs.CV

RadMatch:基于发现级匹配的可审计放射学报告评估

新指标通过发现级匹配与可审计错误计数评估报告质量,临床契合度超越先前最优模型。