10901 条条目 · 106 个活跃源
2026年9月3日
04:00
arXiv cs.CV

Doppio:用于下落颗粒非接触式重量估计的数据集

提出下落颗粒视频数据集,记录咖啡粉逐帧重量真值,用深度学习准确估计累计重量,实现非接触测量。

04:00
arXiv cs.CV

基于几何潜在扩散的空间感知世界动作模型

提出SA-WAM,用预训练视频模型联合预测动作、RGB与深度,实现3D感知世界建模,在RoboCasa等基准及真实机器人上达最优,并提升预测。

04:00
arXiv cs.CV

RGB到红外图像转换用于未见无人机域中的红外车辆检测

生成式RGB转红外可缓解红外数据稀缺,ControlNet扩散模型最优,在Kust4K和VTUAV上mAP显著提升。

04:00
arXiv cs.CV

面向3D目标检测的立体4D雷达:融合几何对齐与绝对速度估计

立体4D雷达检测法,利用几何视差估计绝对速度并融合特征,缓解数据稀疏,AP3D提升8.82点。

04:00
arXiv cs.CV

AI眼里出美人:多模态大语言模型系统性高估面部吸引力

多模态大语言模型系统性高估面部吸引力:评分偏高、区间较窄;虽与人类排序相关,却不能复现人类绝对评分。

04:00
arXiv cs.CV

SR-Edit:基于自精化的区域感知图像编辑

SR-Edit通过迭代自精化从模型自身预测提取区域划分保持原采样动态并保留非编辑区提高质量

04:00
arXiv cs.CV

基于自训练与肿瘤感知形变的可泛化脑肿瘤分割

结合自训练与肿瘤感知形变增强的脑肿瘤分割方法,在异质性数据上超越仅用标注的基线。

04:00
arXiv cs.CV

面向多模态大语言模型评估的深度交错图文上下文

提出新的TIC-Bench基准,评估多模态模型在深度交错图文中的逻辑、时空关联能力,发现与人类差距明显。

04:00
arXiv cs.CV

从检测到定位:面向全合成与篡改图像的统一取证框架

提出统一多分类取证框架,区分真实、全生成与篡改图像,并利用分割分支实现像素级篡改定位,优于现有方法。

04:00
arXiv cs.CV

AffectDelta:超越情感标签的图像编辑

提出情感增量模型,将图像编辑视为八维情感分布间的带符号迁移,利用近二十五万样本训练,增强情感对齐与内容保持。

04:00
arXiv cs.CV

学习吸引与排斥:人脸识别的双质量边际学习(DQM-Face)

提出双质量边际学习框架,融合幅度与语义质量,以吸引排斥双向边际增强类内紧凑和类间分离,超越现有方法。

04:00
arXiv cs.CV

4D高斯表示中复杂对象分割的查询重写

提出无训练查询重写策略,将冗长描述转为关键词形式,显著提升4D场景分割性能,时间准确率升至92.21%,vIoU升至76.94%。

04:00
arXiv cs.CV

基于证据解耦刻画医学视觉-语言分割中的文本分支敏感性

提出证据解耦解码器分析模态交互,发现文本敏感性因数据集而异,主要提供全局语义调制而非空间定位。

04:00
arXiv cs.CV

层级卫星图像合成生成引擎Genesis

地球观测本质多尺度,现有模型无法生成跨尺度空间一致的完整金字塔。提出Genesis,结合超分与扩展算子,从稀疏种子生成无缝多分辨率地图。

04:00
arXiv cs.CV

物理驱动的独立样本对生成用于迭代自监督低剂量CT去噪

提出物理驱动的跨域迭代自监督低剂量CT去噪,分离泊松-高斯噪声并生成独立训练对,迭代细化,效果优于自监督基线。

04:00
arXiv cs.CV

GaLe:内存高效的全局近似与局部精确特征

将特征图分为局部精确与全局近似,无需重训练即可在边缘设备匹配精确推理精度,较补丁法提速65%、内存降低90%。

04:00
arXiv cs.CV

利用因果解释生成医学图像反事实样本

提出无需生成模型的医学图像反事实框架,直接从分类器提取因果证据,实现确定性、可控制的编辑,更贴近原图。

04:00
arXiv cs.CV

GDB-Reward:从评估指标到图形设计训练奖励

提出GDB-Reward框架,将多种图形设计评估指标转化为统一强化学习奖励,在不微调生成模型的情况下显著提升设计规范符合度。

04:00
arXiv cs.CV

单帧广播画面中米制尺度运动员定位的自顶向下框架

提出自顶向下框架,结合边界感知自适应分块与双关键点估计,实现单帧广播画面运动员米制定位,精度提升两成以上。

04:00
arXiv cs.CV

MV-dVRK:面向空间手术感知的多视角基准

首个结合同步立体视角与精确几何的离体手术数据集,多视点优化重建覆盖率67%,优于前馈模型的43%。

04:00
arXiv cs.CV

流匹配中频率与像素的平衡

提出频域对数损失,平衡频率与像素监督,加速流匹配收敛并提升FID与感知质量。

04:00
arXiv cs.CV

RVSD:检索视觉稀疏解码以缓解大型视觉语言模型中的视觉幻觉

提出RVSD免训练解码框架,统一token稀疏化与语义视觉检索,有效缓解视觉幻觉并保持最优性能。

04:00
arXiv cs.CV

挑战性条件下的基于视频的手掌静脉认证

首个公共视频掌静脉数据集CUP,测试21种识别器,脏污使错误率倍增;提出时序聚合与区域最优传输匹配,显著提升鲁棒性并降低计算开销。

04:00
arXiv cs.CV

AutoCompass:通过弱标签学习实现公共地图上的精准视觉定位

提出弱监督训练法:无需航向标签,融合绝对与相对位姿,在公共地图上实现精准视觉定位。

04:00
arXiv cs.CV

人脸伪造中的多工具图像编辑溯源

提出多工具图像编辑溯源,构建50万张人脸编辑数据集,设计DPEC法,融合空间与频域痕迹,优于9种方法。

04:00
arXiv cs.CV

InceptionGS:非结构化视角采样下的大规模高斯泼溅生成式自举

提出一种自举方法,融合重建与生成,以自适应生成先验修复视图稀缺区域,实现非结构化采样下大场景高斯泼溅。

04:00
arXiv cs.CV

图像信号处理器中RAW与RGB复原的基准评测

现代相机经ISP转换RAW为sRGB。盲复原在ISP前后不同:RAW域策略优于通用RGB模型,但ISP感知的RGB模型整体最佳,性能取决于模型与成像管线对齐。

04:00
arXiv cs.CV

基于频谱协调的高效全能天气恢复

提出轻量级一体化恢复法FReSH-IR,频谱分解高低频并用傅里叶跳跃连接,以80%更少参数达同等质量。

04:00
arXiv cs.CV

基于广义内容/风格先验的数据高效多对比度MRI重建网络

提出模块化框架,以内容风格先验为核心,用无配对图像预训练,将重建转为轻量精修,少量数据即超越全监督。

04:00
arXiv cs.CV

SolarWM:面向长时程视频世界模型的开源数据与可扩展训练框架

推出SolarWM开源框架,统一10个数据集143万片段,适配多种视频模型,仅用5秒序列训练即可实现分钟级实时交互,为世界模型研究提供可复现基座。

04:00
arXiv cs.CV

RoGe:端到端隐式重建与生成的新视角合成

RoGe联合重建与视频扩散,以隐式射线特征替代显式3D桥接,使稀疏输入合成时序连续视频,在DL3DV最优。

04:00
arXiv cs.CV

用图像思考:推理驱动图像生成的系统化基准

提出RIG-BENCH基准,评估推理驱动图像生成,覆盖四类认知任务,发现模型存在推理-生成差距,常输出局部合理但全局不合逻辑的结果。

04:00
arXiv cs.CV

MuyBridge:基于稀疏融合的单目视频移动端人体质心估计

用手机单目视频融合二维姿态与稀疏深度估计运动员质心,免三维标注,垂直误差33-41毫米,支持63帧/秒实时处理。

04:00
arXiv cs.CV

PlantC2USeg:面向少样本统一植物点云分割的跨尺度一致预训练

提出PlantC2USeg跨尺度一致预训练与信息受限解码,少样本植物点云分割跨域最优,降低适配成本。

04:00
arXiv cs.CV

针对学习型轨迹评分设计通用训练样本

通过扰动人类轨迹生成更有区分度的正负样本,训练轨迹评分器,在两种生成式规划器上EPDMS分别提升0.4和0.3。

04:00
arXiv cs.CV

使用两阶段检测与生态型分类级联的高效虎鲸被动声学监测

提出轻量级两阶段级联进行虎鲸发声检测与五生态型分类提升罕见类性能主动学习适应新环境实现实时监测

2026年9月2日
04:00
arXiv cs.CV

面向总缩放梯度变分模型的锥约束双线性分解

提出锥约束双线性分解求解TSGV模型,采用交替最小化保收敛,在去噪和NLOS成像中性能优越。

04:00
arXiv cs.CV

StreamScout:学习何时深入检索以实现流式视频理解

StreamScout:提出自适应推理框架,渐进增强视觉证据,以蒸馏和强化学习优化停止策略,降低推理成本,提升流式视频理解。

04:00
arXiv cs.CV

分布式隐式危害:多模态大语言模型视频审核中的组合性安全盲点

良性组件组合可产生隐式危害,多模态大模型有组合盲区;合成九千视频评测,检测显著失效,真实场景亦同。

04:00
arXiv cs.CV

ZimaBlue:通过可扩展视频预训练演化通用世界动作模型

提出ZimaBlue框架,借大规模视频预训练三阶段训练,零样本成功率从36.1%提升至77.8%。

04:00
arXiv cs.CV

Qwen-Drive-1.0:迈向自动驾驶视觉语言基础模型的初步探索

提出自动驾驶视觉语言基础模型,统一三维感知、问答与规划,BEV头与规划专家提升驾驶性能,保持通用能力。

04:00
arXiv cs.CV

流匹配的拉格朗日视角

用拉格朗日视角推导流匹配:目标身份守恒导出拟线性PDE,特征线法得直线轨迹,曲率源自去噪器雅可比。

04:00
arXiv cs.CV

CoLT-Drive:用于驾驶可行性预测的反事实长尾基准与知识保持适配

提出决策级驾驶可行性预测问题,构建反事实长尾基准CoLT-Drive,并设计知识保持适配框架KPA,显著提升小模型长尾场景预测准确率。

04:00
arXiv cs.CV

超越盲从:OCR推理任务验证的基准评测

提出VeriOCRBench基准,评测OCR推理任务验证,发现多模态大模型普遍盲从与过度拒答。

04:00
arXiv cs.CV

CrossFeat:在特征描述符空间中桥接成像模态

提出CrossFeat框架,在描述符空间学习跨模态映射,解耦几何与外观,提升多模态匹配性能。

04:00
arXiv cs.CV

超越语言先验:诊断与修复多模态大语言模型中的视觉源幻觉

挑战语言先验,揭示视觉源幻觉,提出ACFT对抗对比微调,0.9%数据零开销达SOTA。

04:00
arXiv cs.CV

TRUST:阈值重校准的不确定性安全训练,用于乳腺癌筛查中的认证排除

提出闭环阈值感知训练法,动态校准排除阈值并惩罚接近排除区的阳性病例。在NLBS和RSNA上,该模型在98%和95%召回率下实现最高排除率,优于基线,支持高召回选择性排除。

04:00
arXiv cs.CV

ViTAL-X: 视频-文本对齐与跨模态时间编辑

提出XTE-Bench揭示视频模型时间盲区,及自监督XTE框架;ViTAL-X仅用0.4B参数、1M片段,超越7B模型,证明精准时间对齐优于纯规模扩展。

04:00
arXiv cs.CV

经验应存于何处?面向持续视觉Transformer的分层Hebbian记忆

提出分层Hebbian记忆,含工作、情景、语义三层,控制器调节读写与巩固,在持续视觉任务上高准确率,优于单库检索。

04:00
arXiv cs.CV

SlideMix:基于多模态打乱的全切片图像分析增强

SlideMix用VLM定位诊断区域并混洗特征,课程学习控制打乱强度,提升全切片图像分析准确性与泛化性,在11个数据集上验证有效。