10911 条条目 · 106 个活跃源
2026年9月2日
04:00
arXiv cs.CV

Qwen-Drive-1.0:迈向自动驾驶视觉语言基础模型的初步探索

提出自动驾驶视觉语言基础模型,统一三维感知、问答与规划,BEV头与规划专家提升驾驶性能,保持通用能力。

04:00
arXiv cs.CV

流匹配的拉格朗日视角

用拉格朗日视角推导流匹配:目标身份守恒导出拟线性PDE,特征线法得直线轨迹,曲率源自去噪器雅可比。

04:00
arXiv cs.CV

CoLT-Drive:用于驾驶可行性预测的反事实长尾基准与知识保持适配

提出决策级驾驶可行性预测问题,构建反事实长尾基准CoLT-Drive,并设计知识保持适配框架KPA,显著提升小模型长尾场景预测准确率。

04:00
arXiv cs.CV

超越盲从:OCR推理任务验证的基准评测

提出VeriOCRBench基准,评测OCR推理任务验证,发现多模态大模型普遍盲从与过度拒答。

04:00
arXiv cs.CV

CrossFeat:在特征描述符空间中桥接成像模态

提出CrossFeat框架,在描述符空间学习跨模态映射,解耦几何与外观,提升多模态匹配性能。

04:00
arXiv cs.CV

超越语言先验:诊断与修复多模态大语言模型中的视觉源幻觉

挑战语言先验,揭示视觉源幻觉,提出ACFT对抗对比微调,0.9%数据零开销达SOTA。

04:00
arXiv cs.CV

TRUST:阈值重校准的不确定性安全训练,用于乳腺癌筛查中的认证排除

提出闭环阈值感知训练法,动态校准排除阈值并惩罚接近排除区的阳性病例。在NLBS和RSNA上,该模型在98%和95%召回率下实现最高排除率,优于基线,支持高召回选择性排除。

04:00
arXiv cs.CV

ViTAL-X: 视频-文本对齐与跨模态时间编辑

提出XTE-Bench揭示视频模型时间盲区,及自监督XTE框架;ViTAL-X仅用0.4B参数、1M片段,超越7B模型,证明精准时间对齐优于纯规模扩展。

04:00
arXiv cs.CV

经验应存于何处?面向持续视觉Transformer的分层Hebbian记忆

提出分层Hebbian记忆,含工作、情景、语义三层,控制器调节读写与巩固,在持续视觉任务上高准确率,优于单库检索。

04:00
arXiv cs.CV

SlideMix:基于多模态打乱的全切片图像分析增强

SlideMix用VLM定位诊断区域并混洗特征,课程学习控制打乱强度,提升全切片图像分析准确性与泛化性,在11个数据集上验证有效。

04:00
arXiv cs.CV

FoldingAgent:从演示视频推断参数化折纸程序

提出智能体框架,结合视觉语言模型与专用工具,从演示视频推断可执行的参数化折纸程序,并在基准上验证有效。

04:00
arXiv cs.CV

Puppeteer:物体锚定的姿态感知共语手势生成

提出一种模型,在因果潜空间扩散,融合语音、历史动作与物体几何,生成姿态感知和物体锚定的共语手势。

04:00
arXiv cs.CV

SAM3-LoRA:面向多类结构缺陷分割的概念可提示基础模型的参数高效适配

将LoRA用于SAM3,以类名提示并设硬负样本训练,仅更新0.121%参数,分割性能大幅提升。

04:00
arXiv cs.CV

揭示人脸嵌入:利用基础模型进行读取、渲染与命名

线性变换使人脸嵌入与基础模型对齐,无需训练即可实现自然语言描述、图像重建与身份命名。

04:00
arXiv cs.CV

少即是多:视觉概念融合中正负空间的平衡

提出自动融合管道,显式运用正负空间,结合扩散与矢量优化,提升概念融合的创意与可识别性。

04:00
arXiv cs.CV

面向胸部CT免文本三维异常分割的实例引导报告锚定

提出实例引导报告锚定:训练利用报告文本,推理仅需图像即可分割多类异常,胜过无文本基线两成,近顶尖方法。

04:00
arXiv cs.CV

一眼足矣:SimLoss单遍细粒度图像描述

提出SimLoss,用嵌入空间对比损失训练单遍模型,无需多阶段流程,精度接近多阶段方法,速度提升约20倍。

04:00
arXiv cs.CV

Streaming4D:通过分块视频生成与增量重建加速4D世界模型

提出Streaming4D,将分块视频生成与增量3D重建同步并行,降低交互延迟,在RTX 4090上提速1.24倍,保持几何质量与多视角一致性。

04:00
arXiv cs.CV

GenScale:图像生成与编辑中物体相对尺度基准

提出GenScale基准,含900图像级条目与1643对尺度关系,评估生成编辑的物体相对大小;配套Rescale后处理可修正尺度,提升合理性。

04:00
arXiv cs.CV

BrainDiff:多模态脑MRI纵向报告生成

首个脑MRI纵向报告系统,优于通用及单次模型,外部验证保持91%,通过干预提升图像依赖2.5倍。

04:00
arXiv cs.CV

教视觉语言模型使用给定尺度:面向度量物理推理的无标签等变训练

提出无标签等变训练,利用尺度对称性约束监督模型,无需真实标注即可提升度量物理推理的尺度响应与准确性。

04:00
arXiv cs.CV

超越地标提取:结构化图像分类中的鲁棒几何特征构建框架

针对结构化图像分类,提出关键点后特征构建框架,比较坐标、距离、角度及混合特征,实验表明混合表示最优。

04:00
arXiv cs.CV

限制而非重训:推理时VLM引导的零样本航空影像分割

推理时用VLM引导冻结分割模型,限定关键类别并定位漏检小物体,提升零样本航空分割性能。

04:00
arXiv cs.CV

视觉-语义事件链条件化的物理合理视频生成

将物理演化建模为事件链,结合物理事件推理、关键帧路由和对比语义引导,生成物理可信的视频。

04:00
arXiv cs.CV

基于Veronese嵌入的射影平面Soft-Argmax

用二次嵌入将直线映射为对称矩阵,消除霍夫空间双重覆盖的歧义,实现无缝加权平均提取,损失等价于弦距离。

04:00
arXiv cs.CV

人不能两次拍摄同一条街道:视觉-语言测量城市变化的可靠性局限

街道没有实质重建时重拍也会显著改变感知评分,单点测量不可靠;聚合数百对观测才能可靠度量城市变化。

04:00
arXiv cs.CV

分离视觉语言模型中的感知与推理:晶体结构的无模型渲染天花板

“渲染天花板”以无模型参考分离感知与推理,经2160个晶体结构验证,证明模型误差全属模型自身。

04:00
arXiv cs.CV

FTU-Seek:稀疏功能组织单元分割中的基础模型引导难负样本学习

提出一种病理基础模型引导的难负样本学习框架,提升稀疏功能组织单元分割。

04:00
arXiv cs.CV

DGNet:双知识引导的红外小目标检测网络

针对语义纠缠与部署限制,提出基于双文本先验的DGNet,含小波调制与方向对齐损失,有效解耦并提升检测性能。

04:00
arXiv cs.CV

提示条件场景奖励的可控图像描述生成

提出基于场景图奖励的可控图像描述方法,并引入基准测试,提升可控性且不损质量。

04:00
arXiv cs.CV

基于对比人类感知3D表示的前馈多视角多人重建

提出统一人物感知3D空间与跨模态对比学习,实现前馈多视角多人重建,抗遮挡且高效。

04:00
arXiv cs.CV

警惕裂痕:AI生成视频检测中的跨尺度耦合失配

发现AI视频跨尺度耦合失配这一新信号,提出RIFT框架,在两大基准上F1超99%,泛化性强。

04:00
arXiv cs.CV

EarthLD:迈向基于视觉语言引导扩散模型的统一开放世界滑坡理解

提出地滑理解扩散框架,融合视觉语言,统一识别、制图与触发解释,全球基准优于现有方法。

04:00
arXiv cs.CV

一种融合卡尔曼滤波的倾斜估计算法设计与实现

基于惯性传感器与微控制器,采用卡尔曼滤波融合加速度计和陀螺仪,抑制噪声与漂移,实现倾斜角稳定估计。

04:00
arXiv cs.CV

卫星能看到通勤者吗?——对视觉基础模型的关键基准测试

比较四种卫星视觉编码器,语言监督分布内最强,地理感知零样本迁移佳,但跨洲通勤OD生成仍是开放问题。

04:00
arXiv cs.CV

基于重力先验驱动解耦变换与位姿精化的高效鲁棒绝对位姿估计

利用重力先验解耦变换,将绝对位姿估计降为四自由度;一维投票估计旋转并精化,在数据集和SLAM中领先。

04:00
arXiv cs.CV

Solaris:迈向生成而非编码的界面

Solaris界面世界模型逐帧生成UI,以语言模型理解意图,结合自回归与蒸馏,实现动态生成的开放交互。

04:00
arXiv cs.CV

基于微观注视动力学的情绪监测智能决策支持系统

利用智能眼镜捕捉微观眼动特征,混合AI实现情绪监测,个性化F1达83.6%。

04:00
arXiv cs.CV

ReBridge-Flow:流匹配中后验桥的重新耦合用于图像复原

提出ReBridge-Flow,重新耦合后验桥端点以缓解流匹配图像复原中的桥错配,提升结构一致性。

04:00
arXiv cs.CV

禁止你的注意力:通过选择性移除频谱域中的内在焦点,欺骗多模态大语言模型

提出基于相位感知的对抗攻击,抑制多模态模型对结构区域的关注,实现高效隐蔽攻击。

04:00
arXiv cs.CV

VOIM:面向RGB-D与单目SLAM的免训练开放词汇三维实例建图

免训练体素级实例管理器,延迟标签决策,从深度或单目视觉构建开放词汇三维实例地图,性能胜过现有最强系统。

04:00
arXiv cs.CV

RingMoClaw:遥感自演进研究的经验启发式多智能体框架

遥感模型研究仍靠人工试错,RingMoClaw用多智能体闭环优化,四任务精度提升,演进步骤减40%。

04:00
arXiv cs.CV

带引导式稀疏全局精化的先进像素扩散模型

提出PixSGR,以稀疏全局精修高效生成高保真图像,FID在256/512分辨率达1.51/1.60。

04:00
arXiv cs.CV

基于事件的无人机预测的残差卡尔曼动态

事件相机无人机框预测:残差卡尔曼模型优于基线,事件条件最强,去相关测试下仍有效。

04:00
arXiv cs.CV

视觉语言模型中的视觉注意力忠实性具有异质性

因果扰动分析显示视觉语言模型注意力忠实性分为充分忠实分布式忠实和非聚焦三种模式与人类标注仅六成一致

04:00
arXiv cs.CV

场景文本识别能否识读罕见组合?

罕见词与字符组合使场景文本识别准确率大跌,模型扩增无效,根因在自回归解码器先验;改CTC解码有效,需架构变革。

04:00
arXiv cs.CV

从术语到图表:面向科学图表理解的视觉指令生成

提出利用科学术语生成图表指令数据的方法,构建19.4万图表、140万指令的SciGram数据集,微调模型显著提升科学图表问答性能,达到领先水平。

04:00
arXiv cs.CV

视觉不敏感鸿沟:诊断视觉-语言模型何时未能利用视觉证据

揭示视觉语言模型存在“视觉不敏感鸿沟”:常忽视图像证据;提出样本固有敏感度指标,用于条件集成诊断。

04:00
arXiv cs.CV

面向垃圾分拣语义分割无监督域适应的视觉语言引导伪标签

提出跨模态伪标签流程,用视觉语言模型生成可靠伪标签,实现无监督域适应,证明质量比数量更重要。

04:00
arXiv cs.CV

冠状动脉CTA报告生成的多中心基准与临床结构化指标

建立四中心基准及CSM_CCTA指标,评估7个模型;与放射科医生评分高度相关(r=0.97),优于现有指标,支持临床对齐的CCTA报告评估。