10961 条条目 · 106 个活跃源
2026年8月25日
04:00
arXiv cs.CV

EXPL-FR:通过视觉-语言对齐解释人脸识别模型

将视觉语言模型与人脸识别空间对齐,属性提示作锚点,无需文本训练;用无标签可检测性选语义签名,实现解释审计。

04:00
arXiv cs.CV

BIMScript:面向BIM导入的材质感知结构化场景程序

BIMScript以单一语法回答何物、多快、何处:扩展材质,加速解码,精确定位,直接导入BIM。

04:00
arXiv cs.CV

西红柿、土豆与洋葱:对人脸呈现攻击检测中人脸必要性的质疑

用蔬菜训练检测器获92.70%AUC,证明可迁移的人脸呈现攻击检测可不依赖人脸。

04:00
arXiv cs.CV

CLSC DETR:基于跨层几何支持的可信候选排序用于无人机小目标检测

针对无人机小目标检测,提出跨层局部支持与一致性校准模块,聚合几何证据提升定位质量估计,并自适应校准分类分数,改善候选排序,显著提升检测精度。

04:00
arXiv cs.CV

超越视觉相似性:面向知识型视觉问答的实体对齐检索

提出KBMR,首个多模态大模型检索器,实现实体语义对齐,超越CLIP,提升检索与问答精度。

04:00
arXiv cs.CV

FigmaTrace:捕捉人类Figma设计工作流中的创意细节

FigmaTrace含200小时视频转3469条设计轨迹,训练模型在GUI任务上比肩前沿闭源模型。

04:00
arXiv cs.CV

复杂度诱导:通过结构化标签扭曲实现组合泛化

对训练数据做结构化标签扭曲可让标准CNN无需改架构即可组合泛化,预测未见过的颜色-形状组合。

04:00
arXiv cs.CV

基于近距离摄影测量生成橡胶混凝土亚毫米级三维点云,用于缺陷提取与变形监测,可替代LiDAR。

基于近距离摄影测量生成橡胶混凝土亚毫米级三维点云,用于缺陷提取与变形监测,可替代LiDAR。

04:00
arXiv cs.CV

多尺度水果胶囊:膨胀卷积与动态路由实现野外可解释水果识别

采用膨胀卷积和动态路由融合多尺度,以1/3深度在野外数据集上超越十个迁移学习基线,最高提升2.7%。

04:00
arXiv cs.CV

是规划而非解码器:推理增强的文本到图像生成中组合失败的诊断与修复

推理增强文生图失败源于规划而非解码器;解码器忠实执行,编辑修复规划即可提升性能,几何评分验证有效。

04:00
arXiv cs.CV

TASSO: 面向视觉-语言模型持续学习的任务特定子空间优化

提出TASSO,通过子空间学习和几何感知蒸馏保持潜在空间几何,缓解灾难性遗忘与零样本退化,超越现有方法。

04:00
arXiv cs.CV

Presto:基于想象搜索的高效、免训练的开放世界物体放置

将开放世界物体放置重构为MLLM引导的启发式搜索,零样本免训练,粗到细优化,性能最优且更符合人类感知。

04:00
arXiv cs.CV

扩展早期诊断视野:用视觉Transformer预测肺癌

研究用视觉Transformer从胸片提前1-2年预测肺癌,迁移学习提升AUC与准确率,适度重采样降本70%,显示潜力但未达临床应用阈值。

04:00
arXiv cs.CV

扰动思维,而非像素:视觉语言模型强化学习中的潜空间轨迹多样化

提出潜空间加噪的NC-GRPO,通过多样化轨迹提升视觉语言模型数学推理与抗幻觉能力

04:00
arXiv cs.CV

情感强度至关重要:用CVAE在虚拟人中生成逼真表情

提出基于CVAE的方法,从真实数据学习,可控制虚拟人面部表情强度,仅用7680个样本即可生成连贯情绪变化。

04:00
arXiv cs.CV

视频对象中心学习的语义槽

提出语义槽方法,用变换器解码器使槽位成为语义查询,免去时间预测,大幅提升视频对象分解性能。

04:00
arXiv cs.CV

StereoDiffuer:基于扩散的渐进式几何建模与显著性注意力感知立体匹配

提出基于扩散的立体匹配框架,结合显著性注意力感知几何细节,迭代细化视差,改善边缘模糊。

04:00
arXiv cs.CV

DamageScope:面向卫星影像灾害损失评估的大规模视觉-语言检索

框架采用检索增强生成结合卫星影像与视觉语言模型及语言模型通过多向量聚类和双存储架构高效评估灾害损失

04:00
arXiv cs.CV

SketchFlow:基于CLIP潜在空间GMM先验流的零样本矢量草图生成

提出新方法,在CLIP空间用GMM先验与流匹配,零样本生成高质量矢量草图,并支持未见类别与语义插值。

04:00
arXiv cs.CV

保真度-多样性-一致性(FDC):遥感变化检测的数据剪枝

首次评估遥感变化检测数据剪枝,现有方法无优势;提出以变化分布保真度为核心的FDC法,性能稳定提升。

04:00
arXiv cs.CV

校准你所发布的:面向验证器引导的文本到图像生成的后选择风险控制

提出选择感知的留出校准,对完整部署策略而非单个候选做风险控制,实证降低发布风险。

04:00
arXiv cs.CV

学习重看:视觉语言模型中自由裁剪路由的损失差距监督

利用模型自身失败信号监督裁剪路由,令视觉语言模型先全局后局部重看,显著提升细粒度问答性能。

04:00
arXiv cs.CV

LiteEvent-AE:面向低延迟能量受限边缘设备的轻量级事件视觉自编码器

轻量事件自编码器压缩神经形态数据,参数量降至1/35.6,能耗降至1/726,实时44.8FPS。

04:00
arXiv cs.CV

DefaultShift:审计加速文本到图像模型中的语义默认偏移

提出DefaultShift审计,衡量加速文生图模型替换时的语义默认偏移;校准可减少10%-35%偏移,并提升准确率。

04:00
arXiv cs.CV

穿越薛定谔桥:从死后自溶恢复生前图像的基准评测以增强法医诊断

提出死后自溶恢复任务,构建首个同源非配对数据集,用薛定谔桥建模,以诊断效用为评测基准。

04:00
arXiv cs.CV

SpatialDiff:基于隐式空间建模的3D感知对象移动

提出新方法,用隐式三维建模与全局空间监督捕获三维结构,实现复杂场景中物体的精确移动。

04:00
arXiv cs.CV

HP-UniIF:面向统一图像融合的分层提示学习

提出HP-UniIF,用扩散先验统一融合、恢复与感知,以分层调制解耦多目标,性能优越。

04:00
arXiv cs.CV

FlashReg:GPU加速的三团点云配准,实现实时对应到位姿估计

GPU加速点云配准,稀疏二阶图与三团搜索减少内存和延迟,相比TurboReg提速2-3倍,内存减半,适合机载感知。

04:00
arXiv cs.CV

SAFE-G:面向知识型视觉问答的结构感知忠实证据引导生成

提出SAFE-G框架,结合结构感知图检索与强化学习,确保证据定位和忠实推理,显著提升KB-VQA准确率。

04:00
arXiv cs.CV

PatchGate:在冻结视觉语言模型中以内在对象清单缩小表述差距

PatchGate无训练框架,提取视觉证据并校准解码,提升可见对象覆盖率13.4%,减少幻觉12%,无需外部检测器。

04:00
arXiv cs.CV

BC-IHV:调节色彩空间以实现稳定的修正流低光增强

提出SA-RF与可学习色彩空间BC-IHV,调节逆梯度动态范围,低光增强重建与感知显著提升。

04:00
arXiv cs.CV

跨模态PET衰减校正的区域加权损失与模型融合

在跨模态PET衰减校正中,区域加权μ空间L1损失比架构更关键;融合双模型提升性能,居公开验证榜第一。

04:00
arXiv cs.CV

面向比特流损坏的严苛视觉理解:通过比特流语言建模作为鲁棒语义先验

提出比特流语言建模框架,提取损坏比特流的语义先验,提升视频恢复、描述和姿态估计性能。

04:00
arXiv cs.CV

迈向无混叠的4D高斯表示:运动感知滤波

提出运动感知3D平滑滤波,抑制动态场景新视角合成的混叠,适配多种4D表示,性能优于现有方法。

04:00
arXiv cs.CV

GaussVid:结合3D感知视频扩散先验的稀疏视图高斯泼溅

提出3D感知视频修复框架,利用相机条件几何先验增强稀疏视图高斯泼溅重建,提升多视角一致性与保真度。

04:00
arXiv cs.CV

FIRM-Video:先查后评,实现可靠的文本到视频奖励建模

提出先查后评的清单驱动框架,分维度核实后再聚合评分,实现可靠高效的文本到视频奖励建模,基准性能最优。

04:00
arXiv cs.CV

ViSMoE:面向具身指代定位的视觉感知稀疏专家混合模型

ViSMoE用视觉感知路由的稀疏专家混合分别处理视图与对象,得到可区分表示,在REVERIE和SOON上超越现有最优方法。

04:00
arXiv cs.CV

GuardPaint:文本到图像生成的推测性安全解码

提出守卫绘画框架,在扩散轨迹内安全干预,定点修复违规区域,显著降低攻击成功率并保持图像质量。

04:00
arXiv cs.CV

弱监督视频异常检测中的帧级评估主要衡量视频级排序

帧级评估主要反映视频级排序;同一视频内帧序不重要,视频级恒定分数即可获得高分。

04:00
arXiv cs.CV

AirAlign:面向无人机最后一米导航的几何感知相对位姿对齐

提出AirAlign框架,利用几何感知特征与集成学习实现无人机RGB图像相对位姿对齐,实验验证有效。

04:00
arXiv cs.CV

Sparse Multi-Stage Expert-Agent Routing for Complex Clinical Reasoning

04:00
arXiv cs.CV

利用高效非对角协方差建模改进的去噪扩散概率模型

提出高效非对角协方差建模(K-DCT),以近线性复杂度加速扩散采样,少步数下FID和似然更优。

04:00
arXiv cs.CV

VIG:视觉信息增益作为多模态思维链压缩的奖励信号

提出VIG,用图像降低预测不确定度衡量词元信息增益,在线双前向计算,提升多模态推理精度-效率权衡。

04:00
arXiv cs.CV

可缩放矢量图形潜空间

提出Transformer自编码SLS,学习SVG路径的紧凑可逆潜空间,支持向量运算,算力省150倍。

04:00
arXiv cs.CV

制造中数据稀缺下的可信视觉质量检测

针对制造中缺陷样本稀缺,用扩散模型生成合成缺陷,结合贝叶斯分类器延迟人工审查,提升检测可信度并降低成本。

04:00
arXiv cs.CV

面向低资源牙科记录补全的实体约束CBCT检索

提出ECCR:仅采纳不扩展实体集的检索证据,低资源牙科补全得分提升,获第二名。

04:00
arXiv cs.CV

基于观测算子的像素空间扩散

观测算子扩散用粗到细观测替代固定监督,收敛快质优,ImageNet-256上FID1.52。

04:00
arXiv cs.CV

检索增强视觉提示:在双光子成像中引导基础模型

提出检索增强视觉提示,推理时用检索示例框引导基础模型,免微调提升双光子成像神经元检测。

04:00
arXiv cs.CV

C²Path:视觉-语言增量目标检测中的类条件路径解耦

提出C²Path,利用专家库构建类条件解耦路径,隔离更新,解决类别知识耦合,性能领先。

04:00
arXiv cs.CV

基于视图图剪枝的稳健全局运动恢复结构

提出子图引导的视图图剪枝框架,利用子图一致性剔除不可靠边,提升全局SfM在模糊、序列及无序图像上的鲁棒性。