11301 条条目 · 106 个活跃源
2026年6月5日
04:00
arXiv cs.CV

个人AI助手在相册视觉问答中的应用

研究个人相册VQA,构建camroll数据集和camroll-agent,利用层级记忆导航大量个性化图像,揭示与长文本记忆的差异。

04:00
arXiv cs.CV

模型是否共享安全表征?跨模型引导安全视觉生成

提出跨模型安全控制框架,源模型学习安全方向迁移至目标,无需目标不安全数据,实现同等安全性与生成质量。

04:00
arXiv cs.CV

深度学习辅助基于OCT和OCTA的AMD分期

深度学习模型利用OCT/OCTA数据自动准确分级AMD严重度,基于生物标志物模型性能最优,尤其利于早期检测。

04:00
arXiv cs.CV

从单目视频恢复物理上合理的人-物交互

提出RePHO,用强化学习和自适应采样从单目视频重建物理合理的人-物交互,提升物理合理性。

04:00
arXiv cs.CV

LightVesselNet:用于视网膜血管分割的超轻量级亚10万参数网络

提出仅75K参数的LightVesselNet,集成注意力与多尺度特征,在五个数据集上高效分割,适合低资源临床部署。

04:00
arXiv cs.CV

TopoPult-SSL:基于自蒸馏弱临床先验的无腺体掩膜跨设备睑板腺分割

提出TopoPult-SSL框架,无需腺体掩膜,仅用弱临床先验实现跨设备分割,Dice达0.716,性能超越现有模型。

04:00
arXiv cs.CV

Biomazon: A Multimodal Dataset for 3D Forest Structure and Biomass Modeling in the Amazon Basin

04:00
arXiv cs.CV

OCT血管造影中的三维视网膜微血管修复

提出深度学习算法,从单次OCTA数据恢复三维视网膜微血管,显著提升图像质量与保真度。

04:00
arXiv cs.CV

NIV:神经轴变体用于可变字体生成

NIV自动将静态字体转为可变字体,通过神经变形预测位移,支持多轴一致变体,泛化至未见图样和手写输入。

04:00
arXiv cs.CV

VideoKR:迈向知识密集与推理密集型视频理解

首个知识密集型视频理解训练语料VideoKR,含31.5万推理示例,有效提升模型视频推理能力。

04:00
arXiv cs.CV

通过特权传感器引导对比学习实现PointGoal导航的鲁棒场景迁移

提出特权传感器引导的对比学习,解耦表征与策略,提升PointGoal导航场景迁移,部署仅需单目RGB,性能超越大模型。

04:00
arXiv cs.CV

UniPixie:通过流匹配的统一概率性三维物理学习

UniPixie将物理预测重构成连续分布学习,单图生成可控多样物理场,统一多求解器,误差降低超50%。

04:00
arXiv cs.CV

你还会把这个叫做Dax吗?视觉语言模型与人类中的新颖视觉参照

VLM学习矛盾新概念困难且过度泛化,人类与模型敏感度相关但更精准。

04:00
arXiv cs.CV

Disentangled Fine-Grained Prototype Learning for Incomplete Image-Tabular Classification

04:00
arXiv cs.CV

用于马匹情感状态评估的马眼眨眼检测与分类

三种眨眼分类方法在马视频中达高F1分数,揭示细粒度面部动作单元检测的潜力与挑战。

04:00
arXiv cs.CV

形式概念格:基于概念学习的语义支架

利用形式概念格作为语义支架,引导神经网络学习分层概念表示,提升可解释性与干预效果。

04:00
arXiv cs.CV

ORACLE-CT:面向CT分类的解剖感知支持池化

提出ORACLE-CT框架,通过多器官分割实现解剖感知池化,提升CT分类的判别力和外部鲁棒性。

04:00
arXiv cs.CV

我们能否在生成前预测文本到图像内容的人类偏好?这样做有用吗?

研究能否在生成前预测人类偏好分数以改进图像生成质量,发现可行且硬件开销极小。

04:00
arXiv cs.CV

使用视觉几何变换器的非配对RGB-热高斯泼溅

提出非配对RGB-热高斯泼溅框架,用视觉几何变换器估计位姿,对齐后实现多模态新视角合成。

04:00
arXiv cs.CV

LLM引导的ANN索引优化用于人-物交互检索

提出相位感知LLM代理优化耦合参数,HICO-DET上比TPE提升33.3%,吞吐量增益15.3倍。

04:00
arXiv cs.CV

UltraVR: 面向证据支撑推理的诊断性超分辨率图像VQA基准

UltraVR基准用结构化推理链诊断VLM在超分辨率图像上的证据获取与推理失败环节。

04:00
arXiv cs.CV

ShotCrop³:将人像图像裁剪为电影级三镜头构图

提出三重镜头构图任务和ShotCrop方法,从单张人像生成三镜头组,定位精度比GPT-5提升2.82倍。

04:00
arXiv cs.CV

Almieyar-Oryx-BloomBench:面向认知启发的视觉-语言模型双语多模态基准

首个基于Bloom分类法的双语多模态认知基准,揭示VLM在事实回忆与创造性合成上的短板及英阿差距。

04:00
arXiv cs.CV

BRepCLIP:面向CAD理解的BRep基元对比多模态预训练

BRepCLIP首次以对比预训练对齐BRep几何与语言图像,大幅提升CAD检索与零样本分类性能。

04:00
arXiv cs.CV

HDST-GNN: 用于无人机航拍图像多目标跟踪的异构动态时空图神经网络

提出HDST-GNN异构动态时空图网络,通过高度自适应边、异构节点和遮挡门控聚合,MOTA达94.51%,ID切换减少81%。

04:00
arXiv cs.CV

BMCR:基于强化学习的自适应骨干模块组合用于遥感目标检测

提出BMCR方法,动态组合CNN与ViT模块,实现自适应遥感检测,性能提升达2.5点。

04:00
arXiv cs.CV

面向医学视觉问答的噪声感知视觉表示学习

提出噪声感知Med-VQA框架,用去噪自编码器与LoRA微调,提升鲁棒性与性能。

04:00
arXiv cs.CV

皮肤之下是什么?估算猪的体况

PigFormer系统利用RGB-D摄像头自动预测猪的背膘厚度等体况指标,MAE仅2.43毫米,实现非接触连续监测。

04:00
arXiv cs.CV

面向细粒度分布外检测的双特征解耦方法

提出双特征解耦网络(DFDNet),通过空间-频率与重构引导模块解耦特征,解决细粒度类间细微差异与背景干扰,显著提升检测性能。

04:00
arXiv cs.CV

KV-Control: 参数高效的键/值注入方法用于轨迹可控的文本到运动生成

KV-Control通过注意力侧注入键值记忆实现精确轨迹控制,轻量高效且不破坏文本运动先验。

04:00
arXiv cs.CV

VTI-CoT:面向视频推理的视觉-文本交错思维链

提出VTI-CoT框架,融合视觉与文本推理,自动构建多模态数据,经OCR压缩提升训练效率,达到SOTA性能。

04:00
arXiv cs.CV

多任务裂缝基础模型:面向土木基础设施中工程可靠的裂缝表示与拓扑保持

提出CrackGeoFM多任务框架,实现裂缝精确分割、拓扑保持与不确定性校准,仅需5张标注样本即可适应新场景。

04:00
arXiv cs.CV

T-SAR-JEPA:通过潜在预测的SAR幅度堆叠自监督时间异常检测

自监督框架T-SAR-JEPA通过潜在预测检测SAR时间异常,在夏威夷数据集上ROC-AUC达77%,优于基线方法。

04:00
arXiv cs.CV

CoFi-UCGen:无需标签先验的由粗到细无监督条件生成

提出CoFi-UCGen框架,通过语义互学习与比特码实现无标签的粗到细条件生成,提升图像质量与语义一致性。

04:00
arXiv cs.CV

V2V-Bench:视频到视频生成评估的综合基准

V2V-Bench提出11维度评估视频到视频生成,包含时序对齐等五类,与人类判断相关性达0.905。

04:00
arXiv cs.CV

LongSpace:探索视频中从感知到回忆的长时空间记忆

提出长视频空间记忆基准LongSpace-Bench和框架LongSpace,利用3D线索与层级记忆提升长程空间理解。

04:00
arXiv cs.CV

用于快速自回归图像生成的并行雅可比解码

提出并行雅可比解码(PJD),通过二维空间并行扩展和注意力掩码优化,实现4.8-6.4倍加速,保持生成质量。

04:00
arXiv cs.CV

基于机器学习的监控摄像头实时威胁检测

基于YOLOv8,融合自建钝器数据集,实时检测枪支、刀具和钝器,提升精度且无过拟合。

04:00
arXiv cs.CV

ViCuR:视觉线索作为多模态在策略蒸馏中的可恢复特权

ViCuR用可恢复视觉线索替代答案特权,轻量模块提取任务相关证据,提升多模态蒸馏性能,平均超1.19。

04:00
arXiv cs.CV

TextWand:场景文本编辑的统一框架

提出统一框架TextWand,通过ORPE实现像素级布局与样式控制,RAS确保擦除干净,构建基准TextWand-Bench,多项任务超越现有模型。

04:00
arXiv cs.CV

基于LLM提示翻译和LoRA微调的韩语日记文本情感感知图像生成

利用LLM识别日记隐含情感,结合LoRA微调生成儿童画风格图像,研究触发词影响与评估指标局限。

04:00
arXiv cs.CV

DRIFT: 一种用于视觉-语言模型中连续输出解码的残差流适配器

DRIFT框架结合基础预测与流匹配生成细化,在连续输出任务(如视觉定位、机器人控制)中迭代提升性能。

04:00
arXiv cs.CV

物理引导的深度展开用于盲跨传感器光谱超分辨率:通过学习光谱变换函数

提出PGU-Net,联合估计高光谱图像与光谱变换函数,解决盲跨传感器超分辨率,性能领先。

04:00
arXiv cs.CV

ExpSpeech-Net:表情与语音的多模态融合用于深度伪造检测

提出轻量级多模态深度伪造检测模型ExpSpeech-Net,融合表情与语音,准确率达94.5%。

04:00
arXiv cs.CV

先想象再预测:交错潜在视觉推理用于视频事件预测

提出交错潜在视觉推理框架Future-L1,通过潜在空间保留视觉语义,在视频事件预测上达到最先进性能。

04:00
arXiv cs.CV

超越绝对分数:基于相对编辑差异的通用图像美学评估

提出RED-Aes框架,利用编辑模拟审美推理,通过相对监督学习美学差异,实现更优泛化。

04:00
arXiv cs.CV

LPDR下一代并行解码器:架构优化与类别平衡的GAN增强

融合空间混合注意与类别平衡增强,将少数省份车牌识别率从78.2%提至91.5%,保持152FPS实时处理。

04:00
arXiv cs.CV

LiAuto-GeoX: 高效可落地的驾驶Transformer

提出基于几何蒸馏的稠密3D重建模型,220FPS运行,实现高效实时自动驾驶感知与预测。