11301 条条目 · 106 个活跃源
2026年6月18日
04:00
arXiv cs.CV

通过正则化微调实现3D视觉语言模型的域泛化适应

提出ReFine3D框架,结合选择性层调优与正则化策略,提升3D多模态模型域泛化能力,性能提升显著且计算开销小。

04:00
arXiv cs.CV

面向独立书写者的离线签名验证的原型签名方法

提出基于原型签名的数据驱动策略,生成多样负样本,提升离线签名验证中熟练伪造检测能力,且与架构无关,结合线性SVM提高效率。

04:00
arXiv cs.CV

推理即交集:视频多模态大模型中视觉关注的共识帧对齐

提出无需时间标注的共识帧奖励框架,通过视频内在线索对齐模型焦点,提升视频推理性能。

04:00
arXiv cs.CV

数据强制蒸馏:恢复少步视频生成中的多样性与保真度

提出数据强制蒸馏(DFD),通过教师评分差异引导分布,一行代码微调即可恢复多样性和保真度。

04:00
arXiv cs.CV

预算感知的自适应对抗补丁用于黑盒目标检测

提出查询高效、预算自适应的黑盒攻击,结合汤普森采样与NES更新,动态调整补丁大小,经严格平图测试,在CNN和Transformer检测器上有效。

04:00
arXiv cs.CV

Vines-DB:一个用于多物种观赏藤本植物分割的RGB图像数据集

Vines-DB数据集含1218张原始RGB图像,7种观赏藤本,手工标注,增强至2307张,用于多类实例分割。

04:00
arXiv cs.CV

人脸呈现攻击检测中的架构偏差:视觉Transformer与卷积神经网络的比较研究

预训练视觉Transformer在面部防伪检测中更准确、公平,种族差异减83%,泛化能力提升3.6倍。

04:00
arXiv cs.CV

CAOA:补全辅助下的物体-CAD对齐

提出结合语义点云补全与对称感知位姿估计的CAOA方法,在Scan2CAD上精度提升17%。

04:00
arXiv cs.CV

神经相位相关

提出学习基的相位相关泛化,突破固定基限制,适用于非刚性形变与量子动力学,医学图像配准表现优异。

04:00
arXiv cs.CV

RegimeVGGT:面向视觉几何基础Transformer的逐层空间保持冗余去除方法

RegimeVGGT通过逐层U型双轴压缩实现无训练加速,在匹配重建质量下对VGGT*提速6.7倍。

04:00
arXiv cs.CV

基于CIFAR-10数据集的神经网络图像分类实验分析

CIFAR-10上神经网络图像分类实验,验证准确率74.77%,验证损失中途上升,体现表示学习与记忆差异。

04:00
arXiv cs.CV

Bridging Creative Intent and Visual Quality: Creator-Driven Recurrent Video Generation with Agentic Feedback Loops

04:00
arXiv cs.CV

多模态超图融合用于低光人群计数

提出多模态超图融合与可变形稀疏注意力的LCNet,在三个低光基准上超越现有方法。

04:00
arXiv cs.CV

基于补丁级自监督学习和扩展互惠重排序的空中-地面LiDAR位置识别

提出补丁级自监督学习与扩展互惠重排序框架,解决空中-地面LiDAR位置识别域差距与误报,显著提升检索性能。

04:00
arXiv cs.CV

ICRA 2026 GOOSE 2D细粒度语义分割挑战赛技术报告:利用DINOv3实现野外机器人中的鲁棒户外场景理解

采用DINOv3 ViT-L/16骨干、ViT-Adapter和Mask2Former,结合多尺度测试增强与模型集成,以76.57%复合分获ICRA 2026 GOOSE挑战赛第一名。

04:00
arXiv cs.CV

面向基于知识的新闻图像描述的分层多模态检索方法

本文提出分层多模态检索增强框架,利用外部知识生成新闻图像深度描述,在EVENTA挑战赛获第5名。

04:00
arXiv cs.CV

重新思考文本到图像作为室内场景识别的语义感知数据增强

利用Stable Diffusion生成室内场景合成图像增强训练,DIRE方法可100%识别生成图像。

04:00
arXiv cs.CV

伪造灾情:扩散时代跨域合成灾难检测基准

扩散模型生成逼真假图难辨,现有检测器泛化差(准确率降50%),亟需跨域无关检测方法。

04:00
arXiv cs.CV

MolmoMotion:基于语言指令的3D点轨迹预测

提出3D点轨迹预测任务,构建数据集与基准,模型支持自回归和流匹配,优于基线,可迁移至机器人操作和视频生成。

04:00
arXiv cs.CV

APT:面向因果视频语言理解的原子物理转换

提出原子物理转换(APT)作为因果监督信号,通过APT-Tune提升VLM对物理转换的检测与视频理解。

04:00
arXiv cs.CV

Hallucination Detection and Correction in Medical VLMs via Counter-Evidence Verification

04:00
arXiv cs.CV

LandslideAgent with Multimodal LandslideBench: A Domain-Rule-Augmented Agent for Autonomous Landslide Identification and Analysis

04:00
arXiv cs.CV

UniTemp: 通过双向蒸馏解锁任意时间顺序的视频生成

提出UniTemp双向蒸馏框架,支持任意方向视频生成,解决因果VAE限制,实现双向扩展与插帧等灵活工作流。

04:00
arXiv cs.CV

用于高效低能耗图像恢复的脉冲金字塔小波变换

提出脉冲金字塔小波模型,通过双金字塔小波块降低计算能耗,保持图像质量,展现SNN在图像恢复的潜力。

04:00
arXiv cs.CV

基于场景线索的内在4D高斯分割

提出Intrinsic-GS,无需掩码训练,利用高斯自身特征实现动态场景分割,性能优异且速度快。

04:00
arXiv cs.CV

超越多样性:将视觉令牌剪枝视为子空间重建以实现高效视觉语言模型

SPARE方法通过子空间重建与反相关性选择,实现视觉令牌高效剪枝,性能领先。

04:00
arXiv cs.CV

基于热核先验的流形变分学习

提出流形锚定变分框架,用几何感知EM确保原型在数据流形上,在MRI基准上取得最高准确率和稳定性。

04:00
arXiv cs.CV

BrainFusionNet:一种深度学习与可解释AI模型,理解MRI图像的局部、全局和序列特征以改进脑肿瘤检测

BrainFusionNet混合CNN、ViT和GRU,结合可解释AI,在MRI脑肿瘤分类中达98%准确率,有效提取局部与全局特征。

04:00
arXiv cs.CV

面向异构雷达位置识别的空间分层蒸馏

提出空间分层蒸馏,通过非对称对齐实现异构雷达位置识别,在动态序列上取得最优结果。

04:00
arXiv cs.CV

基于先进深度学习模型的多类脑肿瘤分类:一项比较研究

EfficientNetB0在MRI脑肿瘤分类中准确率最高(95%),脑膜瘤召回率从20%提升至89%,表明架构效率优于深度。

04:00
arXiv cs.CV

PEFT-MedSAM:面向可解释皮肤病变分割的医学基础模型高效微调

提出PEFT-MedSAM,仅微调解码器实现高精度皮肤病变分割,Dice达0.94以上,兼具可解释性。

04:00
arXiv cs.CV

SMART:基于高分辨率成像数据的灵活、可解释、可扩展时空脑图谱

SMART框架解耦疾病动态与个体解剖,用微分方程和神经细胞自动机构建可解释时空图谱,预测精度领先。

04:00
arXiv cs.CV

HandwritingAgent:可缩放矢量空间中的语言驱动手写合成

HandwritingAgent通过语言和参考图像直接合成SVG手写序列,无需风格训练,性能超越当前最优模型。

04:00
arXiv cs.CV

SAMA:面向统一低资源多模态信息抽取的语义锚定对齐增强方法

提出SAMA框架,通过语义锚引导多模态大模型生成高保真合成数据,经双约束过滤,在低资源任务中显著提升性能。

04:00
arXiv cs.CV

SpectralDiT:针对流匹配DiT的时间步条件谱残差校正

SpectralDiT在DiT残差分支添加时间步条件谱分解校正,零初始门控,以0.6%额外FLOPs实现FID降低8.7%。

04:00
arXiv cs.CV

重新思考表格结构识别中的指针损失:面向空间局部性的几何感知指针损失

提出几何感知指针损失,加权邻近细胞梯度,减少相邻错误,实现表格结构识别新最优。

04:00
arXiv cs.CV

临床对齐的几何约束用于鲁棒的IVUS血管边界分割

GeoCat利用几何一致性损失和双编码器,IVUS分割Dice达0.93,边界误差0.14mm,几何误差小,支持可靠斑块量化。

04:00
arXiv cs.CV

SCR引导的难度感知优化用于红外小目标检测

提出REEM框架,利用信杂比调制损失,增强低可见性目标检测,提升IoU和检测率,降低虚警。

04:00
arXiv cs.CV

基于UDF的点云重建的学习半径估计

提出学习半径选择器,离线训练预测连续支撑半径,提升UDF点云重建细尺度精度。

04:00
arXiv cs.CV

面向无训练零样本三维医学图像异常检测:一种基于批处理的二维基础模型方法

提出CS3F,用2D基础模型实现无训练3D医学图像零样本异常检测,通过跨主体相似性评分定位异常。

04:00
arXiv cs.CV

从边界框到视觉推理:用于视觉语言模型的在线策略数据标注工具

ScreenAnnotator开源工具通过在线策略标注与贝叶斯验证,实现近100%接受率,VLM准确率提升35.1%。

04:00
arXiv cs.CV

使用轨迹对齐时间无关流的光学相干断层扫描测试时适应

提出流匹配测试时自适应,通过直方图匹配和移除时间条件,实现OCT图像去噪,AMD分割达最优。

04:00
arXiv cs.CV

模糊几何分支点建模用于结构感知的手写汉字增强

提出模糊几何驱动的结构感知增强框架,建模分支点模糊集,鲁棒解耦笔画,显著降低手写汉字识别错误率。

04:00
arXiv cs.CV

DreamReg:基于信念驱动的世界模型实现2D-3D超声配准

DreamReg利用信念驱动的世界模型,通过内部想象模拟探头运动,实现鲁棒且高精度的实时2D-3D超声配准。

04:00
arXiv cs.CV

他们要去哪里?基于自我视角视频的多模态行人运动建模

提出MMPM框架,基于行人过街行为分离建模多模态轨迹,在PIE/JAAD上超越基线。

04:00
arXiv cs.CV

重新思考空-地协作:渐进式跨任务基准与社会化学习框架

提出AGPC基准与SCP框架,通过粗到细的任务条件协作,在异构空-地感知中实现3.73%协同增益和7.86%性能提升。

04:00
arXiv cs.CV

基于对抗模型的医学图像分割不确定性量化

提出QUAM-SM框架,用对抗搜索识别脆弱像素,区分认知与偶然不确定性,提升分割可靠性和边界敏感性。

04:00
arXiv cs.CV

学习扭曲:前列腺DWI校正的弱监督图像质量迁移

提出弱监督图像质量迁移框架,利用IQA信号和原型流匹配生成真实失真,实现前列腺DWI校正,优于现有方法。