11061 条条目 · 106 个活跃源
2026年8月12日
04:00
arXiv cs.CV

真的有伪装目标吗?走向现实的伪装目标检测

现有伪装检测假设每图必有目标,忽略纯背景等现实情况。提出OPC16K基准与OPCNet网络,联合检测与分割,减少误报。

04:00
arXiv cs.CV

学习高斯结构:面向前馈驾驶重建的干预引导密度控制

提出高斯结构学习框架,用干预引导密度控制及跨时查询提升重建精度,优于现有方法。

04:00
arXiv cs.CV

AlbumentationsX:图像及相关标注的统一增强管道

AlbumentationsX统一增强管道,随机变换同步作用于图像与标注,防错位,可复现,可扩展。

04:00
arXiv cs.CV

PRMU:面向多模态大语言模型中人物中心知识遗忘的无语料基准

提出PRMU基准,评估无语料条件下多模态人物知识遗忘,并给出SGPE基线方法。

04:00
arXiv cs.CV

VidForensics-M1:面向AI生成视频取证的可验证时间定位元检测强化学习

首次将元检测引入AI视频检测,利用可验证时间证据,通过证据引导奖励再分配,提升泛化性与伪造定位能力。

04:00
arXiv cs.CV

Rescene: 带限随机强迫将冻结的神经天气预报算子转变为气候模拟器

用带限随机扰动包裹冻结天气算子,实现百年稳定气候模拟,恢复日变率与阻塞频率。

04:00
arXiv cs.CV

SpecF2M:基于频谱感知的多任务网络,利用儿童眼底照片估算眼轴长度与屈光不正

提出频谱感知多任务网络,用儿童眼底照片估算眼轴及屈光,MAE0.535mm/0.706D,优于基线。

04:00
arXiv cs.CV

CausalSplat:面向3D高斯泼溅的全面层级推理

提出CausalSplat,融合VLM与3D场景图,解耦显式感知与隐式推理,实现3DGS因果推理SOTA。

04:00
arXiv cs.CV

捕捉足球中人体运动的不确定性用于表征学习

提出自监督框架,用未来运动预测学习足球人体运动表征,建模多模态不确定性,提升预测精度并泛化到多任务。

04:00
arXiv cs.CV

AdvFD:通过对抗弗雷歇距离损失提升视觉生成

提出对抗弗雷歇距离(AdvFD),用可学习对抗表示补充静态特征,避免弗雷歇破解,提升生成质量。

04:00
arXiv cs.CV

视网膜图像的算法统计学

用归一化压缩距离度量学习分析3D视网膜OCT图像,误差0.5dB,优于深度学习,提出NCV特征集并模拟非度量嵌入失真。

04:00
arXiv cs.CV

APCReg:解剖先验引导的CBCT-IOS粗到精配准——多视角投影与可靠性控制残差校正

提出解剖先验引导的多视角粗到精配准方法,结合可靠性控制残差校正,实现口内扫描与锥形束CT亚毫米级配准。

04:00
arXiv cs.CV

基于系列DCE-MRI的纵向三维基础建模用于新辅助乳腺癌治疗反应预测

融合纵向三维成像与临床数据,预测新辅助化疗完全缓解,曲线下面积零点七三六,证实成像互补价值。

2026年8月11日
04:00
arXiv cs.CV

大型语言模型在结直肠息肉光学诊断中的表现

多模态大模型对息肉分型有一定准确性,但未达ESGE标准,需前瞻性试验与人机协同后再临床应用。

04:00
arXiv cs.CV

PragyaDoc:面向低资源场景的多语种医疗文档理解通用文档智能框架

PragyaDoc四层框架处理印度22种语言医疗文档,破解英文壁垒,惠及农村患者及基层工作者。

04:00
arXiv cs.CV

在领域特定语言动作空间中学习室内布局策略

提出基于领域特定语言动作空间的布局策略学习方法,显著提升空间合理性与设计逻辑性。

04:00
arXiv cs.CV

NeuroPilot:一种智能体驱动的神经影像处理、质量控制与管理流水线

NeuroPilot智能体系统自动化神经影像处理与质控,部署17队列超12万被试,将数月流程压缩至一周。

04:00
arXiv cs.CV

Mechanistic Interpretability-Guided Selective Fine-Tuning of Vision-Language Models for Centimeter-Level Flood Depth Estimation

04:00
arXiv cs.CV

P2Voxel:用于3D网格令牌化的金字塔枢轴体素化

P2Voxel通过金字塔枢轴体素化,将网格转化为紧凑可学习的令牌,实现高效重建。

04:00
arXiv cs.CV

审计胸部X光片上的医学视觉-语言模型:跨机构估计参考一致性

评估三模型在胸部X光片的六发现,参考一致性不跨站点迁移,须按站点和接口重新评估。

04:00
arXiv cs.CV

数据集组成对紧凑YOLO模型嵌入式实时无人机野火检测的影响

实验表明,真实未增强数据集在无人机野火检测中平衡最佳,合成数据混合与增强未能提升最终部署效果。

04:00
arXiv cs.CV

XEns-CKD:一种基于可解释集成方法的慢性肾脏病分期检测方案

提出XEns-CKD集成视觉Transformer模型,用超声图像分类慢性肾脏病五期及正常,准确率86.36%,结合可解释技术识别病变区域,较现有方法提升4%。

04:00
arXiv cs.CV

MVMD:一种增强镜面检测的多视角方法

多视角镜面检测方法MVMD,通过跨视图与自注意力建模镜内外关联,提升精度和IoU,增强三维重建效果。

04:00
arXiv cs.CV

基于fNIRS的自闭症分类中的时间泛化:跨时间窗口迁移基准

fNIRS自闭症分类存在时间分布偏移,跨窗口零样本准确率仅54-69%,微调可恢复至90%以上,域对抗与自监督方法无需目标数据可达78-90%。

04:00
arXiv cs.CV

下一步编辑什么:对话系统中视觉对齐的图像编辑后续建议

提出三阶段框架,用多目标强化学习与视觉验证器提升对话系统图像编辑建议,显著降低视觉不一致并提升点击率等指标。

04:00
arXiv cs.CV

COMEX: 一个基于构图的可解释美学图像裁剪基准与学习框架

提出COMEX基准和两阶段SFT+GRPO框架,联合学习裁剪、构图理解与解释生成,全面提升可解释美学裁剪性能。

04:00
arXiv cs.CV

几何胜过估计深度:Sim2Real下仅RGB多相机3D跟踪

几何一致性主导Sim2Real多相机3D跟踪:几何优先HOTA 13.0,伪激光雷达仅0.12;检测质量与定位一致性为各自瓶颈。

04:00
arXiv cs.CV

基于视觉的无人机交通监测车辆检测综述:实验洞察与未来方向

综述无人机车辆检测,指出兼容性、实时、鲁棒三大挑战,未来聚焦模型优化、边缘计算与自适应控制。

04:00
arXiv cs.CV

潜频有效性:利用筛选的视频VAE迁移算子实现快速频谱编辑

提出潜频有效性(LFV),仅部署保真提升且不加剧漂移的算子;423个中146需通道混合,速度比像素滤波重编码快3倍。

04:00
arXiv cs.CV

BRACE:用重心有理预测驯服尖锐不规则性,加速扩散Transformer推理

提出BRACE,用重心有理预测代替多项式外推,缓存稀疏特征,稳定加速扩散Transformer,质量效率最优。

04:00
arXiv cs.CV

超越各向同性假设:面向纳米级GBM分析的连续性约束分割与GPU形态测量

无需密集标注的GPU框架,以连续性约束分割各向异性图像,精准量化GBM厚度及病变增厚。

04:00
arXiv cs.CV

开放世界层次化感知:基于类别无关提议的分类学抽象,实现词汇表外道路物体的安全处理

对类别无关提议做分类学抽象,未知物体零自信误分类,94%安全处理(26%正确,69%保守未知)。

04:00
arXiv cs.CV

多模态皮肤病变分类:Swin Transformer与临床元数据融合

SwinTransformer融合临床元数据,皮肤病变分类准确率92.55%,且提升校准与可解释性。

04:00
arXiv cs.CV

基于VSWIR成像光谱的亚像元野火温度实时物理反演

提出VSWIR野火温度反演框架,用GPU加速非线性最小二乘,实现飞行内实时估计,误差约42K,并验证了空间分辨率泛化能力。

04:00
arXiv cs.CV

MAGIC-SSCIL:面向半监督类增量学习的流形锚定与几何增量校准

提出无样例存储的MAGIC框架,用软加权几何校准与结构对齐稳定特征空间,防遗忘,提升半监督类增量学习精度。

04:00
arXiv cs.CV

复杂度世界:在可验证视觉决策上基准测试视觉语言模型

提出视觉决策基准ComplexityWorld,390个任务。直接推理通过率低,GPT-5.6-Sol达75.6%,揭示视觉到决策瓶颈。

04:00
arXiv cs.CV

LAVE:面向视频工具使用智能体的潜在视觉证据增强规划

提出LAVE训练-free框架,复用工具调用的潜在视觉证据,突破文本观察瓶颈,提升视频智能体规划性能,在多个基准上显著领先。

04:00
arXiv cs.CV

多模态大语言模型的多分支策略优化

提出多分支策略优化(MBPO),以分支相对优势与时间重放缓冲改进多模态强化学习信用分配,提升优化效率。

04:00
arXiv cs.CV

牛顿GS:面向高斯场景动画的物理结构化对象级神经牛顿动力学

牛顿GS以22维物体状态和神经残差模拟动力学,用仿射变换驱动高斯场景动画,误差更低。

04:00
arXiv cs.CV

HSMLA:用于高效视觉Transformer的分层Softmax多尺度线性注意力

提出HSMLA,融合线性注意力与软max精修及多尺度卷积,在密集预测中实现高达4.2倍加速与高精度。

04:00
arXiv cs.CV

FlowErase-OPD:流匹配模型中基于锚定在线策略蒸馏的多概念擦除

提出基于在线策略蒸馏的多概念擦除框架,改善擦除与保留的平衡,性能领先。

04:00
arXiv cs.CV

利用热成像与传感器融合的深度学习进行网络硬件故障预测

热成像与功率数据融合的深度学习模型,经区域提取预处理,准确率达94%,有效预测网络硬件早期故障。

04:00
arXiv cs.CV

HeatCast:美国124个城市街区尺度地表温度预测基准

HeatCast是美国124城市30米月度地表温度预测基准,含数据评估,最优模型误差7.74K。

04:00
arXiv cs.CV

大道至简:面向超长视频理解的多键情景记忆检索

提出多键情景记忆检索框架,推理时邻域过滤与时间扩展,避免全局建模,三个长视频基准最优。

04:00
arXiv cs.CV

高速公路数据采集:一种几何、类别无关的嵌入式车辆计数方法

提出几何类无关计数法,用背景减除和虚拟线圈,无需预训练检测器,树莓派超实时,精度83%-100%。

04:00
arXiv cs.CV

基于多任务一致性的对抗攻击检测

利用多任务输出不一致性检测对抗攻击,无需额外开销,基准数据集上对投影梯度攻击检测AUC达99.9%。

04:00
arXiv cs.CV

CosmosAlign:面向生成式交通视频预测的世界基础模型适配

CosmosAlign以两阶段LoRA适配世界模型,推理时增强,获AI City Challenge 2026赛道5第一,得分76.49。

04:00
arXiv cs.CV

SpikeWorld:冻结脉冲世界模型的快速状态自适应

提出SpikeWorld:145万参数的稀疏脉冲世界模型,部署时全部冻结,仅经外部残差路径无标签自适应,显著提升预测与奖励。

04:00
arXiv cs.CV

视觉与WiFi融合:基于物理的体机械属性估计

提出视觉与射频融合框架,用材料槽估计体机械属性,提升精度与物理一致性。

04:00
arXiv cs.CV

超复数神经网络中的鬼特征与诡异迁移学习

利用超复数额外虚部生成鬼特征,并通过诡异迁移学习整合,提升神经网络效率。