11091 条条目 · 106 个活跃源
2026年8月6日
04:00
arXiv cs.CV

LoRetta:面向全球尺度遥感稠密影像匹配的基础模型与大规模数据集

LoRetta将稠密匹配重构为定位-配准,构建全球多时相基准LEVIR-GM,AUC达83.3%,超越基线,延迟降低47.8%。

04:00
arXiv cs.CV

利用深度学习推进电线杆与标志检测

基于DETR检测电线杆和标志,精度达90.43%和88.26%,倾斜角误差1.01度,并公开数据集。

04:00
arXiv cs.CV

PADFormer:基于稀疏视角图像的姿态无关异常检测

提出姿态无关异常检测新模型,用ViT直接重建无异常图,免3D重建,在PAD基准最优,少样本检测亦佳。

04:00
arXiv cs.CV

GEB-Bench:多声部讲述的抽象结构

新基准测试抽象结构的多声部识别,失败有规律:模型能识别单声部,但跨声部映射普遍失败,仅前沿模型能缩小差距。

04:00
arXiv cs.CV

感知先于推理:视频理解与问答中的动态潜在推理

提出动态潜在推理法,先感知后按需推理,在九项视频问答基准上提升准确率,生成少于20个词元。

04:00
arXiv cs.CV

教基础模型读懂毫米波:用于人类行为理解的姿态引导运动学表示

提出mmMind,以3D姿态监督雷达编码器预训练,结合语言模型实现行为理解,性能优于基线。

04:00
arXiv cs.CV

TRNet:地形引导的频率校正与结构感知解码用于多模态水稻田分割

提出TRNet,融合高程与坡度校正地形干扰,联合语义边界内部分割,水稻IoU提升9-19个百分点,减少陡坡误检。

04:00
arXiv cs.CV

Radar4D-VLM:冻结语言模型上的提议引导时序4D雷达推理

提出仅用4D雷达的时序VLM,通过提议引导令牌化实现场景与运动推理,目标召回达98.13%,优于基线。

04:00
arXiv cs.CV

TriCLE:面向边缘部署细粒度聚类的三模态视觉-语言推理

TriCLE从单张RGB图像生成热像与深度图,融合文本在紧凑骨干上聚类飞机,GSPO策略达78%准确率,量化后可部署于8GB边缘设备。

04:00
arXiv cs.CV

RUTA:基于率-效用优化的原则性视觉令牌分配

RUTA用率-效用优化联合决策视觉令牌的保留与数量,仅用2%-4%令牌维持88%-94%性能。

04:00
arXiv cs.CV

SIGNPOST-Bench:多模态大语言模型中文本-视觉冲突消解基准

提出SIGNPOST-Bench基准,用对抗文本干扰图像定位,使误差增大4.8倍,揭示多模态模型易受冲突文本误导。

04:00
arXiv cs.CV

将生物特征与AI智能体标识绑定以实现授权委托

提出BIND框架,将人脸生物特征与AI代理标识绑定,实现授权委托与身份审计,零误配时真匹配率达96%。

04:00
arXiv cs.CV

CLIP-CC-Bench:评估视频-语言模型中的段落级视频描述

提出CLIP-CC-Bench评测套件,基于电影长视频段落描述,集成多种LLM嵌入模型与双重语义匹配,评测17个视频语言模型并发布代码。

04:00
arXiv cs.CV

内容感知图像缩放中接缝裁剪的分析与实现

接缝裁剪实现内容感知缩放,含前向能量与掩码保护,支持缩小放大,分析复杂度与效果。

04:00
arXiv cs.CV

Poly-OPD:面向能力可选流模型的异构多教师在线策略蒸馏

提出Poly-OPD框架,融合异构教师互补能力至单一流模型,经像素桥与适配器消除干扰,按差距课程训练,显著提升文本生成图像性能。

04:00
arXiv cs.CV

iStructTab:图像与表格数据多模态学习的结构化特征排序

针对图像与表格数据,提出图增强描述符排序算法,优化特征序列,提升多模态学习性能与鲁棒性。

04:00
arXiv cs.CV

重探扩散数据生成实现跨域少样本目标检测的免费午餐增强

提出SITN,以定制噪声与背景修复分别应对视觉和语义域差,合成有效数据,跨域少样本检测达新最佳。

04:00
arXiv cs.CV

OmniVR:面向退化历史影片修复的联合视频-音频条件生成

首个联合音视频生成修复模型,基于统一多模态DiT,修复模糊噪声等退化,视听指标全面超越现有方法。

04:00
arXiv cs.CV

ReGround:通过自我诊断与视觉重检恢复多步推理中的视觉锚定

ReGround通过自我诊断与图像重注入恢复多步推理的视觉锚定,无需改架构,显著提升多基准效果。

04:00
arXiv cs.CV

基于CNN-QNN混合模型与优化相关特征的图像分类

提出优化卷积特征相关性以匹配量子神经网络纠缠结构,发现中等相关性可提升分类精度与稳定性。

04:00
arXiv cs.CV

锚点思考:锚定且高效的文档推理

提出ADOPD 2026,将页面元素转为视觉锚点,实现区域语义标注、接地生成与密集计数,迈向锚点文档推理。

04:00
arXiv cs.CV

CofactVLA:通过反事实干预为视觉-语言-行动模型去混杂

提出CofactVLA框架,通过反事实干预消除视觉混杂,解决语言指令被覆盖问题,真实场景成功率提升52.3%

04:00
arXiv cs.CV

muSync-GS:天气与道路几何危险的物理同步驾驶视频合成

提出物理同步框架,将天气与路面起伏同时耦合到车辆动力学与视频编辑,精确重现危险场景中的车辆响应。

04:00
arXiv cs.CV

Season:面向迁移性对抗攻击的频谱感知正交梯度细化

频谱感知正交梯度细化分离低高频低显著性引导高频至背景正交投影降干扰增强八种攻击平均提升6.6个百分点

04:00
arXiv cs.CV

UBLLIE:统一背光与低光图像增强

提出无监督统一框架,结合CLIP提示学习与残差U-Net,提升背光及低光图像质量,超越现有方法。

04:00
arXiv cs.CV

预测,然后检索:基于视频前缀的跨实例未来状态检索

提出预测状态检索任务,结合预测与跨实例检索;构建基准并发现预测是核心挑战,LFTR以低推理成本缩小差距。

04:00
arXiv cs.CV

Faster-WAM:面向鲁棒世界动作模型的高效推理时未来条件化

提出高效未来条件化世界动作模型,稀疏融合降计算,成功率升至73.57%,速度提升2.21倍,鲁棒性强。

04:00
arXiv cs.CV

全向路由:PCB布线中约束感知空间推理的语义耦合多模态基准

首个语义耦合PCB布线推理基准,含1681个设计、四任务,揭示大模型在约束与电气功能上的不足。

04:00
arXiv cs.CV

预见不可见:叶化石图像的模态补全重建

AmodalDINO联合预测可见完整叶与脉序,合成训练达95%Dice,可4位量化浏览器离线运行。

04:00
arXiv cs.CV

工具艺术家:使用工具的统一多模态模型实现智能体图像生成

提出工具艺术家,将统一多模态模型后训练为全自主智能体,统一编排推理、工具与图像生成,性能超固定流程。

04:00
arXiv cs.CV

Q-CueGraph:面向多模态推理的查询条件视觉证据图

提出Q-CueGraph,将问题映射为预算化坐标级观察,无需区域框监督,冻结reader下用19%面积在V*Bench达0.833。

04:00
arXiv cs.CV

GeoReward:缓解视觉语言模型中的上下文变量过估计以实现跨市场偏好预测

提出GeoReward,通过市场感知检索增强、上下文引导视觉调制、选择性敏感损失,缓解VLM对主导线索过估计,提升跨市场广告偏好预测。

04:00
arXiv cs.CV

TwinIR:面向在线高精地图构建的协同隐形双点攻击

提出近红外隐形双点物理攻击,协同优化干扰点以抑制边界几何补偿,显著降低在线高精地图构建精度并引发危险规划。

04:00
arXiv cs.CV

并非所有冗余标记都相同:通过标记角色分析视觉标记剪枝

研究发现视觉标记剪枝方法对标记角色有不同偏好,但与性能无直接关联;保留非活跃标记有时能维持或提升性能。

04:00
arXiv cs.CV

超越全局路由聚合:面向MoE视觉语言模型的阶段感知专家合并

提出阶段感知专家合并,以相位归一化路由保留专家角色,优于全局聚合,性能提升达9.6%。

04:00
arXiv cs.CV

REZE:基于识别的零样本视频时间定位

提出免训练REZE方法,分片打分并确定性聚合,提升视频时间定位性能,刷新零样本SOTA。

04:00
arXiv cs.CV

DIVE:面向高效视觉语言模型的动态迭代视觉证据构建

DIVE动态迭代选取视觉token,构建互补证据,减少88.9%视觉token仍保持98.2%性能,实现高效推理。

04:00
arXiv cs.CV

EndoVLM:基于解剖引导稀疏性与渐进对齐的内镜视觉-语言预训练模型

内镜视觉语言预训练模型采用解剖引导稀疏池化与渐进对齐在34.8万例上预训练优于现有模型零样本泛化强

04:00
arXiv cs.CV

隐私保护动作识别:分类、方法与隐私-效用权衡

综述32篇论文,划分五类方法,指出评估薄弱、权衡显著,提出统一评估协议与路线图。

04:00
arXiv cs.CV

降采样图像训练何时产生相同梯度?

降采样梯度差异由噪声项和固定下限组成,0.65-0.95噪声窗可保梯度,LoRA省时14.6%

04:00
arXiv cs.CV

CARVE:跨切片各向异性视觉证据重分配,实现高效三维医学体积理解

CARVE以训练无关方式压缩三维医学影像视觉令牌,按证据非均匀分配预算,减少80%令牌仍保留98.1%性能。

04:00
arXiv cs.CV

VoxStruct3D:针对体素空间三维MRI合成的结构引导流匹配

提出体素空间流匹配方法,以结构为先导生成三维磁共振图像,实现解剖连贯与高视觉质量,综合性能最优。

04:00
arXiv cs.CV

ACA-GS:自适应容量锚定高斯溅射,用于紧凑动态辐射场

提出自适应容量锚定高斯溅射,按时空需求动态分配神经高斯与特征,减存储保质量,压缩率提升1.5倍。

04:00
arXiv cs.CV

OutLangSplat:无人机户外场景的三维语言高斯泼溅

针对无人机户外场景遮挡和远距离问题,提出双分支特征表示与无训练聚合策略,提升开放词汇分割与定位性能,并首个开源相关数据集。

04:00
arXiv cs.CV

ColorFD:面向遥感目标检测的有限差分引导黑盒物理对抗攻击

提出ColorFD,用纯色补丁与差分进化实现黑盒物理攻击,有限差分定位关键区域,提升攻击效果。

04:00
arXiv cs.CV

物理心智:从视频到可执行世界,实现免训练物理推理

PhysMind从视频构建可执行世界,免训练物理推理,反事实问答超GPT-5.5

04:00
arXiv cs.CV

Talk2Sensors:自动驾驶中基于传感器自适应物理线索匹配的三维视觉定位

提出首个多传感器三维视觉定位数据集及框架,用语言引导传感器自适应融合物理线索,自动驾驶性能领先。

04:00
arXiv cs.CV

场景文本图像超分辨率的连续-离散耦合生成

提出DualTSR,将场景文本超分建模为连续-离散耦合生成,免外部OCR先验,高效且多项指标最优。