11171 条条目 · 106 个活跃源
2026年7月22日
04:00
arXiv cs.CV

中文标题:AEC工程图纸布局检测与信息提取的深度学习方法基准测试

中文摘要:构建AEC专用数据集并基准测试五种深度学习模型,RF-DETR与Qwen3-VL表现最优,为自动信息提取奠定基础。

04:00
arXiv cs.CV

SWITi:使用滑动窗口内部平铺量化和减少平铺伪影

SWITi通过滑动窗口平均降低后验预测平铺伪影,引入无参考指标FRT/ASV,在荧光显微镜数据中提升重建保真度与分辨率。

04:00
arXiv cs.CV

缓解零样本视频时刻检索中的模态与语言风格差距

基于自相似性规避模态和语言风格差距,结合MLLM推理,实现零样本视频时刻检索最先进性能。

04:00
arXiv cs.CV

基于大视觉语言模型的上下文结构化视频异常检测

提出CSI-VAD,通过分解视频为环境、物体、时间三种上下文进行无训练异常检测,效果优于直接整体推理。

04:00
arXiv cs.CV

CoGoal3D: 基于3D感知融合与精化的协作式3D目标检测

提出两阶段3D协作检测框架CoGoal3D,通过3D感知融合缓解空间错位,并用点重构精化,在三个数据集上[email protected]提升超10%,达SOTA。

04:00
arXiv cs.CV

IMMoE:基于视图专家混合融合的不完整多视图异常检测

提出IMMoE,通过多视图专家融合和局部异常增强编码器,处理缺失视图异常检测,在RIMAD上像素级和图像级指标分别提升11.8%和2.8%。

04:00
arXiv cs.CV

Mage-Flow:一种高效的原始分辨率图像生成与编辑基础模型

Mage-Flow是4B参数的高效图像生成编辑模型,协同设计实现快速训练与推理,1024^2图像生成仅需0.59秒。

04:00
arXiv cs.CV

对比式在线策略蒸馏

COPD通过对比指令生成token级优势信号,促使学生模型学习更简洁高效的推理,减少推理长度且不损性能。

04:00
arXiv cs.CV

FilmWorld:通过动态电影世界建模实现小说到电影的智能体生成

提出FilmWorld智能体系统,分构建与演化两阶段将小说转化为长视频,显著提升叙事保真度与跨场景一致性。

04:00
arXiv cs.CV

Gaze-DETR:基于优先级地图自上而下引导的红外弱小无人机检测方法

提出Gaze-DETR,通过预测优先级图引导定位前特征增强,在红外弱小无人机检测上取得高精度。

04:00
arXiv cs.CV

现在你看到了仇恨:面向隐藏仇恨性幻象的自适应视图检索

提出自适应视图检索框架,通过检索-校准恢复隐藏仇恨含义,检测准确率达93.2%,大幅超越现有方法。

04:00
arXiv cs.CV

Delineate Anything v2:一种面向农田地块边界的全球基础模型

提出Delineate Anything v2,基于73M实例数据集,在100国基准上性能提升103.3%,可5.4小时完成乌克兰全国勾画。

04:00
arXiv cs.CV

使用混合几何注意力推进异构医学数据的多模态融合

提出CURE框架,通过HyFuse层高效融合异构医学数据,性能提升3.97%,计算成本降低87.8%。

04:00
arXiv cs.CV

IGGT4D:流式4D实例关联几何Transformer

在线处理视频流,统一几何与实例,构建大规模4D数据集,超越流式基线。

04:00
arXiv cs.CV

面向几何基础的3D基础模型的潜在黎曼流匹配

在VGGT潜在空间用黎曼流匹配于四超球面乘积流形,实现有效3D几何生成,性能优异。

04:00
arXiv cs.CV

文本模板Token是扩散Transformer中的隐式语义寄存器

发现结构模板Token作为隐式语义寄存器维持对象身份,提示语义间接注入;据此设计剪枝规则可减20%计算量。

04:00
arXiv cs.CV

点梯调优:面向3D点云理解的参数高效层次适应

PLT通过层次局部-全局融合和动态提示生成,仅用极少量参数在点云理解上达到最优性能。

04:00
arXiv cs.CV

ABot-World-0:在单张台式GPU上实现无限交互世界推演

提出实时长程交互视频世界模型,单GPU实现720P@16FPS流式推演,通过双向蒸馏与长程对齐保持连贯性。

04:00
arXiv cs.CV

解剖感知的CT心包分割三维网格精化

提出解剖感知3D网格精化框架,利用解剖和几何力迭代优化CT心包分割,提升精度,尤其对弱分割。

04:00
arXiv cs.CV

GATE-3D: 面向开放集三维形状检索的几何感知测试时自适应重排序

提出几何感知测试时自适应重排序,选择性融入几何信息提升3D形状检索,mAP@10提高2.00点,几何假阳性降低10.8%。

04:00
arXiv cs.CV

FlexiAvatar:任意身体可见度下的统一三维高斯人体化身

仅优化可见身体区域以消除未观察肢体伪影,借助扩散补全不可见区域,PSNR平均提升约3%。

04:00
arXiv cs.CV

CR-Refiner:面向编辑条件三维场景检索的以对象为中心的最优传输重排序器

提出CR-Refiner,基于最优传输和LLM的免训练重排序器,提升编辑条件3D检索,并发布新基准3D-CER。

04:00
arXiv cs.CV

GLID: 门控局部本征维度修复人脸伪造检测器的盲点

GLID通过冻结视觉Transformer的局部本征维度几何信号,无需训练数据即可提升跨生成器检测性能,平均AUC达0.805。

04:00
arXiv cs.CV

OmniReasoner:通过原生工具实现长音频-视频推理

OmniReasoner让模型先低成本预览,再按需高保真检查,提升长音视频推理准确性与时间定位。

04:00
arXiv cs.CV

掩码视觉动作:统一世界建模

提出掩码视觉动作的像素控制接口,15小时微调实现视觉保真与可控,用于策略评估、规划与逆向建模。

04:00
arXiv cs.CV

外观指针——扩散变换器的多模态区域控制

提出外观指针,实现扩散变换器的多模态区域控制,无需重新训练,性能达先进水平。

04:00
arXiv cs.CV

ExpertVerse: 面向知识密集型视觉合成中专家级推理的通用基准

构建ExpertVerse基准,评估生成模型知识密集型推理,训练KnowThinker并优化,揭示推理缺陷。

04:00
arXiv cs.CV

置信门控的纯视觉航向对齐用于无人机-无人车协同系统

提出置信门控框架,用面积和航向变化作代理,有界混合回退改善低置信时命令行为。

04:00
arXiv cs.CV

PathAgentBench:在全切片病理图像上评估证据探寻型视觉语言模型的基准

介绍PathAgentBench基准,评估四种能力,发现模型从全切片图像直接获取证据仍有显著差距。

04:00
arXiv cs.CV

无需训练,飞行更优:无人机导航的测试时缩放视觉语言模型

测试时缩放通过迭代细化与自修正,无需训练即提升无人机导航VLMs的规划准确性与安全性,达到SOTA。

04:00
arXiv cs.CV

潜在空间中的ERank作为图像复杂性和丰富度度量

ERank通过深度特征通道协方差的有效秩无标签度量图像丰富度,与人类复杂度高度相关(r=0.72),用于数据选择提升超分辨率与OCR性能。

04:00
arXiv cs.CV

InstructMixup:指令引导的显著补丁编辑以实现鲁棒数据增强

InstructMixup在单样本内用指令引导编辑显著补丁并混合,注入分形结构,实现鲁棒数据增强,性能超越多种方法。

04:00
arXiv cs.CV

高效学习图像压缩的波前并行化

提出无训练推理加速算法,波前并行优化自回归模型推理,加速超13倍且保持率失真性能。

04:00
arXiv cs.CV

Sarus:基于同态加密的隐私保护多供应商感知融合

Sarus框架利用同态加密实现多供应商感知融合的隐私保护,在加密域聚合检测结果,线性扩展且提升覆盖。

04:00
arXiv cs.CV

NGPS:基于深度卫星图像匹配与多速率传感器融合的无GPS空中地理定位与2.5D重建

提出NGPS框架,通过深度图像匹配与多传感器融合实现无人机无GPS绝对定位,位置RMSE仅2.94m,较单目VIO提升3.5倍,实时运行。

04:00
arXiv cs.CV

ROMS-IMLE:极简主义竞争性单步生成建模方法

提出极简单步生成模型,摒弃迭代去噪,用IMLE和卷积网络快速生成高质量样本,FID达2.56。

04:00
arXiv cs.CV

EAR-Net:从多视图图像实现端到端绝对旋转估计

提出端到端EAR-Net,通过共极置信图与可微旋转平均模块估计绝对旋转,精度速度大幅领先现有方法。

04:00
arXiv cs.CV

从距离到轨迹:无人机实时符号距离函数建图与距离加速运动规划

提出OREN-SDF建图和Bubble*规划,实现无人机实时避障,速度提升数倍。

04:00
arXiv cs.CV

基于结构化场景知识与可验证推理-动作一致性的自动驾驶认知双过程规划

提出认知双过程规划框架,以结构化链式思维表示场景知识,自动生成监督,路由快速/慢速推理并用规则验证一致性,实现80.14%精度与17.39%延迟降低。

04:00
arXiv cs.CV

PoseIDON:利用基础模型特征进行六自由度姿态估计的海底沉积物掩埋测绘

提出PoseIDON方法,结合基础模型与多视角摄影测量,实现海底物体掩埋深度估算,误差约10厘米,支持非侵入性环境评估。

04:00
arXiv cs.CV

使用扩散模型去噪蒙特卡洛渲染

扩散模型成功去噪蒙特卡洛渲染,可基于自然渲染信息条件化,性能达SOTA,生成具真实感的重建(直阴影、弯高光、无飞蚊)。

04:00
arXiv cs.CV

IBoxCLA: 通过改进的Box-dice和对比潜在锚点实现鲁棒框监督息肉分割

IBoxCLA解耦位置/尺寸与形状学习,结合改进Box-dice和对比潜在锚点,实现鲁棒框监督息肉分割,mDice/mIoU提升6.5%/7.5%。

04:00
arXiv cs.CV

AIM-CoT:主动信息驱动多模态思维链用于视觉-语言推理

提出AIM-CoT框架,通过主动信息驱动和动态触发,提升多模态思维链的视觉推理性能。

04:00
arXiv cs.CV

Great X:面向6G的弥合Sim2Real差距的统一多模态模拟器

Great-X是虚幻引擎实现的统一多模态模拟器,提供像素级同步数据,有效弥合Sim2Real差距,性能优于现有方案。

04:00
arXiv cs.CV

阅读还是忽略?视觉-语言模型中排版攻击鲁棒性与文本识别的统一基准

提出RIO-VQA任务与RIO-Bench,揭示防御中目标识别与文本阅读的权衡,提供数据驱动基线改善两者。

04:00
arXiv cs.CV

用于细节敏感且成本高效的U-Net变体解码器的SUPER模块

SUPER模块以小波域频率抑制替代空间上采样,在提升细节精度的同时大幅降低解码器计算成本。

04:00
arXiv cs.CV

3D疼痛:生成可控合成面部用于自动疼痛评估

提出3DPain合成数据集及ViTPain模型,通过可控面部生成与身份感知注意力,解决疼痛评估中的数据稀缺与偏差问题。

04:00
arXiv cs.CV

连续上下文:基于指令图像编辑的连续强度控制

提出通过标量强度实现编辑效果从无到有的连续控制,无需特定属性训练。

04:00
arXiv cs.CV

FedS2R:面向自动驾驶合成到真实语义分割的单次联邦域泛化

提出首个单次联邦域泛化框架FedS2R,通过数据增强与知识蒸馏实现合成到真实语义分割,全局模型性能接近集中式训练。

04:00
arXiv cs.CV

玻璃表面检测:利用闪光/无闪图像中的反射动态

提出NFGlassNet,利用闪光/无闪图像的反射动态,含反射对比挖掘与注意力模块,玻璃检测性能超越现有方法。