11301 条条目 · 106 个活跃源
2026年6月29日
04:00
arXiv cs.CV

混元图像3.0技术报告

混元图像3.0开源800亿参数MoE模型,13亿激活,性能媲美最先进模型。

04:00
arXiv cs.CV

关于具身AI世界模型的综合综述

综述了具身AI世界模型,提出三轴分类法,分析了数据指标与开放挑战,强调物理一致性与计算效率权衡。

04:00
arXiv cs.CV

GraphPilot:基于场景图条件的语言驱动自动驾驶

提出场景图条件方法,将结构化关系融入语言驾驶模型,显著提升性能且无需测试时输入。

04:00
arXiv cs.CV

SynSeg:端到端开放词汇语义分割中多类别对比学习的特征协同

SynSeg提出多类别对比学习与特征协同结构,弱监督下提升语义分割性能,mIoU提升0.6%-8.9%。

04:00
arXiv cs.CV

PhysChoreo: 具有部件感知语义锚定的物理可控视频生成

提出PhysChoreo框架,从单图生成物理真实可控视频,优于现有方法。

04:00
arXiv cs.CV

计算机生成全息术中的复值二维高斯表示

提出复值2D高斯基元全息表示,参数空间缩减5:1,优化加速50%,PSNR提升13dB,渲染提速3200倍。

04:00
arXiv cs.CV

超越序列距离:模态间距离不变的位置编码

提出DIPE位置编码,解耦模态间/内位置,消除距离惩罚,稳定长上下文视觉感知。

04:00
arXiv cs.CV

超100FPS即时表现力高斯头部化身

前馈编码器单图转3D一致快速表现力头部,轻量局部融合,107FPS质量可比,速度提升3-4数量级。

04:00
arXiv cs.CV

当提示变得可视化:面向大型图像编辑模型的视觉中心越狱攻击

VJA通过纯视觉输入实现越狱攻击,成功率达80.9%,并引入内省多模态推理防御。

04:00
arXiv cs.CV

基于置信度蒸馏的门控关系对齐实现高效视觉语言模型

GRACE通过置信门控蒸馏与关系对齐,量化模型超越FP16基线,3倍吞吐量,54%内存节省。

04:00
arXiv cs.CV

基于视频到视频翻译的随机桥接视频对象移除

本文提出随机桥接模型,将视频对象移除重构为视频到视频翻译,利用输入视频先验指导,通过自适应掩码调制,显著提升视觉质量与时序一致性。

04:00
arXiv cs.CV

维护证据链:视频时间定位中免训练令牌剪枝的语义证据分配

SemVID通过语义证据分配,在仅用12.5%视觉令牌时保留95.4% mIoU,预填充加速5.8倍。

04:00
arXiv cs.CV

MPFlow:多模态后验引导流匹配用于零样本MRI重建

提出MPFlow,利用辅助MRI模态的预训练PAMRI实现跨模态引导零样本重建,仅需20%采样步数即可匹配扩散基线质量,并将肿瘤幻觉减少15%以上。

04:00
arXiv cs.CV

RAE-NWM:密集视觉表示空间中的导航世界模型

RAE-NWM利用密集视觉特征与条件扩散Transformer建模导航动态,通过时间门控提升动作精度,改善规划导航。

2026年6月26日
04:00
arXiv cs.CV

使用混合机器学习和图像处理方法预测水果质量

结合图像处理与深度学习的混合方法评估水果新鲜度,实时准确率超90%,无需高算力。

04:00
arXiv cs.CV

一种用于激光焊接预测熔透深度和形态的多任务时空深度神经网络

基于熔池图像提出多任务时空深度学习模型,预测熔透状态、深度和形态,准确率高达99.35%。

04:00
arXiv cs.CV

深度伪造基准测试衡量了什么?——基于冻结自监督表示的审计

用自监督表示线性探针审计发现,深度伪造基准测试更多衡量通用模态理解而非取证能力,高分未必反映真实威胁。

04:00
arXiv cs.CV

中文标题

通过fMRI迁移学习将认知任务谱系从单源扩展到多源,发现运动状态跨范式迁移受限,工作记忆状态在预算约束下具有高优先级。

04:00
arXiv cs.CV

中文标题:LCG:基于稀疏关系注意力机制的长上下文一致性图像生成

中文摘要:提出LCG框架,利用稀疏关系注意力和路由一致性约束,实现长序列多图像生成的一致性与可扩展性。

04:00
arXiv cs.CV

GeMoE:门控熵——基于MoE的大型视觉语言模型中不确定性感知自适应路由的关键

GeMoE通过门控熵自适应路由,保留99.5%性能,提升36.5%专家激活稀疏性。

04:00
arXiv cs.CV

超越美学:量化浑浊场景中的信息损失

提出TUB数据集与PCD指标,量化浑浊水下结构信息损失,与实例分割性能强相关。

04:00
arXiv cs.CV

通过可微分搜索在视觉基础模型中发现层特定提示融合

提出可微分搜索发现层特定提示融合方案,混合融合优于单一方案,有效提升视觉提示调优性能。

04:00
arXiv cs.CV

DocArena:将原始文档转化为可控的文档搜索代理训练环境

DocArena自动化构建多模态文档搜索训练环境,无需人工标注,显著提升搜索代理性能。

04:00
arXiv cs.CV

自监督城市树木生物量估算:机载LiDAR与光学观测

提出自监督框架,利用LiDAR与光学数据估算城市树木冠级生物量,R²约0.6,生成双时相数据库,无需人工标注。

04:00
arXiv cs.CV

DinoLink:面向带宽受限的协作式V2X感知的令牌中心表示压缩框架

DinoLink采用双稀疏架构与残差向量量化,实现139倍比特率压缩,保持32.8% mAP,窄带环境下加速34.5倍。

04:00
arXiv cs.CV

保持警惕:通过反事实视觉对齐缓解多模态大语言模型中的视觉懒惰

提出VIGIL框架,通过反事实视觉对齐与几何约束最大化视觉-响应互信息,缓解多模态大模型视觉懒惰幻觉。

04:00
arXiv cs.CV

从粗到细:非刚性三维形状匹配的混合自监督方法

提出双分支粗到细混合自监督法,结合拉普拉斯与弹性基,非刚性形状匹配达SOTA,高效抗噪。

04:00
arXiv cs.CV

基于多模态深度学习的高光谱卫星图像甲烷羽流分割

提出多模态深度学习模型,以低计算成本实现高精度甲烷羽流分割,提升监测效率。

04:00
arXiv cs.CV

主动对抗扰动驱动的关联记忆检索用于RGB-事件视觉目标跟踪

提出APRTrack框架,通过分层对抗扰动与关联记忆检索,应对模态退化与目标不完整,实现鲁棒RGB-事件跟踪。

04:00
arXiv cs.CV

神经体素动力学:通过体素特征平流学习隐式三维物理

提出自监督框架,通过体素特征平流从视频学习隐式三维物理,无需物理引擎,实现异质现象模拟,长期稳定。

04:00
arXiv cs.CV

从幻觉到接地:通过CRISP诊断视觉空间智能

CRISP通过一致性诊断视觉空间智能,揭示专有模型推理与感知脱节,开源模型缺乏多跳组合推理。

04:00
arXiv cs.CV

PhyEditBench:面向物理感知图像编辑的真实世界多阶段基准

提出PhyEditBench评估图像编辑的物理理解,发现现有方法局限,并利用视频生成作为推理机制。

04:00
arXiv cs.CV

遗忘、预判与自适应:长视频的测试时训练

提出帧遗忘网络,用三帧和惊奇度自适应窗口,大幅降低长视频测试时训练计算量,高效保留时序上下文。

04:00
arXiv cs.CV

感知、裁决与进化:基于事后洞察的自优化取证智能体用于AI生成图像检测

提出自进化取证框架ForeAgent,融合多域特征感知与裁决,通过事后洞察驱动迭代自优化,在AI生成图像检测中达SOTA性能。

04:00
arXiv cs.CV

SpaceRipple:面向任务的低轨地球观测卫星网络的轻量级语义传输

SpaceRipple框架实现语义传输,省带宽提性能。

04:00
arXiv cs.CV

位置重绑定缓存复用:面向交错多模态推理的无重放视觉重访

PRCR通过重绑定位置兼容坐标复用历史视觉缓存,避免重放,准确率提升5%,计算量降低数万倍。

04:00
arXiv cs.CV

DeCoFlow:面向持续异常检测的归一化流结构分解方法

DeCoFlow通过冻结基与低秩适配器分解子网,实现持续异常检测SOTA(MVTec 98.40%,VisA 93.00%)且参数零遗忘。

04:00
arXiv cs.CV

DiCoBench:基于差异与共性视觉线索的多图像细粒度感知基准

DiCoBench提出高分辨率多图像细粒度基准,含差异与共性两类任务,现有模型准确率远低于人类98.3%。

04:00
arXiv cs.CV

TaskTok:深入探究任务驱动图像恢复中的任务令牌

TaskTok通过可学习的令牌开关和轻量模块选择性恢复任务相关令牌,高效提升图像分类、分割、检测等下游任务性能。

04:00
arXiv cs.CV

LogicIR:用于图像恢复的逻辑门网络

首个逻辑门网络图像恢复模型,UNet架构实现高效计算,性能强且成本极低。

04:00
arXiv cs.CV

在挑战性条件下用于鲁棒手术多任务学习的时间一致标签插值

提出FAROS框架,利用流引导标签插值生成时间一致密集伪标签,平衡时空监督,提升手术多任务学习鲁棒性。

04:00
arXiv cs.CV

FracEvent:基于分数阶弛豫像素动力学的事件相机模拟

分数阶弛豫动力学模拟事件相机像素生命周期,保留状态改善事件时序,在下游任务中表现更优。

04:00
arXiv cs.CV

Disco-LoRA: 面向多概念视频定制的内容、风格与运动的解耦组合

Disco-LoRA解耦内容、风格与运动,两阶段实现多概念视频定制,保持外观、风格和运动可控。

04:00
arXiv cs.CV

LayersReg:一种用于可靠术中3D/2D配准的逐层渐进回归器

LayersReg模拟迭代优化,在特征空间逐层搜索像素流趋势,实现高精度术中配准,误差仅0.68°和1.41mm。

04:00
arXiv cs.CV

容量可控的多视图3D高斯泼溅风格化

通过容量控制和最优传输,解决多视图风格一致性问题,保留语义结构。

04:00
arXiv cs.CV

从掩码到概念:通过高效测试时概念嵌入搜索实现自动提示的SAM3用于少样本标注

提出M2C框架,在冻结SAM3中自动搜索概念嵌入,结合不确定性估计主动标记需修正样本,实现高效少样本医学图像标注。

04:00
arXiv cs.CV

基于三轴向感兴趣区域和多任务学习的颅内动脉瘤分类与分割

提出多任务框架,实现13部位4模态动脉瘤分类分割,采用三轴ROI及双解码器,获RSNA第二名。

04:00
arXiv cs.CV

PhysEditWorld:面向可编辑物理世界模型的大规模数据集

引入含重力参数的多模态数据集PhysEditWorld,支持可控物理编辑,提升动态建模一致性。

04:00
arXiv cs.CV

鲁棒洋葱:噪声下逐层剖析开放词汇目标检测器

研究发现开放词汇检测器鲁棒性主要受视觉骨架和特征崩溃影响,预训练策略、注释等贡献小,图像域主导,轻量级方法可显著提升。

04:00
arXiv cs.CV

从多视图图像中提取神经材质

NeuMatEx可微逆渲染法借助大型材质重建模型初始化和不确定性指导,从多视图图像提取神经材质,效果优于PBR方法。