10762 条条目 · 106 个活跃源
2026年9月25日
04:00
arXiv cs.CV

DeltaWAM:面向双臂操作的增量世界动作模型

提出DeltaWAM,联合预测视觉增量与动作,并用流式增量记忆提升双臂操作成功率、降低计算与延迟。

04:00
arXiv cs.CV

动作表示中的方向-尺度分解:重新思考视觉-语言-动作模型的词元化对象

DSD将动作增量分解为方向与尺度再词元化,提升离散词元VLA成功率,并缓解混合数据训练的性能下降。

04:00
arXiv cs.CV

MoVISA:面向视频目标分割的多令牌推理

MoVISA 用多分割令牌跨帧表示目标,实现语言与时空掩码细粒度对齐,MeViS 基准 J&F 提升 13.2%。

04:00
arXiv cs.CV

M²PFN:面向阿尔茨海默病可泛化多模态上下文学习的端到端解耦对齐

提出M²PFN,将TabPFN扩展为多模态阿尔茨海默病诊断模型,端到端解耦对齐,在ADNI及外部队列上泛化优于基线。

04:00
arXiv cs.CV

看起来相同,答案却不同:面向鲁棒视觉语言推理的翻转方向引导

提出免训练方法FlipDir,以低秩翻转子空间引导解码抑制VLM答案翻转,构建VisFlip基准。

04:00
arXiv cs.CV

面向语言引导医学图像分割的多模态路由与区域细化

提出MRSeg:以图像-文本对路由特征适配,区域桥细化,仅7.11M参数即达领先精度。

04:00
arXiv cs.CV

MEVL-STP:面向任意形状场景文本检测与识别的多编码器与视觉语言模型

提出多编码器分割与视觉语言模型识别两阶段法,生成多边形掩码,无需合成预训练,CTW1500端到端H均值85.86%。

04:00
arXiv cs.CV

PlenoCI:面向视角依赖感知变化分类的全光特征

从3DGS解析推导全光导数特征PlenoCI,忽略朗伯纹理、捕获视角依赖行为,用于变化分类,误报低两个数量级。

04:00
arXiv cs.CV

HelloWorld:迈向生成式驾驶世界模型的实际应用

提出2B驾驶世界模型HelloWorld,实现多传感器可控生成与高效交互式仿真。

04:00
arXiv cs.CV

利用多模态大语言模型中的目标知识实现鲁棒的少样本分割

提出MK-FSS,用MLLM挖掘查询图像的空间与语义知识,经双记忆融合与跨模态提示增强少样本分割鲁棒性。

04:00
arXiv cs.CV

ViRDM:驾驭表征分布匹配,实现少步因果视频生成

ViRDM免教师与评论器,仅后训练生成器,20次更新使少步因果视频生成VBench达84.87,省显存耗时。

04:00
arXiv cs.CV

RGBD20K:面向RGB-D语义分割的大规模基准

提出RGBD20K数据集,覆盖160类、2万对RGB-D图像,并提出SPF融合方法,刷新各基准最优性能。

04:00
arXiv cs.CV

基于透过率提取与距离对齐的无源长波红外高光谱测距

提出TEDA法:解耦测距与温度-发射率反演,先提取大气透过率再按距离对齐,降低偏差并提速约20倍。

04:00
arXiv cs.CV

分数之下:重新思考视频理解模型的幻觉评估

提出因果阶段干预法,发现定位是视频理解幻觉主因,其影响约为视觉观察的四倍,现有基准难以预测可靠性。

04:00
arXiv cs.CV

仅所见之物:3D高斯泼溅中视角相关外观的观测格拉姆压缩

以每高斯观测格拉姆矩阵为失真度量压缩球谐颜色,免训练下提升PSNR并缩减体积。

04:00
arXiv cs.CV

幻觉栖身何处:VQ 分词视觉语言模型中的跨架构回路

定位VQ分词视觉语言模型共有的早期层注意力路由回路,仅消融L0可使开放生成物体幻觉相对降31%。

04:00
arXiv cs.CV

WildHSR:基于3D基础模型的度量前馈式4D人物-场景重建

3D基础模型前馈重建带度量尺度与人物身份的4D人物-场景,EMDB-2/RICH领先,10.1 fps。

04:00
arXiv cs.CV

利用卫星影像中的答案不变冗余实现边缘端高效VLM推理

Rift利用答案不变冗余剪枝与弹性预填充,边缘端能耗降78%、延迟降69%,准确率升至73%。

04:00
arXiv cs.CV

FluidRain:不可压缩雨流作为环中环视频去雨的注意力偏置

提出FluidRain,以无散度雨流为注意力偏置,跨尺度邻帧循环聚合,仅0.80M参数,并设新基准。

04:00
arXiv cs.CV

EIB-Net:面向可泛化AI生成图像检测的熵引导信息瓶颈

EIB-Net以熵引导信息瓶颈选取低熵图块,学习紧凑泛化特征,检测AI生成图像;仅2%数据达85.7%准确率,跨生成器泛化强。

04:00
arXiv cs.CV

看见不等于测量:面向视觉语言模型的工具增强度量空间推理

为小型VLM加装几何工具,把度量计算移出模型权重:绝对距离MRA由0.46升至0.74,相对距离、方向大幅提升,编排开销仅0.03。

04:00
arXiv cs.CV

少即是多:仅编码器的音视频分割

提出仅编码器的EASE音视频分割方法,速度达365FPS,比最优模型快3倍,取得SotA性能。

04:00
arXiv cs.CV

扩散蒸馏分布匹配中的谱幅度净化

提出即插即用SAP-DMD,调制扩散蒸馏方向场幅度谱以抑制低频主导,促进细节恢复并提升少步采样质量。

04:00
arXiv cs.CV

FoCal:面向航拍可见光-红外目标检测的频率导向跨模态交互与光谱校准

提出FoCal,通过频率感知双域校准与差异引导光谱调制实现跨模态交互,三数据集上精度与效率领先。

04:00
arXiv cs.CV

UpDown-SC:面向室内LiDAR地点识别的重力规范化双包络Scan Context

提出免训练极坐标描述子UpDown-SC,重力规范化后构建上下双包络,提升室内及安装高度变化下LiDAR地点识别可靠性。

04:00
arXiv cs.CV

Med-AR:面向长尾胸部X射线分类与不确定性感知评估的自回归视觉-语言预训练

提出Med-AR-8B/2B放射学自回归视觉语言预训练模型,长尾胸片分类优于对比方法,尾部识别与选择性预测更佳。

04:00
arXiv cs.CV

ComplexSync:复杂场景下的高保真实时唇形同步

提出基于扩散的统一框架ComplexSync,通过双流联合训练、蒸馏加速与关系对齐损失,在复杂场景下实现超70FPS的实时高保真唇形同步。

04:00
arXiv cs.CV

面向后续岩土工程分析的多时相采场点云自动地理配准技术

提出3D-TARGeT,用低成本标签自动地理配准采场点云,多时相扫描达厘米级,优于常用方法。

04:00
arXiv cs.CV

地球观测嵌入中可恢复的地理位置信息

三种地球观测模型嵌入均可恢复地理位置,AlphaEarth最佳;建议地理信息含量纳入模型审计。

04:00
arXiv cs.CV

FounRef:基于稀疏锚点的冻结单目基础先验的鲁棒、保结构、快速度量精化

FounRef免训练,用稀疏锚点校验对齐冻结单目基础先验,快速生成保结构稠密度量深度,精度鲁棒性俱佳。

04:00
arXiv cs.CV

ImCorr:通过隐式特征解码实现亚像素级语义对应

ImCorr以连续隐式特征解码消除网格量化误差,提升细粒度语义对应,[email protected]提高6.2个百分点。

04:00
arXiv cs.CV

SARFusion:面向鲁棒相机-LiDAR 3D目标检测的场景感知路由融合

提出SARFusion,将相机-LiDAR融合重构为场景感知分支路由,逐查询自适应选择相机、LiDAR或融合分支,增强鲁棒3D检测。

04:00
arXiv cs.CV

PHOSA:照片级真实3D手语数字人建模与基准

发布与聋人专家共建的多视角中文手语数据集,提出混合SMPL-X拟合与解耦式3D手语数字人建模,高保真并泛化单目视频。

04:00
arXiv cs.CV

IronViT:迈向高效通用视觉表示学习

该模型先整合多专家能力再约束计算,经注意力桥蒸馏并迁移至混合注意力编码器,兼顾通用表征与高分辨率效率。

04:00
arXiv cs.CV

TOLA:面向扩散式文本图像超分辨的文本感知单步潜在适配

提出TOLA单步潜在适配,以置信度加权文本条件与潜在残差校正抑制OCR误识、恢复笔画,达最优性能。

04:00
arXiv cs.CV

视觉语言模型的域重定心与置信度加权先验校准

提出免训练CLIP校准法DRC,经高斯混合重定心与置信度加权先验校正,跨域精度最高且优于零样本。

04:00
arXiv cs.CV

双曲多模态持续学习:一种最近容许解

提出HMCL,将保持旧多模态几何化为共享双曲等距,用最近容许校正修正更新,显著减少漂移并提升性能。

04:00
arXiv cs.CV

纵向视野的深度学习预测青光眼进展速率并识别快速进展者

GLAM深度学习模型仅凭纵向视野序列即可预测青光眼进展速率,识别快速进展者AUC达0.990。

04:00
arXiv cs.CV

基于可解释神经网络的协同DCT图像去噪极限研究

提出可微架构DeepBM3D,融合非局部分组、DCT域维纳滤波与多阶段细化,超越经典基线,重复纹理表现尤佳。

04:00
arXiv cs.CV

SEE Challenge 2026:宽光照范围内的事件引导亮度调整

赛事用SEE-600K评测宽光照事件引导亮度恢复,PSNR排名,15份提交;极暗下各系统仍见误差。

04:00
arXiv cs.CV

学习一种面向自监督表示的流

提出非对抗FBDM,以球面条件速度回归学习自监督表示,近DM且提速1.48–1.83倍,有理论保证。

04:00
arXiv cs.CV

AgriCountDINO:面向农业的参数高效示例引导计数与定位

AgriCountDINO以示例引导、仅8.4M参数实现农业目标计数与定位,三样本MAE 11.92,零样本MAE 14.25。

04:00
arXiv cs.CV

基于不确定性感知视觉Transformer的多民族近视与非近视人群青光眼检测:一项多中心模型开发与验证研究

ViT模型基于5.6万张眼底照片,经16个跨国数据集验证,青光眼AUROC最高99.6%,高度近视下优于医生。

04:00
arXiv cs.CV

面向视觉语音识别的姿态自适应动态FiLM调制

提出姿态自适应动态FiLM框架,DR-FiLM动态预测权重调节调制强度,显著降低音素错误率。

04:00
arXiv cs.CV

面向12导联心电图分类的混合CNN—状态空间—注意力主干网络与联合嵌入预测预训练

提出混合CNN-状态空间-注意力主干与JEPA隐空间预训练,提升12导联ECG分类及少标签迁移性能。

04:00
arXiv cs.CV

智能游艇码头试验平台中面向场景特定船舶检测的帧到全景定位与上下文感知采样

提出帧到全景定位与上下文感知采样,4万帧减至220张,微调YOLO26-m船舶检测AP50达94.78%。

04:00
arXiv cs.CV

基于可微仿真与辐射场分解的超声成像阴影抑制

RFlash可微辐射场分解超声图像并重渲染抑制声影,改善胎儿脑评估,无需原始数据或硬件改动。

04:00
arXiv cs.CV

密集覆盖,稀疏精修:字节受限的协同感知

提出覆盖-精修协同感知:全图粗传加高价值区域精修,按需分配比特,1.87KB下达0.60 AP。

04:00
arXiv cs.CV

面向阿尔茨海默病检测的在线手写片段级风险发现

提出NormPaST-Risk,用片段级风险发现实现可解释在线手写AD检测,DARWIN上性能领先。

04:00
arXiv cs.CV

基于视觉潜空间缺陷锚定推理的工业异常检测

Anomaly-LR于视觉潜空间做缺陷锚定推理,构建IAD-LR-22K数据集,无需外部工具即达最优。