10772 条条目 · 106 个活跃源
2026年9月24日
04:00
arXiv cs.CV

S2A:面向免对齐RGB-T显著目标检测的语义到空间对齐

提出S2A框架,先语义交互后空间校准,缓解免对齐RGB-T显著检测的错位特征污染,性能领先。

04:00
arXiv cs.CV

超越平衡准确率:面向无人机电力线路巡检中视觉语言与纯视觉缺陷评估的分辨率与对等性受控基准

构建ElecVQA-Bench受控基准,审计六项评估变量,发现视觉语言模型在无人机电力线缺陷评估中无稳定优势。

04:00
arXiv cs.CV

生成式视频压缩的信息容量:量化同等质量下的码率—算力交换

提出信息容量指标,量化等质量下码率与解码算力的交换,14B解码器效率约是1.3B的十倍。

04:00
arXiv cs.CV

混合高斯表示:面向鲁棒开放词汇3D分割的多视角物体关联与边界细化

提出混合高斯统一3D表示,联合多视角物体关联与语义对比学习,并优化边界重建,LERF上mIoU达59.1%。

04:00
arXiv cs.CV

空间不可见,时间可见:面向GUI智能体的运动视觉CAPTCHA

运动视觉CAPTCHA靠时序分离隐藏语义;600例基准中人类99.6%,最佳GUI智能体16.8%。

04:00
arXiv cs.CV

CereVLA:受小脑启发、后果感知的残差治理,实现高效视觉-语言-动作执行

提出受小脑启发的CereVLA,用流残差修正并预测后果,抑制不利校正,提升VLA执行成功率与效率。

04:00
arXiv cs.CV

SatUnreal:基于虚幻引擎的卫星立体匹配高精度合成数据集

提出基于虚幻引擎的高精度卫星立体匹配数据集SatUnreal,含1万立体像对,零样本迁移超越真实数据。

04:00
arXiv cs.CV

无语义先验的重叠视觉分组

提出DPG无需语义先验,多测量域交叉重叠生成非排他性视觉分组,BSDS500验证其与人标注区域边界对应。

04:00
arXiv cs.CV

潜在演化的世界动作模型

提出LeWAM,以JEPA嵌入替代视频扩散进行动作生成与环境演化,并用DemoDPO离线偏好优化,RoboTwin成功率92.28%。

04:00
arXiv cs.CV

DeltaS:读取门控线性注意力状态以实现流式视频中的 KV 缓存驱逐

DeltaS免训练且与查询无关,以门控线性注意力状态漂移选取信息量大的视频块并驱逐KV缓存,优于基线。

04:00
arXiv cs.CV

CasCVS-Net:面向关键安全视野评估的分阶段多任务级联网络

分阶段多任务级联CasCVS-Net,以预测框与掩码联动检测、分割与CVS评估,改善罕见解剖定位。

04:00
arXiv cs.CV

Know-Your-Scene(KYS)-SLAM:用于双目视觉SLAM特征匹配的层次化语义-运动先验

以层次化语义-运动先验调制特征匹配、取代硬剔除,在KITTI与EuRoC上显著降低轨迹漂移。

04:00
arXiv cs.CV

M3D-Net:面向乳腺钼靶分类的空间上下文、特征复用与差分注意力分层协同

M3D-Net协同坐标注意力、特征复用与差分注意力,钼靶/超声分类准确率达97.78%和80.39%。

04:00
arXiv cs.CV

ICM:面向恶劣天气域自适应的类内混合方法

提出类内混合一致性框架ICM,在同一图像同类内混合以保持真实语义布局,Cityscapes→ACDC达75.7% mIoU,超SOTA 1.9个百分点。

04:00
arXiv cs.CV

NV-Reason-CT:用于CT分析的3D视觉语言模型

融合原生3D视觉编码与放射科医生引导推理,支持CT异常分类、报告生成和交互分析,阅片时间减半。

04:00
arXiv cs.CV

SGDet3D++:面向4D雷达与相机3D目标检测的几何锚定语义

提出假设条件化证据接地,经AGR/GCR/DVC按三维状态过滤语义、几何与时序证据,4D雷达相机检测性能显著提升。

04:00
arXiv cs.CV

基于双优先级联邦预训练构建的可泛化脑结构MRI基础模型

BrainFedFM经双优先级联邦预训练,在42站点16.4万例脑MRI上学习,于20数据集17项任务达最优,泛化性强。

04:00
arXiv cs.CV

Track2Art:以运动为中心的从2D点跟踪器恢复铰接物体模型

以运动为中心,由RGB-D视频点轨迹分组恢复铰接物体部件与关节,无需部件数先验和测试时优化。

04:00
arXiv cs.CV

InGuard:迈向安全文本到图像生成的通用内部护栏

提出InGuard内部护栏,免改底模,提示分级、嵌入修正、潜空间早停,安全率97.9%–98.8%。

04:00
arXiv cs.CV

RoadOcc:面向路侧占用预测,学习何时保持、迁移或刷新记忆

RoadOcc学习保持/迁移/刷新记忆,路侧占用预测达65.29 mIoU、32.37动态mIoU。

04:00
arXiv cs.CV

SynSeq:基于冠状动脉造影视频的端到端SYNTAX评分预测

提出SynSeq,直接由冠脉造影视频预测SYNTAX评分,性能显著超越现有方法,并可辅助血运重建决策。

04:00
arXiv cs.CV

FFM-CP:面向少样本计算病理学的视觉-语言基础模型跨骨干融合

FFM-CP:以正交Procrustes对齐并融合多个病理视觉语言模型,少样本分类54项对比中50项优于单模型。

04:00
arXiv cs.CV

NeuralSRNF:面向非刚性3D与4D对象统计形状分析与生成的神经平方根法向量场

提出神经表示NeuralSRNF,解决平方根法向量场不可逆难题,将逆映射计算缩至3秒内,高效实现3D/4D非刚性形状分析与生成。

04:00
arXiv cs.CV

AWM-VLA:面向高效可解释视觉-语言-动作策略的对齐世界建模

将对齐世界模型嵌入扩散策略,用未来令牌预测观测语义并做物体级对齐,成功率最高提升21%,可解释性强。

04:00
arXiv cs.CV

可见性引导的结构化测度流:面向类别条件式3D高斯生成

VISTA-GS将3D高斯对象建模为可见性加权的结构化测度,以测度VAE与渲染一致测度流实现类别条件生成,无需逐实例优化。

04:00
arXiv cs.CV

评估使用独立扩散加权MRI的仅ADC深度学习流程在乳腺癌检测与分割中的应用

本文首次全面评估仅用ADC图的深度学习流程,基于独立扩散加权MRI进行乳腺癌分类、检测与分割。

04:00
arXiv cs.CV

DualStabSleepNet:面向鲁棒睡眠分期的双域扩散稳定网络

提出双域扩散稳定网络DSSNet,在数据与特征域抑制噪声与漂移,四个PSG数据集达最优精度,跨数据集鲁棒。

04:00
arXiv cs.CV

融合感知的结构化图块潜流直接3D高斯生成

提出融合感知层次高斯块表示与结构感知修正流,直接类别引导生成3D高斯,秒级且多视角一致。

04:00
arXiv cs.CV

DMM-Align:面向2D-3D配准的双角色扩散闭环优化

提出DMM-Align闭环框架,以双角色扩散与可微几何反馈协同优化匹配和位姿,提升低重叠遮挡下的配准鲁棒性。

04:00
arXiv cs.CV

视觉-语言上下文学习中的性别偏见

性别化示例会将视觉语言模型偏见导向示例性别,损害另一性别表现;用合成图像替换真实示例图像可减轻偏见。

04:00
arXiv cs.CV

ScoutNeRV:通过ScoutNet快速编码基于网格的视频INR

轻量侦察网络按内容选预训练专家初始化HiNeRV,加速优化,37轮达36.92dB,9.25倍提速。

04:00
arXiv cs.CV

全模态生而平等,但视频更平等:弥合联合视频生成中的交叉注意力差距

联合扩散模型存在互惠对应差距:模态到视频的对应弱于视频到模态。RecCAR通过KL正则化对齐弱方向,提升视频-动作和视频-音频生成质量。

04:00
arXiv cs.CV

GaussianDS:面向场景理解的深度监督语义高斯泼溅

提出深度监督语义3DGS,联合优化外观、深度与语义,抑制语义漂移,在LERF与3D-OVS上刷新最优。

04:00
arXiv cs.CV

RelCheck:面向VLM幻觉纠正的双证据空间定位

提出免训练后校正管线RelCheck,融合场景图三元组与边界框空间谓词,构建三层视觉知识库,显著改善MLLM空间关系幻觉纠正。

04:00
arXiv cs.CV

TopoGS:面向大规模3D高斯泼溅的拓扑感知锚点特征聚合

TopoGS借八叉树拓扑聚合锚点特征,区分有效父子关系并软加权,提升大规模场景渲染质量与效率。

04:00
arXiv cs.CV

面向全身衰减校正的几何锚定 PET 感知多模态伪 CT 合成:BIC-MAC 挑战赛

挑战赛提出GeoPACT:以NAC-PET为空间参考,融合MRI与定位像,经衰减图及PET响应监督,滑窗生成全身伪CT,实现无CT衰减校正。

04:00
arXiv cs.CV

基于ResNet-LSTM-CBAM与DCT混合网络的空频域视频伪造检测系统

提出融合空频域特征的ResNet-LSTM-CBAM+DCT视频伪造检测模型,多项基准数据集实验验证其优越性能。

04:00
arXiv cs.CV

UVU:通过视觉-语言统一自回归范式提升多模态理解

UVU将视觉监督引入预训练,以连续视觉编码和像素级码本统一自回归生成,提升多模态理解。

04:00
arXiv cs.CV

Groundbench:多分辨率多边形定位揭示视觉语言模型的几何差距

同一数据改测五档顶点多边形,最强模型框IoU 88.2,直接多边形仅57.7,暴露输出几何差距。

04:00
arXiv cs.CV

VIVAS:以视觉-语言统一自回归监督激活 VLM 预训练中的视觉感知

VIVAS以统一视觉语言词表和自回归监督,增强VLM细粒度视觉感知,在39项多模态基准达SOTA。

04:00
arXiv cs.CV

全球建筑物与居民点数据集在不同地理与聚落情境下的比较评估

基准评测七套全球建筑数据集:Overture矢量F1中位数最高0.786,栅格精度随分辨率与建筑密度变化,时间对齐可使精度提升。

04:00
arXiv cs.CV

MotionSpec:面向运动一致视频生成的谱轨迹监督

提出MotionSpec框架,通过谱轨迹一致性与局部光流一致性监督,提升视频生成的运动一致性与时序连贯性。

04:00
arXiv cs.CV

视觉绊线:预判深度视觉系统的失效

提出视觉绊线框架,利用表征漂移、预测振荡、轨迹曲率与注意力熵等时序不稳定信号,提前预警深度视觉系统的失效。

04:00
arXiv cs.CV

基于隐式神经表示与扩散模型精化的牙科锥形束CT视野扩展

提出三阶段框架:隐式神经表示补全截断投影,迭代重建提升解剖一致性,扩散模型精化图像,有效扩展牙科CBCT视野并减少伪影。

04:00
arXiv cs.CV

ZoomDiff:面向双摄像头平滑变焦的高保真扩散模型

提出高保真扩散模型ZoomDiff,融合双摄潜空间与像素空间,提升双摄平滑变焦的几何一致性与高频细节。

04:00
arXiv cs.CV

任务诱导的视觉Transformer特征空间黎曼度量

提出任务诱导黎曼度量与谱拉回网络,将低秩度量蒸馏为重要度头,几何化token剪枝使深度误差降低25%。

04:00
arXiv cs.CV

AstraLOD3:LOD3建筑模型的零样本多模态智能体重建

AstraLOD3以多模态智能体零样本重建LOD3建筑模型,35次运行媲美专用方法。

04:00
arXiv cs.CV

提示、探测、训练,还是标注?业余场景下的单摄像头体育视频理解

业余单摄像头排球评测显示:无单一范式各阶段通吃,身份识别最难,规则可补像素不足。

04:00
arXiv cs.CV

LiAM-SAM:面向鲁棒SAM2多目标跟踪的生命周期感知记忆

将多目标跟踪视为生命周期记忆完整性问题,针对初始化、漂移与重识别设计机制,实现最优HOTA与IDF1。

04:00
arXiv cs.CV

TEEP-RCNN:基于Faster R-CNN中改进卷积块注意力的纹理增强边缘感知钢材表面缺陷检测

提出TEEP-RCNN,改进CBAM与TTA+WBF,NEU-DET十轮达73.3%mAP@50。