11301 条条目 · 106 个活跃源
2026年6月4日
04:00
arXiv cs.CV

基于CT体积的多粒度三维肾脏病变表征

提出LesionDETR模型,实现肾脏病变多属性集合预测,双侧异常AUC达0.799。

04:00
arXiv cs.CV

解耦信息区域的选择性耦合:视觉Transformer无数据量化的掩码注意力对齐

掩码注意力对齐解耦信息区域,解决ViT无数据量化分布不匹配,提升合成样本质量。

04:00
arXiv cs.CV

通过有界噪声注入的隐式模糊化用于鲁棒医学图像分割

提出NoiseUNet,在跳跃连接注入有界噪声实现隐式模糊化,提升医学图像分割的精度和边界保真度。

04:00
arXiv cs.CV

运动引导的因果解耦用于鲁棒的多视图动态心脏MRI诊断

针对视图与疾病特征纠缠问题,提出MoViD框架,利用运动引导和对抗解耦分离特征,提升诊断鲁棒性。

04:00
arXiv cs.CV

先想象再绘制:图像生成的视觉提示工程

提出VPE,在内部框架中先生成视觉语义提示再生成图像,加速收敛、提升质量,编辑保持效果显著优于外部方法。

04:00
arXiv cs.CV

面向视觉语言模型的有状态视觉编码器

提出有状态视觉编码器,使视觉表示依赖历史上下文,提升多图像比较与变化检测性能,超越通用基线。

04:00
arXiv cs.CV

DSA:快速自回归视频生成的动态步数分配

DSA用置信度引导自适应分配去噪步数,实现实时自回归视频生成(22.63 FPS),质量保持更优。

04:00
arXiv cs.CV

Hyper-ICL:基于双曲锚点蒸馏的多模态上下文学习注意力校准

提出轻量级无演示框架Hyper-ICL,通过双曲锚点蒸馏校准注意力,提升准确性与稳定性。

04:00
arXiv cs.CV

超快速神经视频压缩

基于块的超快神经视频压缩框架,通过多帧联合建模与并行解码,大幅提升速度与性能,达到新标杆。

04:00
arXiv cs.CV

3DThinkVLA: 通过3D思维引导协同训练赋予视觉-语言-动作模型潜在3D先验

提出3D思维引导协同训练框架,使VLA模型隐式进行3D空间推理,无需外部模型,性能SOTA。

04:00
arXiv cs.CV

INTACT:面向异构协同感知的本车引导类型化稀疏证据检索

INTACT提出本车引导类型化稀疏证据检索,实现零训练异构插入,仅0.52M参数,通信压缩16倍,性能领先。

04:00
arXiv cs.CV

基于深度神经网络梯度损失的影像组学特征选择用于肺癌分期检测

提出GL-RFE方法,利用神经网络损失梯度递归消除特征,肺癌分期检测准确率达90.22%。

04:00
arXiv cs.CV

超越对称对齐:医学领域视觉-语言模型中模态不平衡的光谱诊断

提出SAS非对称度量,揭示医学图像信息更丰富,与检索性能强相关,助力临床部署。

04:00
arXiv cs.CV

SFMambaNet:基于谱-频增强的选择性状态空间模型用于对应点修剪

首次将频域感知与Mamba结合,通过谱几何注意力和频率门控抑制噪声,提升对应点修剪的鲁棒性和性能。

04:00
arXiv cs.CV

ChannelTok:高效灵活长度视觉标记化

提出通道级灵活长度视觉标记化,轻量快速,解码速度提升8.6倍,参数仅159M,达SOTA感知质量(rFID 2.92)。

04:00
arXiv cs.CV

评估视觉文本生成中的推理忠实度

视觉文本生成模型虽能生成清晰文字,但推理忠实度差,频繁出现语义错误与逻辑不一致。

04:00
arXiv cs.CV

公平且高性能的面部识别的自适应校准

自适应校准(AC)利用局部上下文修正余弦相似度不匹配,实现面部识别公平与高性能,无需人口统计数据。

04:00
arXiv cs.CV

IMPose:具有动态校正传播的交互式多人姿态估计

提出IMPose工具,通过双级跟踪传播多人姿态校正,低点击实现高效高精度标注,大幅减少人工干预。

04:00
arXiv cs.CV

光学引导的神经坍缩用于SAR少样本类增量学习

利用光学先验引导SAR特征,通过神经坍缩增强紧凑性与类间分离,提升少样本类增量学习性能。

04:00
arXiv cs.CV

稀疏动态相机下的4D重建

提出3D轨迹初始化方法,结合跨相机匹配与点跟踪及深度排序正则化,提升动态区域4D重建质量。

04:00
arXiv cs.CV

Impostor:面向现实AIGC篡改定位的智能体策展基准

提出Impostor数据集(10万篡改图,覆盖7种AIGC模型)与PANet网络,用于现实篡改定位。

04:00
arXiv cs.CV

COMBINER: 基于属性邻居关系引导的组合图像检索

提出COMBINER,通过属性解耦与邻居关系建模,解决视觉相似但属性不同的样本检索难题,实验验证有效。

04:00
arXiv cs.CV

目标检测中的实例级事后不确定性量化

提出MC-GLM方法,实现目标检测的实例级事后不确定性量化,在自动驾驶场景验证有效。

04:00
arXiv cs.CV

StrokeTimer:基于非增强CT的缺血性卒中发作时间估计的鲁棒表示学习

提出StrokeTimer框架,自监督学习与能量引导对比学习结合,从非增强CT估计卒中发作时间,多中心数据AU0.69,较基线提升近50%。

04:00
arXiv cs.CV

MeshWeaver:基于稀疏体素引导的表面编织自回归网格生成

通过稀疏体素编码器提供几何上下文,实现单步粗到细顶点预测,压缩比达18%,支持16K面网格,几何保真度显著提升。

04:00
arXiv cs.CV

使用YOLOv8、SORT跟踪和时间数据插值的实时自动车牌识别

提出五阶段管道结合YOLOv8、SORT和插值,解决实时车牌识别中光照、遮挡等难题。

04:00
arXiv cs.CV

MeshFlow:通过MeshVAE和基于流的扩散变压器的高效艺术网格生成

提出MeshFlow,通过VAE和流变压器并行生成3D网格,比自回归方法快18倍且精度高。

04:00
arXiv cs.CV

利用轻量级框预测器增强MedSAM的医学图像分割

提出轻量级框预测器增强MedSAM,单次点击生成边界框,提升多模态分割性能,Dice最高达0.98。

04:00
arXiv cs.CV

中文标题

提出鲁棒骨姿态估计,用学习点候选与RANSAC/Hough变换,X射线和超声中平均误差4.1-5.51°,优于传统方法。

04:00
arXiv cs.CV

ReConFuse: 重建误差引导的语义融合用于AI生成视频检测

利用预训练VAE重建误差区分真假视频,ReConFuse框架融合误差与语义特征,实现强泛化检测。

04:00
arXiv cs.CV

短视频平台上动态屏幕原生GUI代理的基准测评

提出LivingScreen基准,测试短视频平台动态屏幕GUI代理,揭示模型存在过度或不足观察问题,未能达到人类水平。

04:00
arXiv cs.CV

用于高光谱图像分类的数据高效复杂特征融合网络

提出DE-CFFN模型,因子分析降维并减半滤波器,SE块增强特征,性能相当但模型更小、更快。

04:00
arXiv cs.CV

Dream.exe:视频生成模型能否梦到可执行的机器人操作?

Dream.exe框架评估8个视频生成模型,发现模型能生成可执行操作,但视觉质量不预测执行成功率。

04:00
arXiv cs.CV

基于专家混合潜在对齐的物理感知视频生成

提出PILA框架,通过混合专家潜在对齐注入物理先验,在冻结视频模型中提升物理合理性,达SOTA。

04:00
arXiv cs.CV

基础模型能否洞悉生物学?基于空间转录组学评估胶质母细胞瘤注意力一致性

提出空间转录组学评估框架,发现病理基础模型注意力富集于通路而非单基因,平滑度不代表生物学一致性。

04:00
arXiv cs.CV

Z-FLoc: 基于几何基元的零样本楼层平面定位

提出无需重训练的零样本楼层平面定位方法,利用几何基元匹配,在未知环境中超越现有学习算法。

04:00
arXiv cs.CV

基于序列Mamba的由粗到细分层架构用于大脑重建

提出CHASMBrain框架,双流Mamba粗细两阶段编码,图像到fMRI预测相关系数0.429,超越基线。

04:00
arXiv cs.CV

NextMotionQA:使用视觉语言模型评估和判断人体运动理解

NextMotionQA基准包含三项任务,评估发现VLM粗粒度判断与专家一致(κ=0.70),但细粒度部分级判断弱(κ=0.10)。

04:00
arXiv cs.CV

雕琢你不断演进的梦想:概念增量通用定制

提出CCDM模型,通过解耦LoRA和可控合成策略,解决增量定制中的遗忘与概念忽视问题。

04:00
arXiv cs.CV

胃癌病理基础模型及其真实世界验证

GRACE模型在28项任务中优于通用模型,AI辅助使诊断准确率从82.0%提至89.9%,灵敏度与特异性显著提升。

04:00
arXiv cs.CV

基于并查集、剪枝和查找表的2D和3D图像快速立方体持续同调

提出Flash Cubical,通过并查集、剪枝和查找表实现2D/3D图像上V-过滤立方体持续同调的高效计算。

04:00
arXiv cs.CV

NoRA:评估视觉第一人称规范动作推理中的基于事实的合理性

NoRA基准通过事实-理由-动作图评估VLM规范推理,发现模型能识别动作与事实但难构建完整合理空间及正确绑定。

04:00
arXiv cs.CV

OA-CutMix: 纠正CutMix的标签偏差

OA-CutMix用分割掩码修正CutMix的标签偏差,性能超越多种混合方法,训练成本低。

04:00
arXiv cs.CV

注意任务中自闭症谱系障碍筛查的3D时序分析

基于DECA提取3D头部姿态和面部特征,GRU模型筛查ASD准确率达84.6%,优于2D方法。

04:00
arXiv cs.CV

MusaCoder:在摩尔线程GPU上通过全栈训练实现原生GPU内核生成

MusaCoder全栈训练框架结合执行反馈强化学习,生成高效原生GPU内核,在KernelBench上超越开源闭源模型达SOTA。

04:00
arXiv cs.CV

IRIS-GAN:深度伪造人脸的阶段性专家检测

IRIS-GAN通过分阶段训练GAN人脸检测器,实现99%以上伪造检测率和98.9%真实人脸准确率,对扩散模型也有一定能力。

04:00
arXiv cs.CV

基于学习的3D表示的最新进展与趋势

综述3D表示从离散显式向隐式范式的转变,分析其优势、局限及在重建渲染中的关键应用与未来挑战。

04:00
arXiv cs.CV

MAOAM:基于视觉-语言模型的统一对象与材质选择

提出MAOAM框架,统一文本和点击交互,实现物体与材质精确选择,利用VLM和分割头,多任务训练提升鲁棒性。

04:00
arXiv cs.CV

CDPM-Align: 多尺度引导对齐的扩散预训练用于鲁棒的小样本解剖标志点检测

提出CDPM-align多尺度引导对齐扩散预训练,通过条件生成学习鲁棒表示,在小样本标注下提升解剖标志点检测的准确性和可靠性。

04:00
arXiv cs.CV

分层空间分割用于表面重建

提出分层分割与平面组装策略,恢复扫描缺失,生成紧凑水密网格,优于主流方法。