基于CT体积的多粒度三维肾脏病变表征
提出LesionDETR模型,实现肾脏病变多属性集合预测,双侧异常AUC达0.799。
解耦信息区域的选择性耦合:视觉Transformer无数据量化的掩码注意力对齐
掩码注意力对齐解耦信息区域,解决ViT无数据量化分布不匹配,提升合成样本质量。
通过有界噪声注入的隐式模糊化用于鲁棒医学图像分割
提出NoiseUNet,在跳跃连接注入有界噪声实现隐式模糊化,提升医学图像分割的精度和边界保真度。
运动引导的因果解耦用于鲁棒的多视图动态心脏MRI诊断
针对视图与疾病特征纠缠问题,提出MoViD框架,利用运动引导和对抗解耦分离特征,提升诊断鲁棒性。
先想象再绘制:图像生成的视觉提示工程
提出VPE,在内部框架中先生成视觉语义提示再生成图像,加速收敛、提升质量,编辑保持效果显著优于外部方法。
面向视觉语言模型的有状态视觉编码器
提出有状态视觉编码器,使视觉表示依赖历史上下文,提升多图像比较与变化检测性能,超越通用基线。
DSA:快速自回归视频生成的动态步数分配
DSA用置信度引导自适应分配去噪步数,实现实时自回归视频生成(22.63 FPS),质量保持更优。
Hyper-ICL:基于双曲锚点蒸馏的多模态上下文学习注意力校准
提出轻量级无演示框架Hyper-ICL,通过双曲锚点蒸馏校准注意力,提升准确性与稳定性。
超快速神经视频压缩
基于块的超快神经视频压缩框架,通过多帧联合建模与并行解码,大幅提升速度与性能,达到新标杆。
3DThinkVLA: 通过3D思维引导协同训练赋予视觉-语言-动作模型潜在3D先验
提出3D思维引导协同训练框架,使VLA模型隐式进行3D空间推理,无需外部模型,性能SOTA。
INTACT:面向异构协同感知的本车引导类型化稀疏证据检索
INTACT提出本车引导类型化稀疏证据检索,实现零训练异构插入,仅0.52M参数,通信压缩16倍,性能领先。
基于深度神经网络梯度损失的影像组学特征选择用于肺癌分期检测
提出GL-RFE方法,利用神经网络损失梯度递归消除特征,肺癌分期检测准确率达90.22%。
超越对称对齐:医学领域视觉-语言模型中模态不平衡的光谱诊断
提出SAS非对称度量,揭示医学图像信息更丰富,与检索性能强相关,助力临床部署。
SFMambaNet:基于谱-频增强的选择性状态空间模型用于对应点修剪
首次将频域感知与Mamba结合,通过谱几何注意力和频率门控抑制噪声,提升对应点修剪的鲁棒性和性能。
ChannelTok:高效灵活长度视觉标记化
提出通道级灵活长度视觉标记化,轻量快速,解码速度提升8.6倍,参数仅159M,达SOTA感知质量(rFID 2.92)。
评估视觉文本生成中的推理忠实度
视觉文本生成模型虽能生成清晰文字,但推理忠实度差,频繁出现语义错误与逻辑不一致。
公平且高性能的面部识别的自适应校准
自适应校准(AC)利用局部上下文修正余弦相似度不匹配,实现面部识别公平与高性能,无需人口统计数据。
IMPose:具有动态校正传播的交互式多人姿态估计
提出IMPose工具,通过双级跟踪传播多人姿态校正,低点击实现高效高精度标注,大幅减少人工干预。
光学引导的神经坍缩用于SAR少样本类增量学习
利用光学先验引导SAR特征,通过神经坍缩增强紧凑性与类间分离,提升少样本类增量学习性能。
稀疏动态相机下的4D重建
提出3D轨迹初始化方法,结合跨相机匹配与点跟踪及深度排序正则化,提升动态区域4D重建质量。
Impostor:面向现实AIGC篡改定位的智能体策展基准
提出Impostor数据集(10万篡改图,覆盖7种AIGC模型)与PANet网络,用于现实篡改定位。
COMBINER: 基于属性邻居关系引导的组合图像检索
提出COMBINER,通过属性解耦与邻居关系建模,解决视觉相似但属性不同的样本检索难题,实验验证有效。
目标检测中的实例级事后不确定性量化
提出MC-GLM方法,实现目标检测的实例级事后不确定性量化,在自动驾驶场景验证有效。
StrokeTimer:基于非增强CT的缺血性卒中发作时间估计的鲁棒表示学习
提出StrokeTimer框架,自监督学习与能量引导对比学习结合,从非增强CT估计卒中发作时间,多中心数据AU0.69,较基线提升近50%。
MeshWeaver:基于稀疏体素引导的表面编织自回归网格生成
通过稀疏体素编码器提供几何上下文,实现单步粗到细顶点预测,压缩比达18%,支持16K面网格,几何保真度显著提升。
使用YOLOv8、SORT跟踪和时间数据插值的实时自动车牌识别
提出五阶段管道结合YOLOv8、SORT和插值,解决实时车牌识别中光照、遮挡等难题。
MeshFlow:通过MeshVAE和基于流的扩散变压器的高效艺术网格生成
提出MeshFlow,通过VAE和流变压器并行生成3D网格,比自回归方法快18倍且精度高。
利用轻量级框预测器增强MedSAM的医学图像分割
提出轻量级框预测器增强MedSAM,单次点击生成边界框,提升多模态分割性能,Dice最高达0.98。
中文标题
提出鲁棒骨姿态估计,用学习点候选与RANSAC/Hough变换,X射线和超声中平均误差4.1-5.51°,优于传统方法。
ReConFuse: 重建误差引导的语义融合用于AI生成视频检测
利用预训练VAE重建误差区分真假视频,ReConFuse框架融合误差与语义特征,实现强泛化检测。
短视频平台上动态屏幕原生GUI代理的基准测评
提出LivingScreen基准,测试短视频平台动态屏幕GUI代理,揭示模型存在过度或不足观察问题,未能达到人类水平。
用于高光谱图像分类的数据高效复杂特征融合网络
提出DE-CFFN模型,因子分析降维并减半滤波器,SE块增强特征,性能相当但模型更小、更快。
Dream.exe:视频生成模型能否梦到可执行的机器人操作?
Dream.exe框架评估8个视频生成模型,发现模型能生成可执行操作,但视觉质量不预测执行成功率。
基于专家混合潜在对齐的物理感知视频生成
提出PILA框架,通过混合专家潜在对齐注入物理先验,在冻结视频模型中提升物理合理性,达SOTA。
基础模型能否洞悉生物学?基于空间转录组学评估胶质母细胞瘤注意力一致性
提出空间转录组学评估框架,发现病理基础模型注意力富集于通路而非单基因,平滑度不代表生物学一致性。
Z-FLoc: 基于几何基元的零样本楼层平面定位
提出无需重训练的零样本楼层平面定位方法,利用几何基元匹配,在未知环境中超越现有学习算法。
基于序列Mamba的由粗到细分层架构用于大脑重建
提出CHASMBrain框架,双流Mamba粗细两阶段编码,图像到fMRI预测相关系数0.429,超越基线。
NextMotionQA:使用视觉语言模型评估和判断人体运动理解
NextMotionQA基准包含三项任务,评估发现VLM粗粒度判断与专家一致(κ=0.70),但细粒度部分级判断弱(κ=0.10)。
雕琢你不断演进的梦想:概念增量通用定制
提出CCDM模型,通过解耦LoRA和可控合成策略,解决增量定制中的遗忘与概念忽视问题。
胃癌病理基础模型及其真实世界验证
GRACE模型在28项任务中优于通用模型,AI辅助使诊断准确率从82.0%提至89.9%,灵敏度与特异性显著提升。
基于并查集、剪枝和查找表的2D和3D图像快速立方体持续同调
提出Flash Cubical,通过并查集、剪枝和查找表实现2D/3D图像上V-过滤立方体持续同调的高效计算。
NoRA:评估视觉第一人称规范动作推理中的基于事实的合理性
NoRA基准通过事实-理由-动作图评估VLM规范推理,发现模型能识别动作与事实但难构建完整合理空间及正确绑定。
OA-CutMix: 纠正CutMix的标签偏差
OA-CutMix用分割掩码修正CutMix的标签偏差,性能超越多种混合方法,训练成本低。
注意任务中自闭症谱系障碍筛查的3D时序分析
基于DECA提取3D头部姿态和面部特征,GRU模型筛查ASD准确率达84.6%,优于2D方法。
MusaCoder:在摩尔线程GPU上通过全栈训练实现原生GPU内核生成
MusaCoder全栈训练框架结合执行反馈强化学习,生成高效原生GPU内核,在KernelBench上超越开源闭源模型达SOTA。
IRIS-GAN:深度伪造人脸的阶段性专家检测
IRIS-GAN通过分阶段训练GAN人脸检测器,实现99%以上伪造检测率和98.9%真实人脸准确率,对扩散模型也有一定能力。
基于学习的3D表示的最新进展与趋势
综述3D表示从离散显式向隐式范式的转变,分析其优势、局限及在重建渲染中的关键应用与未来挑战。
MAOAM:基于视觉-语言模型的统一对象与材质选择
提出MAOAM框架,统一文本和点击交互,实现物体与材质精确选择,利用VLM和分割头,多任务训练提升鲁棒性。
CDPM-Align: 多尺度引导对齐的扩散预训练用于鲁棒的小样本解剖标志点检测
提出CDPM-align多尺度引导对齐扩散预训练,通过条件生成学习鲁棒表示,在小样本标注下提升解剖标志点检测的准确性和可靠性。
分层空间分割用于表面重建
提出分层分割与平面组装策略,恢复扫描缺失,生成紧凑水密网格,优于主流方法。