Oxygen-TryOn:面向任何商品的时尚原生基础虚拟试穿模型
Oxygen-TryOn是时尚原生基础模型,通过三阶段训练实现多物品高保真试穿,在多项基准领先。
闭环:自回归生成渲染的无训练重访一致性
利用3D引擎的时空对应修复自回归生成中的重访不一致,无需训练且性能更优。
风险路由隐式边界细化用于鲁棒超声图像分割
RIBR用隐式残差校正和边界正则化提升超声分割鲁棒性,在9个数据集上边界误差最小。
保持一致!利用一致性约束增强LVLM的鲁棒视觉推理
提出ConVBench基准及ConVLM方法,通过GRPO强化学习与一致性奖励,提升LVLM视觉推理的逻辑一致性和鲁棒准确率。
使用残差U-Net和文本提示SAM3精化从1米NAIP影像进行农田范围与可见边界制图
用ResUNet和文本提示SAM3精化,从1米NAIP影像制图农田范围与边界,测试精度高,有效处理复杂场景。
学习用于三维占用的自适应语义高斯分配
提出SAGFormer,通过评分选择高斯集,减少语义混合,增强体素支持,显式容量分配补充高斯优化。
中文标题:当照片列队包含来自大型图库的非匹配排名第一图像时,准确性会如何?
图库越大,目击者错误识别率及错误信心越高,质疑此类照片列队用于逮捕的合理性。
SCALE:先进节点下局部P&R DRV修复的自监督约束感知布局生成
SCALE自监督框架经布局生成与VLM微调,提升亚2nm局部DRV修复率12-25%。
重新思考基础模型时代下车辆重识别中的多分支与跨骨干融合
基础模型时代,改进单一骨干网络加重排序比多分支融合更有效。
扩散模型在医学图像修复中的应用:挑战、解决方案分类与未来方向
综述扩散模型在医学图像修复中的进展,分析架构与挑战,提出分类法,指出缺乏标准化基准等问题。
医学检查清单:评估多模态模型对医学图像的理解能力
Medical-Checklist通过二选一测试评估多模态模型对医学图像的理解,发现现有模型理解不足,临床应用前景遥远。
基于全景感知与视觉语言模型的低空信道多径预测
提出PanoLAMP框架,用视觉语言模型预测低空多径参数,性能优于基线方法。
TextSLIP:面向医学报告生成的文本自监督CLIP
通过文本自监督对比学习增强CLIP的语义监督,提升医学报告生成性能。
重新思考视觉基础模型自适应的逐层信息分配
提出提示信息瓶颈(PIB)框架,优化逐层信息分配,仅调优0.35%参数即达92%+精度。
Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning
EVL-MCoT:增强视觉-语言多链式思维用于有害模因检测
EVL-MCoT采用多链式思维与原型引导解码,增强视觉-文本对齐,提升有害模因检测性能。
小型视觉语言模型知错却难言:真实图像退化下言语置信与内部置信的双模型研究
小VLM知错但说不出口:内部概率比口头置信更可靠,但严重低光下两者均不可信。
一种面向同质结构弱边界分割的平滑相分离模型
提出基于Cahn-Hilliard方程的平滑相分离模型,集成softmax拟合与相场正则化,有效分割弱边界同质结构,精度与边界定位优于对比方法。
ReCowGnition:一个用于奶牛面部识别的现实生物特征基准
提出真实场景奶牛面部识别基准数据集,含6838张图像、161头奶牛,定义评估协议,提供六种模型结果。
CARDIAG:面向冠状动脉造影的深度学习架构密集段分类基准
发布CARDIAG基准,评估24种模型进行冠状动脉造影像素分类,最佳集成F1=0.479,强调高低分辨率特征。
缓解小样本类增量学习中的区域捷径
针对小样本类增量学习中模型因区域捷径误分类新类的问题,提出组合学习方法学习公共与判别基元集,有效缓解并提升准确性与可解释性。
InnoText:统一视觉文本生成与编辑模型
提出InnoText统一框架,通过字体尺寸感知、小字符增强等方法,实现高质量中英文文本生成与编辑。
CommandLM:自车行为层级的数据驱动描述器
CommandLM多模态大模型从传感器数据生成自车行为描述,CIDEr 0.67,人类评价58%准确合规,支持透明审计。
扩散模型中减少曝光偏差的频谱先验
提出频谱对齐(SPA)方法,校准功率谱减少曝光偏差,仅增3-4%开销,兼容CFG。
FAIR:面向AI生成虚假图像检测的特征增强隐式正则化
FAIR通过场景结构先验抑制纹理偏置,提升AI假图检测跨生成器泛化,精度提升8%,实现零样本鲁棒性。
使用多平台激光扫描的单木生长重建框架
提出多平台激光扫描单木生长重建框架,通过深度学习分割和生长模型实现胸径与材积准确估计,误差稳定。
GLI-AL:一个具有统一解剖-病灶标签的多模态胶质瘤MRI标签资源
提出BraTS-GLI Anatomy-Lesion资源,含1251个统一八类标签,扩展前景监督,提升共存病灶敏感度。
投影追踪CPCANet用于域泛化
PP-CPCANet利用投影追踪在Stiefel流形学习全局正交基,克服协方差秩亏,域泛化达SOTA。
LayoutLite:面向高效文档OCR的令牌级隐式布局分析
提出轻量模块LayoutLite,通过令牌级隐式布局分析去除低信息视觉令牌,降低推理成本,保持OCR质量。
面向视觉异常检测的深度卷积大间隔$\ell_p$-SVDD
提出DLM-SVDD,联合学习卷积特征与核决策边界,用大间隔$\ell_p$-SVDD优化,性能优于现有方法。
从水平集演化到阈值优化:一种用于图像分割的灰度水平集框架
本文证明长度项非必要,提出灰度水平集框架,将PDE演化转为阈值搜索,实现快速分割大规模退化图像。
基于新颖视图合成在混叠低纹理环境中从稀疏视图进行视觉重定位
提出结合多视图立体与LiDAR深度的3D高斯溅射重定位法,提升行星类似地形的单图6自由度位姿估计精度。
JustDepth:基于单扫描激光雷达监督的实时雷达-相机深度估计
JustDepth单阶段融合雷达和相机,仅用单扫描LiDAR训练,推理快39.7倍,条纹伪影减少66%。
基于深度学习的腹部CT肠梗阻检测与定位
提出多任务深度学习框架,同时检测肠梗阻并定位过渡区,准确率93%,定位命中率95%。
dRAE:基于超球面编码的表征自编码器
提出超球面量化(HSQ)解决度量不匹配,实现可扩展离散表征自编码器,码本利用率100%,词汇量达131k性能持续提升。
TRaM-VSR:面向一步扩散视频超分辨率的重要性感知令牌路由与合并
利用运动与语义评估令牌重要性,动态路由合并,在一步扩散VSR中加速推理并保持高质量与时间一致性。
AgentHOI:基于多智能体推理与隐式表示对齐的人-物交互视频生成
AgentHOI通过多智能体推理与隐式文本-运动对齐,无需显式运动输入即可从文本生成人-物交互视频,显著提升交互自然性和指令遵循。
先填后进:面向场景专用遥感多模态大模型的能力差距驱动后训练
提出FBA方法,先填补能力差距再场景专用化,后训练显著提升港口遥感任务性能。
SLIP:面向三维医学图像的低延迟交互式提示分割
SLIP框架解耦图像编码与交互推理,实现低延迟、可逆提示的3D医学图像交互分割,优于现有方法。
fMRI2Face: 全高清fMRI-视频数据集及几何引导的神经解码框架用于动态人脸重建
首个全高清fMRI-视频数据集结合几何引导框架,从脑活动重建动态人脸,显著提升保真度与一致性。
RadSight:迈向感知可靠的多模态放射影像理解
RadSight提出感知驱动模型,双编码器四阶段学习,在百万级基准六维度超越现有模型,证实低层视觉感知是可靠临床诊断关键。
几何2D场景图生成
提出基于Faster R-CNN和注意力图卷积网络的方法,不依赖语义数据,在小数据集上生成装配场景图。
SiPhy:单图像物理属性推理
SiPhy框架从单张RGB图像推理物理属性,结合视觉与语言知识,性能超越多视图方法,可用于物理理解数据标注。
通过强化数据选择的主动少样本分割
提出强化学习框架优化支持集选择,实现少样本医学图像分割的联合优化,提升分割性能。
IR275K:面向高效遥感的多帧红外超分辨率基准
提出红外多帧超分基准IR275K(594视频/27.5万帧),轻量模型CGMamba达33.19dB PSNR,证实2D旋转位置编码的关键作用。
时间反演成像:重建过去人类-环境交互的多模态基准与框架
提出时间反演成像,从热、紫外、可见光谱衰退痕迹重建过去交互,构建TRACE-HEI数据集,用多模态扩散模型方法验证可行性。
可变形三角形喷射:用于实时辐射场渲染的灵活基元
提出可变形三角形,用边缘控制点实现非凸形状表示,可微分渲染,性能优于现有方法。
扩散模型的感知相关性与保持高斯性的鲁棒潜在角度水印方法
提出LAW方法,将水印编码为潜在对的反点角度,保持高斯性并实现鲁棒嵌入。
Twins: 用焦点损失学习预测统一表示
Twins通过通道级联ViT和VAE特征形成统一连续token空间,并用焦点回归克服优化不平衡,显著提升生成质量。
CARA:面向可解释碰撞预测的概念感知风险注意力
CARA利用事故叙事提取风险概念,通过视觉语言对齐形成动态轨迹,实现可解释碰撞预测,提升准确性与预警及时性。