Forge4D:基于未标定稀疏视角视频的前馈式4D人体重建与插值
提出Forge4D,从未标定稀疏视角视频高效前馈重建4D人体,结合流式3D高斯重建与稠密运动预测,实现新视角和新时间合成。
面向遥感图像分类的语义感知层次共识学习
提出语义感知层次共识方法,利用层级标签结构融合预测,提升遥感图像分类性能。
ARGenSeg:基于自回归图像生成模型的图像分割
提出统一框架,以图像生成实现分割,提升像素级感知,超越现有方法并大幅加速推理。
协同模态与切片记忆框架用于跨模态三维脑肿瘤分割
提出MSM-Seg,融合模态与切片记忆及类别无关提示,实现多模态脑肿瘤高效精准分割。
LaGen:迈向自回归激光雷达场景生成
首个自回归LiDAR场景生成框架,单帧输入加边界框条件,逐帧交互生成长时序场景,在nuScenes上SOTA。
用于稳健自主导航的三路开放集检测
针对未知场景,提出将检测结果三分类为已知、未知、背景,避免单一阈值取舍,提升自主导航安全性与效率。
通过激活重放提升大型多模态模型的推理能力
无需训练,重放低熵激活,提升强化学习后多模态模型的数学、视觉智能体和视频推理能力。
Lumos3D:一种用于低光照3D场景恢复的单次前向框架
提出Lumos3D,无位姿单前向低照度恢复框架,经跨光照蒸馏与Lumos损失,由无位姿多视图直接恢复,免逐场景优化,效果媲美场景特定法。
PreResQ-R1:面向鲁棒视觉质量评估的响应-偏好解耦排序与评分强化优化
提出PreResQ-R1,解耦响应与偏好,用GRPO统一评分与排序,在IQA/VQA基准达SOTA。
好事过头反成坏事——知识蒸馏何时加剧过拟合及如何避免
中间层知识蒸馏在细粒度小样本数据中显著提升性能,但经典数据集只需蒸馏最后一层。
保真偏好而非人口统计偏好:图像美学/偏好评分器的像素级属性敏感性审计
审计四类评分器,发现保真偏好主导而非人口偏好,合成图像结果误导,需真实数据验证。
世界模型的柏拉图式表征假说
提出预测一致性假设,认为共享状态转移目标促使异构世界模型收敛到相似潜在结构,并验证其功能兼容。
YOLOv26/YOLOv11/YOLOv8跨代优化:面向复杂果园细粒度小目标检测与实例分割
对比YOLOv8/11/26五种规模及两种分辨率,小目标训练更优;YOLOv11s-960最佳,YOLOv26s-960性价比高。
DriftAD:视觉引导文本漂移的少样本工业异常检测
提出DriftAD少样本异常检测框架,含信号放大、视觉引导文本漂移、空间门控模块,在MVTecAD和VisA上达最优性能。
面向卫星轨道预测的速度耦合表示细化
提出速度-位置耦合表示学习方法,结合轨道分段建模,提升卫星轨道预测精度。
通过速度匹配扩展扩散模型的强化学习
提出速度匹配奖励微调RVM,直接优化速度场,免去似然计算,性能优于轨迹策略梯度,训练成本更低。
混合比例并非性能关键:诊断视觉-语言模型少样本适配中的原型混合
混合比可无验证集近最优估计,但即使最优调和仍不及线性探针;性能瓶颈在模型类而非超参数。
更多运动并不总是更好:语料组成决定数据增强是否有助于基于SMPL的帕金森步态严重度评估
基于SMPL运动评估帕金森步态严重度,宏F1达0.58;语料构成而非数据量决定效果,速度对比是关键。
CRISP:面向遥感语义分割的校准感知视觉状态空间对偶
针对状态空间对偶模型压缩高频导致边界平滑,提出校准算子恢复细节,并利用多原型头保持特征,提升遥感分割精度。
Gen2Physics:通过多视角材质分解将生成的三维网格赋予物理属性
自动分解生成网格为材质并赋予物理属性,分割精度提升两倍,匹配质量估计,唯一输出水密子网格。
遗忘中恢复:跨图像退化的持续学习
提出RwF框架,用轻量适配器按序学习新退化,免遗忘且无需旧数据,无监督路由选路径,PSNR提升15dB,首建持续多退化恢复基准。
LUCAID:面向肺癌精准病理的智能体多模态AI
LUCAID智能体AI系统覆盖肺癌病理全流程,前瞻临床验证决策一致性达93%,优于病理医生的68%-81%。
灵长类视觉揭示鲁棒动态AI的缺失原则
灵长类视觉揭示缺失原则:动态物体识别需将运动逐步融入表征;预测世界模型最接近脑且泛化强,预示预测学习是路径。
基于CT阅片3D注视模式预测放射科医生专业水平
提出凝视感知Transformer,融合放射科医生3D注视模式,用于胸CT经验分类,AUC 0.91,F1 0.86。
DDMS:将多视角基础特征判别式蒸馏至单视角模型
通过判别式蒸馏,将多视图模型的三维几何知识注入单视图模型,获得兼具三维一致性与局部判别性的基础特征。
基于Transformer的婴儿护理干预分类视频数据集
ICVD:4144视频12类,Transformer93.97%,帧级23%,需时间建模。
LUX:病灶感知图条件视觉-语言架构,用于可解释的内镜影像描述
提出病灶感知图条件视觉语言架构LUX,用于可解释内镜描述,提升性能并减少幻觉。
跨模态目标计数:分类法、基准、应用与开放性挑战
目标计数转向开放词汇模型,但评估滞后致失败;提出五轴分类,强调稳健评估以区分开放世界泛化与基准优化。
AffineTok:面向扩散友好视觉分词器的语义仿射一致性
提出语义仿射一致性,用两个训练组件优化分词器,ImageNet-256上gFID降至1.21/1.10。
演化语义概念漂移下的持续视觉学习
提出SemReWrite框架,选择性更新过时视觉语义映射并保留有效知识;引入EvoShift-Bench基准与重写/保留指标,取得更优平衡。
GlanceWAM:世界-动作模型的稀疏测试时想象
GlanceWAM将视觉想象异步化,在潜在空间解码动作,实现实时控制与高成功率,优于同步世界模型。
SceneReGen:从单张图像生成式重建三维场景
提出SceneReGen框架,将场景重建视为在共享坐标系中生成与组装完整物体,通过选择性位姿分解弥合生成与重建差距,在3D-FUTURE上取得最优场景级指标。
LG-GER:基于多模态证据蒸馏的语言引导群体情绪识别
利用多模态大模型生成空间证据并蒸馏至单视觉语言模型,推理时无需检测器,性能领先。
RefineRank:面向外科手术时空定位的联合框细化与排序
该方法以紧凑模块融合语言与区域特征,联合细化候选框与排序,提升手术时空定位精度,无需重训骨干。
面向单张肖像重建的3D高斯头部源人脸真实性检测:基准与专用检测器
首个基准揭示单图重建3D头部检测难题,提出两阶段训练检测器,掩码自编码+多视角对比学习,精度最高。
HAP: 基于跨模态对齐的头自适应视觉令牌剪枝
提出PAQ指标衡量头对齐质量,按PAQ加权聚合注意力剪枝令牌,保留5.6%令牌达99.1%性能,最先进。
Luce:面向3D资产生成的可重照明高斯表示
提出Luce:体素化多模态高斯统一几何与PBR材质,单图生成可重照明资产,Toys4K上FID提升28%,达SOTA。
ROI门控SAHI:内容自适应切片推理实现高效目标检测
提出ROI门控SAHI,用轻量提议器定位前景以节省算力。稀疏场景加速显著(最高6.9倍),但需策略路由保证平均性能。
面向乳腺超声诊断的通用-专家模型协作引导反馈框架
提出引导反馈框架,引导阶段结合术语与专家预测防幻觉,反馈阶段融合文本视觉特征,提升诊断准确性与可解释性。
吸收梯度冲突:基于Kent分布的跨模态哈希语义方差建模
提出Kent分布代理哈希,以动态方向方差吸收多标签梯度冲突,稳定语义均值,优于现有方法。
DRRG:用于放射学报告生成的离散扩散框架
提出DRRG离散扩散框架用于放射报告生成,采用迭代去噪和修正,结合临床实体掩码与概念条件,优于自回归方法。
WeMM-Embedding:微信多模态嵌入技术报告
微信多模态嵌入模型(2B/4B/9B)基准领先,9B版SOTA80.6,已部署微信推荐搜索,代码开源
IterCAD:面向正交视图的CAD代码生成的迭代式程序修复
提出迭代修复框架,将正交视图到CAD生成变为渐进修复,反复分析差异决定修改或停止,提升代码可执行性与几何保真度。
低秩速度场作为无监督4D医学图像插值的结构先验
提出低秩速度场结构先验,约束运动至张量低秩空间,实现无监督四维医学图像插值,改善结构一致性与解剖轮廓。
用于4D医学图像插值的相位对齐有限傅里叶周期形变
提出相位对齐有限傅里叶周期形变,嵌入周期运动先验并重参数化时间,实现4D医学图像插值,在ACDC和4D-Lung上最优。
扩散与流模型中的表示学习:应用视角
综述扩散与流模型的表示学习应用,提出三层次框架,覆盖分类、感知等下游任务,展望未来方向。
中文标题
中文摘要
面向4D点云视频自监督学习的掩蔽点管联合嵌入预测
提出联合嵌入预测,以掩蔽点管潜在预测避免重建,学习时空特征,提升动作识别性能。
VisCache:面向高效视觉大语言模型推理的视觉KV缓存剪枝
免训练视觉缓存剪枝:关键帧筛选与分层剪枝协同,仅留19-28%缓存即获2.35倍加速,性能持平,新前沿。
ViSculpt:以视觉为中心的智能体几何编辑
无需训练的多智能体系统,通过Blender界面模拟人工操作,直接编辑3D网格,保持原始特征。