GraFT:通过3D场景图为多模态大语言模型提供空间推理的免训练框架
GraFT免训练框架借3D场景图提供几何、布局与属性推理,ScanQA提升27%,VSI-Bench超越多个微调模型。
相位信息对少样本细粒度图像分类的影响
提出幅相整合模块与专用网络,利用相位信息提升少样本细粒度图像分类,在五个公开数据集上超越现有方法。
多视图图像的稀疏自回归场景生成建模
提出稀疏体素潜空间自回归模型,由多视图图像补全场景,无需三维真值,新视角质量优于先前。
锐化集成:用于脑MRI修复后处理的SSIM对齐残差细化器
提出结构相似度对齐的残差细化器后处理:误差基本不变,集成评分提升,六成以上病例改善,无需大规模重训练。
OctWorld:基于八叉树三维映射的长程世界一致性视频生成
提出八叉树三维记忆的视频扩散框架,实现长程世界一致生成,优于现有方法。
世界奖励:面向相机条件世界模型的奖励建模
提出世界奖励模型,用视觉语言模型统一评测动作与画质,超越GPT-5.5,提升世界模型强化学习。
RARF:区域感知修正流用于3D脑部MRI修复
提出区域感知修正流RARF,仅修复病变区域,保留健康脑组织解剖结构,BraTS评测中重建结果具竞争力。
2D婴儿姿态估计中的盲点:从噪声标注中稳健学习
提出REMIND,利用训练动态聚类选择关键点识别噪声标注,在早产儿姿态估计中AUC达93%。
整体三维结构的稳定可扩展光束法平差
提出统一框架,将光束法平差扩展到联合优化几何特征与高阶关系,保持稀疏结构,速度接近经典方法且精度更高。
数字凹视下的高效语义理解
数字凹视借稀疏观测与选择性计算能以极低算力达到接近全图的语义理解,无需逐像素密集处理。
可编辑视觉设计
提出以编码代理驱动的可编辑视觉设计范式,整合视觉语言模型与图像生成,产出分层可编辑、含真实文本的设计。
IchthyoNoma:孟加拉淡水鱼识别中零样本生物视觉-语言模型的命名与上下文敏感性
测试零样本视觉语言模型识别孟加拉淡水鱼,性能依赖生物知识、语言、命名与上下文;最强模型孟加拉语提示也近乎随机。
TAP-Path:面向高效可信病理基础模型的任务自适应结构与标记剪枝方法
提出TAP-Path框架,剪除冗余模块与标记,参数减24.96%、算力减35.20%,性能超Virchow2/UNI2-h,内外验证均保持高准确率与可靠性。
DSAQuant:面向视频生成的去噪阶段对齐量化感知训练
DSAQuant:训练按去噪阶段对齐,保早期结构、强后期细节;推理禁用CFG,视频量化性能显著提升。
离散思维,连续动作:面向端到端自动驾驶的潜对齐规划
LaPla提出潜对齐规划VLA框架,将语义映射为连续动作,免自回归并消除量化误差;L2误差降15.52%,成功率提升33.34个百分点。
以目录图像为冷启动:迈向可部署的硬质合金旋转锉识别
目录图像作冷启动识别硬质合金旋转锉:度量学习迁移不足一半,灰度化与订单约束检索增益最大。
CORE:通过重排序器蒸馏提升MLLM嵌入模型的组合推理
用重排序器蒸馏提升多模态大语言模型嵌入的组合推理,提出排序KL散度目标,在组合推理基准上最优且不损检索性能。
超越检索:面向流式视频理解的渐进式潜记忆演化
提出流式视频理解新框架,将记忆从存储检索转为检索内化,经分层渐进演化形成紧凑潜记忆,达最优性能。
Scal3R:面向可扩展在线三维重建的高效多相对位姿查询学习
多参考相对位姿查询、轻量令牌注入冻结主干及位姿图优化,大幅降低在线重建漂移。
使用3D基础模型场景表示的零样本新视角深度合成
提出Z3D方法,利用3D基础模型内部表示进行潜在扩散,从新视角生成逼真深度图,实现多数据集零样本深度估计。
看见再合成:VLM引导的转换事件发现用于弱监督稠密视频描述
提出SBS框架,先用视觉语言模型感知片段间隙并检测事件转换,再优化时间掩码,提升弱监督稠密视频描述的定位与生成性能。
单编辑器多种编辑:统一的无训练多样化视频编辑框架
提出无训练视频编辑框架,融合稀疏因果记忆与软潜混合,统一支持指令及参考引导的多样编辑,性能显著领先。
生成图像模型中的持久身份保持:基准与评估系统
生成模型身份保持仍差;用可复用持久身份表示,可显著减轻生成编辑修复中的身份漂移,不损质量与指令遵循。
Principia:视频模型的关联物理测试
提出Principia基准,用成对物体关系一致性检验视频模型的牛顿物理,无需校准。测试8种现象,现有生成模型得分低,视觉语言模型检测接近随机。
时间之形:视频-标记对比提升视频大模型时间理解
为视频大模型设计时间反事实目标,作用于末帧视频标记,按顺序对比排序视图,无需改架构即可提升视频时间理解性能。
BooM-VVT:利用图像级伪数据增强无掩码视频虚拟试穿
提出无掩码视频试穿,用图像级伪数据训练,结合关键帧采样与三维位置编码,建多视角数据,增强时间一致与服装保真。
Puffin-World:利用原生3D世界状态扩展统一多模态模型
统一多模态框架联合物理深度外观原生状态与全景相机生成物理一致三维世界并重建几何发布相关数据集
ScoreMix:扩散模型分数组合生成合成数据提升识别性能
利用扩散模型分数组合混合类别条件,无需外部资源即可生成难样本,提升人脸识别准确率最高7%。
TokenMatch:基于曲率引导分词的三维网格对应Transformer
提出统一Transformer模型TokenMatch,用曲率引导分词与自/交叉注意力,仅训练于部分匹配即可泛化至全形状,多数指标领先且推理亚秒级。
超越模糊:基于皮肤微纹理的远程皮肤科可评估性语义三视图流水线
提出语义三视图流水线,以皮肤微纹理为质量标志,融合多视图评估可诊断性,清晰病例AUC升至0.96。
时间自蒸馏:视频中视觉状态跟踪的无监督学习
提出S3T时间自蒸馏,以时间采样密度为特权信息,稠密视角教师指导稀疏学生,无需标签监督,提升视频状态跟踪精度。
利用解剖先验和主动学习提高AGITG TOPGEAR临床试验中临床靶区体积分割精度
解剖先验和主动学习均提升CTV分割精度,联合最优DSC0.87,支持自动化轮廓QA。
感知哪种模态重要:面向鲁棒VLA策略的证据门控正则化
提出证据门控正则化,解决VLA模态纠缠,增强抗遮挡/干扰鲁棒性,仿真与真实机器人成功率显著提升。
当视觉遇见图:图推理与学习综述
综述视觉图表示用于图推理与学习,分三类:视觉推理、视觉增强学习、科学图表,展望感知图的基础模型。
基于可组合基础先验与泛化抓取合成的自适应视觉-语言抓取
提出AdaRoboVLG,解耦抓取合成与任务理解,利用可组合先验实现跨手泛化与功能抓取,无需重训基础策略。
ISP-AD:含合成与真实缺陷的大规模真实工业异常检测数据集
提出ISP-AD最大真实工业异常检测数据集,含合成/真实缺陷;少量真实缺陷提升泛化,合成缺陷作冷启动。
FlexMap:灵活相机配置下的鲁棒高清地图构建
FlexMap无需相机参数即可适应多变配置,利用几何基础模型与时空增强,在缺失视图下仍优于依赖位姿的基线。
AnyBox:面向机器人操作的箱体高效零样本9自由度位姿估计
AnyBox零样本估计箱体9D位姿,利用几何先验与深度过滤,基准AP提升36点,接近CAD模型方法。
VKnowU:评估多模态大语言模型中的视觉知识理解
提出VKnowU基准,含1680问、1249视频,评估28个多模态大模型,发现其缺乏物理等视觉知识;新模型VideoKnow+显著提升性能。
脱离普朗克轨迹:利用二维色度改进相机内色彩
改用二维色度与轻量神经网络,LED场景颜色误差平均降22%,兼容传统光源,可实时用于相机内校准。
量子隐式神经表示用于新视角合成
提出3D-QISR,首个混合量子-经典辐射场模型,用参数化量子电路替代NeRF骨干,参数减半而性能相当,开辟量子隐式神经渲染新方向。
Fast-BEV++:算法致快,设计至简
Fast-BEV++分解视图变换免定制内核,提速超3倍;在nuScenes达0.488 NDS与134+FPS,兼顾精度与高效部署。
面向连续视角优化的相机泼溅法
提出相机泼溅法,将相机建模为3D高斯,用点相机连续可微优化视角;相比FVS,更好捕捉金属反射和复杂纹理。
Skyfall-GS:利用卫星影像合成沉浸式三维城市场景
融合卫星重建与扩散细化,无需昂贵三维标注,合成街区级沉浸式三维城市场景,支持实时探索。
DIAL-GS:基于4D高斯溅射的无标签街景动态实例感知重建
提出DIAL-GS:用4D高斯溅射无标签街景动态实例感知重建,实例与动态互促,超现有自监督。
基于大语言模型自动标注的短窗口滑动学习用于实时暴力检测
提出短窗口滑动学习,用大模型自动标注短片段,保留时序,实时检测暴力准确率高,分别达95.25%与83.25%。
热成像用于无接触式心肺与泌汗反应监测
热成像视频可无接触估计皮电、心率与呼吸率,最佳皮电相关0.40,呼吸误差3.1,心率受帧率限制,为工业人机交互提供辅助感知。
损失最知:通过损失轨迹检测视频标注错误
利用检查点损失轨迹计算累积样本损失,用于审计视频标注的语义错标与时间乱序,较基线提升达4.2点AUC。
EmbedTalk:基于高斯嵌入的说话头合成
提出高斯嵌入替代三平面,用于说话头合成,提升渲染质量、口型同步及运动一致性,模型更紧凑,可每秒60帧以上。
PoseDreamer:基于扩散模型的可扩展逼真人体数据生成流水线
提出扩散模型流水线PoseDreamer,生成50余万张带三维标注的逼真图像,质量优于渲染数据,训练效果媲美真实数据。