KM-Speaker:基于关键点的风格控制,用于高质量语音驱动3D面部动画与对话定位
提出关键点条件流生成框架,分离唇动与上半脸动态,实现高保真运动与灵活控制,超越现有方法。
数字化教练智能:基于VLM和RAG的整体运动员画像智能体框架
提出混合智能体框架,结合CV与VLM,通过智能分块和自纠错实现自动化运动员评估,支持自然语言查询。
DataComp-VLM: 改进的视觉-语言模型开放数据集
DCVLM基准:指令密集型数据混合比过滤更关键,8B模型达63.6%准确率,领先FineVision 5.4个百分点。
SIGNET:用于跨语言手语翻译的动作级知识迁移
SIGNET框架通过动作级知识迁移实现跨语言手语翻译,利用注意力机制融合多专家,在多个基准上达到最优性能。
Animation2Code:评估视频到代码生成中的时间视觉推理
新基准Animation2Code评估视频到代码推理,发现模型外观匹配好但时间一致性差。
IMU-HOI:通过接触感知的惯性融合实现一致的人-物交互与运动捕捉的共生框架
提出IMU-HOI框架,利用稀疏IMU联合推断人体姿态与物体轨迹,通过接触感知融合提升交互场景下的运动捕捉精度。
Meshtryoshka: 通过网格光栅化实现真实场景的可微分渲染
提出嵌套网格壳可微分渲染框架,兼容现成光栅化器,适用于无界真实场景,质量接近非网格方法。
AEGIR:使用高斯点云对室内逆渲染中的面光源建模
AEGIR显式建模面光源,结合可微延迟渲染与多重要性采样,实现准确局部光传输与更一致的材质光照分解。
遗忘咒:从自回归图像生成模型中擦除概念
提出Obliviate方法,通过KL监督、轨迹更新及对齐前缀,有效擦除自回归图像生成模型中的有害概念。
基于物理的解耦流建模用于脑疾病进展轨迹
提出PDF框架,解耦脑病变形态与强度演化,引入PDE正则化,实现最优预测。
FedLAS:用于神经网络校准的特征调制双向标签平滑
FedLAS通过特征调制双向标签平滑,检测并调整样本的过自信与欠自信,提升神经网络校准效果。
SemDynReg:语义引导的动态3D高斯溅射变形正则化
提出语义引导的物体级变形正则化方法,提升动态场景渲染一致性与质量。
BackTranslation2.0:一种基于语言学动机的手语生成评估指标
BackTranslation2.0基于语言学,通过工具和LLM交叉比较从四维度评估手语生成,与人类判断高度相关。
BREIT:基于多频3D电阻抗成像的脑卒中重建框架
BREIT是3D MF-EIT脑卒中重建的模块化框架,包含数据生成、正向求解和D-bar方法,并提出dFNO-bar提升脑SSIM。
距离感知空间建模预测原发组织微结构转移风险
提出DTMf-MIL方法,利用符号距离函数显式捕捉肿瘤微环境空间布局,显著提升转移风险预测性能。
SATB-VR:利用信噪比感知轨迹混合训练少步视频恢复扩散模型
提出信噪比感知轨迹混合策略,动态混合预测与真实轨迹,解决训练-推理不一致,实现高效少步视频恢复。
LogiCo:逻辑与结构异常检测的统一框架
LogiCo通过组件级特征重建统一检测逻辑与结构异常,在四个基准上达到最优性能。
通过语言介导的鲁棒嵌入生成减轻组织病理学中的批次效应
GLMP框架利用多模态大语言模型,通过文本中间表示生成鲁棒嵌入,有效减轻批次效应,提升病理模型泛化性。
CCRC:面向图像变化描述与分割的变化感知描述推理链
提出CCRC双链框架,通过变化感知注意力和标记精炼器,实现图像变化描述与像素级定位,达最优性能。
FreqOrtho-SR:频率引导的正交专家学习用于真实世界图像超分辨率
FreqOrtho-SR通过频率专家路由和正交梯度投影,平衡保真与感知,适应多种退化。
X-Mind:通过预测世界模型实现高效视觉思维链的端到端驾驶
X-Mind将预测世界模型内化为视觉思维链,以紧凑表示和递归扩散实现低延迟端到端驾驶。
扩散逆问题的随机最优控制采样
提出随机最优控制采样,通过封闭形式控制更新实现快速测量一致的高质量图像重建。
物理基础的世界模型多智能体动力学基准
CrashTwin基准通过时空一致性、能量守恒等量化评估,揭示高视觉质量的世界模型常掩盖严重物理违规。
虚拟戒指试戴
结合MediaPipe和YOLO,自动检测手部关键点并调整戒指位置与大小,实现真实感佩戴。
PSP:利用位置和形状先验的跨域少样本医学图像分割
提出PSP框架,利用位置与形状先验解决跨域纹理差异,通过三个模块实现鲁棒分割,性能显著超越现有方法。
CoGS: 基于单目视频的组合动态人-物场景高斯泼溅
CoGS通过分解人体、物体与场景,六阶段优化实现单目视频动态人-物重建,效果更优。
ViPSim:协同视觉与参数空间实现一致长时域具身世界模型
ViPSim通过视觉与参数空间协同,解决几何对应缺失,实现一致长时域生成,提升轨迹保真度与泛化能力。
HKVLM: 通过将语言查询绑定到冻结检测器实现忠实推理定位
HKVLM用轻量对齐钩子绑定冻结检测器区域与语言查询,实现忠实推理,定位精度提升50-90倍,幻觉率从0.99降至0.23-0.43。
RefGlass-GS:一种基于无人机的融合框架,通过高斯溅射实现反射玻璃幕墙的逼真、语义与交互式数字化
提出RefGlass-GS框架,实现无人机对反射玻璃幕墙的逼真、语义与交互式数字化,在面板分割、视角规划和渲染上超越现有方法。
DLGStream: 动态语言嵌入的高斯溅射实现开放词汇自由视角视频流
DLGStream通过双不透明度动态语言高斯与插值变形场,实现低存储高帧率的开放词汇自由视角视频流,支持交互与编辑。
Ground4D: 基于一致性感知的单目视频4D重建
提出Ground4D两阶段方法:先以3D基础模型初始化几何,再经动态高斯泼溅精化,实现单目视频中多视图一致的4D重建与渲染。
Personalizing MLLMs via Reinforced Multimodal Reference Game
EpiSAM:挑战性石刻铭文中的字符分割
提出EpiSAM邻域感知Transformer,通过预测相邻字符解决石刻铭文边界歧义,提升分割精度并实现零样本泛化。
ExACT: 示例驱动的校准精化方法用于遥感图像免训练视觉定位
提出ExACT框架,通过示例视觉校准与结构感知精化,实现遥感图像免训练精准像素定位,效果优于现有方法。
天空是什么颜色(对于非人类)?
通过计算不同物种视觉系统的天空光单色同色异谱,发现主导波长差异显著,远不同于人类感知的蓝色。
自我进化的智能体图像恢复:深思规划与直觉执行
提出SEAR框架,融合直觉执行与深思规划的MCTS及自进化记忆,解决贪婪搜索与信息遗忘,图像恢复性能领先。
基于投影的红外热成像与立体相关数字图像相关耦合方法
提出投影耦合方法,将红外热成像二维温度映射到立体相关DIC三维点,适用于曲面并计算温度梯度与变化率。
尼泊尔车牌字符识别
基于YOLO和CNN的尼泊尔天城文车牌识别系统,准确率达93%,代码已开源。
视觉-语言模型的测试时缩放
测试时缩放使小型LVLM性能提升30%,但过多计算致失焦,视觉信息仅在推理早期贡献。
从采集数据中学习:元数据驱动的心脏MRI多模态预训练
利用采集元数据作为文本监督,MetaCLIP-CMR在心脏MRI分类与分割中表现优异,仅需极少量预训练图像即达可比性能。
SciFlow:自监督光流领域泛化的语义交叉干扰
SciFlow通过语义干扰和几何一致性,实现从合成到真实域的自监督光流泛化,无需真实标注。
Evidence-Based Text-Conditioned 3D CT Synthesis for Ovarian Cancer
Mural:基于混合Transformer架构将大语言模型知识迁移至图像生成
通过混合Transformer融合冻结大语言模型与扩散模型,仅用文本-图像数据训练,取得强性能并涌现跨语言、颜色引导等能力。
基于秒级跟踪和强化学习验证的多模态大模型高效时空定位
提出秒级跟踪+强化学习验证管道,结合合成思维链与RL优化,实现长视频高效准确时空定位。
从雾室到飞机舷窗:像素配准成像与合成微调实现跨域去雾
实验室雾预训练加合成雾微调,无需目标域数据即可在飞机窗等新场景有效去雾。
超越后向散射:面向基础骨干网络的快速SAR洪水分割的AlphaEarth土地覆盖先验
评估AlphaEarth土地覆盖先验提升SAR洪水分割,在难事件上优于DEM但稳定性略差。
自适应频谱感知特征解耦网络用于小目标检测
提出SFDNet,通过自适应频谱解耦和类原型蒸馏,有效检测小目标,性能显著超越现有方法。
特征空间中的流匹配用于随机世界建模
FlowWM在预训练高维特征空间进行流匹配,实现高效随机世界建模,提升感知性能与模式覆盖。
语义感知、物理启发、几何约束的天气视频合成
提出语义、物理、几何三信号框架,合成多样逼真天气效果,提升自动驾驶鲁棒性。
BTI-Net:基于不确定性感知门控的双向解码器级任务交互用于多任务医学图像分析
提出BTI-Net,通过双向解码器任务交互门控实现分割分类协同,无需额外标注,在超声、皮肤镜及脑MRI上提升IoU和精度。