PatchScene:基于块的体素扩散用于大规模场景补全
提出基于块的体素扩散框架,结合置信度引导时空融合与环形流扩散,实现大规模LiDAR场景最优补全,泛化能力强。
自举生成器:基于流匹配的无配对视觉编辑
提出ByG框架,利用基模型知识和循环一致性无配对训练,梯度路由解决训练-推理差距,数据稀缺下图像视频编辑达SOTA。
Demo2Tutorial: From Human Experience to Multimodal Software Tutorials
多模态视频理解中的视觉状态跟踪基准测试
提出VSTAT基准,发现多模态大模型在视觉状态跟踪上远低于人类,主要失败于视觉感知而非推理,现有代理方法仍不足。
GARDEN:基于RGB图像的重力对齐解耦环境重建
提出GARDEN框架,利用重力先验从RGB图像重建可物理交互的解耦环境,刚体与背景分离,提升模拟真实性与效率。
VLESA:用于人类活动监控的视觉语言具身安全智能体
VLESA框架通过第一人称视频实时监控人类活动并预测危险,使用目标条件安全Q过滤器提升干预精度,安全性提高超41个百分点。
Video-Mirai:自回归视频扩散模型需要远见
Video-Mirai通过冻结的未来编码器将目标蒸馏到因果状态,弥补表示规划缺口,提升视频生成一致性且不改变推理设计。
面向高置信度对抗训练的自适应因果对齐
高置信度预测常过拟合背景,HICAT框架通过自适应诊断与矫正实现语义均衡,显著降低鲁棒泛化差距。
AAD-1:面向一步自回归视频生成的非对称对抗蒸馏
AAD-1通过非对称对抗蒸馏与分阶段训练,解决运动塌陷,实现一步自回归视频生成最优性能。
探索激光雷达语义场景补全的简易提升方法
用语义伪标签和可见性信息提升性能,旧模型可超越SOTA。
PixVOD:像素分布式直接视觉里程计与深度估计
提出全并行像素分布式视觉里程计与深度估计,通过高斯置信传播和关键帧锚定,实现传感器上实时共识与深度推断。
SimuScene:从单张图像重建可立即用于仿真的组合式三维场景
将物理引擎融入生成过程,通过物理反馈校正形状与布局,实现稳定可仿真的三维场景重建。
NewtPhys:基础模型理解牛顿物理学吗?
NewtPhys数据集基于真实场景多视图图像,提供细粒度物理标注,评估多个模型,揭示低层物理推理局限。
PHASER:面向视觉-语言-动作模型的相位感知与语义经验回放
PHASER通过相位感知容量分配与语义干扰路由,解决VLA模型持续学习中灾难性遗忘,ASR提升31%达87.8%。
PaintBench:精确视觉编辑的确定性评估
PaintBench是精确视觉编辑的确定性基准,揭示模型表现低(最高17.1% mIoU),与下游任务强线性相关。
双差分散焦与立体一致性深度估计
提出D^3S算法,融合双差分散焦与立体一致性,实现4mm基线、1cm误差的紧凑高精度深度估计。
MARIO:运动增强的实时多传感器惯性里程计
提出基于人体运动动力学的IMU姿势先验,结合多传感器融合,显著降低惯性里程计漂移达42%。
BEAST3D:通过高斯泼溅从多视角视频进行动物行为分析和神经编码
BEAST3D自监督学习多视角动物3D表示,用高斯泼溅重建,仅需四视图,应用于行为分析和神经编码。
用于联合音频-视频生成的推理时缩放策略
提出多验证器框架与自适应奖励加权,平衡多目标,提升音视频生成的语义对齐与同步性能。
视觉任务中的改进型信念注意力
提出Belief2-Attention,同时利用投影与垂直分量并引入额外内积矩阵,在图像分类与分割中验证有效性。
分割引导的空间索引用于可泛化且可解释的深度伪造检测
利用分割引导空间索引选择语义补丁池化,提升深度伪造检测泛化性与可解释性,Celeb-DF v2 AUC达0.905,无需微调。
面向阻塞性睡眠呼吸暂停低通气综合征的基于证据的多模态筛查的结构化视觉证据分解
提出EviOSAHS框架,分解面部七区域视觉证据并结合临床资料,高灵敏度筛查OSAHS,准确率88.47%。
DefocusTrackerAI -- 一种用于自动检测离焦粒子图像的通用框架
提出基于YOLOv9的深度学习框架DefocusTrackerAI,自动检测离焦粒子图像,不确定性0.1-0.4像素,通用性强,适用于多种光学实验。
数据流形几何显式建模的扩散图像生成
提出MIND模型,显式建模数据流形几何,融合离散标记与连续扩散,通过软top-k聚合等创新,FID低至2.06。
基于流的生成模型用于优化压缩感知应用中的采样策略
提出任务感知流生成框架优化压缩感知子采样,在图像重建等任务中达最先进性能,峰值信噪比显著提升。
弥合2D与3D之间的鸿沟:面向视觉语言导航的层次化语义-几何地图
提出HSGM,将3D几何结构化表示,VLM高层规划,零样本导航达SOTA。
结合细胞层与分类器注意力实现可解释弱监督病理定位
提出注意力条件一致性联合训练细胞层和分类器,使定位信号对齐,AUC提升至0.94以上。
Planktonzilla: 用于理解浮游生态系统的多模态数据集与模型
整合13种成像系统、含1740万图像的最大浮游数据集,显示监督分类优于CLIP训练,现有生物基础模型不足。
多样性优先于频率:重新审视视觉思维链智能体中的工具使用
工具使用坍塌现象表明,单纯增加工具使用无益推理,多样化探索更关键,引入熵正则化可降低使用却提升性能。
递归视觉Transformer与动态深度宽度调整的资源高效图像语义通信
提出递归ViT及动态深度宽度调整策略,参数减少48.7%,同计算量下重建质量更高。
位置编码锚定视觉Transformer的空间结构:鲁棒性的几何视角
提出SSDC指标,发现位置编码使ViT形成索引锚定空间结构,显著提升内容干扰鲁棒性,不同编码效果相似。
广义协变动作建模:通过时空解耦构建广义流形
提出GAM框架,通过时空解耦实现广义协变,从稀疏演示中密集填充连续动作流形,提升鲁棒性与泛化能力。
从视频中学习物理:最小轨迹条件下时不变二阶常微分方程的可辨识性
证明视频可唯一恢复二阶ODE参数,欠阻尼系统只需单视频,其他需三个轨迹,引入正则化防止潜在坍塌。
CardioLens:通过多序列心脏MRI评估揭示多模态大语言模型的临床现实差距
CardioLens测试平台揭示多模态大语言模型在心脏MRI解读中存在显著临床差距,性能差且难以改善。
基于语义和结构引导的脑活动图像重建通用框架
提出MindDiffuser两阶段框架,结合CLIP文本与视觉特征,实现语义和结构引导的图像重建,在fMRI/EEG/MEG三种模态下显著提升性能。
CoCoVideo:基于高质量商业模型的AI生成视频检测对比基准
提出CoCoVideo-26K数据集与CoCoDetect框架,实现高保真AIGC视频伪造检测,性能领先。
视觉噪声引导的上下文内蒸馏用于多模态大语言模型遗忘
VGID通过视觉噪声与文本上下文干预构建教师分布,蒸馏实现参数级遗忘,遗忘效果优且模型效用损失小。
VDSB-GWSyn:用于冠脉造影中可控且解剖可行的导丝合成的扩散薛定谔桥
提出DSB模型合成高保真冠脉导丝样本,改进定位精度,MPE从16.01降至7.71像素,PCK@3px从52.63%升至86.27%。
CoilDrop-MRI:基于线圈丢弃的自监督物理引导MRI重建
CoilDrop-MRI通过线圈级丢弃自监督学习,在多种MRI数据上性能优于现有方法,接近监督重建质量。
神经3D网格纹理映射的进展:综述
综述了神经3D网格纹理映射最新进展,涵盖GAN到扩散方法,分析架构、监督、数据集与挑战。
StressDream:引导视频世界模型实现鲁棒策略评估与改进
StressDream优化扩散模型噪声,引导生成合理的高影响结果(如任务失败),实现鲁棒策略评估与改进。
具有统一切线约束先验和曲率正则化的测地线
提出集成切线约束与曲率惩罚的测地线框架,通过方向提升空间限制切线,增强对弱边界和拓扑捷径的鲁棒性。
MyoSem:将肌电信号与自然语言动作语义对齐以实现手部动作理解
MyoSem提出EMG-语言语义对齐框架,实现手部动作文本-信号双向检索,优于基线并泛化到新用户和动作。
APE:用于图像生成与编辑的智能体提示增强器
APE后训练小型语言模型作为提示增强智能体,以轻量方式提升图像生成与编辑的视觉对齐,复杂组合任务上性能接近大模型。
StemBind:多模态大模型在抽象视觉推理中迷失于规则与实例之间
StemBind揭示多模态模型推理瓶颈:规则到实例映射失效,即使感知、规则正确仍51.2%选错,扩大模型或思维链无效。
DiffCrossGait:基于潜在扩散的2D-3D跨模态步态识别中的轨迹级对齐
提出DiffCrossGait,利用潜在扩散实现2D-3D步态轨迹级对齐,三阶段策略驱动,解耦生成与判别,高效推理达SOTA。
LastAct:轨迹引导的最新活动定位用于实时智能家居活动识别
LastAct用轨迹图像和边界定位器,在混合窗口中定位最新活动,提升流式智能家居活动识别鲁棒性。
面向空中车辆检测的对抗性补丁数字到物理迁移
研究对抗补丁从数字到物理的攻击,发现ON补丁物理鲁棒性最佳,揭示空中车辆检测系统的实际脆弱性。
急驾驶事件的严酷真相:基于大规模遥测、街道网络与谷歌街景的米兰路段级分析
米兰研究:宽车道、开阔视野增急驾驶强度;密集建筑降低;标线自行车道比隔离式风险高19.5%。
SUPREME:一个用于可复现的图像遗忘方法评估的多GPU框架
SUPREME开源多GPU框架,分布式执行训练、遗忘与评估,加速图像分类遗忘方法的可复现评估。