基于多模态基础模型与几何的零样本三维通用障碍物检测
零样本3D障碍检测,融合多模态基础模型与几何,时序LiDAR聚合,定位100米内,召回率提升10-25%。
人眼视觉约束的超分辨率
受人类视觉启发,动态指导超分辨率,降低计算复杂度,减少FLOPS而不损失感知质量。
论视觉位置识别中的运动模糊与去模糊
针对VPR中运动模糊影响研究不足,提出新基准评估运动模糊与去模糊,并给出自适应策略。
VerteNet——一种多上下文混合CNN Transformer,用于侧位脊柱DXA图像中精确的椎骨标志点定位
提出VerteNet混合模型,利用双分辨率注意力捕获局部与全局信息,实现高精度椎骨标志点定位,归一化均值误差4.92。
白色聚合与恢复:面向小样本3D点云语义分割
提出WARM模块,用白化和着色变换生成确定性原型,解决注意力分布差距,在S3DIS上达到最优。
AffordanceSAM:在功能可供性定位中再分割一切
提出AffordanceSAM,通过适应模块和三阶段训练扩展SAM到功能可供性定位,实现SOTA性能。
基于监督式跨模态特征匹配的单帧点-像素配准
提出无检测器框架实现单帧LiDAR与图像直接点-像素匹配,利用可重复性评分抑制不可靠匹配,在多个基准上达SOTA。
面向真实世界错位观测的鲁棒自监督跨模态超分辨率
RobSelf自监督模型联合优化翻译器和滤波器,实现错位对齐与高保真超分,速度提升15.3倍。
Memory-SAM: 基于检索生成提示的无需人工提示舌体分割
Memory-SAM通过检索历史病例自动生成提示,引导SAM2实现高精度舌体分割,无需人工标注,mIoU达0.9863。
AV-Master:双路径综合感知提升音视频问答性能
AV-Master以动态聚焦与模态偏好策略,增强跨模态协作,在复杂音视频问答中表现优异。
过渡匹配蒸馏用于快速视频生成
提出过渡匹配蒸馏框架,将视频扩散模型蒸馏为高效少步生成器,实现速度与质量的灵活平衡。
H3Former:基于超图的语义感知聚合与双曲层次对比损失框架用于细粒度视觉分类
提出H3Former,用超图聚合细粒度表示,双曲层次对比损失增强类间分离与类内一致性。
自我超越:外部特征引导对于加速扩散Transformer训练是否不可或缺?
提出自我超越方法,仅用内部特征监督加速DiT训练,性能超越外部引导的REPA。
LUMOS:用于分割的潜在通用医学先验知识
LUMOS利用冻结通用视觉模型提取潜在先验,引导传统医学分割网络,无需领域微调即提升性能。
面向视频面部表情识别的缓存个性化测试时自适应方法
提出TTA-CaP,利用三个互补缓存和门控机制实现无梯度在线个性化,在视频FER中性能超越SOTA。
任意到完整:单阶段深度补全中的Depth Anything提示方法
Any2Full提出单阶段、域通用的深度补全方法,通过尺度感知提示编码器将稀疏输入转化为统一尺度提示,性能提升32.2%,速度提升1.4倍。
基于策略的自回归图像模型调优:结合实例级与分布级奖励
提出轻量RL框架,用GRPO优化自回归图像生成,引入分布级LOO-FID奖励提升多样性,结合实例级奖励与自适应熵正则化,数轮调优即显著改善质量与多样性。
RehearsalNeRF:解耦动态照明的内在神经场以实现场景编辑
提出利用稳定光照先验解耦动态光照与场景辐射,实现鲁棒的新视角合成与场景编辑。
高斯溅射中的预测光度不确定性用于新视角合成
提出贝叶斯正则化线性最小二乘法预测像素级不确定性,提升高斯溅射可靠性及下游任务性能。
通过枚举与计数诊断多模态大语言模型的长视频定量推理
构建证据标注基准EC-Bench,揭示模型在长视频定量推理中枚举、时间定位和聚合能力远逊于人类。
循环渲染:基于视觉自反馈的矢量图形生成
提出Render-in-the-Loop范式,通过视觉自反馈训练与渲染验证推理,高效生成SVG,超越基线。
AS-Bridge:连接下一代天文巡天的双向生成框架
AS-Bridge利用扩散模型和布朗桥过程,实现LSST与Euclid观测的双向转换,支持缺失预测和罕见事件跨巡天探测。
浮点执行下基于Lipschitz的鲁棒性认证
针对浮点执行与实数算术的差距,提出形式化理论并实现高效认证器,首次在Lipschitz鲁棒性认证中考虑浮点影响。
APIVOT:交错视觉-语言思维的自适应规划
APIVOT利用视觉语言模型交错语言与视觉思维,实现长程自适应规划,在空间约束任务中显著提升成功率和效率。
DreamCharacter-1:从3D生成基础模型到产品级角色生成
提出DreamCharacter-1轻量后适应框架,通过几何纹理优化与推理加速,从3D基础模型生成产品级高保真角色,性能领先。
中文标题
利用低成本无人机和起重机摄影测量,实现落叶树冠3D重建,精度5-6毫米,完整度92-98%,用于监测枝条伸长。
GIRAF:迈向与铰接物体的可泛化人体交互
提出文本条件扩散模型,通过物体中心表示和混合训练,实现泛化的全身与铰接物体交互,超越现有方法。
超越热成像:从时间分辨热观测中推断热物理性质
提出ThermoField框架,融合神经场景与可微热传导,从热观测中联合重建几何、估计热物理参数并预测热演化。
对抗性诱饵:误导ViT中基于注意力的防御
独立优化补丁作为诱饵,转移注意力以绕过基于注意力得分的防御,揭示注意力大小非可靠对抗指标。
LOGOS:语言引导的航空场景有向目标检测
提出LOGOS,利用文本提示引导密集旋转场景下的有向目标检测,性能超现有方法。
FedTR:基于迁移学习的工业视觉检测联邦学习框架
FedTR结合迁移学习与联邦学习,用于工业视觉缺陷检测,词级准确率达95.5%和94.2%。
LightCrafter: 基于PBR条件的视频扩散细化实现可控且一致的重照明
提出LightCrafter,将视频重照明转化为PBR代理视频的扩散翻译,实现更精细的光照控制与时间一致性,超越现有方法。
SAGA:自回归视频生成的稳定加速引导
SAGA无需训练,通过加速度域光谱引导和噪声初始化,提升自回归视频生成时序质量。
端到端自动驾驶中的后训练技术
后训练弥补开环模仿不足,按监督形式分四类,提升自动驾驶安全与可靠性。
UAV-OVVIS:无人机也需要开放词汇视频实例分割
提出无人机开放词汇视频实例分割任务及无需训练的AeroTrack框架,在9类8279轨迹基准上显著优于现有方法。
ProsMAE:用于ISUP等级分类的多源MAE预训练
本文提出多源MAE预训练框架,利用多个病理数据集增强编码器泛化,在ISUP等级分类中优于普通MAE。
GRE-Diff:用于结构化布局扩散的高斯房间嵌入
基于高斯房间嵌入的扩散框架,自动化生成可编辑公寓平面图,实现AI与人工协作。
LDFE:用于双流CNN的RGB-IR目标检测的拉普拉斯解耦特征增强模块
LDFE模块用拉普拉斯解耦、全局/局部增强融合RGB-IR特征,在6个数据集上mAP提升2.0%-6.2%。
增强视角专家混合模型用于多查询车辆再识别及大规模基准
提出EV-MoE模型,增强各视角特征并动态融合,辅以多视角对齐损失,构建大规模基准LCRI-1K。
VSRo-200:一个用于研究监督和多模态鲁棒性的罗马尼亚语视觉语音识别数据集
首个罗马尼亚语视觉语音识别数据集VSRo-200,200小时播客视频,研究监督质量、域迁移与多模态鲁棒性。
通过时间比率理解与缓解视频-动作泛化差距
提出时间比率指标衡量动作模型对未来依赖,并据此动态增强视频条件信号以缓解泛化差距。
EVIS:一种基于物理的NVIDIA Isaac Sim事件相机插件
EVIS插件在Isaac Sim中生成高帧率全标注事件流,支持实时插值与噪声模拟。
基于细粒度语义指导的统一人脸攻击检测
通过为MS-UFAD数据集添加细粒度伪造文本描述,提出DAF-Net网络,利用双对齐机制提取泛化语义表征,显著提升检测性能。
计算机视觉中的连续测试时适应:方法、基准与未来方向
综述连续测试时适应问题,分类优化、参数高效与架构方法,讨论基准与未来方向。
多器官图像联邦学习基准评估
提出MobenFL基准,集成20种FL算法和22个多器官数据集,从性能、效率、隐私等多维度评估,助力临床应用。
基于注意力的白质高信号分割及血管性与脱髓鞘病变区分
结合注意力分割与特征分类,可有效区分血管性和脱髓鞘白质病变,在多个数据集上展现潜力。
利用颜色命名进行图像增强
提出NamedCurves+,利用颜色命名和色调曲线实现可解释、可交互的图像增强,性能优于现有方法。
LEEVLA:看清潜在环境演化中关键信息的视觉-语言-动作模型
提出LEEVLA,通过漂引导动态优先化与结构化特征流生成,实现任务证据引导与潜在结构化推理,性能优于先前方法。
面向未对齐RGBT视频目标检测的双相关超图网络及大规模基准数据集
提出双相关超图网络,建模时空相关性解决未对齐RGBT检测问题,并构建大规模多样化基准DVT-VOD1000,取得SOTA性能。
基于多尺度图像表示的无配对联合分布建模
提出LUD-MSR框架,用多尺度图像表示平衡域一致性与信息保持,仅用边缘数据建模联合分布,在cryo-EM去噪中有效。