SCOUT:通过结构化思维链与多目标过程奖励解锁增强的空间推理
SCOUT通过结构化思维链和多目标过程奖励,显著提升空间推理,超过GPT-4o。
ScaleVid:无网格推理的几何感知视频物体缩放
两阶段训练解耦前景变换与背景保持,免3D重建,实现几何一致、前景保真、背景保留的物体缩放。
HSTGFormer:用于三维人体姿态估计的超时空图Transformer
针对时空分离建模局限,提出超时空图变换器,以局部耦合图聚合和双尺度时间图,高效精准做三维姿态估计。
GenFAR:基于深度学习从49,246例多队列MRI推导的脑结构广义表征
提出GenFAR,用49,246例多队列MRI训练出通用脑表征,提升下游任务精度与样本效率。
M-Net:融合谱特征与物理场算子的医学图像分割深度学习网络
M-Net融合矩阵谱特征与向量微积分算子,经数学注意力门融合,肝/肾/脑肿瘤分割较基线提升12.37%/3.52%/5.55%。
HAMP-LIC:面向学习图像压缩的Hessian感知混合精度训练后量化
提出HAMP-LIC,基于Hessian感知的混合精度训练后量化,优化位宽分配,实现4.85倍压缩,BD-rate损失仅0.59%,消除跨平台编解码误差。
神经蒙皮的测地线切割单元先验
提出切割单元蒙皮几何先验,以图近似体测地距离,加速计算且鲁棒,提升神经蒙皮模型效果。
用于增强左前降支动脉三维分割的邻域注意力Transformer网络
提出NA-UNETR,以邻域注意力和不确定性加权损失提升低对比CT左前降支分割的Dice与边界精度。
Diagram-MMU:科学图表的多模态基准
提出Diagram-MMU基准,含3.7k图表与18.3k题,评估12个MLLM,发现解析比问答更难。
超越试错:图像到视频一致性的智能体优化
提出智能体自改进框架,两阶段优化提示与参数,结合DSG/CMQ评估,人类偏好胜率高达69%。
XYZFlow:高效生成建模的多维捷径流扩展
XYZFlow通过多维缩放流匹配,时空缩放与NSP,实现7.2-8.5倍加速及优秀FID。
DreamFly:面向空中视觉语言导航的因果记忆与滚动时域扩散规划
提出DreamFly,融合因果记忆、滚动时域扩散规划与显式终止预测,在OpenFly基准上取得最优导航性能。
面向内存高效测试时自适应的曲率感知零阶优化
曲率感知零阶优化:对角Hessian各向异性扰动,仅前向传播优化适配器,内存高效测试时自适应SOTA
可解码但不可访问:对解缠皮肤病变表征上基于距离的可靠性估计的审计
解缠表示可解码但可靠性估计失效,距离度量AUROC低于随机,监督探针却可恢复域信息,表明信息可解码但不可用于可靠性估计。
可解释计算机视觉中的类别激活映射:以方法为中心的CNN、Transformer与基础模型时代视觉解释综述
综述57种CAM方法,按归因机制分类,涵盖CNN至基础模型时代,指出评估碎片化。
StateFlow:为预可视化构建、演化与访问三维世界状态
StateFlow以持久3D世界状态为核心,分构建、演化、访问三阶段,实现可控生成与迭代编辑。
基于辅助函数法的相似变换图像傅里叶-梅林配准
提出亚像素级相似变换估计算法,先估尺度旋转再估平移,误差优于离散互相关傅里叶-梅林法。
基于几何的全光点云压缩
提出基于KLT和帧内预测的全光点云属性压缩,兼容G-PCC,性能为当前最优。
基于色相分割模型树的边界连续跨相机RGB映射
提出色相分割模型树方法,经边界连续混合优化,提升跨相机映射精度并抑制色差。
基于公有领域影片库的对话感知视频配乐生成
提出OSSL-v2公有领域影片库,用对话信号提升视频配乐生成,效果优于现有基线。
Qwen-MusicAVQA-7B:面向音乐视听问答的多模态模型
轻量方案用冻结编码器,音乐视听问答准确率96%,关键在于保留音频细粒度时序,训练仅数小时。
如实测量浏览器摄像头视线:捕获时钟方法论与开放参考实现
针对浏览器摄像头视线追踪延迟测量失真,提出捕获时钟诚实测量法并开源。
单视图MRI扫描中阿尔茨海默病检测的CNN架构比较
十种CNN架构对比检测阿尔茨海默病,VGG16最佳(准确率95.33%),非痴呆向极轻痴呆分类最难。
Un-EVIMO:无监督事件相机独立运动分割
首个无监督事件相机独立运动分割框架,用几何约束生成伪标签,无需标注,处理任意数量物体,性能媲美监督方法。
HandEdit:面向第一视角人手到机器人灵巧手图像编辑的统一基准
HandEdit:具身感知图像编辑基准,将第一视角人手转换为机器人灵巧手,支持可扩展机器人学习。
3D场景生成:综述
综述3D场景生成:涵盖程序化、神经3D、图像与视频四种范式,剖析挑战与未来方向。
COLORA:卷积模型高效微调方法及光学相干断层扫描图像分类研究案例
提出CoLoRA,将LoRA扩展至卷积层,参数减少80%以上,性能相当且保持模型尺寸,适用于医学及自然图像分类。
P2MFDS:面向浴室环境的老年人隐私保护多模态跌倒检测系统
融合毫米波雷达与振动传感,提出隐私保护多模态跌倒检测系统,以双流网络提升精度与召回率。
UK Biobank中基于组织掩膜的全身体图像配准方法
提出性别分层全身磁共振配准,用脂肪肌肉掩膜增强,提升Dice分数、减少折叠频率。
域感知轻量级光谱分组卷积用于高光谱鱼新鲜度分类
提出轻量级SGNet网络,用光谱分组卷积与双注意力,以4.75M参数达97.8%精度,实时预测鱼新鲜度。
基于激光雷达的城市尺度三维变化检测
提出不确定性感知的以对象为中心的城市级LiDAR变化检测方法,通过多分辨率NDT配准、逐点检测水平校准及类别约束匹配,在Subiaco市达到95.3%准确率,优于最强基线。
CORE-3D:基于三维嵌入的上下文感知开放词汇检索
提出CORE-3D,利用渐进粒度精化的SemanticSAM和上下文感知CLIP编码,提升三维语义分割与开放词汇检索性能。
MicroAUNet:结合知识蒸馏的边界增强多尺度融合用于结肠镜息肉图像分割
提出边界增强多尺度轻量网络MicroAUNet,结合可分离卷积与注意力,经知识蒸馏,以极低复杂度实现实时高精度息肉分割。
卷积层激活降维用于分布外与对抗攻击检测方法
提出一种可控高压缩的卷积层激活降维法,提升分布外与对抗攻击检测性能,同时降低计算和内存开销。
4D-WAM:用于自动驾驶的4D一致世界建模
提出4D-WAM,利用几何基础模型监督训练实现4D一致世界建模,提升自动驾驶轨迹规划。
路标水印:视觉水印共存的联合优化
提出联合优化方法,使图像视频水印在不可感知下共存,提升解码鲁棒性与视觉质量,支持分层来源标记。
MAD-HOI:从文本生成关节手物交互的掩码自回归扩散
提出MAD-HOI,用掩码自回归扩散从文本生成手物交互,支持变长、复合、补全及终止预测,更逼真多样。
P3CA:通过空间探测对视觉基础模型嵌入进行编码器无关解读
提出P3CA,一种编码器无关的空间探测方法,估计局部主方向并投影,无需重训练即可解释视觉基础模型嵌入。
LEGO:分层语言高斯泼溅
LEGO实现开放词汇3D场景层次化理解,统一SAM粒度并构建语言场景图,支持空间推理,刷新SOTA。
面向运动伪影感知的自监督表示学习用于三维脑MRI运动伪影消除
提出SSRL-MAR无配对自监督框架,三阶段学习减少三维脑MRI运动伪影,效果优于源监督模型。
DoseBridge:用于肺部调强质子治疗剂量预测的去噪扩散桥模型
首个去噪扩散桥模型DoseBridge,融合CT与束流几何预测调强质子治疗剂量,性能优于现有模型。
人类视觉与计算机视觉
中心标记胜过训练网络;模型存在年龄、种族、意识形态偏差;提出按群体视线学习以覆盖所有人。
更准确,却更不人性:视觉模型中的格式塔分组
测试45个视觉模型对格式塔分组的符合度,发现封闭模型虽准确但人性对齐低,提供无需新实验的评估标尺。
面向统一动态人脸关键点检测
提出人脸部位锚定关键点位置(FPALP),统一各N点数据集;用动态查询解码器,单模型可预测任意数量关键点,性能优异。
冻结的脑MRI基础模型是站点指纹
冻结脑MRI基础模型嵌入主要编码采集站点(约0.9),非预训练所致;移除站点子空间会损害分割。
SeFaR:深度神经网络的语义特征感知鲁棒性测试
提出SeFaR框架,用层次概念模型和扩散模型生成语义扰动,发现影响决策的未知特征,生成可解释的失败诱导概念。
TRACE-GS:面向稀疏视图3DGS恢复的带特权几何条件的同策略轨迹蒸馏
用特权几何做在线轨迹蒸馏,教师沿学生采样轨迹监督,解决稀疏视图三维高斯恢复的推理失配,仅留学生模型,性能提升。
从检测到理解:面向多任务交通异常推理的TAR与TAR-Bench
提出交通异常推理数据集TAR与测试集TAR-Bench,含4.4万思维链标注,多任务微调提升21.4分。
MRIComp4Flow:用于训练多模态生成模型的3D脑MRI压缩
JPEG2000压缩可有效训练3D脑MRI生成模型,20:1压缩比下合成质量与未压缩相当。
空间思维链:面向视觉语言模型的模态无关空间接地
提出空间令牌框架,蒸馏3D几何与物体属性为连续令牌,无需额外模块提升VLM空间推理,可解释。