InfiniVerse:基于占用引导的自动驾驶无界场景生成
提出统一管道,通过3D占用表示自回归扩展场景并生成视频,实现长距可控动态城市场景合成,FID 6.4,FVD 67.97,性能SOTA。
MSNN-LINet: 基于连续线性集成的跨模态学习
提出LINet多流网络,通过连续线性集成实现每层跨模态学习,解决特征融合离散问题,在RGB-D场景分类中达45.2%精度。
FROST: 基于冻结特征和非参数统计的无训练小样本分割
FROST利用冻结DINOv3特征和非参数密度比,无需训练即可实现遥感小样本分割,性能领先。
重新思考基础模型协作:通过代理任务推理增强专门化模型
提出FAT框架,基础模型通过代理任务推理协作专门模型,在多项任务中提升性能且计算成本更低。
PruneGround:面向3D视觉定位的即插即用空间剪枝框架
提出PruneGround框架,通过语言引导剪枝、多视角描述重构和LLM定位,在3DVG上取得SOTA性能。
ExPLoRe:面向多目标掩码图像建模的专家补丁级损失路由
ExPLoRe用MoE调度权重作每补丁损失系数,通过损失耦合实现内容相关加权,提升多目标MIM性能。
Reasoning-aware Speculative Decoding for Efficient Vision-Language-Action Models in Autonomous Driving
看穿权重:场景坐标回归中的隐私泄露
通过查询攻击从SCR模型重建训练环境的3D几何与外观,揭示其并非隐私安全。
GaussianMap: 为多传感器在线高清地图构建学习高斯表示
提出GaussianMap,用自适应高斯图元替代固定分辨率BEV,实现高效在线HD地图构建,达到SOTA性能。
超越单字:多模态大语言模型句子级甲骨文理解评估
引入S-OBI基准评估MLLMs句子级甲骨文理解,发现模型依赖字符识别且视觉错误传播。
学会否定:多模态大语言模型中的动作否定
提出UCF101-AD基准,揭示多模态大模型在动作否定任务上准确率低于50%,因果提示可显著降低误判。
HSDF-Lane: 结合语义车道先验的高度对齐符号距离场用于3D车道检测
HSDF-Lane隐式建模路面为高度对齐符号距离场,结合车道语义先验,实现3D车道检测与高度估计,获最优性能。
将时间一致性蒸馏到2D网络中用于经直肠超声前列腺视频分割
提出蒸馏时间一致性到2D网络的框架,实现实时视频分割,采用置信度加权和双尺度原型对齐,无需密集标注,精度与速度兼优。
ForgeDrive:自动驾驶中统一视觉-动作生成的双向交叉条件
提出“先行动后想象”范式,通过双向交叉条件统一视觉与动作生成,提升规划性能。
从失败中学习:计算机使用代理的推理时自我改进
通过LLM分析失败轨迹,生成代码补丁提升代理性能,成功率提升6.6%,无需额外训练。
CooperScene:具有C-V2X通信特征的多模态协同自主性基准
高保真协同自主数据集,含真实C-V2X通信特征,覆盖多场景,提供大规模3D标注与评估基准。
中文标题:重新思考特征工程与学习策略在少样本隐式情感识别中的作用
中文摘要:提出紧凑多模态框架,集成多源特征与交叉注意力,揭示微动态任务中视觉基础模型的表示坍缩与伪泛化问题。
HyperVLP:在双曲空间中增强层次化手术视频-语言预训练
提出双曲空间预训练框架,显式保留手术知识的层次结构,减少假阴性并增强语义一致性,提升阶段识别性能。
UHD-MFF:通过可学习查找表打破多焦点超高清图像融合的障碍
提出首个超高清多焦点融合数据集与可学习查找表框架,实现实时4K融合,性能超越现有方法。
AC3S:面向3D感知合成数据生成的自适应调节
提出自适应调节扩散框架,动态控制条件强度,结合多智能体VLM生成3D感知数据,提升图像质量与下游效用。
WarpHammer: 利用三维物体先验稠密化场景扭曲实现极端视角合成
WarpHammer利用3D物体显式先验重建,解决大视角下扭曲稀疏伪影,无需微调即可融合外部无位姿辅助视图,实现稳健极端视角合成。
可解码并不代表有根基:VLM空间推理的视觉消融仲裁者
空白图像仲裁揭示VLM空间推理中线性探针高估视觉认知,存在视觉有根据、先验与反转三种机制:水平有根据,垂直先验,深度反转。
AA:一个用于屏幕视线估计的多视角多模态数据集
AA数据集含8个屏幕摄像头和2个侧摄像头,同步采集面部与视线目标,支持多视角多模态学习,抗遮挡,提供标准化评估。
基于扩散的多样化内容生成的加速似然最大化
提出加速似然最大化(ALM),无需训练,直接优化未观测区域,生成连贯内容,效率高且性能优越。
基于双流双层循环优化的域自适应目标检测
解决循环自训练在目标检测中伪标签不可靠、训练不稳及损失爆炸问题,提出双流双层循环优化,跨域实验效果显著。
统一框架下的视频理解与生成桥接
提出Vega混合架构,结合自回归预测与扩散渲染,实现视频理解与生成统一,在VBench和VideoMME上表现优异。
基于语言辅助的真实世界低分辨率图像块超分辨率
提出LA-SR框架,利用视觉语言模型在语言空间对齐内容与质量,实现真实低分辨率图像的超分辨率重建。
患者级肘部异常检测:泄漏感知下的学习预处理、校准及分诊操作点评估
在MURA数据集的肘部X光异常检测中,预处理策略对判别性能提升有限,原始输入DenseNet121基线仍具竞争力。
RCL-Mamba:面向测量的旋转稀疏扫描计算层析成像双域状态空间模型
RCL-Mamba双域状态空间模型,先校正投影域旋转模糊再抑制图像域稀疏伪影,扫描视角从512降至64,效率提升8倍且不损失质量。
CLIMB:基于质心的分层记忆用于在线持续自监督学习
提出CLIMB方法,结合分层质心记忆与知识蒸馏,在在线持续自监督学习上超越现有最优。
一次编辑万物
提出MICE方法,无需训练即可在多模态扩散Transformer中并发编辑多个图像实例,通过调控注意力避免语义干扰,保持视觉一致性。
Deep Spectral Models for Robust Dental Shape Generation
小波优化的伪3D加速扩散模型用于截断计算层析成像
提出小波优化伪3D加速扩散模型,扩展成像范围,消除截断伪影,恢复高保真3D结构。
无提示无泄露:基于无提示扩散的鲁棒生成式隐写框架
提出无提示扩散隐写框架,融合风格语义先验和级联仿射耦合模块,通过预测-校正机制优化,实现高安全、高精度和可控隐写。
DrivingDepth:稀疏提示的逐像素尺度校正用于驾驶深度估计
提出DrivingDepth,利用稀疏LiDAR逐像素校正冻结深度模型尺度,兼顾高精度与几何一致性,AbsRel 11.19,EdgeCR 5.741。
MAPE:利用多源对抗扰动消除防御可迁移对抗攻击
提出MAPE方法,通过SAPE和PPSA消除多源对抗扰动,在CIFAR-10和Mini-ImageNet上防御率超95.1%和71.5%。
MS-Resampler:面向高效多模态大语言模型的多范围视觉重采样
提出多范围视觉重采样框架,融合局部与全局信息,提升多模态大模型效率,计算开销极小。
一视频一世界:将单目视频转化为物理4D场景
OVOW是首个无需训练的系统,从单目视频重建实例级、可物理模拟的水密4D网格场景。
中文标题:时间保留优于处理:诊断与设计时空单阶段视频检测器
中文摘要:提出TemporalLens诊断框架和YOLO-3D架构,揭示时空模型依赖多帧而堆叠2D模型仅靠单帧,时间深度保留是性能关键(+3.7 mAP)。
迈向识别音高格里高利圣咏符号的基础模型
设计通用编码并训练共享基础模型,在四个格里高利圣咏数据集上达到新最优。
AeroVerse-SatAgent:受双视觉通路理论启发的无人机-卫星协同空间推理
受双视觉通路启发,提出无人机-卫星协同空间推理模型SatAgent,通过几何感知3D重建与多视角对齐,在复杂环境推理中大幅超越现有模型。
动态对比增强4DCT中左心房与左心耳分割的时间训练策略
动态4DCT左房心耳分割:全帧训练早期最佳,生理子集后期相当;时间多样性重要,子集可平衡性能效率。
边建图边思考:用于增量式3D场景图的异步视觉-语言智能体
提出异步架构,在线建图与语义精化并行,支持查询且语义渐增,性能超越现有方法。
PRISM: 基于潜在组合一致性的单幅图像反射去除
利用潜在空间线性分离与一致性策略,实现单幅图像反射去除,性能领先。
Localized Conformal Prediction for Image Classification with Vision-Language Models
MV-GEL:语言驱动的网格多视图几何实体定位
提出MV-GEL框架,通过语言驱动选择最佳视图,实现网格上精细几何实体定位,性能大幅提升。
缓解3D掩码自编码器中的位置泄露以实现鲁棒表示学习
提出MPL-MAE缓解位置泄露,通过重校准嵌入与门控接口平衡空间和语义特征。
AugSplat:基于辐射场引导的高斯泼溅方法用于稀疏视图设置
AugSplat利用辐射场合成辅助视图,优化高斯泼溅稀疏视图重建,实现高质量实时渲染。
使用物理感知神经算子Transformer的EAST钨单体偏滤器温度场重建
PNOT融合图注意力和物理约束,实现EAST偏滤器温度场高精度实时重建。
HVPNet:面向通用显著与伪装物体检测的仿生网络
受人类视觉启发,HVPNet通过视网膜集成和皮层解码实现高效准确的多模态显著与伪装物体检测。