TCNeRV:面向隐式神经视频压缩的双域时序上下文建模
TCNeRV在特征与嵌入双域利用重建上下文,约3M参数下PSNR达36.08dB,BD-rate较HM降低22.06%。
GRACE:几何与射线感知的相机高效多视角行人跟踪
GRACE融合体引导特征与射线条件化实现相机高效多视角跟踪,BTR仅用低置信检测续轨,双相机将MOTA升至91.07。
VOR-Bench:面向视频对象移除的人类感知驱动基准
提出VOR-Bench视频对象移除基准,含配对视频与掩码数据集、自动生成框架及VLM感知评分,评估与人类高度一致(ρ>0.9)。
NeuroTS-Net:多模态MRI中小儿脑肿瘤的多类语义分割
提出NeuroTS-Net三维编解码网络,多模态MRI小儿脑肿瘤多类分割,Dice达0.94/0.93。
面向纵向血管造影图像的时间一致性血管图提取与匹配
提出先匹配、后联合细化血管图的策略,缓解分割微小差异造成的图不一致,提升匹配面积且不碎片化。
面向嵌入向后兼容的多模态知识保持适配器
提出首个仅适配器方法,无需更新多模态大模型主干,通过多级保持损失维持嵌入几何,实现跨模态检索向后兼容且高效。
PiPS:面向可解释语义分割的事后原型解释
提出首个全事后原型解释法PiPS,为语义分割提供直观空间解释,无需改模型且不损原性能。
MedPCFM-TED:基于教师引导端点蒸馏的一步点云流匹配植入物生成
提出教师引导端点蒸馏TED,一步生成点云颅骨植入物,无需路径拉直,重建质量不降,0.04秒/样本。
超越分布内指标:先天性心脏病分割的系统性分布外评估
首个先心病分割分布外评估:分布内指标难反映跨队列鲁棒性,架构比预训练更关键,少量目标域标注即可提升。
不是又一个文本基准:让“视觉”回归大型视频模型的视觉问答
本文提出时间帧检索、视频未来预测与因果记忆扭曲三个视觉基准,发现前沿视频模型视觉推理显著弱于文本。
Bi-FlowGS:通过双向光流协同细化连接生成式视角补全与高斯几何
Bi-FlowGS以光流桥接生成式视角补全与高斯几何正则,双向协同细化,缓解几何欺骗,提升稀疏视角重建质量与一致性。
基于VQA专用显著性的高保真视频质量评估
提出HFVQA,用VQA专用显著性与多尺度时空块,保留高保真线索,仅处理12%候选块,在NR VQA基准达最优。
面向作物表型分析的网格重建方法评估
评估7种作物表型网格重建流程,GGGS、PGSR和2DGS较优,GGGS综合领先约27%。
sensVLA:面向自主轮式装载机的空间锚定视觉-语言-动作模型
sensVLA融合VLM与流匹配动作专家,BEV特征直连专家,解耦空间与语言,提升装载精度与鲁棒性。
GeoLAM:从无标注人类视频中学习基于几何的潜在动作
GeoLAM借冻结几何特征与4D几何教师监督,从无动作标注人类视频学几何锚定的潜在动作,助力机器人操作。
潜在多模态知识的枢纽-谱激活
提出枢纽-谱激活,无需配对监督或梯度更新,在冻结表征中激活潜在多模态知识,提升跨模态检索与原型分类。
面向选择性左右主张验证的对称性感知似然轨道聚合
冻结视觉语言模型左右细粒度验证不可靠;似然轨道聚合法免学习融合八项似然并设置信阈值,提升选择性验证。
预测人类分歧以实现校准的动态面部表情识别
提出分歧感知动态表情识别框架,用狄利克雷-多项似然建模标注计数,预测标注熵实现选择性预测,精度不降、校准更优。
FROD:基于特征匹配与残差去噪的甲骨文破译
FROD将甲骨文破译建模为跨时代图像翻译,融合特征匹配门控与残差去噪扩散,识别准确率提升3.8%。
基于事件的选择性注意力用于多分辨率快速感兴趣区域(ROI)检测
免训练显著性注意力模型直接处理低分辨率事件流,多尺度检测ROI,降采样达256倍,准确率70.8%,毫秒级响应。
ResLRP:残差抵消在视觉 Transformer 归因不稳定性中的作用
ViT 的 LRP 归因因残差连接抵消而爆炸;ResLRP 显式处理残差抵消,提升归因质量,VLM 增益最大。
MUMINS:基于元数据条件的不确定性感知医学图像下一状态合成
MUMINS扩散框架单次反向过程合成随访影像并预测空间不确定性图,跨解剖重训练可匹配或超越专用方法。
基于CLIP嵌入与SVM的阿联酋住宅建筑多模态文化遗产建筑风格分类
CLIP多模态图文特征结合UMAP、K-Means与SVM,阿联酋住宅八类风格分类准确率达98%。
从基础嵌入到农田地图:标签效率、时间可迁移性与独立人工验证
AlphaEarth嵌入在缅因州耕地制图达93.7%精度,标签高效、跨年可迁移,人工验证优于CDL。
InfoTaxa:面向细粒度视觉分类体系的信息校准无标签聚类
无标签细粒度聚类在物种级遇瓶颈:InfoTaxa以DNA审计揭示其既受聚类所限,也受表征信息所限。
Probe-VAD:用于免训练视频异常检测的有序似然探测
提出Probe-VAD,用有序二分类探测冻结VLM的严重度偏好,聚合连续异常分数,免训练且高效。
EventEgoHands++:基于事件相机的第一人称3D手部网格重建与真实数据集
提出事件第一人称3D手网格重建,结合左右手实例检测与自适应注意力,并建百万帧真实数据集,性能领先。
面向多模态大语言模型物体幻觉缓解的语义-空间一致性验证
提出免训练SSAV,融合语义稳定与空间一致性验证物体声明,有效缓解多模态大模型物体幻觉。
探索2D骨干网络对室内语义占用预测的影响
固定3D流程仅换2D骨干,室内语义占用预测mIoU差异巨大,DINOv2最佳;2D骨干是关键变量。
DecoGS:面向自由视点视频流式传输的3D高斯自适应静态-动态解耦
DecoGS自适应解耦3D高斯动静区域,在线训练,兼顾高保真、低闪烁与实时自由视点视频流。
PanoGS-SLAM:全景三维高斯泼溅SLAM
首个基于三维高斯泼溅的全景密集SLAM,在球面域进行可微渲染与位姿优化,提升跟踪精度与渲染质量并实现实时。
SSC-Priors:探索语义与可见性先验以提升激光雷达语义场景补全
将语义伪标签与可见性先验作为附加输入,无需复杂架构即可提升激光雷达语义场景补全。
MuJoCo 中的光流翼拍计数:卷积、脉冲与注意力时序模型比较
MuJoCo中光流翼拍计数对比卷积、脉冲与注意力时序模型,1.5/3米准确率92%–97%,未定架构排名。
追踪不可见目标:面向完全与长期遮挡的鲁棒目标跟踪框架
提出融合YOLOv11n、卡尔曼预测与遮挡感知重识别的抗遮挡跟踪框架,显著提升长期遮挡下MOTA和IDF1。
SlotDiT:面向扩散Transformer的对象中心表征
将场景分解为对象槽在槽隐空间做文本引导扩散,预测未来轨迹;机器人任务完成率更高,视频质量相当更高效。
Video-HolmesV2:多模态大语言模型能否基于长视频中的时空音视频证据进行推理?
提出Video-HolmesV2基准,要求长视频中基于时空音视频证据推理,引入音频文本引导压缩;强模型准确率不足60%。
BrainFocus:面向高效视觉语言模型的脑电引导感兴趣区域选择
BrainFocus:EEG/YOLO选ROI,VQA升4.14-9.87pp,算力降23%-39%
LM-PCVMNet:深度融合标志点与元数据的儿童颈椎成熟度分析
提出LM-PCVMNet,融合标志点、热图与元数据实现儿童颈椎成熟度自动分期,发布PCVM+数据集,性能领先。
ORCA:面向新视角合成的遮挡感知细化与补全
ORCA从单图重建3D场景,小空洞复用RGB-D修补,大区域才生成补全,减少幻觉并提升新视角质量。
级联非视域成像
提出级联非视域成像法,利用高阶反射光子,可对拐角隐藏物体成像,并经仿真与原型验证。
基于自适应样本高斯编码重建的三维场数据压缩
统一高斯编码框架,以固定基元预算重建结构化、非结构化及粒子场数据,精度更高、存储可预测。
EMODY Flow:情感感知的音频驱动全身动作生成
轻量流匹配框架,借冻结多模态大模型与音频编解码器生成情感感知全身动作和表情,辅助分类器增强情感区分。
基于深度字典网络的超低剂量CT去噪基础模型
提出架构可解释的深度字典网络基础模型,经百万级CT预训练,统一实现多器官超低剂量CT去噪,性能领先。
Det-LIME:面向自动海洋哺乳动物检测的检测器感知、多实例局部可解释模型无关解释
Det-LIME:检测器感知多实例LIME,为海洋哺乳动物检测提供实例级高分辨率解释,改善多实例归因。
噪声条件化是 LoRA 微调的免费正则化器:组织病理学中基于扩散的伪影检测无需病理编码器
高斯条件噪声是 LoRA 微调的免费正则化器:无需病理编码器即可提升组织病理学扩散伪影检测。
PhysStream:具备结构化场景记忆与细粒度运动控制的流式物理视频生成
提出PhysStream,以结构化场景记忆与速度增量信号实现流式物理视频生成及细粒度交互控制。
表格解码:DELTA 解析结构,TARQA 理解表格
DELTA 以 OTSL 识别表格结构,TARQA 微调 LLM 提升表格问答,支持多语言。
面向临床部署的胸部放疗自动勾画:解剖变化感知的双向选择性状态空间记忆
提出解剖变化感知双向状态空间记忆网络DAMM-Net++,多中心验证Dice达0.955,AI辅助使勾画时间缩短75-80%。
面向机器人学习与控制的世界-动作模型:综述
世界-动作模型将未来世界预测与可执行动作生成相耦合,本文综述其分类体系、机器人应用、评测基准及关键挑战。
Neverwhere 视觉跑酷基准套件
构建60余个3D高斯溅射场景的闭环跑酷评测基准Neverwhere,支持大规模可复现机器人评测。