Omni-Prune: 面向高效全模态大语言模型的查询感知统一令牌剪枝
无训练查询感知视听令牌剪枝,联合去冗余,加速3.25倍、内存降1.3倍,保持99%性能。
鲁棒6自由度物体姿态追踪:遮挡与快速运动下的内置恢复机制
提出结合关键点匹配与优化对齐的6DoF追踪方法,内置失败检测与恢复,在遮挡和快速运动中鲁棒,速度达57.6fps。
VIPER:面向物理合理视频生成的视觉上下文物理推理框架
VIPER通过参考视频演示物理过程,利用多模态大模型提取物理线索,指导视频生成器实现物理行为迁移。
PlanCraft:灵感源于建筑师的渐进式3D住宅场景生成——草绘、精炼与布置
提出渐进式平面图生成方法,以2D空间契约为基石,实现高质量3D场景,实验指标大幅超越现有最佳方法。
擦除还是不擦除:具有保留感知的自适应排序子空间扩展的鲁棒免训练概念擦除
PARSE是一种免训练概念擦除框架,通过动态发现并编辑子空间,实现鲁棒擦除且不牺牲模型效用。
MOJITO:模态联合学习实现统一端到端自动驾驶
MOJITO通过模态联合注意力消除级联接口,实现端到端自动驾驶,在NAVSIM上取得新SOTA。
基于Token-区域引导的跨注意力融合多模态情感解读
提出跨注意力融合框架,利用视觉-语言模型提取OCR文本,对齐语义与视觉区域,在孟加拉语政治模因检测中达到0.94 Macro-F1。
MemVLN: 用于视觉与语言导航的情景记忆与程序记忆
MemVLN结合情景记忆与程序记忆,实现实时高效导航,性能与速度显著提升。
Markerless Motion Capture in Routine Clinical Upper Limb Assessments: Validity and Insights Beyond Ordinal Scoring
神经形态目标检测:深入研究与未来方向
综述神经形态目标检测:涵盖问题、数据集、评估指标,分析事件表征与时序建模等方法,评估模型并探讨未来方向。
SketchMamba:一种轻量级状态空间模型,用于联合渐进式草图分类与笔划自动补全
SketchMamba以单因果序列模型同时实现渐进分类与笔划自动生成,参数量仅1.55M,精度达94.93%,70%笔划时即达90%最终精度。
JarvisHub:面向画布原生多模态创意智能体的开放框架
JarvisHub是画布原生创意智能体框架,支持长期多模态创作与可检查编辑的自动化。
ConFusion:连续融合空间学习实现细粒度可控红外与可见光图像融合
提出ConFusion框架,通过高斯条件调制学习连续融合空间,实现实例级细粒度可控融合,性能领先。
使用主要和次要标签的弱监督实例级格里森模式估计
提出弱监督多实例学习框架,聚合预测建模主要与次要格里森模式,有效估计实例级模式并超越现有方法。
几何与语义融合:视觉检测任务中语义驱动边界框优化的分数阶梯度稳定方法
提出分数阶语义IoU损失,融合几何与语义,利用历史状态正则化梯度,稳定优化性能。
ATCNet-CIAM用于多会话运动想象脑电图信号分类
提出ATCNet-CIAM模型,集成通道注意力模块,提升多会话运动想象脑电分类准确率与稳定性。
GaitFace:用于远距离行人识别的多模态数据集
GaitFace数据集暴露了现有模型在低分辨率和高视角下的缺陷,为远距离行人识别提供严格基准。
D3O:面向有序回归的动态分布蒸馏
D3O通过自蒸馏动态演化有序标签分布,结合对比增强和CDF交叉层蒸馏,有效处理模糊噪声,显著提升有序回归性能。
PathSelect:全切片病理学的顺序令牌选择
PathSelect以可微顺序令牌选择,平均44.86令牌达74%准确率,实现36.6倍压缩且优于采样方法。
WGDnet: 威沙特引导的几何感知深度网络用于PolSAR图像分类
提出WGDNet,融合可学习Wishart统计与几何自适应卷积,提升PolSAR分类精度和边界保真度。
DAP-Pose:深度时间对齐与物理感知跨模态传感器融合实现鲁棒姿态估计
提出DAP-Pose,融合视觉/惯性/GNSS,深度时间对齐与物理约束实现鲁棒姿态估计,KITTI上SOTA(误差1.31%/0.46°),抗时间错位。
XMatchAD:基于重建的异常检测的跨模态匹配视角
提出XMatchAD框架,通过跨模态匹配增强异常检测与定位,性能超越现有方法。
GRAPE:用于铰接式肖像网格估计的渐进路由
GRAPE通过构建躯干-头部运动链与渐进对齐网络,提升肖像网格重建质量及下颌-表情解耦。
RRTrack:面向动态场景的鲁棒且可恢复的物体6D姿态跟踪
RRTrack通过2D-6D闭环跟踪与双库模板匹配,在动态场景中实现快速运动及完全遮挡后的鲁棒恢复,性能提升65%以上且实时(55.2 FPS)。
基于扰动感知的扩散引导混合分割方法,用于鲁棒且标注高效的植物胁迫表型分析
提出扩散引导混合分割框架,结合骨干网络与扩散模型,在PlantSegV3上达71.83% mIoU,对扰动鲁棒且标注高效。
多模态遥感图像生成的对比参数解耦
提出对比参数解耦框架,从文本生成光学/红外/SAR多模态图像,实现语义一致与结构对齐,性能优于现有方法。
面向提示驱动手术概念分割的SAM3参数高效适配
提出LoRA适配SAM3进行手术概念分割,仅优化0.98%参数,性能优于基线,支持下游重建模拟。
GNM Head:一种生成式人体头部测量模型
提出GNM参数化模型,覆盖头脸颈眼齿舌,基于高分辨率扫描和专家样本,拟合3D人脸达SOTA,已开源。
SimBEV2X:面向多任务车联网协同感知的大规模数据集与数据生成工具
基于CARLA的V2X协同感知最大数据集与生成工具,提出CoBEVFusion架构。
PathScale-R1:病理图像分析中的跨尺度推理
提出抗捷径的跨尺度病理推理框架,构建PathScale-VQA数据集,优化PathScale-R1模型,实现最佳跨尺度推理性能。
RoadVGGT:道路结构感知的前馈式路面重建
无需每场景优化,融合几何模型与网格,重建紧凑高斯路面,提升图像、语义及高程精度。
可操控的双人头部虚拟形象
提出STEER,实现双人对话头部虚拟形象的注视、头部节奏和情绪的可控生成,优于现有方法。
超越外观:面向移动空地平台的行人关联与跟踪的多线索框架与大规模基准
提出融合多线索的FUSION框架与最大规模视角多变数据集RealMvMoAT,实现移动空地平台行人关联跟踪最优性能。
一致证据,鲁棒识别:几何变换下的忠实归因正则化
提出基于子模搜索的无注释归因正则化,通过路径一致性和终止对齐损失提升归因稳定性与鲁棒性,仅微降精度。
OmniCache:扩散模型的多维分层特征缓存
提出OmniCache统一分层缓存框架,利用多维特征冗余,无需训练即降低推理延迟达35%,保持视觉保真度。
具有动态显式头发的头部数字人
提出DynHair,通过3D高斯溅射和时序网络建模动态头发,从视频重建可动画头部数字人,实现物理逼真头发运动。
长尾医学图像分类
长尾分布导致医学图像分类偏向常见病,通过数据增强和深度学习模型有效减少误差,最佳模型表现良好具应用前景。
基于嵌入的异常检测用于清洗全球作物类型参考数据集
提出EBA框架,利用预训练嵌入检测异常标签,清洗后提升作物类型模型精度,保守清洗有效。
基于互模态信任与轻量重建正则化的细粒度轮胎花纹识别
提出融合互模态信任与轻量重建正则化的方法,建立MTire299数据集,有效提升细粒度轮胎识别性能。
TimePLE: 重新思考视频时间定位中的时间表示
TimePLE通过预测时间区间联合分布,将视频时间定位转化为区间原生表示,在四个基准上平均mIoU达58.9,优于端点预测方法。
RODR:用于解缠流形表示的黎曼正交解耦正则化
RODR通过解耦法向和切向分量,避免几何梯度干扰,同时保持几何细节与采样均匀性,性能媲美当前最优方法。
基于视觉-语言模型的自主车辆GNSS欺骗检测方法
提出首个VLM框架,融合视觉与传感器数据检测GNSS欺骗,三阶段微调后F1达94-95%,计算量减少86%。
彩色眼底照相分析:面向多模态AI的数据、预处理与建模的协同演进
综述彩色眼底照相AI中数据集、预处理与建模的协同演进,迈向多模态整合与稳健临床部署。
流形约束的噪声优化以实现多样扩散采样
MoNO流形约束噪声优化,提升扩散模型多样性,无需辅助目标,收敛更高效。
可以编辑什么?开放式策略发现与情绪可编辑性图谱
EmoScope通过情绪条件化功能推理发现图像特定编辑空间,实现自适应策略,用户偏好率88.1%,并揭示分类器指标盲点。
目光到文本生成:超越人类注意的分类解码
提出Gazette框架,将目光扫描路径解码为自然语言目标描述,超越分类解码,实现人机交互新范式。
DDVT:用于视觉问答中答案定位的动态双层视觉Transformer融合网络
提出DDVT网络,含问导动态区域和跨模态多尺度聚合模块,精准定位答案,性能超越现有方法。
DuoAD:利用[CLS]双重特性实现免训练少样本异常检测
基于[CLS]双重特性(全局语义+注意图)的免训练少样本异常检测框架,实现自动增强与特征重加权,三数据集AUC达97.7%/93.2%/84.5%。