从名义强度到等效降雨:自动驾驶感知测试模拟降雨的路径可信度评估框架
提出路径基模拟降雨可信度评估法,以真实雨滴谱为参考,用等效强度、不确定带及RRD分数与感知一致性校正,优选路径,支持自动驾驶感知测试。
ViT-FREE:通过早期退出与合成自适应实现高效人脸识别
提出ViT-FREE多出口框架,利用预训练ViT中间层进行人脸识别,10层退出可提速20%且性能仅降1.5,并引入轻量微调优化浅层。
植物生长估计的特征提取
提出两种植物生长阶段特征提取方法,CNN方法(VGG-19+SVM)准确率98.4%,速度快,适合实时应用。
SpecLoR: 频谱超前校正实现运动连贯文本到视频生成
SpecLoR通过频域超前校正修正轨迹漂移,以低开销增强视频运动连贯性。
SpikeTAD:用于端到端时间动作检测的脉冲神经网络
首个基于SNN的端到端时间动作检测架构,低功耗高精度,验证可行性。
AGE-MIL:锚定引导的证据学习用于患者级别预测
提出锚定引导证据MIL框架,通过患者级锚点整合多切片信息,实现弱监督下的稳定优化,性能优于八种现有方法。
中文标题:元数据感知的多提示推理用于零样本事故理解
中文摘要:提出三阶段零样本事故理解:时间定位、多视角元数据推理解决分歧、空间定位,效果显著优于直接提示。
使用GAN和忆阻器分类器的非正面人脸识别
提出GAN正面化与忆阻器识别结合的框架,非正面人脸识别准确率达96%,实现高效边缘计算。
MSUE:多模态足球理解专家
提出MSUE多专家架构,通过VLM数据合成和LLM动态分派,在SoccerNet VQA挑战中以0.95准确率获第三名。
Tac-DINO: 通过补丁对齐学习视觉-触觉特征
构建大规模触觉数据集及全息匹配基准,提出VTPA方法实现视觉-触觉局部到全局对齐,性能超越无对齐方法。
世界模型自蒸馏:训练世界模型解决通用任务
结合自蒸馏与强化学习,从视频扩散模型蒸馏出指令条件执行器,无需配对视频,借助VLM反馈优化,在基准上超越原模型。
MFEN:面向可见光-红外行人重识别的多频率专家网络
提出多频率专家网络,自适应组合频带并结合增强优化,有效解决可见光-红外行人重识别的模态差异问题。
ISAP-3D: 身份槽对齐的部件感知三维生成
ISAP-3D通过身份槽对齐实现稳定可控的部件感知三维生成,优于现有方法。
Q-Fold:面向查询的焦点-上下文时空折叠用于长视频理解
Q-Fold通过查询引导的焦点-上下文折叠,无需训练即兼顾高保真视觉证据与时间覆盖,在长视频基准上一致提升,超长视频提升9.1个百分点。
发展中国家恶劣天气下混合交通目标检测的YOLOv11与YOLOv8性能分析
YOLOv11n在恶劣条件下精度提升3.2%,FLOPs减少22%,达70.9 FPS,适合边缘部署。
TopoCap:学习拓扑无关的运动先验用于单目视频到动画
TopoCap提出通用运动流形,从单目视频提取运动并零样本重定向到任意拓扑角色,超越专业模型。
基于2D PET/CT投影的肺癌时间条件与多时间生存预测
提出ATCS和MTS方法,时间建模提升肺癌PET/CT生存预测精度,平均AUC达0.794。
面向食物-水关系的Prithvi-EO休耕地检测适配:地理空间基础模型的ViT-Adapter颈部与参数高效骨干调优
用参数高效微调与ViT-Adapter颈部组合,最佳配置mAP@50达0.9479,较基线提升25.7%,有效检测不规则休耕地。
超越暗知识:基于混合蒸馏实现可靠预测
混合蒸馏并非劣化版知识蒸馏,它通过邻域训练同时提升准确率、校准度与表征线性性,实现更可靠的预测。
基于令牌的局部点云4D重建
提出DynaTok,基于令牌与流匹配,从局部点云序列无对应地进行4D重建,提升质量与时序一致性。
InternVideo3:利用多模态上下文推理将基础模型智能体化
提出多模态上下文推理框架,将理解转为闭环过程,实现长视频证据累积与验证,高效压缩KV缓存,多项基准表现优异。
SHERPA: 接缝感知的协调ERP适配用于开放域360°全景生成
SHERPA轻量适配框架融合圆形RoPE等技术,实现开放域360°全景生成,支持真实感和风格化提示。
MLT-Dedup:基于多级表示与时空匹配的高效大规模在线视频去重
提出MLT-Dedup框架,通过多级嵌入与时空匹配,实现精准在线去重,重复率降低91%,索引容量提升5倍。
使前瞻可操作:重新利用世界动作模型中的表示对齐
AGRA通过对齐表示,使世界模型动作解码聚焦交互区域,提升操作准确性与鲁棒性。
CellNet -- 利用稀疏且带噪声的点标注进行细胞定位
基于回归的深度学习算法,用稀疏点标注计数细胞,低数据量下有效,助力人类基因组研究。
从二维网格到一维标记:改革多模态图像融合的共享表示
提出1D标记接口融合多模态图像,通过选择性标记编辑平衡全局一致性与局部细节,性能最优。
连接昼夜:协同提示与原型学习的无监督跨域重识别
提出无监督昼夜重识别框架,结合提示与原型学习两阶段训练,无需标注即达到全监督精度。
VOID:在潜在扩散模型中击败未授权的模仿
VOID框架通过放大编码错误和抑制引导信号破坏语义,阻止未授权模仿,同时保持视觉质量,防御效果提升223%。
通过渐进式基于幅值的剪枝在单训练周期内发现稀疏子网络
渐进幅值剪枝在单训练周期内高效稀疏化网络,在CIFAR-10上精度超越LTH、SNIP等基线。
MAGMaR 2026 共享任务结果
第二次多模态检索增强生成共享任务:视频检索与生成系统均超基线,多个团队提交优秀方案。
Bridging the Modality Gap in Forensic Image Retrieval
自然语言下的小时级视频时间定位是一个搜索问题:基准与实证分解
小时级视频时间定位本质是搜索问题,现有Video-LLM因搜索瓶颈表现差,检索-定位混合方案提升6.7倍。
电势增强的基准数据集用于电容层析成像的物理引导图像重建
提出电势增强ECT数据集,集成物理场信息,提升重建准确性与鲁棒性,为物理引导机器学习奠基。
Damage-TriageFormer:基于单时相影像的建筑损伤类型评估基础模型框架
提出单图像后事件损伤类型模型及基准,无需灾前图像即可精准分类,支持应急响应。
解剖条件递归细化用于拓扑感知的Willis环分割
提出AC2RUNet,通过双流架构与动态课程学习,显著降低Hausdorff距离和Betti数误差,改善血管拓扑连接性。
DepthMaster:面向透视与全景图像的单目深度统一估计框架
通过分解全景图为透视补丁并引入一致性损失,统一了深度估计,零样本性能达SOTA。
重路由而非移除:面向视觉语言模型的可恢复视觉令牌路由
提出可恢复路由Reroute,替代不可逆令牌删除,利用重要性动态变化提升视觉定位性能。
先验的回声:遗忘的计算现象学
用神经网络模拟记忆衰退,可视化遗忘带来的认知混沌与诗意恐怖。
槽位、转换、循环:学习可组合的世界模型用于ARC
提出Loop-OWM,通过槽位和循环转换学习视觉符号规则,在ARC-1和ARC-2上超越基线。
一种用于目标检测与实例分割的涡轮推理策略
提出迭代利用检测与分割互补信息的涡轮策略,无需重训练即提升两者精度,以计算开销换取性能。
VLGA:用于自动驾驶的视觉-语言-几何-动作模型
VLGA引入几何模态,用点图回归重构密集3D世界,在自动驾驶任务中取得SOTA性能。
看似微不足道的设计选择如何主宰病理学LLM性能
调整补丁大小与放大倍数等设计,通用LLM在病理任务中性能大幅提升,缩小了与专用模型的差距。
STEAM:压缩与变换增强注意力模块
提出常参数STEAM模块,用图多头注意力与输出引导池化建模通道和空间注意力,以极低计算开销提升CNN性能,超越ECA和GCT。
DrivingAgent:面向自动驾驶系统的设计与调度智能体
DrivingAgent框架自动化模块开发,并用强化学习训练的轻量级LLM实时调度,优化速度与精度权衡。
DIRECT: 具身规划器中应在何时何地分配测试时计算?
DIRECT按场景上下文动态分配测试时计算,以更低成本保持高性能,避免朴素扩展浪费。
面向有效水下多人类-机器人协作的语义感知潜水员活动识别框架
提出DAR-Net框架,通过语义引导与像素监督识别六种潜水员活动,创建首个UDA数据集,实验中超越现有模型。
XPR:一个可扩展的跨平台点云可微分渲染器
XPR框架用少量Python代码实现点云可微渲染新方法,可跨平台编译至GPU/TPU/CPU等硬件。
使用多光谱超表面与混合深度学习构建智能皮肤癌检测系统
多光谱超表面结合CNN-ViT混合模型,皮肤癌检测准确率98%,灵敏度95%,特异性99%。
Causal Clothes-Invariant Feature Learning for Cloth-Changing Person Re-ID
Temporal2Seq:一种用于时间视频理解任务的统一框架
Temporal2Seq统一框架将时序视频任务输出表示为令牌序列,支持多任务训练,表现优异。