视觉常识驱动的场景图生成知识精炼
提出无模型依赖的语义引导知识精炼框架,利用常识推理修正场景图预测,无需重训练且性能提升。
GMBFormer:一种NDVI引导的全局记忆库Transformer,用于从超高分辨率影像中提取城市绿地
GMBFormer利用NDVI门控和全局记忆库的相似性原型检索,提升超高分辨率影像城市绿地提取精度,在三个数据集上优于基线。
PAR3D:一种用于场景理解的部件感知统一3D多模态大语言模型
提出PAR3D框架及部件级数据集ScenePart,增强部件感知表示与分层查询,显著提升部件级问答与分割。
物理的无形之手:视频扩散模型所知远超其展示
视频扩散模型可线性解码物理合理性,准确率81%,物理表示源于去噪过程。
面向大规模野外几何处理的蒙特卡洛斯捷克洛夫算子
提出蒙特卡洛法估计Steklov算子,快速稳健处理低质多组件网格,计算45万形状谱,用于3D表示学习。
Flash-WAM: 面向世界行动模型的模态感知蒸馏
Flash-WAM压缩推理至单步,延迟从8.1秒降至348毫秒(23倍加速),仿真成功率85.5%,真实世界60%。
这个编辑正确吗?面向推理感知图像编辑的多维基准
提出RE-Edit基准,从五维度评估图像编辑系统,发现先进模型视觉佳但隐式推理薄弱,后编辑可缓解。
面向自主导航的不确定性感知自适应传感器融合
提出混合深度学习方法结合UKF,自适应融合IMU和视觉特征,通过不确定性感知损失提升VIO位姿估计精度与鲁棒性。
Oklch+:一种改进色差预测的Oklab三参数扩展
Oklch+通过三个参数改进Oklab,实现接近CIEDE2000的色差预测精度,且欧氏距离近似感知距离。
询问澄清:通过多轮对话解决指令歧义
提出Ask-to-Clarify框架,通过多轮对话澄清指令歧义并生成动作,两阶段训练策略使其在真实任务中优于现有方法。
What Objects Enable, Not What They Are: Functional Latent Spaces for Affordance Reasoning
Drishti AI-Event Guardian:面向大型聚集活动的智能实时人群监控与应急响应系统
提出Drishti AI系统,融合深度学习的多模态数据,实现实时密度估计、异常检测与预测,集成四模块,显著提升大型活动安全监测与应急响应效率。
GS-NFS:动态高斯溅射和点云的带宽自适应流传输
GS-NFS通过GPU并行加速动态3DGS编解码,实现全帧率处理,比现有技术快1-2个数量级,保持高质量。
语言模型能学会倾听吗?
提出框架根据说话者词语生成听话者面部反应,用VQ-VAE量化手势,预训练语言模型提升效果,动作流畅反映语义。
AffordanceVLA: 一种通过可供性感知理解赋能动作生成的视觉-语言-动作模型
提出AffordanceVLA,利用结构化可供性预测(Which2Act/Where2Act/How2Act)作为中间表示,桥接视觉-语言-动作,实现精准操纵。
双向优于单向:循环一致性的双向对齐用于无样本类别增量学习
本文提出BiCyc,通过循环一致性双向对齐,减少旧类遗忘,提升无样本增量学习精度。
采用改进条件化和多样性增强的渐进式增长生成对抗网络实现可制造超表面吸收体的逆向设计
提出GAN逆向设计框架,生成2-18GHz可制造超表面吸收体,实现高精度、高多样性与物理一致性。
LadderMan:学习人形机器人感知爬梯
LadderMan系统实现人形机器人鲁棒爬梯与操作,两阶段学习融合深度视觉策略,零样本迁移至真实硬件。
ActiveMimic:基于主动感知的自我中心视频预训练
ActiveMimic从自我中心视频恢复视角动作,联合学习主动感知与操作,性能匹敌机器人数据预训练模型,证实主动感知是关键。
高维数据流形上的高效平均曲率计算
通过代数恒等式和截断SVD,将平均曲率计算成本降低几个数量级,实现50-300倍加速。
RadiusFPS:基于球形体素修剪的高效最远点采样(CPU和GPU)
提出RadiusFPS,利用球形体素修剪加速最远点采样,GPU版本速度提升2.5倍、内存减半,实现实时机器人视觉应用。
上下文多实例学习
预训练上下文学习器,用合成数据单次前向传播解决MIL任务,无需梯度更新,性能超越需专门训练的基线模型。
空间伪影相干性决定基于块的rPPG的编码器鲁棒性
提出空间伪影相干性(SAC)指标,解释93.8%方差,确定P-Hybrid算法最鲁棒,SAC<0.30且低中运动时PatchPCA有优势。
眼见为虚:面向搜索驱动的视频虚假信息检测基准
提出EVID-Bench基准,通过搜索网络视频检测虚假信息,最佳准确率仅61.43%,AI生成内容尤难。
通过语义锚点和空间仲裁的弱监督增量分割
提出SASA方法,用语义锚点稳定表示、空间仲裁过滤噪声,缓解特征漂移,提升分割性能。
深入场景:通过焦点计划生成打破视觉-语言决策的感知瓶颈
SceneDiver通过粗到细焦点计划生成和蒸馏适配器,减少VLM/VLA视觉幻觉,提升具身决策效率。
模态内邻居从不撒谎:通过基于图的模态内推理纠正跨模态噪声对应
IN2R利用模态内邻居几何稳定性合成软原型,有效纠正跨模态噪声对应,性能最优。
Pinpoint:通过跨源检索与重排序实现全球图像地理定位
提出检索-重排序架构,融合Flickr与街景图像,实现全球级图像地理定位,达到最优性能。
设计驱动的最优传输流匹配
将先验作为设计选择,利用数据低频投影实现最优传输恒等耦合,减少轨迹曲率,提升生成质量。
基于联合潜在扩散的单图像反射分离
联合潜在扩散模型通过交叉注意力与分离采样,实现单图像反射与透射层鲁棒分离。
端到端文本行检测与排序
Orli模型将行检测与阅读顺序统一为图像序列问题,自动生成基线,零样本达到高精度。
GroupToM-Bench:多模态大语言模型中群体心智理论及非线性社会涌现的基准测试
提出GroupToM-Bench基准,揭示多模态大模型在群体心智与非线性社会涌现上远逊人类。
标准E2E:面向端到端自动驾驶数据集的统一框架
提出StandardE2E框架,统一6个驾驶数据集接口,支持跨数据集预训练与联合训练,简化新数据集成流程。
基于潜空间运动跟踪的单次测量前瞻性动态三维MRI重建
提出PDMR框架,离线学习运动场潜流形,在线快速适应,实现高保真、时间一致的前瞻性动态三维MRI重建,优于现有方法。
基于边际触发的问题再仲裁的答案自一致性方法(面向CVPR 2026 VidLLMs挑战)
提出ASC-MQRA框架,通过多轮随机问答和答案自一致性提升视频关系推理,边际触发再仲裁优化低置信度样本,测试平均准确率达81.16%。
FindIt:面向通用多模态大语言模型的格式感知视觉检测基准
首个评估通用多模态大模型定位能力的基准,涵盖四类检测任务,揭示模型对输出格式高度敏感。
3D视觉指南:数据、学习范式与应用
提出3D视觉数据分类法,连接几何表示、学习范式与重建生成等应用,揭示效率与保真度平衡趋势。
高效且无需训练的单图像扩散模型
基于多尺度补丁数据集和封闭式降噪器,无需神经网络训练,实现高效高质量单图像生成。
EReL@MIR 2025多模态文档检索挑战赛(赛道1)概述
该挑战要求单一系统处理闭集与开放域检索,前三名均基于Qwen2-VL,无训练系统仅差微调冠军0.1分。
XSSR:跨领域自监督代表性选择实现医学图像分割高效标注
XSSR以5%标注预算,通过自监督MAE和贪心选择算法,在医学图像分割中达到接近全数据性能,Dice提升0.4-2.5点。
UniCanvas:基于扩散的文本与图像联合生成统一模型
UniCanvas用扩散模型在像素画布上联合生成文本和图像,实现无缝统一多模态生成。
SBP-Net: 基于滑动盒投影的薄结构重建学习网络
利用滑动盒局部深度投影与神经网络融合,高效重建3D薄结构并保留精细细节。
鲁棒的多视图聚类对抗不完美信息
提出后验引导的潜在对应推断框架,统一处理不完整视图和噪声对应,提升聚类鲁棒性。
视觉泛化中数据规模、模型复杂度与输入模态的实证研究
本实证发现,增大数据规模稳定提升泛化,模型复杂度收益不稳,颜色信息关键,显式先验特征效果因架构而异。
基于部分分解注意力的空间基础概念瓶颈模型
新方法通过部分分解注意力与高斯先验,在CUB-200上分类精度接近全监督,指向精度提升16%,仅需少量数据初始化。
HYolo:一种基于超图学习的智能物联网目标检测系统
将超图学习融入YOLO,建模高维特征关系,在COCO上mAP@50提升约12%,增强检测鲁棒性。
MorphoQuant:面向全模态大语言模型的模态感知量化
提出MorphoQuant,通过分布感知偏置补偿和形态定向量化优化,实现全模态4-bit量化,在ScienceQA上超越W4A16基线。
VT-3DAD:通过视觉-文本正态空间对齐的跨类别三维异常检测
提出无训练框架VT-3DAD,利用视觉-文本对齐实现跨类别3D异常检测,在ShapeNetPart上达SOTA,单样本AUC-ROC提升至94.80%。
Video2LoRA: 面向视觉语言模型的参数化视频内化
Video2LoRA实现视频参数内化,一次前向生成LoRA,零视觉令牌推理,性能持平,成本大幅降低。
几何保持无监督对齐:面向异构基础模型的对齐方法
提出GPUA,无监督对齐视觉与视觉-语言模型,保持几何结构,提升零样本识别与分割性能。