MIRROR: 通过格罗莫夫-瓦瑟斯坦距离对齐语言到图像的语义关系
提出MIRROR框架,通过SI-GW几何正则化对齐语言与视觉关系,提升多模态大模型关系一致性且不增参数成本。
秩感知双曲对齐的视觉-语言数据集蒸馏
RAHA利用双曲空间和不对称目标控制对齐容量,强制测地线对齐并正则化残差子空间,提升跨模态检索和迁移鲁棒性。
MAVIN:具有叙事控制的多镜头音视频生成
提出MAVIN框架,实现多镜头音视频生成与叙事控制,解决时间错位和多主体一致性问题,性能领先。
并非所有关系都同等旋转:面向视角鲁棒的3D场景图生成的变换感知解耦
提出TAD框架,解耦关系推理为稳定和方向两部分,实现视角鲁棒的3D场景图生成,性能领先。
DMV-Bench:通过偶然线索注入诊断长时程多模态智能体的视觉记忆
DMV-Bench是首个交互式多模态视觉记忆基准,提出双编码架构DualMem,在长链条任务中显著优于现有系统。
镶嵌地球
TTE利用可学习球面Voronoi分区集中表征,引入全局语义标记,在多项任务中达到最优。
SemCityLoc:基于语义三维城市模型的空中六自由度定位
利用语义表面配准与轻量级3D建筑模型,在复杂城区将平均定位误差从9.89米降至2.62米,无需辐射重建。
SelectAnyTree: 一种用于3D森林激光雷达点云的可提示实例分割模型
SelectAnyTree通过点击提示分割森林点云中的单棵树,单次点击IoU达78.2,优于基线24.8点。
ReWorld:为世界动作模型学习更优表征
提出ReWorld表征学习框架,优化中间表征提升自动驾驶世界动作模型的生成与规划性能,FVD降23.9%,PDMS升至90.4,训练加速2倍。
微调多模态大语言模型以从家庭短视频中进行临床级自闭症行为评分
微调多模态LLM使家庭视频自闭症行为评分信度提升40%,诊断F1提升53%,达临床水平。
Aloe-Vision:面向医疗的稳健视觉-语言模型
提出Aloe-Vision医疗LVLM系列,基于高质量多模态数据训练,性能优于基线,但当前模型仍易受对抗输入影响。
结构化的Li-GS:融合LiDAR与空间约束的结构化3D高斯泼溅
提出Structured-Li-GS框架,结合LiDAR-SLAM,用少量高斯实现高质量密集点云重建。
TruEye:对图像中AI生成人物的细粒度检测
TruEye模型细粒度检测AI生成人像,区分五种合成类别,无需大模型,速度百倍提升,准确率领先。
CoIn:基于高斯泼溅引导的全面2D-3D修复
CoIn通过多阶段一致性管道结合2D修复与3D高斯泼溅,支持任意形状掩码的物体移除与插入,性能领先。
MemoBench:动态变化环境中的世界建模基准测试
提出“消失-重现”动态环境基准,评估视频模型在目标消失后正确恢复其更新状态的能力。
超越运动捕捉:用合成人体运动扩展运动分词器进行生成建模
利用大规模合成运动扩展运动表示,结合改进VQ-VAE分词器,显著提升运动生成任务的覆盖度与组合性。
基于物理世界建模的感知3D模拟
P3Sim系统结合学习推理与几何结构,从部分观测和变换信号模拟未来场景,泛化多类3D任务。
理解汽车感知中的跨支架泛化:多支架基准与支架变化度量
提出多支架基准及两个度量,发现几何支架差异导致性能显著变化,对比距离可预测迁移难度。
雷达引导摄像头验证的自动紧急制动:雷达-摄像头融合中目标检测的再思考
提出无训练数据的雷达引导边缘密度门控验证法,搜索空间减98.7%,延迟0.12ms/ROI,零漏刹。
基于分布的深度多实例学习用于非小细胞肺癌肿瘤比例评分
提出基于零膨胀贝塔分布的多实例学习,仅用切片级TPS标签预测肿瘤比例,显著优于基线,提升准确性
DeLux:利用神经形态数据进行视频中的跨模态局部伪影修复
提出DeLux跨模态修复方法,以神经形态事件流为先导,修复RGB视频光照伪影,MS-SSIM超0.99,伪影降低88%。
Beyond Points: Spherical Distributional Part Prototypes for Interpretable Classification
大型语言模型教导视觉学生:细粒度概念知识的跨模态迁移
LaViD利用LLM生成选择题,将语言知识蒸馏到纯视觉模型,无需配对数据,提升细粒度分类与鲁棒性。
乘性均匀噪声下的ICF图像去噪:基于对数域Noisier2Inverse框架的自监督研究
提出对数域Noisier2Inverse自监督去噪框架,用于ICF图像乘性均匀噪声去除,最佳PSNR 21.41dB,无需干净数据。
Qwen-Image-2.0-RL技术报告
采用RLHF与在线策略蒸馏后训练,显著提升图像生成和编辑的视觉质量与指令跟随,多基准得分提高。
可解释人工智能在生物多样性监测与生态图像分析中的应用
可解释AI应成为生态模型验证标准,确保预测基于生态信号而非虚假相关,提升保护决策的可靠性。
面向冻结视觉语言模型的VLM感知元光学前端设计
提出CODA框架,直接优化元光学前端,使冻结CLIP零样本准确率从53.75%提升至65.41%,并跨模型数据集迁移。
MVPruner:用于加速自动驾驶中多视图视觉语言模型的动态令牌剪枝
MVPruner两阶段自适应剪枝,依据视图多样性和指令文本动态分配预算,实现4.97倍加速且精度保留98.5%。
GeoFace:基于几何约束扩散的一致多视角人脸生成
GeoFace利用几何约束扩散,双流联合生成多视角人脸与3D几何,实现跨视角一致,提升重建质量。
面向多帧红外小目标检测中分割一切模型的时间涌现提示方法
提出TEP-SAM,利用时间涌现线索联合全局与局部运动,增强目标特征,实现低SNR多帧红外小目标高效分割。
基于CNN与视觉Transformer融合的AI生成图像识别
提出融合多种检测方法识别AI生成图像,在CIFAKE数据集上达97.32%准确率。
拆解病理性捷径:用于忠实LVLM解码的因果框架
Fox框架通过因果干预切断注意力头病理性捷径,消除幻觉,实现忠实解码,性能提升29.1%。
CascadeOcc: 利用级联VQ表示重新思考3D占据世界模型
CascadeOcc通过级联VQ与多尺度时间建模,以粗到细方式预测3D占据,验证了优化内在表示的有效性。
PixelU:用于高效端到端像素扩散的U形Transformer
PixelU以简约U形结构解耦高低频,用跳跃连接和空间下采样实现高效像素扩散,仅1/3计算成本超越强基线。
MASS: 面向光流视频帧插值精化的运动对齐选择性扫描
MASS沿光流轨迹构建特征序列,自适应采样精化流与掩膜,在大位移复杂动态场景达最优。
面向城市电磁场地图预测的多模态条件高分辨率Transformer
提出多模态条件高分辨率Transformer预测电磁场,融合FiLM与交叉注意力,测试MAE 0.0461,较UNet提升25.2%。
使用辅助目标学习基于1比特激光雷达的定位
首个二值神经网络六自由度激光雷达定位框架BiLoc,以辅助目标自适应调节信息保留,缓解二值化信息损失,性能新SOTA。
加密手写文档图像的联合转录与解密:与传统流程的比较
提出直接图像解密端到端方法,绕过转录阶段,实验表明联合建模优于传统两阶段流程。
SIFT:视频扩散模型中物理合理运动的自我想象微调
提出自我想象微调(SIFT)打破运动纠缠,提升视频物理真实感与运动解耦。
场景与人类同世界:前馈重建
SHOW框架耦合前馈场景重建与人体网格恢复,利用人体先验和场景约束,实现度量尺度一致的人景重建。
基于细胞病理图像合成与知识蒸馏的两阶段跨域宫颈异常筛查
两阶段跨域宫颈检测框架:SC-UNSB合成中间域缓解域偏移,知识蒸馏双级特征对齐提升泛化性能。
ZooClaw-FashionSigLIP2:通过蒸馏微调实现鲁棒的时尚检索
提出蒸馏微调与权重插值的时尚检索模型,超越现有方法,发布新基准并分析数据集偏差。
全景场景分析:从畸变感知工程到球面原生基础建模的综述
全景场景分析从畸变感知到球面原生建模的演进,核心矛盾为球面等变性与重用透视预训练权重不可兼得,揭示评估五不足,提出六路线。
面向复杂交通场景的嵌入式实时车牌识别系统
本系统针对发展中国家复杂交通场景,采用轻量CNN和FPGA加速,实现嵌入式实时车牌识别,检测mAP 93.6%,识别准确率87.88%。
ModaFlow: 模态感知流匹配用于高保真虚拟试穿
ModaFlow通过模态感知引导、正则化损失和掩码策略实现高保真虚拟试穿,FID降低约30%。
TRUST:基于图像到超声视频迁移学习的高效腹部创伤识别
TRUST框架通过跨频协同适配器、多粒度运动感知和视觉查询语义聚合,在超声创伤识别中提升性能9.63%,计算高效。
海马-DETR:基于海马建模的显式记忆目标检测框架
基于海马记忆建模的检测框架,模拟海马子区域提升检测精度与泛化能力。
MindFlow:协调认知语义与声学动态的双人对话面部动画生成
仿神经腹侧-背侧通路的双路径框架,解耦语义推理与动态控制,实现更优面部动画。
Video-MME-Logical:视频时间逻辑推理的受控诊断基准
提出Video-MME-Logical基准,通过五种时序逻辑操作诊断模型,发现人类与模型差距大,微调难以弥补。
使用最大均值差异的可扩展且可微分的点云配准
提出MMD-Reg,基于最大均值差异的可微点云配准,线性复杂度,支持端到端训练。