FlowOVD: 学习生成式潜流用于零样本开放词汇检测
提出FlowOVD,将查询生成建模为潜空间连续流,零样本开放词汇检测在COCO和LVIS上分别达49.5和31.5AP,优于现有方法。
VICR:面向真实世界图像超分辨率的视觉上下文恢复
VICR基于DiT,将超分视为图像补全,通过解耦局部与全局视觉先验恢复结构并保持语义一致,仅127M参数达SOTA。
FROST-STA:用于Ego4D短期物体交互预测的冻结密集特征
冻结密集图像视频特征结合多任务预测,在Ego4D短期交互挑战中获得第二,Top-5 mAP达5.13。
采用FiLM调制的头部姿态感知视觉语音识别
提出HP-VSR-ResFiLM框架,利用FiLM调制融合头部姿态信息,提升非正面视角鲁棒性,在LRS2/LRS3上WER分别达到25.0%和33.2%。
SkyShield:以占据为低空无人机自主飞行的安全接口
提出首个低空无人机前视语义占据基准SkyShield,配套安全指标KAR-mIoU和基线SkyOcc,实现占据作为安全接口。
扩展并行序列模型至基础级视觉编码器
C-GSPN基于2D空间传播,提速40-52倍,参数少15%,分割提升2.1%,4倍端到端加速。
GIRL-DETR:梯度隔离强化学习用于视频时刻检索
提出GIRL-DETR,首将强化学习后训练引入轻量级VMR,冻结主干,三阶段渐进优化非可微指标,解决损失退化,显著提升定位精度。
CASTLE2026 WDL团队技术报告
基于Qwen的证据感知多模态推理管道结合LoRA微调与多帧采样,在CASTLE挑战中取得第一。
CR-JEPA:用于遥感图像检索的跨模态联合嵌入预测学习
CR-JEPA模型通过JEPA预测与解耦头设计,在BEN-14K上跨模态检索提升至75.8%,参数更少。
SuperMemory-VQA:面向长期记忆的自我中心视觉问答基准
提出评估AI长期记忆的自我中心VQA数据集,含52.9小时日常活动与4853个问答对,揭示现有系统不可靠。
将图像视为表格:使用TabPFN进行上下文学习以实现低数据量下AI生成图像的检测
提出将图像编码为表格,用TabPFN上下文学习检测AI生成图像,低数据场景下优于现有方法,无需梯度微调。
RoboStressBench:具身场景下VLM对物理视觉压力的鲁棒性基准测试
RoboStressBench将视觉压力分解为材质、视角、光照、几何四维,评估VLM具身场景鲁棒性,并引入压力感知求解器。
合适的推理策略就是一切:面向EgoCross挑战的几乎无需训练的逐领域推理
针对EgoCross挑战,采用逐领域推理策略几乎无需训练,用20样本达66.98%准确率,证明领域感知可弥补模型局限。
MoEIoU:将边界框回归视为专家混合模型
提出MoEIoU损失,基于专家混合自适应聚合重叠、中心与形状误差,课程式权重调度,加速收敛并提升定位精度。
城市感知中视觉语言模型的基准应具有可靠性意识且可协商
城市感知基准应纳入人类分歧与弃权,报告可靠性,协商标签空间,以服务城市治理。
RefDiffNet:在检测前学习揭示细微PCB缺陷
RefDiffNet轻量模块利用无缺陷参考图像增强输入,突出缺陷,显著提升PCB检测性能,计算开销极低。
MBench:视频世界模型记忆能力的综合基准
提出MBench基准,从实体、环境、因果一致性评估视频世界模型记忆能力,揭示长期状态保持局限。
DINO-GFSA:基于语义门控融合与Mamba序列聚合的地理定位
提出DINO-GFSA框架,融合语义门控与Mamba序列聚合,实现无人机跨视角地理定位的SOTA性能。
DASH:面向引导校准紧凑扩散模型的双分支分数蒸馏
DASH提出双分支蒸馏,独立监督无条件与条件分数分支,配合课程迁移和锚项正则化,实现5.9倍压缩且保持引导保真度。
连接拓扑与深度表示学习:一种用于四类脑肿瘤分类的TDA-ViT融合模型
提出TDA-ViT融合模型,结合拓扑与Transformer特征,脑肿瘤分类准确率达99.10%,优于多种现有模型。
超声视频的队列级神经图谱
提出超声视频队列级神经图谱,联合训练数千帧,实现标注高效转移,减少专家标注负担。
单通道组织分割:基于基础模型的跨模态知识蒸馏
提出跨模态蒸馏框架,将多通道基础模型知识迁移至单核通道轻量模型,Dice提升13点,参数减少23倍。
GABI:面向航天器分割的几何感知边界融合
提出轻量边界感知多任务分割架构,利用距离场监督提升航天器分割精度,跨域泛化优秀且模型更小。
MMDG-Bench:多模态域泛化基准
提出MMDG-Bench,含D2M/M2D框架及统一协议,揭示DG技术提升泛化、框架选择依模态稳定性、强骨干放大收益。
CV-Arena:面向指令式计算机视觉问题解决与人类-AI协作偏好的开放基准测试
提出CV-Arena基准与Active Elo协议,评估21个系统发现指令遵循、物理推理等不足,并开发CV-Agent探索闭环推理。
hZACH-ViT:面向低数据医学影像中紧凑视觉Transformer的弯曲潜在几何
hZACH-ViT用弯曲几何扩展ZACH-ViT,在7个医学数据集上平均提升2.1%,最佳达5.5%,证实几何与曲率需依数据集选择。
一通道以统全局:重新思考视觉位置识别的输入表示
灰度图在视觉位置识别中性能不输RGB,严重外观变化下更优,且节省资源,足以胜任全局定位。
推理、检索、重排:面向组合视频检索的零样本推理感知框架
R3-CoVR零样本框架:推理编辑效果生成描述,检索加约束重排,R@1达91.9%,R@10达98.2%。
COLLAR:级联对象级潜在精化实现高保真条件生成
提出COLLAR框架,通过扩展视野和级联特征优化提升对象级控制,在COCO基准上超越现有方法。
地毯制造中训练质量控制AI的数据收集
提出在线机器视觉系统,实时检测地毯缺陷并系统收集标注图像,以持续训练AI模型,提升工艺质量。
Reasmory:三维重建作为VLM空间推理的显式记忆
Reasmory用结构化程序与领域特定语言让VLM可靠利用3D重建记忆,空间推理提升6-18%。
大规模文生视频扩散Transformer的边界保护W8A8 HiFloat8量化
针对文生视频Transformer,保留首尾块为BF16,其余量化HiF8,实现无损量化。
红细胞介导血管造影中视网膜血流量量化的自动红细胞检测与跟踪
提出EMTrack框架,通过流动上下文模块与拓扑感知跟踪实现红细胞自动检测追踪,有效量化视网膜血流,性能优于现有方法。
多时相指代分割的开源基准与基线
提出多时相指代分割任务,构建首个基准数据集MTRefSeg-21K及变化感知LVLM框架,性能领先。
Flexible Control of 3D CT Generation via Text and Semantically-Defined Segmentation Prompts
学习神经变形表示用于4D动态形状生成
提出解耦运动与形状的神经变形表示,预测蒙皮权重和刚体变换,实现高质量4D动态形状生成,性能优于以往方法。
SWARD:基于随机窗口注意的关系蒸馏用于跨架构语义分割
SWARD通过随机窗口注意蒸馏和原型判别正则化,实现跨架构语义分割知识蒸馏,性能达最优。
跨轴特征融合与关节运动差异预测的文本驱动三维人体运动编辑
结合跨轴特征融合与关节运动差异预测,提升文本驱动3D运动编辑的语义对齐与保真度,达最优结果。
ProductWebGen:多模态产品网页生成基准
提出ProductWebGen基准,用于评估多模态模型生成产品展示网页的能力,对比了基于编辑和统一模型的两种工作流。
SANA-Streaming:基于混合扩散Transformer的实时流视频编辑
提出SANA-Streaming框架,通过混合扩散Transformer和系统协同设计,在RTX5090上实现1280x704分辨率24FPS实时编辑,时序一致性和吞吐量显著超越现有方法。
通过对比蒸馏的轻量化SAR舰船检测
提出SURGE框架,对比蒸馏转移关系几何,轻量SAR检测提升6.2mAP。
看见不等于知道:VLMs是否知道何时不应回答空间问题(及原因)
研究揭示VLMs在遮挡和透视歧义下过度自信作答,准确率低于30%甚至10%,且难以识别有效视角,需重视弃权能力评估。
DTG-Restore:无需训练的视频超分辨率扩散精炼
提出解耦时间引导,无需训练即可提升低分辨率视频结构保真度与时序稳定性,结合即插即用模块显著改善细节。
聚类引导的领域特定预训练基础模型:超高分辨率北极遥感
通过聚类筛选北极超高分辨率图像并自监督预训练ViT,提升北极特征映射性能,优于通用模型。
Mitigating Content Shift and Hallucination in GenAI Image Editing via Structural Refinement
Dex2HOI: 灵巧双手双物体交互生成
提出Dex2HOI统一扩散模型,用双流扩散和运动融合网络实现双手双物体交互生成,推理速度提升540倍。
OmniMem:面向长视频生成的可扩展与自适应记忆检索
OmniMem提出显式全范围记忆检索,通过稀疏KV选择与自适应窗口排除,提升长视频生成动态度52.3%。
一种用于磁共振图像增强脑肿瘤分割的新型全局上下文感知深度神经网络
提出GCSER-UNet模型,融合空间与通道注意力,脑肿瘤分割Dice达94%-95%,超越现有最优。
设备端生成式AI实现符合GDPR的视觉监控:基于本地目标检测的自然语言警报
边缘设备实时目标检测后丢弃像素,本地LLM生成文本警报,不传图像,符合GDPR数据最小化原则。
VLM3:视觉语言模型是原生3D学习者
视觉语言模型天生擅长3D学习,简单方法即可掌握多种任务,性能超专家模型。