VLM答案不是异常分数:无训练视频异常检测中的排名压缩
无训练视频异常检测中,概率读出优于生成读出,因生成读出导致排名压缩,平均提升5-13点。
面向残余听力损失的研究:新型耳蜗OCT数据集中纤维化的量化
本研究用深度学习分割耳蜗OCT图像,量化植入物所致纤维化,改进UNET模型效果最佳,可可靠评估纤维化负担。
掩码外锚定指令:高效上下文扩散变换器的精确参考缓存
提出掩码外锚定指令与精确参考缓存,用在线蒸馏恢复质量,多参考编辑保持质量并加速3.9倍以上。
视觉-语言-行动模型中令牌压缩的恰可察觉差异建模
提出动作恰可察觉差异模型,以语言条件动作响应界定令牌可容忍变化,提升VLA模型压缩可靠性。
ES-VP:能量塑形动态视觉提示实现高效模型适配
提出ES-VP,用低秩初始化与能量引导动态生成图像专属提示,参数更少、性能超越SOTA。
跨田地分布偏移下农业杂草检测的可迁移性研究
跨作物杂草检测迁移:少样本微调(25标注)优于无监督域适应,可减少标注需求。
当适应适得其反:MedSAM微调中的表示漂移与分布外失败
MedSAM微调提升域内和近分布外性能,但降低远分布外表现;解码器漂移致退化,编码器LoRA最稳健,提示抖动增强鲁棒性。
条件流匹配的难度校准插值路径
提出难度校准流匹配,从模型自身损失导出插值调度,提升采样质量,在少更新大批量场景下表现最佳。
WildFin:野外鱼类行为识别数据集
该数据集用于鱼类行为识别,含静态监控与动态跟拍,经大量标注生成9小时数据,揭示模型与真实水下分析的差距。
冻结CLIP先验用于鲁棒自监督泊松逆问题
提出ADMM展开求解器,冻结CLIP特征作先验,轻量解码器适配,实现自监督泊松逆问题重建,鲁棒且性能媲美监督。
KoViDoRe:韩语视觉文档检索
引入韩语视觉文档检索基准KoViDoRe并配套训练集,评估揭示现有模型在多页、复杂结构检索上表现欠佳。
基于视觉Transformer的隐私保护目标检测
提出利用感知加密和ViT嵌入结构的目标检测隐私保护方法,精度几乎无损。
能量加权球面矩的最大熵编码
提出能量加权球面矩的最大熵闭合,五参数模型重建辐照度,胜率78.7%,亮度RMSE降15.8%,无负辐照度。
MultiCube:具有部件级语义与空间控制的组合式3D生成
提出MultiCube,实现3D物体部件级语义与空间独立控制,两阶段扩散生成组合网格,支持复杂布局。
OmniAssistBench:面向全模态大语言模型的助手式交互基准
提出OmniAssistBench基准,评估全模态大模型视频助手能力,现有模型得分低,常答错或不完整。
稀疏光场采样改善随手3D/4D重建
多摄像头即使基线短,也能显著提升单次、少量和随手视频的重建质量,曝光稀缺时角度采样尤为有效。
在GPU CUDA与张量核上实现多精度支持的显存高效Im2win卷积
提出支持全精度CUDA核与半精度张量核的im2win卷积,优化访存与异步数据移动,相比cuDNN等提速最高6.4倍,显存仅用35%-53%。
当生成图像看似正确却检索错误:覆盖引导的跨尺度重索引实现知识忠实的生成式感知
提出CERES闭环多模态索引,覆盖引导跨尺度重索引解决尺度概念丢失,提升知识忠实与检索,多项基准最优
Re³Cap:强化学习下的检索引导图像描述优化
提出检索引导强化学习优化图像描述,无需额外标注,修正幻觉遗漏,超越监督微调,关系推理较GRPO提升8.64%。
基于显著性正则化调优的多模态跟踪器优化
提出显著性正则化调优,平衡可塑性与稳定性,提升多模态跟踪性能
无IMU四旋翼机体坐标系状态估计与稀疏场景流
提出仅用视觉与推力命令、不依赖惯性传感器、在机体坐标系中的四旋翼状态估计,输出稀疏场景流。
GS-Net:面向异构车辆数据复用的可泛化即插即用3DGS模块
提出GS-Net即插即用模块,聚合稀疏点云生成密集高斯原语,提升跨传感器视图渲染质量与初始化速度,促进车辆数据复用。
视觉基础模型驱动的前景感知伪激光雷达生成用于单目三维物体检测
提出前景感知伪激光雷达生成框架,用视觉基础模型增强深度与前景,提升单目三维检测,达到新最优。
超越隔离头:视觉Transformer的多重叠头自注意力
提出多重叠头自注意力,软重叠促头间通信,超越标准多头注意力,开销极小。
Crane:上下文引导的提示学习与注意力精炼用于零样本异常检测
提出上下文引导的提示学习与注意力精炼框架,提升零样本异常检测与定位精度。
海岸线作为结构性约束:利用场景几何实现自主水面艇定位
利用海岸线和水面几何实现GPS拒止下自主定位,LiDAR和单目两种框架,经真实数据验证,有效降低漂移。
WeedNet:基于基础模型的全局到本地AI实时杂草物种识别与分类方法
WeedNet以自监督和微调识别1593种杂草,准确率91%,区域模型达97.38%,支持机器人集成与智能咨询。
VT-MUSE:面向操控任务的多模态统一序列视触觉表示学习
提出VT-MUSE两阶段视触觉表示学习框架,通过跨模态时序对齐与条件变分潜变量建模,融合视觉与触觉历史,提升操控策略性能。
面向心脏消融规划的LGE-MR图像临床质量与可用性的视觉语言模型评估
提出两阶段视觉语言模型,自动评估心脏磁共振图像质量并判断消融规划的临床可用性。
深层模型,浅层对齐:揭示神经解码中的粒度失配
提出浅层对齐框架,用中间层表征做解码目标,性能提升22%-58%,并呈现正向缩放趋势。
微调心电图基础模型以预测冠脉CT血管造影结果
基于冠脉CT血管造影,微调心电图模型预测冠脉狭窄,多中心验证有效,结合临床概率提升风险分层,可影像前筛查。
ProtoFlow:通过低曲率原型流缓解类增量遥感分割中的遗忘
提出时间感知原型动力学框架ProtoFlow,以轨迹建模类别原型并显式学习演化,稳定几何结构,在遥感增量分割基准上提升mIoU 1.5-2.0并降低遗忘。
基于移动激光扫描与语义三维道路空间模型的物体表面辐射指纹识别
利用重复激光扫描聚合构建物体表面辐射指纹,识别材料属性,为语义三维城市模型补充缺失的材料信息。
InverFill:面向少步扩散修复增强的单步反转方法
提出InverFill,以单步反转将掩码图像语义注入初始噪声,实现少步高保真修复,无需训练。
文本是什么颜色?——图像内嵌提示引发幻觉的基准
用内嵌冲突范式与色彩基准评测十六个多模态模型,发现其易受图内文字干扰,语义压倒颜色感知,条件性幻觉率超五成。
DINO驱动的自动驾驶:视觉基础特征作为仿真到现实生成的统一桥梁
以视觉基础特征为统一桥,用子空间投影和随机通道丢弃平衡一致性与真实感,完成仿真到现实视频生成。
RecGen3D:共享规范空间中的重建引导三维生成
提出RecGen3D框架,在共享规范空间协作重建与扩散,解耦学习,实现稀疏视图下完整一致三维生成,保真鲁棒更优。
MeltwaterBench:地表融水时空降尺度的深度学习
提出融水基准,用深度学习融合遥感与气候模型,时空降尺度生成每日百米融水图,精度超传统法,并公开数据集。
CFM:语言对齐的视觉概念基础模型
提出语言对齐的概念基础模型,提供细粒度可解释且空间定位的概念,支持分类分割描述任务,性能与不透明模型相当。
PhotoBench:超越视觉匹配,迈向个性化意图驱动的照片检索
提出PhotoBench基准,基于真实个人相册的多源推理,揭示统一嵌入模型与智能体系统的局限,推动个性化检索发展。
基于FBP雅可比学习的双域细化网络用于稀疏视角双能CT材料分解
提出双域细化网络,用FBP雅可比近似与傅里叶卷积残差块,实现稀疏双能CT材料分解。
图像分类模型的反事实压力测试
基于因果生成模型的反事实压力测试,通过干预属性生成逼真图像,比传统扰动更准确评估模型在分布偏移下的鲁棒性。
学习编排视觉基础模型实现多任务密集预测
提出COVE:用协同组合器构造候选,任务条件路由器调度冻结基础模型,反事实监督防坍缩,计算更少且超越单专家。
采用结构化编辑提示与密集-稀疏融合的CoVR-R先推理后检索方法
提出CoVR-R零样本推理-检索流程,Qwen3.5生成描述与嵌入,融合密集与稀疏检索,验证集R@1达80.81。
Tetris:基于瓦片级采样的高效高保真视频目标跟踪
Tetris以瓦片级采样分解视频,用ILP剪枝冗余,在5%精度损失内实现最高68.8倍吞吐提升。
基于动作的组织可供性实现预期自动取景,降低腹腔镜手术中医生认知负荷
从手术视频动作提取标签训练模型,预测视线与镜头运动,自动取景降低医生认知负荷。
ConceptFormer:面向视觉文档检索中查询-文档对齐的自适应潜概念学习
提出潜概念学习框架,以条件潜概念桥接视觉证据与语义,显著提升检索准确率。
CogCanvas:多主体参考图像生成评估基准
CogCanvas评估多主体参考图像生成五种SOTA随主体数增多性能下降超三主体时物体绑定失败
MatMMExtract:从材料科学文献中提取子图级可溯源图文对的开源流水线
提出开源流水线分解复合图为子图并注释图文构建39万对数据集检测精度92%检索命中率提升4.4倍