ALTER:通过区域差分建模纵向变化实现三维CT报告生成
提出ALTER,融合全局先验、区域差分与区间变化,建模CT纵向变化,实现三维报告生成,达最优。
TruthLens:基于自评估真实性分数的大型视觉语言模型对象幻觉检测
提出TruthLens自评估框架,利用特殊令牌真实性分数检测对象幻觉,无需辅助模型,性能SOTA,AUROC提升超17%。
基于SDR融合与增益图逆色调映射的双输出多曝光HDR重建
提出双输出多曝光高动态范围重建,融合标准动态范围图像与增益图逆色调映射,实现最优重建
G²ARD-GS:几何引导的锚点正则化高斯溅射蒸馏
提出几何引导锚点正则化蒸馏法,将密集高斯先验压缩为紧凑表示,在5-30倍压缩下性能最优,并提升几何复用与配准精度。
ChronoVision:基于潜在状态重建的时间推理
提出一种多模态框架,通过潜在状态重构与强化学习提升时间推理,在两项基准上取得最优性能。
Vorch-IR:长时统一多模态身份替换视频生成
提出统一框架Vorch-IR,支持单双人身份替换及背景替换,融合视频、参考图和文本指令,自动构建数据,实现身份保持与动作连贯。
用于跨朝向无线感知的仿真到现实双注意力与对抗迁移网络
提出双注意力与对抗迁移网络,用仿真数据增强跨朝向感知,少样本实测迁移后识别率达95%。
URNet:一种面向高效RGB-D语义分割的统一重参数化网络
提出URNet,单编码器同时完成多模态特征提取与融合,采用重参数化、线性门控注意力和金字塔合并解码器,兼顾高效与最先进性能。
Vorch-Streamer:将人类音视频生成扩展到实时长时流式生成
提出新框架,以因果生成与自强制蒸馏实现实时长时音视频流式生成,超实时且保持同步与身份一致。
DistMedVL:基于分布的视觉-语言对齐用于不确定性感知的医学图像分割
提出DistMedVL概率框架建模跨模态不确定性,6.3M参数在八项基准超越SOTA,高效强泛化。
TAU-Bench:从异常实例跟踪到细粒度视频异常理解
提出TAU-Bench基准,联合评估异常实例跟踪与细粒度视频理解,揭示语义推理与视觉定位的差距。
StreamArena:迈向连续、交互式与长时程的智能体流式视频理解
提出长时程交互式流媒体视频理解基准StreamArena与双层级架构StreamMind,各项能力优于现有基线。
SciQNet:面向科学图像质量评估的两阶段多模态自适应
提出SciQNet两阶段多模态自适应科学图像质量评估方法,融合评分与理解监督,获ICME挑战赛第二名。
一个排名,任意预算:用于长视频理解的套娃式证据到上下文帧选择
提出MEC帧选择法,构建可重用稀疏索引与位置自适应排名,任意预算截断即用,精度提升3.77%,延迟降低47%-51%。
面向无人机摄影测量的迭代式混合离散-连续视点规划
提出迭代混合离散-连续视点规划方法,结合启发式评分与CMA-ES优化,提升重建精度与完整性。
PhyLatent:学习JEPA世界模型的动力学相关表示
提出动力学相关训练目标,解决JEPA世界模型三种坍缩,降低失败率并提升模型预测控制成功率。
超越相关性:面向智能体全切片图像推理的贝叶斯证据获取
提出贝叶斯证据获取框架,通过最大化信息增益降低WSI推理的不确定性,零训练下性能最优。
LiteKD-Net:面向移动图像去噪的轻量级知识蒸馏网络
提出轻量知识蒸馏网络,用物理噪声模拟生成训练数据,以深度可分离卷积构建学生网络,特征级蒸馏传递教师能力,兼顾恢复质量与低算力。
LAWM-3D:从人类视频学习3D感知潜在动作,用于可泛化的机器人世界模型
提出LAWM-3D:从人类视频学习3D感知潜在动作,提升世界模型的生成、物理一致性与泛化性能。
Engram-E2VID:基于参考的事件到视频重建——通过外观印迹的生成激活
提出结构引导框架,生成激活外观印迹与事件运动结构,实现高质量重建,PSNR提升3.29dB。
UniVVT:高保真视频虚拟试穿的统一端到端框架
提出统一端到端框架,将视频试穿改为语义条件生成,免除掩码姿态变形模块,高保真且性能领先。
ConceptADapt:概念引导的动态注意力自适应特征重构用于少样本工业异常检测
提出概念引导的动态注意力特征重构方法,结合稀疏自编码器与LoRA,少样本异常检测表现最优。
GST-Bench:视频能否让视觉语言模型发展出全局空间感知?
GST-Bench评测视频全局空间感知;最强模型42.68,远逊人类79.08,暴露长时视频整合缺陷。
面向图像恢复的关系流形流映射蒸馏
提出FoRM,将关系蒸馏转为流映射,学习流映射算子并加一致性约束,五个复原任务超SOTA,方差降50%。
STAIL:基于大语言模型的语义文本锚定医学影像增量学习
提出语义文本锚定增量学习,以文本替代图像存储,借大语言模型锚定特征,减少遗忘,提升医学影像持续学习性能。
证据驱动的动态视觉选择器用于高效长视频理解
提出基于内部注意力证据的动态视觉选择器,自适应分配计算,减少50%视觉令牌且提速3.9倍,性能更优。
HyTBE:面向跨域红外小目标检测的双曲目标-背景专家模型
提出双曲目标背景专家模型,干预目标背景关系并建模,提升跨域红外小目标检测泛化性。
Vorch-Director:基于噪声感知误差修正的交互式世界故事模型
提出噪声级别感知的残差修正策略,减少自回归生成中的误差累积,提升长视频音视频一致性与稳定性。
KVAE:面向多模态生成模型的标记器系列
KVAE系列分词器覆盖音视频图像,压缩性能优越,重建与生成指标超越Wan-2.2等开源模型,代码已开源。
SR-JEPA: 在3D场景中学习预测潜在状态
提出SR-JEPA,预测缺失实体的潜状态,ARKitScenes识别达43.13%,展现可查询的三维组合式预测。
有序扩散用于三维人体配准
提出ODin,将人体配准建模为扩散生成过程,处理扫描歧义,优于回归并创SOTA,用时缩短三分之二。
VSMP-IMU:视频引导的语义运动程序用于传感器感知的合成IMU生成
视频引导的语义运动程序生成合成IMU,在五个人体活动识别数据集上超越纯真实训练与现有基线。
Vorch-Omni:视听多任务编排
Vorch-Omni:统一视听生成框架,任意条件到任意输出,流匹配扩散,无需专用架构,支持10余种视听生成与编辑任务。
MAVISEG:扩散Transformer中零样本开放词汇分割的流形传播与视觉原型
提出训练无关的MAVISEG,挖掘生成轨迹、视觉统计与特征几何,纠正逐像素评分,六项基准全最优。
能量引导流匹配
提出能量引导流匹配,移动端点逐步释放高频实现粗到细生成,ImageNet 256 FID达1.45,文本生成亦有效。
克服注意力漂移:同质性-异质性引导的特征聚合用于低光照遥感图像增强
提出双先验框架,用同质与异质引导特征聚合,克服注意力漂移,提升低光遥感增强效果。
用于少样本腹部分割的贝叶斯自适应加权集成
提出贝叶斯自适应加权集成框架,自动优化少样本分割权重,应对标签稀缺与域偏移,显著提升性能。
监控摄像头图像中道路交通目标在道路平面上的精准定位
提出两阶段几何感知定位法,预测车辆足迹四边形中心,将图像定位误差降低51.8%,中位误差降至4.29像素,大幅提升远距离及透视变形场景精度。
可控服装:基于潜在扩散模型的虚拟试穿精准标签与生成
利用开源人工智能为服装图添加长度风格等标签,训练适配器生成用户可控图像,确保虚拟试穿真实。
形状感知的OBB到HBB转换方法
提出形状感知的OBB转HBB方法,利用船体形状、丰满度与朝向生成更紧凑的HBB,优于三种基线方法。
Curia-MAE:面向3D医学图像分割的多模态多解剖MAE预训练
扩展MAE预训练,用30万CT/MRI多模态多解剖数据,提升冻结编码器分割性能,病灶任务优于完整微调。
DTRNet:用于手写中文文本识别与伪造字符检测的双文本-部首解码
提出双文本-部首解码实现行级伪造字符检测,解耦识别与结构验证,IDS调置信度,兼顾性能与可解释性。
D-CLOT:双闭环最优传输用于无监督动作分割
提出双闭环最优传输方法,重估动作原型解决表征-原型不一致,在五个基准上提升分割质量。
多年地理空间推理:将年际一致的历史预测作为自由输入模态
利用模型自身历史预测与外部掩码,将单年单任务分类器升级为跨年推理,作物分类F1提升1.6个百分点。
在活态语境中见世界:统一室内外城市场景生成
HoloWorld统一室内外城市生成,通过跨尺度上下文保持建筑内外对应与街区连贯性,性能超越SOTA。
浮动辐射网络
提出浮动辐射网络,以平面高斯图元与连续神经辐射场结合,支持光线追踪与编辑,重建质量高。
绘制亚美尼亚巴黎:从20世纪散居报刊中提取并地理编码商业广告
用视觉语言模型从亚美尼亚侨民报刊提取广告并地理编码,绘制20世纪巴黎亚美尼亚商业地图。
Robust-WAM:在世界-动作模型中桥接生成式预训练与语义前瞻
提出鲁棒世界动作模型后训练法,保留生成预训练,增加语义前瞻对齐,使动作预测耐受视觉变化,提升多种基线成功率。
MirrorNet:医学图像匿名化真能保护患者身份吗?
医学图像去标识化仅删元数据,模型能从扫描恢复患者肖像,证明其仍可识别身份,应视为生物特征数据。
拓扑感知的邻域学习用于无源跨场景高光谱图像分类
提出拓扑感知无源学习框架,结合熵动量伪标签与邻域拓扑,无需源数据实现跨场景高光谱分类最优性能。