GSO-Net:面向石化物流节点危险货物转运合规的视觉状态机
首个石化危险货物转运SOP视觉理解基准,含超5万帧、9步15态,揭示稀疏轮询下状态识别不足。
OphBiWSSD:以双向权重绑定状态空间对偶扩展眼科手术中的时序动作定位
提出OphBiWSSD,线性复杂度双向建模眼科手术时序依赖,OphNet上mAP超基线约6.7%。
面向低重叠场景的谱一致性引导多视图点云配准
提出谱一致性引导框架GMPCR,筛选可靠对应与扫描对,构建稀疏位姿图并自适应同步,低重叠配准高效鲁棒。
EgoMaize:严重田间遮挡下的第一人称玉米实例分割基准
发布EgoMaize第一人称玉米实例分割基准,采用证据封闭标注应对严重同类遮挡;基线难以兼顾细结构恢复、实例归属与遮挡推理。
融合3D磁共振成像与临床数据的阿尔茨海默病诊断多模态可解释深度学习框架
融合3D MRI与临床数据的可解释多模态深度学习框架,性能与解释随任务、模态、融合和队列变化,MMSE为跨队列主导特征。
DERA:面向违禁物品检测的分离式边缘残差适配
DERA融合层级特征与边缘金字塔,学边界先验注入早期视觉,仅14.7K参数,AP提升3.1/1.6/2.4。
Earth-Agent-Pro:迈向真实世界全链路地球观测的智能体
提出执行自适应规划-执行框架,结合专家技能与结构化记忆,实现开放世界全链路地球观测,并发布Earth-Bench-Pro基准。
面向可控裂缝数据合成的端到端自动化流水线
端到端自动化流水线:贝塞尔骨架结合GAN生成裂缝掩码,双ControlNet扩散解耦外观与几何控制,实现可控裂缝合成。
桥接视觉基础模型先验与CLIP:面向医学图像的空间感知小样本异常检测
提出Spatial-FAD,融合VFM空间先验与CLIP语义,提升小样本医学异常检测与病灶定位。
RoES:面向多模态图像的旋转等变选择性频率融合
提出RoES旋转等变选择性频率融合网络,动态解耦高低频并双分支处理,融合与检测均达SOTA。
面向3D场景理解的分区不变微调
提出PointPiT,面向场景点云的分区不变微调,以不足1%参数媲美全量微调。
LettuceVisSim:一种为基于视觉的强化学习生成生菜图像时间序列的模拟器
LettuceVisSim 生菜生长模拟器可生成带标注的作物图像时间序列,支持设施农业中基于视觉的强化学习决策。
ChitraMiti:孟加拉语几何推理中的视觉定位与模态依赖基准评测
提出孟加拉语几何基准ChitraMiti,发现VLM仅凭文本描述即可媲美图文输入,跨模态验证薄弱。
PhysioAI:临床知识引导的语义监督用于基于骨架的物理治疗动作识别
提出PhysioAI,将结构化临床知识经CLIP编码为语义锚点,训练时监督骨架动作识别,推理仅需骨架,多个康复数据集精度领先。
一种技能并非万能:长视频问答中帧选择技能的自动发现与分类引导路由
提出AutoSkill,自动发现并路由帧选择技能,无需目标视频和答案,在五个长视频基准上提升性能。
面向无人机建筑立面异常筛查的对齐式辐射RGB-热红外融合
提出RGB-热辐射配准与有符号局部对比编码,构建M3T数据集;分层缺陷检测提升,整体精度未超RGB。
SCORE:面向服装混合终身行人重识别的子分布感知协同知识强化
提出SCORE框架,用自适应子分布建模与协同知识强化缓解灾难性遗忘,实现最优性能。
语义对齐的梯度驱动上下文保持图像编辑
提出IABEdit,将可微语义验证嵌入训练,用冻结VLM描述残差的梯度引导编辑,无推理开销。
RelateAnything:从任意输入实时进行开放词汇关系预测
53M参数模型RelateAnything,从任意图像与区域实时预测开放词汇关系,20ms/帧,跨域与零样本大幅超越同类及3B VLM。
KAD-Net:面向单张深度图像鲁棒3D手部姿态估计的运动学感知解耦学习
提出KAD-Net,通过手指拓扑约束增强远端关节表示,并解耦2D定位与深度估计以减少干扰,在多个基准上实现最优3D手部姿态估计。
DRS-VPT:使用视觉点 Transformer 直接在扫描中重定位
提出前馈 Transformer DRS-VPT,实现图像到扫描配准,统一相机-LiDAR 标定与室内重定位,性能领先且零样本迁移强。
基于多模态内容与真实世界证据的虚假新闻短视频检测与解释
提出NVKE-CEI,以视觉-OCR相似度变化选关键帧,融合内容与证据双LLM,检测虚假短视频并解释
超越模糊视觉线索:研究深度伪造视频中的生理扰动与跨模态不一致性
基于真实rPPG构建高保真伪造,提出双向协同注意力融合rPPG与面部行为,检测深度伪造并验证跨域迁移。
NOVA-GS:面向低光照新视角合成的噪声感知视角一致高斯泼溅
NOVA-GS统一低光增强、去噪与几何优化,无需SfM/配对监督,提升新视角合成的鲁棒性与一致性。
RA-SOD:模态退化下的可靠性感知RGB-T显著目标检测
提出可靠性感知框架RA-SOD,建模模态可靠性并融入特征学习与跨模态融合,抗模态退化,四基准达SOTA。
面向视网膜血管分割的超广角扫频源OCTA数据集与极坐标门控Mamba网络
发布首个公开超广角扫频源OCTA视网膜血管分割数据集WOIVES,并提出PG-Mamba网络,分割及血管定量指标优于七种方法。
同一个编码器,不同的赢家:面向细胞绘画编码器评估的配对视图框架
提出CP-BG-Bench配对视图框架,揭示细胞绘画编码器排名随协议而异,差异可沿三轴解读。
CoralscapesV2:珊瑚礁全景与细粒度视觉场景理解
该数据集将珊瑚礁分割类别扩至95个细粒度类,含6.5万鱼实例掩码,为首个珊瑚礁全景分割数据集,助力礁区监测。
ExpertHTR:基于多任务学习与稀疏专家混合的统一手写文本识别
提出ExpertHTR统一框架,以多任务互补监督和稀疏专家混合,提升多源手写文本识别性能。
GRACE:扩散模型中几何引导保留的自适应概念擦除
GRACE以语义加权子空间与自动安全锚机制,实现扩散模型局部自适应概念擦除,兼顾擦除效果与生成保真。
多模态户型图编码:学习稠密的模态不变表示
MMFE将多种二维户型表示映射到共享稠密隐网格,以逐格InfoNCE对齐跨模态,提升匹配、对齐与检索。
基于AquaCubeAI的Φsat-2星上浊度监测
提出轻量级AquaCubeAI模型,在Φsat-2星上由多光谱影像直接反演近岸水体浊度,显著降低响应时延,并验证了低功耗VPU部署的可行性。
面向长视频理解的在线视频智能体框架
提出在线视频智能体框架VideoXAgent,按需调用专家工具聚合证据,提升长视频理解。
LGFN:面向伪装目标检测的轻量级门控RGB-偏振融合与模态可用性调节。
提出LGFN轻量门控RGB-偏振融合框架,按偏振可用性路由,提升伪装目标检测精度并大幅降参降耗。
LG-PF:轻量级置信度引导的偏振图像融合
提出轻量级置信引导偏振融合框架LG-PF,选择性迁移可靠偏振信息并抑制不可靠响应,仅0.29M参数即在六项指标上最优。
SCDM:基于差分推理的空间-上下文解耦 Mamba,用于高效图像分类。
提出SCDM双分支差分Mamba,解耦病灶与正常解剖,以更少参数和计算实现高效分类。
数据稀缺时,自监督预训练最能助力视网膜疾病进展建模
纵向数据稀缺时,冻结自监督编码器加轻量生存头最有效;迁移由自监督目标而非规模/领域匹配决定。
HemaHier:面向谱系感知骨髓细胞学的链条件序数层级
提出HemaHier序数层级预测头,借链条件成熟度评分耦合细类与谱系预测,减少严重生物学错误。
基于新多中心数据集的阴道镜CIN分级与Swede评分预测双交叉注意力框架
提出双交叉注意力框架,基于新建多中心数据集,预测阴道镜CIN分级与Swede评分,性能优于现有方法。
Pre-Trained Low-Rank Tensor Decomposition for Multi-Dimensional Image Recovery
通过效价-唤醒度锚定的强化学习平衡图像生成中的情感对齐与语义一致性
提出VA锚定Flow-GRPO,用CLIP-VA奖励与中性语义锚,平衡情感对齐与语义一致。
超越精度:面向可靠生物医学图像分割的不确定性引导边界细化
提出RABR-Net,以不确定性引导门控残差细化边界,显著提升边界Dice与HD95,增强分割可靠性。
MGAvatar:面向头部化身几何与外观建模的网格绑定高斯
提出网格-高斯混合表示,以顶点绑定与面绑定两种模式分阶段建模头部几何与外观,实现高保真头像渲染。
标签噪声下的手语识别学习:面向孤立词与连续场景的噪声鲁棒损失研究
手语识别标签噪声下,SCE/GCE在孤立词任务优于CE但稳定性差;连续任务无增益,辅助权重效应混淆。
VideoTok4D:面向紧凑世界表示的4D感知视频分词器
提出4D感知视频分词器VideoTok4D,通过时空解耦与轨迹动态注意力,实现紧凑4D表示,存储大减且生成高效。
基于潜在布朗桥扩散的3D CT到PET转换
提出潜在布朗桥扩散两阶段3D CT到PET转换,VAE对比学习对齐,提升PET保真度与病灶代谢保留。
TileNet:面向平屋顶自主无人机系统巡检的基于瓦片的CNN-SVM架构
提出瓦片式轻量CNN-SVM架构,无人机双高度实时巡检平屋顶,准确率达94.4%,优于GoogLeNet与AlexNet。
UniPart:面向具身交互的零样本语言驱动3D部件分割
UniPart以CLIP文本驱动3D Transformer,实现零样本开放词汇部件分割与真实抓取。
基于CNN-DNN架构的并行训练加速诊断模型开发
CNN-DNN并行训练提升新冠CT诊断效率,3D CNN训练时间最多缩短31倍,兼顾性能与速度。
输入分辨率至关重要:实时目标检测延迟
延迟建模为预处理、推理、后处理分布卷积,参数随分辨率变化;实验表明分辨率感知参数化拟合更优。