TerraMind:用于地球观测的大规模生成式多模态模型
TerraMind是首个融合token与像素级双重表示的地球观测多模态基础模型,实现零样本/少样本应用并超越SOTA。
GenTrack:新一代多目标跟踪方法
提出GenTrack多目标跟踪法,采用混合策略、粒子群优化及社交交互,性能领先,代码已开源。
通过正则化微调实现3D视觉语言模型的域泛化适应
提出ReFine3D框架,结合选择性层调优与正则化策略,提升3D多模态模型域泛化能力,性能提升显著且计算开销小。
面向独立书写者的离线签名验证的原型签名方法
提出基于原型签名的数据驱动策略,生成多样负样本,提升离线签名验证中熟练伪造检测能力,且与架构无关,结合线性SVM提高效率。
推理即交集:视频多模态大模型中视觉关注的共识帧对齐
提出无需时间标注的共识帧奖励框架,通过视频内在线索对齐模型焦点,提升视频推理性能。
数据强制蒸馏:恢复少步视频生成中的多样性与保真度
提出数据强制蒸馏(DFD),通过教师评分差异引导分布,一行代码微调即可恢复多样性和保真度。
预算感知的自适应对抗补丁用于黑盒目标检测
提出查询高效、预算自适应的黑盒攻击,结合汤普森采样与NES更新,动态调整补丁大小,经严格平图测试,在CNN和Transformer检测器上有效。
Vines-DB:一个用于多物种观赏藤本植物分割的RGB图像数据集
Vines-DB数据集含1218张原始RGB图像,7种观赏藤本,手工标注,增强至2307张,用于多类实例分割。
人脸呈现攻击检测中的架构偏差:视觉Transformer与卷积神经网络的比较研究
预训练视觉Transformer在面部防伪检测中更准确、公平,种族差异减83%,泛化能力提升3.6倍。
CAOA:补全辅助下的物体-CAD对齐
提出结合语义点云补全与对称感知位姿估计的CAOA方法,在Scan2CAD上精度提升17%。
神经相位相关
提出学习基的相位相关泛化,突破固定基限制,适用于非刚性形变与量子动力学,医学图像配准表现优异。
RegimeVGGT:面向视觉几何基础Transformer的逐层空间保持冗余去除方法
RegimeVGGT通过逐层U型双轴压缩实现无训练加速,在匹配重建质量下对VGGT*提速6.7倍。
基于CIFAR-10数据集的神经网络图像分类实验分析
CIFAR-10上神经网络图像分类实验,验证准确率74.77%,验证损失中途上升,体现表示学习与记忆差异。
Bridging Creative Intent and Visual Quality: Creator-Driven Recurrent Video Generation with Agentic Feedback Loops
多模态超图融合用于低光人群计数
提出多模态超图融合与可变形稀疏注意力的LCNet,在三个低光基准上超越现有方法。
基于补丁级自监督学习和扩展互惠重排序的空中-地面LiDAR位置识别
提出补丁级自监督学习与扩展互惠重排序框架,解决空中-地面LiDAR位置识别域差距与误报,显著提升检索性能。
ICRA 2026 GOOSE 2D细粒度语义分割挑战赛技术报告:利用DINOv3实现野外机器人中的鲁棒户外场景理解
采用DINOv3 ViT-L/16骨干、ViT-Adapter和Mask2Former,结合多尺度测试增强与模型集成,以76.57%复合分获ICRA 2026 GOOSE挑战赛第一名。
面向基于知识的新闻图像描述的分层多模态检索方法
本文提出分层多模态检索增强框架,利用外部知识生成新闻图像深度描述,在EVENTA挑战赛获第5名。
重新思考文本到图像作为室内场景识别的语义感知数据增强
利用Stable Diffusion生成室内场景合成图像增强训练,DIRE方法可100%识别生成图像。
伪造灾情:扩散时代跨域合成灾难检测基准
扩散模型生成逼真假图难辨,现有检测器泛化差(准确率降50%),亟需跨域无关检测方法。
MolmoMotion:基于语言指令的3D点轨迹预测
提出3D点轨迹预测任务,构建数据集与基准,模型支持自回归和流匹配,优于基线,可迁移至机器人操作和视频生成。
APT:面向因果视频语言理解的原子物理转换
提出原子物理转换(APT)作为因果监督信号,通过APT-Tune提升VLM对物理转换的检测与视频理解。
Hallucination Detection and Correction in Medical VLMs via Counter-Evidence Verification
LandslideAgent with Multimodal LandslideBench: A Domain-Rule-Augmented Agent for Autonomous Landslide Identification and Analysis
UniTemp: 通过双向蒸馏解锁任意时间顺序的视频生成
提出UniTemp双向蒸馏框架,支持任意方向视频生成,解决因果VAE限制,实现双向扩展与插帧等灵活工作流。
用于高效低能耗图像恢复的脉冲金字塔小波变换
提出脉冲金字塔小波模型,通过双金字塔小波块降低计算能耗,保持图像质量,展现SNN在图像恢复的潜力。
基于场景线索的内在4D高斯分割
提出Intrinsic-GS,无需掩码训练,利用高斯自身特征实现动态场景分割,性能优异且速度快。
超越多样性:将视觉令牌剪枝视为子空间重建以实现高效视觉语言模型
SPARE方法通过子空间重建与反相关性选择,实现视觉令牌高效剪枝,性能领先。
基于热核先验的流形变分学习
提出流形锚定变分框架,用几何感知EM确保原型在数据流形上,在MRI基准上取得最高准确率和稳定性。
BrainFusionNet:一种深度学习与可解释AI模型,理解MRI图像的局部、全局和序列特征以改进脑肿瘤检测
BrainFusionNet混合CNN、ViT和GRU,结合可解释AI,在MRI脑肿瘤分类中达98%准确率,有效提取局部与全局特征。
面向异构雷达位置识别的空间分层蒸馏
提出空间分层蒸馏,通过非对称对齐实现异构雷达位置识别,在动态序列上取得最优结果。
基于先进深度学习模型的多类脑肿瘤分类:一项比较研究
EfficientNetB0在MRI脑肿瘤分类中准确率最高(95%),脑膜瘤召回率从20%提升至89%,表明架构效率优于深度。
PEFT-MedSAM:面向可解释皮肤病变分割的医学基础模型高效微调
提出PEFT-MedSAM,仅微调解码器实现高精度皮肤病变分割,Dice达0.94以上,兼具可解释性。
SMART:基于高分辨率成像数据的灵活、可解释、可扩展时空脑图谱
SMART框架解耦疾病动态与个体解剖,用微分方程和神经细胞自动机构建可解释时空图谱,预测精度领先。
HandwritingAgent:可缩放矢量空间中的语言驱动手写合成
HandwritingAgent通过语言和参考图像直接合成SVG手写序列,无需风格训练,性能超越当前最优模型。
SAMA:面向统一低资源多模态信息抽取的语义锚定对齐增强方法
提出SAMA框架,通过语义锚引导多模态大模型生成高保真合成数据,经双约束过滤,在低资源任务中显著提升性能。
SpectralDiT:针对流匹配DiT的时间步条件谱残差校正
SpectralDiT在DiT残差分支添加时间步条件谱分解校正,零初始门控,以0.6%额外FLOPs实现FID降低8.7%。
重新思考表格结构识别中的指针损失:面向空间局部性的几何感知指针损失
提出几何感知指针损失,加权邻近细胞梯度,减少相邻错误,实现表格结构识别新最优。
临床对齐的几何约束用于鲁棒的IVUS血管边界分割
GeoCat利用几何一致性损失和双编码器,IVUS分割Dice达0.93,边界误差0.14mm,几何误差小,支持可靠斑块量化。
SCR引导的难度感知优化用于红外小目标检测
提出REEM框架,利用信杂比调制损失,增强低可见性目标检测,提升IoU和检测率,降低虚警。
基于UDF的点云重建的学习半径估计
提出学习半径选择器,离线训练预测连续支撑半径,提升UDF点云重建细尺度精度。
面向无训练零样本三维医学图像异常检测:一种基于批处理的二维基础模型方法
提出CS3F,用2D基础模型实现无训练3D医学图像零样本异常检测,通过跨主体相似性评分定位异常。
从边界框到视觉推理:用于视觉语言模型的在线策略数据标注工具
ScreenAnnotator开源工具通过在线策略标注与贝叶斯验证,实现近100%接受率,VLM准确率提升35.1%。
使用轨迹对齐时间无关流的光学相干断层扫描测试时适应
提出流匹配测试时自适应,通过直方图匹配和移除时间条件,实现OCT图像去噪,AMD分割达最优。
模糊几何分支点建模用于结构感知的手写汉字增强
提出模糊几何驱动的结构感知增强框架,建模分支点模糊集,鲁棒解耦笔画,显著降低手写汉字识别错误率。
DreamReg:基于信念驱动的世界模型实现2D-3D超声配准
DreamReg利用信念驱动的世界模型,通过内部想象模拟探头运动,实现鲁棒且高精度的实时2D-3D超声配准。
他们要去哪里?基于自我视角视频的多模态行人运动建模
提出MMPM框架,基于行人过街行为分离建模多模态轨迹,在PIE/JAAD上超越基线。
重新思考空-地协作:渐进式跨任务基准与社会化学习框架
提出AGPC基准与SCP框架,通过粗到细的任务条件协作,在异构空-地感知中实现3.73%协同增益和7.86%性能提升。
基于对抗模型的医学图像分割不确定性量化
提出QUAM-SM框架,用对抗搜索识别脆弱像素,区分认知与偶然不确定性,提升分割可靠性和边界敏感性。
学习扭曲:前列腺DWI校正的弱监督图像质量迁移
提出弱监督图像质量迁移框架,利用IQA信号和原型流匹配生成真实失真,实现前列腺DWI校正,优于现有方法。