视觉语言模型对农业的了解超出其表现,基于评分标准的验证可弥合差距
构建116个数据集基准,线性探测显示VLM视觉编码器已编码农业特征;以任务评分标准引导测试时推理与PPT验证,F1近乎翻倍。
LeCor:通过元学习测试时训练学习被纠正,用于交互式三维肺肿瘤分割
LeCor将纠正视为训练信号,对逐例重置的适配器做元学习测试时训练,单步梯度即改善未点击切片,七轮Dice升至0.827。
脊髓多发性硬化病灶的纵向追踪:一项验证研究
比较五种脊髓多发性硬化病灶纵向追踪策略,基于配准的重叠法最佳,并首次系统评估实例对应。
从噪声视图图学习全局相机位姿用于运动恢复结构
用置换等变图神经网络从噪声相对位姿回归全局一致相机外参,无需监督,全局SfM框架可扩展至千张图像。
Infra-Bench CLS:面向关键基础设施分类的全球开源基准——基于地球观测基础模型
全球开源基准Infra-Bench CLS覆盖七大洲13类关键设施,评测七种地球观测基础模型,最优F1达57.9%,电力类表现偏弱。
面向视觉语言模型的固定词元基低秩提示学习
将提示矩阵低秩分解并固定词元基,仅训练嵌入系数,参数更少且性能匹配或优于CoOp。
AnimalLift:通过学习规范形状、纹理与毛发贴图从单张图像重建可动画的3D动物
AnimalLift 由单图重建统一拓扑的可动画3D动物,联合预测几何、纹理与UV对齐毛发贴图。
RoMa-Ω:前馈3D模型对图像匹配了解多少?
前馈3D模型零样本匹配弱但特征强;以VGGT-Ω替换DINO重训RoMa得RoMa-Ω,多基准超越SOTA。
MethaneFuse:基于多传感器卫星观测学习的甲烷羽流检测
提出MethaneFuse,可从部分可用的异构多传感器观测中学习,甲烷羽流检测F1与AUROC显著提升。
RouteBridge:神经辐射场与3D高斯泼溅之间基于可靠性路由的双向蒸馏
提出RouteBridge,按射线可靠性在NeRF与3DGS间双向路由蒸馏,自适应选教师或弃权,3DGS导出提升1.56dB至28.77dB。
基于单幅图像和散焦深度的无标记视线估计
仅用单张2D图,结合虹膜定位与散焦深度估计头姿,无需标记;以变分贝叶斯逻辑回归映射8维特征到注视点。
LightMedSeg-ISLES:参数量比 nnU-Net 少 81 倍的中风病灶分割
提出126万参数轻量分割流程,Dice达nnU-Net的97.5%,病灶F1更高,FLOPs少4.7倍。
在单目步态分析中使用时间插值从缺失关键点恢复生物力学信号
缺踝关键点时膝角误差达23.4°,时间插值降至1.1°,恢复方差与平滑度,无需学习模型。
面向遥感影像开放世界目标检测的双曲几何
提出HyRS-OWOD,用双曲几何建模类别层级,改进未知发现与增量学习,提升遥感开放世界检测性能。
IAE-VTG:交互对齐的动作-实体视频时序定位
提出IAE-VTG,在表征与训练分配层面联合建模动作-实体交互,提升视频时序定位精度。
VFNet:面向气液两相流空隙率估计的多视角时空模型
提出双分支时空网络VFNet,利用同步多视角视频估计气液两相流空隙率,性能优于基线并提升流型分类。
基于语义一致性学习的跨物种动物重识别
提出语义一致性学习,稳定跨物种动物重识别表征并保持共享语义结构,在11个数据集上优于现有方法并泛化新物种。
蒸馏图像原型用于引导式测试时自适应
提出DIPTTA框架,用蒸馏图像原型动态锚定源知识,实现特征回放与源校准不确定性估计,抑制错误累积与遗忘。
空间遮挡下的步态冻结预测:一种IMU监督的跨模态蒸馏方法
跨模态蒸馏框架以IMU监督视觉模型,双流融合骨骼与像素抗遮挡,实现零穿戴设备的精准步态冻结预测。
面向卷积神经网络的逐层可调提升方案
提出面向CNN的逐层可调提升小波方案,含低通、高通和顺序策略,保证可逆稳定,在分类和异常检测上提升。
LogiScope-VQA:面向工业场景物流危险识别的视觉语言模型基准测试
构建LogiScope-VQA基准,含2476图、2918视频和10274问答,评测视觉语言模型在物流危险识别中的感知、理解与推理,揭示其与人类差距。
能信任视频幻觉检测器吗?VidHalLoc:为评估“评估者”而设的基准
提出VidHalLoc基准,用2000个对抗样本统一评测视频幻觉检测,最佳方法准确率仅34.63%。
SkNeXt实现PB级显微数据的拓扑引导神经元重建
SkNeXt以拓扑为先,利用SWC骨架稀疏校对并按需读取图像,单GPU一周完成PB级脑数据重建。
从像素到层级序列:面向视觉语言二值变化检测的四叉树掩码编码
QUAKE-CD将二值变化掩码编码为语法约束的四叉树序列,实现可验证的结构化生成,在QUAKE-CoT上F1达78.31%。
基于潜在桥匹配的反照率估计
提出基于潜在桥匹配的反照率估计法,以像素重建损失保证物理一致性,推理成本低、泛化性强。
预训练与蒸馏比架构类型更重要:面向无标记单细胞分类
无标记单细胞分类中,预训练与蒸馏比架构选择更关键;预训练提升性能,蒸馏小模型可超越更大教师。
CLFTv2:基于层次化特征金字塔的高效相机-激光雷达融合语义分割
CLFTv2以Swin多尺度编码器与轻量FPN解码器替代全局ViT注意力,提升分割精度与效率。
StreetDiff:基于结构提示的跨视图一致多视图稳定扩散实现多视图街景生成
提出StreetDiff多视图扩散框架,用全景对齐与结构提示保证跨视图一致,并构建街景数据集。
基于类别自适应模态融合与情感几何的对话多模态情感识别
通过几何增强视觉表示、类别自适应模态融合与效价-唤醒先验,提升对话情感识别性能。
SA-Profile:基于超分辨率MRI的自动滑车沟角轮廓分析
提出自动框架,融合多方位MRI超分辨重建,连续测量滑车沟角,误差11.6°,可刻画滑车发育不良。
Vague2Detect:基于知识的开放世界检测中模糊提示的处理
结合微调Sentence-BERT检索知识库、YOLO-World验证与LLM动态扩展,将模糊提示成功率从32%提升至61%,最高85%。
解析文生图扩散模型中的对象依赖概念脆弱性
识别文生图扩散模型的对象依赖概念脆弱性,用稀疏自编码器审计去噪轨迹,并在推理时校正,提升概念一致性。
让字幕接受考验:通过多项选择题问答评估视频字幕质量
提出CapQuiz,以视频多选题问答评估字幕信息保真度,涵盖10类问题24个领域,与人工判断更一致。
从少样本分割到临床医生在环的医学图像分析
将少样本医学图像分割重构为临床医生在环的序贯决策:仅在预期降低临床风险时才动用稀缺的专家交互预算。
什么使对抗样本能在深度伪造检测器之间迁移?
60个检测器实验表明,源与目标共享骨干、预训练或训练数据会提升对抗迁移性,多源融合攻击成功率远高于单源平均。
Elastoformer:通过弹性模型变换实现动态自适应
将常规网络转为可实时弹性推理的单一模型,运行时切换多模式,最高降85%计算、50%延迟、76%内存。
超越相似性:基础模型作为免训练组合视频检索的高效骨干
免训练组合视频检索框架:冻结基础模型互补,按查询难度自适应推理,兼顾可扩展与细粒度推理,达SOTA。
LinearMask-GS:面向紧凑3D高斯泼溅的稳定掩码重要性剪枝
LinearMask-GS用线性增量激活替代Gumbel-Sigmoid,稳定掩码排序,实现紧凑3DGS,大幅减少高斯并保持或提升渲染质量。
面向鲁棒视觉语言编码器的各向同性嵌入扰动
提出Aether:在嵌入空间用α混合施加各向同性扩散扰动,语义一致的轻量正则,显著提升视觉语言编码器性能。
当融合失效:面向多模态医学图像分割的损坏感知再平衡融合
揭示退化模态特征损坏干扰融合,提出CoReFuse-Med抑制损坏、再平衡模态贡献,提升分割精度与鲁棒性。
面向流式说话人头生成的解耦自强迫蒸馏
音频融入身份解耦低维运动空间,小因果模型生成运动潜变量并经扩散渲染;解耦自强迫蒸馏令两模型并行流式,15.4 FPS、1.3秒延迟、质量无损。
ScopeMamba-YOLO:面向遥感影像小目标检测的内外感知范围拓宽
提出ScopeMamba-YOLO,以离路零门控选择性扫描解耦上下文与卷积,配合CGCM、SS-PAN等提升遥感小目标检测,VisDrone上mAP50达52.6%。
FreqFLD:基于频率调制实现一体化人脸关键点检测
FreqFLD以频率调制与频率感知专家混合,提升复杂场景下跨数据集人脸关键点检测泛化。
TransGaze-Object:真实驾驶场景下基于Transformer的驾驶员注视对象预测框架
提出基于Transformer的端到端框架,直接预测驾驶员注视对象;构建UD-FSG数据集,准确率达60%,优于PoG关联的51%。
TRACE:面向高效GUI智能体的轨迹鲁棒准入与证据排序
TRACE免训练,用轨迹鲁棒证据排序与覆盖保留剪枝GUI视觉token,并单调收缩KV,降低推理开销。
真实世界与临床环境人体运动挑战赛(MoCha)@ECCV2026 第三名方案:面向域泛化UPDRS步态严重程度估计的语言对齐运动表征
提出语言对齐运动表征与域模型合并,在MoCha未见站点获第三,Macro-F1达0.57。
SynThermFace:通过合成数据生成扩增有限配对数据用于可见光-热红外人脸识别
SynThermFace借助扩散模型将少量真实可见光-热红外配对扩增为大规模合成配对,训练跨谱人脸识别模型,推理仅需单次前向。
UOT-Gap:基于非平衡最优传输的视觉语言模型模态差距变分原理
免训练UOT-Gap以非平衡最优传输分解模态差距,成对残差追踪检索退化,评估字幕质量与对齐鲁棒性。
无坐标几何:LiDAR扩散作为三维特征桥梁
以LiDAR条件扩散模型桥接2D先验与3D点云,无坐标特征中自发形成结构化三维表示。
高光谱图像分类的降维方法
面向高光谱卫星图像监督分类,比较PCA、LDA降维及KNN、SVM、RF分类;真实数据中PCA+RF总体精度与Kappa最高。