域偏移下鲁棒脑MRI分割的置信度校准正则化
提出CalSAM框架,仅微调SAM解码器,用特征Fisher信息惩罚和置信度失配惩罚抑制域偏移与过度自信,提升脑MRI分割精度和校准。
评估深度嵌入在荷兰森林清查中树种分类的有效性
荷兰森林清查中深度嵌入优于手工特征,准确率提升七至九个百分点,宏F1提升十七点,适用数据有限场景。
CityRiSE:通过强化学习在大型视觉语言模型中推理城市社会经济状态
提出基于强化学习的城市社会经济推理框架,提升预测准确性与泛化能力。
探索面向可解释图像质量评估的指令数据质量
针对可解释图像质量评估,提出基于聚类的数据选择法,仅用10%数据即可达到全量微调性能。
深入级联不稳定性:图像恢复与目标检测协同的Lipschitz连续性视角
恢复与检测功能失配引发级联不稳定;提出Lipschitz正则化检测,融合恢复与检测,提升稳定性和精度。
EvDiff:使用单步扩散模型的基于事件的视频重建
EvDiff采用代理训练和单步扩散,无需配对数据,从单色事件流生成高质量彩色视频,保真度和感知指标均优于现有方法。
GeoUniPR:一种几何一致性的跨模态地点识别统一框架
提出几何一致的统一框架GeoUniPR,将激光雷达点云投影成深度图,融合强度与法向信息,用双ViT编码器高效训练,并设计空间一致对比损失,在跨模态地点识别中达到SOTA。
SegPAR:面向语义分割的类中心决策式稀疏攻击
提出类中心决策式稀疏攻击SegPAR,采用新差异奖励,提升稀疏效率与MIoU下降,媲美白盒。
CLEAR:基于结构化采样的类别级专家聚合用于长尾分类
提出CLEAR框架,用结构化采样生成专家,按类别可信度聚合,提升长尾分类及少样本性能。
低倍率荧光成像用于乳腺癌切缘检测的临床可行性:基于纹理分析与深度学习
4x与10x放大MUSE图像诊断性能相当,深度学习和纹理分析均达高准确率,低倍率视野更大、成像更快,可用于术中切缘评估。
代码与图像推理的自我进化
让模型用代码执行视觉算法,并通过自我反思进化技能,显著提升推理准确率。
唐诗基准:面向诗转图生成的多维评测基准与基于评分标准的评估器
提出唐诗图像生成多维基准(十维人工标注)及评估器PAE,媲美Claude,可扩展至新图。
基于概念的任意场景注视目标估计
提出概念驱动的可提示注视目标估计任务,构建数据集Gaze-Co与模型GazeAnywhere,实现端到端估计并达到最优性能。
用于临床文本引导医学图像分割的双域跨模态解码
提出DD-CMD双域跨模态解码,结合空间注意与频谱调制,用于临床文本引导肺部感染分割,性能显著提升。
视觉语言模型在水下图像重建系统评估中获胜
提出系统评估方法,从准确性、一致性、水参数效应评估水下重建;视觉语言模型显著优于物理模型。
COGENT:容积医学图像的反事实高斯解释
提出COGENT框架,在高斯参数空间进行反事实优化,为容积医学图像生成稀疏、局部且保持解剖一致的解释。
高斯元空间增强用于多模态IPMN风险分层中的堆叠集成
胰腺癌风险分层中,提出cUPMI方法增强堆叠集成,对高容量树模型效果稳定,融合影像组学与2.5D CNN达最佳预测性能。
手部可见性检测器:逐关键点可见性估计
首次将手部关节可见性估计作为独立任务,利用预训练姿态模型提升精度,并用于多视角三角测量降误差。
以梵高之眼:基于扩散模型的全局风格迁移
提出全局风格迁移(GST),多对一聚合艺术家作品,在扩散模型隐空间学习风格偏移,兼顾内容对齐,实现高保真风格化。
多智能体目标存在性验证与学习式掩膜几何细化:2026年第八届LSVOS挑战赛MeViS-Text赛道冠军报告
提出多智能体协同验证目标存在性,辅以风格细化掩膜,破解误导性无目标表达式,勇夺MeViS-Text赛道冠军。
由矩阵谱分解导出的新型正交多小波滤波器
利用快速鲍尔法构造两种超紧支撑正交多小波,具正交与对称性,图像压缩去噪中SSIM等指标优于现有滤波器。
生成式语义分割:可观测语义-图像接口与层次化生成器证据对齐
提出语义棱镜框架,用单步生成渲染语义图,结合类颜色码本与层次特征对齐,Cityscapes达72.07% mIoU,并改进像素误差排序。
从合成到去除:基于物理的反射模拟与扩散视频去反射
提出闭环框架,物理模拟反射视频数据,训练扩散模型单步去反射,并建立首个基准,性能领先且推理更快。
利用层次化监督复用基于RGB的基础模型实现热图像深度估计
提出RGB-HS框架,利用RGB基础模型的分层监督对齐多级特征,实现热图像深度估计,性能优越。
面向安全关键驾驶中威胁感知控制的语言结构化关系Q学习
语言结构化关系Q学习提升威胁感知但未转化为自适应控制,存在识别-控制鸿沟。
大型视觉-语言模型中的测试时幻觉调控
提出免训练TTH:零样本多模态分类器生成辅助logits,熵加权融合,抑制LVLM对象幻觉。
Hybrid-LUT:通道感知的混合查找表与滤波实现高效图像去噪
提出Hybrid-LUT,Y通道用LUT恢复纹理,UV通道滤波保持色彩;存储降2/3,421KB达最优,真实数据CPSNR提升0.63dB。
基于分层引用的生成式视频压缩
提出分层引用生成式视频压缩GVCHR,利用分层参考与注意力减少伪影,显著提升压缩效率和视觉质量。
ProtoHGF-Net:面向RGBT目标检测的原型超图融合与模态内校准
提出原型超图融合网络,结合教师掩码校准抑制背景干扰,在多个数据集上取得最优性能。
用于蚊媒疾病检测的视觉Transformer与门控循环单元混合框架
ViT+ConvGRU框架用于蚊媒疾病检测,准确率88.88%,优于RNN/LSTM/GRU。
驾驶世界模型如何进行反事实预测?
驾驶世界模型做反事实预测时,直接动作条件预测未利用事实延续导致失败;简单免训练方法可显著提升效果。
面向手术器械实例分割的拓扑感知查询选择
拓扑感知查询选择将手术器械实例分割视为关系型集合问题,源域F1提升、失败率降低,跨域迁移不稳定。
CAM引导的显著性裁剪与基于图像的恶意软件分类
测试HiResCAM引导裁剪,对比随机、高低显著性裁剪,发现恶意软件图像裁剪无效,自然图像低显著性裁剪略有效。
KANResDiff:通过Kolmogorov-Arnold网络学习局部残差扩散用于模糊医学图像分割
提出KANResDiff,用KAN学习局部残差扩散,分阶段建模模糊性,指标SOTA。
隐身斗篷:实时隐私保护的体积视频流
针对体积视频流隐私泄露,提出隐形流,用目标检测与深度掩码,跨视图传播决策,仅融合净化点云,实时隐私保护。
AI艺术检测器在生成器变化下的鲁棒性
人工智能艺术检测器在生成器变化下泛化不足,常将新图像误判为人类,CLIP模型效果最佳,但差距显著,需分层防御。
运动即提示:利用运动引导的跨帧视觉提示增强多模态大语言模型的运动推理
提出运动即提示框架,跨帧轨迹标记增强运动推理,无需训练,两基准分别提升4.2%与8.9%
Zero-OVCD:桥接免训练基础模型与伪标签学习的开放词汇变化检测
提出Zero-OVCD两阶段框架,无需像素级标注,结合掩膜细化与噪声抑制生成伪标签,训练检测器,显著提升开放词汇变化检测精度。
让每一步都算数:成像逆问题的时空信息分配
提出频谱自适应调度与测量优先注意力,无需训练平衡时空信息分配,提升图像复原质量。
从多模态伪标签中学习以实现稳健的开放词汇实例与全景分割
提出多模态伪标签框架,结合CLIP和GPT增强视觉-文本对齐,显著提升开放词汇实例与全景分割性能。
STAR: 面向可泛化三维场景理解的空间-拓扑感知路由框架
提出空间-拓扑感知路由框架STAR,结合自监督预训练与动态专家分配,解决跨传感器拓扑差异,提升室内外3D场景理解性能。
推进MLLM无人机图像理解与推理:基准与免训练多智能体系统
构建UAVQA-Bench基准,提出免训练多智能体系统UAV-MAS,32B模型准确率77.0%,超Gemini 3 Pro达4%,8B版提升8.7%。
解字:大规模专家审核的古文字训诂数据集与基准
构建古文字训诂VQA数据集及基准,含50万问答对;现有模型在字形、语义、历时分析上不足,微调后全面提升。
商业猪舍环境中边界增强的猪只点云分割
提出边界增强猪点云分割法,用八叉树变换器融合多尺度特征,软距离监督加双向跨边界语义模块缓解粘连,提升精度。
EGM-Det:面向无人机RGB-IR目标检测的熵引导多模态自适应融合
熵引导自适应融合EGM-Det,门控+蒸馏助RGB-IR检测,三基准SOTA,VEDAI涨超10%
LiveAnimate:实时稳定的长时流式人体动画
实时流式人体动画系统,基于140亿视频扩散模型,检索式缓存,双卡19.63 FPS,三分钟质量稳定。
榛子X射线图像自动二分类:质量评估的深度学习基准
榛子X光图像二分类基准:最优集成模型平衡精度86.3%;多划分评估与标签精修对小型不平衡数据至关重要。
视觉模型能否读懂雷达显示屏?——雷达图像用于空中交通复杂度估计的可行性研究
视觉变换器可从雷达图像回归交通复杂度,准确率高,且扰动响应与飞机贡献一致,证明雷达图像可行。
UniSwap:说话视频的流式音视频身份替换
首个流式音视频身份替换框架,用统一扩散变换器同步换脸换声,保留内容动态,支持长视频稳定生成。
双模态提示扩散先验用于零样本高光谱全色锐化
提出双模态提示扩散模型,融合低分辨率高光谱与全色提示,加全色引导正则化,零样本高光谱全色锐化性能最优。