AAMBERS-UAV:面向UAV杂草稻分割的采集感知多模态骨干评估与排序
UAV分割常规划分高估泛化;采集暴露提升性能但模态排名依赖架构,需采用采集感知同测试评估。
GeoContext:视觉语言地理定位中的一个上下文阶梯与两种失败模式——盲目依赖用户提供的位置上下文及错误确认位置声明
提出GeoContext基准,含GeoHint与GeoVerify任务,揭示模型过度依赖位置提示、难以准确验证位置声明。
FACT:利用编译工具使用轨迹的AI生成图像检测取证智能体
提出FACT,自适应调用取证工具收集证据,经演化-蒸馏-精炼,在多个基准包括未见生成器上性能最佳。
UniFusion: 基于统一时空深度对齐的稀疏视角4D重建
提出统一时空深度对齐框架,无需前景分割,联合解决跨视角与时间不一致,提升动态高斯泼溅的4D重建质量。
面向域泛化分割的分层提示注入器
提出空间分层提示与分层提示注入器为每类添加区域级几何锚点并自适应注入以提升域泛化分割
MolParser-Mobile:面向大规模化学文献挖掘的超快速OCSR系统
提出AutoML优化的轻量级OCSR系统,仅9.98M参数,吞吐每秒1520分子,精度相当或更优。
GenPuzzle:图像生成模型的视觉推理基准测试
GenPuzzle要求图像模型保持状态并逻辑求解,含2005道视觉推理题;最强模型仅达40.57%,暴露逻辑与几何缺陷。
CoRe-SAM3:面向SAM3裂缝分割的条件语义-视觉调和
基于语义与视觉差异,以语义为主、视觉生成条件残差校正分割,仅1.9万参数使交并比达70.5%、线相似度达89.2%。
利用高斯过程校正特征缓存加速扩散Transformer
提出高斯过程回归校正框架,利用残差零均值高斯特性与不确定性自适应策略,减少计算且提质。
PAI-Actor:动态场景中的电影级多角色替换
提出电影级多角色动画框架,在真实视频中替换动态角色,保持场景一致性与画质,实现高效长视频生成。
STAR-Pro:面向高效大型视觉语言模型的分阶段令牌自适应缩减与渐进式精炼
免训练两阶段视觉令牌缩减:先保留广泛特征覆盖,再用动态注意力渐进精炼,在激进压缩下保持性能并显著提速。
AVSplat:基于辅助视图预处理的密集视图前馈三维高斯泼溅
提出AVSplat,用辅助视图预处理和自适应体素融合,使性能随视图增多稳定提升,避免密集视图退化。
超越分类:结构化监督对齐医学语义与视觉证据
三种结构化监督均缓解ViT空间坍缩,图文对齐最优,聚焦真实病变,提升分类精度与可解释性。
FineHOI:面向零样本人-物交互检测的部件感知密集表示
FineHOI用密集部件特征与自适应注意力,改进空间建模,提升零样本人-物交互识别。
STP-BENCH:基于组织病理学图像的虚拟空间转录组学统一系统基准
提出该基准:含六种癌症、两类平台,评估二十一种预测法,统一编码会改变排名,已开源。
测试时弱到强对齐:将隐式奖励从弱流模型迁移到强流模型
提出AlignGraft,利用弱源对齐模型的速度差作为隐式奖励,在采样时引导冻结的强模型,无需奖励或梯度,即可跨尺度迁移对齐。
基于含噪单目深度估计与多点匹配的高效鲁棒、相机无关的多视图三维几何重建
高效鲁棒的相机无关三维重建,利用点间线性关系与多点匹配,可从含噪单目深度或弱透视估计,无需相机参数
ProtoRAG:用于少样本细粒度遥感目标检测的基于原型的检索增强
提出原型检索增强框架,解耦定位与识别,用判别式原型学习与不确定性引导推理,提升少样本细粒度遥感目标检测精度。
几何感知测试时学习用于定量空间推理
提出TTL-SR,利用几何一致性与未标注测试数据自适应模型,提升视觉语言模型空间推理精度,准确率分别提升6.47%和9.41%。
MORPHA:形态约束训练与低资源疟疾显微镜跨采集迁移的极限
提出形态一致性约束MORPHA,使二元分类跨采集泛化下降减少30.8%,校准误差降低49%,并界定形态迁移与伪标签的适用边界。
图像尺度鲁棒性与视觉识别性能:跨架构分析
跨七类20种视觉模型,基线精度与尺度鲁棒性强负相关,参数量、架构族及表征稳定性无额外解释力。
第八届LSVOS挑战赛报告:复杂与多模态视频目标分割
第八届视频目标分割挑战赛:评测复杂、文本及音频引导分割;顶级方案用基础模型、目标记忆与多模态推理。
动物重识别学到什么?视觉表征中的线性生物学概念及其来源
动物重识别模型虽无生物学监督,却线性编码性别年龄等概念,训练只是迁移而非创造这些概念。
深度到图像合成驱动的生成式无引导深度补全
提出生成式无引导深度补全,由稀疏深度合成伪图像实现语义引导,经蒸馏与注意力融合,精度鲁棒性更佳。
FujinSplat:RAW域高斯溅射看穿烟雾
在RAW域分离烟雾介质与ISP变换,固定基础ISP,用逐视图校正训练静态3D高斯,超越现有方法。
DriveZero:超越人类示范的端到端驾驶
DriveZero将驾驶拆为感知与动作模型,分别预训练后统一为端到端规划器,无人类轨迹监督,在多项基准上超越专家。
NSFlow:用于视觉里程计的端到端可微分神经符号光流
提出神经符号光流法,融合卷积网络与可微优化器,端到端训练,实时运行,挑战场景误差下降42%,提升视觉里程计精度。
评分陷阱:即便明确指示忽略,图像中的权威线索仍能改变视觉语言模型的判断
即便被明确要求忽略,图像中的权威线索仍显著改变模型判断;官方答案效应为十九点五,高于教师及学生提示。
用于缺陷定位的空间注意力监督:在扩散增强缺陷检测中利用真实掩码作为训练信号
利用真实缺陷掩码作空间监督训练分类网络,结合扩散增强提升激活定位AUROC,效果显著。
从凝视到意义:无需训练的AI智能体实现统一视觉定位与解释
首次提出无需训练的凝视目标智能体,利用预训练视觉语言模型与视觉提示,实现凝视推理,基准性能最优。
PhysWeep:视频生成器是否实现了你要求的物理?
PhysWeep发现:视频生成器按随机种子锁定错误物理参数而非按请求生成;看似自然的视频也可能物理错,平均分测不出。
SolarBench:全球太阳能即时预报基准
整合十一个站点十年六百万天空/卫星图像,评估模型,揭示平均精度与快速波动预测间的差距。
PASTEL:单目4D场景重建的全景对齐法
提出全景对齐法,将不可见区域探索转为2D方向规划,生成边界外内容并提升单目4D重建性能。
用于骨骼生成的分支中心标记化与测试时增强
提出分支中心标记化与测试时视图增强,提升骨骼生成精度,误差降16.9%
TBDub:面向生产的视觉配音
TBDub面向生产优化视觉配音,通过自适应训练与蒸馏实现两步生成,保持质量并大幅提速。
针对文本到图像模型隐式漏洞的自动红队测试
提出多智能体框架,自动生成并优化隐式对抗提示,结合裁判反馈与累积对抗解码,有效暴露文生图模型漏洞,优于基线。
一次扰动并不够:行为AI评估中的可辨识性与盲基线
行为评估需n次扰动方能确定输入依赖;单次不足;视觉语言模型得分通常低于盲基线。
基于高效解剖预判与多模态确认的全身弥散加权成像多发性骨髓瘤病灶分割
提出两阶段框架,利用表观弥散系数生成解剖先验,并经多模态确认实现高效分割多发性骨髓瘤病灶,性能最佳。
将视觉基础模型适配至声学实现无位姿三维声呐重建
利用几何关系与物理噪声模型,将视觉基础模型适配到声呐,首次实现无位姿三维重建。
一个模型,两个世界:声呐与光学图像的双向转换
提出非对称物理先验桥接与自适应监督,实现单一模型双向声呐-光学图像转换,性能媲美或超越专用模型。
MobileVLA-R1 2.0:面向移动机器人控制的强化学习增强推理
提出强化学习增强的视觉-语言-动作框架,结合结构化推理与移动控制,提升长程任务成功率。
用于多模态图像匹配的辐射、旋转与尺度不变特征描述子
提出RRSI特征描述子,双头采样保留结构,跨模态重建约束,实现多模态图像匹配对辐射、旋转和尺度的鲁棒性。
基于加权速度引导的对象感知背景受控编辑
提出无需训练的对象感知速度控制框架,抑制背景漂移并稳定物体边界,实现局部编辑。
SignDino:时间轴自蒸馏的自监督手语表示学习
SignDino将自监督蒸馏自图像迁移到手语时间轴,拆分手/脸流,以轻量时序变换器学习其演化,多任务达先进水平。
CST-WM:面向具身视觉跟踪的因果结构化世界模型
提出CST-WM因果结构化世界模型,阻断动作对目标证据的直接注入,借规划提升跟踪与重获取能力。
基于GAN的深度学习模型在胸部X光肺炎检测中的比较研究
多种模型对比,MobileNetV2准确率最高88%,GAN增强未提升验证性能。
VDiff-Bench:面向细粒度图像差异识别的挑战性基准
提出VDiff-Bench基准,评估MLLM细粒度图像差异识别,其在噪声纹理等低级变化上易失败。
跨加速因子MRI重建中的单一共享LoRA权重
冻结预训练骨干,训练共享适配器与门控网络,以极少参数实现跨加速因子磁共振重建,性能优且泛化稳定。
儿童凝视:儿童协作行为理解基准数据集
为研究儿童协作行为,提出ChildGaze数据集,含27个视频、10641帧、73268条标注,协作标签一致性高,支持儿童发展与人机交互研究。
MSCA-UNet:用于图像分割的多尺度上下文与注意力U-Net
提出MSCA-UNet,在U-Net瓶颈加多尺度空洞卷积,解码器加CBAM注意力,mIoU从96.9%提至99.1%,验证两机制互补有效。