ABot-N1:迈向通用视觉语言导航基础模型
提出解耦认知与控制的慢快架构,用像素锚点统一多任务,城市场景导航POI到达率提升35%。
垂直融合:压缩内部表示以实现鲁棒ViT分类
VFusion通过垂直聚合ViT内部层级特征,利用中间层冗余纠正最后一层错误,显著提升分类鲁棒性。
自监督自动抠图
SSMatte首次实现无需标注的自监督自动抠图,通过分解语义锚定与细节抠图,性能媲美全监督方法。
SynthDocBench:面向长上下文视觉文档理解的受控基准
提出合成基准SynthDocBench,系统控制多因素,揭示VLM在长文档中的长度退化、位置敏感性和图表理解崩溃三大失败模式。
TVT-PAPD:面向自监督全切片图像分类的病理感知原型蒸馏
提出TVT-PAPD,利用病理感知原型蒸馏学习WSI形态模式,在脑胶质瘤分类中达93%和90%加权F1,跨队列泛化好。
乳腺摄影基础模型在域偏移下的鲁棒性基准测试
多数据集评估发现乳腺摄影基础模型鲁棒性参差不齐,数据集级域外评估是关键。
物理启发的伪异常生成与原型特征引导的三维异常检测
提出PA3AD框架,通过物理启发生成伪异常和原型特征引导,有效学习分布偏移,实现领先的3D异常检测性能。
BOCCHI:基于MSDCT-UNet的更真实、更具挑战性的局部运动模糊检测基准
提出BOCCHI基准与MSDCT-UNet网络,克服梯度捷径,仅用633张训练图像实现跨数据集最优迁移。
无标注家具编码:编码内容与迁移能力
自监督FSQ点云编码可替代类别和姿态标注,训练目标控制旋转信号,迁移性因形状而异。
SPORT:面向不完整多视图聚类的结构感知原型解耦
提出SPORT框架,通过解耦原型共享与专有成分、结构感知对比学习及混合插补,提升不完整多视图聚类性能。
格拉斯曼喷溅 I: 用于动态场景渲染的移动秩2时空面元
提出格拉斯曼喷溅,用秩2面元实现闭合运动模型,训练速度最快,质量排名第二。
不是所有颜色类别都同样稳定:一项多语言自由颜色命名实验
多语言实验发现,绿色命名最稳定,黄色易被描述为金、棕色,红色居中,有助于感知颜色模型开发。
光流模型在现实世界的泛化性研究
研究揭示光流模型在现实世界泛化不足,合成基准无法准确预测真实表现,扩大训练数据无济于事。
走向自主且可审计的医学影像模型开发
AMID框架通过数据条件规划与验证优化,实现医学影像模型自主开发,性能接近人工方案。
NanoVSR:面向边缘设备的实时视频超分辨率
提出全卷积架构NanoVSR,利用结构重参数化兼容硬件,无需光流,在边缘设备实现实时高性能。
通过聚类截断提升自回归文本到图像生成中的样本多样性
提出基于聚类截断的熵截断采样策略,在保持图像质量和提示对齐前提下显著提升多样性。
领域为何重要:水下目标检测与标注质量的领域感知基准评估
通过领域感知框架,揭示领域因素对水下检测与标注质量的显著影响,指导数据收集与基准评估。
基于惩罚加权最小二乘和引导全变分的量子压缩感知CT重建算法
提出PWLS-GTV量子压缩感知CT算法,融合光子统计加权与引导全变分,稀疏视图下PSNR达36.64dB。
DiffUE:通过扩散自编码器增强不可学习示例的效用-不可学习性权衡
DiffUE将噪声注入语义空间,在保持图像质量的同时实现鲁棒不可学习性,有效抵抗高级再学习策略。
模拟天气条件下基于无人机的车辆再识别基准测试
模拟天气影响无人机车辆再识别,雨天影响大于雾天,AdaSP方法鲁棒性最强。
答案条件化思维链蒸馏:面向小VLM的少样本工业视觉
仅用18-30张图像微调小VLM,工业视觉任务平均提升1.7-4.4pp,超越GPT-4.1。
基于深度学习的端到端实时无人机人员检测框架
提出YOLOv8-nano框架,在16-25米高度实现高可靠性人员检测,帧率41-50FPS。
WasteAssistant:法规引导的智能垃圾分类与可持续管理视觉问答框架
提出法规引导的视觉问答框架,结合多模态模型,在21类垃圾分类数据集上BLEU达0.8291,提升分类准确率与合规性。
利用视觉语言模型计算两视频帧相似性并分组以检测异常帧,提取专家工人独特动作
提出基于视觉语言模型对比手册与专家视频帧相似性,检测异常帧提取专家隐性知识,提取率达66.9%。
视觉-语言模型中基于谱热流的保守令牌凝聚
SpecFlow用谱热流保守凝聚视觉令牌,无需训练,压缩88.9%令牌仍保留95.6%性能,实现高效准确平衡。
光谱一致流:一步式三维医学图像翻译
提出SC-Flow,利用光谱一致性校正器实现一步3D医学图像翻译,精准还原解剖细节并保持结构一致性。
标题:迈向高效弱监督语义分割:仅使用低倍镜组织病理图像
摘要:研究证明低倍镜病理图像在弱监督分割中可媲美高倍镜,并发现关键退化点,为高效存储设计提供指导。
使用对称注意力的水面倒影检测
利用非完美反射对称性,SAWRD-Net结合等变卷积与矩阵分解解码器检测水面反射轴,真阳性率0.890。
基于3D高斯三角化的增量式在线场景重建
直接三角化高斯表示,在线增量重建高保真网格,支持高质量渲染并降低长序列开销。
HyperBank:用于少样本球体显微镜分割的可微分经典先验库
HyperBank可微分经典算子库在少样本球体分割中与基础模型竞争,揭示经典视觉线索的有效性。
基于噪声残差聚类的有效合成图像检测
提出免训练方法,利用噪声残差聚类区分真实与合成图像,平均准确率82.2%,泛化能力强。
Traj-VLN: 通过自回归轨迹生成学习像素空间交互
在像素空间中通过自回归轨迹生成学习导航交互,微调视觉语言模型实现跨场景泛化,有限资源下达到最优性能。
TOLiD:通过令牌提升蒸馏弥合视觉基础模型到激光雷达预训练的架构差距
TOLiD将激光雷达点云特征转为视觉令牌,通过令牌级蒸馏弥合架构差距,实现高效自监督预训练。
RED-Sphere: 用于跨人群眼底疾病领域泛化的超球面残差边缘去偏方法
提出RED-Sphere框架,通过超球面残差边缘去偏与反事实正则化,消除外观捷径干扰,提升跨人群眼底疾病分类鲁棒性。
能量引导就是所需的一切?用于驾驶世界模型的免训练规范注入
免训练能量引导可操控驾驶世界模型轨迹,但视频未完全遵循,需跨流耦合实现端到端控制。
TriCons-Pose: 类别级物体姿态估计的三角形不变性几何一致性学习
提出三角形不变性几何一致性学习,通过稳定关键点检测和姿态不变聚合,实现鲁棒准确的类别级姿态估计。
利用温度采样和方差校正时间偏移实现扩散模型的多样性
提出方差校正时间偏移,使温度采样有效增加扩散模型多样性,无需重训且质量损失小。
检测AI生成视频:视觉-语言双视角综述
提出视觉-语言双视角分类法,将任务重定义为事实保真度验证,实现从痕迹匹配到语义验证的范式转变。
h-Flow:基于Doob h-变换的灵活流式图像编辑
提出h-Flow,利用Doob h-变换实现无需训练的流编辑,通过速度正交分解可控权衡源一致性与目标对齐。
大型视觉语言模型中的认知专家混合
提出认知分层推理框架,分解专家输出并追踪推理轨迹,提升感知能力,减少幻觉。
MAC-Splat:多属性一致性实现高保真稀疏视角重建
提出MAC-Splat,通过多属性一致性损失直接监督3D,解决稀疏视图几何伪影,显著提升重建保真度,PSNR提升超4.5dB。
中文标题:用于视频中复杂装配动作理解的组合上下文微调视觉语言模型
中文摘要:提出CCFT和LP-AT方法,分解动作元素微调视觉语言模型,在装配视频理解中优于基线。
对齐与分割:基于未对齐标签的无监督建筑分割方法
提出对齐与分割方法,同时学习标签对齐和分割,无需精确标签,实现高质量建筑分割。
3D-DefectBench:细粒度3D生成缺陷的视觉语言模型评估管道受控因子研究
提出3D-DefectBench基准,系统分析VLM缺陷检测管道,发现模型选择最关键,六视图RGB性价比高,但最优VLM仍不及人工标注。
OmniX: 通过前馈轨迹场实现任意视角与任意时间的4D重建
OmniX解耦动静态,用动态令牌生成轨迹场,实现任意视角/时间4D重建,性能达SOTA。
学习聚焦:解剖引导的注意力正则化用于医学图像分类
提出Locus框架,利用预训练分割模型引导分类器关注解剖区域,通过注意力正则化提升医学图像分类性能。
基于动作单元引导的微表情识别合成视频生成
提出EquiME合成微表情数据集,75K视频由AU引导生成,跨数据集性能优异。
Design Choices in Splitting-Based Self-Supervised Sparse-View CT Reconstruction
TreeSoc:面向足球视频理解的树结构动态推理与工具协同
TreeSoc采用树结构动态推理与工具协同,将视频问答转为层次搜索,在SoccerBench上三任务均达85%以上SOTA,跨域泛化至NExT-QA 74.16%。
X-GuideAR:一种减少透视引导过程中辐射暴露的增强现实框架
X-GuideAR增强现实框架通过合成X光预览减少62.3%透视次数,提升螺钉置入精度与骨包容,降低辐射暴露。