FoMoVLA: 融合视觉预见与运动指导的视觉-语言-动作模型
联合学习未来特征预见与稀疏点跟踪,增强VLA连续动作策略,实现SOTA与零样本泛化。
扩散模型中基于反事实推断的稀有概念生成
提出CI-Diff,利用反事实推断消除扩散模型固有偏见,通过自然直接效应解耦罕见属性,实现稀有概念生成。
论基于扰动的可解释人工智能中的分歧:基于SAR图像洪水检测的扰动选择基准测试
研究扰动xAI中补丁形状与替换方案对解释一致性和忠实性的影响,强调参数选择的重要性。
VQ-Touch:一种跨传感器和场景的数据高效触觉生成框架
提出VQ-Touch框架,利用DM-VQGAN和离散扩散解码器,实现跨传感器多场景触觉生成,少样本训练性能领先。
面向摄像机篡改监控的干净参考流式检测镜头遮挡与光度变化
提出干净参考流式检测镜头遮挡与光度突变,低误报高召回(F1=0.800,0.025误报率下召回0.925),可审计传感器健康子系统。
WorkDrive:面向自动驾驶的道路施工因果链
WorkDrive框架通过因果链标注与一致性强化学习,将施工区轨迹预测误差降低12%。
GeoDetect:面向视觉语言预训练模型的几何对抗检测
提出GeoDetect,利用VLP嵌入空间各向异性导致对抗样本偏离流形,通过几何分数实现可靠检测。
多模态作为监督:通过多模态实现对测试环境的自监督特化
在测试环境中利用多模态数据进行自监督预训练,可获得与大规模通用模型相当的性能,减少对互联网数据集的依赖。
基于LLM的机器人足球比赛自动解说方案
提出全自主实时机器人足球解说系统,利用神经符号架构生成无幻觉解说,适应直播与赛后分析。
模糊模态边界:从单模态到多模态行人重识别的统一综述
综述行人重识别从单模态到多模态的演进,涵盖跨模态任务、多模态融合及未来方向。
VideoChat3:用于高效通用视频理解的完全开源视频MLLM
VideoChat3完全开源,通过I3D-ViT和自适应帧分辨率高效处理视频,数据合成流水线增强泛化,4B参数超越以往模型。
中文标题:物理信息扩散实现生物力学合理的3D手语生成
中文摘要:提出PIDiffSign模型,融合解剖约束与对比损失,提升手语生成的真实感与语义保真度。
TanGO:基于切空间引导与优化的免训练3D编辑
TanGO提出切空间引导优化方法,实现免训练3D编辑,通过逐令牌自适应控制减少语义伪影,性能领先。
选择性驱动效率:面向视觉地点识别的数据集剪枝
提出地点级剪枝方法,利用地点内多样性和地点间相似性评估,构建紧凑核心集,降低训练成本并保持高性能。
无需真实人脸的人脸识别基准测试
研究发现两个强合成数据集可替代真实基准评估人脸识别,达成隐私保护的完全合成流程。
静态图像与时空番茄数据:利用强标签和弱标签实现检测、分割、跟踪及视频实例分割
发布两个番茄视觉数据集,含静态和视频数据,提供像素级成熟度标签,支持检测、分割、跟踪等任务。
FlashDecoder:基于Transformer的实时潜空间到像素流式解码器
FlashDecoder纯Transformer逐帧解码器,滚动KV缓存固定窗口,实现低延迟流式解码,速度与内存效率大幅提升,重建质量持平卷积解码器。
基于相移轮廓术的眼睛重建中的旋转运动误差补偿
提出旋转运动补偿框架,估计眼球旋转并补偿像素失配与相移误差,区域优化减少伪影,有效提高动态3D眼睛重建精度。
面向视觉语言模型的U形多粒度学习
UPrompt采用U形多粒度提示学习,通过粗到细与细到粗的级联增强,显著提升视觉语言模型性能。
基于SAM驱动的伪标注和状态空间交互扩散的弱监督RGB-D显著目标检测
提出SAM-PAG生成伪标注与S^2Diff扩散模型,弱监督RGB-D SOD性能优于同类方法。
Stitch-Inferencer:通过全景重建增强内窥镜视频分割与跟踪
提出实时模型无关框架,利用在线全景画布扩展视野,提升内窥镜分割与跟踪性能且无需重训练。
论成功与简单:对可迁移视觉-语言攻击流程的再审视
提出SimVLA,简化跨模态攻击,提升迁移性和效率,证明复杂操作有害,领域知识更关键。
从草稿到无草稿:基于特权蒸馏与快速植入的单步视频对象移除
提出D2DF框架,通过特权蒸馏和快速植入实现单步视频对象移除,质量优且仅需1秒。
JADE-GS:事件引导的联合交替去模糊三维高斯泼溅
JADE-GS融合事件与图像先验,通过双向循环联合3D高斯泼溅去模糊,训练快、感知质量最优。
视频 = 世界 + 事件流
提出视频分解为世界与事件流模型,世界为持久场景,事件流为动态变化,用于实时全双工视听交互预训练。
Introspective Attention Modulation for Safe Text-to-Image Generation
中文标题:光场视差估计的频率结构化场学习
中文摘要:提出FreqLF方法,利用傅里叶-局部潜场学习实现光场视差估计,避免显式代价体积,性能接近强监督基线。
中文标题
DINE框架引入全局形变先验,结合距离约束,在软组织点云配准中降低Chamfer距离27-79%,鲁棒性显著提升。
AlphaWiSE:面向连续多模态表示学习的自适应权重插值
AlphaWiSE通过事后权重插值组合双检查点,拟合标量系数,实现连续多模态学习,提升跨模态检索性能。
面向报纸图像的层级结构理解
提出模块化流水线与端到端Tiramisu两种互补方法,发布新数据集,有效重建报纸层级结构。
单向双曲投影下基于光线的微型DOE投影仪FPP相位误差校正
基于光线的相位误差校正,利用单向双曲条纹估计投影仪针孔,无需立体标定,显著提升非线性投影下的重建精度。
量化人脸识别模型超球面嵌入几何中的训练成员信息
训练身份数量对成员可分性影响最大,跨域数据夸大信号,融合统计量可提升检测。
QuReC: 基于查询特定引导与局部-全局响应校准的全能图像恢复
提出QuReC框架,通过退化引导查询重构和局部-全局响应校准,实现空间自适应恢复,性能领先。
RoGS:面向大规模道路表面建图的自适应网格高斯表示
提出自适应网格高斯建图框架,通过2D高斯surfel与区域自适应网格实现高效高精度路面重建。
超越单一专家:在多模态大语言模型中协调多样视觉先验以实现空间理解
ViPS框架通过高效先验代理和动态融合机制,协调多种视觉先验,显著提升MLLM空间理解性能,达到新SOTA。
参数高效的视觉基础模型提示调优与自适应焦点损失用于可解释的MCI筛查
基于冻结DINOv2的参数高效提示调优,用可学习令牌和自适应焦点损失提升MCI筛查可解释性,F1达0.641。
SUFLECA:扩展特征学习以实现CAD与图像对齐
SUFLECA通过大规模NOC监督学习几何特征与几何一致匹配,实现高效零样本CAD对齐,超越强基线。
DAPGNet:动态自适应物理引导的图扩散网络用于高光谱图像分类
提出物理先验引导图扩散网络,通过光谱先验改进拓扑与传播,在四个数据集上提升分类精度达最优。
在线神经时空记忆用于动态新颖视图合成
通过解耦记忆更新与应用频率,配合辅助损失和缓存策略,实现实时动态场景新颖视图合成。
MAGiSt3R:基于多Agent前馈的单目RGB视频三维重建
提出MAGiSt3R多Agent框架,以近10FPS从单目RGB视频重建三维场景并跟踪相机,性能优于现有方法。
ARMOR++:面向深度伪造检测器可迁移攻击的多域基元集智能编排
ARMOR++多智能体框架协调多域攻击基元,显著提升黑盒迁移攻击成功率,暴露检测器可靠性漏洞。
HoloGeo:基于证据驱动推理减轻地理定位中的地标偏见
HoloGeo通过证据驱动推理和多维奖励,有效消除地标偏差,显著提升地理定位鲁棒性。
CRISP:域偏移下鲁棒医学图像分割的迭代挤压约束细化方法
CRISP利用正区域秩稳定性假设,通过潜在扰动获得高精度和高召回先验,迭代挤压细化,无需目标域数据即可实现鲁棒医学图像分割。
SceneBind:跨视觉、音频和语言的“是什么”与“在哪里”绑定
SceneBind通过语义-空间实体表示,结合全局与对象级信息,实现跨模态场景检索与定位,达SOTA。
运动条件多视图融合用于超声心动图心肌梗死定位
提出MCF-Net,融合运动与视觉基础模型,极稀疏监督定位心肌梗死,段级F1 72.4%,准确率84.9%。
面向无监督可见光-红外行人重识别的结构-语义互学习
结构-语义互学习通过结构解耦和闭环校准解决无监督跨模态重识别的噪声问题,性能领先。
Symbal:检测模型生成描述中的系统性错位
Symbal利用双阶段结构检测描述系统性错位,在420数据集基准上准确率达63.8%,较基线提升近4倍。
艺术观看中的不同注视模式:自闭症个体、艺术家和神经典型观察者注意力的空间和时间特征
自闭症成人艺术观看时空间注视范围似艺术家,但时间模式独特(短注视、少停留、轨迹独特),形成特异性注意力特征。
多LLM协作的MRI报告生成:脑肿瘤学中的视觉指令微调
通过多LLM协作生成3D MRI图像-文本数据集,构建的VLM在报告生成和视觉问答中表现更优,助力脑肿瘤诊疗。
MeanFlowNFT:将前向过程强化学习引入平均速度生成器
提出MeanFlowNFT,将前向RL用于平均速度生成器,通过瞬时速度预测实现奖励优化,保留快速少步采样,性能超越基线。