基于计算机视觉与不平衡感知学习的传染性牛红眼病检测
评估YOLOv11/v26与类平衡策略检测牛红眼病,RMO改善少数类识别,最高准确率0.99。
多模态大语言模型视觉词元剪枝的层感知位置嵌入
提出层感知位置嵌入策略,在定位敏感层用稀疏嵌入、其余层用连续嵌入,提升剪枝后多模态大语言模型性能。
VISTA:视频注入式风格化文本到动画生成
VISTA以两阶段框架融合文本内容与参考视频风格,无需配对三元组,生成可控风格化3D人体动画。
BindCLIP:面向组合式视觉语言评分的一种平衡耦合
BindCLIP用令牌-图块-深度平衡最优传输耦合,读取冻结CLIP的组合关联,提升多个基准。
用于跨域小样本分类的免训练谱转导精炼
免训练谱转导精炼STR,在冻结特征上构建k近邻图谱坐标,迭代精炼类原型,提升跨域小样本分类性能。
OnlineWM:面向有效世界建模的因果感知主动在线学习
提出 OnlineWM 在线框架,融合主动在线学习与因果感知微调,提升世界模型动作可控性与泛化。
VGGT-Prime:面向高效视觉几何Transformer的计算自适应混合注意力头
揭示VGGT注意力头架构冗余,提出计算自适应混合注意力头,动态分配计算模式,8倍加速且性能相当,结合现有方法达14倍。
Mira-Scene:面向生成式3D场景的像素对齐布局
提出组合式3D场景重建框架Mira-Scene,用有界规范坐标图替代稀疏位姿回归,以像素对齐的密集对应恢复物体布局,无需场景级标注,精度显著超越基线。
面向三维医学分割的置信度感知教师-学生蒸馏
提出置信度感知教师-学生蒸馏,仅需单层点提示,心脏MRI分割较最优半监督提升43.6%。
PRISM-RAG:面向烟草产品与立法政策推理的多模态超图检索增强生成
PRISM-RAG多模态超图RAG解决跨辖区烟草法规消歧,正确辖区检索率93.9%,优于标准RAG。
MemeTAG:基于标签嵌入重建的关键词驱动迷因分类
提出MemeTAG框架,利用关键词语义引导与标签嵌入重建,实现多模态有害迷因精准分类。
TAPe+ML:面向多任务计算机视觉的紧凑结构化表示
提出紧凑结构化表示TAPe+ML,以不足10万参数统一支持分类、检测与分割,多任务性能出色。
MarsFM:面向火星地形起伏估计的阴影正则化流匹配
提出MarsFM,用阴影正则化流匹配从HiRISE影像估计火星地形,低步数推理性能稳定。
基于机器学习的肉牛饲养场图像衍生PM10估算:应对超越现有数字成像方法的浓度范围
以对比面板图像结合XGBoost估算肉牛场高浓度PM10,R²为0.792,中位绝对误差103 μg/m³。
MAGIC:面向高效视觉文档检索的边缘引导最优传输压缩方法
MAGIC为免训练后压缩方法,以最优传输双边缘引导压缩多向量嵌入,激进压缩下高效提升检索性能。
基于事件相机的多视角地理定位
事件相机多视角地理定位:将地理数据集转事件流微调模型,地点识别召回率达82%,并发布新数据集。
面向湿壁画残片风格分类的碎片感知视觉Transformer
提出碎片感知视觉变换器框架,结合前景掩码、修复正则与分布对比学习,集成提升湿壁画残片风格分类准确率。
OnomatoBridge:漫画中的拟声词翻译与渲染流水线
提出OnomatoBridge漫画拟声词翻译渲染流水线,在Manga109日英评测中英文正确率提升10–25分,日文残留减少20–50%。
面向双手流程化异常检测的手部感知状态转移建模
HACT用角色保留历史与标记点过程量化手部事件意外性,检测双手装配异常,性能最优、误报最少且跨序免重训。
4DGS-Fixer:视频扩散先验引导迭代细化的生成式稀疏视角4D高斯泼溅
提出视频扩散先验引导迭代细化的稀疏视角4DGS,融合多视深度与视频修复伪监督,PSNR提升近2dB。
Edit-VAR:驯服视觉自回归模型,实现精准视频编辑
Edit-VAR:首个免训练免反转的视频编辑框架,借视觉自回归模型实现精准编辑与源内容保持。
Cube-Splat:基于立方体贴图分解与伴随一致优化的高保真360°高斯泼溅SLAM
首个全景高斯泼溅SLAM,将360°帧分解为共享光心立方体贴图,以伴随映射融合多面梯度,跟踪与重建达SOTA。
超越精确匹配:面向跨域PCBA视觉问答的任务感知GRPO
提出跨域PCBA视觉问答多模态框架,用任务感知GRPO与稳健推理,官方榜达83.24分。
VGGT-CAD:基于几何锚定的参数化CAD三维模型重建
VGGT-CAD借预训练三维几何先验与可变视角融合,从单/多视图重建参数化CAD模型。
SafeStyle:用于扩散风格化中可控风格-泄漏权衡的校准式风格残差注入
免训练的SafeStyle框架通过校准风格残差注入,分离风格与内容子空间,有效平衡风格保真与内容泄漏。
基于上下文感知集中式复制粘贴数据增强的野火图像多类别语义分割
上下文感知集中式复制粘贴增强限制火斑至语义合理区域并按源背景匹配,提升野火多类别分割性能与真实感。
基于曲率自适应管状校正的几何感知扩散引导
提出免训练曲率自适应管状校正CAT,约束扩散引导的法向与切向位移,稳定采样并提升逆问题生成性能。
S3VD:面向视频去雨的语义引导时空扫描
S3VD融合多尺度语义与时空扫描,解耦门控建模帧内外关联,去雨达SOTA,PSNR提升0.84dB。
VeriFuse:面向协同3D感知的有界视觉-语言仲裁与推理引导精炼
VeriFuse让冻结VLM仲裁车路协同3D候选,DAIR-V2X上AP50达0.494且延迟鲁棒。
结合目标检测与几何感知聚类以区分无人机影像中的重叠植株
提出几何感知后检测框架,用质心/径向交点聚类区分无人机RGB影像中重叠植株,F1达0.89。
JEPA引导的扩散模型:面向生成式交通预测的预测性视觉-语言条件
冻结V-JEPA提取预测潜表征,轻量对齐模块驱动冻结扩散模型,免重训生成未来交通视频,竞赛列第三。
PrismAlign:先验引导的多视图VLM对齐,实现抗幻觉表格OCR
提出多视图VLM框架PrismAlign,融合表格逻辑先验,解耦结构与内容对齐,贝叶斯决策降幻觉,多基准达SOTA。
当在线自适应有害:用于持续医学图像分割的参数冻结测试时集成
持续医学图像分割中,参数冻结测试时集成不更新权重,仅多视图概率平均,优于在线自适应。
基于立体事件相机的昆虫野外追踪
将事件相机事件转为视频并结合立体配置,实现昆虫野外高速低延迟三维追踪,减少运动伪影。
RobotEQ-Video:以视频为中心、带世界状态分类体系的社会主动智能基准
发布视频中心基准RobotEQ-Video,构建四级世界状态分类体系,含2K+视频,现有系统表现仍逊于人类。
面向开放词汇场景建图的场景语言模型
提出SceneLM,以结构化文本列表为唯一持久记忆,通过增删改对象维护开放词汇3D场景地图,表示紧凑6-12倍,可在边缘设备在线运行。
隐藏在众目睽睽之下:基于扩散模型的视觉语言模型地理定位隐私泄露缓解
针对视觉语言模型地理定位隐私泄露,提出基于扩散潜空间扰动的主动防御,增强黑盒迁移性并保持图像质量。
SIRA:基于查询锚定对齐的推理感知手术器械分割
提出推理感知分割任务与SurgRS数据集,SIRA通过查询锚定双重对齐提升语义与视觉一致性。
量化感知卡尔曼估计用于扩散采样
提出QuAKE,将量化去噪器采样建模为在线估计问题,结合平滑轨迹先验与高斯观测模型,递归更新后验并支持高阶ODE求解器,显著缩小与全精度采样的分布差距。
AgentVidBench:评估多模态大模型智能体的多跳视频问答基准
AgentVidBench:多跳视频问答基准,评估MLLM智能体的时空与因果推理,提供分步解题轨迹。
ME-Dex 1.0:将异构触觉感知引入世界动作建模
提出 ME-Dex 1.0,统一异构触觉、视觉与动作建模,提升机器人操作性能。
面向可扩展三维建图、定位与渲染的自适应世界记忆三维基础模型
提出自适应世界记忆三维基础模型,统一可扩展三维建图、定位、重建与高斯渲染,实验优于基线。
CompAdapt:面向物理一致性文本到视频生成的可适配复合运动建模
CompAdapt将物理一致T2V扩展至复合运动,支持语言指定参数并免重训适配新物理规律。
P$^3$-SAM:面向少样本带钢表面缺陷分割的感知并行提示SAM
提出P3-SAM,用感知编码与并行提示提升少样本带钢缺陷分割,三基准达SOTA,mIoU提升12%。
MT-WAM:将单次前向预测表征重新导向动作生成
MT-WAM保留原训练目标,引入未来二维点轨迹与视觉特征监督,推理跳过未来视频预测,显著提升控制成功率。
PSEE:面向点监督时序动作定位的渐进式传感器事件扩展
PSEE用语义激活、传感器过渡证据与自适应时序归属,为点监督时序动作定位生成伪片段,提升伪边界质量。
VoxelTTO:体素对齐的前馈式三维高斯泼溅与测试时优化
体素对齐前馈3DGS,以体素特征解码高斯,测试时优化LoRA并采用随机体渲染,提升RGB-D新视角合成与位姿估计。
OpenSAL360:面向全景视频显著性采集的开源众包平台
首个开源低成本全景视频显著性众包采集平台,无需VR,公开500条视频、2000余名标注者的最大数据集。
SkillIR:面向智能体图像复原的场景感知技能演化
提出SkillIR,以场景感知技能引导智能体图像复原,逐步验证并动态更新,提升质量与工具使用可靠性。
局部思考,全局精修:面向内存高效三维重建
提出LoG-VGGT,跨窗口注意力结合全局相机一致性精修,实现内存高效长序列三维重建。