基于里程计的高速赛车三维车道检测
提出高速赛车3D车道检测数据集与方法,利用里程计预积分与多相机集成,实现近300Hz处理,F1>0.9,横向误差<0.18m。
DCVC-MB:基于状态空间模型的神经B帧视频压缩
提出DCVC-Mamba B帧压缩框架,利用状态空间模型实现时空融合与熵感知跳过,平均BD率降低8.98%。
SD-MAR: 基于合成数据和强化学习的多图像分析推理
提出SD-MAR框架,用合成数据与BDA强化学习提升多图像分析推理,准确率提高36.95%,跨域泛化保持或提升。
MonteRET:多粒度知识检索增强多模态大语言模型的AI智能体,用于胸部CT报告生成
MonteRET融合全局与区域特征,检索知识并重写报告,显著提升胸部CT报告质量和临床效能。
推理解除概念抑制与面向视频的评估:针对文本生成视频模型
提出SIRUS推理框架,无需训练即可抑制目标概念并保留非目标内容,在视频遗忘与质量权衡上优于基线方法。
关键帧罗盘:关键帧条件视频生成的全面评估
首个关键帧条件视频生成基准KeyFrame-Compass,含386样本及自动评估,揭示关键帧执行与视频质量的权衡及密度影响。
MultiRef-Compass:多参考音视频生成的全面评估
提出MultiRef-Compass基准,含350样本四维度评估多参考音视频生成,揭示当前模型改进空间。
SeeSE3:视觉特征中三维空间的涌现
发现自监督视觉模型潜在子空间与三维欧氏空间强相关,据此提出纯潜在空间视觉定位与里程计方法。
超越标量损失:通过梯度向量场手术校准分割模型
针对区域损失函数的过度自信问题,提出梯度向量场手术,按预测误差线性缩放梯度以校准模型,保持高精度。
动态操作超图用于基于视觉的人类活动识别:超越成对关系
提出动态操作超图建模多实体高阶关系,在EPIC-KITCHENS和Assembly101上HO-F1分别提升6.9和9.5个百分点。
棉花-SF YOLO:学习结构和频率线索用于复杂田间环境下的早期棉铃检测
结合动态蛇形卷积和频域调制,利用结构与频率线索提升复杂田间早期棉铃检测精度。
冻结视觉基础模型中涌现的区域级面部对应
DINOv3无需面部训练,即实现83%区域级面部对应与95.5%时间跟踪,中间层特征最优。
无序输入的全局一致性即时三维高斯泼溅重建
首个全局一致的无序输入即时3D高斯泼溅重建方法,利用共视图与GPU优化实现高质量快速重建。
$K$-NeAS: 基于神经符号距离函数的可扩展多材料CT重建
提出$K$-NeAS可扩展架构,自动多材料CT表面重建,无需手动调节,在腹部三材料重建PSNR提升1.88dB。
通过自我场景增强强化多模态大语言模型中的自我中心空间感知
提出ESA框架,用自我元素图增强空间感知,在EgoTextVQA上室内外分别提升8.14%和8.72%。
多尺度ViT推理结合栖息地适应先验和kNN检索的多物种植物识别
采用多尺度ViT与kNN检索,融合栖息地适应先验,实现多物种植物识别,获PlantCLEF 2026第三名。
G2SR:基于几何方法的快速高效内存高斯曲面重建
G2SR采用轻量前端+几何后端,少视图下快速(69-89fps)低内存(203MB)实现高精度3D高斯曲面重建。
使用GPU友好的图形纹理编码压缩3D高斯泼溅数据
利用GPU纹理压缩球谐系数,通过局部分组重排序及比特率控制,实现高效并行解码且视觉质量损失极小。
VTM-Nav: 用于跨场景物体目标导航的分层视觉拓扑记忆
提出无需训练的VTM框架,通过分层视觉拓扑记忆实现跨场景经验重用,在三个基准测试中表现最佳。
Hough-SIFT:基于Hough空间的线性结构鲁棒图像配准
Hough-SIFT在Hough空间匹配SIFT描述子,解决强线性场景失效问题,鲁棒性优于SIFT且保持正常场景精度。
Uni-AdaVD:通过正交值分解实现视觉生成的通用概念擦除
Uni-AdaVD通过正交值分解与自适应擦除偏移,在不更新权重下抑制目标语义,实现通用视觉生成概念擦除。
基于深度强化学习的3D几何牙齿对齐规划
提出深度强化学习框架,利用DDPG、Transformer和课程学习,自动生成安全高效的3D牙齿对齐路径。
SwinAD:面向无监督工业异常检测的多阶段特征重构
SwinAD提出多阶段特征重构,利用冻结Swin编码器和多样性解码器,显著提升多类无监督异常检测像素级定位精度。
AdaTurn:面向主动视觉感知代理的预算感知测试时缩放
AdaTurn通过预算感知框架和强制回答训练,解决主动视觉代理因预算不足导致的截断问题,显著提升低预算场景的准确率。
HyMobileAgent:数据与环境协同扩展的高效GUI代理
HyMobileAgent采用数据-环境协同扩展框架,集成多组件训练,实现移动GUI高效代理。
打破长增量3D目标检测中的模型遗忘循环
针对长增量3D检测的模型遗忘,提出学习动力学驱动的记忆与回顾(LDMR)框架,有效缓解遗忘并超越基线。
高级图像生成:负提示优化与潜在分类器引导
双引导框架:LLM优化负提示与CNN-RNN分类器引导扩散,减少伪影,提升语义保真度。
MagicPrompt:用于视频生成的超轻量级提示调优
以少于1%可训练参数实现高效视频生成微调,通过注意力嵌入提示和双空间奖励优化解决成本与稳定性问题。
Autoregressive Modeling of Film with Applications in Video Montage
VIABench:一个从盲人收集的、用于视觉障碍辅助的综合视频基准
VIABench基准评估多模态大语言模型在盲人辅助中的三大任务,发现主动提醒任务最具挑战性。
GlobalForge:迈向鲁棒的AI生成图像检测
GlobalForge通过抑制局部伪影、强化全局结构实现鲁棒AI图像检测,在8个基准上平均提升5.89%超越先前最优。
前列腺MRI分级中临床协变量的因果对抗性探测
因果对抗法分析前列腺MRI分级协变量:抑制年龄等无益信息提升AUC,而抑制PSA等关键信号则降低性能。
第11届ABAW竞赛中的RAS团队:多模态矛盾情绪识别方法
提出文本中心的多模态残差融合模型,用于识别矛盾犹豫情绪,私人测试集MF1达78.24%,较文本模型提升4.03%。
基于病理切片基础模型的多教师蒸馏预训练多实例学习网络
提出多教师蒸馏预训练MIL框架,用病理基础模型初始化,提升线性探测与少样本性能。
自动驾驶中鸟瞰视角分割的变分推理
提出基于变分推理的TVB网络,融合归一化流与注意力机制,实现多相机BEV分割,性能优越。
ReBind:通过显式引用关系的结构化指令进行多参考视频编辑
ReBind通过嵌入参考标记的语义指令,建立视觉属性与源的显式绑定,实现高质量多参考视频编辑,性能领先。
VideoSEMA: 一种可扩展且高效的类Mamba注意力用于视频理解
VideoSEMA用分割时空注意力等效全时空,超越大型ViT和Mamba,高分变率下退化更缓。
初见便知:从人脸推断显性人格
提出GlanceFace框架,利用视觉语言模型和语义增强模块,从面部图像推断MBTI显性人格,支持人机交互初识策略。
AE-UAV:空对空事件相机无人机跟踪基准与实时频域跟踪器
提出首个空对空事件相机无人机跟踪数据集及CPU实时频域跟踪器,以420FPS实现高精度。
TAMF-VTON: 基于高保真图像合成的纹理感知无掩模虚拟试衣
提出无掩模虚拟试衣框架TAMF-VTON,通过MoE微调、频域监督与数据管道实现高保真纹理和快速推理,性能领先。
FoMoVLA: 融合视觉预见与运动指导的视觉-语言-动作模型
联合学习未来特征预见与稀疏点跟踪,增强VLA连续动作策略,实现SOTA与零样本泛化。
扩散模型中基于反事实推断的稀有概念生成
提出CI-Diff,利用反事实推断消除扩散模型固有偏见,通过自然直接效应解耦罕见属性,实现稀有概念生成。
论基于扰动的可解释人工智能中的分歧:基于SAR图像洪水检测的扰动选择基准测试
研究扰动xAI中补丁形状与替换方案对解释一致性和忠实性的影响,强调参数选择的重要性。
VQ-Touch:一种跨传感器和场景的数据高效触觉生成框架
提出VQ-Touch框架,利用DM-VQGAN和离散扩散解码器,实现跨传感器多场景触觉生成,少样本训练性能领先。
面向摄像机篡改监控的干净参考流式检测镜头遮挡与光度变化
提出干净参考流式检测镜头遮挡与光度突变,低误报高召回(F1=0.800,0.025误报率下召回0.925),可审计传感器健康子系统。
WorkDrive:面向自动驾驶的道路施工因果链
WorkDrive框架通过因果链标注与一致性强化学习,将施工区轨迹预测误差降低12%。
GeoDetect:面向视觉语言预训练模型的几何对抗检测
提出GeoDetect,利用VLP嵌入空间各向异性导致对抗样本偏离流形,通过几何分数实现可靠检测。
多模态作为监督:通过多模态实现对测试环境的自监督特化
在测试环境中利用多模态数据进行自监督预训练,可获得与大规模通用模型相当的性能,减少对互联网数据集的依赖。
基于LLM的机器人足球比赛自动解说方案
提出全自主实时机器人足球解说系统,利用神经符号架构生成无幻觉解说,适应直播与赛后分析。
模糊模态边界:从单模态到多模态行人重识别的统一综述
综述行人重识别从单模态到多模态的演进,涵盖跨模态任务、多模态融合及未来方向。