面向真实世界教育应用的人类-物体交互检测器诊断
提出诊断驱动框架,通过错误分类与归因分析,将HOI检测器宏F1从48.6提升至90.2。
面向第一人称自然语言查询定位的手部轨迹融合
提出手部轨迹编码器融合手部运动特征,显著提升第一人称视频中自然语言查询定位精度。
Any2Poster: 跨模态与领域的任意源海报生成
提出Any2Poster基准与智能体,支持8种输入5领域,智能体准确率87.25%,性能显著提升。
中文标题
针对图像反射分离中线性模型局限,提出可学习非线性叠加与特征交互框架,解决真实非线性耦合,实现高保真分解,性能优越。
SaluNet:在无归一化深度网络中实现全面可塑性
提出SALU激活函数替代归一化层,消除可塑性抑制,在CIFAR-10达97.35%,ImageNet达78.67%,并支持单样本训练。
Pixel Cube:基于扩散的真实感光照再现的人像视频重光照
提出扩散方法,利用混合数据与HDR环境图控制,实现真实一致的人像视频重光照,保留身份细节,达到SOTA。
ATLAS:面向对抗性激光雷达感知的大规模评估基准
首个物理对抗激光雷达基准,揭示强模型更抗移除攻击却更易被注入攻击,归因于训练增强缺陷。
可部署计算病理学的途径结构化特权蒸馏
MoPE框架通过特权蒸馏将转录组信息编码为途径索引,实现仅组织学推理并显著提升性能。
面向遮挡鲁棒目标检测的微小型协同推理
决策级融合(WBF)在超低端设备上优于特征级融合,遮挡场景mAP提升0.27,三视图融合增益更大,硬件实验覆盖增益+29.8%。
自动驾驶的未来之路:KITScenes多模态数据集
KITScenes多模态数据集结合高保真传感器与完整HD地图,首次实现3D交通元素精确映射,拓展地理多样性并推出四项基准。
基于椭圆轴估计的圆柱形物体CAD到CT配准
提出两阶段几何配准法,通过椭圆检测与PCA实现<0.1°误差的圆柱物体CAD-CT配准,无需强度校准或特征匹配。
TGV-KV:面向视觉语言模型的基于文本引导的KV驱逐策略
通过文本引导视觉信息重要性,优化KV缓存,保持99.2%精度并提升吞吐量52.6%。
面向紧凑型自动驾驶感知的平衡学习与多传感器融合
提出紧凑多任务感知模型,自适应损失加权平衡学习,融合多传感器,参数少性能优。
GuidedBridge:利用先验引导无训练改进桥接模型
提出无训练先验引导方法,通过对比弱先验与已见先验增强利用,并设计频率调制及级联框架,有效改进桥接模型图像翻译性能。
层级视图-令牌传输实现零样本三维问答
提出KeyVT,层级收集视图和令牌,结合语义几何选视图,最优传输选代表令牌,显著提升零样本3D问答性能。
面向鲁棒基础设施检测的分层联邦学习:动态聚类与自适应正则化
提出分层联邦学习框架,通过动态聚类和自适应正则化解决宏观结构差异与微观统计不平衡,实现鲁棒基础设施检测。
FCUS-rPPG:通过梯度振荡抑制实现快速收敛的远程光电容积描记无监督框架
提出FCUS-rPPG,仅需一个训练周期即达跨数据集SOTA,通过梯度抑制与噪声正则化实现快速收敛。
MUSE:多模态大语言模型的统一智能执行框架
MUSE通过模块组合与验证引导修复,无需重新训练即可显著提升冻结多模态大语言模型在困难任务上的性能。
ROBUST-WT: 基于白化与训练增强的鲁棒不确定性感知分割变换
针对WT-PSE的四个局限,提出域自适应增强、混合损失与课程调度,Dice从0.939提升至0.956。
去噪扩散隐式模型生成过程的反转:实证评估与新方法
提出混合反转法提高DDIM初始潜在变量预测精度及重建质量,自插值测试验证效果。
Reinforcement Learning from Cross-domain Videos with Video Prediction Model
FAF-CD: 频感知融合用于不完美多模态遥感变化检测
提出FAF-CD,通过自适应门控融合空间与频域特征,在多模态变化检测中性能提升且计算量降低。
$A^2$:较小的自监督ViT定位能力优于较大的ViT
提出A^2方法,用小模型定位、大模型提取特征,无需额外训练,定位更优且表示丰富。
厘清LVLMs可视化素养中的视觉正确性与事实正确性
提出分离视觉与事实正确性框架,发现LVLMs高准确率可能源于事实记忆而非视觉推理,开发反事实测试评估仲裁机制。
JAVEDIT:基于智能体数据策展的联合音视频指令引导视频编辑
首次提出大规模高质量联合音视频编辑数据集与基准,构建基线模型,在多数指标上超越现有方法。
NVIDIA OmniDreams:用于闭环自动驾驶仿真的实时生成式世界模型
OmniDreams是实时生成式世界模型,基于Cosmos扩散模型自回归生成动作条件视频,用于闭环仿真,可合成极端天气等长尾场景。
SRENet:面向点云动作识别的频谱重入网络
SRENet通过频谱分解与重入模块,从频率视角学习全局和细粒度时间动态,在三个数据集上实现最优性能。
KC-3DGS: 峰度约束的高斯泼溅实现高保真视图合成
提出KC-3DGS,用小波域峰度约束增强3DGS,显著提升稀疏视图下感知质量,可即插即用。
GLINT:用于细粒度放射学表征的稀疏门控视觉-语言对齐
GLINT通过稀疏门控对齐和密集特征正则化,解决图像-报告尺度不匹配,实现零样本分类、定位及3D CT分割。
问有所值:面向实例目标导航的成本感知开放式交互
提出成本感知交互方法,通过信息增益分析选择问题,构建基准及加权成功率指标,实现零样本导航。
超越语义:从视觉-语言数据建模事实与情感感知体验
提出P-Topics建模与PercepT架构,从图像-文本数据发现事实与情感感知主题,准确匹配图像到感知簇,性能显著优于基线。
BA-T: 一种用于双视图束调整的迭代Transformer
BA-T轻量迭代Transformer,通过单层BA式更新,提升双视图重建精度与一致性,参数仅为传统模型的16%。
PaddleOCR-VL-1.6:通过欠优化区域精炼和渐进式后训练拓展文档解析前沿
PaddleOCR-VL-1.6采用区域感知优化与渐进式后训练,在OmniDocBench上达96.33%新SOTA。
TASE: 面向3D场景理解与编辑的截断感知语义嵌入
将2D语义特征投影到截断感知空间,通过通道数控制细节,实现文本驱动的3D场景灵活编辑,优于先前方法。
VistaHop:面向视觉深度搜索的多跳视觉推理基准
VistaHop评估多跳视觉推理,最佳模型准确率仅24.3%,揭示视觉锚定与长链推理的短板。
MemoGen:过往经验能否改善未来文本到图像生成?
MemoGen无需参数更新,仅凭经验记忆两轮进化即超越强系统。
追随你的偏好++:重新思考图像修复中的偏好对齐
利用奖励模型构建偏好数据,发现其存在偏见,集成可缓解,并迁移至物体移除任务。
基于结构化状态空间对偶的跨模态特征融合多模态图像配准网络
提出RegNetMamba-2,利用结构化状态空间对偶提取结构特征,通过交叉模态交互与多尺度融合实现高效精确配准。
FreeStreamGS: 从无位姿流式输入中在线前馈三维高斯泼溅
针对流式无位姿在线新视角合成,提出FreeStreamGS,用去耦内参恢复和动态点偏移纠正漂移,渲染质量媲美离线方法。
MariData:面向海洋环境的单步无配对图像翻译
提出MariData框架,基于CycleGAN-turbo一步无配对翻译,零卷积跳跃连接保留小目标细节,合成逼真海洋数据缓解数据稀缺。
SAMatcher:基于Segment Anything的共视性建模实现鲁棒特征匹配
利用SAM进行共视性建模,预测掩码和边界框,通过跨视图交互提升特征匹配鲁棒性。
PRISM:通过自组织专家特化协同视觉基础模型
提出PRISM双流MoE框架,以专家特化解构与动态重组协同视觉基础模型,实现新SOTA。
中文标题
提出SIU^2^A框架评估科学图像效用与可升级性,发现现有多模态系统在错误检测与修复上存在重大缺陷。
SynCred-Bench:AI生成视觉虚假信息中合成可信度的基准测试
SYNCRED-Bench评估显示,AI生成具有合成可信度的虚假图像,现有系统(真阳性率<58%)和人类(63%)均难识别,构成严重新威胁。
Mamba增强隐式运动学习实现音频驱动肖像动画
提出Mamba增强隐式运动框架,两阶段解耦运动预测与渲染,从单图及音频生成逼真视频,达新最优。
一个统一的多任务框架实现可解释的胸部X光分析
提出IMT-CXR框架,模拟放射科医生诊断流程,实现可解释分析,盲评中66%AI报告优于临床。
P²-DPO:通过校准直接偏好优化在感知处理中定位幻觉
P²-DPO通过自生成在线偏好对与校准损失,直接解决感知瓶颈和视觉鲁棒性问题,无需人类反馈即超越强基线。
PHAF:闪速生成个性化手部虚拟化身
从两张图像快速生成逼真手部虚拟化身,速度提升30倍,支持AR/VR实时部署。
IDO:面向多模态假新闻检测的不一致性感知分布优化
提出IDO方法,通过事实和模态不一致性建模优化分布,提升多模态假新闻检测性能,达到最优。
Enginuity:面向工程图视觉语言理解的数据集与基准
首个工程图VLM基准Enginuity,定义零件表提取与VQA任务,揭示模型描述保真度与事实推理的显著差距。