DeceptionX:基于多模态大语言模型的可解释性欺骗检测
提出DeceptionX框架,将欺骗检测转为可解释推理,通过三阶段训练和DARE策略,在真实基准上超越现有方法并提供透明推理路径。
从仿真到现实:用于机器人草莓采摘的田间6D姿态数据集与基线
首个真实农田草莓6D姿态数据集及合成数据,揭示并量化仿真到现实差距。
面向多GPU高斯泼溅的可扩展PyTorch抽象
提出多GPU高斯泼溅PyTorch抽象,通过CUDA统一内存和NVLink分布参数,实现十亿级高斯泼溅的城市规模重建。
3D-CBM:生成式三维建模中基于概念的可解释性框架
提出3D-CBM框架,将概念瓶颈模型融入3D生成,实现可解释性和交互式修正,实验概念预测准确率88.8%。
SceneMiner:身份保持多任务微调用于统一BEV场景挖掘
SceneMiner通过身份保持多任务微调消除跨任务干扰,仅训练~102k参数即输出互补挖掘信号。
Adv-TGD:面向人脸识别冒充攻击的对抗性文本引导扩散方法
提出Adv-TGD框架,基于扩散模型与文本引导,实现高成功率(85.90%)人脸冒充攻击,兼具高视觉保真度。
AVIS:面向视觉语言模型的自适应测试时缩放
AVIS通过无训练剪枝和难度预测,自适应调整视觉与推理计算,优化准确率与成本权衡。
4DP-QA:面向视觉语言模型中4D感知的可扩展问答
提出4DP-QA数据集与True-Motion Tracking方法,解耦物体与相机运动,提升VLM的4D场景理解能力。
自然环境下的机器人感知跨模态基准测试
WildCross基准测试揭示当前视觉模型在自然环境中感知的局限性,提供476K帧RGB及深度数据用于地点识别与深度估计。
中文标题:使用深度相机的非接触式3D人体测量用于智能健康监测
中文摘要:利用深度相机3D点云非接触测量人体尺寸及体积表面积,为智能健康监测提供基础。
条纹投影轮廓测量中的空间耦合相位-深度标定
提出空间耦合相位-深度法,像素共享全局映射加平滑修正,消除伪影,精度与立体参考相当,空间一致性显著提升。
关于对齐层次化标准化嵌入的音频-视觉广义零样本学习
提出AHSE方法,通过标准化和层次对齐解决音频-视觉与文本模态差异,实现广义零样本学习竞争性能。
冷冻基础模型嵌入在胸部X光检查中丢弃小病灶信号:对部署前评估的启示
冻结ViT全局聚合丢失小病灶信号,但可通过patch令牌结合感兴趣区域恢复。
FreqKD:面向红外目标检测的频率解耦跨模态知识蒸馏
FreqKD通过低频严格MSE与高频松弛log-MSE解耦蒸馏,提升红外检测性能,在KAIST数据集上达64.1 mAP50,超越基线2.4点。
理解跨传感器特征变化以实现可泛化的3D感知
频域源域变化建模合成多样视图,正则化融合表示,无目标域样本提升跨数据集雷达-相机3D检测鲁棒性。
用于航天器6D姿态估计的精度感知光照解耦视觉Transformer
提出PAID-ViT,通过解耦光照与结构、估计区域可靠性等,在挑战性光照下降低平移误差,提升鲁棒性。
运动增强外观:面向微手势在线识别的RGB-骨架门控残差融合
提出双流RGB-骨架门控残差融合模型DyFADet+,微手势在线识别F1达40.88排名第二。
中文标题:无标签多标签识别中视觉语言模型从标志性到包容性的适应
提出无监督框架,通过“切割”与“缝合”两阶段,使VLM从标志性转向包容性,实现无标签多标签识别,性能超越现有方法。
学习实例自适应低秩正交子空间用于换衣行人重识别
提出Ortho-ReID,从VLM文本构建低秩服装子空间,用几何约束提取正交衣着不变特征,在PRCC等数据集上显著提升性能。
MedCTA:临床工具代理基准
MedCTA基准评估临床多步骤工具任务,发现前沿模型在调用、稳定性等方面脆弱,需提升可靠性。
参数高效适配器微调用于表格-图像多模态学习
提出TI-Adapter,冻结表格编码器并以适配器微调图像分支,20数据集上以较少参数达到或超越全微调性能。
ARGUS: 堆叠多视角身份马赛克注入用于主体保持视频生成
Argus通过堆叠多视角身份马赛克注入实现动态身份记忆,结合反事实自监督,显著提升视频生成主体保持鲁棒性,达SOTA。
先推理,再重新推理:跨视角回顾提升空间推理能力
提出ReRe框架,通过跨视角回顾进行两阶段推理,无需训练即显著提升空间推理性能。
RankVR:低秩结构感知与价值重校准用于鲁棒组合图像检索
提出RankVR,利用低秩结构感知和语义价值校准,解决组合图像检索噪声问题,显著提升鲁棒性。
DroneShield-AI: 面向争议空域实时自主无人机威胁检测、行为意图分类与群体智能的多模态传感器融合框架
提出首个多模态融合反无人机框架,实现96.1%检测精度与30秒威胁预警,成本约500美元。
ERN-Net:用于文档二值化的演化推理节点网络
提出ERN-Net,通过演化推理节点增强退化区域,结合ConvNeXt-Tiny与DIBCO预训练,实现低数据内存下的高效二值化。
MultiToP:学习修补视觉标记以缓解视频大多模态模型中的幻觉
提出MultiToP框架,通过动态全局修补令牌替换不可靠视觉标记,减少视频大模型幻觉,F1提升50.6%,准确率提升18.58%。
从提示到令牌:将因果监督内化到视觉语言模型中用于多图像因果推理
BridgeVLM将因果图转为因果令牌内化,通过RAMP层和M3S接口,显著提升多图像因果推理,干预准确率54.4%,结构F1 75.1%。
基于迁移学习的X射线图像电池检测
利用迁移学习检测X射线图像中的锂电池,精度达94%,推理时间22毫秒。
A Comprehensive Ecosystem for Open-Domain Customized Video Generation
关注重点:面向3D高斯泼溅的基于公共随机性的感知封装器
提出2D感知封装器,利用伪随机噪声和Wasserstein损失增强纹理,显著减小模型尺寸并提升感知质量。
衔尾蛇-空间:闭合空间推理的数据-模型循环
提出自我进化框架,模型兼作提问者与解答者,通过闭环动态调整训练难度,用更少样本显著提升空间推理性能。
公共交通车辆多视角座舱监控系统
推出含同步RGB-D与LiDAR数据及3D人体姿态标注的公共交通座舱监控数据集,支持多视角3D检测模型评估。
UniReason-Med:医学VQA中二维到三维迁移的共享基础推理接口
共享推理接口利用2D医学图像监督,提升3D VQA性能,实现推理结构从2D向3D的迁移。
AnchorEdit:通过因果记忆在多轮图像编辑中保持时间一致性
AnchorEdit利用因果记忆与自回归扩散,克服多轮编辑身份漂移和错误累积,实现高分辨率长序列稳定编辑(10+轮)
中文标题:基于时空场景图基础的规划与验证视频奖励推理
中文摘要:SG-PVR通过规划-验证推理和时空场景图,系统检查提示条件,实现显式视觉证据的细粒度语义对齐。
Wild3R:基于无约束稀疏照片集合的前馈式三维高斯溅射
提出Wild3R前馈方法及WildCity数据集,从无约束稀疏照片学习外观一致性并去除瞬态物体,性能超越现有前馈方法。
低光照3D高斯泼溅中伪地面真值生成的场景自适应非线性色调曲线
提出场景自适应非线性色调曲线,替代线性伪GT,PSNR提升最高4.34dB,改善低光照3D重建质量。
SheafStain:面向空间与生物学一致性虚拟染色的层论薛定谔桥方法
提出SheafStain,用层论与薛定谔桥解决虚拟染色中空间不连续和上下文污染问题,实现一致染色。
SG2Loc:基于3D场景图的时序视觉定位
提出轻量级时序视觉定位方法,利用3D场景图与粒子滤波语义匹配,降低存储开销保持性能。
面向动态多模态上下文学习的任务感知结构化记忆
TASM通过任务向量压缩与语义合并构建动态记忆,高效平衡多模态上下文学习的性能与适应性。
使用开放人脸图像质量标准的身份证图像质量评估
应用OFIQ度量评估身份证图像质量,可显著提升呈现攻击检测性能。
面向自动驾驶危险检测的视觉-语言模型任务对齐稳定性分析
VLM鲁棒性依赖腐败类型,嵌入漂移难预测危险检测,存在假阴性与假警报不对称失败模式。
TextHOI-3D:基于离散多视图生成与联合网格优化的文本到三维手物交互
TextHOI-3D框架利用多视图视觉令牌作为中间表示,实现文本到三维手物网格生成,显著提升几何精度和物理合理性。
LASA:一种面向开放词汇场景草图语义分割的弱监督方法
LASA跨层聚合注意力,弱监督下引导语义对齐,在三个草图数据集上mIoU提升3.43-15.74
用于人脸识别的视觉Transformer需要更多寄存器令牌
引入寄存器令牌消除注意力伪影,提升可解释性和性能,ViT-8R在IJB-B/C基准上达SOTA。
ParseFixer:一种通过选择性多模态纠正的文档解析智能体框架
提出选择性多模态纠正的智能体框架ParseFixer,提升文档解析准确性,获DataMFM挑战赛第三名。
通过LLM引导的视频拼接进行手语翻译的语料增强
提出无需人工标注的语料增强方法,利用LLM和视频拼接合成数据,SLT任务BLEU-4提升2.92。
从内容到知识:基于神经知识表示的闪电快速长视频理解
将长视频编码为神经知识表示,挂载冻结VLM实现极速查询,性能媲美SOTA,延迟降低两个数量级。
FitVTON:通过身体-服装尺寸控制实现合身感知的虚拟试穿
FitVTON通过尺寸控制与纹理校正实现真实合身虚拟试穿,显著提升尺寸准确性和形状保持。