SurGe:点云地图中的表面几何改进
SurGe通过点梯度匹配损失和邻域注意力解码器改善局部表面几何,在零样本基准中达到最优平均秩。
KLIP:基于扩散先验的KL散度在逆问题中定位分布偏移检测
提出无需先验知识的KL散度度量,可检测并定位逆问题中的局部分布偏移。
EGOSTREAM:一种用于自我中心视觉中流式情景记忆的诊断基准
EGOSTREAM诊断基准通过AVW评估流式记忆,发现现有机制准确率约45%且低于实时,暴露架构缺陷。
基于学习到的成对初始化与几何优化的多相机-激光雷达联合外参标定
提出两阶段框架,结合成对学习初始化与几何优化,实现多相机全局一致标定,显著降低误差。
nuReasoning:面向长尾自动驾驶的以推理为中心的数据集与基准
nuReasoning是长尾自动驾驶的大规模推理数据集与基准,含2万片段和三种推理标注,提升VLM问答和VLA规划性能。
TunerDiT: 无需训练的渐进式引导扩散变压器用于多事件视频生成
无需训练的TunerDiT通过事件分区掩码和跨事件提示融合,实现多事件视频生成,在8项指标上达到最优。
野外伴随言语手势识别
首个大规模伴随言语手势数据集GRW(15.6万视频,150词类),用于训练模型分类、识别和定位语义手势。
CoFiDA-M:基于概念感知特征调制的仅图像推理跨域适应方法
利用MONET概念概率作为特权信息,训练教师网络并蒸馏出仅图像学生模型,显著提升跨域皮肤癌筛查中黑色素瘤召回率。
中文标题:利用紧凑高斯分布学习全局运动的前馈式4D重建
中文摘要:C4G框架用紧凑高斯令牌和视频扩散模型实现前馈4D重建,全局运动建模,无需相机位姿。
利用源域监督与未标注目标数据的鲁棒跨域泛化
提出自监督预训练与模型集成策略,利用源域标签和无标签目标域数据,跨设备Dice提升超6%。
通过噪声对齐解决扩散桥中的端点欠拟合
扩散桥端点欠拟合源于噪声失配,提出噪声对齐扩散桥(NADB),重构映射关系解决欠拟合,在图像恢复与翻译中验证有效。
GAP3D: 将VLM潜变量与补丁级嵌入进行生成式对齐以实现3D生成
GAP3D通过扩散对齐VLM潜变量与图像补丁级特征,实现模块化3D生成,无需大规模3D数据,具有多模态零样本能力。
成像逆问题的轨迹约束
提出无训练轨迹约束框架TRACE,通过耦合相邻状态稳定重建路径,提升成像逆问题质量。
使用扩散测地矩审计无训练三维形状检索
引入DGM审计无训练形状描述符协议效应,发现输入场与聚合协议主导结果,贡献可复现分析。
Embodied3DBench:视觉语言模型低级具身空间智能的基准测试
提出Embodied3DBench基准,评估6类低级空间智能任务,发现模型交互感知弱,大规模数据微调可显著提升。
基于方位向多普勒分解的Sentinel-1条带模式增强深度学习迭代框架
提出基于方位子孔径自监督增强框架,利用物理一致性生成数据,迭代推理提升图像质量,优于现有基线。
轻量级互补线索融合用于鲁棒视频人脸伪造检测
仅增292参数,融合低频小波去噪特征与相位谱或LBP,AUC提升约4%,低成本超越主流检测器。
GeRaF:基于神经网络的射频信号几何重建
GeRaF首次用神经隐式学习从射频信号重建3D几何,通过滤波渲染和物理管线克服低分辨率与噪声,实现毫米级重建。
透视箱子:基于雷达信号的非视距三维重建
利用外部视距几何引导射频传播,统一视距与非视距神经重建框架GeRaF 2.0实现稳定物理一致的隐藏几何重建,达新SOTA。
深度心理视觉图像表征
基于心理视觉的深度学习模型,利用频域与复数表示提升可解释性,降低对深度的依赖。
基于多信号先验和SAM2精细化的抗湍流动态目标分割
提出无训练多信号分割流水线,融合运动、语义先验与SAM2细化,在湍流场景取得0.425 mIoU。
运动引导的稀疏校正实现跨多种显微镜模式的专家级点追踪
RIPPLE以稀疏校正方式,在多种显微镜视频中实现专家级点追踪,将手动点击减少3-25倍,同时保持标注质量。
引导对比令牌信用分配用于离散策略优化
提出GCPO算法,通过对比正负提示预测差异实现令牌级信用分配,在文本-图像生成和思维链推理中优于GRPO和DAPO。
MetaRanker:人在回路的主动排序用于超透镜图像质量
提出MetaRanker,以语义可解释性定义超透镜图像质量,主动排序减少80%人工标注,排名与人类评估高度一致。
面向心外膜和纵隔脂肪的自动分割:一种基于受试者间配准和随机森林的多厂商方法
提出全自动分割心外膜和纵隔脂肪的方法,基于配准和随机森林,准确率98.4%。
使用哈希概率金字塔的欧拉高斯泼溅
用梯度优化概率密度替代启发式修剪,保留3DGS速度,实现SOTA重建质量。
SalsaAgent: 用于交互式舞蹈生成的多模态具身语言模型
SalsaAgent多模态语言模型通过运动令牌传递生成响应领舞和音乐的萨尔萨舞蹈,实现双人协调。
基于热成像图像的甲状腺结节分析方法
本文提出热成像结合图像处理与分类方法,用于甲状腺结节分析,旨在辅助早期诊断。
迈向道德的面部年龄估计:一种无需儿童数据训练的广义零样本基准
提出广义零样本基准,训练不包含儿童数据,评估显示模型在未见年龄组性能平均下降46.4%,存在已见类偏差。
高效长视频推理的语义与视觉证据:HD-EPIC VQA挑战的一种解决方案
提出语义与视觉证据双路径框架,动态检索整合实现高效长视频推理,在HD-EPIC VQA挑战中表现优异。
口袋牙医:通过高效多模态大模型实现设备端牙齿图像理解
Pocket-Dentist牙齿多模态问答基准发现紧凑模型(2B)准确率更高,计算成本更低,部署延迟降4.9倍,内存降2.3倍。
ViASNet:一种用于预测动态显著性和观众参与度的视频广告显著性网络
提出ViASNet模型预测视频广告动态显著性,利用熵诊断广告吸引力,加速广告设计与测试。
CapTalk:文本引导的风格化与语音驱动的3D头部动画
提出文本引导的语音驱动3D头部动画框架,实现风格与情绪分离控制及动态情绪变化,生成同步嘴唇运动和表情。
EarthShift:衡量地球观测中真实世界分布偏移鲁棒性的基准
首个遥感分布偏移鲁棒性基准,实验显示模型分布外性能下降15-20%,需提升鲁棒性。
面向零样本交通事故理解的多阶段VLM流水线
提出三阶段VLM流水线,结合32B和235B模型混合输出,零样本预测事故时间、位置和类型,在CVPR2026挑战赛中夺冠。
基于参考数据集几何结构的FID再思考
FID与样本质量不匹配受数据集密度和有效秩影响,集中数据FID趋势更佳,分散数据可能误导。
WorldMemArena:通过动作-世界交互评估多模态代理记忆
提出四阶段记忆生命周期基准,发现记忆写入不保证性能,视觉利用不足,系统不稳定。
正交负引导在注意力特征空间用于文本到图像生成
提出注意力特征空间的正交负引导法,通过正交化负提示特征抑制无关概念,保留期望语义,效果优异。
DMC-CF:面向因果推理的动态多模态反事实问答基准
构建真实视频多模态因果反事实基准DMC-CF,评估显示多模态大模型在真实场景因果推理能力亟待提升。
AnyMo:使用掩码建模扩展任意模态条件运动生成
提出大规模多模态数据集OmniHuMo和统一框架AnyMo,结合残差FSQ分词器与掩码建模变换器,实现任意模态组合的高质量运动合成。
ParCo-SDF:学习无先验的变形物体局部到完整有符号距离场
提出ParCo-SDF两阶段框架,时序编码结合FiLM条件预测,无需先验,实现变形物体高保真重建。
每类细胞一次点击即可分割全部实例
利用SAM特征聚类,无训练CoP递归扩展,性能超90%且超越全监督。
恢复策略引发的错误:面向鲁棒GUI智能体的基准测试与轨迹合成
提出GUI-RobustEval基准与RoTS轨迹合成框架,生成80万数据,微调模型在OSWorld达47.4%成功率,提升错误恢复能力。
摄影测量重建方法与3D高斯泼溅在路面粗糙度分析中的比较评估
比较四种重建方法,COLMAP敏感度最高,开源方案可用于低成本路面粗糙度评估。
Uni-RCM:面向多类异常检测的统一参考引导跨模态映射
提出Uni-RCM框架,通过参考引导块和残差量化器实现多类异常检测,在MVTec-3D AD上达最优性能。
FedSmoothLoRA:实现联邦低秩自适应中更平滑、更快的收敛
FedSmoothLoRA使用Round-Matching和Gradient-Aligned矩阵,解决联邦LoRA的更新空间、状态不匹配和初始状态问题,实现更平滑快速收敛。
FlowSeg:面向大语言模型条件分割的动态语义引导
FlowSeg通过双向语义流动态引导掩码生成,解决语义不对齐,实现更可靠匹配,达最优性能。
V2XCrafter:学习生成跨智能体的驾驶场景
提出V2XCrafter框架,通过渐进式多智能体扩散和跨智能体注意力机制生成一致的高保真街景,增强协作3D目标检测。
在CFMME上对大型视觉-语言模型进行基准测试:一个全面的中文金融多模态评估数据集
CFMME为中文金融多模态评测数据集,含6052实例,评估LVLMs显示问答准确率66.11%,检测等任务均分77.18,表明模型仍有较大提升空间。
ESAM++:高效的边缘端在线3D感知
提出轻量级ESAM++,用3D稀疏特征金字塔网络替代高计算量模块,实现推理速度3倍提升、模型缩小2倍,适合边缘设备。