RubricRL:用于文本到图像生成的简单可泛化奖励
提出RubricRL框架,构建结构化评价清单并自适应加权,提升文本-图像生成的忠实度、细节与泛化性。
学习编码-解码方向对以揭示深度视觉网络中的影响概念
提出无监督方法学习编码-解码方向对,通过方向聚类和概率估计揭示概念表示机制,并在合成和真实数据上验证有效性。
GH-ESD:基于假设驱动的实例级视觉任务错误切片发现
提出GH-ESD框架,通过假设生成与验证发现实例级错误切片,提升检测分割任务性能,引入GESD基准。
MATANet:一种面向海洋物种细粒度水下识别的多上下文注意与分类感知网络
提出MATANet,通过多上下文注意力与层级分类感知,在细粒度水下物种识别中大幅超越基准,适用于自动化海洋监测。
基于DINOv3的零样本图像匹配:多对多关联方法
提出DINOv3多对多关联零样本匹配,用最大似然估计和两阶段LO-RANSAC实现鲁棒几何匹配。
WHU-PCPR:面向复杂城市场景地点识别的跨平台异构点云数据集
提出WHU-PCPR跨平台异构点云数据集,覆盖复杂城市场景,含82.3km轨迹,用于地点识别研究。
MVGD-Net:一种新颖的运动感知视频玻璃表面检测方法
提出利用运动不一致性线索的视频玻璃表面检测网络MVGD-Net,含跨尺度多模态融合与时序注意力模块,性能超越现有方法。
对齐稳定修复:抑制多余物体插入并保持颜色一致性
提出ASUKA框架,用重建先验抑制物体幻觉,专用VAE解码器保持颜色一致,提升修复效果。
语义丰富性还是几何推理?VLM视觉不变性的脆弱性
现代VLM在几何变换下视觉不变性脆弱,语义稀疏时性能骤降,揭示语义理解与空间推理的差距。
强化特征:面向多光谱地球观测的双教师蒸馏
提出双教师对比蒸馏框架,融合多光谱与光学教师进行跨模态学习,分割/检测/分类分别提升3.64/1.2/1.31个百分点。
当视觉证据模糊时:空想性错觉作为视觉模型的诊断探针
空想性错觉诊断视觉模型:行为由表示方式决定,低不确定性可意味安全抑制或过度解释,揭示语义鲁棒性差异。
为什么视觉语言模型难以识别人体情绪?
VLM因长尾偏见和时序信息缺失难识情绪,通过中间帧语言摘要改善。
CNS-Edit++:基于耦合神经形状表示的类别无关3D编辑
提出基于耦合神经形状与特征体积优化的3D编辑框架,支持多种编辑操作及区域控制,性能优于现有方法。
基于联合位置嵌入和遮挡级注意力的遮挡感知全景分割
提出PEMOLA模块,结合遮挡分类器与联合调制,提升遮挡下全景分割质量。
ScaleMoGen:人类运动生成的逐尺度自回归预测
ScaleMoGen通过多尺度离散token粗到细自回归预测生成运动,实现SOTA性能并支持无需训练的文本引导编辑。
提升具身世界模型用于规划与控制
用轻量策略将高层动作映射到低层关节,构建提升世界模型,降低搜索维度,规划效率提升3.8倍。
测试时寄存器作为令牌化图像生成的全局先验
RegToken利用寄存器结构转化为无需训练的全局先验令牌,提升生成质量并加速优化。
多任务情感识别中的参数隔离专家强度奇偶集成方法
提出强度奇偶规则和参数隔离专家,实现专家去相关,在多任务情感识别中验证分数达1.6949,远超基线0.45。
PC-Seg:基于稀疏二维标注的三维OCT分割的渐进式跨视图一致性方法
PC-Seg利用稀疏2D标注和跨视图一致性训练3D OCT分割模型,仅用0.7%标注数据达到全监督精度。
放弃之前再看一眼:预算约束下的符合证据获取用于可靠视觉语言模型
LVLM幻觉严重,现有方法需放弃80%声明。BCEA引入三选决策,在预算内获取证据,提升可靠性。
PAVXploreRL:面向物理-动作-视觉世界模型的强化学习与动作探索
提出PAVXploreRL框架,通过奖励驱动优化物理、动作、视觉目标,结合分布内轨迹与噪声驱动的分布外动作探索,提升泛化与性能。
MoGe-3:自引导稀疏体素精化的精细细节单目几何估计
MoGe-3通过自引导稀疏体素精化将单目几何估计从2D提升至3D,实现高保真度量点图,显著提升局部细节恢复效果。
深度估计器是用于3D场景几何修复与重建的隐式神经场
提出神经深度场(NDF),将深度估计器视为隐式场,通过单次测试优化解决不一致与不可靠问题,实现高保真全局一致几何修复。
3D FaceShell:作为VLM防御机制的3D面部化身属性迁移
3D FaceShell用可学习高斯壳产生细微扰动,使VLM对3D面部属性推断出错,同时保持身份和外观不变。
是什么使得语言表征成为人类大脑高层视觉感知的良好模型?
语言模型图像描述可预测大脑高层视觉响应,机器描述与文本嵌入器效果更优,中间层表现最佳,是研究视觉感知的有效工具。
GenSyn10:用于图像分类基准测试的多生成式AI数据集
GenSyn10含6万张合成图像,评估分类模型泛化力,微调后已知生成器准确率达99%,未知生成器降至79-96%。
仿人运动:基于自运动归一化时间特征的毫瓦级硬件实时空中人体跟踪
提出EMTS-Det,用自运动归一化残差运动通道和小网络在RPi上31.85FPS跟踪,AP25达0.462,远超YOLOv8n。
JEPA预测器:面向遮挡特征补全的可迁移算子
JEPA预测器可跨编码器迁移,通过线性投影补全遮挡特征,在重遮挡下显著提升分类精度(如Stanford Dogs提升36个百分点)。
ForensicNet:轻量级注意力增强的MobileNetV2自动人脸识别
提出轻量级注意力增强的ForensicNet人脸识别框架,结合MobileNetV2与CBAM,两阶段迁移学习,准确率达92.4%且计算量低。
可信赖的风险感知人脸检索(RA-FR)新进展
提出风险感知人脸检索,融合盲修复、自监督特征与共形预测,在5%风险下平均检索10张图像,实现可靠可审计的监控人脸检索。
MAC 2026:推动微动作分析迈向细粒度理解
第三届MAC挑战赛聚焦微动作细粒度理解,引入多模态大语言模型评估,总结数据集与优胜方案。
部分标注多任务面部情感识别的共享潜在变量
共享潜在变量方法处理部分标注多任务,在仅37%全标签数据上将表情F1提升至0.446,突破动作单元上限,验证表示瓶颈而非损失函数。
轨迹感知的跨视角地理定位与序列观测
提出融合视频与路线描述的跨视角地理定位框架,利用轨迹几何提升匹配精度,显著优于现有方法。
手工特征学习与卷积神经网络用于面部表情识别的实证研究
CNN在复杂数据上表现最佳,HOG在受控环境有效,LBP最差;数据集复杂度是关键。
部分信息分解作为资源受限深度神经网络脑肿瘤分割训练的多对比度3D MRI选择策略
部分信息分解预选输入对可接近全输入性能,降低脑肿瘤3D U-Net训练计算成本。
重新思考读出:解锁视频骨干网络用于AI生成视频检测
V-PVP轻量读出替换聚合层,双流处理patch速度场,冻结骨干达95.28 AUC。
广义少样本基准下的无需训练开放词汇3D点云分割
无需训练与标注,通过跨视图一致性融合冻结模型,在广义少样本3D点云分割中显著提升新类精度。
通过强化学习进行推理引导的部件级视觉定位
提出对象-部件层级反射定位法,先定位父对象再定位部件,4B模型经部件感知GRPO训练后超越7B模型。
GS-RealBlur:一种灵活的实世界图像去模糊数据采集框架
GS-RealBlur框架通过手持相机与云台结合、3D重建配准,生成高质真实模糊-清晰数据集,显著提升去模糊模型泛化性能。
中文标题
无监督关键点跌倒检测框架,遮挡及带宽受限下优于监督方法,隐私保护强。
显式优于隐式:通过复数结构张量表示增强CNN用于眼周识别
复数结构张量提供显式方向先验,使CNN眼周识别准确率提升,EER降低5-26%。
筛查性乳腺X线摄影AI中的数据集来源特征与捷径学习:一项跨数据集案例研究
简单合并异常富集外部数据引入域偏移,抵消额外正例收益,导致AI性能下降,需域感知策略。
SLAPBench:四指SLAP指纹验证的多模态大语言模型基准
首个四指SLAP指纹验证MLLM基准显示提示方式控制模型崩溃,模型能力决定判别性能。
针对人脸识别的有意电磁干扰攻击
揭示生物传感器物理-数字管道漏洞,用常见射频设备实施电磁干扰,评估人脸识别鲁棒性,提供新基准数据集。
基于LLM驱动的跨语言手写OCR自动机器学习:利用GPT-5、GPT-4o和Claude Sonnet 4的闭环神经架构搜索
LLM自主搜索神经架构,跨语言手写OCR准确率超93%,最佳98.1%,推理延迟41-44ms。
基于物理感知掩码扩散的城市鱼眼灾害检测洪水模拟
提出PhysFlood,用扩散模型从单张鱼眼图像合成逼真洪水,可自由控制水位等变量,实现高精度模拟。
从校正立体视觉中几何蒸馏:利用极线线索进行单目深度估计
提出EpiDistill,通过校正立体令牌蒸馏极线注意力,将多视图尺度先验转移至单目模型,显著提升零样本度量深度估计。
改进的VBGS:实时连续变分贝叶斯高斯溅射
通过空间截断变分推理和改进重分配,实现实时连续重建,延迟从84秒降至0.05秒,提速1680倍。
E3DGS:颜色即几何嵌入下的三维高斯泼溅统一几何-光度等变性
统一颜色-几何嵌入实现SE(3)等变高斯泼溅,无需张量积,提升鲁棒性与数据效率。
视觉地点识别是否所有令牌都必要?面向高效推理的令牌缩减实证研究
本研究首次系统评估令牌缩减在视觉地点识别中的应用,可减少29%计算量、提升44%吞吐量,准确率仅降不足1%。