DataEvolver:自我进化的多智能体数据构建方法用于文本丰富图像生成
DataEvolver利用被拒绝样本反馈,自我进化构建文本丰富图像数据,显著提升生成质量。
SimpleSearch-VL:多模态智能体深度搜索的简易方案
SimpleSearch-VL通过改进搜索验证过程,实现高效可靠实用的多模态智能体搜索,少量数据即可媲美顶级模型。
全自动高精度分割OCT中的视网膜萎缩与椭圆体区厚度:真实世界GA监测的可靠工具
提出全自动深度学习框架,高精度分割OCT中GA生物标志物(RPE/EZ丢失及变薄),Dice达0.88,ICC>0.98,可靠用于真实世界监测。
基于双流强化学习的令牌稀疏医学多模态推理
ViToS用双流强化学习裁剪视觉令牌,在医学推理中性能提升超100%,加速推理。
DPPE:重新思考基于相机的位置编码以扩展多视图Transformer
提出解耦姿态位置编码(DPPE),解决扩大训练时性能停滞问题,实现稳定长时训练并提升泛化。
用于生物特征验证的稀疏性诱导散度损失
提出Q-Margin损失,引入概率化边际,保持α-散度稀疏性,在生物特征验证中性能优异,尤其低假接受率下表现突出,训练高效。
学习多视图雷达语义分割的结构一致表示
提出可学习超图与最优传输对齐框架,捕获高阶依赖并融合多视图,提升雷达语义分割精度,在CARRADA和RADIal上分别达63.8%和83.4% mIoU。
Preserve the Hard, Regenerate the Rest: Uncertainty-Guided Synthetic Training Data Augmentation with Diffusion Models
GUI代理真正需要什么样的记忆?从被动记录到主动任务驱动状态
提出ATMem将GUI代理记忆从被动存储转为主动执行状态,通过STR-GRPO强化学习选择性使用记忆,提升长程任务可靠性。
基于多模态代理AI与主动波浪补偿的鲁棒自主无人机海上平台着陆
提出双DRL代理框架,实现无人机海上平台100%着陆成功率,高效稳定甲板水平。
LiteMatch:通过代价体稳定化的轻量级零样本立体匹配
LiteMatch以代价体稳定化实现轻量级零样本立体匹配,参数少、泛化强。
中文标题:CVPR 2026 RoboSpatial挑战技术报告:面向具身空间推理的选择性推理激活与参考框架消歧
中文摘要:提出RoboSpatialBrain,结合强制推理激活与参考框架重定向,在CVPR 2026挑战中以80.9%成功率夺冠。
PrISM-IQA:面向智能手机摄影的实用化图像质量评估
PrISM-IQA提出多问题有序诊断,预测严重级别,实现实用化图像质量评估,支持ISP调优。
直方图约束图像生成
提出直方图约束图像生成(HIG),通过最优传输实现精确的分布约束,平衡全局与局部控制,并可嵌入信息。
WIDER-FAIR:用于公平性评估的WIDER-FACE数据集标注版本
构建WIDER-FAIR数据集,标注种族性别,发现黑人检测性能低且排除后公平差距增大。
SAMBA:面向SAR目标识别的散射引导掩蔽双向Mamba基础模型
SAMBA模型采用线性复杂度的Mamba编码器和散射引导掩蔽策略,在SAR目标识别任务上达SOTA,参数更少。
WorldRoamBench:面向交互世界模型长期稳定性的开放世界基准
提出WorldRoamBench基准,从动作、视觉、物理、记忆四维度评估交互世界模型稳定性,测试显示无模型完全达标。
ShellMaker:结构约束下的语言引导外部补全
提出语言引导框架,在结构约束下补全建筑外部网格,提升风格一致性。
REDI: 面向DINOv3令牌缩减的语料感知补丁排序
REDI结合TF-IDF和注意力图排序补丁,减少46.8%令牌,Top-1达84.706%,超基线。
内在稳定的脉冲神经网络:克服无批归一化下的性能障碍
提出IS-SNN架构,用拓扑感知权重标准化和残差连接实现无BN稳定信号,性能媲美动态BN,资源消耗降低96.4%。
基于双范围体素表示的语义占用预测
提出双范围体素表示,融合单扫描点云的视角特征,提升预测精度与速度。
Phantom:一种具有潜在与空间约束的统一换脸深度伪造防护框架
提出Phantom框架,联合潜在与空间约束,自适应合成目标并施加掩蔽扰动,显著提升换脸深度伪造防护成功率与视觉质量。
面向扩散模型遗忘的稀疏自编码器:只看不碰
稀疏自编码器可检测概念,直接干预易致伪影;用无目标嵌入替换目标区域可干净擦除,揭示检测与干预的差距。
记忆增强LSTM自编码器用于IMU传感器融合的无监督活动识别
提出无监督记忆增强自编码器融合多IMU传感器,短窗内提特征,准确率达96.6%和98.4%
GeoISF:实例语义森林启发的大规模跨视角地理定位——基于地面激光雷达到卫星图像
GeoISF利用WordNet构建实例语义森林,提升跨视角定位的语义匹配,性能显著优于现有方法。
GPU加速的基于块体倒塌动力学的逆向结构拼合
提出JIP-2框架,利用GPU加速物理引擎与深度学习,从倒塌图像逆向重建原结构,实现自动化拼合。
无标签驾驶场景复杂度检测:基于联合嵌入预测架构
利用自监督潜世界模型的时序预测误差,无需标签即可检测驾驶场景复杂度,有效识别安全关键场景。
图像自回归生成的数据溯源
提出事后溯源框架,通过生成图像特征模式追踪自回归模型来源,无需修改生成过程。
地理空间矢量数据自动质量评估:一种基于空间表征学习的GeoAI方法
提出Topo4Vec框架,通过拓扑模拟和空间表征学习自动检测矢量数据错误,建筑重叠识别准确率达0.99,街道网络缺陷达0.60,实现可扩展质量监控。
RADIANT-PET:基于大语言模型和强化学习的推理增强型PET/CT病变分割
RADIANT-PET利用大语言模型推理与强化学习,抑制生理性假阳性,显著提升PET/CT病变分割精度。
SoccerNet 2026 以球员为中心的球类动作识别:基于一致性集成的单球员注意力机制
提出两阶段流水线,优化时空注意力与加权集成融合,宏F1从48.6提升至58.94。
少类保真度:通过优化扰动评估真实条件下CNN分类器的解释
提出面向少类场景的保真度评估指标,用优化扰动测量XAI可靠性,揭示领域与解释方法关联。
面向纵向胸部X光报告的过渡感知最佳N采样
提出过渡感知最佳N采样,无需训练,通过集合间距离编码变化,用于纵向胸部X光报告生成,性能优于随机选择。
AEGIS:面向视觉传感器的鲁棒对抗检测的语义GAN与证据学习框架
提出AEGIS框架,结合语义GAN与证据学习,在Tiny ImageNet上AUROC达92.1%,优于传统检测方法。
JASPR:组织学与空间基因组学的联合空间表征学习,用于改进虚拟基因组筛选和临床预后
JASPR框架通过跨模态重建学习组织学与空间基因组学的联合空间表征,提升乳腺癌基因预测和预后能力。
RadarTwin:面向移动式室内感知的场景特定毫米波雷达模拟与学习
基于3D重建与视觉语言模型合成雷达训练数据,零样本识别达2.5倍概率,少量标注达95.3%。
CLOSER-VLN:用于空中视觉语言导航的闭环自验证检索增强推理
提出闭环自验证检索增强推理方法,无需训练策略,有效减少空中导航累积误差,在CityNav上提升性能。
视觉驱动的偏好合成以缓解VLM幻觉
ViPSy框架利用视觉线索构建偏好数据,显著降低VLM幻觉率,提升视觉能力。
使用关键相关层注意力增强层间交互
KCLA通过关键相关机制实现线性复杂度,保持动态更新和跨层连接,提升多种视觉任务性能。
元学习作为类人视觉表征的原理
元学习无需人类数据,训练的表征即能预测人类相似性、语义规则和高级视觉皮层,体现快速学习新语义关系的需求。
面向资源受限视觉物联网系统的语义感知生成式图像传输
提出语义感知生成式图像传输框架,在0.074bpp下以44.6%比特达到29.9dB PSNR,优于DeepJSCC/WITT。
DCSNet:用于医学小目标分割的检测引导分层裁剪与多尺度特征聚合
DCSNet通过检测引导裁剪与多尺度特征聚合,解决医学小目标分割的类别不平衡和边界模糊问题,显著提升精度。
RSGPNet:用于遥感开放词汇语义分割的几何提示
提出无需训练的几何提示框架RSGPNet,利用几何区域和一致性约束优化分割,显著提升遥感复杂区域精度。
MedDiffuseMix:利用显著性感知扩散模型保留诊断证据的医学图像数据增强
提出显著性引导扩散混合框架,对低重要性区域进行增强,保留诊断证据,提升分类性能。
SatSplat:面向卫星影像的几何精确高斯泼溅法
提出SatSplat框架,用2DGS与在线相机调整,处理光照变化,几何精度高,MAE降11.93%,显存降31%。
DiffRGD: 通过黎曼梯度下降的推理时扩散引导
DiffRGD通过黎曼梯度下降保持潜在高斯分布,实现推理时引导,无需重训,提升图像恢复与条件生成性能。
基于反事实视觉基础不确定性检测LVLMs中的临床幻觉
通过反事实实体扰动对比事实与反事实定位结果,检测LVLM幻觉,提升性能并提供可解释定位。
JuZhou 1.0技术报告:首个完全在中国自主研发AI加速器上训练的、原生于边缘设备的文生图基础模型
JuZhou 1.0是首个纯国产AI加速器训练的轻量边缘文生图模型,0.387B参数,4步推理1.6秒,GenEval 0.69超SDXL。
CLEAR-MoE:通过校准驱动层选择从冻结视觉Transformer中提取共享基专家
CLEAR-MoE将冻结ViT转为MoE,共享SVD基保持99.9%精度,路由几乎不影响性能。
MammoFlow:基于解剖一致性流匹配的多视角乳腺X光图像合成
提出MammoFlow,利用视角几何关系与对齐模块生成物理一致的多视角乳腺图像,提升分类AUC 5%。