面向流式说话人头生成的解耦自强迫蒸馏
音频融入身份解耦低维运动空间,小因果模型生成运动潜变量并经扩散渲染;解耦自强迫蒸馏令两模型并行流式,15.4 FPS、1.3秒延迟、质量无损。
ScopeMamba-YOLO:面向遥感影像小目标检测的内外感知范围拓宽
提出ScopeMamba-YOLO,以离路零门控选择性扫描解耦上下文与卷积,配合CGCM、SS-PAN等提升遥感小目标检测,VisDrone上mAP50达52.6%。
FreqFLD:基于频率调制实现一体化人脸关键点检测
FreqFLD以频率调制与频率感知专家混合,提升复杂场景下跨数据集人脸关键点检测泛化。
TransGaze-Object:真实驾驶场景下基于Transformer的驾驶员注视对象预测框架
提出基于Transformer的端到端框架,直接预测驾驶员注视对象;构建UD-FSG数据集,准确率达60%,优于PoG关联的51%。
TRACE:面向高效GUI智能体的轨迹鲁棒准入与证据排序
TRACE免训练,用轨迹鲁棒证据排序与覆盖保留剪枝GUI视觉token,并单调收缩KV,降低推理开销。
真实世界与临床环境人体运动挑战赛(MoCha)@ECCV2026 第三名方案:面向域泛化UPDRS步态严重程度估计的语言对齐运动表征
提出语言对齐运动表征与域模型合并,在MoCha未见站点获第三,Macro-F1达0.57。
SynThermFace:通过合成数据生成扩增有限配对数据用于可见光-热红外人脸识别
SynThermFace借助扩散模型将少量真实可见光-热红外配对扩增为大规模合成配对,训练跨谱人脸识别模型,推理仅需单次前向。
UOT-Gap:基于非平衡最优传输的视觉语言模型模态差距变分原理
免训练UOT-Gap以非平衡最优传输分解模态差距,成对残差追踪检索退化,评估字幕质量与对齐鲁棒性。
无坐标几何:LiDAR扩散作为三维特征桥梁
以LiDAR条件扩散模型桥接2D先验与3D点云,无坐标特征中自发形成结构化三维表示。
高光谱图像分类的降维方法
面向高光谱卫星图像监督分类,比较PCA、LDA降维及KNN、SVM、RF分类;真实数据中PCA+RF总体精度与Kappa最高。
超越"一刀切":面向MLLM视觉Token剪枝的样本自适应策略路由
提出即插即用轻量路由器VIP-Router,按样本自适应选择视觉Token剪枝策略,显著提升准确率。
Spot-the-shift:评估长期变化的视觉定位图像差异描述
提出人类验证基准SPOT-THE-SHIFT,评估长期变化的视觉定位图像差异描述;现有MLLM表现不佳,合成数据可提升且不损通用能力。
视频为何仍然如此昂贵?视频与视听大语言模型中的推理效率机制综述
综述视频/视听大模型推理效率机制:帧采样、模态编码、词元压缩、预填充解码,汇总精度—成本,指出视听与评测缺口。
超越弱标签:面向高分辨率多光谱影像弱监督水体分割的提示引导局部细化
提出两阶段弱监督水体分割框架,将初始掩膜转为结构化提示做局部细化,提升IoU/F1并改善岸线与细结构。
SceneHI:可控光照的高分辨率三维一致场景纹理合成
SceneHI将2D扩散先验用于3D纹理合成,无需微调或优化即可生成高分辨率、三维一致且带烘焙阴影的场景纹理,速度提升80%。
形状引导的高斯泼溅用于稀疏视角X射线三维重建
提出形状引导高斯泼溅框架,以解剖形状先验约束高斯基元与密度,5视角X射线重建PSNR提升2.83dB
学习适应与校准:面向医学视觉语言模型小样本不确定性预测的分数分布对齐
所提方法重加权校准分布,对齐支持集与查询集分数,无需查询标签缩小小样本医学VLM适配的共形覆盖偏差。
PACE:面向QoE高效检索增强对话服务的感知时延级联服务路由与填充控制
PACE以感知首响时延为QoE目标,联合级联路由与填充控制,P95降半且优于RAG 2.4倍。
可编程世界模型
将世界状态演化与视觉渲染解耦,以自然语言程序维护持久全局状态,实现可编程长时程交互世界模型。
具有中心不变偏移与边缘感知掩膜的增强可变形卷积
提出增强可变形卷积,结合中心不变偏移与边缘感知掩膜模块,抑制无效形变,语义分割性能超越主流可变形卷积变体。
X射线层析纳米成像中基于数据一致性扩散先验的先进脑组织成像
提出LUCID,融合多视角扩散先验与投影域数据一致性,恢复X射线层析缺失锥信息,提升脑组织成像保真度。
AgroVisNet:面向萝卜、马铃薯与尖瓜病害分类的轻量级卷积网络及BD-PlantDX专家验证基准
轻量网络AgroVisNet与专家验证基准BD-PlantDX,涵盖萝卜、马铃薯、尖瓜病害,准确率达99.52%。
跨模型一致性作为自动息肉分割的部署时可靠性信号
提出无参考RBQE框架,用独立裁判模型与主模型的分割一致性度量可靠性,跨架构裁判ROC-AUC最高达0.960。
人工智能素养与可持续发展:伦理治理与发展目标框架
AI素养可支撑17项SDGs;提出六级伦理框架,调查显示技术强而伦理治理准备不足,宜纳入课程与治理。
BrainTaskonomy:在fMRI基础模型中学习如何预训练与迁移什么
利用学习关系组织fMRI基础模型的预训练课程与迁移选择,显著降低重建误差并提升下游任务表现。
基于堆叠集成学习的水稻品种精准分类
提出堆叠集成模型,基于20类水稻图像实现100%分类准确率,并开发手机应用,助力防伪与质量控制。
Field Converter:几何初始化时序残差精化,实现足球转播中世界坐标系的球员姿态估计
足球转播中,几何初始化根节点,时序残差精化使根误差降至10cm,世界坐标MPJPE达13.2cm。
利用测试时部分观测引导图像到3D生成
提出免训练框架,用测试时部分几何观测,以射线一致占用似然引导图像到3D模型,显著提升几何保真度与视觉质量。
基于扩散模型的多样化实例生成:增强遥感图像小样本目标检测
用扩散模型生成多样化遥感实例切片并嵌入全图增强数据,小样本检测平均提升4.4%。
零样本学习中偏差的统计方法:手写识别视角
提出通用统计纠偏法:GZSL作黑箱,两阶段蒙特卡洛校正,大规模手写词识别未见词准确率提升超20%,约15维即可。
可控复制粘贴:面向遥感小样本目标检测的可控扩散增强方法
提出可控扩散复制粘贴,将小样本新类目标注入多样上下文并方向对齐,DIOR提升10.76%。
Arti-JEPA:将视频世界模型适配于声道实时MRI,用于语音产出分析
提出Arti-JEPA,用62小时无标注声道实时MRI自监督适配视频世界模型;冻结表征用于音素、口吃与术后分析,时间先验优于逐帧编码。
识别机器人世界模型中的习惯、物理与干扰
机器人世界模型将遥操作多模态拆为操作习惯、共享物理与干扰;冻结物理读出、只调薄接口,提升低样本迁移与抗干扰。
RealSimLoop:基于可微降阶仿真与视觉反馈的在线真实到仿真自适应
RealSimLoop:在降阶神经子空间内做可微仿真,借可微渲染以像素梯度在线优化材料参数,滑动窗口实现准实时的真实到仿真自适应。
CHIMERA挑战赛任务2和3:基于多模态数据集的膀胱癌患者应答亚型分类与进展生存预测
CHIMERA多模态挑战赛评估膀胱癌BCG应答亚型分类与进展预测,最佳F1 0.73、C指数0.68。
基于形态解耦的骨骼分类用于错颌畸形临床评估
TeethGNN解耦解码器从CBCT预测形态指标,图神经网络融合图像特征并协同校准,实现错颌畸形自动分级。
DCReg:面向高效退化激光雷达配准的解耦表征
DCReg解耦退化配准,Schur补检测、基对齐表征、预条件缓解,精度提高20-50%,加速116倍
自动可复现的相机内参标定
提出全自动相机内参标定流程,自动筛图并选径向畸变阶数,使留出集重投影误差降25%,选阶再降5%。