面向实时检测管线的近零开销多模型分层分类实现
提出五步法实现DLA上的INT8分类器部署,与GPU检测器并发,管线开销近零(12.5对13.3FPS),通用性强。
ProBAG: 原型引导的边界感知图扩散用于弱监督组织病理学分割
原型引导的边界感知图扩散方法ProBAG:结合视觉与病理文本原型,经能量重校准和图扩散生成伪掩码,无需CRF,提升弱监督病理分割。
VOLA:基于VLM的语义属性预测提升开放世界驾驶
用VLM图像令牌预测可驾驶与脆弱性属性,免文本生成和SAM,开放世界异常迁移优于视觉及提示VLM基线。
PolarSym:用于CAD平面图解析的极坐标几何感知注意力
提出PolarSym,以极坐标解耦方向与距离建模几何关系,增强Transformer几何感知,低开销提升CAD平面图解析性能。
基于时序负知识迁移的反捷径蒸馏
提出反捷径蒸馏(ASD),用早期教师作时间负参考,将学生推出捷径方向,提升精度与鲁棒性。
CoDiR:置信度引导的扩散细化用于半监督组织病理学分割
提出CoDiR,用扩散模型细化低置信度区域,结合一致性训练,半监督病理分割性能领先。
双锚点,做得更好:用于零样本异常检测的层次化分组合并
提出双锚框架,以层次图像锚补充文本锚,增强视觉接地、降低提示依赖,在工业和医疗基准上实现强泛化。
LookBack:通过视觉引用使用对LVLM响应进行评分的方法与位置
提出LookBack方法,无需训练,通过视觉回看分数增强词元似然,提升LVLM响应评分与Best-of-N选择,开销极小。
GeoBridge:生成式图像地理定位中的解耦语义条件化
GeoBridge提出解耦语义条件机制,连接冻结语义MLLM与球面流匹配解码器,提升图像地理定位精度。
BoltNet:面向端侧植物物种识别的超轻量卷积网络
提出超轻量网络BoltNet,仅341K参数达0.682 F1,跨CPU/GPU/NPU高效运行。
扭曲地球观测以改进边缘边缘冰区的冰标注
提出基于互信息扭曲对齐多模态卫星影像,利用稀疏专家标注实现精确海冰分割。
你见你所画?:面向统一多模态模型整体评估的语义闭环框架
提出SGU零注释语义闭环框架,整体评估统一多模态模型。
HarmoniDPO:通过偏好优化扩散的视频引导音频生成
提出HarmoniDPO框架,采用双视频表示、在线偏好优化和双尺度扩散搜索,提升视频到音频生成的同步性和主观质量。
TD-VAD:文本驱动学习打破视频异常检测的视觉依赖
提出TD-VAD,用LLM生成文本描述训练VAD模型,免目标域视频数据,性能优于无监督方法。
干扰物感知的视频对象分割
提出干扰物感知方案,将干扰物独立分类,改进LWL方法,在DAVIS 2017上取得新最优结果。
Seed2GS:基于单参考视图定位的3D高斯场景免相机免训练目标提取
Seed2GS免相机免训练,基于单参考视图从3DGS场景提取目标,mIoU达92.1%,计算延迟仅9.3秒。
几内亚比绍腰果园遥感检测:基于卫星影像与主动学习的方法
利用哨兵二号影像和主动学习,实现几内亚比绍全国腰果园自动检测,平衡准确率达94%。
弱监督视频异常检测中帧级AUC的审计:粒度、分辨率与场景偏差
帧级AUC池化评估掩盖视频内定位差异,分辨率不足,且存在场景偏差。
SurfSVR:二维表面先验作为三维几何正则项用于稀疏体素重建
将二维表面先验作为三维几何正则项,通过区域化曲面建模引导稀疏体素重建,抑制碎片化与浮空伪影,提升质量。
LoSA:面向免训练视频扩散加速的近无损稀疏注意力
提出LoSA近无损稀疏注意力,固定99%注意力质量阈值,早期测量索引复用,达3.2倍加速且性能几乎无损。
先画这个
反转典型草图生成,预测二维场定义绘制顺序,从文本或图像生成有序矢量草图。
定量MRI映射中扩散模型不确定性的评估与校准
扩散模型不确定性有助于评估定量磁共振成像误差并支持选择性预测,但需校准才能进行定量区间解读。
临床部署还有多远?评估医学影像中完整无监督域适应流程
评估完整无监督域适应:无标签目标域选择难,验证器有差距;集成和少量标注可缩小但未消除。
预测函数而非特征:基于函数空间联合嵌入预测学习的KAN医学图像分割
提出函数空间联合嵌入预测学习(FS-JEPA),在KAN聚合前预测边缘函数,提升医学图像分割,平均Dice最佳。
通过定位去偏:弱监督空间异常检测的补丁级基准与基线
提出稀疏时空框架,动态聚焦异常区域抑制背景偏见,并发布补丁级空间标注与评估协议,可审计的弱监督空间异常检测。
勿忘显而易见——RISC:面向安全自动驾驶的风险知情切片覆盖协议
提出RISC协议,风险引导压力测试与覆盖评估,关键失效发现率从34%升至98.5%。
更好的槽位,更好的世界:对象中心世界模型的表示质量与鲁棒性
对象中心世界模型研究表明:槽位质量高则规划成功率高,可省去辅助输入,分布偏移下鲁棒性优于场景中心模型,预训练特征是关键。
SCOPE-Router:面向执行任务的成本感知开放集VLM路由
提出一种成本感知的开放集路由方法及执行型基准,经混合校准,在开放集评估中取得最优排名分数。
看看探针拖回了什么!MedCLIP中真实世界的胸片捷径
研究发现MedCLIP模型在各层存在捷径,局部与弥散性捷径出现深度不同,数据质量影响结论。
RA-CLIPScore:让生成模型评估更具可解释性
提出RA-CLIPScore,用双提示和局部补丁对齐空间分布,评估更可解释。
理解基础模型为何能有效检测扩散生成图像
基础模型检测扩散生成图像,依赖低中频分布差异而非语义特征,揭示其鲁棒性与可解释性。
Map-Det3D:面向流式输入的多视角三维目标检测的度量前馈三维重建先验
用前馈度量三维重建作几何骨干,直接在重建空间预测三维框,免去二维到三维提升,提升单目视频检测的稳健与迁移。
基于骨骼运动预测与关节级性能评估的自主远程康复
基于骨骼运动预测与关节级评估的自主远程康复系统,无标记视频上实现高精度质量分类与短期预测,助力康复。
Avatar-Forever:面向高质量实时无限虚拟形象的解耦并行训练
解耦并行训练框架Avatar-Forever,并行优化效率与鲁棒,配合分块缓存,实现实时无限虚拟人。
DPO中的上下文盲区:上下文校准偏好优化缓解MLLM物体幻觉
提出上下文偏好增益指标和上下文校准偏好优化算法,增强上下文利用,减轻物体幻觉,相对降低36%幻觉率
TGRHuman:基于扩散渲染器的文本引导真实感3D人体生成
提出TGRHuman,解耦几何与纹理,用多视图法线和几何雕刻保持一致性,用扩散渲染器生成纹理,高效合成高质量3D人体。
GeoFlow:基于几何对齐先验的高效驾驶视频生成
利用几何先验替代高斯噪声,缩短采样轨迹,大幅减少推理步数,实现高效驾驶视频生成。
基于报告弱标签与监督式裂缝分割的钻孔岩心自动分析
结合报告弱标签分类与监督分割,门控U-Net实现裂缝分割F1 0.860并后处理估算缺陷间距。
生成作为辅助监督:通过解耦嵌入预测在零推理开销下增强视觉理解
提出GAS:以生成作辅助监督,解耦嵌入预测增强MLLM理解,训练后弃生成分支,零开销提升感知与空间理解。
少样本有序学习用于高光谱鱼图像逐日新鲜度估计
首次将少样本学习用于高光谱食品质量评估,有序回归头与生物约束结合,仅需每片3天标注,MAE达1.58天,2天准确率72.3%。
SCOUT:通过结构化思维链与多目标过程奖励解锁增强的空间推理
SCOUT通过结构化思维链和多目标过程奖励,显著提升空间推理,超过GPT-4o。
ScaleVid:无网格推理的几何感知视频物体缩放
两阶段训练解耦前景变换与背景保持,免3D重建,实现几何一致、前景保真、背景保留的物体缩放。
HSTGFormer:用于三维人体姿态估计的超时空图Transformer
针对时空分离建模局限,提出超时空图变换器,以局部耦合图聚合和双尺度时间图,高效精准做三维姿态估计。
GenFAR:基于深度学习从49,246例多队列MRI推导的脑结构广义表征
提出GenFAR,用49,246例多队列MRI训练出通用脑表征,提升下游任务精度与样本效率。
M-Net:融合谱特征与物理场算子的医学图像分割深度学习网络
M-Net融合矩阵谱特征与向量微积分算子,经数学注意力门融合,肝/肾/脑肿瘤分割较基线提升12.37%/3.52%/5.55%。
HAMP-LIC:面向学习图像压缩的Hessian感知混合精度训练后量化
提出HAMP-LIC,基于Hessian感知的混合精度训练后量化,优化位宽分配,实现4.85倍压缩,BD-rate损失仅0.59%,消除跨平台编解码误差。
神经蒙皮的测地线切割单元先验
提出切割单元蒙皮几何先验,以图近似体测地距离,加速计算且鲁棒,提升神经蒙皮模型效果。
用于增强左前降支动脉三维分割的邻域注意力Transformer网络
提出NA-UNETR,以邻域注意力和不确定性加权损失提升低对比CT左前降支分割的Dice与边界精度。
Diagram-MMU:科学图表的多模态基准
提出Diagram-MMU基准,含3.7k图表与18.3k题,评估12个MLLM,发现解析比问答更难。
超越试错:图像到视频一致性的智能体优化
提出智能体自改进框架,两阶段优化提示与参数,结合DSG/CMQ评估,人类偏好胜率高达69%。