ROAD:判别性语义的互惠目标对齐用于三维形状生成
提出ROAD框架,将判别式3D模型先验迁移至扩散Transformer,通过互惠对齐策略减少训练成本,仅用1.5%数据即达工业级性能。
RefCaptioner:多参考图像 grounded 视频字幕生成
提出多参考图像视频字幕任务及RefCaptioner框架,提升指代绑定与抗干扰,性能领先开源模型。
超越帧选择:长视频理解中的生成式潜在证据聚合
提出GenEvA,以查询条件分布聚合跨帧潜在证据,超越选帧,显著提升长视频理解性能且开销极小。
ScaFE:基于大模型生成临床特征程序的数据高效疤痕分类
将LLM临床知识转为可执行特征程序,本地运行。跨医院疤痕分类准确率81%,超基线10个百分点;仅用10%数据仍领先11.8点。
去除与保留:全能图像恢复的双歧义校正
提出DAR-Net,通过语义与空间双歧义校正提升全能图像恢复性能,在多项基准上取得最优结果。
MarkushGlyph与OCSRGlyph:改进的化学结构识别
提出两种图像转文本模型:OCSRGlyph优化单分子识别,MarkushGlyph整体解析Markush结构,并引入新评估指标。
从文本在卫星存档中查找变化:如何高效组合前后影像
比较八种融合模块:两阶段搜索降本十余倍;曼巴无速度优势;压缩表示减参降延迟但丢细节。
MIND:基于扩散Transformer的多模态意图驱动医学图像融合网络
提出MIND,用意图文本引导扩散Transformer实现医学图像融合,提升融合质量与分割精度。
迈向实时PixOOD:面向自动驾驶的高效异常分割
加速PixOOD异常分割,TensorRT优化,桌面182FPS/嵌入式75FPS,快20倍,实时部署自动驾驶。
耳廓世界:基于层次化动作引导的世界模型实现CT耳廓精细分割
提出层次化动作引导的世界模型,在潜在空间迭代推理,精准分割CT耳廓细小不规则结构,HD95降低43%
Beacon:知晓何时及如何进行智能体视觉推理
提出Beacon模型,通过必要性感知奖励与提示引导扩展,提升多模态模型的工具调用自适应性与实际效能,实现更强整体性能。
RadHarmony:智能体AI时代下的放射学数据处理
开源库RadHarmony统一放射数据集,支持多模态标注,AI代理辅助集成,并预训练ViT。
MixFrag:脆弱性引导的视觉Transformer混合精度训练后量化
提出脆弱性引导的混合精度训练后量化,用KL散度评估层敏感性,位分配建模为背包问题,检测分割达最优。
正电子偶素三光子贝叶斯成像
提出TRIO贝叶斯三光子成像算法,精度较时间三边测量提升约两倍,兼容现有TOF-PET。
ReToken:用单个Token提升视觉语言模型的视觉检索能力
提出ReToken,一个可学习嵌入作为检索目标,从视觉KV缓存中选取相关稀疏token,小数据训练即显著提升图像视频检索性能,且轻量可单卡运行。
PhiZero:围绕物理语言构建的世界模型
PhiZero用物理语言描述世界状态,自监督学习视频,先推理后渲染,实现物理一致的世界建模与交互模拟。
基于行为对齐表示的跨具身迁移
行为对齐表示可促进跨具身迁移,末端执行器轨迹尤佳,且有助于利用无动作数据,提升模拟到真实任务进展28%。
Chimera:混合视觉扩散Transformer的设计与Chinchilla缩放
提出奇美拉混合视觉扩散骨干,用异构缩放律训练11B模型,计算效率高,零样本外推至30秒视频。
迈向多模态深度学习的肺部疾病分类:基于纹理的机器学习在公共胸部X光数据上的初步研究
基于公共胸片,用纹理特征区分新冠与其他肺炎,准确率75.4%,略优于基线,并提出多模态深度学习方向。
ACE-Data-0:以人为中心的环境采集作为具身数据引擎
提出ACE数据引擎,从家庭环境采集多感官同步数据,构建含150小时、7.5万交互片段的数据集,并设层级基准。
Endo-NeRF++:面向动态手术场景重建的不确定性感知神经渲染与多分辨率哈希编码
提出Endo-NeRF++,用多分辨率哈希编码、时序特征融合和不确定性自适应采样,提升动态内镜场景重建精度与时间一致性,性能优于基线。
手语问答:一项新任务、新基准与新基线,用于手语理解
首个提出手语问答任务,构建两个问答基准并设计基线模型,超越主流视觉语言模型,推动手语深层语义理解。
MUL-T:解码多重组织图像中的空间细胞结构
MUL-T轻量Transformer,用细胞token掩码预测建模组织,无监督嵌入,效率媲美ViT,超越基线。
训练中简化神经网络
受神经坍缩启发,监控类别表征可辨识性,动态裁剪尾部层并替换为轻量分类头,在保持精度下大幅削减参数。
Tycho:面向ARC-AGI-3的基于程序化世界模型的主动抽象
Tycho用程序化世界模型交互建模最优策略达88.49核心是主动抽象判断何时构建修复使用或绕过模型
ReGenVC:超低码率下的端到端实时生成式视频编码
提出ReGenVC,面向谈话视频的生成式编码,超低码率(26kB/77帧)且8GPU实时解码(24fps)。
TSOG:时空有序高斯格式
TSOG是一种4D高斯泼溅高效表示格式,扩展时空有序,压缩超90%,质量损失小。
MMHBench:长视频心理健康理解的多视角基准
构建MMHBench,268长视频2184问,评估22个多模态大模型的长视频心理健康理解,任务极具挑战。
UniCross:统一跨技能灵巧操作合成
统一框架建模抓取、重定位、手内旋转与平移四种技能,实现跨技能策略,稳健且支持长时程操作。
Qwen-UI-Agent技术报告:迈向下一代以真实世界为中心的基座GUI代理
提出Qwen-UI-Agent,覆盖移动、电脑、网页等环境,统一GUI与CLI动作,数据飞轮加持,移动基准SOTA,电脑/浏览器任务达前沿水平。
BG-REAL:一个基于真实数据的公开基准,用于背景篡改检测与定位
BG-REAL是含7000样本的背景篡改检测基准,揭示重编码伪影是基线模型共有风险。
知识引导的原子动作解耦方法用于动作识别
KDA利用LLM分解动作标签为原子动作,通过知识注入与解耦模块增强表征,实现精确解耦,在多标签动作识别中达SOTA。
一图胜千言:通过混合深度学习从图像中提取皮肤暴露数据以增强安全评估
混合深度学习量化图像暴露皮肤,与人工评估80%一致,可扩展用于安全评估。
从野外单张人体图像中估计体重和身高
提出用深度学习从单张自然人体图像估计体重、身高和BMI,构建新数据集,全身图像效果最佳。
TraceCLIP:从Patch到CLS的贡献中恢复局部语义
TraceCLIP无需训练,利用patch-to-CLS贡献恢复局部语义,零样本分割平均mIoU提升1.3-4.5点。
DVPSFormer:面向自动驾驶的高效在线深度感知视频全景分割
提出统一在线架构,通过显式场景离散化和在线多数投票,高效实现4D理解,在Cityscapes-DVPS和SemKITTI-DVPS上达SOTA。
WildShadowRemover:通过细节保持的视频扩散模型实现野外视频去阴影
提出基于视频扩散模型与LoRA微调的野外视频去阴影框架,通过细节注入和频率分解调制实现高质量、时间一致的阴影去除。
物理与隐私交汇之处:面向隐私保护的脑肿瘤生物力学建模的联邦物理信息神经网络
联邦物理信息神经网络结合隐私保护与生物力学建模,在分散数据上达91.4%准确率,超越集中训练基线。
Rad-JEPA 3D:用于3D计算机断层扫描的放射学联合嵌入预测模型
提出Rad-JEPA 3D联合嵌入预测框架,混合H-Mamba编码器与HSOR正则化,在12万CT扫描上预训练取得SOTA。
延迟感知的双手对齐用于双手动作分割
提出轻量级LACA模块,显式估计双手时序偏移分布,自动对齐提升分割性能,仅增0.0086M参数。
LumaGuide:扩散模型中免训练HDR生成的分布塑造
LumaGuide通过可微能量引导在采样时塑造亮度分布,无需重训练即可实现HDR生成。
基于配准的光谱融合用于未配准WLI/NBI内窥镜病变分割
提出复域融合框架,通过拓扑正则化与可靠性估计引导选择性融合,有效提升未配准WLI/NBI病变分割性能。
边缘设备上猛禽物种的轻量级图像分类:通过视频帧提取、知识蒸馏和TensorRT部署扩展稀有物种数据集
利用视频帧扩展数据集和知识蒸馏,实现稀有猛禽轻量分类,边缘设备上FP16推理速度达313 img/s,精度几乎无损。
比较基础模型嵌入与传统方法在头颈癌远处转移预测中的性能
CT基础模型嵌入预测头颈癌远处转移AUC达0.791,优于传统方法,且减少专业知识需求。
基于样条边界表示的稀疏视角重建与等几何分析仿真
从稀疏RGB图像直接重建多片B样条边界表示,产出紧凑光滑水密几何,原生兼容CAD与仿真,并支持观测场投影。
HeteroPROPMT:一种实时且保护隐私的异构协作感知框架
HeteroPROMPT提出实时隐私保护异构协作感知,用提示对齐特征,少量参数提升精度,模态分类准确率超99.99%。
Eddeep:一种用于扩散MRI中快速涡流畸变校正的深度学习框架
Eddeep深度学习框架实现快速涡流畸变校正,质量媲美FSL Eddy,推理时间大幅减少。
MoSAIC:针对局部部位运动风格迁移的对齐干预监督
MoSAIC提出对齐干预监督与分部位路由,实现局部运动风格迁移,在保留未选区域的同时提升指定部位响应,改善编辑权衡。
Zero-Fi: 基于对比信号-语言对齐的零样本Wi-Fi人体活动识别
提出Zero-Fi框架,利用对比信号-语言对齐,无需标注样本即可零样本识别新活动类别,实验验证有效。
看见还是知道?多模态大语言模型中的视觉上下文敏感性
多模态大模型能编码视觉证据,但无法可靠控制对先验知识的依赖,导致视觉任务失败。