Light-WAM: 具有状态融合动作解码的高效世界动作模型
Light-WAM通过状态融合动作解码高效预测机器人动作,仅0.44B参数、72ms推理延迟,性能强劲。
TIDE:面向统一视频编辑与生成的任务隔离扩散
TIDE通过每令牌任务嵌入和双路径条件,实现统一视频编辑与生成,性能领先。
自监督视觉Transformer用于CBCT颞下颌关节骨关节炎检测
DINO系列ViT部分解冻最后两个模块,CBCT骨关节炎检测AUC达0.902,适配策略优于主干选择。
少看多思:面向高效多模态大语言模型的逐块注意力跳跃
发现视觉注意力早期饱和,跳过深层冗余模块,动态路由实现高效推理,性能保持94%以上。
CheXanatomy:面向胸部X光片的解剖感知视觉语言建模
CheXanatomy框架将解剖知识集成到视觉语言模型,自回归监督生成分割掩码,性能媲美U-Net,鲁棒性及样本效率更优。
几何驱动的脑沟模式流分析
提出泊松方程框架,将脑沟建模为几何驱动流,用于检测JME中的细微皮层异常。
CoVEBench:视频编辑模型能否处理复杂指令?
CoVEBench基准测试揭示,现有视频编辑模型难以同时完成多项复杂编辑操作,常出现遗漏或伪影。
SceneConductor:基于多智能体编排的单图像三维场景生成
提出多智能体编排框架,三阶段从单图生成3D场景,引入几何感知布局预测器,提升几何精度与空间一致性。
TVI-CoT:面向多模态理解的文本-视觉交织链式思维推理
提出TVI-CoT框架,通过可学习令牌在推理中动态切换文本与视觉特征,提升多模态理解,在多个基准上取得最佳效果。
眼见为实:基于视觉锚点的提示重写对齐方法
FaithRewriter利用视觉线索引导提示增强,生成更忠实意图的文本到图像提示,缩小意图-生成差距。
候选感知因果推理增强教学视频时间答案定位
提出CACR框架,含候选选择和时间逻辑推理,经GRPO优化,在六个基准上达SOTA性能。
基于分割辅助的脑部MRI合成及跨图像多对比度特征记忆库检索增强
提出分割辅助闭环与双库检索增强,从任意对比度合成脑MRI,提升肿瘤区保真度。
基于细粒度情感-原因对提取的精确情感归因视频描述
提出细粒度情感-原因对提取框架,通过概念分解与视觉引导学习,提升视频情感描述的准确性与丰富性。
FiberTune:在视觉-语言-动作微调中保持动作纤维视觉残差
提出FiberTune,用在线动作探针过滤残差并对齐视觉教师,防止视觉结构崩溃,微调性能显著提升。
NGram-MoSE: 基于N元上下文与专家混合的高效遥感超分辨率
提出轻量Transformer NGram-MoSE,通过N元上下文注入与专家混合机制,实现高效遥感超分辨率,降低计算成本并提升泛化能力。
深度学习时代的面部表情识别:方法、模型、数据集、性能、挑战及未来研究方向的系统性多准则综述
系统综述深度学习FER五阶段演进、多准则分类、数据集、性能比较、挑战及未来方向。
OmniCap-IF:全模态视频字幕指令遵循能力的基准测试与改进
首个全模态字幕指令遵循基准OmniCap-IF,评估格式与内容正确性,揭示格式-内容权衡,并构建数据集与模型提升性能。
驾驭野外流式视频
构建流式视频数据集与系统,赋予VLM主动交互、长时记忆和实时处理能力。
SSAFE:基于冻结视觉编码器的简单强健AI生成图像检测
发现冻结多模态编码器自然区分真假,用10K精简数据集+线性分类器实现强检测,无需微调。
可学习的令牌稀疏化用于高效千兆像素全切片图像推理
提出可训练令牌稀疏化,仅用32个令牌(0.78%原长),实现高精度零样本泛化。
OmniTryOn: 视频中一键试穿任意物品
提出OmniTryOn,无需外部先验,实现视频中多衣物同时试穿,通过首帧缓存和时空一致RoPE,性能超越现有方法。
DriveReward:面向自动驾驶的全面数据集与生成式视觉语言奖励模型
提出DriveReward数据集及专用视觉语言奖励模型,通过反事实标注增强失败案例,1B模型性能优于大型模型。
BLUE:面向自动驾驶中高效视觉-语言-行动模型的语言使用优化
BLUE训练轻量门控,按帧决定是否启用语言生成,实现2.54倍加速与SOTA性能。
MB-Loc:室外激光雷达场景中的多平面鸟瞰图定位
提出MB-Loc框架,用2.5D多平面BEV表示和KL正则化实现实时、视角鲁棒的激光雷达定位,性能超越当前最优。
WaveDiT:分布感知小波流匹配实现高效3D脑MRI合成
WaveDiT在3D小波系数空间用流匹配结合分解注意力与异方差建模,高效合成全分辨率脑MRI,提升分布对齐和解剖一致性。
偏移依赖的非对称性:面向联邦医学分割的正交逆低秩适应
针对联邦医学分割中编码器-解码器不对称,提出逆非对称调优与子空间正交正则化,减少泄露提升泛化。
不借助图像的思考:通过在线策略自蒸馏内化视觉操作
提出Imagine-OPD框架,在线自蒸馏内化图像推理,减少冗余工具调用,提升性能并降低推理开销。
PRPO:通过令牌级动态优势重塑的感知强化策略优化
PRPO提出令牌级强化学习框架,识别并增强关键感知令牌,多模态推理平均提升23.3%和21.1%。
AUCp:利用无标注验证数据的异常检测推理模型选择的伪AUC方法
提出AUCp指标,无需标注验证集,通过假设测试集全阳性计算伪AUC,有效选择最优异常检测模型。
学习在线性张成空间之外求解生成式常微分方程
SpanLift通过空间残差算子突破标量系数更新的局限,实现少步采样,CIFAR-10 FID从8.16降至5.69。
BioVid: 具有生物行为语义理解的自回归视频生成
BioVid学习生物行为自然时长分布,生成视频时长分布接近真实,Wasserstein距离1.24。
面向混合针孔-鱼眼相机的BEV目标检测的畸变感知PETR
提出畸变感知PETR,用自适应模块处理鱼眼畸变,在混合相机BEV检测中超越基线,揭示学习与重参数化冲突。
MaskAlign:令牌子集表示对齐实现高效扩散训练
提出MaskAlign,通过对随机采样令牌子集对齐减少依赖,并引入预掩码混合块减轻信息损失。
少即是多:基于全局-局部轨迹缩减的低计数PET去噪3D扩散模型无训练加速框架
提出无训练全局-局部跳跃策略,大幅加速3D扩散模型PET去噪,无需重训,质量更优或相当。
BLM-SGAN:面向语义-空间文本到图像生成的双向语言建模
提出BLM-SGAN,利用BERT双向语言模型解决长依赖和梯度消失,在鸟类图像生成达SOTA。
CSFlow:将流匹配与人类对比敏感度对齐
CSFlow通过对齐生成频率与人类对比敏感度,改进流匹配权重,降低FID 4.7%,提升视觉真实感。
超越一致性:在零样本视频编辑中保留时间结构
针对零样本视频编辑无法保留原始时间结构的问题,本文提出自适应分割与令牌合并方法,实现高效且保持叙事连贯的编辑。
几何感知的鱼眼-激光雷达融合用于低重叠场景下的鲁棒3D目标检测
提出几何感知混合融合框架,解决鱼眼与激光雷达几何失真,在多个数据集上显著提升检测精度。
针对组织病理学中即时对抗净化的染色感知小波正则化
提出染色感知小波正则化(SAWR),利用Haar变换多级小波域解耦对抗噪声,提升鲁棒性10.69%,保持纹理频谱保真。
成对图像查找器:用于城市感知研究的视觉对齐街景图像对查找的开源工具
开源工具通过特征匹配与语义分割量化街景图像对齐,输出高质量图像对,支持纵向变化研究。
DeepMine-Mamba:缓解基于Mamba的状态空间模型在文档图像二值化中的信息稀释
提出DeepMine-Mamba,用抗稀释门缓解Mamba信息稀释,选择性恢复笔画细节,在文档二值化上取得竞争性性能。
使用Inception和残差CNN对Galaxy10 DECals数据集中的星系进行分类
ResNet101和InceptionV4对星系分类准确率达90%,ResNet101更优,可作未来巡天分类基础。
应用深度学习实现混合现实中的座舱分割
使用U-net和DeepLabV3+对座舱图像分割,准确率约90%,实现混合现实虚实融合。
JA-SIREN:通过频谱匹配实现正弦网络的确定性初始化
JA-SIREN通过频谱匹配的确定性初始化,消除随机变异性,图像回归PSNR达67.18dB,提升21.3dB且零方差。
GOPAgen:具有结构记忆和分层推理的运动感知高效代理长视频理解
提出GOPAgen,融合视频编解码器,通过GOP树推理与结构记忆机制实现高效长视频理解并提升VQA性能。
注意力引导自编码器融合的无人机输电线路绝缘子缺陷检测方法
提出AE-YOLO框架,融合轻量自编码器与注意力机制,在绝缘子缺陷检测数据集上mAP达95.10%,比最强YOLO基线提升5.0点。
WorldBench:一个具有挑战性和视觉多样性的多模态推理基准
WorldBench评估多模态大模型视觉推理,最强模型仅64%准确率,揭示视觉理解弱点。
基于分解视觉代理的直接三维感知物体插入
提出DIRECT框架,通过分解外观、几何和上下文引导,实现姿态可控的高保真物体插入,效果优于现有方法。
从像素到牛顿:通过单目视频预测体内关节接触力
提出从单目视频预测体内关节接触力的无物理规律方法,精度媲美个体化模拟,为临床与康复提供新途径。
深入视觉思维:神经科学启发的概念电路用于解释和引导视觉Transformer
ViSAE工具箱用神经科学启发概念电路,提升ViT可解释性,概念编辑使最差组准确率提升48.2%。