VideoGen-Agent:强化视频生成智能体
VideoGen-Agent通过多任务强化学习调用外部工具生成视频,在自建VABench基准上得分由56.5升至86.1。
PixelDiT2:基于表征锚定的像素扩散Transformer
提出PixelDiT2,以冻结视觉基础模型的逐块表征引导,解耦表征学习与像素生成,免自编码器,FID达1.46。
解剖分解的胸部CT投影作为胸片骨抑制的可扩展监督
提出CT解剖分解投影框架,生成像素配准配对监督,无需真实配对数据即可抑制胸片骨骼,提升骨重叠区异常检测。
DTKDP:面向轻量级有向SAR舰船检测的双教师知识蒸馏与剪枝框架
提出双教师蒸馏剪枝框架DTKDP,大幅压缩有向SAR舰船检测模型,参数算力大降且精度近原模型。
GAE:学习几何原生潜在空间以实现3D一致的世界生成
提出几何原生潜在空间GAE,作为感知与生成共享基础,显著提升3D一致生成质量与连贯性。
重新审视多视图立体:一种序列到序列的表述
将多视图立体转为序列到序列任务,以相机感知模型和全局代价体联合预测全部视图几何,性能达最优。
SPHQuant:面向视觉语言模型的高效极低比特权重量化
SPHQuant以无旋转球面量化分解权重,将离群值隔离至半径并加精度,兼顾极低比特精度与吞吐。
WorldCrafter:具有隐式3D感知记忆的一致视频世界模型
提出以相机可查询的隐式3D记忆压缩多视角历史的视频世界模型,实现长时程一致、相机可控的流式探索。
SLICEChat:面向全切片病理语言模型的编码器内渐进式Token剪枝
SLICEChat在全切片病理MLLM编码器内渐进剪枝Token,融合Mamba与Transformer,兼顾精度与效率。
通过专业化基础图像模型生成胸部X光反事实图像
提出专业化框架,将预训练生成模型转为因果机制,构建胸部X光反事实模型RadCF,高效且能缓解分类器捷径学习。
Hi-Singers:一个用于富有表现力的音频驱动歌唱头部合成的综合性高质量数据集
首个大规模高质量歌唱头部合成数据集Hi-Singers,含约170小时视频,显著提升视觉真实感、唇同步与节奏动态。
从平扫脑MRI预测鞘内示踪剂强化:直接回归与流匹配对比
训练104例对比显示,直接回归比流匹配更准更省,能预测鞘内示踪剂强化,外部验证同样占优。
AffordanceWAM:面向机器人操作的可供性感知联合世界-动作建模
提出可供性感知世界-动作模型,用标量可供性与热图联合预测未来视觉和机器人动作,提升操作与人类到机器人迁移。
病灶门控混合合成用于虚拟对比增强乳腺MRI:MAMA-SYNTH挑战赛解决方案
病灶门控混合合成,由平扫合成增强乳腺MRI,协调肿瘤与背景通路,平衡多指标,挑战赛第六。
GameHorizon 套件:游戏玩法中的多时间跨度数据与评测
推出GameHorizon套件:含自动标注管线、21款游戏5000小时AAA数据,以及离线与逐步在线基准,评测47个模型。
CIG-MAE:面向自监督WiFi感知的跨模态信息引导掩码自编码器
提出CIG-MAE自监督框架,以双流掩码自编码器重建CSI幅相,用自适应信息引导掩码与Barlow Twins正则对齐跨模态表征,在三数据集上超越SOTA与全监督基线。
SENSE加速脑MRI中解剖保真的伪影抑制
ART-Net利用解剖感知残差注意力抑制SENSE四倍加速脑MRI伪影,提升图像质量并保持解剖保真。
视觉图推理的知识编译方法
提出VGCompiler,用表示编译器和操作编译器从图图像恢复结构并编译可执行操作,8B模型超越闭源基线28.9%。
面向视障用户多模态出行辅助的经济型AI集成智能手杖
88美元全离线AI智能手杖,融合RGB视觉与ToF测距,以振动和音频提示助视障者避障,F1达0.82。
主动空间检查:面向有效且高效的具身探索
提出ACE框架,以空间检查融合证据感知与曝光引导移动,导航成功率提升18.0%,问答探索效率提升10.3%。
基于LGE-MRI的房颤多中心双心房分割:二维与三维框架
提出2D/3D双心房分割基准框架,多中心LGE-MRI显示腔体跨域迁移优于心房壁。
Omni2Web:音视频网站开发基准测试
提出Omni2Web音视频网站开发双语基准,含918实例、13907步和三轨;评测17模型,意图恢复与代码执行远低于oracle。
SmoLSTM:一种具有持久循环记忆的紧凑型视觉-语言-动作模型
以循环状态记忆整段情景,冻结视觉语言骨干+矩阵记忆LSTM,0.04B参数记忆任务成功率77.5%。
MoSAT:基于空间音频与文本描述的人体动作生成
提出MoSAT,联合空间音频与文本描述生成人体动作,构建STAM数据集,性能达SOTA。
混合神经视频表示的分辨率灵活解码
提出分辨率灵活解码框架,统一2倍上采样对齐,结合中间监督与难度感知采样,提升混合神经视频表示重建质量。
基于遥感影像时间序列的巴西塞拉多火烧区制图多时相数据集
基于CBERS/AMAZONIA卫星WFI影像时间序列,构建2020–2022年巴西塞拉多火烧区多时相数据集,用随机森林分类并验证制图精度。
AWR-Net: Decoupling Anatomy and Appearance for 3D Fetal Brain Ultrasound Synthesis
SomaNet: Weakly Supervised Learning for Instance Soma Segmentation in 3D Electron Microscopy with Partial Annotations
面向主动机器人的认知动作推理:基于以人为中心的多模态观测
提出主动机器人动作推理ProRobo与10K多模态数据集ProAction;通用MLLM弱,训练可提升。
If You Hear It, Help Find It: Orthogonal Knowledge Distillation for Open-Vocabulary Audio-Visual Event Localization
用于说话人脸深度伪造检测的互补性rPPG衍生线索与唇部区域频域线索
rPPG波形与唇部DCT线索互补,融合检测说话人脸伪造AUC达0.891,跨生成器迁移性各异。
事件流时间量化中的鲁棒性-分辨率权衡
硬时间分箱不连续;连续编码器L1敏感度下界2/Δ,线性二箱插值最优唯一,实验降漂移47-72%且精度近不变。
脑到图像生成:基于生成对抗网络从脑电图重建视觉刺激
单被试EEG可高于随机地粗粒度语义检索视觉刺激,但跨被试骤降,直接生成噪声化,无法忠实重建像素。
重新思考流式视频扩散模型:上下文、执行与训练
提出流式视频扩散统一框架,比较历史条件、执行与训练;渐进历史提升质量并加速,全去噪历史并非高质量生成前提。
面向多模态卒中复发预测的视觉与跨模态学习:一个可解释的两步框架
自监督预训练与冻结微调提升多模态卒中复发预测,缓解模态失衡,促成视觉与临床特征跨模态交互。
超越综述:视觉多目标跟踪中检测与关联的系统性实证研究
系统实证评估视觉多目标跟踪算法:检测质量主导关联性能;深度学习检测+ReID优于联合;端到端Transformer更鲁棒但昂贵。
Moonworks Lunara:艺术智能建模
以探索驱动世界实现定义艺术智能,推出Lunara文生图模型,多项评测领先,参数量低于10B。
你盗用了我的镜头吗?开创生成视频中的相机运动抄袭检测
构建首个相机运动分析基准,提出融合涡度线索的光流表征,检测器在生成视频抄袭检测上较最强基线提升3.02倍。
性能与一致性之辨:评估基础模型在Lung-RADS筛查中的表现
微调使模型Lung-RADS筛查AUC从0.70升至0.83,接近放射科医生水平且输出一致,但尚需外部验证。
验证而非采样:视觉语言与视觉-语言-动作模型的区域级鲁棒性
验证而非采样:对VLM/VLA在连续图像扰动区域做鲁棒性验证,鲁棒性更依赖扰动类型与模型家族。
基于XAI的AI高光谱图像分类降维
利用XAI与AI降维,以CNN处理200+通道高光谱图像,提升木材回收可持续性与效率。
MarsRecon:面向火星的自监督多模态表面表征
火星HiRISE自监督多模态表征流程,用掩码自编码器降重建损失,对齐文本、坐标及局部-全局图像,实现检索。
基于事件引导运动的事件-帧融合帧间分割
提出事件-帧融合架构,用事件引导运动插值帧间分割,达500Hz、低能耗,提升模糊过曝鲁棒性。
3D场景图中语义不确定性的分层聚合
无需额外感知训练,利用已有检测置信度与嵌入估计条目正确概率,沿包含层级聚合,提升物体检索与房间断言。
保留决策权的医学视觉语言助手评估
提出AuthEval,记录并评估模型建议与本地决策,揭示权限差距受约束和评估单位影响。
GameReplica:面向视觉语言智能体的黑盒视觉游戏复现基准
黑盒游戏复现基准:智能体仅凭截图与交互推断游戏规则;最佳模型71.6%,视觉保真显著高于机制一致性。
利用拓扑材料特征进行大规模三维纺织增强体的纱线追踪
基于统计特征与变分优化,从粗分辨率CT图像中半自动追踪大规模三维纺织增强体纱线,成功率逾90%。
ALPINE:面向参数与样本高效少样本学习的自适应定位
超轻量空间关系架构,核心为内容自适应图像块定位器;参数少27–53%仍超越多基线,泛化与抗遮挡更强。
面向单光子视频成像的时空通量探测
提出时空通量探测,直接从稀疏光子流估计傅里叶系数,以极少光子恢复高速运动与光照,并支持速度选择性重聚焦。
以风格为掩护:基于风格化传输的深度图像隐写
提出StyleStegaNet,以风格化传输替代载体匹配,实现深度图像隐写,检测率约51%。