S2T-Unet:一种面向跨模态MRI转换的结构到风格框架
提出S2T-Unet,分离模态不变结构与风格,量化编码结构并转换风格,IXI实验达或超SOTA。
DiffReID:面向目标重识别的判别式扩散模型
提出判别式扩散模型DiffReID,结合CLIP提示调优与视觉引导去噪,学习身份感知分布并生成身份不变特征,五个重识别基准超越多数SOTA方法。
SafeVantage:面向可靠具身决策的视角感知记忆
视角感知记忆与主动采集框架,记录支持视角,预测可见性指导选视,校准输出是/否/弃权,提升决策可靠性。
用于跨被试EEG到图像检索的结构化视觉目标学习
提出结构化视觉目标学习与免训练细化,提升跨被试EEG到图像检索,Top-1达48.1%。
Seg3DParts:基于分割的可控部件级三维生成
将分割作为显式锚定信号,结合跨部件全局交互,从单图直接生成对齐的部件网格,并发布20万物体、百万部件的大规模数据集。
表征动态揭示多模态大语言模型视觉 Token 剪枝的语义显著性与相似性
视觉token表征动态揭示语义显著性与相似性;据此提出免训练剪枝MSDG-Prune,大幅压缩视觉token并提速。
WeLike2Party!面向多人图像动画的上下文动作迁移
提出免显式姿态的多人动画框架,以参考非对称RoPE与身份绑定监督实现上下文动作迁移,构建MotionTwin数据集与基准。
SFE-VGGT:面向事件相机单目深度估计的无源VGGT蒸馏
无源SFE-VGGT用事件重建代理帧蒸馏VGGT几何先验,可靠性加权,无需配对RGB,夜间误差降15%。
DispFlow-GS:面向单目可变形三维高斯泼溅的位移流监督与运动解耦
提出位移流监督与运动解耦框架,缓解高斯流与光流域差异,并引入形变-渲染一致性指标,显著提升运动定位与一致性。
先验驱动的3D高斯泼溅增强:法线与深度正则化
提出融合表面法线与稠密深度先验的3DGS优化方法,提升几何精度与视觉质量,在复杂场景中表现稳健。
超越可读性:评估任务信息可恢复性
可读性≠任务信息可恢复性;提出显式评估框架比较恢复路径,图书封面实验显示实体链接恢复可超越直接视觉读取。
World2Motion:将视频世界模型转化为三维人体动作生成器
将视频世界模型改造为单阶段3D人体动作生成器,构建混合数据并提出偏移解耦噪声调度,推理提速约3.3倍。
视觉并行搜索:通过并行瓦片检查与自适应缩放学习搜索高分辨率图像
提出VPS视觉并行搜索框架,主智能体并行检查图像瓦片并自适应缩放,提升高分辨率视觉问答,且可训练。
VesselBench-800K:面向多模态船舶检测、计数与密度估计的大规模感知基准
迄今最大全球多模态船舶感知基准,含80万张512×512光学/SAR图像,支持检测、计数与密度估计。
Back2Struct:让结构化图像重新可编辑
从图像恢复可编辑 SVG/XML 代码,让图表等结构化图像可编辑并保持视觉保真。
Salt++:面向少步流式多模态生成的上下文对齐后训练
Salt++以因果自流与上下文对齐自回归DMD两阶段后训练,实现4步流式音视频生成,视觉与运动质量大幅领先。
UltraMatch:面向超快与内存高效图像匹配的传输路径路由
UltraMatch以路由少量候选路径替代稠密token匹配,大幅提速省内存,单卡支持6K分辨率推理。
面向星上数据缩减的嵌入式双时相建筑损毁评估
基于YOLOX孪生检测器,压缩上行参考并在星上比对,仅下行目标级损毁结果,抗配准误差,嵌入平台验证。
面向高效视频生成的参数化条纹注意力
提出参数化条纹注意力PSA,统一刻画视频DiT的周期对角条纹,单内核生成稀疏掩码,提速1.57倍。
面向业务化哨兵-2小麦面积估算中地面真值标签噪声消解的双轨数据整理与分类框架
用13期哨兵-2 NDVI与849样本,XGBoost最优;预测面积较官方仅高2.99%,优于空间掩膜25.11%,提出双轨整理分类框架。
RBF-GNN:面向伪坐标图卷积的有理基函数
提出RBF-GNN,用有理Padé基函数替代随维度指数增长的B样条,提升关键点匹配等任务性能。
MotionInsight:诊断生成视频中的物体运动缺陷
提出VidMotion数据集与MotionInsight评估器,实现物体运动缺陷的三维诊断。
NHO:一种用于基于锚点的区域定位与稠密对应的神经哈密顿算子
NHO用稀疏锚点和内蕴几何学习神经哈密顿算子,以局域特征空间互惠细化,实现区域定位与稠密对应,抗缩放旋转。
OmniRoute:将时序语义证据映射至音视频令牌预算,实现高效全模态大语言模型
提出免训练两阶段压缩框架OmniRoute,按时序语义证据分配音视频令牌预算,兼顾效率与性能。
Real2Gym:从视频构建仿真训练场,让机器人获得技能
提出Real2Gym,将视频演示转为交互仿真训练场,习得技能迁移至真机,真机成功率超GPT-6 Astra 33.3%。
无承诺的上下文:非刚性变形下的鲁棒稠密对应
CoCo-Reg以区域块丰富稠密点特征却不限制最终点级搜索,非刚性配准对应误差降低72.6%。
Spatial-OPSD:通过无标签自蒸馏实现自我改进的空间推理
无标签自蒸馏,用深度与三维先验由教师对学生轨迹做词元级监督,逐轮递归训练实现多轮自提升并达开源前沿。
GleanVID:面向高效视频大语言模型的互补Token选择
GleanVID是免训练的视频大模型推理加速框架,按时间新颖度分配预算并联合代表性与互补性选Token,25%Token保留98.6%性能。
UniBuild: Unified Building Mapping From Multi-Source Optical Remote Sensing Imagery With Detail Decoding and Geometry Regularization
LDM-is-AE:潜在扩散模型是用于端到端图像生成的自编码器
提出LDM-is-AE,将潜在扩散模型自身视为自编码器,端到端联合学习潜表示与去噪,无需独立分词器,FID达1.80/1.90。
盲区中的速度:自动驾驶视觉语言模型动态感知的可解释性分析
VLM车速理解存盲区:潜表征可解码却难表达,时序利用弱,专用模型仍有差距;规划合理≠状态可靠。
NRF-GS:面向高表达力与紧凑高斯泼溅的神经残差场
以共享全局神经残差场替代逐高斯球谐,增强视角相关反射建模,高斯数量减少50%仍保持或提升渲染质量。
无模态误导的端到端自监督RGB-T跟踪
ESMTrack:端到端自监督RGB-T跟踪,免伪标签与密集标注,缓解模态主导,五基准领先且实时。
MSTypography:通过平衡词语可读性与物体可识别性实现多字符语义排版
提出全局到局部的多字符语义排版框架,兼顾字形可读性与物体可识别性,在五种语言上超越SOTA。
面向设备-边缘多模态推理的基于残差向量量化的任务导向视觉特征压缩
提出Q-TOFC,用残差向量量化压缩视觉特征,融合查询相关聚合与量化误差补偿;负载较TOFC降53.6%,性能相当,时延更低。
改进的分布扩散模型
将粒子扩展推迟至后层并引入时间相关评分规则调度,使分布扩散模型少步生成质量优异且不随采样步数退化。
为何多模态大模型难以计数:以ConvStack突破个体化与聚合瓶颈
揭示MLLM计数受分块个体化与聚合压缩双瓶颈制约,提出ConvStack注入局部结构提升密集计数。
基于指令分解的多粒度语言引导模仿学习
提出指令分解的多粒度语言引导模仿学习,将整体任务描述拆解为细粒度子任务指令,提升学习效率与性能。
TaoFlowForge:基于级联流匹配的渐进式原生网格生成
基于级联流匹配将网格生成分解为顶点与连接预测,两阶段粗到细,图像条件下达开源拓扑生成SOTA。
Waypoint-1.5:面向消费级硬件的实时视频世界模型
Waypoint 1.5 是可实时运行于消费级硬件、响应键鼠操控的交互式视频扩散世界模型。
EviViT:面向细粒度感知的证据自适应视觉Transformer
EviViT借视觉搜索轨迹预测证据密度,引导区域重读与token分配,冻结主干通用,提升细粒度精度。
不平衡SAR船舶分类中的跨数据集迁移与未知类检测
六模型在两SAR船舶数据集上评估域内、跨集迁移与未知类检测;跨集泛化差,任务不确定性常优于MC-dropout方差。
PalmLeaf-VQA:面向多地区历史贝叶手稿理解的多文种视觉问答基准
多文种贝叶手稿视觉问答基准,覆盖南亚东南亚八类藏品;最强多模态模型准确率仅58%,罕见文字与退化版面理解仍难。
一步最优:无条件整流流是 Noise2Noise 去噪器,多步积分可证明有害——低剂量 CT 的基准与基于任务的可检测性研究
无标签去噪单步流最优,多步积分偏离MMSE降保真,配对关键;低剂量CT中PSNR升但病灶可测性反降。
一次评估,任意工作点:超网络摊销MeanFlow用于3D MRI重建
超网络将采样模式等运行点映射至单步MeanFlow,一次评估重建3D MRI,学习采样掩膜增益显著,支持自监督。
视频扩散训练中时间注意力头的专门化
逐头普查视频扩散训练:整体集中度不升,仅少数头专门化,结构见于首个时间块,注意力呈自帧与邻帧局部路由。
Enhancing Foundation Models for Imbalanced SAR Ship Classification via Targeted Oversampling
ForensicZoom:基于多模态大语言模型的自适应视觉检查,实现工业级人脸伪造检测
提出自适应视觉检查框架,模型可自主放大可疑区域进行多轮取证推理,工业级检测TPR超97%且可解释。
面向长视频理解的查询对齐视频帧选择
面向多项选择题,将答案选项作为语义线索扩展查询,按问题-答案对的余弦相似度评分选帧,同等帧预算下优于均匀采样。
稳步学习:累积相对点间隔分数用于人脸图像质量评估
提出CARPM-FIQA,累积训练全程相对点间隔分数,稳定人脸图像质量评估,提升判别与排序稳定性。