Joint Branch-Space Transform Coding for Diffusion Activation Quantization with Classifier-Free Guidance
VASC:面向高效三维重建的值感知稀疏注意力与跨层记忆
VASC 提出免训练稀疏注意力,融合值感知块选择与跨层记忆,兼顾位姿估计与重建质量,推理最高提速 2.29 倍。
面向重述图像-文本监督分布的匹配预算审计框架
提出匹配预算审计框架,以64词预算五维评估重述图文监督分布,发布约4.9亿审计语料。
EyeTAG:眼动轨迹感知的注视估计
EyeTAG将近期预测差分主体无关的显式注视轨迹先验,融合人脸与眼流做因果多帧估计,误差降约1°。
概念驱动的领域自适应:在干草堆中寻找抽象之针
提出三阶段CDDA框架,以概念为语义锚点适配双塔视觉语言模型,实现教学视频概念级检索,优于多个基线。
RelationVGGT:面向三维空间关系分割的视觉几何Transformer
RelationVGGT免位姿、免逐场景优化,前馈实现多视图三维空间关系分割,并构建自动标注流程。
注意言辞:基于文本条件的文本感知视频到语音合成
提出WYS框架,以文本条件缓解视觉歧义,用注意力融合与流匹配生成高保真语音,刷新视听同步与准确率。
扩散多模态大语言模型中的两个时钟:答案在推理解释展开前已稳定
掩码扩散多模态模型中答案可在推理展开前稳定,分块与提示影响覆盖率及准确率,覆盖率是差异主因。
VIEScore2:带空间定位解释的统一图像评估
VIEScore2统一评估图像生成与编辑,单次预测质量分数和缺陷位置,性能优于通用VLM与空间评估器。
Video-Index:面向视频理解的精选元基准
提出攻击金字塔审计115个视频基准,构建840项Video-Index,顶尖模型领先开源37个百分点。
利用合成状态过渡自举视频交互生成
用图像编辑模型合成起止状态锚点,提出状态引导采样并构建可扩展交互数据集,微调后显著提升交互生成质量。
面向视频生成中动态主体集合的主体一致性
提出动态主体集合一致性评估框架DynSC-Eval,并用其奖励后训练提升长视频生成主体一致性。
基于转录孟加拉语文本的开放词汇词语识别
手写孟加拉语词语识别,自建9841图像集,融合目标检测与改进NMS,F1达92.61%,词级识别率96.12%。
FutureWorlds:从多种未来中学习机器人世界模型
提出从多种未来学习机器人世界模型的框架,利用记忆条件搜索引导策略优化,显著提升长时预测与运动一致性。
克服逻辑门网络扩展中的核冗余
提出动态逻辑核框架,缓解逻辑门网络宽度扩展中的核冗余,提升核利用与多样性,以更高参数效率提高准确率。
Ego2Act:评估第一人称视频生成中的目标导向操作
Ego2Act基准含2,640个第一人称目标导向操作视频,评测多步任务模拟;模型常跳步,物理动态预测不佳。
MVDG:面向无约束真实世界图像的高效多视图3D消歧
MVDG基于VGGT实现多视图联合消歧,单次推理替代成对比较,提升SfM精度与速度。
HierGF:基于几何感知消息传递的分层高斯场用于稀疏视图三维重建
提出分层高斯场HierGF,用几何感知消息传递生成伪监督,提升稀疏视图重建一致性并补全欠采样区域。
面向自动视频标注的ASH:零样本开放词汇多目标跟踪与分割
提出GPT虚拟提示批处理与ASH分块匹配,实现零样本开放词汇长视频多目标跟踪分割,显存低于25GB。
用于视频表示中规范高斯构建的仿射对齐图集
提出仿射对齐图集规范高斯表示,以逐帧仿射变换吸收全局运动,减少错位,可低成本集成并提升大运动视频重建质量。
PhysicsLENS:诊断视频生成模型中的物理属性盲区
提出基准PhysicsLENS,用配对场景评测视频模型,发现其常忽视任务所述物理属性。
解析混合单光子激光雷达回波以重建前景视图与隐藏场景
状态感知框架从遮挡单光子直方图重建前景与隐藏场景,并发布真实配对数据集,提升隐藏深度与点云精度。
骨架与策略提示:面向视觉语言模型的免训练否定理解
提出免训练方法SSP:抽取问题骨架、检索同类问题归纳否定策略,无需更新参数即提升VLM否定VQA表现。
FlashBack:在流式视觉语言模型中知晓何时该记忆
FlashBack:免训练框架,先判断查询是否需要历史,再按需检索长期记忆,兼顾实时感知与长时记忆。
iSEE:通过自监督实现客体永久性
iSEE 无需任何标注,借证据建模、外观—位置分离与重现线索,实现遮挡下的客体永久性追踪。
孟加拉语转写段落中的颜色无关词分割
面向手机拍摄手写孟加拉文,构建含阴影干扰数据集,实现颜色无关词分割,F1达91.2%。
CineMR:面向定量心脏磁共振评估的工具集成视觉语言推理
CineMR以工具增强视觉语言推理,调用分析工具完成定量Cine CMR评估,显著优于现有模型。
RSNA颅内动脉瘤(RSNA-ICA)数据集
RSNA联合多学会发布RSNA-ICA大型公开数据集,含4278例患者的7202个CTA、MRA及MRI序列,用于AI颅内动脉瘤检测与定位。
基于语义RGB-Depth的显微立体视频手术技能评估
融合立体与单目深度的语义RGB-Depth框架,结合器械与解剖语义流及层次注意力,实现显微立体视频手术技能评估,F1达0.938。
OptimusMesh:通过稀疏潜在枢轴从点云生成紧凑自回归网格
OptimusMesh将点云压缩为16个稀疏潜在枢轴,两阶段自回归直接生成紧凑三角网格,面数减少25.7%–94.1%,几何保真度具竞争力。
AutoGUIWorld:将图像生成器作为GUI智能体的视觉世界模型
无需部署软件,用图像生成器与规划器合成GUI交互轨迹,微调后显著提升OSWorld与ScienceBoard任务表现。
EgoFound3R:基于逐点交互属性的端到端世界空间第一视角手部重建
EgoFound3R 以端到端统一模型在世界空间重建第一视角手部几何,并同程预测逐点可见性、接触与距离,精度显著提升、吞吐约 6 倍。
一种面向动态场景的紧凑显式4D表示
提出Sparc4D,将单目视频编码为稀疏4D状态,压缩动态特征,重建质量优且紧凑,可迁移。
基于动态归航优化的三维网格生成流匹配强化学习
提出动态归航优化DHO,将负轨迹优化转为正样本吸引引导归航,构建Flow3D-Pro提升3D网格生成质量。
STAGE:面向文本到3D模型的子空间靶向仿射生成擦除
免训练闭式分阶段文本到3D模型概念擦除:按类型校正结构/外观,TRELLIS得分66.7胜53.2。
当裁判行动时:审计文化情境提示下VLM引导的图像选择
审计VLM裁判:4B近随机、位置偏差大,重排序改变六成选择;8B超CLIP,但一致性过滤须随裁判更换重审。
ShelfChange3D:面向零售货架监测的对象级3D变化检测
将货架监测定义为对象级3D变化检测,提出数据集与端到端框架,实现精准3D定位,性能优于现有基线。
PickMoment:通过学习去模糊与模糊到视频实现连续时间单图到视频
提出PickMoment,直接学习曝光任意子区间均值模糊,单模型统一去模糊、模糊到视频与连续时刻恢复,性能领先。
Dyna3:基于深度基础模型的 VLM 引导免训练 4D 重建
Dyna3免训练扩展深度基础模型至4D重建,VLM引导分割分离动静,精度更优、速度快、显存低。
ODDR:基于奖励引导的单步去阴影扩散
提出ODDR:合成数据训练单步去阴影扩散ODD,结合无标注奖励模型微调,缩小合成到真实差距。
ARROW:真实场景中4D观测的任意重建与追踪
提出前馈模型ARROW,以顺序无关查询统一任意图像集的3D重建与点追踪,在多基准达最优。
FiVOS:基于交互式视频目标分割与滤波器增强的鱼类分割算法
提出FiVOS鱼类分割方法,以掩码块滤波与噪声过滤抑制误差累积,在鱼类视频分割任务中达到SOTA。
CLASP:基于单一超网络的空间定位概念持续低秩适配器
提出无回放持续个性化法,用单一固定超网络生成概念低秩适配,支持空间控制,参数量不随概念数增长。
利用野外自我运动监督声源定位
用自我运动作弱监督学习双耳声源定位,结合视觉几何与传统双耳线索,在真实音视频数据集上验证有效。
通过对比轨迹排斥实现更平滑的流匹配
提出CoFlow,借对比轨迹排斥降低速度场局部利普希茨常数,改善少步推理,FID显著降低且无额外训练开销。
MWOP:面向高效多模态大模型的模态感知宽度维度算子剪枝
提出MWOP,按模态路径剪枝注意力、分离视觉与文本FFN通道,预填充提速1.6倍且性能保持99.7%。
面向预训练目标检测的定位感知不确定性
提出轻量事后证据元模型,冻结检测器,以定位误差和显著性课程估计框级不确定性;对抗下TP-FP AUROC最高提升22%。
处理参数对无人机摄影测量高精度测量的影响
通过768种处理变体评估发现,参数设置显著影响无人机摄影测量精度,优化后系统误差降低超半,为高精度监测提供指导。
MMVistaReason:迈向多模态推理的开放数据与后训练配方
MMVistaReason开放数据后训练方案,融合SFT/RL与多专家,4B/9B在15项基准胜更大模型。
不确定性引导的握手:面向手术级胶质瘤分割的高效人在回路精修
不确定性引导人在回路胶质瘤分割:Dice 0.914,HD95 4.76mm,交互量仅11.3%。