Hob-VL:基于视觉的布尔推理基准
提出Hob-VL视觉布尔推理基准,含6000道是非题和1000道识别题,揭示模型准确率仅约50%。
面向可泛化深度伪造检测的交叉重建再审视
重新审视交叉重建,提出保留伪造痕迹多样性的解耦框架,结合掩码频率感知重建,提升深度伪造检测泛化性。
SuperMotion:面向文本驱动人体运动编辑的源保留去噪
提出SuperMotion:在反向每步复用源运动,学习保留门与干净空间锚点,无需编辑掩码,提升编辑精度并抑制时序细节衰减。
SALD:扩散模型的自参考优势学习
提出SALD自参考训练框架,用同模型双噪声路径误差差加权,无需外部教师或额外参数,提升生成质量。
VTR-Bench:评估视频生成中视觉文本渲染的系统性基准
提出VTR-Bench,评测视频生成视觉文本渲染,含300提示与自动评测,发现11个模型普遍不佳。
在消退之前:在推理阶段强化 VideoLLM 中的时间表征
VideoLLM 的时间信息在中间层涌现却向输出层逐渐消退;无需训练的时间激活注入法可有效强化时间推理。
PAGER:通过几何与关系蒸馏实现局部到全局对齐
提出PAGER,无标签蒸馏几何与关系,将局部特征对齐冻结全局3D语义空间,超越监督微调并提升迁移。
FedCKA:表征引导的层个性化实现跨驾驶域联邦3D感知
FedCKA用CKA相似度动态生成聚合掩码,选择性共享一致层,跨域联邦3D检测NDS提升7个百分点。
VoxelSynth3D:基于配对合成CLINIC-Metal基准的可解释体图像域金属伪影校正
提出免训练的三维图像域金属伪影校正框架VoxelSynth3D,并构建配对合成基准;留出集上稳定降低组织误差,近金属处有结构折衷。
数据稀缺条件下长尾出血性病灶分割的合成训练
提出无需真实病灶标注合成训练框架,用于数据稀缺下长尾出血病灶分割,cSS/CMB上优于传统滤波基线。
Oneira:从开放式生成到视频世界模型中的开放世界交互
Oneira用编码智能体维护可扩展世界状态,使视频世界模型中新生成实体可交互、交互结果持久。
超越域级适应:面向间隔的语义-外观交互校正及其在个性化联邦视觉-语言模型中的应用
MOSAIC以决策感知有害性评分建模类-域残差交互并做低秩校正,提升个性化联邦视觉-语言模型精度。
并非所有错误都能靠规模扩展消除:视觉语言推理中规模扩展的止步之处
提出可分离定律,刻画视觉语言模型性能随语言主干规模与视觉token数的变化,发现部分能力永不受益于扩展,并给出算力分配规则。
面向越南语视觉问答的多层融合Transformer视觉与文本表示融合
提出多层融合Transformer与交叉注意力,聚合多层图文特征,在越南语ViVQA上优于基线。
MLLM评委真的在评判编辑吗?在经验证质量保持的图像编辑评估中审计偏差
提出EditJudgeBias基准,经质量保持验证后审计五个MLLM评委,发现无关线索均造成超出自身噪声的偏差。
重新思考扩散模型中的记忆缓解:强化文本条件
提出免训练法:高斯平滑重分配交叉注意力,强化内容词元并抑制填充,兼顾提示对齐与缓解记忆。
DiVid:诊断视频生成模型中特定维度的多样性坍缩
DiVid将视频生成多样性分为语义、风格、运动等六维诊断,发现全局高分模型仍在运动与镜头维度坍缩。
当文生图助力编辑:去噪期间条件作用的影响
统一编辑器可在去噪中有界切换至文生图任务,借其能力提升编辑质量,并靠切换时机平衡质量与源图保持。
架构采样:通过冻结视觉-语言模型中的计算多样性实现测试时扩展
提出免训练架构采样,通过复用解码器层块产生多样计算路径,pass@9平均提升6.58个百分点。
MEGA:通过空间视觉蒸馏从3D高斯泼溅中提取对象级网格
提出MEGA,通过空间视觉蒸馏从3DGS提取对象级水密网格,实现高精度占用与逼真渲染。
3DROID:一个可渲染的3D高斯数据集,附带逐场景实测可靠性
研究外参可靠性对前馈3DGS的影响,提出校准感知流程,将重建场景锚定到机器人度量工作空间,发布带场景级可靠性信息的可渲染数据集。
连续条件化VLA:融合肌电与视觉任务描述符
提出肌电条件化EC-VLA与视觉标注VA-VLA,在杂乱分布外场景下均显著优于语言提示基线。
ATI-VLA:通过可操作对齐与自适应注入的以动作为中心的预测式视觉-语言-动作模型
共享码本对齐观测与动作表征,轻量侧路自适应注入预测潜变量,以动作中心单目标训练,仿真与真机均达SOTA。
FFBL-Coop:关联解耦的协同3D多目标跟踪
提出"先融合后绑定"的FFBL-Coop,解耦实例准入与身份管理,提升协同3D多目标跟踪精度与连续性。
PhysDEM:稀缺测量下时空场生成的物理定义能量匹配扩散
提出PhysDEM,融合物理方程与稀疏观测,无需全场地数据即可生成多可能时空场。
GIFTBench:诊断图像伪造定位中的泛化能力并指导模型设计
GIFTBench多轴基准揭示跨源迁移不对称等泛化问题,并指导设计出ForenScope框架。
Cog-VADU:面向视频异常检测与理解的免训练认知推理框架
提出免训练框架Cog-VADU,将视频异常检测重构为序列认知推理,结合跨模态重排序,提升零样本可解释性。
GenCOPE:面向机器人抓取的合成到真实泛化类别级物体位姿估计
仅用合成数据训练,借助2D-3D语义一致性与跨模态融合,实现轻量高效且可泛化至真实的类别级物体位姿估计。
OneStreamer:统一流式视频交互中的感知、记忆与主动响应
OneStreamer统一流式视频感知、记忆与主动响应,构建百万级数据,4B模型在八项基准领先。
VETO:面向视觉语言模型的视频高效令牌优化
VETO为训练可选插件,以帧内/帧间双轴令牌压缩加速长视频VLM,最高提速45%,精度保持或提升。
评估多任务形态学概念学习在3D CT肺结节恶性评估中的作用
基于LIDC-IDRI数据比较单任务与多任务3D CNN,发现联合学习毛刺、分叶等形态特征未明显提升恶性风险分类,类别失衡与标注结构是关键。
GaugeVLM:以可测量的几何干预结构化空间监督
通过三维场景可控干预生成关联观测,将测量误差转为偏好边际,提升视觉语言模型空间推理与跨域泛化。
是组合,而非对话:VLM 丢失的是场景,而非线索
VLM 需正确组合呈现视觉证据;场景碎片化损害使用与定位,仅有充分证据不够。
拨动心弦!模态动态字体
提出模态动态字体:用字形固有振动模态驱动平滑动画,冻结视频扩散模型仅调幅相,形状运动解耦,优于基线。
Masked Swingers:利用数据增强推动自监督学习中的自编码器发展
提出掩码交换者:双增强分别掩码编码,交换CLS后解码,学视角无关表示,显著优于MAE。
ExploreNet:在扩散GRPO中学习何处探索
提出ExploreNet自适应探索扩散GRPO各潜变量噪声,生成质量提升14%,人类偏好胜率67.2%。
改写感知代价甚微:视觉语言模型在 ε ≤ 4/255 下的定向语义替换
白盒定向语义替换在ε≤4/255内即可改写VLM感知,将源语义完全替换为目标语义,并出现语义融合。
学习语义修补以实现可动画的高斯头部化身
提出SInGA,在UV空间做语义修补补全单图未观测面部区域,回归高斯属性,无需逐身份优化即可动画。
用于视觉语言模型少样本分布外适应的归纳视觉逻辑
免训练归纳视觉逻辑:借VLM残存描述能力构建类别特征词典,实现远域分布外可解释分类。
TrackFish3D:基于多视角视频的鱼群自监督三维跟踪
TrackFish3D利用多视角几何自监督实现鱼群三维跟踪,无需身份标注,3D MOTA达95.8%,并可泛化至鸟类。
PhyProbe:重新思考生成视频中的物理一致性评估
PhyProbe 用冻结时空编码器加轻量评分头,融合排序、回归与校准,评估生成视频物理一致性;多数基准领先,与人类判断高度一致,偏好评估也有竞争力。
MSU 团队 GenText-Forensics 2026 挑战赛技术报告
提出分解式思维链流水线,结合篡改检测器与双视觉语言模型,获挑战赛第三名。
超越层级:统一多模态模型的位置分辨梯度冲突与位置感知调制
发现生成-理解梯度冲突随视觉token位置变化,提出位置感知调制,仅在高冲突位置去除反对齐梯度,提升统一多模态模型性能。
VidHarness:面向低成本长视频理解的可进化智能体框架
VidHarness以MCTS进化智能体框架,借多保真验证与混合路由降本,在多项长视频理解基准上刷新SOTA。
MOBA-VL:面向实时MOBA解说的赛事事件定位多轮强化学习
MOBA-VL以遥测定位事件、多轮强化学习训练9B模型,实时解说总分领先,事件召回率升至42.1%。
LoopVL:循环视觉智能
LoopVL将循环Transformer扩展至视觉语言模型,共享模块迭代更新多模态状态,性能超越更大模型并现视觉顿悟。
可听世界模型:面向3D世界的空间感知声音生成
免训练框架将声音融入3D世界:语义分层定位声源并锚定几何,渲染随听者移动的空间音频,空间一致性更强。
PAMI:面向文本到人体-物体交互生成的部位锚定运动框架
PAMI用身体部位锚点投票定位物体运动,粗到细生成并细化接触几何,接触召回率较此前最佳提升14.5%。
面向任务特定视觉感知的合成数据策划
核心不是生成更多,而是生成什么:按任务设计场景、外观与标注;程序化渲染、物理仿真与生成式AI各有所长,须与真实数据互补。
基于视觉语言模型街景描述的行人路径感知安全估计
以视觉语言模型街景描述作可解释中介,估算感知安全并规划行人路线;实地验证相关性有限,基准提升未带来现场增益。