余弦误导:辅助损失重塑视觉语言模型,而非其潜在变量
余弦对齐与准确率负相关(r=-0.94),潜在变量被绕过,辅助损失通过共享参数重塑模型。
让它简单:视觉-语言-动作模型的一步动作生成
通过偏置高噪声训练分布,标准扩散训练即可实现一步动作生成,性能媲美多步解码。
共鸣心智:具备心智理论的闭环社交化身
提出闭环双智能体框架,融合心智理论推理与多模态生成,实现更自然的社交交互。
艺术史与文本生成图像中的性别伪影
研究表明性别表征塑造艺术风格,且生成模型放大历史性别伪影。
面向数据高效高斯虚拟形象的自学习表情变形
SAGE框架自监督学习表情变形,联合优化2D高斯与SDF,从极少数据实现高保真可动画虚拟形象。
Unveiling the Unknown: Open Vocabulary Object Detection with Scene Graphs
CamFlow+:用于二维相机运动估计的混合运动基元及其稳定应用
CamFlow+提出混合运动基元框架,在稠密流空间估计相机运动,提升精度和视频稳定性。
忠实、丰富且精确:T2I模型生成自然科学插图的基准测试
提出FEPBench基准,从多学科科学插图中评估T2I模型的忠实度、丰富性与精确性,发现SOTA模型存在文本渲染和推理瓶颈。
MemoryCard:面向长视频问答的主题感知多模态线索压缩
MemoryCard通过主题分割与事件摘要构建视频记忆卡片,显著提升长视频问答准确率,最高相对提升21.8%。
从视频中学习几何表示以构建空间智能多模态大语言模型
GeoVR用2D视频学习几何表示,通过多目标蒸馏3D知识,赋予MLLM空间智能,在空间推理中达SOTA。
T-FunS3D:任务驱动的层次化开放词汇3D功能分割
T-FunS3D实现任务驱动的3D功能分割,高效省内存,性能达先进水平。
面向扩散模型训练的几何感知数据集压缩
提出几何感知分布对齐法,通过单向最优传输与正则化,实现高效数据子集压缩训练扩散模型。
ReCache:通过REINFORCE学习扩散模型的预算感知缓存调度
ReCache用强化学习学习缓存调度,在给定预算下最大化生成质量,显著降低计算成本。
纹理保持隐式神经表示用于锥束CT截断重建
自监督神经场景表示联合物理迭代精化,消除CBCT截断伪影并保留高频纹理。
文本到3D室内场景生成中基于视觉语言模型的全局-局部蒙特卡洛树搜索
提出全局-局部MCTS规划文本到3D室内场景,层次化表示与PRM引导搜索,扩散模型纹理预测,新数据集3DTindo-bench,生成场景更真实。
ReSAGE-PAR:行人属性识别中基于表征相似性评估的生成式扩展
提出ReSAGE-PAR管道,利用扩散模型生成图像,结合视觉-语言评分与贝叶斯分类器生成伪标签,提升行人属性识别性能达8.7%。
基于结构化步态-语言表征的LLM条件病理步态合成
提出多模态LLM框架合成病理步态,病理tokenizer保留特征,合成数据提升分类准确率至92.77%。
LoomVideo:融合多模态输入的视频生成与编辑统一框架
LoomVideo提出5B参数高效统一模型,用MLLM和零开销条件实现视频生成编辑,速度提升5.41倍,电商时尚场景表现优异。
使用大语言模型和梯度提升的多模态性别歧视识别与表征
提出基于LLM和梯度提升的多模态性别歧视识别方法,模因中语义特征有效,短视频需更强时序建模。
基于深度学习的二维口内图像三维口腔重建
软件法用10张2D口内图重建3D口腔模型,无需硬件,精度77.49%,但点分布不均。
视频速率流式风格化:基于视觉感知MLLM条件编辑扩散——蒸馏UNet与MLLM文本编码器上的非对称批处理推理
针对蒸馏UNet与MLLM文本编码器的不对称瓶颈,提出流式管道,通过非对称批处理、编译优化和条件刷新,单卡RTX 3090 Ti实现27-30fps视频速率风格化。
ATT-CR:自适应三角Transformer的云去除方法
提出自适应三角Transformer,用三角注意力和特征选择门控降低计算开销并抑制云干扰,性能优于现有方法。
HyperVis:基于洛伦兹双曲面的连续潜在视觉关系图实现组合推理
HyperVis在洛伦兹双曲面上建模视觉关系,作为训练正则化和推理编码器,提升组合推理性能,曲率稳定于高值。
视觉自回归模型的知识蒸馏
提出VarKD,通过选择性教师监督与减少令牌歧义,有效蒸馏视觉AR模型,优于基线,缩小与大型模型差距。
RQUL-UIE:通过数据集内自监督活化质量不稳定标签的水下图像增强
提出扩散模型自监督策略,用质量评分量化噪声分级指导去噪,结合傅里叶细化网络,有效利用不稳定标签提升增强效果。
Diff-CA: 用扩散模型分离共有和显著因子
提出扩散模型条件框架,弱监督分解共有与显著因子,实现高质量对比分解与目标操作。
位置、类型、原因与重要性:面向文本到图像反馈的结构化缺陷定位
提出结构化缺陷定位(SDG),将缺陷建模为(位置,类型,原因,重要性)元组,构建数据集与评估协议,实现诊断到对齐,提升生成图像质量。
MS-DKC:面向医学图像分割模型设计与适配的数据集知识卡框架
MS-DKC框架明确数据集要求,映射设计先验与风险标准,实验表明不同数据集需不同策略。
基于选择性注意力的计算感知事件到帧重建
提出计算感知的E2F框架,采用循环编解码器与选择性上下文融合,实现高效重建,平衡质量与复杂度。
基于时间冗余掩码与潜在修复的自适应令牌化
利用冻结分词器的潜在空间时间冗余,无参数自适应分配令牌,轻量LIT修复,实现高效推理与31倍加速。
FontFusion:通过字体排版条件增强扩散模型中的生成文本
提出FontFusion框架,以层次化token表示与位置感知嵌入解决扩散模型中字体控制与可读性的矛盾,提升字体生成效果。
VZCrash:大规模自车碰撞IMU数据集
首个大规模真实车辆碰撞IMU数据集,含3.1万碰撞和15.8万负样本,验证数据规模对训练实际部署的碰撞检测模型至关重要。
对抗攻击已揭示答案:面向视觉语言模型的定向偏差引导测试时防御
发现对抗图像特征沿主导方向偏移,据此提出DBD防御框架,实现SOTA鲁棒性,甚至对抗精度超越干净精度。
SAM-Flow:基于源锚定掩码流的免训练图像编辑
SAM-Flow通过源锚定掩码流和动态软掩码,实现免训练局部图像编辑,有效保留背景。
RhymeFlow:基于异步去噪流调度的无训练视频生成加速
RhymeFlow无训练解耦帧去噪轨迹,仅关键帧密集去噪并跳步非关键帧,加速视频生成且保质量。
DisasterBench:复杂环境下基于无人机的灾害响应多模态基准
提出涵盖14种灾害场景、9个任务的多阶段推理基准DisasterBench,及2B参数轻量模型DisasterVL,推理精度接近GPT-4o且效率更高。
SC-MFJ:一种用于医学图像分割的简单触觉质量度量
提出SC-MFJ度量触觉质量,发现简单高斯后处理比二值分割提升147倍,优于学习SDF且更稳定,几何指标无法识别。
Symb-xMIL:数字病理学中多实例学习的符号解释
提出Symb-xMIL框架,量化模型与逻辑规则的对齐,揭示病理学MIL决策语义,提升可解释性。
GRAMformer: 通过体积多模态交叉注意力实现任意顺序模态交互
提出体积多模态交叉注意力(VMA),利用查询与多模态键的联合几何体积建模任意顺序交互,集成于GRAMformer提升效率与效果。
基于合成数据生成与视觉的皱纹和关键点检测用于双臂布料操作
提出合成数据生成与视觉感知框架,结合CNN和YOLOv8,实现双臂布料操作中关键点与皱纹检测。
基于黎曼退化流形的测地流匹配用于盲图像恢复
将退化建模为黎曼流形上的点,用测地流匹配学习内在传输动态,推广线性流匹配,处理混合退化。
迈向一对多时间定位
针对一对多视频时序定位,构建基准、数据集及奖励函数,模型性能显著提升。
复杂性平衡的扩散分割
CBS按近似负担分割扩散时间线分配容量,提升合成质量且不增推理成本,FID改进约35%。
基于无人机多光谱成像的水稻病害制图深度学习框架比较
对比CNN与Transformer模型,U-Net++(EfficientNet-B3)达97.62% mIoU,轻量级CNN更可靠。
EasyLens:一种免训练即插即用的医学视觉语言模型细微病灶表示放大器
通过原型空间与反事实推理增强病灶表示,免训练提升医学VLM对细微病灶的检测性能。
放射学中比较推理的视觉语言框架
提出实体感知跨图像比较推理框架,构建大规模数据集,模型在检索与生成任务中均达最优性能。
HomeWorld:一种从平面图到精装修的统一框架,用于生成可控、密集交互的全屋场景
提出统一层次化框架,从平面图到全屋精装修,实现可控密集交互场景生成,数据集和5K场景将开源。
结合想象力的思考:基于世界模拟器的智能体视觉空间推理
提出Astra框架,以世界模拟器增强视觉语言模型的想象推理,通过强化学习训练何时何地如何想象,显著提升空间推理性能。
StoryVideoQA:基于大规模、多类型和自动生成数据集提升深度视频理解
构建363K问答的最大深度视频理解数据集,评估20种方法发现不足,并提出PlotTree代理。
中文标题
两步生成比五十步物理一致性更好,因相位退化。PhaseLock锁定两步运动先验,提升物理一致性6.2分,开销极低。