混元图像3.0技术报告
混元图像3.0开源800亿参数MoE模型,13亿激活,性能媲美最先进模型。
关于具身AI世界模型的综合综述
综述了具身AI世界模型,提出三轴分类法,分析了数据指标与开放挑战,强调物理一致性与计算效率权衡。
GraphPilot:基于场景图条件的语言驱动自动驾驶
提出场景图条件方法,将结构化关系融入语言驾驶模型,显著提升性能且无需测试时输入。
SynSeg:端到端开放词汇语义分割中多类别对比学习的特征协同
SynSeg提出多类别对比学习与特征协同结构,弱监督下提升语义分割性能,mIoU提升0.6%-8.9%。
PhysChoreo: 具有部件感知语义锚定的物理可控视频生成
提出PhysChoreo框架,从单图生成物理真实可控视频,优于现有方法。
计算机生成全息术中的复值二维高斯表示
提出复值2D高斯基元全息表示,参数空间缩减5:1,优化加速50%,PSNR提升13dB,渲染提速3200倍。
超越序列距离:模态间距离不变的位置编码
提出DIPE位置编码,解耦模态间/内位置,消除距离惩罚,稳定长上下文视觉感知。
超100FPS即时表现力高斯头部化身
前馈编码器单图转3D一致快速表现力头部,轻量局部融合,107FPS质量可比,速度提升3-4数量级。
当提示变得可视化:面向大型图像编辑模型的视觉中心越狱攻击
VJA通过纯视觉输入实现越狱攻击,成功率达80.9%,并引入内省多模态推理防御。
基于置信度蒸馏的门控关系对齐实现高效视觉语言模型
GRACE通过置信门控蒸馏与关系对齐,量化模型超越FP16基线,3倍吞吐量,54%内存节省。
基于视频到视频翻译的随机桥接视频对象移除
本文提出随机桥接模型,将视频对象移除重构为视频到视频翻译,利用输入视频先验指导,通过自适应掩码调制,显著提升视觉质量与时序一致性。
维护证据链:视频时间定位中免训练令牌剪枝的语义证据分配
SemVID通过语义证据分配,在仅用12.5%视觉令牌时保留95.4% mIoU,预填充加速5.8倍。
MPFlow:多模态后验引导流匹配用于零样本MRI重建
提出MPFlow,利用辅助MRI模态的预训练PAMRI实现跨模态引导零样本重建,仅需20%采样步数即可匹配扩散基线质量,并将肿瘤幻觉减少15%以上。
RAE-NWM:密集视觉表示空间中的导航世界模型
RAE-NWM利用密集视觉特征与条件扩散Transformer建模导航动态,通过时间门控提升动作精度,改善规划导航。
使用混合机器学习和图像处理方法预测水果质量
结合图像处理与深度学习的混合方法评估水果新鲜度,实时准确率超90%,无需高算力。
一种用于激光焊接预测熔透深度和形态的多任务时空深度神经网络
基于熔池图像提出多任务时空深度学习模型,预测熔透状态、深度和形态,准确率高达99.35%。
深度伪造基准测试衡量了什么?——基于冻结自监督表示的审计
用自监督表示线性探针审计发现,深度伪造基准测试更多衡量通用模态理解而非取证能力,高分未必反映真实威胁。
中文标题
通过fMRI迁移学习将认知任务谱系从单源扩展到多源,发现运动状态跨范式迁移受限,工作记忆状态在预算约束下具有高优先级。
中文标题:LCG:基于稀疏关系注意力机制的长上下文一致性图像生成
中文摘要:提出LCG框架,利用稀疏关系注意力和路由一致性约束,实现长序列多图像生成的一致性与可扩展性。
GeMoE:门控熵——基于MoE的大型视觉语言模型中不确定性感知自适应路由的关键
GeMoE通过门控熵自适应路由,保留99.5%性能,提升36.5%专家激活稀疏性。
超越美学:量化浑浊场景中的信息损失
提出TUB数据集与PCD指标,量化浑浊水下结构信息损失,与实例分割性能强相关。
通过可微分搜索在视觉基础模型中发现层特定提示融合
提出可微分搜索发现层特定提示融合方案,混合融合优于单一方案,有效提升视觉提示调优性能。
DocArena:将原始文档转化为可控的文档搜索代理训练环境
DocArena自动化构建多模态文档搜索训练环境,无需人工标注,显著提升搜索代理性能。
自监督城市树木生物量估算:机载LiDAR与光学观测
提出自监督框架,利用LiDAR与光学数据估算城市树木冠级生物量,R²约0.6,生成双时相数据库,无需人工标注。
DinoLink:面向带宽受限的协作式V2X感知的令牌中心表示压缩框架
DinoLink采用双稀疏架构与残差向量量化,实现139倍比特率压缩,保持32.8% mAP,窄带环境下加速34.5倍。
保持警惕:通过反事实视觉对齐缓解多模态大语言模型中的视觉懒惰
提出VIGIL框架,通过反事实视觉对齐与几何约束最大化视觉-响应互信息,缓解多模态大模型视觉懒惰幻觉。
从粗到细:非刚性三维形状匹配的混合自监督方法
提出双分支粗到细混合自监督法,结合拉普拉斯与弹性基,非刚性形状匹配达SOTA,高效抗噪。
基于多模态深度学习的高光谱卫星图像甲烷羽流分割
提出多模态深度学习模型,以低计算成本实现高精度甲烷羽流分割,提升监测效率。
主动对抗扰动驱动的关联记忆检索用于RGB-事件视觉目标跟踪
提出APRTrack框架,通过分层对抗扰动与关联记忆检索,应对模态退化与目标不完整,实现鲁棒RGB-事件跟踪。
神经体素动力学:通过体素特征平流学习隐式三维物理
提出自监督框架,通过体素特征平流从视频学习隐式三维物理,无需物理引擎,实现异质现象模拟,长期稳定。
从幻觉到接地:通过CRISP诊断视觉空间智能
CRISP通过一致性诊断视觉空间智能,揭示专有模型推理与感知脱节,开源模型缺乏多跳组合推理。
PhyEditBench:面向物理感知图像编辑的真实世界多阶段基准
提出PhyEditBench评估图像编辑的物理理解,发现现有方法局限,并利用视频生成作为推理机制。
遗忘、预判与自适应:长视频的测试时训练
提出帧遗忘网络,用三帧和惊奇度自适应窗口,大幅降低长视频测试时训练计算量,高效保留时序上下文。
感知、裁决与进化:基于事后洞察的自优化取证智能体用于AI生成图像检测
提出自进化取证框架ForeAgent,融合多域特征感知与裁决,通过事后洞察驱动迭代自优化,在AI生成图像检测中达SOTA性能。
SpaceRipple:面向任务的低轨地球观测卫星网络的轻量级语义传输
SpaceRipple框架实现语义传输,省带宽提性能。
位置重绑定缓存复用:面向交错多模态推理的无重放视觉重访
PRCR通过重绑定位置兼容坐标复用历史视觉缓存,避免重放,准确率提升5%,计算量降低数万倍。
DeCoFlow:面向持续异常检测的归一化流结构分解方法
DeCoFlow通过冻结基与低秩适配器分解子网,实现持续异常检测SOTA(MVTec 98.40%,VisA 93.00%)且参数零遗忘。
DiCoBench:基于差异与共性视觉线索的多图像细粒度感知基准
DiCoBench提出高分辨率多图像细粒度基准,含差异与共性两类任务,现有模型准确率远低于人类98.3%。
TaskTok:深入探究任务驱动图像恢复中的任务令牌
TaskTok通过可学习的令牌开关和轻量模块选择性恢复任务相关令牌,高效提升图像分类、分割、检测等下游任务性能。
LogicIR:用于图像恢复的逻辑门网络
首个逻辑门网络图像恢复模型,UNet架构实现高效计算,性能强且成本极低。
在挑战性条件下用于鲁棒手术多任务学习的时间一致标签插值
提出FAROS框架,利用流引导标签插值生成时间一致密集伪标签,平衡时空监督,提升手术多任务学习鲁棒性。
FracEvent:基于分数阶弛豫像素动力学的事件相机模拟
分数阶弛豫动力学模拟事件相机像素生命周期,保留状态改善事件时序,在下游任务中表现更优。
Disco-LoRA: 面向多概念视频定制的内容、风格与运动的解耦组合
Disco-LoRA解耦内容、风格与运动,两阶段实现多概念视频定制,保持外观、风格和运动可控。
LayersReg:一种用于可靠术中3D/2D配准的逐层渐进回归器
LayersReg模拟迭代优化,在特征空间逐层搜索像素流趋势,实现高精度术中配准,误差仅0.68°和1.41mm。
容量可控的多视图3D高斯泼溅风格化
通过容量控制和最优传输,解决多视图风格一致性问题,保留语义结构。
从掩码到概念:通过高效测试时概念嵌入搜索实现自动提示的SAM3用于少样本标注
提出M2C框架,在冻结SAM3中自动搜索概念嵌入,结合不确定性估计主动标记需修正样本,实现高效少样本医学图像标注。
基于三轴向感兴趣区域和多任务学习的颅内动脉瘤分类与分割
提出多任务框架,实现13部位4模态动脉瘤分类分割,采用三轴ROI及双解码器,获RSNA第二名。
PhysEditWorld:面向可编辑物理世界模型的大规模数据集
引入含重力参数的多模态数据集PhysEditWorld,支持可控物理编辑,提升动态建模一致性。
鲁棒洋葱:噪声下逐层剖析开放词汇目标检测器
研究发现开放词汇检测器鲁棒性主要受视觉骨架和特征崩溃影响,预训练策略、注释等贡献小,图像域主导,轻量级方法可显著提升。
从多视图图像中提取神经材质
NeuMatEx可微逆渲染法借助大型材质重建模型初始化和不确定性指导,从多视图图像提取神经材质,效果优于PBR方法。