SymmAdapt:基于对称流匹配的医学图像分割无源域适配方法
提出对称流匹配无源域适配分割,生成伪标签与合成源像,保持结构一致,在多种医学影像上优于现有方法。
基于多模态第一/第三视角数据采集与结构化任务知识的装配与拆卸作业AI工人指导
提出数据驱动方法,从专家演示中提取结构化任务知识,实现程序文档与情境感知指导,优于静态图像方法。
OmniCAD:面向机器人装配中三维空间推理的大规模基准
提出OmniCAD,含2.5万机械装配,评估组件定位、装配关系与工具增强推理,现有VLM表现差。
面部形状模型的多视图神经回归
用合成多视图图像训练神经网络,直接预测可重拓扑面部网格,相机参数与3D地标正则化提升精度。
用于视觉表征学习的双曲层次聚类
提出基于双曲层次聚类的可解释标记混合器,构建新骨干网络,在多项视觉任务上超越现有模型。
MorphoCLIP:文本监督的对比学习用于细胞绘画图像中的扰动匹配
对比模型用冻结主干和轻量模块将细胞绘画图像与扰动文本双向匹配,前十命中率优于随机;化合物-基因匹配仍待解决。
Contextrast++:鲁棒多尺度上下文对比学习用于语义分割
提出Contextrast++,结合上下文对比学习与边界感知负采样,改进多尺度特征融合、缓解类别不平衡,提升语义分割性能,且推理无额外开销。
混合生成-判别式物体放置
提出半生成方法,用均匀锚点融合前后景特征,预测合理性分数与放置集,平衡效率与效果。
LoViF 2026 首届统一去除雨滴与反射挑战赛:方法与结果
综述雨滴与反射统一去除挑战赛:基于真实数据集,149人参赛,12份有效方案,分析并展望未来。
看见未见:基于高斯语义的稀疏视角3D泛化
提出SeeU框架,用语义条件高斯细化及跨视图熵感知模块,解决稀疏视角遮挡导致的结构不完整,提升渲染质量。
无编辑奖励的图像编辑在线强化学习可行吗?
提出借助文本生成奖励替代编辑奖励的Lever-Edit框架,实现无编辑奖励的图像编辑在线强化学习,效果媲美微调基准。
SiZeUp:利用深度序数损失从航拍图像快速构建三维代理
提出SiZeUp,用深度序数损失从航拍图像快速构建三维城市代理,避免稠密点云,速度提升23-52倍
GuidedFlow:一种用于增材制造异常检测的注意力引导框架
提出注意力引导流模型GuidedFlow,用于增材制造异常检测与定位,在AM3D-AD和MVTec-AD上优于多数先进方法。
OmicSync:基于证据约束的大语言模型推理的可靠性感知空间多组学聚类
OmicSync:证据约束LLM推理的可靠性感知空间多组学聚类,闭环优化提升性能。
ByteAction:字节空间动作识别基础模型
直接从压缩比特流识别动作,无需像素解码,抗损坏且保护隐私;通过双视图增强与一致性训练,实现最强鲁棒性。
直接、并行还是顺序?无训练多主体图像到视频生成的比较研究
比较直接、并行、顺序三种无训练多主体图像到视频生成,评估外观、运动、时间一致性与主体间连贯性。
VersaDB:用于统一多模态数据集的高性能AI存储数据库
VersaDB统一存储多模态AI数据集,采用页式存储、B+树索引与分层元数据管理,最高加速5.35倍。
LagrangeGS:动态3D高斯溅射上的非保守拉格朗日系统
将动态三维高斯溅射建模为非保守拉格朗日系统,解决轨迹不一致、不可逆与长期坍缩,实现稳定外推和时间反演。
Object-Uni:以对象为中心的空间理解与可控生成的统一模型
统一模型将姿态作为共享几何变量,统一姿态感知、空间推理、条件生成与新视角合成,提升物体级姿态理解与可控生成。
以数据集为中心的葡萄叶部病害分类与检测深度学习方法基准
构建以数据集为中心的葡萄叶病分类检测基准,发现跨数据集性能下降明显,强调数据来源与真实场景验证。
RISE:面向世界动作模型的自适应想象
提出自适应想象框架RISE,按预期收益决定推演或停止,减少冗余并提升规划性能,经两大基准验证。
Grounded-Exo2Ego:面向鲁棒的第三视角至第一视角视频生成的结构化语义锚定
提出双分支扩散模型,结合几何锚定与语义接地,并解决相机重建错位,外视转内视视频生成效果大幅提升。
注释作为展开:视频多模态大语言模型的高效可扩展强化学习
提出OraRL,将注释作为oracle轨迹进行强化学习,解决优势反转,仅需2.2倍SFT时间,性能显著超越GRPO及多个基准。
利用最优传输聚合视觉信息进行视频语言模型令牌压缩
提出AVIOT,将视频令牌压缩视为最优传输问题,自适应任务与空间,压缩后性能不降或更优。
DiffVC-ONE:基于一步视频扩散Transformer的扩散式生成视频压缩
提出一步扩散视频压缩框架,统一潜压缩与混合条件,实现高感知质量和高时间一致性,且推理成本低。
测试时学习前列腺解剖用于微超声癌症检测
提出ANT分割引导的测试时适应方法,通过学习前列腺解剖提升微超声癌症检测,AUC提高2.9%和3.6%。
亲近朋友,更要亲近对的邻居:灾害条件核正则化图注意力用于建筑损毁分类
灾害条件图注意力引入可学习空间核先验,用残差去相关损失抑制空间自相关,提升建筑损坏分类迁移。
基于噪声残差伪影模式分析的零样本彩色图像篡改定位
提出零样本无训练盲篡改定位法,从单图噪声残差估计参考伪影模式,用相关性与高斯混合评分生成像素级篡改图
聚合而非适应:跨站点帕金森步态严重度的受试者级后验聚合与直推式校准
单线性层在冻结编码器上以0.6945宏F1夺冠,靠受试者聚合与直推校准,微调反而更差。
MV2GF:基于视觉几何基础模型的多视角行人检测
提出MV2GF,用视觉几何基础模型融合任务特征与几何特征,投影点图至3D,提升多视角行人检测对未知相机配置的泛化能力。
AGIDefect-4K:面向AI生成图像缺陷检测、定位与解释的丰富标注数据集
构建含4000张AI生成图像的数据集,提供缺陷检测、定位、解释及质量评分标注,揭示缺陷诊断挑战。
RECOUNT:基于合成视觉示例的参考引导计数
RECOUNT用参考图和扩散生成示例库,引导零样本计数,避免文本描述粗粒度,显著降低计数误差。
亚里士多德流形:利用柏拉图式感知特征实现无需反向传播的快速概念学习
基于柏拉图表示假设,形式化亚里士多德流形,刻画冻结表征的层间几何,实现无需反向传播的可解释概念学习。
提升、关联与融合:面向二维到三维基础模型迁移的决策中心框架
提出决策中心框架LAF,五算子规范2D到3D迁移,审计161个系统,揭示关联非身份、载体决定查询接口等特性。
身份感知的人-物体交互动作描述生成
提出身份感知人-物交互动作描述任务及ID-HOINet模型,基于多视角学习与两阶段重写,联合生成身份与动作,性能最优。
TopoSurfel:在高斯Surfel与网格间构建闭环以进行表面重建
提出TopoSurfel,通过可微等值面提取网格与高斯Surfel闭环,网格引导演化抑制漂浮物并填补孔洞,实现高精度重建。
公共葡萄病害数据集中的捷径学习:标注粒度是调节因素而非原因
公共葡萄数据集中标注粒度仅调节捷径非成因:缩小该类框误报降六成六,反向粗化不产生误报。
弥合语言与球面空间:面向文本到全景图生成的以对象为中心的控制
提出PanoCtrl,以对象为中心,将文本转为球面对象条件,提升全景图生成的空间对齐与质量。
ArtiMo:智能体驱动的关节网格动画
提出ArtiMo智能体框架零样本用大模型生成关节网格动画结合URDF约束与视觉自校正性能超基线
AffordAny:基于视觉-语言引导的几何推理,从单目RGB图像实现开放世界三维功能定位
提出AffordAny框架,利用单目RGB图像构建大规模三维功能监督,结合冻结视觉语言模型与伪标签自训练,在开放世界基准上实现最优功能定位性能。
M2Depth:统一单目深度基础先验与多视图立体
双向互精化融合单目深度与多视图立体,解决尺度模糊,增强结构完整性,性能超越现有方法。
SPARK-SAM:面向红外小目标分割的基于响应知识的SAM自提示自适应
SPARK-SAM以0.726M参数,用响应知识与自提示状态让SAM在红外小目标分割三个基准上领先(IoU最高86.49%)。
VisTa3D:面向视觉、触觉与3D点云的薄物体重建数据集与基准
首个多模态薄物体重建数据集,含视觉、深度与触觉;现模型精度低,触觉可提升重建。
身份保持的文本到视频生成:智能体增强与语义修复
提出AESR框架,以智能体增强提示并语义修复视频,缓解身份漂移,获MM挑战赛第一。
Vis-Poison:多模态检索增强生成中的视觉知识投毒
提出Vis-Poison,用多智能体构造视觉合理的投毒图像,黑盒攻击多模态RAG,成功率40%-65%,对多种MLLM仍有效。
CARD:诊断视觉语言模型中信念到行动路由失败
提出CARD方法,发现视觉语言模型虽能表示信念,但未将其用于动作预测,导致合作任务中信息闲置。
DiGS-Avatar:基于UV空间扩散的单图像可动画3D人体重建
提出新方法:将单图3D人体重建化为UV空间扩散补全,0.71秒生成可动画高保真化身。
面向视觉几何基础Transformer的多视角对抗样本生成
提出MVAP-G,单次前馈生成跨视角一致扰动,免迭代降低VGGT性能,暴露3D模型安全漏洞。
MotionPhys:通过光流轨迹的物理一致性检测AI生成视频
利用光流轨迹物理一致性,跨时间尺度建模几何演化,检测AI视频运动异常,泛化性强。
EviRank:多模态图像重排序的结构化相关性证据
将多模态图像重排序转化为语义约束满足问题,提出EviRank,统一解析查询并生成六类证据槽,结合确定性评分与列表比较,无需训练即达SOTA,蒸馏学生保留九成性能。