随机液体形变场:动态3D高斯泼溅的闭式连续时间细胞SDE泛化
将液体网络的随机噪声加入CfC形变场,训练时用噪声,无需求解器,在合成场景优于MLP,但真实场景噪声无益。
文档视觉语言模型中基于状态条件的视觉证据检索用于细粒度感知
提出状态条件视觉证据检索,按需获取细粒度信息,提高文档解析效率与鲁棒性。
指令蒸馏:文本指令作为视觉示例
提出指令蒸馏,为每图生成结构化指令,推理无需图像,性能相当,词元降2.9倍,延迟降3.3倍,与图像互补。
MANTLE:基于模块化上行链路原则的自适应行星原位感知框架
提出多任务网络MANTLE,共享DINOv2骨干,地形分类准确率92.56%,巨石分割IoU 0.753,支持模块化上行持续学习。
TopoAgent:基于大型视觉语言模型的结构感知图表到图拓扑抽取感知-推理框架
提出TopoBench-180基准与TopoAgent框架,实现图表到图的拓扑抽取,性能优于现有视觉语言模型。
用于高分辨率目标检测的可变粒度标记化
提出无需训练的VGTok,按区域设定可变粒度,固定标记预算,航拍检测刷新最优,大幅降低算力内存。
文本驱动的艺术布景:从绘画中获取姿态、光照与相机参考
从绘画重建姿态、光照与相机,提出文本驱动的可编辑3D布景生成任务,模型优于CLIP检索。
文本引导模型用于人脸编辑的大规模评估
首次大规模评估六种文本引导模型人脸编辑,覆盖169属性:发型饰品佳、姿态差,存过度编辑偏差。
无人机与卫星图像的像素级地理配准
提出SkyReg数据集与基准,用于无人机-卫星像素级地理配准,训练几何感知重建管道达最优。
超越表示学习:面向3D脑MRI的联合嵌入预测生成的系统研究
提出Med-D-JEPA,将联合嵌入预测生成用于3D脑MRI,生成质量优于基线,合成预训练显著提升分类与分割性能。
ClearText-Video:桥接视频恢复与场景文本增强的大规模文本中心视频数据集
CTVid:大规模文本视频基准,发现视觉增强不保证文本保真,模糊比低分辨率更损推理。
基于预测编码层次的无参考立体全景图像质量评估
提出基于预测编码层次的无参考立体全景图像质量评估方法,融合局部与全局感知,性能优于现有方法。
FigMirror:定位、编码与绘图
提出FigMirror框架,利用坐标定位与编码能力,将参考图风格迁移至新数据绘图,效果优于现有方法。
MWIR-4-Plastic:使用中波红外高光谱成像和机器学习识别复杂的报废工业塑料
首个公开报废汽车黑色塑料高光谱数据集,提出多模态光谱-空间框架结合深度学习实现准确分类,并建立基准。
BlobBoards:用于精确位姿的鲁棒标记
提出BlobBoards标记系统,利用高斯斑点场实现高精度位姿估计,优于AprilTag且抗遮挡。
FairReL:基于公平感知表示学习的深度伪造检测
FairReL针对子群敏感成分提出公平感知表示学习,提升未见集AUC 3.9%,降子群FPR差异10.2%
ReconSplat:超越已观测视图的通用三维场景重建
提出ReconSplat,结合3D高斯泼溅与多视角潜在扩散,兼顾未观测区域外观与几何,实现新视角合成和深度估计,优于现有方法。
NBS:无偏立体
无架构归纳偏置的端到端Transformer,仅靠合成数据训练,即达SOTA立体匹配精度与效率,证明显式几何先验不再必要。
DocIntent:面向真实文档视觉问答的可回答性引导智能体修复
提出无需训练的智能体修复框架,按问题可回答性选择性修复,回滚验证,提升多模态大模型在退化文档问答性能。
RoSe-SLAM:基于动态单目视频的鲁棒语义感知高斯溅射SLAM
利用2D基础模型语义特征与时空运动掩码识别动态干扰,实现鲁棒跟踪与高质量静态重建。
断裂场:面向断裂三维高斯模拟的接触感知二元多场传递
提出断裂场方法:为断裂三维高斯模拟按碎片独立传输质量动量场,消除碎片间动量泄漏,并以接触投影减少碰撞穿透。
mmIR:用于3D毫米波雷达ADC合成的频域逆渲染
mmIR可微分FMCW逆渲染器,借助LiDAR物理模型合成高分辨率3D雷达数据,相关度远优于基线。
从粗到细:用于医学图像合成的迭代对抗神经元胞自动机
提出StyleGANCA,首个轻量级NCA生成对抗网络,仅617k参数在PathMNIST取得最佳FID/KID,生成图像质量高。
ActiveAugment:深度学习中增强选择的在线主动学习
将数据增强选择视为在线主动学习,按样本选模型脆弱增强,在低标注预算及跨域情景下显著优于现有方法。
可解释多损失蒸馏框架:实现高效可解释的虾病文本分类
提出SALT框架,用多损失蒸馏分类虾病文本,结合LIME/SHAP可解释,优于监督基线,兼顾效率与可解释。
基于验证的上下文工程:迈向全自动医学影像代码生成
多智能体框架两阶段验证与自动上下文工程实现医学影像代码全自动生成零人工干预分割0.90准确率99%
弹性三角形溅射
提出弹性核函数,具备边界双侧梯度支持与自适应边界值,在形状重建和新视角合成中优于现有三角形溅射方法。
高效语言到视觉特征注入的指代单目标跟踪
LVTrack用门控注入调控语言、避免语义漂移,借冻结预训练模型降成本,混合位置编码与KL损失提升性能。
NFAD:分布偏移下的干扰过滤异常检测
提出干扰过滤异常检测法,抑制成像条件变化引发的干扰,分布偏移场景检测率达91.0%,且不影响常规性能。
基于声学感知的开集视听语义分割成本学习
提出声学接地成本学习框架,动态细化视听语义,挖掘干扰类别,显著提升开放类别分割性能。
跳舞火柴人:训练视频生成模型的入门数据集
为训练视频生成模型设计的合成视频数据集,含64x64、64帧、4020个片段,提供深度、法线、部件标签等标注,便于快速迭代与评估。
基于噪声感知采样与归一化流的sRGB真实噪声建模
提出噪声感知采样的归一化流框架,估计相机设置以生成多样真实噪声,提升去噪性能。
Di²CycleSB:基于薛定谔桥Transformer的高质量无监督夜间可见度增强
提出动态积分图像先验引导的循环薛定谔桥框架,无监督夜间增强,无需正则与分解即抑制光效。
GramLoop:免训练Gram门控重放实现鲁棒稠密预测
免训练GramLoop以Gram门控重放增强DINOv3,五基准升,COCO-O+0.252,保干净。
DReSG:用于风格化高斯溅射的扩散残差
提出DReSG,基于扩散残差的3D高斯风格化框架,通过残差反馈与多视图拟合,在保持结构和跨视图稳定性的同时实现参考风格化。
AdapToPASS:面向全景语义分割的歧义感知自适应球面变换器
提出仿生自适应球形变换器,用歧义感知注意力与双焦点表示,提升全景分割在未知变换下的鲁棒性,超越现有方法。
6D姿态估计中条件流匹配的基础特征融合
提出FunFlow6D,利用几何与外观基础模型特征及交叉注意力融合,减少监督与内存,性能超越现有方法,并经消融验证。
减影法肿瘤分割与病灶中心pCR预测在MAMA-MIA挑战中的应用
FME团队采用减影法分割肿瘤并以病灶为中心预测pCR,在MAMA-MIA挑战中两项均获第二。
基于映射的图像扩散
提出基于张量的图像增强去噪泛函,含正则化先验,证明最小解存在,擅长伽马校正,性能比肩偏微分方程方法。
分割中的特征谱脆弱性:数据集依赖、架构特定定位与谱相关性
特征谱脆弱性在分割中具有数据集依赖和架构特异性,低频干预对不同模型影响差异显著,且不同于输入域鲁棒性。
Chat-Edit-3D++:基于大语言模型的交互式3D与4D场景编辑
提出Hash-Atlas解耦网络,基于大模型实现对话式3D/4D编辑,可调度30种视觉工具。
梯度能量总变差的张量变分公式
提出梯度能量总变差的张量变分公式,证明凸性并推得欧拉-拉格朗日方程,去噪实验优于EAD和TV。
面向开放词汇3D场景理解的动态鲁棒光度-语义重建
提出SPAR,联合几何语义编码,显式分离动态噪声,动态场景下实现SOTA的新视图合成与语义分割。
STARLINC:利用帧间相关性去除卫星轨迹伪影
首个无需像素标注的卫星轨迹去除ML框架,利用合成数据、帧间差分图和热力图,显著提升真实数据效果。
无训练流匹配图像生成器的隐藏状态精化
提出无训练循环框架,在去噪器内重复精化隐藏状态,提升流匹配生成质量,不改变权重或采样器,显著提高指标。
SGRNet:面向头颈癌结构化放射学报告的空间引导放射网络
SGRNet利用器官分割和肿瘤定位先验头颈癌结构化报告mAP达0.60较3D基线提升8.8个百分点
利用正则化项中的通道表示:图像扩散案例研究
提出基于通道编码的新非线性扩散滤波,用软直方图能量泛函推导更新,抗混合噪声,恢复性能优。
SGPDFuse:语义引导的物理解缠通用多模态图像融合
提出语义引导物理解缠融合方法,解耦固有场景与瞬态干扰,语义对齐保目标,纹理正则除伪影,统一架构达三类基准最优。
面向联邦视频域适应的多尺度时间域对齐
提出METAL框架,用多尺度时间对齐与蒸馏解决联邦视频域适应的时序对齐难题,达最优。
面向类无关检测的无背景目标性学习
无背景目标性学习(B-FOR):免背景监督,位移感知尺度场解码,类无关检测AR提升10+点。