HorizonRelight:基于扩散变换器的长时域视频一致性重照明
通过跨块潜变量传播和掩码自条件训练,实现长视频重照明的时间一致性,显著减少边界伪影。
TrafficAlign:用于交通场景生成的大语言模型对齐
TrafficAlign自动合成真实交通场景,对齐LLM,使碰撞率降低36.1%,与各地区分布强对齐。
面向MRI扫描的神经系统疾病准确检测与实时网络部署的深度多尺度神经网络
提出End-Net网络,通过21个Inception模块提取多尺度特征,结合WGAN-GP处理不平衡,在四类MRI疾病分类中性能最优,并实现实时网页部署。
异常工厂3D:面向无监督3D异常检测的多样化伪异常合成模块化框架
提出AF3AD模块化框架,从正常点云合成伪异常,提升3D异常检测定位性能。
置信度反馈加权图匹配网络:复杂干扰下在线-离线激光损伤点匹配
提出仅需质心坐标的置信度反馈加权图匹配网络,抑制干扰源传播,匹配F1达96.36%。
CMTFormer: 融合Transformer与层次化信息交互的RGB-事件目标检测
提出CMTFormer,层次化融合RGB与事件信息,通过浅层对齐、中层增强、深层自适应融合,在事件目标检测上超越现有方法。
GPC:面向可迁移运动控制的大规模生成式预训练
提出GPC框架,通过标记化和自回归Transformer预训练,实现高成功率的通用运动控制,并具备鲁棒和自然行为。
DTI:生成式人脸视频超分辨率的动态轨迹初始化
提出DTI范式,通过增强-注入条件机制和判别性引导,实现感知与保真度平衡,少量微调达SOTA性能。
面向图像质量评估的空间局部图像退化嵌入
针对自监督学习忽视局部退化问题,提出SLIDE-IQA方法,用双分支Transformer和阈值排除机制提升局部失真敏感性,性能领先。
先表达后匹配:面向非精选数据的零样本形状匹配
ATM零样本框架,通过先表达后匹配,利用预训练模型和参数化先验实现无需训练的鲁棒3D形状对应。
Again-Pose: 锚点引导的自适应帧间运动线索传播用于高质量人体姿态重建
提出Again-Pose框架,利用锚点帧的运动线索修复退化帧姿态,显著提升鲁棒性和稳定性。
合成CT何时可迁移?一种无标签的供体/宿主诊断方法,用于真实肺部CT上的医学视觉-语言模型路由
基于合成数字孪生,发现结节能力可迁移至真实CT,解剖能力则否,无需标签即可预测迁移性。
零门控语言条件的人体运动预测
ZGL用零门控适配器注入语言描述,仅在减少预测误差时启用,提升人体运动预测精度。
HiReFF:基于未标定稀疏视角视频的高分辨率前馈式人体重建
提出HiReFF,从四视未标定视频实现2K分辨率360度人体重建,高效前馈,无需每场景优化。
Pointer-CAD v2: 先规划后构建的尺寸感知参数精确CAD生成
提出Plan-Then-Construct框架直接预测连续参数,消除量化误差,显著提升几何精度,适用于精密工程。
增强任意开源多模态大模型的部件级点定位
提出通用方法,冻结模型参数,利用注意力机制提升部件级点定位精度,可集成于任意开源MLLM。
基于物理交互的遮挡鲁棒多目标解耦
提出无掩码方法,从稀疏遮挡视角实现多目标3D重建与物理仿真。
D²R²OSR:面向真实世界全景图像超分辨率的退化解耦表示
提出D²R²OSR框架,解耦鱼眼与ERP退化,联合视角感知与退化建模,实现高质量全景超分辨。
MirrorPPR:基于示例的人像照片修图
提出基于示例的人像修图框架MirrorPPR,通过操作提取器与LoRA注入DiT,结合4700万样本数据集,实现精细结构修图与身份保持。
FDM-MFVT:用于无掩模虚拟试穿的少步采样扩散模型
无需掩模,仅需6步采样,提出FDM-MFVT扩散模型与3万对数据集,高效生成高保真试穿图像。
ScaleErasure:下一代自回归图像生成中推理时最小干预的精确概念擦除
提出ScaleErasure方法,通过推理时最小干预,在语义高度纠缠下精确擦除不安全概念,保持生成能力。
RAGA:面向3DGS虚拟角色-场景交互的实时光线追踪高斯阴影投射
提出RAGA方法,基于精确射线-高斯线积分实现实时阴影投射,无需网格重建,提升3DGS场景中角色交互阴影的真实感和稳定性。
ASTAD:面向自动驾驶中合成到真实域自适应的非对称风格迁移
提出ASTAD任务和ASTModel,利用无标签真实参考进行语义一致的非对称风格迁移,提升自动驾驶域适应性能,推理加速3.2倍。
动态解析与更新自然语言规范的VLM视觉语言跟踪方法
提出语言依赖解析机制,利用Qwen-VL进行成分感知更新,显著提升视觉-语言跟踪鲁棒性。
Multi-scale Object-Aware Gaze Estimation via Geometric Reasoning
Wan2.2-I2V-A14B上的W4A4推理量化
融合混合精度与通道平滑,实现Wan2.2模型W4A4量化,VBench指标仅差FP16的2-3.5%,运动平滑度提升。
快至可行动:面向低延迟机器人视觉语言模型与视觉语言动作模型的时空视觉令牌合并
ST-Merge通过时空令牌合并,实现2倍推理加速仅损失1%精度,在VLA上达8.3倍加速。
SAFE-DiT:面向高分辨率扩散Transformer的语义感知快速路径执行
SAFE-DiT消除冗余掩码开销,实现高分辨率DiT推理2.69~5.09倍加速,内存降低至1/3,且视觉质量非劣。
L2D2-GS:面向前馈动态高斯场景重建的稠密化学习
提出L2D2-GS框架,通过自监督稠密化和几何正则化,实现前馈动态高斯场景重建,SOTA且基元更少。
SAD-GS:通过动态地理语义锚点学习可靠的3D语义高斯场
提出动态地理语义锚点框架,解决多视图语义漂移与跟踪异常,实现可靠3D语义高斯场学习,性能最优。
DR-GS:基于物理的可变形与可重光照的2D高斯散射
DR-GS通过解耦几何、光照与材质,实现高质量动态变形与重光照渲染,支持后编辑。
NaLA: 一种面向高质量3D场景生成的原生3D LLM布局代理
NaLA通过直接编码3D资产和边界,采用粗到细预测机制,实现高质量、高效率的3D场景布局生成。
Event-VLA: 基于动作条件的事件融合实现鲁棒视觉-语言-动作模型
提出Event-VLA框架,利用事件流增强光照鲁棒性,通过动作查询路由融合,在正常与低光照下保持高操作成功率。
共振膜片溅射实现任意尺度超分辨率
提出共振膜片溅射,用高表达力Brane替代高斯,减少重叠,实现更快更高质量的任意尺度超分辨率。
Miti360:一个用于改进重新造林监测的综合数据集
提出非洲肯尼亚森林监测数据集Miti360,含高分辨率图像与地面数据,微调DeepForest模型提升检测精度12%和召回率69%。
FiRe:频率重参数化作为周期性隐式神经表示的预处理器
FiRe通过低秩门控重参数化频率,作为隐式预处理器加速周期性INR优化,图像拟合PSNR最高提升1 dB。
在有限辅助异常先验下的鲁棒零样本异常检测
DIVE通过文本嵌入注入和解耦机制,在有限异常先验下显著提升零样本异常检测性能,平均超越基线16%-47%。
柏拉图式防御:大规模预训练时代自监督编码器的后门防御
提出无攻击、无模型、无模态依赖的黑盒防御,利用表示兼容性能量函数实现后门检测与净化。
机器真的能看到图像中的物体吗?基于句法距离和视觉自指实例的研究
通过句法距离构造视觉自指任务,发现当前架构在全局语义任务上存在临界点,准确率崩塌至随机猜测。
Bit-ViP: 利用位平面通过混淆保护图像视觉隐私
提出Bit-ViP位平面混淆方案,结合混沌系统与差分隐私生成不可逆噪声,防图像重建保隐私,实验有效。
学习自适应分配高斯模型的任意尺度图像超分辨率
QuADA-GS用神经路由自适应分配高斯原语,结合层次指针卷积,实现高效任意尺度超分辨率,性能达SOTA。
EvLIR:从有序事件中学习光照残差实现低光图像增强
EvLIR利用有序事件学习光照残差,通过时序残差模块建模事件动态,实现低光图像增强,在多个基准上取得最优结果。
通过通用关键帧提取弥合视频问答与视频引导的智能体任务
提出VG-GUIBench基准和TASKER算法,以关键帧提取提升视频理解与智能体任务性能。
从相位到现象:基于最小相移输入的自监督次表面散射学习
仅用八张相移图像自监督预训练次表面散射,泛化复杂物体,重建保真度远超传统方法。
VCS-SLAM: 几何验证的语义证据融合用于三维高斯SLAM
提出几何验证的语义融合框架,抑制遮挡与模糊区域的伪影,提升语义一致性与重建质量。
基准AUC不代表可部署的可靠性:监控视频异常检测的现成特征跨数据集审计
跨数据集测试显示基准AUC不可靠,性能接近随机,误报率极高,远不能直接部署。
学习何处与何时:弱监督视频异常检测中基于补丁的时空定位
提出联合建模异常时空的补丁框架,利用邻近感知Top-k策略实现细粒度定位,无需边界框监督,显著提升精度。
过肩视频监控中多模态触摸检测的实证评估
过肩视频多模态触摸检测评估:运动与边缘检测F1约18%,真实场景误检严重,无法可靠重建按键。
基于熵的掩码修正以实现模糊场景中无干扰的3D高斯泼溅
RefineSplat采用熵感知自适应掩码和密度控制,识别模糊干扰物,在Ambiguous wild数据集上实现最优的无干扰新视角合成。
CellDETR:一种面向组织病理学图像的可扩展细胞表示学习的检测引导框架
CellDETR基于Deformable DETR实现可扩展细胞表示学习,通过解耦与对比学习提升分类性能,并具备跨数据集迁移能力。