通过迁移学习增强建筑自动化焊接机器人的焊缝分割:解决双边分割网络的局限性
基于迁移学习的焊缝分割框架提升反射鲁棒性,Joint IoU提高22.36%,恢复96.33%零IoU失败,适用于轻量实时焊接机器人。
MobileWan:弥合移动视频扩散的质量差距
MobileWan首个将5B参数视频扩散模型部署至手机,通过循环蒸馏和压缩实现高质量、低延迟视频生成,VBench得分83.79创纪录。
Visual graphs for image classification: does the structure affect performance?
用于细粒度图像识别的视觉-语言模型中的结构化压缩提示调优
提出结构化压缩提示调优,通过语义关系编码与压缩损失增强语义对齐,在细粒度识别中取得最优性能。
PhyMRI-SR:迈向物理感知的MRI图像超分辨率
提出物理感知超分辨率法,动态处理分辨率,结合先验与物理约束,实现最优MRI重建。
VendorBench-100:深度伪造图像检测的统一跨范式基准
提出VendorBench-100基准,评估36个模型,发现商业API最优,但指标分歧(MCC与AUC)是核心发现。
MAC-XA:基于X射线血管造影的冠状动脉狭窄报告的多视角解剖对应融合
提出对齐约束多视角融合方法,利用合成数据学习解剖对应,提升狭窄报告一致性与评估质量。
不完全多视图聚类的直路径流匹配
提出直路径流匹配替代扩散模型,结合视图补全与聚类对齐,实现不完全多视图聚类新SOTA。
AlayaWorld:长时序且可玩的视频世界生成
提出AlayaWorld全栈开源框架,支持实时交互与多样动作,统一生成世界开发流程,奠定基础。
EeveeDark:面向低光视频增强的事件引导传感器级融合二值神经网络框架
EeveeDark融合RAW与事件流,用二值神经网络实现低光视频增强,性能优于先前BNN方法且兼顾效率。
MoWorld:一个闪速世界模型
MoWorld实现50FPS实时交互,推理成本仅为现有模型的30%-50%,高效低耗。
WING:基于窗口先验的门控Inception生成网络用于跨模态CT合成
WING利用窗口先验分解CT回归,门控Inception生成多窗口预测,Transformer融合细化,达最优跨模态合成。
基于令牌的双视图融合与大型视觉模型自适应乳腺癌分类
提出令牌双视图学习框架,在冻结ViT中通过融合令牌实现多深度交叉视图交互,提升乳腺癌分类性能。
VaseMuseum:古希腊陶器数字智能博物馆
提出VaseMuseum框架,结合多模态感知与知识检索,控制证据来源与响应,减少幻觉,提升可靠性。
XRFormer:面向XRF表示学习的多尺度标记化
提出XRFormer,多尺度标记化Transformer实现XRF光谱分析,自监督预训练提升性能,参数效率高。
类别无关运动预测的合成到真实场景迁移
提出目标感知运动预测与增强框架,弥合域差距,构建首个合成4D LiDAR数据集,提升真实场景预测性能。
增强RGB-噪声表示学习的通用合成图像检测
提出RNSIDNet,双分支架构结合硬样本对比学习,增强RGB-噪声表示,实现鲁棒通用合成图像检测,性能达SOTA。
以教师对齐修复桥接扩散模型剪枝与步骤蒸馏
提出教师对齐修复阶段,桥接剪枝与一步蒸馏,实现单步生成,在ImageNet-512上FID超越原模型。
FADRA:频率感知扩散与残差自适应视频人脸修复
提出FADRA,结合频率感知扩散和迭代残差自适应,在预训练视频扩散模型上高效恢复高质量且时间一致的人脸细节。
图像无法言说之处:语言引导的嗅觉表征学习
SCENT框架用语言引导对齐视觉与嗅觉,通过VLM生成场景描述学习气味表征,实现跨模态检索与气味解缠。
身份证件中光学可变器件的时序建模
提出自监督时序建模验证身份证件全息图动态,无需攻击样本,超越现有方法。
HoloCount: 面向多模态大模型的整体视觉计数基准
提出HoloCount基准,从语义、分析、鲁棒性三层面评估MLLM计数能力,揭示其在复杂推理场景的显著性能瓶颈。
EgoPolice:高风险警察执法记录仪视频中的自我中心视频理解基准
EgoPolice数据集用于高风险执法记录仪视频理解,精细标注,挑战性强,顶级模型仍难预测“武器出鞘”等高风险动作。
点云为骨架:累积点云增强的自回归生成用于闭环自动驾驶仿真
提出点云骨架框架,用累积点云增强自回归生成,提升闭环自动驾驶仿真视觉逼真度。
PIPBench:包含用户画像的个性化图像生成评估框架
提出首个包含用户画像的评估基准PIPBench,揭示现有方法关键限制,指明个性化文生图新挑战与机遇。
代理分析法:VLM作为条件编码器时的定位信号
通过代理分析发现,VLM作为条件编码器时定位信号未传到预设层,而是隐藏在不同中间表示中,导致编辑精度下降。
身份证件中动态全息行为的验证
提出新数据集MIDV-DynAttack和新验证方法,可检测动态全息攻击,无需动态样本训练,开源代码与数据集。
Andha-Dhun:印地语音频描述初探
首个印地语音频描述数据集,比较直接生成与翻译方法,发现机器翻译缺乏文化适应,需面向印度视障观众调整内容。
基于提示适配器的上下文路由实现参数高效的多镜头长视频外推
PACR-Video利用冻结扩散模型、低秩适配器和递归提示路由,实现参数高效多镜头长视频外推,性能超越基线。
缓解条件式户型图生成中的领域偏移:面向数据高效自适应的合成预训练
提出合成预训练强制物理约束,显著缓解户型图生成领域偏移,低数据微调性能提升40%。
气流攻击:针对红外遥感视觉-语言模型的热气流对抗扰动
首次用热气流扰动攻击红外遥感视觉-语言模型,跨模型攻击成功率达48.5%,暴露严重漏洞。
一种融合日间视觉性能与夜间反光性能评估的VLM增强交通标志状况综合评估框架
提出VLM日间评估与LiDAR夜间反光一体化框架,LLaVA/Qwen表现优异,462个标志中识别68个需更换。
视觉作为统一的多模态生成
提出将计算机视觉视为统一多模态生成,使用统一模型处理多种视觉任务,无需特定架构,表现媲美专业系统。
MonoIR-RS: 基于CLIP和VLM自适应的红外遥感视觉-语言学习
MonoIR-RS数据集通过CLIP对比学习和VLM指令微调,将红外遥感图像与语言对齐,显著提升召回率和红外线索覆盖。
GEM-Occ:从视觉几何证据到具身语义占用记忆
提出HIOcc室内占用基准和GEM-Occ框架,通过高斯证据内存将视觉几何转化为语义占用记忆,提升预测与建图性能。
CAIRN:基于拓扑感知的大型多模态模型的跨房间3D场景理解
CAIRN提出拓扑感知3D-LLM,利用图神经网络和分层注意力实现跨房间理解,在多房间基准上大幅领先。
ELSA3D:面向统一3D理解与生成的弹性语义锚定
ELSA3D通过弹性语义锚定统一3D理解与生成,实现稀疏精准跨模态交互,性能最优且计算减半。
多站点乳腺X线摄影钙化分类的无监督域适应
提出无监督域适应框架,结合风格迁移与Swin Transformer,使多站点乳腺钙化分类AUC从0.68提升至0.72-0.73。
面向法医合成媒体检测的概率AI模型的溯因佐证
采用溯因推理佐证多模型输出,显著降低合成媒体检测误报率,并首次实证评估SynthID。
BitFair: 适用于超低功耗XR视觉的12nm位串行CNN加速器,具有可学习早期终止与自适应位排序
BitFair通过可学习早期终止和自适应位排序,在12nm工艺下实现亚毫秒延迟、高能效,准确率提升达9.2%。
ProxyPose:通过视频到视频翻译的六自由度姿态追踪
将6-DoF姿态追踪转为视频到视频翻译,仅需视频和单像素标记,利用扩散模型生成代理视频后经典求解,无需额外输入,处理困难材质与遮挡,达SOTA。
从RGB生成到密集场读出:基于文本到图像模型的像素空间密集预测
提出ReChannel,去除目标解码器,以线性头直接映射token到像素块,在多项密集预测任务上达SOTA,速度提升2.48倍。
OrchardBench:基于物理的GPU并行苹果园仿真基准
OrchardBench是物理精确的GPU并行苹果园仿真,为农业机器人采摘提供基准,基线成功率约40%。
SSA-3DGS:面向3D高斯泼溅的屏幕空间伪影无监督去除方法
提出无监督框架SSA-3DGS,联合优化3D场景与2D覆盖层消除伪影,PSNR提升达9dB。
GraspIT:弥合模拟与真实世界双向鸿沟的验证抓取SE(3)姿态生成数据集
GraspIT提供2.3M抓取候选(83%优质),经滑移测试验证,双向映射模拟与真实,含316k标注帧,开源。
Lift3D-VLA:将VLA模型提升到具备3D几何与动力学感知的操作
提出Lift3D-VLA框架,融合显式3D点云推理与时空一致动作生成,在模拟和真实操作任务中成功率提升超10%。
TMF-RSE: 三模态融合结合区域语义与证据不确定性用于肺部严重程度评分
提出TMF-RSE三模态融合框架,整合外观、结构、语义特征,利用证据回归实现肺部严重程度评分与不确定性估计,性能超越基线。
WristMimic: 基于手腕引导的全身人形控制操作
WristMimic通过手腕引导分离身体与手指操作,无需手指姿态监督,实现高效物体操控。
标签层级转换:深入挖掘类别层级以增强深度分类器
提出标签层级转换(LHT)框架,利用转换网络和混淆损失挖掘层级相关性,提升深度分类器性能。
从像素到肖像:说话头部生成技术与应用综述
综述说话头部生成四大技术,剖析评估差距与趋势,聚焦身份保持、唇同步等核心挑战。