通过频谱均衡的全频谱不可学习样本
提出FUSE方法,用随机频谱掩码和跨频带一致性,生成全频谱鲁棒的不可学习扰动。
LiveEdit:迈向基于扩散的实时流式视频编辑
提出实时流式视频编辑框架LiveEdit,通过三阶段蒸馏和AR掩码缓存,实现12.66 FPS且视觉质量最优。
Do Image Editing Models Understand Lighting?
深度语义对齐与亲和引导融合的结构化雷达点云生成
提出视觉-雷达融合点云生成方法,利用语义对齐与稀疏补全提升质量,增强检测跟踪鲁棒性。
ProtoKV:带摘要状态记忆的延迟查询流式视频理解
ProtoKV用固定容量摘要状态记忆处理流式视频延迟查询,精度提升达12.5点。
校准谐波叠加隐式神经表示用于多维数据
提出CHOIR,用协调谐波叠加替代函数组合,结合感知频谱校准,有效提升多维数据重建性能。
识别未知:面向机器人-物体交互的无提示开放词汇异常识别
提出AnomNOVIC框架,结合MAE与NOVIC,实现无预定义类别的实时异常识别,在机器人场景达47.1% AP。
LearniBridge:面向扩散模型加速的特征缓存可学习校准
提出通过轻量LoRA实现特征缓存的可学习校准,仅需少量样本即可显著加速扩散模型,最高加速5.87倍。
基于事件的注视控制系统实现专业球类比赛实时精确旋转估计
提出事件相机与高速反射镜主动视觉系统,离线s-CMax法精度最高,在线法达8.8%幅度误差、3ms延迟,实现专业比赛实时旋转估计。
解剖引导的残差运动扩散用于可控4D心脏MRI合成
提出级联扩散模型合成可控4D心脏MRI,合成数据提升分割性能(Dice+2.8%,边界误差-5.4mm)。
ReasonCLIP-58M:面向CLIP的视觉基础常识推理监督
通过两阶段推理监督策略,提升CLIP视觉常识推理与零样本检索,增强多模态大模型表现。
恶劣天气下的多模态图像融合:掩码引导的特征恢复与交互
提出掩码引导的多模态融合方法,集成特征恢复与交互,利用伪真值和掩码机制应对恶劣天气,性能超越现有方法。
NaviCache: 视频生成的测试时自校准缓存
NaviCache将特征演化建模为惯性导航,通过双状态估计实现误差有界计算跳过,显著提升视频生成效率。
面向鲁棒大蒜幼苗检测的对抗性增强策略学习
提出对抗增强策略学习框架,联合优化增强与检测,实现复杂光照下鲁棒蒜苗检测,AP50达91.6%且无额外开销。
通过最优传输语义流连接视觉与语言概念
提出OTF-CBM模型,用最优传输流匹配实现跨模态概念对齐,提升分类精度与概念忠实度。
PhysRAG:通过检索增强生成提升视频生成中的物理感知
PhysRAG利用检索增强生成与数据过滤,构建物理库注入可学习查询,提升视频生成的视觉质量与物理规则遵循。
基于纤维束追踪的合成数据生成用于示踪组织学纤维束分割
用纤维束追踪生成合成数据训练U-Net,结合真实数据减少3倍标注量,性能达当前最优。
多模态3D MRI中的局部、全局与跨模态上下文建模
提出MICViT模型,融合局部/全局及跨模态注意力,在多模态脑MRI中显著提升预测性能。
考虑置信度的工具编排以实现鲁棒视频理解
提出 Robust-TO 框架,将每帧可信度融入推理,在多种扰动下保持高精度,有效解决盲信问题。
实用化的卷帘快门相对位姿估计
引入仿射对应,仅需7点即可快速估计卷帘快门位姿与运动,精度最佳且可估计平移速度。
面向通用显著性目标检测的异构表示液体融合
LFNet通过液体融合动态整合CNN与SSM特征,实现通用显著性目标检测,性能领先。
SpatialFlow-GRPO:空间信用驱动图像编辑
提出空间细粒度奖励反馈框架,区域感知优化提升图像编辑质量。
Qwen-Image-Agent:弥合现实世界图像生成中的上下文鸿沟
提出Qwen-Image-Agent框架,通过上下文感知规划和接地弥合鸿沟,实现图像生成SOTA。
RIS辅助的毫米波无线网络可靠主动切换技术
通过优化RIS元素数量,在满足切换时序前提下节能10%,阻塞区信噪比提升15-30dB。
PortraitGen:示例驱动的GRPO与双重奖励引导的逼真肖像生成
提出PortraitGen框架,引入真实图像到GRPO采样,结合双重奖励,有效抑制AI伪影,实现高逼真肖像生成。
PanoImager: 几何引导的稀疏全景视图新视角合成与重建
提出无SfM框架PanoImager,融合前馈位姿深度先验、扩散视图补全与深度引导3DGS,提升极致稀疏全景重建稳定性。
基于动态奖励优化的多参考图像生成扩展
提出DyRef框架,通过动态奖励优化大幅提升多参考图像生成性能。
面向MOBA分析的计算机视觉:Dota 2中可见性分析的数据集与基准
提出Dota2-Vis数据集,用YOLO11l检测图标生成可见性曲线,揭示结构化数据难捕捉的行为模式。
聚焦关键:利用显著性的扩散MoE准确路由
SharpMoE利用干净潜在特征引导路由,解决噪声干扰,实现扩散MoE精准资源分配,提升视觉生成性能。
Geometric Gradient Rectification for Safe Open-Set Semi-Supervised Learning
TraMP-LLaMA:基于解耦指令调优的生成式可解释性用于面部表情质量评估
提出TraMP-LLaMA框架,联合预测面部表情质量分数并生成结构化文本报告,采用解耦指令调优,性能提升至少4.39%。
Unison:基于协同理解与生成的统一多模态模型基准测试
提出Unison基准(2169样本),评估多模态模型理解与生成协同能力,支持诊断评估与人类对齐。
事件感知指令助手用于指代视频分割
通过事件查询将视频分解为简单事件,逐事件理解,结合像素与对象特征,提升分割性能。
星载遥感基础模型用于灾害事件的无监督变化检测
基于ResNet+FPN的无监督方法,无需训练即可高效检测灾害异常,通用性强。
用于腹部CT器官定位的伪文本条件3D Grounding DINO
提出CT-3GDINO轻量检测器,伪文本条件实现3D器官定位,粗定位性能强,严格对齐有限。
SubdivAR:神经网格细分的自回归下一尺度预测
SubdivAR提出自回归下一尺度预测框架,结合混合拓扑感知Transformer,在FII-40K数据集上豪斯多夫距离和倒角距离分别降低18.8%和14.2%。
TMP:面向大规模图像生成与编辑的树结构混合策略剪枝
提出通用剪枝框架TMP,将HunyuanImage 3.0从80B压缩至20B(缩减75%),并支持单卡推理。
精确且确定性的图像块描述符检索:基于层次归一化
层次归一化拆分特征向量,利用主分量相似度加边界剪枝,实现精确确定性最近邻检索,加速达13倍。
具有迭代自改进码本的安全自回归图像生成
提出迭代自改进码本,利用模型自身识别不安全图像并修正码本,无需外部反馈,迭代提升安全性。
FlameVQA:一个基于辐射热监督的物理驱动无人机野火VQA基准
FlameVQA是无人机野火VQA基准,利用辐射热TIFF图像进行温度推理,评估显示当前多模态大模型需领域适应。
SatSplatDiff:几何保持的生成式精化方法用于高保真卫星高斯泼溅
提出几何保持的生成式精化方法,通过深度监督和阴影引导,提升卫星高斯泼溅的视觉保真度与几何精度,MAE降18%,FID-CLIP升28-45%。
CORTEX:用于可信3D胸部CT多模态大模型的结构化推理基准
CORTEX为3D胸部CT提供结构化推理基准,通过四阶段诊断轨迹和专家验证,支撑可信多模态模型。
LISA:面向视觉条件可控生成的似然分数对齐
提出LISA正则化方法,显式对齐侧网络中间特征与近似似然分数,加速训练收敛,提升生成质量,几乎无额外成本。
RoPEMover:基于位置嵌入的深度感知物体重定位
提出RoPEMover,通过旋转位置嵌入实现深度感知的物体重定位,保持场景一致性,性能达最优。
中文标题:并非所有动作都同等重要:重新思考灵巧世界模型的条件化
中文摘要:提出结构化动作条件化方法DexAC-WM,通过动作标记化与语义分支,解决高自由度动作建模不平衡问题,提升视频预测质量。
不要止步于众数模式!通过特征自引导缓解预训练流模型中的多样性崩溃
提出特征自引导与流形正则化,无需训练和额外模型,低成本缓解预训练流模型多样性崩溃。
SAM2Matting:通用图像与视频抠图
SAM2Matting通过追踪器-抠图框架,仅用图像训练实现视频抠图新SOTA,支持多样提示,泛化性强。
RayPE:面向三维感知视频生成的射线空间位置编码
提出RayPE,利用Plücker互易积将6D坐标注入注意力,提升3D一致性、摄像机可控性与视频质量。
PhysiFormer:在世界空间中学习力学模拟
PhysiFormer是一种扩散Transformer,直接在全局坐标中预测顶点轨迹,无需归纳偏置,实现刚体/弹性体运动模拟,性能优于自回归方法。
看与嗅:学习视觉-嗅觉表征
通过语义对齐合成视嗅数据,提出自监督框架See & Sniff,气味分类提升7%,并实现气味定位。