格式控制的多尺度JPEG压缩响应分析用于图像级伪造筛查
提出轻量级特征工程,用多尺度误差水平分析检测图像压缩历史不一致,格式控制下AUC达0.99。
G-PROBE:面向3D点云的跨视场地点识别与确定性耦合定位
G-PROBE提出免学习跨视场定位框架,通过虚拟传感器分解与确定性耦合,在不对称视场下实现高性能全局定位。
ROAD-Waymo:面向自动驾驶的大规模动作感知数据集
基于Waymo Open数据集扩展,含198k帧、12.4M标签,用于道路场景智能体、动作、位置和事件检测。
从我的视角到你的视角:利用特权自我中心监督从外部视角视频学习自我中心线索
提出Ego2ExoVLM,通过时间同步视频对和特权监督,使VLM从外部视频推断自我中心属性,提升ADL监测性能。
T^3S:基于热时间思维的卫星图像时间序列可泛化作物分类
提出T^3S方法,用热时间替代日历时间对齐物候,提升跨年跨区域作物分类的泛化性与不确定性校准。
中文标题:当蒸馏破坏运动控制:恢复快速视频生成器的生成轨迹
中文摘要:提出MotionEcho框架,通过自适应教师指导修复蒸馏模型的运动控制,提升保真度与视觉质量,保持生成效率。
VOTE:基于轨迹集成投票的视觉-语言-动作优化
提出VOTE框架,通过减少动作token和投票集成策略,实现高效推理与高性能,边缘平台推理达46Hz,成功率优于SOTA。
HunyuanVideo-HOMA:多模态驱动人体动画中的通用人-物交互
提出弱条件多模态框架HunyuanVideo-HOMA,通过稀疏运动引导和适配器,实现通用人-物交互视频生成,自然性与泛化性达SOTA。
Trexplorer Super:CT体积中管状物体的拓扑正确中心线树跟踪
改进模型Trexplorer Super在管状物体中心线跟踪中优于现有方法,解决重复分支和提前终止,新数据集验证效果。
基于视觉物体属性的常识推理研究
提出OPTICS评估框架,12个VLM零样本推理远低于人类(计数<40%,比较70%),在照片、反事实、物理功能、高计数上表现差。
先解释再回答:组合视觉推理综述
综述组合视觉推理,梳理五阶段范式演变、60+基准及核心挑战(幻觉、推理偏见),展望世界模型与协作推理。
ECHO:以自我为中心的人-物体交互建模
ECHO是首个仅从头腕追踪恢复人-物交互的统一框架,三变量扩散过程实现灵活输入与长序列一致性生成,性能最佳。
前瞻思考:多模态大语言模型与世界模型中的预见智能
新数据集FSU-QA评估和提升模型预见未来事件能力,微调后性能显著超越更大模型。
T2T-VICL:通过隐式文本驱动视觉语言模型的跨任务视觉上下文学习
提出T2T-VICL框架,利用隐式文本驱动实现跨任务视觉上下文学习,提升任务对齐与图像保真度。
VFM-Loc:通过对齐判别性视觉层次实现无需训练的跨视角地理定位
VFM-Loc无需训练,对齐视觉基础模型判别性层次,跨视角定位性能超越监督方法20%以上。
面向协同碰撞预测的时空语义V2X框架
提出语义V2X框架,利用V-JEPA生成时空语义嵌入,传输至车辆预测碰撞,通信量降四个数量级,F1提升10%。
MMEarth-Bench:通过多模态测试时训练实现全球模型适应
提出MMEarth-Bench多模态环境任务基准,发现模型地理泛化差,通过测试时多模态重构训练提升性能。
基于密集轨迹生成的几何感知单图像4D合成
MoGe4D利用密集4D点轨迹扩散,从单图合成几何感知的动态4D场景,实现时空一致和新视角渲染。
HART:通过闭环框架的高分辨率无标注推理技术
HART提出闭环框架,无需外部标注即可聚焦高分辨率关键区域,优化推理性能,显著超越强基线。
混凝土低对比度XCT图像分割:一种无监督方法
针对混凝土XCT低对比度问题,提出无监督自标注法,结合超像素与CNN,优于灰度阈值,提升骨料-砂浆区分度。
如果呢?基于世界模型的情境推理模拟仿真
提出WanderDream数据集,实现无需主动探索的心智模拟,验证世界模型在情境推理中的有效性。
EventVGGT: 探索跨模态蒸馏以实现一致的事件深度估计
提出EventVGGT,通过三级跨模态蒸馏从VGGT提取时空与几何先验,事件深度估计误差降低53%以上。
G-ZAP: 可泛化的零样本任意尺度全色锐化框架
提出G-ZAP零样本框架,实现任意尺度全色锐化,跨场景泛化,支持权重重用,性能SOTA。
雨滴与反射的统一去除:新基准与新流程
定义统一去除雨滴反射任务,构建真实数据集,提出扩散框架实现最优性能。
CompDiff:面向公平与零样本交叉医学图像生成的层次化组合扩散
CompDiff通过层次化分解人口条件,实现零样本交叉泛化,提升医学图像生成公平性与质量。
从内容到受众:面向广播电视分析的多模态标注框架
提出多模态标注框架,评估九种前沿模型在意大利电视新闻中的语义标注,并整合收视数据揭示受众敏感性与代际差异。
FMMC:利用基础模型实现精确的材料分类
提出FMMC框架,通过生成高质量材料图像与融合视觉语言模型先验,突破数据瓶颈,显著提升材料分类精度。
MegaFlow:零样本大位移光流
MegaFlow利用预训练全局ViT特征实现全局匹配与轻量细化,在零样本大位移光流上达到SOTA,并具强迁移性。
GP-4DGS: 基于变分高斯过程的单目视频概率4D高斯溅射
提出GP-4DGS框架,利用变分高斯过程实现动态场景概率建模,量化运动不确定性并提升重建质量。
TIR-Agent:训练探索性与高效的图像恢复智能体
TIR-Agent通过监督微调与强化学习训练,结合随机扰动和自适应奖励,实现高效决策,推理加速2.5倍,超越12个基线。
AlloSR²:通过同质异构生成流修正一步超分辨率以保持真实感
提出AlloSR²框架,利用SNR引导初始化与流锚定一致性,实现一步真实超分辨率,平衡保真与真实感。
EgoExoMem:基于同步第一人称和第三人称视频的跨视角记忆推理
提出跨视角记忆推理基准EgoExoMem及无训练帧选择法E²-Select,最佳模型仅55.3%,新方法达58.2%。
CanvasAgent:通过视觉工具编排实现复杂图像创建与编辑
CanvasAgent通过CanvasCraft数据集训练,学习编排多种视觉工具进行多轮交互,实现复杂图像创建与编辑。
合成雾霾条件下无人机检测与跟踪的任务驱动评估
合成雾导致无人机检测跟踪性能下降、漏检增多,含雾训练最有效,恢复质量不直接改善下游感知。
单摄像头单光源双目视线估计
提出用单摄像头单光源实现视线估计,通过引入虚光源和虚闪烁,利用瞳孔与闪烁距离关系,验证新归一化因子,性能可接受。
基于级联特征消除的层次分类:在人类表型本体对齐的面部表型分析中的应用(FaceMesh2HPO)
FaceMesh2HPO采用级联特征消除的层次分类,利用3D面部网格与HPO对齐,实现可解释表型分类,但对罕见叶项性能有限。
统计对抗:视觉数据集中的自然后门特征
发现视觉数据中自然存在的统计信号可像后门一样操控模型预测,且跨架构迁移。
渲染感知的贝叶斯三维高斯泼溅:原生不确定性与自适应复杂度控制
提出渲染感知贝叶斯3DGS,用正态逆威沙特后验跟踪不确定性,主动视图选择PSNR提升0.453dB,校准误差降17倍。
Light-Omni:长期记忆下的智能体视频理解中反射优于推理
提出Light-Omni框架,通过双上下文状态实现反射式视频理解,避免迭代推理,速度提升12倍,准确率提升2.4%。
多教师对比蒸馏:面向边缘高效病理基础模型
提出MuCoDi,用多教师对比蒸馏将病理基础模型压缩为轻量编码器,在边缘设备高效推理且性能接近教师。
利用生成图像模型实现无需训练的原始形状抽象
无需训练的3D形状基元抽象方法,利用生成图像和视觉语言模型实现零件分割与拟合,类别无关,精度瓶颈在分割。
Ground3D-LMM:基于LMM的细粒度3D点指涉与空间推理
Ground3D-LMM实现点指涉与度量对话,ScanNet上强基线(2.5M问答对)
补丁知识迁移用于高效AI生成图像质量评估
提出补丁知识迁移框架,通过多级蒸馏实现高效评估,计算成本降低67.7%且性能接近教师模型。
关联恢复测试:揭示遗忘后可恢复的快捷关联
提出ART方法,诊断遗忘后快捷关联的功能性可恢复性,揭示输出与表征指标未覆盖的方面。
Taxlifier:利用疾病分类学增强胸部X线多标签分类
提出两种层次多标签分类方法,利用疾病层次关系,在三个大型数据集上显著提升准确率、AUC和F1分数。
级联扩散反演恢复云微结构
提出两阶段扩散超分辨率框架,逆扩散将云微结构提升4倍,优于现有方法,捕捉关键细小云结构。
基于LoRA的跨上下文视觉-语言适应用于临床伤口监测中的个性化严重不良事件检测
提出双流LoRA跨上下文融合与OOD检测的视觉-语言框架,实现临床伤口监测中个性化严重不良事件高效检测。
VEIL:视觉编码劫持如何诱导视觉模型中的偏差
VEIL揭示图表编码劫持视觉模型导致偏差,注意训练可部分缓解,提议将图表时间序列分类视为表示与测量问题。
REVIVE:面向自动驾驶车辆中破坏行为检测与恢复的多模态框架
提出REVIVE多模态框架,检测并恢复自动驾驶摄像头涂鸦遮挡攻击,采用类型感知修复,显著恢复目标检测性能(召回率从0.588升至0.967)。
面向二维高斯图像表示的聚类码本量化
提出聚类引导矢量量化,将高斯参数分组量化,实现比特率降低20%且质量不变。