何处与何时强制:面向流式虚拟人的路由式强制
按语义区域与噪声阶段路由蒸馏,人物/高噪用DFD,嘴部/背景/低噪用DMD,提升动态多样性并保质量。
自监督感知可解释的单目深度估计
提出自监督框架PIMDE,分解图像为感知特征图并分支估计、融合,KITTI上兼顾精度与可解释性。
FARE:面向诱饵替换式图像生成器检测的取证接受域估计
提出FARE,利用生成器特有伪影构建接受域,仅凭单张图像即可检测部署时生成器被暗中替换,优于基线。
算力用在何处:面向高效视频扩散的异构注意力
提出HetA-DiT异构注意力,按token去噪难度自适应分配算力,仅约20%token走稠密注意力,兼顾质量与效率。
STORM-Bench:在演化且不完整证据下评估在线视频问答
STORM-Bench评测证据演化且不完整的在线视频问答;14个模型准确率最高60.3%,可靠性却仅5.7%–35.6%,普遍过度自信。
PhoenixSR:生成式异构蒸馏赋能高效真实世界超分辨率模型
PhoenixSR以生成式异构蒸馏迁移扩散先验至前馈超分网络,推理无扩散开销,多骨干感知提升、保真度保持。
FLIP:面向视觉-语言模型的最终层推理时探测
提出FLIP最终层推理时探针,验证VLM内部干预是否支持结构化任务计算,而非一般性扰动;属验证非引导。
PICO:面向六自由度手术器械位姿估计的投影信息引导一致性优化
端到端PICO预测分割、深度与位姿,用投影及点对点损失提升几何一致性,遮挡下旋转估计仍具竞争力。
利用空间结构进行全切片图像的转导式小样本分类
提出SlideTIM,结合空间-潜层正则与类别先验,改进全切片图像转导式小样本分类,宏F1显著提升。
TRACKGRAPH:基于图像空间跟踪的在线开放词汇3D场景图
TRACKGRAPH在图像空间跟踪2D掩码后融合为3D,实现在线开放词汇场景图,比OVI-MAP快1.7倍、省3.3倍显存。
利用条件随机场优化细胞学预测
提出CytoCRF,改进条件随机场并融合多骨干;细胞学数据集仅50标注即较零样本提升33.7个百分点
看见语义转变:差异感知的手语视频句子级时序分割
SignShift通过帧间差异建模和句数预测,实现纯视觉手语句子级分割,性能显著领先。
波段选择稳定性与语义分割性能:一项关于高光谱城市的研究
六种波段选择方法中,方法内稳定性因方法而异,与分割性能无一致关联;Top-K可媲美基线且推理更快,但性能不随K单调提升。
谁说了什么:音视频大语言模型中的符号化三模态绑定机制
揭示音视频LLM的符号化三模态绑定机制,失败主因视听错位;提出ASD提示,免训练提升多项基准。
面向交替曝光HDR视频的双流配准与金字塔融合
提出双流配准与金字塔融合框架,用光流和中点位移处理过曝,重建交替曝光HDR视频,性能超越现有方法。
DepthEvidence:统一多模态语言模型中的度量深度预测与几何推理
DepthEvidence以自预测度量深度为对象级证据,统一多模态语言模型中的度量深度预测与几何推理。
Pocket-STVG:面向时空视频定位的轻量级架构
提出Pocket-STVG轻量级级联架构,复用预训练组件,参数不足90M,支持弱监督与零样本时空视频定位,性能相当而成本更低。
ReG-SAM:面向二维基础血管分割的参考图驱动SAM
ReG-SAM利用参考图集的图提示与血管原型嵌入,提升SAM二维血管分割,在19个数据集上优于基线。
FedHisto-PAST:面向跨站点肺组织病理分类的参数高效染色感知联邦学习
以冻结病理基础模型加参数高效染色感知联邦学习,仅调1.25%参数,跨站点肺三分类宏F1达0.729。
HyperErase:面向文生图模型多概念擦除的尺度校准超网络
HyperErase通过尺度校准超网络按提示生成LoRA,解耦校正,实现多概念擦除且无需推理梯度更新。
TaskIR:基于退化自适应与任务反馈的任务驱动图像复原
TaskIR:两阶段任务驱动统一复原框架,融合退化自适应与任务反馈精修,提升多退化复原和下游性能。
DyMD:在少步视频世界模型中通过分布匹配蒸馏保持交互动态
DyMD通过自适应教师重噪与动态伪评分,将14B教师蒸馏为四步1.3B学生,提升交互动态及规划成功率。
用于新视角合成的光场基元
光场基元将稠密光线库压缩为可微基元,在4D光线空间直接优化实时渲染,支持抗锯齿、重聚焦、鱼眼与折射。
面向组合图像检索的保留与组合训练
提出PACT训练法,以源图像视觉证据补充目标字幕监督,无需目标图像,在四个零样本CIR基准上表现优异。
WeaveAgent:面向超高分辨率遥感影像的两阶段工具路由智能体
WeaveAgent两阶段解耦路由与感知,工具路由由0%升至80.75%,准确率达0.518。
高斯你所需:跨场景尺度的紧凑高斯泼溅
提出TangoGS,以拍摄信息定模型规模、用训练反馈控高斯增减,跨尺度实现质量与规模的最佳平衡,无需重调参。
多视图图像集中的几何不一致定位
提出DeformView数据集与DEFECt3R,实现宽基线多视图图像对几何不一致的像素级定位。
CytoSPM:基于结构化提示库的开放词汇细胞病理学检测
提出多领域细胞病理基准PentaCyto及两阶段检测器CytoSPM,实现高效开放词汇检测。
UniAR:多视角提示学习增强的统一自闭症识别框架
提出UniAR,以多粒度提示学习生成词句级诊断描述并与视觉对齐,在MRI与面部基准上超越SOTA。
MoTop:面向微动作单元检测的运动-拓扑模型
提出MoTop运动-拓扑模型,融合可学习运动上下文与面部关键点拓扑变化,线性外推增强微AU表征,CD6ME上达最优。
CG-HAF:面向智能体护肤支持中序数型痤疮严重度分级的可解释全局—局部皮损负荷融合框架
融合整体严重度概率与皮损负荷特征,可解释分类器提升痤疮序数分级,重症增益最大,跨数据集需对齐标准。
ClearGS:面向手持视频的可靠性感知高斯泼溅
提出ClearGS,用可靠性感知视图分配与渲染引导视频内修复,无需清晰参考即从手持视频重建高质量3D高斯泼溅。
开放词汇域遗忘
提出开放词汇域遗忘(OVDU),用Fisher掩码与目标流形散射实现类无关遗忘,4样本超8样本基线。
高光谱视频压缩的隐式神经表示
隐式神经表示用于高光谱视频压缩,逐帧传统法PSNR增4.99dB、码率降88.88%,提升目标跟踪。
从奖励信号到视觉效用:医学视觉语言模型后训练的受控审计
审计医学VLM后训练:准确率提升有限,视觉获益和图像敏感性反降,优化目标与有用视觉行为存在差距。
诊断视觉-语言模型组合性失败的来源:一项受控分析
COMPASS受控分析发现:VLM组合失败中整合成本仅部分,各技能受自身负载拖累,交叉负载多有益,属多因素。
KneePreM:面向三维膝关节MRI基础模型的大规模无标注预训练与标签高效微调
KneePreM为膝MRI三维自监督模型,经1.9万例无标注预训练,分类与分割的迁移性能及标签效率显著提升。
SatNav:基于卫星影像的可扩展长时程无人机视觉语言导航基准
提出基于卫星影像的可扩展长时程无人机视觉语言导航基准,涵盖18城11.8万回合,验证卫星到无人机迁移可行。
ContraFM-S2O:基于流匹配与对比学习的一步式SAR到光学图像翻译模型
提出ContraFM-S2O,以流匹配和对比学习实现一步SAR到光学图像翻译,细节更优、推理更快,达SOTA。
OpenVAM:基于视觉语言模型的开放世界视觉注意力建模
提出OpenVAM框架,解耦视觉定位与VLM语义解释,跨域预测显著图并生成what/why解释。
AxonSynth:面向光片显微镜零样本三维轴突分割的域随机化合成数据
AxonSynth以域随机化合成数据实现光片显微镜轴突零样本3D分割,无需真实标注。
针对CLIP中隐蔽嵌入空间后门的区域级黑盒防御
CLIPGuard通过分段嵌入扰动检测并语义修复可疑区域,黑盒防御CLIP嵌入空间后门。
INRs 能走多远?面向脑部 MRI 的跨域参数高效 INR 语义分割
探究INR脑MRI分割跨域表现:低参数下优势显著;提出分层架构HierINRSeg,Dice最多提升8.2个百分点。
面向可解释关键安全视野评估的结构化推理智能体框架
提出结构化推理智能体框架,以场景图与子准则验证分解CVS评估,实现可解释判读,mAP达68.1%。
OC-GS:面向不规则转台采集的高斯泼溅重建
OC-GS以共享运动模型联合优化图像几何与视角,显著提升稀疏不规则转台采集的重建质量。
GraphWrit3R:端到端三维场景图生成
GraphWrit3R以点云或高斯泼溅为输入,端到端输出JSON三维场景图,免真值标注,在3DSSG上达SOTA。
FreshLatent:面向资源受限具身VLM感知的信道感知潜空间适配
冻结VLM、仅训练轻量信道感知潜适配器,0 dB下分割精度显著提升,参数与能耗远低于重型编解码方案。
FuseReg:正则化层融合缓解表征自编码器中的重建-生成差距
FuseReg以随机编码器层子集训练正则化融合,单解码器适配多融合,缩小重建-生成差距,gFID降29%。
取证双生:面向AI生成图像取证的自监督残差学习
提出自监督残差学习框架,仅用真实图像训练,可零样本检测27种未见AI生成器,AUC达97.99%。
VkVIO:基于Vulkan的跨平台GPU加速视觉惯性里程计
首个基于Vulkan的跨平台GPU加速视觉惯性里程计VkVIO,多设备实时高精度,性能超越CUDA方案。