合成基准夸大了前向-前向缩放:层局部训练的真实数据限制
FF层局部训练在真实数据上扩展性差于BP,合成基准夸大其性能,且无内存优势。
中文标题:架构自适应的深度伪造检测不确定性融合
中文摘要:提出COF方法融合五类不确定性,优化相关性与预测误差对齐,无模型修改,域内相关性高,但跨域泛化仍为关键挑战。
MMBU:大规模多模态生物医学理解基准,探究视觉语言模型感知能力
MMBU是目前最大的生物医学视觉语言基准,覆盖35个子模态,评估15个开源模型,发现医疗适应提升性能但高准确率掩盖感知缺陷。
VideoSEG-O3:一种用于推理视频对象分割的多轮强化学习框架
提出首个多轮强化学习框架,模拟人类从粗到细认知,实现推理视频对象分割。
RigPAPR: 基于固定视角视频的静态神经点云蒙皮动画
RigPAPR用PAPR消除关节伪影,从固定视角视频驱动静态神经点云,无需网格代理或姿态校正,PSNR提升3+dB。
S23DR 2026冠军方案
提出基于流匹配与两阶段精炼的3D线框重构方法,在S23DR挑战赛中以HSS=0.654获第一。
RPC-GS:基于原生RPC渲染的卫星图像高斯泼溅方法
RPC-GS是首个原生使用有理多项式相机模型的卫星图像高斯泼溅框架,通过直接投影高斯参数避免近似误差,实现更低重建误差。
锚定而非渐变:视觉-语言模型在纹理斜度感知中失败
VLM仅对少数锚点(如0°、±25°)有反应,缺乏渐变感知,微调也无法消除锚定。
基于空间分离评估的高光谱分类自适应波段选择
SGBR-HC两阶段法用光谱排名初始化稀疏门,空间分离评估下约20个波段获最高分类精度和Kappa系数。
USU-Corn-WeedDB:一个用于饲料玉米多物种杂草检测的无人机RGB图像数据集
公开无人机RGB数据集,含800张标注(三种杂草10539框)和8000张未标注图块,支持饲料玉米杂草的监督与半监督学习。
MedSIGHT:迈向医学大型视觉语言模型中的有根基视觉理解
MedSIGHT统一框架实现医学图像理解与分割,创新区域感知器和码本,少量数据达最优性能。
打破锁定:通过表示调控实现文本到图像生成的多样化
发现早期DC成分锁定的生成同质性根源,提出DAVE无训练方法衰减该成分,提升多样性并保持质量。
MotionEnhancer:利用视频扩散增强运动感知的视觉语言模型
利用视频扩散模型运动先验,通过注意力对齐增强视觉语言模型的运动理解,无需额外参数。
ARAPDiffusion:基于扩散的可变形形状空间学习中的ARAP正则化
将ARAP变形正则化引入潜在扩散模型,减少对大量3D数据依赖,实现高效变形形状空间学习。
FS-DVS:一种增强信息完整性的频率选择性动态视觉感知范式
FS-DVS集成可学习空间滤波器,模仿视网膜神经节细胞,优化后自发形成中心-环绕中频选择模式,实现抗噪信息增强与检测识别性能提升。
LRMIL:基于高分辨率知识蒸馏的高效低分辨率多实例学习用于全切片图像分类
LRMIL通过两阶段知识蒸馏将高分辨率知识迁移至低分辨率,实现高效且性能优异的全切片图像分类。
Multi-FRuGaL:面向癌症诊断与预后的多模态灵活冗余感知分解门控学习
提出Multi-FRuGaL框架,通过分解与门控机制处理缺失模态,在头颈癌预后和HPV分类中显著提升AUC。
EgoPressDiff:面向自我视角UV域手部压力估计的多模态视频扩散
提出多模态视频扩散框架EgoPressDiff,融合手部姿态、3D网格与深度信息生成UV压力图,性能提升34%以上。
基于限制不安全信息流的多模态扩散Transformer统一安全上下文图像生成
提出UVR框架,通过限制不安全信息流实现安全生成,图像合成和编辑擦除率达91%和77%,保持质量。
FreeAnimate:基于预览引导去噪的无训练人体图像动画
FreeAnimate无需训练,利用预览引导去噪实现人体动画,保持时序、身份与背景稳定,效果达SOTA。
AdaGRPO: 面向基于流的GRPO的能力感知自适应增强
提出AdaGRPO,通过在线课程过滤和跨层级优势融合,解决GRPO训练盲目性,稳定提升性能。
CFRNet:面向消费级嵌入式NPU的实时盲脸修复的循环一致性定点训练
提出2.0M参数CFRNet,采用循环一致性定点训练,在消费级NPU上实现实时盲脸修复,性能更优。
Stream3D-VLM: 基于增量几何先验的在线3D空间理解
提出在线3D视觉语言模型,通过自回归流控与几何自适应体素压缩,实现视频流实时空间理解,在29个任务上超越现有模型。
LUCID: 学习统一控制实现夜间摄影中的去眩光与曝光掌控
LUCID框架将夜间图像恢复视为连续可控过程,通过眩光解缠和扩散生成实现选择性光源控制与HDR重建,性能领先。
SS-TPT:基于稳定性和适用性引导的测试时提示调优,实现对抗鲁棒视觉语言模型
提出SS-TPT,通过稳定性和适用性分数筛选增强视图,实现高效鲁棒的测试时提示调优,大幅改善鲁棒性-吞吐量权衡。
可控光照变化下的光照感知表示学习
提出光照感知框架,将照明变化作为训练信号,在分类检测任务上优于对比学习基线,提升鲁棒性。
诊断视觉语言模型中的视觉无知
VLM常依赖语言先验,内部视觉信息被抑制,基准评估无意奖励视觉无知,需设计反事实数据强制跨模态对齐。
SVHighlights:迈向超长体育视频精彩片段检测
首个超长体育视频精彩片段检测基准SVHighlights,提出无需训练的TF-SELECTOR方法,有效处理小时级视频。
超越骨架:使用Same2X训练策略直接从驱动视频学习动画
DirectAnimator绕过姿态提取,用驱动线索三元组和Same2X策略直接学习动画,性能SOTA且鲁棒高效。
DRIFT:从鲁棒性差距到不变性流形用于AI生成图像检测
DRIFT方法构建真实图像不变性流形,通过鲁棒/脆弱子空间分解和排序边界检测伪造,开放世界泛化性强且可解释。
polyDAG: 视觉语义图中高效连续因果发现的多项式无环性约束
polyDAG用多项式迹约束替代指数约束,实现高效连续因果发现,结构恢复更优且速度提升33%。
CLIP看得越多,反击越猛:多视图引导的自适应反攻击提升测试时对抗鲁棒性
提出MAC方法,通过多视图自适应反攻击增强CLIP测试时鲁棒性,高效且无需调参。
CL-CLIP:基于CLIP的持续学习框架,利用代价体积类别解耦进行目标检测
CL-CLIP通过代价体积类别解耦增强持续学习,减轻灾难性遗忘,提升目标检测性能。
从视觉到文本:一种用于身份证鲁棒跨域呈现攻击检测的紧凑多模态方法
提出紧凑多模态模型结合视觉与文本检测身份证攻击,真实数据是关键,合成数据集需改进。
TrioPose:原生三重流扩散变换器用于姿态引导的文本到图像生成
TrioPose通过三重流姿态感知DiT和可学习偏置掩码,解决多人姿态生成中的肢体扭曲,在Human-Art上AP达64.33,提升30%。
GuideCAD:一种基于前缀嵌入的轻量级多模态三维CAD模型生成框架
GuideCAD通过前缀嵌入融合视觉文本信息,以少量参数高效生成3D CAD模型,参数减少4倍,训练效率提升2倍。
前所未见:基于一致视频源数据集的真正零样本组合图像检索基准测试
提出ZeroSight基准与SC4CIR方法,用视频数据实现真正零样本,揭示现有评估夸大性能。
不要暂停:面向在线视频理解的流式视频-语言同步
提出SVLS范式及LyraV助手,通过帧驱动控制器和流式令牌节奏器实现无暂停的逐帧同步,同步率98.29%,支持实时视频理解。
中文标题:ForensicConcept:面向AI生成图像检测的可迁移取证概念
中文摘要:提出ForensicConcept框架,从检测器中提取显式取证概念并跨骨干网络迁移,通过概念码本注入提升检测泛化性,实验验证迁移有效性可预测。
STREAM:面向数字组织病理学图像生成的随机黎曼流匹配与各向异性解码器
STREAM首个将黎曼流匹配用于病理图像生成,利用超球面潜空间和各向异性解码实现SOTA性能。
MVSegNet:一种用于产前超声中胎儿侧脑室分割与心房宽度估计的轻量级边界感知网络
MVSegNet轻量网络实现胎儿侧脑室高精度分割与宽度估计,Dice 80.79%,误差3.40mm,速度165.6fps。
何时使用3D是值得的?——肺CT中CNN和Transformer的资源-性能前沿
2.5D CNN在肺癌CT筛查中性能与稳定性最优;2D/2.5D比3D更可靠。
异步补丁扩散:空间灵活的图像生成
异步补丁扩散用空间异质噪声实现灵活图像生成,质量媲美标准扩散,擅长修复与自适应生成。
当恢复至关重要:多模态大语言模型编辑中代理隐私的盲点
提出首个恢复导向SPPE基准,定义可编辑性评估与代理到源编辑恢复任务,方法提升13.9%且全指标超越。
一种自适应数据清洗框架用于噪声标签检测
提出自适应多度量聚类框架,无阈值先验分离噪声样本,提升检测召回与模型精度。
检测真实视频流中的时间局部化篡改
现有数据集难检测真实视频中的短篡改片段,本文构建新数据集并用两种方法建立初始基准。
LARA:面向视觉-语言-动作模型的潜在动作表示对齐
提出LARA框架,联合对齐LAM与VLA表示,相互增强,在多项基准上平均提升约10%-15%。
GP-Adapter:用于小样本分布外检测的高斯过程CLIP适配器
提出GP-Adapter,基于高斯过程不确定性建模增强CLIP,无需训练即可实现小样本分类与分布外检测。
3DMorph:单图引导的局部3D形状编辑与变形
提出3DMorph,单图引导局部3D形状编辑,自动定位转移2D修改,支持中间形状生成,性能优于现有方法。
Native3D:基于统一网格-纹理建模与语义对齐的端到端三维场景生成
提出统一网格-纹理建模与语义对齐损失,绕过2D中间表示,实现端到端三维场景生成,提升几何纹理保真度。