重新思考开放世界视频异常检测:诊断定义盲区
现有评估存在定义盲区,模型对异常定义不敏感,新指标与DeCoS方法可改善,应改为定义条件异常评分。
DS@GT ARC 在 ImageCLEFmed GANs 2026:用于隐私保护CT切片生成的几何过滤
采用几何过滤的隐私保护CT生成框架,实现0.549隐私分数与0.3290 FID,但无法消除患者解剖身份。
U-CFR:不确定性引导的级联前向精化交互式分割
提出U-CFR框架,利用不确定性引导内部伪点击自主修正,减少10%以上点击,提升边界精度。
3D-GIMP:当3D高斯修复遇上PatchMatch
3D-GIMP通过单次关键视图修复和3D PatchMatch传播,实现高保真物体移除,提升渲染速度与视图一致性。
ViSTR-Bench:多模态大语言模型能否从动态场景的连续视觉线索中进行推理?
提出ViSTR-Bench基准,系统评估MLLMs的动态场景连续视觉推理,发现模型远低于人类水平。
人行道时刻:更丰富的表示是否总是更符合人类对齐?来自城市步行视频的证据
城市步行视频实验表明,时间平均图像在二元分类中与视频特征的对齐效果相当,挑战了更丰富表示更符合人类对齐的假设。
SubSplat: 通过子像素高斯重参数化实现高分辨率像素对齐3DGS
SubSplat以子像素高斯重参数化从低分辨率特征恢复结构密度,实现高保真高效渲染。
基于差分动作单元的可解释图注意力网络压力识别模型(StressGAT)
StressGAT利用图注意力与差分动作单元,实现88.62%准确率且可解释的个性化压力识别。
智能体设计师:渐进式多智能体协作实现结构感知的室内布局生成
提出迭代验证的多智能体框架,确保布局严格遵循建筑约束,显著优于现有方法。
引擎原生的可编辑3D世界重建(含物体和光照)
提出Lumera,从单图重建引擎原生可编辑3D场景,含物体框和参数化灯光,检测领先但灯光定位精度待提升。
网络监督的多标签识别:评估基准与双分支多标签对比学习
构建网络监督多标签识别基准,提出双分支对比学习方法,有效识别纠正噪声标签,性能领先。
WhereEdit:掩码感知的局部潜空间编辑用于单步图像编辑
提出WhereEdit框架,通过自动识别语义区域并局部自适应调制,实现高效高质量的单步图像编辑。
DINO-VPT: 面向物理与数字联合人脸反欺骗的分层视觉提示调优
提出纯视觉轻量框架DINO-VPT,通过提示路由网络动态注入提示,无需多模态融合,实现统一人脸反欺骗SOTA性能。
MAGE-Vein:基于指静脉图像的多实例年龄与性别估计
提出多实例多任务框架MAGE-Vein,融合三指特征并优化性别分类,在平衡数据集上MAE达6.12年,推翻指静脉年龄估计不可行共识。
冻结的3D CT视觉编码器中的稀疏概念通道
每个放射学发现由约10个稀疏通道编码,关闭则评分下降;CCP方法优于CT-CHAT,延迟低22倍。
FA-LAM:聚焦感知的大型虚拟化身模型,用于单次4D可动画高斯头
提出FA-LAM,通过对称语义注意力和双相训练解决注意力噪声与动画重建冲突,实现高质量4D可动画高斯头重建。
FSB-Net:针对非增强CT脑卒中病变分割的频率-空间边界网络
提出FSB-Net,融合频率与空间边界信息,通过小波变换、交叉注意力和频谱损失,精准分割NCCT脑卒中病变,性能达SOTA。
MagicMakeup:一种区域可控的扩散变换器,用于高保真妆容迁移
提出MagicMakeup框架,通过令牌对齐区域门控和跨模态感知引导,实现高保真、区域可控的妆容迁移。
Ms. Forcing:基于多尺度分块和注意力的高效流视频生成
Ms.Forcing通过按噪声水平自适应调整空间粒度,降低45% token数和注意力成本,实现22.84 FPS,比Rolling Forcing快39.6%。
RECO:面向路边3D检测中外参扰动的区域感知补偿方法
提出区域感知外参补偿框架RECO,通过分片6D位姿偏移与可微门融合,有效校正扰动,提升路边3D检测鲁棒性。
面向不确定性感知的文本到视频检索的分布对齐桥接
提出分布对齐桥接框架,将检索视为分布对齐,用高斯分布建模不确定性,扩散桥接迭代优化,KL散度对比损失,性能显著提升。
HyWorldVLA:一种用于自动驾驶的混合世界建模视觉-语言-行动模型
HyWorldVLA混合世界VLA框架统一像素监督与潜在学习,在自动驾驶中优于基线并建立噪声鲁棒性新基准
基于微调CycleGAN的无监督牙科CBCT金属伪影抑制
提出无监督CycleGAN减少牙科CBCT金属伪影,非配对训练,BRISQUE提升34.6%,FID降至157,SSIM 0.91,实时推理,高保真,可作临床辅助
潜变量中介的跨学习方法用于少样本声阻抗成像
提出RD-SCL框架,通过可微分解卷积算子动态估计潜波并对称跨学习利用未标记数据,少样本声阻抗成像性能领先,计算成本低。
GroupVideo:多身份定制的文本到视频生成
GroupVideo通过多模态身份对齐和ID定位模块,解决多身份视频生成中的身份混淆问题,在2万视频数据集上表现优异。
MVEI与EmObserver:通过情感陈述判断增强面向多模态大语言模型的视觉情感智能
提出情感陈述判断范式,构建MVEI基准与EmObserver模型,全面提升多模态大语言模型的视觉情感智能。
AUCH-Net:基于动作单元的一致性感知超图网络,用于跨域小样本面部表情识别
提出AUCH-Net,基于动作单元构建一致性超图,学习可迁移特征,有效提升跨域小样本表情识别性能。
可解释深度伪造检测挑战赛
ACM多媒体2026挑战赛:基于XPlainVerse基准,评估图像分类与双层次自然语言解释,推动可解释检测发展。
ProCap:显著性引导的物体纠正实现忠实全面的视频描述
提出轻量级显著性迭代修正框架,无需重训模型,提升视频描述完整性48%,降低幻觉45%。
WAT3R: 前馈式水下三维重建
提出WAT3R框架,利用退化适应与轻量神经模块,从前馈方式重建水下3D场景,输出点图和位姿,性能优于现有方法。
GeoThreat:针对遥感图像解译的大规模视觉-语言模型的可迁移定向对抗攻击
GeoThreat通过概念与感知调制实现遥感LVLM的可迁移定向对抗攻击,性能优越。
光谱-空间协同引导网络用于高光谱显著目标检测
提出S3GNet,利用光谱导数与区域层次建模去除光照干扰,跨流协同与多尺度细化,实现高效高光谱显著目标检测。
HyperImageNet:大规模高空间分辨率高光谱图像分类基准
提出含2.6万高光谱图像块、138类细粒度土地覆盖的基准,支持语义及实例分割,开放环境评估验证有效性。
实现任意粒度的文本行人人检索
提出任意粒度检索范式,构建多粒度数据集与评估基准,CMAM框架通过正交专家感知等实现跨模态对齐,显著超越现有方法。
展示而非言说:基于生成像素而非LLM文本评估空间认知
提出ProVisE框架评估空间认知,发现图像生成模型在像素表达上有优势,文本VLM在组合推理上领先。
TransBiolab:一个真实世界多视图的杂乱透明生物医学物体数据集
提供杂乱透明生物医学物体的多视图RGB-D数据集,含15类物体、1.03M实例,支持分割、深度估计和6D姿态估计。
因果-代理IR:自适应图像恢复代理的自我进化因果记忆
提出Causal-AgentIR多代理框架,构建因果记忆图,实现知识积累与协作推理,有效提升图像恢复适应性。
面向散焦去模糊的RealDefocus基准
RealDefocus基于真实Bokeh数据集,提供配对图像、预定义划分和统一评估框架,用于散焦去模糊方法比较。
Geo3R:缓解多模态大语言模型中的空间推理幻觉
Geo3R是一种无训练即插即用框架,通过几何证据与3D推理有效缓解多模态大模型空间推理幻觉。
C-PTQ:面向多模态大语言模型后训练量化的Fisher加权通道敏感度方法
C-PTQ利用Fisher加权近似海森矩阵,将任务敏感度融入量化缩放,无需辅助模块达SOTA。
Loss Landscape Topology Reveals Why Simple Baselines are Competitive at 3D Point Cloud Segmentation Under Class Imbalance
HalluScope:面向多模态大语言模型的细粒度幻觉诊断
提出细粒度幻觉诊断任务与HalluScope模型,实现检测分类可解释生成,有效指导模型纠正幻觉。
第二届LoViF 2026真实世界全能图像恢复挑战赛:方法与结果
第二届LoViF挑战赛推动真实世界全能图像恢复,涵盖模糊、低光等退化,总结有效设计并更新基准。
病理视觉-语言模型真的能看见病理吗?
PathBind揭示病理VLM存在答案准确与视觉绑定间的显著差距,视觉证据非必要、领域训练增益有限、注意力扩散等问题。
斯托克斯信息引导的扩散模型用于鲁棒线性偏振估计
GenPolar基于扩散模型预测斯托克斯分量,两阶段训练实现高保真偏振估计,提升材料检测与去反射性能。
面向安全的手机辅助导航中的人行道与道路分割
提出安全导向分割框架,构建数据集,评估模型发现综合精度、伪安全错误和运行速度是关键。
DTIF: 复杂森林中基于Delaunay三角拓扑的鲁棒闭环检测
基于树干提取与Delaunay拓扑的轻量框架,实现森林中鲁棒闭环检测与全局配准,低计算开销,适用于边缘平台。
CRAG-MM-Diagnostics:实现知识密集型视觉问答的阶段性分析
提出阶段性诊断基准,揭示KI-VQA中知识检索与推理为主要瓶颈,并通过接地双模态RAG提升准确率。
解耦跨模态流形差异:利用可见光扩散先验进行红外超分辨率
提出Shift-IISR双路径扩散框架,用全局调制和局部细化模块提升红外超分辨率的一致性与生成能力。
眼不见,心还在:全模态大语言模型的令牌压缩
提出ReMo框架,通过跨模态信息重分配压缩视觉令牌54%,准确率不减反升。