Preserving Knowledge across Space and Time for Continual Video Deepfake Detection
深度可分离边缘视觉系统中的预处理失效与对抗检测
预处理防御在深度可分离边缘架构上失效,但其预测分歧可无训练检测对抗样本。
冻结视觉语言模型何时会响应无图像对象令牌编辑?一项免答案键协议及其启示
免答案键协议揭示:冻结视觉语言模型响应对象令牌编辑需显式教学,受令牌洁净度与密度影响,文本问答保留九成以上。
神经崩溃引导的无任务持续异常检测
提出NC-TFAD框架,用等角紧框架几何空间与合成异常样本,实现无任务边界的工业异常检测,在MVTec AD和VisA上优于现有方法。
FoRIS:免训练上下文分割中的渐进式前景细化
将上下文分割视为由粗到细过程,提出免训练FoRIS框架,经前景纯化、定位、整合三阶段渐进细化,1-shot/5-shot平均提升4.5/4.8 mIoU。
STARS-GS:面向大规模航空地表重建的结构感知正则化高斯泼溅
提出结构感知的高斯泼溅重建框架,通过保留结构的分区、邻域约束与自适应正则化,显著提升大规模航空地表重建精度。
探索对比语言-图像预训练在多源遥感数据中的潜力
提出全模态遥感框架,以光谱基分解和掩码对比学习将模型扩至异构数据,并建大型数据集,提升检索与零样本分类。
遮挡鲁棒的多模态情绪识别:基于面部图像与EMG融合的VR方法
融合下半脸视频与遮挡区EMG识别七类情绪,宏F1达51%,优于单模态基线,可用于VR情感交互。
TruncGradGS:通过截断梯度更新改进的3D高斯泼溅
提出分段截断梯度以解决梯度消失,提升三维高斯泼溅优化稳定性与初始化鲁棒性,适用静态与动态场景。
残差最优传输的专家协作方法用于模态感知红外-可见光目标检测
提出FlexibleFusion,用模态感知专家协作和残差自步熵最优传输,在模态缺失时仍可自适应融合,实现一致检测性能。
SafeRestore:面向选择性工业图像修复的检测器相对风险证书
提出面向检测器的风险证书,用于选择性工业图像修复的审计,具可审计性,但不宣称优于简单策略。
SafeRI:大型视觉语言模型的词元级安全识别与干预
提出流式识别与门控LoRA的按需安全干预,仅在检测到不安全时激活重定向,保持通用能力。
WIDE:面向跨模态生成式检索的动态扩展通配符推理
动态扩展通配符推理:校准熵阈值,通配符解码扩展搜索,混合重排序,抑制跨模态检索强迫幻觉,超越现有方法。
丹麦树种制图:光谱-时间特征与地理空间基础模型嵌入的比较
比较光谱时间特征与基础模型嵌入:前者总体精度更高,后者少样本占优;已生成丹麦十米树种图,精度79.9%
FlashRender:通过相机控制的视频MeanFlow实现少步生成式渲染
提出FlashRender少步生成渲染框架,引入表示变换对齐、MeanFlow与流图蒸馏,解决采样步相关相机控制,以25倍低成本达多步质量并增强相机可控性。
基于可变形时间对齐与差异感知融合的神经视频压缩
针对复杂运动/高频纹理下时间上下文不准,提出可变形时间对齐与差异感知融合,抑制错位,率失真性能超DCVC-DC
为世界模型构建预训练数据:基于虚幻引擎的动作条件视频生成流水线
提出基于虚幻引擎的两阶段分布式流水线,生成动作条件多视角视频,为世界模型预训练产出海量合成数据。
Drive-HWM:动态潜变量引导的自动驾驶分层世界模型
提出分层快慢世界模型,分离长期预测与即时决策,用光流学习动态潜变量,联合预测下一帧和动作,提升驾驶性能。
Text2Thermal:基于文本先验的物理感知热图像合成
通过文本提供材质、天气等热辐射先验,无需RGB即可生成热图像,FID达最优。
审计医学生成模型中的患者隐私:利用DeepSSIM++进行可扩展的记忆检测
提出DeepSSIM++,自监督度量医学生成模型记忆,准确高效检测患者数据泄露,较基线显著提升。
RhythmFormer远程光电容积描记中可解释人工智能的跨数据集迁移与可靠性
量化表明,归因指标跨数据集补充性能而非替代;皮肤覆盖与SaCo揭示模型关注点,不保证准确性。
EraseSAE:基于稀疏自编码器的文本到视频扩散模型精准概念擦除
EraseSAE用稀疏自编码器解耦时空特征并精准擦除目标概念,保持生成质量,优于现有方法。
在推理时稳定相机控制的新视图合成
将相机运动分解为小自回归步骤,可减少误差累积,提升稳定性和3D重建质量,无需重训。
面向高效渐进图像压缩的树结构向量量化
提出树向量量化框架,以层次二叉树组织码字,根到叶路径前缀可解码,实现高效渐进图像压缩。
PL-SCEA:面向少样本工业异常检测的预训练注意力重构
通过自相关与幂律加权重构预训练注意力,配合VAE重建计分,实现少样本工业异常准确检测与定位。
重新思考3D噪声:通过免优化的形态扰动学习3D感知视频先验
提出3D形态扰动正则器,免优化保持空间一致性,增强几何先验,降低深度误差12.5%,提升机器人操作成功率8%。
SV-WAM:用于端到端自动驾驶的高效环视世界动作模型
提出环视世界动作模型:视频预测仅作监督,推理时弃视频分支,实现低延迟规划最优;加可行驶正则提升安全。
CoFiE:面向高效流式视频理解的从粗到精证据选择
提出CoFiE框架,在视觉编码前粗筛帧、LLM预填充中细选关键帧,减少冗余并提精度,多个视频基准达SOTA。
ARCOS:跨OCT设备的角膜层分割零样本边界定位
提出ARCOS零样本边界定位框架,跨设备角膜层分割精度高,匹配设备准确率95.1%,跨设备84.3%,厚度误差低。
ToPO:面向注意力潜扩散模型的令牌条件偏好路由
ToPO以令牌条件偏好路由优化潜扩散模型,无需奖励模型,在SD-1.5和SDXL的多数指标上均优于Diffusion-DPO。
理解自动驾驶数据集:通过自然语言描述图像子集间的差异
提出用自然语言描述图像子集差异,辅助自动驾驶数据集分析,开发AD-Diff基准,评估开放权重模型。
DropClick:面向农业机器人数据的半自动单击分割
提出单击分割工具DropClick,仅用少量图片训练即可生成伪标签,减少标注输入,性能优于同类方法。
SignSeek:面向手语词典检索的可迁移表征学习
基于显著引导的发音部位掩码对比学习,实现跨语料手语检索最优,且零样本泛化到未见过手语。
视频生成器能否跨片段追踪世界?视频延续中世界状态推理的基准与方法
提出世界状态推理基准与显式实体状态更新法,将视频延续状态得分由45.2提升至69.3。
观测条件潜在能量先验用于稀疏隐式神经形状补全
提出观测条件潜在能量先验,改善冻结隐式神经表示解码器的稀疏形状补全,优于L2和高斯混合先验。
面向组织病理学全切片图像分类的语义感知子图状态空间模型
提出语义感知子图状态空间模型:聚合病理块为子图以保持空间结构,结合GNN与Mamba编码子图内外信息,实现全切片高效分类。
MetaStructAtlas:面向全身PET/CT功能与结构推理的定位式3D视觉语言数据集及基准
提出MetaStructAtlas和MetaStructVQA,含490套PET/CT、5万掩膜、10万问答对,支持全身功能与结构推理。
LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes
Unfold The World: Factorize 4D Properties in Reinforcing Spatial Reasoning
RealCADBench: Benchmarking Parametric CAD Modeling from Industrial Design Intents
Urban Boundaries, Social Barriers: A Benchmark and Vision-Centric Framework for Mapping Gated Communities and Equity Implications
VisCAD: A Foundation Model Suite with Multimodal Industrial CAD Intelligence
SPARK: Input-Conditioned Sparse Activation Modulation for Frozen DiT-based Super-Resolution
KnowVis: Knowledge-Centric Visual Summarization for Video Lectures
A Reverse Sign Language Dictionary: Open-Vocabulary Sign Recognition from Continuous Signing via Video Captioning and Description Retrieval
Fill My Mirror: Geometry-Constrained Mirror Inpainting
ENEAS: Embedding-guided Neural Ensemble for Adaptive Segmentation
用于多尘农业条件的传感器测试环境概念
提出室内外试验场概念,含封闭粉尘循环试验台与真实农业场景,用于评估粉尘对传感器及算法的影响。
VI3:利用惯性线索锚定预训练3D基础模型
VI3用IMU读数恢复预训练3D模型的度量尺度,无需真值监督,保持几何一致性,适应多种架构。
选择、压缩、再投资:长视频多模态大模型中视觉令牌分配的控制性研究
选择最关键:8个查询选中帧胜于16个均匀帧;压缩近乎无损;将省下令牌再投资,可再获2-3分。