I2VShield:针对基于DiT的图像到视频模型的高效主动防御框架
提出生成对抗攻击方法,通过文本自适应扰动和多模态注意力破坏,高效破坏视频时空连贯性并降低计算成本。
Argus-Unified:迈向紧凑经济的图像理解与生成统一模型
Argus-Unified利用预训练VLM和混合视觉token,以极低数据(15.6M)和成本(约2000美元)实现图像理解与生成统一,性能达SOTA。
ReLATE: 可靠性引导的证据融合用于鲁棒无人机-卫星跨视角地理定位
提出UAVSat-Deg退化基准和ReLATE方法,通过可靠性引导证据融合提升定位鲁棒性,在退化测试中取得最佳性能。
超越计数:病理基础模型的分布鲁棒性裕度
提出CRoMa样本级鲁棒性度量,将表示几何转为分布,揭示模型异质性,辅助模型选择。
计算细胞学中用于异常检测的群等变扩散
D4-等变扩散框架利用旋转反射对称性,获得变换一致伪健康重建,提升细胞学异常检测AUC与稳定性。
古代钱币铭文解读:基于目标检测的新型罗马共和国数据集字符识别
收集5654张罗马共和国钱币图像,用YOLOv7-Large实现90.4%的mAP50,突破铭文识别难题。
DensFiLM:面向人群场景的密度条件视频显著性模型
提出密度条件视频显著性模型DensFiLM,通过轻量调制层实现密度自适应,显著提升人群场景预测性能。
考虑安全性的级联推理用于作物损害评估及可控错误权衡
提出级联架构CascadeCropNet,通过阈值控制误差,在作物损害评估中减少54%漏报,无需重训练。
看到、说到,还是忘记?跨对话轮次的视觉KV记忆因果审计
提出CVMA框架审计视觉KV遗忘,发现安全遗忘依赖低未来视觉依赖或事实已言说,而非当前注意力。
医学中的智能代理AI:架构、应用、评估及临床转化挑战
医学代理AI依赖大模型执行多步骤任务,但评估与临床需求脱节,需清晰定义和真实世界验证。
跌倒事件冲击检测:利用时空图卷积网络与循环神经网络分析3D骨骼数据
提出基于STGCN和RNN的3D骨骼图方法,精准检测跌倒冲击时刻,准确率超90%。
面向视频模型的视觉提示工程
视觉提示工程通过修改任务图像提升视频模型性能,比文本提示更有效,是简单高效的方法。
少即是多:面向通用AIGC音视频检测的模态解耦方法
提出解耦检测法DAV-Det,独立分析各模态伪造线索,在通用场景挑战赛获第一。
基于文本反转的少样本开放词汇遥感图像分割
通过文本反转优化文本查询,将遥感分割受影响类别的平均交并比从3.9提升至39.4。
ReDesign:通过智能体分解从图像中恢复可编辑设计结构
提出ReDesign智能体框架,逐步扩展与验证恢复可编辑设计,实现高视觉保真度与最佳可编辑性。
LAIA数据集:面向智能汽车的标注注意力
提出LAIA合成数据集,含44人15小时驾驶及眼动追踪,用于端到端驾驶注意力研究与模型可解释性。
超越面部一致性:具有整体身份保留的个性化人物图像生成
提出动态平衡缩放策略协调面部与外观身份,实现更优权衡,并引入新基准。
放射学视觉语言模型基准的法医可重复性审计:从预期协议到发布制品
审计发现该基准存在提示绑定、DICOM反转、截断等不一致,撤回原始声明并提出可验证控制。
OmniPhys: 知识图谱驱动的文本到图像生成物理常识基准测试与集体优化
基于物理知识图谱的1551样本基准及迭代框架OmniPrompt,有效提升12个模型的物理一致性。
基于指令的图像编辑:数据、模型、评估和应用综述
综述基于指令的图像编辑,涵盖数据、模型、评估与应用,提出CDD-IIE基准,对比开源方案,展望未来方向。
基于证据感知的多智能体推理实现忠实情感图像描述
提出SEA-Cap系统,通过情感证据挖掘与协作审核,消除幻觉,实现情感准确与事实一致,达最优性能。
FLASH:基于统一超图状态空间模型的高效碰撞跌倒检测
FLASH框架融合超图与状态空间模型,高效检测跌倒碰撞,实现SOTA精度、实时推理与零样本泛化。
SepPrune:基于分隔符的高效多模态大语言模型剪枝框架
提出基于分隔符的剪枝方法SepPrune,无需训练即可移除80.2%视觉令牌,保留96.3%准确率。
视频对象插入与图层分解的显式层建模
提出TriLayer数据集和DBL-Diffusion框架,通过显式层建模提升视频对象插入与图层分解质量。
通过目标感知数据对齐的细粒度食品图像理解
提出数据对齐方法,经选择与精炼后融合专家决策,提升细粒度图像理解,性能提高且高效。
LAFOV PET扫描仪中基于机器学习分类器逐事件背景剔除的系统评估
评估ML分类器用于LAFOV PET逐事件背景剔除,4特征模型泛化好,准确率0.74/0.69,但抑制散射有限需改进。
Freq-RemoteVAR: 面向遥感变化检测的下一频率自回归建模
提出频率自回归框架Freq-RemoteVAR,将变化检测转为频域逐级生成,通过频率分词和因果建模捕捉长程依赖,并抑制伪变化,性能领先。
AI系统中的图像质量依赖退化
通过图像质量估计调整置信度阈值,避免低质图像下的关键错误,并用归一化流评估图像质量。
GeoMFD:基于几何感知适配器与边界场蒸馏的连续无人机视角地理定位
提出连续无人机视角地理定位方法GeoMFD,结合冷启动、几何感知适配器和边界场蒸馏,用单模型缓解遗忘并达到多环境竞争性能。
面向昼夜无人机视角地理定位的统一基准与模态自适应网络
构建含可见、红外、卫星图像的昼夜地理定位基准IRCHN,提出MASTR-Net实现模态自适应对齐,性能领先。
超越静态成本:面向长尾分类的学习动态感知损失函数
提出学习动态感知损失(LDAL),动态调整类别权重,超越现有重加权方法,兼顾准确性与泛化性。
利用LLM生成的食材标签和多模态融合的食物图像分割
提出LIM-F与LIM-Q模块,借助LLM推断食材标签提升分割性能,在FoodSeg103达最优,mIoU达55.0。
LaP-Forensics:基于潜在-像素一致性的多模态推理用于深度伪造检测
LaP-Forensics利用DDIM重建残差增强RGB检测,GRPO优化预测,跨生成器检测有效,但文本忠实性和后处理可靠性待改进。
对抗性深度伪造生成及基于净化的对抗性检测研究
使用多模型PGD攻击生成深度伪造,结合两个检测器以99.4%准确率检测,自研净化检测AUROC达0.81-0.98。
利用语言弱监督的开放式CT体积分割
结合体素与切片级弱监督,利用报告提取切片描述,提升CT分割Dice,少量标注下相对增益22%。
TIGA:轨迹注入式生成攻击——针对黑盒AIGC检测器
提出TIGA框架,无需源图像和训练,通过注入对抗性轨迹生成逃避黑盒AIGC检测器的图像,性能强且鲁棒。
面部去标识化:从采集到处理的领域视角综述
首篇覆盖物理、传感器、数字域的面部去标识化综述,系统分析进展与挑战,强调标准化基准。
MODUS:仅解码器的多样模态任意到任意建模
提出仅解码器的任意到任意多模态模型Modus,对称处理各模态,无需特定头或损失,性能强且灵活。
评估VLMs在游戏QA中自主代理驱动的几何裁剪检测中的应用
VLMs检测游戏几何裁剪误报多,适合作为多阶段QA流水线的高召回候选过滤器。
面向视频级矛盾与犹豫识别的知识引导多模态交互流推理
PRISM-AH将矛盾与犹豫建模为多模态冲突,融合流式推理与知识引导LLM,视频级识别Macro F1达0.6133。
Wonder:视频世界模型新高度
Wonder实现实时相机可控视频世界探索,核心创新包括密集坐标场控制、稀疏注意力记忆与自蒸馏训练优化。
准SVD:李约束矩阵分解用于实时成像
准SVD通过李约束并行分解矩阵,在医学成像中实现3-20倍加速和25+ FPS吞吐量,优先重建保真度。
NEXT:基于视觉语言模型的推理驱动视频推荐
NEXT-8B推理用户意图推荐视频,三阶段训练,提升观看时长0.53%和曝光量0.51%。
并行解码蒸馏:实现快速图像与视频生成
PDD通过并行预测多个去噪步骤加速生成,无需复杂损失,实现SOTA并提升多样性。
一种函数型曲线对齐与形状分析方法
提出函数型数据分析框架,用基展开解析估计变形变量,实现曲线对齐与形状分析,成功捕捉随机轮廓分布。
VetClaw:一种用于兽医疾病筛查的边缘-云端多模态智能体系统
VetClaw通过摄像头和症状描述进行零样本兽医疾病筛查,症状引导可提升分类性能。
论合成数据在面部识别阈值校准中的应用:对边境控制系统的性能与安全影响
合成数据可用于初步校准,但高安全场景仍需真实数据验证,否则导致性能下降和攻击风险增加。
超越缩放:面向超高分辨率遥感的多工具视觉推理学习
针对超高分辨率遥感多工具推理难题,提出GeoMTVR数据集和GeoLens模型,结合强化学习优化工具调用,提升准确性和效率。
Pictura:面向驾驶的大规模视角自博弈
提出视角自博弈方法,用Pictura模拟器从图像直接训练驾驶策略,无需特权观测,性能比肩并零样本迁移超越特权模型。
薛定谔的猫:潜在场景运动学的概率表征与预测
提出GARFIELD概率模型,学习时空潜在分布表征未来运动,采样快97倍,密度估计快两个数量级。