VigilFormer:基于形变注意力与因果风险推断的视频异常检测
VigilFormer结合形变时空注意力与因果建模,实现视频异常检测的高精度(87.83% AUC)与实时速度(41.5FPS),优于现有弱监督方法。
GridVQA-X:评估多模态可解释性方法的框架
GridVQA-X诊断框架揭示现有方法无法区分真实推理与捷径,暴露跨模态可解释性关键缺陷。
UtVAA:面向移动图像分类的带有附加注意力的超微型视觉Transformer
提出UtVAA超微型ViT,采用Affix Attention与空洞瓶颈,亚百万参数下达竞争性准确率,适合移动边缘部署。
Style-CCL:通过课程持续学习实现内容保留的风格迁移
提出多阶段课程持续学习框架,逐步训练扩散变换器从语义到纹理风格,克服风格主导问题,实现三核心指标最优。
子语义图像分割
提出子语义分割新类别,用DETECTURE解决VLM与SAM耦合的语言泄漏等三大失败模式,创建TextureADE数据集,性能最优。
HorusEye:以语言为动态注意力的应急视觉分析
HorusEye用动态语言注意力实现应急视觉分析,发现语言反馈效果高度依赖模型(Gemini提升47.3%,Qwen2-VL下降5.1%),并揭示热成像裁剪悖论。
MMLongEmbed:在长上下文场景中基准测试多模态嵌入模型
首个长上下文多模态嵌入模型基准,揭示现有模型依赖表面特征匹配,性能受长度和关键位置影响。
我的视觉语言数据在你的AI中吗?成员推理测试(MINT)演示2
MINT框架检测训练数据成员,准确率达90%,推出多模态审计平台,促进AI透明与合规。
自动化三维运动监测用于幼鱼昼夜活动与异常检测
结合深度学习与双目视觉,实现幼鱼3D运动追踪与昼夜节律基线建立,提供生理应激预警。
超越自注意力:次二次视觉Transformer用于快速图像描述
提出基于高斯混合模型和EM算法的概率Transformer,将自注意力复杂度从二次降为线性,在Flickr30K上取得显著提升。
X-Tokenizer: 用于视觉-语言-动作预训练的多模态动作分词器
X-Tokenizer通过语义残差量化和掩码动作建模,将动作分词器从压缩工具转变为语义接口,显著提升多模态对齐与长时任务性能。
XMedFusion:面向自主医疗系统的知识引导多模态感知与推理框架
XMedFusion通过结构化多智能体感知与推理,增强视觉接地和临床发现提取,显著提升放射报告生成的准确性和一致性。
纹理证据存在于SAM的何处?特征、提议掩膜与纹理分割
冻结SAM粗特征保留纹理组织,提案银行有纹理掩膜,失败源于读取与承诺不匹配。
分而治噪:一种公平组合扩散模型的博弈论方法
通过博弈论公平分配噪声区域,协调多个扩散模型,避免主导与冲突,提升条件图像生成质量。
利用空间填充曲线为小规模和有限数据视觉Transformer提供空间先验
VIOLIN通过空间填充曲线轻量注入空间归纳偏置,在有限数据和小模型上提升性能达8.7%。
解构幻觉:正交语义投影实现稳健可解释性
提出LSA框架和OSP方法,通过正交化查询向量消除语义幻觉,提升视觉-语言模型解释的稳健性。
GeoRoPE:面向遥感基础模型的地面感知旋转适应方法
GeoRoPE通过地坐标与频率校准,轻量级增强遥感基础模型的跨分辨率鲁棒性和尺度敏感表示学习。
避免分配格次模最小化中的指数爆炸
提出分配格次模最小化新框架,避免指数膨胀,大幅提升效率。
Scribby:一种用于语义视频分析的多级大语言模型框架
提出多级LLM框架,通过逐句分析和语义分组平衡宏观与微观视频理解。
通过潜在空间运动建模实现二维电影CMR的时间一致且可控视频生成
提出解耦心脏空间与运动的文本-视频生成模型,合成时间一致的高保真CMR序列,缓解数据稀缺。
动量引导的语义预测(MoFore)用于自监督视频表示学习
提出MoFore框架,通过预测未来潜在表示和对比正则化,实现无标签的自监督视频表示学习,具有时域一致性和语义结构。
FactCheck:基于多智能体协作的可行性感知长期动作预测
FactCheck通过闭环“观察-规划-验证”机制与多角色协作,显著提升长期动作预测的物理可行性,在基准测试中超越现有方法。
大规模行人属性识别中优化动态与稀疏边界的实证分析
在109,000张图像中发现少数类样本率低于1%导致标准优化失效,采用焦点损失调参使宏F1达62.32%,并揭示0.1%以下的稀疏墙边界。
图像到图像生成模型的视觉编码器行为指纹:基于训练范式的六个商业API分类
研究六种商用图像生成API,通过次JND扰动和DINOv2特征距离分析,发现编辑训练模型与采样适应模型呈现两类行为聚类。
双螺旋视觉(DH-V2):一种用于带宽受限感知的几何视觉采样器
双螺旋采样器实现1433倍压缩,保留几何结构,无需神经网络,准确率提升6.03%,亚毫秒感知。
基于变分深度展开与Mamba非局部建模的水下图像增强
融合变分建模与Mamba非局部建模的深度展开网络,实现水下图像增强,视觉质量和量化性能领先。
YTClickbait21K:面向多频道和内容类别的YouTube点击诱饵检测的人工标注多模态数据集
提供2.1万YouTube视频、人工标注点击诱饵的多模态数据集,覆盖多类别,标注一致性高,为检测模型提供基准。
最后但同样重要:面向多模态KV缓存压缩的边界注意力校准
提出BACON方法,校准注意力窗口与最后查询证据,抑制噪声,多模态KV压缩平均提升7.5%。
视觉编码器作为隐私边界:无编码器视觉语言模型中的视觉令牌侧信道
无编码器VLM中视觉令牌侧信道泄露隐私,攻击可恢复图像与文本,防御需降低空间采样。
ScoutVLA:基于双专家VLA模型的以无人机为中心的主动感知用于开放世界具身问答
ScoutVLA双专家VLA模型通过解耦架构与知识隔离训练,实现主动感知,在开放世界具身问答中成功率和正确率分别提升10.48倍和7.72倍。
JoyAI-VL-Interaction:实时视觉-语言交互智能
开源首个8B级实时视觉交互模型,自主决定响应或静默,集成可部署系统,超越现有应用。
Understanding Cross-Modal Contributions in Continual Vision-Language Models: A Theoretical Perspective
一种用于可靠且可扩展的柠檬叶病害分类的集成深度学习方法
集成InceptionV3和MobileNetV2,对柠檬叶病害分类准确率达99.27%,结合对抗训练与Grad-CAM提升可靠性。
基于测地线框架的掩膜提议投票方法用于稳健图像分割
提出测地线框架下掩膜提议投票方法,用自适应域切初始化生成候选掩膜,投票融合实现鲁棒精确分割。
改进的知识蒸馏用于土地利用图像分类
提出改进的知识蒸馏框架,用VGG16指导轻量MobileNetV2,结合硬监督与软监督,土地利用分类达99.04%准确率。
深度学习在地震解释中的应用:盐丘分割的联邦学习进展
FedSaltNet联邦学习框架实现隐私保护的盐丘分割,轻量U-Net与前景加权策略在非独立同分布数据上使IoU提升4%。
立场:视觉推理中系统性的主体性缺失
当前视觉语言模型普遍缺乏自主推理能力,仅能被动检索语义而不擅主动探索视觉证据,新基准V-IRD揭示其关键差距。
基于离散扩散模型的高效图文思维强化
离散扩散模型替代自回归实现多模态强化学习,局部视觉编辑减计算26.9%,分解奖励分配提效11.2%,总提升38.04%。
S23DR 2026:基于对比去噪的DETR风格集合预测实现端到端3D线框预测
提出WireframeDETR,以DETR风格直接预测3D边坐标对,引入对比去噪训练、多尺度编码器和渐进损失加权,取得HSS 0.575。
HSQ-VLM:一种用于糖尿病视网膜病变可解释性的新型空间约束四象限分割VLM模型
HSQ-VLM通过四象限分割与交叉注意力机制,生成自然语言报告,实现糖尿病视网膜病变高灵敏度检测与解剖精确可解释性。
Multi-HMR 2:多人在以摄像机为中心的视角下的人体检测、网格恢复与追踪
提出Multi-HMR 2框架,实现摄像机坐标系下多人检测、网格恢复与追踪,无需先验知识,性能领先。
MVEB:大规模视频嵌入基准
提出含23任务的视频嵌入基准MVEB,评估33模型发现无模型全能,音频贡献取决于标注来源。
汽车近红外图像中鲁棒合成到真实语义分割的纹理-形状偏差平衡
提出TSA和VSD方法平衡纹理-形状偏差,提升NIR合成到真实分割鲁棒性,域差距降低63.6%。
学习稀疏潜在预测基础模型用于多模态神经影像
提出Neuro-JEPA模型,结合潜在预测与混合专家架构,在超155万扫描上预训练,多项任务表现更优且一致。
ReGenHuman:重新生成人体外观以实现逼真的全身视频匿名化
ReGenHuman:首个全身视频匿名化流程,重新生成而非编辑,从结构线索合成人体,实现逼真、时序一致、匿名,隐私/质量/实用性最佳。
基于遥感图像和深度学习的多模态注意力自动化灾害损伤评估
提出多模态注意力融合双时相遥感图像,实现建筑四级损伤分类,准确率94.90%,提升评估速度与应急响应效率。
NEXUS:物理一致接触丰富的三维物体动态的神经能量场
NEXUS用神经能量场建模接触丰富三维物体动态,组合保守与非保守效应,提升长程准确性并指导视频生成。
外科视频中解剖感知目标检测的高斯空间先验
提出高斯空间先验模块,利用解剖空间关系提升手术视频小目标检测,AP50提升33.5%。
迈向全球人工智能驱动的宫颈癌筛查
首个多国验证的深度学习宫颈癌筛查模型,性能优于专家,但国家间差异大,合并症影响最大。
通过视觉-语义枢轴终身学习弥合城市街景推理中的地理偏差
HVSP-LL框架通过分层视觉-语义枢轴与公平重放,将城市间街景感知差距缩小38%-57%,消除灾难性遗忘。