激励视觉语言模型搜索长视频问答
VSeek框架用强化学习与神经符号方法,通过可验证奖励提升长视频问答准确率。
对大型视觉语言模型进行过载攻击以实现越狱
提出信息过载越狱方法,通过递归图像排版增加复杂度,攻击成功率达88.6%,超基线48.7%。
RePos: 跨环境WiFi三维姿态估计的相对到绝对输出分解
RePos分解WiFi姿态估计为根相对姿态与根位置,学习环境不变表示,跨环境测试MPJPE降低10-21%。
面向全模态密集视频字幕的并行自回归解码
利用事件间弱依赖实现无损并行解码,提升密集视频字幕生成效率与性能。
GuideMe:流式视频中的多领域任务引导与干预
GuideMe是首个多领域流式视频闭环任务引导基准,发现模型擅长指令但弱于错误检测与纠正。
唤醒扩散变换器:通过大规模激活调制激发更强的生成与理解能力
发现DiT中大规模激活集中特定维度,受去噪步调制;提出EMA框架无训练提升生成细节与表征区分性。
基于零阶优化与模型合并的跨设备协同测试时适应
结合零阶优化与模型合并,实现资源受限设备上的协同测试时适应,降低计算与内存需求。
VISTA:审计视觉语言模型中的语义偏差
VISTA通过语义熵与分布偏差检测视觉概念条件性分歧,发现1.2%高可疑案例及选择性拒绝模式。
REAL-OW:基于低秩适应与双阶段目标性建模的无重放开放世界目标检测
提出基于LoRA和双阶段目标性建模的无重放开放世界目标检测框架,有效克服灾难性遗忘,性能达最优。
CONFLUX: 一种带有强化学习后处理的3D胸部CT合成潜在扩散模型
提出CONFLUX,3D潜扩散模型合成胸部CT,用强化学习后处理提升临床属性控制,FID32.3,后处理减少47%缺陷。
基于增益感知的预测空间递归控制器的轻量级息肉分割
提出增益感知递归控制器,直接在预测空间校正轻量级息肉分割,显著提升分割精度与部署效率。
OmniDS:面向鱼眼相机的全向深度估计双流上下文融合
OmniDS通过双流动态上下文融合与多视图共识,实现鱼眼相机全向深度估计SOTA性能,并支持高效部署。
CURE:面向复杂退化的可控统一图像恢复
CURE通过解耦可调表示实现复杂退化下的可控恢复,无需改架构即达最优性能。
自然语言中的摄像机运动理解
现有视觉语言模型无法正确理解自然语言中的摄像机运动,作者建立基准与训练集,微调模型性能提升明显,但仍不及人类表现。
PosterHarness:将科学海报生成转化为可审计的指令遵循基准
提出可审计框架,用占位符合同强制模型不生成虚假图形,基于12篇论文实验消除虚假图形,实现可量化评测。
RIGS-Refiner:结肠镜息肉分割预测空间中的风险引导递归细化
轻量后细化插件,风险引导递归更新预测残差,仅增519参数,性能提升显著。
文本到图像生成用于投影仪-相机系统配准
提出深度网络从文本生成兼具真实感与丰富特征的自然图像,提升投影-相机配准精度,经用户验证有效。
HyperVAttention: 面向视频扩散的时空聚类高效稀疏注意力
HVA通过时空局部窗口聚类与硬件感知合并,无需训练,实现2.13倍加速并保持高保真度。
MambaLIE:基于状态空间模型的场景光照强度增强低光图像方法
提出MambaLIE方法,结合状态空间模型与局部增强,高效建模光照分布,在精度、速度和模型大小上超越现有方法。
$C^3$ASD: 多层级一致性驱动的表示学习
提出C^3ASD多层级一致性框架,通过三重约束提升主动说话人检测在噪声、遮挡等退化条件下的鲁棒性。
重新思考基于CLIP的脑解码:对抗鲁棒性的作用
对抗鲁棒性表示能提升脑解码性能,更贴合大脑活动,优于标准CLIP。
SafeGuard:面向社会风险AI生成视频检测的多智能体感知-推理框架
提出多智能体框架协同感知与推理,在20K视频新基准上提升18.7%准确率,优于现有方法。
PixCon:面向基础模型半监督分割的纯净正例对比学习
PixCon通过只采用学生正确分类的标记像素构建无污染正例集,无需阈值过滤,在多个数据集上改进DINOv2基线,精度提升来自干净正例监督。
基于注意力引导的EfficientNet架构实现监控图像中罪犯的精确识别
提出AG-EfficientNet,集成CBAM与多尺度融合,混合损失优化,监控人脸识别准确率达98.2%,优于经典模型。
信噪比自适应统一扩散模型用于多任务医学图像分割
UniT-Diff统一扩散模型通过SNR自适应调节解决多任务冲突,三基准上均超越独立模型。
一种带有时序事件验证的实时智能视频监控多任务深度学习框架
提出统一多任务框架,集成人脸、车牌、武器、烟火及行为检测,通过时序验证大幅降低误报,实时运行于普通硬件。
Vidu S1:实时交互式视频生成模型
Vidu S1是实时交互视频生成模型,支持语音控制数字角色,实现无失真无限时长视频生成,性能最优。
文本作为部分约束:面向鲁棒视觉-语言学习的核心-残差对齐
提出TPC框架,将文本视为部分约束,通过核心-残差对齐实现稳定匹配,提升零样本识别与对抗鲁棒性。
DistillH-Mamba:基于超图-曼巴的高效冲击跌倒检测知识蒸馏模型
提出DistillH-Mamba模型,采用超图-曼巴与知识蒸馏,冲击跌倒检测准确率97.38%,推理时间减少73.8%。
ExpoMotion:面向多曝光融合的大规模基准与Householder投影网络
提出大规模动态基准ExpoMotion及Householder正交投影网络HOP,有效消除鬼影并保持细节。
通过对抗性公路旅行防御地理位置识别
提出RoadTrip攻击,用光束搜索构建欺骗路径,以细微扰动引导模型定位错误位置,黑盒场景迁移性强。
BVS:基于多模态大语言模型的贝叶斯视觉搜索用于细粒度感知
BVS框架利用贝叶斯视觉搜索,融合先验引导与后验校正,高效处理超高分辨率图像细粒度感知,显著优于基线。
透视WiFi:基于动态核注意力的轻量级人体姿态估计
WiLHPE框架利用WiFi信号轻量级估计人体姿态,动态核注意力机制,PCK50达85.96%和94.27%,低开销。
FairFlow: 揭秘与缓解文本-图像扩散Transformer中的刻板印象偏见
FairFlow通过分析偏见传播机制,在关键语义枢纽注入公平方向,高效中和性别、种族等刻板印象,兼顾公平与保真且计算开销极低。
学习抑制基于SPAD的激光雷达耀斑
本文提出物理信息分割法PILF,将耀斑抑制转为语义分割,利用SPAD多回波特性,mIoU达79.32%。
快速3D基础模型初始化的高斯泼溅
利用3D基础模型初始化相机位姿与点云,联合优化高斯原语,深度引导损失实现快速收敛,3分钟完成高质量重建。
OpenGlass:一种面向本地MLLM驱动的实时视觉辅助的传感-计算分离架构
OpenGlass采用传感-计算分离架构,本地运行MLLM,实现<1秒延迟的隐私保护视觉辅助。
基于语义分割的苏木精-伊红组织病理图像肝癌图像级诊断
提出基于语义分割的H&E图像肝癌诊断框架,采用nnU-Net训练三种肝癌,五折交叉验证准确率达0.975-1.000,可辅助降低诊断成本与时间。
OmniLayout:面向PCB布局中约束感知几何推理的示意图耦合多模态基准
首个PCB布局推理基准OmniLayout,含四项约束任务,揭示LLMs在几何、布线、功能推理上的局限。
面向少步扩散模型的可分解探针:跨骨干家族与蒸馏范式的提示、潜变量和分数选择性
提出可分解探针替代单一标量,发现潜变量层可检测修正流骨干,分数层反映蒸馏目标,提示层为通用响应通道。
视觉语言模型中视觉信息流的路径
研究视觉语言模型中视觉信息的两种路由路径:直接与文本中介,路径选择依赖任务且具有灵活性。
从通用动作到领域特定监测:基于骨架动作识别的先验自适应迁移
提出PATS框架,通过选择性保留相关先验实现高效迁移,在阿尔茨海默病及跌倒检测中性能提升。
LBTCap:用于实时遥感图像变化字幕的轻量级双边Transformer
LBTCap轻量双边Transformer,39.99M参数,实现实时遥感变化描述,准确率接近SOTA。
WorldBagel:揭示统一多模态模型在视觉-语言-动作-世界建模中的威力
WorldBagel统一框架在多任务机器人中优于专用模型,证明统一性是学习有效VLAW模型的关键。
超越后量化:使用专用HASH Token的原生哈希学习
提出HashViT,引入专用HASH令牌实现原生哈希学习,消除特征-代码差异,在三大基准上取得领先性能。
GrowFields:面向拓扑变化植物生长的组合式4D神经场
提出组合式4D神经场GrowFields,建模点云时序中植物生长,处理拓扑变化和异步器官发育,提升时空精度与形态保真。
存在但未被记住:审计冻结的VLA如何编码、部署和引导视觉历史
冻结VLA中历史信息与当前帧冗余,仅当前帧退化时使用;部署策略因架构而异,可引导性取决于如何使用历史,建议注入独特信息。
TemporalGS:基于时间先验的3D高斯泼溅渲染免训练即插即用加速
利用时间先验动态剔除和选择性渲染,实现3DGS免训练渲染加速,性能可比甚至优于现有方法。
品牌即记忆:视觉语言模型为新闻来源编码因果性且机制可定位的可信度先验
视觉语言模型基于来源品牌编码可定位的可信度先验,优先于内容证据,造成可靠性缺陷。
基于扩散模型的手写轨迹恢复
提出首个扩散模型框架,从离线图像恢复在线笔迹,精准重建多笔画字符,时序与形状保真度优于现有方法。