11271 条条目 · 106 个活跃源
2026年7月7日
04:00
arXiv cs.CV

激励视觉语言模型搜索长视频问答

VSeek框架用强化学习与神经符号方法,通过可验证奖励提升长视频问答准确率。

04:00
arXiv cs.CV

对大型视觉语言模型进行过载攻击以实现越狱

提出信息过载越狱方法,通过递归图像排版增加复杂度,攻击成功率达88.6%,超基线48.7%。

04:00
arXiv cs.CV

RePos: 跨环境WiFi三维姿态估计的相对到绝对输出分解

RePos分解WiFi姿态估计为根相对姿态与根位置,学习环境不变表示,跨环境测试MPJPE降低10-21%。

04:00
arXiv cs.CV

面向全模态密集视频字幕的并行自回归解码

利用事件间弱依赖实现无损并行解码,提升密集视频字幕生成效率与性能。

04:00
arXiv cs.CV

GuideMe:流式视频中的多领域任务引导与干预

GuideMe是首个多领域流式视频闭环任务引导基准,发现模型擅长指令但弱于错误检测与纠正。

04:00
arXiv cs.CV

唤醒扩散变换器:通过大规模激活调制激发更强的生成与理解能力

发现DiT中大规模激活集中特定维度,受去噪步调制;提出EMA框架无训练提升生成细节与表征区分性。

04:00
arXiv cs.CV

基于零阶优化与模型合并的跨设备协同测试时适应

结合零阶优化与模型合并,实现资源受限设备上的协同测试时适应,降低计算与内存需求。

04:00
arXiv cs.CV

VISTA:审计视觉语言模型中的语义偏差

VISTA通过语义熵与分布偏差检测视觉概念条件性分歧,发现1.2%高可疑案例及选择性拒绝模式。

04:00
arXiv cs.CV

REAL-OW:基于低秩适应与双阶段目标性建模的无重放开放世界目标检测

提出基于LoRA和双阶段目标性建模的无重放开放世界目标检测框架,有效克服灾难性遗忘,性能达最优。

04:00
arXiv cs.CV

CONFLUX: 一种带有强化学习后处理的3D胸部CT合成潜在扩散模型

提出CONFLUX,3D潜扩散模型合成胸部CT,用强化学习后处理提升临床属性控制,FID32.3,后处理减少47%缺陷。

04:00
arXiv cs.CV

基于增益感知的预测空间递归控制器的轻量级息肉分割

提出增益感知递归控制器,直接在预测空间校正轻量级息肉分割,显著提升分割精度与部署效率。

04:00
arXiv cs.CV

OmniDS:面向鱼眼相机的全向深度估计双流上下文融合

OmniDS通过双流动态上下文融合与多视图共识,实现鱼眼相机全向深度估计SOTA性能,并支持高效部署。

04:00
arXiv cs.CV

CURE:面向复杂退化的可控统一图像恢复

CURE通过解耦可调表示实现复杂退化下的可控恢复,无需改架构即达最优性能。

04:00
arXiv cs.CV

自然语言中的摄像机运动理解

现有视觉语言模型无法正确理解自然语言中的摄像机运动,作者建立基准与训练集,微调模型性能提升明显,但仍不及人类表现。

04:00
arXiv cs.CV

PosterHarness:将科学海报生成转化为可审计的指令遵循基准

提出可审计框架,用占位符合同强制模型不生成虚假图形,基于12篇论文实验消除虚假图形,实现可量化评测。

04:00
arXiv cs.CV

RIGS-Refiner:结肠镜息肉分割预测空间中的风险引导递归细化

轻量后细化插件,风险引导递归更新预测残差,仅增519参数,性能提升显著。

04:00
arXiv cs.CV

文本到图像生成用于投影仪-相机系统配准

提出深度网络从文本生成兼具真实感与丰富特征的自然图像,提升投影-相机配准精度,经用户验证有效。

04:00
arXiv cs.CV

HyperVAttention: 面向视频扩散的时空聚类高效稀疏注意力

HVA通过时空局部窗口聚类与硬件感知合并,无需训练,实现2.13倍加速并保持高保真度。

04:00
arXiv cs.CV

MambaLIE:基于状态空间模型的场景光照强度增强低光图像方法

提出MambaLIE方法,结合状态空间模型与局部增强,高效建模光照分布,在精度、速度和模型大小上超越现有方法。

04:00
arXiv cs.CV

$C^3$ASD: 多层级一致性驱动的表示学习

提出C^3ASD多层级一致性框架,通过三重约束提升主动说话人检测在噪声、遮挡等退化条件下的鲁棒性。

04:00
arXiv cs.CV

重新思考基于CLIP的脑解码:对抗鲁棒性的作用

对抗鲁棒性表示能提升脑解码性能,更贴合大脑活动,优于标准CLIP。

04:00
arXiv cs.CV

SafeGuard:面向社会风险AI生成视频检测的多智能体感知-推理框架

提出多智能体框架协同感知与推理,在20K视频新基准上提升18.7%准确率,优于现有方法。

04:00
arXiv cs.CV

PixCon:面向基础模型半监督分割的纯净正例对比学习

PixCon通过只采用学生正确分类的标记像素构建无污染正例集,无需阈值过滤,在多个数据集上改进DINOv2基线,精度提升来自干净正例监督。

04:00
arXiv cs.CV

基于注意力引导的EfficientNet架构实现监控图像中罪犯的精确识别

提出AG-EfficientNet,集成CBAM与多尺度融合,混合损失优化,监控人脸识别准确率达98.2%,优于经典模型。

04:00
arXiv cs.CV

信噪比自适应统一扩散模型用于多任务医学图像分割

UniT-Diff统一扩散模型通过SNR自适应调节解决多任务冲突,三基准上均超越独立模型。

04:00
arXiv cs.CV

一种带有时序事件验证的实时智能视频监控多任务深度学习框架

提出统一多任务框架,集成人脸、车牌、武器、烟火及行为检测,通过时序验证大幅降低误报,实时运行于普通硬件。

04:00
arXiv cs.CV

Vidu S1:实时交互式视频生成模型

Vidu S1是实时交互视频生成模型,支持语音控制数字角色,实现无失真无限时长视频生成,性能最优。

04:00
arXiv cs.CV

文本作为部分约束:面向鲁棒视觉-语言学习的核心-残差对齐

提出TPC框架,将文本视为部分约束,通过核心-残差对齐实现稳定匹配,提升零样本识别与对抗鲁棒性。

04:00
arXiv cs.CV

DistillH-Mamba:基于超图-曼巴的高效冲击跌倒检测知识蒸馏模型

提出DistillH-Mamba模型,采用超图-曼巴与知识蒸馏,冲击跌倒检测准确率97.38%,推理时间减少73.8%。

04:00
arXiv cs.CV

ExpoMotion:面向多曝光融合的大规模基准与Householder投影网络

提出大规模动态基准ExpoMotion及Householder正交投影网络HOP,有效消除鬼影并保持细节。

04:00
arXiv cs.CV

通过对抗性公路旅行防御地理位置识别

提出RoadTrip攻击,用光束搜索构建欺骗路径,以细微扰动引导模型定位错误位置,黑盒场景迁移性强。

04:00
arXiv cs.CV

BVS:基于多模态大语言模型的贝叶斯视觉搜索用于细粒度感知

BVS框架利用贝叶斯视觉搜索,融合先验引导与后验校正,高效处理超高分辨率图像细粒度感知,显著优于基线。

04:00
arXiv cs.CV

透视WiFi:基于动态核注意力的轻量级人体姿态估计

WiLHPE框架利用WiFi信号轻量级估计人体姿态,动态核注意力机制,PCK50达85.96%和94.27%,低开销。

04:00
arXiv cs.CV

FairFlow: 揭秘与缓解文本-图像扩散Transformer中的刻板印象偏见

FairFlow通过分析偏见传播机制,在关键语义枢纽注入公平方向,高效中和性别、种族等刻板印象,兼顾公平与保真且计算开销极低。

04:00
arXiv cs.CV

学习抑制基于SPAD的激光雷达耀斑

本文提出物理信息分割法PILF,将耀斑抑制转为语义分割,利用SPAD多回波特性,mIoU达79.32%。

04:00
arXiv cs.CV

快速3D基础模型初始化的高斯泼溅

利用3D基础模型初始化相机位姿与点云,联合优化高斯原语,深度引导损失实现快速收敛,3分钟完成高质量重建。

04:00
arXiv cs.CV

OpenGlass:一种面向本地MLLM驱动的实时视觉辅助的传感-计算分离架构

OpenGlass采用传感-计算分离架构,本地运行MLLM,实现<1秒延迟的隐私保护视觉辅助。

04:00
arXiv cs.CV

基于语义分割的苏木精-伊红组织病理图像肝癌图像级诊断

提出基于语义分割的H&E图像肝癌诊断框架,采用nnU-Net训练三种肝癌,五折交叉验证准确率达0.975-1.000,可辅助降低诊断成本与时间。

04:00
arXiv cs.CV

OmniLayout:面向PCB布局中约束感知几何推理的示意图耦合多模态基准

首个PCB布局推理基准OmniLayout,含四项约束任务,揭示LLMs在几何、布线、功能推理上的局限。

04:00
arXiv cs.CV

面向少步扩散模型的可分解探针:跨骨干家族与蒸馏范式的提示、潜变量和分数选择性

提出可分解探针替代单一标量,发现潜变量层可检测修正流骨干,分数层反映蒸馏目标,提示层为通用响应通道。

04:00
arXiv cs.CV

视觉语言模型中视觉信息流的路径

研究视觉语言模型中视觉信息的两种路由路径:直接与文本中介,路径选择依赖任务且具有灵活性。

04:00
arXiv cs.CV

从通用动作到领域特定监测:基于骨架动作识别的先验自适应迁移

提出PATS框架,通过选择性保留相关先验实现高效迁移,在阿尔茨海默病及跌倒检测中性能提升。

04:00
arXiv cs.CV

LBTCap:用于实时遥感图像变化字幕的轻量级双边Transformer

LBTCap轻量双边Transformer,39.99M参数,实现实时遥感变化描述,准确率接近SOTA。

04:00
arXiv cs.CV

WorldBagel:揭示统一多模态模型在视觉-语言-动作-世界建模中的威力

WorldBagel统一框架在多任务机器人中优于专用模型,证明统一性是学习有效VLAW模型的关键。

04:00
arXiv cs.CV

超越后量化:使用专用HASH Token的原生哈希学习

提出HashViT,引入专用HASH令牌实现原生哈希学习,消除特征-代码差异,在三大基准上取得领先性能。

04:00
arXiv cs.CV

GrowFields:面向拓扑变化植物生长的组合式4D神经场

提出组合式4D神经场GrowFields,建模点云时序中植物生长,处理拓扑变化和异步器官发育,提升时空精度与形态保真。

04:00
arXiv cs.CV

存在但未被记住:审计冻结的VLA如何编码、部署和引导视觉历史

冻结VLA中历史信息与当前帧冗余,仅当前帧退化时使用;部署策略因架构而异,可引导性取决于如何使用历史,建议注入独特信息。

04:00
arXiv cs.CV

TemporalGS:基于时间先验的3D高斯泼溅渲染免训练即插即用加速

利用时间先验动态剔除和选择性渲染,实现3DGS免训练渲染加速,性能可比甚至优于现有方法。

04:00
arXiv cs.CV

品牌即记忆:视觉语言模型为新闻来源编码因果性且机制可定位的可信度先验

视觉语言模型基于来源品牌编码可定位的可信度先验,优先于内容证据,造成可靠性缺陷。

04:00
arXiv cs.CV

基于扩散模型的手写轨迹恢复

提出首个扩散模型框架,从离线图像恢复在线笔迹,精准重建多笔画字符,时序与形状保真度优于现有方法。