10971 条条目 · 106 个活跃源
2026年8月24日
04:00
arXiv cs.CV

通过高效的片段到视频监督增强长视频理解中的局部推理

提出片段到视频监督方法,用片段级问答训练长视频推理,仅需简单奖励和单次前向,提升准确率与效率。

04:00
arXiv cs.CV

TRACE:训练时报告引导与临床有序概念编辑

提出训练时报告引导的临床有序概念编辑框架,利用报告监督、测试仅需图像,解决标注不全,性能与鲁棒性领先。

04:00
arXiv cs.CV

RDANet:用于红外小目标检测的相对退化感知网络

提出RDANet,含多尺度抗混叠下采样与原型引导跳跃记忆模块,提升跨尺度与背景变化的检测鲁棒性,性能领先。

04:00
arXiv cs.CV

识别、定位、关联:文档图像的端到端键值提取

提出256M参数VLM端到端提取文档键值对,无需OCR,性能超越更大模型且更快。

04:00
arXiv cs.CV

LoRC: Detecting AI-Generated Images via Low-Rank Collapse in Semantic Residuals

04:00
arXiv cs.CV

CertVLA: Certified Defense against Physical Visual Attacks for Vision-Language-Action Models

04:00
arXiv cs.CV

面向自动驾驶的具有语义属性的多模态交通标志检测

融合相机与激光雷达,提出变形融合与双运动模型,实现跨区域长距离交通标志检测,失检率0.49%。

04:00
arXiv cs.CV

打破高置信度:高安全阈值下的实用人脸冒充攻击

首个高安全阈值下人脸识别系统的实用冒充攻击,仅百次查询即达92%以上成功率。

04:00
arXiv cs.CV

先路由后观察:面向长视频理解的查询自适应证据获取

提出Route2Look框架,通过查询自适应路由策略动态选择证据获取工具,实现长视频理解SOTA性能并保持帧效率。

04:00
arXiv cs.CV

多模态协同交互的VLA端到端自动驾驶

提出VLA端到端自动驾驶系统,通过多模态交互与多轨迹规划优化,提升长尾场景下驾驶推理的安全性与可解释性。

04:00
arXiv cs.CV

EmotionDialogCN: A Spontaneous Multimodal Dataset for Mandarin Emotional Dialogue

04:00
arXiv cs.CV

结合特征鲁棒增强与证据支撑解释优化的可解释深度伪造检测

提出特征鲁棒增强与证据偏好优化,提升低质量下的检测鲁棒性并生成可解释证据,获ACM MM 2026挑战赛第一。

04:00
arXiv cs.CV

InfinityEdit:基于轻量编辑触发适配器的无限视频编辑

针对开放视频流的无限编辑,提出轻量适配器,仅在编辑到达时激活,实现稳定延续与生成。

04:00
arXiv cs.CV

OccluRank:仅添加序数秩即可实现可控遮挡感知的布局到图像生成

提出OccluRank,为边界框加序数秩编码遮挡顺序,借助排序感知交互模块,在合成数据集上训练,更可靠地生成符合指定遮挡关系的图像。

04:00
arXiv cs.CV

GAP-SAM:用于可泛化AI生成图像篡改定位的全局伪影先验

提出GAP-SAM全局伪影先验,注入SAM3调制解码,提升篡改定位泛化,Pixel-F1领先12.6

04:00
arXiv cs.CV

LHMCF-Net:用于医学图像分割的学习型双曲平均曲率流网络

提出LHMCF-Net,基于双曲平均曲率流的深度展开网络,用于医学图像分割,以惯性机制应对低对比度和模糊边界,性能领先。

04:00
arXiv cs.CV

SuppreSensing:专家引导的特征重校准与差异增强用于多模态目标检测

提出SuppreSensing,通过专家驱动的特征重校准与差异增强,解决多模态遥感检测的异质性与噪声干扰,在多个数据集上达到最优性能。

04:00
arXiv cs.CV

面向模式对齐的运动学知识图谱:多模态步态分析中的结构化潜在表征学习

提出ScoliDetect框架,以运动学知识图谱融合多模态步态,外部AUC达0.972,且可解释。

04:00
arXiv cs.CV

基于视觉基础模型的跨域目标检测语义兼容知识蒸馏

提出语义兼容知识蒸馏框架SLE-T,解决跨域目标检测中师生特征空间尺度失配,用轻量适配器提升性能,节省资源。

04:00
arXiv cs.CV

MigrationNarrate:用于检测YouTube视频中移民叙事的数据集

首个英国移民叙事多模态数据集,含1115个YouTube转录本,12类超级叙事及53个标签,并提供基准测试。

04:00
arXiv cs.CV

潜在有序证据与输出错位:多模态大语言模型的推理时有序透镜对齐

多模态大模型隐状态含序数信息但输出错位;OLA推理时对齐序数透镜,提升序数回归,全面超越基线。

04:00
arXiv cs.CV

自主位姿估计中几何扰动的鲁棒验证

采用全局利普希茨优化验证位姿估计鲁棒性,可发现关键失效并削减超80%搜索空间。

04:00
arXiv cs.CV

手背图像用于沉浸式(XR)和隐私保护的年龄保证与儿童安全

提出用XR头显自带摄像头拍摄手背进行年龄验证,实验显示可零未成年人漏入,兼顾隐私与沉浸。

04:00
arXiv cs.CV

结合渐进非凸性的无三角化光束法平差:从粗略先验精化相机位姿

无需三角化的光束法平差,以射线深度表示结构,采用渐进非凸性,从粗先验精化相机位姿,鲁棒高效。

04:00
arXiv cs.CV

识别条件推理:无需训练的多模态LLM流水线实现细粒度微动作理解

提出免训练纯提示系统,动态路由子任务至判别或生成多模态大模型,在MAC 2026微动作挑战赛获第一,开放任务得分2.68远超次优1.44。

04:00
arXiv cs.CV

WA-JEPA:重新思考用于自动驾驶世界-动作建模的视频JEPA范式

WA-JEPA重构视频JEPA,用未来掩码与条件流匹配联合预测未来场景与动作,实现自动驾驶规划领先

04:00
arXiv cs.CV

CoST:基于时空对齐的语义感知城市理解

提出CoST时空对齐框架,捕捉跨区域地理规律,增强城市语义理解,性能平均提升8.7%。

04:00
arXiv cs.CV

CoAnchor:基于对象级锚点的时空错位鲁棒协同感知

提出CoAnchor,用稀疏对象级锚点统一修正空间与时间错位,应对通信延迟和位姿噪声,鲁棒且轻量。

04:00
arXiv cs.CV

COMET:面向视频多模态大语言模型的对比运动增强时序推理

提出COMET:显式时序表示、外观运动融合、方向感知优化,增强视频大模型运动时序推理,动作时序提升,静态持平。

04:00
arXiv cs.CV

基于高斯混合潜流的随机3D人体运动预测

提出带高斯混合先验的潜流模型,提升预测准确性与合理性,并实现不确定性量化,在Human3.6M和AMASS上达到最优。

04:00
arXiv cs.CV

AT-ViT:面向植物标本图像性状识别的区域目标多视图视觉Transformer,结合交叉注意力与多尺度分块

提出AT-ViT双分支ViT,用掩码引导分块加权与交叉注意力聚焦植物区域,提升性状识别精度和鲁棒性。

04:00
arXiv cs.CV

Human-JEPA:一种以人为中心的视觉模型,感知并预测未来

Human-JEPA以视频训练,通过锚定预测防止表征崩溃,参数减少2.7倍仍在姿态与重识别上领先,且预测头不退化。

04:00
arXiv cs.CV

A2DINOv3:基于社会化协作重新思考多模态目标检测

提出A2DINOv3多专家协作框架,通过选择性交互避免模态干扰,零初始化平滑融合,多个基准达最优。

04:00
arXiv cs.CV

CIVA:基于评论家诱导的值子空间攻击视觉世界模型智能体

提出CIVA攻击,利用评论家诱导的低维值子空间,对世界模型智能体进行高效时序一致的在线攻击。

04:00
arXiv cs.CV

手工知识与学习表征融合何时值得?一种成本归一化的堆叠、替代与干扰基准

手工知识与学习表征的融合:叠加于自监督、替代于高效预训练、干扰于迁移;冻结特征增益可预测端到端收益。

04:00
arXiv cs.CV

仅遮罩不够:医学AI多模态去标识化的生成式修复

提出ClinX框架,结合OCR遮罩与生成式修复抑制图像PHI,并分层净化文本,在MedVQA中兼顾隐私与效用,证明修复优于单纯遮罩。

04:00
arXiv cs.CV

Llama-Mobile:视觉语言模型的高效2.7位量化

提出VLM量化框架,用模型自生成数据,2.7位格式支持Arm CPU,将Llama 3.2 11B压缩至3.7GB,保持VQA性能。

04:00
arXiv cs.CV

模块化智能体:可靠且可审计的CT扫描空间关系验证

提出模块化医学影像智能体,分阶段完成CT轴向切片空间关系验证,准确率94.1%,远超端到端模型42.5个百分点。

04:00
arXiv cs.CV

Stream3Dv2:几何-语义融合增强的流式零样本3D场景理解

提出Stream3Dv2无训练框架,融合几何语义与流形距离优化,实现鲁棒流式零样本3D场景理解,性能超基线。

04:00
arXiv cs.CV

视觉提示就够了吗?渐进式视觉支架下的VLM空间推理研究

引入轻量视觉支架可显著提升VLM空间推理准确率,最高增34个百分点,并弥补GRPO训练局限,证明视觉呈现方式决定基准测试测的是感知还是推理。

04:00
arXiv cs.CV

VLM答案不是异常分数:无训练视频异常检测中的排名压缩

无训练视频异常检测中,概率读出优于生成读出,因生成读出导致排名压缩,平均提升5-13点。

04:00
arXiv cs.CV

面向残余听力损失的研究:新型耳蜗OCT数据集中纤维化的量化

本研究用深度学习分割耳蜗OCT图像,量化植入物所致纤维化,改进UNET模型效果最佳,可可靠评估纤维化负担。

04:00
arXiv cs.CV

掩码外锚定指令:高效上下文扩散变换器的精确参考缓存

提出掩码外锚定指令与精确参考缓存,用在线蒸馏恢复质量,多参考编辑保持质量并加速3.9倍以上。

04:00
arXiv cs.CV

视觉-语言-行动模型中令牌压缩的恰可察觉差异建模

提出动作恰可察觉差异模型,以语言条件动作响应界定令牌可容忍变化,提升VLA模型压缩可靠性。

04:00
arXiv cs.CV

ES-VP:能量塑形动态视觉提示实现高效模型适配

提出ES-VP,用低秩初始化与能量引导动态生成图像专属提示,参数更少、性能超越SOTA。

04:00
arXiv cs.CV

跨田地分布偏移下农业杂草检测的可迁移性研究

跨作物杂草检测迁移:少样本微调(25标注)优于无监督域适应,可减少标注需求。

04:00
arXiv cs.CV

当适应适得其反:MedSAM微调中的表示漂移与分布外失败

MedSAM微调提升域内和近分布外性能,但降低远分布外表现;解码器漂移致退化,编码器LoRA最稳健,提示抖动增强鲁棒性。

04:00
arXiv cs.CV

条件流匹配的难度校准插值路径

提出难度校准流匹配,从模型自身损失导出插值调度,提升采样质量,在少更新大批量场景下表现最佳。

04:00
arXiv cs.CV

WildFin:野外鱼类行为识别数据集

该数据集用于鱼类行为识别,含静态监控与动态跟拍,经大量标注生成9小时数据,揭示模型与真实水下分析的差距。

04:00
arXiv cs.CV

冻结CLIP先验用于鲁棒自监督泊松逆问题

提出ADMM展开求解器,冻结CLIP特征作先验,轻量解码器适配,实现自监督泊松逆问题重建,鲁棒且性能媲美监督。