11001 条条目 · 106 个活跃源
2026年8月19日
04:00
arXiv cs.CV

视觉-语言-动作驾驶模型的推理时注意力引导

在驾驶模型推理时对视觉词元施加有界注意力偏置,无需重训即可将轨迹引向关注目标,层数越多效果越强。

04:00
arXiv cs.CV

第十届AI城市挑战赛

第十届AI城市挑战赛:325队、26国,六大轨道覆盖多摄像头感知、交通异常推理、生成预测等。

04:00
arXiv cs.CV

CAS-FD:用于单视角犯规与假摔识别的接触感知时间采样

提出接触感知时间采样方法,用于单视角犯规与假摔识别,新数据集上准确率86%,较无接触感知提升12个百分点。

04:00
arXiv cs.CV

PXDepth: 面向结构保持的单目深度估计的像素空间建模

提出PXDepth,分离全局上下文与像素级预测,保留细粒度结构和清晰边界,零样本下兼具局部精度与全局准确性。

04:00
arXiv cs.CV

OV3D-Bench:面向开放词汇单目三维检测的诊断基准

提出OV3D-Bench诊断基准,解耦定位与语义,发现几何定位成熟,开放词汇语义仍是瓶颈。

04:00
arXiv cs.CV

YILDIZ-VPR:面向视觉地点识别、覆盖密集且环境条件多样的新数据集

新数据集YILDIZ-VPR,步行采集校园多季节天气场景,含GPS等传感器,支持视觉地点识别研究。

04:00
arXiv cs.CV

基于区域级组织推理与非平衡最优传输的淋巴细胞拟态校正

提出区域级组织推理与非平衡最优传输的淋巴细胞拟态校正法,蒸馏轻量分类器,在乳腺癌数据上优于全监督。

04:00
arXiv cs.CV

AerialYield-B2D:温室蓝莓数据集,含五阶段成熟度掩膜与果实计数

提出温室蓝莓数据集,含514张图像、30195个实例,提供五阶段成熟度掩膜与果实计数。

04:00
arXiv cs.CV

PROBE:基于操作锚定的视觉问答与VLM智能体

提出MG-VQA任务与PROBE基准,智能体方法优于感知,微调PROBE-Agent提升并实现虚实迁移。

04:00
arXiv cs.CV

学会不学什么:面向鲁棒视觉语言模型的对抗解耦提示调优

ADAPT通过双提示机制解耦伪鲁棒特征与鲁棒特征,缓解鲁棒泛化过拟合,提升未见类鲁棒性。

04:00
arXiv cs.CV

面向多参数MRI肿瘤分类的异质性感知深度学习

提出HA-DLC框架,用聚类和跨患者对齐建模肿瘤异质性,以双流特征提取提升多参数MRI肿瘤分类,优于现有方法。

04:00
arXiv cs.CV

掩蔽关键:面向自动驾驶的显著性引导视频自监督学习

提出V-JEPA4A,用显著性驱动掩蔽预训练驾驶视频,提升表征,在追踪、分割、深度上超越随机掩蔽,仅增14%开销。

04:00
arXiv cs.CV

飓风后航空影像的碎屑体积快速估算

提出分割条件单目高度网络,从单次飓风后航拍影像估算碎屑体积,无需激光雷达与地面数据,精度优于参数预报。

04:00
arXiv cs.CV

结构平面图到模型转换:确定性几何与受控智能体视觉语言精化

提出首个无需任务训练的结构平面图转有限元模型框架,结合确定性几何与受控智能体视觉语言精化,精度高。

04:00
arXiv cs.CV

基于SAM3的关键帧推理:第八届LSVOS挑战赛MeViS-Text赛道第三名解决方案

无训练两阶段:Gemini选关键帧,SAM3生成并传播掩码,获MeViS-Text第三名。

04:00
arXiv cs.CV

学习双平面X射线至CT重建中的位置与内容提升

提出新型框架,先重建三维解剖布局再生成CT,以布局反馈校准密度,双平面X光重建CT达最优。

04:00
arXiv cs.CV

UniQuery4R:基于单一查询的统一4D场景重建

提出查询条件式4D重建框架,一次编码多帧,查询联合预测对应、3D位置与场景流,在WorldTrack上最优。

04:00
arXiv cs.CV

基于轨迹状态扰动探测关联不稳定性:查询传播多目标跟踪中的片段级主动学习

提出QPID,用轨迹状态扰动探测关联不稳定性,按多样性选代表片段,用于查询传播多目标跟踪的片段级主动学习。

04:00
arXiv cs.CV

B样条嵌入结构学习用于3D牙齿分割

提出B样条嵌入结构学习,利用连续结构约束与动态分类器,提升3D牙齿分割精度,达新最优。

04:00
arXiv cs.CV

面向开放世界人脸反欺骗的基元驱动组合式取证视觉提示

提出组合式取证视觉提示框架,在视觉特征空间组合微取证基元,适应开放世界人脸反欺骗,性能最优。

04:00
arXiv cs.CV

基于滚动快门视频的扫描线感知可动画高斯化身

该法逐扫描线合成替代模糊平均,从滚动快门视频重建清晰无畸变可动画高斯化身,新视角合成优于基准。

04:00
arXiv cs.CV

如果,那么,否则:视觉-语言导航中的条件分支诊断

提出CondVLN基准,诊断视觉-语言导航中的条件分支,揭示智能体选错分支,神经符号模型使性能提升2倍。

04:00
arXiv cs.CV

MoE-ViE:高效图像与视频理解的专家混合视觉编码器

MoE视觉编码器,细粒度专家优于密集,无辅助损失平衡,帧级蒸馏增强视频,最大以76%延迟匹敌1.7倍SOTA。

04:00
arXiv cs.CV

从子宫组织病理学空间异质性中学习潜在进展状态

SpaTIE框架从子宫病理空间异质性学习形态表征,推断肿瘤进展状态,并与多组学及预后关联。

04:00
arXiv cs.CV

GeoWeaver:基于分层几何装配的精确长序列三维重建

提出GeoWeaver框架,结合几何先验与测试时自适应,通过分块处理及全局对齐细化,提升长序列三维重建的精度与全局一致性。

04:00
arXiv cs.CV

连续性驱动的工业缺陷检测表示学习

提出连续性正则化框架,利用正常区域密集监督提升缺陷检测,小数据下最高提升21个百分点。

04:00
arXiv cs.CV

中文标题:带同步重置的噪声群体神经元用于高性能脉冲神经网络

中文摘要:提出噪声群体神经元模型,结合群体同步重置与神经随机性及平均场反向传播,解决时空信息丢失和梯度失配,在多个数据集上实现高性能,CIFAR10-DVS准确率87.35%。

04:00
arXiv cs.CV

去云还是不去云:阴天水体分割中原始SAR与合成NDWI的比较分析与融合

合成NDWI优于原始SAR,融合二者可提升阴天水体分割精度。

04:00
arXiv cs.CV

MS-MFAD:多模态大语言模型用于人脸防欺骗检测

提出多模态大模型人脸防欺骗,像素-语义锚定实现可解释推理,少量标注降ACER40-50%,跨域性能优。

04:00
arXiv cs.CV

REChart:基于大型推理模型的推理高效图表编辑

REChart两阶段训练,过程监督+双奖励,减少过度思考,提升图表编辑,推理令牌减79%。

04:00
arXiv cs.CV

S³AM:一种用于多模态显著目标检测的带可靠性校准频率适配器的单流SAM

提出单流SAM,用可靠性校准频率适配器控制多模态特征注入,仅12.20M可训练参数即达竞争性能。

04:00
arXiv cs.CV

谱梯度正交化提升大规模差分隐私训练性能

谱梯度正交化利用极分解去噪,在大批量高信噪比下显著提升DP-SGD准确率,最多提高20.9%,并降低方差。

04:00
arXiv cs.CV

TEAMS:文本提示的时空双头曼巴蛇

提出TEAMS文本提示时空双头Mamba蛇框架,增强轮廓分割,多个数据集上优于现有方法。

04:00
arXiv cs.CV

SPVC:跨数据集驾驶场景渲染的结构化与全景视频修复

提出结构化与全景视频修复框架,利用空间条件和时序线索,跨数据集修复驾驶场景背景与前景的模糊、闪烁及错位。

04:00
arXiv cs.CV

SemComp-Bench:视频生成中语义任务完成的基准评测

提出面向结果的视频生成语义任务完成基准,含六领域数据集与视觉语言模型评估协议,评测达成意图与语义关联。

04:00
arXiv cs.CV

TF-CADE:面向零样本时间动作检测的前景集中文本-视频对齐

提出TF-CADE前景集中对齐与置信度重加权,解决零样本动作检测类别易混,性能SOTA。

04:00
arXiv cs.CV

反事实解剖引导的时空解码用于医学VLM免标注幻觉缓解

提出CAST,推理时用反事实干预选解剖区域,时空对比解码,免标注缓解医学VLM幻觉,优于基线。

04:00
arXiv cs.CV

GSToken:用于紧凑三维医学图像表示的几何结构化高斯令牌

提出高斯令牌用于多模态脑瘤分割,显式编码3D几何,冻结探测证明其信息密度显著优于基线。

04:00
arXiv cs.CV

NGS-Marker:面向3D高斯泼溅的鲁棒原生水印

提出原生水印框架NGS-Marker,通过渐进注入实现全场景覆盖,抵御局部提取侵权,支持混合与多模态保护。

04:00
arXiv cs.CV

利用现有稀疏点标注实现海底影像密集分割

利用历史稀疏点标注作为SAM2提示,自动筛选可靠点生成伪标签,训练高精度分割模型,推动海底生态监测规模化。

04:00
arXiv cs.CV

更多基础模型反而更少:诊断与解决多视图融合失败

融合更多编码器性能未必上升,KAGES基于核对齐贪心选择,优于全融合,平均AULC提升至5.8点。

04:00
arXiv cs.CV

SE-MoLoRA:面向领域特定摄影评估的共享专家LoRA适配器

提出SE-MoLoRA模块化适配框架,分离通用与专业摄影知识,路由选择专家,正交正则解耦,评分提升显著。

04:00
arXiv cs.CV

NeuroPath:脑启发的双通路图卷积网络用于骨架动作识别

提出双通路图卷积网络,分离时空建模,动态融合互补信息,提升骨架动作识别精度。

04:00
arXiv cs.CV

超越评分量表:手术技能模型能否跨评估标准学习可迁移表征?

跨评分标准迁移不对称:JIGSAWS→LASANA有效,反向失败;任务头主导预测,骨干只需时空特征。

04:00
arXiv cs.CV

GroupForward:通过实例分组的前馈高斯泼溅构建可指涉的三维场景

提出实例分组的前馈高斯泼溅模型,从稀疏无位姿多视图像重建几何、外观、实例与语义,并构建可指涉场景推理框架,实现复杂三维指涉分割。

04:00
arXiv cs.CV

基于可解释AI的白内障手术视频技能评估框架

提出可解释AI框架,利用2000个手术视频自动评估白内障技能,与专家评分相关性达87%。

04:00
arXiv cs.CV

BrainNorm:通过语义图谱预训练识别常态的基础模型

该模型基于六万六千例脑扫描预训练学习语义图谱常态空间年龄估计与多疾病分类超越基线偏差符合临床病理

04:00
arXiv cs.CV

MSEditor:迈向一致的多镜头视频编辑

提出MSEditor,首个一致多镜头视频编辑框架,用多视角数据监督与跨镜头信息聚合,保持身份与时间连贯。

04:00
arXiv cs.CV

代码即表示:学术文档的可编译解析范式

提出CADP,用可编译LaTeX+Python重构页面;引入基准,显示现有模型难生成高保真可执行结果。

04:00
arXiv cs.CV

新概念必须从何处进入:统一多模态模型中的入口点门控跨任务可用性

跨任务可用性由概念绑定进入共享计算的入口点决定;中层对齐目标以极小代价获取新概念。