10831 条条目 · 106 个活跃源
2026年9月15日
04:00
arXiv cs.CV

利用图像-问题依赖性提升VLM测试时强化学习

TTIQ利用图像与问题依赖性构建奖励,引导VLM测试时强化学习,在八个VQA数据集各规模上均取得最佳表现。

04:00
arXiv cs.CV

月球遥感多模态多分辨率基础模型

提出月球遥感多模态多分辨率基础模型,基于近200万瓦片、11模态双尺度预训练,四任务超基线并开源。

04:00
arXiv cs.CV

医学图像分类中类间过渡不确定性的自适应共形重分配

提出AdaConRed,将共形预测集重分配为可操作单类决策,提升口腔癌和黑色素瘤等关键类别准确率。

04:00
arXiv cs.CV

经目标校验的视频问答可靠性分数优化

无需重训或改答案,利用目标校验精炼视频问答可靠性分数;HERBench与Perception Test上AURC平均降16.6%和18.9%。

04:00
arXiv cs.CV

基于时间可靠性抑制与组合图解码的可靠第一人称动作预测

提出TRS+RVG,抑制不可靠时序证据并重排动名组合,损坏下鲁棒性提升,稀有组合降至1.1%。

04:00
arXiv cs.CV

HGSQ:面向实时航拍小目标检测的热力图引导稀疏查询检测器

HGSQ以热力图预测引导稀疏查询与局部细化,并自适应调整解码预算,航拍小目标实时检测达高精度。

04:00
arXiv cs.CV

Multimodal Foundation Models Adaptation based on Domain-Aware Relaxed Orthogonal Subspace for Remote Sensing

04:00
arXiv cs.CV

ConeGaussian:面向通用中心相机的抗锯齿高斯光线追踪

各向异性像素足迹由相机逆向映射的相邻光线直接构建,可免修改适配多种中心相机与高斯光线渲染骨干,1/8分辨率下提升达4.3dB。

04:00
arXiv cs.CV

基于事件视觉与时间增强卷积脉冲神经网络的行人过街意图分类

将驾驶视频转为事件流,用CARLA增强,训练卷积脉冲网络分类行人过街意图,准确率达95.83%。

04:00
arXiv cs.CV

RIGOR:面向全景重建的机组感知几何

冻结前馈主干,将全景视频视为四视图虚拟机组,通过一致性检测与几何验证构建Sim(3)位姿图,校正漂移、提升重建精度。

04:00
arXiv cs.CV

迈向实用精准农业:嵌入式边缘硬件上的实时水果检测与视频分析

在Jetson边缘端实现实时水果检测、跟踪计数,TensorRT FP16高效,管线30 FPS无丢帧,性能受采集视角影响。

04:00
arXiv cs.CV

基于任务的CT协议优化:强化学习与虚拟成像试验

提出强化学习与虚拟成像试验的CT协议优化框架,仅评估约2%方案即恢复98.2%穷举最优,无仿真预筛达89.7%。

04:00
arXiv cs.CV

ProtoCAM:用于超声图像乳腺病变分类的可解释小样本掩膜引导原型学习

ProtoCAM融合掩膜引导特征与原型度量学习,小样本下乳腺超声分类F1达0.910,兼具可解释性。

04:00
arXiv cs.CV

从宣传的改进到实测能力:在伪造任务上评估 ChatGPT Images 2.5

实测ChatGPT Images 2.5伪造任务:宣传改进未带来目标字段正确性提升,细字与定位仍受限。

04:00
arXiv cs.CV

多模态遥感影像火星滑坡分割的全局-局部上下文渐进扩展网络

首次系统评估火星滑坡分割,提出融合渐进扩展与Transformer的U形网络,多模态数据上表现最佳。

04:00
arXiv cs.CV

YOLO12-MambaScan:一种融合高频增强与状态空间建模的高效目标检测器

融合高频增强卷积、坐标注意力与Mamba全局建模的YOLO12航拍小目标检测器,精度与效率兼顾。

04:00
arXiv cs.CV

Realtime-Venus:一种具备异步委托能力的全双工交互系统

提出全双工交互系统Realtime-Venus,双9B模型支持视听与语音,异步委托任务,多项基准领先。

04:00
arXiv cs.CV

MARC:面向亚细胞空间转录组细胞分割的形态学感知共识回归

MARC预测多方法共识支持图,免去多流程推断,Dice达0.90,助力大规模细胞分割评估。

04:00
arXiv cs.CV

Hyper-LLaVA:面向多模态持续指令微调的双曲不确定性感知模态平衡路由

提出Hyper-LLaVA,用双曲空间分布相似度增强模态内任务匹配,并按不确定性平衡跨模态路由。

04:00
arXiv cs.CV

面向共显著目标检测的秩一致性集合推理

提出RCSR框架,将图像组视为无序集合,用秩一致性与截尾统计聚合多尺度组槽,抑制偶然匹配,无需外部模型。

04:00
arXiv cs.CV

FFVO:面向长时序视觉里程计的前馈位姿解码器

FFVO以紧凑相机令牌、分层时序解码与轨迹监督,实现长时序视觉里程计稳定低漂移的位姿估计。

04:00
arXiv cs.CV

基于眼中心追踪与动态阈值的低成本实时驾驶员疲劳检测系统开发

利用摄像头非侵入式实时监测眼睛开闭,超时闭眼即判定疲劳并报警,低成本防事故。

04:00
arXiv cs.CV

MomentBA:面向可微光束法平差中各向异性对应不确定性的二阶空间矩

MomentBA从局部匹配响应的二阶空间矩导出各向异性协方差,融入可微光束法平差,提升单目视觉里程计精度与鲁棒性。

04:00
arXiv cs.CV

恢复真正重要之处:联合恢复与识别的启示

提出任务驱动的联合恢复-识别(JR²)范式:只恢复识别所需区域,提升性能,并跳过约70%干净帧降本。

04:00
arXiv cs.CV

StepPrune:跨多模态大语言模型的自适应序列化视觉Token选择

将视觉token剪枝建模为自适应序列决策,自动确定保留量,剪枝88.9%仍保94.6%性能,提速1.5倍。

04:00
arXiv cs.CV

GEAR:从动态编码到动态激活的社交轨迹预测

提出GEAR,在轨迹生成时动态激活个体与社会偏置,按未来步和密度调节社会线索,提升预测性能。

04:00
arXiv cs.CV

超越OCR准确率:图像退化下以文本为中心的VQA——模块化与端到端方法对比

退化图像下,微调模块化OCR流程准确率达57.5%,远超端到端基线,OCR错误率难测VQA表现。

04:00
arXiv cs.CV

面向3D点云的效用保持语义隐私保护

提出类别迁移式点云语义加密框架,隐藏原类别、保持任务效用并支持授权恢复。

04:00
arXiv cs.CV

DiVA:通过视频模型实现交互式数字生命模拟

DiVA用MLLM路由加堆叠视频管线,实现可长期交互的数字生命模拟,AVC转场防退化,效果领先。

04:00
arXiv cs.CV

TotalSynth:基于MRI和CBCT的稳健全身合成CT

TotalSynth是可复用预训练框架,用MRI和CBCT生成全身合成CT,性能稳健;外部数据需验证并可选微调。

04:00
arXiv cs.CV

使用深度学习的零样本跨材料叠层衍射相位重建

提出局部到全局学习框架,无需迭代即可零样本跨材料重建叠层衍射相位,指标最优,速度较ePIE快约十倍。

04:00
arXiv cs.CV

基于深度面部表情分析的真实场景事件级情绪识别

提出端到端事件级情绪识别流程:检测人脸、CNN分类表情并聚合概率,实验验证真实场景有效性。

04:00
arXiv cs.CV

BLInD:将驾驶意图学习为未来自车轨迹上的分布

仅凭车辆状态历史即可预测未来轨迹的多模态分布,无需感知输入,跨数据集通用,毫秒级推理,使AEB误报最多降25倍。

04:00
arXiv cs.CV

SGWIB:面向视频高光检测的切片Gromov-Wasserstein信息瓶颈

提出SGWIB信息瓶颈框架,以切片Gromov-Monge差距正则保留片段时序结构,并结合上下文解耦,在两数据集上取得最优高光检测性能。

04:00
arXiv cs.CV

SkyAnchor:从无位姿地面视角序列更新度量尺度航拍3D高斯场景

以航拍场景为固定支架,配准无位姿地面序列,插入地面高斯并联合优化,实现度量轨迹与高质量渲染。

04:00
arXiv cs.CV

面向地球基础模型的物理类型化与几何感知表示

探讨地球基础模型是否应显式保留物理类型与几何变换,先以ERA5分阶段证伪,检验实际增益。

04:00
arXiv cs.CV

Mind2Cloud:基于双粒度扩散解码的脑电到点云生成

双粒度扩散解码融合全局Transformer与局部PVCNN,随去噪时间步自适应调整粒度,由脑电生成点云,在EEG-3D数据集上刷新最优。

04:00
arXiv cs.CV

CirrGuide:基于T2加权MRI的肝硬化分割与严重程度分类深度级联框架

深度级联框架先分割肝硬化肝脏,再以预测掩膜为解剖先验引导分类,提升T2W MRI分割与轻中重度分级性能。

04:00
arXiv cs.CV

面向CT肝脏肿瘤分割的基础模型参数高效微调

PEFT微调SAM分割CT肝转移瘤:Conv-Adapter/LoRA最准,DiSCo参数效率最高。

04:00
arXiv cs.CV

量子门控 LiteSSD:一种参数高效的前视声呐目标检测轻量级量子-经典混合框架

提出量子门控LiteSSD,将量子多电路处理改写为通道门控,以极少参数实现前视声呐高精度检测。

04:00
arXiv cs.CV

适配开放权重多模态大语言模型以生成电子显微镜分割点提示

MLLM经适配可从自然语言生成电镜点提示;Qwen3-VL AP50达0.736,且能跨数据集迁移。

04:00
arXiv cs.CV

LPA-CWM:一种基于反事实世界模型运动推理的学习型物理裁判器

LPA-CWM用3M参数学习型裁判器学习候选响应可靠性权重,改进反事实世界模型的运动推理。

04:00
arXiv cs.CV

RA-CoA:基于检索增强属性链的免训练时尚图像描述生成

免训练框架RA-CoA以检索属性集+属性级推理提升时尚图像描述精度,METEOR涨26.3%。

04:00
arXiv cs.CV

弥合合成-真实域差距的少样本冷冻电子断层扫描分类

提出可学习变换模块的合成到真实适应框架,在输入与特征层面弥合域差距,少样本分类超越现有迁移学习基线。

04:00
arXiv cs.CV

面向各向异性纹理分析的PyRadiomics体素间距感知扩展

为PyRadiomics添加体素间距感知扩展,无需插值即可分析各向异性纹理,与原版兼容。

04:00
arXiv cs.CV

不依赖网格特征系统加速 HKTex:局部展开与随机化热特征

用局部展开与随机化热特征替代 HKTex 全局特征分解,提高精度并大幅加速,支持超大网格。

04:00
arXiv cs.CV

在对我说话还是对别人说话?重新思考第一视角视频中的"对我说话"检测

将TTM重构为在线帧级预测,构建90万帧数据集,多模态模型F1达75.5%。

04:00
arXiv cs.CV

基于三维步态的孤独症分类:注意力增强深度学习与跨折统计稳定性分析

提出注意力增强Transformer框架,基于三维步态特征分类自闭症,两数据集五折交叉验证准确率达99%与95%,并评估跨折稳定性。

04:00
arXiv cs.CV

SignMimic:基于人体形状无关姿态迁移引导的鲁棒高质量手语动作生成

SignMimic通过刚性规范化、非刚性适配与姿态补全,实现鲁棒高质量手语视频生成,在多数据集达SOTA。

04:00
arXiv cs.CV

双向路由与稀疏空间注意力驱动的多视角BEV 3D目标检测及其在自动驾驶中的应用

提出Sparse-BEVNet,融合双向路由与稀疏空间注意力,提升BEV 3D检测性能。