10732 条条目 · 106 个活跃源
2026年9月29日
04:00
arXiv cs.CV

外科基础模型揭示标签效率的任务依赖性

SURGE外科基础模型基于3000万帧预训练,标签效率因任务而异:场景理解易饱和,细粒度推理需更多标注。

04:00
arXiv cs.CV

CaptchaArena:面向交互式验证码的计算机使用智能体训练用大规模细粒度数据集

首个交互式验证码大规模细粒度数据集,含5万题、20类、5种交互模式及轨迹与推理标注,训得9B智能体达71.7分。

04:00
arXiv cs.CV

使用混合量子机器学习的人脸分类

8量子比特混合量子分类器用于人脸识别,CPU上准确率与训练效率超FaceNet,推理0.2–0.5秒。

04:00
arXiv cs.CV

视觉语言预训练粒度重要吗?跨胸部X光解读任务的视觉语言目标受控评估

固定编码器与数据比较九种目标,发现预训练粒度与任务粒度在极端处对齐,无单一目标普适最优。

04:00
arXiv cs.CV

TriO:面向万物感知的三模态无监督占用世界模型

三模态自监督世界模型,无需标注,预测4D占用、分割与流,零样本道路障碍分割达SOTA。

04:00
arXiv cs.CV

媒介可见性的双刃剑:视觉框架如何削弱女国会议员的胜任力感知

视觉框架影响女国会议员胜任力:分屏降低其胜任力,愤怒语言更损温暖,单独出镜或提升女性观众政治效能。

04:00
arXiv cs.CV

面向视觉指针式仪表读数的类型均衡联邦学习

提出类型均衡联邦框架,多站点不共享原图协同训练,四阶段完成指针表读数,并发布MeterFL数据集。

04:00
arXiv cs.CV

CueKFS:面向长视频理解的智能体线索驱动关键帧选择

免训练CueKFS将问题与帧匹配转为动态视觉线索比较,智能体修订线索重探索视频,多基准长视频问答达最优。

04:00
arXiv cs.CV

长尾人体数据整理的质量过滤器审计

低姿态工人稀少,更常被质量过滤剔除和检测器漏检,长尾人体数据整理不宜依赖边界框或姿态。

04:00
arXiv cs.CV

基于强化学习增强胸片报告生成中的视觉推理

提出整合解剖区域和事实奖励的强化学习框架,提升胸片报告生成的视觉推理与可解释性。

04:00
arXiv cs.CV

PredRA:通过确定性成分提取与受控随机细化实现快速医学图像转换

PredRA以确定性预测为参考,受控随机细化残差,参数更少、采样更快地实现高保真医学图像转换。

04:00
arXiv cs.CV

ScreenHaystack:在GUI元素定位中寻找盲区

提出ScreenHaystack基准,发现主流GUI定位模型存在空间盲区且可迁移至未见样本;盲区源于训练数据覆盖不均,盲区导向增强可提升精度。

04:00
arXiv cs.CV

ControlGS:面向下游处理感知的XR渲染的神经高斯条件化

将XR渲染到人眼间的下游处理纳入优化,按运行时参数动态生成高斯原语,端到端提升XR画质且开销极小。

04:00
arXiv cs.CV

Depth Any Seen:哪些表面,距离多远?

Depth Any Seen用多伯努利深度集与ExactMB,联合估计可见表面及度量深度,显著减少过预测。

04:00
arXiv cs.CV

ReFM:面向运动重定向的语义感知细化流模型

ReFM将跨骨骼运动重定向转为渐进细化流,以对比学习语义引导,兼顾语义保真与物理合理。

04:00
arXiv cs.CV

设计性失忆,因必要而记忆:面向文档智能的持久状态

文档AI无状态,无法跨文档、会话和时间积累证据与经验;综述提出持久证据状态框架及纵向评测。

04:00
arXiv cs.CV

通过参数域密钥嵌入的高斯图像隐写

将8位信息嵌入二维高斯参数而非像素,密钥选参微调,正确密钥无误恢复,错误密钥近随机,视觉损失小,迁移至自然图像。

04:00
arXiv cs.CV

OneFixer:面向驾驶场景的高质量且一致的单步自回归3DGS细化

OneFixer以单步自回归扩散修复驾驶场景3DGS,实现高质量、时序一致、低延迟,闭环碰撞率降三分之一。

04:00
arXiv cs.CV

CausalDriveBench:评估自动驾驶视觉-语言-动作模型的因果推理

提出CausalDriveBench,评估驾驶VLA因果推理,最佳准确率70.6%,推理与轨迹预测不相关。

04:00
arXiv cs.CV

PQR3D:面向多视图3D目标检测、基于参考条件时序窗口的渐进式查询细化

在参考条件时序窗内渐进细化查询,支持随机帧采样与独立推理;在nuScenes上达71.6 NDS、64.9 mAP。

04:00
arXiv cs.CV

PruneForget:视觉模型的联合遗忘与剪枝

PruneForget以遗忘集指导剪枝,联合遗忘与剪枝;在图像分类与生成模型上降推理成本,性能近重训后剪枝。

04:00
arXiv cs.CV

双耳视听实例分割

提出双耳视听实例分割任务,利用双耳空间线索分割发声实例,构建两个基准并提出模型,显著优于单耳方法。

04:00
arXiv cs.CV

面向原始3D点云的保几何盲水印

提出基于八叉树的盲水印框架,直接在xyz坐标嵌入提取,无需原始点云,抗重采样与位姿变化且失真低。

04:00
arXiv cs.CV

面向高分辨率植物成像稠密表征迁移的可扩展域内自监督基础模型

千万级植物图像上自监督预训练ViT掩码自编码器,稠密预测Dice达0.8686,优于自然图像基线。

04:00
arXiv cs.CV

污染、先验还是证据?分解并训练全切片视觉语言模型中的证据使用

提出CleanSlide基准与Pair-DPO,剥离污染和先验,显著提升全切片病理模型对图像证据的利用与外部性能。

04:00
arXiv cs.CV

KeyRec:面向流式与长视频理解的有界视觉记忆

免训练KeyRec以有界视觉记忆压缩流式长视频,仅10%token,15项中13项最佳。

04:00
arXiv cs.CV

评估单组学与多组学可解释人工智能(MOXAI)用于成人型弥漫性胶质瘤分子亚类分类

MOXAI整合甲基化与拷贝数,分类成人型弥漫性胶质瘤分子亚型,多模态准确率达92.98%,可解释关键位点。

04:00
arXiv cs.CV

Devol-ONE:单一自回归Transformer混合架构,统一视觉-语言-动作与潜在世界建模

混合Transformer框架统一视觉语言理解、潜在动态预测与动作生成,动作受语义与动力学共同塑造。

04:00
arXiv cs.CV

基于核的 CLIP 引导:融入视觉语言模型偏好

提出核引导方法,将视觉语言模型偏好迁移至 CLIP,无需教师嵌入或人工标注,提升检索并保持识别能力。

04:00
arXiv cs.CV

面向无线边缘大规模场景重建的联邦3D高斯泼溅

提出资源高效的联邦3D高斯泼溅框架,结合设备端剪枝轻量化与模型恢复,在无线边缘实现大规模场景重建。

04:00
arXiv cs.CV

出现不等于忠实:文本到图像生成中的喻体入侵

文生图中存在喻体入侵:喻体被误绘为可见物且跨语言持续;提出诊断基准、评分与缓解法。

04:00
arXiv cs.CV

RoboSTAR:面向人形机器人的下一尺度自回归手语翻译

RoboSTAR:文本驱动手语生成框架,以部位量化与下一尺度自回归由粗到细并行生成身体与手部动作,可重定向至人形机器人执行。

04:00
arXiv cs.CV

FSS-UBrain:多区域小样本脑肿瘤MRI分割

提出区域式单样本脑肿瘤MRI分割框架,在BraTS上对WT、TC、ET取得高Dice和低HD95。

04:00
arXiv cs.CV

OpenMASC:用于加速MRI中跨轨迹金属感知采样与校正的开源流程

开源流程OpenMASC:生成配对金属伪影MRI数据,校正网络与强化学习联合优化采样,适配多轨迹。

04:00
arXiv cs.CV

FoundDSR: A Generalizable Foundation Model with Guided 2D Gaussian Splatting for Depth Super-Resolution

04:00
arXiv cs.CV

基于重嵌入网络的两阶段多视角步态识别

提出TFTR两阶段框架:孪生网络提取视角嵌入,Transformer重嵌入灵活融合多视角,两数据集准确率领先。

04:00
arXiv cs.CV

HeroFrame-Bench:基于评分标准–排序协同演化的参考锚定评测,用于电影主视觉帧选择

构建HeroFrame-Bench,以参考锚定百分位与评分标准–排序协同演化评测电影主视觉帧选择,人机一致率升至83.78%。

04:00
arXiv cs.CV

流动中的骨架:面向人体运动预测的图结构流匹配

提出图结构流匹配,以时空骨架图与条件速度场生成未来运动并保持骨骼约束,AMASS验证且跨骨架泛化。

04:00
arXiv cs.CV

一次感知,全部机动:面向机动级信号意图预测的方向性交通信号理解

提出方向性交通信号理解任务,从前视图预测直行、左转、右转、掉头各信号的通行性,方向级建模更优。

04:00
arXiv cs.CV

面向多模态大模型区域到全局迁移的渐进视图在线策略蒸馏

提出渐进视图在线策略蒸馏,以填充裁剪为过渡,将学生视图由局部迁移至全图并加权监督,多任务平均准确率达77.51%。

04:00
arXiv cs.CV

SGA-Flow-GRPO:面向Flow-GRPO的空间梯度引导信用分配

提出空间梯度引导的信用分配框架,用奖励梯度构建连续空间信用图,辅以MAD鲁棒归一化,在GenEval上达SOTA对齐质量。

04:00
arXiv cs.CV

RefCompose:基于LoRA条件扩散的多参考图像生成

RefCompose用固定参考画布与双流LoRA解耦布局和外观,实现恒定显存的多参考图像生成。

04:00
arXiv cs.CV

更少词元,更多自教:面向极端视觉词元削减的在线策略自蒸馏

提出LT-OPD:全词元教师对学生自生成轨迹做在线自蒸馏,配预算课程,5%词元下性能升至82.3%。

04:00
arXiv cs.CV

EyeVQA:从识别到空间定位的眼科视觉语言模型基准评测

EyeVQA整合21个眼科数据集,含2万问答、六病七题型,44.5%需跨图推理;14个VLM最佳仅62.8分。

04:00
arXiv cs.CV

Endo-TSR:面向内窥镜重建的外观与运动时域谱建模

提出Endo-TSR,用有界傅里叶颜色残差和平移残差建模时序外观与运动,配Matérn谱先验,内窥镜重建质量最优。

04:00
arXiv cs.CV

基于凸包自适应偏移的骨架动作识别去偏

提出凸包自适应偏移归一化CHASE,减轻骨架实体偏置,提升动作与交互识别性能。

04:00
arXiv cs.CV

面向密集事件视觉的脉冲神经网络片上训练

提出DELL局部学习,面向密集事件视觉,降低脉冲网络训练内存并提升光流与分割性能。

04:00
arXiv cs.CV

StegGNN:面向图像隐写术的图表示学习

提出基于图神经网络的自编码器图像隐写框架StegGNN,将图像建模为图结构,性能与CNN基准相当。

04:00
arXiv cs.CV

CityToolVQA:面向城市低空环境三维空间认知的工具增强视觉问答

几何工具链处理定量问答,零样本适配VLM;准确率67.6%,十个模型提升12.7–36.9个百分点。

04:00
arXiv cs.CV

RefAdapt-DiT:面向参考条件扩散 Transformer 的自适应联合注意力

免训练RefAdapt自适应控制参考-目标联合注意力,超少步生成最高加速3.54倍且画质相当。