10941 条条目 · 106 个活跃源
2026年8月28日
04:00
arXiv cs.CV

利用大型重建模型重建交互中的人与物体

提出MILO框架,利用大型重建模型从单图重建3D人-物交互,凭借几何结构先验简化流程,精度优于现有方法。

04:00
arXiv cs.CV

StreamAV-Bench:流式音视频生成的综合基准

首个流式音视频生成基准,含渐进与交互双轨,评测13系统,发现时序漂移与交互瓶颈。

04:00
arXiv cs.CV

利用无人机非精确异步离散GPS轨迹的相机标定

针对GPS轨迹不精确、异步离散,用迭代最小二乘估计相机姿态,推荐轨迹使标定精度达测量误差14%。

04:00
arXiv cs.CV

Dose-PlanNet:基于物理的深度学习放疗剂量预测

物理引导的3D深度学习预测前列腺放疗剂量,靶区覆盖相当,危机器官保护改善,多数计划达标,加速工作流。

04:00
arXiv cs.CV

超越试验场:基于LiDAR的辅助车道变更系统独立公共道路测试

基于LiDAR在法国A31高速独立测试辅助车道变更系统,对比UNECE R79,发现部分操作不满足安全距离要求。

04:00
arXiv cs.CV

UrbanGround:从局部感知到真实尺度城市中的空间能动性

提出UrbanGround城市沙盒,测试多模态大模型。局部感知尚可,但长程导航错误累积,无法持续目标导向行为。

04:00
arXiv cs.CV

检索头遇见视觉:揭示VLM如何定位与提取视觉信息

发现视觉检索头(约2%注意力头)负责将文本定位到图像区域,屏蔽它们使定位准确率骤降80%,且跨任务、跨模型通用。

04:00
arXiv cs.CV

TrapVLA:诱使视觉-语言-动作模型陷入配置故障模式

提出配置故障诱捕后门攻击:VLA模型受文本触发执行特定失败行为,TrapVLA学习动作残差实现。

04:00
arXiv cs.CV

RTNav:迈向实时零样本目标导航

提出RTNav实时零样本目标导航,考虑推理延迟与异步步进,HM3D成功率+11%,SCT+5.1点

04:00
arXiv cs.CV

面向鲁棒音视频语音识别的对比解码注意力引导可靠性缩放

提出可靠性感知的对比解码缩放,依据注意力动态和预测差异自适应调节强度,在LRS3上提升干净与低信噪比下的AVSR性能。

04:00
arXiv cs.CV

4DSynth:面向动态具身模拟的可控程序化世界合成

提出4DSynth,从文本/掩码/照片生成可编辑4D环境,支持动画、轨迹和物理仿真;生成的导航基准显示现有VLM任务失败率高。

04:00
arXiv cs.CV

Knowledge Distillation Driven Semantic NOMA with GAN Refinement for 6G Robotic Vehicle Networks

04:00
arXiv cs.CV

面向大规模全切片图像嵌入提取的解耦I/O主导流水线

解耦I/O流水线分离数据移动与计算,实现大规模全切片图像嵌入高效提取,存储主导,视为数据密集问题。

04:00
arXiv cs.CV

实验室物体沉浸式可视化的三维重建方法比较评估

比较四种三维重建法制作实验室全息模型,神经辐射场最佳,能处理透明/反射/低纹理物体,支持沉浸式教学。

04:00
arXiv cs.CV

CLAP:跨具身视频世界模型是零样本物理模拟器

CLAP跨具身视频世界模型,统一动作空间,零样本物理模拟,性能领先。

04:00
arXiv cs.CV

How AI Experiences Art: Emergent Aesthetic Structure in a Self-Supervised Multimodal Embedding Space

04:00
arXiv cs.CV

时间锚定的语言生成:迈向实时视觉-语言模型

提出时间锚定语言生成任务与TRACE指标,构建时间同步交错模型VLM-TSI,实现实时视觉语言生成。

04:00
arXiv cs.CV

基于基础模型迁移的锂离子正极裂纹数据高效量化

基础模型迁移实现锂离子正极裂纹的高效量化,稀疏标注即可获得群体级统计,单张图像评估退化。

04:00
arXiv cs.CV

ANTShapes:基于事件的神经形态物体分类基准数据集

用ANTShapes创建四个事件视觉数据集,经卷积脉冲网络基准测试,确认其适用性。

04:00
arXiv cs.CV

超越离散样本:高信息密度回放用于高效终身行人重识别

高信息密度回放:历史数据压缩为固定预算记忆,用复杂度分配、度量凝练与跨模态适应,提升终身行人重识别泛化并降本。

04:00
arXiv cs.CV

GSM8K-V:视觉语言模型能否在视觉情境中解决小学数学应用题?

提出GSM8K-V视觉数学基准;最强模型仅59%,人类91%;主要瓶颈是隐含视觉推理错误。

04:00
arXiv cs.CV

高频优先:改进图像隐式神经表示的两阶段方法

高频优先两阶段训练,用软掩码加权细节像素,后全图训练,提升隐式神经表示重建质量,缓解频谱偏差。

04:00
arXiv cs.CV

面向城市语义分割的低投入训练数据生成框架

利用扩散模型和伪标签适配目标域,将低成本语义图转为高保真图像,提升城市分割精度达8个百分点。

04:00
arXiv cs.CV

DOD-SA:单模态标注下的红外-可见光解耦目标检测

提出一种仅用单模态标注的红外-可见光解耦检测框架,通过协同师生网络与渐进训练降低标注成本。

04:00
arXiv cs.CV

EgoSurg:基于环境相机的手术室工作流第一人称回放的任意视点合成

EgoSurg利用环境相机重建手术室动态场景,合成任意角色视角,无创且支持安全回顾与培训。

04:00
arXiv cs.CV

ReSplat:循环高斯泼溅学习

提出循环高斯泼溅模型,利用渲染误差作反馈迭代优化高斯,无需梯度,适应多视图多分辨率,高效且SOTA。

04:00
arXiv cs.CV

多变量扩散Transformer解耦注意力用于高保真掩码-文本协同人脸生成

提出MDiTFace扩散Transformer,统一处理掩码与文本,用解耦注意力分离动态/静态路径,缓存复用静态特征,降低掩码计算开销94%以上,提升人脸保真度与条件一致性。

04:00
arXiv cs.CV

基于注视的身份认证:影响认证性能的因素

研究基于注视的身份认证关键因素,基于8849名受试者数据,分析信号质量、校准及滤波对认证性能的影响。

04:00
arXiv cs.CV

FLAT:用于MRI重建的展开网络的流对齐训练

提出FLAT方法,将展开网络与流匹配轨迹对齐,提升级联稳定性与重建质量。

04:00
arXiv cs.CV

三维与二维圆心精确测量及其在激光雷达-相机外参标定中的应用

提出基于共形几何代数与RANSAC的三维圆心估计及弦长方差二维圆心估计,提升激光雷达-相机外参标定精度。

2026年8月27日
04:00
arXiv cs.CV

融合感知视觉专家与多模态大语言模型的可解释植物病害诊断:从基准图像到真实世界机器人田间验证

提出H2MAF,融合决策级CNN与多模态大模型,在真实田间取得约99%准确率,但依赖校准。

04:00
arXiv cs.CV

商业果园早期解剖结构绿果分类的轻量级多模态视觉-语言框架

基于TinyCLIP的轻量级框架分类苹果幼果解剖结构,宏F1达0.93,支持边缘部署。

04:00
arXiv cs.CV

融合局部地理环境特征与空间上下文提升滑坡易发性制图

提出LGSCF融合策略,结合局部地理环境与空间上下文,提升滑坡易发性制图精度。

04:00
arXiv cs.CV

降低AI驱动检测门槛:自动化结构缺陷检测的无代码工作流

提出无代码工具YOLOEZ,集成标注、训练与推理,性能优于传统方法,降低AI结构检测门槛。

04:00
arXiv cs.CV

SHIFT-LLM:深度剪枝大语言模型中的分布偏移校正

训练后无需微调,用线性残差适配器校正深度剪枝引起的分布偏移,闭式最小二乘校准,零梯度,最多提升15.7个准确率点。

04:00
arXiv cs.CV

RefLAM:基于参考文本的历史阿拉伯语手稿行标注流水线

RefLAM流水线将手稿图像与转录转为可验证行级标注,满分100可证明正确,提速75倍,发布AraMS-28k数据集。

04:00
arXiv cs.CV

针对LLaVA中物体幻觉背后的注意力头

针对LLaVA物体幻觉,锁定32个注意力头干预,CHAIRs由0.37降至0.23,证实头部选择有效。

04:00
arXiv cs.CV

音视频同步度量指标到底在衡量什么?

联合审计音视频同步指标发现:各指标侧重不同,互不一致;建议用可靠性卡报告,而非单一分数。

04:00
arXiv cs.CV

看得更多,检测更少?遏制多视角异常检测中的信息泄漏

多视角融合引发信息泄漏,损害重建检测;GLAD框架以受限融合+注意力机制,实现多视角异常检测SOTA。

04:00
arXiv cs.CV

采集偏移下,冻结的血液学基础模型可信吗?

冻结血液学基础模型域内饱和,跨域准确率与校准崩坏,需审计准确率、校准、暴露及类先验鲁棒性。

04:00
arXiv cs.CV

CoRE:驾驶视频中弱监督由粗到细的风险证据学习

驾驶风险随时间演变且有场景实体支撑,但监督仅限粗粒度视频级标签。

04:00
arXiv cs.CV

Lightweight Machine Learning-Driven Monocular Sidewalk Path Extraction for Embedded Micromobility Navigation

04:00
arXiv cs.CV

OpenCVL:面向细粒度跨视角定位的开放多样大规模数据集

提出OpenCVL,61.7万组跨视角图像对覆盖欧洲4国41城,融合高精传感器及野外图像,纠正噪声标注,提升细粒度定位性能。

04:00
arXiv cs.CV

WAVE:反转引导层级实现从粗到细的引导深度超分辨率

WAVE利用多级小波变换反转粗到细引导层级,分离高低频并语义门控,提升深度超分辨率,尤其高倍率。

04:00
arXiv cs.CV

MulVec:面向免训练零样本组合图像检索的细粒度角色感知匹配

提出角色感知方法MulVec,将查询分解为全局与局部角色向量,分角色匹配后加权排序,无需训练即可提升零样本组合检索精度。

04:00
arXiv cs.CV

V-Link:在动作DiT中恢复视觉-语言-动作模型丢失的视觉表征

V-Link通过空间与语义查询恢复丢失视觉表征并注入动作DiT,大幅提升机器人操作成功率。

04:00
arXiv cs.CV

PointRL:从可验证标注证据中学习点级视觉-语言定位

PointRL用可验证标注作为隐藏证据,通过强化学习训练点级定位,奖励评估覆盖率与数量一致性,在PointArena提升9.5%。

04:00
arXiv cs.CV

并非所有注意力头都有助于关键视觉标记的选择:头感知剪枝更重要

关键视觉标记的选择能力集中在少数注意力头;据此提出头感知剪枝,先按相似度剪冗余再剪,性能效率兼得。

04:00
arXiv cs.CV

医学视觉语言模型在放射学中学到了什么?分布偏移下的迁移、对齐与源代理泄漏

医学VLM在分布偏移下出现盲点:迁移低、配对检索低、源代理泄漏;自监督初始化优于监督,对抗适应不稳定,需压力测试。

04:00
arXiv cs.CV

GraftSR:凭借同实例引导,为真实世界图像超分辨率嫁接真实纹理

提出GraftSR:同实例参考引导嫁接真实纹理,双掩码机制解耦注入,构建数据集,达SOTA,LPIPS降20.2%。