10861 条条目 · 106 个活跃源
2026年9月10日
04:00
arXiv cs.CV

面向流式说话人头生成的解耦自强迫蒸馏

音频融入身份解耦低维运动空间,小因果模型生成运动潜变量并经扩散渲染;解耦自强迫蒸馏令两模型并行流式,15.4 FPS、1.3秒延迟、质量无损。

04:00
arXiv cs.CV

ScopeMamba-YOLO:面向遥感影像小目标检测的内外感知范围拓宽

提出ScopeMamba-YOLO,以离路零门控选择性扫描解耦上下文与卷积,配合CGCM、SS-PAN等提升遥感小目标检测,VisDrone上mAP50达52.6%。

04:00
arXiv cs.CV

FreqFLD:基于频率调制实现一体化人脸关键点检测

FreqFLD以频率调制与频率感知专家混合,提升复杂场景下跨数据集人脸关键点检测泛化。

04:00
arXiv cs.CV

TransGaze-Object:真实驾驶场景下基于Transformer的驾驶员注视对象预测框架

提出基于Transformer的端到端框架,直接预测驾驶员注视对象;构建UD-FSG数据集,准确率达60%,优于PoG关联的51%。

04:00
arXiv cs.CV

TRACE:面向高效GUI智能体的轨迹鲁棒准入与证据排序

TRACE免训练,用轨迹鲁棒证据排序与覆盖保留剪枝GUI视觉token,并单调收缩KV,降低推理开销。

04:00
arXiv cs.CV

真实世界与临床环境人体运动挑战赛(MoCha)@ECCV2026 第三名方案:面向域泛化UPDRS步态严重程度估计的语言对齐运动表征

提出语言对齐运动表征与域模型合并,在MoCha未见站点获第三,Macro-F1达0.57。

04:00
arXiv cs.CV

SynThermFace:通过合成数据生成扩增有限配对数据用于可见光-热红外人脸识别

SynThermFace借助扩散模型将少量真实可见光-热红外配对扩增为大规模合成配对,训练跨谱人脸识别模型,推理仅需单次前向。

04:00
arXiv cs.CV

UOT-Gap:基于非平衡最优传输的视觉语言模型模态差距变分原理

免训练UOT-Gap以非平衡最优传输分解模态差距,成对残差追踪检索退化,评估字幕质量与对齐鲁棒性。

04:00
arXiv cs.CV

无坐标几何:LiDAR扩散作为三维特征桥梁

以LiDAR条件扩散模型桥接2D先验与3D点云,无坐标特征中自发形成结构化三维表示。

04:00
arXiv cs.CV

高光谱图像分类的降维方法

面向高光谱卫星图像监督分类,比较PCA、LDA降维及KNN、SVM、RF分类;真实数据中PCA+RF总体精度与Kappa最高。

04:00
arXiv cs.CV

超越"一刀切":面向MLLM视觉Token剪枝的样本自适应策略路由

提出即插即用轻量路由器VIP-Router,按样本自适应选择视觉Token剪枝策略,显著提升准确率。

04:00
arXiv cs.CV

Spot-the-shift:评估长期变化的视觉定位图像差异描述

提出人类验证基准SPOT-THE-SHIFT,评估长期变化的视觉定位图像差异描述;现有MLLM表现不佳,合成数据可提升且不损通用能力。

04:00
arXiv cs.CV

视频为何仍然如此昂贵?视频与视听大语言模型中的推理效率机制综述

综述视频/视听大模型推理效率机制:帧采样、模态编码、词元压缩、预填充解码,汇总精度—成本,指出视听与评测缺口。

04:00
arXiv cs.CV

超越弱标签:面向高分辨率多光谱影像弱监督水体分割的提示引导局部细化

提出两阶段弱监督水体分割框架,将初始掩膜转为结构化提示做局部细化,提升IoU/F1并改善岸线与细结构。

04:00
arXiv cs.CV

SceneHI:可控光照的高分辨率三维一致场景纹理合成

SceneHI将2D扩散先验用于3D纹理合成,无需微调或优化即可生成高分辨率、三维一致且带烘焙阴影的场景纹理,速度提升80%。

04:00
arXiv cs.CV

形状引导的高斯泼溅用于稀疏视角X射线三维重建

提出形状引导高斯泼溅框架,以解剖形状先验约束高斯基元与密度,5视角X射线重建PSNR提升2.83dB

04:00
arXiv cs.CV

学习适应与校准:面向医学视觉语言模型小样本不确定性预测的分数分布对齐

所提方法重加权校准分布,对齐支持集与查询集分数,无需查询标签缩小小样本医学VLM适配的共形覆盖偏差。

04:00
arXiv cs.CV

PACE:面向QoE高效检索增强对话服务的感知时延级联服务路由与填充控制

PACE以感知首响时延为QoE目标,联合级联路由与填充控制,P95降半且优于RAG 2.4倍。

04:00
arXiv cs.CV

可编程世界模型

将世界状态演化与视觉渲染解耦,以自然语言程序维护持久全局状态,实现可编程长时程交互世界模型。

04:00
arXiv cs.CV

具有中心不变偏移与边缘感知掩膜的增强可变形卷积

提出增强可变形卷积,结合中心不变偏移与边缘感知掩膜模块,抑制无效形变,语义分割性能超越主流可变形卷积变体。

04:00
arXiv cs.CV

X射线层析纳米成像中基于数据一致性扩散先验的先进脑组织成像

提出LUCID,融合多视角扩散先验与投影域数据一致性,恢复X射线层析缺失锥信息,提升脑组织成像保真度。

04:00
arXiv cs.CV

AgroVisNet:面向萝卜、马铃薯与尖瓜病害分类的轻量级卷积网络及BD-PlantDX专家验证基准

轻量网络AgroVisNet与专家验证基准BD-PlantDX,涵盖萝卜、马铃薯、尖瓜病害,准确率达99.52%。

04:00
arXiv cs.CV

跨模型一致性作为自动息肉分割的部署时可靠性信号

提出无参考RBQE框架,用独立裁判模型与主模型的分割一致性度量可靠性,跨架构裁判ROC-AUC最高达0.960。

04:00
arXiv cs.CV

人工智能素养与可持续发展:伦理治理与发展目标框架

AI素养可支撑17项SDGs;提出六级伦理框架,调查显示技术强而伦理治理准备不足,宜纳入课程与治理。

04:00
arXiv cs.CV

BrainTaskonomy:在fMRI基础模型中学习如何预训练与迁移什么

利用学习关系组织fMRI基础模型的预训练课程与迁移选择,显著降低重建误差并提升下游任务表现。

04:00
arXiv cs.CV

基于堆叠集成学习的水稻品种精准分类

提出堆叠集成模型,基于20类水稻图像实现100%分类准确率,并开发手机应用,助力防伪与质量控制。

04:00
arXiv cs.CV

Field Converter:几何初始化时序残差精化,实现足球转播中世界坐标系的球员姿态估计

足球转播中,几何初始化根节点,时序残差精化使根误差降至10cm,世界坐标MPJPE达13.2cm。

04:00
arXiv cs.CV

利用测试时部分观测引导图像到3D生成

提出免训练框架,用测试时部分几何观测,以射线一致占用似然引导图像到3D模型,显著提升几何保真度与视觉质量。

04:00
arXiv cs.CV

基于扩散模型的多样化实例生成:增强遥感图像小样本目标检测

用扩散模型生成多样化遥感实例切片并嵌入全图增强数据,小样本检测平均提升4.4%。

04:00
arXiv cs.CV

零样本学习中偏差的统计方法:手写识别视角

提出通用统计纠偏法:GZSL作黑箱,两阶段蒙特卡洛校正,大规模手写词识别未见词准确率提升超20%,约15维即可。

04:00
arXiv cs.CV

可控复制粘贴:面向遥感小样本目标检测的可控扩散增强方法

提出可控扩散复制粘贴,将小样本新类目标注入多样上下文并方向对齐,DIOR提升10.76%。

04:00
arXiv cs.CV

Arti-JEPA:将视频世界模型适配于声道实时MRI,用于语音产出分析

提出Arti-JEPA,用62小时无标注声道实时MRI自监督适配视频世界模型;冻结表征用于音素、口吃与术后分析,时间先验优于逐帧编码。

04:00
arXiv cs.CV

识别机器人世界模型中的习惯、物理与干扰

机器人世界模型将遥操作多模态拆为操作习惯、共享物理与干扰;冻结物理读出、只调薄接口,提升低样本迁移与抗干扰。

04:00
arXiv cs.CV

RealSimLoop:基于可微降阶仿真与视觉反馈的在线真实到仿真自适应

RealSimLoop:在降阶神经子空间内做可微仿真,借可微渲染以像素梯度在线优化材料参数,滑动窗口实现准实时的真实到仿真自适应。

04:00
arXiv cs.CV

CHIMERA挑战赛任务2和3:基于多模态数据集的膀胱癌患者应答亚型分类与进展生存预测

CHIMERA多模态挑战赛评估膀胱癌BCG应答亚型分类与进展预测,最佳F1 0.73、C指数0.68。

04:00
arXiv cs.CV

基于形态解耦的骨骼分类用于错颌畸形临床评估

TeethGNN解耦解码器从CBCT预测形态指标,图神经网络融合图像特征并协同校准,实现错颌畸形自动分级。

04:00
arXiv cs.CV

DCReg:面向高效退化激光雷达配准的解耦表征

DCReg解耦退化配准,Schur补检测、基对齐表征、预条件缓解,精度提高20-50%,加速116倍

04:00
arXiv cs.CV

自动可复现的相机内参标定

提出全自动相机内参标定流程,自动筛图并选径向畸变阶数,使留出集重投影误差降25%,选阶再降5%。

04:00
arXiv cs.CV

How (Mis)calibrated is your Federated CLIP and what to do about it?

04:00
arXiv cs.CV

Candor-LR: A Dyadic Conversational Dataset for Audio-Visual Speech Recognition

04:00
arXiv cs.CV

AVSRBench: A Multi-Condition AVSR Benchmark

04:00
arXiv cs.CV

ROVR-Open-Dataset: A Large-Scale Depth Dataset for Autonomous Driving

04:00
arXiv cs.CV

Data-Driven Risk Fields for Safer End-to-End Autonomous Driving

04:00
arXiv cs.CV

Synergistic Vision-Language Reinforcement Enables Scalable On-Demand Analysis across Diverse Clinical Tasks

04:00
arXiv cs.CV

Take What You Need: Flexible Multi-Task Semantic Communications with Channel Adaptation

04:00
arXiv cs.CV

DUET-DINO: Simultaneous Cross-View World Modeling for Latent Planning in Robot Manipulation

04:00
arXiv cs.CV

RAU: Reference-based Anatomical Understanding with Vision Language Models

04:00
arXiv cs.CV

Anatomy-Grounded Weakly Supervised Prompt Tuning for Chest X-ray Latent Diffusion Models

04:00
arXiv cs.CV

Multi-dimensional Preference Alignment by Conditioning Reward Itself

04:00
arXiv cs.CV

Let ViT Speak: Generative Language-Image Pre-training