10881 条条目 · 106 个活跃源
2026年9月7日
04:00
arXiv cs.CV

ARC-Loc:利用方位角射线收敛作为几何线索的直接跨视角定位

新方法利用方位角射线收敛实现直接跨视角定位,免去深度模型和BEV变换,推理更快且精度相当。

04:00
arXiv cs.CV

Temporal Residual Neural Radiance Fields for Monocular Video Dynamic Human Body Reconstruction

04:00
arXiv cs.CV

PuTR-CouT: Counting-by-Tracking in Camera-Trap Image Sequences

04:00
arXiv cs.CV

Compositional Reward Models for Conditional Medical Image Generation

04:00
arXiv cs.CV

面向前馈目标检测的高效多时间尺度事件表示

提出对数B样条与几何感知置信度的多尺度事件表示,性能超CSTR,支持高效递归更新,适用前馈检测。

04:00
arXiv cs.CV

MultiAttenGastro:用于胃肠道内镜分类的多维度注意力增强

提出多维度注意力增强,经八骨干五数据集验证:效果取决于领域表示差距,大差距有提升,小差距无效,结果不显著。

04:00
arXiv cs.CV

面向弱监督视频异常检测的自适应多粒度时间建模

提出自适应多粒度时间建模框架,含时序细化与事件分割模块,并用相似度融合生成视频级预测,提升异常检测精度。

04:00
arXiv cs.CV

基于校准融合的无训练逻辑与结构异常检测

提出无训练异常检测法,经正常集校准融合互补特征,同时识别逻辑与结构异常,性能领先。

04:00
arXiv cs.CV

学习空间光谱细化与校准互补观测的高光谱图像超分辨率重建

提出无监督双阶段融合框架,先学隐式张量表示细化空间光谱,再用双观测无参校准互补,提升高光谱重建精度。

04:00
arXiv cs.CV

基于视觉语言模型的无标签跨域跟踪器自适应

提出用视觉语言模型诊断并调参,无标签跨域适应跟踪器,恢复大部分性能损失,选择性优化。

04:00
arXiv cs.CV

面向高效高斯泼溅的紧凑神经外观模型

提出紧凑神经外观模型替代球谐,存储降至28字节,优化提速1.3倍,质量更优。

04:00
arXiv cs.CV

BLASt3R:任意图像集的束调整,结合多视图匹配与单目先验

提出规则化束调整,用多视图匹配与单目先验统一在线VSLAM与离线无序重建,未标定法超越先前标定法。

04:00
arXiv cs.CV

基于分层度量学习的少样本视频识别

提出分层度量学习法,从帧级到类原型渐进施加多阶段约束,联合优化特征紧凑性、时空对齐、判别性与鲁棒性,在五个基准数据集上表现优异。

04:00
arXiv cs.CV

要事优先:教基于大语言模型的智能体先满足硬性要求再考虑软性要求

提出FTF-RL方法,针对多优先级需求优化推理,显著提升任务成功率并增强泛化。

04:00
arXiv cs.CV

SMILE:面向医学诊断的自解释多模态信息瓶颈

提出自解释多模态信息瓶颈框架,协同优化预测与可解释性,显著提升诊断准确率与泛化能力。

04:00
arXiv cs.CV

WeAgent-MMGenEdit:多模态智能体图像生成与编辑的全栈方案

全栈方案:多模态运行时、数据流水线、基准与后训练,增强知识密集型图像生成编辑,30B接近1T。

04:00
arXiv cs.CV

保守免疫拓扑提升病理基础模型跨癌种MSI-H预测的泛化能力

保守免疫拓扑(CIT)无需标注,提升病理基础模型跨癌种MSI-H预测的泛化,零样本AUC提高5.34%。

04:00
arXiv cs.CV

可测量滑块:从可微图像测量中学习连续控制

以闭式可微图像测量定义连续控制,经可观测性测试与测量引导,多分支组合,控制有序高选择性可组合,优于基线

04:00
arXiv cs.CV

自适应门控深度伪造检测:面向低分辨率与资源受限环境

提出AdaGate-DF自适应门控框架,按图像质量路由样本,多出口早退省算力,在低分辨率下兼顾检测精度与效率,AUC达0.9370。

04:00
arXiv cs.CV

UniMate:一个统一模型,实现多样骨骼的动画生成

提出UniMate统一模型,可从任意骨骼和文本生成动作,无需测试时优化,支持跨拓扑零样本迁移。

04:00
arXiv cs.CV

MEOX:面向地球观测的紧凑多模态混合专家模型

提出紧凑多模态掩码自编码器MEOX,总参数311.5万,在GEO-Bench等任务上超越CSMoE,实现高效地球观测表征学习。

04:00
arXiv cs.CV

多焦点数字显微图像中孢粉化石的可扩展检测

提出首个可扩展端到端自动化流程,用于全玻片孢粉化石检测,将分析时间从数天降至1小时内。

04:00
arXiv cs.CV

反射感知的生成式新视角合成

无需训练的反射感知新视角合成:将镜面视为互补视图,用镜像门控注意力与反射注入,实现反射一致生成。

04:00
arXiv cs.CV

CrossDepth:面向可泛化多视角环绕深度估计的几何约束注意力

提出几何约束注意力与相机射线嵌入,实现自监督多视角深度估计,提升跨图一致性及泛化能力。

04:00
arXiv cs.CV

思考-验证-修正:基于视觉语言模型与动态逻辑张量网络的神经符号视觉推理

提出神经符号框架,结合视觉语言模型与动态逻辑张量网络迭代验证,三示例诱导数独规则,性能达到或超越现有方法。

04:00
arXiv cs.CV

从可解释性方法到可解释模型

主张从可解释性方法转向可解释模型:现有工具足以比较模型,并需实测依赖者理解,而非仅构建方法。

04:00
arXiv cs.CV

A Generalizable Feature Extractor for Alzheimer's-Related Brain MRI Tasks

04:00
arXiv cs.CV

资源受限农业田间条件下设备端植物病害检测的轻量级视觉Transformer压缩

融合剪枝、量化与知识蒸馏压缩模型,用于农业设备端植物病害检测,体积降54.5倍,精度保持约95%。

04:00
arXiv cs.CV

跨模态分诊网络:一种面向胸片严重程度分诊与视觉可解释性的多模态深度学习框架

跨模态分诊网络融合图像与文本,实现胸片严重度分诊和可解释性;虽基准指标高,但与放射科专家一致性低,需专家标注。

04:00
arXiv cs.CV

Motion-Omni:面向口语对话的端到端联合语音与全身动作生成

提出端到端口语对话模型,同时生成语音与全身动作,联合训练保证对齐,性能接近级联系统且快数倍。

04:00
arXiv cs.CV

AVENUE:音视频编辑理解与评估

提出基准与模态感知评估框架,测试音视频编辑模型,发现编辑单一模态常致另一模态意外改变。

04:00
arXiv cs.CV

WorldSculpt:从带位姿标注的视频生成组合式世界

提出利用单物体三维生成先验,从多视角视频生成含数百物体的组合场景,无需场景级训练,性能领先。

04:00
arXiv cs.CV

FailureSpot:面向视觉-语言-动作模型的标签高效时间戳级故障检测

提出数据高效框架,利用未标注动作块生成弱监督信号,结合主动学习精选标注,提升VLA模型时间戳及轨迹级故障检测精度。

04:00
arXiv cs.CV

可伸缩神经视频表示压缩

提出可伸缩神经表示视频编码,单流支持码率与解码复杂度缩放,性能优于现有可伸缩及非可伸缩编码。

04:00
arXiv cs.CV

多尺度图像表示压缩

提出一种过拟合图像编码法:全组件率失真量化熵编码,多尺度跨阶段共享,较最新标准省10.5%码率,解码复杂度可选。

04:00
arXiv cs.CV

利用冻结视觉语言模型的免训练语音中心全方位理解

免训练:用语音识别器把音频转成带时间戳文本,让冻结视觉语言模型支持以语音为中心的全方位理解。

04:00
arXiv cs.CV

Encore:基于自适应信号路由的无限音视频生成

提出自适应信号路由方法,通过调节条件信号实现无限长同步音视频生成,兼顾局部连续与全局一致,性能优于现有方法。

04:00
arXiv cs.CV

协作式片上阵列相机

提出分布式元光学学习,协作优化亿万纳米柱阵列,实现全谱宽带成像与感知重建,仿真实验均佳,不依赖照明光谱。

04:00
arXiv cs.CV

STEMPix:基于相变材料的像素传感器,用于分辨边缘移动方向

提出STEMPix像素,在CMOS图像传感器内生成3位边缘方向码,无需传输全帧,实现了高填充因子与低能耗,支持全局快门和动态阈值。

04:00
arXiv cs.CV

AquaBEV:基于3D声纳监督的单目水下BEV占用预测

提出AquaBEV,用单目RGB预测水下BEV占用,训练时以3D声纳监督,较最强基线Visible IoU提升4.0%。

04:00
arXiv cs.CV

MASLD风险分层的超声图像学习流程开发与评估

超声图像学习用于MASLD风险分层,SWE较B模式更优,纤维化分期AUROC最高0.80。

04:00
arXiv cs.CV

基于超声和大规模计算机视觉模型的肝硬化失代偿预测

利用大规模计算机视觉模型分析常规腹部超声,无创预测肝硬化失代偿风险,补充现有临床评分,助力早期干预。

04:00
arXiv cs.CV

STyMo:快速可控的少样本动作风格迁移

提出STyMo,用数秒配对数据、一两分钟训练实现少样本动作风格迁移,分解静态与时间风格成分,支持运行时调节,并设防伪门控。

04:00
arXiv cs.CV

EyeMakeYou:面向高频眼动合成的身份、任务与主观状态条件扩散模型

提出多条件扩散框架EyeMakeYou,融合身份、任务与主观状态生成高频眼动序列,精度与特征相似度优于现有方法。

04:00
arXiv cs.CV

解释性多模态深度学习整合影像与临床数据检测口腔潜在恶性病变

提出M2-OPMDNet多模态框架,融合白光、自体荧光图像与临床信息,AUC达0.952,优于单模态,SHAP解释显示临床数据互补影像,助力口腔癌筛查。

04:00
arXiv cs.CV

SocioGesture:人机交互中的实时自适应社交手势感知

提出实时自适应社交手势感知系统,融合身体-手部骨架,抗遮挡且可在边缘设备实时运行,并支持扩展手势集。

04:00
arXiv cs.CV

分数阶自适应运动放大:用于噪声受限视频放大的相位可靠性加权

提出分数阶自适应运动放大,以分数阶导数替代恒增益,并按单演信号幅度逐像素加权,显著抑制平坦区噪声,因果处理达69fps。

04:00
arXiv cs.CV

胎儿脑超声扫描中与标准切面的接近度测量

提出半监督分割与6D位姿回归管道,实现胎儿脑超声标准切面的连续实时接近度反馈,边缘设备运行达39Hz。

04:00
arXiv cs.CV

用ImageNet做文本到图像生成,能走多远?

仅用ImageNet与增强,达FLUX性能,超SD3/SDXL,少千倍数据,更可复现。

04:00
arXiv cs.CV

何时重要,何事重要?——视觉运动模仿策略中条件视觉定位的诊断与改进

视觉运动模仿策略遇到相似干扰时会选错目标,诊断发现条件视觉定位是关键,增强目标选择可显著提升仿真与实物鲁棒性。