11161 条条目 · 106 个活跃源
2026年7月24日
04:00
arXiv cs.CV

A real-time RGB-D perception pipeline for autonomous impact hammers in mining: self-filtering, rock segmentation and rock-breaking poses generation

04:00
arXiv cs.CV

统一视频密集预测:从不相交数据学习

UniD模型统一预测八种场景属性,通过蒸馏从分散数据集学习,利用扩散模型桥接域差距,无需伪标注。

04:00
arXiv cs.CV

GLAM-SLAM:基于流密化与空间分解的实时高斯大规模建图

GLAM-SLAM实现实时高斯SLAM,通过流密化和空间分解,在长序列数据上重建质量提升15%。

04:00
arXiv cs.CV

KroQuant: 基于克罗内克结构块变换的扩散Transformer高效训练后量化

KroQuant用克罗内克结构块变换实现W4A4量化,参数少、速度快,图像质量优于现有方法。

04:00
arXiv cs.CV

为视觉Transformer建立遗忘基准

首次为视觉Transformer建立遗忘基准,评估多种算法、数据集与遗忘协议,提供公平可重复的比较基准。

04:00
arXiv cs.CV

将广义幂图拟合到三维图像数据:虚拟材料测试的先决条件

综述将广义幂图拟合到3D图像数据的方法,用于虚拟材料测试,比较多种算法策略。

04:00
arXiv cs.CV

可训练的对数线性稀疏注意力用于高效扩散Transformer

LLSA利用分层结构将注意力复杂度从二次降至对数线性,加速DiT训练6倍、推理28倍,保持生成质量。

04:00
arXiv cs.CV

聚焦关键:基于动作单元的时空注意力约束实现抗噪声动作质量评估

提出动作单元空间注意力与双流解耦框架,去除背景噪声,分离动作与环境,实现SOTA评分性能。

04:00
arXiv cs.CV

SuperFlow:基于强化学习的实时流匹配模型训练

提出SuperFlow框架,通过方差感知采样和步级优势计算,仅用5.4%-56.3%训练步数即实现性能提升与训练加速。

04:00
arXiv cs.CV

EmoSpace:细粒度情感原型引导的沉浸式情感图像生成

EmoSpace通过细粒度情感原型和条件引导生成沉浸式图像,提升情感对齐,适合场景设计。

04:00
arXiv cs.CV

受电弓-接触网系统电弧检测的多模态学习

提出多模态框架结合图像与力测量检测弓网电弧,扩展DeepSAD并引入伪异常生成,显著提升检测性能。

04:00
arXiv cs.CV

SoccerSynth Field:利用虚拟足球模拟器的合成数据增强场地检测

利用合成数据集预训练模型,显著提升足球场地检测的鲁棒性和准确性,实现经济高效的解决方案。

04:00
arXiv cs.CV

DCVC-MV: 具有高效视间预测的深度上下文多视点视频压缩

提出DCVC-MV框架,利用视间运动特征传播和条件熵模型,实现高效多视点视频压缩。

04:00
arXiv cs.CV

基于前馈高斯溅射的实时人体重建与动画

提出HumanGS框架,从稀疏多视图实时重建人体,无需预训练,重建速度提升15倍。

04:00
arXiv cs.CV

全旋转等变光谱-空间学习用于多光谱目标检测

FressDet提出全旋转等变光谱-空间框架,通过隐式扭曲、一致性加权和定向头,以93%更少参数达多光谱检测SOTA。

04:00
arXiv cs.CV

QATMA:多模态对齐的量化感知训练用于开放词汇目标检测

QATMA通过课程量化和文本锚定蒸馏,解决极低位量化下多模态对齐退化,零样本检测AP提升4.3-7.6。

04:00
arXiv cs.CV

O3N:面向城市自主体的全向开放词汇占据预测

首个全向开放词汇占据预测框架,从单张RGB图像实现,在多项基准上达到最优性能。

04:00
arXiv cs.CV

基于统一研究的相机陷阱物种随时间识别:经验与待解问题

首次系统研究相机陷阱物种随时间识别,揭示时间偏移和类不平衡挑战,提出改进方向与开放问题。

04:00
arXiv cs.CV

ELT:弹性循环变换器用于视觉生成

ELT通过权重共享循环变换器和内部自蒸馏,实现参数高效、动态计算与质量权衡的视觉生成。

04:00
arXiv cs.CV

PersonaGesture:基于单参考样本的未知说话人共语手势个性化

提出扩散管道PersonaGesture,通过自适应风格注入与隐式分布校正,实现单参考下未知说话人手势个性化,无需逐人优化。

04:00
arXiv cs.CV

Cambrian-P: 基于姿态锚定的视频理解

引入可学习相机令牌和姿态回归头,在空间推理和通用视频QA上显著提升,验证了相机姿态的关键作用。

04:00
arXiv cs.CV

高CFG扩散反演何时失败?提示与潜变量交互的受控研究

高CFG反演失败取决于提示-潜变量配对,提示压力可区分难易但不足,需局部轨迹感知干预改进重建。

04:00
arXiv cs.CV

任务对齐:跨多样视觉任务实现实用模型合并的简单代理

提出任务对齐代理,大幅加速超参数选择,将模型合并扩展到多任务视觉模型。

2026年7月23日
04:00
arXiv cs.CV

引导、思考、行动:视觉-语言-动作模型中的交互式具身推理

提出GTA-VLA框架,通过用户视觉引导和空间视觉链式思考实现可纠错的具身推理,OOD场景下成功率显著提升。

04:00
arXiv cs.CV

HOMIE: 通过多模态智能增强实现以人-物为中心的视频个性化

HOMIE框架通过多模态增强,统一内外主体输入,实现高保真人-物交互视频个性化。

04:00
arXiv cs.CV

面向安全网络物理空间的物联网架构:VISOR经验报告

VISOR项目在音乐节测试多种IoT设备(无人机、CCTV等)检测恶意活动,为安全网络物理空间选出最优架构配置。

04:00
arXiv cs.CV

广义最小二乘核化张量分解

提出GLSKF框架,融合全局低秩与局部残差建模,高效补全多维时空数据,实验性能优越。

04:00
arXiv cs.CV

最便宜的生存:面向对抗鲁棒性的成本感知硬件自适应

提出成本感知硬件自适应框架,用加速失效模型量化影响。实验表明低成本L4芯片生存时间增20%、成本降75%,推断延迟是关键。

04:00
arXiv cs.CV

Soft-TransFormers 持续学习方法

Soft-TF通过任务特定实值掩码微调冻结Transformer,消除遗忘且任务推断错误无害,性能优于提示/适配器方法。

04:00
arXiv cs.CV

FE-MCFormer:一种用于强噪声环境下机械故障诊断的新型时频可解释架构

FE-MCFormer通过频率自适应与多尺度时频融合,在-10dB强噪声下实现鲁棒可解释的机械故障诊断。

04:00
arXiv cs.CV

基于肿瘤锚定的深度特征随机森林用于肺癌分割中的分布外检测

RF-Deep用少量标注和深度特征随机森林检测肺癌分割中的分布外输入,近OOD准确率超93%,远OOD近完美。

04:00
arXiv cs.CV

Timeripple:通过理解潜在空间中的时空相关性加速vDiT

基于潜在时空相关性,提出自适应重用策略加速vDiT,节省85%计算量且质量损失小于0.06%。

04:00
arXiv cs.CV

深层弱监督图像分割的统一变分框架

提出统一变分框架用于稀疏监督分割,基于Potts模型与RKHS,作为损失函数无需真实分割图即达可比性能。

04:00
arXiv cs.CV

ChronoStitch:无训练组合视觉KV记忆实现长时域时序推理

提出无训练方法,通过全局RoPE坐标重定位和选择性重计算,高效组合视觉KV缓存,提升长视频时序问答性能。

04:00
arXiv cs.CV

Crowd4D:场景感知的单目4D人群重建

提出Crowd4D框架,联合优化人群与场景,利用HSIP代理实现准确人景对齐,在复杂大场景中稳健重建4D人群。

04:00
arXiv cs.CV

早期检测,极少升级:从压缩比特流中随时检测AI生成视频

从压缩比特流实时检测AI视频,利用编码运动场,计算量降低5个数量级,门控维持假阳性率,延迟15%片段提升准确率至0.78。

04:00
arXiv cs.CV

D3VL: 使用语言模型从3D时序数据和视频中理解驾驶场景

D3VL框架融合2D/3D时序数据,驾驶场景问答性能提升11%,并扩展WaymoQA数据集。

04:00
arXiv cs.CV

合成与衍生训练图像用于校园垃圾检测:基于YOLOv8n的多种子评估

合成与衍生图像未提升YOLOv8n检测性能,真实图像基线[email protected]最高达0.691。

04:00
arXiv cs.CV

EGRNet:一种具有边缘门控细化与对抗感知的轻量级语义分割网络

EGRNet轻量语义分割网络(0.46M参数),采用边缘门控细化与对抗感知,Cityscapes上mIoU达65.28%,适用于边缘实时应用。

04:00
arXiv cs.CV

VQ移植:预训练视觉分词器中高效VQ模块集成

VQ-Transplant框架实现即插即用集成新VQ模块,保留原参数,轻量适应后达近SOTA性能,节省95%训练成本。

04:00
arXiv cs.CV

病理学家注意力对齐的前列腺组织病理学报告生成

本文引入病理学家注意力训练报告生成模型,通过多模态数据集和注意力对齐损失,使NLP指标提升10.9%,临床组件准确率提升19.3%。

04:00
arXiv cs.CV

超声心动图中的域偏移:跨数据集左心室分割的可解释量化与预测

超声心动图域偏移可结构化测量,几何预处理缓解,分割性能下降可预测(R²=0.612)。

2026年7月22日
04:00
arXiv cs.CV

风格胜于实质:情感描述偏好评估的捷径审计

情感描述偏好评估存在风格捷径,未理解视频即可达高分,需改进评估方法。

04:00
arXiv cs.CV

危险还是异常?评估视觉语言模型对危险与差异的理解

研究发现VLM常将异常误判为危险,明确区分二者能更有效评估安全推理能力。

04:00
arXiv cs.CV

从像素到预后:卷积与GLCM特征融合实现自动四分类白内障严重程度分级

融合CNN深度与GLCM手工特征,SVM分类四类白内障,准确率95%,无需GPU,适合基层远程医疗。

04:00
arXiv cs.CV

Text-conditioned Segmentation for Tomato Phenotyping via Procedural Synthetic Data

04:00
arXiv cs.CV

DuSPiT:双分支子补丁像素扩散Transformer

提出双分支子补丁像素扩散Transformer,分离全局与局部建模,生成更精细图像,质量效率优于先前模型。

04:00
arXiv cs.CV

AniGS:桥接渲染与扩散先验的3D场景动画

AniGS利用视频扩散模型为3D场景添加环境动态,通过迭代更新和细化保持结构,实现沉浸式动画。

04:00
arXiv cs.CV

Recti-Q:面向边缘机器人中分布外鲁棒量化感知的特征空间校正

Recti-Q轻量特征空间校正恢复量化模型分布外鲁棒性,参数开销<1%,保留99%内存节省。

04:00
arXiv cs.CV

惊喜强制:长视频生成中的记忆与跳过选择

提出惊喜强制框架,通过记忆库和自适应去噪优化资源分配,提升长视频生成一致性和质量。