11301 条条目 · 106 个活跃源
2026年6月10日
04:00
arXiv cs.CV

AnyMod-LLVE: 模态无关推断的低光视频增强

提出AMNet统一框架,通过双门控转换器与多模态预训练,实现模态缺失下的鲁棒低光视频增强。

04:00
arXiv cs.CV

Lip Forcing:用于实时唇同步的少步自回归扩散

提出首个自回归扩散唇同步方法,两步去噪实现实时推理,1.3B模型达31FPS,14B模型比教师快39.8倍。

04:00
arXiv cs.CV

重叠小波扩散用于低光图像增强

提出重叠小波扩散框架,消除分块伪影并增强细节,在低光数据集上PSNR提升0.58dB。

04:00
arXiv cs.CV

基于特征融合的多模态脑肿瘤分类

采用双分支多模态网络融合MRI与放射组学特征,门控融合策略准确率达96.13%,优于单模态基线。

04:00
arXiv cs.CV

密集声景中鸟类叫声的时频定位

将鸟鸣检测视为目标检测任务,用YOLO在密集热带声景中定位,新指标IoMin优于IoU,性能翻倍。

04:00
arXiv cs.CV

UniDexTok: 基于真实数据的统一灵巧手分词器

提出UniDexTok,无需重定向即可统一表达异质灵巧手,重建误差从厘米级降至亚毫米级(降低98%以上),具备零样本/小样本能力。

04:00
arXiv cs.CV

++nnU-Net:基于前缀的数据增强扩展nnU-Net

提出基于图像配准的++nnU-Net数据增强模块,在2D医学分割任务中Dice得分最高提升22%。

04:00
arXiv cs.CV

IMPACT:学习内模预测控制用于力量型机器人操作

IMPACT将力量任务解耦为任务规划与内模预测控制,提升成功率、泛化性、安全性与能效。

04:00
arXiv cs.CV

XtrAIn:训练引导的遮挡特征归因方法

XtrAIn将遮挡操作从输入空间转移至参数空间,避免基线偏差和归因偏移,生成更清晰可解释的归因模式。

04:00
arXiv cs.CV

几何感知的强化学习用于二维不规则排样

提出几何感知强化学习,用Polygons Transformer编码几何,结合CORL框架,在2D不规则排样中达到最优启发式性能。

04:00
arXiv cs.CV

灵巧点策略:从人类示范中学习基于点的灵巧手策略

从人类视频提取3D关键点训练自回归Transformer,无需机器人示范即可迁移灵巧手策略,真实任务成功率75%。

04:00
arXiv cs.CV

POPSICLE:冷冻电镜断层扫描中分割与定位的基准数据集

POPSICLE基准套件用于冷冻电镜断层扫描分割与定位,提供标准化评估,揭示任务间模型排名差异。

04:00
arXiv cs.CV

深度树张量网络

提出深度树张量网络,捕获高阶特征交互,树状拓扑参数共享,性能优于现有方法。

04:00
arXiv cs.CV

Visual-TCAV:基于概念的归因与显著性图实现图像分类事后可解释性

Visual-TCAV框架生成概念显著性图并估计归因,融合局部与全局解释,忠实度优于TCAV。

04:00
arXiv cs.CV

NoiseSDF2NoiseSDF: 从噪声监督中学习干净的神经场

受Noise2Noise启发,提出NoiseSDF2NoiseSDF,通过最小化噪声SDF间的MSE损失,从含噪点云隐式去噪学习干净神经场,显著提升重建质量。

04:00
arXiv cs.CV

基于蒸馏的单步残差移位扩散图像超分辨率方法

RSD蒸馏法实现单步图像超分辨率,感知质量优于教师模型和同类方法,计算成本低。

04:00
arXiv cs.CV

CleanPatrick:图像数据清洗基准

基于Fitzpatrick17k的首个大规模图像数据清洗基准,识别三类问题并提供评估框架。

04:00
arXiv cs.CV

LaRI:面向单视图3D几何推理的分层射线相交

LaRI从单张图像预测多层点图,一次前向传播完成遮挡几何重建,高效且视图对齐。

04:00
arXiv cs.CV

NuWa:面向边缘设备的轻量级类别特定视觉Transformer生成方法

NuWa提出自知识净化和闭式优化,为边缘设备高效导出类别特定轻量ViT,无需重训练,准确率提升29%,剪枝速度提升33倍,成本降低99.8%。

04:00
arXiv cs.CV

高效文本到图像生成中的成本感知路由

根据提示复杂度动态路由不同模型,最优平衡质量与成本,平均质量超越任何单一模型。

04:00
arXiv cs.CV

双流注意力引导学习用于弱监督全切片图像分类

提出双流注意力引导学习框架,通过教师-学生架构和伪标签,提升弱监督全切片图像分类的判别性能与鲁棒性。

04:00
arXiv cs.CV

低光照行人检测的自动标注

提出自动红外-RGB标注管线,生成标签训练模型在低光照行人检测上优于真实标签。

2026年6月9日
04:00
arXiv cs.CV

野外场景下的多模态群体情绪识别:迈向隐私安全的非个体方法

利用集体音视频信号,通过多模态融合与变分编码器实现隐私保护的群体情绪识别。

04:00
arXiv cs.CV

VisualLeakBench: 视觉-语言智能体中可复现的动作边界传播故障

VisualLeakBench基准测试发现,智能体从图像向工具参数传播敏感文本,基线传播率高达85.5%,防御后仍存风险。

04:00
arXiv cs.CV

NeuroAlign: 动态与结构神经影像的层次化多模态融合用于MCI分析

提出NeuroAlign框架,层次化融合fMRI与DTI,高效检测MCI/SCD,归因分析揭示多模态脑模式。

04:00
arXiv cs.CV

页面图像分类器:基于百年扫描档案微调实现内容特定处理

利用百年考古档案微调分类器,RegNetY-16GF达99.16%准确率,模型与数据集已开源。

04:00
arXiv cs.CV

SlideCheck:利用数据集分布指导病理基础模型的自监督预训练

SlideCheck通过显式异常性和恶性评分审计病理预训练数据,引导自监督ViT预训练,实现可控且高效的数据集构建。

04:00
arXiv cs.CV

SENTRY:软错误下视觉Transformer的统计可靠性分析

提出统计注入框架,以极少样本实现高置信可靠性分析,实验成本降低万倍,揭示少量比特翻转致灾难性精度崩溃。

04:00
arXiv cs.CV

你能否相信所见?人类与AI检测合成法律证据

人类与AI均难可靠识别合成法律证据,建议结合人工审查、AI筛查与来源认证。

04:00
arXiv cs.CV

全方位之眼:非结构化交通中基于等变特征学习的360度LiDAR感知设计与分析

提出360度LiDAR感知框架,结合扇形全景与旋转等变卷积,在非结构化交通中检测稳定,但对小目标仍有挑战。

04:00
arXiv cs.CV

视觉Transformer对抗性微调的机制分析

对抗性微调提升了ViT对已见图像损坏的鲁棒性,但未泛化到未见类型,也未改变稀疏表示。

04:00
arXiv cs.CV

AMN:一种用于细胞核分割的自适应多尺度融合网络,具有边界和不确定性建模

AMN网络融合Swin和ResNet,门控融合及多目标损失,CoNIC达到平均Dice 0.82,优于基线模型。

04:00
arXiv cs.CV

Crayotter:面向长视频编辑的可追踪多智能体工作流

Crayotter开源系统,通过可追踪工件实现多智能体阶段化长视频编辑与失败诊断,人类评分3.40/5,优于基线。

04:00
arXiv cs.CV

针对关键之处进行引导:基于Token级视觉敏感度引导的大视觉语言模型幻觉缓解方法

提出Token级视觉敏感度引导(TLVS),每步解码动态调整强度,只干预易幻觉token,显著缓解LVLM幻觉。

04:00
arXiv cs.CV

MOSS-Video-Preview:通过交叉注意力实现实时视频理解

提出双通道交叉注意力架构,实现感知与生成非阻塞运行,数据合成引导实时行为,解码速度提升约5倍。

04:00
arXiv cs.CV

基于锚点条件的景观图像生成组合控制

锚点条件微调框架用四维组合向量控制生成,检出率0.85,对齐0.817,精度依赖类别。

04:00
arXiv cs.CV

数据稀缺条件下合成图像没有免费午餐

数据稀缺和隐私敏感下,GAN和DDPM生成图像鲁棒性优于VAE,需多维评估。

04:00
arXiv cs.CV

可读却不可预测:视觉语言模型中的旋转结果预测

视觉语言模型能识别旋转后图像,却无法从原图推断旋转结果,预测准确率近乎为零。

04:00
arXiv cs.CV

视觉语言模型能感知传感器所感吗?一种可扩展的专家引导式轮椅可达性街景评估方法

专家引导视觉语言模型从街景图像评估轮椅可达性,结果与传感器行为数据部分一致,具可扩展性。

04:00
arXiv cs.CV

AVI-Bench:迈向类人音频-视觉智能的全能多模态大语言模型评测基准

提出AVI-Bench基准,评估全能多模态大语言模型的跨模态音频-视觉智能,发现模型局限并提出四层分类。

04:00
arXiv cs.CV

FineGen:基于VLM的多智能体细粒度图文数据集构建框架

FineGen通过协作生成-验证-纠正流程构建含14.7万硬负样本数据集,硬样本准确率提升14.4%。

04:00
arXiv cs.CV

DOME:从稀疏监督中学习可迁移领域变量以实现测试时适应

DOME通过显式结构化域表示,利用视觉语言预训练和稀疏域库,在测试时适应中超越复杂算法。

04:00
arXiv cs.CV

AQIFormer:基于Transformer的多视角跨城市空气质量分类架构

提出AQIFormer,融合前后视角与气象参数,多任务学习,跨城市分类精度达89.96%,泛化能力强。

04:00
arXiv cs.CV

神经外科医生需要看到的:从超声生成的合成术中MRI用于脑肿瘤手术中脑移位补偿

提出从超声生成合成MRI补偿脑移位的方法,配准误差降至5.86mm,提供术中MRI更新。

04:00
arXiv cs.CV

ViMax:智能体视频生成

ViMax通过多智能体协作与分层叙事引擎,实现长视频的叙事连贯与视觉一致。

04:00
arXiv cs.CV

液态神经网络作为动态三维高斯泼溅的即插即用连续时间形变场

用液态神经网络替代MLP作形变场,实现显式连续时间建模,提升高频关节运动重建质量。

04:00
arXiv cs.CV

面向视觉语言模型的动态人类偏好数据集

提出新基准评估VLM动态偏好理解,含自动化管道与数据集,测试了现有模型。

04:00
arXiv cs.CV

MM-Matryoshka:通过二维多模态套娃训练框架实现预算弹性视觉文档检索

提出二维套娃训练框架,实现预算弹性视觉文档检索,降存储计算开销保质量。

04:00
arXiv cs.CV

是否需要教基础模型什么是生成图像?基于分析谱自适应的无梯度生成伪影检测

无梯度法将检测转为OOD异常测量,冻结基础模型解耦统计语义偏差,零样本下优于梯度优化。

04:00
arXiv cs.CV

使用微调YOLOv8在边缘硬件上的实时工业缺陷检测:基于NEU与MVTec AD数据集的系统性基准测试及汽车电池制造扩展

提出Industrial-YOLO框架,在Jetson Orin上实现120FPS与98.5%mAP,零延迟部署于汽车装配线。