11301 条条目 · 106 个活跃源
2026年6月8日
04:00
arXiv cs.CV

一致反演:面向结构保持视觉编辑的反向一致性引导

一致反演框架通过反向一致性引导校正早期去噪,无需训练提升结构保真度,仅增加少量推理开销。

04:00
arXiv cs.CV

TraRA: 面向城市监控视频文本检测的轨迹级识别聚合

提出TraRA,通过轨迹级时序与多模态聚合,提升监控视频文本识别的鲁棒性和准确性。

04:00
arXiv cs.CV

Reconstructing Multi-Decadal Forest Disturbances: A Spatio-Temporal Transformer Approach

04:00
arXiv cs.CV

CULTURESCORE:评估视频生成模型的文化忠实度

提出三维度文化忠实度评估框架,测试10国6千余视频,最佳模型仅56.8%,行为维度最差,凸显文化忠实度至关重要。

04:00
arXiv cs.CV

DualGate-Net:面向组织病理学细胞检测的先验门控双编码器框架

提出DualGate-Net,通过可学习先验门控融合双编码器与辅助分支,自适应调节组织先验,在OCELOT上提升细胞检测鲁棒性。

04:00
arXiv cs.CV

EvoGS:基于进化树构建连续分层高斯泼溅以实现可扩展3D流式传输

EvoGS首创连续分层高斯泼溅,通过进化树消除冗余,降低传输与显存,实现平滑自适应流媒体。

04:00
arXiv cs.CV

看不暴露:面向开放世界、渴求上下文的MLLMs自适应隐私控制

提出无训练APD方法,漂移隐私元素并锚定上下文,经AdaptShield评估,隐私与内容保留平衡提升约10%。

04:00
arXiv cs.CV

外观有帮助吗?在线3D多行人跟踪中基于图像重识别的系统研究

系统研究在线3D行人跟踪中图像重识别,轻量投影框架下,级联匹配优于线性融合,兼顾延迟与身份保持。

04:00
arXiv cs.CV

OPTIMUS-Prime:深度视觉模型的极小且充分概念解释

提出OPTIMUS框架,生成既充分又最小的概念热图,为深度模型预测提供形式化保证。

04:00
arXiv cs.CV

几何感知超图推理用于点云分割中的新类发现

提出超图框架建模高阶关联及几何感知原型,提升点云分割中新类发现的准确性。

04:00
arXiv cs.CV

AdaTok: 具有质量保持的动态令牌的自预算图像令牌化

AdaTok自预算动态令牌,平均118个令牌达高质量,生成吞吐量提升2.1倍。

04:00
arXiv cs.CV

ExMesh:具有拓扑适应性的显式网格重建

ExMesh通过集成可微优化与离散拓扑更新,实现显式网格自适应细化与纹理一致,平衡精度、效率与简洁性。

04:00
arXiv cs.CV

OpenGlass:用于设备端基于事件手势识别的开源智能眼镜

开源智能眼镜平台,模块化支持事件与帧相机,低功耗续航11.8小时,手势识别准确率83.94%。

04:00
arXiv cs.CV

AnchorWorld:基于视角演变定制的具身第一人称世界模拟

提出AnchorWorld框架,通过外部视角辅助训练和锚定视图定制,实现鲁棒的人-环境交互与动态世界演化,性能超越现有方法。

04:00
arXiv cs.CV

Dash2Sim:基于真实世界行车记录仪视频的闭环驾驶模拟

该框架将单目行车视频转为4D驾驶日志,创建含4244场景的基准数据集,发现工作区场景对学习型规划器极具挑战。

04:00
arXiv cs.CV

时空解耦适配器用于微手势在线识别

提出时空解耦适配器与自适应软平衡增强,解决微手势长尾分布,在挑战赛排名第一。

04:00
arXiv cs.CV

VeriDrive:用于高性价比视觉-语言规划的可验证反事实监督

VeriDrive框架通过结构化可验证反事实监督和选择性校正,降低视觉-语言规划成本并提升性能。

04:00
arXiv cs.CV

可持续且可解释的轮廓特征提取的变分矩不变量

引入变分矩不变量,融合区域、边界与切线几何,生成高判别力不变特征,配合轻量分类器实现高效高精度轮廓分类。

04:00
arXiv cs.CV

RealDocBench:面向真实世界监管文档的字段级问答与布局理解基准

发布真实监管文档字段级QA与布局理解双轨基准,评估18个系统,揭示隐藏的性能差异、医学难点及成本延迟权衡。

04:00
arXiv cs.CV

注意差距:解析视频实例分割中的性能瓶颈

诊断框架揭示VIS性能瓶颈:跟踪不稳定为关键,尤其在遮挡和长视频中,且属算法性问题。

04:00
arXiv cs.CV

野外有丝分裂检测:MIDOG 2025挑战中的多肿瘤与上下文感知泛化

MIDOG 2025挑战评估12种肿瘤多区域有丝分裂检测,挑战区假阳性增三倍,集成提升约1.5%,TTA无效,野外检测仍困难。

04:00
arXiv cs.CV

DisPOSE: 投影多随机扩散用于自监督多视角3D人体姿态估计

DisPOSE用扩散和可微投影分配多视角人体,超图解码器回归3D,性能最优且标签高效。

04:00
arXiv cs.CV

观看、记忆、推理:基于MLLM的人类视角视频理解

从人类视角提出视频MLLM框架,围绕观看、记忆、推理三个能力,梳理挑战、方法及应用。

04:00
arXiv cs.CV

DSU-Net:一种注意力增强的密集跳跃U-Net用于乳腺X线图像中的乳腺病变分割

提出注意力增强密集跳跃U-Net,在乳腺X线图像分割中达Dice 0.9421,准确可靠。

04:00
arXiv cs.CV

Skill-3D: 面向自主3D空间推理的自进化场景感知技能

Skill-3D通过场景记忆与技能库共进化,将3D空间推理工具利用率从39%提升至78%,显著增强智能体性能。

04:00
arXiv cs.CV

中文标题:检测差异:可解释性在关键之处

中文摘要:提出DnD方法,直接比较目标检测模型,揭示共享与差异错误,结合错误类型分析,引导可解释性关注关键示例。

04:00
arXiv cs.CV

基于流式力控制的流式视频生成

StreamForce实现因果统一的流式视频生成,支持连续力输入与实时响应,性能达到最优。

04:00
arXiv cs.CV

隐式数据合成:对比无监督数据增强

提出扰动网络权重生成对比样本,避免改变科学数据结构,实现无监督增强并提升性能。

04:00
arXiv cs.CV

UniSHARP: 通用锐化单目视图合成

提出UniSHARP,通过统一潜在空间和射线基表示实现跨相机系统单目视图合成,性能大幅领先。

04:00
arXiv cs.CV

面向生成式图形图表的语义-结构对齐

提出双重条件扩散框架,通过结构对齐和语义对齐生成艺术且数据一致的图形图表,优于传统方法。

04:00
arXiv cs.CV

实时注意力弯曲器:视频扩散变换器的细粒度交互式网络弯曲

该工具实现视频扩散变换器的实时细粒度交互操纵,提供模型材料亲密性,探索默认表征空间外的美学。

04:00
arXiv cs.CV

物理引导的深度学习先进洪水预测:融合UNet、FNO与SAR/光学影像

融合UNet与FNO及物理约束的多模态遥感框架,实现高精度、物理一致的洪水预测。

04:00
arXiv cs.CV

基于神经缩放定律的超声心动图心肌分割与灌注量化的计算最优网络设计

利用神经缩放定律优化小数据集心肌分割网络,性能达专家级,参数减少240倍。

04:00
arXiv cs.CV

T2LM:基于多句子的长期3D人体运动生成

T2LM用1D卷积VQVAE和Transformer从多句子生成平滑长期3D运动,无需序列数据,性能领先。

04:00
arXiv cs.CV

ErA:基于误差感知的深度展开网络用于单图像散焦去模糊

ErA联合学习核基与逐像素权重,通过误差感知项校正估计误差,在多个数据集上达到最优去模糊性能。

04:00
arXiv cs.CV

一种用于鲁棒六自由度抓取姿态估计的跨视图融合框架

提出跨视图融合框架,通过自监督对比学习增强点云特征一致性,结合圆柱集成模块,提升6-DoF抓取姿态估计鲁棒性。

04:00
arXiv cs.CV

ActionMap: 基于体素动作热图的机器人策略学习

ActionMap用体素热图动作头替代原解码器,提升VLA性能,在LIBERO和Franka上平均+8.2%,数据效率更高。

04:00
arXiv cs.CV

物理驱动的SAR图像飞机目标语义散射结构理解

提出物理驱动范式,定义语义关键点及可见性属性,构建S3U-SAR框架实现飞机目标完整拓扑重构。

04:00
arXiv cs.CV

基于权重空间元学习的机器人策略自适应

提出WIZARD框架,仅凭语言指令和演示视频生成LoRA参数,无需微调,大幅提升机器人策略适配性能。

04:00
arXiv cs.CV

超越普遍性:GCC-FER数据集与文化感知自适应的动态面部表情识别

提出跨文化DFER数据集GCC-FER及文化感知自适应系统,缓解文化偏见,提升多文化场景性能。

04:00
arXiv cs.CV

信号交叉口弱势道路使用者安全的集成路边感知与通信框架

本文提出集成多模态感知、边缘近失分析与V2X/P2X通信的框架,基于公开数据集验证VRU保护需求,支持非单一传感器方案。

04:00
arXiv cs.CV

超越后向散射:从检测SAR图像中提取InSAR相干性

提出深度学习框架,从检测SAR图像直接回归相干性,无需配准,精度优于传统方法,可泛化至全球数据。

04:00
arXiv cs.CV

AIDEN:针对视障人士的AI助手设计与初步研究

AIDEN通过多模态触觉-视觉反馈提升视障人士自主性,实验表明用户满意度高。

04:00
arXiv cs.CV

图像类别翻译:基于类别假设的可视化检查与翻译距离分类

利用图像翻译网络将输入转为类别假设,通过翻译距离分类,提升可解释性并揭示数据集偏差。

04:00
arXiv cs.CV

COMPOSE:用于多视角三维人体姿态估计的超图覆盖优化

COMPOSE将多视角3D人体姿态估计重构为超图精确覆盖优化,无需训练,精度比最优优化方法提升31个百分点。

04:00
arXiv cs.CV

MoDA:面向指令型多模态大模型细粒度视觉定位的调制适配器

MoDA轻量级调制适配器,通过通道级乘法调制增强指令型多模态大模型细粒度视觉定位,多个基准提升显著且计算开销极小。

04:00
arXiv cs.CV

挑战性立体图像中基于预训练模型的零样本多边形匹配用于姿态估计和多边形云

首个零样本多边形匹配方法,结合预训练模型与几何约束,无需训练即实现多边形匹配与姿态估计,性能领先。

04:00
arXiv cs.CV

可扩展的Transformer生成对抗网络

GAT通过潜空间训练和纯Transformer架构,辅以中间监督与宽度感知学习率,实现可扩展GAN,在ImageNet-256上仅需60轮达SOTA(FID 2.18)。

04:00
arXiv cs.CV

窥视:基于LoRA的高效编码器自适应方法用于少样本语义分割

提出TaP方法,利用LoRA轻量微调编码器,实现少样本语义分割的快速适应与性能提升,避免灾难性遗忘。

04:00
arXiv cs.CV

测量一致性的朗之万校正器用于稳定潜在扩散逆问题求解器

提出MCLC模块,通过测量一致朗之万更新缩小求解器与稳定反向扩散动态的差异,提升稳定性。