11301 条条目 · 106 个活跃源
2026年6月17日
04:00
arXiv cs.CV

当大语言模型分析疤痕:从图像到有临床意义的特征

ScaFE框架利用LLM生成特征提取代码,将疤痕图像转为临床评分特征,实现数据高效、隐私保护且可解释。

04:00
arXiv cs.CV

ReAge3D:具有视角一致性的3D人脸重回春

提出ReAge3D框架,利用DiffReaging模型和中心外向传播策略,实现多视角一致的3D人脸重回春,效果优于现有方法。

04:00
arXiv cs.CV

重新审视面向3D CT报告生成的LLM适配:一项关于规模与诊断先验的研究

提出RAD3D-Prefix框架,冻结大LLM仅训练轻量投影层,在3D CT报告生成中实现高效且泛化强。

04:00
arXiv cs.CV

EgoCS-400K:面向世界模型的自我中心游戏数据集

EgoCS-400K是大型自我中心CS游戏数据集,含40万+第一人称视频和1万小时数据,用于未来预测、状态事件展开等交互视觉建模。

04:00
arXiv cs.CV

分辨率不变的自适应体积极力学属性场

AdaVoMP用稀疏自适应体素和transformer预测3D力学属性,分辨率提升16^3倍,更准更高效。

04:00
arXiv cs.CV

EventDrive:用于视觉-语言驾驶智能的事件相机

EventDrive基准与模型将事件相机融入驾驶智能,通过事件金字塔和混合专家模块显著提升时间精度和鲁棒性。

04:00
arXiv cs.CV

统一多模态自回归建模:共享上下文-视觉分词器是实现统一的关键

UniAR通过共享视觉分词器统一理解与生成,并行位预测加速,扩散解码高质量图像,性能领先。

04:00
arXiv cs.CV

MOCHI:协作性人物交互中的运动增强

MOCHI两阶段框架增强协作人物交互数据:优化手部抓取,扩散细化全身运动,生成物理合理序列。

04:00
arXiv cs.CV

未来动态三维重建:一种解耦自我运动的三维世界模型

FR3D世界模型解耦自我运动与场景演化,通过教师-学生蒸馏实现未来动态三维重建的几何一致性与零样本泛化。

04:00
arXiv cs.CV

Predicting Immune Biomarkers with MultiModal Mixture-of-Expert Pathology Foundation Models Empowers Precision Oncology

04:00
arXiv cs.CV

面向开放森林观测站的神经树木重建

OFO利用NeRF改进森林3D重建,提升地图质量,支撑碳汇监测等气候应用。

04:00
arXiv cs.CV

Edit3DGS:基于2D指令引导扩散与3D高斯泼溅的动态头部编辑统一框架

融合2D指令扩散与3D高斯泼溅,实现动态头部可控编辑,生成高保真、时序一致的3D头像。

04:00
arXiv cs.CV

MODE-RAG:流形异常诊断与基于能量的检索增强生成评估

提出MODE-RAG多智能体系统,利用变分自由能和注意力动态干预,有效减少多模态幻觉,提升鲁棒性。

04:00
arXiv cs.CV

GASE:基于高斯泼溅的重构具身仿真环境的自动化系统

GASE利用全景相机阵列与姿态策略,自动构建高保真仿真环境,分割精度提升10%+,真实部署性能差距低于10%。

04:00
arXiv cs.CV

MagicSim:可执行具身交互的统一基础设施

MagicSim构建可执行世界,统一控制、技能与规划,实现自动轨迹生成与交互评估。

04:00
arXiv cs.CV

中文标题:标注万物:面向机器人操作的3D资产自动标注

中文摘要:提出AnnotateAnything框架,自动为3D资产生成可执行操作标签,提升仿真数据收集效率与任务成功率。

04:00
arXiv cs.CV

中文标题

两阶段微调ResNet50实现皮肤镜图像黑色素瘤高敏检测,敏感度87.56%、AUC 0.956,较单阶段提升超4%。

04:00
arXiv cs.CV

对比动作-图像预训练用于视觉运动控制

CAIP利用第一人称视频中手部关键点作为动作代理,通过对比学习预训练,在少量机器人数据上实现超30%性能提升。

04:00
arXiv cs.CV

通过自监督学习对胫骨平台骨折进行分型:一种无标签框架与专家验证

无标签自监督学习从X光片发现4个骨折表型,专家验证其一为粉碎性,独立于传统分类。

04:00
arXiv cs.CV

异构移动机器人上的非接触式呼吸监测:一种多模态边缘计算框架

提出模态自适应非接触呼吸监测框架,在异构机器人上跨平台泛化,多模态覆盖0-8米无需算法重调。

04:00
arXiv cs.CV

Where Should Action Generation Begin? A Learnable Source Prior for Generative Robot Policies

04:00
arXiv cs.CV

ERQA-Plus:具身AI推理的诊断基准

ERQA-Plus是具身AI推理诊断基准,含1766问答实例,揭示最强模型在空间推理等方面的缺陷。

04:00
arXiv cs.CV

MuseVLA:一种自适应多模态感知的视觉-语言-动作模型用于机器人操作

MuseVLA集成多传感器工具,生成传感器令牌与描述,采用统一表征融合,在机器人操作任务上达80.6%成功率,显著优于基线。

04:00
arXiv cs.CV

NTIRE 2024图像超分辨率(x4)挑战赛:方法与结果

综述NTIRE 2024四倍超分挑战,无资源限制,PSNR评估,199人20队参与,推动单图超分性能并展示趋势。

04:00
arXiv cs.CV

ED3R: 面向协作机器人的能量感知分布式灾害检测

ED3R框架实现层级协同决策,野火检测成功率97.18%,能耗降36.4%,检测提速41%。

04:00
arXiv cs.CV

Qwen-RobotManip技术报告:对齐解锁机器人操作基础模型的规模化能力

Qwen-RobotManip通过统一对齐框架整合异构数据,实现规模化训练,获得零样本泛化能力,在多个OOD基准上显著超越先前模型。

04:00
arXiv cs.CV

粗制品悖论:AI重写放射学报告中合成标准化如何侵蚀临床不确定性与跨模态对齐

AI重写报告时,标准化清理文本反而大幅降低图像-文本对齐,退化主因是任务类型而非临床内容。

04:00
arXiv cs.CV

Qwen-RobotNav技术报告:面向智能体导航系统的可扩展导航模型

提出Qwen-RobotNav可扩展导航模型,参数化接口支持推理时动态配置,多任务联合训练达SOTA,零样本泛化真实机器人。

04:00
arXiv cs.CV

混合片曲面:一种用于光滑曲面拟合的无缝显式表示

提出混合片曲面,一种紧凑无网络的光滑显式表示,通过代理网格与多项式映射混合优化实现光滑拟合,无需输入参数化。

04:00
arXiv cs.CV

Colab NAS:遵循奥卡姆剃刀原理获取轻量级任务特定卷积神经网络

ColabNAS用免费GPU服务,3.1小时即可在TinyML基准上取得SOTA,实现低成本轻量级网络搜索。

04:00
arXiv cs.CV

看见不等于筛查:针对智能体技能扫描器的多模态隐藏指令攻击

现有扫描器忽视图像隐藏指令盲点,提出SkillCamo攻击与ExecScan防御,提升多模态安全检测性能。

04:00
arXiv cs.CV

服务计算中基于风格化标志的高效查询视频对抗攻击

提出黑盒视频攻击框架SLA,三阶段生成自然对抗样本,超越现有方法。

04:00
arXiv cs.CV

NTIRE 2025图像超分辨率(x4)挑战赛:方法与结果

NTIRE 2025举办4倍超分挑战,设恢复与感知两赛道,286人注册,25队参赛,总结方法推动SR发展。

04:00
arXiv cs.CV

警惕混叠——信号保持对鲁棒图像恢复至关重要

提出BOA-Restormer,在频域处理下采样和上采样以避免混叠,以低成本提升鲁棒性。

04:00
arXiv cs.CV

SceneCompleter:用于生成式新视角合成的密集3D场景补全

提出双流扩散模型在RGBD潜空间完成3D补全,生成几何一致的新视角。

04:00
arXiv cs.CV

TextMesh4D:零样本文本到4D网格生成

首个零样本文本转4D网格框架,通过雅可比变形场与局部-全局语义正则化,实现高保真动态网格生成,单卡24GB GPU高效运行。

04:00
arXiv cs.CV

4DSloMo:基于异步捕获的高速场景4D重建

提出异步捕获与扩散模型修复方法,用低帧率相机实现高速场景4D重建。

04:00
arXiv cs.CV

4D表示的最新进展:几何、运动与交互

综述4D表示在几何、运动与交互方面的进展,指导选择与定制合适表示,涵盖NeRF、3DGS、LLM/VFM及数据集现状。

04:00
arXiv cs.CV

BusterX++:迈向基于MLLM的统一跨模态AI生成内容检测与解释

BusterX++统一检测图像与视频AI生成内容,发现单阶段纯RL策略优于SFT+RL,通过高策略熵实现跨模态能力转移,达SOTA。

04:00
arXiv cs.CV

Detail++:文本到图像扩散模型的无训练细节增强器

提出无训练框架Detail++,通过渐进式细节注入与质心对齐损失,显著提升多对象复杂提示的生成质量。

04:00
arXiv cs.CV

有效的Gaussian管理用于高保真物体重建

提出Gaussian管理框架,通过选择性激活、自适应表示和鲁棒法线蒸馏,以更少参数实现高保真外观与几何重建。

2026年6月16日
04:00
arXiv cs.CV

FairGen:面向人口统计学公平的医学图像合成的偏好对齐扩散模型

FairGen通过医生偏好对齐的扩散模型,合成群体平衡的医学图像,在多项任务中公平性提升高达95.9%,同时保持诊断准确率。

04:00
arXiv cs.CV

通过K近邻实现卷积与注意力的插值

提出ConvNN框架,统一卷积与自注意力为k近邻聚合的特例,实现局部与全局聚合的连续谱。

04:00
arXiv cs.CV

稳态强制:在长时域自然视频扩散中平衡空间持久性与运动连续性

提出Steady-Forcing框架,融合视觉锚点与运动记忆,实现长时域视频生成中背景与运动的平衡。

04:00
arXiv cs.CV

FUSE:通过贝叶斯融合认知与偶然不确定性量化视觉-语言模型的不确定性

FUSE框架贝叶斯融合两种不确定性,精准量化VLM输出正确性,达最先进校准水平。

04:00
arXiv cs.CV

用于足球动作预测的输入条件槽查询分层GRU

提出分层GRU模型,利用输入条件槽查询、频率加权匹配和高斯软目标,预测5秒后10类动作,mAP达17.91%。

04:00
arXiv cs.CV

人工智能用于海上安全:CNN与视觉Transformer架构在海上目标检测中的比较评估

研究评估CNN与ViT等模型在海上目标检测中的性能,ViT达100%准确率,适用于海上监视与自主导航。

04:00
arXiv cs.CV

BBR-Net: 面向连续医学图像分割的边界平衡重放方法

提出BBR-Net,通过边界平衡重放保留解剖结构,正向任务有效,反向因初始数据质量差失效,结构可靠性决定重放效果。

04:00
arXiv cs.CV

RAMS:面向嵌入式边缘感知的资源自适应与检测条件模型切换

RAMS轻量级控制器动态切换YOLOv8模型,检测条件策略防止降级,实现5.6倍加速与74%精度保留。

04:00
arXiv cs.CV

基于分歧的跨模型路由用于隐式视频问答

提出无训练跨模型路由方法,利用模型分歧路由不同模型,隐式视频问答准确率提升1.43%。