11101 条条目 · 106 个活跃源
2026年8月3日
04:00
arXiv cs.CV

TraceViT:用于视觉抽象推理的锚定轨迹监督

提出基于单调变换链的轨迹监督循环推理模型,在抽象推理基准上分别取得67.8%和24.3%的通过率。

04:00
arXiv cs.CV

CodeShrink:面向高效多模态代码理解的自适应视觉压缩

提出CodeShrink,通过无空白渲染、自适应配置和指令感知剪枝,减少视觉令牌最多71.2%,显著提升多模态代码理解效率。

04:00
arXiv cs.CV

面向黑暗环境下鲁棒且3D感知的RGB-NIR成像

提出3D感知神经融合模型,无需干净RGB监督,在3D空间隐式融合噪声RGB与NIR,恢复清晰图像,鲁棒且泛化强。

04:00
arXiv cs.CV

HierDoc:长文档视觉问答的页面到区域层级证据路由

提出层级证据路由框架,将页面与区域选择连接为两阶段预测,显著提升长文档VQA性能。

04:00
arXiv cs.CV

面向图像分类的域自适应深度联合信源信道编码

提出域自适应深度联合信源信道编码,用伪标签对抗对齐与对比学习应对分布偏移,提升目标域分类精度。

04:00
arXiv cs.CV

视觉生成中文本条件的缩放特性

据损失随提示结构化语言量的缩放规律,用图像标注构建结构化提示并训练提示器,超越开源、媲美闭源。

04:00
arXiv cs.CV

OASIS:基于3D高斯泼溅的遮挡感知单图像手部化身重建

提出基于三维高斯泼溅的遮挡感知单图手部重建方法,用可见性注意力和网格特征处理遮挡与形变,实现高效逼真重建。

04:00
arXiv cs.CV

Meshy T2:基于流匹配的快速原生网格生成

提出Meshy T2,用顶点集VAE与粗到细流匹配级联,实现快速原生网格生成,中位6秒完成图像到网格,比自回归方法快一个数量级。

04:00
arXiv cs.CV

基于二维断层成像的模拟异常检测

提出预测组织内异常成像质量的新技术,用于评估和设计射频断层成像传感器。

04:00
arXiv cs.CV

光流传感器:方向选择性仿生视网膜设计

光流传感器芯片结合DVS事件与时间差并行计算,功耗降303倍,延迟微秒级,数据量减3.3倍。

04:00
arXiv cs.CV

从非结构化点云进行各向异性表面近似的高维点嵌入流形学习

提出高维点嵌入中的流形学习方法,对无结构点云做各向异性表面近似,生成高保真紧凑网格,且可扩展。

04:00
arXiv cs.CV

AniCrafter:视频扩散模型中基于化身-背景条件化的逼真人物动画定制

AniCrafter提出化身-背景条件机制,将人物动画重构为修复问题,实现遮挡感知,在开放域动态背景中优于现有方法。

04:00
arXiv cs.CV

RayViT:面向视角鲁棒模仿学习的射线条件视觉表示

提出射线条件ViT,注入相机几何,视角扰动下模仿学习鲁棒性提升约13个百分点。

04:00
arXiv cs.CV

FibVLA:一种基于斐波那契采样的高效时序视觉-语言-动作模型

提出新框架,用对数事后采样和斐波那契递归推理高效捕获长时序,动作更平滑、成功率更高,实时性优于视频基线。

04:00
arXiv cs.CV

对比学习用于图像复杂度表征

提出CLIC框架,用对比学习表征图像复杂度,创新随机裁剪混合生成多尺度正样本,性能媲美监督方法,并可提升视觉任务表现。

04:00
arXiv cs.CV

So-Fake:社交媒体图像伪造检测的基准评测与可解释性

提出So-Fake-Set数据集(200万图像)、OOD基准及强化学习检测框架So-Fake-R1,检测精度提升1.3%,定位IoU提升4.5%。

04:00
arXiv cs.CV

ST-WAM:语义-时间世界动作模型,应对视觉分布偏移下的稳健操控

提出ST-WAM,用DINOv3语义表征预测未来与检索历史,零样本视觉偏移下成功率提升21.3个百分点,突破像素生成局限。

04:00
arXiv cs.CV

MoPET:用于统一医学图像分类的参数高效混合专家

MoPET以稀疏路由选低秩专家,共享容量并抑制跨域冲突,统一医学图像分类,优于独立适配器。

04:00
arXiv cs.CV

CBCT-IQ:用于图像质量评估与基准测试的公开带标注锥束CT数据集

首个公开CBCT图像质量标注数据集,含1764个切片和专家四级评分,基准测试26种质量评估方法。

04:00
arXiv cs.CV

BWM:面向机器人学习的低成本高保真世界模拟器

提出BWM动作条件世界模型,兼作数据引擎与策略评估器,提升保真度,世界竞技场三项第一。

04:00
arXiv cs.CV

一种实现STEM课堂环境中学生个体参与度实时测量的生物特征传感器网络

提出生物特征传感器网络,用于STEM课堂学生个体参与度实时非侵入式测量,设备端处理保护隐私。

04:00
arXiv cs.CV

几何可观测性指数:SE(3)位姿估计中的影响、Fisher信息与弱可观测性

提出几何可观测性指数,证明其等于影响函数与信息矩阵,并揭示残差门控的鲁棒性机制。

04:00
arXiv cs.CV

快速特征场(F³):事件的一种预测性表示

提出F³事件表示,预测未来事件以保留场景结构与运动,高效鲁棒,在光流、语义分割和深度估计上达到最优。

04:00
arXiv cs.CV

JoVA:面向视频-音频联合生成与编辑的统一多模态学习

JoVA以双分支架构原生联合表示视频、音频和文本,统一生成与编辑,免去对齐模块,性能达SOTA。

04:00
arXiv cs.CV

AREA3D:统一前馈三维感知与视觉语言引导的主动重建智能体

提出主动重建智能体AREA3D,融合前馈感知与视觉语言引导,高效选择视点,重建精度领先。

04:00
arXiv cs.CV

EMAG:基于指数移动平均引导的自校正扩散采样

提出EMAG,无需训练的自校正扩散采样法,通过自适应层选择增强负样本,提升生成质量,人类偏好分比CFG高0.46。

04:00
arXiv cs.CV

渐进式棋盘格用于自回归多尺度图像生成

提出渐进式棋盘格排序,实现自回归多尺度图像生成中的并行采样与序列条件平衡,在更少步骤下达到先进性能。

04:00
arXiv cs.CV

面向胎儿超声解读的认知感知视觉-语言基础模型

提出胎儿超声AI,用知识图与强化学习解耦视图-疾病关联,百万级数据训练,在报告生成与诊断上显著领先。

04:00
arXiv cs.CV

基于KAN隐式神经表示的可变形医学图像配准

提出两种基于KAN的隐式神经表示方法实现无需训练的高精度可变形配准稳定性好且开销低

04:00
arXiv cs.CV

WaMo:面向细粒度文本-运动检索的小波增强多频轨迹分析

提出小波增强多频轨迹分析框架WaMo,捕捉关节时空细节,实现细粒度文本-运动检索,大幅超越现有方法。

04:00
arXiv cs.CV

矩核:深度卷积网络中旋转和反射等变性的一种简单可扩展方法

提出矩核,以径向函数与坐标乘积表示O(d)等变卷积核,避免群卷积扩展,提升医学图像方向一致性。

04:00
arXiv cs.CV

揭秘视频推理

视频模型推理主要源于扩散去噪步骤,而非帧间;发现链式步骤机制及多种涌现行为,并提出免训练集成方法提升推理。

04:00
arXiv cs.CV

ActionParty:生成式视频游戏中的多主体动作绑定

提出多主体世界模型,用主体状态令牌解耦渲染与个体控制,可同时控制七个玩家,提升动作跟随与身份一致性。

04:00
arXiv cs.CV

提示重注入:缓解多模态扩散变换器中文本到图像生成的提示遗忘

针对多模态扩散变换器的提示遗忘,提出免训练提示重注入,将早期提示表示注入深层,缓解遗忘,提升指令遵循与生成质量。

04:00
arXiv cs.CV

步骤级视觉锚定忠实度预测长程视觉语言模型的分布外泛化

长程视觉语言模型中,步骤级视觉锚定忠实度预判分布外泛化(相关系数0.83),与规模准确率无关,是独立能力维度。

04:00
arXiv cs.CV

基于人体网格与骨骼恢复的经胸远程超声自动初始探头放置方法

提出利用人体网格与骨骼恢复的框架,实现自动配准及初始探头放置引导,经5名志愿者验证误差可接受。

04:00
arXiv cs.CV

距离感知软提示引导的多模态效价-唤起估计

提出距离感知软提示引导,用高斯核软标签与层级融合进行多模态VA估计,在Aff-Wild2上优于基线。

04:00
arXiv cs.CV

推理时轨迹优化用于保持结构的漫画图像编辑

提出无训练轻量轨迹校正法,使预训练编辑模型适配漫画,保留全局结构,改善文本移除与网屏合成,耗时仅增约11%。

04:00
arXiv cs.CV

I3DM:面向一致视频场景生成的隐式三维感知记忆检索与注入

提出隐式三维感知记忆机制,以三维对齐检索注入,提升重访一致性与相机控制精度。

04:00
arXiv cs.CV

PhyUnfold-Net:物理引导深度展开推进遥感变化检测

以奇异值熵为先验,物理引导深度展开分解变化与干扰,经频谱抑制和分段约束,提升遥感变化检测精度。

04:00
arXiv cs.CV

TRACE:基于有形重建和几何对齐上下文视频掩蔽的高保真3D场景编辑

TRACE:网格引导的3DGS编辑,几何对齐与视频掩蔽实现高保真、多视角一致的场景编辑。

04:00
arXiv cs.CV

Dynamic Execution Commitment of Vision-Language-Action Models

04:00
arXiv cs.CV

Leveraging Image Generators to Address Data Scarcity: The Gen4Regen Dataset for Forest Regeneration Mapping

04:00
arXiv cs.CV

评估GeoAI解释与卫星洪水制图中领域知识的一致性

提出一种评估框架,用量化方法检验深度学习解释与遥感领域知识的一致性,提升模型可解释性。

04:00
arXiv cs.CV

CREST: Curvature-Regulated Event-Centric Sampling for Efficient Long-Video Understanding

04:00
arXiv cs.CV

MolSight:面向统一化学图像理解的图感知视觉-语言模型

提出图感知视觉语言模型MolSight,融合分子拓扑与语义对齐,显著提升化学图像理解性能。

04:00
arXiv cs.CV

Teaching Video Generators to Remember: Eliciting Dynamic Memory for Out-of-Sight State Evolution

04:00
arXiv cs.CV

MI-CXR:多时间区间胸部X光纵向推理基准

提出MI-CXR基准,评估多访视胸部X光纵向推理,含三类任务;14个视觉语言模型平均准确率仅29.3%,暴露时序组合推理缺陷。

04:00
arXiv cs.CV

多模态扩散Transformer中概念遗漏的诊断与纠正

通过线性探针发现文本嵌入中的“遗漏信号”,提出OSI放大该信号,显著缓解多模态扩散模型的概念遗漏。

04:00
arXiv cs.CV

反提示:针对文本引导的图像到视频生成的图像保护

提出Anti-Prompt方法,注入不可感知扰动破坏文本引导视频生成,利用模型对文本依赖,实现高效跨模型保护。