10961 条条目 · 106 个活跃源
2026年8月26日
04:00
arXiv cs.CV

DRRG:用于放射学报告生成的离散扩散框架

提出DRRG离散扩散框架用于放射报告生成,采用迭代去噪和修正,结合临床实体掩码与概念条件,优于自回归方法。

04:00
arXiv cs.CV

WeMM-Embedding:微信多模态嵌入技术报告

微信多模态嵌入模型(2B/4B/9B)基准领先,9B版SOTA80.6,已部署微信推荐搜索,代码开源

04:00
arXiv cs.CV

IterCAD:面向正交视图的CAD代码生成的迭代式程序修复

提出迭代修复框架,将正交视图到CAD生成变为渐进修复,反复分析差异决定修改或停止,提升代码可执行性与几何保真度。

04:00
arXiv cs.CV

低秩速度场作为无监督4D医学图像插值的结构先验

提出低秩速度场结构先验,约束运动至张量低秩空间,实现无监督四维医学图像插值,改善结构一致性与解剖轮廓。

04:00
arXiv cs.CV

用于4D医学图像插值的相位对齐有限傅里叶周期形变

提出相位对齐有限傅里叶周期形变,嵌入周期运动先验并重参数化时间,实现4D医学图像插值,在ACDC和4D-Lung上最优。

04:00
arXiv cs.CV

扩散与流模型中的表示学习:应用视角

综述扩散与流模型的表示学习应用,提出三层次框架,覆盖分类、感知等下游任务,展望未来方向。

04:00
arXiv cs.CV

中文标题

中文摘要

04:00
arXiv cs.CV

面向4D点云视频自监督学习的掩蔽点管联合嵌入预测

提出联合嵌入预测,以掩蔽点管潜在预测避免重建,学习时空特征,提升动作识别性能。

04:00
arXiv cs.CV

VisCache:面向高效视觉大语言模型推理的视觉KV缓存剪枝

免训练视觉缓存剪枝:关键帧筛选与分层剪枝协同,仅留19-28%缓存即获2.35倍加速,性能持平,新前沿。

04:00
arXiv cs.CV

ViSculpt:以视觉为中心的智能体几何编辑

无需训练的多智能体系统,通过Blender界面模拟人工操作,直接编辑3D网格,保持原始特征。

04:00
arXiv cs.CV

MatReplace:面向室内场景材质替换的无参考、条件对齐基准

MatReplace:无参考基准评估材质替换。发现名称驱动渲染已解决,像素理解仍是难题。

04:00
arXiv cs.CV

TransPhy:面向物理接地图像编辑的视觉上下文学习

提出物理接地视觉上下文编辑基准PhysVICL-74与TransPhy框架,通过规则归纳和混合专家渲染,提升物理规则遵循及泛化能力。

04:00
arXiv cs.CV

提示学习改变了什么?——视觉语言模型的自然语言概念分析

用固定自然语言词典稀疏表示文本嵌入,比较提示学习前后概念变化;变化大且与准确率提升正相关。

04:00
arXiv cs.CV

基于量规的视觉修复上下文自进化UI代码生成

发现UI转代码自进化中“视觉修复耦合”问题,提出RubSE框架,用量规结构化引导修复,显著提升六种模型和三个基准的稳定性和性能。

04:00
arXiv cs.CV

重新思考零样本跨城市目标检测中的预训练与数据增强

提出模块化训练,采用多数据集预训练和灰度世界变换,减少跨城市分布差异,在AI城市挑战赛中获第一。

04:00
arXiv cs.CV

基于图监督的层次化临床对齐用于大语言模型放射学报告生成

提出图监督层次化临床对齐,分层监督疾病与全局语义,用知识图谱提升放射报告临床一致性,超越更大模型。

04:00
arXiv cs.CV

PlaceSeek:基于语义锚定与情感对齐的城市户外场所人本地理空间检索

提出PlaceSeek框架,将自然语言查询映射到街景图像,分解功能与情感子意图,经语义验证和情感重排,检索准确率显著提升。

04:00
arXiv cs.CV

Syn2RealTrack:弥合合成数据与现实世界数据集差距的在线多视角多目标跟踪

分解合成-真实差距为三部分,重分配几何与外观信任,免重训练,在AICity2026 Track1获HOTA 52.01%。

04:00
arXiv cs.CV

EgoErrorVQA:通过程序性错误评估自我中心代理AI的理解能力

提出EgoErrorVQA任务,显式建模程序性错误,评估显示模型弱点;引入解耦推理框架,提升错误理解并取得最优。

04:00
arXiv cs.CV

基于定向距离场的事件运动估计

提出基于定向距离场的事件运动估计,以单步平均替代迭代优化,达亚像素低延迟,并用于去模糊与眼动追踪。

04:00
arXiv cs.CV

美在观者的ELBO中:面部感知中处理流畅性的变分解释

用变分自编码器在无标注人脸数据上发现,魅力评分与证据下界方向一致,且吸引力与原型性相关,支持流畅性理论。

04:00
arXiv cs.CV

NeoWorld-Pro:从单目图像编程交互式场景,用于具身模拟

NeoWorld-Pro将单目图像重建为程序化交互场景,基于多模态大模型与物理引擎迭代优化,支持堆叠与操控,优于现有方法。

04:00
arXiv cs.CV

密度图逆IFS重建的摊销式集合预测

摊销式逆IFS重建:单次前馈预测映射集,精确合成训练加测试时细化,优于逐图优化,真实图像提速12–2600倍。

04:00
arXiv cs.CV

SandwichQuant:量化前后哪些参数起作用?

揭示归一化仿射子空间为量化校正关键,提出量化前后两阶段校正,提升视觉与语言模型低比特量化性能。

04:00
arXiv cs.CV

保留还是丢弃?用于紧凑视频表示的自适应分词器

提出KATok自适应分词器,基于Transformer VAE按内容丰度丢弃无用token,实现数据相关压缩,并设计两种位置预测策略保证空间一致性,以更高压缩比提升重建与生成质量。

04:00
arXiv cs.CV

CARE:自适应激光雷达感知中用于首次发现的相机残差储备

CARE无训练分配法:预留射线预算给轨迹预测未覆盖的相机检测,首次发现召回率提升约5点,含安全遗忘模块。

04:00
arXiv cs.CV

关注学生:在线学习中自动参与度预测的行为与情境线索

融合多模态行为与情境线索,在主观性高的CASED数据集上实现校准不确定性预测,性能具竞争力。

04:00
arXiv cs.CV

SeMoCo:面向运动语言建模的语义优先运动编解码器

语义优先编解码器SeMoCo,令牌含语义与残差运动学,双轴生成器建模细化,重建最优,文本到运动有效。

04:00
arXiv cs.CV

基于示例的最小标注鲁棒异常检测:采用Exemplar Med-DETR

扩展检测模型,采用示例特征生成与域感知对比优化,仅需不到百分之十标注即可在胸片异常检测中达到接近最优性能。

04:00
arXiv cs.CV

融合对抗与协作学习的AI生成图像质量评估

提出交互感知框架,通过对抗与协作路径建模AI生成图像的感知保真与提示对齐的相互作用,实现最先进性能。

04:00
arXiv cs.CV

DoublesEval:利用职业双打羽毛球诊断视觉语言模型的多智能体战术推理

提出DoublesEval框架,以职业双打羽毛球诊断多智能体战术推理,发现各诊断层级均薄弱,TacticCheck测试时校验可稳定提升性能。

04:00
arXiv cs.CV

元数据感知的生成式基础模型自适应用于条件性 CMR 合成

用元数据提示微调潜扩散模型合成心脏磁共振,经三种策略优化,FID提升57%,仅靠元数据无需几何信息。

04:00
arXiv cs.CV

无标记姿态估计用于抗阻训练技术评估

用BlazePose从普通视频提取关节角度,评估抗阻训练动作,可支持实验室外生物力学评估。

04:00
arXiv cs.CV

ZODIAC:基于八叉树的零样本扩散用于解剖补全

提出零样本八叉树扩散补全腰椎,无需模拟训练,整合解剖先验与部分观测,提升真实遮挡下鲁棒性。

04:00
arXiv cs.CV

基于MRI的神经肌肉疾病深度影像组学表型:拓扑驱动的特征刻画

基于磁共振成像的拓扑影像组学,可量化神经肌肉疾病脂肪浸润架构,为鉴别诊断提供新型生物标志物。

04:00
arXiv cs.CV

B-MIM:面向细粒度解剖结构可泛化分割的偏置掩码图像建模

提出B-MIM偏置掩码建模,弱化全局语义、强化局部重建,提升CT细粒度结构分割泛化。

04:00
arXiv cs.CV

MaST:面向轻量级目标跟踪的运动感知稀疏流水线

提出运动感知稀疏跟踪器MaST,用运动先验与稀疏预测头实现轻量级最优,152FPS。

04:00
arXiv cs.CV

方差引导空间注意力融合:应对非对称传感器退化的鲁棒端到端驾驶

提出方差引导空间注意力融合,用密集可靠性门控和跨模态信任机制,应对非对称传感器退化,提升端到端驾驶鲁棒性。

04:00
arXiv cs.CV

面向可解释人脸识别的视觉语言模型融合

多视觉语言模型融合提升人脸识别精度与可解释性,融合分数、文本理由及图像,优于单个模型。

04:00
arXiv cs.CV

VizAnchor:通过双锚推理解码篡改可视化中的操纵意图

提出VizAnchor框架,用双锚证据与VLM推理定位篡改并推断误导意图。

04:00
arXiv cs.CV

面向手术器械分割的SAM层级原型记忆自适应

提出HPMA框架,利用多尺度原型记忆库与适配器增强SAM,解决提示退化瓶颈,实现手术器械分割SOTA性能。

04:00
arXiv cs.CV

面向Transformer微调的低秩三元适配

提出三元乘法适配,用低秩分解更新三元权重,无需反量化,保持三元域,性能优于基线。

04:00
arXiv cs.CV

X-MULTI:基于视觉语言模型的成像因子解缠用于因子感知图像合成

提出X-MULTI用视觉语言模型监督新因子组合,并改进FAA指标减少相关性泄漏,提升因子解缠评估。

04:00
arXiv cs.CV

ReGround-Surg:面向手术视频指称分割的可靠性引导锚点定位框架

提出轻量级可靠性引导锚定框架,改进SAM2手术视频指称分割,抑制错误锚点传播,在两个数据集上稳定超越现有方法。

04:00
arXiv cs.CV

基于可解释相互视觉注意的类人社会参与分析

受心理学启发显式建模二元视觉注意结合头部姿态与几何推理给出可解释的个体和群体参与度评估

04:00
arXiv cs.CV

KLTNet:学习稀疏特征跟踪,实现鲁棒准确的单目视觉惯性里程计

提出轻量级学习型稀疏特征跟踪器,用稠密光流与三帧块细化减少漂移,预测置信权重,提升视觉惯性里程计精度

04:00
arXiv cs.CV

迈向可靠的人工智能组织学染色:非配对生成模型中缩放与不确定性的系统研究

系统评估六种无监督模型在肝纤维化染色转换中的缩放与不确定性;感知、任务与一致性相互独立,需联合评估。

04:00
arXiv cs.CV

扩散模型中的在线策略自蒸馏

将图像级奖励引导转为显式去噪目标,在线策略自蒸馏提升扩散模型对齐效率与可分析性。

04:00
arXiv cs.CV

水下亚表层海藻森林分割的深度学习架构比较评估:Kelp-o-Tron

Kelp-O-Tron(DeepLabV3)分割性能最优,Dice=0.712,IoU=0.627。

04:00
arXiv cs.CV

基于自编码器潜在表示的图像差异量化

用自编码器潜在空间余弦相似度量化图像差异,优于像素级指标,与人类感知一致,准确率超98%。