11241 条条目 · 106 个活跃源
2026年7月9日
04:00
arXiv cs.CV

ProMoE-FL:面向缺失模态的多模态联邦学习的原型条件专家混合

提出基于原型条件专家混合框架,动态合成缺失特征,在公共X光数据集上超越现有方法。

04:00
arXiv cs.CV

LipSSD:用于对抗鲁棒目标检测的Lipschitz约束单次检测

提出LipSSD,通过Lipschitz约束实现鲁棒目标检测,与对抗训练互补,提升检测鲁棒性并保持精度。

04:00
arXiv cs.CV

MiLSD:面向资源受限设备的微型线段检测器

提出MiLSD,在亚兆字节预算下用紧凑网络实现线段检测,1MB内将sAP10从10.6提升到24.1,支持8位量化。

04:00
arXiv cs.CV

NLPCC 2026共享任务1概述:难度感知的多语言多模态医学教学视频理解评估

提出DA-MIVQA任务,按证据难度区分简单与复杂问题,含三个赛道,评估医学教学视频问答系统。

04:00
arXiv cs.CV

反事实公平的图像分类器是否满足群体公平?——一项理论与实证研究

通过新数据集发现反事实公平不保证群体公平,因存在相关但不因果的潜在属性,提出CKD方法可使其满足。

04:00
arXiv cs.CV

SpaR3D-MoE: 自适应稀疏视图三维空间推理与几何归纳混合专家模型

提出SpaR3D-MoE框架,通过自适应时空采样与几何归纳MoE,从稀疏RGB输入实现三维空间推理,在VSI-Bench等任务达SOTA,平均分63.5。

04:00
arXiv cs.CV

动态少步:统一动态计算与少步蒸馏的高效视频生成

提出动态少步加速框架,联合优化去噪步数与模型稀疏,实现30倍加速并保持生成质量。

04:00
arXiv cs.CV

像素级精确可解释的胁迫指数化:一种用于田间作物病害严重程度量化的语义分割框架

提出统一深度学习框架,实现病害严重程度量化,U-Net达98.2%像素精度,严重度指数与专家标注高度相关(r=0.968)。

04:00
arXiv cs.CV

CoFINN:面向守恒定律物理问题的守恒通量信息神经网络

CoFINN将有限体积守恒通量嵌入CNN训练,提升可压缩流场预测精度,阻力误差降低34%(平均15%),小数据场景下尤为显著。

04:00
arXiv cs.CV

AI for Cultural Heritage Textiles: Fine-Tuned Latent Diffusion for Novel Ulos Motif Synthesis

04:00
arXiv cs.CV

URS-Stereo:面向实时立体匹配的不确定性引导残差搜索

提出不确定性引导残差搜索模块,自适应调整搜索区域,提升粗到细立体匹配的鲁棒性,保持实时性能。

04:00
arXiv cs.CV

CoMind:多视角与多心智下的协作人类活动理解

新数据集整合多模态数据,支持协作中心智理论分析,建立三项基准任务促进行为建模。

04:00
arXiv cs.CV

几何坍缩:当视觉模型无法验证物理因果性

提出“几何坍缩”现象:深度预测模型受物理不合理边缘干扰,全局错误修复仅47%,缺乏因果验证机制。

04:00
arXiv cs.CV

检索与精炼制胜噪声票据:扩散模型运动生成中的对齐优化

提出WINRO框架,无需训练通过检索优化噪声票据,提升文本-运动对齐与语义一致性。

04:00
arXiv cs.CV

基于全分辨率全卷积循环神经网络的栅格化分类点云铁路轨道提取

提出用全分辨率全卷积循环神经网络从栅格化点云提取铁路轨道,合成数据训练,去噪后提取中心线,实现高质量自动化。

04:00
arXiv cs.CV

WildCity:一个真实世界城市规模的渲染、仿真和空间智能测试平台

WildCity是城市级真实多模态数据集,含18条平均84km轨迹,挑战包括动态物体等,推动城市规模渲染与空间智能。

04:00
arXiv cs.CV

Gen4U: 通过扩散模型统一视频生成与理解

Gen4U利用扩散模型中间表示,无需微调即可实现视频生成与理解的统一,保持强感知性能。

04:00
arXiv cs.CV

良好初始化是忠实视觉归因的关键

提出CoPAIR和TRACE两种前向方法,实现紧凑top-k掩码忠实归因,在多个模型上达SOTA,修复率达94-96%。

04:00
arXiv cs.CV

SPEAR:面向逼真具身AI研究的模拟器

SPEAR通过Python库连接Unreal Engine,提供超1.4万函数与73fps渲染,支持多种真值图像及复杂工作流图。

04:00
arXiv cs.CV

面向嵌入式事件视觉的硬件感知图神经网络剪枝

提出硬件感知剪枝与量化策略,在FPGA上优化图神经网络,BRAM减少26.5%-31.4%,精度下降仅1.65%-5.18%。

04:00
arXiv cs.CV

Ensemble Deep Learning Approaches for AI-Altered Video Detection

04:00
arXiv cs.CV

Video2Reaction:野外视频到观众反应分布的映射

提出Video2Reaction数据集,用开源LLM标注观众情感分布,微调模型达77% Top-3 F1,但预测集体反应仍具挑战。

04:00
arXiv cs.CV

自监督预训练提升点云叶片-木材分割的跨地点和跨尺度鲁棒性

自监督预训练提升点云木质分割鲁棒性,木材IoU提高约10%,体积估计误差减半至2.40m³。

04:00
arXiv cs.CV

ReMoDEx:一种面向大规模图像数据集的、基于局部到全局相关性的模型决策可解释性框架

ReMoDEx框架结合局部与全局解释,可规模化评估分类决策,发现快捷学习问题,弥补传统指标不足。

04:00
arXiv cs.CV

智能剪刀:面向嵌入式硬件的空间冗余缩减与CNN压缩联合方法

动态裁剪减少空间冗余,联合压缩CNN三维,计算量降41.5%且准确率提升0.3%。

04:00
arXiv cs.CV

Compass:前列腺癌检测需要多视角上下文

提出Compass方法,整合旋转超声视频与活检帧,用transformer聚合证据,提升前列腺癌检测性能。

04:00
arXiv cs.CV

LoCA:视觉基础模型的空间感知低秩卷积适应

LoCA解耦通道与空间,实现卷积感知低秩微调,性能优异。

04:00
arXiv cs.CV

关注重点:病灶感知的高分辨率图像块发现与融合用于胸部X光报告生成

提出LePaX框架,通过可学习空间分配与全局区域融合,在不增加视觉令牌下实现高效高分辨率胸片感知,提升诊断质量并减少令牌用量。

04:00
arXiv cs.CV

基于动态质量感知的通用不完整多模态学习

提出GIML框架,通过动态质量感知统一处理模态缺失与退化,提升鲁棒性与泛化性。

04:00
arXiv cs.CV

Bi-PT: 基于双向交叉注意力点变换器的稀疏心脏MRI数据四腔心重建

提出Bi-PT,通过双向交叉注意力学习特征,结合神经ODE变形场,从稀疏MRI点云准确重建四腔心网格。

04:00
arXiv cs.CV

SHTA:半监督医学图像分割中的语义难token校正与中心对齐

SHTA通过难token校正和中心对齐,提升半监督分割中难区域的语义一致性,不增推理成本。

04:00
arXiv cs.CV

TRACE-Seg3D:机构偏移下鲁棒三维胶质瘤分割的反事实上下文审计

提出反事实上下文审计框架,量化预测稳定性,暴露传统指标遗漏的失败模式,提升3D胶质瘤分割鲁棒性。

04:00
arXiv cs.CV

AT-Attn:面向纵向多模态阿尔茨海默病诊断的时间感知交叉注意力模型

提出AT-Attn框架,通过时间编码与非对称交叉注意力融合MRI与纵向临床数据,诊断准确率达0.719,优于基线,验证了时序约束融合策略的临床价值。

04:00
arXiv cs.CV

导航层次:脑图上的双曲学习用于疾病诊断

提出双曲脑图学习框架,建模ROI-社区-全脑层次,结合GaMamba捕获拓扑依赖,优于现有方法并识别生物标志物。

04:00
arXiv cs.CV

中文标题:在对话式图像编辑中使隐式保留意图显式化

中文摘要:提出OCCUR-Bench基准和ReSpec框架,显式化隐式保留意图,提升图像编辑恢复保真度和时间一致性。

04:00
arXiv cs.CV

HPR-SAM:面向无提示SAM的医学图像分割的层次概率表示学习

提出层次概率表示框架,通过分布、多组件及局部可靠性表示及分层融合,实现无提示医学图像分割SOTA。

04:00
arXiv cs.CV

EdgeCompress:面向EdgeAI的多维模型压缩与动态推理耦合方法

EdgeCompress通过动态裁剪、复合压缩与动态推理,降低ResNet-50计算量48.8%并提升精度0.8%,优于现有压缩框架。

04:00
arXiv cs.CV

SpiS-GAN: 基于螺旋调制与星形操作的笔迹合成

SpiS-GAN用星形螺旋块捕捉轨迹,螺旋判别器检测缺陷,边缘损失提升清晰度,显著超越SOTA并降低识别错误率。

04:00
arXiv cs.CV

基于3D感知大语言模型的自我视角人体运动预测

Ego3DLM利用3D场景感知与跨模态单次推理,统一预测姿态和动作语言,达到最优性能。

04:00
arXiv cs.CV

AnchorPrune:相关性锚定的上下文扩展用于视觉令牌剪枝

提出无训练框架,先构建相关性锚点再扩展上下文,避免冗余,高效压缩视觉令牌,保持97.6%性能。

04:00
arXiv cs.CV

面向CLIP密集开放词汇预测的稀疏注意力机制

替换CLIP自注意力为α-entmax,稀疏化并隐式去噪,提升密集开放词汇预测性能。

04:00
arXiv cs.CV

面向主体驱动的个性化文本到图像生成的阶段感知适应与分布校准

SPaRa-DCAL框架通过阶段感知低秩适应与分布校准候选选择,强调评估需兼顾身份、文本与多样性。

04:00
arXiv cs.CV

ASFR-Net:面向异构遥感影像变化检测的对抗对齐与空间-频率精化网络

提出ASFR-Net,通过对抗对齐与空频精化消除模态差异,构建新基准VisNIR-HCD,在异构遥感变化检测中达SOTA。

04:00
arXiv cs.CV

ColorFM:基于流匹配的颜色迁移优化到学习框架

ColorFM框架通过流匹配连接优化与学习,实现精确、语义一致的颜色迁移,效果优于现有方法。

04:00
arXiv cs.CV

TACoS: 从涂鸦标注到精确分割的二维材料弱监督学习

提出TACoS框架,用<0.6%标注数据实现二维材料精确分割,性能达全监督96%以上。

04:00
arXiv cs.CV

PUF:即插即用的不确定性感知融合方法用于在线3D场景图生成

提出即插即用的不确定性感知融合框架PUF,通过概率关联和证据积累,在在线3D场景图生成中显著优于现有方法且保持实时性。

04:00
arXiv cs.CV

NoDrift3R:射线图引导耦合实现抗漂移的无位姿前馈三维重建

提出射线图引导耦合与双频视点调度,解决长序列漂移,实现鲁棒的无位姿前馈三维重建。