10961 条条目 · 106 个活跃源
2026年8月26日
04:00
arXiv cs.CV

TurboT2VA:基于分数正则化一致性蒸馏的快速大规模文本到视频-音频生成

提出TurboT2VA蒸馏19B模型,四步生成提速20.1倍,高分辨率加速54.67倍,质量同步不降。

04:00
arXiv cs.CV

Game2World引擎:解锁野外游戏视频以训练世界模型

提出G2W引擎自动提取并去除游戏UI,构建数据集,训练GameCleaner模型,提升世界模型训练效果。

04:00
arXiv cs.CV

TorchMorph:CUDA加速的形态学变换

TorchMorph扩展实现CUDA形态学变换,兼容scipy接口,支持多维,性能提升显著。

04:00
arXiv cs.CV

Interpretable Fundus Image Classification via Ring-Based Retinal Vasculature Features

04:00
arXiv cs.CV

IDeaL:基于改进死叶的无数据多教师蒸馏

提出IDeaL方法,通过去相关损失生成教师特化样本,实现无数据多教师蒸馏,性能接近甚至超越用真实图像蒸馏的学生模型。

04:00
arXiv cs.CV

用于卫星云掩膜降尺度的深度学习超分辨率

提出两种深度学习方法,实现卫星云掩膜四倍超分降尺度,并构建跨传感器数据集。

04:00
arXiv cs.CV

侧扫声呐图像中海草栖息地制图的弱监督海底分割

仅用图像级标签实现侧扫声呐海草栖息地像素级分割,mIoU达87.6%,自监督预训练再提3%。

04:00
arXiv cs.CV

基于卷积神经网络集成的中风预测:迈向更高的诊断准确性

集成方法(随机森林、堆叠、装袋)在中风预测中达99.52%准确率,优于其他模型,验证其高效性。

04:00
arXiv cs.CV

MoTE:面向多任务视频理解的任务专家混合

提出MoTE解码器,将LLM前馈层转为任务专家,按样本级任务路由激活,约20亿参数,在COIN基准上超越基线。

04:00
arXiv cs.CV

基于MoE的特征适配器用于X射线血管造影中无提示的冠状动脉二值分割

提出基于MoE的特征适配器,无提示分割冠状动脉,优于基线并提升跨数据集泛化能力。

04:00
arXiv cs.CV

ORBITALIF:面向星上云去除的高效脉冲联邦学习框架

提出星上云去除联邦学习框架OrbitALIF,用脉冲神经网络实现高能效,能耗仅为ANN的1.4%。

04:00
arXiv cs.CV

人因引导的具身主动视觉中视空间复杂性认知模型

提出多模态复杂性框架,分类量化视听等特征,用于驾驶场景及认知人因研究。

04:00
arXiv cs.CV

从看见到行动:智能眼镜作为第一人称智能平台

首次统一框架综述智能眼镜,定义感知-状态-交互-行动闭环与L0-L5分级,强调系统可靠性、可纠错、可治理。

04:00
arXiv cs.CV

LeFlow:面向世界模型的生成式潜流规划

LeFlow将规划转为条件潜轨迹生成,实现可复用潜规划,成功率提升且规划时间降一个数量级

04:00
arXiv cs.CV

原生空间3D CarveMix多中心T1w卒中分割

采用3D CarveMix增强和MedNeXt-L,多中心T1w卒中分割Dice 0.648,较基线提升0.018。

04:00
arXiv cs.CV

用于主动脉跟踪的循环瓶颈时空蒸馏

提出半监督时空蒸馏框架将2D教师知识蒸馏至时空学生网络提升主动脉跟踪精度减少56%结构异常

04:00
arXiv cs.CV

EMFE:一种轻量级、可解释的疟疾细胞分类机器学习框架

提出EMFE五特征框架,用经典机器学习对疟疾红细胞分类,患者级交叉验证达94.6%准确率,轻量可解释。

04:00
arXiv cs.CV

LAION-BVD:面向多模态预训练的千万小时开放视频数据集

LAION-BVD:千万小时视频数据集,含1.3B链接、8000万视频,多模态预训练性能优异。

04:00
arXiv cs.CV

面向泛化性脑肿瘤分割的多阶段提示引导特征调制

多阶段动态提示nnU-Net经FiLM调制提升脑肿瘤分割,BraTS GOAT上Dice优于基线。

04:00
arXiv cs.CV

机器人世界模型真的遵循动作吗?诊断与对齐用于策略学习的动作条件生成

提出WorldEcho诊断与世界模型的动作遵循问题,及WorldSync对齐方法,提升离专家轨迹生成质量,增强策略学习效果。

04:00
arXiv cs.CV

内在PAPR:通过邻近注意力点渲染解决三维内在分解中的误归因问题

提出内在PAPR,用邻近注意力点渲染实现逐点监督,结合先验与空间雕刻损失,解决误归因,优于现有方法。

04:00
arXiv cs.CV

基于深度学习框架区分GOTHIC巡天中候选双活动星系核与偶然叠加

用YOLOv11从GOTHIC巡天4.6万被拒候选中识别出2.96万双核候选,目视确认约54.5-62%为真,得约1.4-1.8万可行系统。

04:00
arXiv cs.CV

ExMesh++:基于拓扑自适应重建与分解,从多视图图像生成可重照明 UV-PBR 网格资产

先自适应调整网格拓扑并保持UV,再在固定UV上优化PBR贴图与光照,实现高质量可重照明网格资产。

04:00
arXiv cs.CV

模型效应还是标签效应?肺栓塞分割的精细化标注与人类参考基准

评估标注比模型训练更影响肺栓塞分割性能;经细化标注后DSC提升显著,并建立人类参考基准。

04:00
arXiv cs.CV

基于去噪得分匹配的理想观察者近似用于信号已知确切检测任务

提出基于去噪得分匹配的理想观察者近似法,用无信号图像训练得分模型,可检测任意加性信号,无需重训。

04:00
arXiv cs.CV

基于深度学习方法的儿童自闭症谱系障碍筛查:通过与其他模型比较评估YOLOv26s分类模型

YOLOv26s筛查儿童自闭症:准确率92.86%,F1分数0.9291,深度学习可用于面部筛查。

04:00
arXiv cs.CV

RACR-MIL:全切片图像鳞状细胞癌弱监督分级的排名感知上下文推理

提出弱监督鳞癌分级新方法,构建混合图与排名约束注意力,跨部位泛化,精度提升3-9%,定位提升10%。

04:00
arXiv cs.CV

具有原位激活批量归一化的深度特征金字塔卷积网络用于自动皮肤病变边界分割

提出原位激活批归一化的高效内存深度网络分割皮肤病变,显存受限下实现高容量集成,ISIC2018上Jaccard达0.752。

04:00
arXiv cs.CV

基于自知识蒸馏的三流时移注意力微表情识别网络

提出三流时移注意力网络结合自知识蒸馏运动放大与通道注意解决微表情强度低和数据集小问题达到最优性能

04:00
arXiv cs.CV

空间-DISE:评估视觉语言模型空间推理的统一基准

提出统一基准Spatial-DISE,按认知分类学划分四类空间推理,含基准与12K训练集,评估28个VLM发现其与人类差距显著。

04:00
arXiv cs.CV

基于置信度伪标签的无监督增量学习

基于置信度伪标签的无监督增量学习,免人工标注,精度超现有方法5%以上。

04:00
arXiv cs.CV

自动驾驶车辆轨迹预测的自适应多模式分布外检测

针对轨迹预测的分布外检测,提出模式感知CUSUM,显式建模多错误模式并自适应阈值,减少检测延迟和误报。

04:00
arXiv cs.CV

STA-Net:用于轻量级植物病害分类的解耦形状与纹理注意力网络

提出解耦形状与纹理注意力,经轻量搜索建网,CCMT上401K参数/51.1M FLOPs,89%准确率,优于基线。

04:00
arXiv cs.CV

释放合作的力量:人与机器如何协同改进人脸识别

人机协作提升人脸识别准确率,基线差越小增益越大;智能融合择优合作优于机器单独或全员融合。

04:00
arXiv cs.CV

DLTPose:基于精确稠密表面点估计的6DoF姿态估计

提出DLTPose:融合稀疏关键点与稠密预测,用DLT获取表面点估计6DoF姿态,并做对称感知排序,超越多数方法。

04:00
arXiv cs.CV

Voronoi辅助优化用于从无向点扩散无符号距离场

提出无网络VAD方法,利用Voronoi准则定向法线并扩散构建无符号距离场,高效鲁棒,适用于复杂拓扑。

04:00
arXiv cs.CV

基于堆叠Transformer的时空注意力模型用于动态手语及手指拼写识别

提出基于堆叠变换器的时空注意力模型,无需固定骨架图,从零训练在手指拼写与手语识别上均达最优。

04:00
arXiv cs.CV

LAFR:基于潜在码本对齐适配器的高效扩散式盲脸恢复

提出码本适配器对齐低质量潜在特征,配合多级恢复损失,仅用0.9%数据微调即达高效盲脸恢复,训练时间减少70%。

04:00
arXiv cs.CV

Iwin Transformer:基于交错窗口的分层视觉变换器

该模型免位置嵌入,交错窗口注意力与卷积结合,降低复杂度,支持跨分辨率微调和二维到三维迁移,性能优越。

2026年8月25日
04:00
arXiv cs.CV

基于文本引导的视觉依赖图学习与跨模态注意力先验

提出CM-GLasso框架,融合视觉语言与稀疏图模型,利用文本可视化和交叉注意力先验,联合估计共享及类别特定依赖图,分类分割性能领先。

04:00
arXiv cs.CV

基于DenseNet的少样本跨数据集结核检测适应

DenseNet121全微调配合每类75样本,跨数据集结核检测准确率达98.36%,有效缓解域偏移。

04:00
arXiv cs.CV

利用结构化上下文推理提升基于知识的视觉问答

提出结构化上下文推理框架,通过筛选压缩多模态信息为关系三元组,提升知识型视觉问答性能。

04:00
arXiv cs.CV

EditStream:面向交互式视频生成与编辑的统一自回归框架

EditStream统一多任务视频生成编辑,采用DiT与蒸馏少步自回归,兼顾质量与稳定性。

04:00
arXiv cs.CV

DesignAgent3D:通过类设计师多模态推理的交互式3D场景编辑

提出交互式智能体框架,采用“计划-感知-行动”范式,澄清意图并精准定位,实现多视图一致的场景编辑,显著优于现有方法。

04:00
arXiv cs.CV

微笑的拓扑学:牙科影像中的持续同调

用持续同调和SVM对CBCT牙科影像分类诊断,准确率达97.67%和96.77%,超CNN。

04:00
arXiv cs.CV

测量动画电影中的性别呈现

分析224部动画片:女性角色总量与真人电影相当,但人类角色女性多、非人类男性多,女性更常同框。

04:00
arXiv cs.CV

校准分布奖励学习:对齐人类感知的视频生成

提出偏好感知框架,用精英过滤校准数据,分布奖励建模与Wasserstein对齐,提升视频生成的人类偏好一致性。

04:00
arXiv cs.CV

基于AI的服装生产视觉检测

开发AI视觉检测系统,CNN检测缝纫缺陷,深色有效浅色受限,精度依赖训练数据多样性。

04:00
arXiv cs.CV

WorldMind:面向状态感知NPC行为的解耦游戏世界模型

提出解耦式游戏世界模型,以理解、决策、控制、生成四层闭环实现状态感知非玩家角色行为,建十四万数据集,效果更优。

04:00
arXiv cs.CV

ViTexSZ:用于脑电癫痫检测的异构视觉-文本知识蒸馏

提出ViTexSZ框架,将脑电转波形图,对齐多通道特征并融合临床语义,经视觉-文本蒸馏实现轻量检测,在四个数据集上准确率最高,相对提升达12.9%。