跳到主要内容
步芽

【极致配音】2026 cs231n ViT论文解读:一张图片值16x16个词:大规模图像识别的Transformer

斯坦福cs231n系列,深度解读ViT论文《An Image is Worth 16x16 Words》,讲解如何用Transformer做大规模图像识别。

难度
难度 4/5深度学习经典论文解读,需扎实的神经网络与Transformer基础
适合人群
有深度学习基础、想深入理解ViT的CV/AI学习者与研究者
前置要求
深度学习基础(神经网络、反向传播)、Transformer与注意力机制(理解自注意力)、计算机视觉基础(了解CNN与图像分类)、线性代数与Python(矩阵运算、PyTorch)
课程规模
1 · 3554播放

主题覆盖

Vision Transformer图像分块patch自注意力机制大规模图像识别Transformer架构预训练与迁移图像分类位置编码CNN对比论文精读

课程大纲(1 讲)

  1. P1 · 【极致配音】论文解读:一张图片值16x16个词:大规模图像识别的Transformer20 分钟

本课程卡由 AI 生成,可能存在误差,欢迎反馈。