【极致配音】2026 cs231n ViT论文解读:一张图片值16x16个词:大规模图像识别的Transformer
斯坦福cs231n系列,深度解读ViT论文《An Image is Worth 16x16 Words》,讲解如何用Transformer做大规模图像识别。
- 难度
- 难度 4/5 — 深度学习经典论文解读,需扎实的神经网络与Transformer基础
- 适合人群
- 有深度学习基础、想深入理解ViT的CV/AI学习者与研究者
- 前置要求
- 深度学习基础(神经网络、反向传播)、Transformer与注意力机制(理解自注意力)、计算机视觉基础(了解CNN与图像分类)、线性代数与Python(矩阵运算、PyTorch)
- 课程规模
- 1 讲 · 3554播放
主题覆盖
Vision Transformer图像分块patch自注意力机制大规模图像识别Transformer架构预训练与迁移图像分类位置编码CNN对比论文精读
课程大纲(1 讲)
- P1 · 【极致配音】论文解读:一张图片值16x16个词:大规模图像识别的Transformer20 分钟
本课程卡由 AI 生成,可能存在误差,欢迎反馈。