加载中…
首页/AI 学习

深度学习

卷积网络处理图像,序列模型处理文本,Transformer 统一了现代 NLP 与多模态架构。

建议先修

以下章节有助于理解本章内容(非强制):

神经网络线性代数
机器学习核心 · 第 3 章路径 6/8本章完成 0%CNNAttentionTransformer

可用 ← → 键切换主题

注意力机制

Query · Key · Value · Softmax

Query 词:「机器」

我
21.0%
喜欢
20.9%
机器
29.2%
学习
28.9%

Self-Attention 让每个位置「关注」序列中所有位置:用 Query 与 Key 的点积计算相似度,Softmax 归一化后与 Value 加权求和。

相关演示

线性代数:点积相似度 →

深度学习检查点

学完演示后来检验一下。全部答对即可标记本章测验通过。

  1. 1. 卷积层共享权重的主要好处是?

  2. 2. Self-Attention 中 Query 与 Key 的点积用来?

  3. 3. Transformer 相对 RNN 的重要优势是?

与 AI 的联系

  • 大模型:GPT、Claude 等均基于 Transformer decoder。
  • 多模态:视觉编码器 (ViT) + 语言模型融合。
  • Scaling Law:更多数据、更大模型通常带来更好性能。
← 上一章:神经网络
学习中心6 / 8
下一章:训练与调参 →