第7步:Transformer 入门

Positional Encoding · Multi-Head Attention · Encoder 前向 — 现代大模型的基石
① Positional Encoding — sin/cos 给每个位置打上"位置标签"(行=位置 0-7,列=维度 0-15)
② Multi-Head Attention — 输入句子,看各头关注了哪些词
点击上方词标签选择当前 Query,查看它"关注"各词的程度
③ Encoder 架构总览(简化版:d_model=8, heads=2, d_ff=16)
InputEmbed+ PosEncMulti-Head AttnAdd & NormFFNAdd & NormOutput

示例句子

当前 Query 词

The
从单头到多头
DL Ch6 演示了单头自注意力(Q=K=V=词向量)。
Multi-Head:多组独立的 Q/K/V 投影,每组"关注"不同的语义关系。
Positional Encoding:sin/cos 给每个位置编码,让模型知道词序。
Add & Norm:残差连接 + Layer Normalization。
这里用极小模型(d=8, 2头)手工权重做演示。

🔰 先修:DL 第6步 · 注意力机制入门

💡 键盘快捷键:← → 切换章节