atlas.全部探索人工智能 / 本科 · 硕士 · 博士
人工智能 · 12 MIN EXPLORATION

Transformer 是怎么「读懂」一句话的?

点一个词,看它把注意力分给了谁。下面每一个数字都是真算出来的。

只用位置编码,不看内容:每个词都盯着自己左边的那个词。

小猫没有跳上桌子,因为它太累了。小猫没有跳上桌子,因为它太累了。Query · 提问的词(点击选择)Key · 被关注的词(颜色越深,权重越大)
小猫没有跳上桌子,因为它太累了。
小猫
没有
跳上
桌子
,
因为
它
太
累
了
。
Attention(Q, K, V) = softmax( QKᵀ / √6 ) · V

① 「桌子」的输入向量 x

B类名词 1.00语境→A 0.09偏置 1.00+ 位置编码 6 维

② q = x · W_Q

[1.42, 1.68, 2.20, -0.06, -0.13, -2.20]
Key③ q·k④ 缩放后⑤ softmax
小猫-0.58-0.242.5%
没有3.541.4413.5%
跳上6.602.6947.3%
桌子3.541.4413.5%
,-0.58-0.242.5%
因为-0.34-0.142.8%
它0.360.153.7%
太-2.15-0.881.3%
累-3.08-1.260.9%
了0.460.193.9%
。2.250.928.0%
温度 T1
0.254

教学模型:2 层、5 个头,权重为手工设计以展示机制,省略了 W_V 的多维投影、前馈网络和层归一化。真实模型的权重靠训练得到,头的分工也远没有这么整齐。

小挑战 1 / 5

在「指代头」里点选「它」:它把注意力放在了谁身上?

直接操作上方的模型,完成时会自动告诉你。

THE BIG PICTURE

一个完整的 Transformer 块

每个头有自己的 W_Q、W_K、W_V,各自学会关注不同关系。输出拼接后再投影回原维度。

延伸阅读:Vaswani et al., Attention Is All You Need (2017)