自注意力:一眼看懂「谁在听谁」

本页是教学演示,不是真训练或推理。权重写死在前端常量里,无网络、无模型。

Transformer 的自注意力让每个 token 按权重「看」序列中的其他位置。下面用五个汉字演示:当前查询 token 用强调描边,连线透明度表示注意力权重。

点「步进」切换查询位;可选自动轮播(≥1.2s),随时暂停。热力矩阵默认关闭,优先看连线与数字。

Transformer 平面模拟

查询 q=0「机」· 手动步进