AI 原理可视化

把公式变成能拖动的东西。纯前端计算,无后端无 API 调用。

注意力机制:每个词在看谁

自注意力的核心是 softmax(QKᵀ/√d)。矩阵每一行是一个 query token,列是它能看到的 key token,格子里的数字是分配的注意力权重(百分比,每行和为 100%)。颜色越红代表关注度越高。

这个演示说明了什么
  • Causal mask 的作用:取消勾选后右上三角会出现数值——那是 BERT 这类 encoder 的双向注意力;勾选时被屏蔽,因为 GPT 生成时不能看到未来的词
  • Temperature 的影响:调低(→0.2)注意力会集中到单个 token,调高(→3)会趋于均匀。这就是为什么采样温度影响输出确定性
  • 第一行永远是 100%:第一个 token 只能看自己,softmax 单个元素必然为 1
  • ⚠️ Q/K 向量由词的哈希生成(保证同词同结果),不是真实训练出来的语义向量,所以「谁关注谁」没有语义含义。这里演示的是机制而非语义
📖 对应笔记:注意力机制推导 完整推导、代码实现与延伸阅读