对于矩阵的理解
对于矩阵乘法一直反复地容易忘记。它首先能够从两个视角,一个是行视角,一个是列视角
对于矩阵乘法一直反复地容易忘记。它首先能够从两个视角,一个是行视角,一个是列视角

从行视角来看,把一行看为一个整体,右边乘一个大的矩阵,那么后面对应的结果也是这样的。我们发现, 刚好能够达到降维的操作
补充:行视角、列视角,以及普通视角 vs LLM 视角
行视角就是开头说的:把左边的一行看成一个整体,右边矩阵的每一行也看成一个整体,结果就是把右边这些行按左边的数字加权求和,混合出一个新向量。 就是 4 个 的行按 4 个权重混合成 1 个,所以叫降维。
列视角则是反过来:拿左边这一行去和右边矩阵的某一列逐元素相乘再相加,得到一个数,右边有几列就得到几个数,每个数是一列一列单独算出来的。行视角和列视角算出来的结果完全一样,只是行视角把结果解释成"加权混合",列视角把结果解释成"逐个点积"。
这两个视角正好对应普通世界和 LLM 世界的例子。普通视角就是买菜:4 种水果的单价是 ,3 份订单各买了多少是 ,乘出来就是每份订单的总价 ,一个数一个数地算,是列视角,本质是加权求和。LLM 视角就是 Attention:q 是 ,代表对 4 个 token 的关注权重,V 是 ,每个 token 一行向量,乘出来就是把各 token 的向量按注意力权重加权混合,得到融合上下文的新向量,是行视角。
一句话记忆:矩阵乘法 = 加权求和。列视角看"结果里每个数怎么算出来的",行视角看"结果向量怎么混合出来的"。权重是单价,结果就是钱(买菜);权重是注意力,结果就是语义(LLM)。"降维"就是把多个来源的信息揉成一个。
反向链接(0)
还没有笔记链接到这里。在 Obsidian 里用 [[笔记名]] 引用它,这里就会出现,关系图谱上也会多出一条连线。