1
向量:一排有顺序的数字
向量就是一排按顺序排列的数字,比如 (170, 60, 25) 可以表示「身高 170cm、体重 60kg、年龄 25 岁」。两个向量「像不像」,就看对应的数字是不是接近——这个直觉后面极其重要。
把每个词都翻译成一排数字:「猫」= (0.9, 0.1, 0.2),「狗」= (0.8, 0.2, 0.1),「汽车」= (0.0, 0.9, 0.8)。看数字就知道:猫和狗是近邻,和汽车八竿子打不着。AI 理解语义的起点,就是这种「数字化的近邻关系」。
现代 AI(包括聊天机器人)第一步永远是「把文字变成向量」,术语叫词向量 / 嵌入(embedding)。数字可以是几百上千个,道理不变。
2
矩阵:数字的表格,变换的机器
矩阵就是把数字摆成长方形的表格。它的神奇用途是:一个矩阵代表一种「批量变换」——向量从左边进去,出来时就完成了指定的变化。
拿照片举例:一张 1000×1000 的照片是 100 万个像素数字组成的大矩阵。美颜 App 的滤镜,就是给这张表乘上某个矩阵:
- 「变亮滤镜」= 每个数字变大一点
- 「黑白滤镜」= 把红绿蓝三个数按比例混合成一个
- 「旋转滤镜」= 按几何规则重新摆放每个像素
- 「磨皮滤镜」= 让相邻数字彼此靠近一点(抹平差异)
矩阵像一台「数字加工流水线」:原图从这头进去,成品从那头出来。想要什么效果,就换一台流水线(换个矩阵)。多个滤镜叠加 = 流水线串联,数学上就是矩阵连乘。
3
矩阵乘法:其实只是「成批的加权求和」
矩阵乘法看起来规则古怪,内核非常日常。看一个「点外卖」版本:
汉堡 15 元 / 杯,奶茶 9 元 / 杯
总价 = 3×15 + 2×9 = 63 元 「对应位相乘再相加」——这就是矩阵乘法的唯一核心动作
矩阵乘大矩阵,无非是把上面这个动作成千上万次地做。为什么 AI 芯片(GPU)矩阵运算快得飞起?因为这种「成批乘加」天生适合几千个小核心同时开工——一人算一格,并行不吵架。
顺带解密神经网络:每一层就是「输入向量 × 矩阵 + 微调,再过一个简单弯折函数」,层与层串联(矩阵连乘)。ChatGPT 一次回答,就是几十层这样的乘法流水线,参数就是流水线里那些矩阵的数字。所谓「训练」,就是不断微调这些数字,直到输出越来越像人话。
4
为什么偏偏是「线性」?
因为线性运算可以任意拆分、任意组合:先加后乘、先乘后加,结果一致;处理 1 万行数据和处理 1 行没有本质区别,只是重复。这种「可拆可并」的性质让海量计算变得可规划、可加速。现实世界当然不是线性的(这也是神经网络要加「弯折函数」的原因——往线性流水线里塞进非线性,才能学出复杂规律)。
还有个工程常识送给你:为什么推荐系统「猜你喜欢」那么准?把「你」变成一个向量、「商品」变成向量,找「夹角最小」的向量——数学上一步乘法的事。
?
常见疑问
学 AI 必须系统学完线性代数吗?
入门阶段不需要。掌握三样就够:向量(数字列表)、矩阵(数字表格)、矩阵乘法(加权求和)。遇到「特征值」「奇异值」等词,知道它们是「找数据中最重要的方向」即可,用到再深入。
矩阵乘法为什么不直接对应位置相乘?
因为矩阵的使命是「变换」:输出的第 i 行第 j 列 = 输入第 i 行与变换规则第 j 列做加权求和,这样才能完成「旋转」「混合」等真变换。对应位置相乘反而什么都变换不了。
向量数据库、RAG 是什么?
都是本课概念的工程化:把文档全变成向量存起来(向量数据库),提问时把问题也变向量、找最近邻(回忆第 5 课的概率近邻 + 本课的向量相似),把找到的内容喂给 AI 作答——就是所谓的 RAG 检索增强。
→