计算机中的数学 · 小白练习本 第 6 课 / 共 7 课
第 6 课 · 约 9 分钟

线性代数:
AI 世界的通用语言

「线性代数」四个字劝退过无数人,但它的本质朴素极了:把一串数字排好队,再成批地做加减乘。照片是一张数字表格,一段话是一排数字,而「处理」它们的数学工具就是这门课。

需要的基础:会加法和乘法 · 识字(这就够了)

1

向量:一排有顺序的数字

向量就是一排按顺序排列的数字,比如 (170, 60, 25) 可以表示「身高 170cm、体重 60kg、年龄 25 岁」。两个向量「像不像」,就看对应的数字是不是接近——这个直觉后面极其重要。

把每个词都翻译成一排数字:「猫」= (0.9, 0.1, 0.2),「狗」= (0.8, 0.2, 0.1),「汽车」= (0.0, 0.9, 0.8)。看数字就知道:猫和狗是近邻,和汽车八竿子打不着。AI 理解语义的起点,就是这种「数字化的近邻关系」。

现代 AI(包括聊天机器人)第一步永远是「把文字变成向量」,术语叫词向量 / 嵌入(embedding)。数字可以是几百上千个,道理不变。

2

矩阵:数字的表格,变换的机器

矩阵就是把数字摆成长方形的表格。它的神奇用途是:一个矩阵代表一种「批量变换」——向量从左边进去,出来时就完成了指定的变化。

拿照片举例:一张 1000×1000 的照片是 100 万个像素数字组成的大矩阵。美颜 App 的滤镜,就是给这张表乘上某个矩阵:

矩阵像一台「数字加工流水线」:原图从这头进去,成品从那头出来。想要什么效果,就换一台流水线(换个矩阵)。多个滤镜叠加 = 流水线串联,数学上就是矩阵连乘。

3

矩阵乘法:其实只是「成批的加权求和」

矩阵乘法看起来规则古怪,内核非常日常。看一个「点外卖」版本:

订单 (3 份汉堡, 2 杯奶茶) × 价格表
汉堡 15 元 / 杯,奶茶 9 元 / 杯
总价 = 3×15 + 2×9 = 63 元 「对应位相乘再相加」——这就是矩阵乘法的唯一核心动作

矩阵乘大矩阵,无非是把上面这个动作成千上万次地做。为什么 AI 芯片(GPU)矩阵运算快得飞起?因为这种「成批乘加」天生适合几千个小核心同时开工——一人算一格,并行不吵架。

顺带解密神经网络:每一层就是「输入向量 × 矩阵 + 微调,再过一个简单弯折函数」,层与层串联(矩阵连乘)。ChatGPT 一次回答,就是几十层这样的乘法流水线,参数就是流水线里那些矩阵的数字。所谓「训练」,就是不断微调这些数字,直到输出越来越像人话。

4

为什么偏偏是「线性」?

因为线性运算可以任意拆分、任意组合:先加后乘、先乘后加,结果一致;处理 1 万行数据和处理 1 行没有本质区别,只是重复。这种「可拆可并」的性质让海量计算变得可规划、可加速。现实世界当然不是线性的(这也是神经网络要加「弯折函数」的原因——往线性流水线里塞进非线性,才能学出复杂规律)。

还有个工程常识送给你:为什么推荐系统「猜你喜欢」那么准?把「你」变成一个向量、「商品」变成向量,找「夹角最小」的向量——数学上一步乘法的事。

?

常见疑问

学 AI 必须系统学完线性代数吗?

入门阶段不需要。掌握三样就够:向量(数字列表)、矩阵(数字表格)、矩阵乘法(加权求和)。遇到「特征值」「奇异值」等词,知道它们是「找数据中最重要的方向」即可,用到再深入。

矩阵乘法为什么不直接对应位置相乘?

因为矩阵的使命是「变换」:输出的第 i 行第 j 列 = 输入第 i 行与变换规则第 j 列做加权求和,这样才能完成「旋转」「混合」等真变换。对应位置相乘反而什么都变换不了。

向量数据库、RAG 是什么?

都是本课概念的工程化:把文档全变成向量存起来(向量数据库),提问时把问题也变向量、找最近邻(回忆第 5 课的概率近邻 + 本课的向量相似),把找到的内容喂给 AI 作答——就是所谓的 RAG 检索增强。

最后一课