1
概率:给「可能性」标价格
概率就是给每件事的可能性打分:0 分(不可能)到 1 分(必然),或者换成 0% 到 100%。天气预报说「降水概率 70%」,意思是「跟今天类似的一百天里,大约七十天下雨」。
把可能性想象成一张 100 张券的抽奖券池:下雨的券占 70 张,天晴占 30 张。概率就是「数券」——只是券池越大、信息越多,数出来的比例越靠谱。
两条最基本的规矩:所有可能性加起来必须等于 1(券分完了);互不干扰的事概率直接相乘(抛两次硬币都是正面 = ½ × ½ = ¼)。
2
条件概率:新证据改变判断
「掷骰子掷出 6」的概率是 1/6。但如果有人偷偷告诉你「这次掷出的是偶数」呢?可能性瞬间收窄成 {2,4,6},掷出 6 的概率变成了 1/3。拿到新信息后重新算概率,就是条件概率——记作 P(掷出6 | 已知是偶数)。
这就是 AI 思维的核心:判断不是一次性的,而是随证据不断更新的。垃圾邮件过滤器的工作原理就是一个漂亮的例子:
- 建立经验库统计历史上垃圾邮件和正常邮件里,各词出现频率:「中奖」多见于垃圾邮件,「会议纪要」多见于正常邮件。
- 收到新邮件逐词查表:这个词在垃圾邮件里出现时,邮件是垃圾的概率多大?
- 合并证据几十个词的证据按贝叶斯方法合在一起,得出「这封邮件是垃圾邮件」的总概率。
- 给出结论超过阈值(比如 95%)就扔进垃圾箱——而且会根据你的误判反馈继续学习。
把「证据更新信念」总结成一条公式的,是 18 世纪的贝叶斯定理。它如今是垃圾邮件过滤、医学检测解读、自动驾驶感知共同的数学心脏。
3
大数定律:为什么样本多了就靠谱
抛 10 次硬币可能出现 7 次正面,但抛 1 万次,正面比例几乎必然非常接近 50%。次数越多,偶然的波动越被「平均」掉——这条朴素得惊人的规律叫大数定律,它是「统计能反映现实」的全部底气。
问 3 个人「今晚吃不吃火锅」,答案全是「吃」,你会错误地觉得全城都爱吃火锅;问 3000 个随机的人,比例就稳了。民意调查、A/B 测试、AI 训练数据,全在赌同一条数学定律。
顺着这条定律还有一句反话:AI 时代常说的「数据偏差」问题,其实是大数定律的前提被破坏了——券池本身就不均匀(比如训练数据里某类人样本太少),再多数据也平均不出公正。数学告诉我门「越多越准」,也提醒我们「池子得先对」。
4
统计三件套:平均、波动、分布
- 平均数(以及中位数):概括「典型水平」。注意平均数怕极端值——和首富平均资产没意义,这时中位数更诚实。
- 波动(方差/标准差):同样平均身高 170,波动小说明「大家都差不多」,波动大说明「高矮悬殊」。两个平均值相同的班级,可能完全不同。
- 分布:把所有可能值出现的频率画成图。钟形的「正态分布」无处不在——身高、考试分数、测量误差都是。机器学习很多时候就是在「猜数据服从什么分布」。
下一课会讲到,AI 里的照片、文字先被变成一长串数字,而「学习」的过程本质上是统计:在亿万样本中找出「哪个数字搭配最常一起出现」。所以说:AI 的聪明,是概率统计堆出来的聪明。
?
常见疑问
AI 回答会出错,是不是说明它不可靠?
它本就是概率系统:输出的是「最可能的答案」。对确定性任务(算账)会显得笨,对模糊任务(写作、翻译)反而出色。可靠性的关键在于「概率 + 校验」双保险,而不是指望它 100% 对。
「赌徒谬误」是什么?
连开 5 次大后觉得「下次该开小了」——错。每次开奖独立,历史不影响下一次。但连开 1000 次大,你该怀疑的不是运气而是骰子(大数定律在提示:偏差大到不正常,必有原因)。
需要学多少概率才能理解 AI 新闻?
掌握本课三样就够:条件概率(证据更新判断)、大数定律(样本多才靠谱)、分布(数据长什么样)。剩下的都是这三样的组合与延伸。
→