测试版 本网站处于测试版。信息仍在持续添加和审核中。
工作坊概览
深入解读,是"AI 到底是怎么运作的"的姊妹篇。

你正在使用哪种 AI 模型

你屏幕上的聊天机器人,用的是某一个具体模型,而现在大多数工具都提供不止一个选项。菜单上写着"快速"、"思考"或某个版本号,这些选择会改变工具擅长什么、要花多长时间、要花多少钱,以及它给出的答案有多大分量。四点差异,几乎涵盖了实务工作者需要知道的一切。菜单里的名字每隔几个月就会变一次,这四点差异不会变。

开场活动

给你屏幕上这个工具做个体检

  1. 打开你真正在用的那个AI工具,找到模型菜单,把具体的模型名称和版本号记下来。
  2. 查一下你用的是哪个套餐,是不是免费版。
  3. 查一下数据设置:这家公司有没有说会用你的对话来训练模型?每人填一行,把这张表留下来。

在今天之前,你能答上来这三个关于你每天在用的工具的问题吗?

第一点差异

快速模型与推理模型

每个模型写字的方式都一样,一次生成一个词元(token)。不同的是,它开始下笔之前有没有先做一些"功课"。

两种回答方式

按下发送之后发生了什么

快速模型
? A

直接开始下笔。适合写草稿、调整语气,以及处理你自己提供的文字。

推理模型
? A

先写出隐藏的中间步骤,再给出答案。更慢,但在处理规则和比对时表现更好。

推理模型多花的时间,都花在第一个字出现之前。它事后展示给你的那些步骤,是它自己对答案的一套说法,而这套说法可能并没有说出真正驱动它得出答案的原因。
默认用的是快速模型

除非你另外选择,工具给你的默认是一个体积小、速度快、成本低的模型,因为大多数问题根本不需要更强的模型。它会立刻开始下笔。改写一封邮件、缩短一段文字、总结你贴进去的文件,用它换来的速度很值,质量也够用。

推理模型(reasoning model)会先把问题想清楚

标着"推理"或"思考"的模型,会先写出一连串中间步骤,然后才把内容显示给你。一步步推导,能明显提高那些需要走好几步才能算清楚的问题的准确率(Wei 等,2022),比如一条带三个条件的资格规则,或是两份文件之间的比对。这类模型更慢,有时要多等一分钟,运行成本也更高。

"思考"不等于"核对"

模型给你看的那些步骤,并不是它真正得出答案的过程记录。研究者在提示词(prompt)里悄悄放了一条提示,改变了模型的答案,结果模型写出的却是一段语气笃定、逐步推理的解释,只字未提那条提示(Turpin 等,2023)。推理模型确实能减少粗心的错误,但它依然可能一本正经地说错,凡是你要据此行动的内容,都得自己核实。

什么时候值得等

当一个错误会让服务对象付出代价、当问题里包含不止一个条件、或者你想要工具核对而不是生成内容时,就用推理模型。而调整语气、写草稿,以及你本来就打算仔细读一遍的文字,快速模型就够用了。

在问出真正重要的问题之前,先留意自己用的是哪种模式。把一个棘手的问题丢给快速模型,正是大多数实务工作者得到"听起来笃定、实际很浅"的答案的原因。

第二点差异

模型大小与参数量

模型通常用大小来描述,一般是参数量(parameters),比如 8B、70B 或 400B。这个数字值得弄懂,它没说出来的东西同样值得弄懂。

什么决定了能力

三项投入,一个模型

训练数据 算力 参数量 模型的能力有多强
只提高一项,另外两项就被浪费
能力是这三项共同造就的。封闭实验室一项都不公开,所以"这个模型更大"或"训练得更好"这类说法,外界大多无从查证。
运行在哪里

数据中心、笔记本电脑,还是手机

大型模型,运行在数据中心最强,语言覆盖最广。你的文字会传到运营它的公司那里。
中型模型,日常默认选项大多数聊天机器人默认给你的就是它。速度快,写草稿绰绰有余。
小型模型,运行在你自己的设备上离线运行,文字留在机器上,在服务对象的语言上表现最弱。
大小决定了模型能在哪里运行,也就决定了你的文字要传多远。最强的模型,恰恰是你没法自己部署的那些;而你能自己部署的那些,在服务对象所说的语言上恰恰最弱。
参数是模型内部的旋钮

训练的过程,就是不断调整数十亿个内部数字,直到模型对下一个词元的猜测和它正在学习的文本对上。这些数字就是参数,也是模型所保留的全部内容。数一数参数量,80 亿也好,4000 亿也好,衡量的是模型有多大空间来容纳"模式",而不是事实的数量,因为模型本来就不存储事实。

数据、算力和大小,三者要配合

三项投入共同决定了一个模型最终有多强:它学习过的文本量、训练它花了多少算力、以及它有多少参数。这三项同步提升,模型质量会跟着平稳提高;只提高其中一项,另外两项就被浪费了(Kaplan 等,2020)。用太少的文本训练一个大模型,反而会被一个用更多文本训练出来的小模型打败(Hoffmann 等,2022)。销售封闭模型的公司,这三项数字一个都不公开,所以哪怕是"这个模型比那个更大"这种说法,外界通常也无从核实。

大模型与小模型

大语言模型(large language model),参数量以千亿计,运行在数据中心(data center)里,通过互联网传到你面前。小语言模型(small language model),参数量只有几十亿,可以在笔记本电脑或手机上运行,完全不需要联网。小模型便宜、快速、私密,能力上的局限也很明显。如今这两种都是为了不同的用途特意打造出来的。

小模型可以专精一件事

小模型不可能样样都强。但如果针对一个具体的窄任务再做训练,它在那件事上可以和一个大得多的通用模型旗鼓相当。也可以用一个大模型去"教"一个小模型,这种方法叫作蒸馏(distillation)(Hinton 等,2015)。它没法把能力推广到自己的专精范围以外。而在这个范围之内,它往往只用一小部分算力和电力就能完成同样的工作,这对成本和能耗都很重要。

模型大小,最先在服务对象的语言上显现出差别

分词器(tokenizer)把英语切成较少的片段,却把许多其他语言切成多得多的片段,同样的内容最多能多出五倍。这意味着同一个请求,用服务对象的语言处理时,花费更高、速度更慢,也更快占满模型的工作记忆(Ahia 等,2023)。一旦把模型缩小,它接触最少的那些语言,就是最先受影响的。一个读英语很流畅的小模型,处理越南语、阿姆哈拉语或海地克里奥尔语时,往往明显更差。

大小告诉你的是,一个模型能装下多少、能在哪里运行,它不能告诉你某一个具体答案是不是对的。

第三点差异

开放模型与封闭模型

这一点关乎谁掌握着模型,以及公司之外的人能不能运行它。

两种安排

封闭云端与开放权重

封闭模型,运行在公司云端

你的文字传到公司那里,答案再传回来。通常是最强的模型,覆盖的语言也最广。条款由公司制定,模型由公司掌握,公司可以在不通知你的情况下改动它。

开放权重,运行在你掌控的硬件上

你下载模型,自己运行它。文字可以留在这台机器上。这需要花硬件、部署和人力的成本,而且现实中你能运行得起的模型,通常更小也更弱。

最能保护服务对象文字的那种安排,恰恰也是在服务对象语言上表现最差的那种。大多数机构最终用的还是封闭工具,再配一条书面规定,规定哪些内容可以输入进去。
封闭模型(closed model)是租来的使用权

最知名的那些 AI 助手都是封闭的。公司自己保留训练好的参数,你只能通过它的应用程序或编程接口(API)接触模型。你不能查看它、不能自己运行它,公司改动或停用它的时候,你也留不住它。公司也没有义务告诉你这个模型是用什么训练的、有多大、上一次更新改了什么,而且大多数时候它确实不说。你的文字会传到公司的服务器上去获得回答。

开放权重(open weights)模型可以下载

另一些公司会公开训练好的参数,任何人都可以下载模型,在自己的电脑或所在机构的服务器上运行它。这就是为什么一台不联网的笔记本电脑也能回答你,也是为什么一个小供应商不必向任何人租用模型,就能自己做出产品。

开放权重不等于开放源代码(open source)

公开出来的权重,只是最终算出来的一堆数字。产出这些数字的训练数据(training data)和训练代码,通常仍然保密,外部谁也没法研究或重建这个模型。开源促进会把"开源"这个说法,专门留给那些公开了足够信息、让人真能做到这一点的模型(Open Source Initiative,2024)。许可证也各不相同。有些开放权重模型采用标准的宽松许可证,另一些则附带定制条款,限制谁可以使用、能用来做什么。你所在机构要在某个模型基础上搭建东西之前,先把许可证读一遍。

这一点如何影响到你的服务对象

只有当模型运行在你所在机构自己掌控的硬件上时,服务对象的文字才真正不会离开这栋楼,这也是开放权重值得关心的一个实实在在的理由。但这一点也很容易被夸大:一个应用完全可以建立在开放模型之上,却依然把每一个字都发送到某个云端服务器。问清楚文字最终去了哪里,并且要一份书面答复。

开放还是封闭,不是在给质量排名,也不是在给安全性排名。它决定的是谁能运行这个模型、你的文字会传多远,而这首先是一个关乎你的服务对象的问题,其次才是一个技术问题。

第四点差异

训练数据与知识截止日期

两个大小相同的模型,表现可以截然不同。一个模型,是由它看过的文本、加上后续对它做的调校(fine-tuning)共同塑造出来的。

你看不到的训练数据

这些模型学习自海量的网络文本,再加上授权和购买来的材料。大多数封闭模型从不公开清单,所以你没法核实模型在你问的那条规则上,到底看过什么靠谱的内容。网络文本以英语为主,服务对象所说的大多数语言在其中都很单薄,语言差距正是从这里开始的。

一个截止日期(cutoff),外加一个外挂的搜索功能

训练在某个日期停止,模型的"记忆"也就停在了那一天。现在许多工具会外挂一个实时网络搜索,来越过这个日期,这确实有帮助,但也把问题换了个方式:答案这时候好不好,就看工具恰好抓到了哪些网页,所以要问它用了哪些来源,并且把它们打开看一看。

长文件不是被平均着读完的

放在一长段输入开头或结尾的事实,比埋在中间的同一个事实,被找到的可靠程度要高得多,而且输入越长,准确率越会往下掉(Liu 等,2024)。贴进去一份四十页的政策文件,只问一个很窄的问题,答案很可能漏掉模型技术上确实"读过"的某一段。与其把整份文件都交出去,不如直接引用你关心的那部分。

训练之后的那道调校工序

模型学会预测文本之后,人们还会用人类反馈对它做调校,让它听从指令、按特定语气回答、拒绝特定请求(Ouyang 等,2022)。真正让两个模型在对话中"感觉不一样"的,是这道工序,而不是大小。它同时也会奖励迎合。用这种方式训练出来的助手,往往会附和用户说出的看法,一旦用户提出反驳,它们就会放弃原本正确的答案(Sharma 等,2024)。给模型一个错误的前提,它多半会顺着往下编。

版本会在你不知不觉间改变

模型会被重新训练、更新,有时悄无声息地进行,菜单里同一个名字,指向的可能已经不是上个月那套系统了。工具更新之后,把你保存下来的提示词重新测一遍,也重新检验一下你原先对"这个工具哪里靠谱"形成的判断。

训练,是你既看不见也改不了的那部分,却决定了模型在越南语上表现如何、在某条县级规则上表现如何、在上个月的政策变化上表现如何。要假设,恰恰是在你工作所在的地方,它最单薄。

经验法则

什么任务,用什么模型

你在做什么 该用什么 改写一封邮件、缩短一段文字、整理你自己写的笔记 默认的快速模型。你要的是速度,而且输入内容你自己看得清楚。 理清一条资格规则、比对两份文件、检查表格里有没有矛盾之处 用推理模型,然后对照官方来源核实具体细节。 当地办事处、截止日期、费用、最近的政策变化 任何模型都行,但要打开网络搜索功能,并且把它引用的来源都打开看一看。光靠训练时的记忆是不够的。 任何用服务对象的语言处理、并且有实际后果的事情 找合格的口译员或笔译员。不管是开放还是封闭、大还是小,没有任何模型能替代这一点。 任何含有服务对象身份识别信息的内容 除非你所在机构书面批准,否则完全不要用云端工具。先把识别信息去掉。
这五行里有两行,其实根本无关模型选择,而这两行恰恰风险最大。
值得了解
  • 一个工具的免费版,通常用的是它最轻量的模型。如果问题事关重大,先确认一下自己用的到底是哪个模型。
  • 标着"推理"的模型,不代表它会核实事实。
  • 两个产品可能用的是同一个底层模型,表现却依然不同,因为包装它的公司加上了自己的一套指令。
  • 发布公告里的跑分(benchmark)成绩,测的是别人的任务,用的语言多半也不是你服务对象的语言。
  • 开放模型本身并不能保护服务对象的数据。只有把它运行在你自己掌控的硬件上才能做到这一点,而大多数建立在开放模型之上的应用并不是这样。
试试这个

弄清楚你用的是哪个模型

花五分钟,让每个人打开自己实际使用的 AI 工具的模型菜单,写下确切的名称和版本。然后给全组一个带着规则的问题,比如一条收入限制加一个截止日期。一半人问快速模型,一半人问推理模型。把几个答案念出来听听。用心程度的差别是看得出来的,而两种答案都仍然需要核实,这一点也同样看得出来。

本页引用来源
  1. Ahia, O., Kumar, S., Gonen, H., Kasai, J., Mortensen, D. R., Smith, N. A., & Tsvetkov, Y. (2023). Do all languages cost the same? Tokenization in the era of commercial language models. Proceedings of EMNLP 2023, 9904-9923. https://doi.org/10.18653/v1/2023.emnlp-main.614
  2. Hinton, G., Vinyals, O., & Dean, J. (2015). Distilling the knowledge in a neural network. arXiv:1503.02531. https://arxiv.org/abs/1503.02531
  3. Hoffmann, J., Borgeaud, S., Mensch, A., et al. (2022). Training compute-optimal large language models. Advances in Neural Information Processing Systems 35. https://arxiv.org/abs/2203.15556
  4. Kaplan, J., McCandlish, S., Henighan, T., et al. (2020). Scaling laws for neural language models. arXiv:2001.08361. https://arxiv.org/abs/2001.08361
  5. Liu, N. F., Lin, K., Hewitt, J., Paranjape, A., Bevilacqua, M., Petroni, F., & Liang, P. (2024). Lost in the middle: How language models use long contexts. Transactions of the Association for Computational Linguistics, 12, 157-173. https://doi.org/10.1162/tacl_a_00638
  6. Open Source Initiative. (2024). The Open Source AI Definition 1.0. https://opensource.org/ai/open-source-ai-definition
  7. Ouyang, L., Wu, J., Jiang, X., et al. (2022). Training language models to follow instructions with human feedback. Advances in Neural Information Processing Systems 35. https://arxiv.org/abs/2203.02155
  8. Sharma, M., Tong, M., Korbak, T., et al. (2024). Towards understanding sycophancy in language models. International Conference on Learning Representations (ICLR) 2024. https://arxiv.org/abs/2310.13548
  9. Turpin, M., Michael, J., Perez, E., & Bowman, S. R. (2023). Language models don't always say what they think: Unfaithful explanations in chain-of-thought prompting. Advances in Neural Information Processing Systems 36. https://arxiv.org/abs/2305.04388
  10. Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). Attention is all you need. Advances in Neural Information Processing Systems 30. https://arxiv.org/abs/1706.03762
  11. Wei, J., Wang, X., Schuurmans, D., et al. (2022). Chain-of-thought prompting elicits reasoning in large language models. Advances in Neural Information Processing Systems 35. https://arxiv.org/abs/2201.11903