你正在使用哪种 AI 模型
你屏幕上的聊天机器人,用的是某一个具体模型,而现在大多数工具都提供不止一个选项。菜单上写着"快速"、"思考"或某个版本号,这些选择会改变工具擅长什么、要花多长时间、要花多少钱,以及它给出的答案有多大分量。四点差异,几乎涵盖了实务工作者需要知道的一切。菜单里的名字每隔几个月就会变一次,这四点差异不会变。
给你屏幕上这个工具做个体检
- 打开你真正在用的那个AI工具,找到模型菜单,把具体的模型名称和版本号记下来。
- 查一下你用的是哪个套餐,是不是免费版。
- 查一下数据设置:这家公司有没有说会用你的对话来训练模型?每人填一行,把这张表留下来。
在今天之前,你能答上来这三个关于你每天在用的工具的问题吗?
快速模型与推理模型
每个模型写字的方式都一样,一次生成一个词元(token)。不同的是,它开始下笔之前有没有先做一些"功课"。
按下发送之后发生了什么
直接开始下笔。适合写草稿、调整语气,以及处理你自己提供的文字。
先写出隐藏的中间步骤,再给出答案。更慢,但在处理规则和比对时表现更好。
除非你另外选择,工具给你的默认是一个体积小、速度快、成本低的模型,因为大多数问题根本不需要更强的模型。它会立刻开始下笔。改写一封邮件、缩短一段文字、总结你贴进去的文件,用它换来的速度很值,质量也够用。
标着"推理"或"思考"的模型,会先写出一连串中间步骤,然后才把内容显示给你。一步步推导,能明显提高那些需要走好几步才能算清楚的问题的准确率(Wei 等,2022),比如一条带三个条件的资格规则,或是两份文件之间的比对。这类模型更慢,有时要多等一分钟,运行成本也更高。
模型给你看的那些步骤,并不是它真正得出答案的过程记录。研究者在提示词(prompt)里悄悄放了一条提示,改变了模型的答案,结果模型写出的却是一段语气笃定、逐步推理的解释,只字未提那条提示(Turpin 等,2023)。推理模型确实能减少粗心的错误,但它依然可能一本正经地说错,凡是你要据此行动的内容,都得自己核实。
当一个错误会让服务对象付出代价、当问题里包含不止一个条件、或者你想要工具核对而不是生成内容时,就用推理模型。而调整语气、写草稿,以及你本来就打算仔细读一遍的文字,快速模型就够用了。
在问出真正重要的问题之前,先留意自己用的是哪种模式。把一个棘手的问题丢给快速模型,正是大多数实务工作者得到"听起来笃定、实际很浅"的答案的原因。
模型大小与参数量
模型通常用大小来描述,一般是参数量(parameters),比如 8B、70B 或 400B。这个数字值得弄懂,它没说出来的东西同样值得弄懂。
三项投入,一个模型
数据中心、笔记本电脑,还是手机
训练的过程,就是不断调整数十亿个内部数字,直到模型对下一个词元的猜测和它正在学习的文本对上。这些数字就是参数,也是模型所保留的全部内容。数一数参数量,80 亿也好,4000 亿也好,衡量的是模型有多大空间来容纳"模式",而不是事实的数量,因为模型本来就不存储事实。
三项投入共同决定了一个模型最终有多强:它学习过的文本量、训练它花了多少算力、以及它有多少参数。这三项同步提升,模型质量会跟着平稳提高;只提高其中一项,另外两项就被浪费了(Kaplan 等,2020)。用太少的文本训练一个大模型,反而会被一个用更多文本训练出来的小模型打败(Hoffmann 等,2022)。销售封闭模型的公司,这三项数字一个都不公开,所以哪怕是"这个模型比那个更大"这种说法,外界通常也无从核实。
大语言模型(large language model),参数量以千亿计,运行在数据中心(data center)里,通过互联网传到你面前。小语言模型(small language model),参数量只有几十亿,可以在笔记本电脑或手机上运行,完全不需要联网。小模型便宜、快速、私密,能力上的局限也很明显。如今这两种都是为了不同的用途特意打造出来的。
小模型不可能样样都强。但如果针对一个具体的窄任务再做训练,它在那件事上可以和一个大得多的通用模型旗鼓相当。也可以用一个大模型去"教"一个小模型,这种方法叫作蒸馏(distillation)(Hinton 等,2015)。它没法把能力推广到自己的专精范围以外。而在这个范围之内,它往往只用一小部分算力和电力就能完成同样的工作,这对成本和能耗都很重要。
分词器(tokenizer)把英语切成较少的片段,却把许多其他语言切成多得多的片段,同样的内容最多能多出五倍。这意味着同一个请求,用服务对象的语言处理时,花费更高、速度更慢,也更快占满模型的工作记忆(Ahia 等,2023)。一旦把模型缩小,它接触最少的那些语言,就是最先受影响的。一个读英语很流畅的小模型,处理越南语、阿姆哈拉语或海地克里奥尔语时,往往明显更差。
大小告诉你的是,一个模型能装下多少、能在哪里运行,它不能告诉你某一个具体答案是不是对的。
开放模型与封闭模型
这一点关乎谁掌握着模型,以及公司之外的人能不能运行它。
封闭云端与开放权重
你的文字传到公司那里,答案再传回来。通常是最强的模型,覆盖的语言也最广。条款由公司制定,模型由公司掌握,公司可以在不通知你的情况下改动它。
你下载模型,自己运行它。文字可以留在这台机器上。这需要花硬件、部署和人力的成本,而且现实中你能运行得起的模型,通常更小也更弱。
最知名的那些 AI 助手都是封闭的。公司自己保留训练好的参数,你只能通过它的应用程序或编程接口(API)接触模型。你不能查看它、不能自己运行它,公司改动或停用它的时候,你也留不住它。公司也没有义务告诉你这个模型是用什么训练的、有多大、上一次更新改了什么,而且大多数时候它确实不说。你的文字会传到公司的服务器上去获得回答。
另一些公司会公开训练好的参数,任何人都可以下载模型,在自己的电脑或所在机构的服务器上运行它。这就是为什么一台不联网的笔记本电脑也能回答你,也是为什么一个小供应商不必向任何人租用模型,就能自己做出产品。
公开出来的权重,只是最终算出来的一堆数字。产出这些数字的训练数据(training data)和训练代码,通常仍然保密,外部谁也没法研究或重建这个模型。开源促进会把"开源"这个说法,专门留给那些公开了足够信息、让人真能做到这一点的模型(Open Source Initiative,2024)。许可证也各不相同。有些开放权重模型采用标准的宽松许可证,另一些则附带定制条款,限制谁可以使用、能用来做什么。你所在机构要在某个模型基础上搭建东西之前,先把许可证读一遍。
只有当模型运行在你所在机构自己掌控的硬件上时,服务对象的文字才真正不会离开这栋楼,这也是开放权重值得关心的一个实实在在的理由。但这一点也很容易被夸大:一个应用完全可以建立在开放模型之上,却依然把每一个字都发送到某个云端服务器。问清楚文字最终去了哪里,并且要一份书面答复。
开放还是封闭,不是在给质量排名,也不是在给安全性排名。它决定的是谁能运行这个模型、你的文字会传多远,而这首先是一个关乎你的服务对象的问题,其次才是一个技术问题。
训练数据与知识截止日期
两个大小相同的模型,表现可以截然不同。一个模型,是由它看过的文本、加上后续对它做的调校(fine-tuning)共同塑造出来的。
这些模型学习自海量的网络文本,再加上授权和购买来的材料。大多数封闭模型从不公开清单,所以你没法核实模型在你问的那条规则上,到底看过什么靠谱的内容。网络文本以英语为主,服务对象所说的大多数语言在其中都很单薄,语言差距正是从这里开始的。
训练在某个日期停止,模型的"记忆"也就停在了那一天。现在许多工具会外挂一个实时网络搜索,来越过这个日期,这确实有帮助,但也把问题换了个方式:答案这时候好不好,就看工具恰好抓到了哪些网页,所以要问它用了哪些来源,并且把它们打开看一看。
放在一长段输入开头或结尾的事实,比埋在中间的同一个事实,被找到的可靠程度要高得多,而且输入越长,准确率越会往下掉(Liu 等,2024)。贴进去一份四十页的政策文件,只问一个很窄的问题,答案很可能漏掉模型技术上确实"读过"的某一段。与其把整份文件都交出去,不如直接引用你关心的那部分。
模型学会预测文本之后,人们还会用人类反馈对它做调校,让它听从指令、按特定语气回答、拒绝特定请求(Ouyang 等,2022)。真正让两个模型在对话中"感觉不一样"的,是这道工序,而不是大小。它同时也会奖励迎合。用这种方式训练出来的助手,往往会附和用户说出的看法,一旦用户提出反驳,它们就会放弃原本正确的答案(Sharma 等,2024)。给模型一个错误的前提,它多半会顺着往下编。
模型会被重新训练、更新,有时悄无声息地进行,菜单里同一个名字,指向的可能已经不是上个月那套系统了。工具更新之后,把你保存下来的提示词重新测一遍,也重新检验一下你原先对"这个工具哪里靠谱"形成的判断。
训练,是你既看不见也改不了的那部分,却决定了模型在越南语上表现如何、在某条县级规则上表现如何、在上个月的政策变化上表现如何。要假设,恰恰是在你工作所在的地方,它最单薄。
什么任务,用什么模型
- 一个工具的免费版,通常用的是它最轻量的模型。如果问题事关重大,先确认一下自己用的到底是哪个模型。
- 标着"推理"的模型,不代表它会核实事实。
- 两个产品可能用的是同一个底层模型,表现却依然不同,因为包装它的公司加上了自己的一套指令。
- 发布公告里的跑分(benchmark)成绩,测的是别人的任务,用的语言多半也不是你服务对象的语言。
- 开放模型本身并不能保护服务对象的数据。只有把它运行在你自己掌控的硬件上才能做到这一点,而大多数建立在开放模型之上的应用并不是这样。
弄清楚你用的是哪个模型
花五分钟,让每个人打开自己实际使用的 AI 工具的模型菜单,写下确切的名称和版本。然后给全组一个带着规则的问题,比如一条收入限制加一个截止日期。一半人问快速模型,一半人问推理模型。把几个答案念出来听听。用心程度的差别是看得出来的,而两种答案都仍然需要核实,这一点也同样看得出来。
本页引用来源
- Ahia, O., Kumar, S., Gonen, H., Kasai, J., Mortensen, D. R., Smith, N. A., & Tsvetkov, Y. (2023). Do all languages cost the same? Tokenization in the era of commercial language models. Proceedings of EMNLP 2023, 9904-9923. https://doi.org/10.18653/v1/2023.emnlp-main.614
- Hinton, G., Vinyals, O., & Dean, J. (2015). Distilling the knowledge in a neural network. arXiv:1503.02531. https://arxiv.org/abs/1503.02531
- Hoffmann, J., Borgeaud, S., Mensch, A., et al. (2022). Training compute-optimal large language models. Advances in Neural Information Processing Systems 35. https://arxiv.org/abs/2203.15556
- Kaplan, J., McCandlish, S., Henighan, T., et al. (2020). Scaling laws for neural language models. arXiv:2001.08361. https://arxiv.org/abs/2001.08361
- Liu, N. F., Lin, K., Hewitt, J., Paranjape, A., Bevilacqua, M., Petroni, F., & Liang, P. (2024). Lost in the middle: How language models use long contexts. Transactions of the Association for Computational Linguistics, 12, 157-173. https://doi.org/10.1162/tacl_a_00638
- Open Source Initiative. (2024). The Open Source AI Definition 1.0. https://opensource.org/ai/open-source-ai-definition
- Ouyang, L., Wu, J., Jiang, X., et al. (2022). Training language models to follow instructions with human feedback. Advances in Neural Information Processing Systems 35. https://arxiv.org/abs/2203.02155
- Sharma, M., Tong, M., Korbak, T., et al. (2024). Towards understanding sycophancy in language models. International Conference on Learning Representations (ICLR) 2024. https://arxiv.org/abs/2310.13548
- Turpin, M., Michael, J., Perez, E., & Bowman, S. R. (2023). Language models don't always say what they think: Unfaithful explanations in chain-of-thought prompting. Advances in Neural Information Processing Systems 36. https://arxiv.org/abs/2305.04388
- Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). Attention is all you need. Advances in Neural Information Processing Systems 30. https://arxiv.org/abs/1706.03762
- Wei, J., Wang, X., Schuurmans, D., et al. (2022). Chain-of-thought prompting elicits reasoning in large language models. Advances in Neural Information Processing Systems 35. https://arxiv.org/abs/2201.11903