换个角度想
大语言模型像一位读过整座图书馆的「接话高手」:你说上半句,他凭读过的无数文字,接出最可能的下半句。读得够多,接出来的往往就是对的答案;但他是在接话,不是在查书,所以偶尔会接出一句听着很像、其实不对的话。
术语 · AI
LLM
用海量文字训练出来、靠「预测下一个词元」来生成内容的模型。ChatGPT、Claude、DeepSeek、豆包背后都是大语言模型,常简称「大模型」。
根据前文,一个词元一个词元地往下接
大语言模型像一位读过整座图书馆的「接话高手」:你说上半句,他凭读过的无数文字,接出最可能的下半句。读得够多,接出来的往往就是对的答案;但他是在接话,不是在查书,所以偶尔会接出一句听着很像、其实不对的话。
前文「中国的首都是」
前文「我家猫的名字是」
在训练数据里见过无数次
下一个词元的概率高度集中
训练数据里不可能有你家的猫
概率分散在一堆常见猫名上
你的问题被切成词元送进模型
ChatGPT、豆包、Kimi、Claude 的对话框背后,都是一个大语言模型在一个词元一个词元地生成。
写邮件、做总结、翻译、改写,本质上都是让它根据你给的内容往下接。
代码也是文字。Vibe Coding 用的编程助手,背后同样是大语言模型。
问 AI「strawberry 里有几个 r」,它有时会答错。这么强的模型,为什么会在简单的数数上出错?
它看到的是词元,不是一个个字母。「strawberry」可能被切成两三块,它并没有逐个字母去数,而是凭印象接话。让它先把单词逐个字母拼出来再数,或者让它写段代码来数,就准了。
大语言模型不是搜索引擎,也不是数据库。它的回答是「生成」出来的,不是「查」出来的,所以说得流畅不代表说得对。需要准确事实时,让它联网检索,或者把资料直接发给它。