术语 · AI

大语言模型

LLM

用海量文字训练出来、靠「预测下一个词元」来生成内容的模型。ChatGPT、Claude、DeepSeek、豆包背后都是大语言模型,常简称「大模型」。

根据前文,一个词元一个词元地往下接

它只会往下接
没见过也会接,接出来的只是「像」答案
大语言模型只做一件事:看着前面的内容,算出下一个词元各种可能的概率,挑一个接上,再预测下一个。聊天、写作、翻译、写代码,都是这件事重复成千上万次。

换个角度想

大语言模型像一位读过整座图书馆的「接话高手」:你说上半句,他凭读过的无数文字,接出最可能的下半句。读得够多,接出来的往往就是对的答案;但他是在接话,不是在查书,所以偶尔会接出一句听着很像、其实不对的话。

它是怎么一个词一个词写出回答的?

  1. 交给模型的前文

    前文「中国的首都是」

    交给模型的前文

    前文「我家猫的名字是」

  2. 在训练数据里见过无数次

    下一个词元的概率高度集中

    训练数据里不可能有你家的猫

    概率分散在一堆常见猫名上

  3. 「北京」96%,稳稳接上
    「咪咪」只有 8%,也照样接上了
  4. 又稳又准见过的知识,接得几乎不会错这正是大语言模型擅长的事
    像答案而已没见过也会接,不会主动说不知道这就是幻觉的来源

你的问题被切成词元送进模型

什么时候会遇到它

  1. 聊天助手

    ChatGPT、豆包、Kimi、Claude 的对话框背后,都是一个大语言模型在一个词元一个词元地生成。

  2. 写作和整理

    写邮件、做总结、翻译、改写,本质上都是让它根据你给的内容往下接。

  3. 写代码

    代码也是文字。Vibe Coding 用的编程助手,背后同样是大语言模型。

想一想

问 AI「strawberry 里有几个 r」,它有时会答错。这么强的模型,为什么会在简单的数数上出错?

看答案

它看到的是词元,不是一个个字母。「strawberry」可能被切成两三块,它并没有逐个字母去数,而是凭印象接话。让它先把单词逐个字母拼出来再数,或者让它写段代码来数,就准了。

最容易踩的坑

大语言模型不是搜索引擎,也不是数据库。它的回答是「生成」出来的,不是「查」出来的,所以说得流畅不代表说得对。需要准确事实时,让它联网检索,或者把资料直接发给它。

⌘K搜索知识库

最近收录

正在载入知识索引…