Skip to content

理解大语言模型(LLM)的工作方式,是所有 AI 概念(提示词、RAG、Agent、MCP)的地基。本笔记讲透 Token、上下文窗口与自回归生成。

Token:大模型眼中的"文字"

Token 是 LLM 处理文本的最小单位——不一定是完整单词,可能是词的一部分、标点甚至空格。

"Hello, world!" → ["Hello", ",", " world", "!"]
"你好世界"     → ["你好", "世界"]

关键认知:大模型不读文字,它只读数字。Tokenizer 把文本切块(Token)并映射成固定词表里的整数 ID。

  • 词表通常 5 万~20 万 Token
  • 中文平均一个 Token 约对应 1~2 个字,所以中文文本更耗 Token
  • 这解释了为什么 LLM 数不清"strawberry"里有几个 r——它看的是 Token 数字,不是字母

上下文窗口(Context Window)

定义:上下文窗口是 LLM 的"工作记忆",决定它单次能"记住"的最大文本量(以 Token 计)。

  • 对话里:你发的消息 + AI 的回复 + 系统指令 + 检索到的资料,全部计入上下文窗口
  • 窗口满了怎么办 → 截断/压缩旧内容(Compaction),或用 RAG 按需注入
  • 不同模型窗口不同:GPT-3 4k、GPT-4 8k/32k、现代模型可达 128k~1M+

这也正是"会话状态快照"(_session-state)存在的意义——上下文窗口是有限的。

自回归生成(Autoregressive Generation)

LLM 生成文本的本质是逐 Token 预测

① 接收全部输入(Prompt + 历史)→ ② 预测下一个最可能的 Token → ③ 拼回去 → ④ 重复直到结束

几个关键采样参数控制"怎么选下一个 Token":

参数作用
Temperature随机性:低→保守稳定,高→发散创意
Top-p只从累积概率 p 内的候选里选,控制多样性
Max Tokens最多"补"多少步(输出长度上限)

核心洞察

  • 模型无记忆:每次调用都是"从零开始",它知道的全部都在输入的上下文窗口里
  • 一切 AI 技巧的本质:精准管理有限的上下文窗口——把该给的(指令/事实/工具/历史)放进去
  • 这个思想贯穿提示词工程、RAG、Agent、MCP

一句话总结

模型不读文字、只读 Token 数字,中文更耗 Token;上下文窗口是它唯一的工作记忆,模型没有记忆,所有 AI 技巧的本质都是管好这块有限的窗口。

关联概念