Appearance
理解大语言模型(LLM)的工作方式,是所有 AI 概念(提示词、RAG、Agent、MCP)的地基。本笔记讲透 Token、上下文窗口与自回归生成。
Token:大模型眼中的"文字"
Token 是 LLM 处理文本的最小单位——不一定是完整单词,可能是词的一部分、标点甚至空格。
"Hello, world!" → ["Hello", ",", " world", "!"]
"你好世界" → ["你好", "世界"]关键认知:大模型不读文字,它只读数字。Tokenizer 把文本切块(Token)并映射成固定词表里的整数 ID。
- 词表通常 5 万~20 万 Token
- 中文平均一个 Token 约对应 1~2 个字,所以中文文本更耗 Token
- 这解释了为什么 LLM 数不清"strawberry"里有几个 r——它看的是 Token 数字,不是字母
上下文窗口(Context Window)
定义:上下文窗口是 LLM 的"工作记忆",决定它单次能"记住"的最大文本量(以 Token 计)。
- 对话里:你发的消息 + AI 的回复 + 系统指令 + 检索到的资料,全部计入上下文窗口
- 窗口满了怎么办 → 截断/压缩旧内容(Compaction),或用 RAG 按需注入
- 不同模型窗口不同:GPT-3 4k、GPT-4 8k/32k、现代模型可达 128k~1M+
这也正是"会话状态快照"(_session-state)存在的意义——上下文窗口是有限的。
自回归生成(Autoregressive Generation)
LLM 生成文本的本质是逐 Token 预测:
① 接收全部输入(Prompt + 历史)→ ② 预测下一个最可能的 Token → ③ 拼回去 → ④ 重复直到结束几个关键采样参数控制"怎么选下一个 Token":
| 参数 | 作用 |
|---|---|
| Temperature | 随机性:低→保守稳定,高→发散创意 |
| Top-p | 只从累积概率 p 内的候选里选,控制多样性 |
| Max Tokens | 最多"补"多少步(输出长度上限) |
核心洞察
- 模型无记忆:每次调用都是"从零开始",它知道的全部都在输入的上下文窗口里
- 一切 AI 技巧的本质:精准管理有限的上下文窗口——把该给的(指令/事实/工具/历史)放进去
- 这个思想贯穿提示词工程、RAG、Agent、MCP
一句话总结
模型不读文字、只读 Token 数字,中文更耗 Token;上下文窗口是它唯一的工作记忆,模型没有记忆,所有 AI 技巧的本质都是管好这块有限的窗口。
关联概念
- 应用:提示词工程-基础与框架、AI基础概念-RAG检索增强生成
- 架构:[AI-Agent-概述与核心组成](/学习笔记/AI技术/AI Agent/AI-Agent-概述与核心组成)(Agent 本质是上下文窗口管理)