Appearance
大语言模型(Large Language Model, LLM)本质上是大的深度神经网络,通过学习海量文本数据理解和生成人类语言;AIGC(AI 生成内容)则利用这类模型按给定条件自动生成文本、图像、音频、视频。两者共同构成了生成式 AI 的核心图景。相关基础可先看 大语言模型与Token。
认识大语言模型
定义与本质:LLM 是"大规模语言模型"的简称,通过大量文本数据训练,理解语言结构、语法、上下文和语义联系。本质特征:层数深、参数量大、训练数据量大。
四大特点:
| 特点 | 说明 |
|---|---|
| 通用能力 | 在海量文本上预训练,捕获广泛语言结构和世界知识,泛化能力强于传统小模型 |
| 知识丰富 | 通过简单目标(预测下一个词)训练,发展出超越传统模型的多任务能力 |
| 指令遵循 | 用自然语言建立统一任务解决模式,"提示学习"(Prompt Learning)实现人机自然交互 |
| 工具拓展 | 通过大规模预训练和灵活微调,更好适应和利用外部工具,扩展功能与问题解决能力 |
预训练与微调
- 预训练:使用 Transformer 架构在大量语料(书籍、文章、网页)上发现统计关系和模式;解决数据稀缺性、先验知识与迁移学习问题,降低训练成本
- 微调:将预训练学到的共性"移植"到特定任务模型,再用少量标注数据微调
两条预训练技术路线:
- BERT(谷歌 2018):编码器模型 + 下一个句子预测(NSP)任务——输入句子对(A,B),预测 B 是否是 A 的正确后续(正例=连续句子,负例=随机句子);微调时在编码器上加简单输出层
- GPT 系列(OpenAI):因果语言模型,预测序列中下一个词("昨天我去了→____"),擅长文本生成
技术挑战:数据配比、学习率调整、异常行为发现等经验性问题,处理不当会导致大规模训练回退、浪费算力。
国内大模型产品格局
| 产品 | 厂商 | 特点 |
|---|---|---|
| 文心一言 | 百度 | 飞桨平台 + 文心知识增强大模型,写作辅助、跨模态理解生成 |
| 讯飞星火 | 科大讯飞 | 2023 年发布,中文能力评测超越 ChatGPT,医疗/法律/教育专业突出 |
| 通义千问 | 阿里云 | 多轮交互、多模态知识理解、文生图、外部 API 互联 |
| 腾讯混元 | 腾讯 | 跨领域知识 + 自然语言理解,作为腾讯云 MaaS 服务底座 |
| 昆仑天工 | 昆仑万维 | 中国首个对标 ChatGPT 的双千亿级大模型,强大算力支撑 |
核心生成算法
| 算法 | 原理 | 特点 |
|---|---|---|
| 变分自编码器(VAE) | 编码器把高维输入转为潜在空间概率分布并抽样,解码器重构生成新数据 | 比 GAN 数学理论完备,训练更易 |
| 注意力机制 | 模仿人类关注方式,处理时集中于相关部分 | Transformer 等大模型核心 |
| Transformer | 编码器+解码器各 6 层串联,采用自注意力机制按重要性分配权重,并行处理 | 显著提高计算效率 |
| 扩散模型 | 先把先验数据分布转为随机噪声,再逐步去噪还原真实图像,神经网络学习去噪过程 | 图像质量高、无须对抗训练、可扩展并行,图像/视频生成主流 |
AIGC 概览
定义:AIGC(Artificial Intelligence Generative Content)利用 AI 模型,根据主题、关键词、格式、风格等条件自动生成文本、图像、音频、视频等内容的新型创作模式。
发展三阶段:
- 助手阶段(2021 前):主要生成文字,仅作创作辅助,内容空洞刻板
- 协作阶段(现在):人机紧密互动共创,可生成多样化个性化内容,甚至以虚拟人形态出现(PGC→UGC→AIGC 演进)
- 原创阶段(未来愿景):实现完全原创(嗅觉/触觉/味觉/情感形态)
提示词(Prompt)与提示工程
- Prompt 定义:指导用户输入和内容生成的关键词,起源于研究者为下游任务设计的输入形式,帮大模型"回忆"预训练知识
- 形式:一句简单问题、较长文本或一组指令(多个单词/词组/短句,逗号分隔)
- 影响:Prompt 的简洁度、清晰度、上下文联系强弱直接决定生成质量
- 提示工程(Prompt Engineering):涉及指令、上下文、示例、限制条件和目标等要素的设计,提高模型性能与准确性
AIGC 应用场景
| 领域 | 能力 |
|---|---|
| 文本生成 | 新闻撰写(体育/金融简讯)、给定格式撰写(报告/论文)、风格改写、生成诗歌/演讲报告/热点评论 |
| 图像生成 | 基于深度学习和 GAN,文字描述→图像;用于设计(logo/创意)、娱乐(角色/场景)、教育(教学资料) |
| 视频生成 | 提示词需更详细(时间维度+动态元素),当前高质量全自动生成仍在发展中,常需人工后期编辑 |
| 辅助编程 | 代码生成/续写(通义灵码等)、错误检测、注释生成、单元测试生成 |
| 其他领域 | 医疗(病例分析、报告生成)、金融(风险评估、市场预测)、教育(资源生成、考试出题)、娱乐(剧情/音乐/剧本) |
综合影响:提高生产效率、降低成本;对从业者提出"与 AIGC 协作"的新能力要求;同时面临内容质量参差、版权、真实性等挑战。
一句话总结
LLM 是"读了海量文本、会预测下一个词"的深度神经网络;AIGC 让它从"理解"走向"创造"。提示词是人与大模型的对话界面,提示工程是驾驭它的核心技能。相关延伸见 提示词工程、RAG。