Skip to content

多模态提示词工程是指导模型同时处理文本、图像、音频、视频等输入的提示技术。它不只是"看图说话"的技巧,而是把各模态信息编排进上下文窗口、让模型按你的分析路径输出的系统工程。

什么是多模态提示

多模态模型(如 GPT-4o、Claude、Gemini 等)把图像、音频、视频与文本统一编码进上下文。提示词需要回答三个问题:

  1. 看什么——输入哪些素材、聚焦哪个区域
  2. 怎么分析——按什么顺序、用什么框架处理
  3. 输出什么——期望的格式与颗粒度

文本+图像提示编排技巧

技巧说明示例
先任务后素材先说明分析目标,再传入图像"识别这张图里的品牌元素,然后……"
引用图像区域指明画面中的具体对象/位置"关注右上角的产品与左下角的价格标签"
指定分析顺序强制模型先观察再推理"先描述图表内容,再判断趋势是否合理"
要求结构化输出用表格/JSON 限定结果"输出:| 元素 | 位置 | 判断 |"
处理模态冲突图文矛盾时明确以谁为准"以图片内容为准,忽略文字说明中的不一致"

API 调用上,图像通常以 base64 或 URL 形式放入内容块(如 Claude 的 content 数组、OpenAI 的 image_url),提示词本身仍遵循"清晰指令 + 上下文 + 输出格式"原则。

图像生成提示

生成类提示与理解类不同,核心是用文字"画"出画面。常用五要素法

主体 + 环境 + 构图 + 光影与色彩 + 风格媒介

要素关注点
主体谁、长什么样、穿什么、在做什么、表情
环境场景、背景、道具、氛围
构图视角、景别、主体位置(左/中/右、前/中/背景)
光影与色彩光源方向、色调、明暗对比
风格媒介摄影/插画/3D、媒介质感(水彩、胶片、赛博朋克等)

关键经验:数量与空间关系是图像生成模型最常见的错误点。用"分区块描述"(左/中/右、上/中/下、前景/中景/背景)或坐标感提示,可显著提升准确率。进阶做法是采用结构化字段(subject/style/composition/lighting 分项描述),相当于给模型一张"设计规格表"。

视频与音频提示

  • 长上下文视频/音频:部分模型(如 Gemini)原生支持约 90 分钟视频、约 9.5 小时音频,可用时间戳引用定位片段:"从 12:30 开始的那段发言……"
  • 高频场景:会议转写与总结、视频内容提取、音画同步校验
  • 编排要点:指定采样粒度(逐句/逐段)、输出结构(要点/时间线/表格),并明确哪些片段需要重点分析

常见误区

  1. 堆砌关键词:不是"投喂关键词",而是用完整句描述任务与画面
  2. 数量与位置含糊:"几只猫""放一起"易出错,应给出明确数量与坐标式位置
  3. 忽略模态冲突:图文矛盾时不声明优先级,模型可能自行"脑补"
  4. 不给输出格式:期望表格却得到大段文字
  5. 一次性塞入过多:复杂任务未拆解,模型遗漏关键点——应先分解为识别→结构化→推理→输出

一句话总结

多模态提示先答三问——看什么、怎么分析、输出什么;生图用"主体+环境+构图+光影色彩+风格媒介"五要素法,数量与空间位置是最常见出错点。

关联概念