Nano Banana 提示词指南:掌握五维公式告别盲目堆砌词汇

告别咒语堆砌:Nano Banana 提示词范式重构

在图像生成与多模态模型领域,许多创作者仍习惯于从 Stable Diffusion 或早期的 Midjourney 沿袭下来的「词云堆砌法」——把各种分辨率修饰词、艺术家风格与质量词用逗号生硬拼凑。然而,Google 官方针对 Nano Banana 提示词官方指南 给出了截然不同的标准:模型拥有极强的自然语言语义解析能力,想要获得高可控、高一致性的生成效果,必须全面转向类似电影导演案的叙事化提示词工程。

本文将拆解 Google Cloud 官方总结的 Nano Banana 2 与 Nano Banana Pro 提示词核心逻辑,解析「五维公式」实操细节,并展示如何通过正向描述、精准镜头词汇以及图文融合逻辑,为后续对接 Veo 视频模型与 Lyria 音频模型打下严谨的关键帧基础。

Nano Banana 提示词指南:掌握五维公式告别盲目堆砌词汇

核心对比:传统关键词堆砌 vs 导演式叙事公式

提示词的本质是与大语言模型后端的视觉编码器进行意图同步。下表直观呈现了两种模式在提示词结构、模型解析负载与输出一致性上的真实差异:

评估维度 传统关键词堆叠模式(Tag-based) Nano Banana 导演式叙事(Director-style)
结构逻辑 碎片化词汇逗号拼接,如 masterpiece, best quality, 1girl, street 完整语义长句,严格遵循「主体+动作+场景+构图+风格」结构
语义理解 容易发生实体属性交叉污染(例如把背景颜色误涂到主体衣物上) 语法主谓宾清晰,明确区分前景主体属性与背景环境边界
排他描述 常用否定词 no cars, without trees,往往反向诱发错误元素 纯粹正向具象化表达,使用 empty street, barren land 明确空置状态
文字与排版 画面字母严重变形、乱码,文字与环境光影脱节 支持双引号包裹渲染字符,并可直接指定排版字体与字号层级
多模态扩展 静态帧难以复用,难以形成连续剧本 可无缝作为关键帧注入 Veo 生成一致性运镜视频

文生图黄金法则:五维叙事公式实操拆解

纯文本生成单张静帧时,Nano Banana 的官方底层框架可固化为:Subject(主体)→ Action(动作/状态)→ Context(场景/光影)→ Composition(镜头构图)→ Style(艺术风格与材质)。每一个要素都应采用自然的句式展开:

  1. Subject(主体):清晰指定主角形象、材质、衣着与特征,避免泛指。例如将「a barista」细化为「a middle-aged female barista wearing a canvas apron with rolled-up sleeves」。
  2. Action(动作):赋予主体动态交互,例如「carefully pouring steamed milk into an artisanal ceramic mug to form a delicate leaf pattern」。
  3. Context(环境与光影):交代空间景深与环境光源,例如「inside a dimly lit Nordic cafe, morning sunlight streaming through condensation on the tall glass window」。
  4. Composition(镜头构图):使用真实电影摄制术语,例如 cinematic wide shot、low angle looking up、shallow depth of field、50mm lens f/1.8,而非生造虚词。
  5. Style(风格与色彩):标明渲染引擎、胶片批次或美学派别,例如「kodachrome color grading, realistic textures, soft film grain, natural shadows」。

资深技术博主实测避坑:绝对不要在提示词中使用否定句(Negative Prompts)。若你不希望街道上有车,写入 no cars 时,注意力机制依旧会高亮 cars 概念从而大概率凭空画出一辆轿车。正确的写法是描述状态本身——使用 an empty asphalt road 或 a completely deserted suburban street。

图生图与精准编辑:参考图关系与文字渲染

在多模态工作流中,Nano Banana Pro 具备优秀的图生图参考解析与画面文字硬排版能力。针对参考图再生成与画面局部重绘,官方提出了明确的契约约束:

  • 带参考图生成:必须遵循「参考图关系说明 + 新场景/新动作」的句式。例如明确标注「保留参考图 1 中角色的面部结构与金色短发,将其置于暴风雨中的霓虹赛博朋克屋顶,摆出戒备姿态」。
  • 定向编辑逻辑:编辑时切勿含糊其辞,明确划定「改什么、留什么」。提示词范式为:「保持背景与环境光线不变,仅将模特身上的长袖衬衫修改为深蓝色复古工装夹克」。
  • 高精度文字渲染:需要将文字清晰印在招牌、衣物或包装上时,必须将文字用英文半角双引号转义包裹,并追加字体定位描述。例如提示词应写为:the words "BREW & BEAN" cleanly printed in bold sans-serif font across the wooden storefront sign。

生态延伸:串联 Veo 与 Lyria 的多模态工作流

Nano Banana 并不是一座孤岛。在 Google Cloud Vertex AI 生态中,通过导演式提示词生成的图片具备高度规范的场景构图与光影信息,可以直接作为首尾关键帧输入给 Veo 视频生成模型。由于构图字段中预先锁定了 dolly zoom、panning shot 或 FPV drone flight,Veo 在插帧与运镜补全时能够完全继承你的物理空间逻辑。同时,结合 Lyria 依据场景情感与节奏生成匹配的自适应配乐,一套从静态叙事卡片到沉浸式视听成片的工业化链路便水到渠成。