1. 项目缘起:当古诗词遇见AIGC,一场教育内容的“供给侧改革”

最近和几位做儿童教育产品的朋友聊天,大家都在感慨,传统内容生产的“产能”跟不上了。尤其是古诗词绘本这类产品,从选题、配图到排版,周期长、成本高,而且很难做到个性化。一个“江南可采莲”的页面,画师画出来可能是一个样子,但每个孩子脑海里的“莲叶何田田”可能千差万别。就在大家为创意和效率发愁的时候,AIGC(人工智能生成内容)这股风,实实在在地吹到了我们面前。

这不仅仅是“用AI画张图”那么简单。我理解的“儿童古诗词绘本AIGC”,是一个系统工程:它利用大语言模型(LLM)和文生图模型(如Stable Diffusion、Midjourney),将一首首经典古诗词,自动化、批量化、个性化地转化为图文并茂、适合儿童阅读的绘本页面。核心解决的痛点,是优质儿童教育内容生产的“效率”与“个性化”之间的矛盾。它适合谁?适合像我一样的内容创作者、教育行业的创业者、甚至是有心的家长老师,想为孩子定制独一无二的学习材料,但又受限于时间和专业技能。

市面上已经有不少尝试,但大多停留在单点应用,比如用AI生成一张配图。而我想探讨的,是如何构建一个从“诗”到“书”的完整工作流。这背后涉及提示词工程、图像风格控制、版面自动化设计、内容安全过滤等一系列技术点的串联。更重要的是,如何确保生成的内容不仅“像”,而且“好”——符合儿童认知,传递诗词意境,且绝对安全可靠。这就像一位经验丰富的绘本编辑,现在有了AI作为超级助手,但核心的审美把控和教育理念,依然需要人来主导。

2. 核心思路拆解:从单点生成到系统化工作流

刚开始接触这个想法时,很容易陷入一个误区:找一首诗,扔给ChatGPT写个故事,再扔给Stable Diffusion生成配图,拼起来就完事了。实际动手后才发现,这样出来的东西支离破碎,图文割裂,完全达不到绘本应有的叙事连贯性和视觉美感。一个合格的儿童古诗词绘本AIGC项目,其核心思路必须超越简单的工具叠加,转向系统化的流程设计。

2.1 工作流全景图:四步走策略

我经过多次试验和调整,总结出一个相对稳定高效的“四步走”工作流,它构成了整个项目的骨架:

  1. 诗词解析与儿童化转译 :这是所有工作的起点。输入一首古诗,首先需要大语言模型(我主要用GPT-4或国内的同级别模型)对其进行深度解析。但这解析不是学术性的,而是“儿童化”的。模型需要提取核心意象(如“孤舟蓑笠翁”中的“舟”、“蓑笠”、“雪”)、基本情感基调(孤独、静谧),然后将其转译成一个3-5句话的、有简单情节的儿童故事片段。这一步的关键提示词(Prompt)需要明确指令:“请将这首古诗转化为一个适合5-8岁儿童理解的、富有画面感的简短故事。请使用简单句式和具体名词,避免抽象词汇。”

  2. 分镜与画面描述生成 :有了故事片段,下一步就是为绘本分镜。我们需要决定一页放多少内容,以及每个画面对应什么描述。这里,大语言模型再次发挥作用。我会要求模型:“将上面的故事分解为3个连续的绘本画面,并为每个画面撰写一段详细的、适合AI绘画的文生图提示词。提示词需包含:主体描述、环境背景、色彩风格(如明亮、水彩)、画面构图(如全景、特写)、以及‘儿童绘本插图’这样的质量限定词。” 例如,针对“床前明月光”,生成的提示词可能是:“一个可爱的古代小男孩,穿着睡衣,坐在床沿,双手托腮,望着窗外。窗外有一轮巨大的、皎洁的圆月,月光如轻纱般洒进房间,照亮了木质地板。温馨的夜晚氛围,柔和的淡蓝色和暖黄色调,迪士尼卡通风格,儿童绘本插图,4K高清。”

  3. 高质量图像生成与迭代 :这是最直观也最需要耐心的一步。将上一步得到的画面描述,输入到文生图模型。我主要使用Stable Diffusion WebUI搭配特定的儿童插画风格模型(如“XX儿童绘本风格Lora”)。这一步不是一蹴而就的,需要反复调整提示词、负面提示词(用于排除不想要的元素,如“恐怖、写实、血腥”),以及采样参数。通常,一个画面需要生成5-8个批次,从中挑选最符合意境和儿童审美的版本。 一个核心技巧是使用“角色一致性”技术 ,通过LoRA模型或Reference Only等方法,确保同一主角(如诗中的“小孩”、“诗人”)在不同页面中形象基本稳定。

  4. 版面合成与内容安全审查 :图像生成后,使用设计工具(如Canva、Figma,或通过Python的PIL库自动化)将图片与对应的诗句、译文或故事文字进行排版。排版时需注意留白、字体大小和色彩搭配,确保适合儿童阅读。 但在此之前,有一个绝对不能省略的步骤:人工安全审查。 尽管我们在提示词中加入了安全限制,但AI生成仍有小概率出现怪异、不当或不符合教育导向的内容。每一张图、每一段AI生成的文字,都必须经过人工仔细核查,确保其积极、健康、无误导性。这是AIGC应用于儿童内容的生命线。

2.2 技术栈选型背后的考量

为什么选这些工具?这里有一些实战后的思考:

  • 大语言模型选型 :GPT-4在理解古诗意境和创造性转译上表现最佳,但成本高且存在网络问题。国内如文心一言、通义千问、Kimi等模型在中文古诗理解和生成上已非常出色,且更稳定。 我的策略是“混合使用” :用国内模型做初稿生成和批量处理,用GPT-4对关键或复杂诗句进行优化和润色,兼顾效率与质量。
  • 文生图模型选型 :Midjourney在艺术感和“开箱即用”上无敌,但定制性差、成本高,且角色一致性控制难。Stable Diffusion开源免费,本地部署,拥有海量的社区模型和LoRA,可以精细地训练或微调出独一无二的“儿童绘本风格”,是实现项目个性化与可控性的基石。因此, 我最终以Stable Diffusion为主力 ,辅以一些针对性的优质Checkpoint和LoRA模型。
  • 自动化脚本 :当处理数十上百首诗词时,手动操作是不可想象的。我使用Python编写了串联整个流程的脚本:调用LLM API、解析返回的JSON、批量调用Stable Diffusion的API、重命名和归类图片文件。这构成了项目的“生产线”。

注意:关于“免费的AIGC降重软件”热词 :在成人内容领域,这可能是个需求。但在儿童教育绘本创作中, “降重”不是核心关切,甚至是要避免的 。我们追求的是在正确理解诗词基础上的、富有创意的“转译”,而不是对现有内容的改写以避免重复。核心价值在于生成的新颖、恰当的视觉化表达,而非文本本身的“查重率”。盲目使用降重工具,可能会损害内容的准确性和儿童适宜性。

3. 实操深水区:提示词工程与风格控制

系统流程搭建好后,真正的挑战在于细节的实现。AIGC领域有句话叫“Garbage in, garbage out”(垃圾进,垃圾出),在绘本生成中体现得淋漓尽致。提示词的质量直接决定了最终作品的成败。

3.1 儿童绘本提示词的核心要素

一个高效的儿童绘本图像提示词,不是形容词的堆砌,而是有结构的蓝图。我总结了一个“五层结构法”:

  1. 主体与动作层(核心) :清晰定义画面主角(谁)在做什么(干什么)。例如:“一个扎着两个发髻的小女孩,踮起脚尖,伸手去摘树上的红苹果。”
  2. 环境与细节层(丰富) :描述场景、时间、天气及关键细节。例如:“在阳光明媚的果园里,秋天,树叶有些泛黄,草地上有一个小竹篮。”
  3. 风格与质量层(定调) :这是决定画面“感觉”的关键。必须明确:“儿童绘本插图,水彩手绘风格,柔和线条,圆润造型,温暖明亮色彩,2D卡通,高细节,4K分辨率。” 负面提示词则要加入:“恐怖,暗黑,写实照片,成人内容,文字,水印,变形的手脚。”
  4. 构图与镜头层(引导) :告诉AI你想要的视角。例如:“全景视角,微微俯视,主体位于画面中央。”
  5. 技术参数层(控制) :在Stable Diffusion中,这包括采样方法(如DPM++ 2M Karras)、步数(20-30)、尺寸(建议512x768或768x512以适应绘本竖版)。 一个关键技巧是使用较低的CFG Scale(如7-9) ,这能让画面更柔和,更符合儿童审美,避免AI因为过度遵循提示词而产生生硬感。

3.2 实现角色与风格一致性

这是绘本,不是画册。如果每一页的主角长得都不一样,故事就碎了。实现一致性有几种主流方法:

  • LoRA训练法(推荐,成本适中) :为自己设定的主角(例如一个叫“童童”的通用古代儿童形象)准备20-30张多角度、多表情的设定图,在Stable Diffusion中使用LoRA训练方法进行训练。训练完成后,得到一个几十兆的小模型文件。在生成任何页面时,在提示词中加入“ lora:TongTong:0.8 ”这样的触发词,就能稳定地召唤出“童童”的形象。权重(0.8)可以微调以平衡角色一致性和场景适应性。
  • Reference Only或IP-Adapter法(快速,但控制力稍弱) :这些是SD的新插件或功能。你只需上传一张角色参考图,AI就会在生成新图时尽力模仿该角色的面部和大致风格。这种方法无需训练,适合快速测试或角色设定尚未完全固定的情况,但在复杂场景和多人物互动中,稳定性不如训练好的LoRA。
  • 固定随机种子法(基础,但有限) :在Stable Diffusion中,使用相同的正面/负面提示词、相同的模型和相同的随机种子(Seed),可以生成高度相似的图像。但这通常用于生成同一场景的不同变体,对于跨越不同诗词、不同场景的角色一致性,作用非常有限。

我的实操心得是:对于长期项目,花时间训练一个高质量的专属角色LoRA是值得的。 它像是一个定制的演员,随时听候调遣,极大提升了后续批量生产的效率和质量稳定性。

4. 从诗到书:一个完整的《静夜思》页面生成实录

理论说了很多,我们来看一个完整的实操例子,以李白的《静夜思》为例,生成一个对开页(两页)。

4.1 第一步:LLM解析与故事化

我向大语言模型(以文心一言为例)发送如下Prompt:

你是一位资深的儿童绘本编辑。请将李白的《静夜思》(床前明月光,疑是地上霜。举头望明月,低头思故乡。)转化为适合5岁儿童的理解。
请按以下步骤输出JSON格式:
1. 用一句话解释这首诗在讲什么(儿童能懂的语言)。
2. 将这首诗扩展成一个有3个场景的、非常简短的小故事(每个场景2-3句话)。
3. 为这3个场景分别写一段详细的AI绘画提示词,用于生成儿童绘本插图。提示词需包含:时间、地点、人物动作、环境细节、色彩风格(温馨、柔和)、以及“儿童绘本插图”这个关键词。

模型的返回结果(经整理):

{
  "poem_explanation": "这首诗讲的是一个古代的小朋友,晚上看到床前明亮的月光,以为是地上结了霜,他抬头看看月亮,又低下头想念远方的家乡。",
  "story_scenes": [
    {
      "scene_number": 1,
      "description": "晚上,一个叫小宝的古代小男孩准备睡觉了。他坐在床边,忽然发现地上有一片亮亮的白光,像冬天看到的霜一样。",
      "image_prompt": "夜晚,古代中式风格的儿童卧室,一个约5岁、穿着白色睡衣的可爱小男孩(小宝)坐在木床边缘,睁大眼睛好奇地看着地板。银白色的月光从雕花木窗斜照进来,在地板上形成一片明亮的光斑,像一层薄薄的霜。室内光线昏暗而温馨,点着一盏小油灯,暖黄色和月光的冷白色交织。水彩手绘风格,儿童绘本插图,柔和线条。"
    },
    {
      "scene_number": 2,
      "description": "小宝觉得很奇怪,他抬起头,看向窗外。哇,原来是一轮又大又圆的月亮挂在夜空中,月光正是从那里来的。",
      "image_prompt": "视角从小宝的肩后看向窗外。夜晚,深邃的蓝色夜空,挂着一轮巨大的、皎洁的圆月,月亮上隐约有图案。月光如轻柔的纱幕洒向大地。小宝仰着头,侧脸露出惊讶和开心的表情。窗台上可能有一小盆植物。迪士尼卡通风格,儿童绘本插图,色彩明亮柔和。"
    },
    {
      "scene_number": 3,
      "description": "看着月亮,小宝想起了远方的爷爷奶奶。他低下头,小手放在胸前,心里觉得暖暖的,又有点想念。",
      "image_prompt": "小宝坐在床边,微微低下头,双手轻轻交握放在腿上,表情安静,带着一点点思念的微笑。月光温柔地笼罩着他。房间里很安静,可能有一个小布偶放在枕头边。画面充满宁静、温馨和淡淡的思念情绪。吉卜力动画风格,儿童绘本插图,高细节。"
    }
  ]
}

4.2 第二步:SD生成与迭代优化

以第一个场景的提示词为例,我将其输入Stable Diffusion WebUI。我使用的底模是经过筛选的、擅长亚洲卡通风格的模型,并加载了我事先训练好的“古代儿童-小宝”LoRA(权重0.7)。

  • 正面提示词 (best quality, masterpiece, ultra-detailed), (a cute 5-year-old ancient Chinese boy:1.2), wearing white pajamas, sitting on the edge of a wooden bed, looking at the floor with curious eyes, silver moonlight shines through the carved window, forming a bright patch on the floor like frost, dim and warm room, a small oil lamp, warm yellow and cold white moonlight, watercolor hand-painted style, children's picture book illustration, soft lines, <lora:XiaoBao_v1:0.7>
  • 负面提示词 (worst quality, low quality:1.4), (monochrome), zombie, (ugly face), (bad hands), (extra fingers), text, signature, watermark, realistic, photo, adult, scary, dark
  • 参数 :采样器 DPM++ 2M Karras,步数 28,尺寸 512x768,CFG scale 8。

点击生成。第一轮结果可能不尽如人意:也许月光太刺眼,也许孩子表情太呆板,也许构图太满。这时就需要“迭代优化”:

  1. 调整提示词 :如果月光不像“霜”,可以加强“like frost, shimmering”的描述;如果画面太暗,可以增加“soft glow”、“bright moonlight”等词。
  2. 调整LoRA权重 :如果孩子形象不够突出,将LoRA权重从0.7提高到0.8;如果风格被LoRA带偏太多,则降至0.65。
  3. 使用ControlNet :如果构图始终不理想,可以启用ControlNet的“Canny”或“Scribble”功能,手绘一个简单的草图(床、窗、人物的位置),让AI基于此线稿上色和细化,能极大提升构图可控性。

经过3-5轮调整,我得到了满意的场景一图片。然后,用同样的逻辑(保持相同的LoRA触发词和大致风格描述),生成场景二和场景三的图片。 关键点在于,通过LoRA和相对一致的风格提示词,确保三个场景中的“小宝”是同一个孩子,且画风统一。

4.3 第三步:排版与成书

三张图生成后,我使用Figma进行排版。

  • 左页 :放置场景一的图片,下方用大号、圆润的字体(如“方正少儿体”)印上“床前明月光,疑是地上霜。”诗句旁可配以小字拼音和极简的儿童化解释。
  • 右页 :上半部分放场景二的图片,下半部分放场景三的图片。对应诗句“举头望明月,低头思故乡。”排版时注意图文对应关系,留出足够的呼吸空间。
  • 整体检查 :检查色彩是否协调,文字是否清晰易读,确保没有任何AI生成的诡异细节(如扭曲的家具纹理、奇怪的光影)。确认无误后,导出为PDF或高清图片,一页精美的《静夜思》儿童绘本对开页就完成了。

5. 避坑指南:那些我踩过的“雷”与解决方案

AIGC创作充满惊喜,也遍布陷阱。尤其在儿童内容领域,有些坑一旦踩中,后果可能很严重。以下是我在实践中总结出的核心问题与解决方案,希望能帮你省下大量试错时间。

5.1 内容安全与价值观把控

这是最高优先级的红线。

  • 问题1:AI生成不当或恐怖图像 。即使在提示词中加入了大量负面词,SD模型在理解“不画什么”时仍有局限,特别是当使用了一些融合模型时,可能触发底模中不合适的元素。

    • 解决方案
      1. 使用经过筛选的安全模型 :优先使用社区推荐的、专为安全内容训练过的模型,避免使用来源不明或融合了过多元素的“万能”模型。
      2. 开启安全过滤器 :在Stable Diffusion WebUI的设置中,启用“Safety Checker”。
      3. 人工审查,无一例外 :生成每一批图片后,必须人工逐张快速浏览。建立条件反射,一旦看到任何怪异、惊悚或成人化的苗头,立即删除该图片并调整提示词(通常需要加强负面提示词,或更换模型)。
      4. “白名单”思维 :与其告诉AI“不要什么”,不如在正面提示词里更精确地描述“要什么”。例如,明确“happy expression”(快乐表情)、“safe environment”(安全环境)。
  • 问题2:文化细节错误 。AI可能混淆朝代服饰、建筑风格。例如,生成唐代故事却出现了明清家具。

    • 解决方案 :在提示词中加入明确的时代和风格限定词,如“Tang dynasty style clothing”(唐代风格服饰)、“ancient Chinese architecture”(中国古代建筑)。对于重要项目,需要准备一些参考图,使用图生图(img2img)功能或ControlNet的Reference模式进行引导。

5.2 技术实现中的稳定性问题

  • 问题3:角色“崩坏”与不一致 。这是多页面绘本最大的挑战。即便使用了LoRA,在动作幅度大、角度特殊的场景中,角色脸部或身体也可能变形。

    • 解决方案
      1. 高质量LoRA训练集 :训练LoRA时,准备的角色图片要涵盖正面、侧面、半身、全身、微笑、惊讶等多种角度和表情,背景尽量干净单一。
      2. 分部位控制 :在生成复杂动作时,可以尝试使用Regional Prompter这类插件,将提示词分为“脸部区域:描述稳定面容”和“身体区域:描述动作”,分别控制。
      3. 局部重绘(Inpainting) :如果生成的整体图很好,只是脸部稍微变形,可以使用SD的“局部重绘”功能,只对脸部区域进行重新生成,同时使用高重绘强度并固定种子,以修正细节。
  • 问题4:批量生成效率低下 。手动操作几百首诗是不可想象的。

    • 解决方案 :必须使用自动化脚本。学习使用Stable Diffusion的API(如通过 webui-api 项目)或Auto1111的脚本功能。用Python编写脚本,读取一个包含所有诗词和分镜提示词的CSV或JSON文件,循环调用API进行生成,并自动按诗名和场景编号保存图片。这将效率提升数十倍。

5.3 审美与教育性平衡

  • 问题5:画面精美但偏离诗意,或过于幼稚 。AI可能生成一幅非常卡通、色彩斑斓的画,但却完全失去了原诗“静夜思”的静谧和淡淡乡愁。

    • 解决方案 提示词是传达“意境”的桥梁 。不要只描述物体,要描述情绪和氛围。在提示词中加入如“quiet and peaceful night atmosphere”(宁静平和的夜晚氛围)、“a sense of gentle longing”(淡淡的思念之情)、“soft and dreamy”(柔和而梦幻)等描述整体感觉的词汇。同时,在风格限定上,可以尝试“Ghibli style background with simple character”(吉卜力风格的背景搭配简单人物),既能保证艺术性,又不失童真。
  • 问题6:文字与图结合生硬 。AI生成的文字解释可能过于复杂或存在事实性错误。

    • 解决方案 LLM生成的内容永远是初稿 。必须由具备教育背景或文学常识的人进行审核和润色。将AI生成的儿童化解释,与权威的诗词赏析对照,确保核心意象和情感传达准确无误,同时语言保持在目标年龄段的认知水平。

6. 进阶可能:让绘本“活”起来

当静态绘本的流水线跑通后,我们可以探索更丰富的形态,这也是AIGC的潜力所在。

6.1 生成互动元素与延伸内容

利用LLM的多模态和代码能力,我们可以轻松为每首诗生成配套内容:

  • 趣味问答 :让AI针对绘本故事生成3-5个互动问题(如“小宝为什么觉得地上有霜呀?”),附上答案,可以做成书后的“亲子问答”环节。
  • 简笔画教程 :提示AI:“将画面中的主要元素(如月亮、床、小孩)分解为3步简笔画步骤,用文字描述出来。” 这能增加绘本的动手乐趣。
  • 配套儿歌或童谣 :让AI模仿儿童儿歌的韵律,创作一首与诗词主题相关的短歌,丰富阅读体验。

6.2 动态绘本与有声书

这是AIGC的“升级玩法”。

  • 生成动态效果 :使用AI动画工具(如Stable Diffusion的AnimateDiff扩展,或Runway ML、Pika等),将关键的绘本页面转化为2-3秒的轻微动画——月光流淌、小孩抬头、树叶飘动。这种轻微的动效能极大地吸引儿童的注意力。
  • AI配音与配乐 :使用文本转语音(TTS)技术,如微软Azure、谷歌TTS或 ElevenLabs,选择一款亲切的儿童音色或故事讲述者音色,为整个绘本配音。甚至可以提示AI生成一段简单的背景音乐描述(如“宁静的、带有古筝音色的睡前音乐”),然后利用AI音乐生成工具(如Suno AI)生成一小段配乐。最终合成一个有声动态绘本视频。

6.3 个性化定制与规模化

这才是AIGC绘本的终极优势。你可以构建一个简单的界面,让家长或老师输入孩子的名字、选择喜欢的颜色或动物。后端流程中,LLM在生成故事时会将主角名字替换为定制名称,文生图提示词中也会加入“穿着蓝色衣服”(如果孩子喜欢蓝色)或“身边有一只小猫”这样的元素。虽然每本书都不同,但得益于自动化流程,其边际成本极低,真正实现了“千人千面”的个性化教育产品。

这条路走下来,我的体会是,AIGC不是要取代绘本作家和画师,而是成为他们手中一支前所未有的、充满想象力的“智能画笔”。它把创作者从重复性的体力劳动中解放出来,让我们能更专注于最核心的部分:创意策划、审美把控和教育理念的融入。技术会不断迭代,今天觉得难如登天的角色一致性,明天可能会有更简单的解决方案。但无论工具如何变化,对内容品质的坚持、对儿童心理的尊重、对教育初心的守护,才是我们使用这支“画笔”时,最不能忘记的“手”。

更多推荐