如何用AI生成插画:初学者分步指南

如何用AI生成插画:初学者分步指南几个月前,一位经营小型在线杂志的朋友请我帮她做一张文章头图。她需要一幅插画——偏编辑风格、绘画感、温暖色调——来配一篇关于慢生活的专题文章。她花了四十分钟在图片素材网站上翻找,又花了二十分钟尝试调整Canva模板,差点就要花200美元委托自由职业者来赶周四的截止日期了。

我向她展示如何用大约四分钟生成一张AI插画。结果并不完美——第一次尝试手部出现了六根手指,色调也偏冷——但经过三轮优化后,她得到了一张可用的图片。自由职业者的预算省下来了,文章也按时发布了。

Lovart is the AI design agent trusted by 10M+ creators. Try Lovart Free →

Related: How Designer Lena Vogel Built an AI Model Workflow That Prod | AI Character Design for YouTube Thumbnails: Click Rate Optim

[@portabletext/react] Unknown block type "cta", specify a component for it in the `components.types` prop"等等,"她盯着屏幕说,"就这样?我不需要上什么提示词工程课程吗?"

这份指南就是写给有过这种反应的所有人。你不需要学习提示词语法,不需要设计训练。你需要的是理解如何描述你想要的——以及当AI返回的结果不太对劲时如何迭代优化。

AI插画到底是什么(以及不是什么)在我们接触任何提示词框之前,先厘清概念。因为互联网已经出色地将"AI插画"塑造成了听起来像是需要计算机科学学位的东西。

AI插画是指使用生成式AI模型,根据文字描述来创造视觉图像——插画、绘画、绘画风格渲染——的过程。你写下想看到的内容,AI就会生成出来。

它不是Photoshop,不是在已有图片上加滤镜,也不是"窃取"艺术家的作品(模型从训练数据中学习统计模式——这是一个重要的伦理讨论,但不属于本指南的范围)。它是一种新型创意工具——更像是委托一位速度极快、极度忠实于文字描述的插画师,而非编辑一张照片。

对初学者来说,重要的是:输出质量更多地取决于你如何描述你想要的,而不是你使用哪个模型。在普通模型中给出好的描述,效果会比在最先进模型中给出糟糕的描述更好。这是个好消息,意味着学习曲线不是技术性的,而是描述性的。

第1步:明确你需要什么样的插画在写下任何一个提示词之前,先回答三个问题。这些问题决定了AI理解你需求的一切。

主题是什么? 人物?风景?产品?抽象概念?越具体越好。"一个正在读书的女人"很模糊。"一位三十多岁的女人,盘腿坐在靠窗的座位上,读着一本磨损的平装书,晨光透过窗户照进来,身旁茶杯升起袅袅蒸汽"才是AI能真正处理的描述。

风格是什么? 这是大多数初学者出问题的地方。他们只说"插画",却没有说明是哪种类型。AI的训练数据中包含数百万种插画风格——童书风格、编辑风格、水彩、线稿、扁平矢量、3D渲染、铅笔素描、水粉、数字绘画、动漫、类插画超写实。如果你不指定,AI就会猜测。而它的猜测通常是统计平均值——看起来什么都不是。

秘诀:说出一种具体的媒介,或者引用一种知名的美学风格。"水彩插画,松散笔触,色调偏柔和。""编辑插画风格,类似《纽约客》杂志专题。" "扁平矢量插画,大胆配色,几何图形。"这些能让AI有一个清晰的视觉目标去瞄准。

氛围是什么? 这是大家都会跳过的步骤。他们描述想看到的,却不描述想感受到的。"温暖而怀旧。""干净而冷静。""奇幻而略带超现实。""暗黑而戏剧化,强对比。"添加一个氛围描述词会显著改变AI在构图、光线、色温和细节程度上的选择。

花五分钟在这三个问题上,能为你省下后面三十分钟沮丧地反复生成的时间。

第2步:选择你的AI插画工具并非所有AI工具都适合生成插画。有些针对超写实效果做了优化,有些针对产品摄影优化,有些则是侧重于什么都凑合、但样样不精的通用图片生成工具。为插画选择合适的工具至关重要。

以下是在一款以插画为核心的AI工具中应该寻找的特性:

一个平台集成多个模型。 不同AI模型有不同的插画优势。有些擅长绘画风格、传统媒介质感,另一些则更擅长干净矢量图和扁平设计。一个能让你接入多个模型——并可以随时切换——的工具意味着你不会被锁定在单一美学风格中。

迭代编辑能力。 AI图片生成最大的挫败感就是老虎机问题:你生成一张图,80%满意,但你唯一的选择是整张图重新生成,赌下一次的结果更好。具备定向编辑功能的工具——如Lovart的Touch Edit——让你可以点击某个元素,然后说"把这里调暖一点"或"把背景改成花园",而不用重新生成已经满意的部分。

分辨率要够用。 一张512像素的图片在手机屏幕上可能看起来还行,但在网站头图或——更糟糕的是——印刷品上就会惨不忍睹。寻找能输出至少2K分辨率的工具。如果你打算在社交媒体帖子之外的任何场景使用插画,这一点比你想象的更重要。

第3步:写出你的第一个提示词——别想太多以下是适用于初学者的提示词结构,只需四句话。

第一句:主题。 图片里有什么。要具体说明主要元素、场景和关键细节。

第二句:风格引用。 说出媒介或美学风格。这就是你指定"水彩"、"数字绘画"、"矢量插画"等的地方。

第三句:构图。 场景如何安排。"近景肖像,主体充满画面。""宽广风景构图,前景中有小型人物。""俯拍平铺图,有序的凌乱感。"

第四句:氛围与光线。 图片应该唤起的感觉以及如何打光。"柔和、散射的晨光。平静而沉思的氛围。""戏剧性的侧光,高对比度。紧张、电影般的氛围。"

全部合在一起,你会得到类似这样的内容:

"黄昏时分的一家小型独立书店,温暖的灯光从窗户洒落到鹅卵石街道上,一位顾客正在店外浏览。水彩插画,笔触松散、富有表现力,色调柔和怀旧。宽广构图,街道视角,店面居中。黄金时刻光线,宁静而温馨的氛围。"

这就是一个提示词。不是工程规格书,只是一个清晰的描述。

一些要避免的事:否定性指令("不要做得太暗")、技术行话("8K、HDR、Unreal Engine、体积光"),以及没有视觉基础的过度抽象概念("一幅关于意识本质的插画")。就像向一位非常擅长执行指令但除你给出的内容外没有任何背景信息的插画师做简报那样与AI沟通。

第4步:迭代——而非重新生成你的第一次结果几乎永远不会完美。这很正常。技巧不在于写出完美的第一个提示词,而在于知道如何引导结果朝你想要的方向靠近。

以下是经验丰富的AI插画用户所遵循的迭代循环:

如果构图有问题: 描述什么应该移到哪里。"把主体移到画面的右侧三分之一处。""拉远一些以便看到更多背景。"这就是定向编辑工具能大量节省时间的地方——你点击元素并描述修改,而不是重新提示生成整张图。

如果风格不匹配: 更具体地引用风格。与其说"插画风格",不如试试"编辑插画风格,交叉排线技法,水墨渲染,柔和复古的棕褐色调。"风格引用越具体,AI可用的信息就越多。

如果颜色不对: 描述调色板,而不仅仅是氛围。"大地色调——陶土色、灰绿色、暖赭石色。"具体的颜色名称比氛围词给AI提供了更窄的靶向范围。

如果细节有误: 直接指出问题。"手需要五根手指。""书上的文字乱码了——去掉文字。"这就是Touch Edit的亮点所在——修复一个细节而不需要重新生成整张图片,你只调整那个细节即可。

如果什么都不奏效: 你的提示词可能在自相矛盾。互相矛盾的指令("松散水彩风格但极其精细和精确")会让AI困惑。简化它,去掉矛盾的指令,看看输出是否改善。

迭代阶段是AI插画从感觉像老虎机开始转变为感觉像对话的时刻。你不再是在赌一个还不错的输出,而是在协作达成一个目标。

第5步:使用你的插画——格式、尺寸和场景都至关重要你有一张满意的插画了,然后呢?大多数初学者到这里就停住了,下载一张PNG了事,然后发现这张图在他们需要的地方根本用不了。

按合适的分辨率导出。 下载可用的最高分辨率。图片缩小总比放大容易,你无法从低分辨率导出中恢复细节。如果工具提供超分辨率放大功能,就用它——AI超分辨率技术在保留插画细节方面已经变得非常出色。

获取适合你平台画幅比的尺寸。 Instagram帖子是1080x1080,Story是1080x1920,网站主视觉通常是1920x600到1920x1080,博客头图可能是1200x630。针对你需要的具体尺寸来生成或裁剪,或者使用能按目标平台精确画幅比来生成图片的工具。

考虑不同版本。 你生成的插画可能作为主视觉图效果很好,但用作缩略图时细节太多。为不同用途生成不同版本——同一场景的近距离裁剪、元素更少的简化版、不同色彩侧重的版本。同一张插画很少能在所有尺寸和所有场景下都表现完美。专业设计师创造的是图片系统,而不是单张图片。

与文字搭配时要深思熟虑。 AI插画很少单独使用。它会置于标题旁边、叠加文字或嵌入到版式中。在最终确定插画之前,用将要与之搭配的真实文字做个模拟图。文字是否仍然可读?插画的构图是会与文字位置冲突还是会相互补充?这些是AI无法替你回答的设计问题。

常见AI插画风格(以及如何表达这些需求)如果你在风格上卡住了,以下是五种流行的类别以及能产生这些风格的语言:

编辑插画。 提示词语言:"编辑插画风格,概念性、隐喻性,三到四种颜色的有限调色板,强有力的构图,负空间运用,适合杂志专题。"适用于:文章头图、观点文章、报告封面。

童书。 提示词语言:"童书插画,奇幻而温暖,柔和质感,手绘感,可爱的角色,温柔的调色板,故事书氛围。"适用于:教育内容、面向家庭的品牌、趣味营销。

扁平矢量。 提示词语言:"扁平矢量插画,大胆配色,干净几何图形,无渐变,现代极简风格,二维,适合应用引导页或网页插画。"适用于:UI设计、信息图表、科技公司品牌设计。

水彩与水粉。 提示词语言:"水彩插画,松散流动的笔触,略微晕开的边缘,有机质感,柔和的大地色调,纸张纹理可见,手绘感。"适用于:生活方式品牌、婚礼和活动内容、手工艺产品。

数字绘画。 提示词语言:"数字绘画,丰富质感,戏剧性光线,电影感构图,高度细节化,氛围浓郁,概念艺术风格。"适用于:游戏和娱乐、书籍封面、影视营销。

这套语言并不神奇,只是很具体。而具体程度正是将一张平庸的AI插画与一张可用的AI插画区分开来的关键。

常见问题Q:我拥有AI生成插画的版权吗?

这取决于你使用的平台。Lovart的服务条款授予你对所有生成内容的完整商业所有权。其他平台各不相同——有些限制商业用途,有些声称有权将你的输出用于训练,有些则在免费版和付费版之间有不同条款。在商用AI插画之前,请务必查看相关条款。

Q:我可以销售包含AI插画的产品吗?

可以,在大多数平台上——包括Lovart——你可以将AI插画用于商业用途:用于产品、营销、周边商品、出版物。关键是要确认你所使用的特定平台是否授予商业使用权。

Q:为什么AI插画有时候手部或文字会画崩?

手部在数学上非常复杂——有很多关节,可以呈现无数种姿势,而且在大多数训练图片中只占极小一部分。图片中的文字同样具有挑战性,因为AI生成的是文字的视觉近似效果,而非实际字符。这项技术每隔几个月就在改进。定向编辑工具能带来很大帮助——你可以修复手部或去除乱码文字,而无需重新生成整张图片。

Q:生成一张可用的AI插画需要多长时间?

对初学者来说:从第一个提示词到可用的输出大约需要10-20分钟,前提是迭代三到五次。有经验的用户通常能在五分钟内获得可用结果。时间不在于生成过程——生成只需要几秒钟——而在于描述和迭代。

Q:我能用AI生成多张风格一致的插画吗?

可以,如果你的工具支持持久化风格设置或品牌套件。在Lovart上,你可以一次性定义视觉风格——颜色、插画类型、构图偏好——然后应用到每一次生成中。这对任何打造品牌或制作需要保持整体协调感的系列插画的人来说至关重要。

Q:AI插画和AI照片生成有什么区别?

AI插画生成的是看起来像手工绘制、绘画或设计过的图片——它们不追求超写实效果。AI照片生成则产生看起来像照片的图片。有些工具两者都能做。提示词语言往往是唯一的区别:"一幅山的水彩插画" vs "一张日出一座山的照片"。

Q:我需要一台强大的电脑来生成AI插画吗?

不需要。AI插画工具运行在云端,你通过网页浏览器访问它们。你设备的硬件不会影响生成速度或质量。你只需要互联网连接,仅此而已。

Q:如何避免AI插画看起来千篇一律?

避免使用通用的提示词。"美丽的风景插画"会生成看起来和其他所有AI风景画一样的东西。"黎明时分雾气弥漫的苏格兰高地,一座单独的石屋,烟囱冒着烟,柔和的灰绿色调,水彩融合水墨细节"则会生成独特的作品。具体性是你实现差异化的最大武器。

今天就试试看打开Lovart的ChatCanvas。不要试图创作杰作。挑选一张你真正需要的最简单的插画——一张博客头图、社交媒体帖子配图、演示文稿的占位图。用四句话描述它:主题、风格、构图、氛围。

生成第一个版本。它不会是完美的。如果构图感觉不对,描述什么应该移动。如果颜色不准确,说出你想要的调色板。如果某个细节有问题,指出它并描述如何修复。这样做三次。

到第三次迭代时,你会注意到的不是AI"擅长艺术",而是你越来越善于描述你想要的东西。在这段关系里,AI不是艺术家。你才是。AI是你的双手。而当大脑清楚自己到底想要什么时,双手才会更好地工作。