百度智能云 AI 作画:文心一格能力已开放 API,单次最多出 8 张

百度智能云 AI 作画是百度智能云基于文心大模型推出的文生图服务:给它一段文字,它返回一张或多张图片,面向有图片创作需求的开发者提供 API 调用服务。它和普通「AI 画图网页」的区别在于定位——不是给人点着玩的工具,而是一套可以直接接进业务流程的出图能力。产品分多个版本,其中「AI 作画-高级版」已正式商用,把百度自家文生图系统「文心一格」的能力开放成了开发者接口。

从文心一格到开发者接口

文心一格是百度基于知识和大模型打造的文生图系统,综合利用知识图谱、跨模态生成与编辑模型。官方产品说明写明:AI 作画-高级版正是接入文心一格能力的产品线,既支持文生图,也支持基于参考图的文生图,并提供了更丰富的风格(艺术创想、唯美二次元等)与更精美的画面质量。百度 AI 开放平台对它的描述是「国内技术自研、基于大模型的通用且可控的文生图系统」,可根据自然语言智能生成不限定风格的图像。

一语成画:通用文生图

基础的用法就是文字直接出图。官方示例按中国艺术、动漫设计、电商设计、游戏制作、工业设计、图库素材、插画设计、营销设计等方向给出了参照,风格跨度较大:既能出水墨山水这类传统题材,也能出二次元人物与商业产品图。对需要国风、或需要风格统一系列物料的团队来说,这种跨度决定了它能覆盖的场景有多宽。

百度智能云 AI 作画官方示例:中国艺术题材的水墨山水生成效果

以美成美:参考图作画

除了纯文字,AI 作画还支持「参考图作画」——上传一张参考图片,再配合文字描述,模型会把参考图的风格与构图迁移到新图上。官方示例里,一张真人照片(人与机器人在舱内对着笔记本)经过参考图重绘后,输出的是同构图的动漫风格画面。这类能力在需要统一视觉风格的系列物料里很实用:给定一张定调图,后面几十张图都能沿着同一套风格往下走,不必每次从零描述风格。

改文字就能改图

AI 作画-高级版支持文本驱动的图像编辑,并且可以多轮交互。官方示例给的是一个直观的对比:同一片湖面日落,只调整描述文本,画面里就多出一堆篝火。也就是说,画面微调不必重写一整段提示词,改一句话再生成即可,这在反复打磨同一张图的场景下能省不少时间。

给开发者:两个接口搞定一次出图

官方 API 文档写明,AI 作画-高级版涉及两个接口:提交请求与查询结果。提交请求接收文本、分辨率、数量、参考图等参数,创建任务并返回任务 ID;随后用查询结果接口查看生成状态,图片出好后即可拿到图片地址链接。参数上,AI 作画-高级版提供 2 个版本、9 种图片尺寸,单次最多可生成 8 张图片。这种「提交 + 轮询」的异步设计适合批量出图:一次提交多张,再按任务去取结果。

240 亿参数的知识增强扩散模型

官方资料把 AI 作画的技术路线概括为「知识增强扩散模型」:在学习过程中融入语言、视觉、跨模态等多源知识,让生成图像在语义一致性上更稳,参数规模达到 240 亿。另一个细节是基于知识的 Prompt 学习——模型会自动把简短的提示词扩充为包含风格、构图与视觉要素的更完整描述。对不擅长写提示词的人来说,这层自动补全能明显降低上手门槛。

百度智能云 AI 作画官方示例:动漫设计风格的人物生成效果

用在哪儿

官方列出的落地方向覆盖比较广:国风插画、动漫设计、游戏制作、电商设计、插画设计、营销设计、图库素材、工业设计。其中典型的是电商与营销——商品图、节日海报、社媒配图这类高频、量大、又要风格统一的物料,正好适合用 API 批量产出。

百度智能云 AI 作画官方示例:电商设计方向的饮品商品图生成效果

成本与边界

AI 作画-高级版按「点」计费。官方资源包价格表显示,基础尺寸在 v1 版本下每张消耗 2 点、v2 版本 3 点,高级尺寸则分别是 4 点与 6 点;资源包买得越大单价越低,20 万点档位折合 0.14 元/点,付费后的默认并发为 2 路。有两点需要提醒:一是价格与活动会调整,选型前建议以官方控制台的实际报价为准;二是生成模型本身存在随机性,输出内容的准确性与安全性无法完全保证,正式接入前最好先做一轮小批量测试。如果画面里需要出现中文字,也建议先验证文字渲染的准确度。

一句话概括:百度智能云 AI 作画不是又一个「AI 画图网站」,而是把文心一格的文生图能力做成了可调用的服务——文生图、参考图作画、文本驱动编辑三条路都通,按点计费、单次最多 8 张,适合需要批量出图并接入自有系统的团队。

百度智能云 AI 作画下载地址
支持的操作系统: Windows macOS Linux iOS Android