可图 Kolors:把中文字写对的文生图模型,代码与权重都开源
可图(Kolors)是快手自研的文生图大模型。它在 AI 绘画这一波里算是个特殊样本:模型本身开源得很彻底——代码、权重、配套工具链都能拿到;但面向普通用户的独立平台已在 2024 年 8 月 23 日关闭,图像生成入口整体并进了可灵 AI。想直接出图的人去可灵 AI 就好,想折腾的人则可以把权重拉下来自己跑。
先解决中文:把字写对
官方开源仓库写明,可图(Kolors)在中英文字符渲染上具备显著优势,并把「文字渲染」列为重点展示能力之一,Kolors 能生成正确的中文汉字。这在国产模型里长期是个痛点——不少模型画得出人像和场景,一遇到画面里的汉字就开始乱码。官方示例里,藤蔓花球上的「我爱世界」这类汉字是模型直接画出来的,而不是后期贴上去的。

中国元素与写实人像
官方示例按四类展示:高质量人像、中国元素生成、复杂语义理解、文字渲染。中国元素这块包括长城、古典建筑与中国城市天际线;写实人像走的是自然肤质与电影感光线那条路线。这两类恰好是中文创作者用得最多的场景——国风插画、节日海报、电商人像,官方都给了现成的参照。


技术账:256 tokens 上下文与自建评测集
官方技术资料写明,可图基于隐空间扩散(latent diffusion)模型,在数十亿图文对上训练;文本侧支持中英文双语输入,上下文长度达 256 tokens。团队还自建了评测集 KolorsPrompts——1000 多条提示词,覆盖 14 个类别与 12 个评价维度,人工与机器评估同时做。2024 年 7 月 3 日,可图在 FlagEval 多模态文生图榜单拿到第二名,中英文主观质量评估位列第一。
开源到什么程度
这是可图比较特别的地方。官方开源仓库写明:项目代码采用 Apache-2.0 许可,模型权重面向学术研究完全开源,商业使用需向官方登记。除主模型外,IP-Adapter、ControlNet(Canny / Depth / Pose)、Inpainting、LoRA 这些常用能力也都已开源,并且已经支持 ComfyUI、Gradio 与 Diffusers——也就是说,它能直接接进现有的 AI 绘画工作流,而不是只能在一个封闭网页里用。
现在去哪儿用它
可图官网的公告写明:可图后续通过可灵 AI 平台继续提供图像生成服务,原可图平台已于 2024 年 8 月 23 日正式关闭。原有的 AI 创作与 AI 形象定制能力都整合进了可灵 AI;2025 年 4 月可灵 AI 发布可图 2.0 图像生成模型,同年 7 月 10 日上线可图 2.1。有一点要注意:官方明确说平台迁移不保留历史创作记录,如果你还有旧作品留在可图平台上,得先自行保存。
也要说清的边界
两件事值得先知道。一是可图已经不是一个独立在运营的产品,网上不少「可图官网入口」的旧教程还指向已关闭的地址,实际能用的入口在可灵 AI。二是开源不等于随便用:权重对学术研究开放,商用需要按官方要求登记;官方也提示,生成模型存在随机性,输出内容的准确性与安全性无法完全保证。这两条不是坑,但都是选型前该算进去的成本。
一句话概括:可图(Kolors)的价值不在「又一个 AI 画图网站」,而在于它是一个能写对中文、权重开源、能接进 ComfyUI 的中文文生图模型;日常出图去可灵 AI,重度玩家把权重拉下来自己跑,两条路都通。