多场景 PAI-Diffusion 中文模型家族大升级,12 个模型、2 个工具全部开源

1,372次阅读
没有评论

概述

在过去几年中,随着 AI 生成内容(AI Generated Content,AIGC)的快速发展,Stable Diffusion 模型在该领域崭露头角。阿里云机器学习 PAI 团队为推动这一领域的发展,参考了 Stable Diffusion 的模型结构,结合中文语言的特点,通过大量对模型预训练数据的处理和过滤,以及训练过程的优化,提出了 PAI-Diffusion 中文文图生成模型,实现了图像生成质量的大幅提升和风格多样化。PAI-Diffusion 模型的 Pipeline 不仅包含了标准的 Diffusion Model,还集成了中文 CLIP 跨模态对齐模型,使得模型能够生成符合中文文本描述的各种场景下的高清大图。此外,我们也推出了 PAI 的自研 Prompt 美化器 BeautifulPrompt,赋能 Stable Diffusion 类应用一键出美图。

我们在这次的工作中,将 PAI-Diffusion 中文模型家族扩展到多种应用场景,支持文生图、文图生图、图像修复、LoRA、ControlNet 等多种常见功能。为了更好地与开源社区互动,我们将 12 个 PAI-Diffusion 中文模型(包括基础模型、LoRA、ControlNet 等)全部开源,并支持用户自由下载和使用,与开发者一起共同推动 AI 生成内容技术的发展,创造出更有创意和影响力的作品。此外,PAI-Diffusion 中文模型对应两个推理工具也在开源社区推出。其中,Chinese Diffusion WebUI 作为 Stable Diffusion WebUI 的插件与 PAI-EAS 无缝兼容,支持 5 分钟内一键在 PAI-EAS 拉起中文 AIGC 应用;Diffusers-API 也完美支持中文模型的快速部署和推理。

在下文中,我们详细介绍 PAI-Diffusion 中文模型家族及其工具 Chinese Diffusion WebUI 和 Diffuser-API 的使用。

多场景的 PAI-Diffusion 中文模型家族

我们利用海量中文图文对数据,训练了如下 12 个模型,包括基础模型、LoRA、ControlNet 等,模型列表如下:

多场景 PAI-Diffusion 中文模型家族大升级,12 个模型、2 个工具全部开源

上述所有模型都可以在我们的 Hugging Face Space 进行下载,我们的模型也可以通过 ModelScope 进行调用。模型生成的效果如下所示:

多场景 PAI-Diffusion 中文模型家族大升级,12 个模型、2 个工具全部开源

下面给出了三个 PAI-Diffusion 中文模型的应用场景:

应用场景一:输入草稿图和对应的 Prompt,生成精细的艺术图画。

多场景 PAI-Diffusion 中文模型家族大升级,12 个模型、2 个工具全部开源

应用场景二:污染破损的古诗词绘画图像的修复,即 image in-painting。 

多场景 PAI-Diffusion 中文模型家族大升级,12 个模型、2 个工具全部开源

应用场景三:为国风游戏绘制中国古代室内场景。

多场景 PAI-Diffusion 中文模型家族大升级,12 个模型、2 个工具全部开源

为了尽可能提升模型输出图像的质量,我们搜集海量开源的图文对数据集,包括大规模中文跨模态预训练数据集 WuKong、大规模多语言多模态数据集 LAION-5B 等。此外,我们也搜集了大量不同领域、不同场景的数据集,用于扩展 PAI-Diffusion 中文模型家族的应用场景。我们针对图像和文本进行了多种清洗方式,筛选掉低质量数据。具体的数据处理方式包括 NSFW(Not Safe From Work)数据过滤、水印数据去除,我们也使用 CLIP 分数和美观值分数评分,过滤 CLIP 分数和美观值分数较低的数据,保证生成图像的语义一致性和质量。为了适配中文语义场景,我们的 CLIP Text Encoder 采用 EasyNLP 自研的中文 CLIP 模型(https://github.com/alibaba/EasyNLP)进行建模,使得模型更懂中文语言。

PAI-Diffusion 中文模型部署工具

本节详细介绍 PAI-Diffusion 中文模型对应的两个开源工具。Chinese Diffusion WebUI 作为插件与 PAI-EAS 无缝兼容,支持 5 分钟内一键拉起中文 AIGC 应用;Diffusers-API 通过 API 形式支持中文模型的快速部署和推理。

Chinese Diffusion WebUI

由于 Stable Diffusion WebUI 无法原生支持中文模型,我们开发了 Chinese Diffusion WebUI,作为 Stable Diffusion WebUI 的插件提供给用户。它提供了图形划的用户界面,使用户(尤其是没有编程经验的设计师)可以使用 PAI-Diffusion 中文模型的多种功能,例如文生图、图生图、图像风格迁移、图像编辑等。Chinese Diffusion WebUI 的界面如下图所示:

多场景 PAI-Diffusion 中文模型家族大升级,12 个模型、2 个工具全部开源
多场景 PAI-Diffusion 中文模型家族大升级,12 个模型、2 个工具全部开源

为了方便用户在 PAI-EAS 上使用 Chinese Diffusion WebUI,我们的插件也支持了两种模式:单机版本和集群版本,用户可以根据需求和资源选择不同的模式。在单机版中,用户在独占的节点上使用 Chinese Diffusion WebUI,特别方便个人设计师的使用。集群版利用 PAI 的弹性推理服务,实现并行处理,高效利用和共享计算资源,从而实现了更高的资源利用率。

此外,Chinese Diffusion WebUI 也可以在非 PAI-EAS 环境下使用,用户只需要在下载 Chinese Diffusion WebUI 插件,放置在标准 Stable Diffusion WebUI 的插件目录下就可以实现本地的使用了。

Diffusers-API

Diffusers-API 是阿里云机器学习 PAI 团队开源的、基于 Diffusers 的文图生成云服务 SDK。用户可以直接基于本项目提供的镜像,在 PAI-EAS 上部署各种 Diffusion 相关服务,例如文生图、图生图、LoRA、ControlNet 等。Diffusers-API 还基于 PAI-Blade 对模型进行了推理优化,降低推理流程的端到端延迟 2.3 倍,同时可显著降低显存占用,超过 TensorRT-v8.5 等业内 SOTA 优化手段。

在 Diffusers-API 中,我们使用 StableDiffusionLongPromptWeightingPipeline 作为默认的推理接口,以支持带有权重的、无长度限制的英文 Prompt。然而,Diffusers 默认的推理接口无法无缝支持中文文本的处理。我们扩展了 StableDiffusionLongPromptWeightingPipeline,根据载入模型的 Text Encoder,自动检测语言,并且进行适配,使得无需修改 Diffusers-API 的任何接口的条件下,支持社区 Stable Diffusion 和 PAI-Diffusion 中文模型的一键部署,其 HTTP 请求体示例如下:

{ 
"task_id" : "001",  
"prompt": "一只可爱的小猫咪",  
"negative_prompt": "模糊", 
"cfg_scale": 7,
"steps": 25,
"image_num": 1,
"width": 512, 
"height": 512,
"use_base64": True
}

部署 PAI-Diffusion 中文模型的步骤详见这里。

总结

通过先前的 PAI-Diffusion 中文模型的开源,我们成功提升了图像生成质量和风格多样化,并实现了中文文本描述下各种场景的高清大图生成。此外,我们还推出了自研的 Prompt 美化器 BeautifulPrompt,为 Stable Diffusion 类应用提供了一键美图的能力。在本次的工作中,我们不仅将 PAI-Diffusion 中文模型家族扩展到多种应用场景,还全面开源了 12 个 PAI-Diffusion 中文模型,包括基础模型、LoRA、ControlNet 等。我们的工作希望为开发者们提供更多的创作可能性和创新机会,共同推动 AI 生成内容技术的发展,创造出更有创意和影响力的作品。此外,我们还推出了两个开源工具,Chinese Diffusion WebUI 和 Diffuser-API,提供便捷的使用体验。Chinese Diffusion WebUI 作为插件与 PAI-EAS 无缝兼容,支持用户在 5 分钟内快速搭建中文 AIGC 应用;而 Diffusers-API 则完美支持中文模型的快速部署和推理。我们期待与开发者们共同推动 AI 生成内容技术的前进。

正文完
可以使用微信扫码关注公众号(ID:xzluomor)
post-qrcode
 0
评论(没有评论)

文心AIGC

2023 年 9 月
 123
45678910
11121314151617
18192021222324
252627282930  
文心AIGC
文心AIGC
人工智能ChatGPT,AIGC指利用人工智能技术来生成内容,其中包括文字、语音、代码、图像、视频、机器人动作等等。被认为是继PGC、UGC之后的新型内容创作方式。AIGC作为元宇宙的新方向,近几年迭代速度呈现指数级爆发,谷歌、Meta、百度等平台型巨头持续布局
文章搜索
热门文章
潞晨尤洋:日常办公没必要上私有模型,这三类企业才需要 | MEET2026

潞晨尤洋:日常办公没必要上私有模型,这三类企业才需要 | MEET2026

潞晨尤洋:日常办公没必要上私有模型,这三类企业才需要 | MEET2026 Jay 2025-12-22 09...
面向「空天具身智能」,北航团队提出星座规划新基准丨NeurIPS’25

面向「空天具身智能」,北航团队提出星座规划新基准丨NeurIPS’25

面向「空天具身智能」,北航团队提出星座规划新基准丨NeurIPS’25 鹭羽 2025-12-13 22:37...
钉钉又发新版本!把 AI 搬进每一次对话和会议

钉钉又发新版本!把 AI 搬进每一次对话和会议

钉钉又发新版本!把 AI 搬进每一次对话和会议 梦晨 2025-12-11 15:33:51 来源:量子位 A...
5天连更5次,可灵AI年末“狂飙式”升级

5天连更5次,可灵AI年末“狂飙式”升级

5天连更5次,可灵AI年末“狂飙式”升级 思邈 2025-12-10 14:28:37 来源:量子位 让更大规...
商汤Seko2.0重磅发布,合作短剧登顶抖音AI短剧榜No.1

商汤Seko2.0重磅发布,合作短剧登顶抖音AI短剧榜No.1

商汤Seko2.0重磅发布,合作短剧登顶抖音AI短剧榜No.1 十三 2025-12-15 14:13:14 ...
最新评论
ufabet ufabet มีเกมให้เลือกเล่นมากมาย: เกมเดิมพันหลากหลาย ครบทุกค่ายดัง
tornado crypto mixer tornado crypto mixer Discover the power of privacy with TornadoCash! Learn how this decentralized mixer ensures your transactions remain confidential.
ดูบอลสด ดูบอลสด Very well presented. Every quote was awesome and thanks for sharing the content. Keep sharing and keep motivating others.
ดูบอลสด ดูบอลสด Pretty! This has been a really wonderful post. Many thanks for providing these details.
ดูบอลสด ดูบอลสด Pretty! This has been a really wonderful post. Many thanks for providing these details.
ดูบอลสด ดูบอลสด Hi there to all, for the reason that I am genuinely keen of reading this website’s post to be updated on a regular basis. It carries pleasant stuff.
Obrazy Sztuka Nowoczesna Obrazy Sztuka Nowoczesna Thank you for this wonderful contribution to the topic. Your ability to explain complex ideas simply is admirable.
ufabet ufabet Hi there to all, for the reason that I am genuinely keen of reading this website’s post to be updated on a regular basis. It carries pleasant stuff.
ufabet ufabet You’re so awesome! I don’t believe I have read a single thing like that before. So great to find someone with some original thoughts on this topic. Really.. thank you for starting this up. This website is something that is needed on the internet, someone with a little originality!
ufabet ufabet Very well presented. Every quote was awesome and thanks for sharing the content. Keep sharing and keep motivating others.
热评文章
读懂2025中国AI走向!公司×产品×人物×方案,最值得关注的都在这里了

读懂2025中国AI走向!公司×产品×人物×方案,最值得关注的都在这里了

读懂2025中国AI走向!公司×产品×人物×方案,最值得关注的都在这里了 衡宇 2025-12-10 12:3...
5天连更5次,可灵AI年末“狂飙式”升级

5天连更5次,可灵AI年末“狂飙式”升级

5天连更5次,可灵AI年末“狂飙式”升级 思邈 2025-12-10 14:28:37 来源:量子位 让更大规...
戴尔 x OpenCSG,推出⾯向智能初创企业的⼀体化 IT 基础架构解决方案

戴尔 x OpenCSG,推出⾯向智能初创企业的⼀体化 IT 基础架构解决方案

戴尔 x OpenCSG,推出⾯向智能初创企业的⼀体化 IT 基础架构解决方案 十三 2025-12-10 1...
九章云极独揽量子位三项大奖:以“一度算力”重构AI基础设施云格局

九章云极独揽量子位三项大奖:以“一度算力”重构AI基础设施云格局

九章云极独揽量子位三项大奖:以“一度算力”重构AI基础设施云格局 量子位的朋友们 2025-12-10 18:...
乐奇Rokid这一年,一路狂飙不回头

乐奇Rokid这一年,一路狂飙不回头

乐奇Rokid这一年,一路狂飙不回头 梦瑶 2025-12-10 20:41:15 来源:量子位 梦瑶 发自 ...