从零训练文生图模型的教程发布:代码与 1 亿图像数据,训练投入不小
Jasper Research 发布了一份 cookbook(教程),讲如何从零构建文生图模型。它不只有最终结果,还写了完整的推理过程和中间结果。
这份教程以交互式报告的形式发布在 Hugging Face 上。配套资源有两个:包含 1 亿图像的数据集 Monet Dataset,和带微型模型的代码库 nano t2i。代码在 GitHub,数据集在 Hugging Face。
有编程基础的人可以拿着教程、代码和数据,自己从头训练一个模型。教程适合两类人:想深入理解文生图模型的人,或对前沿实验室怎么构建模型感到好奇的人。
不过限制也摆在那里。1 亿图像的数据集规模很大,训练所需的算力和时间是一笔不小的投入。nano t2i 是微型模型,生成质量会受到容量限制。这些因素决定了它更适合理解原理,而不是直接投入生产。