Krea2_FP8 是 Krea 2 OSS Turbo 的优化权重版本,核心价值在于把原本约 24.76 GiB 的 BF16 权重压缩到约 12.01 GiB。源文强调,它面向希望在 16GB 或 24GB 显存设备上体验 Krea 2 文生图能力的用户,重点解决模型体积、显存压力和本地部署门槛。

文生图模型部署与视觉生成流程示意图。
这个项目并不是重新训练一个完整新模型,而是围绕 Krea 2 OSS Turbo Transformer 权重进行选择性量化。README 将它定位为社区可用的优化版本,希望在保留核心生成质量的同时,让更多消费级硬件可以运行 Krea 2。
源文给出的策略比较克制:只对二维浮点权重矩阵进行 torch.float8_e4m3fn 权重量化,例如线性层和卷积层的主要权重;偏置、归一化缩放、位置编码以及其他一维向量继续保留原始高精度格式。这样做的目标是在压缩体积和保持稳定性之间取得平衡。
项目特别避开了一些容易影响输出稳定性的结构,例如小型张量、归一化相关参数,以及 README 中提到的敏感投影和调制层。对图像生成模型来说,这类保守量化能减少纹理、结构和提示词响应方面的异常风险。
Krea2_FP8 更适合本地文生图测试、工作流集成、模型部署评估和消费级 GPU 体验。对站点读者来说,它的看点不是单纯“变小”,而是用更低显存压力接近原模型工作流,让 Krea 2 OSS Turbo 有机会进入更多个人和小团队环境。
源文同时提醒用户遵守 KREA 2 的许可证和使用条款。实际落地前,建议先用固定提示词、固定种子和同一推理环境做对比测试,确认速度、显存占用和图像质量符合自己的业务需求。