MiniMax-M3-MXFP8 是 MiniMax-M3 的 MXFP8 量化版本,定位于长上下文多模态任务。源文显示,MiniMax-M3 具备 100 万 token 上下文长度,参数规模约 4280 亿,激活参数约 230 亿,可处理文本、图像、视频等输入,并面向复杂推理、代码生成和协同办公等场景。
MiniMax-M3-MXFP8 源文 benchmark 图,展示模型在多类任务中的能力表现。
这不是一个全新架构的独立模型,而是 MiniMax-M3 的量化版本。README 将它归入 image-text-to-text 管线,标签包含 multimodal、moe、agent、coding 和 video,说明它的重点并不只在文本生成,也覆盖多模态理解、智能体任务和代码场景。
MiniMax-M3 通过 thinking 参数提供三种推理模式:enabled 表示始终启用推理,adaptive 表示由模型判断是否需要额外推理,disabled 则用于降低延迟、提高吞吐。这个设计让同一个模型可以在质量优先和速度优先之间做取舍。
本地部署可以先下载 MiniMax-M3 权重,源文给出的命令是 hf download MiniMaxAI/MiniMax-M3 --local-dir MiniMax-M3。推理框架方面,README 推荐 SGLang、vLLM 和 Transformers,并给出对应文档入口。
为获得更稳的推理表现,源文建议使用 temperature=1.0 与 top_p=0.95。如果站点面向开发者读者,这篇内容可以重点放在量化版本、长上下文效率和可部署框架三个角度上。