7月21日,阿里发布最新图像生成基础模型Qwen-Image-3.0。该模型支持最大4.5k Token超长输入,可一次生成涵盖公式符号、几何图形、逻辑推导步骤等多元素融合的知识图解、复杂UI界面,同时支持12国语言和20多款字体原生渲染。

据CNMO科技了解,Qwen-Image-3.0是千问图像生成和编辑模型系列的第三代基础模型,对于GPT-Image-2擅长的直播间页面,Qwen-Image-3.0也能轻松生成。

Qwen-Image-3.0着重提升了模型对于复杂信息的承载能力,较前代在文本输入长度上实现了4.5倍的跃升。这意味着,在影视短剧分镜、复杂信息图、产品说明页等需要超长提示词输入的场景中,用户不再需要将需求压缩成一句话,而是可以像给设计师撰写需求文档一样,完整描述画面结构、文字内容、视觉风格和排版细节,减少反复生成和人工调试成本。凭借Qwen-Image-3.0对语义并置和空间控制能力的把握,新模型可一次性生成涵盖9种不同领域的9宫格知识图解。
此外,Qwen-Image-3.0还能轻松理解复杂指令和画面的逻辑嵌套关系,可根据一条指令在同一幅图中生成网页、软件界面、聊天窗口、海报等多类组合式视觉内容。
龙虾之父一条推文:Loop 时代终结?
Gartner最新预测:全球AI模型与平台市场高速增长:2026 年规模将达 640 亿美元
腾讯混元发布科研智能体Hyra-1.0:单一框架打通AI研发与科学发现
AI热潮狂飙:韩国 7 月出口再创纪录 芯片暴增超1. 8 倍
OpenAI扩大ChatGPT家长通知:青少年暴力违规将触发提醒
小鹏甩出TuringViT视觉编码器:只用十分之一数据 却把SOTA基线甩在身后