5月9日消息,智象未来(HiDream.ai)正式开源发布新一代图像生成基础模型 HiDream-O1-Image。开源版本参数规模 8B,采用全球首创的 Pixel-level Unified Transformer(UiT)原生全模态架构,模型权重与代码以 MIT 协议完整开放,支持商用、本地部署与低代码集成。同步存在的 Pro 版(200B+ 参数、闭源)在六项主流基准中拿下 SOTA,开源 8B 版则在多个核心维度反超 GPT Image 2 与同量级闭源模型。
模型已在 Hugging Face 与 GitHub 双渠道上线,提供 Full(50 步推理、最高质量)与 Dev(28 步蒸馏版、更快)两个变体。这是智象未来继 2025 年 4 月开源 HiDream-I1(17B)之后的新一代升级,参数规模反而下降的同时多项指标全面超越前代,体现了架构升级带来的能效跃迁。
UiT 架构:单 token 空间替代 VAE 加文本编码器
HiDream-O1 最关键的技术变更集中在底层架构。Pixel-level Unified Transformer 把像素、文本、任务条件统一放进一个共享 token 空间处理,无需外部 VAE,也无需独立文本编码器。这与当前主流扩散模型"VAE 编码加 CLIP/T5 文本编码器加 DiT/UNet 主干"的三段式管线形成鲜明对比,整条链路被压缩成一个端到端 Transformer。
这种"原生全模态"设计的直接收益有三点。其一,去除 VAE 意味着像素重建误差不再是质量天花板,模型可以直接在 2048×2048 分辨率上端到端生成,免去多阶段超分。其二,文本与图像 token 共享同一注意力空间,跨模态对齐不再依赖外挂 encoder 的语义投影,长文本渲染与复杂指令理解的上限被显著拉高。其三,任务条件统一表示让"文生图、指令编辑、主体驱动个性化"等多种任务可以在同一个权重内切换,无需为每种任务单独训练 LoRA 或 ControlNet。
按官方说法,UiT 也是为未来扩展到视频与 3D 全模态生成预留的架构基础。这意味着 HiDream-O1 不是一个孤立的图像模型,而是一条多模态产品线的起点。
Benchmark 直接对标 GPT Image 2 与 FLUX.2 Dev
8B 参数下的成绩单足够硬。GenEval(组合生成)拿到 0.90 的 SOTA 成绩,对比 GPT Image 2 的 0.89 实现反超;DPG-Bench(密集提示对齐)0.8983 领先 FLUX.2 Dev;HPSv3(人类偏好)10.37 优于 GPT Image 2 的 10.21;CVTG-2K(复杂视觉文本生成)0.9128 领先所有同量级模型;LongText-Bench 中英长文本渲染 0.979 / 0.978,同样压过 GPT Image 2。
外部第三方评测体系给出的位置同样靠前。在 Artificial Analysis Text-to-Image Arena 中,HiDream-O1 位列第 8 名,是当前榜单上最靠前的开源权重模型之一。这意味着即便不考虑开源属性,仅以"出图质量加指令理解"作为单一维度评判,8B 版本也已经站到了全球前十的位置——相比之下,FLUX.1 系列、Stable Diffusion 3.x 等同等开源量级的对手在主流人类偏好基准上的差距明显。需要注意的是,这些数据由开发方自测公开,第三方独立验证仍在跟进中。
Reasoning-Driven Prompt Agent 与多语言文本渲染
模型内置的 Reasoning-Driven Prompt Agent 是另一个非典型设计。在生成前,Agent 会对用户输入的指令做一轮推理:拆解布局结构、校验物理逻辑、解析主体属性、规划文本排版,然后改写为优化后的英文 prompt,并附带 JSON 格式的 reasoning 与 resolved_knowledge 输出。
这套机制把"prompt engineering"从用户负担转移到了模型自身,对希望直接用自然语言描述需求、不愿手工调 prompt 的非技术用户尤其友好。复杂场景(如"国庆海报包含五个不同主体加多区域中文标语")在传统模型上往往需要反复调优才能稳定出图,HiDream-O1 通过 Agent 前置推理把这一过程内化。
文本渲染本身也是 HiDream-O1 的核心卖点。模型支持中英双语精准长文本渲染、多区域文本布局,目标场景明确指向海报、信息图表、标牌、商品包装等以"图文结合"为核心需求的设计领域。LongText-Bench 上中英双线接近 0.98 的成绩,以及 CVTG-2K 上 0.9128 的领先,直接对应这条赛道的实际可用性。
8B 与 Pro 200B+ 双线策略
HiDream.ai 这次的发布走的是"开源旗舰加闭源 Pro"的双线策略。8B 开源版面向社区与中小团队,单卡 CUDA GPU(推荐 flash-attn 加速)即可本地部署,Dev 蒸馏版几秒出图,对独立开发者与工具站点而言落地门槛极低。
Pro 版参数规模超过 2000 亿,闭源、不公开权重,在六项基准中拿下 SOTA。这条路径与 FLUX 系列(Pro 闭源、Dev/Schnell 开源)的策略高度相似,本质是用闭源能力撑商业化收入,用开源版本占据开发者心智与工作流入口。MIT 协议的选择把开源版的可用性进一步放大——商用无需付费授权,模型可以被直接打包进 SaaS 产品对外销售。
局限性
HiDream-O1-Image 当前公开的 benchmark 主要由开发方自测,第三方独立评测覆盖度有限。8B 参数级别在端到端生成 2048×2048 时对显存仍有一定要求,消费级显卡可能需要量化或分块处理才能稳定运行。Reasoning-Driven Prompt Agent 改写 prompt 时会把用户原文转成英文,对希望保留中文原始语义细节的场景可能产生偏差。指令式图像编辑、主体驱动个性化、故事板生成等附加能力虽列入特性清单,但社区实际验证案例尚未规模化出现。Pro 200B+ 版闭源不公开权重,开源 8B 与 Pro 之间的能力差距具体多大,外部用户暂时无法直接对比。