6月22日消息,东京 AI 实验室 Sakana AI 正式发布 Fugu,一个以模型 API 端点形式提供的多智能体编排系统。它不是一个传统意义上的大模型,而是一个被训练来调度其他大模型的小型 LLM——接收用户请求后,自主决定是直接回答还是将任务拆解给多个专家模型协同完成,最终合成单一输出。从调用者角度看,它就是一个 OpenAI 兼容的 API 端点,但内部跑的是一整套多 Agent 协作流水线。Sakana 的 claim 是:Fugu Ultra 在多项 benchmark 上匹配 Anthropic Fable 5 和 Mythos Preview 级别的性能,且不受美国 AI 出口管制约束。
技术架构:不是路由器,是用强化学习训出来的"指挥官"
Fugu 的核心不是规则驱动的模型路由,而是两篇 ICLR 2026 论文的工程化产物。TRINITY 是一个进化出来的轻量级协调器,在多轮对话中为不同 LLM 分配 Thinker(思考)、Worker(执行)、Verifier(验证)三种角色,自适应地分派编程、数学、推理和知识任务。Conductor 则通过强化学习训练,自主发现自然语言协调策略——它学的不是"哪个模型擅长什么"的静态映射,而是"怎么设计 Agent 之间的沟通模式和聚焦 prompt 能让一群模型合作得更好"。
与 OpenRouter 这类静态路由器的区别在于:OpenRouter 是你指定用哪个模型,Fugu 是一个任务内部可能调了 5 个模型的 7 次请求,调用者看到的只是一个最终答案。更值得注意的是递归调用机制——Fugu 在训练过程中学会了将自身作为 Agent 池中的一员再次调用,实现 test-time scaling。当子任务结果不够好时,它可以把自己当作另一个"专家"再跑一轮。 Benchmark 表现:11 项测试领先 8 项,但细节值得拆开看
Fugu Ultra 的 benchmark 覆盖编程、推理、科学和 Agent 能力四个维度,对标 Opus 4.8、Gemini 3.1 Pro 和 GPT-5.5 三个公开可用的前沿模型。数据来自官方技术报告,基线分数采用各模型提供商自报值。 核心数据:SWE-Bench Pro 73.7(Opus 4.8 为 69.2,GPT-5.5 为 58.6),TerminalBench 2.1 得分 82.1(Opus 4.8 为 74.6),LiveCodeBench 93.2,GPQA-D 95.5,Humanity's Last Exam 50.0。11 项 benchmark 中 Fugu Ultra 在 8 项上取得最高或并列最高分。
但 Fable 5 和 Mythos Preview 不在 Fugu 的 Agent 池中(因为它们不公开可用),官方在表格中注明了这一点——也就是说"匹配 Fable 5"的对标是间接的,不是同一评估框架下的直接对比。另外 SWE-Bench Pro 使用的 scaffold 是 mini-swe-agent,而 Opus 4.8 的基线分数来自 Anthropic 使用定制 scaffold 的自报值,两者评估条件不完全一致。MRCRv2 上 GPT-5.5 以 94.8 领先 Fugu Ultra 的 93.6,SciCode 上标准 Fugu(60.1)反而优于 Fugu Ultra(58.7),说明更重的编排在某些场景下引入了噪声而非增益。
最有说服力的定性测试是 AutoResearch 实验:用 Karpathy 的 AutoResearch 框架让 AI Agent 自主优化一个小型 GPT 的训练 recipe,Fugu Ultra 在单张 H100 上跑了 14 小时 123 次实验后,平均 BPB 达到 0.9774,优于所有三个单体前沿模型基线(最优对手为 0.9781)。这直接说明了多模型编排在 agentic ML 研究场景下的实际价值。
产品定位与定价:AI 主权叙事 + 两层产品线
Fugu 分为两个版本:标准版 Fugu 面向日常编程和交互式工作,平衡延迟和质量,允许用户从 Agent 池中排除特定模型/供应商以满足合规要求;Fugu Ultra 面向高难度任务(Kaggle 竞赛、论文复现、安全评估、专利检索),调用更深的专家池,不支持自定义排除。
定价分为订阅制和按量付费两条线。订阅制三档:Standard 20 美元/月、Pro 100 美元/月(10 倍用量)、Max 200 美元/月(20 倍用量),所有档位均可使用两个版本。按量付费面向企业客户,Fugu Ultra 定价为输入 5 美元/百万 token、输出 30 美元/百万 token,上下文超过 272K 时翻倍。对比 Opus 4.8 的 API 定价(输入 15 美元、输出 75 美元/百万 token),Fugu Ultra 在单位 token 层面更便宜,但由于多 Agent 调用的 token 消耗远高于单模型,实际总成本需要按具体任务计算。
Sakana 在定位上反复强调的不是"我们比 Opus 更强",而是"不依赖单一供应商即可获得前沿性能"。这对日本及其他受美国 AI 出口限制影响的国家是一个真实的差异化卖点。Fugu 目前不对 EU/EEA 地区提供服务,正在推进 GDPR 合规。
竞品对比:从静态路由到并行投票到动态分工,多模型编排的三个层级
理解 Fugu 的定位,需要先厘清"多模型"这个词下面至少存在三个完全不同的技术层级。
第一层是静态路由,代表产品是 OpenRouter Auto Router。它用一个 meta-model 分析你的 prompt,从几十个模型中选一个最适合的来回答,然后在同一会话内锁定这个选择以保持一致性并最大化 prompt cache 命中。每个请求只调用一个模型,本质上是"选最好的一个"。上限就是池中最强单模型的性能,编排层不产生额外能力,只减少选错模型的概率。
第二层是并行投票,代表产品是 OpenRouter Fusion(2026 年 4 月上线)。Fusion 把同一个 prompt 扇出给多个专家模型并行处理,启用 web search,然后由一个 judge 模型将所有回答综合成结构化分析——标注共识、矛盾、部分覆盖、独特见解和盲点——最终输出一个合并答案。这是经典的 mixture-of-agents 架构。OpenRouter 声称 Fusion 以大约一半的单次调用成本匹配 Fable 5 级别的性能。它的优势是透明度——你可以通过 plugin 覆盖参与投票的模型和最终裁判模型。但它的机制决定了天花板:所有模型看到的是同一个完整 prompt,各自独立作答,judge 做的是"从 N 个答案中提取最优共识"。这在摘要、问答、内容生成等每个模型都能独立回答的场景下效果好,但在需要拆解子任务和多步骤协作的场景下(代码工程、论文复现、复杂推理),投票不如分工。
第三层是动态分工编排,这是 Fugu 所在的位置。Conductor 不是把同一个问题交给所有人投票,而是把一个复杂任务拆成子任务,为每个子任务选择最合适的模型,前一步的输出作为后一步的输入,而且可以递归调用自身加深推理。TRINITY 为每个参与的模型分配 Thinker、Worker 或 Verifier 角色,形成流水线而非投票池。这解释了为什么 Fugu Ultra 在 SWE-Bench Pro(73.7 vs Opus 69.2)和 AutoResearch(BPB 0.9774 vs 最优单模型 0.9781)这类多步骤任务上的优势最明显——这些任务不是"5 个模型各写一个答案取最好"能解决的。
与 Anthropic Claude/OpenAI GPT 等单体前沿模型相比,Fugu 的优势集中在复合任务——需要同时涉及代码编写、数学推理和长文理解的场景,编排带来的分工增益大于单模型全能的优势。但在单一维度的极端场景(如 Opus 4.8 在安全评估 CTI-REALM、GPT-5.5 在 MRCRv2 上的表现),专用模型仍然领先。
与 Agent 框架(LangChain/CrewAI/AutoGen)相比,Fugu 的差异在于编排逻辑是强化学习训出来的而非手写的,且复杂性对调用者完全隐藏。代价是黑盒性:你无法查看 Fugu 为每个请求选择了哪些模型、如何协调——而 Fusion 允许你自定义参与模型和 judge。这在需要审计的金融和医疗场景下是 Fugu 的硬伤,也是 Fusion 的差异化优势。
三个结构性局限:黑盒、成本和天花板
第一是黑盒问题。Fugu 不暴露内部路由决策,官方 FAQ 明确表示这是"设计上的选择"。对于需要可审计性的受监管行业(金融、医疗、保险),这意味着 Fugu 在合规层面存在硬性障碍。你没有办法向审计员解释"这个决策是哪个模型做出的",因为你自己也不知道。
第二是实际成本的不可预测性。虽然单位 token 定价清晰,但一个请求内部调用了多少 token 取决于 Fugu 的编排策略——一个简单问题可能只调一个模型用了 500 token,一个复杂任务可能内部消耗了 5 万 token。官方提供了每请求的用量报告,但你无法在发送请求前预估成本。对于 budget 敏感的团队,这是一个需要认真评估的风险。
第三是我们之前讨论过的凸包天花板。Fugu 的能力上限是 Agent 池中所有模型最强能力的最优组合,它不能产出任何池中模型都不具备的全新能力。当任务需要的恰好是已有模型强项的组合时,Fugu 表现优异;当任务需要一种全新的认知能力时,编排不提供额外增益。AutoResearch 实验中 Fugu Ultra 对最优单模型的领先幅度仅为 0.0007 BPB,这个数字说明在接近前沿的地方,编排带来的边际收益正在收窄。Sakana 的应对策略是承诺每两周随新前沿模型更新 Agent 池——这意味着 Fugu 的天花板跟着行业走,不会落后,但也永远不会真正领先。