OpenAI は 8 月 13 日、API 経由でフラッグシップ推論モデル GPT-5.6 Sol をこれまでの標準経路より最大 14 倍高速に稼働させる新サービス階層「Ultrafast」を限定プレビュー公開しました。バックエンドは Cerebras のウェハースケール AI プロセッサで、実測は最大 750 出力トークン/秒。標準経路の 50 tok/s 前後という現状値と比べ、推論のデコード段でボトルネックとなる HBM 帯域の制約を回路レイアウトごと巻き取ることで速度と品質の両立を主張しています。既に Jane Street・Podium・Basis・Rogo などがコーディング/金融調査/コマース/カスタマーサポートで試験導入中です。
主なポイント
- 「Ultrafast」は OpenAI API の新料金階層。対象モデルは最上位の GPT-5.6 Sol で、品質は標準経路と同一とされる
- スループット目標は最大 14 倍・実測 750 tok/s。標準経路 (Standard) ベースラインは約 53 tok/s
- 実装は Cerebras の wafer-scale チップで推論を走らせる構成。GPU クラスタで支配的な HBM 帯域制約をアーキテクチャで回避
- 想定ユースケースは金融調査・インシデント対応・カスタマーサポート・音声アプリ・E コマース・実験実行
- 現段階は限定プレビュー。順次容量拡大を予定。同日 Cerebras もプレスリリースで OpenAI 向け Ultrafast の実装役であることを公表
出典: Previewing Ultrafast mode: GPT-5.6 Sol at up to 14X the speed