【2026年8月最新】OpenAIが「Ultrafastモード」を先行公開|GPT-5.6 Solを最大14倍速・毎秒750トークンで動かすCerebras製の新API

OpenAIがGPT-5.6 Sol向けのUltrafastモードを先行公開
この記事のポイント

OpenAI(オープンエーアイ)は2026年8月13日、AI向け半導体を手がけるCerebras Systemsと連携し、APIの新しい提供メニュー「Ultrafastモード」を先行公開(プレビュー公開)したと発表した。OpenAI公式ページ「Previewing Ultrafast」やCerebrasの発表のほか、The Decoder・Unite.aiなど複数の技術メディアが報じている。

ポイントは、これが「新しいAIモデル」ではなく「既存のGPT-5.6 Solを、これまでよりずっと速く応答させるための実行環境」だという点だ。この記事では、Ultrafastモードが何なのか、なぜ速いのか、どれくらい速いのか、そして何に向いているのかを、専門用語をかみくだいて整理する。

項目内容
発表日2026年8月13日
提供元OpenAI(推論の高速化はCerebras Systemsが担当)
対象モデルGPT-5.6 Sol(OpenAIの旗艦モデル)。新モデルではなく提供形態の追加
速さ標準処理の最大14倍、出力は毎秒最大750トークンとされる
使うチップCerebrasのウェハースケール・エンジン(ウェハー1枚を丸ごと使う大型チップ)
提供状況順番待ち制の限定プレビュー。一部の顧客から順次拡大予定
料金未公表(2026年8月下旬時点)

まず概要:GPT-5.6 Solを「最大14倍速」で動かす新API

生成AIを使うとき、答えが1文字ずつ表示されて「書き終わるのを待つ」感覚があると思う。この「1秒あたりに何文字(何トークン)出せるか」が応答の速さで、Ultrafastモードはここを一気に引き上げるものだ。OpenAIによれば、GPT-5.6 Solの出力速度は毎秒最大750トークン、標準の処理と比べて最大14倍になるという。

トークンは、AIが文章を扱うときの細かい単位で、日本語ではおおむね1〜2文字くらいに相当する。毎秒750トークンは、体感としては「ページがほぼ一瞬で埋まる」レベルの速さだ。ただしこの数値は上限値(最大)であり、実際の速さは処理内容や混雑状況で変わる点には注意がいる。

Ultrafastモードとは:知能はそのまま、速さだけ上げる

ここが誤解されやすいところだが、Ultrafastは「賢くなった新モデル」ではない。OpenAIとCerebrasは、Ultrafastを「新モデルではなくサービス階層(提供メニュー)であり、同じGPT-5.6 SolをCerebrasのウェハースケール・ハードウェア上で動かしたもの」と説明している。

OpenAIとCerebrasは、標準版と同じGPT-5.6 Solの知能を保ったまま、品質を落とさずに速さだけを引き上げたと説明している。根拠として、知識労働の生産性をはかる「GDP-Val」というベンチマークで、最初から最後まで通した処理がおよそ5.6倍速くなり、しかも品質の低下はなかったとしている。ただしこれは提供側による説明・評価であり、第三者が同じ条件で検証したものではない点は割り引いて読む必要がある。

Ultrafastモードの3つのポイント
観点標準のGPT-5.6 SolUltrafastモード
モデルの中身GPT-5.6 Sol同じGPT-5.6 Sol(変更なし)
答えの質基準標準版と同等と説明されている
出力の速さ基準最大14倍、毎秒最大750トークンとされる
動かすチップ主にGPUCerebrasのウェハースケール・エンジン
使える人APIの一般利用者順番待ち制の限定プレビュー参加者
料金公表済み(GPT-5.6 Solの通常価格)未公表

なぜ速いのか:Cerebrasの「ウェハースケール」チップ

速さの理由は、使っているチップの構造にある。ふつうのAI用GPUは、計算するチップと、データを置いておくメモリが分かれていて、その間でデータをやり取りする。生成AIの応答生成では、モデルの「重み(パラメータ)」をメモリから何度も読み出す必要があり、この読み出しの帯域(通り道の太さ)が渋滞の原因になりやすい。これを「メモリ帯域のボトルネック」と呼ぶ。

Cerebrasのチップは、シリコンウェハー1枚をほぼ丸ごと1個のチップとして使う「ウェハースケール・エンジン」という設計で、44GB(ギガバイト)ぶんの高速メモリ(SRAM)をチップの上に載せている。大容量の高速メモリをチップ上に備えることで、推論時のデータのやり取りを減らし、メモリの通り道を活かしやすくなる。結果として、1トークンずつ生成していく処理が速くなる、という理屈だ。

ざっくり言うと:「頭の良さ」を変えずに、「話すスピード」だけを上げる仕組み。そのために、メモリの渋滞が起きにくい特殊な大型チップを使っている。

どれくらい速いのか:ベンチマークの数字

OpenAIとCerebrasが示した比較値を整理すると、次のようになる。標準のGPT-5.6 Sol比で最大14倍、Anthropicの「Claude Fable 5」比でおよそ11倍、「Claude Opus 4.8」の高速モード比でおよそ5倍、とされる。

具体的なタスクの例として、博士課程レベルの難問を集めた「Humanity's Last Exam」の2,500問を処理したところ、GPT-5.6 SolのUltrafastは11時間11分で完了し、比較対象のClaude Fable 5は78時間27分かかった、という数字が示されている。これは所要時間でおよそ7倍の差にあたる。ただし、ここまでの「最大14倍」「約11倍」「約5倍」「5.6倍」といった数値は、いずれもOpenAIおよびCerebrasが公表したベンダー側の測定値で、第三者が同一条件で再現・検証したものではない。公表値として受け止める必要がある。

Ultrafastは何と比べて何倍速いのか
比較の相手速さの差(発表値)補足
GPT-5.6 Sol 標準処理最大14倍同じモデルの通常提供との比較
Claude Fable 5約11倍難問2,500問の処理では所要時間で約7倍差
Claude Opus 4.8(高速モード)約5倍高速モード同士の比較
GDP-Val(実務寄りの評価)約5.6倍端から端まで通した処理。品質は維持と説明

何に使えるのか:向いている場面と現状の制約

OpenAIは、Ultrafastが効きやすい用途として、コーディング(プログラム作成)、コマース(ネット通販の処理)、金融リサーチ、カスタマーサポート、システム障害の対応、サイバー脅威の検知、法務向けの文書作成、エンジニアリングのレポート作成などを挙げている。いずれも「人やシステムが答えを待っている時間が短いほど価値が上がる」タイプの仕事だ。

たとえば対話しながらコードを書く場面では、返答が速いほど試行錯誤の回数を増やせる。障害対応やセキュリティのように一刻を争う場面でも、分析結果が早く出るほど復旧が早まる。逆に、夜間にまとめて処理するバッチ作業のように「待てる」仕事では、速さのメリットは相対的に小さい。

制約もはっきりしている。現時点では順番待ち制の限定プレビューで、誰でもすぐ使えるわけではない。料金も未公表で、一般提供の時期も示されていない。Cerebrasの大型チップは供給量に限りがあるため、拡大のペースは「容量が増え次第」とされている。

まとめ:AI競争の軸が「賢さ」から「速さ」にも広がる

この記事のまとめ:

なお、Ultrafastの発表と同じ2026年8月13日には、GoogleもGemini 3.7 Flashを発表しており、こちらは前世代の半額の導入価格が打ち出されている。AIモデルの競争は「どこまで賢いか」だけでなく「どれだけ速く・安く答えを返せるか」も重要な土俵になりつつある。Ultrafastモードは、その流れをOpenAIとCerebrasが「専用チップ」というかたちで一段進めた事例だといえる。一般提供の条件と料金が明らかになったとき、実際にどこまで使われるかが次の焦点になる。

おすすめ情報・ツール
#AI #生成AI #2026 #OpenAI #Cerebras
← 記事一覧に戻る