Codexはなぜ急に重くなったのか──OpenAIが始めた「次の一手」

Codexはなぜ急に重くなったのか──OpenAIが始めた「次の一手」 TECH

はじめに

最近、CodexのToken消費が激しい。

いつか来るとは思っていたが、「やはり来たか」というのが正直な感想だ。

5時間制限は思った以上に厳しくなり、以前なら余裕で終わっていた作業が、途中で残量を気にしながら進めることも増えた。

時折、「あれ?」と思うような気の利かない修正を返してくることもある。

もちろん、OpenAIを責めるつもりはない。

AIエージェントの利用者は爆発的に増えた。

GPUにも限界がある。

企業として利用量を調整したくなる気持ちは、むしろよく理解できる。

Anthropicも、かつて同じ道を歩いた。

人気が出れば、リソースは足りなくなる。

これはAIサービスが避けて通れない宿命なのだろう。

それでも、昔からGPTを追いかけてきた一人としては、少しだけ寂しかった。


そんな中、2026年6月24日。

その寂しさを少し紛らわせるニュースが飛び込んできた。

OpenAIが、Broadcomと共同開発した独自推論ASIC「Jalapeño(ハラペーニョ)」を正式に発表したのである。

しかも記事を読んでいて、私はある一文で思わず手を止めた。

GPT-5.3-Codex-Sparkを用いた評価。

今年春、Cerebrasとの発表で世界を驚かせた、あの「Codex Spark」。

1000 tok/sという、冗談のような数字を掲げたモデルだ。

もしOpenAIが、そのSparkを本気で動かすための専用チップを設計しているのだとしたら──。

これは単なる「AIチップ」のニュースではない。

Codexの未来を変える話なのかもしれない。

OpenAIのひとつの回答[Cerebras]──Codex Sparkが示す「速さ」への執念
Codex Sparkは「賢さ」ではなく「速さ」を売りにした。毎秒1000トークン級の応答を実現するために、OpenAIが選んだのはCerebrasという異端の計算機だった。GPU時代の次に来る、AI体験設計の変化を読み解く。

OpenAIは、なぜ「推論ASIC」を選んだのか

今回のニュースを読んで、私が最初に気になったのは「独自チップを作った」という事実ではありません。

なぜ、学習ではなく推論なのか。

そこでした。

GoogleのTPUは長い年月をかけて進化してきましたが、学習向けと推論向けで設計を分けています。

学習は巨大な行列演算を何週間も回し続ける世界。

一方、推論は一人ひとりのユーザーへ、できるだけ速く、できるだけ安く回答を返す世界です。

似ているようで、求められるものは全く違います。

今回発表されたJalapeñoは、その名前の通り推論専用です。

OpenAIも公式発表で一貫して「Inference Platform(推論プラットフォーム)」と表現しています。

つまり、最初から狙いは一つでした。

ChatGPTを、Codexを、APIを、もっと安く回すこと。

私はこれを読んで、逆に安心しました。

なぜなら、これは非常に現実的な経営判断だからです。


AIモデルの学習には莫大なお金が掛かります。

しかし、それは数か月に一度の巨大イベントです。

対して推論は違います。

ChatGPT。

Codex。

API。

画像生成。

将来のAIエージェント。

これらは24時間365日止まることなく世界中で実行され続けています。

つまりOpenAIにとって、一番お金が出ていく場所は学習ではありません。

推論です。

仮に推論コストを30%削減できれば、その恩恵は全サービスへ毎日降り注ぎます。

Codexの利用制限を緩めることもできるかもしれません。

API価格を下げられるかもしれません。

将来のAgentをもっと長時間動かせるかもしれません。

投資回収という意味では、これほど効率の良い場所はありません。


もちろん、ここで「GPUは終わった」と言うつもりはありません。

むしろ逆です。

Jalapeñoが成功するかどうかは、これから数年かけて決まります。

チップを設計することよりも、

コンパイラ。

カーネル。

ランタイム。

サービングシステム。

こうしたソフトウェアを成熟させるほうが、はるかに難しい世界だからです。

GoogleもTPUを今日の姿に育てるまで、長い年月を費やしました。

OpenAIも同じ道を歩くことになるでしょう。

しかし、推論専用という割り切りは、その挑戦の難易度を大きく下げています。

万能な計算機を目指す必要はありません。

GPTを速く動かせれば、それでいい。

この一点に集中できることこそ、Jalapeño最大の強みなのかもしれません。

Sparkという名前に、私は反応した

今回の公式発表で、一番気になった一文がある。

GPT-5.3-Codex-Sparkを用いた評価。

普通なら、

「社内モデルで評価しました。」

あるいは、

「LLMワークロードで評価しました。」

そんな書き方でも十分だったはずだ。

それなのに、わざわざSparkというモデル名を書いている。

私はここに、OpenAIからの小さなメッセージを感じた。


今年の2月、Cerebrasと共に発表されたCodex Sparkは衝撃だった。

1000 tok/s。

さらに、Cerebrasは3000 tok/s級という数字まで公開し、生成AIは「賢さ」だけではなく、「速さ」の競争へ入ったことを強く印象付けた。

もちろん、その数字は特殊な条件下での測定だ。

しかし、それでも十分だった。

「待つ」という概念を消そうとしている。

OpenAIが見せたかった未来は、そこにあった。


実際、人間がストレスを感じるのは、考えるAIではない。

待たされるAIだ。

例えばIDEで、

「このCSSだけ直して。」

「このSVGを少し小さく。」

「この関数をリファクタリングして。」

そんな操作をするたびに数秒待たされる。

一日に何百回も繰り返せば、それだけで体験は大きく変わる。

だからSparkは、賢さよりも反応速度を追い求めたモデルなのだろう。


そして今回。

OpenAIは、そのSparkを評価モデルとしてJalapeñoの記事に登場させた。

ここから先は、私の推測になる。

もしかするとOpenAIは、Sparkを動かすためにJalapeñoを設計したのではない。

Jalapeñoを前提として、Sparkという体験を設計していた。

そう考えると、話は一本につながる。

チップ。

モデル。

カーネル。

サービングシステム。

公式発表でも、この四つを一体で設計したことを何度も強調していた。

つまりOpenAIは、単にGPUを置き換えようとしているのではない。

「人を待たせないAI」という体験そのものを設計しているのではないか。


もちろん、Jalapeñoで本当に1000 tok/s級を実現できるかは分からない。

記事にも性能値は書かれていない。

だから、これは期待を込めた推測に過ぎない。

それでも私は、Sparkという名前が公式発表に現れたことを偶然とは思えなかった。

あの春に見せられた「速さへの執念」は、どうやら一度きりのデモでは終わらないらしい。

AIは、一社ですべてをやる時代ではなくなる

今回のニュースを読みながら、もう一つ思ったことがある。

もしかすると私たちは、AIの役割分担が始まる瞬間を見ているのかもしれない。

少し前まで、AIと言えば一つだった。

質問する。

文章を書く。

画像を作る。

コードを書く。

全部ChatGPT。

そんな時代だった。

しかし、AIエージェントが現れたことで状況は変わり始めている。


例えば私は最近、要約程度の仕事ならクラウドAIを使わなくてもいいと思うようになった。

ブラウザにはBuilt-in AIが入り始めた。

ChromeもEdgeも、ローカルで動く小さなモデルを持ち始めている。

PCのNPUも、ようやく仕事を見つけ始めた。

「この記事を三行で。」

「この文章を英訳して。」

「PDFを要約して。」

そんな雑事のために、わざわざ巨大なGPUクラスタを呼び出す必要はない。

ローカルで十分だ。


一方で、CodexのようなAIエージェントは違う。

何十ファイルも読み、

依存関係を解析し、

テストを書き、

レビューし、

何時間も考え続ける。

こちらは、ローカルAIではまだ荷が重い。

だから私は最近、

RPA的なエージェントと、

コーディングエージェントを、

同じ土俵で語ることに違和感を覚えるようになった。

要求される性能が、まるで違うからだ。


もし私の予想が当たるなら、

数年後のAIはこんな構成になる。

ブラウザやOSに組み込まれたローカルAIが雑事を片付ける。

その上で、OpenAIのような巨大モデルは、

設計。

レビュー。

エージェント。

創造的な仕事。

本当に「考える」必要がある場面だけを担当する。

つまり、

GPTは不要になるのではない。

GPTは、よりGPTらしい仕事だけを任されるようになる。


そう考えると、今日のJalapeñoのニュースは、単なる半導体の話ではない。

「巨大AIは全部の仕事をする」という時代から、

「それぞれのAIが、自分の得意分野を担当する」という時代への転換点。

そんな未来を、少しだけ先取りしているように見えた。

そして、その世界なら――。

推論ASICに莫大な投資をするOpenAIと、ローカルAIを育てるGoogleやMicrosoftは、実は正面から戦っているわけではないのかもしれない。

AIにも、分業の時代が始まろうとしている。


https://openai.com/index/openai-broadcom-jalapeno-inference-chip