はじめに
最近、CodexのToken消費が激しい。
いつか来るとは思っていたが、「やはり来たか」というのが正直な感想だ。
5時間制限は思った以上に厳しくなり、以前なら余裕で終わっていた作業が、途中で残量を気にしながら進めることも増えた。
時折、「あれ?」と思うような気の利かない修正を返してくることもある。
もちろん、OpenAIを責めるつもりはない。
AIエージェントの利用者は爆発的に増えた。
GPUにも限界がある。
企業として利用量を調整したくなる気持ちは、むしろよく理解できる。
Anthropicも、かつて同じ道を歩いた。
人気が出れば、リソースは足りなくなる。
これはAIサービスが避けて通れない宿命なのだろう。
それでも、昔からGPTを追いかけてきた一人としては、少しだけ寂しかった。
そんな中、2026年6月24日。
その寂しさを少し紛らわせるニュースが飛び込んできた。
OpenAIが、Broadcomと共同開発した独自推論ASIC「Jalapeño(ハラペーニョ)」を正式に発表したのである。
しかも記事を読んでいて、私はある一文で思わず手を止めた。
GPT-5.3-Codex-Sparkを用いた評価。
今年春、Cerebrasとの発表で世界を驚かせた、あの「Codex Spark」。
1000 tok/sという、冗談のような数字を掲げたモデルだ。
もしOpenAIが、そのSparkを本気で動かすための専用チップを設計しているのだとしたら──。
これは単なる「AIチップ」のニュースではない。
Codexの未来を変える話なのかもしれない。

OpenAIは、なぜ「推論ASIC」を選んだのか
今回のニュースを読んで、私が最初に気になったのは「独自チップを作った」という事実ではありません。
なぜ、学習ではなく推論なのか。
そこでした。
GoogleのTPUは長い年月をかけて進化してきましたが、学習向けと推論向けで設計を分けています。
学習は巨大な行列演算を何週間も回し続ける世界。
一方、推論は一人ひとりのユーザーへ、できるだけ速く、できるだけ安く回答を返す世界です。
似ているようで、求められるものは全く違います。
今回発表されたJalapeñoは、その名前の通り推論専用です。
OpenAIも公式発表で一貫して「Inference Platform(推論プラットフォーム)」と表現しています。
つまり、最初から狙いは一つでした。
ChatGPTを、Codexを、APIを、もっと安く回すこと。
私はこれを読んで、逆に安心しました。
なぜなら、これは非常に現実的な経営判断だからです。
AIモデルの学習には莫大なお金が掛かります。
しかし、それは数か月に一度の巨大イベントです。
対して推論は違います。
ChatGPT。
Codex。
API。
画像生成。
将来のAIエージェント。
これらは24時間365日止まることなく世界中で実行され続けています。
つまりOpenAIにとって、一番お金が出ていく場所は学習ではありません。
推論です。
仮に推論コストを30%削減できれば、その恩恵は全サービスへ毎日降り注ぎます。
Codexの利用制限を緩めることもできるかもしれません。
API価格を下げられるかもしれません。
将来のAgentをもっと長時間動かせるかもしれません。
投資回収という意味では、これほど効率の良い場所はありません。
もちろん、ここで「GPUは終わった」と言うつもりはありません。
むしろ逆です。
Jalapeñoが成功するかどうかは、これから数年かけて決まります。
チップを設計することよりも、
コンパイラ。
カーネル。
ランタイム。
サービングシステム。
こうしたソフトウェアを成熟させるほうが、はるかに難しい世界だからです。
GoogleもTPUを今日の姿に育てるまで、長い年月を費やしました。
OpenAIも同じ道を歩くことになるでしょう。
しかし、推論専用という割り切りは、その挑戦の難易度を大きく下げています。
万能な計算機を目指す必要はありません。
GPTを速く動かせれば、それでいい。
この一点に集中できることこそ、Jalapeño最大の強みなのかもしれません。
Sparkという名前に、私は反応した
今回の公式発表で、一番気になった一文がある。
GPT-5.3-Codex-Sparkを用いた評価。
普通なら、
「社内モデルで評価しました。」
あるいは、
「LLMワークロードで評価しました。」
そんな書き方でも十分だったはずだ。
それなのに、わざわざSparkというモデル名を書いている。
私はここに、OpenAIからの小さなメッセージを感じた。
今年の2月、Cerebrasと共に発表されたCodex Sparkは衝撃だった。
1000 tok/s。
さらに、Cerebrasは3000 tok/s級という数字まで公開し、生成AIは「賢さ」だけではなく、「速さ」の競争へ入ったことを強く印象付けた。
もちろん、その数字は特殊な条件下での測定だ。
しかし、それでも十分だった。
「待つ」という概念を消そうとしている。
OpenAIが見せたかった未来は、そこにあった。
実際、人間がストレスを感じるのは、考えるAIではない。
待たされるAIだ。
例えばIDEで、
「このCSSだけ直して。」
「このSVGを少し小さく。」
「この関数をリファクタリングして。」
そんな操作をするたびに数秒待たされる。
一日に何百回も繰り返せば、それだけで体験は大きく変わる。
だからSparkは、賢さよりも反応速度を追い求めたモデルなのだろう。
そして今回。
OpenAIは、そのSparkを評価モデルとしてJalapeñoの記事に登場させた。
ここから先は、私の推測になる。
もしかするとOpenAIは、Sparkを動かすためにJalapeñoを設計したのではない。
Jalapeñoを前提として、Sparkという体験を設計していた。
そう考えると、話は一本につながる。
チップ。
モデル。
カーネル。
サービングシステム。
公式発表でも、この四つを一体で設計したことを何度も強調していた。
つまりOpenAIは、単にGPUを置き換えようとしているのではない。
「人を待たせないAI」という体験そのものを設計しているのではないか。
もちろん、Jalapeñoで本当に1000 tok/s級を実現できるかは分からない。
記事にも性能値は書かれていない。
だから、これは期待を込めた推測に過ぎない。
それでも私は、Sparkという名前が公式発表に現れたことを偶然とは思えなかった。
あの春に見せられた「速さへの執念」は、どうやら一度きりのデモでは終わらないらしい。
AIは、一社ですべてをやる時代ではなくなる
今回のニュースを読みながら、もう一つ思ったことがある。
もしかすると私たちは、AIの役割分担が始まる瞬間を見ているのかもしれない。
少し前まで、AIと言えば一つだった。
質問する。
文章を書く。
画像を作る。
コードを書く。
全部ChatGPT。
そんな時代だった。
しかし、AIエージェントが現れたことで状況は変わり始めている。
例えば私は最近、要約程度の仕事ならクラウドAIを使わなくてもいいと思うようになった。
ブラウザにはBuilt-in AIが入り始めた。
ChromeもEdgeも、ローカルで動く小さなモデルを持ち始めている。
PCのNPUも、ようやく仕事を見つけ始めた。
「この記事を三行で。」
「この文章を英訳して。」
「PDFを要約して。」
そんな雑事のために、わざわざ巨大なGPUクラスタを呼び出す必要はない。
ローカルで十分だ。
一方で、CodexのようなAIエージェントは違う。
何十ファイルも読み、
依存関係を解析し、
テストを書き、
レビューし、
何時間も考え続ける。
こちらは、ローカルAIではまだ荷が重い。
だから私は最近、
RPA的なエージェントと、
コーディングエージェントを、
同じ土俵で語ることに違和感を覚えるようになった。
要求される性能が、まるで違うからだ。
もし私の予想が当たるなら、
数年後のAIはこんな構成になる。
ブラウザやOSに組み込まれたローカルAIが雑事を片付ける。
その上で、OpenAIのような巨大モデルは、
設計。
レビュー。
エージェント。
創造的な仕事。
本当に「考える」必要がある場面だけを担当する。
つまり、
GPTは不要になるのではない。
GPTは、よりGPTらしい仕事だけを任されるようになる。
そう考えると、今日のJalapeñoのニュースは、単なる半導体の話ではない。
「巨大AIは全部の仕事をする」という時代から、
「それぞれのAIが、自分の得意分野を担当する」という時代への転換点。
そんな未来を、少しだけ先取りしているように見えた。
そして、その世界なら――。
推論ASICに莫大な投資をするOpenAIと、ローカルAIを育てるGoogleやMicrosoftは、実は正面から戦っているわけではないのかもしれない。
AIにも、分業の時代が始まろうとしている。

