Codexが評価され始めた本当の理由 ─ Claude Code疲れという現実

Codexが評価され始めた本当の理由 ─ Claude Code疲れという現実 TECH

Claude Codeは“Agentic AI”の象徴として注目されたが、実務現場ではToken消費とコスト問題が急浮上している。
一方、OpenAI CodexはChatGPT Plus内で利用でき、固定費で高い実用性を持つ点が評価され始めた。
AI開発支援は「自律性の演出」より、「安定・経済性・制御性」の時代に入りつつある。

「Agentが全部やる時代」は、本当に来るのか

ここ数ヶ月、AIコーディング界隈は妙な空気になっている。

少し前まで、
「Claude Codeこそ未来」
「Agentic AIの本命」
「人間は仕様を投げるだけになる」

そんな熱狂があった。

だが最近、流れが変わってきた。

Reddit、X、GitHub周辺を見ていると、
静かに増えている言葉がある。

「……Codexでよくない?」

しかも厄介なのは、
これが単なる“性能比較”ではないことだ。

コスト。
速度。
制御性。
実務感。

つまり、
「現場で本当に使えるか」
という話になってきている。

そして、その議論になると、
Claude Codeは急に苦しくなる。


Claude Codeは「Agent感」を売りすぎた

Claude Codeは、確かにインパクトがあった。

  • 勝手に調べる
  • 勝手に考える
  • 勝手に修正する
  • 勝手にファイルを触る

「AIが自律的に開発する」

この未来像そのものは魅力的だった。

だが、現場で実際に回し始めると、
別の問題が見えてくる。

  • Token消費が読めない
  • 毎回全体を舐め回す
  • 推論ループが長い
  • “考えてる感”は凄い
  • でも待たされる
  • しかも高い

さらに問題なのは、
“AIが頑張っている感”と、
“仕事が進む感”が一致しないことだ。

これはかなり重要だ。

開発者が欲しいのは、
Agent演出ではない。

成果物である。


Codexは「道具」に徹している

一方、Codexはかなり思想が違う。

実際に触ると分かるが、
異様に“実務寄り”だ。

  • 無駄に騒がない
  • 内部では考えている
  • でも表面は静か
  • 指示追従が安定
  • コード変更が読みやすい
  • 「いや、そこ気付くのか」が多い

しかも、
かなり気が利く。

雑な仕様でも、
「普通こうするよね」
を汲み取ってくる。

この“職人感”が強い。

特に驚くのは、
WebGPU系みたいな、
壊れやすい領域でも普通に完走することだ。

Three.js
WebGPU
Canvas
Shader系

この辺は、
AIが途中で壊しやすい。

だがCodexは、
妙な破綻が少ない。

もちろん万能ではない。

だが、
「普通の人が実務で使う」
レベルなら、かなり強い。


しかもPlusプランで使える

ここ、
まだ知られてない人が結構いる。

API前提の人も多いと思うが、
Codexは、ChatGPT Plusで普通に使える。

つまり、
月額固定費の中に入っている。

これがデカい。

稟議書通すのも楽だろう。

Claude Code界隈を見ていると、
Token残量に怯え始める人が本当に多い。

「今これ投げると危険」
「長文貼ると終わる」
「また全体読み始めた……」

みたいな、
“メーター監視ゲーム”
が始まる。

だがCodexは、
かなり雑に使っても、
案外減らない。

少なくとも自分の使い方では、
1日適当に仕事を投げ続けても、
5時間リセット時にリミット制限が50%を下回ったことがほぼない。
もっとも、コード量50KBくらいまでの軽量タスクだが。

それにしても、この安心感は大きい。

AIツールは、
「使うたびに料金を意識する」
時点で集中力を削る。


GPTとCodexを分けると、異様に強い

最近かなり思うのだが、
OpenAIは役割分離がうまい。

  • ChatGPT → 思考・相談
  • Codex → 実装・修正
  • GPT Images → デザイン
  • Realtime → 音声

全部を1つに押し込んでいない。

これ、
かなり重要だ。

個人的には、

「仕様はGPTと対話して詰める」

「Codexに投げる」

これが最強に近い。

仕様決めには、いろいろな考え事がある。
Codexは基本的に無口だ。
自由な発想の議論を交わして、仕様を詰めていく作業はGPTが強い。
おまけに、GPTのサブスク内で、レート制限に掛かることはまずない。
ここをCodexでやろうとすると、Tokenが削れる。

Claude系は、
全部を1つのAgentでやろうとする。

だが現実には、
“考える工程”と
“実装する工程”は違う。

そこを分離したほうが、
人間側も制御しやすい。


「Agentic AI」の怪しさ

ここは以前からずっと思っている。

自律Agent系は、
未来感が強い。

デモ映えもする。

だが実務では、
制御不能性が急に怖くなる。

  • 何を読んだ?
  • なぜその変更した?
  • どこまで触った?
  • いつTokenを燃やした?
  • なぜその判断?

この辺がブラックボックス化しやすい。

しかも、
Agentは基本的に
“頑張るほど金を使う”。

これは構造的な問題だ。

だから最近、
「Agentを全面に出す設計」
そのものへの反動が起き始めている気がする。


CodexはClaude Codeよりもお得なことが多い

海外で話題になっていた比較がある。

Claude Codeは、「AIが自律的に働く未来」を見せた。

だが現実には、“Agentが頑張るほどTokenが燃える”という問題も露呈した。

実際、海外コミュニティでは、「Codexの方が圧倒的に燃費がいい」という声が急増している。

Redditでは、
「Claudeは1ドルあたり1.35M token、
Codexは12.5M」
といった極端な比較まで投稿され始めた。

もちろん条件差はあるため鵜呑みにはできない。
しかし、
「Claudeはすぐ制限に達する」
「Codexは異様に長持ちする」
という体感談は、
今や珍しくない。

Anthropic自身も、
「現在の料金設計はAgent時代を想定していなかった」
と認めている。

実際、
あの設計思想だと、
長文脈・全探索・自律判断を多用するため、
どうしても燃費が悪化しやすい。

そして今、
その“ロマン”よりも、
“固定費の安心感”
を重視する空気が強くなってきた。


結論 ─ AIに欲しいのは「演出」ではない

Claude Codeは、
未来を見せた。

それ自体は間違いなく功績だ。

だが現場は、
少しずつ冷静になってきている。

必要なのは、

  • 自律演出
  • 長考アピール
  • Agent感

ではない。

  • 安定
  • 経済性
  • 制御性
  • 実務速度

である。

AIは、
“賢そうに見えること”
より、

“普通に仕事が終わること”

の方が遥かに重要なのだ。

そして今、
その「普通に終わる」を、
最も自然に提供しているのが、
案外Codexなのかもしれない。

AIに求められているのは、
「どれだけ長考したか」
ではない。

「どれだけ少ないTokenで、
どれだけ仕事を終わらせたか」

である。


「内部で終わらせる」という設計思想 —— Grok 4.3とCodexが示す、Agentic時代の分岐点
Grok 4.3の強さは「Agentic AI」ではなく「内部完結型の知性」にある。Codexとの共通点やClaude Codeとの違いを整理し、これからのAI設計思想の分岐点を解説。
Codexで求人LPを丸ごと生成したら、制作フローが消えた話|5分で“そのまま使えるHTML”が出てきた
Codexに雑プロンプトを投げただけで、実用レベルの求人LPが5分で完成。HTML・CSS・画像を一括生成し、そのまま公開可能なレベルに到達した実例から、「制作フロー消滅」の実態と人間に残る仕事を解説。
Codexで何ができる?PC操作まで行う“実務AI”の実力を検証(コード生成の次へ)
Codexを実際に使い、既存SVGツールの改修を検証。コード生成に留まらず、ファイル解析・修正・実行まで自律的に行う“作業者型AI”の実力と限界を実体験ベースで解説する。
AIエージェントはなぜ遅くなるのか?増やすほどコストが爆発する構造を解説
AIエージェントが流行している。「複数のエージェントが協調してタスクを解決する」という構図は魅力的に見える。だが、実際に手を動かしてみると違和感が残る。結論を先に言う。エージェントは雑に使うと、効果がないどころかコストだけ増える。エージェン…