Claude CodeとCodex:開発時間と費用をどう比較する?
同じ課題と合格条件でコーディングエージェントを比較する方法。依頼文、記録表、成功した作業あたりの費用の計算例を紹介します。

目次
AIがすぐにコードを書いても、その後の修正に午後いっぱいかかることがあります。Claude CodeとCodexを選ぶときは、利用できる変更が完成するまでの時間を、人によるレビューも含めて測りましょう。
どちらもプロジェクトのファイルを読み、コードを変更し、コマンドを実行するエージェントです。ターミナルは文字でコマンドを入力する画面です。対応環境はClaude Codeの文書とCodexの案内で確認できます。
本記事は2026年10月5日時点の公式情報と評価方法を扱います。両製品を実行して得た速度や勝率の報告ではありません。

最近の変更を把握する
Anthropicは9月28日にSonnet 5.5、OpenAIは9月29日にGPT-6.1 SolとCodexの再利用可能なクラウド環境を紹介しました。モデルと作業環境が変わるため、古い比較だけで判断しにくくなっています。Anthropicの発表、OpenAIの発表
| 比較すること | 確認する質問 |
|---|---|
| 作業環境 | 自分のプロジェクトを導入・実行・テストできるか |
| モデルと設定 | どのモデルと推論設定を使ったか |
| レビュー | 変更ファイルと実行コマンドを確認しやすいか |
| チームとの相性 | 普段の確認・修正の流れに合うか |
推論設定は、モデルが考えて確認する際の労力を調整します。製品間で名前が同じでも計算量が等しいとは限らないため、設定を記録します。
小さな課題を一つ決める
例として、注文一覧にCSVのダウンロードを追加します。CSVは表を区切り文字付きのテキストで保存する形式です。同じ依頼文を両方に渡してください。
既存の注文一覧にCSV出力を追加してください。
画面で選択したフィルターを出力にも反映してください。
日本語、カンマ、引用符、改行を含む値を保持してください。
既存のログインと注文取得を維持してください。
関連テストを実行し、変更ファイルと確認結果を説明してください。
無関係なデザイン変更やデプロイは行わないでください。
同じプロジェクトの版から、それぞれ別のコピーを用意します。実行環境とテストのコマンドも合わせ、一方の修正を他方に見せないようにします。
テストは要求どおりの動作を確認する検査です。AI自身が追加したテストに加え、人が先に決めた空の一覧、日本語、絞り込みなども確認します。
結果の記録表
| 項目 | 記録する内容 |
|---|---|
| 実行条件 | ツールの版、モデル、推論設定、開始時のプロジェクト |
| 総時間 | 依頼から変更を受け入れるまで |
| 人の時間 | 補足説明、レビュー、手作業の修正 |
| 結果 | 合格条件と残った不具合 |
| 使用量 | 契約枠の消費、または実際のAPI料金 |
同じ種類の課題を数回試し、成功も失敗も残します。前のファイルやキャッシュが条件を変えていないかにも注意します。
完了した作業あたりの費用
以下は計算方法を示す架空の例で、製品の測定値ではありません。
| 架空のツール | 試行数 | API総費用 | 合格数 | 合格一件あたり |
|---|---|---|---|---|
| A | 10 | US$4 | 8 | US$0.50 |
| B | 10 | US$3 | 5 | US$0.60 |
式は「総費用÷合格数」です。合格が0件なら計算できず、不成功として記録します。実際にはレビューの人件費と実行環境の費用も考えます。
月額契約の場合、API料金に無理に置き換えず、利用枠内で完了した仕事と追加購入を記録してください。OpenAIの料金説明も両者を区別しています。
まず導入しやすい方で小さな変更を完成させ、もう一方に同じ課題を渡します。必要な動作と確認のしやすさを比べることで、自分のプロジェクトに合う選択ができます。
例:依頼より先に合格条件を用意する
CSV出力なら、カンマ、引用符、改行をそれぞれ含む三つの小さなサンプル行を用意します。日本語の名前と、一行だけを選ぶフィルターも加えてください。どの行が出力されるべきかを、どちらのエージェントも動かす前に決めておきます。
画面からファイルを取得し、CSVを読み込めるツールで内容を確認したうえで、変更ファイルとテスト結果を見ます。テストの成功は有用ですが、認証やアクセス制御を検査していなければ、それらも正常とは断言できません。別の人が再確認できるよう、合格条件を結果と一緒に保存しましょう。
よくある質問
コードが最初に出るまでの時間だけで比べられますか?
それは作業の一部です。修正とレビューを含め、要求を満たすまで測ってください。人が手を動かした時間と、処理を待った時間も分けて記録すると判断しやすくなります。
一度成功したらチームの標準にしてよいですか?
最初の参考結果として扱い、実務に近い課題をいくつか追加で比較してください。開始条件を合わせ、失敗した試行や人の助けが必要だった部分も残します。


