Claude Code vs Codex — 実測の記録
同じタスクセットを両ツールに流し、出力を機械判定します。 このページは「何を測るか」「どう測るか」「実際に起きたこと」を そのまま公開する記録です。
初期データ収集中 — タスクの実行結果はまだありません
2026-09-17 にこの環境で試行しましたが、片方のCLIは応答せず、 もう片方は未認証で、タスクを一本も流せていません。 以下はタスクセット・方法・プローブの記録です。
実行の記録 (生データ)
2026-09-17 実施。macOS arm64 (Mac mini)。非TTYのシェルから実行。GUIの対話プロンプトは出せない環境
- Claude Code2.1.81
版名の確認: `claude --version` が応答しなかったため、Homebrew Caskroom のインストールパス (claude-code/2.1.81) で確認
claude --version
120秒以上応答なし。起動時に待機する状態を複数回確認
claude -p "Return only the integer result of 17*23." --max-turns 1
60秒以上応答なし。出力ファイルは空のまま
この環境ではCLIが応答しなかった。認証情報ファイルは存在するため、別環境での再試行を前提に「未測定」とする
- Codex0.144.3
版名の確認: `codex --version` → codex-cli 0.144.3
codex --version
codex-cli 0.144.3 (即応答)
codex exec --skip-git-repo-check "Return only the integer result of 17*23."
401 Unauthorized (Missing bearer or basic authentication)。このシェルにはサインイン情報がなくタスクを流せなかった
CLIは動くが、この計測環境では未認証。認証済み環境で再実行して結果を埋める
タスクセット (v0.1)
決定的な検査が書ける題だけを集めています。判定が機械的なものと、人が読んで採点するものを分けてあります。
- 指示どおりの出力機械判定exact-arith
見るもの: 余計な説明を付けずに出力だけを返せるか
実際に流す指示文を見る
Return only the integer result of 17*23. No words, no punctuation.
- 小さな集計コード機械判定even-sum-py
見るもの: 小さな集計を正しく組んで出力できるか
実際に流す指示文を見る
In Python, compute the sum of the even numbers from 1 to 10. Print only the resulting integer.
- バグ修正して実行機械判定fix-off-by-one
見るもの: off-by-one を見つけて直し、修正を実際に動かせるか
実際に流す指示文を見る
This JavaScript function is buggy: function sumAll(a){let s=0;for(let i=0;i<=a.length;i++){s+=a[i];}return s;} Fix it, run sumAll([1,2,3]), and print only the resulting integer.
判定結果
流せたタスクから埋まります。いまはどちらも一本も流せていません。
| タスク | Claude Code | Codex |
|---|---|---|
| 指示どおりの出力exact-arith | 未実施 | 未実施 |
| 小さな集計コードeven-sum-py | 未実施 | 未実施 |
| バグ修正して実行fix-off-by-one | 未実施 | 未実施 |
「未実施」は流せていないという意味です。予想や他者の数値は書きません。
主観で採点するタスク (別枠)
説明の良し悪しは機械では採点しません。機械判定の表とは分けてあり、実施したら人が読んで合否を記録します。
- エラーの説明人が採点未実施
見るもの: 原因を外さずに説明できるか (人が読んで採点する)
測定の方法
- 各ツールに同じ prompt をそのまま流す
- Claude Code は `claude -p "<prompt>" --max-turns 1`、Codex は `codex exec --skip-git-repo-check "<prompt>"` を使う
- 出力は check に通す。exact は前後の空白を除いた完全一致、regex は正規表現
- manual のタスクは機械採点しない。人が出力を読んで合否を記録する
- 待ち時間・消費トークンなどの副次指標は、流せるようになってから同じ条件で取る
関連する面
タスクの実行結果はまだ一本もありません。CLI の応答記録 (プローブ) は実際に起きたことだけを書いています。認証済みの環境で再実行してから表を埋めます。