Claude 4.7 Opus vs GPT-5
2026年を代表する2つのフラッグシップLLMを徹底比較 — ベンチマーク、コード生成、推論力、コスト、API体験。どちらをいつ使うべきか?
コーディングと知識労働のためのAnthropic最先端モデル
Googleが複雑なエージェントタスクをスケールで解決するために位置付けた速度層
独立したクロスベンチマークは存在せず、両社の公表データはほとんどが異なるテストを使用している。共通のアンカーであるClaude Opus 5が含まれるGDPval-AA v2、OSWorld 2.0、Terminal-bench 4.0の項目に限っては、二つの表を並べて比較することが妥当と言える——だからこそ「明確な勝者」を宣言するのはミスリーディングだ。数字が示すのは、高頻度・低遅延・単価重視のエージェント型ワークロードでは、Gemini 3.8 Flashが入力・出力トークンあたり約13倍安いという事実であり、「スケールでのエージェントタスク」というポジショニングは理にかなった選択だ。一方、一回限りの難しいコード問題、アーキテクチャ判断、数時間に及ぶ無人タスクでは、Fable 5.1のTerminal-Bench-ScienceとGDPval-AA v2における優位性、そしてCognition/Devinがローンチ当日に移行した実績の方が強いシグナルとなる。キャッシュ面では即断しないこと:Geminiの読み取り価格は$0.075/MでFable 5.1の$0.25/Mより安いが、時間単位のストレージ課金が加わる——自分の利用プロファイルで計算して判断すべきだ。忘れてはならないのは、Claude Opus 5.5(2026年9月22日発表)が「多くのタスクでFable 5.1と同等の性能を、Opus 5比で40%安いコストで」実現している点——予算が限られているなら第三の選択肢として試す価値がある。最も確実な方法は、両モデルを同じタスクセットで、自分自身のコードベースにおいて、GitHub Copilot上で連続して検証することだ。
| カテゴリー | Claude Fable 5.1 | Gemini 3.8 Flash |
|---|---|---|
| パフォーマンス | 9/10 | 8/10 |
| 学習のしやすさ | 7/10 | 8/10 |
| エコシステム | 8/10 | 9/10 |
| コミュニティ | 7/10 | 8/10 |
| 求人市場 | 7/10 | 7/10 |
| 将来性 | 7/10 | 7/10 |
# Claude Fable 5.1 - Python SDK によるエージェント呼び出し(デフォルトはHigh effort)
import anthropic
client = anthropic.Anthropic() # ANTHROPIC_API_KEY は環境変数から読み込まれる
response = client.messages.create(
model="claude-fable-5-1",
max_tokens=4096,
tools=[
{
"type": "bash_20250124",
"name": "bash"
}
],
messages=[
{
"role": "user",
"content": (
"リポジトリ内で失敗している flaky テストを見つけ、根本原因を "
"逆アセンブルレベルで説明し、修正 PR を用意して。"
),
}
],
)
for block in response.content:
if block.type == "text":
print(block.text)
elif block.type == "tool_use":
print(f"[tool: {block.name}] input={block.input}")
# キャッシュ読み取りを活用するには、システムプロンプトを cache_control でマークする:
# system=[{"type": "text", "text": LONG_CODEBASE_CONTEXT,
# "cache_control": {"type": "ephemeral"}}]
# → 再読み込みは $0.25/M トークンで課金される(Fable 5比で75%安い)# Gemini 3.8 Flash - Python SDK によるスケールでのエージェント呼び出し
from google import genai
from google.genai import types
client = genai.Client() # GEMINI_API_KEY は環境変数から読み込まれる
response = client.models.generate_content(
model="gemini-3.8-flash",
contents=(
"1000 行の CSV を処理し、各行にカテゴリを割り当て、"
"集計結果を JSON で返して。"
),
config=types.GenerateContentConfig(
temperature=0.2,
max_output_tokens=2048,
),
)
print(response.text)
# 高頻度・大規模な処理ではbatchエンドポイントの使用が推奨される:
# client.batches.create(model="gemini-3.8-flash", src="gs://bucket/jobs.jsonl")
# 入力 $0.75/M、出力 $3.75/M(2026年12月31日まで有効なキャンペーン価格;
# 2027年1月1日から $1.50/$7.50 に引き上げられることが事前に発表されている)独立したクロスベンチマークは存在せず、両社の公表データはほとんどが異なるテストを使用している。共通のアンカーであるClaude Opus 5が含まれるGDPval-AA v2、OSWorld 2.0、Terminal-bench 4.0の項目に限っては、二つの表を並べて比較することが妥当と言える——だからこそ「明確な勝者」を宣言するのはミスリーディングだ。数字が示すのは、高頻度・低遅延・単価重視のエージェント型ワークロードでは、Gemini 3.8 Flashが入力・出力トークンあたり約13倍安いという事実であり、「スケールでのエージェントタスク」というポジショニングは理にかなった選択だ。一方、一回限りの難しいコード問題、アーキテクチャ判断、数時間に及ぶ無人タスクでは、Fable 5.1のTerminal-Bench-ScienceとGDPval-AA v2における優位性、そしてCognition/Devinがローンチ当日に移行した実績の方が強いシグナルとなる。キャッシュ面では即断しないこと:Geminiの読み取り価格は$0.075/MでFable 5.1の$0.25/Mより安いが、時間単位のストレージ課金が加わる——自分の利用プロファイルで計算して判断すべきだ。忘れてはならないのは、Claude Opus 5.5(2026年9月22日発表)が「多くのタスクでFable 5.1と同等の性能を、Opus 5比で40%安いコストで」実現している点——予算が限られているなら第三の選択肢として試す価値がある。最も確実な方法は、両モデルを同じタスクセットで、自分自身のコードベースにおいて、GitHub Copilot上で連続して検証することだ。
無料相談を受ける単一の答えはない——独立したクロスベンチマークは存在せず、両社の公表データはほとんど異なるテストを使用している。共通のアンカー(Claude Opus 5)が含まれるGDPval-AA v2、OSWorld 2.0、Terminal-bench 4.0の項目に限り、二つの表を並べて比較することが妥当と言える。Anthropicのデータでは、Fable 5.1がTerminal-Bench-ScienceとGDPval-AA v2で優位。DeepMindのデータでは、Gemini 3.8 FlashがTerminal-bench 2.1とDeepSWE v1.1でOpus 5に近いか上回るが、Terminal-bench 4.0では明確に劣る。タスクの種類によって結果は変わる——最も信頼できる方法は、GitHub Copilot上で自分自身の計測を行うことだ。