Claude 4.7 Opus vs GPT-5
2026年を代表する2つのフラッグシップLLMを徹底比較 — ベンチマーク、コード生成、推論力、コスト、API体験。どちらをいつ使うべきか?
難易度が高く、長時間にわたり、誤りへの許容度が低いタスクのための最上位モデル
ほとんどのタスクでFable 5.1と同等の性能を、40%低いコストで
出発点はOpus 5.5であるべきだ。Anthropic自身の言葉でも、ほとんどのタスクでFable 5.1と同等の水準にあり、明らかに安価だからだ。しかし公式のベンチマーク表と「Choosing a model」ガイドはこうも述べている——最も難易度が高く、長時間にわたるエージェントタスクでは、その差は依然として現実のものだ。ルールはこうなる:まずOpus 5.5で自分のタスクを実測し、必要ならeffortレベルを引き上げる。それでも基準を満たさないタスククラスだけをFable 5.1に移す。逆をやれば、不要なコストとMaxプランで急速に消費される週次割り当てを招くことになる。
| カテゴリー | Claude Fable 5.1 | Claude Opus 5.5 |
|---|---|---|
| パフォーマンス | 9/10 | 8/10 |
| 学習のしやすさ | 7/10 | 8/10 |
| エコシステム | 8/10 | 8/10 |
| コミュニティ | 7/10 | 7/10 |
| 求人市場 | 7/10 | 7/10 |
| 将来性 | 8/10 | 9/10 |
# Python - Claude Fable 5.1: 長時間のエージェントタスク、デフォルトのhigh effort
import anthropic
client = anthropic.Anthropic()
response = client.messages.create(
model="claude-fable-5-1",
max_tokens=8000,
output_config={"effort": "high"},
tools=[
{"type": "bash_20250124", "name": "bash"},
{"type": "text_editor_20250728", "name": "str_replace_based_edit_tool"},
],
messages=[
{
"role": "user",
"content": (
"Refactor the payment reconciliation module across all "
"affected files, keep existing tests green, and explain "
"every non-obvious tradeoff you made."
),
}
],
)
for block in response.content:
if block.type == "thinking":
print("[thinking]", block.thinking[:200])
elif block.type == "text":
print("[answer]", block.text)
# 注:effortは単純なeffort=パラメータではなく、output_config内で指定する。
# Fable 5.1ではtool_choiceによる強制的なtool-useはもはやサポートされていない;モデルが
# 自らツールを選択する。そうでない場合、APIは400 invalid_request_errorを返す。# Python - Claude Opus 5.5: 一般的なタスク、デフォルトのmedium effort
import anthropic
client = anthropic.Anthropic()
response = client.messages.create(
model="claude-opus-5-5",
max_tokens=4096,
# output_configを指定しない場合デフォルトの"medium"が使用される;難しいeval
# クラスでスコアが不足する場合は上位レベルを試す:
# output_config={"effort": "xhigh"},
messages=[
{
"role": "user",
"content": "Summarize this quarter's support tickets into 5 themes with counts.",
}
],
)
for block in response.content:
if block.type == "text":
print(block.text)
# 注:Opus 5.5ではthinkingが常に有効; thinking={"type": "disabled"}を
# 送信するとどのeffortレベルでも400 invalid_request_errorが返る。古い
# computer_20251124のcomputer-useツールもClaude APIおよびGoogle Cloudで
# 受け付けられないため、最新のツールバージョンへの移行が必要。出発点はOpus 5.5であるべきだ。Anthropic自身の言葉でも、ほとんどのタスクでFable 5.1と同等の水準にあり、明らかに安価だからだ。しかし公式のベンチマーク表と「Choosing a model」ガイドはこうも述べている——最も難易度が高く、長時間にわたるエージェントタスクでは、その差は依然として現実のものだ。ルールはこうなる:まずOpus 5.5で自分のタスクを実測し、必要ならeffortレベルを引き上げる。それでも基準を満たさないタスククラスだけをFable 5.1に移す。逆をやれば、不要なコストとMaxプランで急速に消費される週次割り当てを招くことになる。
無料相談を受けるFable 5.1は、より高い計算力を使用し、デフォルトのeffortが`high`で動作する、$10/$50(MTokあたり)のモデルで、難易度の高い推論と長時間のエージェントタスクに推奨される。Opus 5.5はデフォルトの`medium`effortで動作し、$4/$20であり、Anthropic自身の言葉によればほとんどのタスクでFable 5.1と同等の性能を発揮する。両モデルとも1Mコンテキスト、最大128Kトークンの出力、そして2026年6月のナレッジカットオフを共有している。