Claude Code vs Cursor
Claude Code(ターミナルCLI)とCursor(エディタ) — AIコーディングツールの比較。マルチエージェント、Plan Mode、Composer、IDE統合、プロダクション開発者ワークフロー。
Cognitionのクラウドベース自律型ソフトウェアエンジニアエージェント
Anthropicのターミナルネイティブで承認ゲート型・サンドボックス化されたコーディングエージェント
Devinの看板ベンチマークFrontierCodeは自社設計だ。第三者ベンチマークの結果はまちまちで、DeepSWE 1.1とTerminal-Bench 2.1ではFable 5.1を上回るが、Terminal-Bench 4では見劣りする。料金面ではClaude Codeの方が予測しやすい——1日あたり平均約13ドル、printモードでは`--max-budget-usd`で上限を設定できる。明確に定義され、テストでゲートされたタスクにはDevinを試し、曖昧なアーキテクチャ判断を伴うタスクにはClaude Codeの承認ゲート型モデルの方が安全だ。判断は必ずパイロット運用で下すこと。
| カテゴリー | Devin | Claude Code |
|---|---|---|
| パフォーマンス | 7/10 | 7/10 |
| 学習のしやすさ | 6/10 | 7/10 |
| エコシステム | 6/10 | 9/10 |
| コミュニティ | 5/10 | 9/10 |
| 求人市場 | 5/10 | 7/10 |
| 将来性 | 8/10 | 8/10 |
# Devin CLI — インストール、権限モード選択、セッション管理
# 出典: https://docs.devin.ai/cli および https://docs.devin.ai/cli/reference/commands
# 1) Devin CLIのインストール(macOS/Linux)
curl -fsSL https://cli.devin.ai/install.sh | bash
# 2) プロジェクトディレクトリで、サンドボックス化されたAutonomousモードでタスクを開始
cd ~/projects/backend
devin --permission-mode autonomous --sandbox \
-- "Upgrade Express 4 routes to Express 5, keep the test suite green"
# 3) 同じディレクトリの直近セッションを再開する、または特定のセッションに戻る
devin -c
devin -r abc12345
# 4) 非対話(print)モードでの単発クエリ
devin -p "list all TODO comments"
# 5) ローカルエージェントの代わりにクラウドセッションを開始
devin --cloud
# セッション内でのモード切り替え: /mode, /normal, /accept-edits, /smart, /bypass
# 注: Autonomousは--sandboxでのみ動作し、edit/write呼び出しは
# サンドボックスの外側にあるため、このモードでも承認を求める。すべての呼び出しを
# 承認なしで実行するモードはBypassである。# Claude Code — サンドボックス化されたAutoモードでタスクを開始し、コストを追跡する
# 出典: docs.claude.com/en/docs/claude-code/setup · /security · /costs · /github-actions
# 1) インストール(ネイティブインストーラー — macOS/Linux/WSL)
curl -fsSL https://claude.ai/install.sh | bash
# 2) リポジトリ内でAutoモードで対話的に開始
cd ~/projects/backend
claude --permission-mode auto \
"Upgrade Express 4 routes to Express 5, keep the test suite green"
# 3) セッション内のトークン/コストサマリー
/usage
# 3b) 予算上限はprint(ヘッドレス)モードでのみ有効 — -pが必須
claude -p --max-budget-usd 5.00 \
"Upgrade Express 4 routes to Express 5, keep the test suite green"
# 4) GitHub ActionsでPR/issueコメントをトリガーにする(事前にセットアップが必要)
/install-github-app
# その後、PR/issueコメントに: @claude このPRをレビューしてエッジケースを列挙して
# 注: Manualモードではファイル書き込み・コマンド実行のたびに承認を求める;
# Autoモードでは別の分類器モデルがリスクの高い操作を審査する。Devinの看板ベンチマークFrontierCodeは自社設計だ。第三者ベンチマークの結果はまちまちで、DeepSWE 1.1とTerminal-Bench 2.1ではFable 5.1を上回るが、Terminal-Bench 4では見劣りする。料金面ではClaude Codeの方が予測しやすい——1日あたり平均約13ドル、printモードでは`--max-budget-usd`で上限を設定できる。明確に定義され、テストでゲートされたタスクにはDevinを試し、曖昧なアーキテクチャ判断を伴うタスクにはClaude Codeの承認ゲート型モデルの方が安全だ。判断は必ずパイロット運用で下すこと。
無料相談を受ける部分的にはそうだ。Devinは専用のクラウドVMと専用ブラウザ上で独立して動作できる。Devin CLIのBypassモードではすべてのツール呼び出しが承認なしで進み(Autonomousモードでもedit/write呼び出しは依然として承認を求める)、SWE-2はFrontierCode 1.1 MainでFable 5.1に1ポイント未満の差まで迫っている。しかし同じ計測セットの中でも、Terminal-Bench 4のようなより汎用的なタスクでは大きく後れを取る(27.3% 対 55.8%)。CognitionのPre-Task Checklist自体もその限界を明確に示している——明確な成功基準(テストスイート、CI、ビルドステップ)があり、あなたの手元で3時間を超えないタスクが自律エージェントに適している。つまり自律性は、明確に定義されたタスクでは強力だが、曖昧なタスクでは限定的だ。