Claude Code vs Cursor
Claude Code (CLI terminal) face à Cursor (éditeur) — comparaison d'outils de codage assisté par IA. Multi-agents, mode Plan, Composer, intégration IDE et workflow de développement en production.
L'agent d'ingénierie logicielle autonome basé sur le cloud de Cognition
L'agent de codage natif-terminal d'Anthropic, à validation et sandboxé
Devin construit lui-même son benchmark phare, FrontierCode ; les résultats des benchmarks indépendants sont mitigés : il dépasse Fable 5.1 sur DeepSWE 1.1 et Terminal-Bench 2.1, mais reste à la traîne sur Terminal-Bench 4. Côté prix, Claude Code est plus prévisible : ~13 $/jour en moyenne et un plafond `--max-budget-usd` en mode print. Essayez Devin pour des tâches bien définies et couvertes par des tests ; pour des travaux d'architecture incertains, le modèle à validation de Claude Code est plus sûr. Tranchez la décision avec un pilote.
| Catégorie | Devin | Claude Code |
|---|---|---|
| Performance | 7/10 | 7/10 |
| Facilité d'apprentissage | 6/10 | 7/10 |
| Écosystème | 6/10 | 9/10 |
| Communauté | 5/10 | 9/10 |
| Marché de l'emploi | 5/10 | 7/10 |
| Pérennité | 8/10 | 8/10 |
# Devin CLI — installation, choix du mode de permission et gestion de session
# Source : https://docs.devin.ai/cli et https://docs.devin.ai/cli/reference/commands
# 1) Installation du Devin CLI (macOS/Linux)
curl -fsSL https://cli.devin.ai/install.sh | bash
# 2) Dans le répertoire du projet, démarrer une tâche en mode Autonomous sandboxé
cd ~/projects/backend
devin --permission-mode autonomous --sandbox \
-- "Upgrade Express 4 routes to Express 5, keep the test suite green"
# 3) Reprendre la dernière session du même répertoire ou revenir à une session précise
devin -c
devin -r abc12345
# 4) Requête ponctuelle en mode non interactif (print)
devin -p "list all TODO comments"
# 5) Démarrer une session cloud plutôt qu'un agent local
devin --cloud
# Changer de mode en session : /mode, /normal, /accept-edits, /smart, /bypass
# Remarque : Autonomous ne fonctionne qu'avec --sandbox, et comme les appels
# edit/write restent hors du sandbox, ce mode demande aussi une validation ;
# le seul mode qui exécute tous les appels sans validation est Bypass.# Claude Code — démarrer une tâche en mode Auto sandboxé et suivre les coûts
# Source : docs.claude.com/en/docs/claude-code/setup · /security · /costs · /github-actions
# 1) Installation (native installer — macOS/Linux/WSL)
curl -fsSL https://claude.ai/install.sh | bash
# 2) Démarrage interactif en mode Auto dans le repo
cd ~/projects/backend
claude --permission-mode auto \
"Upgrade Express 4 routes to Express 5, keep the test suite green"
# 3) Résumé des tokens/coûts en session
/usage
# 3b) Le plafond de budget n'est valable qu'en mode print (headless) — -p obligatoire
claude -p --max-budget-usd 5.00 \
"Upgrade Express 4 routes to Express 5, keep the test suite green"
# 4) Déclenchement via GitHub Actions dans un commentaire de PR/issue (installation préalable)
/install-github-app
# Puis dans le commentaire de PR/issue : @claude examine cette PR et liste les edge cases
# Remarque : en mode Manual, chaque écriture de fichier/exécution de commande demande une validation ;
# en mode Auto, un modèle classificateur distinct examine les actions à risque.Devin construit lui-même son benchmark phare, FrontierCode ; les résultats des benchmarks indépendants sont mitigés : il dépasse Fable 5.1 sur DeepSWE 1.1 et Terminal-Bench 2.1, mais reste à la traîne sur Terminal-Bench 4. Côté prix, Claude Code est plus prévisible : ~13 $/jour en moyenne et un plafond `--max-budget-usd` en mode print. Essayez Devin pour des tâches bien définies et couvertes par des tests ; pour des travaux d'architecture incertains, le modèle à validation de Claude Code est plus sûr. Tranchez la décision avec un pilote.
Obtenir une consultation gratuitePartiellement. Devin peut fonctionner de manière indépendante dans sa propre VM cloud et son propre navigateur ; en mode Bypass du Devin CLI, tous les appels d'outils progressent sans validation (même en mode Autonomous, les appels edit/write demandent toujours une validation), et SWE-2 s'approche de Fable 5.1 à moins d'un point d'écart sur FrontierCode 1.1 Main. Mais sur le même ensemble de mesures, il accuse un net retard sur une tâche plus généraliste comme Terminal-Bench 4 (27,3 % contre 55,8 %). La propre « Pre-Task Checklist » de Cognition trace clairement la limite : les tâches avec un critère de succès net (suite de tests, CI, étape de compilation) et ne dépassant pas trois heures de votre temps conviennent à un agent autonome — autrement dit, l'autonomie est solide sur des tâches bien définies, limitée sur les travaux ambigus.