Claude Code vs Cursor
Claude Code (CLI de terminal) frente a Cursor (editor) — comparativa de herramientas de codificación con IA. Multiagente, Plan Mode, Composer, integración con IDE y flujo de trabajo de desarrollo en producción.
El agente de ingeniería de software autónomo en la nube de Cognition
El agente de codificación nativo de terminal de Anthropic, con puntos de aprobación y sandbox
Devin construye su propio benchmark insignia, FrontierCode; en las métricas independientes el panorama es mixto: supera a Fable 5.1 en DeepSWE 1.1 y Terminal-Bench 2.1, pero queda atrás en Terminal-Bench 4. En precio, Claude Code es más predecible: ~13 $/día de media y un tope duro con `--max-budget-usd` en modo print. Para tareas bien definidas y con pruebas prueba Devin; para trabajo arquitectónico incierto, el modelo de aprobación por puntos de Claude Code es más seguro. Decide con un piloto.
| Categoría | Devin | Claude Code |
|---|---|---|
| Rendimiento | 7/10 | 7/10 |
| Facilidad de aprendizaje | 6/10 | 7/10 |
| Ecosistema | 6/10 | 9/10 |
| Comunidad | 5/10 | 9/10 |
| Mercado laboral | 5/10 | 7/10 |
| A prueba de futuro | 8/10 | 8/10 |
# Devin CLI — instalación, selección de modo de permiso y gestión de sesiones
# Fuente: https://docs.devin.ai/cli y https://docs.devin.ai/cli/reference/commands
# 1) Instalación de Devin CLI (macOS/Linux)
curl -fsSL https://cli.devin.ai/install.sh | bash
# 2) Inicia una tarea en modo Autonomous con sandbox en el directorio del proyecto
cd ~/projects/backend
devin --permission-mode autonomous --sandbox \
-- "Upgrade Express 4 routes to Express 5, keep the test suite green"
# 3) Continúa la última sesión en el mismo directorio o vuelve a una sesión concreta
devin -c
devin -r abc12345
# 4) Consulta puntual en modo no interactivo (print)
devin -p "list all TODO comments"
# 5) Inicia una sesión en la nube en lugar del agente local
devin --cloud
# Cambiar de modo dentro de la sesión: /mode, /normal, /accept-edits, /smart, /bypass
# Nota: Autonomous solo funciona con --sandbox y, como las llamadas edit/write
# quedan fuera del sandbox, también pide aprobación en este modo;
# el modo que ejecuta todas las llamadas sin aprobación es Bypass.# Claude Code — iniciar una tarea en modo Auto con sandbox y seguimiento de coste
# Fuente: docs.claude.com/en/docs/claude-code/setup · /security · /costs · /github-actions
# 1) Instalación (instalador nativo — macOS/Linux/WSL)
curl -fsSL https://claude.ai/install.sh | bash
# 2) Inicia de forma interactiva en modo Auto dentro del repositorio
cd ~/projects/backend
claude --permission-mode auto \
"Upgrade Express 4 routes to Express 5, keep the test suite green"
# 3) Resumen de tokens/coste dentro de la sesión
/usage
# 3b) El tope de presupuesto solo es válido en modo print (headless) — -p es obligatorio
claude -p --max-budget-usd 5.00 \
"Upgrade Express 4 routes to Express 5, keep the test suite green"
# 4) Activación desde un comentario de PR/issue con GitHub Actions (instalación previa)
/install-github-app
# Luego, en el comentario del PR/issue: @claude revisa este PR y enumera los edge cases
# Nota: En modo Manual, cada escritura de archivo/ejecución de comando pide aprobación;
# en modo Auto, un modelo clasificador independiente revisa las acciones de riesgo.Devin construye su propio benchmark insignia, FrontierCode; en las métricas independientes el panorama es mixto: supera a Fable 5.1 en DeepSWE 1.1 y Terminal-Bench 2.1, pero queda atrás en Terminal-Bench 4. En precio, Claude Code es más predecible: ~13 $/día de media y un tope duro con `--max-budget-usd` en modo print. Para tareas bien definidas y con pruebas prueba Devin; para trabajo arquitectónico incierto, el modelo de aprobación por puntos de Claude Code es más seguro. Decide con un piloto.
Solicita una consultoría gratuitaEn parte. Devin puede operar de forma independiente en su propia VM en la nube y en su propio navegador; en el modo Bypass de Devin CLI todas las llamadas a herramientas avanzan sin aprobación (incluso en modo Autonomous, las llamadas edit/write siguen pidiendo aprobación), y SWE-2 se acerca a Fable 5.1 en FrontierCode 1.1 Main con menos de un punto de diferencia. Pero en el mismo conjunto de medición se queda claramente atrás en una tarea más general como Terminal-Bench 4 (27,3 % frente a 55,8 %). El propio Pre-Task Checklist de Cognition también marca el límite con claridad: las tareas con un criterio de éxito claro (suite de pruebas, CI, paso de compilación) y que no superen las tres horas en tus manos son adecuadas para un agente autónomo — es decir, la autonomía es sólida en tareas bien definidas y limitada en trabajo incierto.