Claude Code 与 Cursor
Claude Code(终端 CLI 工具)与 Cursor(编辑器)—— AI 编程工具对比。多 Agent、Plan Mode、Composer、IDE 集成与生产环境开发者工作流。
Cognition 推出的云端自主软件工程师智能体
Anthropic 推出的终端原生、审批门控且沙盒化的编码智能体
Devin 的旗舰基准 FrontierCode 由它自己搭建;在第三方评测中表现参差不齐:在 DeepSWE 1.1 和 Terminal-Bench 2.1 上超过 Fable 5.1,但在 Terminal-Bench 4 上落后。在价格上 Claude Code 更可预测:平均每天约 13 美元,且在 print 模式下有 `--max-budget-usd` 硬性上限。在定义明确、有测试把关的任务上可以尝试 Devin;在架构不明确的任务上,Claude Code 的审批门控模式更安全。最终决定用试点来验证。
| 分类 | Devin | Claude Code |
|---|---|---|
| 性能 | 7/10 | 7/10 |
| 学习难易度 | 6/10 | 7/10 |
| 生态系统 | 6/10 | 9/10 |
| 社区 | 5/10 | 9/10 |
| 就业市场 | 5/10 | 7/10 |
| 面向未来 | 8/10 | 8/10 |
# Devin CLI — 安装、权限模式选择与会话管理
# 来源:https://docs.devin.ai/cli 和 https://docs.devin.ai/cli/reference/commands
# 1) 安装 Devin CLI(macOS/Linux)
curl -fsSL https://cli.devin.ai/install.sh | bash
# 2) 在项目目录中,以沙盒化 Autonomous 模式启动一个任务
cd ~/projects/backend
devin --permission-mode autonomous --sandbox \
-- "Upgrade Express 4 routes to Express 5, keep the test suite green"
# 3) 继续同一目录下的最近会话,或返回指定会话
devin -c
devin -r abc12345
# 4) 以非交互(print)模式执行一次性查询
devin -p "list all TODO comments"
# 5) 启动云端会话而非本地智能体
devin --cloud
# 会话内切换模式:/mode, /normal, /accept-edits, /smart, /bypass
# 注意:Autonomous 仅在 --sandbox 下运行,且由于 edit/write 调用
# 处于沙盒之外,即使在该模式下仍会请求审批;唯一让所有调用
# 无需审批执行的模式是 Bypass。# Claude Code — 在沙盒化 Auto 模式下启动任务并追踪成本
# 来源:docs.claude.com/en/docs/claude-code/setup · /security · /costs · /github-actions
# 1) 安装(原生安装程序 — macOS/Linux/WSL)
curl -fsSL https://claude.ai/install.sh | bash
# 2) 在仓库内以 Auto 模式交互式启动
cd ~/projects/backend
claude --permission-mode auto \
"Upgrade Express 4 routes to Express 5, keep the test suite green"
# 3) 会话内 token/成本摘要
/usage
# 3b) 预算上限仅在 print(无头)模式下生效 — 必须带 -p
claude -p --max-budget-usd 5.00 \
"Upgrade Express 4 routes to Express 5, keep the test suite green"
# 4) 通过 GitHub Actions 在 PR/issue 评论中触发(需先安装)
/install-github-app
# 然后在 PR/issue 评论中输入:@claude 请审查这个 PR 并列出边界情况
# 注意:在 Manual 模式下,每次文件写入/命令执行都需要审批;
# 在 Auto 模式下,由独立的分类模型审查高风险操作。Devin 的旗舰基准 FrontierCode 由它自己搭建;在第三方评测中表现参差不齐:在 DeepSWE 1.1 和 Terminal-Bench 2.1 上超过 Fable 5.1,但在 Terminal-Bench 4 上落后。在价格上 Claude Code 更可预测:平均每天约 13 美元,且在 print 模式下有 `--max-budget-usd` 硬性上限。在定义明确、有测试把关的任务上可以尝试 Devin;在架构不明确的任务上,Claude Code 的审批门控模式更安全。最终决定用试点来验证。
获取免费咨询部分如此。Devin 可以在自己的云端虚拟机和浏览器中独立运行;在 Devin CLI 的 Bypass 模式下,所有工具调用都无需审批即可推进(即便在 Autonomous 模式下,edit/write 调用仍需要审批),而且 SWE-2 在 FrontierCode 1.1 Main 上与 Fable 5.1 的差距不到一分。但在同一评测集中,Terminal-Bench 4 这类更通用的任务上明显落后(27.3% 对 55.8%)。Cognition 自己的 Pre-Task Checklist 也明确划出了边界:拥有明确成功标准(测试套件、CI、构建步骤)且预计三小时内能完成的任务适合交给自主智能体——也就是说,自主性在定义明确的任务上表现强劲,在不确定的任务上则有限。