# Agentic Engineering 能力成熟度:从 Vibe Coding 到生产级协作
Agentic Engineering 不是二进制开关——它是一个从'完全人写'到'规格驱动全自动'的成熟度。理解你在能力成熟度上的位置,比争论哪个极端更好更有意义。
概念来源
Andrej Karpathy 在 2025 年提出 vibe coding — 以感觉驱动、弱审查的 AI 编程。2026 年初他更偏好 Agentic Engineering 作为专业语境的说法。
Addy Osmani 强调:vibe coding 适合探索和低风险实验;Agentic Engineering 指向 AI agent 可执行实现,但人仍拥有架构、质量和正确性责任 — 可写进团队实践与治理机制。
Simon Willison 的 Agentic Engineering Patterns 把概念落成可复用模式,而非术语争论。
可培训的定义
Agentic Engineering 是一种在软件交付中使用 coding agents 的工程实践:通过清晰目标、受控工具、隔离工作区、版本控制、自动化测试、人工审查和可追溯证据,让 agent 参与实现与验证,同时由人承担最终技术责任。
五个关键词:Agent、Engineering、Loop、Harness、Accountability。
核心概念见 Agentic Coding Agent 核心概念;Harness 实践见 Harness Engineering。
与 Vibe Coding 的光谱
| 模式 | 适用场景 | 人的职责 | 风险 |
|---|---|---|---|
| Vibe Coding | 原型、一次性脚本 | 快速表达意图,接受结果 | 难维护、难审计 |
| AI-assisted Engineering | 局部提效、补全 | 写主体设计,审查 AI 输出 | 取决于个人习惯 |
| Agentic Engineering | 专业交付、团队协作 | 设计目标、验证、负责合并 | 需工程纪律与治理 |
一句话:Vibe coding 是「我不太看代码还能跑」;Agentic Engineering 是「我让 agent 写,但我能解释、验证、回滚并承担责任」。
能力成熟度的五阶段
| 阶段 | 特征 | 代码产出中 AI 占比 |
|---|---|---|
| L1: 辅助补全 | IDE 补全、Copilot 单行建议 | <10% |
| L2: 对话编码 | Chat 生成函数/模块,人组装 | 20-40% |
| L3: Agent 协作 | Agent 自主完成任务,人评审 | 50-70% |
| L4: 规格驱动 | Spec → Agent 全流程,人签署门禁 | 80%+ |
| L5: 自治团队 | 多 Agent 并行,人只设约束 | 95%+ |
大部分团队卡在哪
多数团队在 L2-L3 之间摇摆。瓶颈不是模型能力,而是:
- 没有可评审的 Spec
- 测试体系跟不上生成速度
- 缺乏独立评审角色
Simon Willison 关键模式
Tool Loop
LLM + system prompt + tools + observations。没有工具执行能力时只是代码建议器;有了执行能力,agent 通过运行测试收敛。企业要治理的是 Harness,不是模型本身。
Git 是安全绳
每个 agent session 应在分支或 worktree 中运行;小步提交便于审查和回滚。Agent 可辅助解释 diff、整理 commit,不能替代人的合并责任。
First Run the Tests
启动 session 的高价值短指令 — 建立基线,诱导 agent 后续继续用测试验证改动。
Red/Green TDD
先写失败测试再实现 — 减少「看起来合理但未验证」的代码。
Agentic Manual Testing
自动化测试不能替代 UI 亲眼验证;agent 可用 Playwright、截图执行「类手工测试」,人仍检查关键结果。
Subagents
价值在保护主上下文;适合探索、影响面扫描、独立 review。过度拆分增加协调成本。
PR Accountability
反模式: 把 agent 生成但自己没审过的 PR 交给同事 — 是把责任转嫁给 reviewer。好的 agentic PR 要小、可审、带测试证据。
六能力域
- Intent & Spec — 需求拆解、验收条件、风险边界
- Context & Knowledge — 团队约定、架构决策、skills 沉淀
- Harness & Tools — 终端、测试、浏览器、CI、权限与沙箱
- Verification & Evidence — 测试、截图、日志、可复现实验
- Collaboration & Review — Git 分支、PR 尺寸、review checklist
- Learning Loop — 复盘、失败模式、工具改进、知识资产更新
升阶路线
| 跃迁 | 关键动作 |
|---|---|
| L2 → L3 | Agent CLI + 沙箱 + Review 节点 |
| L3 → L4 | Spec 体系 + 独立 Evaluator + 门禁自动化 |
| L4 → L5 | 多 Agent 编排 + 度量驱动治理 |
30/60/90 天路径:
- 0–30 天: 分支/worktree 边界;先跑测试;小步提交;agent instructions 模板
- 31–60 天: Playwright;红/绿 TDD;subagent 做影响面扫描
- 61–90 天: skills/templates 固化;度量 PR lead time、defect leakage;纳入 CI/CD 门禁
反模式清单
- 未审查 PR 丢给同事
- 无基线测试
- 只看 demo,不看边界路径
- 巨大任务一次性委托
- 没有证据的完成声明
- 忽视初级工程师技能退化
参考
- Andrej Karpathy, Agentic Engineering, 2026
- Addy Osmani, Agentic Engineering
- Simon Willison, Agentic Engineering Patterns
- SoluteLabs: “Agentic Engineering Is a Spectrum” (2025)