[research@ai4se] : ~ $
cd ../
[methodology] | | 14 min

# Agentic Engineering 能力成熟度:从 Vibe Coding 到生产级协作

Agentic Engineering 不是二进制开关——它是一个从'完全人写'到'规格驱动全自动'的成熟度。理解你在能力成熟度上的位置,比争论哪个极端更好更有意义。

[agentic-engineering][methodology]

概念来源

Andrej Karpathy 在 2025 年提出 vibe coding — 以感觉驱动、弱审查的 AI 编程。2026 年初他更偏好 Agentic Engineering 作为专业语境的说法。

Addy Osmani 强调:vibe coding 适合探索和低风险实验;Agentic Engineering 指向 AI agent 可执行实现,但人仍拥有架构、质量和正确性责任 — 可写进团队实践与治理机制。

Simon Willison 的 Agentic Engineering Patterns 把概念落成可复用模式,而非术语争论。

可培训的定义

Agentic Engineering 是一种在软件交付中使用 coding agents 的工程实践:通过清晰目标、受控工具、隔离工作区、版本控制、自动化测试、人工审查和可追溯证据,让 agent 参与实现与验证,同时由人承担最终技术责任。

五个关键词:AgentEngineeringLoopHarnessAccountability

核心概念见 Agentic Coding Agent 核心概念;Harness 实践见 Harness Engineering

与 Vibe Coding 的光谱

模式适用场景人的职责风险
Vibe Coding原型、一次性脚本快速表达意图,接受结果难维护、难审计
AI-assisted Engineering局部提效、补全写主体设计,审查 AI 输出取决于个人习惯
Agentic Engineering专业交付、团队协作设计目标、验证、负责合并需工程纪律与治理

一句话:Vibe coding 是「我不太看代码还能跑」;Agentic Engineering 是「我让 agent 写,但我能解释、验证、回滚并承担责任」。

能力成熟度的五阶段

阶段特征代码产出中 AI 占比
L1: 辅助补全IDE 补全、Copilot 单行建议<10%
L2: 对话编码Chat 生成函数/模块,人组装20-40%
L3: Agent 协作Agent 自主完成任务,人评审50-70%
L4: 规格驱动Spec → Agent 全流程,人签署门禁80%+
L5: 自治团队多 Agent 并行,人只设约束95%+

大部分团队卡在哪

多数团队在 L2-L3 之间摇摆。瓶颈不是模型能力,而是:

  • 没有可评审的 Spec
  • 测试体系跟不上生成速度
  • 缺乏独立评审角色

Simon Willison 关键模式

Tool Loop

LLM + system prompt + tools + observations。没有工具执行能力时只是代码建议器;有了执行能力,agent 通过运行测试收敛。企业要治理的是 Harness,不是模型本身。

Git 是安全绳

每个 agent session 应在分支或 worktree 中运行;小步提交便于审查和回滚。Agent 可辅助解释 diff、整理 commit,不能替代人的合并责任

First Run the Tests

启动 session 的高价值短指令 — 建立基线,诱导 agent 后续继续用测试验证改动。

Red/Green TDD

先写失败测试再实现 — 减少「看起来合理但未验证」的代码。

Agentic Manual Testing

自动化测试不能替代 UI 亲眼验证;agent 可用 Playwright、截图执行「类手工测试」,人仍检查关键结果。

Subagents

价值在保护主上下文;适合探索、影响面扫描、独立 review。过度拆分增加协调成本。

PR Accountability

反模式: 把 agent 生成但自己没审过的 PR 交给同事 — 是把责任转嫁给 reviewer。好的 agentic PR 要小、可审、带测试证据。

六能力域

  1. Intent & Spec — 需求拆解、验收条件、风险边界
  2. Context & Knowledge — 团队约定、架构决策、skills 沉淀
  3. Harness & Tools — 终端、测试、浏览器、CI、权限与沙箱
  4. Verification & Evidence — 测试、截图、日志、可复现实验
  5. Collaboration & Review — Git 分支、PR 尺寸、review checklist
  6. Learning Loop — 复盘、失败模式、工具改进、知识资产更新

升阶路线

跃迁关键动作
L2 → L3Agent CLI + 沙箱 + Review 节点
L3 → L4Spec 体系 + 独立 Evaluator + 门禁自动化
L4 → L5多 Agent 编排 + 度量驱动治理

30/60/90 天路径:

  • 0–30 天: 分支/worktree 边界;先跑测试;小步提交;agent instructions 模板
  • 31–60 天: Playwright;红/绿 TDD;subagent 做影响面扫描
  • 61–90 天: skills/templates 固化;度量 PR lead time、defect leakage;纳入 CI/CD 门禁

反模式清单

  • 未审查 PR 丢给同事
  • 无基线测试
  • 只看 demo,不看边界路径
  • 巨大任务一次性委托
  • 没有证据的完成声明
  • 忽视初级工程师技能退化

参考