# AI4SE 成熟度模型设计:分型诊断,而不是一刀切开药
团队都在用 AI,不等于都能用同一套改进方案。AI4SE 成熟度模型用 6 域 × 18 项的证据化画像识别短板,再按成熟度分型给出剂量匹配的能力提升处方——评估的目的不是打分,而是具体问题具体分析。
本文基于 AI4SE 团队成熟度模型 v0.3.5 的设计稿与评估表,面向需要在组织内做当前态诊断、证据化评分与持续改进牵引的研发管理者、工程效能负责人与顾问。配套评估表以能力画像与风险项输出为主,不计算团队总分。
门诊里最危险的习惯,不是「不会开药」,而是「见过感冒就开同一种药、同一种剂量」。
AI4SE 转型里也有同类误判:团队都装了 Coding Agent,于是全员上同一套工作流模板、同一套培训课、同一套「自主化」目标。结果往往是——工具层看起来很热闹,流程与人机协作契约却跟不上;或者基础标准还没立住,就开始追 L4/L5 的系统化叙事。
成熟度评估的关键点,不在于给团队贴一个等级标签,而在于:不同成熟度的团队,改进优化方案本就不同。 哪怕最终都要补「证据驱动的 Review」,从 L2 走到 L3 与从 L3 走到 L4,动作集合与投入剂量也不一样。模型存在的意义,是发现能力短板,再具体问题具体分析地给出 AI4SE 能力提升方案。
本文讲这套模型为什么这样设计、如何判级、以及如何把评估输出读成「分型处方」。能力项的完整 L1–L5 行为锚点以评估表为准,文中只保留设计逻辑与读图方法。
一、为什么需要团队级成熟度模型
采购工具、组织培训、宣布「全面拥抱 AI」,都容易做成活动。真正难的是回答三个问题:
- 当前稳定发生的是什么? 不是计划里写了什么,也不是演示里演了什么。
- 短板卡在哪一层? 是效能目标不清,还是流程未改、方法未立、工具无边界、协作无契约、组织无土壤?
- 下一步该开什么「药」、开多大「剂量」? 继续堆工具,还是先补门禁与责任链?
DORA、SPACE、DevEx 回答的是「交付与体验发生了什么」;分层技术模型 回答的是「工程能力应按什么结构理解」。成熟度模型补的是第三块:团队在 AI4SE 各能力域上的当前画像,以及由此推导的改进优先级。
它刻意不做四件事:
| 不做 | 原因 |
|---|---|
| 单一团队总分 | 平均数会掩盖关键短板;「总分 3.2」无法指导下周改什么 |
| 团队排名 | 评估服务于改进,不服务于竞赛 |
| 固定周期成熟度承诺 | 模型可复评,但不内置「三个月必到 L4」 |
| 绑定特定厂商/框架 | 评的是能力,不是采购清单 |
二、模型定位:画像诊断,服务处方
模型用于评估团队在 AI4SE 方面的当前能力画像,识别差距,并为持续改进提供证据基础。它不绑定单次项目背景,也不以单一总分评价团队优劣。
应输出:
- 能力域画像:六个域各自的成熟度分布
- 能力项热力图:18 个能力项的 L1–L5 状态
- 证据强度与评分置信度:说明分数是否可靠
- 瓶颈项与证据缺口:说明为什么不能评到更高等级
- 持续改进建议:基于缺口提出下一步方向
不应输出: 总分、排名、周期跃迁承诺、对特定工具的强制要求。
一句话:
评估是分型诊断;处方是按短板与证据缺口匹配的能力提升方案。
三、设计原则
| 原则 | 说明 |
|---|---|
| 当前态评分 | 只评已经稳定发生的实践,不评计划、愿景或一次性演示 |
| 证据优先 | 评分基于可观察事实、产物、流程记录、系统数据与访谈交叉验证 |
| 团队一致性 | 个别人做到不代表团队能力;个人实践通常最高不超过 L2 |
| 就低不就高 | 只满足高等级的部分条件时,按已稳定满足的共同能力评分 |
| 能力而非工具 | 锚点描述团队具备什么能力,不硬编码厂商或框架 |
| 可复评 | 同一模型可用于后续周期复评,但不内置固定时间目标 |
| 不算总分 | 输出画像、瓶颈与改进建议,不输出排名分 |
这些原则共同服务一个目的:让「处方」建立在可复核事实上,而不是建立在口号或体感上。
四、能力结构:6 域 × 18 项
模型采用 6 个能力域、18 个能力项,与 AI4SE 分层技术模型对齐:Effectiveness 地基、Process / Methods / Tools 三层、Harmony 横切,以及组织与文化支撑。
| 域 | 能力域 | 定位 | 能力项 |
|---|---|---|---|
| D1 | 效能地基 | Quality + Efficiency + Value | 价值目标与成效假设;质量与信任基线;效率与流动度量 |
| D2 | 流程层 | 人机协作的可审计闭环 | AI4SE 工作流设计;小批量任务分解;证据驱动的 Review/Ship 门禁 |
| D3 | 工程方法与工作纪律 | 可复用、可训练、可验证的方法 | 规格化表达;上下文组织;验证与证据纪律 |
| D4 | 工具层 | Agent 运行环境、上下文与自动化验证 | Agent 运行环境与权限;AI 可访问的工程上下文;自动化验证与工具链集成 |
| D5 | Harmony 人机/Agent 协作 | 横切三层的协作契约 | 协作职责与独立验证;HITL/HOTL/HOOL 风险路由;责任归属与审计记录 |
| D6 | 组织与文化 | 持续采纳与团队学习 | 实践带头人与培训;社区与知识资产;采纳信心与行为转变 |
结构本身就在提示「分型」:若 D4 明显高于 D2/D5,典型处方不是再买一把更强的 Agent,而是补工作流、门禁、职责与风险路由——否则工具越强,绕过治理的速度越快。
与参考框架的映射
| 本模型 | 对应来源 |
|---|---|
| D1 效能地基 | AI4SE Effectiveness Focus;DORA Value / Flow 视角 |
| D2 流程层 | Pressman Process;Research → Plan → Execute → Review → Ship |
| D3 工程方法 | Pressman Methods;SDD、Agentic Engineering、Harness 等稳定能力抽象 |
| D4 工具层 | Pressman Tools;Agent 运行时、权限、上下文、自动化验证 |
| D5 Harmony | Harmony 横切;HITL / HOTL / HOOL 监督光谱 |
| D6 组织与文化 | 采纳、培训、实践社区等组织土壤 |
度量框架(DORA / SPACE / DevEx)告诉你「效果与体验如何」;成熟度模型告诉你「能力结构哪里缺,下一步该补哪一块」。
五、等级语义:L1–L5
主标签使用 L1–L5。若需对齐 Microsoft CMM 风格命名,可映射为 L100–L500。
| 等级 | 名称 | 通用判级语义 |
|---|---|---|
| L1 | 初始 | 实践零散、个人化、不可重复,缺少团队标准与证据 |
| L2 | 工具化 | 已有局部实践或初步规则,但依赖个人经验,团队一致性与治理较弱 |
| L3 | 工程化 | 形成明确标准、角色责任、必要产物与评审机制,可重复执行 |
| L4 | 系统化 | 标准嵌入流程与工具链,关键数据可追踪,并形成持续改进闭环 |
| L5 | 自主化 | 在明确治理边界内,低风险路径可稳定自动运行,异常可升级,决策证据可追踪,并基于运行数据持续优化 |
说明:L2 的「工具化」是简写,表示 AI4SE 已从零散想法进入局部实践或初步规则阶段,不代表只评估工具采购。
对「开药」而言,等级差比绝对分更重要:
- 大量能力项停在 L1–L2:优先建团队标准、模板、执行记录与证据纪律,而不是追自主化叙事。
- 多数已到 L3、局部可冲 L4:把标准嵌入任务系统、评审门禁与工具链,让缺失证据真的能挡住交付。
- 工具高、流程/Harmony 低:先补协作契约与门禁,再谈扩大 Agent 权限。
同一味「药」(例如证据门禁),剂量不同:L2→L3 往往是「评审前必须有变更说明 / 测试 / 风险说明」;L3→L4 则是「缺失证据会阻止或延迟交付,且要求嵌入工具链」。
六、证据化判级:让处方可复核
1. 判级五步法
最终等级 = 满足该等级必要条件的最高等级,并受证据强度、团队覆盖度与封顶规则约束。
- 确认当前稳定实践:只看已稳定发生的行为。
- 对照行为锚点:选择最接近当前事实的 L1–L5 描述。
- 检查必要条件:条件不完整则降到已满足的最高等级。
- 应用封顶规则:按证据强度、覆盖度、执行记录与「普通工程实践边界」封顶。
- 形成最终解释等级:记录证据摘要、AI4SE 增量证据、证据缺口、置信度与改进建议。
v0.3.5 评估表以顾问专家评分为主要成熟度输入;最终进入 Dashboard 的是被证据与覆盖度规则封顶后的最终解释等级,不是主观体感分。
2. 证据强度与覆盖度封顶
| 证据强度 | 含义 | 封顶倾向 |
|---|---|---|
| 低 | 个人描述、单次案例、不可复核截图 | 通常最高 L2 |
| 中 | 有文档/访谈/少量样本,但连续性或覆盖不足 | 通常最高 L3 |
| 高 | 完整工作周期或 4 周以上、多样本、多来源且可关联工作产物 | 才具备解释 L4/L5 的条件 |
| 覆盖度 | 含义 | 封顶倾向 |
|---|---|---|
| 个人 | 个别成员能做到 | 通常最高 L2 |
| 小组 | 单一角色或局部场景 | 通常最高 L3 |
| 团队 | 主要交付角色与关键环节稳定使用 | L3+ 的基本门槛 |
| 跨团队 | 多团队共享治理与知识机制 | 组织级扩散信号 |
3. AI4SE 增量证据
普通 PR、CI、Git、测试记录可以作为基础证据,但不能自动证明 AI4SE 成熟度。评估者必须能说明:
- AI 参与了哪个环节;
- 团队如何调整了流程、验证、权限、责任或知识资产;
- 这些调整能否被复核。
没有增量证据,就容易把「我们一直有 CI」误判成「我们已经系统化做 AI4SE」——处方也会开错。
4. 相邻能力项边界
为减少同一证据被重复解释,评估时要分清:
| 能力项 | 主要评什么 | 不替代什么 |
|---|---|---|
| D2.3 证据驱动门禁 | 评审/交付前是否要求证据,缺失是否影响交付 | 不替代 D3.3 验证方法纪律,也不替代 D5.3 责任链 |
| D3.3 验证与证据纪律 | 如何验证 AI 输出、留下什么证据 | 不因已有普通 CI 自动高分 |
| D4.3 自动化验证与工具链 | AI 辅助变更是否可识别并进入统一验证链路 | 不替代门禁决策与人工责任 |
| D5.1 协作职责与独立验证 | 人/Agent 职责、接管点、验证是否独立于生成主体 | 「都人工看过」≠ 自动高分 |
| D5.3 责任归属与审计 | 谁批准、谁验证、谁合并、谁担责是否可追踪 | 一般 Code Review 记录 ≠ AI4SE 责任链 |
边界清晰,短板才清晰;短板清晰,处方才不会「一药治百病」。
七、从画像到处方:同病异治
成熟度评估的产品,不是雷达图本身,而是可执行的改进方案差异。下面用三类常见画像说明「分型」——它们都可能被口头描述成「团队在用 AI」,处方却完全不同。
类型 A:工具领先,流程与 Harmony 偏弱
画像特征: D4 相对最高;D2、D5 明显落后;L1/L2 项集中在工作流、风险路由、责任记录。
错误处方: 继续采购更强 Agent、扩大自动改代码权限、用工具使用率当成功指标。
匹配处方:
- 先定义团队级 AI4SE 工作流与小批量任务标准(D2.1 / D2.2);
- 建立证据驱动的 Review/Ship 要求(D2.3),并与验证纪律(D3.3)对齐;
- 明确职责、独立验证与 HITL/HOTL/HOOL 风险路由(D5);
- 工具权限扩张必须跟在协作契约之后,而不是之前。
类型 B:多域卡在 L1–L2
画像特征: 全局大量 L1/L2;偶有个人高手;知识散落在聊天与个人笔记。
错误处方: 直接对标「自主化 Agent 团队」、上复杂多 Agent 编排。
匹配处方:
- 选定少数高价值场景,建立可重复的规格 / 上下文 / 验证模板(D3);
- 识别实践带头人,做角色化辅导而非一次性培训(D6.1);
- 把成功与失败模式沉淀为团队知识资产(D6.2);
- 目标先到工程化(L3)可重复,再谈系统化。
类型 C:多数近 L3,局部可冲 L4
画像特征: 标准与执行记录已有;缺的是嵌入工具链、数据闭环与决策影响。
错误处方: 再开一轮「意识提升」培训,或用满意度调查代替工程改造。
匹配处方:
- 把证据要求、权限与验证结果嵌入任务系统 / PR / 发布门禁(D2 / D4);
- 让指标影响优先级与治理决策,而不只是事后展示(D1);
- 责任链与风险路由进入可审计记录(D5.2 / D5.3);
- 用复评验证「低成熟项是否清零」,而不是只看域平均分上涨。
「同药异量」示例
以 D2.3 证据驱动的 Review/Ship 门禁 为例:
| 当前大致位置 | 下一剂改进 | 成功信号 |
|---|---|---|
| L1–L2 | 规定评审前必要证据清单,并在真实任务中留下执行记录 | 从「靠自述」变为「有稳定证据格式」 |
| L2–L3 | 证据要求成为团队共识,缺失会被指出并补齐 | 多个真实交付样本可见一致执行 |
| L3–L4 | 证据要求嵌入门禁,缺失会阻止或延迟交付 | 门禁失败记录可查,且影响真实交付 |
| L4–L5 | 按风险、变更类型与历史质量动态调整门禁强度 | 有运行数据证明动态策略有效 |
评估若只给一个「D2.3 = L2」,却开出「上动态门禁引擎」的药,就是典型的剂量错误。
八、评估表怎么用(v0.3.5)
正式评估表把 18 个能力项、行为锚点、必要条件、建议证据、封顶规则与证据字段收在同一评分页。顾问版填写节奏建议如下:
- 基于访谈、证据与交付记录填写顾问专家评分;不了解事实时填「不清楚/无证据」,不按 L1 处理。
- 阅读能力项 Note 中的 L1–L5 锚点、必要条件与封顶规则。
- 补充证据摘要、证据类型、AI4SE 增量证据、来源/链接与样本周期。
- 填写证据评分、证据强度、团队覆盖度、置信度、证据缺口与改进建议。
- 查看规则冲突提示与最终等级:顾问评分高于「建议最高等级」时,以证据封顶结果解释。
- 用 Dashboard 看能力域画像;用 Risk Register 汇总低成熟、低证据、覆盖不足与增量证据缺口。
Dashboard 默认使用最终解释等级,不使用平均分作为团队总分,也不做排名。域平均分只用于看轮廓;决策仍应看最低项、L1/L2 数量、风险项与证据缺口。
九、如何读评估输出:一份 mock 演练
以下图表与数据复现自可视化 mock(ai4se-maturity-visualization-mock-v0.1):雷达图看轮廓、柱状图看域差、提升条看行动成效、热力图看能力项。全部为模拟数据,不代表真实团队或成熟度承诺,用来演示「读图 → 分型 → 处方」。
1. 先看 Dashboard 关键信号
一眼可读的四件事:L1/L2 是否成片存在、是否已有 L4/L5、哪几个域变化最大、当前属于哪类典型画像。本例首次评估被标为类型 A:工具领先 · 流程/Harmony 偏弱——这已经是处方方向,而不只是分数摘要。
2. 首次评估:典型结构性失衡
雷达图上,灰色「首次评估」轮廓整体贴近 L2,唯有 D4 工具层明显外扩;青色「改进后」轮廓更圆、更靠外。读首次轮廓时,重点不是「平均多少」,而是形状是否失衡。
| 域 | 能力域 | 域画像(均值) | 解读线索 |
|---|---|---|---|
| D1 | 效能地基 | 2.00 | 有局部目标/体感,未到工程化 |
| D2 | 流程层 | 1.67 | 工作流与门禁偏弱 |
| D3 | 工程方法 | 2.00 | 规格/上下文/验证仍偏个人 |
| D4 | 工具层 | 2.67 | 相对领先 |
| D5 | Harmony | 1.67 | 风险路由与协作契约不足 |
| D6 | 组织与文化 | 2.00 | 培训与知识资产未机制化 |
全局信号更刺眼:18 项中有 16 项落在 L1/L2,L4/L5 为 0。
这不是「再买工具」的信号,而是类型 A:工具层相对领先,流程与 Harmony 偏弱。
再下钻到能力项热力图——域均值会掩盖单项短板,热力图不会:
能力项层面,短板也很具体(图中红框):
- D2.1 AI4SE 工作流设计:L1(仍停留在个人使用)
- D5.2 HITL/HOTL/HOOL 风险路由:L1(未做风险分级)
- D4.2 / D4.3:已到 L3(上下文与验证链路相对靠前)
由此开出的第一剂处方应指向 D2 与 D5,而不是继续加码 D4:把个人用法收成团队工作流,把「全都人工看一眼」升级为有分级的风险路由与可审计责任链,并同步补齐规格/上下文/验证模板(D3)与价值假设(D1)。
3. 改进后评估:看短板清零,而不只看均值上涨
| 指标 | 首次 | 改进后 |
|---|---|---|
| L1/L2 能力项 | 16 | 0 |
| L4/L5 能力项 | 0 | 3 |
| 六域画像 | 约 L2 附近、D4 略高 | 均达或接近 L3,D3/D4 局部进入 L4 |
提升最大的域是 D2 / D3 / D5(约 +1.33)。这与处方方向一致:短板域被优先抬起。热力图右侧一列显示局部进入系统化的项包括:
- D3.3 验证与证据纪律 → L4(证据进入评审与交付决策)
- D4.2 / D4.3 → L4(上下文受控可维护;AI 辅助变更稳定进入验证链路)
读图时建议固定问三句:
- 形状像什么?(类型 A/B/C 或其它组合)——先看雷达与 Dashboard
- 哪些项在拖后腿?(最低项与 L1/L2 清单)——再看热力图红区
- 证据是否撑得住?(低证据、覆盖不足、增量证据缺口会不会让「高分」不可解释)
域平均分上涨但 L1/L2 仍多,说明短板未清;L4/L5 增加但风险路由仍空,说明自主化叙事超前于治理。好的复评,证明的是处方有效,而不是分数好看。
十、收束:评估服务于可执行的能力提升
AI4SE 成熟度模型 v0.3.5 的设计选择可以收成四句:
- 用 6×18 对齐分层工程结构,避免只评工具或只评文化。
- 用证据与覆盖度封顶,避免把计划、演示和个人英雄当成团队能力。
- 输出画像与缺口,不算总分,避免排名替代诊断。
- 把评估读成分型处方:不同成熟度、不同短板,改进方案与剂量本就不同。
回到开篇的类比:病人都是「感冒」,专业医生仍会问病程、体质与并发症,再决定同药异量或换方案。团队都在「用 AI」,专业的 AI4SE 改进同样如此——先分型诊断,再具体问题具体分析地提升能力。
相关阅读: