[research@ai4se] : ~ $
cd ../
[measurement] | | 18 min

# AI4SE 成熟度模型设计:分型诊断,而不是一刀切开药

团队都在用 AI,不等于都能用同一套改进方案。AI4SE 成熟度模型用 6 域 × 18 项的证据化画像识别短板,再按成熟度分型给出剂量匹配的能力提升处方——评估的目的不是打分,而是具体问题具体分析。

[maturity-model][measurement][ai4se-framework]

本文基于 AI4SE 团队成熟度模型 v0.3.5 的设计稿与评估表,面向需要在组织内做当前态诊断、证据化评分与持续改进牵引的研发管理者、工程效能负责人与顾问。配套评估表以能力画像与风险项输出为主,不计算团队总分。

门诊里最危险的习惯,不是「不会开药」,而是「见过感冒就开同一种药、同一种剂量」。

AI4SE 转型里也有同类误判:团队都装了 Coding Agent,于是全员上同一套工作流模板、同一套培训课、同一套「自主化」目标。结果往往是——工具层看起来很热闹,流程与人机协作契约却跟不上;或者基础标准还没立住,就开始追 L4/L5 的系统化叙事。

成熟度评估的关键点,不在于给团队贴一个等级标签,而在于:不同成熟度的团队,改进优化方案本就不同。 哪怕最终都要补「证据驱动的 Review」,从 L2 走到 L3 与从 L3 走到 L4,动作集合与投入剂量也不一样。模型存在的意义,是发现能力短板,再具体问题具体分析地给出 AI4SE 能力提升方案。

本文讲这套模型为什么这样设计、如何判级、以及如何把评估输出读成「分型处方」。能力项的完整 L1–L5 行为锚点以评估表为准,文中只保留设计逻辑与读图方法。


一、为什么需要团队级成熟度模型

采购工具、组织培训、宣布「全面拥抱 AI」,都容易做成活动。真正难的是回答三个问题:

  1. 当前稳定发生的是什么? 不是计划里写了什么,也不是演示里演了什么。
  2. 短板卡在哪一层? 是效能目标不清,还是流程未改、方法未立、工具无边界、协作无契约、组织无土壤?
  3. 下一步该开什么「药」、开多大「剂量」? 继续堆工具,还是先补门禁与责任链?

DORA、SPACE、DevEx 回答的是「交付与体验发生了什么」;分层技术模型 回答的是「工程能力应按什么结构理解」。成熟度模型补的是第三块:团队在 AI4SE 各能力域上的当前画像,以及由此推导的改进优先级

它刻意不做四件事:

不做原因
单一团队总分平均数会掩盖关键短板;「总分 3.2」无法指导下周改什么
团队排名评估服务于改进,不服务于竞赛
固定周期成熟度承诺模型可复评,但不内置「三个月必到 L4」
绑定特定厂商/框架评的是能力,不是采购清单

二、模型定位:画像诊断,服务处方

模型用于评估团队在 AI4SE 方面的当前能力画像,识别差距,并为持续改进提供证据基础。它不绑定单次项目背景,也不以单一总分评价团队优劣。

应输出:

  • 能力域画像:六个域各自的成熟度分布
  • 能力项热力图:18 个能力项的 L1–L5 状态
  • 证据强度与评分置信度:说明分数是否可靠
  • 瓶颈项与证据缺口:说明为什么不能评到更高等级
  • 持续改进建议:基于缺口提出下一步方向

不应输出: 总分、排名、周期跃迁承诺、对特定工具的强制要求。

一句话:

评估是分型诊断;处方是按短板与证据缺口匹配的能力提升方案。


三、设计原则

原则说明
当前态评分只评已经稳定发生的实践,不评计划、愿景或一次性演示
证据优先评分基于可观察事实、产物、流程记录、系统数据与访谈交叉验证
团队一致性个别人做到不代表团队能力;个人实践通常最高不超过 L2
就低不就高只满足高等级的部分条件时,按已稳定满足的共同能力评分
能力而非工具锚点描述团队具备什么能力,不硬编码厂商或框架
可复评同一模型可用于后续周期复评,但不内置固定时间目标
不算总分输出画像、瓶颈与改进建议,不输出排名分

这些原则共同服务一个目的:让「处方」建立在可复核事实上,而不是建立在口号或体感上。


四、能力结构:6 域 × 18 项

模型采用 6 个能力域、18 个能力项,与 AI4SE 分层技术模型对齐:Effectiveness 地基、Process / Methods / Tools 三层、Harmony 横切,以及组织与文化支撑。

能力域定位能力项
D1效能地基Quality + Efficiency + Value价值目标与成效假设;质量与信任基线;效率与流动度量
D2流程层人机协作的可审计闭环AI4SE 工作流设计;小批量任务分解;证据驱动的 Review/Ship 门禁
D3工程方法与工作纪律可复用、可训练、可验证的方法规格化表达;上下文组织;验证与证据纪律
D4工具层Agent 运行环境、上下文与自动化验证Agent 运行环境与权限;AI 可访问的工程上下文;自动化验证与工具链集成
D5Harmony 人机/Agent 协作横切三层的协作契约协作职责与独立验证;HITL/HOTL/HOOL 风险路由;责任归属与审计记录
D6组织与文化持续采纳与团队学习实践带头人与培训;社区与知识资产;采纳信心与行为转变

结构本身就在提示「分型」:若 D4 明显高于 D2/D5,典型处方不是再买一把更强的 Agent,而是补工作流、门禁、职责与风险路由——否则工具越强,绕过治理的速度越快。

与参考框架的映射

本模型对应来源
D1 效能地基AI4SE Effectiveness Focus;DORA Value / Flow 视角
D2 流程层Pressman Process;Research → Plan → Execute → Review → Ship
D3 工程方法Pressman Methods;SDD、Agentic Engineering、Harness 等稳定能力抽象
D4 工具层Pressman Tools;Agent 运行时、权限、上下文、自动化验证
D5 HarmonyHarmony 横切;HITL / HOTL / HOOL 监督光谱
D6 组织与文化采纳、培训、实践社区等组织土壤

度量框架(DORA / SPACE / DevEx)告诉你「效果与体验如何」;成熟度模型告诉你「能力结构哪里缺,下一步该补哪一块」。


五、等级语义:L1–L5

主标签使用 L1–L5。若需对齐 Microsoft CMM 风格命名,可映射为 L100–L500。

等级名称通用判级语义
L1初始实践零散、个人化、不可重复,缺少团队标准与证据
L2工具化已有局部实践或初步规则,但依赖个人经验,团队一致性与治理较弱
L3工程化形成明确标准、角色责任、必要产物与评审机制,可重复执行
L4系统化标准嵌入流程与工具链,关键数据可追踪,并形成持续改进闭环
L5自主化在明确治理边界内,低风险路径可稳定自动运行,异常可升级,决策证据可追踪,并基于运行数据持续优化

说明:L2 的「工具化」是简写,表示 AI4SE 已从零散想法进入局部实践或初步规则阶段,不代表只评估工具采购

对「开药」而言,等级差比绝对分更重要:

  • 大量能力项停在 L1–L2:优先建团队标准、模板、执行记录与证据纪律,而不是追自主化叙事。
  • 多数已到 L3、局部可冲 L4:把标准嵌入任务系统、评审门禁与工具链,让缺失证据真的能挡住交付。
  • 工具高、流程/Harmony 低:先补协作契约与门禁,再谈扩大 Agent 权限。

同一味「药」(例如证据门禁),剂量不同:L2→L3 往往是「评审前必须有变更说明 / 测试 / 风险说明」;L3→L4 则是「缺失证据会阻止或延迟交付,且要求嵌入工具链」。


六、证据化判级:让处方可复核

1. 判级五步法

最终等级 = 满足该等级必要条件的最高等级,并受证据强度、团队覆盖度与封顶规则约束。

  1. 确认当前稳定实践:只看已稳定发生的行为。
  2. 对照行为锚点:选择最接近当前事实的 L1–L5 描述。
  3. 检查必要条件:条件不完整则降到已满足的最高等级。
  4. 应用封顶规则:按证据强度、覆盖度、执行记录与「普通工程实践边界」封顶。
  5. 形成最终解释等级:记录证据摘要、AI4SE 增量证据、证据缺口、置信度与改进建议。

v0.3.5 评估表以顾问专家评分为主要成熟度输入;最终进入 Dashboard 的是被证据与覆盖度规则封顶后的最终解释等级,不是主观体感分。

2. 证据强度与覆盖度封顶

证据强度含义封顶倾向
个人描述、单次案例、不可复核截图通常最高 L2
有文档/访谈/少量样本,但连续性或覆盖不足通常最高 L3
完整工作周期或 4 周以上、多样本、多来源且可关联工作产物才具备解释 L4/L5 的条件
覆盖度含义封顶倾向
个人个别成员能做到通常最高 L2
小组单一角色或局部场景通常最高 L3
团队主要交付角色与关键环节稳定使用L3+ 的基本门槛
跨团队多团队共享治理与知识机制组织级扩散信号

3. AI4SE 增量证据

普通 PR、CI、Git、测试记录可以作为基础证据,但不能自动证明 AI4SE 成熟度。评估者必须能说明:

  • AI 参与了哪个环节;
  • 团队如何调整了流程、验证、权限、责任或知识资产;
  • 这些调整能否被复核。

没有增量证据,就容易把「我们一直有 CI」误判成「我们已经系统化做 AI4SE」——处方也会开错。

4. 相邻能力项边界

为减少同一证据被重复解释,评估时要分清:

能力项主要评什么不替代什么
D2.3 证据驱动门禁评审/交付前是否要求证据,缺失是否影响交付不替代 D3.3 验证方法纪律,也不替代 D5.3 责任链
D3.3 验证与证据纪律如何验证 AI 输出、留下什么证据不因已有普通 CI 自动高分
D4.3 自动化验证与工具链AI 辅助变更是否可识别并进入统一验证链路不替代门禁决策与人工责任
D5.1 协作职责与独立验证人/Agent 职责、接管点、验证是否独立于生成主体「都人工看过」≠ 自动高分
D5.3 责任归属与审计谁批准、谁验证、谁合并、谁担责是否可追踪一般 Code Review 记录 ≠ AI4SE 责任链

边界清晰,短板才清晰;短板清晰,处方才不会「一药治百病」。


七、从画像到处方:同病异治

成熟度评估的产品,不是雷达图本身,而是可执行的改进方案差异。下面用三类常见画像说明「分型」——它们都可能被口头描述成「团队在用 AI」,处方却完全不同。

类型 A:工具领先,流程与 Harmony 偏弱

画像特征: D4 相对最高;D2、D5 明显落后;L1/L2 项集中在工作流、风险路由、责任记录。

错误处方: 继续采购更强 Agent、扩大自动改代码权限、用工具使用率当成功指标。

匹配处方:

  1. 先定义团队级 AI4SE 工作流与小批量任务标准(D2.1 / D2.2);
  2. 建立证据驱动的 Review/Ship 要求(D2.3),并与验证纪律(D3.3)对齐;
  3. 明确职责、独立验证与 HITL/HOTL/HOOL 风险路由(D5);
  4. 工具权限扩张必须跟在协作契约之后,而不是之前。

类型 B:多域卡在 L1–L2

画像特征: 全局大量 L1/L2;偶有个人高手;知识散落在聊天与个人笔记。

错误处方: 直接对标「自主化 Agent 团队」、上复杂多 Agent 编排。

匹配处方:

  1. 选定少数高价值场景,建立可重复的规格 / 上下文 / 验证模板(D3);
  2. 识别实践带头人,做角色化辅导而非一次性培训(D6.1);
  3. 把成功与失败模式沉淀为团队知识资产(D6.2);
  4. 目标先到工程化(L3)可重复,再谈系统化。

类型 C:多数近 L3,局部可冲 L4

画像特征: 标准与执行记录已有;缺的是嵌入工具链、数据闭环与决策影响。

错误处方: 再开一轮「意识提升」培训,或用满意度调查代替工程改造。

匹配处方:

  1. 把证据要求、权限与验证结果嵌入任务系统 / PR / 发布门禁(D2 / D4);
  2. 让指标影响优先级与治理决策,而不只是事后展示(D1);
  3. 责任链与风险路由进入可审计记录(D5.2 / D5.3);
  4. 用复评验证「低成熟项是否清零」,而不是只看域平均分上涨。

「同药异量」示例

D2.3 证据驱动的 Review/Ship 门禁 为例:

当前大致位置下一剂改进成功信号
L1–L2规定评审前必要证据清单,并在真实任务中留下执行记录从「靠自述」变为「有稳定证据格式」
L2–L3证据要求成为团队共识,缺失会被指出并补齐多个真实交付样本可见一致执行
L3–L4证据要求嵌入门禁,缺失会阻止或延迟交付门禁失败记录可查,且影响真实交付
L4–L5按风险、变更类型与历史质量动态调整门禁强度有运行数据证明动态策略有效

评估若只给一个「D2.3 = L2」,却开出「上动态门禁引擎」的药,就是典型的剂量错误。


八、评估表怎么用(v0.3.5)

正式评估表把 18 个能力项、行为锚点、必要条件、建议证据、封顶规则与证据字段收在同一评分页。顾问版填写节奏建议如下:

  1. 基于访谈、证据与交付记录填写顾问专家评分;不了解事实时填「不清楚/无证据」,不按 L1 处理。
  2. 阅读能力项 Note 中的 L1–L5 锚点、必要条件与封顶规则。
  3. 补充证据摘要、证据类型、AI4SE 增量证据、来源/链接与样本周期。
  4. 填写证据评分、证据强度、团队覆盖度、置信度、证据缺口与改进建议。
  5. 查看规则冲突提示与最终等级:顾问评分高于「建议最高等级」时,以证据封顶结果解释。
  6. 用 Dashboard 看能力域画像;用 Risk Register 汇总低成熟、低证据、覆盖不足与增量证据缺口。

Dashboard 默认使用最终解释等级,不使用平均分作为团队总分,也不做排名。域平均分只用于看轮廓;决策仍应看最低项、L1/L2 数量、风险项与证据缺口。


九、如何读评估输出:一份 mock 演练

以下图表与数据复现自可视化 mock(ai4se-maturity-visualization-mock-v0.1):雷达图看轮廓、柱状图看域差、提升条看行动成效、热力图看能力项。全部为模拟数据,不代表真实团队或成熟度承诺,用来演示「读图 → 分型 → 处方」。

1. 先看 Dashboard 关键信号

Mock Dashboard 关键信号一览

一眼可读的四件事:L1/L2 是否成片存在、是否已有 L4/L5、哪几个域变化最大、当前属于哪类典型画像。本例首次评估被标为类型 A:工具领先 · 流程/Harmony 偏弱——这已经是处方方向,而不只是分数摘要。

2. 首次评估:典型结构性失衡

6 域成熟度轮廓:首次 vs 改进后

雷达图上,灰色「首次评估」轮廓整体贴近 L2,唯有 D4 工具层明显外扩;青色「改进后」轮廓更圆、更靠外。读首次轮廓时,重点不是「平均多少」,而是形状是否失衡

能力域前后对比柱状图
能力域域画像(均值)解读线索
D1效能地基2.00有局部目标/体感,未到工程化
D2流程层1.67工作流与门禁偏弱
D3工程方法2.00规格/上下文/验证仍偏个人
D4工具层2.67相对领先
D5Harmony1.67风险路由与协作契约不足
D6组织与文化2.00培训与知识资产未机制化

全局信号更刺眼:18 项中有 16 项落在 L1/L2,L4/L5 为 0。
这不是「再买工具」的信号,而是类型 A:工具层相对领先,流程与 Harmony 偏弱。

再下钻到能力项热力图——域均值会掩盖单项短板,热力图不会:

18 项能力热力图:首次 vs 改进后

能力项层面,短板也很具体(图中红框):

  • D2.1 AI4SE 工作流设计:L1(仍停留在个人使用)
  • D5.2 HITL/HOTL/HOOL 风险路由:L1(未做风险分级)
  • D4.2 / D4.3:已到 L3(上下文与验证链路相对靠前)

由此开出的第一剂处方应指向 D2 与 D5,而不是继续加码 D4:把个人用法收成团队工作流,把「全都人工看一眼」升级为有分级的风险路由与可审计责任链,并同步补齐规格/上下文/验证模板(D3)与价值假设(D1)。

3. 改进后评估:看短板清零,而不只看均值上涨

指标首次改进后
L1/L2 能力项160
L4/L5 能力项03
六域画像约 L2 附近、D4 略高均达或接近 L3,D3/D4 局部进入 L4
各能力域提升幅度

提升最大的域是 D2 / D3 / D5(约 +1.33)。这与处方方向一致:短板域被优先抬起。热力图右侧一列显示局部进入系统化的项包括:

  • D3.3 验证与证据纪律 → L4(证据进入评审与交付决策)
  • D4.2 / D4.3 → L4(上下文受控可维护;AI 辅助变更稳定进入验证链路)

读图时建议固定问三句:

  1. 形状像什么?(类型 A/B/C 或其它组合)——先看雷达与 Dashboard
  2. 哪些项在拖后腿?(最低项与 L1/L2 清单)——再看热力图红区
  3. 证据是否撑得住?(低证据、覆盖不足、增量证据缺口会不会让「高分」不可解释)

域平均分上涨但 L1/L2 仍多,说明短板未清;L4/L5 增加但风险路由仍空,说明自主化叙事超前于治理。好的复评,证明的是处方有效,而不是分数好看。


十、收束:评估服务于可执行的能力提升

AI4SE 成熟度模型 v0.3.5 的设计选择可以收成四句:

  1. 用 6×18 对齐分层工程结构,避免只评工具或只评文化。
  2. 用证据与覆盖度封顶,避免把计划、演示和个人英雄当成团队能力。
  3. 输出画像与缺口,不算总分,避免排名替代诊断。
  4. 把评估读成分型处方:不同成熟度、不同短板,改进方案与剂量本就不同。

回到开篇的类比:病人都是「感冒」,专业医生仍会问病程、体质与并发症,再决定同药异量或换方案。团队都在「用 AI」,专业的 AI4SE 改进同样如此——先分型诊断,再具体问题具体分析地提升能力。

相关阅读: