ls -la ~/notes/measurement/
MEASUREMENT
7 articles
cd ../ 01 02 03 04 05 06 07
提效比较的三锚点:可比性、可分离性、诚实性
AI 介入软件工程后,提效比较常掉进鸡同鸭比。本文提出三锚点——可比性(固定 backlog / 团队 / 窗口)、可分离性(冻结复杂度基线)、诚实性(预期而非伪装实测)——并给出吞吐、周期时间(速度口径)与配对汇总的读数纪律,附常见反模式。
和团队死磕 AI4SE 效能指标:从模糊「提效 %」到可对照的度量共创
别再用说不清分母的「提效 300%」焦虑彼此。把端到端角色拉齐,对齐 DORA 与精益术语,按两大组结对共创指标,再在同一团队、固定迭代与需求范围下用百分位做前后对照——附吞吐、多段 Cycle Time、质量与 Token 成本配方。
AI4SE 成熟度模型设计:分型诊断,而不是一刀切开药
团队都在用 AI,不等于都能用同一套改进方案。AI4SE 成熟度模型用 6 域 × 18 项的证据化画像识别短板,再按成熟度分型给出剂量匹配的能力提升处方——评估的目的不是打分,而是具体问题具体分析。
Anthropic 2026 报告中的生产力数据:该量什么、别量什么
从 Anthropic 2026 趋势报告提炼可观测信号:60% AI 渗透率 vs 0–20% 完全委托、27% 新增类工作、以及 TELUS/CRED 等案例背后的度量启示。
从 DORA 到 DevEx:AI4SE 度量框架的全景
DORA 衡量交付、SPACE 衡量生产力、DevEx 衡量体验——AI4SE 需要整合这三套框架,因为 Agent 同时影响交付速度、人的工作方式和开发体验。
DORA 2025:AI 是放大器,不是银弹
Google DORA 2025 报告的关键发现:90% 的软件从业者正在使用 AI,59% 报告代码质量提升——但 AI 同时放大了好的和坏的工程实践。
AI4SE 时代的开发者生产力:为什么传统指标正在失效
用代码行数、Story Points、PR 数量来衡量 AI4SE 时代的开发者?这些指标不仅没用,还会鼓励错误行为。我们需要新框架。