返回 S01~S90 教材库
S55 · 总 Day 145教材已备 ≠ 学习已完成

S55:为 Dashboard 增加一个真正有问题意识的指标

好指标从一个可行动问题出发,明确事件、分子、分母、窗口、slice 与 owner;把更多数字放到 dashboard 并不会自动增加理解。

2027-01-16dashboard、metric-design、sli、actionability、optional

内容类型:预习教材(不代表已完成)
日期:2027-01-16
阶段:P2 · AI Systems Engineering 90
总路线:Day 145 / 360
周次:W8 · Observability、Cost、SLO、Capacity
节奏:周六可选探索 / 补学
状态:教材已备;学习未完成
标签:dashboard、metric-design、sli、actionability、optional

一句话定义

好指标从一个可行动问题出发,明确事件、分子、分母、窗口、slice 与 owner;把更多数字放到 dashboard 并不会自动增加理解。

学习目标

  1. 从问题而非现有字段定义一项指标。
  2. 写清分子、分母、窗口、数据完整性和解释边界。
  3. 理解 alert、dashboard、exploration 和 release evidence 的不同用途。
  4. 可选地补一个小型计算或展示,不追求完整看板。

核心知识

  • Dashboard 用于持续理解状态;alert 用于需要及时行动的异常;探索查询用于临时调查;release evidence 支持特定版本决策。一个图不能同时完美服务四种目的。
  • 指标必须对应 owner 可采取的动作。没有阈值也可以有价值,但需要说明趋势变化后先调查什么。
  • 比率指标要显示分子和分母。成功率 100% 可能只有两个请求,cost/success 暴涨可能是成功数骤降。
  • 窗口选择影响信号:短窗口敏感但噪声大,长窗口稳定但反应慢。比较时还要控制版本、流量和业务 mix。
  • Missing telemetry 不是正常值。数据缺失、迟到与采样应单独显示,不应默认当零。
  • 指标命名应包含单位和语义,例如 ai_task_duration_mshuman_review_wait_seconds,避免含糊 performance_score

机制与推导

示例问题:“高风险任务是否因人工队列积压而超出目标时间?”

metric: high_risk_review_within_target_ratio
numerator: 窗口内等待 <= 30min 且已有决定的高风险任务
denominator: 窗口内到期且进入人工复核的高风险任务
slice: team/decision type(控制基数)
missing: 无 enqueue timestamp 或无成熟 outcome 单独计数
owner/action: review operations 调整分配、容量或升级路径

不要把尚未到期任务放入分母,也不要排除失败后悄悄让比率变好。若数据太少,展示计数和区间,而非宣布趋势。

最小练习或观察步骤

  1. 从慢、贵、错、tool error、human backlog 中选一个具体问题。
  2. 写指标名、分子、分母、窗口、slice、数据源和 owner。
  3. 构造 8~12 条合成记录,手算一次并同时显示样本数。
  4. 加一条缺失数据和一条尚未成熟任务,说明如何处理。
  5. 写两句:指标异常时先查什么;指标正常时仍不能证明什么。
  6. 精力不足可跳过,不要求画漂亮 dashboard 或设置报警 gate。

常见误区与边界

  • 先找能画的字段,再为图编造问题。
  • 只显示比例,不显示分母与数据缺失。
  • 每个用户、案件和 prompt 都成为 slice/label。
  • 用单阈值跨不同风险等级、地区和任务复杂度。
  • 指标变化就自动归因于最近模型版本。
  • 本日可选;不新增 dashboard 也不影响阶段学习。

系统 / 金融 / Web3 场景连接

金融人工复核要按风险和期限分层,平均等待可能掩盖高风险过期。Web3 交易助手可看“在目标时间内达到指定确认深度的比例”,但要按链和 gas 条件切片,且不能把未成熟交易当失败或成功。

自检问题

  1. Dashboard、alert 与 release evidence 各用于什么?
  2. 为什么比率必须同时展示分子分母?
  3. 尚未成熟 outcome 应怎样处理?
  4. 一个可行动指标需要怎样的 owner?

专业课程对齐

  • 阅读 Google SRE 资源 的 SLI/SLO、monitoring 与 alerting 章节入口,重点区分“值得观察”和“需要唤醒人处理”。
  • 阅读 OpenTelemetry 官方文档 的 metrics、exemplars 与 semantic conventions,观察聚合指标怎样链接回代表性 trace。
  • 阅读 Full Stack Deep Learning 2022 的 monitoring 讲次,理解模型、系统和业务指标怎样互补而非合成万能分数。

深入学习提示

先写 owner 会采取的动作,再决定指标。用缺失数据、小分母和业务 mix 改变三个反例攻击它。若还想深入,只增加一个代表性 trace link 或 slice;不要扩展成整套监控项目。

学后填写区

  • 今日选择(休息 / 设计 / 小计算):
  • 指标完整定义:
  • 数据缺失与成熟窗口:
  • 可行动 owner:
  • 不能支持的结论:
重点主线 · H03 · 工具接口与代码变更边界本周配套机制实验 · W8 · 系统观测:一次成功任务到底花了什么 →详细讲义、离线示例与源码;按需要选读,不新增必交任务。
本页是未来 P2 的预习教材。等 P1 完成并正式进入 P2 后,再填写真实理解、练习结果和不确定项;现在阅读不会改变P1 唯一进度账本