返回 AICAP-180
B8 · Day 79真 API + 流式 + Docker

vibe-coding worklog

B1→B18 这条曲线的产出,不只是代码和数字,还要变成可链接、可被招聘方核验的资产——这正是 AISA(AI Solutions Architect)作品集的命门。

阶段: B8 · 真 API + 流式 + Docker(Day 71-80) 标签: #build-in-public #worklog #aisa-portfolio #honest-metrics

今日导引(由浅入深)

B1→B18 这条曲线的产出,不只是代码和数字,还要变成可链接、可被招聘方核验的资产——这正是 AISA(AI Solutions Architect)作品集的命门。

前几天(Day 71-78)攒下了一批真实工程数字:A/B 结果、cost/run、镜像体积、待补的 TTFT。 今天把它们写成一篇公开英文 worklog,用数字讲工程决策,而非营销话术。

这是「过程可见性」资产:招聘 manager 看的是「你怎么做决定、有没有量、诚不诚实」,而不是漂亮形容词。 今天的「最小可判定产出」是公开 worklog 首篇的可链接 URL(建仓 / 发文外部动作)+ 其中嵌入的真实数字表。

1. 机理精读

公开 worklog 是 AISA 作品集的「过程可见性」资产。 评审强制项是「可链接资产 + eval 数字 + 单位成本」,不是笔记数量。 一篇好 worklog 满足三条:

  • 真实数字(TTFT、x/29 通过率、cost/run)讲清一个工程决策;
  • 日期(时效可核,agent 领域半衰期 ~6 个月);
  • 可链接 artifact(commit、报告 JSON、镜像、部署 URL)。

它把「我会架构」从口头声明变成可点开核验的证据链——这是 AISA 投递与普通简历的分水岭。

为什么是英文 + build-in-public? AISA 投递面向的是国际化的工程组织,英文写作是默认通道; build-in-public 让招聘方在面试前就能读到你的真实工作节奏与判断质量,等于把作品集前置到筛选环节。

关键纪律是诚实——把「待跑(需 key)」「待建」如实标注,而不是把半成品吹成已完成。 诚信本身就是 AISA 信号:架构师的价值在于可信的判断,注水的 worklog 直接证伪这一点。 一个能坦白「这列 TTFT 还没跑」的人,比一个把占位数字写死的人更可信。

「vibe-coding」不等于无纪律乱写。 它指 Claude Code Daily OS(2026-04)那套人机协作的工程节奏——快速迭代、即时验证、把决策与数字沉淀成可追溯记录。 worklog 是这套节奏的外化产物,纪律恰恰更严:每条主张都要能落到一个 artifact 或一个数字上。

与相邻概念的边界。

  • worklog ≠ 营销博客(后者卖叙事,前者卖证据);
  • ≠ 内部 commit message(后者面向自己 / 团队,前者面向外部招聘方,需自洽可读);
  • ≠ 长文 / papers(papers 是收口的深度综述,worklog 是过程流水,二者互补——本仓 /papers 下可放英文条目)。

2. 推导 / 手算 / 代码走读

本日为「外部发布动作」,非本仓 src 代码走读, 但要走读可嵌入 worklog 的真实数字来源,确保引的每个数都能溯源到一个文件:

  1. A/B 数字来自 scripts/ab-compare.tsagent-evals/ab.json: V4-Pro 89.7% vs V4-Flash 79.3%、Δ+10.3pp、CI[0,20.7]、3W/0L/26T、N=29。 worklog 里引「Δ … [95% CI …]」时直接用脚本打印的 QUOTABLE 行,措辞不走样。
  2. cost/run: V4-Flash $0.0139/run(同模型成本参照),与 completion 79.3% 配成「这个能力档位花多少钱」的单位经济。
  3. TTFT(ms): 源自流式接入 + src/agent/eval/stats.tssummarizeLatency(p50/p95/p99)—— 这一列是 待跑(需 key),worklog 里必须以占位 / 待补标注,不能编一个数填上。
  4. 显著性措辞: 照搬 scripts/ab-compare.ts 第 41 行的判定语义—— CI 跨 0 即 not significant,worklog 写「not-sig@N=29」,不夸大成「显著优于」。

走读结论:可立即写入的真实数字(A/B + 成本)都能溯源到具体文件;TTFT 唯一待补,标注清楚即可。 worklog 的可信度恰恰建立在「每个数都指得出来源」上——读者点开 agent-evals/ab.json 就能复核 79.3% 这个数。

一个实用的自检:写每一句带数字的话之前,问自己「这个数指向哪个文件 / 哪个 commit」。

  • 答得出 → 写进 worklog,并把 artifact 链接挂上。
  • 答不出 → 要么去把它跑出来,要么标成「待补」,绝不凭印象填一个。

这条自检把「过程可见性」从口号落成可操作的纪律:worklog 里不存在「来源不明的数字」。 对 AISA 投递而言,一篇 5 个数全都点得开来源的 worklog,胜过十篇华丽但不可核验的博客。

3. 今日实战

  1. 建公开英文 worklog 仓库(或在本仓 /papers 下新增英文条目),定好带日期的条目格式。
  2. 写第 1 篇,纳入本 block 真实数字表:
    • V4-Flash 79.3% / V4-Pro 89.7%(completion, judge=pass, N=29)
    • Δ +10.3pp,95% CI [0, 20.7]not-sig@N=29
    • cost $0.0139/run(V4-Flash)
    • TTFT (ms):待补(需 key 跑后填入)
  3. 每条主张挂一个可链接 artifact(ab.json / 报告 / Dockerfile / commit)。
  4. 用 build-in-public 口吻写「为什么选 V4-Flash 而非 V4-Pro」——把 +10.3pp 不显著 + 成本差讲成一个真实的工程取舍。
  5. 发布,记录首篇 URL 进作品集索引。

4. 今日实测 / 产出

  • 外部动作——公开 worklog 首篇链接为外部发布动作(建仓 + 发文)。
  • 可立即写入的真实数字已具备(上述 A/B 与成本);TTFT 为 待跑(需 key 跑) 后补入
  • 诚实标注:本笔记不替 worklog 写死 TTFT,也不把「首篇已发布」当成已完成事实——发布是待执行的外部动作。

5. 常见误区 / 陷阱

  1. 无数字的空泛叙事: 评审强制要可链接资产 + eval 数字,纯形容词的 worklog 等于零信号。
  2. 把待跑 / 待建吹成已完成: 诚信底线一旦破,整份作品集可信度归零。TTFT 待补就写待补。
  3. 数字与来源脱钩: 引一个 79.3% 却指不出哪个报告文件,核验者无法复现,等同没引。
  4. 只发不维护日期: agent 领域半衰期 ~6 个月,无日期的 worklog 很快被当过时,时效标注是硬要求。

6. 学习资源(每条带 YYYY-MM)

  • Claude Code 2026 Daily OS 工作流 / vibe-coding 节奏(Anthropic, 2026-04)——本日机理来源。
  • Anthropic「Demystifying evals」(Anthropic, 2026-01)——eval 数字作为可核验信号。
  • build-in-public 实践综述(行业惯例,2025-2026 持续)——公开 worklog 对求职投递的有效性。
  • 本仓 artifact:scripts/ab-compare.tsagent-evals/ab.jsonsrc/agent/eval/stats.ts(2026-06,AICAP-180)。

SOTA检查 (2026-06 更新)

  • Claude Code Daily OS(2026-04)工作流仍当前;公开 worklog / build-in-public 对 AISA 投递有效。
  • 过时黑名单:无数字的空泛叙事(评审强制可链接资产 + eval 数字);把半成品吹成已完成;数字不溯源。
  • 下次复查点:TTFT 跑出后回填 worklog;首篇发布后将 URL 纳入作品集索引并定期复核时效(半衰期 ~6 个月)。

衔接

  • 昨天:Day 78 — 镜像瘦身 <300MB(攒下镜像体积这一项可量化产出)
  • 今天:把 A/B、cost/run、待补 TTFT 写成公开英文 worklog 首篇——AISA 作品集的过程可见性资产
  • 明天:Day 80 — 端到端固化(容器内重跑 29 任务回归,给整个 B8 收口)