返回 AIPROD-90
P1 · Day 1AI 数据产品与知识治理(C9)

为什么 2026 年 AI 系统的主要投资在数据侧

AIPROD-90 的开篇。90 天计划专打 2026-07-01 能力基线审计确认的四个缺口(C9 数据产品 / C7 评测生产闭环 / C5 威胁建模回滚 / C13 defend 叙事),而 P1 的 22 天全部押在 C9——14 个维度里唯一的 2 分。本篇不教任何具体技术,它回答一个立项级问题:。答案立住了,Day 2-22 的每一天才有正当性。

日期: 2026-07-01 阶段: P1 - AI 数据产品与知识治理(Day 1/22) 标签: #data-readiness #ai-ready-data #data-product #opening

今日导引

  • 定位:AIPROD-90 的开篇。90 天计划专打 2026-07-01 能力基线审计确认的四个缺口(C9 数据产品 / C7 评测生产闭环 / C5 威胁建模回滚 / C13 defend 叙事),而 P1 的 22 天全部押在 C9——14 个维度里唯一的 2 分。本篇不教任何具体技术,它回答一个立项级问题:为什么值得把 90 天里最长的一个阶段花在数据上。答案立住了,Day 2-22 的每一天才有正当性。
  • 前置:读过 docs/daily/AIROAD_PROGRESS.md 的 Day 0 基线表(知道 C9 为什么是 2 分);对 AML Copilot 的构成有印象(docs/AML_COPILOT_PRD.mdsrc/aml/generator.ts 的金标数据集、docs/abpa/capstone-aml/README.md 的 capstone 结构)。曾在 AIPA Day 89(docs/aipa/day89-unit-cost.md)见过「把一个数字拆开讲」的方法——今天对「数据侧投资」这个论断做同样的事。
  • 学完能做什么:能在立项评审或面试追问里,用带出处的三层证据(商业数据 / 结构性论证 / 生态并购)论证「2026 年 AI 系统的差异化与失败主因都在数据侧」;能对照两条具体失败链解释「数据侧失败为什么是静默的」;能指出本仓 AML Copilot 在 data readiness 上的三个实测缺口,并说出 P1 哪几天补哪一个。
  • 一句话核心:模型侧已经商品化(一行 API 人人平等),数据侧成了 AI 系统唯一无法外购的部分——所以钱、失败和护城河都搬到了数据侧。

衔接

  • 昨天:Day 0 基线(2026-07-01 证据审计版,见 docs/daily/AIROAD_PROGRESS.md)——14 个维度里 C9 数据产品是唯一的 2 分:readiness pack 有模板无实填、金标数据集无版本化契约、检索层无权限拦截。短板被数字钉死了。
  • 今天:先回答「为什么补这个短板值得 22 天」——用 Gartner 两条商业证据、模型商品化的结构性论证、2025-2026 一整年的并购与标准事件,证明数据侧是当前 AI 系统投资的主战场;再把论证落回 AML Copilot 的三个实测缺口,给出 P1 的 22 天作战地图。
  • 明天:Day 2-3 进入第一件武器——data contracts。精读 ODCS v3.1.0(Linux Foundation Bitol,2025-12),把「数据侧要治理」从口号变成 contract-as-code 的可执行 schema 与 SLA。

核心问题

2023-2024 的 AI 叙事是「选对模型」;2026 年做过生产系统的人都知道,接入一个 frontier 模型只需要一行 API 调用和一张信用卡——你能接,你的竞争对手也能接。那么一个尖锐的问题浮出来:如果模型人人可得,AI 项目之间的差距从哪里来?失败又败在哪里?

本篇用三层证据回答:商业数据说「失败在数据侧」(A 节),结构性论证说「差异化只能在数据侧」(B 节),生态版图说「资本已经照此下注」(C 节)。然后解剖两条具体的失败链(D 节),最后把镜头对准本仓的 AML Copilot——它正是一个「模型侧能跑、数据侧欠债」的活体样本(E 节)。

A. 商业证据:Gartner 的两条压舱石数据

先给两条经本日 WebSearch 核实到 Gartner 官方新闻稿的原始表述,再解释为什么这两条合在一起构成立项弹药。

第一条(失败侧下界):Gartner 2025-02-26 新闻稿《Lack of AI-Ready Data Puts AI Projects at Risk》(2025-02):

"Through 2026, organizations will abandon 60% of AI projects unsupported by AI-ready data."

配套调查(2024 Q3,248 名数据管理负责人):63% 的组织没有、或不确定自己有适配 AI 的数据管理实践。注意精确措辞——不是「60% 的 AI 项目会失败」,而是「没有 AI-ready data 支撑的那部分项目,60% 会被放弃」。条件从句是这条预测的全部力量:它把放弃率归因到一个可控变量上。

第二条(成功侧行为):Gartner 2026-04-16 新闻稿《Gartner Says Organizations with Successful AI Initiatives Invest Up to Four Times More in Data and Analytics Foundations》(2026-04):

自评 AI 成功的组织,在基础层(数据质量、治理、AI-ready 人才与变革管理)上的投入(占营收比)最高达失败组织的 4 倍

配套数据(2025-11~12 调查,353 名 D&A/AI 负责人):只有 39% 的技术负责人相信当前 AI 投资会对财务表现产生正面影响;AI-ready 数据能力成熟度最高的组织,业务成果(营收增长、成本优化)最高高出 65%。

两条合起来读才见分量:第一条是尸检报告(死掉的项目死在哪),第二条是幸存者画像(活下来的组织钱花在哪)——两个独立调查、相隔 14 个月、指向同一个变量。给 CFO 讲数据投资预算时,这就是「不投的代价」与「投的回报」的一对量化锚点。也要诚实标注局限:两条都是调查归因(自评成功 + 相关性),不是受控实验;「up to 4x / up to 65%」是上界措辞,引用时不可抹掉 "up to"。

在评审 gate 里的具体用法(P1 Day 6-7 会做成可打分的 scorecard,这里先给用法轮廓):

  • 立项 gate:任何 AI 用例立项材料必须附 data readiness 评估——否则按 Gartner 口径,它默认落在「60% 放弃」的分母里;
  • 预算答辩:数据基础预算被砍时,用 4x 数据反问「我们打算做成功组织,还是失败组织的投入结构」;
  • 反滥用界限:不可拿这两条为任意数据支出背书——Gartner 的投入项是有清单的(数据质量、治理、AI-ready 人才、变革管理),不含盲目囤数据或为建平台而建平台。

B. 结构性论证:模型商品化之后,失败与差异化都迁移到了数据侧

商业数据只说了「是什么」,结构性论证回答「为什么必然如此」。分两步。

第一步:模型侧为什么商品化了。 2026 年的 frontier 模型市场是一个多寡头价格战市场:能力差距以月为单位收窄,API 形态彼此兼容,切换成本趋近于改一个 base URL。这意味着「我用了 X 模型」不构成任何护城河——它是采购决策,不是工程能力。本仓自己就是证据:AICAP-180 的真实 eval 里换一个模型只是配置项(DeepSeek-V4 Flash/Pro 对比,2026-06),AIPA 参考架构里模型在 gateway 后面是可路由的可替换件。当一个组件人人可得、随时可换,投资它就不产生差异化。

第二步:失败与差异化搬去了哪里。 生产系统的实测口径给出了一致答案——数据供给层:

  • 检索是瓶颈,不是生成。2026-05 的多份生产 RAG 工程指南口径一致:「The failure is almost never in generation... the root cause is usually retrieval——the system fetched the wrong chunks, or none at all」(mudassirkhan.me《Production RAG: Why Retrieval Fails and How to Fix It》,2026-05);naive RAG(chunk→embed→top-k)在真实企业语料上约 40% 的查询检索不到正确上下文(多份 2024-2025 复盘的经验值,ailearningguides 2026-05 汇总)。诚实标注:坊间流传一个「RAG 生产失败 ~73% 在检索环节」的更激进数字,本日追查未能钉到可引用的一手出处,故本篇采用上述更保守的可核实口径——这本身就是 P1 要训练的纪律。
  • 卡住上生产的不是算法,是治理40-60% 的企业 RAG 部署到不了生产,元凶是治理而非检索算法——文档 ownership 缺失、查询时访问控制做不了、PII 处理不过关、freshness 无人负责(TianPan.co《Enterprise RAG Governance》2026-04 及《Permission-Aware Retrieval》2026-05,多方口径一致)。
  • 工程注意力已实测转移。企业采用 hybrid retrieval 的意向在 2026 Q1 单季度从 10.3% 涨到 33.3%(翻三倍,VentureBeat 2026)——组织在用预算承认「瓶颈在检索与数据供给」。

反直觉洞察①(模型升级救不了数据债):直觉是「等下一代模型更强,现在的数据问题会被模型能力掩盖掉」。方向恰好相反:模型越强,它对喂进来的上下文越忠实——喂过期政策,它会用更流畅、更自信的语言复述过期政策。数据债不会被模型能力稀释,只会被更好的表达能力包装得更难发现。这就是为什么 60% 放弃率的预测敢把时间写到 "through 2026":模型在这两年里进步巨大,而放弃率的归因变量根本不在模型侧。

第三步:数据侧为什么反过来不会商品化。 论证要闭合还差一块:如果数据侧工具(向量库、contracts 工具链、context store)同样在商品化,那差异化岂不是也会消失?不会——因为商品化的是工具,不是资产。你的 AML 案件史、类型学标注、政策文档及其权限边界、调查员的处置记录,任何供应商都卖不了给你,也卖不了给你的竞争对手;而把这些资产变成 AI-ready 的过程(定义 owner、写契约、建血缘、下沉权限)深度耦合于你的组织结构与监管义务,无法外包成交钥匙工程。经济学口径:模型是可采购的同质投入品,AI-ready 的领域数据是不可交易的专用性资产——竞争优势只能建立在后者上。这也解释了 C 节将看到的并购方向:厂商收购的全是「帮企业治理自有数据」的能力,而不是数据本身。

C. 生态版图 2025-2026:资本与厂商已经用脚投票

如果 B 节的论证成立,数据基础设施赛道应该出现一轮围绕「AI 数据供给」的重组——过去 12 个月它真实发生了。下表按时间排列六个标志性事件(除 Databricks×Tecton 经本日 WebSearch/WebFetch 一手核实外,其余锚点沿用 docs/AIPROD_90_PLAN.md 第 1 节 2026-07-01 核实的基准资料表),表后解释共同逻辑。

时间事件信号
2025-08Databricks 收购 Tecton(feature store 头部,上一轮估值 $900M)独立 feature store 赛道终结;官方博客(2025-08-22)措辞是「AI agents 的实时数据供给」而非 ML 特征工程
2025-11lakeFS 收购 DVC数据版本化赛道整合,收敛为 lakeFS(+DVC) 与 Iceberg/Nessie catalog 两条主线
2025-12ODCS v3.1.0 发布(Linux Foundation Bitol)data contracts 事实标准落定:relationships、可执行 SLA、严格 schema;datacontract.com 规范并入生态
2026-01标注市场转型 evaluation data ops标注不再是训练前的一次性外包,而是评测闭环的常设生产环节;label quality 即 eval quality
2026-04Gartner 数据治理平台 MQ 转向非结构化数据与 AI 资产分析师口径承认:治理对象从表和列扩展到 embedding、prompt、eval 集
2026-05Redis Iris 发布、Pinecone Nexus——governed context store 品类成型「带治理的上下文供给」成为独立产品品类,不再是向量库的附属功能

六个事件读出同一条主线:数据基础设施正在围绕「给 AI agent 供给受治理的上下文」重组。Tecton 被收购时的官方理由——「Successfully deploying AI agents depends on giving them timely, reliable access to enterprise data」(Databricks 博客,2025-08)——把 feature store 十年积累的实时数据服务能力,整体平移到了 agent 上下文供给这个新战场。feature store、数据版本化、data contracts、标注、治理平台、向量库六个原本独立的赛道,2025-2026 全部朝同一个方向收敛。资本不读论文,但资本会算:模型侧无利可图的差异化,只能到数据侧去买。

对照 Day 0 的诊断,这张表还有一层私人含义:C9 覆盖的正是这六个赛道的能力面——契约(Day 2-5)、readiness(Day 6-9)、标注(Day 10-11)、版本化(Day 12-13)、context store(Day 14-15)、权限与 freshness 治理(Day 16-18)。P1 的课程表就是这张生态版图的镜像。

D. 失败模式解剖:数据侧失败为什么是静默的

商业数据和生态版图都是宏观证据。要真正建立恐惧感(架构师的恐惧感是设计出防御的前提),需要看两条微观失败链——都以 AML Copilot 这样的金融合规 copilot 为场景,因为这正是本仓要防御的。

失败链 1:stale embedding 静默失效 → 引用过期政策 → 合规事故。

监管申报阈值调整(政策文档 v2 发布)
  → 知识库源文档已更新,但 embedding 索引未重建(无 freshness SLA、无内容 owner)
  → 检索层继续返回 v1 政策的 chunk(向量相似度不知道「过期」这个概念)
  → LLM 忠实地引用 v1 阈值起草 SAR 叙述,语言流畅、引用规范、置信十足
  → 调查员信任引用(有出处!)→ 按过期阈值漏报
  → 数月后监管检查发现系统性漏报——事故根因不在模型、不在 prompt,在一条没人负责的重索引管道

这条链的杀伤力在于每一环都不报错:文档更新成功、检索返回 200、生成质量评分正常、引用格式完美。传统监控(latency/uptime/error rate)全绿。唯一能拦住它的是数据侧治理:stale retrieval rate 指标、freshness SLA + 内容 owner、embedding 时间戳可追溯(P1 Day 18 的全部内容,2026-04 实践系列)。

失败链 2:权限后置过滤 → 敏感数据已进上下文 → 泄露不可逆。

检索层用特权服务账号连知识库(图省事的常见做法)
  → 对「查询用户无权看的文档」照常检索、照常进入 top-k
  → 工程师在生成后做「后置过滤」:把答案里引用的越权文档删掉
  → 但敏感内容已经进了 LLM 上下文:它影响了生成的措辞、进了推理 trace、
     进了语义缓存、进了 eval 采样日志
  → 某次缓存命中/日志导出/答案改写,越权信息以「换了说法」的形式流出

后置过滤在 2026 年已被工程共识钉为反模式:授权必须下沉到检索层,在文档进入候选集之前判定(participant-aware 访问控制,arXiv 2509.14608,2025-09;工程共识 2026-05)。这也是 40-60% 企业 RAG 上不了生产的最典型单点原因——权限模型无法在查询时执行,安全团队一票否决。

反直觉洞察②(数据侧失败不产生告警,只产生事故):模型侧失败是吵闹的——超时、限流、拒答,监控立刻看见。数据侧失败是静默的——每个组件都「正常工作」,只是整体在正确地做错误的事。这解释了一个悖论:为什么组织普遍感觉「我们的 AI 跑得挺好」,而 Gartner 测出 60% 放弃率——放弃发生在静默失败积累成信任崩塌之后,而不是某次报错之后。所以数据侧投资买的不是「更好的效果」,是可观测的正确性:契约让 schema 漂移报错(Day 2-5)、freshness SLA 让过期可见(Day 18)、权限下沉让越权在检索层被拒(Day 16-17)、版本化让「哪个数据出的这个结果」可追溯(Day 12-13)。

D+. 组织学补注:数据侧投资的一半是组织工程,这正是 BA 经验的杠杆点

D 节两条失败链有一个共同点值得单独拎出来:根因都不是技术缺失,而是责任缺失——失败链 1 缺的是「这份文档的 freshness 归谁负责」,失败链 2 缺的是「这个权限模型由谁定义、在哪一层执行」。这揭示了数据侧投资的真实构成:一半是管道与索引,另一半是 ownership、SLA、跨团队接口的定义——后者本质上是业务分析与组织设计工作。Gartner 4x 投入(2026-04)的措辞印证这一点:投入项里「AI-ready 人才与变革管理」和「数据质量、治理」并列,成功组织买的不只是工具。

对一个 10 年金融零售 PM+BA 背景的学习者,这是 P1 最该抓住的比较优势:data contract 的本质是把口头的跨团队约定写成可执行的接口文档(BA 做了十年的事,只是产物从 Word 变成 YAML+CI);readiness pack 的本质是立项前的可行性尽调;freshness SLA + owner 的本质是服务水平协议谈判。P1 的技术栈(ODCS/lakeFS/IAA)是新的,但驱动它们的技能是存量。这也是 C9 从 2 分补到 3 分的现实路径:不是从零学一门新学科,而是把既有 BA 方法论翻译到 AI 数据资产上。

E. 落到本仓:AML Copilot 的 data readiness 现状审计

宏观论证如果不能落回自己的系统,就只是别人的故事。对照 Day 0 基线(docs/daily/AIROAD_PROGRESS.md,C9 = 2 分),AML Copilot 的数据侧现状是一个诚实的「模型侧能跑、数据侧欠债」样本:

  • readiness pack 有模板、无实填docs/abpa/templates/07-data-readiness-pack.md 的数据清单、source of truth、质量记分卡、标签风险表全部是空表;docs/abpa/capstone-aml/README.md 把「AML Data Readiness Pack v0.1」列为 W1 待办至今未动。也就是说,这个系统从未回答过「数据能否支撑这个业务决策」这个 pack 开篇就问的问题。
  • 金标数据集确定性但未版本化src/aml/generator.ts 里金标 v1(66 案)与 v1.1(66 + 14 难例 = 80 案)用独立 seed 确定性生成、模块级 memoize——可复现性合格。但它没有快照产物(无 golden_YYYY_MM 版本目录)、没有 ODCS 契约(schema/SLA/owner 全无)、没有血缘记录(eval 结果无法声明「基于金标 vX 测得」)。Day 0 的 29 案真实 eval 数字(79.3%/89.7%)和未来 N≥100 的扩测,审计时都需要「数字↔数据版本」的绑定——现在绑不上。
  • 检索层无权限拦截/agent-platform 的策略引擎在 AIPA D103-104 实装了工具调用的事中拦截(有代码有测试),但拦截面只覆盖工具执行,不覆盖检索——D 节失败链 2 的后置过滤反模式在本仓尚无对应防御。src/aml 下的检索相关代码(evalChecks.ts 等)目前只做质量校验,不做授权判定。

P1 的 5 个 🔨 实战项与这三个缺口严格对位。下表是 22 天的知识地图(依据 docs/AIPROD_90_PLAN.md P1 表),每一行回答「解决上文哪个问题」:

主题解决什么问题
1开篇:数据侧投资论证 🔨 /learn/aiprod 路由骨架立住 P1 的正当性(本篇)+ 笔记可浏览
2-3ODCS v3.1.0 精读与 contract-as-codeschema 漂移静默失败 → 契约让它在 CI 报错
4-5契约对象扩展到 AI 资产(eval 集/embedding/prompt)金标数据集无契约 → AML eval 集的 ODCS 草案
6-7GenAI data readiness scorecard 🔨 readiness pack 实填C9 最大欠债:把 templates/07 对 AML Copilot 填满
8-9非结构化→AI-ready 管线质量工程parsing/chunking 的可测性;retrieval eval 映射为数据质量指标
10-11Labeling ops = eval data ops(IAA κ/α)金标 label 的质量本身如何度量(为 P2 judge-κ 铺路)
12-13数据集版本化 🔨 golden set 扩容 + golden_YYYY_MM 版本化eval 数字与数据版本绑定,审计可追溯
14-15Feature store→governed context store 演进C 节生态版图的技术内核;mini-AgentCore 的 context store 接口
16-17Permission-aware retrieval 🔨 策略引擎拦截扩展到检索层失败链 2 的防御:授权下沉检索层(代码+测试)
18Freshness 治理:stale retrieval rate、SLA + owner失败链 1 的防御:让「过期」可观测
19-20GraphRAG 成本修正选型(LazyGraphRAG 等)检索增强的理性选型,不为图而图
21Synthetic data 治理三角 + MIA/AIA 验证本仓金标是合成数据——「合成即合规」叙事作废后如何自证
22P1 收敛 🔨 permission/freshness eval 出数字入账C9 从 2 分到 3 分的外部可验证证据

注意地图的设计逻辑:Day 2-13 建「数据资产的秩序」(契约→readiness→标注→版本化),Day 14-18 建「数据供给的治理」(context store→权限→freshness),Day 19-21 处理两个特殊议题(图检索选型、合成数据合规),Day 22 用数字收口。每个 🔨 都是对既有资产的增量,不新起项目。

本日实战项的诚实标注:Day 1 的 🔨 是 /learn/aiprod 路由骨架(复用既有 learn track 模式,同 /learn/aipa/learn/aicap),属于内容基建而非本篇论证的一部分;本笔记落库时路由尚未实装,以实际 merge 为准,不在此预报「已上线」。

深读池链接

  • docs/ai-foundations/papers/45-data-lineage-contracts-openlineage-ai-data-quality.md — 血缘与契约的论文级基础(OpenLineage / data quality),Day 2-5 与 Day 12-13 的理论底
  • docs/AI_DATA_PRODUCT_MANAGEMENT_PLAYBOOK.md — 数据产品管理全景 playbook,C9 维度的库内总纲
  • docs/AI_DATA_CONTRACTS_LINEAGE_QUALITY_PLAYBOOK.md — 契约/血缘/质量三件套的操作手册,Day 2-5 直接衔接
  • docs/AI_DATA_LIFECYCLE_GOVERNANCE_PROVENANCE_RETENTION_PLAYBOOK.md — 数据生命周期与留存治理,失败链 1 的治理侧展开
  • docs/AI_RETRIEVAL_EVAL_GRAPH_RAG_PLAYBOOK.md — 检索评测与 GraphRAG,Day 8-9 与 Day 19-20 的配套
  • docs/AI_CONTEXT_ENGINEERING_PLAYBOOK.md — 上下文工程视角(数据侧投资的消费端),Day 14-15 的配套
  • docs/AI_DATA_RESIDENCY_CROSS_BORDER_SOVEREIGN_AI_PLAYBOOK.md — 数据驻留与跨境视角,金融域数据侧投资的合规约束面
  • docs/abpa/templates/07-data-readiness-pack.md — Day 6-7 要实填的模板本体
  • docs/aipa/day89-unit-cost.md — 「一个数字拆到可答辩」的方法论示范,本篇论证方式的体例来源

参考资料

  1. Gartner — Lack of AI-Ready Data Puts AI Projects at Risk(press release,2025-02-26):「Through 2026, organizations will abandon 60% of AI projects unsupported by AI-ready data」;2024 Q3 调查 248 名数据管理负责人,63% 没有或不确定有适配 AI 的数据管理实践(本日 WebSearch 核实原始表述与出处)
  2. Gartner — Organizations with Successful AI Initiatives Invest Up to Four Times More in Data and Analytics Foundations(press release,2026-04-16):成功组织在数据质量/治理/AI-ready 人才/变革管理上投入(占营收比)最高 4 倍;2025-11~12 调查 353 名 D&A/AI 负责人;39% 信心值;最高成熟度组织业务成果高出最高 65%(本日 WebSearch 核实;官网对抓取返回 403,表述经多个二级信源交叉确认)
  3. Databricks — Tecton is Joining Databricks to Power Real-Time Data for Personalized AI Agents(官方博客,2025-08-22,本日 WebFetch 一手核实):「Successfully deploying AI agents depends on giving them timely, reliable access to enterprise data」;Tecton 能力并入 Databricks 工作流与 Agent Bricks
  4. mudassirkhan.me — Production RAG: Why Retrieval Fails and How to Fix It(2026-05,本日 WebFetch 核实):「The failure is almost never in generation」;naive RAG 约 40% 查询检索不到正确上下文;四大检索失败根因
  5. ailearningguides — RAG in Production 2026(2026-05):「retrieval is the bottleneck, not generation」;40% 检索失败率为 2024-2025 多份复盘的经验值
  6. TianPan.co — Enterprise RAG Governance(2026-04)/ Permission-Aware Retrieval(2026-05):40-60% 企业 RAG 部署到不了生产,元凶为治理(ownership/查询时 ACL/PII/freshness);后置过滤为反模式
  7. VentureBeat — The retrieval rebuild: hybrid retrieval intent tripled(2026):企业 hybrid retrieval 采用意向 2026 Q1 从 10.3% 升至 33.3%
  8. arXiv 2509.14608 — participant-aware 访问控制(2025-09):授权下沉检索层的学术基线
  9. docs/AIPROD_90_PLAN.md 第 1 节基准资料表(2026-07-01 核实):lakeFS 收购 DVC(2025-11)、ODCS v3.1.0(2025-12)、Redis Iris/Pinecone Nexus(2026-05)、标注转型 evaluation data ops(2026-01)、Gartner 治理平台 MQ 转向(2026-04)
  10. 本仓物证:docs/daily/AIROAD_PROGRESS.md(Day 0 基线 C9=2,2026-07-01)、src/aml/generator.ts(金标 v1=66 案/v1.1=80 案,确定性生成未版本化)、docs/abpa/templates/07-data-readiness-pack.md(空模板)、docs/abpa/capstone-aml/README.md(W1 readiness pack 待办)

SOTA 检查 (2026-07-01)

  • 主线证据当前均为最新:Gartner 4x 投入(2026-04-16)距今 2.5 个月,是数据基础投资论证的最新官方口径;60% 放弃率(2025-02)虽已 17 个月,但其预测窗口 "through 2026" 恰好覆盖今年,2026-04 新闻稿与之互为印证而非替代——两条同时引用是当前最强组合。Databricks×Tecton(2025-08)、Redis Iris(2026-05)等生态事件无更新的反向信号(未见剥离/下架)。
  • 数字诚信记录:坊间「RAG 生产失败 ~73% 在检索」未能钉到一手出处,本篇弃用,改用可核实的 40%(naive RAG 检索错误率)与 40-60%(治理卡生产)——如后续找到 73% 的一手来源,可回补但需注明口径差异(失败归因占比 vs 检索错误率是两个不同分母)。
  • 快变项:(1) governed context store 品类成型仅 2 个月(2026-05),产品格局可能快速变化,Day 14-15 执行当周须重验 Redis Iris/Pinecone Nexus 的产品状态;(2) Gartner 每年 2-4 月密集发布 D&A 预测,2027 年同期数字会替代本篇两条锚点;(3) ODCS 版本演进(Day 2-3 执行时确认 v3.1.0 是否仍为最新)。
  • 黑名单自查:本篇未把 naive RAG 管道当正例(仅作失败率数据来源)、未引用 datacontract.com 作主线(仅提其并入 ODCS 生态)、未使用「合成即合规」叙事(Day 21 将正面处理 MIA/AIA 验证)。
  • 下次复查点:D22(P1 收敛日)复查本篇全部生态锚点;2026-08-02 EU AI Act Art.50 生效后,D 节合规事故链的监管语境需按生效口径补注。