返回 Papers
AI 扩展计划 / Playbooks

AI Requirements Mining / Process Knowledge Extraction Playbook

Requirements mining 不是把文档丢给大模型生成 backlog,而是把多源业务、流程、控制和生产证据转成可追溯、可评估、可验证、可治理、可复用的 requirement and process knowledge assets。AI 可以扩大证据面、发现冲突、聚类噪声和生成候选资产;人类专家负责解释、取舍、授权、治理和上线责任。

595AI_REQUIREMENTS_MINING_PROCESS_KNOWLEDGE_EXTRACTION_PLAYBOOK.md

AI Requirements Mining / Process Knowledge Extraction Playbook

配对阅读:本手册的原理/架构解读版是 docs/ai-foundations/papers/148-ai-requirements-mining-process-knowledge-extraction-architecture.md。先读 paper 建立机制与取舍,再用本手册落地为模板、RACI 与门禁,两者不需要重复精读。

Requirements mining 不是把文档丢给大模型生成 backlog,而是把多源业务、流程、控制和生产证据转成可追溯、可评估、可验证、可治理、可复用的 requirement and process knowledge assets。AI 可以扩大证据面、发现冲突、聚类噪声和生成候选资产;人类专家负责解释、取舍、授权、治理和上线责任。

在金融零售环境中,PRD、BRD、SOP、政策、工单、会议纪要、通话转写、流程图、API 规格、测试用例、生产日志和控制证据都可能包含需求线索。但这些来源的权威级别、版本、生效日期、权限、隐私、记录保留和业务语义完全不同。高级 requirements mining 的重点,是让系统“广泛挖掘、窄口信任、显式验证、全链路追踪”。


1. Source Anchors

AnchorOfficial link本文使用方式
ISO/IEC/IEEE 29148 Requirements Engineeringhttps://www.iso.org/standard/72089.htmlhttps://standards.ieee.org/ieee/29148/6937/作为需求质量、生命周期、traceability 和 stakeholder need 管理的标准化锚点。
FFIEC Development, Acquisition, and Maintenance IT Handbookhttps://ithandbook.ffiec.gov/it-booklets/development-acquisition-and-maintenance/约束 AI 需求挖掘输出如何进入开发、采购、测试、实施、维护和变更控制。
FFIEC Management IT Handbookhttps://ithandbook.ffiec.gov/it-booklets/management/组织治理、风险管理、架构、资源、第三方和监督责任。
NIST SP 800-160 Vol. 1https://csrc.nist.gov/pubs/sp/800/160/v1/upd2/final把 stakeholder protection needs、security、resilience、assurance 纳入需求抽取和架构评审。
NIST SP 800-218 SSDFhttps://csrc.nist.gov/pubs/sp/800/218/final将代码、API、测试资产挖掘连接到安全软件开发、漏洞响应和 release evidence。
NIST AI Risk Management Frameworkhttps://www.nist.gov/itl/ai-risk-management-framework用 Govern / Map / Measure / Manage 设计 AI 风险识别、评估、门禁和持续改进。
ISO/IEC 42001 AI Management Systemhttps://www.iso.org/standard/81230.html用 AI management system 语言设计 policy、role、operation、performance evaluation、internal audit 和 improvement。

Source-to-artifact pattern:

official source anchor
  -> governance principle
  -> mining requirement
  -> architecture control
  -> evidence artifact
  -> owner and metric

2. Executive Framing

高管或业务方常见诉求通常像这样:

我们有很多 PRD、SOP 和 ticket,能不能让 AI 自动生成需求?
我们想把会议记录和客服通话转成 backlog。
我们能不能让 AI 看代码和测试用例,反推出系统需求?

这些诉求需要被改写为系统能力:

Build an evidence-grade requirements and process knowledge extraction capability
that mines candidate needs, rules, events, controls, acceptance criteria and impact links
from governed artifacts,
filters by source authority and permissions,
routes ambiguity to SMEs,
and learns from production feedback without turning AI drafts into approved requirements.

Steering questions:

  1. 哪些 artifact 是权威来源,哪些只是 pain signal 或 discussion evidence?
  2. AI 输出进入 baseline 前由谁验证、用什么 rubric、保留什么证据?
  3. 如何防止越权检索、过期政策引用、PII 泄露和记录处置失控?
  4. 如何把 mined requirements 连接到 process、API、data、test、control、eval 和 release?
  5. 如何从 production logs、QA、complaints、incidents 和 human overrides 回流到 portfolio learning?

3. Use Case Boundary

Requirements mining 适合产生候选、冲突、证据和影响分析,不适合直接产生批准结论。

Use caseGood fitBoundary
Requirements discovery从多源材料中发现候选需求、冲突、遗漏、重复不自动进入 approved baseline
Process knowledge extraction从 SOP、流程图、logs、tickets 中抽 activity、event、role、handoff、variant不把日志行为直接等同于应然流程
Acceptance criteria drafting根据需求和测试资产生成验收候选高影响场景必须 SME 和 QA 验证
Change impact analysis政策、API、流程、控制变化后找影响面影响结论必须由 owner 确认
Control linkage把 policy、control、test evidence 连接到需求不给法律或合规适用性结论
Portfolio learning沉淀复用词汇、模式、eval cases、anti-patterns不用未授权 records 或 PII 做无边界训练

不适合直接交给 AI 的任务:

TaskReason
最终 scope tradeoff涉及商业优先级、资源、风险接受和战略选择
法律或监管解释需要授权职能结合具体事实和管辖范围判断
高影响客户决策需要授权、控制、解释、申诉和人工责任
records retention 或 legal hold 结论需要 Records、Legal、Compliance 决策
模型验证结论需要独立模型风险和验证程序

4. Target Operating Model

Business / Product Owner
  owns outcome, priority, scope, baseline decision

Requirements Architect
  owns mining taxonomy, ambiguity workflow, quality rubric, traceability graph

Process Owner / SME
  validates process activities, exceptions, variants and operating feasibility

Architecture / Engineering
  validates API, data, system, security, performance and integration impact

Risk / Compliance / Control Owner
  validates policy/control linkage, risk tier, approval boundary and evidence need

Privacy / Records / Legal
  validates data use, records class, hold propagation, access and retention controls

QA / EvalOps
  converts mined requirements to tests, eval contracts, thresholds and regression gates

AI Platform / Data Engineering
  operates ingestion, retrieval, permission filter, graph, model versioning and monitoring

RACI snapshot:

ActivityBusiness ownerRequirements ownerArchitectSMERisk / ControlPrivacy / RecordsQA / EvalOps
Source inventoryARCCCCC
Authority classificationARCCCCC
Extraction rubricCA/RCCCCR
Requirement validationARCRCCC
Risk tieringARCCA/RCC
Eval contractCRCCCCA/R
Release gate evidenceARRCCCR
Portfolio learningARCCCCR

5. Implementation Architecture

Connectors
  Confluence / SharePoint / Docs / Jira / Azure DevOps / Git / API gateway
  Contact center / CRM / case management / log platform / GRC / test management
        |
        v
Governed ingestion
  artifact id | source type | owner | approval status | version | hash
  effective date | data class | record class | permission tag | legal hold flag
        |
        v
Pre-processing
  parsing | OCR/layout | transcript diarization | code/API parsing | test extraction
  log event mapping | PII redaction | chunking | metadata enrichment
        |
        v
Knowledge layer
  domain vocabulary | process ontology | authority ladder | policy/control map
  requirement graph | event graph | system/API graph | test/eval graph
        |
        v
AI extraction and reasoning services
  candidate requirements | ambiguity | conflict | duplicate | process events
  stakeholder concerns | evidence standards | acceptance criteria | impact links
        |
        v
Human validation workbench
  side-by-side source evidence | approve/reject/merge/split/escalate
  reason codes | SME comments | decision record | audit trail
        |
        v
Delivery and governance
  backlog sync | requirement baseline | eval contract | test generation
  architecture review | control evidence | release gate | learning loop

Architecture non-negotiables:

Non-negotiableWhy
权限先于检索防止用户通过 AI 摘要看到无权材料
artifact hash and version支持复现、审计和变更影响
authority metadata防止 ticket、会议纪要和 AI draft 覆盖正式政策
structured output schema防止顺滑文本掩盖冲突和不确定性
SME decision logAI 只生成候选,人负责授权
eval contract需求挖掘能力本身也要被评估和门禁
graph traceability支持跨需求、流程、系统、测试、控制、release 的 impact analysis

6. Source Intake and Authority

No artifact enters the mining corpus without owner, version, permission tag and source class. No restricted source enters AI processing without approved purpose and redaction path.

SourceRequired metadataExtraction focusKey risk
PRDowner、version、status、target release、approvalfeature、persona、metric、scope、assumptionsolution bias
BRDbusiness owner、benefit baseline、decision dateoutcome、stakeholder need、policy constraintvague benefit
SOPprocess owner、effective date、retired statusactivity、role、SLA、exception、evidencestale process
Policy/controlpolicy owner、effective date、scope、control idobligation、allowed/prohibited action、approvalmisinterpretation
Ticketsseverity、product、status、linked incident、resolutionpain、defect、workaround、frequencyduplicate noise
Work itemsworkflow status、links、sprint/release、acceptance criteriabacklog、dependency、test/release linksweak traceability
Transcriptsconsent/notice、channel、QA score、redactionintent、friction、agent action、complaint signalPII and transcription error
Meeting notesattendees、roles、decision status、follow-updecision、assumption、open issuenon-authoritative
Process mapsversion、notation、owner、scopeintended flow、roles、controls、SLAidealized flow
Code/API specsrepo/version、endpoint、owner、deploymentactual behavior、contract、validation、errorcode as false policy
Test casestest owner、result、requirement link、coverageexpected behavior、edge case、regressionhappy-path bias
Logsevent schema、retention、sampling、data classvariant、latency、failure、handoff、outcomemissing business semantics
Controlscontrol owner、frequency、test result、issue linkcontrol objective、evidence、remediationcontrol/product disconnect

Authority decision rules:

ConditionDecision
Approved source, current version, clear owner, permission scopedUse for extraction and baseline evidence
Approved source but expired or supersededUse only for historical change impact
Operational source with high frequency pain signalUse for discovery, not baseline
Meeting note with unapproved decisionUse as clarification prompt and decision candidate
Artifact contains restricted data beyond purposeExclude or redact before indexing
Source owner unknownQuarantine until ownership is established

7. Candidate Movement Rules

AI output moves through governed states. It is never approved by generation alone.

Requirement candidate conditionBacklog action
Grounded, no conflict, quality score >= 4, SME approvedCreate backlog item with source links
Grounded but ambiguousCreate clarification task, not delivery story
Conflict between policy and operational practiceCreate issue or decision item, not feature story
High-impact AI behavior without eval contractBlock from release backlog
Source is only ticket or transcriptConvert to problem statement or pain cluster
Derived from code or test onlyMark as actual behavior candidate and request owner decision

Human review level:

Risk tierExampleReview requirement
Lowinternal UI label, non-material routing hintrequirements review and sampling
Mediumemployee workflow recommendation, non-customer-impact fieldSME approval and QA test
Highcustomer money, access, eligibility, complaint, regulated communicationproduct, risk/control, SME and QA approval
Restrictedlegal hold, sensitive identity, fraud, vulnerability, privileged tool actionspecialized owner review and documented gate

8. Extraction Prompt Contract

Extraction prompts are controlled product artifacts. They must say what to extract, what not to infer, how to expose uncertainty and how to preserve source authority.

Required output schema:

{
  "candidate_id": "string",
  "candidate_type": "business_requirement | stakeholder_requirement | solution_requirement | transition_requirement | control_requirement | data_requirement | process_rule | acceptance_criterion | risk_issue",
  "statement": "string",
  "source_refs": [
    {
      "artifact_id": "string",
      "location": "section/page/span/event_id",
      "authority_level": "A1|A2|A3|A4|A5|A6",
      "effective_date": "YYYY-MM-DD"
    }
  ],
  "known_facts": ["string"],
  "unknowns": ["string"],
  "ambiguity_flags": ["actor_unknown", "decision_boundary_unknown", "data_scope_unknown", "control_owner_missing"],
  "conflicts": ["string"],
  "quality_score": 0,
  "recommended_acceptance_criteria": ["string"],
  "validation_owner": "role",
  "risk_tier": "low|medium|high|restricted"
}

Prompt rules:

RuleRationale
Do not invent missing business rules缺证据必须标 unknown
Preserve source authority不同来源不能被平均化
Separate current behavior from desired behavior代码和日志代表事实,不代表应然
Produce questions, not false certainty模糊需求需要澄清
Cite exact source spans支持 SME 快速验证
Flag policy/control conflicts冲突发现是高价值输出
Avoid customer commitmentsmined output 不能成为客户可见承诺

9. Requirement Quality Gate

GatePass signal
Source grounded每个 statement 有 artifact、location、version、owner
Authority clearsource level and conflict policy visible
Actor clearcustomer、employee、system、team、approver 不混淆
Decision boundary clearread / summarize / recommend / draft / decide / act 已区分
Data boundary clearsource fields、purpose、permission、retention 已定义
Control linkage clearapproval、dual control、review、audit evidence 已连接
Acceptance testablepositive、negative、edge case 和 evidence requirement 已写
Eval readydataset、rubric、threshold、critical failure、slice 已定义
Change impact traceableprocess、API、test、control、release links 存在
Owner accountablebusiness owner、SME、architect、QA/EvalOps owner 清楚

Scoring interpretation:

ScoreMeaningAllowed action
0wrong or unsupportedreject and log reason
1discovery notekeep in evidence cluster
2grounded but incompletesend to clarification
3clear but not testable/control-linkedimprove before backlog
4backlog-ready candidatecreate item with source links
5baseline-ready for high-impact userelease gate eligible after eval

10. Traceability Graph

Graph structure turns mined text into impact analysis capability.

LayerNodesEdges
Strategyoutcome、KPI、benefit hypothesis、risk appetitejustifies、constrains
Stakeholderrole、need、concern、decision rightowns、approves、challenges
Requirementcandidate、baseline、acceptance criteriaderives_from、verifies
Processactivity、event、variant、handoff、exceptionprecedes、deviates_from、controls
SystemAPI、data object、service、UI、code ruleimplements、depends_on
Qualitytest case、eval case、rubric、thresholdverifies、blocks
Controlpolicy、control objective、evidence、issueconstrains、monitors
Deliverybacklog、release、change request、incidentdelivers、remediates

Minimum graph queries:

QueryWhy it matters
Show all requirements derived from retired SOP sections防止过期来源继续驱动 backlog
Show requirements without acceptance criteria找不可验收需求
Show high-risk requirements without eval contract找上线阻断项
Show policy changes impacting AI prompts or retrieval corpus防止过期政策输出
Show API schema changes impacting controls and tests支持 release impact review
Show tickets repeatedly linked to rejected requirements识别真实 pain 但方案不对
Show production variants not covered by SOP识别流程治理机会

11. Process Variant Discovery

生产日志揭示 work-as-done,但需要业务语义化才能成为流程知识。

Input pattern:

case_id, activity, timestamp, resource, lifecycle, channel, product,
risk_tier, amount_band, status, outcome, source_system

Steps:

  1. 定义 case 粒度:application、dispute、alert、ticket、complaint、service request。
  2. 标准化 activity:避免把状态码直接当业务活动。
  3. 生成 top variants:找覆盖 80% 体量的主要路径和高风险长尾。
  4. 标记 rework、waiting、handoff、skip、loop、override。
  5. 与 SOP、process map 和 control path 对齐,区分 acceptable exception、control gap、data noise。
  6. 生成 AI opportunity candidates:summarize、route、draft、validate、retrieve、recommend、tool action。
  7. 将每个机会连接到 requirement、acceptance criteria、control 和 eval。

Variant interpretation:

FindingProduct implicationControl implication
主路径覆盖低不宜直接自动化,先治理流程和 taxonomy例外处理和控制路径需补齐
高 rework改进资料收集、校验、政策解释监控返工原因和 customer harm
多团队 handoffAI handoff summary 或队列路由责任和 evidence transfer 要清楚
控制步骤被跳过阻断上线,先修复流程或权限control issue and remediation
高等待来自外部资料客户、第三方提醒和 SLA 管理记录通知和暂停计时逻辑
override 集中在某团队policy ambiguity 或 training gapdual control / QA sampling

12. Eval Contract for the Mining System

Mining system 本身也必须被评估。否则组织会把未经验证的抽取系统当成事实来源。

Eval areaMetricRelease threshold idea
Requirement extraction precisionAI candidates accepted as valid by SMEhigh enough by source class, no critical false positives
Critical recallmust-have policy/control/exception requirements foundzero missed critical control in golden set
Groundednessstatements fully supported by source refsunsupported material claim = release blocker
Authority classificationsource authority correctly rankedno low-authority source overriding approved source
Ambiguity detectionrequired clarifications correctly flaggedhigh-risk ambiguity miss = blocker
Conflict detectionknown conflicts identifiedpolicy/SOP/log conflict misses reviewed
Permission safetyno unauthorized source leakagezero leakage in red-team tests
Output schema validitymachine-readable structured outputnear-perfect schema compliance
SME efficiencyreview time per candidateimproves without lowering quality
Change impact qualityimpacted systems/tests/controls foundvalidated against known changes

Critical failures:

Critical failureWhy it blocks release
hallucinated source citation破坏证据链
unauthorized PII or restricted source in output权限和隐私不可接受
policy/control requirement missed in high-impact workflow可能造成控制缺口
low-authority source treated as approved baseline需求基线被污染
AI-generated customer commitment候选资产越界为外部承诺
hidden conflict between source materials冲突被平滑掩盖
output enters backlog without validation evidence治理边界失效

13. Evidence and Control Checklist

Pre-launch

Control areaEvidence
Source governanceinventory、owner、version、permission、retention、record class
Data protectionprivacy review where applicable、redaction rules、access matrix
Recordsrecord class、legal hold propagation、derived artifact retention
Securityconnector entitlement、secrets handling、audit logging、vendor boundary
Model governancemodel card、prompt version、eval results、limitations
EvalOpsgolden set、rubric、thresholds、critical failures、independent review
SME operationsreviewer guide、decision codes、escalation path
Traceabilitygraph schema、source-to-requirement links、impact queries
Releasego/no-go memo、exceptions、risk acceptance record

Production

Control areaEvidence
Usage monitoringwho mined what、source classes、exports、backlog sync
Quality monitoringacceptance rate、reject reasons、ambiguity density、conflict misses
Permission monitoringdenied retrievals、redaction events、suspicious access
Drift monitoringsource freshness、vocabulary drift、new ticket clusters
Change monitoringpolicy/API/SOP/model/prompt changes and regression eval
Incident handlingleakage、hallucination、wrong baseline、control miss、remediation
Portfolio learningreusable patterns、updated rubrics、added eval cases

14. 30 / 60 / 90 Roadmap

First 30 days: controlled discovery

WorkstreamOutput
Select domainone workflow, e.g., payment dispute, KYC onboarding, fee servicing, AML alert triage
Inventory sourcesPRD/BRD/SOP/policy/tickets/transcripts/process maps/tests/logs/control evidence
Define authority laddersource classes, approval status, conflict rules
Define vocabularykey terms, role names, activity taxonomy, forbidden ambiguous terms
Build small corpuspermission-filtered, redacted, versioned artifact set
Design rubricquality score, ambiguity flags, conflict categories
Create golden setSME-labeled requirements, controls, events, conflicts
Run pilot extractioncandidates, source refs, ambiguity questions, initial graph

Exit criteria:

The team can show source-backed candidates, rejected examples, ambiguity log,
and at least one requirement-to-test-to-control trace for the selected workflow.

Days 31-60: graph, eval and SME workflow

WorkstreamOutput
Traceability graphoutcome -> requirement -> process -> API/data -> test -> control
SME workbenchapprove/reject/merge/split/escalate with reason codes
Eval contractdataset, rubric, slices, thresholds, critical failures
Process mining linktop variants, rework, handoff, waiting, control gap
Backlog integrationonly approved candidates sync to delivery system
Change impact queriespolicy/API/SOP/test changes show impacted assets
Control packpermission audit, evidence pack, release gate memo

Exit criteria:

The mining system can pass golden-set eval, route ambiguous outputs to SMEs,
and create backlog items only with source refs, quality score and validation evidence.

Days 61-90: production pilot and portfolio learning

WorkstreamOutput
Production pilotlimited users, limited corpus, high audit logging
Monitoringquality, permission, source freshness, SME decisions, backlog conversion
Regression evaltriggered by policy/SOP/API/model/prompt/corpus changes
Incident drillhallucinated source, permission leak, wrong baseline, missed control
Portfolio pattern libraryreusable requirement patterns, acceptance criteria, eval cases
Operating modelRACI, governance cadence, funding and scaling decision
Executive reviewvalue evidence, risk issues, expansion roadmap

Exit criteria:

The organization can demonstrate faster discovery, better traceability,
measurable SME productivity, controlled risk, and reusable portfolio assets.

15. Metrics

MetricMeaning
discovery cycle time reduction从 source intake 到 validated candidate 的时间
validated candidate yield每 100 个 artifact 产生的高质量需求数
duplicate reduction合并重复 ticket、story、requirement 的比例
clarification throughputambiguity 从发现到关闭的时间
backlog quality liftapproved story 的 source refs、acceptance criteria、test link 完整度提升
change impact lead time变更影响分析时间
reuse ratepattern、acceptance criteria、eval case、vocabulary 的复用比例
unsupported claim rateAI 输出无来源支持的比例
wrong authority rate权威等级识别错误或低权威覆盖高权威
critical recall miss漏掉高影响政策、控制或例外
permission leakage rate未授权信息在输出中出现
ambiguity miss rate人工发现但 AI 未标注的关键模糊点
conflict miss rate已知冲突未识别
SME disagreement rateSME 对输出解释不一致
production feedback incorporationincident、QA、ticket 回流 eval 的速度

16. Anti-Patterns and Repairs

Anti-patternSymptomRepair
“AI 生成 user story 工厂”backlog 变多,质量更差强制 source_refs、quality score、SME approval
“一个向量库装所有文档”权限、版本、记录边界失控source registry + retrieval-time ACL + corpus partition
“只看文档不看日志”自动化理想流程,忽略真实变体connect event logs and process mining
“只看 ticket 排优先级”高频噪声盖过高风险需求severity、journey、control、value weighted scoring
“让 AI 消除冲突”输出顺滑但错误show conflicts and route to owner
“代码就是需求”历史缺陷被产品化actual behavior vs desired requirement 分离
“eval 只测摘要质量”需求挖掘错误进 backlogtest extraction, authority, conflict, permission and impact
“SME review 无结构”审过但不可复用reason codes and decision log
“不治理 derived artifacts”summary、embedding、graph node 记录风险records/privacy controls for all derived artifacts
“pilot 后不学习”每个团队重复踩坑portfolio pattern library and eval expansion

17. Evidence Artifact Structures

Requirements mining 产物应当以证据字段表达,而不是以可填写表单堆砌。下面三个结构用于约束 intake、candidate review 和 change impact 的最低证据粒度。

17.1 Mining Intake Brief

Field groupEvidence contentQuality bar
Workflow and ownershipworkflow、business owner、process owner、primary outcome能说明为什么选择这个流程,以及谁对结果负责
Risk and source scoperisk tier、source classes included、source classes excluded能解释哪些材料进入语料,哪些因权限、记录或质量原因排除
Governance boundarypermission model、record classes、SME reviewers能证明检索、抽取和人工验证在授权边界内
Evaluation boundaryquality rubric、eval dataset、release decision owner能证明 mining system 本身被评估,输出不会自动进入 baseline

17.2 Requirement Candidate Review Card

Field groupEvidence contentQuality bar
Candidate statementstatement、candidate type、risk tier表达应可测试、可追溯,不混合多个需求
Source groundingsource refs、authority level、effective date每个 material claim 都能定位到来源和版本
Uncertaintyknown facts、unknowns、ambiguity flags、conflicts不把缺失信息包装成确定结论
Traceabilitylinked process activity、API/data/test/control候选需求能连接到流程、系统、测试和控制
Review decisionreview decision、reason code、owner人工验证决定可审计,并能进入后续改进

17.3 Change Impact Memo

Field groupEvidence contentQuality bar
Change identitychanged artifact、change type、effective date说明变化对象、变化性质和生效时间
Impact surfaceimpacted requirements、workflows、APIs、data objects不只列需求,也列系统和流程影响
Assurance impactimpacted tests、evals、controls、records说明哪些验证、控制和记录需要更新
Decision pathrequired approvals、release implication、monitoring update明确是否需要 release gate、回归评估或生产监控调整

18. Decision Narrative

Requirements mining 的端到端架构从 governed ingestion 开始,对 PRD、SOP、policy、tickets、transcripts、work items、code/API、tests、logs 和 controls 做 source inventory、authority classification、permission filtering 和 versioning。系统用 domain vocabulary 和 process ontology 做结构化抽取,生成 requirement candidate、process event、stakeholder concern、control link、acceptance criteria 和 impact links。所有输出进入 traceability graph,经 quality rubric、eval contract 和 SME validation 后,才进入 backlog 或 baseline。

它不是普通 RAG summarization。RAG 总结回答“这些材料说了什么”,requirements mining 要回答“哪些内容可以成为需求、依据是什么、权威级别如何、哪里冲突、哪里模糊、谁验证、怎么测试、影响哪些系统和控制、上线后怎么监控”。核心资产不是摘要,而是 source-backed graph、quality score、eval contract、SME decision log 和 change impact evidence。

低权威来源应作为 discovery signal,而不是 baseline。通话转写可能错,客户表达可能是情绪或投诉,会议纪要可能不是批准决定,ticket 可能是重复噪声。进入 baseline 需要更高权威来源或 owner 追认。

冲突图是高价值发现。政策和控制是约束,SOP 是 intended process,生产日志是真实行为。系统不应让 AI 平滑合并冲突,因为冲突本身可能代表流程绕行、控制缺口、SOP 过期、系统缺陷或政策解释不清。

生产日志揭示 work-as-done。文档挖掘告诉我们设计意图,日志挖掘告诉我们真实行为。两者结合,才能决定该做 AI assistant、流程重构、数据质量改进、API 集成,还是控制修复。

隐私、records 和权限必须先于检索。raw artifacts、chunks、embeddings、summaries、review notes 和 graph nodes 都可能成为 derived artifacts,必须有 retention、legal hold propagation、purpose limitation 和 audit log。

核心原则:

Mine broadly, trust narrowly, validate explicitly, trace everything,
and let production evidence improve the operating knowledge base.