返回 M01~M90 教材库
M88 · 预习教材教材已备 ≠ 学习已完成

M88:新场景迁移与模型选择分析

场景迁移是把同一套任务定义、数据边界、baseline、错误成本和证据原则应用到新问题,再比较规则、传统 ML、小模型与 LLM 的合适角色。

2026-11-19scenario-transfermodel-selectionrulestraditional-mlsmall-modelllm

内容类型:预习教材(不代表已完成)
日期:2026-11-19
阶段:P1 · AI Model Engineering 90 · 知识整合
周次:整合周(M85~M90)
节奏:周四案例迁移
状态:教材已备;学习未完成
标签scenario-transfer model-selection rules traditional-ml small-model llm

一句话定义

场景迁移是把同一套任务定义、数据边界、baseline、错误成本和证据原则应用到新问题,再比较规则、传统 ML、小模型与 LLM 的合适角色。

学习目标

  1. 选择一个此前未在 Lab 中使用的金融、Web3 或文档场景。
  2. 不写代码,也能完成一页模型选择分析。
  3. 把方法角色与输入结构、标签、延迟和可验证性对齐。
  4. 识别哪些知识能迁移,哪些需要新数据才能判断。

核心知识

1. 迁移的不是结论,而是问题框架

从支付争议迁移到链上钱包风险,不能直接沿用阈值和性能;可迁移的是:先定义预测时点、保留证据来源、做时间/实体切分、设置 baseline、允许拒答。新场景的标签质量、基准率、图结构与错误成本都不同,需要重新验证。

2. 四类方法的角色比较

规则表达确定约束、政策和守恒关系;传统 ML处理结构化特征、校准分数和低延迟分类/排序;小模型处理图、序列、图像或非线性结构;LLM处理开放文本、交互、摘要与工具编排。它们可以分层组合,不必选唯一赢家。

3. 场景选择的关键维度

  • 输入:表格、图、序列、图像、文本或混合。
  • 真值:是否可靠、何时成熟、是否受历史决策偏差影响。
  • 动作:自动决定、排序、建议、抽取或摘要。
  • 错误成本:误放、误拒、错误金额、错误主体关联。
  • 运行:延迟、吞吐、内存、网络、隐私。
  • 证据:能否用规则、数据库、执行器或原文验证。

4. 新场景中的 OOD 与治理

新协议、新文档模板、新语言或制度变化会造成分布偏移。模型选择分析应预先定义 OOD 检测/路由和人工责任。尤其不能让 LLM 在证据不可验证时以流畅度填补未知。

机制与推导

一页分析可按“任务→数据→baseline→候选→验证→决定”展开。先问最简单方法能否满足,再问结构模型的增量来自哪里,最后决定 LLM 是主导、辅助还是不进入。

示例问题可以是“把合成智能合约审计发现按复核优先级排序”:规则检查严重度和可复现测试;传统 ML 根据结构化特征排序;代码模型/LLM 摘要发现并建议检查点;真实漏洞结论仍由测试、代码证据和人工审核决定。这里只是分析结构,不预设实际效果。

最小练习或观察步骤

  1. 选一个未用于 W12 Lab 的新场景。
  2. 写五元任务定义与两项非目标。
  3. 画数据结构、真值时间和正确切分。
  4. 为四类方法写“适合步骤 / 不适合步骤 / 验证方式”。
  5. 选择总体架构与最小 baseline。
  6. 写出 OOD、拒答、人工与证据保留策略。
  7. 最后列出三项必须有数据后才能回答的问题。

常见误区

  • 将旧场景阈值和性能直接复制到新场景。
  • 为了用 LLM 把结构化数值任务改写成文本任务。
  • 把公开链上数据等同于可靠身份标签。
  • 忽略标签成熟和历史决策选择偏差。
  • 一页分析写成技术清单,没有动作与成本。
  • 在没有数据时宣布某模型一定最佳。

金融、Web3 与文档场景连接

可选场景包括:贷款材料异常路由、商户交易序列预警、治理提案证据摘要、智能合约发现排序、多语言合同字段抽取。任何场景都需避免法律/合规越权:模型提供结构化证据和辅助判断,责任主体与最终决定必须明确。

自检问题

  1. 迁移时哪些框架可复用,哪些结论不可复制?
  2. 四类方法各放在哪个步骤,为什么?
  3. 真值在何时成熟,切分如何模拟部署?
  4. 哪些输出可被确定性验证?
  5. 哪三项问题必须等数据后再回答?

专业课程对齐

  • Stanford CS229:回看任务假设、泛化、模型选择和分布差异,用于判断新场景是否仍满足原方法的输入、标签与损失条件。
  • Stanford CS329S:回看数据变化、部署约束、监控与人的参与,帮助把“迁移”改写为新的数据—模型—决定系统。
  • Full Stack Deep Learning:回看端到端项目路线与模型/数据迭代,用于比较规则、经典 ML、小模型与 LLM 的整体代价。

深入学习提示

先用 CS229 复核新场景的样本单位、标签机制、损失和泛化假设,再用 CS329S 补预测时点、数据可用性、人工流程与漂移,最后按 FSDL 形成方法选择表。迁移一个陌生场景时,不复用旧结论,只复用问题框架:数据量与质量、结构/序列/图/多模态信息、容错成本、延迟资源、解释审计、分布外输入和回退路径。为规则、经典 ML、小神经/图/序列模型、LLM 各写“主导 / 辅助 / 不进入”及条件,并设计一条最小 baseline。若用金融经验迁移到 Web3 或文档场景,特别检查身份单位、时间窗口和标签成熟方式是否改变。今天的目标是整合并展示可迁移的判断过程,不训练全套模型、不做排行榜;不确定项进入后续阅读清单。

选择表还应保留复查日期,提醒自己结论会随数据与约束变化。

学后填写区

  • 新场景与任务定义:
  • 四类方法角色表:
  • 总体架构与 baseline:
  • OOD、拒答、人工与证据策略:
  • 数据到位前不能回答的问题:
学完后,请把自己的理解、练习结果和仍不确定的问题写入文末“学后填写区”,再到唯一进度账本更新状态。预先阅读后续教材不会自动增加完成数。