返回 AICAP-180
B13 · Day 129FATF typologies + BSA grader + 用户研究

M6 用户研究——半结构化访谈脚本

Day 128 搭好了问卷(survey),它长于广度——规模化、可量化,但短于深度:自陈数据挖不出受访者自己都没意识到的痛点。今天补上 M6 用户研究的另一半——半结构化访谈(semi-structured interview),它用一个固定大纲保证可比性,又留出开放追问的空间挖深度洞察。这是定性研究方法学的核心一档:问卷告诉你「多少人觉得慢」,访谈告诉你「为什么慢、慢在哪个环节、他怎么绕过去」

阶段: B13 · FATF typologies + BSA grader + 用户研究(Day 121-130) 标签: #user-research #semi-structured-interview #funnel-technique #informed-consent

今日导引(由浅入深)

Day 128 搭好了问卷(survey),它长于广度——规模化、可量化,但短于深度:自陈数据挖不出受访者自己都没意识到的痛点。今天补上 M6 用户研究的另一半——半结构化访谈(semi-structured interview),它用一个固定大纲保证可比性,又留出开放追问的空间挖深度洞察。这是定性研究方法学的核心一档:问卷告诉你「多少人觉得慢」,访谈告诉你「为什么慢、慢在哪个环节、他怎么绕过去」。

为什么紧接昨天、通向明天:Day 128 的问卷拿到的是「方向 + 规模」,但它挖不出受访者自己都没意识到的痛点;今天的访谈正好补这块深度,二者加 eval / 行为数据三角验证,构成 Day 130 收口报告里「用户研究工具就绪」的那一栏。今天的最小可判定产出:一份 6 题访谈脚本(漏斗结构 + 每题 probe + consent 开场白)+ 一份自访谈 transcript(验证脚本流畅度与时长)。

1. 机理精读

三种访谈形式的光谱。 把访谈想象成一条从「全控」到「全放」的光谱:

形式结构长处短处
完全结构化逐字念稿、固定选项高可比、可量化挖不出未预期洞察
半结构化固定大纲 + 临场追问兼顾可比与深度依赖访谈员技巧
完全开放自由叙述最大化意外发现难比较、易跑题

半结构化 = 固定大纲 + 灵活追问。 它用一组核心问题保证每个受访者都覆盖到同样的主题(可比性),但允许访谈员根据回答临场追问(probe)。这是用户研究里挖深度洞察的主力形式——既不丢失结构,又不堵死意外发现,所以本日选它。代价是它对访谈员要求高:要能一边守大纲、一边判断哪里值得追问,这正是为什么要先写脚本 + 自访谈练手。

漏斗法(funnel technique):从宽到窄。 访谈的提问顺序至关重要,三段式:

  1. 宽口起步:从宽泛的开放题切入(「能讲讲你平时一天的 AML 调查流程吗?」),让受访者自由叙述,先建立自然语境、让他放松。这一段几乎不打断,只用回声 / 沉默 probe 鼓励展开。
  2. 逐步收窄:随叙述展开,逐步追问到具体环节(「刚才提到证据汇集很花时间,具体卡在哪一步?」)。这一段是挖洞察的主战场,开放 probe 密集。
  3. 末端验假设关键纪律——别在开头就抛出你的假设(「你是不是觉得 SAR 草稿最费时?」),那会污染回答:受访者会顺着你的假设走,你听到的是自己的回声而非真实洞察。假设要留到漏斗末端、受访者已自然提到相关主题时再验证。

为什么这个顺序不能反:如果一上来就问窄问题,你已经替受访者框定了「重要的是什么」,他后面所有回答都会被这个框架带偏,真正的痛点(你没预设的那个)永远不会浮现。宽口起步的本质是先听他的世界,再验你的假设

开放式 probe vs 封闭式 probe。 追问分两种:开放式(「能多讲讲吗?」「那时候你是怎么想的?」)和封闭式(「是 A 还是 B?」)。开放式 probe 更能挖出未预期洞察——它把控制权交还给受访者,让他往你没预设的方向展开;封闭式 probe 把答案框死在你给的选项里,只适合最后确认事实。漏斗的中段应以开放 probe 为主。常用的开放 probe 工具箱:

  • 沉默 probe:受访者答完后停顿 2-3 秒不接话,往往能引出他原本没打算说的补充。
  • 回声 probe:重复对方最后几个词(「……拼到一起?」)促其展开,不引入新信息。
  • 具象化 probe:「能举个上周的具体例子吗?」把抽象抱怨拉回到可核实的事件。
  • 「然后呢」probe:顺着叙述往下推,还原完整流程。

要刻意避免的是引导式 probe(「所以你觉得它没用,对吧?」)——那不是追问,是替对方下结论。

知情同意(recording consent)是硬前置。 录音前必须取得明确的知情同意,consent 开场白至少覆盖五要素:

  1. 目的:为什么访谈、研究用途。
  2. 录音告知:明确说会录音,并征得同意。
  3. 用途与存储:录音怎么用、存哪、谁能看、保留多久。
  4. 退出权:可随时暂停或终止,不影响任何权益。
  5. 匿名 / 保密:结果如何脱敏。

这不是形式——它是研究伦理的底线,也直接影响受访者的坦诚度(知道被录音且信任用途,才会说真话)。consent 开场白要写进脚本,作为固定第一步;在地区法规(如 GDPR / 各地录音同意法)下,口头同意最好也留痕。AML / 合规领域受访者对「被记录」尤其敏感,consent 处理得专业能显著提升坦诚度。

饱和度(saturation):访谈做到多少够。 质性访谈不追求统计代表性,而追求主题饱和——当新增受访者不再带来新主题时,可以停。经验上 6-8 个深访能覆盖大部分主流痛点,但这取决于人群同质性:人群越杂,达到饱和需要的访谈越多。本日只做脚本 + 1 次自访谈,真实饱和判断要等外部受访(待用户)。

为什么访谈与问卷必须配对(三角验证)。 访谈给深度但牺牲了样本量与可量化性:6-8 个深访得到的是丰富的质性数据,不能直接外推到总体。所以它与 Day 128 问卷(广度、可量化)+ 行为 / 链上数据(实际行为)做三角验证:问卷给方向与规模,访谈给「为什么」与机制,行为数据给「实际上做了什么」。三者互补,单用任何一个都有盲区。一个典型用法:问卷发现「60% 的人觉得 SAR 草稿环节慢」,访谈去挖「慢在哪、怎么绕」,行为数据验证「实际在该环节停留时长」——三者对上,结论才可信。

transcript 编码(coding)与一致性。 访谈后要把 transcript 编码成主题(themes),这一步天然主观。降偏手段:(1) 双人独立编码再比对,(2) 工具 / LLM 辅助初编 + 人工核,(3) 用编码者间一致性(inter-coder reliability)量化——可直接借 Day 125-126 的 Cohen's κ 思路,把两个编码者对每段的标签当两个 rater 算 κ。本日只做自访谈,编码一致性留到外部受访(待用户)。

与相邻概念的边界。 半结构化访谈 ≠ 焦点小组(focus group,多人易受群体压力、附和效应)≠ 可用性测试(usability test,观察操作而非问态度)≠ 问卷(quantitative,广度优先)。本日做的是一对一、聚焦态度与流程理解的访谈;它与昨天的问卷是「深度 vs 广度」的互补对,不是替代关系。

2. 推导 / 手算 / 代码走读

今天是文档/方法日,无 src 代码走读(产出是访谈脚本 + transcript,文档类)。给一个漏斗式脚本的最小骨架推演,作为方法演示(6 题 + probe):

  • 第 0 步 · consent 开场白:自我介绍 + 研究目的 + 「本次访谈将录音,仅用于产品改进、不对外、你可随时暂停或退出,是否同意?」(取得明确口头同意后再开始)。
  • Q1(漏斗宽口·开放):「能带我走一遍你最近一次完整的 AML 调查吗?从接到 alert 到提交结论。」
    • probe(开放):「哪一步让你觉得最耗时间?」
  • Q2(仍偏宽):「在这个流程里,你最依赖哪些工具/信息源?」
    • probe:「有没有哪一步你觉得本可以自动化?」
  • Q3(开始收窄):「证据汇集这一步,你具体是怎么把分散的信息拼到一起的?」
    • probe:「能多讲讲那次最难拼的案子吗?」
  • Q4(更具体):「写 SAR 草稿时,你最花时间的是叙述结构还是找证据支撑?」
    • probe:「能举个上周的例子吗?」
  • Q5(验证假设·留到末段):「如果有个工具能先给你一份带证据链接的 SAR 草稿,你会怎么用它?」
    • probe:「你会担心它哪方面?」(开放,挖信任/HITL 顾虑)
  • Q6(收尾·开放):「还有什么我没问到、但你觉得对改进这个工作很重要的?」

自访谈验证步骤:自己扮演受访者把脚本跑一遍,记录 transcript,重点验两件事——(1) 流畅度:题序是否自然、有没有突兀的跳跃;(2) 时长:6 题 + probe 是否落在可控时长内(过长受访者会疲劳、答案质量下降)。

3. 今日实战

  1. 写 6 题访谈大纲:漏斗结构(宽 → 窄)、每题配 1-2 个 probe(优先开放式)、开头含 consent 开场白。
  2. 自访谈跑 1 次:自己扮演受访者完整走一遍,记录为 transcript,committed。
  3. 据自访谈结果微调:把不流畅的题序、超时的题、容易诱导的措辞修掉。
  4. 自评检查清单逐条过:每题是否中性?probe 是否开放优先?假设是否留到末段?consent 是否在录音前?总时长是否可控?
  5. 与 Day 128 问卷对齐主题:确保访谈能挖问卷量到的那几个痛点的「为什么」,二者主题互相咬合而非各说各话。

4. 今日实测 / 产出

  • 访谈脚本(6 题 + probe + consent)+ 1 份自访谈 transcript = 待产出(文档 + 自访谈)真实外部受访 = 待用户
  • 本日为可提交的脚本 + 自测 transcript,用途是验证脚本流畅度与时长,不是真实用户数据。
  • 编码者间一致性(inter-coder κ)= 待跑(需 ≥2 编码者 + 外部 transcript),与 Day 125-126 的 κ 同源方法,本日不产出。

5. 常见误区 / 陷阱

  • 诱导性追问 / 确认偏倚:只追问支持你假设的回答、忽略相反信号。漏斗末段才验假设,且对反例同样追问。
  • 过早抛假设污染回答:开头就问「你是不是觉得 X 最难」会让受访者顺着走。先让他自由叙述。
  • 封闭 probe 用太早:把答案框死,挖不出未预期洞察;中段以开放 probe 为主。
  • 跳过 consent:录音前未取得明确知情同意,既违伦理又降坦诚度。
  • 单人主观编码 transcript:编码阶段应双人或工具辅助,降低单人解读偏差,并报编码者间一致性。
  • 把自访谈当真实用户数据:自访谈只验脚本流畅度与时长,不能代替外部受访(待用户)。
  • probe 不够、平铺直叙:只念 6 个主问题不追问,等于把半结构化退化成结构化,挖不出深度——脚本必须每题预置 probe。
  • 超时疲劳:6 题 + probe 若拖太长,受访者后段答案质量骤降;自访谈正是用来卡这个时长的。
  • 录音后不做编码就「凭印象」:印象会被最生动 / 最近的回答主导(可得性偏差),必须系统编码 transcript。
  • 把访谈结论当统计结论:6-8 个深访是质性证据,给机制不给比例,别说「80% 的用户认为」——那是问卷的活。

6. 学习资源(每条带 YYYY-MM)

  • Nielsen Norman Group, "Interviewing Users" / "User Interviews" 系列(nngroup.com,执行日查具体文章发布日期)— 漏斗法、开放 probe、半结构化访谈方法主线。
  • Steve Portigal, Interviewing Users (2nd ed., 2023) — 访谈技巧与避免诱导的经典实操书。
  • Kathy Charmaz, Constructing Grounded Theory (2nd ed., 2014) — transcript 主题编码与饱和度的方法论参考。
  • Herbert & Irene Rubin, Qualitative Interviewing: The Art of Hearing Data (3rd ed., 2012) — 漏斗法与 probe 类型的经典实操参考。
  • Anthropic《Demystifying evals》(2026-01) — 质性证据与定量 eval 三角验证的思路(交叉参考,B13 主线之一)。

SOTA检查 (2026-06 更新)

  • 当前主流:漏斗式半结构化访谈 + 开放 probe + 知情同意为稳定定性方法,无版本依赖。
  • 是否仍 SOTA:是。访谈方法学成熟,不随技术换代;2025-2026 的新变量在「分析端」——LLM 辅助 transcript 转录与初步主题编码已普及,但不取代访谈本身的方法纪律(漏斗、开放 probe、consent)。
  • LLM 辅助提示:可用 LLM 做转录与初编码,但 LLM 编码有偏、小样本不稳,需人工核对并报编码者间一致性(可借 κ);切勿让 LLM「总结」掉原始引语,洞察常藏在受访者的原话里。
  • 过时黑名单:避免诱导性追问与确认偏倚;避免单人主观编码 transcript(应双人或工具辅助);避免把自访谈 / 小样本访谈外推到总体;避免跳过 consent。
  • 下次复查点:真实外部受访需用户资源(待用户);招到外部受访后重审样本饱和度与编码间一致性(inter-coder reliability,可借 Day 125-126 的 κ 思路衡量编码者一致性)。

衔接

  • 昨天:Day 128 — M6 用户研究:survey 设计(广度、可量化的问卷工具)。
  • 今天:半结构化访谈脚本(深度、漏斗式),补问卷的深度短板,与问卷 + 行为数据三角验证;产出脚本 + 自访谈 transcript,真实外部受访待用户。
  • 明天:Day 130 — Block 收口:grader 报告与工具固化(把 B13 全部结论汇成单一可链接资产)。