M6 用户研究——半结构化访谈脚本
Day 128 搭好了问卷(survey),它长于广度——规模化、可量化,但短于深度:自陈数据挖不出受访者自己都没意识到的痛点。今天补上 M6 用户研究的另一半——半结构化访谈(semi-structured interview),它用一个固定大纲保证可比性,又留出开放追问的空间挖深度洞察。这是定性研究方法学的核心一档:问卷告诉你「多少人觉得慢」,访谈告诉你「为什么慢、慢在哪个环节、他怎么绕过去」
阶段: B13 · FATF typologies + BSA grader + 用户研究(Day 121-130) 标签: #user-research #semi-structured-interview #funnel-technique #informed-consent
今日导引(由浅入深)
Day 128 搭好了问卷(survey),它长于广度——规模化、可量化,但短于深度:自陈数据挖不出受访者自己都没意识到的痛点。今天补上 M6 用户研究的另一半——半结构化访谈(semi-structured interview),它用一个固定大纲保证可比性,又留出开放追问的空间挖深度洞察。这是定性研究方法学的核心一档:问卷告诉你「多少人觉得慢」,访谈告诉你「为什么慢、慢在哪个环节、他怎么绕过去」。
为什么紧接昨天、通向明天:Day 128 的问卷拿到的是「方向 + 规模」,但它挖不出受访者自己都没意识到的痛点;今天的访谈正好补这块深度,二者加 eval / 行为数据三角验证,构成 Day 130 收口报告里「用户研究工具就绪」的那一栏。今天的最小可判定产出:一份 6 题访谈脚本(漏斗结构 + 每题 probe + consent 开场白)+ 一份自访谈 transcript(验证脚本流畅度与时长)。
1. 机理精读
三种访谈形式的光谱。 把访谈想象成一条从「全控」到「全放」的光谱:
| 形式 | 结构 | 长处 | 短处 |
|---|---|---|---|
| 完全结构化 | 逐字念稿、固定选项 | 高可比、可量化 | 挖不出未预期洞察 |
| 半结构化 | 固定大纲 + 临场追问 | 兼顾可比与深度 | 依赖访谈员技巧 |
| 完全开放 | 自由叙述 | 最大化意外发现 | 难比较、易跑题 |
半结构化 = 固定大纲 + 灵活追问。 它用一组核心问题保证每个受访者都覆盖到同样的主题(可比性),但允许访谈员根据回答临场追问(probe)。这是用户研究里挖深度洞察的主力形式——既不丢失结构,又不堵死意外发现,所以本日选它。代价是它对访谈员要求高:要能一边守大纲、一边判断哪里值得追问,这正是为什么要先写脚本 + 自访谈练手。
漏斗法(funnel technique):从宽到窄。 访谈的提问顺序至关重要,三段式:
- 宽口起步:从宽泛的开放题切入(「能讲讲你平时一天的 AML 调查流程吗?」),让受访者自由叙述,先建立自然语境、让他放松。这一段几乎不打断,只用回声 / 沉默 probe 鼓励展开。
- 逐步收窄:随叙述展开,逐步追问到具体环节(「刚才提到证据汇集很花时间,具体卡在哪一步?」)。这一段是挖洞察的主战场,开放 probe 密集。
- 末端验假设:关键纪律——别在开头就抛出你的假设(「你是不是觉得 SAR 草稿最费时?」),那会污染回答:受访者会顺着你的假设走,你听到的是自己的回声而非真实洞察。假设要留到漏斗末端、受访者已自然提到相关主题时再验证。
为什么这个顺序不能反:如果一上来就问窄问题,你已经替受访者框定了「重要的是什么」,他后面所有回答都会被这个框架带偏,真正的痛点(你没预设的那个)永远不会浮现。宽口起步的本质是先听他的世界,再验你的假设。
开放式 probe vs 封闭式 probe。 追问分两种:开放式(「能多讲讲吗?」「那时候你是怎么想的?」)和封闭式(「是 A 还是 B?」)。开放式 probe 更能挖出未预期洞察——它把控制权交还给受访者,让他往你没预设的方向展开;封闭式 probe 把答案框死在你给的选项里,只适合最后确认事实。漏斗的中段应以开放 probe 为主。常用的开放 probe 工具箱:
- 沉默 probe:受访者答完后停顿 2-3 秒不接话,往往能引出他原本没打算说的补充。
- 回声 probe:重复对方最后几个词(「……拼到一起?」)促其展开,不引入新信息。
- 具象化 probe:「能举个上周的具体例子吗?」把抽象抱怨拉回到可核实的事件。
- 「然后呢」probe:顺着叙述往下推,还原完整流程。
要刻意避免的是引导式 probe(「所以你觉得它没用,对吧?」)——那不是追问,是替对方下结论。
知情同意(recording consent)是硬前置。 录音前必须取得明确的知情同意,consent 开场白至少覆盖五要素:
- 目的:为什么访谈、研究用途。
- 录音告知:明确说会录音,并征得同意。
- 用途与存储:录音怎么用、存哪、谁能看、保留多久。
- 退出权:可随时暂停或终止,不影响任何权益。
- 匿名 / 保密:结果如何脱敏。
这不是形式——它是研究伦理的底线,也直接影响受访者的坦诚度(知道被录音且信任用途,才会说真话)。consent 开场白要写进脚本,作为固定第一步;在地区法规(如 GDPR / 各地录音同意法)下,口头同意最好也留痕。AML / 合规领域受访者对「被记录」尤其敏感,consent 处理得专业能显著提升坦诚度。
饱和度(saturation):访谈做到多少够。 质性访谈不追求统计代表性,而追求主题饱和——当新增受访者不再带来新主题时,可以停。经验上 6-8 个深访能覆盖大部分主流痛点,但这取决于人群同质性:人群越杂,达到饱和需要的访谈越多。本日只做脚本 + 1 次自访谈,真实饱和判断要等外部受访(待用户)。
为什么访谈与问卷必须配对(三角验证)。 访谈给深度但牺牲了样本量与可量化性:6-8 个深访得到的是丰富的质性数据,不能直接外推到总体。所以它与 Day 128 问卷(广度、可量化)+ 行为 / 链上数据(实际行为)做三角验证:问卷给方向与规模,访谈给「为什么」与机制,行为数据给「实际上做了什么」。三者互补,单用任何一个都有盲区。一个典型用法:问卷发现「60% 的人觉得 SAR 草稿环节慢」,访谈去挖「慢在哪、怎么绕」,行为数据验证「实际在该环节停留时长」——三者对上,结论才可信。
transcript 编码(coding)与一致性。 访谈后要把 transcript 编码成主题(themes),这一步天然主观。降偏手段:(1) 双人独立编码再比对,(2) 工具 / LLM 辅助初编 + 人工核,(3) 用编码者间一致性(inter-coder reliability)量化——可直接借 Day 125-126 的 Cohen's κ 思路,把两个编码者对每段的标签当两个 rater 算 κ。本日只做自访谈,编码一致性留到外部受访(待用户)。
与相邻概念的边界。 半结构化访谈 ≠ 焦点小组(focus group,多人易受群体压力、附和效应)≠ 可用性测试(usability test,观察操作而非问态度)≠ 问卷(quantitative,广度优先)。本日做的是一对一、聚焦态度与流程理解的访谈;它与昨天的问卷是「深度 vs 广度」的互补对,不是替代关系。
2. 推导 / 手算 / 代码走读
今天是文档/方法日,无 src 代码走读(产出是访谈脚本 + transcript,文档类)。给一个漏斗式脚本的最小骨架推演,作为方法演示(6 题 + probe):
- 第 0 步 · consent 开场白:自我介绍 + 研究目的 + 「本次访谈将录音,仅用于产品改进、不对外、你可随时暂停或退出,是否同意?」(取得明确口头同意后再开始)。
- Q1(漏斗宽口·开放):「能带我走一遍你最近一次完整的 AML 调查吗?从接到 alert 到提交结论。」
- probe(开放):「哪一步让你觉得最耗时间?」
- Q2(仍偏宽):「在这个流程里,你最依赖哪些工具/信息源?」
- probe:「有没有哪一步你觉得本可以自动化?」
- Q3(开始收窄):「证据汇集这一步,你具体是怎么把分散的信息拼到一起的?」
- probe:「能多讲讲那次最难拼的案子吗?」
- Q4(更具体):「写 SAR 草稿时,你最花时间的是叙述结构还是找证据支撑?」
- probe:「能举个上周的例子吗?」
- Q5(验证假设·留到末段):「如果有个工具能先给你一份带证据链接的 SAR 草稿,你会怎么用它?」
- probe:「你会担心它哪方面?」(开放,挖信任/HITL 顾虑)
- Q6(收尾·开放):「还有什么我没问到、但你觉得对改进这个工作很重要的?」
自访谈验证步骤:自己扮演受访者把脚本跑一遍,记录 transcript,重点验两件事——(1) 流畅度:题序是否自然、有没有突兀的跳跃;(2) 时长:6 题 + probe 是否落在可控时长内(过长受访者会疲劳、答案质量下降)。
3. 今日实战
- 写 6 题访谈大纲:漏斗结构(宽 → 窄)、每题配 1-2 个 probe(优先开放式)、开头含 consent 开场白。
- 自访谈跑 1 次:自己扮演受访者完整走一遍,记录为 transcript,committed。
- 据自访谈结果微调:把不流畅的题序、超时的题、容易诱导的措辞修掉。
- 自评检查清单逐条过:每题是否中性?probe 是否开放优先?假设是否留到末段?consent 是否在录音前?总时长是否可控?
- 与 Day 128 问卷对齐主题:确保访谈能挖问卷量到的那几个痛点的「为什么」,二者主题互相咬合而非各说各话。
4. 今日实测 / 产出
- 访谈脚本(6 题 + probe + consent)+ 1 份自访谈 transcript = 待产出(文档 + 自访谈)。真实外部受访 = 待用户。
- 本日为可提交的脚本 + 自测 transcript,用途是验证脚本流畅度与时长,不是真实用户数据。
- 编码者间一致性(inter-coder κ)= 待跑(需 ≥2 编码者 + 外部 transcript),与 Day 125-126 的 κ 同源方法,本日不产出。
5. 常见误区 / 陷阱
- 诱导性追问 / 确认偏倚:只追问支持你假设的回答、忽略相反信号。漏斗末段才验假设,且对反例同样追问。
- 过早抛假设污染回答:开头就问「你是不是觉得 X 最难」会让受访者顺着走。先让他自由叙述。
- 封闭 probe 用太早:把答案框死,挖不出未预期洞察;中段以开放 probe 为主。
- 跳过 consent:录音前未取得明确知情同意,既违伦理又降坦诚度。
- 单人主观编码 transcript:编码阶段应双人或工具辅助,降低单人解读偏差,并报编码者间一致性。
- 把自访谈当真实用户数据:自访谈只验脚本流畅度与时长,不能代替外部受访(待用户)。
- probe 不够、平铺直叙:只念 6 个主问题不追问,等于把半结构化退化成结构化,挖不出深度——脚本必须每题预置 probe。
- 超时疲劳:6 题 + probe 若拖太长,受访者后段答案质量骤降;自访谈正是用来卡这个时长的。
- 录音后不做编码就「凭印象」:印象会被最生动 / 最近的回答主导(可得性偏差),必须系统编码 transcript。
- 把访谈结论当统计结论:6-8 个深访是质性证据,给机制不给比例,别说「80% 的用户认为」——那是问卷的活。
6. 学习资源(每条带 YYYY-MM)
- Nielsen Norman Group, "Interviewing Users" / "User Interviews" 系列(nngroup.com,执行日查具体文章发布日期)— 漏斗法、开放 probe、半结构化访谈方法主线。
- Steve Portigal, Interviewing Users (2nd ed., 2023) — 访谈技巧与避免诱导的经典实操书。
- Kathy Charmaz, Constructing Grounded Theory (2nd ed., 2014) — transcript 主题编码与饱和度的方法论参考。
- Herbert & Irene Rubin, Qualitative Interviewing: The Art of Hearing Data (3rd ed., 2012) — 漏斗法与 probe 类型的经典实操参考。
- Anthropic《Demystifying evals》(2026-01) — 质性证据与定量 eval 三角验证的思路(交叉参考,B13 主线之一)。
SOTA检查 (2026-06 更新)
- 当前主流:漏斗式半结构化访谈 + 开放 probe + 知情同意为稳定定性方法,无版本依赖。
- 是否仍 SOTA:是。访谈方法学成熟,不随技术换代;2025-2026 的新变量在「分析端」——LLM 辅助 transcript 转录与初步主题编码已普及,但不取代访谈本身的方法纪律(漏斗、开放 probe、consent)。
- LLM 辅助提示:可用 LLM 做转录与初编码,但 LLM 编码有偏、小样本不稳,需人工核对并报编码者间一致性(可借 κ);切勿让 LLM「总结」掉原始引语,洞察常藏在受访者的原话里。
- 过时黑名单:避免诱导性追问与确认偏倚;避免单人主观编码 transcript(应双人或工具辅助);避免把自访谈 / 小样本访谈外推到总体;避免跳过 consent。
- 下次复查点:真实外部受访需用户资源(待用户);招到外部受访后重审样本饱和度与编码间一致性(inter-coder reliability,可借 Day 125-126 的 κ 思路衡量编码者一致性)。
衔接
- 昨天:Day 128 — M6 用户研究:survey 设计(广度、可量化的问卷工具)。
- 今天:半结构化访谈脚本(深度、漏斗式),补问卷的深度短板,与问卷 + 行为数据三角验证;产出脚本 + 自访谈 transcript,真实外部受访待用户。
- 明天:Day 130 — Block 收口:grader 报告与工具固化(把 B13 全部结论汇成单一可链接资产)。