M6 用户研究——survey 设计
B13 前七天(Day 121-127)都在做定量评测:把 AML 类型学变成可标注数据、用规则与 LLM 双裁判算混淆矩阵、算 κ 与 recall delta。今天起转向定性用户研究——因为再准的 eval 也回答不了「调查员到底想要 Copilot 怎么帮他」这种问题。M6 用户研究的第一件工具是 survey(问卷):规模化、可量化地收集态度。这是 Solutions Architect
阶段: B13 · FATF typologies + BSA grader + 用户研究(Day 121-130) 标签: #user-research #survey-design #likert #response-bias
今日导引(由浅入深)
B13 前七天(Day 121-127)都在做定量评测:把 AML 类型学变成可标注数据、用规则与 LLM 双裁判算混淆矩阵、算 κ 与 recall delta。今天起转向定性用户研究——因为再准的 eval 也回答不了「调查员到底想要 Copilot 怎么帮他」这种问题。M6 用户研究的第一件工具是 survey(问卷):规模化、可量化地收集态度。这是 Solutions Architect 不能外包给 PM 的能力——架构选型(规则 vs LLM、HITL 介入点、自动化边界)最终要落到「用户到底需要什么」,而需求若来自被措辞污染的假问卷,整套架构就建在流沙上。你要能自己设计无偏问卷,至少能识别 PM 给你的问卷哪里有坑。
为什么紧接昨天、通向明天:Day 121-127 把「系统多准」量化透了,但「系统该往哪走」需要用户输入——今天搭问卷(广度),明天 Day 129 搭访谈(深度),二者加 eval/行为数据三角验证,才构成完整的需求证据链。今天的最小可判定产出:一份可提交的 docs/aipa/b13-survey.md(10 题正式 + 5 题 screener + 偏倚清单)草稿。
1. 机理精读
为什么问卷设计是一门方法学,而不是「随便问几个问题」。 问卷的危险在于:受访者会顺着你的措辞走。一个引导性问题(leading question)能把回答整体推向某个方向,而你拿到的数据看起来完全正常——污染是隐形的。所以问卷设计的核心是最小化系统性偏倚,而不是「问得全」。
五点 Likert 量表测态度强度。 闭合题(closed-ended)用 5 点 Likert(非常不同意 → 不同意 → 中立 → 同意 → 非常同意)而非二元是 / 否,因为它能捕捉态度强度(intensity)而非只有方向。为什么是 5 点:
- 3 点太粗:只有「同意 / 中立 / 不同意」,丢掉了「非常」这一档强度信息,统计上难以区分温和支持者与坚定支持者。
- 7 点及以上太细:受访者难以稳定区分「同意」与「比较同意」,量表内部噪声上升,跨受访者一致性下降。
- 5 点是甜区:强度足够、认知负担可控,且偶数 vs 奇数之争里,奇数(含中点)适合允许「中立」的态度题。
两个易错点:(1) 选项语义要对称——正负各两档 + 一个中点,间距视觉上也要等距,否则受访者会被不对称布局带偏;(2) 中点措辞要中性——用「既不同意也不反对」而非「不知道 / 不适用」,后者会把「有态度但偏中间」和「根本没接触过」两类人混进同一格,污染分布。若要强制表态,可去掉中点用 4 点,但那会丢掉真实中立者的信息,需权衡。
三类必须主动消除的偏倚(每条配「坏 → 好」改写)。
- leading question(引导性措辞):坏=「你有多喜欢这个高效的 Copilot?」——「高效」已经替受访者下了结论,把回答整体推高。好=「你如何评价该 Copilot 的处理速度?」(中性、不预设结论)。
- double-barreled question(双管问题):坏=「Copilot 的速度和准确性如何?」——一道题问了两件事,受访者若觉得「快但不准」就无法作答,数据无法解释。好=拆成两题,速度一题、准确性一题。
- double negative(双重否定):坏=「你是否不认为该功能没用?」——双重否定认知负担过高,回答噪声大、易答反。好=改成正向陈述「该功能对我有用」(5 点 Likert)。
- 绝对化措辞:坏=「你是否总是信任 Copilot 的输出?」——「总是」太极端,几乎所有人都会否定。好=用频率量表(从不 / 偶尔 / 经常 / 总是)。
screener 题保数据质量。 在正式题之前放 5 道 screener(筛选)题,筛掉非目标人群——比如「你过去 6 个月是否做过 AML / 合规调查工作?」否则你的态度数据混入了根本没用过产品的人,整份问卷被稀释。screener 是数据质量的第一道闸。设计 screener 的三个要点:
- 放在最前:不符合条件的人应在投入正式题之前就被筛走,省双方时间、也避免他们的乱填污染主数据。
- 不要泄露入选条件:别问「你是 AML 调查员吗?(是 / 否)」——这等于明示「答是才能继续」,会诱导冒充。改用间接事实题(角色、工作内容、工具使用频率)交叉判断。
- 混入 attention check:放一道明确指令题(「本题请选『不同意』」)抓不认真填的人,与 Day 129 访谈的质量把控同理。
acquiescence bias(默许偏倚)与缓解。 受访者有「倾向于同意」的系统性倾向,尤其面对一连串「你是否同意…」的题。缓解手段:(1) 中性措辞——别把题干写成暗示「正确答案是同意」;(2) 随机选项序 / 反向计分题——穿插几道方向相反的题(「该功能拖慢了我的工作」),事后检查反向题与正向题是否一致,能抓出无脑全选「同意」的人。
与相邻方法的边界——三角验证(triangulation)。 问卷给的是自陈(self-reported)数据,自陈偏倚高:人会说他「认为」自己会怎么做,而非他实际怎么做(intention-behavior gap)。所以问卷不能作为可替代行为数据的唯一证据,必须与另两类证据交叉:
| 证据源 | 长处 | 短处 | 在本项目对应 |
|---|---|---|---|
| 问卷 survey | 广度、可量化、可统计 | 自陈偏倚、挖不出未知痛点 | Day 128 |
| 半结构化访谈 | 深度、挖未预期洞察、问「为什么」 | 样本小、不可量化外推 | Day 129 |
| 行为 / 链上数据 | 看「实际做了什么」、无自陈偏 | 不知道「为什么」、需埋点 | eval / 行为日志 |
三者互为补充:问卷给方向与规模,访谈给机制,行为数据给真实动作。任何单一来源都有盲区,三角验证才能让结论站得住——这与 Day 125-127 用「双裁判 + 真值」给 eval 找外部效度是同一种方法论直觉:单一来源不可信,要多来源交叉。
2. 推导 / 手算 / 代码走读
今天是文档/方法日,无 src 代码走读(产出是 docs/aipa/b13-survey.md,属交叉引用文档而非本仓代码)。给一个「坏题 → 好题」的逐步改写推演,作为最小可手算的方法演示:
- 坏题:「你是否同意这个又快又准的 AML Copilot 没有降低你的调查效率?」
- 缺陷 1:「又快又准」= leading(预设结论)。
- 缺陷 2:「快」+「准」= double-barreled(两件事)。
- 缺陷 3:「没有降低…效率」= double negative。
- 改写步骤:
- 去引导词 → 「这个 AML Copilot 对你的调查效率有何影响?」
- 拆双管 → 分两题:一题问处理速度感受,一题问结果准确性感受。
- 去双否,转 Likert → 「使用该 Copilot 后,我的单案处理时间变短了。」(5 点:非常不同意 → 非常同意)
- 再加一道反向题做一致性校验:「使用该 Copilot 后,我需要花更多时间复核它的输出。」——若某受访者两题都选「非常同意」,则其回答自相矛盾,标记为低质量样本。
这套改写本身就是「偏倚清单」的内容:逐题标注它潜在的引导 / 双管 / 记忆偏倚,附在问卷末尾。
题序也是方法的一部分,按下列原则排:
- screener 在最前:先筛人,省双方时间、保数据质量。
- 简单事实题暖场:让受访者进入状态,再上需要思考的态度题。
- 敏感 / 开放题靠后:放在受访者已投入、信任度上升后,回收率与质量更高。
- 反向题穿插:与正向题分散排布,避免「连续同向题」诱发 acquiescence。
- 选项序随机化(工具支持时):降低首因 / 近因效应(primacy / recency)。
3. 今日实战
- 为 P2 社区起草
docs/aipa/b13-survey.md,结构如下:- 5 题 screener:筛 AML / 合规调查相关人群(角色、调查经验、工具使用频率、attention check 等;间接判定,不泄露入选条件)。
- 10 题正式 survey:混合 Likert(态度强度)+ 单选(事实 / 偏好)+ 1 道开放题(捕捉未预期反馈)。
- 穿插至少 1-2 道反向计分题做 acquiescence 检查。
- 末尾附自评偏倚清单:逐题标注潜在引导 / 双管 / 记忆偏倚,写明已做的中性化处理。
- 全程用中性措辞、避免双重否定、避免双管题。
一个可直接放进草稿的题块示例(说明结构,非最终稿):
| # | 类型 | 题干(中性化后) | 备注 / 偏倚处理 |
|---|---|---|---|
| S1 | screener·单选 | 你过去 6 个月主要的工作内容是? | 间接判定角色,不直接问「是否 AML 调查员」 |
| S2 | screener·attention | 本题请选「比较同意」 | 抓不认真填的人 |
| Q3 | Likert | 使用该 Copilot 后,我的单案处理时间变短了。 | 正向,配对 Q4 反向题 |
| Q4 | Likert·反向 | 使用该 Copilot 后,我需要花更多时间复核它的输出。 | acquiescence 一致性校验 |
| Q5 | 单选 | 你最希望 Copilot 优先帮你做哪一步? | 选项含「以上都不」避免强迫选择 |
| Q12 | 开放 | 关于这个工具,还有什么你想说但前面没问到的? | 捕捉未预期反馈 |
4. 今日实测 / 产出
docs/aipa/b13-survey.md(10 + 5 题 + 偏倚清单)= 待产出(文档撰写)。UI / 用户 gated 的是真实投放而非草稿。- 本日产出为可提交的问卷草稿文件;真实社区投放 = 待用户(需 P2 社区入口)。
5. 常见误区 / 陷阱
- 把 survey 当成可替代行为数据的唯一证据:自陈偏倚高,必须与 Day 129 访谈 + 链上/行为数据三角验证。
- leading / double-barreled / double negative 三连坑:最常见,逐题过偏倚清单才能压住。
- 没有 screener:非目标人群混入会整体稀释态度数据,结论失真。
- 全正向题 + 无反向题:无法识别 acquiescence(无脑全选同意)的低质量样本。
- 把草稿写完就当「做完用户研究」:草稿 ≠ 投放 ≠ 有数据,诚实标注真实投放为待用户。
6. 学习资源(每条带 YYYY-MM)
- Nielsen Norman Group, "Survey methodology" 系列指南(nngroup.com,执行日查具体文章发布日期)— Likert + screener + 中性措辞方法论主线。
- Nielsen Norman Group, "28 Tips for Creating Great Qualitative Surveys"(执行日查发布日期)— 开放题与混合题设计。
- Nielsen Norman Group, "Rating Scales in UX Research: Likert or Semantic Differential?"(执行日查发布日期)— 5 点 vs 7 点、奇偶数量表取舍。
- Don A. Dillman, Internet, Phone, Mail, and Mixed-Mode Surveys (2014) — 问卷工程经典打底,acquiescence / 反向计分原理。
- Roger Tourangeau et al., The Psychology of Survey Response (2000) — 自陈偏倚与 intention-behavior gap 的认知机制经典。
SOTA检查 (2026-06 更新)
- 当前主流:Likert + screener + 中性措辞 + 反向计分一致性检查为稳定方法论,无版本依赖。
- 是否仍 SOTA:是。问卷设计是成熟学科,方法学不随技术换代;2025-2026 的变化主要在「投放与分析工具」(在线面板、LLM 辅助开放题编码),而非量表方法本身。
- LLM 辅助提示:可用 LLM 对开放题做初步主题编码,但需人工抽检——LLM 编码本身也有偏,且小样本下不稳定(同 Day 127 小样本陷阱)。
- 过时黑名单:避免把 survey 当唯一证据替代行为数据;避免引导性/双管/双否措辞;避免无 screener 的「广撒网」问卷。
- 下次复查点:真实社区投放需 P2 入口(待用户);投放后重审样本量是否足够支撑 Likert 分布的统计推断(小 N 同样受 power 限制)。
衔接
- 昨天:Day 127 — 规则 vs LLM 召回缺口分析(定量评测收尾)。
- 今天:转向定性用户研究,搭建无偏问卷工具(screener + Likert + 偏倚清单)。
- 明天:Day 129 — M6 用户研究:半结构化访谈脚本(漏斗式访谈,补问卷的深度短板)。