返回 AICAP-180
B13 · Day 128FATF typologies + BSA grader + 用户研究

M6 用户研究——survey 设计

B13 前七天(Day 121-127)都在做定量评测:把 AML 类型学变成可标注数据、用规则与 LLM 双裁判算混淆矩阵、算 κ 与 recall delta。今天起转向定性用户研究——因为再准的 eval 也回答不了「调查员到底想要 Copilot 怎么帮他」这种问题。M6 用户研究的第一件工具是 survey(问卷):规模化、可量化地收集态度。这是 Solutions Architect

阶段: B13 · FATF typologies + BSA grader + 用户研究(Day 121-130) 标签: #user-research #survey-design #likert #response-bias

今日导引(由浅入深)

B13 前七天(Day 121-127)都在做定量评测:把 AML 类型学变成可标注数据、用规则与 LLM 双裁判算混淆矩阵、算 κ 与 recall delta。今天起转向定性用户研究——因为再准的 eval 也回答不了「调查员到底想要 Copilot 怎么帮他」这种问题。M6 用户研究的第一件工具是 survey(问卷):规模化、可量化地收集态度。这是 Solutions Architect 不能外包给 PM 的能力——架构选型(规则 vs LLM、HITL 介入点、自动化边界)最终要落到「用户到底需要什么」,而需求若来自被措辞污染的假问卷,整套架构就建在流沙上。你要能自己设计无偏问卷,至少能识别 PM 给你的问卷哪里有坑。

为什么紧接昨天、通向明天:Day 121-127 把「系统多准」量化透了,但「系统该往哪走」需要用户输入——今天搭问卷(广度),明天 Day 129 搭访谈(深度),二者加 eval/行为数据三角验证,才构成完整的需求证据链。今天的最小可判定产出:一份可提交的 docs/aipa/b13-survey.md(10 题正式 + 5 题 screener + 偏倚清单)草稿。

1. 机理精读

为什么问卷设计是一门方法学,而不是「随便问几个问题」。 问卷的危险在于:受访者会顺着你的措辞走。一个引导性问题(leading question)能把回答整体推向某个方向,而你拿到的数据看起来完全正常——污染是隐形的。所以问卷设计的核心是最小化系统性偏倚,而不是「问得全」。

五点 Likert 量表测态度强度。 闭合题(closed-ended)用 5 点 Likert(非常不同意 → 不同意 → 中立 → 同意 → 非常同意)而非二元是 / 否,因为它能捕捉态度强度(intensity)而非只有方向。为什么是 5 点:

  • 3 点太粗:只有「同意 / 中立 / 不同意」,丢掉了「非常」这一档强度信息,统计上难以区分温和支持者与坚定支持者。
  • 7 点及以上太细:受访者难以稳定区分「同意」与「比较同意」,量表内部噪声上升,跨受访者一致性下降。
  • 5 点是甜区:强度足够、认知负担可控,且偶数 vs 奇数之争里,奇数(含中点)适合允许「中立」的态度题。

两个易错点:(1) 选项语义要对称——正负各两档 + 一个中点,间距视觉上也要等距,否则受访者会被不对称布局带偏;(2) 中点措辞要中性——用「既不同意也不反对」而非「不知道 / 不适用」,后者会把「有态度但偏中间」和「根本没接触过」两类人混进同一格,污染分布。若要强制表态,可去掉中点用 4 点,但那会丢掉真实中立者的信息,需权衡。

三类必须主动消除的偏倚(每条配「坏 → 好」改写)。

  1. leading question(引导性措辞):坏=「你有多喜欢这个高效的 Copilot?」——「高效」已经替受访者下了结论,把回答整体推高。好=「你如何评价该 Copilot 的处理速度?」(中性、不预设结论)。
  2. double-barreled question(双管问题):坏=「Copilot 的速度和准确性如何?」——一道题问了两件事,受访者若觉得「快但不准」就无法作答,数据无法解释。好=拆成两题,速度一题、准确性一题。
  3. double negative(双重否定):坏=「你是否认为该功能用?」——双重否定认知负担过高,回答噪声大、易答反。好=改成正向陈述「该功能对我有用」(5 点 Likert)。
  4. 绝对化措辞:坏=「你是否总是信任 Copilot 的输出?」——「总是」太极端,几乎所有人都会否定。好=用频率量表(从不 / 偶尔 / 经常 / 总是)。

screener 题保数据质量。 在正式题之前放 5 道 screener(筛选)题,筛掉非目标人群——比如「你过去 6 个月是否做过 AML / 合规调查工作?」否则你的态度数据混入了根本没用过产品的人,整份问卷被稀释。screener 是数据质量的第一道闸。设计 screener 的三个要点:

  1. 放在最前:不符合条件的人应在投入正式题之前就被筛走,省双方时间、也避免他们的乱填污染主数据。
  2. 不要泄露入选条件:别问「你是 AML 调查员吗?(是 / 否)」——这等于明示「答是才能继续」,会诱导冒充。改用间接事实题(角色、工作内容、工具使用频率)交叉判断。
  3. 混入 attention check:放一道明确指令题(「本题请选『不同意』」)抓不认真填的人,与 Day 129 访谈的质量把控同理。

acquiescence bias(默许偏倚)与缓解。 受访者有「倾向于同意」的系统性倾向,尤其面对一连串「你是否同意…」的题。缓解手段:(1) 中性措辞——别把题干写成暗示「正确答案是同意」;(2) 随机选项序 / 反向计分题——穿插几道方向相反的题(「该功能拖慢了我的工作」),事后检查反向题与正向题是否一致,能抓出无脑全选「同意」的人。

与相邻方法的边界——三角验证(triangulation)。 问卷给的是自陈(self-reported)数据,自陈偏倚高:人会说他「认为」自己会怎么做,而非他实际怎么做(intention-behavior gap)。所以问卷不能作为可替代行为数据的唯一证据,必须与另两类证据交叉:

证据源长处短处在本项目对应
问卷 survey广度、可量化、可统计自陈偏倚、挖不出未知痛点Day 128
半结构化访谈深度、挖未预期洞察、问「为什么」样本小、不可量化外推Day 129
行为 / 链上数据看「实际做了什么」、无自陈偏不知道「为什么」、需埋点eval / 行为日志

三者互为补充:问卷给方向与规模,访谈给机制,行为数据给真实动作。任何单一来源都有盲区,三角验证才能让结论站得住——这与 Day 125-127 用「双裁判 + 真值」给 eval 找外部效度是同一种方法论直觉:单一来源不可信,要多来源交叉

2. 推导 / 手算 / 代码走读

今天是文档/方法日,无 src 代码走读(产出是 docs/aipa/b13-survey.md,属交叉引用文档而非本仓代码)。给一个「坏题 → 好题」的逐步改写推演,作为最小可手算的方法演示:

  • 坏题:「你是否同意这个又快又准的 AML Copilot 没有降低你的调查效率?」
    • 缺陷 1:「又快又准」= leading(预设结论)。
    • 缺陷 2:「快」+「准」= double-barreled(两件事)。
    • 缺陷 3:「没有降低…效率」= double negative。
  • 改写步骤
    1. 去引导词 → 「这个 AML Copilot 对你的调查效率有何影响?」
    2. 拆双管 → 分两题:一题问处理速度感受,一题问结果准确性感受。
    3. 去双否,转 Likert → 「使用该 Copilot 后,我的单案处理时间变短了。」(5 点:非常不同意 → 非常同意)
  • 再加一道反向题做一致性校验:「使用该 Copilot 后,我需要花更多时间复核它的输出。」——若某受访者两题都选「非常同意」,则其回答自相矛盾,标记为低质量样本。

这套改写本身就是「偏倚清单」的内容:逐题标注它潜在的引导 / 双管 / 记忆偏倚,附在问卷末尾。

题序也是方法的一部分,按下列原则排:

  1. screener 在最前:先筛人,省双方时间、保数据质量。
  2. 简单事实题暖场:让受访者进入状态,再上需要思考的态度题。
  3. 敏感 / 开放题靠后:放在受访者已投入、信任度上升后,回收率与质量更高。
  4. 反向题穿插:与正向题分散排布,避免「连续同向题」诱发 acquiescence。
  5. 选项序随机化(工具支持时):降低首因 / 近因效应(primacy / recency)。

3. 今日实战

  1. 为 P2 社区起草 docs/aipa/b13-survey.md,结构如下:
    • 5 题 screener:筛 AML / 合规调查相关人群(角色、调查经验、工具使用频率、attention check 等;间接判定,不泄露入选条件)。
    • 10 题正式 survey:混合 Likert(态度强度)+ 单选(事实 / 偏好)+ 1 道开放题(捕捉未预期反馈)。
    • 穿插至少 1-2 道反向计分题做 acquiescence 检查。
  2. 末尾附自评偏倚清单:逐题标注潜在引导 / 双管 / 记忆偏倚,写明已做的中性化处理。
  3. 全程用中性措辞、避免双重否定、避免双管题。

一个可直接放进草稿的题块示例(说明结构,非最终稿):

#类型题干(中性化后)备注 / 偏倚处理
S1screener·单选你过去 6 个月主要的工作内容是?间接判定角色,不直接问「是否 AML 调查员」
S2screener·attention本题请选「比较同意」抓不认真填的人
Q3Likert使用该 Copilot 后,我的单案处理时间变短了。正向,配对 Q4 反向题
Q4Likert·反向使用该 Copilot 后,我需要花更多时间复核它的输出。acquiescence 一致性校验
Q5单选你最希望 Copilot 优先帮你做哪一步?选项含「以上都不」避免强迫选择
Q12开放关于这个工具,还有什么你想说但前面没问到的?捕捉未预期反馈

4. 今日实测 / 产出

  • docs/aipa/b13-survey.md(10 + 5 题 + 偏倚清单)= 待产出(文档撰写)。UI / 用户 gated 的是真实投放而非草稿。
  • 本日产出为可提交的问卷草稿文件真实社区投放 = 待用户(需 P2 社区入口)

5. 常见误区 / 陷阱

  • 把 survey 当成可替代行为数据的唯一证据:自陈偏倚高,必须与 Day 129 访谈 + 链上/行为数据三角验证。
  • leading / double-barreled / double negative 三连坑:最常见,逐题过偏倚清单才能压住。
  • 没有 screener:非目标人群混入会整体稀释态度数据,结论失真。
  • 全正向题 + 无反向题:无法识别 acquiescence(无脑全选同意)的低质量样本。
  • 把草稿写完就当「做完用户研究」:草稿 ≠ 投放 ≠ 有数据,诚实标注真实投放为待用户。

6. 学习资源(每条带 YYYY-MM)

  • Nielsen Norman Group, "Survey methodology" 系列指南(nngroup.com,执行日查具体文章发布日期)— Likert + screener + 中性措辞方法论主线。
  • Nielsen Norman Group, "28 Tips for Creating Great Qualitative Surveys"(执行日查发布日期)— 开放题与混合题设计。
  • Nielsen Norman Group, "Rating Scales in UX Research: Likert or Semantic Differential?"(执行日查发布日期)— 5 点 vs 7 点、奇偶数量表取舍。
  • Don A. Dillman, Internet, Phone, Mail, and Mixed-Mode Surveys (2014) — 问卷工程经典打底,acquiescence / 反向计分原理。
  • Roger Tourangeau et al., The Psychology of Survey Response (2000) — 自陈偏倚与 intention-behavior gap 的认知机制经典。

SOTA检查 (2026-06 更新)

  • 当前主流:Likert + screener + 中性措辞 + 反向计分一致性检查为稳定方法论,无版本依赖
  • 是否仍 SOTA:是。问卷设计是成熟学科,方法学不随技术换代;2025-2026 的变化主要在「投放与分析工具」(在线面板、LLM 辅助开放题编码),而非量表方法本身。
  • LLM 辅助提示:可用 LLM 对开放题做初步主题编码,但需人工抽检——LLM 编码本身也有偏,且小样本下不稳定(同 Day 127 小样本陷阱)。
  • 过时黑名单:避免把 survey 当唯一证据替代行为数据;避免引导性/双管/双否措辞;避免无 screener 的「广撒网」问卷。
  • 下次复查点:真实社区投放需 P2 入口(待用户);投放后重审样本量是否足够支撑 Likert 分布的统计推断(小 N 同样受 power 限制)。

衔接

  • 昨天:Day 127 — 规则 vs LLM 召回缺口分析(定量评测收尾)。
  • 今天:转向定性用户研究,搭建无偏问卷工具(screener + Likert + 偏倚清单)。
  • 明天:Day 129 — M6 用户研究:半结构化访谈脚本(漏斗式访谈,补问卷的深度短板)。