能查出什么
靠逻辑和语言理解就能暴露的 6 类问卷缺陷
这些缺陷不依赖真实受访者的态度,只要读懂题目并尝试作答就会暴露,正是模拟作答最擅长的部分。
题干歧义
一道题可以被理解成两个意思,不同类型的虚拟受访者会给出不同解释。比如“您最近经常运动吗”,“最近”和“经常”都没有界定。
双重问题
一道题里问了两件事,例如“您对价格和质量是否满意”。对价格满意、对质量不满意的人无法作答。
选项不完备或重叠
选项没有覆盖全部情况,或者区间互相交叉(如“1–3 年”和“3–5 年”),受访者找不到唯一符合自己的选项。
量表方向不一致
正向题和反向题混排而没有提示,作答容易出错,后期计分和数据清洗也更麻烦。
跳转逻辑漏洞
某类受访者被引导到本不该出现的题目,或者在某个分支里没有出口,一部分样本会因此作废。
术语门槛
研究者熟悉的专业词,目标人群未必看得懂。真人预测试通常样本很少,这类问题反而容易被漏掉。
边界
模拟作答能证明什么,不能证明什么
判断标准是:这个结论是只依赖题目本身,还是依赖真实人群的态度和行为。前者可以靠模拟发现,后者只能靠真实样本回答。
| 问题 | AI 模拟作答 | 真实受访者 |
|---|---|---|
| 题目有没有歧义、选项是否完备 | 适合,能低成本筛查 | 适合,但样本少时容易漏 |
| 跳转路径是否走得通 | 适合,可以按类型逐条遍历 | 只能覆盖实际出现的路径 |
| 填答时长和疲劳感 | 只能粗略估计 | 以真人预测试为准 |
| 态度分布、均值和比例 | 不能估计 | 唯一可信来源 |
| 变量之间的相关和因果 | 不能作为证据 | 需要正式样本和合适的分析方法 |
方法
五步跑完一轮问卷模拟预测试
- 01
写清问卷和研究背景
准备完整问卷(含跳转规则),并写明研究目的、目标人群和投放渠道。线上自填和线下访员代填暴露的问题不同,渠道要提前说明。
- 02
定义 5 至 8 种受访者类型
类型要覆盖研究需要比较的关键差异,例如年龄段、职业、对主题的熟悉程度和填答意愿。特意加入“不熟悉主题”和“不愿认真作答”的类型,更容易暴露问题。
- 03
逐类逐题模拟作答
让每类虚拟受访者逐题回答,并同时记录三件事:这道题怎么理解、找不到合适选项时想选什么、会不会想跳过。只要答案不要理由,查不出歧义。
- 04
汇总问题清单
把多个类型都理解不一致的题、反复出现的缺失选项、走不通的跳转路径整理成清单,并按影响范围排出修改优先级。
- 05
修订后回归测试
按清单修订问卷,用同一组受访者类型再跑一轮,确认旧问题消失、没有引入新问题,然后再进入真人预测试。
进阶
用代码批量模拟,把“感觉有问题”变成可核对的记录
在对话里手动让模型扮演几个人,结果难以复查,也很难比较修订前后的差异。把模拟写成程序,可以固定受访者设定、重复运行,并用统计结果判断哪些题需要改。
用结构化设定生成虚拟受访者
把每种受访者类型写成参数(人口特征、熟悉程度、作答风格),由脚本组合生成一批虚拟受访者,而不是每次临时描述。设定文件本身就是预测试记录的一部分。
同一设定重复运行
对同一类型多次作答,观察答案是否稳定。同一类人在同一道题上答案摇摆,往往说明题干有歧义;所有类型答案都一样,可能说明这道题没有区分度。
统计跨类型的回答偏差
按题目汇总各类型的理解差异、选择“其他”或要求补充选项的比例,以及被标记为想跳过的次数,用表格排出最可疑的题目。
遍历跳转路径
把跳转规则写成代码,检查每类受访者实际走过的路径,找出无法到达的题、没有出口的分支和逻辑矛盾。
Scientify
用 Scientify 把问卷预测试跑成可复现的分析
Scientify 是运行在隔离云电脑中的科学智能体。你给出问卷、研究目的和受访者类型后,智能体可以编写代码生成虚拟受访者、批量运行模拟作答、统计不同类型之间的回答偏差,并根据结果提出修订建议、在新版问卷上再跑一轮。
代码、依赖、受访者设定、模拟数据、日志和统计图表都保存在同一个工作区,修订前后的结果可以直接对照,也能完整复现。批量模拟耗时较长时,你关掉电脑任务也会继续运行,可以用手机查看进度并给出反馈。
- 智能体、文件和运行环境位于隔离云电脑,关闭电脑后任务继续运行
- 对话历史和工作区文件只保存在隔离云电脑中,Scientify 服务器不存储这些研究数据
- 核心智能体已开源,GitHub 获得 2k+ Stars
- 新注册用户免费获得一台云电脑和 $5 模型额度
误区
使用 AI 模拟问卷时最常见的几个误区
- 把模拟回答当成样本:模拟数据不能计算比例、均值或做假设检验,也不能补齐真实样本量。
- 只看答案不看理由:不要求虚拟受访者说明理解过程,就发现不了歧义和缺失选项。
- 受访者类型太相似:几个类型只是换了名字,模拟结果高度一致,等于只测了一次。
- 用模拟代替真人预测试:模拟可以先筛掉明显缺陷,但填答时长、敏感题反应等仍要靠真人验证。
- 不留记录:不保存设定、版本和结果,修订后无法判断问题是否真的解决,写方法部分时也无从说明。