问卷调研 / 预测试

AI 模拟问卷:投放前,先让虚拟受访者把题目答一遍

问卷调研代价最高的错误,是问卷发出去、数据收回来之后才发现某道题有歧义、某个选项漏了、某条跳转把人带错了地方。AI 模拟作答可以在投放前用很低的成本把这类问题筛一遍。本文讲清它能查出什么、不能证明什么,以及怎样把一次模拟做成可重复、可核对的预测试。

直接答案

AI 模拟问卷的作用是预测试题目,而不是生成研究数据:让模型按不同受访者类型逐题作答,可以发现题干歧义、双重问题、选项缺漏和跳转逻辑错误。模拟结果不能用来估计真实态度分布,正式分析只能使用实际回收并通过质量检查的问卷。

能查出什么

靠逻辑和语言理解就能暴露的 6 类问卷缺陷

这些缺陷不依赖真实受访者的态度,只要读懂题目并尝试作答就会暴露,正是模拟作答最擅长的部分。

题干歧义

一道题可以被理解成两个意思,不同类型的虚拟受访者会给出不同解释。比如“您最近经常运动吗”,“最近”和“经常”都没有界定。

双重问题

一道题里问了两件事,例如“您对价格和质量是否满意”。对价格满意、对质量不满意的人无法作答。

选项不完备或重叠

选项没有覆盖全部情况,或者区间互相交叉(如“1–3 年”和“3–5 年”),受访者找不到唯一符合自己的选项。

量表方向不一致

正向题和反向题混排而没有提示,作答容易出错,后期计分和数据清洗也更麻烦。

跳转逻辑漏洞

某类受访者被引导到本不该出现的题目,或者在某个分支里没有出口,一部分样本会因此作废。

术语门槛

研究者熟悉的专业词,目标人群未必看得懂。真人预测试通常样本很少,这类问题反而容易被漏掉。

边界

模拟作答能证明什么,不能证明什么

判断标准是:这个结论是只依赖题目本身,还是依赖真实人群的态度和行为。前者可以靠模拟发现,后者只能靠真实样本回答。

问题AI 模拟作答真实受访者
题目有没有歧义、选项是否完备适合,能低成本筛查适合,但样本少时容易漏
跳转路径是否走得通适合,可以按类型逐条遍历只能覆盖实际出现的路径
填答时长和疲劳感只能粗略估计以真人预测试为准
态度分布、均值和比例不能估计唯一可信来源
变量之间的相关和因果不能作为证据需要正式样本和合适的分析方法
模拟作答属于问卷设计阶段的工具,结果不进入正式分析。

方法

五步跑完一轮问卷模拟预测试

  1. 01

    写清问卷和研究背景

    准备完整问卷(含跳转规则),并写明研究目的、目标人群和投放渠道。线上自填和线下访员代填暴露的问题不同,渠道要提前说明。

  2. 02

    定义 5 至 8 种受访者类型

    类型要覆盖研究需要比较的关键差异,例如年龄段、职业、对主题的熟悉程度和填答意愿。特意加入“不熟悉主题”和“不愿认真作答”的类型,更容易暴露问题。

  3. 03

    逐类逐题模拟作答

    让每类虚拟受访者逐题回答,并同时记录三件事:这道题怎么理解、找不到合适选项时想选什么、会不会想跳过。只要答案不要理由,查不出歧义。

  4. 04

    汇总问题清单

    把多个类型都理解不一致的题、反复出现的缺失选项、走不通的跳转路径整理成清单,并按影响范围排出修改优先级。

  5. 05

    修订后回归测试

    按清单修订问卷,用同一组受访者类型再跑一轮,确认旧问题消失、没有引入新问题,然后再进入真人预测试。

进阶

用代码批量模拟,把“感觉有问题”变成可核对的记录

在对话里手动让模型扮演几个人,结果难以复查,也很难比较修订前后的差异。把模拟写成程序,可以固定受访者设定、重复运行,并用统计结果判断哪些题需要改。

用结构化设定生成虚拟受访者

把每种受访者类型写成参数(人口特征、熟悉程度、作答风格),由脚本组合生成一批虚拟受访者,而不是每次临时描述。设定文件本身就是预测试记录的一部分。

同一设定重复运行

对同一类型多次作答,观察答案是否稳定。同一类人在同一道题上答案摇摆,往往说明题干有歧义;所有类型答案都一样,可能说明这道题没有区分度。

统计跨类型的回答偏差

按题目汇总各类型的理解差异、选择“其他”或要求补充选项的比例,以及被标记为想跳过的次数,用表格排出最可疑的题目。

遍历跳转路径

把跳转规则写成代码,检查每类受访者实际走过的路径,找出无法到达的题、没有出口的分支和逻辑矛盾。

Scientify

用 Scientify 把问卷预测试跑成可复现的分析

Scientify 是运行在隔离云电脑中的科学智能体。你给出问卷、研究目的和受访者类型后,智能体可以编写代码生成虚拟受访者、批量运行模拟作答、统计不同类型之间的回答偏差,并根据结果提出修订建议、在新版问卷上再跑一轮。

代码、依赖、受访者设定、模拟数据、日志和统计图表都保存在同一个工作区,修订前后的结果可以直接对照,也能完整复现。批量模拟耗时较长时,你关掉电脑任务也会继续运行,可以用手机查看进度并给出反馈。

  • 智能体、文件和运行环境位于隔离云电脑,关闭电脑后任务继续运行
  • 对话历史和工作区文件只保存在隔离云电脑中,Scientify 服务器不存储这些研究数据
  • 核心智能体已开源,GitHub 获得 2k+ Stars
  • 新注册用户免费获得一台云电脑和 $5 模型额度

误区

使用 AI 模拟问卷时最常见的几个误区

  • 把模拟回答当成样本:模拟数据不能计算比例、均值或做假设检验,也不能补齐真实样本量。
  • 只看答案不看理由:不要求虚拟受访者说明理解过程,就发现不了歧义和缺失选项。
  • 受访者类型太相似:几个类型只是换了名字,模拟结果高度一致,等于只测了一次。
  • 用模拟代替真人预测试:模拟可以先筛掉明显缺陷,但填答时长、敏感题反应等仍要靠真人验证。
  • 不留记录:不保存设定、版本和结果,修订后无法判断问题是否真的解决,写方法部分时也无从说明。

常见问题

AI 模拟问卷的结果能写进论文吗?

不能作为数据写进结果部分。可以在方法部分如实说明“问卷设计阶段使用 AI 模拟作答进行了预测试”,作为设计过程的一部分;研究结果和结论必须来自真实样本。

AI 扮演的虚拟受访者接近真人吗?

在理解题目、发现歧义这类任务上有参考价值,但模拟回答通常比真人更一致,不能用来估计真实态度分布,也不能替代真实受访者预测试。

涉及伦理审查的研究能用 AI 模拟问卷吗?

模拟阶段不涉及真实被试,通常不在伦理审查范围内;但正式投放和真人预测试仍需按所在机构的规定执行。

一轮模拟预测试需要多少虚拟受访者?

关键是类型覆盖而不是人数。先确定 5 至 8 种差异明显的受访者类型,每种重复运行若干次以观察答案是否稳定,比堆大量相似的虚拟受访者更有用。

这套方法只能用于问卷吗?

不只是问卷。访谈提纲、实验指导语和知情同意书同样可以先让不同类型的虚拟对象试读,检查理解障碍和表述歧义。

投放之前,先让智能体把问卷测一遍

把问卷草稿和受访者类型交给智能体,它会在云端编写代码批量模拟作答、统计回答偏差,结果保存在工作区里可复现。新注册用户免费获得一台云电脑和 $5 模型额度。

开始研究