在技术尚未实现之前,由真人在幕后扮演系统角色,让用户相信他们在与真实产品交互。用极低成本验证用户是否会真正使用这个功能,以及他们会如何使用。
构建 AI 功能、语音界面或复杂自动化需要数月工程时间。但问题不是「能不能建出来」,而是「用户到底会不会用」以及「他们遇到问题时会怎么反应」。
传统方法是做用户访谈——问用户「如果有这个功能,你会用吗?」。但人们对假设性问题的回答和他们的真实行为往往大相径庭:70% 的人说「会用」,真正用的只有 20%。
Wizard of Oz 测试解决了这个根本问题:让用户相信他们在使用真实产品,观察他们的真实行为。幕后有真人实时模拟系统响应,用户毫不知情。你得到的是行为数据,而不是意见数据——在写第一行代码之前。
Wizard of Oz 测试的核心设置是「前台」和「后台」的分离:用户看到的是一个「可运行的产品」,实际上是一个人工操作员在实时模拟系统行为。
Wizard of Oz 测试最适合「技术复杂但行为验证急迫」的场景——当你需要真实用户行为数据,但还没有(或不想花费)技术资源来建出完整产品时。
1984 年,IBM 研究员 John Kelley 需要了解:如果计算机真的能够理解人类语言,人们会自然地怎样说话?当时的语音识别技术极为有限,无法支撑真实测试。Kelley 的解决方案开创了一个全新的研究方法。
Wizard of Oz 测试的核心风险是被用户发现真相——一旦用户怀疑有人工介入,测试数据就会失真。以下是确保测试质量的关键实践。
Wizard of Oz测试法由卡内基梅隆大学研究员约翰·凯利于1980年在HCI研究中首次系统化应用,其核心思想是让人类操作者在用户不知情的情况下在后台模拟系统功能,从而在真实技术构建完成前验证交互设计的可行性与用户接受度。这一方法在AI产品原型验证中经历了超过四十年的持续演进。