Framework Deep Dive

用户测试五法则

Jakob Nielsen 的研究表明:对 5 位目标用户进行可用性测试,可以发现约 85% 的可用性问题。更多用户带来的边际收益急剧递减。资源有限时,多轮 5 人小测试远胜于一次大型测试。

为什么测 100 个用户还不如测 5 个?

团队通常面临两个极端:要么等待一次昂贵的大规模用户测试(耗时数月,产出堆叠报告,发现的问题根本来不及修);要么干脆不测试(直接上线,在真实用户身上发现问题)。

Nielsen 在 1993 年通过研究证明了第三条路。可用性问题的发现遵循边际递减规律:第 1 位用户揭示最明显的核心问题,到第 5 位用户,你已经开始重复听到相同的问题——收益开始急剧下降。

真正的洞见不是「5 个用户」本身,而是「多轮 5 人迭代测试」的节奏:测 5 人 → 发现问题 → 修复 → 再测 5 人 → 发现新问题 → 再修复。三轮下来,15 个人就解决了你本来需要 45 个人才能解决的问题——而且已经修好了前两轮发现的 bug。

边际递减曲线与迭代测试节奏

理解 5 用户法则的关键,是理解两件事:为什么边际收益在第 5 人后骤降,以及如何通过迭代轮次最大化每一个测试用户的价值。

可用性问题发现率 · 边际递减曲线
~31%
~22%
~15%
~10%
~7%
~5%
~4%
~2%
用户 1
用户 2
用户 3
用户 4
用户 5
用户 6
用户 7
用户 8
前 5 位用户合计发现约 85% 的可用性问题 · 之后每增加一位用户,新发现的问题数量骤降
推荐的迭代测试节奏
第一轮
5 位用户 测试 → 发现核心可用性问题
修复
修复第一轮发现的 Critical 和 Serious 问题
第二轮
5 位新用户 测试 → 验证修复效果,发现新问题
修复
修复第二轮发现的问题
第三轮
5 位新用户 → 就绪度确认
问题严重程度分级
Critical 严重
用户无法完成任务,必须立刻修复
Serious 较严重
明显影响体验,下轮测试前修复
Minor 轻微
有摩擦但不阻断,排入 Backlog
Cosmetic 表面
视觉或措辞问题,有时间再处理
严重程度分级让你不会把精力花在「修复按钮颜色」上,而是先确保用户能完成最核心的任务。一轮测试后,团队的第一个问题应该是:「有几个 Critical 问题?」——这决定了发布前还需要做什么。

出声思考法(Think Aloud Protocol)是获取数据的核心方法:让用户在操作时说出他们正在想什么,即使是碎碎念,也比事后访谈更真实。

什么时候该用它?

5 用户可用性测试适合任何需要快速发现真实交互问题的节点,特别是在开发周期内嵌入的迭代测试,而非作为发布前的一次性审查。

🚀
新功能上线前的可用性预检
在功能正式发布前,用 5 人测试快速排查关键交互路径上的障碍,降低上线后的问题风险。
⚔️
竞品比较测试
给每个竞品各 5 位用户测试相同任务,横向对比找出体验差距,数据比主观感受更有说服力。
📱
移动端 vs PC 端体验对比
同一功能在不同平台的体验差异往往比预期大,分平台各做 5 人测试可以快速量化差距。
🗺️
信息架构与导航结构验证
观察 5 位用户能否找到关键内容,是最快速验证导航设计的方式——卡片分类法的补充。
📝
表单与注册流程摩擦点排查
注册、填写、支付等高摩擦流程是最容易积累隐性问题的地方,5 人测试就能发现大多数障碍。
无障碍设计问题快速发现
邀请有特殊需求的目标用户参与测试,是发现无障碍设计盲点最直接的方法。

Intuit TurboTax
年度迭代测试循环

TurboTax 的报税产品是市场上最复杂的消费级软件之一——用户需要在压力下完成数十步操作,任何一个可用性问题都可能导致用户放弃并转向竞品。Intuit 从 2000 年代初开始,将每年的产品迭代建立在多轮 5 用户测试循环上。

以下是一个完整的迭代测试周期记录,展示了三轮测试如何在三个月内将核心可用性问题逐步消除。

Intuit TurboTax
年度可用性迭代测试循环 · 新引导式问答流程
2010s · 持续实践
三轮迭代:15 位用户,解决 3 轮问题
第一轮
5
一月
测试新「引导式问答」流程。问题:4/5 用户在「联邦税」和「州税」之间感到困惑,反复点错步骤,不清楚两者的区别和填写顺序。
修复措施:添加通俗语言解释卡片,将两个问题合并为一组,重新设计层级提示。
第二轮
5
二月
第一轮问题:混淆率从 4/5 降至 1/5,修复有效。新问题:3/5 用户不确定数据是否被自动保存,反复焦虑地多次点击「保存」按钮,担心进度丢失。
修复措施:在顶部导航栏添加实时可见的「自动保存中…」状态指示器,使用绿色对勾确认已保存。
第三轮
5
三月
两个原始问题均已解决(0/5 用户出现),没有发现新的 Critical 或 Serious 问题。流程就绪,进入宽泛 Beta 测试。
结论:3 轮 15 位用户,将核心可用性问题归零——此后大规模 Beta 测试的错误率明显低于往年。
📊
对比:一次测 15 人 vs 三轮各 5 人
一次测 15 人:能列出所有问题,但来不及修复——下一轮用户仍会遇到同样的问题
三轮各 5 人:每轮修复上一轮的问题,后续用户测试的是已改进版本,发现的都是新问题
用更少的资源解决了更多的问题——因为「修复」本身就是测试预算的一部分
🏆
TurboTax 的可用性成果
连续多年在报税软件 NPS 排名第一,被誉为最复杂品类中体验最好的产品
迭代式 5 用户测试方法被 Intuit 内部称为「可用性的心跳」,嵌入年度开发日历
每年节省的客服成本远超测试投入——发现一个问题并在上线前修复,成本是上线后修复的 1/100

让 5 用户测试真正有效的五个关键

5 用户法则很容易被误解为「只测 5 个人」,但真正的价值在于迭代节奏和测试质量。

01
5 个人是单轮次的数量,每轮测完必须先修再测。如果你测了 15 人但没有在中间修复任何问题,你只是花了三倍成本发现了同样的问题。迭代修复才是价值所在。
02
参与者必须是真实目标用户,不是同事或产品经理。内部人员对产品太熟悉,他们会「猜」出正确答案。真实用户的困惑才能反映上线后的真实情况。
03
出声思考法(Think Aloud)是核心方法:让用户说出他们在想什么。不要打断,不要解释,只要记录。用户说「我以为这个按钮是……」比任何问卷数据都有价值。
04
严重程度分级(Critical / Serious / Minor)帮助你先修最重要的。不要试图在下一轮测试前修复所有问题——只修 Critical 和 Serious,Minor 排入 Backlog,才能在规定时间内完成迭代。
05
记录真实引语,不要解读——直接引用比转述更有说服力。「我不知道这个按钮是干什么的」比「用户觉得按钮不够清晰」更能说服设计师和工程师立刻去修复。保留原话,不要翻译。

一个数学公式,终结了"测试多少用户才够"的争论

"测试5个用户就足够发现85%的可用性问题"这一结论,来自可用性研究之父雅各布·尼尔森与数学家托马斯·兰道尔1993年发表的经典论文。这项研究将可用性测试从昂贵的大规模项目转变为任何产品团队都能负担的日常实践,深刻改变了互联网时代软件产品的迭代节奏。

1980s
可用性测试在大型软件公司兴起
IBM、Apple等大型软件公司开始建立专职的可用性实验室,招募大批测试参与者(有时多达数十人)进行系统评估。这种做法成本高昂、周期漫长,仅有资金雄厚的大公司才能负担,可用性测试被视为一项奢侈的专业活动。
1990
尼尔森提出"折扣可用性工程"
雅各布·尼尔森在ACM CHI大会上提出"折扣可用性工程"(Discount Usability Engineering)概念,主张用小样本快速迭代代替大规模正式测试。他同年出版的《可用性工程》一书系统阐述了启发式评估、出声思维测试等低成本方法,为后续研究奠定基础。
1993
尼尔森与兰道尔发表"5用户法则"核心论文
尼尔森与数学家托马斯·兰道尔在《Behavior & Information Technology》期刊发表论文,用数学模型证明可用性问题的发现率遵循特定的幂律曲线,测试5个用户所发现的问题数量约为全量问题的85%,而增加更多用户的边际收益急剧递减。这一结论为小样本测试提供了严谨的定量依据。
2000
尼尔森在个人网站发布普及版文章
尼尔森在其广受关注的专业网站NNG(Nielsen Norman Group)发表文章《为何只需测试5个用户》,以通俗语言重新阐释1993年论文的核心结论,迅速在互联网产品社区中广泛传播,成为可用性研究史上引用次数最多的文章之一。
2010s至今
游击式测试与持续研究文化普及
随着Agile和精益UX运动的兴起,"每个Sprint做一轮5人测试"成为众多产品团队的标准实践。IDEO等设计公司将快速小样本测试固化为设计冲刺(Design Sprint)的核心环节,使"5用户法则"从研究结论演变为产品团队的日常工作节奏。

与这些工具搭配效果更好