Framework Deep Dive

PURE 可用性评估

通过专家走查从 Purposeful(目标明确性)、Usable(操作可用性)、Reliable(流程可靠性)、Enjoyable(体验愉悦性)四个维度快速评估产品体验质量,无需用户参与,适合快速迭代场景。

不用招募用户,也能快速发现体验问题

传统用户测试需要招募参与者、安排时间地点、整理录像分析——这些在快速迭代的产品开发节奏下往往来不及。PURE(Pragmatic Usability Rating by Experts)可用性评估框架,为这个矛盾提供了一个务实的解法:通过训练有素的专家走查,在数小时内获得具有参考价值的体验评估结论。

PURE 框架由 Jeff Sauro 和 James Lewis 在可用性研究实践中发展而来,强调从用户完成任务的角度出发,而非从设计美观度评价。它的核心假设是:一个经验丰富的产品或 UX 专家,能够在系统性框架的指引下,识别出真实用户会遇到的大多数高严重性问题,即使没有真实用户参与测试。

对产品经理而言,PURE 尤其适合在以下情境中使用:设计评审前的自我检验、竞品体验对比分析、迭代上线前的快速质检,以及资源不足以支撑完整用户研究时的体验基线评估。

PURE 的四个评估维度

每个维度聚焦用户与产品交互的不同层面,评分通常采用 1-3 分或 1-5 分制,分别对应「严重问题 / 轻微问题 / 无问题」:

P
Purposeful
目标明确性
用户能否清楚理解当前页面/功能的用途?操作路径是否与用户心智模型匹配?
用户知道自己现在在哪吗?
页面传达的目的是否清晰?
导航/信息架构是否符合预期?
U
Usable
操作可用性
用户能否顺利完成核心操作?是否存在导致操作失败或中断的障碍?
核心操作路径是否顺畅?
是否有难以发现的关键入口?
错误提示是否足够清晰可操作?
R
Reliable
流程可靠性
产品在不同场景、不同状态下的表现是否一致可预期?异常情况是否被妥善处理?
边缘情况是否被考虑?
加载/错误状态是否有反馈?
跨设备/跨场景体验是否一致?
E
Enjoyable
体验愉悦性
使用过程是否让人愉悦?视觉呈现、微交互和整体情感体验是否符合品牌预期?
视觉设计是否赏心悦目?
操作反馈是否有情感温度?
整体使用感受是否轻松愉快?

如何给每个维度打分?

PURE 采用简单的三分制评分(可根据需要扩展为五分制),每个评分对应明确的行动建议:

分值 含义 用户影响 建议行动
1 严重问题 用户可能无法完成任务,或会产生明显挫败感 上线前必须修复,阻断发布
2 轻微问题 用户会遇到困难或困惑,但通常能最终完成任务 纳入下一迭代优先处理
3 无明显问题 该维度表现符合预期,用户不会受到明显阻碍 记录为参考基线,持续监控

评分完成后,将每个维度的得分汇总为雷达图或热力矩阵,可以直观地发现哪些流程/页面的哪个维度问题最集中。建议多名评估者独立打分后汇总讨论,比单人评估更可靠。

一次 PURE 评估怎么做?

01
定义评估范围与用户任务
30 分钟
明确本次评估的产品范围(是整个 App 还是特定流程),并列出 3-5 个核心用户任务(例如:「新用户完成首次注册并发送第一条消息」)。任务要从用户目标出发,而非功能描述,这决定了评估视角的准确性。
02
组建评估团队(2-4 人为佳)
1 小时准备
PURE 依赖专家判断,建议组建由产品经理、UX 设计师、有经验的工程师构成的混合团队。每人独立评估,避免相互影响。如果只有一人,则应该格外注意自身盲区——太熟悉产品的人往往看不见对新用户显而易见的问题。
03
逐任务走查并打分
2–4 小时
评估者以目标用户身份,逐步完成每个用户任务,在每个关键步骤对 P、U、R、E 四个维度各打一个分数,并记录具体问题描述和截图/录屏证据。问题描述要具体:「注册页第二步的「继续」按钮在深色手机上对比度不足,容易被忽略」比「按钮设计有问题」更有价值。
04
汇总评分,识别高优先级问题
1–2 小时
将所有评估者的分数汇总,取平均值或讨论分歧点。多人都打 1 分的问题是最高优先级,无争议的严重问题。分歧较大(有人打 1 分,有人打 3 分)的问题需要重点讨论,往往隐藏着最有价值的洞察:为什么同一个问题熟悉产品的人没感受到,而新人却觉得很严重?
05
输出问题清单,分级处理
半天
按严重性和影响范围将问题分为「阻断级(P0)/ 重要(P1)/ 优化(P2)」三级,对应「上线前必须修复 / 下版本处理 / 积压池观察」三种处置策略。输出文档需包含问题描述、复现步骤、当前体验截图、建议改进方向,才能真正驱动后续行动。

某电商 App 结账流程的 PURE 评估

电商结账流程
移动端 · 新用户首次购买任务 · 专家走查
3人团队 · 半天完成
🔍
发现的典型问题
P
结账第二步标题为「填写信息」——评分 1 分。用户不清楚是地址还是支付信息,导致焦虑感,建议改为「确认收货地址」
U
优惠券输入框在键盘弹出后被遮挡——评分 1 分。导致部分用户直接放弃使用优惠券,影响转化率
R
支付失败时错误信息仅显示「系统错误」——评分 1 分。用户无从判断是卡余额不足还是网络问题,大量用户直接流失
E
支付成功动画缺失——评分 2 分。相比竞品有明显差距,情感体验单薄,影响用户分享意愿
📊
评估结果与行动
1
3 个 P0 问题:标题歧义、键盘遮挡、错误信息不明——在当次迭代上线前全部修复
2
修复 P 和 U 维度问题后,结账完成率在 A/B 测试中提升 11%,验证了专家评估的准确性
3
支付成功动画(P2)纳入下一个迭代,作为情感化设计专项改进的起点

PURE 的边界:什么时候用,什么时候不够用?

适合用 PURE 的场景
快速迭代中的体验质检、设计方案评审前的自检、资源有限时的基线评估、竞品体验的结构化比较——这些场景都能从 PURE 中获得显著价值。
⚠️
PURE 无法替代真实用户研究
专家走查无法发现「用户为什么有这个行为」的深层动因,也无法暴露专家预设之外的用户行为模式。重大产品决策仍需真实用户验证。
⚠️
避免评估者「产品盲区」
长期使用某产品的评估者,对习以为常的体验问题往往视而不见。建议引入对产品不熟悉的「新鲜眼睛」,或请非产品背景的同事参与评估。
💡
与 HEART 框架配合使用
PURE 擅长发现具体的可用性问题(What),HEART 框架擅长追踪体验的整体趋势(How much)。两者结合,能构建从问题识别到效果追踪的完整体验度量闭环。

谷歌将可用性研究工程化的方法论实践

PURE(Pragmatic Usability Rating by Experts)是由谷歌用户体验研究团队开发的专家评估方法,旨在以低成本、高效率的方式对产品可用性进行结构化评分。它将传统可用性评估中依赖启发式专家判断的模糊流程,转化为可量化、可追踪的标准化工具。

1994
尼尔森启发式评估奠定专家评审基础
雅各布·尼尔森(Jakob Nielsen)发布十条可用性启发式原则,确立了专家评审作为可用性测试补充手段的学术地位。启发式评估方法证明了少数专家能够以低成本发现产品中大多数严重的可用性问题,为后续专家评分类工具的发展提供了方法论基础。
2000年代
企业级可用性评估需求持续增长
随着互联网产品规模扩大,用户研究团队面临"如何在有限资源下对大量界面进行系统性评估"的现实挑战。各大科技公司开始探索将定性专家判断转化为可量化分数的方法,以便在跨团队、跨产品线之间进行横向比较和优先级排序。
2013年前后
谷歌UX团队开发PURE方法
谷歌用户体验研究团队针对内部大规模产品评估需求,开发出PURE评分体系。该方法要求评估者针对每项用户任务从"是否可完成""完成难度""是否需要帮助"等维度进行结构化打分,将主观的可用性判断转化为可统计的量化数据,极大地提升了跨产品比较的可行性。
2015至今
方法论向行业开放并被广泛采用
谷歌研究人员在学术会议与行业论坛上分享PURE方法的实践经验,使其逐渐在UX研究社区中传播开来。众多中大型科技公司将PURE纳入UX研究工具箱,与可用性测试、认知走查等方法组合使用,成为产品可用性基准化测试的重要选项。

与这些工具搭配效果更好