可用性测试:用评估方法来研究用户
在学校里,老师对学习成果的检测可以分为总结性评估和形成性评估两大类。
总结性评估检测学生对学习成果的综合掌握程度。类似于期末测验,它在结束一段时间的学习后进行,用分数表示成绩,然后进一步分析得分状况,算出成绩分布、平均成绩等。
形成性评估则在某个学习阶段进行。它收集学生的理解程度,以及为了让更好地掌握应如何改进教学等反馈信息,类似于课后小测验或小论文等。形成性评估的目的不是打分,而是为了改善。
如果总结性评估的结果很差,就需要重新学习相同的内容,比如留级。在需要排名或选拔时,总结性评估是很好的方法,但对以提高能力为根本目的的教育而言,还是形成性评估更有意义。
同样地,产品的可用性评估也可以分为形成性评估(formative evaluations)和总结性评估(summative evaluations)。
1 形成性评估更重要
总结性评估通常在产品开发生命周期后期进行,用于评估对高保真原型或实际产品。
比较典型的可用性总结性评估是性能测试法。例如,安排几十个用户界面,检验它们的目标达成率、所需时间以及主观满意度等。评估结果一般采用打分形式,例如:
- 目标达成率:55%
- 平均达成时间:5分30秒
- 主观满意度(5分制):2.8分
形成性评估在产品开发生命周期早中期进行,用于发现产品思路、为设计指明方向。
比较典型的可用性形成性评估是发声思考法。一般安排5~6名用户一边操作产品,一边把正在想的内容说出来。因为参与人数较少,计算满意程度、达成率等指标的平均值是没有意义的,所以评估结果大多是具体的内容,比如:提交按钮和重置按钮并排放在一起,经常容易会点错等。
形成性评估可以在产品设计的过程中反复使用。不过,产品经理或许会觉得,如果未能得出具体的测试数据就不算真正做过测试,所以用低保真原型来测试目标达成时间也是一种可能性。
在评估产品可用性时,应该先确定产品目前所处的阶段:即将开始、还是进行中或已经结束?阶段能够确定的话,可用性测试的方法也就可以明确了。
如果出于赶进度、省成本的考虑,只进行总结性评估,那肯定是完全无效的投资。例如,即使你在性能测试中得知目标达成率50%,但却不知道为什么另外一半用户未能达到目标;即使知道主观满意度很低,但也无法得知究竟是哪部分的用户体验不好。
不做形成性评估、只做总结性评估,就和“什么都没学就参加期末考试”一样,结果一定不好,从中也不会得到任何改善方案。总结 性评估应该是在做过很多努力之后,为了更好地掌握成果而采取的评估方法。
2 分析法和实验法
产品可用性评估方法也可以分为分析法(analytics method)和实验法(empirical method)。
分析法也称为专家评审,是一种让产品可用性工程师或用户体验设计师等专家基于自身的专业知识和经验进行评估的一种方法。
实验法收集货真价实的用户使用数据,例如用户测试、问卷调查等方法。
在比较总结性评估和形成性评估时,设计团队认为形成性评估比较重要,但分析法和实验法却难分高下。某种意义上,分析法和实验法是一种互补关系。
| 分析法 | 实验法 |
| 主观 | 客观 |
| 评估结果是假设的 | 评估结果是“事实” |
| 时间少、费用小 | 时间长、花费大 |
| 评估范围较广 | 评估范围较窄 |
| 设计初期也可评估 | 必须准备原型才能评估 |
比如,在只有规格说明书的设计初期阶段,实验法是不可能用来做评估的。即使让用户看规格说明书,也不会得到任何评估结果,只能让专业的可用性工程师来评估(分析法)了。
一般来说,在设计用户测试时,最好先进行简单的分析法评估,理出用户测试时应该要评估的重点和需要重点观察的部分。仓促、粗糙的用户测试并不能带来任何有效的评估结果。
与实验法相比,分析法还有一个优点,那就是时间和费用的消耗较小。如果请用户专门来做一次1~2小时的用户测试,当然需要提供报酬。从实验准备到结束,至少需要几天时间。但如果使用分析法,只要评估人员的时间精力没问题,当天就可以得出评估结果。
不过,分析法也存在很大的缺点:通过分析法得到的结果,是分析者本人的假设或观点。
比如,可能会出现虽然可用性工程师在做完分析法评估后提交了报告,但产品设计人员仍然坚持己见的情况。因为分析法并不基于数据的评估,所以当意见不一致时,并不能够提出支持自己意见的有力证据。因此,指出的产品可用性问题到底是不是问题,有时并不能得出最终结论;若不指出具体问题,更无法讨论寻找解决方案。
如果单纯依赖分析法,可能会陷入无休止的争论中。为了尽快结束毫无意义的争论,必须引进实验法。
小结
与实地研究一样,我们用“可用性测试”来代表一系列可用性评估方法。本节是综述,包括两项主要内容:
- 形成性评估 vs 总结性评估;
- 分析法 vs 试验法。
