重新评估价值链|大数据并未过气,本篇告诉你关于大数据的正解与误解
上周我们进入R2的第二部分:重新定义卓越运营:周一工业4.0,周二增材制造,周三虚拟现实和增强现实,周四数字化供应链,周五服务行业的卓越运营。
本周我们继续卓越运营,主题是将数据转化为资产。昨天我们聊了数据资产与数据战略,今天我们谈谈大数据,一个“古老”的话题。
4 大数据的发展与应用
2010年前后,大数据开始变得流行,广泛地出现在商业对话中,企业开始对海量数据跃跃欲试。最初,很多企业都是在赶时髦,但到今天,大数据对企业的影响已经无法小觑。
但是,尽管企业数据的规模正在飞速增长,大数据的“大”意味着什么,很多企业并不是很清晰。
A. 大数据发展阶段
大数据其实是个老词儿,它是由时任SGI公司首席科学家的约翰·马什(John R. Marshey)于1998年提出的,当时Web刚刚诞生。
本质上,大数据并不是全新的东西,也不是过去20年才出现的。几世纪以来,人们一直在尝试使用数据分析和分析技术来支持决策。早在公元前300年,古埃及人已经尝试捕获亚历山大图书馆的所有“数据”。此外,罗马帝国曾仔细分析军队的统计数据,以确定军队的最佳分配。
不过,在过去20年中,数据的产生数量和速度发生了变化,超出了人类的理解范围。2013年,全球数据总量为4.4ZB;2020年,全球数据将急剧上升至44ZB。即使采用当今最先进的技术,也无法分析所有这些数据。如何处理这些越来越大、越来越非结构化的数据集,是过去10年传统数据分析转为“大数据”的原因。
大数据的发展,可以大致分为三个主要阶段。每个阶段都有自己的特征和能力。
大数据1.0
数据分析和大数据起源于数据库管理领域。它严重依赖于关系数据库管理系统(RDBMS)中常见的存储、提取和优化技术。
数据库管理和数据仓库是大数据1.0的核心组件。它使用众所周知的数据库查询、在线分析处理和标准报告工具等技术,为今天的现代数据分析奠定了基础。
大数据2.0
本世纪初以来,互联网和Web开始提供独特的数据收集和数据分析。随着网络流量和在线商店的扩展,雅虎、亚马逊和eBay等公司通过分析点击率、特定IP的位置数据和搜索日志来分析用户行为。这为数据分析开辟了全新的世界。
从数据分析和大数据的角度,HTTP的Web流量造成的半结构化和非结构化数据的大量增加。除了标准的结构化数据外,组织现在还需要找到新方法和解决方案来处理这些新的数据类型,以便对其进行有效的分析。社交媒体数据的增长,极大地加剧了对工具、技术和分析的需求,人们从这些非结构化数据中可以提取有意义的信息。
大数据3.0
尽管基于Web的非结构化内容仍然是许多组织在数据分析和大数据中的主要重点,但是移动设备中已经发现更大数据价值的可能性。
移动设备不仅可以分析行为数据(例如点击和搜索查询),而且还可以存储和分析基于位置的数据(GPS数据)。随着这些移动设备的进步,可以跟踪运动、分析身体行为甚至健康相关数据(每天要执行的步骤数)。这些数据为交通、城市设计和医疗保健提供了全新的机会。
同时,基于传感器的互联网设备的兴起,正以前所未有的速度增加了数据的生成。成千上万的电视、恒温器、可穿戴设备、甚至是冰箱,都成为物联网的组成部分,每天都在生成ZB级数据。从这些新数据源中提取有意义、有价值的信息的竞赛才刚刚开始。

B. 大数据是多样性非结构化数据
一、大数据是非结构化数据
由大数据发现阶段可以看出,大数据的关键不在于“大”,而在于“多”,也就是多样性的非结构化数据。
以前,企业的数据处理大多基于对结构化数据的分析。所谓结构化数据,是指那些储存在数据库中有清晰行列结构的数据, 如客户地址、存货清单、负债和财务支出等。
但是,大数据必定包含大量非结构化数据,信息并不能整齐地录入数据库表中。这些数据暗含在社交媒体上那些不合文法的句子中、智能手机拍摄的照片中、即时定位信息中、传感器记录的用户身体信息中。甚至,企业可以获取关于整个世界的信息。这些非结构化数据包含丰富的信息,却不能用传统的数据技术进行简单的编码和分析。
非结构化数据最重要的来源是社交媒体。Facebook、Twitter、微博、微信等社交网站吸引了数以十亿计的用户,用户发表的文字、评论及各种内容更新都是海量数据的潜在来源。这些社交数据是具有态度性的(言语间透露着立场、喜好和厌恶),进而可以用于分析网络关系(用户的好友、关注人等反映了社会联系,企业可以用来推断他们与网络中其他人的关系)。而且,这些数据是即时的、连续的,企业可以持续追踪人们立场、情感、对话的变化。
因此,许多企业尝试着从社交数据分析中获取灵感。一些品牌通过观测顾客反馈来评估品牌的声誉,疾病控制中心通过社交媒体监测病毒和流感的传播,好莱坞通过新电影首映后的观众评论预测上映后的票房,许多经济学家甚至通过社交媒体来预测股票的走势。
另一种典型非结构化数据是定位数据,即智能手机所记录的人们的实时位置和动向。定位数据和其他行为数据的结合提供了有 价值的场景信息。如今,搜索引擎所显示的结果不仅受搜索词的影 响,也越来越多地考虑到人们的位置信息。例如,Google上搜索 “比萨”,首先出现的是离用户最近的比萨店的地址和电话,而不是比萨的历史渊源和制作过程。研究表明,人们在手机中记录的每周行动轨迹,在很大程度上揭示了人们的背景信息,有着相似“足迹”的人更倾向于购买相似的产品,这一规律对产品市场定位实践大有裨益。
随着人们的生活被网络挟裹和覆盖,非结构化数据的最大来源将是嵌入人们周围的传感器。据预测,2020年将有超过500亿台设备通过物联网连接并分享信息,这些设备的主体将不是智能手机、网络服务器,而是物联网设备。
物联网包含智能汽车、工厂和产品供应链、灯泡和家具设备,以及手表和服装中置入的传感器,甚至包括人们服用的药物。这意味着,未来将有几十亿台数据获取和传输设备可以为企业所用。比如,通用电气公司在每台喷气式发动机上安装了传感器,使发动机持续更新其运营状态和运营信息(通用将之称为“喷气式发动机的社交网络”)。航空机械部门可以通过这些即时数据监控飞机关键设备的运转状态,以便在出现问题时及时维修,省去了以往定时检修的繁琐程序,使飞机检修更高效、也使航空旅行更方便和低价。
二、处理非结构化数据的新工具
随着大数据的迅猛发展,分析和管理非结构化数据的工具日益完善。大数据如汪洋大海,而商业洞见如一枚绣花针,工具若使用不当,从大数据中获取洞见便如大海捞针。幸运的是,一系列技术的发展正在拓展人们分析和利用大数据的能力。
如今的科技已能以低廉的成本提供大规模数据处理能力。内存计算加速了实时数据的分析能力,使企业能够综合考虑人们所在位置的天气、最近浏览过的网页及其他一切可能的影响因素,以便推送针对性内容。开源软件Hadoop能使分布在不同地方的多个服务器并行处理海量数据,使大数据的管理成本越来越低。
有的工具不关注数据处理能力,而将重点放在从杂乱无章的数据中获取信息。新型数据挖掘工具在抓取社交网站上的原始数据后,能够对其过滤,识别其中的规律,为管理者所用。
可以说,非结构化数据工具中的最大亮点是认知计算能力。例如,自然语言处理能够解读正常的人类语言,包括人们的口头指令、社交媒体中的对话、书籍和文章。这对识别大数据中人类语言模式的至关重要,如用户给客服中心打电话的电话录音。
另一项重要发展是机器学习。机器学习可以根据经验和反馈来识别自身模式,并不断提高自身能力。随着计算机对神经网络的模拟,其功能逐渐超越在非结构化数据中寻找模式的状态,它们能从周遭环境和训练者获取反馈(告知机器某个结论的正误),然后不断自我调整。
IBM Watson整合了自然语言处理和机器学习,能够读懂大量的书面语言,根据反馈和专家指导做出精准的判断。Watson首次亮相于问答竞赛,凭借百科全书式的知识积累和卓越的思能力击败了之前的冠军,并且自此之后应用于现实世界。Watson吸纳了千万条病例,对癌症的初步诊断能力要高于许多医生。Watson及其他类似的技术,将引领下一代人数据分析潮流,为客户服务、欺诈侦测、 广告策划等诸多领域作出贡献。
三、云端大数据
在以往的数据范式中,企业需要自己开发数据收集、存储和分析的设备,成本过于高昂,很多企业难以负担数据分析费用。但如今,企业不需要自己储存数据,甚至小企业也可以获得分析非结构化数据的关键工具。其中的关键,就是云计算的发展。
比如Siri,在手机断网时是不能使用的,因为理解所接收的语言、并对之做出反应的计算过程太复杂,手机本身的处理器难以实现。但连接到云端后,Siri就如鱼得水了。你的手机只需要一个稳定的连接,将语音远程传送到有着强大的处理非结构化数据能力的服务器,便可对接收到的语音做出即时反应。
越来越多的应用和服务可以在互联网上实现无缝交付,因此,很多即时的数据处理并不发生在人们的手机或电脑中,而是在云端。亚马逊、微软、Google及许多其他公司都不再在办公室安装功能强大的计算机,转而发展云端环境,通过订阅和 SaaS服务来满足相应的需求。
云计算对小公司有深远的影响。像Watson一样的服务,企业现在随时可以使用,就像小公司现在可以轻易获取云存储和客户数据库一样。这意味着,大数据并非为拥有庞大IT部门的世界知名企业所独有,所有的公司都能从SAP、IBM等供应商获得一流的分析工具,而只需要为所用数据付费。大数据再也不是天价了。
C. 发展大数据的三个误解
大数据的发展正影响着各行各业,但大部分企业还都“玩不转”大数据,常常存在一些误解。
误解一:算法能解决一切问题
大数据“神奇故事”,造成一种假象:要想打造智能城市和企业,只要将功能最强大的计算机凑在一起,让它们去分析非结构化数据,找出规律,商业洞见自然会浮现出来。显然,数据分析不是这样完成的。
要使大数据发生效用,不仅需要机器和算法,更需要许多专家的参与,因为数据质量和准确性非常重要。数据是怎样收集的?误差率如何?样本是否有代表性?如果进行比对,不同的数据库中数据格式是否相同?因此,数据处理中的许多工作必须人工操作,很多尺度是计算机搞定的。
另一方面,数据分析的算法也会出现各种偏差,毕竟它受到开发人员的主观影响。比如,某程序可以帮助企业筛选出最佳应聘者的简历,但是基于过去招聘经历的筛选结果,并不一定能满足公司未来所需要的技能。
更重要的是,决策管理者的智慧不可替代,他们需要提出正确的问题:公司现阶段最关心的是什么?数据呈现的哪些模式可以直接为公司所用?算法虽然越来越容易寻找答案,但关键还是寻找什么问 题的答案。
误解二:相关分析至上
由于某些著作的流行,许多“砖家”一再指出,有了大数据,就再也不需要考虑因果关系,只关注相关关系即可。这种观点的潜在逻辑是,通过大数据分析得到的规律近乎事实,无须再依赖人们所认知的因果判断。
这种观点显然是不可取的。管理者需要分清相关分析和因果分析之间的差异,以及这种差异什么时候重要、什么时候不重要。简单地说,如果仅仅需要预测分析,数据之间的相关关系或许足够;但如果你想改变前提条件,就必须考虑因 果关系。
例如,你的广告策划团队发现,上海的已婚女性对你的护发产品更感兴趣,但是你无法通过鼓励上海的女性结婚来增加产品销量。不过,发现这一规律后,你可能会考虑将产品定位于上海的已婚 女性群体。在这种情形下,仅需要知道相关关系就可以了。
误解三:大数据是万金油
对大数据最夸张的误解,是将大数据与数据战略混为一谈。在很多时候,企业完全可以建立“小”数据库,并将之应用到数据战略,而不一定非要使用大数据。
数据并不一定非“大”不可。结构化的“小”数据,如客户的点击行为,顾客会点击网页的什么位置、什么时候下拉屏幕、停留了多长时间、是否将商品放入购物车等等,照样可以获得许多有价值的信息。即使Facebook这样为许多大型服务器集群提供大数据的企业,其工程师每天处理的大多数问题也可以在一台运转良好的wh w 电脑上完成。
数据战略的关键在于为企业提供价值,有时候需要大数据,有时候并不需要。
