科技新视野
同事想买房子,心目中有靠近市区的新组屋,以及靠近商业区的公寓,在午餐时向我们征求意见,于是大家七口八舌当起军师。有的问他的财政预算,个人喜好是组屋还是公寓,自己居住还是投资出租,交通和工作地点、环境因素和租赁市场,同住的家人的考量,转售市场等等。
至于同事最后做了什么选择,等他请我们喝入伙酒时自有分晓。由于同事有这个多方面提供数据的机会,所以在决策时就较有优势了。这么一个小小的讨论,其实概括了目前唱得火红的“数据解析”的内涵,也引申出“数据解析”实行时的各种挑战。
先来了解什么才算是“大数据”。根据IBM的定义,供我们做决定用的数据一定要多(Volume)到普通单一电脑系统不能有效处理,流量要快而及时(Velocity),来源要多方面且杂(Variety)以及数据要具备“不确定性”(Veracity),符合了4V的话,就可算是进入了“大数据”的范畴了,可以进行“数据解析”了。同事在投资新房子前所征询的各方数据,基本上算是符合了“大数据”的要求。
工业4.0时代的新宠“数据解析”,其实并不是什么神秘的东西,简单地说,它只是根据我们的“提问”,利用统计学和相关的理论,通过电脑快速的运算,以明确易懂的方式“描述”整个大环境(Description),找出问题的症结(Diagnostic),预测各种最有可能发生的情况(Prediction),最后用“人工智慧”提出解决问题的方法(Prescription),这就是整个“数据解析”的D2P2程序了。
根据人类选择的结果,也会有引起原先数据被调整的可能。如果又出现类似问题的话,整个D2P2程序会再被启动,系统从新“学习”后再提出新对策,理论上经过无数次“学习”之后,系统将会提出越来越完善的解决方法。
“数据解析”是政府和有关部门在制定新政策,拟定各行业的“游戏规矩”时有效的工具,因为当局能够轻易地得到各个有关的跨部门的数据,必要时还能在不涉及到个人隐私和商业利益下,得到更全面的数据。大公司和企业的“数据解析”,一般上都是以提高客户的消费和增加盈利为前提,由于商业的利害考量,所以不容易取得自己营业范围外的数据,更不要说是跨行业了。
比方说,商业大厦想要设计更有效的促销活动吸引消费者,除了要知道各消费群在每家商店的消费习惯和情况,也想了解顾客的财务背景,到商场消费的交通方式、付费和用信用卡的习惯,甚至借贷背景和通讯网购的接受程度等。这些数据都会影响活动的成功率,不过这些数据因为涉及了个人隐私,商家营业额和盈利,也攸关商业竞争和利益关系,还要得到公共服务各业的合作以提供数据,所以在目前是不可能顺利得到的。
在技术方面,离开要如何把种种不同形式的资料如数据、影像、视频和实体数据(如账单,收据),甚至闭路电视等等,都变成电脑能够解读和明白的资讯,还有一大段距离。
“数据解析”在大企业和大公司里已不是容易驾驭的事,在资源缺乏的中小企业和小经济体,则只能在极有限的数据里做做一般的数据分析,其效应远达不到“大数据解析”的要求。这将是所谓工业4.0的大环境里产生的“智慧数据不均”的现象,传统小企业更难在这个环境下竞争和生存。
目前唯一的希望是当局能趁早制定共享“大数据”的框架和“游戏规矩”,在不侵犯个人隐私,不危害国家安全的大前提下,把各种有关的,对企业有应用价值的数据透明化、普及化,让缺乏能力和财力的中小企业,也能有机会进入智慧数据的博弈平台公平竞争。
作者是电子工程师
