一、数据分析平台层次
数据源可分为离线数据、近似实时数据和实时数据,主要说明数据存储结构。流数据的核心是连续性和快速分析性。
计算层中,Spark利用集群内存加载处理数据,省去部分I/O开销,加快计算。Impala利用分布式集群和高效存储,加快大数据集查询速度,即近似实时查询。底层文件系统以HDFS为主,上层YARN是MapReduce第二版,合在一起即Hadoop最新版本。基于之上的应用有Hive、PigLatin,利用SQL思想查询Hadoop上的数据。
关键是用大数据做决策支持。R可做统计分析并利用图形展现;Mahout集数据挖掘、决策支持等算法于一身,包含基于Hadoop实现的经典算法。决策支持系统的展现通过表格和图形,数据展现工具有Tableau和Pentaho。
二、规划的数据平台产品
支持下一代企业计算关键技术的大数据处理平台,包括计算引擎、开发工具、管理工具及数据服务。计算引擎是核心,提供从多数据源异构数据进行实时数据集成、分布式环境下的消息总线、与第三方系统进行服务整合访问;设计分布式计算框架,可处理结构化和非结构化数据,并提供内存计算、规划计算、数据挖掘、流计算等服务。DataStudio包括数据建模、开发、测试等集成开发环境。管理工具包括实施、客户化及系统管理类工具。
新规划将BAP平台拆分为两部分,底层技术平台发展内存计算和数据处理,上层BI展现端重点发展仪表盘、Web和移动设备展现。两大产品通过数据处理接口和嵌入式应用服务于业务系统。
大数据处理平台为BI系统提供语义层、OLAP引擎等底层技术支撑,以及BI及ERP系统性能提升、数据挖掘、非结构化数据处理等方案。具体模块包括语义层、OLAP引擎、数据集成、数据挖掘、数据仓库、非结构化数据管理、消息总线、分布式计算系统、流计算引擎等。