数据仓库-1——开端

1.概念 数据仓库是为企业制定决策,提供数据支持——改善业务流程 1.1 数据输入——三个数据 爬虫

1.概念

数据仓库是为企业制定决策,提供数据支持——改善业务流程

1.1 数据输入——三个数据

  • 爬虫

  • 用户行为——flume——Hive(HDFS) on spark(数仓)

  • 业务数据——sqoop——Hive on spark

数据仓库

Azkaban/Oozie/Airflow/DS 全流程调度(任务调度)

1.2 数仓结构——分层

数仓进行备份、清洗、聚合、统计等

  • ODS——备份

  • DWD——清洗

形成宽表

  • DWS——按天聚合

  • DWT——累计聚合

形成报表

  • ADS——报表

1.3 数据输出

  • 数仓输出报表系统,表格数据

  • 用户画像

  • 推荐系统

  • 机器学习

2.架构设计

2.1 技术选型

  1. 数据采集传输:Flume、Kafaka(缓冲)、Sqoop、Logstash(日志文件)、DataX

  2. 数据存储:MySQL(小量数据 ADS)、HDFS(大量数据)、HBase、Redis、MongoDB

  3. 数据计算:Hive、Tez、Spark Flink、Storm(实时)

  4. 数据查询:Presto、Kylin、Impala、Druid、ClickHouse、Doris

  5. 数据可视化:Echarts、Superset、QuickBI、DataV

  6. 任务调度:Azkaba、Oozie、DolphinScheduler、Airflow

  7. 集群监控:Zabbix(离线)、Prometheus(实时)

  8. 元数据管理:Atlas

  9. 权限管理:Ranger、Sentry(被除名)

2.2 框架版本选择

选择 Apache 框架

框架

旧版本

新版本——推荐

Hadoop

2.7.2

3.1.3

Zookeeper

3.4.10

3.5.7

MySQL

5.6.24

5.7.16

Hive

1.2.1

3.1.2

Flume

1.7.0

1.9.0

Kafka

0.11-0.2

2.4.1

Kafka Eagle

1.3.7

1.4.5

Azkaban

2.5.0

3.84.4

Spark

2.1.1

3.0.0

Hbase

1.3.1

2.0.5

Phoenix

4.14.1

5.0.0

Sqoop

1.4.6

1.4.6

Presto

0.189

0.189

Kylin

2.5.1

3.0.1

Atlas

0.8.4

2.0.0

Ranger

2.0.0

2.0.0

Solr

5.2.1

7.7.0

2.3 生产集群

  • 消耗内存的分开

  • 数据传输紧密的放在一起

  • 客户端尽量放在一起,方便外部访问

  • 有依赖的尽量放在一台服务器上

2.4 测试项目集群规划

服务名称

子服务

服务器 hadoop102

服务器 hadoop103

服务器 hadoop104

HDFS

NameNode

DataNode

SecondaryNameNode

Yarn

NodeManager

Resourcemanager

Zookeeper

Zookeeper Server

Flume(采集日志)

Flume

Kafka

Kafka

Flume(消费 Kafka)

Flume

Hive

Hive

MySQL

MySQL

Sqoop

Sqoop

Presto

Coordinator

Worker

Azkaban

AzkabanWebServer

AzkabanExecutorServer

Spark

Kylin

HBase

HMaster

HRegionServer

Superset

Atlas

Solr

Jar

服务数总计

19

8

8

LICENSED UNDER CC BY-NC-SA 4.0
Comment