1.日志采集Flume 1.1 flume 安装 1.1.1 集群规划
3. 用户行为数据生成和采集 3.1 数据生成模块 3.1.1 目标数据 页面 事件 曝光 <
1.分布式安装部署 本项目使用 apache-zookeeper-3.5.7-bin.tar.gz 1.1 集群规划 在 hadoop102、hadoop103 和 hadoop104 三个节点上部署 Zookeeper。
8.配置历史服务器 8.1 配置 mapred-site.xml cd $HADOOP_HOME/etc/hadoop
vim mapred-site.xml 在该文件里面增加如下配置: <!-- 历史服务器端地址 -->
<
问题原因 国内网络不能访问外网,所以需要将mirrorlist.centos.org替换为国内可以访问的镜像源(替换为阿里云): 问题解决 1.镜像源替换
5.完全分布式运行模式 准备三台客户机(关闭防火墙、静态 IP、主机名称)——已完成(hadoop102、hadoop103、hadoop104) 安装 JDK——hadoop102 已完成 配置环境变量——hado
1.概念 数据仓库是为企业制定决策,提供数据支持——改善业务流程 1.1 数据输入——三个数据 爬虫
有关于分布式文件系统和Fastdfs的详细介绍请见下面附件: /fastdfs.pdf