第一章.Hive基本概念

1. 什么是Hive

  1. # hive简介
  2. - Hive是由Facebook开源用于解决海量结构化日志的数据统计工具
  3. - Hive是基于Hadoop的一个数据仓库工具,可以将结构化的数据文件映射为一张表,并提供类SQL查询功能
  4. # hive本质
  5. - 将HQL转化成MapReduce程序
  6. 1. Hive处理的数据存储在HDFS上
  7. 2. Hive分析数据底层的实现是MapReduce
  8. 3. 执行程序运行在Yarn上

$01[Hive安装与配置] - 图1

2.Hive的优缺点

  1. # hive优点
  2. - 操作接口采用类SQL语法,提供快速开发的能力
  3. - 避免了去写MapReduce,减少开发人员的学习成本
  4. - Hive优势在于处理大数据,支持海量数据饿分析与计算
  5. - Hive支持用户自定义函数,用户可以根据自己的需求来实现自己的函数
  6. # hive缺点
  7. - Hive的HQL表达能力有限
  8. 1. Hive自动生成的MapReduce作业,通常情况下不够智能化
  9. 2. 数据挖掘方面不擅长,由于MapReduce数据处理流程的限制,效率更高的算法缺无法实现
  10. - Hive的效率比较低
  11. 1. Hive的执行延迟比较高,因此Hive常用于数据分析,对实时性要求不高的场合
  12. 2. Hive调优比较困难,粒度较粗
  13. - Hive不支持实时查询和行级别gengxin
  14. 1. Hive分析的数据是存储在hdfs上,hdfs不支持随机写,只支持追加写,所以在hive中不支持delete和update,只能select和insert

3.Hive架构原理

$01[Hive安装与配置] - 图2

  1. Hive通过给用提供一系列交互接口,接收到用户的指令(SQL),使用自己的Driver,结合元数据(MetaStore),将这些指令翻译成MapReurce,提交到hadoop中执行,最后将执行返回的结果输出到用户交互接口

4.Hive和数据库比较

  1. HIve采用类SQL的查询语言HQL
  2. HIve中不建议对数据的读写,所有的数据都是在加载的时候确定的

第二章.Hive安装

1.hive官网

http://hive.apache.org/

2.MySQL安装

  1. 检查是否安装MySQL等相关软件
  1. rpm -qa|grep mariadb
  2. #如果安装了先卸载
  3. sudo rpm -e --nodeps mariadb-libs-5.5.56-2.el7.x86_64
  1. 将MySQL安装包拷贝到/opt/software目录下
  2. 安装MySQL,按照顺序依次执行
  1. sudo rpm -ivh mysql-community-common-5.7.28-1.el7.x86_64.rpm
  2. sudo rpm -ivh mysql-community-libs-5.7.28-1.el7.x86_64.rpm
  3. sudo rpm -ivh mysql-community-libs-compat-5.7.28-1.el7.x86_64.rpm
  4. sudo rpm -ivh mysql-community-client-5.7.28-1.el7.x86_64.rpm
  5. sudo rpm -ivh mysql-community-server-5.7.28-1.el7.x86_64.rpm
  1. 初始化数据库
  1. sudo mysqld --initialize --user=mysql
  1. 查看临时生成的root用户的密码
  1. sudo cat /var/log/mysqld.log
  1. 启动MySQL服务
  1. sudo systemctl start mysqld
  2. sudo systemctl start mysqld //启动MySQL服务
  3. sudo systemctl status mysqld //查看MySQL服务状态
  4. sudo systemctl is-enbaled mysqld //查看是否是开机自启
  1. 登录MySQL
  1. mysql -u root -p 密码
  1. 修改密码
  1. set password=password("密码");
  1. 修改root可以登录MySQL的主机
  1. update mysql.user set host='%' where user='root';
  2. flush privileges; #刷新

3.Hive安装

  1. 把apache-hive-3.1.2-bin.tar.gz上传到linux的/opt/software目录下
  2. 解压apache-hive-3.1.2-bin.tar.gz到/opt/module/目录下面
  1. tar -zxvf /opt/software/apache-hive-3.1.2-bin.tar.gz -C /opt/module/
  1. 修改apache-hive-3.1.2-bin.tar.gz的名称为hive
  1. mv /opt/module/apache-hive-3.1.2-bin/ /opt/module/hive
  1. 修改/etc/profile.d/my_env.sh,添加环境变量
  1. sudo vim /etc/profile.d/my_env.sh
  1. 添加内容
  1. #HIVE_HOME
  2. export HIVE_HOME=/opt/module/hive
  3. export PATH=$PATH:$HIVE_HOME/bin
  1. 解决日志Jar包冲突
  1. mv $HIVE_HOME/lib/log4j-slf4j-impl-2.10.0.jar $HIVE_HOME/lib/log4j-slf4j-impl-2.10.0.bak

4.Hive的元数据部署到MySQL

  1. 将MySQL的JDBC驱动拷贝到Hive的lib目录下
  1. cp /opt/software/mysql-connector-java-5.1.37.jar $HIVE_HOME/lib
  1. 在$HIVE_HOME/conf目录下新建hive-site.xml文件
  1. touch $HIVE_HOME/conf/hive-site.xml
  1. <?xml version="1.0"?>
  2. <?xml-stylesheet type="text/xsl" href="configuration.xsl"?>
  3. <configuration>
  4. <!-- jdbc连接的URL -->
  5. <property>
  6. <name>javax.jdo.option.ConnectionURL</name>
  7. <value>jdbc:mysql://hadoop102:3306/metastore?useSSL=false</value>
  8. </property>
  9. <!-- jdbc连接的Driver-->
  10. <property>
  11. <name>javax.jdo.option.ConnectionDriverName</name>
  12. <value>com.mysql.jdbc.Driver</value>
  13. </property>
  14. <!-- jdbc连接的username-->
  15. <property>
  16. <name>javax.jdo.option.ConnectionUserName</name>
  17. <value>root</value>
  18. </property>
  19. <!-- jdbc连接的password -->
  20. <property>
  21. <name>javax.jdo.option.ConnectionPassword</name>
  22. <value>123456</value>
  23. </property>
  24. <!-- Hive默认在HDFS的工作目录 -->
  25. <property>
  26. <name>hive.metastore.warehouse.dir</name>
  27. <value>/user/hive/warehouse</value>
  28. </property>
  29. <!-- 指定hiveserver2连接的端口号 -->
  30. <property>
  31. <name>hive.server2.thrift.port</name>
  32. <value>10000</value>
  33. </property>
  34. <!-- 指定hiveserver2连接的host -->
  35. <property>
  36. <name>hive.server2.thrift.bind.host</name>
  37. <value>hadoop102</value>
  38. </property>
  39. <!-- 指定存储元数据要连接的地址 -->
  40. <property>
  41. <name>hive.metastore.uris</name>
  42. <value>thrift://hadoop102:9083</value>
  43. </property>
  44. <!-- 元数据存储授权 -->
  45. <property>
  46. <name>hive.metastore.event.db.notification.api.auth</name>
  47. <value>false</value>
  48. </property>
  49. <!-- Hive元数据存储版本的验证 -->
  50. <property>
  51. <name>hive.metastore.schema.verification</name>
  52. <value>false</value>
  53. </property>
  54. <!-- hiveserver2的高可用参数,开启此参数可以提高hiveserver2的启动速度 -->
  55. <property>
  56. <name>hive.server2.active.passive.ha.enable</name>
  57. <value>true</value>
  58. </property>
  59. </configuration>
  1. 登陆MySQL
 mysql -uroot -p123456
  1. 新建Hive元数据库
create database metastore;
  1. 初始化Hive元数据库
schematool -initSchema -dbType mysql -verbose

5.启动Hive

  1. 常规启动
hive --service metastore 
hive --service hiveserver2
#注意:启动后窗口不能再操作,需打开一个新的shell窗口做别的操作
  1. 脚本启动
1.#新建脚本
vim $HIVE_HOME/bin/hiveservices.sh
2.#添加如下内容
#!/bin/bash
HIVE_LOG_DIR=$HIVE_HOME/logs
if [ ! -d $HIVE_LOG_DIR ]
then
    mkdir -p $HIVE_LOG_DIR
fi
#检查进程是否运行正常,参数1为进程名,参数2为进程端口
function check_process()
{
    pid=$(ps -ef 2>/dev/null | grep -v grep | grep -i $1 | awk '{print $2}')
    ppid=$(netstat -nltp 2>/dev/null | grep $2 | awk '{print $7}' | cut -d '/' -f 1)
    echo $pid
    [[ "$pid" =~ "$ppid" ]] && [ "$ppid" ] && return 0 || return 1
}

function hive_start()
{
    metapid=$(check_process HiveMetastore 9083)
    cmd="nohup hive --service metastore >$HIVE_LOG_DIR/metastore.log 2>&1 &"
    cmd=$cmd" sleep 4; hdfs dfsadmin -safemode wait >/dev/null 2>&1"
    [ -z "$metapid" ] && eval $cmd || echo "Metastroe服务已启动"
    server2pid=$(check_process HiveServer2 10000)
    cmd="nohup hive --service hiveserver2 >$HIVE_LOG_DIR/hiveServer2.log 2>&1 &"
    [ -z "$server2pid" ] && eval $cmd || echo "HiveServer2服务已启动"
}

function hive_stop()
{
    metapid=$(check_process HiveMetastore 9083)
    [ "$metapid" ] && kill $metapid || echo "Metastore服务未启动"
    server2pid=$(check_process HiveServer2 10000)
    [ "$server2pid" ] && kill $server2pid || echo "HiveServer2服务未启动"
}

case $1 in
"start")
    hive_start
    ;;
"stop")
    hive_stop
    ;;
"restart")
    hive_stop
    sleep 2
    hive_start
    ;;
"status")
    check_process HiveMetastore 9083 >/dev/null && echo "Metastore服务运行正常" || echo "Metastore服务运行异常"
    check_process HiveServer2 10000 >/dev/null && echo "HiveServer2服务运行正常" || echo "HiveServer2服务运行异常"
    ;;
*)
    echo Invalid Args!
    echo 'Usage: '$(basename $0)' start|stop|restart|status'
    ;;
esac
3#添加执行权限
chmod +x $HIVE_HOME/bin/hiveservices.sh
4.#启动Hive后台服务(需要先启动hadoop)
hiveservices.sh start
#hiveJDBC访问
beeline -u jdbc:hive2://hadoop102:10000 -n atguigu
#hive客户端访问
hive

6.HIve常见属性配置

6.1.Hive运行日志信息配置

  1. 修改$HIVE_HOME/conf/hive-log4j.properties.template文件名称为hive-log4j.properties
mv hive-log4j.properties.template hive-log4j.properties
  1. 在hive-log4j.properties文件中修改log存放位置
property.hive.log.dir=/opt/module/hive/logs

6.2.Hive启动jvm堆内存设置

  1. 修改$HIVE_HOME/conf下的hive-env.sh.template为hive-env.sh
mv hive-env.sh.template hive-env.sh
  1. 将hive-env.sh其中的参数 export HADOOP_HEAPSIZE=1024的注释放开,重启hive。

$01[Hive安装与配置] - 图3

6.3.参数配置方式

  1. 查看当前所有的配置信息
hive>set;
  1. 参数配置的三种方式
  • 配置文件方式: 默认配置文件 : hive-default.xml 用户自定义配置文件 : hive-site.xml
  • 命令行参数方式: hive -hiveconf mapred.reduce.tasks=10;注意仅对本次hive启动有效
  • 参数声明方式: set mapred.reduce.tasks=100;仅对本次hive启动有效