hive split函数 hive principal

转载

编程梦想实现家 2023-05-31 07:35:00

文章标签 hive split函数 hive hadoop Hive 文章分类 Hive 大数据

1、hive连接集群

先执行 beeline

然后按图所示输入：!connect jdbc:hive2://hadoop02:10000

按回车，然后输入用户名，这个用户名就是安装 hadoop 集群的用户名

!connect jdbc:hive2://10.110.13.34:10500/default;principal=hive/idap-agent-34.idap.com@IDAP.COM

上面的这条命令就是使用beeline连接的，default是默认的数据库，principal是票据信息

2、创建库创建表等相关信息

hive建表分为好多格式，找一个最简单的格式textfile为例：

create table test1(id int,name string,city string) row format delimited fields terminated by ',';

创建一个avro:

create table wjtest.t4 ROW FORMAT SERDE 'org.apache.hadoop.hive.serde2.avro.AvroSerDe' STORED AS INPUTFORMAT 'org.apache.hadoop.hive.ql.io.avro.AvroContainerInputFormat' OUTPUTFORMAT 'org.apache.hadoop.hive.ql.io.avro.AvroContainerOutputFormat' TBLPROPERTIES ('avro.schema.url'='/avscs/twitter.avsc')

创建csv表，涉及到托管表与非托管表：

CREATE TABLE csv_table(c1 string,c2 string,c3 string,c4 string,c5 string,c6 string,c7 string)
ROW FORMAT SERDE 'org.apache.hadoop.hive.serde2.OpenCSVSerde' WITH SERDEPROPERTIES 
(   "separatorChar" = "\t",   "quoteChar"     = "'",   "escapeChar"    = "\\")  STORED AS TEXTFILE;   
 
CREATE external TABLE oldcsv(c1 string,c2 string,c3 string,c4 string,c5 string,c6 string,c7 string)
ROW FORMAT SERDE 'org.apache.hadoop.hive.serde2.OpenCSVSerde' WITH SERDEPROPERTIES 
(   "separatorChar" = "\001",   "quoteChar"     = "'",   "escapeChar"    = "\\")  STORED AS TEXTFILE location '/oldcsv';   
CREATE external TABLE oldcsv(c1 string,c2 string,c3 string,c4 string,c5 string,c6 string,c7 string)
ROW FORMAT SERDE 'org.apache.hadoop.hive.serde2.OpenCSVSerde' WITH SERDEPROPERTIES 
(   "separatorChar" = "\001",   "quoteChar"     = "'",   "escapeChar"    = "\\")  STORED AS TEXTFILE location '/oldcsv';   
create external TABLE dspc_tb(pagekey string,url  string,site string,title string,content_dom string,cdate string,kind string, 
 crawl_time string,note string)
ROW FORMAT SERDE 'org.apache.hadoop.hive.serde2.OpenCSVSerde' WITH SERDEPROPERTIES 
(   "separatorChar" = "\t",   "quoteChar"     = "'",   "escapeChar"    = "\\")  STORED AS TEXTFILE location '/crawl_data';

3.分区表的作用

在Hive Select查询中一般会扫描整个表内容，会消耗很多时间做没必要的工作。有时候只需要扫描表中关心的一部分数据，因此建表时引入了partition概念。分区表指的是在创建表时指定的partition的分区空间。

Hive可以对数据按照某列或者某些列进行分区管理，所谓分区我们可以拿下面的例子进行解释。
当前互联网应用每天都要存储大量的日志文件，几G、几十G甚至更大都是有可能。存储日志，其中必然有个属性是日志产生的日期。在产生分区时，就可以按照日志产生的日期列进行划分。把每一天的日志当作一个分区。
将数据组织成分区，主要可以提高数据的查询速度。至于用户存储的每一条记录到底放到哪个分区，由用户决定。即用户在加载数据的时候必须显示的指定该部分数据放到哪个分区。

create table t1(
    id      int
   ,name    string
   ,hobby   array<string>
   ,add     map<String,string>
)
partitioned by (pt_d string)
row format delimited
fields terminated by ','
collection items terminated by '-'
map keys terminated by ':'
;

需要装载的文件内容如下：

1,xiaoming,book-TV-code,beijing:chaoyang-shagnhai:pudong
2,lilei,book-code,nanjing:jiangning-taiwan:taibei
3,lihua,music-book,heilongjiang:haerbin

开始装载数据：

load data local inpath '/home/hadoop/Desktop/data' overwrite into table t1 partition ( pt_d = '201701');

查看分区

show partitions t1;

在创建一份数据并装载，分区=‘000000’

load data local inpath '/home/hadoop/Desktop/data' overwrite into table t1 partition ( pt_d = '000000');

查询相应分区的数据

select * from t1 where pt_d = ‘000000’

添加分区，增加一个分区文件

alter table t1 add partition (pt_d = ‘333333’);

4、hive 分桶

对于每一个表（table）或者分区， Hive可以进一步组织成桶，也就是说桶是更为细粒度的数据范围划分。Hive也是针对某一列进行桶的组织。Hive采用对列值哈希，然后除以桶的个数求余的方式决定该条记录存放在哪个桶当中。

把表（或者分区）组织成桶（Bucket）有两个理由：

（1）获得更高的查询处理效率。桶为表加上了额外的结构，Hive 在处理有些查询时能利用这个结构。具体而言，连接两个在（包含连接列的）相同列上划分了桶的表，可以使用 Map 端连接（Map-side join）高效的实现。比如JOIN操作。对于JOIN操作两个表有一个相同的列，如果对这两个表都进行了桶操作。那么将保存相同列值的桶进行JOIN操作就可以，可以大大较少JOIN的数据量。

（2）使取样（sampling）更高效。在处理大规模数据集时，在开发和修改查询的阶段，如果能在数据集的一小部分数据上试运行查询，会带来很多方便。

create table bucketed_user(id int,name string) clustered by (id) sorted by(name) into 4 buckets row format delimited fields terminated by '\t' stored as textfile;

首先，我们来看如何告诉Hive—个表应该被划分成桶。我们使用CLUSTERED BY 子句来指定划分桶所用的列和要划分的桶的个数：

CREATE TABLE bucketed_user (id INT) name STRING) 
CLUSTERED BY (id) INTO 4 BUCKETS;

在这里，我们使用用户ID来确定如何划分桶(Hive使用对值进行哈希并将结果除以桶的个数取余数。这样，任何一桶里都会有一个随机的用户集合（PS：其实也能说是随机，不是吗？）。

本文章为转载内容，我们尊重原作者对文章享有的著作权。如有内容错误或侵权问题，欢迎原作者联系我们进行内容更正或删除文章。

上一篇：python 数组循环赋值 python for循环给数组赋值

下一篇：扩展jquery函数功能 jquery插件开发方法

提问和评论都可以，用心的回复会被更多人看到评论

发布评论

相关文章

官方博客	全部文章	热门标签	班级博客
了解我们	网站地图	意见反馈

鸿蒙开发者社区	51CTO学堂
51CTO	软考资讯

hive split函数 hive principal

hive split函数 hive principal

51CTO博客