介绍:
Cloudera认证介绍
CDH认证主要包含以下几种:
CCA Spark and Hadoop Developer
CCA Data Analyst
CCA Administrator
CCP Data Engineer
https://www.cloudera.com/about/training/certification.html
1、CCA Spark and Hadoop Developer (CCA175) 开发者认证 认证准备建议:Spark and Hadoop开发者培训 考试形式:120分钟;70%及格;解决10~12基于CDH5机群上需通过实际操作的问题 2、CCA Data Analyst (CCA159) 数据分析师认证 认证准备建议:Data Analyst数据分析师培训 考试形式:120分钟;70%及格;解决10~12个客户问题,对于每一个问题,考生必须给出一个满足所有要求的精确的技术解决方案。考生可在群集上使用任何工具或组合使用工具 3、CCA Administrator Exam (CCA131) 管理员认证 认证准备建议:Administrator管理员培训 考试形式:120分钟;70%及格;基于一个预配置的Cloudera企业版集群,解决8~12个场景下的任务 4、CCP Data Engineer Exam (DE575) 数据工程师认证 认证准备建议:Spark and Hadoop开发者培训;设计及构建大数据应用;考生需对Hadoop有深入了解、具有实际使用大数据工具的经验、以及具备解决实际数据工程问题的专家级水平 考试形式:4小时;提供一个大数据集供使用、7个高性能节点组成的CDH5机群;解决大数据用户可能碰到的5-8个实际问题 |
所需技能:
转换,分批,储存
使用Hadoop文件系统命令将数据加载到HDFS中转换,分批,储存
将存储在HDFS中的给定格式的一组数据值转换为新的数据值或新的数据格式,并将其写入HDFS。
从HDFS加载RDD数据,用于Spark应用程序
使用Spark将RDD的结果写回HDFS
以各种文件格式读取和写入文件
使用Spark API对数据执行标准提取,转换,加载(ETL)过程
数据分析
使用Spark SQL在应用程序中以编程方式与metastore进行交互。通过使用查询加载数据生成报告。
使用metastore表作为Spark应用程序的输入源或输出接收器
了解在Spark中查询数据集的基本原理
使用Spark过滤数据
编写计算聚合统计信息的查询
使用Spark加入不同的数据集
生成排名或排序数据
配置
这是一个实操的考试,考生不仅要会编写代码,也应该熟悉整个开发环境
提供命令行方式,改变你的应用配置,如增加可用内存大小
考点:
CCA175(Spark and Hadoop Developer)
考试所需掌握内容包含以下:
Sqoop
Flume
HDFS shell
Hive
Spark
Spark sql
https://www.cloudera.com/about/training/certification/cca-spark.html
Sqoop考点
HDFS/HIVE 与 mysql 数据的相互导入导出
Field delimiter
File format (text、parquet、sequence-file...)
--append
--query
--compress
Flume考点
实际未涉及
HDFS shell 考点
cp
ls
mv
tail
put
rm/rmr
Hive考点
Hive sql
字符串函数
时间函数
count
sum
group by
order by
Spark 考点 1
实际考试中,只有Spark部分是需要写代码的。
支持语言:Java/Scala、Python
考试环境IDE:IDEA、Eclipse、Sublime
Spark 考点 2
SparkContext
sc.textFile
rdd.map
rdd.filter
rdd.toDF()
rdd.join
Spark SQL 考点
SqlContext
sql.read.FORMAT
df.write.FORMAT
functions API
df.toRDD
Spark submit考点
提交spark任务
--class
--jars
--master
考试环境:
CDH认证考试为在线考试,考试方式通过浏览器打开远程考试环境
远程环境是一个CENTOS桌面版,处在CDH集群中,较卡
考试官网在国外,最好有VPN
考试环境为纯英文,有个老外会在线交流注意事项
考试题目条数9,考试时间120min,及格70%,允许错误两题
考试实际所花费时间跟熟练度以及正确度有关系,不熟练必然时间不足
考试允许参考文档,文档链接
https://www.cloudera.com/about/training/certification/cca-spark.html
考试交付和群集信息
CCA175是一种远程监考,可以随时随地进行。有关更多信息和系统要求,请参阅FAQ常见问题解答。
CCA175是一个使用Cloudera技术的实践性考试。每个用户都有自己的CDH6(目前是6.1.1)集群,该集群预装了Spark 2.4。