什么是Docker技术
自2013年开始出现的大数据概念及伴随出现的以Hadoop,Spark为代表的分布式大数据处理技术,大数据一词让人耳熟能详。大部分框架使用类Java语言实现,对于Python学员,PySpark是使用Python作为开发语言的程序员的福音,借助PySpark,帮助Python开发人员完成大数据任务。
本课程主要讲解Spark技术,借助Spark对外提供的Python接口,使用Python语言开发。涉及到Spark内核原理、Spark基础知识及应用、Spark基于DataFrame的Sql应用、机器学习及深度学习等内容。由浅到深的带大家深入学习大数据领域最火的项目Spark。帮助大家进入大数据领域,抓住大数据浪潮的尾巴。
软件版本:
Hadoop2.7.3
Spark2.3.0
Scala2.11.8
Python2.7.12
Jdk-8u101-linux-x64
Docker 1.12.6
Apache-hive-2.3.2-bin
Mysql-5.5.45-linux2.6-x86_64
Mysql-connector-java-5.1.37-bin
内容涉及:
pyspark 基础模块
pyspark.sql 模块
pyspark.ml 基于DataFrame的机器学习模块
pyspark.mllib package 基于RDD的机器学习模块
中间还会涉及到云计算中的docker容器技术,课程的学习环境就是使用Docker三个容器搭建的分布式环境
pyspark中Numpy、Pandas、Scikit-learn的互操作和相互对比
公开笔记对他人可见,有机会被管理员评为“优质笔记”
{{ noteEditor.content.length }}/2000
讲师收到你的提问会尽快为你解答。若选择公开提问,可以获得更多学员的帮助。
课程大纲
![Spark大数据处理及机器学习【基于Python的Spark 2.3**版】](https://s2.51cto.com/images/202101/25/23624972951c2d5c598bfc635d47a0d4.jpg?x-oss-process=image)
![【大数据 Hadoop生态 Spark 2.x 多案例】Spark 2.x基础与提升](https://s2.51cto.com/images/202101/28/2787286af1fa64b69b672a5ca8d002d7.jpg?x-oss-process=image)
![【大数据 Spark 2.x 流数据 多案例】Spark Streaming流数据处理基础与提升](https://s2.51cto.com/images/201801/11/7f1236c10dc8a7df7590f39cd2e4fd24.jpg?x-oss-process=image)
![Spark技术免费公开课视频课程[张敏老师]](https://s2.51cto.com/images/201704/b8cca7b14ee21ba601a961729eef8dbf984177.png?x-oss-process=image)
![【Python版pyspark】Spark大数据基础入门视频课程](https://s2.51cto.com/images/202101/25/1719a30d8680c2b28a527498cfdfa9c6.jpg?x-oss-process=image)
![Spark的技术应用分享【企业内部分享】](https://s2.51cto.com/images/201805/17/216c1e1caac30a89dff54ebf032136e8.jpg?x-oss-process=image)
![【大数据 Hadoop生态 Spark 2.x 多案例】Spark SQL基础与提升](https://s2.51cto.com/images/202101/28/1bea2e6cb1a4031c22df26f694deddc1.jpg?x-oss-process=image)
![【大数据 hadoop生态 Spark2.x】深入Spark2.x内核大数据](https://s2.51cto.com/images/201703/b55f6f1483e16870f1e267dbbe2d11585adac9.jpg?x-oss-process=image)