← MateriałyBig Data
Przetwarzanie danych na dużą skalę. Apache Spark, Hadoop, architektura data lake, streaming i batch processing.
SparkHadoopHDFSKafkaPython
Notebooki — 12 ćwiczeń
Jupyter Notebook (.ipynb)01Wprowadzenie do Big Data
Big DataKoncepcje5V
.ipynb 02HDFS i ekosystem Hadoop
HadoopHDFSYARN
.ipynb 03MapReduce
MapReduceHadoopPython
.ipynb 04Apache Hive
HiveHQLData Warehouse
.ipynb 05Apache Spark — RDD
SparkRDDPySpark
.ipynb 06Spark DataFrames i SQL
SparkDataFrameSpark SQL
.ipynb 07Spark Streaming
SparkStreamingMicro-batch
.ipynb 08Apache Kafka
KafkaMessagingStreaming
.ipynb 09Data Lake i architektura Lambda
Data LakeLambdaKappaArchitektura
.ipynb 10NoSQL — MongoDB i Cassandra
NoSQLMongoDBCassandra
.ipynb 11Optymalizacja zapytań i partycjonowanie
SparkOptymalizacjaCatalystPartycjonowanie
.ipynb 12Pipeline danych end-to-end
PipelineETLProjekt
.ipynb