Materiały

Big Data

Przetwarzanie danych na dużą skalę. Apache Spark, Hadoop, architektura data lake, streaming i batch processing.

SparkHadoopHDFSKafkaPython

Notebooki12 ćwiczeń

Jupyter Notebook (.ipynb)
01

Wprowadzenie do Big Data

Big DataKoncepcje5V
.ipynb
02

HDFS i ekosystem Hadoop

HadoopHDFSYARN
.ipynb
03

MapReduce

MapReduceHadoopPython
.ipynb
04

Apache Hive

HiveHQLData Warehouse
.ipynb
05

Apache Spark — RDD

SparkRDDPySpark
.ipynb
06

Spark DataFrames i SQL

SparkDataFrameSpark SQL
.ipynb
07

Spark Streaming

SparkStreamingMicro-batch
.ipynb
08

Apache Kafka

KafkaMessagingStreaming
.ipynb
09

Data Lake i architektura Lambda

Data LakeLambdaKappaArchitektura
.ipynb
10

NoSQL — MongoDB i Cassandra

NoSQLMongoDBCassandra
.ipynb
11

Optymalizacja zapytań i partycjonowanie

SparkOptymalizacjaCatalystPartycjonowanie
.ipynb
12

Pipeline danych end-to-end

PipelineETLProjekt
.ipynb