Spark o czym jest i do czego służy?

Spark o czym jest i do czego służy?

Apache Spark to platforma do rozproszonego przetwarzania danych, zaprojektowana do szybkiej analityki dużych zbiorów dzięki przetwarzaniu w pamięci i pracy w klastrach komputerów. Służy do łączenia zadań batch, streamingu, SQL, uczenia maszynowego i grafów w jednym...
Data engineer jak zacząć w branży IT?

Data engineer jak zacząć w branży IT?

Data Engineer wchodzi do branży IT najskuteczniej przez opanowanie SQL i Pythona, zrozumienie ETL oraz budowę prostych pipeline’ów, a następnie dołożenie chmury i narzędzi do przetwarzania rozproszonego, co zwykle zajmuje około 0,5–1 roku przygotowań na poziom...
Data lake co to oznacza w praktyce?

Data lake co to oznacza w praktyce?

Data lake to scentralizowane repozytorium, które gromadzi dane w postaci surowej lub natywnej i nie wymusza wcześniejszego dopasowania do jednego schematu. Co to oznacza w praktyce dla organizacji? Możliwość zebrania w jednym miejscu danych ustrukturyzowanych,...