Nauczysz się, jak osiągnąć maksymalną wydajność przetwarzania poprzez masowe pobieranie danych, ładowanie przyrostowe, transformacje, przetwarzanie plików o złożonych formatach, tworzenie dynamicznych mappingów i stosowanie rozwiązań data science przy użyciu Pythona.
Poznasz sposoby optymalizacji wydajności środowiska Data Engineering poprzez monitorowanie, rozwiązywanie problemów i stosowanie zalecanych praktyk, a także nauczysz się wielokrotnie wykorzystywać tę samą logikę przetwarzania w konkretnych przypadkach użycia.
Po pomyślnym ukończeniu kursu, uczestnik zdobędzie umiejętności niezbędne do:
Informatica Data Engineering Integration Overview
Ingestion and Extraction in Hadoop
Native and Hadoop Engine Strategy
Data Engineering Development Process
Complex File Processing
Hierarchical Data Processing
Mapping Optimization andPerformance Tuning
Monitoring Logs andTroubleshooting in Hadoop
Intelligent Structure Model
Databricks Overview
Databricks Integration