Apply Now
Go to HomeGo to Courses Catalog
EN5Data EngineeringLEVEL 3STARTUP TRACK

EN5-351 | Big Data Infrastructure & Analytics

Scale distributed data warehouses, Apache Spark processing, real-time analytics, and enterprise data lakes.

Course Overview

Architect big data systems. Learn distributed data processing with Apache Spark, real-time streaming with Apache Kafka, data lakes (S3/GCS), and analytical query engines.

Course Curriculum & Modules

01Module 1: Distributed Data Processing with PySpark
02Module 2: Real-time Event Streaming with Apache Kafka
03Module 3: Cloud Data Lakes & Lakehouse Architecture (Delta Lake)
04Module 4: Distributed Analytical Query Optimization
05Module 5: Scaling Big Data Infrastructure in Production

Data Engineering Department Pathway

Data Engineering focuses on relational SQL/NoSQL databases, automated ETL data pipelines, big data streaming (Spark/Kafka), cloud data warehouses, and enterprise data governance frameworks.

Computer & Hardware Requirements

Processor:Intel i7/AMD Ryzen 7
Memory (RAM):16 GB - 32 GB RAM
Graphics Card:Standard graphics
Storage:256 GB SSD
Display:1080p display

Key Learning Outcomes & Benefits

  • Build distributed data processing pipelines using PySpark.
  • Implement real-time data streaming with Apache Kafka.
  • Architect scalable cloud data lakes and warehouses.
  • Optimize big data queries for enterprise analytics.