← Back to Mind Maps
PySpark Learning Roadmap
A structured progression for mastering PySpark, from basic DataFrame operations to advanced distributed computing optimization.
Spark Fundamentals
Core concepts of Apache Spark
SparkSessionDriver vs ExecutorsTransformations vs ActionsLazy EvaluationRDDs vs DataFrames vs DatasetsPartitions
DataFrame Basics
Reading, writing, and viewing data
spark.read / spark.writeCSV, JSON, Parquetdf.show()df.printSchema()df.describe()df.columns
Data Manipulation
Transforming your datasets
select()filter() / where()withColumn()withColumnRenamed()drop()cast()lit()
Aggregations & Grouping
Summarizing data
groupBy()agg()F.sum(), F.avg(), F.count()F.max(), F.min()F.countDistinct()pivot()
Joins & Set Operations
Combining DataFrames
join() (inner, left, right, outer)Cross JoinsBroadcast Joins (F.broadcast)union()unionByName()
Functions & Windowing
Advanced logic and analytics
pyspark.sql.functions (F)Window.partitionBy()F.rank(), F.row_number()F.when().otherwise()UDFs (User Defined Functions)
Optimization & Performance
Tuning Spark applications
Caching (df.cache())Persist (df.persist())repartition() vs coalesce()Spark UIAvoiding ShufflesData Skew Handling