Neylora Data & AI Academy

Free Learning Resource

Exploratory Data Analysis (EDA) Cheat Sheet

Use EDA to understand data quality, distributions, relationships and patterns before modelling.

Dataset Inspection

df.shape
df.head()
df.info()
df.describe()
df.dtypes

Missing Values & Duplicates

df.isnull().sum()
df.isnull().mean() * 100
df.duplicated().sum()
df = df.drop_duplicates()

Outliers using IQR

Q1 = df["Salary"].quantile(0.25)
Q3 = df["Salary"].quantile(0.75)
IQR = Q3 - Q1
lower = Q1 - 1.5 * IQR
upper = Q3 + 1.5 * IQR
outliers = df[(df["Salary"] < lower) | (df["Salary"] > upper)]

Visualization

import matplotlib.pyplot as plt
import seaborn as sns

sns.histplot(df["Salary"])
sns.boxplot(x=df["Salary"])
sns.scatterplot(data=df, x="Age", y="Salary")
sns.heatmap(df.corr(numeric_only=True), annot=True)
plt.show()

EDA Questions

← Back to Academy