Free Learning Resource
Use EDA to understand data quality, distributions, relationships and patterns before modelling.
df.shape
df.head()
df.info()
df.describe()
df.dtypes
df.isnull().sum()
df.isnull().mean() * 100
df.duplicated().sum()
df = df.drop_duplicates()
Q1 = df["Salary"].quantile(0.25)
Q3 = df["Salary"].quantile(0.75)
IQR = Q3 - Q1
lower = Q1 - 1.5 * IQR
upper = Q3 + 1.5 * IQR
outliers = df[(df["Salary"] < lower) | (df["Salary"] > upper)]
import matplotlib.pyplot as plt
import seaborn as sns
sns.histplot(df["Salary"])
sns.boxplot(x=df["Salary"])
sns.scatterplot(data=df, x="Age", y="Salary")
sns.heatmap(df.corr(numeric_only=True), annot=True)
plt.show()