# Simulating Heteroskedasticity
# Module 8 - What Is Heteroskedasticity?
# Dataset: MODULE8_INCOME_SAVINGS_SYNTHETIC

# Simulating Heteroskedasticity
#
# Module 8 notebook lab. This notebook uses original Ceteris Lab teaching data and does not report real empirical findings.

# Learning goal
# Generate and visualize changing variance.
#
# Dataset: MODULE8_INCOME_SAVINGS_SYNTHETIC. Variables: household_id, income, savings, age, education, family_size.

# %% Cell 3
import pandas as pd
import matplotlib.pyplot as plt

df = pd.read_csv("/data/module-8/module8_income_savings_heteroskedastic.csv")
print(df[["income", "savings", "error_scale"]].head())
plt.scatter(df["income"], df["savings"], alpha=0.75)
plt.xlabel("Income")
plt.ylabel("Savings")
plt.title("Synthetic data: spread grows with income")
plt.show()

# Reflection
# Write two sentences: one sentence explaining what the diagnostic or robust result says, and one sentence explaining a limitation or next step.
