# Multiple Categories
# Module 7 - Multiple Categories
# Dataset: MODULE7_CATEGORY_EFFECTS_SYNTHETIC

# Multiple Categories
#
# Module 7 notebook lab. This notebook uses an original Ceteris Lab synthetic teaching dataset and does not report real empirical findings.

# Learning goal
# Encode categories with a base group and compare coefficient meanings.
#
# Dataset: MODULE7_CATEGORY_EFFECTS_SYNTHETIC. Variables: outcome, region, industry, quality_rating.

# %% Cell 3
import pandas as pd
import statsmodels.api as sm

df = pd.read_csv("/data/module-7/module7_category_effects_synthetic.csv")
dummies = pd.get_dummies(df[["region", "industry"]], drop_first=True, dtype=int)
X = pd.concat([df[["education", "experience"]], dummies], axis=1)
model = sm.OLS(df["outcome"], sm.add_constant(X)).fit()
print(model.params.round(3))

# Reflection
# Write two sentences: one coefficient, group difference, or predicted-probability interpretation, and one limitation or coding choice that matters.
