Walmart M5 Data Platform Step 1 report · Raw dataset
Step 01 · Complete

Walmart M5 raw dataset acquired and staged

The pipeline starts with the Kaggle M5 Forecasting – Accuracy competition files. Three production source CSVs were placed under data/raw/ as the immutable landing zone for all later Bronze work.

Status: done Source: Kaggle competition Path: data/raw/
calendar.csv
101 KB
1,969 date rows
sales_train_evaluation.csv
116 MB
30,490 item×store series
sell_prices.csv
194 MB
6,841,121 price rows
Day columns
1,941
d_1 … d_1941 in sales

Why these three files?

The competition zip contains additional files, but the data engineering project uses only the sources required for a full historical sales, calendar, and price spine.

File Role Decision
calendar.csv Date dimension, events, SNAP flags, Walmart week ids Required
sales_train_evaluation.csv Full daily unit sales history (wide format) Required
sell_prices.csv Weekly sell prices by store and item Required
sales_train_validation.csv Earlier subset of the same history Skipped
sample_submission.csv Forecast competition submission template Skipped

Observed schemas

Source Columns Notes
calendar 14 date, wm_yr_wk, weekday, wday, month, year, d, event_name_1/2, event_type_1/2, snap_CA/TX/WI
sales 1,947 Identity cols id, item_id, dept_id, cat_id, store_id, state_id plus d_1d_1941
sell_prices 4 store_id, item_id, wm_yr_wk, sell_price

Repository structure after Step 1

walmart-m5/
├── data/
│   └── raw/
│       ├── calendar.csv
│       ├── sales_train_evaluation.csv
│       └── sell_prices.csv
├── airflow/
├── src/
├── notebooks/
└── README.md

What this step unlocked