"""Quick survey of sales_detailed.csv to see if per-HR-store granularity exists."""
import pandas as pd

df = pd.read_csv("data/sales_detailed.csv", low_memory=False)
print(f"Total rows: {len(df):,}")
print(f"Unique SKUs: {df['sku'].nunique()}")
print(f"Date range: {df['date'].min()} → {df['date'].max()}")
print(f"Year/week range: {df['year'].min()}/{df['week'].min()} → {df['year'].max()}/{df['week'].max()}")
print()
print(f"Countries (drzava): {df['drzava'].value_counts().to_dict()}")
print()
print(f"Document types (tip_dok): {df['tip_dok'].value_counts().head(10).to_dict()}")
print()
print(f"Unique mj_troska (cost centers): {df['mj_troska'].nunique()}")
print("Sample top 20 mj_troska + naziv:")
print(df.groupby(["mj_troska", "naziv_mj_troska"]).size().sort_values(ascending=False).head(20))
print()
print(f"Unique jedinica (unit codes): {df['jedinica'].nunique()}")
print("Top 20 jedinica + naziv:")
print(df.groupby(["jedinica", "naziv_jedinice"]).size().sort_values(ascending=False).head(20))
print()
print("HR-only slice:")
hr = df[df["drzava"] == "HR"]
print(f"  rows: {len(hr):,}")
print(f"  tip_dok mix: {hr['tip_dok'].value_counts().head(10).to_dict()}")
print(f"  unique jedinica (HR only): {hr['jedinica'].nunique()}")
print(f"  unique naziv_jedinice (HR only): {hr['naziv_jedinice'].nunique()}")
print()
print("HR top naziv_jedinice (could be stores!):")
print(hr["naziv_jedinice"].value_counts().head(25))
