# 1. 标准化列名(去除空格,转小写,空格换下划线)
original_cols =list(df.columns)
df.columns=[c.strip().lower().replace(" ","_")for c in df.columns]
stats["cols_renamed"]=sum(a != b for a, b inzip(original_cols, df.columns))
# 2. 删除完全重复的行
before =len(df)
df.drop_duplicates(inplace=True)
stats["dup_removed"]= before - len(df)
# 3. 数值列空值填 0,字符串列填空字符串
null_before =int(df.isnull().sum().sum()) for col in df.columns: if df[col].dtypein("int64","float64"):
df[col].fillna(0, inplace=True) else:
df[col].fillna("", inplace=True)
stats["nulls_filled"]= null_before - int(df.isnull().sum().sum())
# 4. 去除字符串首尾空格 for col in df.select_dtypes(include="object").columns:
df[col]= df[col].str.strip()