Fungsi Pipeline Cleaning Reusable
Bungkus seluruh urutan pembersihan data ke dalam 1 fungsi clean_data(df) agar proses cleaning dapat diterapkan ulang pada file baru secara konsisten.
👀 Contoh dulu
import pandas as pd
def clean_data(raw_df):
df = raw_df.drop_duplicates()
return df
df_in = pd.DataFrame({'a': [1, 1]})
print(len(clean_data(df_in)))Hasilnya: 1
💡 Memastikan konsistensi proses pra-pemrosesan data.
📝 Sekarang giliranmu
Lengkapi fungsi clean_data(raw_df) agar mengembalikan DataFrame df di baris terakhir.
Preview