Fungsi Pipeline Cleaning Reusable

Bungkus seluruh urutan pembersihan data ke dalam 1 fungsi clean_data(df) agar proses cleaning dapat diterapkan ulang pada file baru secara konsisten.

👀 Contoh dulu

import pandas as pd
def clean_data(raw_df):
    df = raw_df.drop_duplicates()
    return df
df_in = pd.DataFrame({'a': [1, 1]})
print(len(clean_data(df_in)))

Hasilnya: 1

💡 Memastikan konsistensi proses pra-pemrosesan data.

📝 Sekarang giliranmu

Lengkapi fungsi clean_data(raw_df) agar mengembalikan DataFrame df di baris terakhir.

Preview