據(jù)清洗與整形:pandas實(shí)戰(zhàn)處理臟數(shù)據(jù)全流程)
做數(shù)據(jù)分析的人經(jīng)常遇到一個場景從網(wǎng)上下載了一份看起來很規(guī)整的數(shù)據(jù)集比如 Airbnb Listings打開一看密密麻麻的字段有價格、有評論、有坐標(biāo)、有房東信息。你以為接下來可以直接建模了結(jié)果df.info()一跑發(fā)現(xiàn)價格是字符串、缺失值占了三成、同一套房源重復(fù)出現(xiàn)了五次甚至還有經(jīng)緯度在海洋里的數(shù)據(jù)。這時候才意識到真正決定分析項(xiàng)目成敗的往往不是后面用了什么高級模型而是前面這兩個環(huán)節(jié)數(shù)據(jù)清洗Data Cleaning和數(shù)據(jù)整形Data Shaping。這篇文章就以 Airbnb Listings 數(shù)據(jù)集為例完整拆解一份原始房源數(shù)據(jù)從“沒法用”到“能用、好用”的全過程。我們會先講清楚清洗和整形各自解決什么問題再給出可復(fù)制的 Python 代碼最后補(bǔ)充實(shí)際項(xiàng)目中的排查思路和工程建議。讀完這篇文章你不僅會處理 Airbnb 數(shù)據(jù)還能把同樣的方法遷移到電商商品、招聘信息、二手房掛牌等其他表格型數(shù)據(jù)集上。1. 這篇文章真正要解決的問題很多初學(xué)者對數(shù)據(jù)清洗有個誤會覺得它就是“刪掉空值”“去一下重復(fù)”屬于體力活沒什么技術(shù)含量。但真實(shí)項(xiàng)目里數(shù)據(jù)清洗和整形往往是耗時最久、最容易出錯、也最影響最終結(jié)論質(zhì)量的環(huán)節(jié)。曾有統(tǒng)計說數(shù)據(jù)分析師 60% 以上的時間花在數(shù)據(jù)準(zhǔn)備上這個比例放在 Airbnb 這類真實(shí)數(shù)據(jù)集上一點(diǎn)都不夸張。Airbnb Listings 數(shù)據(jù)集之所以適合拿來學(xué)習(xí)是因?yàn)樗邆湔鎸?shí)業(yè)務(wù)數(shù)據(jù)的幾乎所有典型問題字段類型錯亂價格列里包含了$、,甚至可能是$1,200.00這種格式pandas 默認(rèn)讀進(jìn)來是字符串。缺失值復(fù)雜有些字段缺失是可以直接刪的有些字段缺失需要填充還有些字段缺失本身就是一種業(yè)務(wù)信號。重復(fù)數(shù)據(jù)同一房源可能因?yàn)榉繓|多次更新、爬蟲重復(fù)抓取而出現(xiàn)多行記錄。異常值價格可能填成了 0評論數(shù)可能是天文數(shù)字經(jīng)緯度可能完全偏離城市范圍。存儲格式不適合分析日期是字符串、臥室數(shù)寫在文本里、多個設(shè)施用逗號拼在一個單元格里比如WiFi,Kitchen,Heating。如果跳過這些問題直接建模輕則指標(biāo)失真重則整個分析結(jié)論被帶偏。比如價格列不轉(zhuǎn)成數(shù)值df[price].mean()就會直接報錯如果錯誤地忽略了重復(fù)項(xiàng)統(tǒng)計房源數(shù)量時會虛高如果不對異常價格做處理中位數(shù)可能被幾個極端值拉到一個完全不符合市場認(rèn)知的位置。這篇文章要解決的問題就是建立一套可復(fù)用的 Airbnb Listings 數(shù)據(jù)清洗與數(shù)據(jù)整形流程。我們會從最原始的 CSV 文件開始一步一步完成數(shù)據(jù)加載、字段檢查、缺失值處理、重復(fù)值處理、異常值處理、類型轉(zhuǎn)換、特征提取和寬表轉(zhuǎn)長表。每一步都會解釋“為什么這么做”而不是只給代碼。2. 數(shù)據(jù)清洗與數(shù)據(jù)整形到底差在哪先做一個概念區(qū)分。很多文章把 Data Cleaning 和 Data Shaping 混在一起講但在工程實(shí)踐中它們的職責(zé)邊界很清晰。數(shù)據(jù)清洗Data Cleaning解決的是“數(shù)據(jù)對不對”的問題。它處理的是臟數(shù)據(jù)包括缺失值、重復(fù)值、異常值、格式錯誤、類型錯誤、不一致的取值等。清洗的目標(biāo)是讓每一行數(shù)據(jù)真實(shí)、準(zhǔn)確、可比較。比如把$100.00變成100.0把3 beds變成3把明顯偏離城市范圍的經(jīng)緯度刪除這些都是清洗。數(shù)據(jù)整形Data Shaping解決的是“數(shù)據(jù)好不好用”的問題。它處理的是數(shù)據(jù)的組織方式包括列的選擇與重命名、行與列的轉(zhuǎn)換、從現(xiàn)有字段中提取新特征、把寬表變長表、把長表變寬表等。整形不改變數(shù)據(jù)本身的真實(shí)性但會改變數(shù)據(jù)的結(jié)構(gòu)讓它更適合后續(xù)可視化、建?;蚪y(tǒng)計分析。比如從last_review日期中提取出年份和月份把a(bǔ)menities從逗號分隔的字符串拆成多個布爾列把每個房源的多個設(shè)施記錄從一行展開成多行這些都是整形??梢杂靡痪湓捀爬ㄇ逑词前褦?shù)據(jù)變干凈整形是把數(shù)據(jù)變順手。實(shí)際項(xiàng)目中這兩個步驟往往是交替進(jìn)行的。比如你發(fā)現(xiàn)price列有缺失值這是清洗問題但如果你想把價格按照neighbourhood_group分組填充中位數(shù)這又涉及分組和轉(zhuǎn)換屬于整形的思路。所以本文不會強(qiáng)行把它們割裂成兩條互不相干的流程而是按照“先清洗后整形”的順序組織這樣對新手最友好。下面用一個表格對比它們的核心差異對比維度數(shù)據(jù)清洗Data Cleaning數(shù)據(jù)整形Data Shaping核心問題數(shù)據(jù)對不對數(shù)據(jù)好不好用主要操作處理缺失值、重復(fù)值、異常值、類型轉(zhuǎn)換列選、重命名、行列轉(zhuǎn)換、特征提取典型字段price、last_review、coordinatesamenities、host_verifications、date失敗后果分析結(jié)果失真分析無法開展或效率低判斷標(biāo)準(zhǔn)每一行數(shù)據(jù)真實(shí)可靠數(shù)據(jù)結(jié)構(gòu)適合當(dāng)前分析任務(wù)3. 環(huán)境準(zhǔn)備與數(shù)據(jù)集說明整個流程只需要 Python 環(huán)境和 pandas 庫不需要額外安裝機(jī)器學(xué)習(xí)框架。建議在虛擬環(huán)境中操作避免依賴沖突。以下是我推薦的安裝方式python -m venv venv source venv/bin/activate # Windows 下使用 venv\Scripts\activate pip install pandas numpy jupyter版本方面pandas 的 1.x 和 2.x 都支持本文代碼具體以你本機(jī)安裝的版本為準(zhǔn)。如果是在 Jupyter Notebook 里操作記得把代碼按單元格拆開執(zhí)行方便隨時查看中間結(jié)果。數(shù)據(jù)集方面本文以 Airbnb 公開的 Listings 數(shù)據(jù)集為例。這類數(shù)據(jù)一般以 CSV 格式提供包含房源 ID、房東 ID、價格、房間類型、經(jīng)緯度、評論數(shù)、最低住宿晚數(shù)、發(fā)布日期等幾十個字段。你可以在 Airbnb 官方的公開數(shù)據(jù)頁面獲取也可以使用 Kaggle 和 Inside Airbnb 上的版本。不同渠道的字段略有差異但核心字段基本一致本文代碼會在讀取數(shù)據(jù)后先做字段概覽所以即使字段名不完全相同也能快速調(diào)整。需要特別說明的是本文不會依賴某個特定版本的 CSV 文件。真實(shí)項(xiàng)目中你拿到的數(shù)據(jù)字段可能比我這里演示的多或少但只要掌握了“先概覽、再清洗、后整形”的思路任何版本的 Airbnb Listings 數(shù)據(jù)都能處理。4. Airbnb Listings 數(shù)據(jù)清洗核心流程拆解從這一節(jié)開始進(jìn)入正題。我們先讀取數(shù)據(jù)并做初步體檢然后按照“缺失值 → 重復(fù)值 → 異常值 → 類型轉(zhuǎn)換”的順序完成清洗。4.1 讀取數(shù)據(jù)并做初步體檢拿到 CSV 后的第一件事不是急著清洗而是先搞清楚數(shù)據(jù)長什么樣。建議按下面的代碼先做一輪快速體檢import pandas as pd import numpy as np # 讀取數(shù)據(jù) df pd.read_csv(listings.csv) # 先看行列數(shù) print(數(shù)據(jù)集形狀:, df.shape) # 看前幾行了解字段類型和大概內(nèi)容 print(df.head(3).T) # 看字段類型 print(df.dtypes) # 看缺失情況 print(df.isnull().sum().sort_values(ascendingFalse).head(20))這里head(3).T是為了把一行數(shù)據(jù)轉(zhuǎn)置成豎排方便觀察每個字段的值。dtypes能告訴我們哪些字段被讀成了對象類型哪些是數(shù)值類型。isnull().sum()則是看缺失值分布。這一步跑完你通常會看到兩種情況很多字段是object類型比如price、last_review、amenities。缺失值集中在少數(shù)幾個字段比如last_review、review_scores_rating、neighbourhood_group。在這個階段不需要做任何處理先記錄觀察結(jié)果再進(jìn)入下一步。4.2 缺失值處理先分類再決定策略缺失值處理的錯誤做法是直接dropna()一把梭。很多新手對所有缺失字段統(tǒng)一刪除結(jié)果把數(shù)據(jù)集刪得只剩一半或者把有業(yè)務(wù)含義的缺失變成無意義的數(shù)據(jù)損失。正確的做法是先回答三個問題這個字段的缺失占比是多少這個字段后續(xù)分析中是否需要用到缺失本身有沒有業(yè)務(wù)含義比如在 Airbnb 數(shù)據(jù)中id、host_id、price這些關(guān)鍵字段如果缺失通常建議刪除對應(yīng)行因?yàn)闊o法填充且影響核心分析。neighbourhood_group缺失但latitude、longitude存在時可以考慮通過逆地理編碼補(bǔ)全或者直接標(biāo)記為“未知區(qū)域”。last_review缺失往往意味著該房源從未收到過評論這是一個有業(yè)務(wù)含義的信號不應(yīng)該簡單刪除而應(yīng)該在整形階段用 0 或“無評論”標(biāo)記。review_scores_rating缺失如果該房源評論數(shù)為 0那缺失是合理的不需要強(qiáng)行填一個分?jǐn)?shù)。下面是一個實(shí)用的處理策略示例# 先看關(guān)鍵字段缺失比例 key_cols [id, host_id, price, last_review, review_scores_rating] missing_ratio df[key_cols].isnull().mean().sort_values(ascendingFalse) print(missing_ratio) # 策略1核心標(biāo)識字段缺失直接刪除 df df.dropna(subset[id, host_id, price]) # 策略2對評分類字段先看評論數(shù)評論數(shù)為0則缺失合理 # 將缺失評分填充為0表示暫無評分 df[review_scores_rating] df[review_scores_rating].fillna(0) # 策略3last_review 缺失填充為 NaT后續(xù)整形時轉(zhuǎn)為“無評論” df[last_review] pd.to_datetime(df[last_review], errorscoerce)這里的關(guān)鍵點(diǎn)是先給缺失值定性再選擇刪除、填充還是保留。如果缺失字段用于建模且缺失比例超過 50%基本可以放棄該字段如果缺失集中在少數(shù)行直接刪除這些行更省事如果缺失字段具有業(yè)務(wù)含義就不要強(qiáng)行填充。4.3 重復(fù)值處理不能只按整行去重數(shù)據(jù)去重也有坑。df.drop_duplicates()默認(rèn)按整行完全重復(fù)來判斷但實(shí)際業(yè)務(wù)場景中Airbnb 房源很可能只是部分字段重復(fù)。舉例來說同一個房源被爬蟲抓取了兩次可能id、host_id、price完全相同但last_review因?yàn)樽トr間不同而不同。這時如果按整行去重根本去不掉。正確做法是選定一組關(guān)鍵字段作為去重依據(jù)。# 方案1按整行去重 df df.drop_duplicates() # 方案2按房源ID去重保留最后一次抓取記錄 df df.sort_values(last_scraped, ascendingFalse).drop_duplicates(subset[id], keepfirst)如果數(shù)據(jù)里沒有l(wèi)ast_scraped字段就按id去重并保留第一條即可df df.drop_duplicates(subset[id], keepfirst)去重之后記得重置索引df df.reset_index(dropTrue)這里需要說明drop_duplicates的subset參數(shù)很靈活。比如你想知道同一個房東是不是重復(fù)發(fā)布了同樣的房源可以把host_id和name組合起來判斷。這個決策完全取決于業(yè)務(wù)上如何定義“重復(fù)”。4.4 異常值處理用業(yè)務(wù)常識圈定合理范圍異常值的判定不能只靠統(tǒng)計方法還必須結(jié)合業(yè)務(wù)常識。Airbnb 數(shù)據(jù)里有幾個典型場景價格字段中price為 0 是明顯異常的。即使是免費(fèi)房源也會用特殊字段標(biāo)識不會直接把價格寫成 0。price高達(dá)幾萬美元而房間類型只是“Private room”也很可疑。這類極端值會嚴(yán)重影響后續(xù)的均值計算。處理思路是先看分布print(df[price].describe())然后結(jié)合業(yè)務(wù)常識設(shè)定合理范圍。比如可以認(rèn)為正常房源的單晚價格應(yīng)該在 10 到 2000 美元之間超出這個區(qū)間單獨(dú)檢查而不是直接一刀切。# 先轉(zhuǎn)成數(shù)值 df[price] df[price].replace([\$,], , regexTrue).astype(float) # 查看異常分布 print(df[price].describe(percentiles[0.01, 0.05, 0.5, 0.95, 0.99])) # 用業(yè)務(wù)閾值過濾 df df[(df[price] 10) (df[price] 2000)]經(jīng)緯度也可以用業(yè)務(wù)常識判斷。比如目標(biāo)城市是紐約那么緯度應(yīng)該在 40.5 到 41.0 之間經(jīng)度應(yīng)該在 -74.3 到 -73.5 之間。超出這個范圍的數(shù)據(jù)要么是抓取錯誤要么是坐標(biāo)漂移。df df[(df[latitude].between(40.5, 41.0)) (df[longitude].between(-74.3, -73.5))]這種基于業(yè)務(wù)范圍過濾的方式比單純靠 3σ 原則更加穩(wěn)健因?yàn)槟闶窃谟妙I(lǐng)域知識約束數(shù)據(jù)而不是讓數(shù)據(jù)自己定義“正?!薄?.5 類型轉(zhuǎn)換用pd.to_numeric和pd.to_datetime收尾清洗的最后一步是類型轉(zhuǎn)換。pandas 在讀 CSV 時經(jīng)常把數(shù)值列讀成字符串尤其是包含貨幣符號、千分位分隔符時更是如此。# 價格轉(zhuǎn)數(shù)值前面已經(jīng)做過 df[price] df[price].replace([\$,], , regexTrue).astype(float) # 評論數(shù)轉(zhuǎn)數(shù)值 df[number_of_reviews] pd.to_numeric(df[number_of_reviews], errorscoerce) # 日期轉(zhuǎn) datetime df[last_review] pd.to_datetime(df[last_review], errorscoerce) # 最低住宿晚數(shù)轉(zhuǎn)整數(shù) df[minimum_nights] pd.to_numeric(df[minimum_nights], errorscoerce).astype(Int64)這里要注意errorscoerce的作用。它會把無法轉(zhuǎn)換的值變成NaN而不是直接報錯中斷。這在真實(shí)數(shù)據(jù)集中非常重要因?yàn)槟阌肋h(yuǎn)不知道 CSV 里會混進(jìn)什么奇怪內(nèi)容。轉(zhuǎn)換之后再次用df.dtypes檢查確保關(guān)鍵字段都變成了float64、datetime64[ns]等對應(yīng)類型。5. Airbnb Listings 數(shù)據(jù)整形與特征工程實(shí)戰(zhàn)清洗完成之后數(shù)據(jù)已經(jīng)“干凈”了但還不一定“好用”。這一節(jié)我們專注于數(shù)據(jù)整形目標(biāo)是把原始字段轉(zhuǎn)換成更利于分析的結(jié)構(gòu)。5.1 列選擇與重命名Airbnb Listings 原始數(shù)據(jù)可能有 70 多個字段但實(shí)際分析往往只需要其中十幾個。建議先做一次列選擇避免后面代碼頻繁在字段名上打轉(zhuǎn)。# 只保留分析需要的字段 cols [ id, host_id, host_name, neighbourhood_group, neighbourhood, latitude, longitude, room_type, price, minimum_nights, number_of_reviews, last_review, reviews_per_month, calculated_host_listings_count, availability_365 ] df df[cols] # 重命名為更簡潔、更符合 Python 習(xí)慣的列名 df df.rename(columns{ neighbourhood_group: district, calculated_host_listings_count: host_listings_count, availability_365: available_days, number_of_reviews: review_count })重命名時推薦使用小寫下劃線的命名規(guī)范這樣可以減少后續(xù)寫代碼時的大寫切換。列名本身就是代碼的一部分一個好的列名能節(jié)省大量溝通成本。5.2 從日期字段中提取新特征last_review是日期類型后可以方便地提取年份和月份。比如你想研究“哪個季節(jié)房源評論最多”就需要把月份單獨(dú)提取出來。df[last_review_year] df[last_review].dt.year df[last_review_month] df[last_review].dt.month # 缺失日期的房源沒有評論用 0 填充年份 df[last_review_year] df[last_review_year].fillna(0).astype(int) df[last_review_month] df[last_review_month].fillna(0).astype(int)這里再次體現(xiàn)了清洗和整形的銜接。last_review的缺失值在清洗階段被保留為NaT到整形階段才轉(zhuǎn)化為“0年0月”這種業(yè)務(wù)語義。整個過程分成兩步走每一步都清楚可控。5.3 對連續(xù)型字段做分段price是連續(xù)數(shù)值但有些分析場景下把它分成幾個價格帶更有價值。比如看“不同價位房源的評論數(shù)差異”用數(shù)值價格當(dāng)然能做散點(diǎn)圖但用價格帶做分組對比更直觀。bins [0, 50, 100, 200, 500, 5000] labels [0-50, 50-100, 100-200, 200-500, 500] df[price_range] pd.cut(df[price], binsbins, labelslabels)pd.cut是等寬分段如果數(shù)據(jù)分布極不均勻也可以用pd.qcut做等頻分段讓每個區(qū)間樣本量接近。選哪個取決于分析目的沒有絕對標(biāo)準(zhǔn)。5.4 從文本字段中提取標(biāo)志位Airbnb 數(shù)據(jù)中room_type的取值有Entire home/apt、Private room、Shared room、Hotel room。如果后續(xù)建模時想把房間類型作為特征最簡單的辦法是 One-Hot 編碼。# 房間類型獨(dú)熱編碼 room_type_dummies pd.get_dummies(df[room_type], prefixroom) df pd.concat([df, room_type_dummies], axis1)需要注意pd.get_dummies默認(rèn)生成的列名會包含原始值中的空格和斜杠比如room_Entire home/apt。這種列名在后續(xù)用字符串操作時容易出問題建議在生成后統(tǒng)一重命名room_type_dummies.columns [ col.lower().replace( , _).replace(/, _) for col in room_type_dummies.columns ]處理完后room_type原始列可以保留也可以刪除。建議在建模前刪除因?yàn)楠?dú)熱編碼已經(jīng)表達(dá)了同樣的信息。5.5 逗號拼接字段的拆解Airbnb 的amenities字段是典型的“一列多值”結(jié)構(gòu)比如WiFi,Kitchen,Heating,Smoke detector,Essentials這樣的數(shù)據(jù)直接用于分析很困難。你很難用df[amenities].value_counts()知道有多少房源提供 WiFi因?yàn)槊總€單元格都包含多個設(shè)施。正確的做法是把多個值拆開。如果你只需要判斷“是否包含某個設(shè)施”可以先生成標(biāo)志位def has_amenity(amenities_str, keyword): return int(keyword in str(amenities_str)) df[has_wifi] df[amenities].apply(lambda x: has_amenity(x, WiFi)) df[has_kitchen] df[amenities].apply(lambda x: has_amenity(x, Kitchen)) df[has_heating] df[amenities].apply(lambda x: has_amenity(x, Heating))如果你想把設(shè)施從寬表轉(zhuǎn)成長表為每個房源和每個設(shè)施生成一行記錄可以使用explode# 先把字符串拆成列表 df[amenities_list] df[amenities].str.split(,) # 拆分為長表 amenity_long df.explode(amenities_list) print(amenity_long[[id, amenities_list]].head(10))explode是 pandas 整形中非常強(qiáng)大的方法。它的作用是把一個單元格中的列表展開成多行同時復(fù)制其他字段。這在處理標(biāo)簽、分類、多值屬性時非常常用。5.6 長表和寬表的相互轉(zhuǎn)換除了explodepivot和melt也是數(shù)據(jù)整形的高頻操作。這里用一個簡單例子說明它們的應(yīng)用場景。假設(shè)你想按district和room_type統(tǒng)計平均價格初始數(shù)據(jù)是每個房源一行。用pivot_table可以把這個長表轉(zhuǎn)換成以district為行、room_type為列的寬表pivot_price df.pivot_table( indexdistrict, columnsroom_type, valuesprice, aggfuncmean ) print(pivot_price)反過來如果你從某個接口拿到的是寬表數(shù)據(jù)每一行是一個district每一列是一種room_type但你想用 matplotlib 或 seaborn 畫分組柱狀圖就需要轉(zhuǎn)回長表。這時候用meltlong_price pivot_price.reset_index().melt( id_varsdistrict, var_nameroom_type, value_nameavg_price ) print(long_price.head())長表和寬表的轉(zhuǎn)換是數(shù)據(jù)整形里最考驗(yàn)理解力的部分。記住一個核心規(guī)則行是樣本、列是特征就是寬表用多行表達(dá)一個樣本的多個屬性就是長表。分析建模常用寬表可視化繪圖和部分統(tǒng)計模型常用長表。6. 運(yùn)行結(jié)果與效果驗(yàn)證清洗和整形的代碼寫完不是跑完沒報錯就算成功。你需要一套驗(yàn)證方法來確認(rèn)每一步都做對了。6.1 驗(yàn)證清洗效果清洗完成后的驗(yàn)證清單# 1. 沒有缺失值或缺失值已按業(yè)務(wù)規(guī)則處理 print(清洗后缺失值總數(shù):, df.isnull().sum().sum()) # 2. 沒有重復(fù)房源 print(房源 ID 重復(fù)數(shù):, df[id].duplicated().sum()) # 3. 關(guān)鍵字段類型正確 print(df[[price, review_count, last_review]].dtypes) # 4. 價格字段的統(tǒng)計量符合業(yè)務(wù)預(yù)期 print(df[price].describe()) # 5. 數(shù)據(jù)范圍沒有異常 print(經(jīng)緯度范圍:, df[latitude].min(), df[latitude].max(), df[longitude].min(), df[longitude].max())預(yù)期輸出中缺失值總數(shù)應(yīng)該為 0 或者嚴(yán)格等于你刻意保留的、具有業(yè)務(wù)含義的缺失值。id重復(fù)數(shù)應(yīng)該是 0。price應(yīng)該是float64review_count應(yīng)該是數(shù)值類型last_review應(yīng)該是datetime64[ns]。價格的最大值不超過你設(shè)定的業(yè)務(wù)閾值。6.2 驗(yàn)證整形效果整形后的驗(yàn)證重點(diǎn)在于結(jié)構(gòu)是否符合后續(xù)分析需要。# 1. 新特征是否生成 print(df.columns.tolist()) # 2. 價格分段是否均勻分布 print(df[price_range].value_counts()) # 3. 獨(dú)熱編碼列是否只有 0/1 print(df[[room_entire_home_apt, room_private_room, room_shared_room]].apply(lambda x: x.unique())) # 4. 長表展開后每個房源的設(shè)施行數(shù)是否準(zhǔn)確 amenity_long_counts amenity_long.groupby(id).size() print(每個房源平均設(shè)施數(shù):, amenity_long_counts.mean())如果某個price_range區(qū)間內(nèi)房源數(shù)極少比如 0 個說明你的分箱邊界可能不合理需要調(diào)整 bins。如果獨(dú)熱編碼列出現(xiàn)了大于 1 的值說明room_type列存在異常值需要回到清洗階段處理。6.3 用可視化快速驗(yàn)證除了打印統(tǒng)計量畫圖是發(fā)現(xiàn)數(shù)據(jù)問題的另一個高效手段。import matplotlib.pyplot as plt # 檢查價格分布 df[price].hist(bins50) plt.title(Price Distribution After Cleaning) plt.xlabel(Price) plt.ylabel(Count) plt.show()如果價格分布仍然出現(xiàn)極端長尾比如右側(cè)拖出很長一條尾巴并且明顯不符合業(yè)務(wù)認(rèn)知就需要回到異常值過濾步驟調(diào)整閾值。如果分布相對集中整體呈右偏形態(tài)這是長尾數(shù)據(jù)的正常表現(xiàn)可以接受。7. 常見問題與排查思路數(shù)據(jù)清洗和整形過程中有幾個問題幾乎每個人都會遇到。這里整理成表格方便你直接對照排查。問題現(xiàn)象可能原因排查方式解決方案pd.read_csv后價格列是 objectCSV 中包含$、,等符號查看df[price].head(10)確認(rèn)格式用replace去掉符號后astype(float)dropna()后數(shù)據(jù)量驟降缺失值占比過高不該統(tǒng)一刪除先計算各字段缺失比例分字段制定策略不要dropna()一把梭df[price].mean()報錯列類型仍是字符串查看df.dtypes先做類型轉(zhuǎn)換再計算日期字段轉(zhuǎn) datetime 失敗包含NaT或非法格式串用errorscoerce后檢查新產(chǎn)生的缺失值修正源格式或統(tǒng)一填充規(guī)則去重后 ID 仍有重復(fù)重復(fù)行的id相同但其他字段不同檢查df[id].duplicated().sum()按 ID 去重時指定subset[id]獨(dú)熱編碼生成的列名帶特殊字符原始分類取值包含空格和斜杠打印df[room_type].unique()獨(dú)熱編碼后統(tǒng)一重命名列名價格異常值導(dǎo)致均值遠(yuǎn)高于中位數(shù)存在極端高價或 0 價用describe(percentiles[...])看分布按業(yè)務(wù)閾值過濾或做分箱explode后數(shù)據(jù)量暴增設(shè)施字段包含大量值檢查展開前后行數(shù)差異確認(rèn)展開口徑是否符合業(yè)務(wù)需求這里特別想強(qiáng)調(diào)一個新手容易犯的錯誤看到read_csv不報錯就以為數(shù)據(jù)至少能用了。實(shí)際上pandas 在數(shù)據(jù)類型解析失敗時默認(rèn)不會報錯而是把整列讀成object類型。所以不報錯不等于數(shù)據(jù)類型正確必須在清洗后主動檢查dtypes。8. 最佳實(shí)踐與工程建議數(shù)據(jù)清洗和整形做多了以后會發(fā)現(xiàn)有章可循。下面這些建議來自實(shí)際項(xiàng)目中的經(jīng)驗(yàn)總結(jié)能幫你少走很多彎路。8.1 清洗流程要寫成函數(shù)而不是腳本很多人習(xí)慣在 Notebook 里從頭到尾寫一長串清洗代碼跑完就完事。但真實(shí)項(xiàng)目的麻煩在于數(shù)據(jù)源會更新比如 Airbnb 每月發(fā)布一次新數(shù)據(jù)。如果清洗邏輯是散落的一堆單元格每次更新都要人工重跑很容易漏步驟。建議把清洗和整形封裝成函數(shù)def clean_listings(df): Airbnb Listings 清洗函數(shù) df df.copy() df df.drop_duplicates(subset[id], keepfirst) df df.dropna(subset[id, host_id, price]) df[price] df[price].replace([\$,], , regexTrue).astype(float) df[last_review] pd.to_datetime(df[last_review], errorscoerce) df df[(df[price] 10) (df[price] 2000)] return df.reset_index(dropTrue) def shape_listings(df): Airbnb Listings 整形函數(shù) df df.copy() df[last_review_year] df[last_review].dt.year df[last_review_month] df[last_review].dt.month df[price_range] pd.cut(df[price], bins[0, 50, 100, 200, 500, 5000]) return df封裝成函數(shù)之后每次數(shù)據(jù)更新只需要重新執(zhí)行clean_listings(new_df)而且函數(shù)名本身就在記錄流程代碼的可讀性和可維護(hù)性能提升一個檔次。8.2 保留原始數(shù)據(jù)清洗結(jié)果另存一個非常實(shí)用的習(xí)慣永遠(yuǎn)保留一份原始數(shù)據(jù)清洗后的數(shù)據(jù)另存為新的變量或者新的文件。# 先備份 raw_df pd.read_csv(listings.csv) df raw_df.copy() # 在 df 上執(zhí)行清洗和整形 ...這樣做的好處是如果清洗規(guī)則需要調(diào)整比如修改價格閾值你不需要重新下載數(shù)據(jù)只需要重新執(zhí)行從raw_df.copy()開始的單元格。另一個好處是當(dāng)你需要追溯某條數(shù)據(jù)為什么被刪除時可以回到原始數(shù)據(jù)檢查。8.3 每一步清洗都要可審計在團(tuán)隊協(xié)作或生產(chǎn)環(huán)境中數(shù)據(jù)清洗規(guī)則必須有記錄。最簡單的做法是在 Notebook 中為每一個處理步驟寫好注釋并且說明依據(jù)。# 刪除價格小于10美元或大于2000美元的房源 # 依據(jù)業(yè)務(wù)上低于10美元視為測試房源高于2000美元視為極端高價 # 影響影響約 1.2% 的行需業(yè)務(wù)確認(rèn)后執(zhí)行 df df[(df[price] 10) (df[price] 2000)]如果團(tuán)隊使用版本管理工具清洗腳本也應(yīng)該納入管理。數(shù)據(jù)清洗不是一次性工作它跟業(yè)務(wù)代碼一樣需要 review需要回溯。8.4 區(qū)分處理與分析避免過度清洗數(shù)據(jù)清洗有一個容易走偏的方向?yàn)榱俗非蟆巴昝罃?shù)據(jù)”而過度清洗。比如某個字段缺失率達(dá)到 30%有人會想盡辦法用機(jī)器學(xué)習(xí)模型去填充它。但在大多數(shù)分析場景下刪除該字段或者簡單地標(biāo)記缺失比復(fù)雜填充更穩(wěn)妥。原則是清洗的目的是讓數(shù)據(jù)能回答問題而不是讓數(shù)據(jù)完美。如果某個字段在你要回答的問題中根本用不到就不需要為它花費(fèi)大量時間。先明確分析目標(biāo)再決定清洗的深度效率會高很多。8.5 在項(xiàng)目早期就約定列名規(guī)范Airbnb 數(shù)據(jù)集來自公開渠道列名比較混亂比如number_of_reviews和reviews_per_month很相似容易混淆。在項(xiàng)目開始時就統(tǒng)一重命名可以避免后面寫出df[number_of_reviews]和df[reviews_per_month]混用的情況。推薦的命名規(guī)范是全部小寫單詞間用下劃線連接。例如review_count、available_days、host_listings_count。這樣寫代碼時不需要記憶大小寫也符合 Python 社區(qū)的習(xí)慣。8.6 注意數(shù)據(jù)來源與合規(guī)性Airbnb 公開數(shù)據(jù)集的獲取和使用需要注意數(shù)據(jù)來源的授權(quán)條款。不同渠道發(fā)布的 Airbnb 數(shù)據(jù)集使用限制不完全相同有些僅限非商業(yè)用途。如果項(xiàng)目用于商業(yè)分析建議先確認(rèn)數(shù)據(jù)的使用許可。另外Airbnb 數(shù)據(jù)中包含經(jīng)緯度等空間信息在公開發(fā)表分析結(jié)果時如果房源數(shù)量較少應(yīng)注意脫敏避免從細(xì)粒度坐標(biāo)反推出具體房源位置。這類數(shù)據(jù)合規(guī)問題在真實(shí)項(xiàng)目里越來越重要建議從一開始就養(yǎng)成習(xí)慣。9. 總結(jié)與后續(xù)學(xué)習(xí)方向這篇文章以 Airbnb Listings 數(shù)據(jù)集為例完整走了一遍數(shù)據(jù)清洗和整形流程。核心結(jié)論可以濃縮成三句話第一數(shù)據(jù)清洗解決的是“數(shù)據(jù)對不對”的問題核心操作是缺失值、重復(fù)值、異常值和類型轉(zhuǎn)換數(shù)據(jù)整形解決的是“數(shù)據(jù)好不好用”的問題核心操作是列選擇、特征提取、寬表長表轉(zhuǎn)換。兩者不能互相替代也不該混為一談。第二清洗和整形都不是一次性任務(wù)而是需要反復(fù)迭代、驗(yàn)證和審計的工程過程。每一步處理都要有依據(jù)、可追蹤并且保留原始數(shù)據(jù)作為對照。第三Airbnb Listings 數(shù)據(jù)集是練習(xí)數(shù)據(jù)清洗和整形的優(yōu)質(zhì)材料因?yàn)樗鼛缀醢怂姓鎸?shí)數(shù)據(jù)的典型問題。把這一套方法吃透之后遷移到電商訂單、招聘信息、房產(chǎn)掛牌等數(shù)據(jù)上只需要調(diào)整字段名和業(yè)務(wù)規(guī)則即可。后續(xù)可以從這幾個方向繼續(xù)深入把清洗和整形結(jié)果用于探索性數(shù)據(jù)分析比如研究紐約不同區(qū)域房源的定價差異。結(jié)合 scikit-learn 構(gòu)建價格預(yù)測模型理解缺失值填充方式對模型效果的影響。學(xué)習(xí)更高級的數(shù)據(jù)整形工具比如pandas的pipe鏈?zhǔn)秸{(diào)用、polars的高性能數(shù)據(jù)框操作。建議收藏這篇文章等真正拿到一份 Airbnb Listings 數(shù)據(jù)時照著流程走一遍再把清洗函數(shù)改造成適合自己業(yè)務(wù)的版本。數(shù)據(jù)清洗沒有那么多“銀彈”多做幾次真實(shí)數(shù)據(jù)比看一百篇教程都管用。