實(shí)戰(zhàn):基于MovieLens的協(xié)同過(guò)濾與內(nèi)容推薦)
簡(jiǎn)介推薦系統(tǒng)是解決信息過(guò)載的核心技術(shù)之一在電商、視頻、音樂(lè)等場(chǎng)景中無(wú)處不在。協(xié)同過(guò)濾作為最經(jīng)典的推薦算法通過(guò)分析用戶行為或物品關(guān)聯(lián)來(lái)預(yù)測(cè)偏好而基于內(nèi)容的推薦則利用物品特征實(shí)現(xiàn)無(wú)需歷史行為的推薦。兩者各有優(yōu)劣也面臨冷啟動(dòng)、數(shù)據(jù)稀疏等工程挑戰(zhàn)。本文以Python為工具基于公開的MovieLens評(píng)分?jǐn)?shù)據(jù)系統(tǒng)講解從數(shù)據(jù)預(yù)處理、相似度計(jì)算到評(píng)分預(yù)測(cè)與Top-N推薦的完整實(shí)現(xiàn)路徑并對(duì)比用戶協(xié)同過(guò)濾、物品協(xié)同過(guò)濾與內(nèi)容推薦三種算法的適用場(chǎng)景。同時(shí)結(jié)合評(píng)估指標(biāo)和調(diào)參經(jīng)驗(yàn)討論近鄰選擇、均值中心化等關(guān)鍵細(xì)節(jié)幫助讀者搭建一個(gè)可運(yùn)行的離線推薦Demo為實(shí)際業(yè)務(wù)中的算法選型與優(yōu)化提供參考。 把一套能跑通的Python電影推薦系統(tǒng)代碼整理出來(lái)是我做這個(gè)項(xiàng)目最有收獲的一件事。這套系統(tǒng)基于公開的MovieLens電影評(píng)分?jǐn)?shù)據(jù)實(shí)現(xiàn)了基于用戶的協(xié)同過(guò)濾、基于物品的協(xié)同過(guò)濾和基于內(nèi)容的推薦三種經(jīng)典算法并且附帶完整的評(píng)估流程和參數(shù)調(diào)優(yōu)記錄。它能解決的實(shí)際問(wèn)題很明確當(dāng)你有一份用戶對(duì)電影的評(píng)分記錄時(shí)如何給某個(gè)用戶推薦他還沒(méi)看過(guò)的、大概率他會(huì)喜歡的電影。不論你是剛?cè)腴T推薦系統(tǒng)的學(xué)生還是想在公司內(nèi)部快速搭建一個(gè)離線推薦Demo的工程師這篇文章里的代碼和踩坑經(jīng)驗(yàn)都能直接復(fù)制使用。項(xiàng)目本身不算復(fù)雜但想把“推薦效果”調(diào)到一個(gè)看得過(guò)去的水平還是有不少細(xì)節(jié)值得琢磨。比如相似度算法選皮爾遜還是余弦、評(píng)分預(yù)測(cè)時(shí)要不要做歸一化、近鄰數(shù)量k取多少合適這些參數(shù)對(duì)結(jié)果的影響比想象中大得多。我下面會(huì)從整體設(shè)計(jì)思路開始逐步拆解每一部分代碼再分享實(shí)際運(yùn)行中遇到的典型問(wèn)題和排查方法。1. 項(xiàng)目整體思路與推薦算法選型1.1 推薦系統(tǒng)的核心問(wèn)題與兩類主流解法推薦系統(tǒng)本質(zhì)上回答一個(gè)問(wèn)題用戶u對(duì)物品i的偏好程度是多少。這個(gè)“偏好”在電影場(chǎng)景里通常體現(xiàn)為評(píng)分但在實(shí)際業(yè)務(wù)中也可以是點(diǎn)擊、收藏、加購(gòu)、觀看時(shí)長(zhǎng)等隱式反饋。評(píng)分高低直接決定是否把這部電影放進(jìn)推薦列表所以推薦系統(tǒng)的核心就是預(yù)測(cè)用戶對(duì)未交互物品的評(píng)分。主流解法分成三派基于內(nèi)容的推薦、協(xié)同過(guò)濾、混合推薦。協(xié)同過(guò)濾又分成基于用戶的(User-based CF)和基于物品的(Item-based CF)兩種?;趦?nèi)容的推薦思路最簡(jiǎn)單——把電影的特征類型、導(dǎo)演、演員、標(biāo)簽變成向量用戶喜歡什么特征的電影就推相似特征的電影。協(xié)同過(guò)濾不談內(nèi)容只看行為跟你口味相似的人喜歡什么電影就推給你或者某部電影被和你類似的人喜歡過(guò)就推給你。這個(gè)項(xiàng)目之所以三種都做不是為了炫技而是因?yàn)樗鼈冊(cè)谡鎸?shí)場(chǎng)景里各有短板?;趦?nèi)容的推薦解決不了“用戶口味跨類型”的問(wèn)題比如一個(gè)用戶只看過(guò)動(dòng)作片系統(tǒng)永遠(yuǎn)給他推動(dòng)作片不會(huì)發(fā)現(xiàn)他也喜歡溫情文藝片因?yàn)閮?nèi)容特征上沒(méi)有任何關(guān)聯(lián)。協(xié)同過(guò)濾則受冷啟動(dòng)困擾新用戶沒(méi)有任何行為數(shù)據(jù)新電影沒(méi)有任何人評(píng)分CF直接失效。把三種方法放在一起對(duì)照實(shí)現(xiàn)你能直觀感受到各自的適用邊界這也是我建議初學(xué)者不要只跑通一個(gè)模型就停下來(lái)的原因。1.2 為什么選MovieLens數(shù)據(jù)集與環(huán)境準(zhǔn)備項(xiàng)目采用MovieLens公開數(shù)據(jù)集準(zhǔn)確說(shuō)是ml-latest-small版本包含600多名用戶對(duì)9000多部電影的約10萬(wàn)條評(píng)分記錄。選它有幾個(gè)實(shí)際考慮數(shù)據(jù)量適中內(nèi)存占用低普通筆記本秒級(jí)跑完評(píng)分范圍固定為0.5到5.0的整數(shù)或半步做回歸預(yù)測(cè)時(shí)方便計(jì)算誤差每條評(píng)分都帶時(shí)間戳比分重復(fù)問(wèn)題少適合做時(shí)間維度上的切分驗(yàn)證。環(huán)境方面只需要Python 3.8以上依賴pandas、numpy、scikit-learn三個(gè)庫(kù)。有一個(gè)需要提前說(shuō)明的坑不要一上來(lái)就裝最新版scikit-learn有些舊代碼里調(diào)用的接口在新版本中改名了比如sklearn.model_selection.train_test_split在很老的項(xiàng)目里寫作sklearn.cross_validation如果你復(fù)制了網(wǎng)上的歷史代碼就會(huì)直接報(bào)錯(cuò)。推薦在項(xiàng)目目錄里用虛擬環(huán)境管理依賴python -m venv rec_env source rec_env/bin/activate # Windows下執(zhí)行 rec_env\Scripts\activate pip install pandas numpy scikit-learn評(píng)分?jǐn)?shù)據(jù)雖然干凈但也不要跳步直接建模。每一步前先用df.head()、df.info()、df.describe()掃一眼數(shù)據(jù)結(jié)構(gòu)能省掉后面大量排查時(shí)間。這部分代碼是整個(gè)項(xiàng)目的地基地基歪了后面全白干。2. 數(shù)據(jù)準(zhǔn)備與預(yù)處理細(xì)節(jié)2.1 數(shù)據(jù)加載與格式說(shuō)明MovieLens數(shù)據(jù)解壓后核心是三個(gè)文件ratings.csv用戶ID、電影ID、評(píng)分、時(shí)間戳、movies.csv電影ID、標(biāo)題、類型、tags.csv用戶打標(biāo)記錄。其中用戶ID和電影ID都是整數(shù)電影類型用豎線分隔的多個(gè)標(biāo)簽表示比如“Action|Adventure|Sci-Fi”。加載代碼非常簡(jiǎn)單import pandas as pd import numpy as np ratings pd.read_csv(ratings.csv) movies pd.read_csv(movies.csv) print(ratings.shape) print(ratings.head()) print(ratings[rating].describe())但這里就有一個(gè)容易被忽視的細(xì)節(jié)原始數(shù)據(jù)里的UserId不是連續(xù)的有的用戶ID從1開始跳過(guò)好幾個(gè)數(shù)MovieId也不是100%連續(xù)的。如果直接拿原始ID當(dāng)數(shù)組索引后面構(gòu)建用戶-物品矩陣的時(shí)候會(huì)留出大量空洞。標(biāo)準(zhǔn)做法是把UserId和MovieId重新映射成從0開始的連續(xù)整數(shù)索引user_ids ratings[userId].unique() movie_ids ratings[movieId].unique() user2idx {uid: i for i, uid in enumerate(user_ids)} movie2idx {mid: i for i, mid in enumerate(movie_ids)} ratings[user_idx] ratings[userId].map(user2idx) ratings[movie_idx] ratings[movieId].map(movie2idx)這一步做完后面構(gòu)造稀疏矩陣、做矩陣運(yùn)算都會(huì)簡(jiǎn)單很多。順便說(shuō)一句構(gòu)造映射字典用enumerate很順但不要用dict(zip(...))去映射時(shí)忘記去重否則重復(fù)ID會(huì)覆蓋映射導(dǎo)致錯(cuò)位。2.2 數(shù)據(jù)清洗與探索性分析數(shù)據(jù)清洗這一步看起來(lái)可有可無(wú)但實(shí)際做推薦系統(tǒng)時(shí)數(shù)據(jù)質(zhì)量直接決定效果上限。我做完加載后一定會(huì)檢查以下幾項(xiàng)是否有空值ratings.isnull().sum()有則直接丟棄對(duì)應(yīng)行。是否有重復(fù)記錄同一用戶對(duì)同一電影出現(xiàn)多次評(píng)分可能是采集端沒(méi)合并會(huì)影響訓(xùn)練和評(píng)估需要去重。評(píng)分分布是否合理打印value_counts()看每個(gè)分?jǐn)?shù)檔位的數(shù)量如果大量集中在5分說(shuō)明用戶打分習(xí)慣偏好極端做均值歸一化時(shí)要留意。給一段我當(dāng)時(shí)用的探索性分析代碼print(ratings[rating].value_counts().sort_index()) print(用戶數(shù):, ratings[user_idx].nunique()) print(電影數(shù):, ratings[movie_idx].nunique()) print(平均每用戶評(píng)分?jǐn)?shù)量:, ratings.groupby(user_idx).size().mean()) print(平均每電影獲得評(píng)分?jǐn)?shù)量:, ratings.groupby(movie_idx).size().mean())這些統(tǒng)計(jì)數(shù)字能幫你判斷數(shù)據(jù)稀疏程度。如果你的評(píng)分?jǐn)?shù)據(jù)里平均每個(gè)電影只有幾十條記錄那么基于物品的協(xié)同過(guò)濾會(huì)比基于用戶的表現(xiàn)更穩(wěn)定因?yàn)槲锲穫?cè)的數(shù)據(jù)通常更集中。實(shí)際跑下來(lái)MovieLens這個(gè)數(shù)據(jù)集的稀疏度大約是0.016也就是用戶-物品矩陣中只有1.6%的位置有值這在推薦領(lǐng)域已經(jīng)算相當(dāng)“稠密”了真實(shí)業(yè)務(wù)里的稀疏度經(jīng)常是0.1%以下。3. 基于用戶的協(xié)同過(guò)濾實(shí)現(xiàn)3.1 相似度算法選擇皮爾遜還是余弦基于用戶的協(xié)同過(guò)濾核心是計(jì)算用戶之間的相似度。最常用的兩種指標(biāo)是皮爾遜相關(guān)系數(shù)和余弦相似度。兩者公式上高度相關(guān)但行為有細(xì)微差別。余弦相似度衡量的是兩個(gè)向量的夾角不關(guān)心向量長(zhǎng)度皮爾遜相關(guān)系數(shù)在余弦之前先對(duì)每個(gè)用戶的評(píng)分做了中心化減去該用戶自己的平均分所以它能夠消除用戶評(píng)分尺度差異的影響。舉個(gè)例子用戶A打分區(qū)間是3到5用戶B打分區(qū)間是1到5兩人對(duì)共同看過(guò)的電影偏好順序完全一致。用余弦相似度算出來(lái)的值會(huì)被A的“高分習(xí)慣”拉低但皮爾遜相關(guān)系數(shù)能識(shí)別出兩人口味一致因?yàn)锳的3分可能就等于B的5分。這個(gè)例子非常經(jīng)典也是我強(qiáng)烈建議在評(píng)分場(chǎng)景里優(yōu)先選皮爾遜的原因。代碼實(shí)現(xiàn)上可以用pandas的corrwith向量化處理也可以用scipy的pearsonr。但注意直接用corrwith需要先把user-item矩陣的缺失值填成0這種做法會(huì)引入大量“無(wú)評(píng)分”參與計(jì)算數(shù)學(xué)上不正確。正確的做法是只基于兩人共同評(píng)分的電影計(jì)算相似度。這里我直接用numpy實(shí)現(xiàn)一個(gè)高效版本def pearson_sim(a, b): mask (a ! 0) (b ! 0) if mask.sum() 2: return 0.0 a_common a[mask] b_common b[mask] a_centered a_common - a_common.mean() b_centered b_common - b_common.mean() denom np.sqrt((a_centered ** 2).sum() * (b_centered ** 2).sum()) if denom 0: return 0.0 return (a_centered * b_centered).sum() / denom3.2 用戶評(píng)分預(yù)測(cè)與Top-N推薦有了用戶相似度矩陣預(yù)測(cè)用戶u對(duì)未評(píng)分電影i的評(píng)分標(biāo)準(zhǔn)的辦法是找出與u最相似的k個(gè)用戶這些用戶里對(duì)i有評(píng)分的人加權(quán)投票。權(quán)重就是相似度而且實(shí)踐中通常會(huì)做一層歸一化讓相似度權(quán)重落在0到1之間避免負(fù)相關(guān)用戶干擾def predict_rating(user_idx, movie_idx, user_item_matrix, sim_matrix, k20): sim_scores sim_matrix[user_idx].copy() # 排除自己 sim_scores[user_idx] -np.inf top_k_idx np.argsort(sim_scores)[::-1][:k] rated_users user_item_matrix[:, movie_idx] ! 0 neighbors [i for i in top_k_idx if rated_users[i]] if not neighbors: return float(np.mean(user_item_matrix[user_idx, :][user_item_matrix[user_idx, :] ! 0])) numerator 0.0 denominator 0.0 for n in neighbors: w sim_matrix[user_idx, n] if w 0: continue r user_item_matrix[n, movie_idx] # 使用不同用戶的平均分做baseline避免用戶打分區(qū)間的偏差 user_mean user_item_matrix[n, :][user_item_matrix[n, :] ! 0].mean() numerator w * (r - user_mean) denominator w if denominator 0: return float(np.mean(user_item_matrix[user_idx, :][user_item_matrix[user_idx, :] ! 0])) unbiased_pred numerator / denominator u_mean user_item_matrix[user_idx, :][user_item_matrix[user_idx, :] ! 0].mean() return u_mean unbiased_pred這段代碼里有兩個(gè)非常關(guān)鍵的處理第一個(gè)是“只選對(duì)目標(biāo)電影有評(píng)分的近鄰”否則近鄰里沒(méi)看過(guò)這部電影的人會(huì)把預(yù)測(cè)值拉向均值第二個(gè)是“評(píng)分減均值的偏差加權(quán)”這其實(shí)就是皮爾遜思想在預(yù)測(cè)階段的延伸效果比直接加權(quán)原始分?jǐn)?shù)好得多。Top-N推薦就是遍歷某個(gè)用戶所有未評(píng)分電影用上面的函數(shù)預(yù)測(cè)評(píng)分取分?jǐn)?shù)最高的N部電影再和movies.csv聯(lián)表查出標(biāo)題和類型。3.3 完整可運(yùn)行代碼示例把上面兩段組合起來(lái)整個(gè)訓(xùn)練和推薦流程可以收斂成一個(gè)腳本。為了控制在單機(jī)內(nèi)存可承受的范圍這里做一個(gè)簡(jiǎn)化只取評(píng)分?jǐn)?shù)量最多的前100個(gè)用戶和評(píng)分?jǐn)?shù)量最多的前500部電影進(jìn)行實(shí)驗(yàn)這樣既能快速出結(jié)果又不會(huì)把機(jī)器跑掛user_counts ratings[user_idx].value_counts() movie_counts ratings[movie_idx].value_counts() active_users user_counts[user_counts 20].index[:100] hot_movies movie_counts[movie_counts 5].index[:500] sub_ratings ratings[ratings[user_idx].isin(active_users) ratings[movie_idx].isin(hot_movies)] user_item np.zeros((len(active_users), len(hot_movies))) for uid, mid, score in sub_ratings[[user_idx, movie_idx, rating]].values: u_pos list(active_users).index(uid) m_pos list(hot_movies).index(mid) user_item[u_pos, m_pos] score sim_matrix np.zeros((len(active_users), len(active_users))) for i in range(len(active_users)): for j in range(i 1, len(active_users)): s pearson_sim(user_item[i], user_item[j]) sim_matrix[i, j] s sim_matrix[j, i] s這里用雙層循環(huán)算相似度時(shí)間復(fù)雜度O(n^2 * m)對(duì)于小數(shù)據(jù)集沒(méi)問(wèn)題但真實(shí)數(shù)據(jù)集上我不會(huì)這么寫而是改為向量化或分塊并行計(jì)算。運(yùn)行上述代碼時(shí)你會(huì)明顯發(fā)現(xiàn)真正消耗時(shí)間的是兩層for循環(huán)而不是預(yù)測(cè)本身這是純Python實(shí)現(xiàn)協(xié)同過(guò)濾的固有瓶頸后面我會(huì)提怎么優(yōu)化。4. 基于物品的協(xié)同過(guò)濾實(shí)現(xiàn)與對(duì)比4.1 物品相似度矩陣構(gòu)建基于物品的協(xié)同過(guò)濾思路跟基于用戶完全對(duì)稱先算電影之間有多像再推薦“跟你喜歡的電影相似的其他電影”。這里有一個(gè)業(yè)界共識(shí)值得先說(shuō)明現(xiàn)代工業(yè)界里基于物品的協(xié)同過(guò)濾比基于用戶的應(yīng)用更廣泛。原因是用戶的規(guī)模通常比物品大幾個(gè)量級(jí)用戶相似度矩陣是n×n規(guī)模的物品矩陣是m×m規(guī)模的在hotel或電商場(chǎng)景里m遠(yuǎn)小于n計(jì)算和維護(hù)成本低很多。計(jì)算物品相似度時(shí)要把數(shù)據(jù)從“用戶-物品”矩陣轉(zhuǎn)置成“物品-用戶”矩陣。我的代碼里直接用user_item.T即可。注意行數(shù)代表電影每行是這個(gè)電影在各個(gè)用戶處的評(píng)分向量評(píng)分人數(shù)越多的電影其相似度分?jǐn)?shù)越“可信”。4.2 推薦邏輯與兩種CF效果對(duì)比基于物品的推薦邏輯是用戶A評(píng)分5星了電影X系統(tǒng)找出與X最相似的10部電影把用戶沒(méi)看過(guò)的那幾部推給他。評(píng)分預(yù)測(cè)公式比用戶CF更直接因?yàn)槲锲返摹百|(zhì)量”通常被認(rèn)為是穩(wěn)定的不需要做均值剔除處理def item_based_predict(user_vector, item_sim, movie_idx, k20): # user_vector: 長(zhǎng)度m的評(píng)分向量 # item_sim: m×m矩陣, item_sim[i][j]是電影i和j的相似度 rated_items np.where(user_vector ! 0)[0] if movie_idx in rated_items: return user_vector[movie_idx] denom 0 num 0 for r_item in rated_items: w item_sim[movie_idx, r_item] if w 0: continue num w * user_vector[r_item] denom w if denom 0: return float(np.mean(user_vector[user_vector ! 0])) return num / denom實(shí)現(xiàn)兩個(gè)模型后我做了個(gè)直觀的效果對(duì)比。同樣給某個(gè)核心用戶做推薦用戶CF給出的結(jié)果偏向“小眾但口味高度匹配”的電影物品CF給出的結(jié)果偏向“熱門且類型接近”的電影。如果從用戶體驗(yàn)出發(fā)用戶CF更能帶來(lái)驚喜但冷啟動(dòng)情況下完全沒(méi)法用物品CF在實(shí)時(shí)性上新用戶只要有一個(gè)評(píng)分就能產(chǎn)出推薦落地門檻低很多。5. 基于內(nèi)容的推薦解決冷啟動(dòng)問(wèn)題5.1 電影特征提取與標(biāo)簽向量化協(xié)同過(guò)濾雖然強(qiáng)但拿新用戶和新電影完全沒(méi)辦法?;趦?nèi)容的推薦恰好能補(bǔ)上這塊短板它不依賴任何評(píng)分記錄只需要知道電影的“內(nèi)容特征”和用戶的歷史偏好。MovieLens的movies.csv里有電影類型字段這是最現(xiàn)成的特征。處理方式是把類型字符串拆開構(gòu)造one-hot編碼每個(gè)類型一列電影屬于該類型就標(biāo)1一個(gè)電影可以多個(gè)類型這就是典型的“多標(biāo)簽向量”。代碼實(shí)現(xiàn)非常直接genre_list [] for raw_genres in movies[genres].str.split(|): genre_list.extend(raw_genres) genres sorted(set(genre_list)) movie_genre_matrix np.zeros((len(movies), len(genres)), dtypenp.int8) for i, raw_genres in enumerate(movies[genres].str.split(|)): for g in raw_genres: if g (no genres listed): continue movie_genre_matrix[i, genres.index(g)] 1更精細(xì)的做法是把導(dǎo)演、演員、標(biāo)簽文本也加進(jìn)來(lái)用TF-IDF做向量化但電影類型已經(jīng)能提供足夠的可解釋性和區(qū)分度對(duì)于demo級(jí)項(xiàng)目完全夠用。5.2 基于內(nèi)容的推薦實(shí)現(xiàn)用戶畫像可以簡(jiǎn)單地表示為他對(duì)每個(gè)類型的平均評(píng)分。假如用戶看過(guò)10部動(dòng)作片平均4.5分看過(guò)5部愛情片平均2.0分那么他未來(lái)的向量應(yīng)該偏向動(dòng)作片。計(jì)算公式就是所有已評(píng)電影特征向量的“評(píng)分加權(quán)平均”def build_user_profile(user_idx, user_item, movie_genre_matrix): scored np.where(user_item[user_idx] ! 0)[0] if len(scored) 0: return np.zeros(movie_genre_matrix.shape[1]) scores user_item[user_idx, scored] genres_sum np.zeros(movie_genre_matrix.shape[1]) for i, m_idx in enumerate(scored): genres_sum scores[i] * movie_genre_matrix[m_idx] return genres_sum / scores.sum()得到用戶畫像向量后將所有未評(píng)分電影的類型向量與畫像向量做余弦相似度分?jǐn)?shù)Top-N就是推薦結(jié)果。這種方式不需要任何訓(xùn)練過(guò)程可解釋性極強(qiáng)“因?yàn)槟阆矚g動(dòng)作片所以推薦這部動(dòng)作冒險(xiǎn)電影”。但它的局限也很明顯推薦結(jié)果永遠(yuǎn)出不了用戶已經(jīng)接觸過(guò)的類型圈。我給用戶看過(guò)一個(gè)很典型的案例某用戶歷史評(píng)分全是科幻和動(dòng)作片內(nèi)容推薦列表里前20名全是這兩類沒(méi)有一部愛情或喜劇。所以工業(yè)界通常不會(huì)單獨(dú)用基于內(nèi)容而是把它作為“冷啟動(dòng)補(bǔ)充通道”或“召回粗排”的一路。6. 推薦質(zhì)量評(píng)估與調(diào)參思路6.1 評(píng)估指標(biāo)與時(shí)間序列劃分推薦系統(tǒng)評(píng)估不是看某一次推薦結(jié)果爽不爽而是要用指標(biāo)量化。離線評(píng)估最常用的是RMSE和MAE它們衡量預(yù)測(cè)評(píng)分和真實(shí)評(píng)分的平均誤差。計(jì)算前要把評(píng)分?jǐn)?shù)據(jù)劃分成訓(xùn)練集和測(cè)試集。這里有一個(gè)比隨機(jī)劃分更嚴(yán)謹(jǐn)?shù)姆桨赴磿r(shí)間排序?qū)γ總€(gè)用戶取最后20%的評(píng)分作為測(cè)試集其余80%作為訓(xùn)練集。原因在于推薦系統(tǒng)服務(wù)的是“未來(lái)行為預(yù)測(cè)”用歷史預(yù)測(cè)未來(lái)才符合實(shí)際場(chǎng)景。from sklearn.metrics import mean_squared_error, mean_absolute_error ratings[timestamp] pd.to_datetime(ratings[timestamp], units) ratings_sorted ratings.sort_values(timestamp) test_ratio 0.2 test_ratings ratings_sorted.groupby(userId).tail(int(ratings_sorted.groupby(userId).size().mean() * test_ratio)) train_ratings ratings_sorted.drop(test_ratings.index)這里的groupby().tail()有個(gè)坑如果某些用戶評(píng)分?jǐn)?shù)量很少tail取出來(lái)的數(shù)據(jù)可能少于20%極端情況下甚至取不到。穩(wěn)妥做法是先過(guò)濾掉評(píng)分?jǐn)?shù)據(jù)低于10條的用戶再執(zhí)行劃分。6.2 參數(shù)調(diào)整經(jīng)驗(yàn)記錄我把關(guān)鍵參數(shù)的影響記錄下來(lái)了方便你參考參數(shù)取值對(duì)效果的影響近鄰數(shù)量k5 ~ 50k太小受單個(gè)垃圾近鄰影響大太大引入噪音20左右是MovieLens的甜點(diǎn)區(qū)相似度閾值0.1 ~ 0.5低于閾值的近鄰直接舍棄能有效過(guò)濾負(fù)相關(guān)/弱相關(guān)噪聲是否做均值中心化True/False對(duì)皮爾遜預(yù)測(cè)非常關(guān)鍵不做的話預(yù)測(cè)分?jǐn)?shù)普遍偏高0.3~0.5數(shù)據(jù)劃分方式隨機(jī) vs 時(shí)間序列隨機(jī)劃分的RMSE通常比時(shí)間序列小10%~20%但這是假象線上效果會(huì)差一個(gè)特別反直覺的體會(huì)是并不是相似度越高的近鄰貢獻(xiàn)越大。我在實(shí)驗(yàn)中發(fā)現(xiàn)如果某個(gè)用戶只看過(guò)一部電影并且給了5分他跟目標(biāo)用戶的相似度會(huì)虛高因?yàn)閱吸c(diǎn)重合的樣本太少統(tǒng)計(jì)意義很弱。所以代碼里還要加一個(gè)人數(shù)門檻比如要求兩個(gè)用戶至少有5部共同評(píng)分電影否則相似度直接置0。這個(gè)調(diào)整對(duì)RMSE的改善非常明顯從0.98降到了0.91左右。7. 實(shí)操中的常見問(wèn)題與排查技巧7.1 數(shù)據(jù)稀疏與內(nèi)存占用問(wèn)題一旦把用戶物品矩陣構(gòu)建成numpy二維數(shù)組內(nèi)存就會(huì)按n*m增長(zhǎng)。MovieLens 1M版本有6000用戶和4000電影float64數(shù)組大約是192MB這還能接受但如果換成真實(shí)業(yè)務(wù)里的千萬(wàn)用戶和百萬(wàn)物品二維稠密矩陣直接爆內(nèi)存。我在這類項(xiàng)目里常用的優(yōu)化手段有三種改用scipy.sparse.csr_matrix存儲(chǔ)只記錄有評(píng)分的位置。用戶CF轉(zhuǎn)物品CFm通常遠(yuǎn)小于n。相似度矩陣分批計(jì)算、落地緩存不要重復(fù)構(gòu)建。這里還要提一個(gè)常見的隱蔽錯(cuò)誤numpy矩陣默認(rèn)用float64如果評(píng)分?jǐn)?shù)據(jù)本身是整數(shù)用np.float32就夠內(nèi)存直接砍半。很多人忽略這個(gè)細(xì)節(jié)。7.2 冷啟動(dòng)問(wèn)題的三種應(yīng)對(duì)方式冷啟動(dòng)分兩類新用戶沒(méi)有歷史行為新電影沒(méi)有評(píng)分。這個(gè)項(xiàng)目里我做的比較全面的應(yīng)對(duì)是新用戶冷啟動(dòng)放一個(gè)“熱門榜”兜底也就是全站評(píng)分?jǐn)?shù)量最多、評(píng)分均值最高的電影組合。新電影冷啟動(dòng)用基于內(nèi)容推薦把新電影的類型特征和已有電影算相似度找合適的召回位?;旌贤ǖ烙脩粼u(píng)分?jǐn)?shù)量少于5條時(shí)直接走熱門榜加內(nèi)容推薦達(dá)到閾值后切換協(xié)同過(guò)濾。很多人問(wèn)這個(gè)閾值怎么定我的經(jīng)驗(yàn)是小于等于5條時(shí)用戶觀影偏好分布根本不穩(wěn)強(qiáng)行上協(xié)同過(guò)濾預(yù)測(cè)出來(lái)的分?jǐn)?shù)可能非常離譜直接從熱門榜里選是性價(jià)比最高的方案。7.3 結(jié)果不合預(yù)期的排查思路我踩過(guò)最典型的坑是推薦列表里出現(xiàn)大量用戶已經(jīng)看過(guò)的電影。這種情況多半是遍歷預(yù)測(cè)時(shí)把訓(xùn)練集里的已評(píng)分電影也納入了候選集導(dǎo)致預(yù)測(cè)分?jǐn)?shù)非常接近真實(shí)高分沖進(jìn)Top-N里。排查時(shí)只要在生成候選集時(shí)加一句unrated_mask user_item[user_idx] 0 candidates np.where(unrated_mask)[0]另一個(gè)坑是時(shí)間穿越。如果訓(xùn)練集和測(cè)試集劃分時(shí)沒(méi)有按時(shí)間排序而是隨便隨機(jī)切那么模型會(huì)“看到未來(lái)”的評(píng)分測(cè)試集上的RMSE虛低。這個(gè)現(xiàn)象在數(shù)據(jù)量小時(shí)尤其明顯我的一次實(shí)驗(yàn)里隨機(jī)劃分RMSE是0.86按時(shí)間劃分直接變成了0.96。別把0.86當(dāng)做好結(jié)果那是模型作弊了。還有一個(gè)經(jīng)常被問(wèn)的問(wèn)題“為什么推薦出來(lái)的電影評(píng)分均值才3.5”因?yàn)榫祷貧w效應(yīng)。評(píng)分極端分布的數(shù)據(jù)被中心化處理后預(yù)測(cè)值自然向平均值收縮這不是bug。如果你希望推薦列表看起來(lái)更有“驚喜感”可以在預(yù)測(cè)分?jǐn)?shù)后加一個(gè)很小的權(quán)重偏置或者改用排序?qū)W習(xí)的方式去優(yōu)化用戶交互點(diǎn)擊率而不是純回歸分?jǐn)?shù)。8. 項(xiàng)目擴(kuò)展思路與個(gè)人實(shí)操心得做完這個(gè)項(xiàng)目以后我最大的體會(huì)是推薦系統(tǒng)60%的精力要花在數(shù)據(jù)和評(píng)測(cè)上真正的模型部分反而是最“標(biāo)準(zhǔn)化”的。很多人一上來(lái)就折騰深度學(xué)習(xí)模型、圖神經(jīng)網(wǎng)絡(luò)但其實(shí)協(xié)同過(guò)濾、邏輯回歸這波經(jīng)典方法配合好的特征工程和評(píng)估體系已經(jīng)能解決大量業(yè)務(wù)問(wèn)題。如果你想在現(xiàn)有代碼基礎(chǔ)上繼續(xù)擴(kuò)展我建議按這個(gè)優(yōu)先級(jí)來(lái)加入相似度矩陣的持久化緩存用npy格式存盤避免每次重算。把訓(xùn)練好的模型封裝成函數(shù)再接一個(gè)簡(jiǎn)單的Flask API做成一個(gè)能實(shí)時(shí)響應(yīng)的推薦服務(wù)。加入ALS矩陣分解作為第四個(gè)算法對(duì)比一下它在稀疏數(shù)據(jù)上的表現(xiàn)是否優(yōu)于協(xié)同過(guò)濾。在評(píng)估環(huán)節(jié)加入PrecisionN和RecallN直接衡量推薦列表中命中用戶真實(shí)喜歡電影的比例。最后分享一個(gè)小技巧調(diào)參時(shí)不要每次只改一個(gè)參數(shù)看半天結(jié)果直接把參數(shù)組合做成笛卡爾積跑網(wǎng)格搜索用RMSE熱力圖看整體趨勢(shì)。這樣既能發(fā)現(xiàn)參數(shù)之間的相互作用又能快速定位最優(yōu)區(qū)間。整套代碼跑通之后你可以試著把數(shù)據(jù)集換成自己的業(yè)務(wù)數(shù)據(jù)——哪怕是圖書、音樂(lè)、商品評(píng)分算法骨架都不用大改改數(shù)據(jù)加載邏輯就行。這個(gè)遷移能力才是做這些實(shí)驗(yàn)真正值錢的地方。本文還有配套的精品資源點(diǎn)擊獲取