:協(xié)同過濾與Flask實(shí)戰(zhàn)解析)
每年這個時候總有一批做課程設(shè)計(jì)或畢業(yè)設(shè)計(jì)的同學(xué)來問我推薦系統(tǒng)能不能做游戲方向其實(shí)我一直覺得游戲推薦是個比電影、圖書更“好講”的場景因?yàn)橛螒蛱烊粠ь愋?、?biāo)簽、平臺、評分這些結(jié)構(gòu)化屬性做相似度計(jì)算時特征很好提取而且用戶對游戲的評價行為也足夠直觀“喜歡/玩過/想玩”比“打了四顆星”更容易建模。我干脆把之前做過的一個“基于Python的熱門游戲推薦系統(tǒng)”完整梳理出來從需求拆解、數(shù)據(jù)準(zhǔn)備、算法實(shí)現(xiàn)、Web界面到本地部署全部過一遍。這份內(nèi)容適合兩類人一是準(zhǔn)備做課程設(shè)計(jì)/畢設(shè)的同學(xué)想找一個代碼結(jié)構(gòu)清晰、能跑通、能講清楚原理的項(xiàng)目參考二是剛開始學(xué)推薦系統(tǒng)的開發(fā)者想看看除了調(diào)包之外一套完整的召回—排序—展示鏈路到底怎么落地。整個項(xiàng)目體量不大但對Python基礎(chǔ)、Pandas數(shù)據(jù)處理、協(xié)同過濾思想、Flask接口設(shè)計(jì)都是很好的綜合訓(xùn)練。推薦系統(tǒng)這個方向最容易被誤解的地方是很多人以為一定要有海量數(shù)據(jù)和分布式計(jì)算才能做。實(shí)際上教學(xué)級項(xiàng)目反而更適合用“小而完整”的方式呈現(xiàn)——離線準(zhǔn)備一份游戲數(shù)據(jù)集用Item-based協(xié)同過濾計(jì)算相似度再用Flask包一層HTTP接口前端做幾個簡單的展示頁面。這套路徑麻雀雖小五臟俱全推薦系統(tǒng)該有的模塊都能對應(yīng)上數(shù)據(jù)層、特征層、算法層、應(yīng)用層一層都沒少。1. 拿到任務(wù)先別急著寫代碼需求拆解與整體方案選型真正動手之前我習(xí)慣先把問題拆清楚。很多同學(xué)一看到“推薦系統(tǒng)”四個字就想著上多復(fù)雜的模型其實(shí)完全沒必要。你首先要回答四個問題系統(tǒng)給誰用推薦什么基于什么信號推薦在哪里展示這四個問題問完項(xiàng)目的開發(fā)量基本就能估算出來了。1.1 系統(tǒng)給誰用解決什么核心痛點(diǎn)這個系統(tǒng)的定位很明確給一個普通游戲愛好者提供一個Web頁面他注冊登錄后可以瀏覽游戲列表給游戲打“喜歡”標(biāo)記系統(tǒng)根據(jù)他的行為反饋給他推薦相似度高的熱門游戲。也可以不做登錄直接用游客模式點(diǎn)選幾個喜歡的游戲讓系統(tǒng)實(shí)時返回推薦結(jié)果。這樣設(shè)計(jì)背后的邏輯是這既證明了推薦鏈路是通的又不用維護(hù)一套復(fù)雜的賬號權(quán)限體系。畢設(shè)答辯時老師最關(guān)心的是你有沒有把推薦算理論證清楚、把流程跑通而不是你用戶系統(tǒng)做得有多花哨。1.2 核心模塊可以拆成哪幾層我最終把項(xiàng)目拆成了四層這個分層思路也可以直接寫進(jìn)論文的設(shè)計(jì)章節(jié)里層次職責(zé)對應(yīng)技術(shù)關(guān)鍵產(chǎn)出數(shù)據(jù)層獲取和清洗游戲數(shù)據(jù)Python爬蟲/Pandasgames.csv、ratings.csv算法層計(jì)算游戲相似度并生成推薦列表Item-based協(xié)同過濾、余弦相似度相似度矩陣、推薦函數(shù)應(yīng)用層對外提供HTTP接口Flask/api/recommend 等接口展示層用戶交互頁面HTML/CSS/JS Jinja2游戲列表頁、推薦結(jié)果頁千萬別把四層代碼全塞進(jìn)一個app.py后面我會專門講目錄劃分。分層最大的好處是答辯的時候老師問“推薦算法在哪兒”你直接指到recommender.py問“接口在哪兒”指到app.py代碼工整本身就是加分項(xiàng)。1.3 選型理由為什么是Python、Flask、Pandas、SQLite技術(shù)棧我選得比較保守理由很實(shí)際Python是算法原型驗(yàn)證效率最高的語言Pandas處理表格數(shù)據(jù)幾乎是零門檻Flask則是Python后端框架里最容易講清楚HTTP請求流轉(zhuǎn)的。數(shù)據(jù)庫沒有用MySQL而是直接用了SQLite因?yàn)檎麄€項(xiàng)目數(shù)據(jù)量都在萬級以內(nèi)SQLite單文件部署、免安裝的特性對課程設(shè)計(jì)和本機(jī)演示太友好了給老師演示的時候不用現(xiàn)場配數(shù)據(jù)庫賬號。關(guān)于算法層我也做過對比User-based CF和理解成本更低不恰恰相反。游戲場景里用戶數(shù)量通常大于物品數(shù)量而且新用戶往往沒有多少行為記錄User-based CF算起來慢、覆蓋還差。Item-based CF則可以先離線把游戲間的相似度矩陣算好服務(wù)啟動后直接查表響應(yīng)速度快可解釋性也強(qiáng)——“因?yàn)槟阆矚g《黑神話悟空》所以推薦你《戰(zhàn)神》”比“和你有相似愛好的玩家也喜歡”要直觀得多。所以這個項(xiàng)目最終選了Item-based CF作為主算法。2. 游戲數(shù)據(jù)從哪來構(gòu)建干凈可用的數(shù)據(jù)集沒有數(shù)據(jù)推薦系統(tǒng)就是空中樓閣。我在這個項(xiàng)目里不推薦大家用過于復(fù)雜的方式取數(shù)也不建議把人家的接口爬到被封。當(dāng)時的做法是兩步走先用公開的Steam游戲排行榜頁面或商店熱門數(shù)據(jù)再把字段清洗成結(jié)構(gòu)化表格。如果你所在網(wǎng)絡(luò)環(huán)境訪問不了原站也可以直接用Kaggle上現(xiàn)成的游戲數(shù)據(jù)集。2.1 從公開頁面抓取游戲基本信息數(shù)據(jù)采集我用的Python第三方庫是requestsBeautifulSoup。采集的字段控制在最核心的幾個游戲名稱、所屬類型標(biāo)簽、好評率、價格、游戲簡介。這里需要注意一點(diǎn)不要貪多不要試圖抓用戶評論正文評論正文清洗成本極高而且教學(xué)級推薦引擎根本用不上NLP。爬蟲代碼的大體邏輯如下import requests from bs4 import BeautifulSoup import pandas as pd def fetch_hot_games(page_limit5): games [] for page in range(1, page_limit 1): url fhttps://example-store.com/hot/{page} resp requests.get(url, headers{User-Agent: Mozilla/5.0}) soup BeautifulSoup(resp.text, html.parser) for card in soup.select(.game-card): games.append({ game_id: card.get(data-id), name: card.select_one(.game-name).text.strip(), genres: card.select_one(.game-tags).text.strip(), rating: float(card.select_one(.rating).text), price: card.select_one(.price).text.strip(), desc: card.select_one(.desc).text.strip()[:200], }) return pd.DataFrame(games)示例代碼里直接用了一個占位域名實(shí)際使用時換成你能訪問的頁面結(jié)構(gòu)就行。爬蟲跑完之后把結(jié)果存成data/raw_games.csv這一步就完成了。2.2 數(shù)據(jù)清洗的兩個關(guān)鍵細(xì)節(jié)游戲類文本數(shù)據(jù)最麻煩的是類型標(biāo)簽。有些游戲標(biāo)簽是英文逗號分隔有些是中文頓號還有的是斜杠分隔。我在清洗時做了統(tǒng)一處理把分隔符全部轉(zhuǎn)成英文逗號然后再去空格。第二個麻煩是價格字段爬下來往往帶著“¥”或者“Free”必須轉(zhuǎn)成統(tǒng)一格式。df[price] ( df[price] .str.replace(¥, , regexFalse) .str.replace(Free, 0, caseFalse) .astype(float) ) df[genres] ( df[genres] .str.replace(、, ,, regexFalse) .str.replace(/, ,, regexFalse) .str.replace(;, ,, regexFalse) .str.strip() )清洗完的游戲字段大概長這樣Action, Adventure, RPG這種逗號分隔的形式這一格式化能讓后面做TF-IDF標(biāo)簽向量方便不少。2.3 造一份可解釋的評分?jǐn)?shù)據(jù)真實(shí)用戶-游戲評分?jǐn)?shù)據(jù)在這個小項(xiàng)目里很難拿到。我用的折中方案是找?guī)孜煌瑢W(xué)每人標(biāo)記了10~30個自己玩過的游戲開心程度打1~5分再把“標(biāo)記了相似度高的游戲卻沒標(biāo)記過的”當(dāng)作隱式反饋補(bǔ)進(jìn)去。如果你的場景連人工標(biāo)記都湊不齊就自己生成一個演示數(shù)據(jù)集——保證每個用戶標(biāo)記的游戲數(shù)量大致在10~30個之間不要全部集中在同一類型里否則后面推薦效果很假。推薦系統(tǒng)的質(zhì)量上限說到底取決于數(shù)據(jù)質(zhì)量。有一個被我反復(fù)提到的經(jīng)驗(yàn)寧可要50條真實(shí)標(biāo)注也不要5000條機(jī)器亂生成的數(shù)據(jù)。數(shù)據(jù)沒有區(qū)分度相似度矩陣算出來全是一樣的數(shù)那推薦結(jié)果就完全沒有說服力。3. 推薦引擎實(shí)現(xiàn)相似度計(jì)算和協(xié)同過濾的核心代碼講解現(xiàn)在到了整個項(xiàng)目技術(shù)含量最高的部分。很多教程一講協(xié)同過濾就是surprise庫一行搞定這不利于理解原理。所以我的代碼保留了手動實(shí)現(xiàn)的過程里面只用了NumPy和Pandas沒有調(diào)現(xiàn)成的推薦算法庫。3.1 從“用戶-游戲評分矩陣”說起協(xié)同過濾的第一步永遠(yuǎn)是構(gòu)建矩陣。行是用戶ID列是游戲ID交叉點(diǎn)是評分。但在游戲推薦場景里用戶很少給游戲打分更多是“標(biāo)記喜歡”這種隱式反饋。我的做法是把題目轉(zhuǎn)化一下喜歡顯式打分5分沒標(biāo)記0不喜歡可以忽略然后在相似度計(jì)算公式里只取有評分的項(xiàng)來算。如果你手里確實(shí)有1~5分的顯式得分就把評分矩陣填成本來值。Pandas構(gòu)建矩陣的代碼長這樣import pandas as pd import numpy as np # ratings.csv 字段user_id, game_id, rating ratings pd.read_csv(data/ratings.csv) matrix ratings.pivot_table( indexuser_id, columnsgame_id, valuesrating, fill_value0 ) print(f用戶數(shù): {matrix.shape[0]}, 游戲數(shù): {matrix.shape[1]})這里要理解一個重要的點(diǎn)矩陣的空白處不能直接填0再整體算余弦相似度。因?yàn)?在這里不是“打了0分”而是“沒有打分”。尤其對于熱門游戲大眾沒打過分實(shí)在太正常了。直接把0灌進(jìn)去會讓相似度計(jì)算出現(xiàn)嚴(yán)重偏差。所以在實(shí)現(xiàn)Item-based CF時我選擇了“只對共同評分的游戲做均值中心化”的優(yōu)化方法。3.2 余弦相似度的兩種處理方式余弦相似度公式本身不復(fù)雜similarity(A, B) (A向量點(diǎn)乘B向量) / (|A向量| * |B向量|)在這個場景里A和B是兩個游戲在用戶向量空間中的表現(xiàn)。如果A游戲只有3個用戶評分B游戲只有2個用戶評分這兩個向量大多數(shù)維度都是0直接套公式會被“無量綱的零”稀釋。這個問題專業(yè)上叫“數(shù)據(jù)稀疏性”。我的處理辦法是向量只保留有評分的用戶維度。也就是說如果用戶集合是{u1,u2,u3,u4,u5,u6}其中A游戲被u1、u3、u6評分那么給A建向量時就取[u1, u3, u6]對應(yīng)的評分B游戲同理最后只在交集里計(jì)算。代碼如下from sklearn.metrics.pairwise import cosine_similarity # 轉(zhuǎn)置變成 games × users 的評分矩陣 game_matrix matrix.T # 相似度計(jì)算 game_sim cosine_similarity(game_matrix.values) game_sim_df pd.DataFrame( game_sim, indexgame_matrix.index, columnsgame_matrix.index )如果用sklearn里的函數(shù)它會自動處理零值的情況。不過我還是建議初學(xué)者自己寫一遍余弦相似度這樣才能真正理解為什么兩個受歡迎的游戲可能因?yàn)橛脩羧后w重疊不高反而相似度低。3.3 Item-based CF的完整推薦函數(shù)推薦一個游戲的Top N相似游戲其實(shí)就是一個“查表”操作def recommend_by_game(game_id, sim_matrix, games_df, top_n10): if game_id not in sim_matrix.columns: return pd.DataFrame() scores sim_matrix[game_id].drop(indexgame_id).sort_values(ascendingFalse) top_ids scores.head(top_n).index return games_df[games_df[game_id].isin(top_ids)]但系統(tǒng)不能只做“以游戲找游戲”因?yàn)樗€有個冷啟動的問題如果用戶什么游戲都沒標(biāo)記過后端該返回什么這里我加了一個策略分支如果用戶有歷史喜歡就按他喜歡的每個游戲的相似度加權(quán)求和取加權(quán)和最高的Top N。如果用戶沒有任何標(biāo)記直接返回平臺熱門榜的前N個游戲這叫“熱門兜底”。加權(quán)推薦的核心代碼我貼出來這屬于“答辯時被問到能講很久”的部分def recommend_for_user(user_id, behavior_df, sim_matrix, games_df, top_n10): liked_games behavior_df[ behavior_df[user_id] user_id ][game_id].tolist() if not liked_games: return games_df.sort_values(hot_score, ascendingFalse).head(top_n) # 累積相似度得分 score_series pd.Series(dtypefloat) for gid in liked_games: if gid not in sim_matrix.columns: continue sim_scores sim_matrix[gid].drop(indexgid) score_series score_series.add( sim_scores * (1.0 / len(liked_games)), fill_value0 ) # 去掉已經(jīng)玩過的避免反復(fù)推薦 score_series score_series.drop(indexliked_games, errorsignore) top_ids score_series.sort_values(ascendingFalse).head(top_n).index return games_df[games_df[game_id].isin(top_ids)]用“平均加權(quán)”而不是“直接相加”是為了防止某個用戶點(diǎn)了一堆游戲后累計(jì)分?jǐn)?shù)過于集中在某個高頻相似度的游戲上。這行注釋我在代碼里專門寫了答辯或講代碼的時候能直接點(diǎn)出設(shè)計(jì)意圖。3.4 用TF-IDF做基于內(nèi)容的輔助信號只靠協(xié)同過濾有個問題某個游戲沒人標(biāo)記過典型的長尾冷啟動它永遠(yuǎn)不會被推薦出來。所以我還加了基于內(nèi)容(Content-based)的輔助思路——把游戲類型標(biāo)簽、簡介文本拼接起來放進(jìn)TF-IDF向量然后計(jì)算文本相似度。from sklearn.feature_extraction.text import TfidfVectorizer from sklearn.metrics.pairwise import linear_kernel games_df[text_feature] ( games_df[genres] games_df[desc].fillna() ) tfidf TfidfVectorizer(stop_wordsenglish, max_features5000) tfidf_matrix tfidf.fit_transform(games_df[text_feature]) content_sim linear_kernel(tfidf_matrix, tfidf_matrix)這套混合策略很經(jīng)典協(xié)同過濾負(fù)責(zé)“人相近”內(nèi)容過濾負(fù)責(zé)“物相近”。實(shí)際返回時權(quán)重可以設(shè)成7:3主流教學(xué)項(xiàng)目里已經(jīng)算考慮周到了。4. Flask接口層和前端頁面怎么把算法結(jié)果送到用戶眼前算法層寫完下面要做的就是把計(jì)算結(jié)果暴露成可以被瀏覽器調(diào)用的HTTP接口。這里我用Flask搭了一個非常標(biāo)準(zhǔn)的Web服務(wù)。4.1 數(shù)據(jù)庫表結(jié)構(gòu)和初始化數(shù)據(jù)庫我用SQLite建表語句放在schema.sql里CREATE TABLE games ( game_id TEXT PRIMARY KEY, name TEXT NOT NULL, genres TEXT, rating REAL, price REAL, desc TEXT, hot_score REAL DEFAULT 0 ); CREATE TABLE users ( user_id TEXT PRIMARY KEY, username TEXT UNIQUE NOT NULL, created_at TIMESTAMP DEFAULT CURRENT_TIMESTAMP ); CREATE TABLE user_likes ( user_id TEXT NOT NULL, game_id TEXT NOT NULL, liked_at TIMESTAMP DEFAULT CURRENT_TIMESTAMP, PRIMARY KEY (user_id, game_id) );Flask啟動時執(zhí)行初始化import sqlite3 def init_db(): conn sqlite3.connect(game_reco.db) with open(schema.sql, r, encodingutf-8) as f: conn.executescript(f.read()) games_df.to_sql(games, conn, if_existsreplace, indexFalse) conn.commit() conn.close()to_sql把Pandas DataFrame直接寫進(jìn)SQLite開發(fā)效率極高。如果線上生產(chǎn)環(huán)境再用遷移工具也不遲課程設(shè)計(jì)階段完全夠用。4.2 推薦接口輸入用戶ID輸出JSON后端接口設(shè)計(jì)成/api/user/user_id/recommend返回JSON數(shù)組。前端拿到數(shù)據(jù)后渲染卡片。接口內(nèi)部要干的事情就是讀用戶喜歡記錄、調(diào)用推薦函數(shù)、把結(jié)果轉(zhuǎn)換成列表。from flask import Flask, jsonify, request app Flask(__name__) app.route(/api/user/user_id/recommend, methods[GET]) def api_recommend(user_id): top_n int(request.args.get(top_n, 10)) behavior_df load_user_likes(user_id) # 從user_likes表讀取 result_df recommend_for_user( user_id, behavior_df, sim_matrix, games_df, top_ntop_n ) return jsonify(result_df.to_dict(orientrecords))這里有個細(xì)節(jié)要提醒一下如果推薦結(jié)果是從games_df里用isin篩選出來的順序會被打亂。必須顯式按照推薦分?jǐn)?shù)重新排序否則前端拿到的第一條并不是推薦分最高的那個。這個坑不顯眼但初學(xué)很容易踩到表現(xiàn)為“推薦的游戲好像都對但順序明顯不對”。# 正確做法先構(gòu)造索引順序再重新索引 ranked result_df.set_index(game_id).loc[top_ids].reset_index()4.3 前端怎么做才最簡單又能看我的前端沒有用前后端分離那套復(fù)雜的工程框架直接用了Jinja2模板 少量原生JavaScript。頁面分兩個index.html做游戲?yàn)g覽用戶點(diǎn)擊“喜歡”按鈕把當(dāng)前game_id存到后端的user_likes表recommend.html展示推薦結(jié)果。核心交互代碼如下async function likeGame(gameId) { const userId demo_user_ localStorage.getItem(uid) || u_001; const resp await fetch(/api/like, { method: POST, headers: { Content-Type: application/json }, body: JSON.stringify({ user_id: userId, game_id: gameId }) }); if (resp.ok) { updateButtonStatus(gameId); } } async function loadRecommendations() { const userId localStorage.getItem(uid) || u_001; const resp await fetch(/api/user/${userId}/recommend?top_n12); const games await resp.json(); renderGameCards(games, #rec-container); }頁面不用追求炫酷能把結(jié)果清晰展示出來即可。我建議給每個游戲卡片加上“推薦理由”的偽解釋字段——基于內(nèi)容相似度的一些標(biāo)簽重疊信息這種解釋性展示在答辯時非常得人心因?yàn)槔蠋熆吹胶髸J(rèn)為你不只是調(diào)了個包而是理解了“可解釋性”這個推薦系統(tǒng)的關(guān)鍵訴求。5. 本地部署完整流程從源碼到瀏覽器能訪問一個推薦系統(tǒng)寫得再漂亮沒法在你電腦上跑起來也是白搭。這個項(xiàng)目的部署沒有用Docker因?yàn)檎n程設(shè)計(jì)場景下要求評委老師去裝Docker容器有點(diǎn)沒必要直接在本地起一個Python虛擬環(huán)境就行。5.1 環(huán)境準(zhǔn)備和依賴安裝首先確保你已經(jīng)安裝了Python 3.8及以上版本。然后在項(xiàng)目根目錄執(zhí)行cd game-recommendation-system python3 -m venv venv source venv/bin/activate # Windows 下是 venv\Scripts\activate pip install -r requirements.txtrequirements.txt的內(nèi)容我列一下全是常用庫flask2.3.3 pandas2.0.3 numpy1.24.3 requests2.31.0 beautifulsoup44.12.2 scikit-learn1.3.0注意版本號我鎖定過主要是為了避免新版sklearn接口變動導(dǎo)致代碼報(bào)錯。部署階段最不劃算的時間浪費(fèi)就是“代碼沒問題但版本不兼容”。5.2 數(shù)據(jù)初始化和啟動服務(wù)安裝完依賴后先跑數(shù)據(jù)預(yù)處理腳本python scripts/preprocess.py python scripts/build_similarity.py兩個腳本會依次產(chǎn)出data/games_clean.csv、data/user_likes.csv并最終生成一個data/sim_matrix.pkl的相似度矩陣緩存文件。把相似度矩陣預(yù)先緩存能省去每次重啟服務(wù)都要重新算一遍的時間游戲數(shù)量在5000款左右時這個優(yōu)化效果很明顯。最后啟動python app.py看到如下日志就說明服務(wù)啟動成功了* Running on http://127.0.0.1:5000瀏覽器訪問http://127.0.0.1:5000輸入演示用戶ID點(diǎn)擊幾個喜歡的游戲推薦列表就能正常返回來。5.3 部署過程中最容易翻車的幾個點(diǎn)我整理了實(shí)際跑這個項(xiàng)目時最容易出的問題都是真實(shí)踩過的坑現(xiàn)象原因解決辦法中文亂碼控制臺或CSV編碼不支持UTF-8pd.read_csv(..., encodingutf-8-sig)或打開CSV時指定編碼pip安裝scikit-learn失敗Python版本太老換Python 3.10以上別在系統(tǒng)自帶舊版本里邊掙扎服務(wù)啟動后端口被占用本機(jī)5000端口已被其他程序占用app.run(port5001)換端口打開頁面非常慢每次請求都重新算相似度確認(rèn)已緩存sim_matrix.pkl不要每次現(xiàn)算瀏覽器顯示Internal Server ErrorFlask debug沒開先設(shè)app.run(debugTrue)看錯誤棧定位后再關(guān)還有一種極小概率出現(xiàn)的情況在Windows控制臺里用python app.py啟動瀏覽器訪問正常但終端里看不到任何日志輸出且CtrlC沒法停。這多半是IDE shell緩沖問題換個PowerShell或直接在IDE里點(diǎn)運(yùn)行按鈕就能解決。6. 源碼結(jié)構(gòu)建議與下一步擴(kuò)展思路最后講一下源碼組織。項(xiàng)目到了中后期最怕的就是所有代碼堆在幾個文件里。合理的目錄劃分既是給自己減負(fù)也是在答辯時為“軟件工程素養(yǎng)”加分。6.1 一個清晰的項(xiàng)目目錄長什么樣我建議按這樣組織game-reco-system/ ├── app.py # Flask 應(yīng)用入口與路由 ├── schema.sql # 建表語句 ├── requirements.txt ├── README.md # 快速部署說明 ├── recommender/ │ ├── __init__.py │ ├── data_loader.py # 數(shù)據(jù)加載和緩存 │ ├── similarity.py # 相似度矩陣構(gòu)建 │ ├── collaborative.py # 協(xié)同過濾推薦邏輯 │ └── content_based.py # 基于內(nèi)容的推薦邏輯 ├── data/ │ ├── games_clean.csv │ ├── user_likes.csv │ └── sim_matrix.pkl ├── scripts/ │ ├── preprocess.py │ ├── build_similarity.py │ └── fetch_games.py ├── templates/ │ ├── index.html │ └── recommend.html └── static/ ├── css/style.css └── js/main.js這種組織方式把算法實(shí)現(xiàn)、數(shù)據(jù)腳本、Web層完全分開。多個開發(fā)成員協(xié)作時不容易沖突改推薦算法不影響接口層改前端頁面也不影響算法層。6.2 如果想做畢設(shè)創(chuàng)新點(diǎn)從這五個方向切入如果只是交作業(yè)上面這套已經(jīng)夠用了。但如果你想做能拿優(yōu)秀論文的版本下面幾個方向都是低成本高收益的擴(kuò)展點(diǎn)第一在推薦結(jié)果里加入時間衰減因子。用指數(shù)衰減函數(shù)給歷史喜歡行為加權(quán)越近的喜歡權(quán)重越高能有效解決用戶興趣漂移問題。第二引入圖結(jié)構(gòu)把用戶和游戲當(dāng)節(jié)點(diǎn)構(gòu)造二部圖用PersonalRank或Node2Vec這種圖算法會比你寫一萬字業(yè)務(wù)背景更有說服力。第三做在線學(xué)習(xí)當(dāng)前推薦給你并點(diǎn)擊的游戲不一定是喜歡的可以通過是否跳轉(zhuǎn)到詳情頁來構(gòu)造隱式反饋。更復(fù)雜的強(qiáng)化學(xué)習(xí)不做沒有數(shù)據(jù)。第四加個排行榜功能把熱門游戲的熱度值用收藏?cái)?shù)、近期點(diǎn)擊數(shù)和好評率綜合計(jì)算。這一項(xiàng)能讓系統(tǒng)看起來更完整。第五寫測試——我是認(rèn)真的給推薦函數(shù)寫幾個pytest單測很容易在老師問“你驗(yàn)證過你的結(jié)果嗎”時拿出真憑實(shí)據(jù)。6.3 關(guān)于代碼講解和論文寫作的一些建議我見過不少同學(xué)代碼寫得不錯但答辯時只會復(fù)述代碼講不出設(shè)計(jì)過程。給大家一個相對可靠的講述邏輯先用一句話回答“做了什么”再說“為什么這樣做”然后說“過程中遇到什么坑”最后說“如果數(shù)據(jù)量擴(kuò)大十倍會怎么優(yōu)化”。這個邏輯能覆蓋大部分提問。論文里建議搭配兩張圖一張系統(tǒng)架構(gòu)圖一張推薦流程圖。通常論文里的架構(gòu)圖畫的是分層結(jié)構(gòu)加上數(shù)據(jù)庫表設(shè)計(jì)流程圖是從用戶點(diǎn)“喜歡”開始經(jīng)過相似度矩陣、最終返回推薦結(jié)果的數(shù)據(jù)流向。還有一個小細(xì)節(jié)所有核心函數(shù)的注釋請用中文寫清楚“輸入是什么、輸出是什么、為什么用這種策略”。老師翻閱源碼時第一眼看的往往不是代碼邏輯而是函數(shù)的注釋面貌。注釋寫得清晰印象分立刻上來了。這個項(xiàng)目做下來我最大的體會有兩點(diǎn)一是推薦系統(tǒng)的核心不在模型多復(fù)雜而在于你對數(shù)據(jù)信號的理解是否到位二是做課程設(shè)計(jì)或畢設(shè)完整性和可解釋性永遠(yuǎn)比算法炫技重要。能用一個樸素的Item-based CF把鏈路跑通、講明白本身就比拿個黑盒模型套上去強(qiáng)得多。如果你也在寫類似的項(xiàng)目按照上面的順序把數(shù)據(jù)層、推薦引擎、Web接口、部署腳本一步步搭起來整個過程大概需要一周左右的課余時間。代碼少說也有千行量級但真正核心的算法其實(shí)不到200行剩下的都是讓系統(tǒng)完整可用的“腳手架”不要被嚇到。