據(jù)分析師必備的18個核心模型:從描述歸因到預(yù)測決策全解析)
1. 從“會用工具”到“會選模型”數(shù)據(jù)分析師的核心分水嶺干了這么多年數(shù)據(jù)分析我見過太多同行包括早期的我自己都曾陷入一個誤區(qū)把數(shù)據(jù)分析等同于熟練使用SQL、Python或者某個BI工具。工具用得再溜函數(shù)寫得再花哨如果面對一個具體的業(yè)務(wù)問題時腦子里一片空白不知道該用什么“套路”去拆解那充其量只是個“數(shù)據(jù)操作員”。真正的價值在于你能像一個經(jīng)驗豐富的偵探面對一堆雜亂無章的線索數(shù)據(jù)知道該用哪種“推理模型”去找到真相。今天我就把我這些年積累的、最常用的18種數(shù)據(jù)分析模型和方法結(jié)合真實的業(yè)務(wù)場景掰開揉碎了講給你聽。這不僅是測繪、金融、電商等任何領(lǐng)域畢業(yè)論文的利器更是你日常工作中從“被動取數(shù)”走向“主動洞察”的必備武器庫。2. 基礎(chǔ)認知層描述現(xiàn)狀與發(fā)現(xiàn)問題在動手分析任何問題之前我們得先搞清楚“發(fā)生了什么”。這個階段的目標是客觀、準確地描繪現(xiàn)狀為后續(xù)的深度分析打下堅實基礎(chǔ)。很多初級分析報告的問題恰恰就出在這一步——描述不清或者帶著預(yù)設(shè)的結(jié)論去描述。2.1 對比分析沒有對比就沒有傷害和洞察這是所有分析方法的基石簡單但威力巨大。核心就一句話孤立的數(shù)據(jù)沒有意義。一個產(chǎn)品本月銷售額1000萬是好是壞不知道。和上個月比環(huán)比、和去年同期比同比、和行業(yè)標桿比橫向?qū)Ρ?、和預(yù)設(shè)目標比目標對比答案才會浮現(xiàn)。實操要點與避坑選擇合適的對比對象這是最容易出錯的地方。對比一個不相關(guān)的對象會得出完全錯誤的結(jié)論。例如對比暑期教育產(chǎn)品的銷售額和冬季的意義不大。要對比去年同期的暑期或者對比競品同期的暑期。確保口徑一致這是數(shù)據(jù)工作的“生命線”。對比前必須確認數(shù)據(jù)的時間范圍、統(tǒng)計維度如“活躍用戶”的定義、計算邏輯是否完全一致。我踩過的坑是一次分析用戶留存發(fā)現(xiàn)結(jié)果異常好后來才發(fā)現(xiàn)是技術(shù)部門中途修改了“用戶登錄”的事件埋點定義導(dǎo)致前后數(shù)據(jù)不可比。務(wù)必在分析啟動前與數(shù)據(jù)生產(chǎn)方如數(shù)倉、業(yè)務(wù)系統(tǒng)負責(zé)人對齊指標口徑。多維度交叉對比單一維度的對比可能掩蓋問題。比如總銷售額同比上漲了20%看起來不錯。但拆開新老用戶看發(fā)現(xiàn)老用戶銷售額暴跌全靠新用戶補貼拉起來的這就揭示了增長結(jié)構(gòu)不健康的問題。2.2 分組分析維度拆解把大象裝進冰箱先得分塊看當對比分析發(fā)現(xiàn)了問題如“總體銷售額下降”下一步就是定位問題到底出在哪兒。分組分析也叫維度下鉆就是把整體數(shù)據(jù)按照某個或某幾個維度如地區(qū)、用戶類型、產(chǎn)品類別、渠道來源進行拆分觀察各個子群體的表現(xiàn)。經(jīng)典應(yīng)用漏斗分析與矩陣分析漏斗分析本質(zhì)上是一種特殊的分組分析按照用戶行為流程進行分組。從“曝光”-“點擊”-“注冊”-“付費”每一步都是一個分組。分析的核心是計算每一步的轉(zhuǎn)化率并定位流失最大的環(huán)節(jié)。例如一個電商App發(fā)現(xiàn)從商品詳情頁到下單支付的轉(zhuǎn)化率驟降那么問題很可能出在支付流程、優(yōu)惠券使用或庫存提示上。矩陣分析象限法比如經(jīng)典的波士頓矩陣用“市場增長率”和“相對市場份額”兩個維度把產(chǎn)品分為明星、金牛、問題和瘦狗四類。這不僅是描述更直接指向策略投資明星、收割金牛、審視問題、放棄瘦狗。在用戶運營中可以用“最近購買時間R”和“購買頻率F”構(gòu)建RFM模型也是矩陣思想的體現(xiàn)用于用戶分群與精準營銷。我的心得分組時維度不是越多越好。優(yōu)先選擇與業(yè)務(wù)假設(shè)最相關(guān)的1-2個核心維度進行拆解。貪多會導(dǎo)致每個分組的樣本量過小結(jié)論不可靠而且會讓報告變得冗長混亂。2.3 結(jié)構(gòu)分析看清業(yè)務(wù)的“成分表”結(jié)構(gòu)分析關(guān)注的是總體中各個部分的占比及其變化。它回答的是“構(gòu)成如何”和“哪個部分最重要”的問題。靜態(tài)結(jié)構(gòu)看某個時間點的構(gòu)成。例如公司營收中產(chǎn)品A、B、C各自的占比。動態(tài)結(jié)構(gòu)看占比隨時間的變化趨勢。例如連續(xù)幾個季度高利潤產(chǎn)品占比是否在提升低毛利產(chǎn)品占比是否在下降這直接反映了產(chǎn)品策略和運營重點是否有效。在測繪領(lǐng)域的應(yīng)用聯(lián)想在測繪科學(xué)畢業(yè)論文中你可以分析某個區(qū)域土地利用類型的構(gòu)成耕地、林地、建設(shè)用地、水域的占比并研究其多年來的結(jié)構(gòu)變化從而揭示該區(qū)域的城鎮(zhèn)化進程或生態(tài)變遷。這就是典型的結(jié)構(gòu)分析。3. 診斷歸因?qū)犹骄俊盀槭裁础泵枋銮宄鞍l(fā)生了什么”之后自然要問“為什么會這樣”。這個層面的模型幫助我們建立變量間的因果關(guān)系或相關(guān)關(guān)系找到問題的根因。3.1 相關(guān)分析發(fā)現(xiàn)線索間的“曖昧關(guān)系”相關(guān)分析用于衡量兩個或多個變量之間關(guān)系的強度和方向。核心指標是相關(guān)系數(shù)如皮爾遜相關(guān)系數(shù)范圍在-1到1之間。正值表示正相關(guān)一個增加另一個也增加負值表示負相關(guān)絕對值越接近1關(guān)系越強。重要警告相關(guān)不等于因果這是數(shù)據(jù)分析中最經(jīng)典的陷阱。夏天冰淇淋銷量和溺水人數(shù)高度正相關(guān)但你能說是冰淇淋導(dǎo)致溺水嗎不它們都受第三個變量“氣溫”的影響。所以發(fā)現(xiàn)相關(guān)性只是提出了一個假設(shè)絕不能直接當作結(jié)論。實操建議在做相關(guān)分析時一定要結(jié)合業(yè)務(wù)常識進行判斷。并且可以進一步使用下面提到的回歸分析在控制其他變量的情況下檢驗這種關(guān)系是否依然穩(wěn)健。3.2 回歸分析量化影響預(yù)測未來如果說相關(guān)分析是發(fā)現(xiàn)“A和B有關(guān)”回歸分析則是試圖量化“A變化一個單位B會平均變化多少”。它是診斷歸因和預(yù)測的利器。線性回歸最基礎(chǔ)的形式假設(shè)因變量和自變量呈線性關(guān)系。比如研究廣告投入X對銷售額Y的影響得到方程 Y aX b。系數(shù)a就表示廣告每多投入1萬元銷售額平均增加a萬元。邏輯回歸當因變量是二分類結(jié)果如是/否買/不買時使用。它預(yù)測的是事件發(fā)生的概率。常用于用戶流失預(yù)測、信用風(fēng)險評分等場景。避坑指南多重共線性如果多個自變量之間高度相關(guān)會導(dǎo)致回歸系數(shù)估計不準難以解釋。解決方法是使用方差膨脹因子VIF進行診斷或采用嶺回歸、主成分回歸等方法。過擬合模型在訓(xùn)練數(shù)據(jù)上表現(xiàn)完美但在新數(shù)據(jù)上一塌糊涂。這說明模型可能“死記硬背”了訓(xùn)練數(shù)據(jù)中的噪聲。解決方法是使用更多的數(shù)據(jù)、進行特征選擇、或使用正則化技術(shù)。忽略殘差分析做完回歸一定要檢查殘差預(yù)測值與實際值之差是否隨機分布。如果殘差有規(guī)律如隨時間增大說明模型遺漏了關(guān)鍵變量需要改進。3.3 杜邦分析財務(wù)問題的“解剖刀”這是一個專門用于財務(wù)分析的神器它通過層層分解凈資產(chǎn)收益率ROE這個核心指標來診斷企業(yè)盈利能力的驅(qū)動因素。公式為ROE 凈利潤率 × 總資產(chǎn)周轉(zhuǎn)率 × 權(quán)益乘數(shù)。凈利潤率反映公司的盈利能力賣一件貨賺多少錢??傎Y產(chǎn)周轉(zhuǎn)率反映公司的運營效率資產(chǎn)用來賺錢的速度。權(quán)益乘數(shù)反映公司的財務(wù)杠桿用多少別人的錢來賺錢。通過對比公司歷史數(shù)據(jù)或行業(yè)標桿你可以一眼看出公司的ROE變化到底是由于產(chǎn)品利潤變薄了凈利率下降還是庫存積壓周轉(zhuǎn)慢了資產(chǎn)周轉(zhuǎn)率下降或是降低了負債權(quán)益乘數(shù)下降。這為管理層提供了極其清晰的改進方向。3.4 5W2H分析萬能的問題拆解框架這其實是一個思維模型而非統(tǒng)計模型但在歸因時極其好用。面對任何問題都從這七個角度去追問What發(fā)生了什么問題現(xiàn)象是什么Why為什么會發(fā)生根本原因是什么Who是誰的責(zé)任涉及哪些角色When什么時候發(fā)生的頻率如何Where在哪里發(fā)生的How怎么發(fā)生的過程如何How much程度如何數(shù)量或代價是多少這個模型能幫你避免歸因時的片面性系統(tǒng)地梳理所有可能的相關(guān)因素。例如一個線上活動效果不佳用5W2H一過活動內(nèi)容What是否吸引人目標用戶Who定位準了嗎推送時間When合適嗎活動頁面Where體驗流暢嗎參與流程How是否太復(fù)雜投入產(chǎn)出How much是否合理這樣排查很難有遺漏。4. 預(yù)測與評估層預(yù)見未來與衡量價值基于歷史和現(xiàn)狀我們對未來進行推測并對不同的方案或結(jié)果進行評價。4.1 時間序列分析從歷史曲線中看到未來這是預(yù)測的核心方法認為事物的未來發(fā)展會延續(xù)過去的某些模式和趨勢。核心是分解時間序列的四個成分趨勢T長期上升或下降的方向。季節(jié)S固定周期內(nèi)的重復(fù)波動如每季度、每年。周期C非固定周期的波動如經(jīng)濟周期。隨機I無法預(yù)測的噪聲。常用模型包括移動平均、指數(shù)平滑如Holt-Winters模型和更復(fù)雜的ARIMA自回歸積分滑動平均模型。個人經(jīng)驗對于業(yè)務(wù)預(yù)測不要一味追求模型的復(fù)雜性。很多時候一個簡單的指數(shù)平滑模型因為參數(shù)少、易于解釋和調(diào)整其表現(xiàn)和穩(wěn)定性會優(yōu)于復(fù)雜的ARIMA。關(guān)鍵是理解業(yè)務(wù)本身是否有強烈的季節(jié)性如零售、旅游或趨勢性如成長期的互聯(lián)網(wǎng)產(chǎn)品。4.2 聚類分析物以類聚人以群分這是一種“無監(jiān)督學(xué)習(xí)”方法即在沒有預(yù)先標簽的情況下根據(jù)數(shù)據(jù)本身的相似性將樣本劃分為不同的群組。目的是讓組內(nèi)樣本盡可能相似組間樣本盡可能不同。K-Means聚類最常用的算法。你需要預(yù)先指定聚類的數(shù)量K。常用于客戶分群、用戶畫像構(gòu)建、市場細分。層次聚類不需要指定K會形成一個樹狀的聚類結(jié)構(gòu)你可以根據(jù)業(yè)務(wù)需要選擇合適的切割層次。在測繪領(lǐng)域的應(yīng)用在遙感圖像分析中聚類算法可以用于土地覆蓋分類將像素點根據(jù)光譜特征自動聚成林地、水體、城市等類別為畢業(yè)論文提供自動化分類的方法。關(guān)鍵點聚類前必須進行數(shù)據(jù)標準化因為不同特征如年齡和收入的量綱差異巨大會嚴重影響距離計算。同時聚類的結(jié)果需要業(yè)務(wù)專家進行解讀和驗證給每個簇賦予業(yè)務(wù)意義如“高價值活躍用戶”、“低頻薅羊毛用戶”。4.3 分類模型給數(shù)據(jù)貼上標簽與聚類相反分類是“有監(jiān)督學(xué)習(xí)”。我們有一批已經(jīng)知道標簽的數(shù)據(jù)如“已流失用戶”和“未流失用戶”讓模型學(xué)習(xí)其中的規(guī)律然后去預(yù)測新數(shù)據(jù)的標簽。決策樹非常直觀像一棵倒置的樹每個節(jié)點都是一個判斷條件如“年齡30”最終葉子節(jié)點就是分類結(jié)果。優(yōu)點是易于理解和解釋。隨機森林構(gòu)建多棵決策樹通過“投票”決定最終結(jié)果。它比單棵決策樹更強大、更穩(wěn)定不易過擬合。支持向量機SVM擅長處理高維數(shù)據(jù)和非線性分類問題通過核函數(shù)。應(yīng)用場景信用評分判斷好壞客戶、圖像識別判斷圖片中是貓還是狗、疾病診斷根據(jù)指標判斷是否患病。4.4 A/B測試因果推斷的“黃金標準”當你有一個改進產(chǎn)品的想法如新按鈕顏色、新推薦算法時如何科學(xué)地證明它真的有效A/B測試就是答案。它將用戶隨機分為兩組或多組一組體驗原方案A組另一組體驗新方案B組在相同時間內(nèi)運行然后對比關(guān)鍵指標如轉(zhuǎn)化率、點擊率。核心原則與常見坑隨機性用戶分組必須完全隨機確保兩組用戶在實驗前除了實驗因素外其他方面如活躍度、偏好統(tǒng)計上無差異。這是得出因果結(jié)論的前提。單一變量理想情況下A/B兩組只應(yīng)有一個不同如按鈕顏色這樣才能把結(jié)果的差異歸因于這個變量。如果同時改了顏色和文案就無法知道是哪個起了作用。樣本量與統(tǒng)計顯著性實驗需要足夠的樣本量和運行時間以確保觀察到的差異不是隨機波動。必須使用假設(shè)檢驗如t檢驗計算p值通常p0.05才認為結(jié)果統(tǒng)計顯著。關(guān)注長期影響有些改動短期看指標上升如更激進的彈窗但可能損害長期用戶體驗和留存。A/B測試應(yīng)關(guān)注包括留存率在內(nèi)的綜合指標。5. 戰(zhàn)略與決策層從分析到行動數(shù)據(jù)分析的最終目的是為了做出更好的決策。這個層面的模型幫助我們系統(tǒng)化地評估選項、分配資源、制定策略。5.1 SWOT分析內(nèi)外兼修看清全局這是一個經(jīng)典的戰(zhàn)略規(guī)劃工具從內(nèi)部優(yōu)勢、劣勢和外部機會、威脅四個維度審視一個項目、產(chǎn)品或公司。優(yōu)勢我們做得好的、獨有的內(nèi)部因素。劣勢我們做得不好、需要改進的內(nèi)部因素。機會外部環(huán)境中有利于我們發(fā)展的因素。威脅外部環(huán)境中可能帶來風(fēng)險或挑戰(zhàn)的因素。關(guān)鍵不在于羅列而在于組合分析交叉矩陣SO策略利用優(yōu)勢抓住機會進攻型。ST策略利用優(yōu)勢規(guī)避威脅防御型。WO策略利用機會克服劣勢扭轉(zhuǎn)型。WT策略減少劣勢規(guī)避威脅生存型。這樣SWOT就從靜態(tài)清單變成了動態(tài)的策略生成器。5.2 PEST分析站在宏觀角度看賽道如果說SWOT側(cè)重企業(yè)自身和行業(yè)競爭PEST則幫你分析更宏觀的外部環(huán)境適合市場進入、長期戰(zhàn)略規(guī)劃等場景。它分析四個宏觀因素政治政策、法規(guī)、穩(wěn)定性等。經(jīng)濟增長率、利率、通貨膨脹、消費水平等。社會人口結(jié)構(gòu)、文化觀念、生活方式等。技術(shù)技術(shù)變革、創(chuàng)新、自動化等。例如分析新能源汽車行業(yè)PEST框架會讓你系統(tǒng)性地思考政府補貼政策P、居民可支配收入E、環(huán)保意識普及S、電池技術(shù)突破T分別帶來了哪些影響。5.3 邏輯樹/議題樹復(fù)雜問題的“分解神器”又名MECE原則相互獨立完全窮盡。當面對一個龐大復(fù)雜的問題如“如何提升公司利潤”時邏輯樹將它層層分解成若干個相互獨立、沒有重疊的子議題直到這些子議題都變得足夠具體、可以著手分析或解決為止。例如第一層利潤 收入 - 成本。第二層收入端收入 銷量 × 單價。銷量 新客戶銷量 老客戶復(fù)購銷量。第三層新客戶銷量新客戶銷量 潛在客戶數(shù) × 轉(zhuǎn)化率 × 客單價…… 如此不斷分解最終形成一個樹狀結(jié)構(gòu)。它能確保思考的全面性和條理性是麥肯錫等咨詢公司的核心工具。5.4 帕累托分析二八法則抓住關(guān)鍵少數(shù)這個原理認為80%的結(jié)果往往由20%的原因所導(dǎo)致。在數(shù)據(jù)分析中我們通過繪制帕累托圖一種特殊的柱狀圖折線圖來識別這些“關(guān)鍵少數(shù)”。如何操作列出所有問題項如產(chǎn)品缺陷類型、客戶投訴原因。計算每項的頻率或成本并從高到低排序。計算累計百分比。繪制圖表柱狀圖顯示每項的值折線圖顯示累計百分比。你會發(fā)現(xiàn)排在前幾項的問題其累計百分比往往迅速達到70%-80%。那么你的改進資源就應(yīng)該優(yōu)先投入到解決這幾個問題上這樣才能用最小的投入獲得最大的改善效果。5.5 平衡計分卡化戰(zhàn)略為可執(zhí)行的指標這是一個戰(zhàn)略管理和績效評估工具旨在將組織的愿景和戰(zhàn)略轉(zhuǎn)化為一套具體的、平衡的績效指標。它從四個平衡的維度來設(shè)定目標財務(wù)維度我們?nèi)绾卧诠蓶|眼中成功如營收、利潤客戶維度我們?nèi)绾卧诳蛻粞壑谐晒θ鐫M意度、市場份額內(nèi)部流程維度我們必須擅長什么如生產(chǎn)效率、交付周期學(xué)習(xí)與成長維度我們?nèi)绾纬掷m(xù)提升和創(chuàng)造價值如員工技能、信息系統(tǒng)它的精髓在于“平衡”和“因果”。不僅關(guān)注財務(wù)結(jié)果也關(guān)注驅(qū)動這些結(jié)果的內(nèi)部過程、客戶以及未來的成長能力。四個維度的指標之間應(yīng)有因果關(guān)系形成一個“戰(zhàn)略地圖”。例如“員工培訓(xùn)投入學(xué)習(xí)成長”提升 - “產(chǎn)品創(chuàng)新速度內(nèi)部流程”加快 - “客戶滿意度客戶”提高 - “公司營收財務(wù)”增長。6. 綜合實戰(zhàn)如何為你的論文或項目選擇模型面對這么多模型你可能會懵我的問題到底該用哪個記住模型是工具問題是核心。選擇模型的過程就是診斷問題的過程。一個簡單的決策流程明確目標我到底要回答什么問題是描述現(xiàn)狀、查找原因、預(yù)測未來還是評估方案評估數(shù)據(jù)我有什么數(shù)據(jù)是時間序列數(shù)據(jù)、截面數(shù)據(jù)、還是面板數(shù)據(jù)數(shù)據(jù)質(zhì)量如何樣本量夠嗎匹配模型想描述/對比用對比分析、分組分析、結(jié)構(gòu)分析。想找原因用相關(guān)分析找線索、回歸分析量化影響、杜邦分析財務(wù)歸因、5W2H系統(tǒng)梳理。想做預(yù)測用時間序列分析基于歷史趨勢、分類/聚類模型基于特征預(yù)測。想做實驗驗證用A/B測試。想制定策略用SWOT、PEST、邏輯樹、帕累托分析、平衡計分卡。迭代驗證沒有哪個模型是“唯一正確”的。通常需要結(jié)合使用并用業(yè)務(wù)常識和新的數(shù)據(jù)去驗證模型的結(jié)論是否合理。給測繪科學(xué)與技術(shù)專業(yè)同學(xué)的建議 如果你的畢業(yè)論文涉及處理大量的空間、遙感或測量數(shù)據(jù)除了上述通用模型你還需要重點關(guān)注與空間分析相關(guān)的特定方法它們往往是你論文的亮點空間自相關(guān)分析檢驗地理事物在空間上是否是隨機分布的是否存在聚集或分散模式如莫蘭指數(shù)。地統(tǒng)計分析用于空間插值如克里金法根據(jù)已知點的測量值預(yù)測未知點的值常用于繪制等高線、污染物濃度分布圖等。緩沖區(qū)分析研究地理要素如河流、道路對其周圍區(qū)域的影響范圍。疊加分析將多個地理圖層進行疊加產(chǎn)生新的空間關(guān)系和屬性如將土地利用圖層與坡度圖層疊加找出適合建設(shè)的區(qū)域。將這些空間分析模型與前面提到的統(tǒng)計模型如回歸分析可以升級為地理加權(quán)回歸以考慮空間異質(zhì)性聚類分析可用于遙感影像分類結(jié)合起來你的論文在方法論上就會顯得非常扎實和前沿。最后我想說掌握這些模型不是讓你死記硬背公式而是要在你大腦里搭建一個“分析工具箱”。下次再面對一堆數(shù)據(jù)和模糊的問題時你能下意識地反應(yīng)“哦這個問題我可以用A/B測試來驗證這個功能效果用漏斗分析定位流失環(huán)節(jié)用回歸分析量化那幾個因素的影響大小……” 這才是數(shù)據(jù)分析師真正的核心能力。工具和模型會不斷更新但這種結(jié)構(gòu)化的分析思維才是你長期吃飯的本錢。先從徹底搞懂這18個最常用的開始在每一個實際項目中刻意練習(xí)你會發(fā)現(xiàn)自己看問題的深度和說服力完全不一樣了。