計(jì)嚴(yán)謹(jǐn)性驅(qū)動(dòng) A/B 測試「Ship / Extend / Stop」決策的完整工作流)
PM Skills 的 /analyze-test以統(tǒng)計(jì)嚴(yán)謹(jǐn)性驅(qū)動(dòng) A/B 測試「Ship / Extend / Stop」決策的完整工作流【免費(fèi)下載鏈接】pm-skillsPM Skills Marketplace: 100 agentic skills, commands, and plugins — from discovery to strategy, execution, launch, and growth.項(xiàng)目地址: https://gitcode.com/GitHub_Trending/pm/pm-skills導(dǎo)讀/analyze-test是 pm-data-analytics 插件中面向產(chǎn)品經(jīng)理的 A/B 測試分析命令從匯總統(tǒng)計(jì)、原始 CSV、實(shí)驗(yàn)平臺(tái)截圖或自然語言描述中接收實(shí)驗(yàn)數(shù)據(jù)依次完成實(shí)驗(yàn)設(shè)計(jì)校驗(yàn)、統(tǒng)計(jì)顯著性計(jì)算、效應(yīng)量與置信區(qū)間評(píng)估最終產(chǎn)出包含明確產(chǎn)品決策Ship / Extend / Stop與業(yè)務(wù)影響估算的分析報(bào)告。讀完本文你將掌握該命令的五步工作流、完整的報(bào)告模板、背后的樣本量公式與統(tǒng)計(jì)檢驗(yàn)實(shí)現(xiàn)以及如何利用倉庫中的 ab-test-analysis 技能與 Python/scipy.stats 完成可復(fù)現(xiàn)的顯著性計(jì)算。一、命令定位pm-data-analytics 插件中的實(shí)驗(yàn)決策入口在 pm-skills 倉庫中pm-data-analytics 插件將「數(shù)據(jù)分析」能力拆分為三個(gè)命令與三個(gè)技能構(gòu)成產(chǎn)品經(jīng)理日常數(shù)據(jù)分析的完整工具箱命令/write-query自然語言生成 SQL、/analyze-cohorts留存與參與度隊(duì)列分析、/analyze-testA/B 測試結(jié)果分析技能sql-queries、cohort-analysis、ab-test-analysis。其中/analyze-test是唯一直接面向?qū)嶒?yàn)決策的入口。其元數(shù)據(jù)pm-data-analytics/commands/analyze-test.md 的 YAML frontmatter明確了它的職責(zé)邊界description: Analyze A/B test results — statistical significance, sample size validation, and ship/extend/stop recommendations argument-hint: test results as data, screenshot, or descriptionargument-hint表明該命令接受三種形態(tài)的輸入結(jié)構(gòu)化數(shù)據(jù)、實(shí)驗(yàn)平臺(tái)截圖或純文字描述這也決定了 Step 1 的數(shù)據(jù)接收設(shè)計(jì)。從插件清單 pm-data-analytics/.claude-plugin/plugin.json 可以看到該插件版本為 2.0.0關(guān)鍵詞覆蓋 product-management、data-analytics、sql、cohort-analysis、retention而在 README.md 的插件總覽中/analyze-test被定位為「Analyze A/B test results —— statistical significance, sample size validation, and ship/extend/stop recommendations」。命令與技能的綁定關(guān)系是倉庫的顯式設(shè)計(jì)/analyze-test在 Step 3 中調(diào)用ab-test-analysis技能見 pm-data-analytics/skills/ab-test-analysis/SKILL.md。倉庫根目錄的 validate_plugins.py 中validate_cross_references函數(shù)L289-L310會(huì)校驗(yàn)命令中引用的技能必須存在于同一插件內(nèi)保證這種「命令鏈技能」的結(jié)構(gòu)不懸空。二、Invocation三種調(diào)用姿勢命令支持三種等價(jià)調(diào)用方式覆蓋從「手上有原始數(shù)據(jù)」到「只有一段口頭描述」的全部場景/analyze-test Control: 4.2% conversion (n5000), Variant: 4.8% conversion (n5100) /analyze-test [upload a CSV of test results] /analyze-test [screenshot from your experimentation platform]第一種直接內(nèi)聯(lián)匯總統(tǒng)計(jì)量對照組轉(zhuǎn)化率 4.2%、樣本 5000實(shí)驗(yàn)組轉(zhuǎn)化率 4.8%、樣本 5100適合數(shù)據(jù)已在手上、快速出結(jié)論的場景第二種與第三種面向原始事件數(shù)據(jù)與實(shí)驗(yàn)平臺(tái)Optimizely、LaunchDarkly 等的導(dǎo)出結(jié)果命令會(huì)自動(dòng)讀取并解析。這與 ab-test-analysis 技能中的約定一致If the user provides data files (CSV, Excel, or analytics exports), read and analyze them directly. Generate Python scripts for statistical calculations when needed.三、五步工作流從數(shù)據(jù)輸入到?jīng)Q策輸出Step 1接受測試數(shù)據(jù)Accept Test Data命令以「格式無關(guān)」為設(shè)計(jì)原則接受的輸入包括匯總統(tǒng)計(jì)各變體的轉(zhuǎn)化率與樣本量原始事件數(shù)據(jù)CSV要求包含user_id、variant、converted、timestamp等關(guān)鍵列實(shí)驗(yàn)平臺(tái)截圖Optimizely、LaunchDarkly 等平臺(tái)的運(yùn)行結(jié)果截圖實(shí)驗(yàn)與結(jié)果的文字描述。CSV 這類原始數(shù)據(jù)會(huì)觸發(fā)技能中的自動(dòng)處理邏輯讀取文件后生成 Python 腳本完成統(tǒng)計(jì)計(jì)算而不是依賴人眼估算。Step 2校驗(yàn)實(shí)驗(yàn)設(shè)計(jì)Validate Test Design這是命令強(qiáng)調(diào)「先校驗(yàn)、再分析」的關(guān)鍵一步——結(jié)果來自有缺陷的實(shí)驗(yàn)時(shí)再漂亮的顯著性數(shù)字也具有誤導(dǎo)性。四個(gè)校驗(yàn)維度樣本量是否充足運(yùn)行功效分析power analysis確認(rèn)樣本量能否支撐期望效應(yīng)量的檢測實(shí)驗(yàn)時(shí)長是否足夠至少覆蓋 1~2 個(gè)完整業(yè)務(wù)周期business cycles以捕獲周度周期波動(dòng)隨機(jī)化是否干凈檢查樣本比率失配Sample Ratio MismatchSRM——當(dāng)實(shí)驗(yàn)組與對照組流量占比偏離預(yù)設(shè)比例時(shí)隨機(jī)化很可能被破壞實(shí)驗(yàn)期間的外部因素季節(jié)性活動(dòng)、市場事件、版本發(fā)布等是否污染了結(jié)果窗口。ab-test-analysis 技能為樣本量校驗(yàn)提供了可直接套用的公式n (Z2α/2 × 2 × p × (1-p)) / MDE2其中 Zα/2 為 95% 置信水平下的雙側(cè)分位數(shù)約 1.96p 為基準(zhǔn)轉(zhuǎn)化率MDE 為最小可檢測效應(yīng)Minimum Detectable Effect。技能同時(shí)設(shè)定了一個(gè)硬性閾值功效低于 80% 即為 underpowered統(tǒng)計(jì)功效不足必須顯式標(biāo)記。Step 3分析結(jié)果Analyze ResultsStep 3 調(diào)用 ab-test-analysis 技能執(zhí)行五個(gè)層面的統(tǒng)計(jì)評(píng)估統(tǒng)計(jì)顯著性Statistical significance計(jì)算 p-value 與置信區(qū)間效應(yīng)量Effect size變體間的絕對差與相對差實(shí)際顯著性Practical significance效應(yīng)是否大到對業(yè)務(wù)有意義——統(tǒng)計(jì)顯著 ≠ 業(yè)務(wù)值得上線置信區(qū)間Confidence interval真實(shí)效應(yīng)的合理取值范圍分段分析Segment analysis數(shù)據(jù)允許時(shí)檢查不同用戶分段是否存在差異化效應(yīng)。技能在Calculate statistical significance步驟中給出了具體的計(jì)算口徑pm-data-analytics/skills/ab-test-analysis/SKILL.md L33-L41分別計(jì)算對照組與實(shí)驗(yàn)組的轉(zhuǎn)化率相對提升Relative lift(variant - control) / control × 100p-value使用雙尾 z 檢驗(yàn)two-tailed z-test或卡方檢驗(yàn)chi-squared test95% 置信區(qū)間針對組間差值計(jì)算統(tǒng)計(jì)顯著性判定p 0.05實(shí)際顯著性判定提升量對業(yè)務(wù)是否有意義。對于提供原始數(shù)據(jù)的場景技能要求生成并運(yùn)行 Python 腳本完成上述全部計(jì)算倉庫約定使用scipy.stats見命令 Notes 末尾。除主指標(biāo)外技能還強(qiáng)制檢查守衛(wèi)指標(biāo)guardrail metricsL43-L45如果收入、活躍度、頁面加載時(shí)間等守衛(wèi)指標(biāo)在主指標(biāo)提升的同時(shí)出現(xiàn)惡化那么「主指標(biāo)獲勝」可能并不是一個(gè)真正的勝利——這是 Step 4 決策時(shí)需要權(quán)衡的核心輸入。Step 4生成分析報(bào)告Generate Analysis命令在 Step 4 輸出一份結(jié)構(gòu)化的完整報(bào)告模板命令執(zhí)行時(shí)會(huì)按此骨架填充真實(shí)數(shù)據(jù)## A/B Test Analysis: [Test Name] **Date**: [today] **Test duration**: [X days/weeks] **Total sample**: [N users] ### Results Summary | Variant | Sample | Metric | Rate | 95% CI | |---------|--------|--------|------|--------| | Control | [n] | [metric] | [X%] | [X% - Y%] | | Variant | [n] | [metric] | [X%] | [X% - Y%] | ### Statistical Analysis - **Relative lift**: [X%] ([CI range]) - **P-value**: [X] - **Statistically significant**: [Yes/No] at 95% confidence - **Minimum detectable effect**: [X%] (what the test was powered to detect) ### Sample Size Check - **Required sample**: [N] per variant (for [X%] MDE at 80% power) - **Actual sample**: [N] per variant - **Verdict**: [Sufficiently powered / Underpowered / Overpowered] ### Decision **Recommendation: [SHIP / EXTEND / STOP]** [Clear explanation of why, considering both statistical and practical significance] ### Business Impact Estimate If shipped to 100% of users: - **Expected impact**: [metric change per month/quarter] - **Revenue impact**: [if applicable] - **Confidence**: [How certain we are about this estimate] ### Caveats - [Any concerns about the test validity] - [Segments where results differ] - [Novelty effects or other biases to consider] ### Follow-Up - [What to test next based on learnings] - [Monitoring plan if shipping the variant]報(bào)告設(shè)計(jì)上值得注意的幾點(diǎn)Sample Size Check用「實(shí)際樣本 vs 需求樣本」直接給出 Sufficiently powered / Underpowered / Overpowered 判定與 Step 2 的功效分析首尾呼應(yīng)Business Impact Estimate把統(tǒng)計(jì)結(jié)果翻譯成月度/季度業(yè)務(wù)指標(biāo)變化與收入影響并強(qiáng)制要求標(biāo)注置信度避免把區(qū)間估計(jì)當(dāng)確定值Caveats與Follow-Up則把實(shí)驗(yàn)的有效性疑慮、分段差異、新奇效應(yīng)novelty effect和后續(xù)監(jiān)控計(jì)劃顯式列出。技能側(cè)還提供了一個(gè)更精簡的結(jié)果摘要格式L58-L72適合快速匯報(bào)Hypothesis / Duration / Sample頭信息 主指標(biāo)與守衛(wèi)指標(biāo)對照表Metric | Control | Variant | Lift | p-value | Significant?Recommendation / Reasoning / Next steps三段式收尾。Step 5提供下一步行動(dòng)建議Offer Next Steps分析完成并非終點(diǎn)命令在 Step 5 主動(dòng)銜接后續(xù)工作流提供三類跟進(jìn)選項(xiàng)Want me todesign a follow-up experimentbased on these findings?——基于本次發(fā)現(xiàn)設(shè)計(jì)后續(xù)實(shí)驗(yàn)Should Irun the analysis for specific segments?——針對特定用戶分段深入分析Want me togenerate the SQLto monitor this metric post-launch?——生成上線后監(jiān)控指標(biāo)的 SQL。第三項(xiàng)直接與同插件的/write-query命令形成工作流銜接——這也呼應(yīng)了 README.md 中「Commands are designed to flow into each other」的設(shè)計(jì)理念一條命令結(jié)束后建議的相關(guān)命令恰好是產(chǎn)品經(jīng)理工作流的自然下一環(huán)。四、決策框架從統(tǒng)計(jì)結(jié)果到產(chǎn)品結(jié)論的映射表ab-test-analysis 技能給出了「實(shí)驗(yàn)結(jié)果 → 推薦動(dòng)作」的完整映射表這是 Step 4 中 SHIP / EXTEND / STOP 決策的依據(jù)pm-data-analytics/skills/ab-test-analysis/SKILL.md L49-L55OutcomeRecommendationSignificant positive lift, no guardrail issuesShip it— roll out to 100%Significant positive lift, guardrail concernsInvestigate— understand trade-offs before shippingNot significant, positive trendExtend the test— need more data or larger effectNot significant, flatStop the test— no meaningful difference detectedSignificant negative liftDont ship— revert to control, analyze why這張表的精髓在于引入了第五種狀態(tài)當(dāng)主指標(biāo)顯著為正但守衛(wèi)指標(biāo)惡化時(shí)決策不是簡單的 Ship 而是 Investigate——先理解權(quán)衡trade-off再?zèng)Q定是否全量。這與命令文檔中「統(tǒng)計(jì)顯著性 ≠ 實(shí)際顯著性」的警示一脈相承。五、統(tǒng)計(jì)實(shí)現(xiàn)要點(diǎn)scipy.stats 與可復(fù)現(xiàn)計(jì)算當(dāng)輸入為 CSV 原始數(shù)據(jù)時(shí)命令與技能約定使用Python scipy.stats生成完整分析命令 Notes 第 5 條If data is provided as CSV, generate the full analysis using Python with scipy.stats。從技能的算法描述可以還原出實(shí)現(xiàn)路徑轉(zhuǎn)化率converted列按variant分組求均值相對提升(variant_rate - control_rate) / control_rate * 100顯著性檢驗(yàn)雙尾 z 檢驗(yàn)對比例可用 z-test for proportions或卡方檢驗(yàn)scipy.stats.chi2_contingency得到 p-value置信區(qū)間基于比例的 Wald 區(qū)間或更穩(wěn)健的 Wilson 區(qū)間輸出 95% CI樣本量/功效校驗(yàn)代入 Step 2 的公式n (Z2α/2 × 2 × p × (1-p)) / MDE2反推需求樣本量并與實(shí)際樣本對比給出 powered 判定。技能中Think step by step. Save as markdown. Generate Python scripts for calculations if raw data is provided.L74意味著完整分析腳本會(huì)被保存保證結(jié)論可復(fù)現(xiàn)、可隨新數(shù)據(jù)重跑——這與/analyze-cohorts命令中「保存 Python 腳本以便用新數(shù)據(jù)重跑」的約定pm-data-analytics/commands/analyze-cohorts.md Notes是同一設(shè)計(jì)哲學(xué)。六、注意事項(xiàng)與常見陷阱Notes命令文檔在 Notes 一節(jié)集中列出了實(shí)踐中的關(guān)鍵警示這些是產(chǎn)品經(jīng)理最容易踩坑的地方統(tǒng)計(jì)顯著 ≠ 實(shí)際顯著數(shù)據(jù)足夠多時(shí) 0.1% 的提升也能顯著但未必值得上線——決策必須同時(shí)看效應(yīng)量的業(yè)務(wù)意義先查樣本比率失配SRM在信任任何結(jié)果之前確認(rèn)實(shí)驗(yàn)組/對照組流量比例符合預(yù)設(shè)新奇效應(yīng)會(huì)虛高短期結(jié)果建議上線后持續(xù)監(jiān)控 2~4 周讓新奇效應(yīng)消退后再下最終結(jié)論功效不足時(shí)正確答案通常是「延展」而非「無效果」Underpowered 實(shí)驗(yàn)無法區(qū)分「沒有差異」和「差異太小測不出來」此時(shí) EXTEND 比 STOP 更穩(wěn)妥收入類指標(biāo)要用置信區(qū)間估算影響用置信區(qū)間的上下界分別估算最好與最壞的業(yè)務(wù)影響而不是只報(bào)點(diǎn)估計(jì)CSV 數(shù)據(jù)走 Python scipy.stats保證計(jì)算的精確性與可復(fù)現(xiàn)性而非手工估算。七、在倉庫中的實(shí)現(xiàn)結(jié)構(gòu)與進(jìn)一步閱讀如果你希望深入理解該命令的工程實(shí)現(xiàn)與周邊配套可以在倉庫中按以下路徑繼續(xù)探索命令本體pm-data-analytics/commands/analyze-test.md —— 本文所基于的核心文檔frontmatter 含description與argument-hint底層技能pm-data-analytics/skills/ab-test-analysis/SKILL.md —— 樣本量公式、檢驗(yàn)方法、決策映射表與結(jié)果摘要模板的完整定義插件清單pm-data-analytics/.claude-plugin/plugin.json —— 插件元數(shù)據(jù)、作者信息與關(guān)鍵詞插件 READMEpm-data-analytics/README.md —— 三個(gè)技能與三個(gè)命令的索引安裝方式在 README.md 中可查看claude plugin install pm-data-analyticspm-skills的安裝命令Claude Code 與 Codex CLI 均支持質(zhì)量保障validate_plugins.py —— 根目錄的插件校驗(yàn)?zāi)_本validate_commandL232-L265檢查命令 frontmatter 必填字段validate_cross_referencesL289-L310校驗(yàn)命令引用的技能存在性保證本文所述「命令 → 技能」鏈條的完整性。在 pm-data-analytics/skills/ab-test-analysis/SKILL.md 的 Further Reading 一節(jié)還列出了 A/B 測試基礎(chǔ)、實(shí)驗(yàn)庫與指標(biāo)選擇等延伸閱讀原文為外部鏈接此處僅提示其存在。結(jié)合命令文檔的完整工作流與技能層的統(tǒng)計(jì)實(shí)現(xiàn)/analyze-test為產(chǎn)品經(jīng)理提供了一條從「拿到實(shí)驗(yàn)數(shù)據(jù)」到「做出有依據(jù)的產(chǎn)品決策」的標(biāo)準(zhǔn)化路徑先校驗(yàn)實(shí)驗(yàn)設(shè)計(jì)、再計(jì)算統(tǒng)計(jì)量、最終在統(tǒng)計(jì)顯著性與實(shí)際顯著性之間做出權(quán)衡把 A/B 測試從「看誰的百分比高」升級(jí)為「用統(tǒng)計(jì)嚴(yán)謹(jǐn)性說話」?!久赓M(fèi)下載鏈接】pm-skillsPM Skills Marketplace: 100 agentic skills, commands, and plugins — from discovery to strategy, execution, launch, and growth.項(xiàng)目地址: https://gitcode.com/GitHub_Trending/pm/pm-skills創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考