ए/बी टेस्टिंग एलएलएम विशेषताएं ग्रोथबुक, स्टैटिग और वाइब्स समस्या
Type: Learn
Languages: Python (stdlib, toy sequential test simulator)
Prerequisites: Phase 17 · 13 (Observability), Phase 17 · 20 (Progressive Deployment)
Time: ~60 minutes
सीखने के लक्ष्य
- मूल्यांकन ("मॉडल काम कर सकता है") को ए/बी परीक्षणों ("उपयोगकर्ताओं की परवाह करते हैं") से अलग करें।
- तीन परीक्षण योग्य अक्षों (प्रोम्प्ट, मॉडल, पैरामीटर) को सूचीबद्ध करें और प्रत्येक के लिए मीट्रिक चुनें।
- CUPED, अनुक्रमिक परीक्षण और बेंजामिन-होचबर्ग बहु-समानता सुधारों को समझाएँ।
- स्टैटिज या ग्रोथबुक को गोदाम-एसक्यूएल मुद्रा और कॉर्पोरेट अधिग्रहण रुख के आधार पर चुनें।
समस्या
आप एक प्रणाली संकेत को हाथ से समायोजित किया है. यह बेहतर लगता है. आप इसे भेजते हैं. परिवर्तन शोर से बदलता है. आप मीट्रिक को दोष देते हैं. या आप एक नया मॉडल भेज दिया और रूपांतरण नहीं चला गया? मॉडल गिराया या परिवर्तन पता लगाने के लिए बहुत छोटा था? आप नहीं जानते, क्योंकि आप एक ए / बी के बिना भेज दिया.
ईवल जवाब देते हैं कि क्या मॉडल लेबल सेट पर एक कार्य कर सकता है। वे जवाब नहीं देते हैं कि क्या उपयोगकर्ता आउटपुट पसंद करते हैं। केवल एक नियंत्रित ऑनलाइन प्रयोग जवाब देता है कि, और केवल अगर प्रयोग में पर्याप्त शक्ति है, गैर-निर्धारकता के लिए नियंत्रण, और कई तुलनाओं के लिए सुधार करता है।
अवधारणा
Evals vs A/B परीक्षण
Evals ऑफ़लाइन, लेबल सेट, जज (रूब्रिक या एलएलएम-जैसे-जजज या मानव) । उत्तरः "क्या इस निश्चित वितरण पर आउटपुट सही / उपयोगी / सुरक्षित है?
A/B test ऑनलाइन, लाइव यूजर्स, रैंडम। जवाबः "क्या नया वेरिएंट उपयोगकर्ता स्तर की मेट्रिक को स्थानांतरित करता है जो मायने रखता है?
दोनों आवश्यक हैं। जोखिम से पहले ईवलस कैच रेग्रेशंस; ए/बी उत्पाद प्रभाव की पुष्टि के बाद करता है।
क्या परीक्षण करना है
- Prompt engineering शब्द, सिस्टम-प्रोम्प्ट संरचना, उदाहरण. मेट्रिकः कार्य सफलता, उपयोगकर्ता प्रतिधारण, लागत/अनुरोध।
- Model selection GPT-4 बनाम GPT-3.5-Turbo बनाम Llama-OSS. मीट्रिकः सटीकता (कार्य) + लागत/अनुरोध + विलंबता P99. बहु-उद्देश्य।
- Generation parameters तापमान, शीर्ष-पी, अधिकतम_टॉकेन्स. मीट्रिकः कार्य-विशिष्ट (आउटपुट विविधता बनाम निर्धारिता) ।
CUPED भिन्नता में कमी
प्रयोग से पहले के आंकड़ों का उपयोग करके नियंत्रित प्रयोग। पोस्ट-पीरियड की तुलना करने से पहले पूर्व-मियाद भिन्नता को वापस लें। विशिष्ट भिन्नता में कमीः 30-70%. प्रभावी नमूना आकार मुफ्त में बढ़ जाता है।
कार्यान्वयनः Statsig और GrowthBook दोनों लागू करें।
अनुक्रमिक परीक्षण
क्लासिक ए / बी नमूना आकार निश्चित मानता है। अनुक्रमिक परीक्षण ("पिक-एंड-डिसीड") दोहराए गए लुक के तहत झूठे सकारात्मक दर को नियंत्रित करते हैं। हमेशा वैध अनुक्रमिक प्रक्रियाएं (एमएसपीआरटी, हॉवर्ड के आत्मविश्वास अनुक्रम) आपको स्पष्ट विजेताओं पर जल्दी रुकने की अनुमति देती हैं।
बहु-समानता सुधार
95% आत्मविश्वास पर 20 ए/बी परीक्षण चलाने से एक झूठा सकारात्मक घटना होती है। बोनफेरोनियो सुधार प्रति परीक्षण α को कसता है; बेंजामिन-होचबर्ग झूठे पता लगाने की दर को नियंत्रित करता है। ग्रोथबुक दोनों को लागू करता है।
SRM नमूना अनुपात असंगत
असाइनमेंट हैश उपयोगकर्ताओं को वेरिएंट में यादृच्छिक बनाता है। यदि 50/50 विभाजन 47/53 देता है, तो कुछ टूट जाता है SRM चेक इसे चिह्नित करता है। दोनों प्लेटफार्मों को लागू किया जाता है।
स्टैटिग बनाम ग्रोथबुक
Statsig:
- $1.1B (सितंबर 2025) के लिए OpenAI द्वारा अधिग्रहित। होस्ट किया गया, SaaS.
- अनुक्रमिक परीक्षण, CUPED, टिकाऊ आबादी।
- ऑल-इन-वनः फीचर फ्लैग्स + प्रयोग + अवलोकनशीलता।
- सबसे अच्छा फिटः टीम पहले से ही एक बंडल उत्पाद चाहता है, OpenAI के स्वामित्व की परवाह नहीं करता है।
GrowthBook:
- ओपन सोर्स (MIT); गोदाम-नेटिव (स्नोफ्लेक/बिगक्वेरी/रेडशिफ्ट से सीधे पढ़ता है) ।
- बहु इंजन: बेयिसियन, आवृत्तिवादी, अनुक्रमिक।
- CUPED, SRM, Bonferroni, BH सुधार।
- स्वयं होस्ट या प्रबंधित क्लाउड।
- सबसे अच्छा फिटः गोदाम-SQL दुकान, डेटा टीम मीट्रिक परत को नियंत्रित करता है, ओएसएस चाहता है.
अनिश्चिततावाद सत्ता को जटिल बनाता है
एक ही प्रॉम्प्ट विभिन्न आउटपुट उत्पन्न करता है। पारंपरिक शक्ति गणना IID अवलोकनों को मानती है। LLM गैर-निर्धारकतावाद के साथ, प्रभावी नमूना आकार नाममात्र से कम है। सुरक्षा मार्जिन के रूप में ~1.3-1.5x द्वारा आवश्यक नमूना आकार को गुणा करें।
वास्तविक मामले के परिणाम
- चैटबॉट इनाम मॉडल संस्करणः +70% वार्तालाप लंबाई, +30% प्रतिधारण।
- Nextdoor विषय पंक्तियाँः पुरस्कार-कार्य को परिष्कृत करने के बाद +1% CTR।
- खान अकादमी खानमीगोः पुनरावर्ती विलंबता बनाम गणित सटीकता व्यापार।
एंटी-पैटर्नः वाइब्स पर शिपिंग
प्रत्येक वरिष्ठ इंजीनियर एक सुविधा का नाम दे सकता है जो शिप की गई थी क्योंकि "यह बेहतर महसूस करता है" बिना ए / बी के। उनमें से अधिकांश उत्पाद मापकों को गिरा दिया गया था टीम महीनों तक ध्यान नहीं दिया। ए / बी मजबूर समारोह है।
संख्याओं को याद रखना चाहिए
- ओपनएआई द्वारा प्राप्त स्टैटिगः $1.1 बिलियन, सितंबर 2025।
- ग्रोथबुकः ओपन सोर्स एमआईटी; बेयिसियन + फ्रीक्वेंटिस्ट + अनुक्रमिक।
- CUPED भिन्नता में कमीः 30-70%
- LLM गैर-निर्धारकता → +30-50% नमूना आकार बफर।
इसका प्रयोग करें
code/main.pyएक स्थिर और अनुक्रमिक सीमाओं के साथ अनुक्रमिक ए / बी परीक्षण का अनुकरण करता है। यह दिखाता है कि अनुक्रमिक आपको जल्दी रुकने की अनुमति देता है।
इसे भेजें
यह सबक हमें फल देता हैoutputs/skill-ab-plan.md. सुविधाओं में बदलाव, कार्यभार, बेसलाइन, प्लेटफार्म का चयन, गेट, नमूना आकार को देखते हुए।
व्यायाम
- दौड़ें
code/main.py. 3% रूपांतरण के साथ 5% की उम्मीद की जाने वाली वृद्धि के लिए, 80% शक्ति तक किस नमूना आकार का नमूना? - स्वास्थ्य सेवा से नियंत्रित स्थानीय ग्राहक के लिए Statsig या GrowthBook चुनें।
- एक ए / बी डिजाइन जो GPT-4 बनाम GPT-3.5 का परीक्षण करता है प्रति हल टिकट लागत पर. प्राथमिक मीट्रिक क्या है, गार्डरेल मीट्रिक, माध्यमिक?
- आपका कैनरी पास है लेकिन ए / बी -1 .2% रूपांतरण दिखाता है. क्या आप जहाज?
- पूर्व अवधि पर CUPED को 60% पोस्ट वैरिएंट के साथ लागू करें। प्रभावी नमूना आकार वृद्धि की गणना करें।
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| Eval | "offline test" | Labeled-set evaluation of model capability |
| A/B test | "experiment" | Live randomized comparison on users |
| CUPED | "variance reduction" | Pre-period regression to reduce variance |
| Sequential test | "peek-ok test" | Always-valid procedure allowing early stop |
| Multiple comparison | "the family error" | Running many tests inflates false positives |
| Bonferroni | "tight correction" | Divide α by number of tests |
| Benjamini-Hochberg | "BH FDR" | False-discovery-rate control, less conservative |
| SRM | "bad split" | Sample ratio mismatch; assignment bug |
| Statsig | "OpenAI owned" | Commercial all-in-one, acquired 2025 |
| GrowthBook | "the OSS one" | MIT warehouse-native platform |
| mSPRT | "sequential probability ratio test" | Classical sequential procedure |
आगे पढ़ना
- GrowthBook — How to A/B Test AI
- Statsig — Beyond Prompts: Data-Driven LLM Optimization
- Statsig vs GrowthBook comparison
- Deng et al. — CUPED
- Howard — Confidence Sequences
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.