Phase 17: Infrastructure & Production

ए/बी टेस्टिंग एलएलएम विशेषताएं ग्रोथबुक, स्टैटिग और वाइब्स समस्या

गैर-निर्धारात्मक LLM के लिए पारंपरिक A/B परीक्षण नहीं बनाया गया था। महत्वपूर्ण अंतरः मूल्यांकन जवाब "क्या मॉडल काम कर सकता है? " ए / बी परीक्षण जवाब "क्या उपयोगकर्ताओं को परवाह है? " दोनों की आवश्यकता है; वाइब जांच पर शिपिंग समाप्त हो गई है। 2026 में क्या परीक्षण किया जाएः शीघ्र इंजीनियरिंग (शब्द लेखन), मॉडल चयन (जीपीटी-4 बनाम जीपीटी-3.5 बनाम ओएसएस; सटीकता बनाम लागत बनाम विलंबता), उत्पादन मापदंड (तापमान, शीर्ष-पी) । वास्तविक मामलेः एक चैटबॉट पुरस्कार मॉडल संस्करण ने +70% वार्तालाप लंबाई और +30% प्रतिधारण प्रदान किया; Nextdoor AI विषय-लाइन प्रयोगों ने पुरस्कार-कार्य परिष्करण के बाद +1% CTR प्रदान किया; खान अकादमी खानमीगो ने विलंबता बनाम गणित सटीकता अक्ष पर पुनरावृत्ति की। प्लेटफार्म विभाजन: Statsig(OpenAI द्वारा सितंबर 2025 में $1.1 बिलियन में अधिग्रहित) क्रमिक परीक्षण, CUPED, ऑल-इन-वन। GrowthBook ओपन सोर्स, वेयरहाउस-नेटिव, बेइशियन + फ्रीक्वेंटिस्ट + अनुक्रम इंजन, CUPED, SRM चेक, बेंजामिन-होचबर्ग + बोनफेर्रोनी सुधार। आप वेयरहाउस-SQL वरीयता के आधार पर चुनते हैं और क्या "ओपनएआई द्वारा अधिग्रहित" आपके संगठन के लिए मायने रखता है।

Type: Learn

Languages: Python (stdlib, toy sequential test simulator)

Prerequisites: Phase 17 · 13 (Observability), Phase 17 · 20 (Progressive Deployment)

Time: ~60 minutes

सीखने के लक्ष्य

  • मूल्यांकन ("मॉडल काम कर सकता है") को ए/बी परीक्षणों ("उपयोगकर्ताओं की परवाह करते हैं") से अलग करें।
  • तीन परीक्षण योग्य अक्षों (प्रोम्प्ट, मॉडल, पैरामीटर) को सूचीबद्ध करें और प्रत्येक के लिए मीट्रिक चुनें।
  • CUPED, अनुक्रमिक परीक्षण और बेंजामिन-होचबर्ग बहु-समानता सुधारों को समझाएँ।
  • स्टैटिज या ग्रोथबुक को गोदाम-एसक्यूएल मुद्रा और कॉर्पोरेट अधिग्रहण रुख के आधार पर चुनें।

समस्या

आप एक प्रणाली संकेत को हाथ से समायोजित किया है. यह बेहतर लगता है. आप इसे भेजते हैं. परिवर्तन शोर से बदलता है. आप मीट्रिक को दोष देते हैं. या आप एक नया मॉडल भेज दिया और रूपांतरण नहीं चला गया? मॉडल गिराया या परिवर्तन पता लगाने के लिए बहुत छोटा था? आप नहीं जानते, क्योंकि आप एक ए / बी के बिना भेज दिया.

ईवल जवाब देते हैं कि क्या मॉडल लेबल सेट पर एक कार्य कर सकता है। वे जवाब नहीं देते हैं कि क्या उपयोगकर्ता आउटपुट पसंद करते हैं। केवल एक नियंत्रित ऑनलाइन प्रयोग जवाब देता है कि, और केवल अगर प्रयोग में पर्याप्त शक्ति है, गैर-निर्धारकता के लिए नियंत्रण, और कई तुलनाओं के लिए सुधार करता है।

अवधारणा

Evals vs A/B परीक्षण

Evals ऑफ़लाइन, लेबल सेट, जज (रूब्रिक या एलएलएम-जैसे-जजज या मानव) । उत्तरः "क्या इस निश्चित वितरण पर आउटपुट सही / उपयोगी / सुरक्षित है?

A/B test ऑनलाइन, लाइव यूजर्स, रैंडम। जवाबः "क्या नया वेरिएंट उपयोगकर्ता स्तर की मेट्रिक को स्थानांतरित करता है जो मायने रखता है?

दोनों आवश्यक हैं। जोखिम से पहले ईवलस कैच रेग्रेशंस; ए/बी उत्पाद प्रभाव की पुष्टि के बाद करता है।

क्या परीक्षण करना है

  1. Prompt engineering शब्द, सिस्टम-प्रोम्प्ट संरचना, उदाहरण. मेट्रिकः कार्य सफलता, उपयोगकर्ता प्रतिधारण, लागत/अनुरोध।
  2. Model selection GPT-4 बनाम GPT-3.5-Turbo बनाम Llama-OSS. मीट्रिकः सटीकता (कार्य) + लागत/अनुरोध + विलंबता P99. बहु-उद्देश्य।
  3. Generation parameters तापमान, शीर्ष-पी, अधिकतम_टॉकेन्स. मीट्रिकः कार्य-विशिष्ट (आउटपुट विविधता बनाम निर्धारिता) ।

CUPED भिन्नता में कमी

प्रयोग से पहले के आंकड़ों का उपयोग करके नियंत्रित प्रयोग। पोस्ट-पीरियड की तुलना करने से पहले पूर्व-मियाद भिन्नता को वापस लें। विशिष्ट भिन्नता में कमीः 30-70%. प्रभावी नमूना आकार मुफ्त में बढ़ जाता है।

कार्यान्वयनः Statsig और GrowthBook दोनों लागू करें।

अनुक्रमिक परीक्षण

क्लासिक ए / बी नमूना आकार निश्चित मानता है। अनुक्रमिक परीक्षण ("पिक-एंड-डिसीड") दोहराए गए लुक के तहत झूठे सकारात्मक दर को नियंत्रित करते हैं। हमेशा वैध अनुक्रमिक प्रक्रियाएं (एमएसपीआरटी, हॉवर्ड के आत्मविश्वास अनुक्रम) आपको स्पष्ट विजेताओं पर जल्दी रुकने की अनुमति देती हैं।

बहु-समानता सुधार

95% आत्मविश्वास पर 20 ए/बी परीक्षण चलाने से एक झूठा सकारात्मक घटना होती है। बोनफेरोनियो सुधार प्रति परीक्षण α को कसता है; बेंजामिन-होचबर्ग झूठे पता लगाने की दर को नियंत्रित करता है। ग्रोथबुक दोनों को लागू करता है।

SRM नमूना अनुपात असंगत

असाइनमेंट हैश उपयोगकर्ताओं को वेरिएंट में यादृच्छिक बनाता है। यदि 50/50 विभाजन 47/53 देता है, तो कुछ टूट जाता है SRM चेक इसे चिह्नित करता है। दोनों प्लेटफार्मों को लागू किया जाता है।

स्टैटिग बनाम ग्रोथबुक

Statsig:

  • $1.1B (सितंबर 2025) के लिए OpenAI द्वारा अधिग्रहित। होस्ट किया गया, SaaS.
  • अनुक्रमिक परीक्षण, CUPED, टिकाऊ आबादी।
  • ऑल-इन-वनः फीचर फ्लैग्स + प्रयोग + अवलोकनशीलता।
  • सबसे अच्छा फिटः टीम पहले से ही एक बंडल उत्पाद चाहता है, OpenAI के स्वामित्व की परवाह नहीं करता है।

GrowthBook:

  • ओपन सोर्स (MIT); गोदाम-नेटिव (स्नोफ्लेक/बिगक्वेरी/रेडशिफ्ट से सीधे पढ़ता है) ।
  • बहु इंजन: बेयिसियन, आवृत्तिवादी, अनुक्रमिक।
  • CUPED, SRM, Bonferroni, BH सुधार।
  • स्वयं होस्ट या प्रबंधित क्लाउड।
  • सबसे अच्छा फिटः गोदाम-SQL दुकान, डेटा टीम मीट्रिक परत को नियंत्रित करता है, ओएसएस चाहता है.

अनिश्चिततावाद सत्ता को जटिल बनाता है

एक ही प्रॉम्प्ट विभिन्न आउटपुट उत्पन्न करता है। पारंपरिक शक्ति गणना IID अवलोकनों को मानती है। LLM गैर-निर्धारकतावाद के साथ, प्रभावी नमूना आकार नाममात्र से कम है। सुरक्षा मार्जिन के रूप में ~1.3-1.5x द्वारा आवश्यक नमूना आकार को गुणा करें।

वास्तविक मामले के परिणाम

  • चैटबॉट इनाम मॉडल संस्करणः +70% वार्तालाप लंबाई, +30% प्रतिधारण।
  • Nextdoor विषय पंक्तियाँः पुरस्कार-कार्य को परिष्कृत करने के बाद +1% CTR।
  • खान अकादमी खानमीगोः पुनरावर्ती विलंबता बनाम गणित सटीकता व्यापार।

एंटी-पैटर्नः वाइब्स पर शिपिंग

प्रत्येक वरिष्ठ इंजीनियर एक सुविधा का नाम दे सकता है जो शिप की गई थी क्योंकि "यह बेहतर महसूस करता है" बिना ए / बी के। उनमें से अधिकांश उत्पाद मापकों को गिरा दिया गया था टीम महीनों तक ध्यान नहीं दिया। ए / बी मजबूर समारोह है।

संख्याओं को याद रखना चाहिए

  • ओपनएआई द्वारा प्राप्त स्टैटिगः $1.1 बिलियन, सितंबर 2025।
  • ग्रोथबुकः ओपन सोर्स एमआईटी; बेयिसियन + फ्रीक्वेंटिस्ट + अनुक्रमिक।
  • CUPED भिन्नता में कमीः 30-70%
  • LLM गैर-निर्धारकता → +30-50% नमूना आकार बफर।

इसका प्रयोग करें

code/main.pyएक स्थिर और अनुक्रमिक सीमाओं के साथ अनुक्रमिक ए / बी परीक्षण का अनुकरण करता है। यह दिखाता है कि अनुक्रमिक आपको जल्दी रुकने की अनुमति देता है।

इसे भेजें

यह सबक हमें फल देता हैoutputs/skill-ab-plan.md. सुविधाओं में बदलाव, कार्यभार, बेसलाइन, प्लेटफार्म का चयन, गेट, नमूना आकार को देखते हुए।

व्यायाम

  1. दौड़ेंcode/main.py. 3% रूपांतरण के साथ 5% की उम्मीद की जाने वाली वृद्धि के लिए, 80% शक्ति तक किस नमूना आकार का नमूना?
  2. स्वास्थ्य सेवा से नियंत्रित स्थानीय ग्राहक के लिए Statsig या GrowthBook चुनें।
  3. एक ए / बी डिजाइन जो GPT-4 बनाम GPT-3.5 का परीक्षण करता है प्रति हल टिकट लागत पर. प्राथमिक मीट्रिक क्या है, गार्डरेल मीट्रिक, माध्यमिक?
  4. आपका कैनरी पास है लेकिन ए / बी -1 .2% रूपांतरण दिखाता है. क्या आप जहाज?
  5. पूर्व अवधि पर CUPED को 60% पोस्ट वैरिएंट के साथ लागू करें। प्रभावी नमूना आकार वृद्धि की गणना करें।

प्रमुख शर्तें

TermWhat people sayWhat it actually means
Eval"offline test"Labeled-set evaluation of model capability
A/B test"experiment"Live randomized comparison on users
CUPED"variance reduction"Pre-period regression to reduce variance
Sequential test"peek-ok test"Always-valid procedure allowing early stop
Multiple comparison"the family error"Running many tests inflates false positives
Bonferroni"tight correction"Divide α by number of tests
Benjamini-Hochberg"BH FDR"False-discovery-rate control, less conservative
SRM"bad split"Sample ratio mismatch; assignment bug
Statsig"OpenAI owned"Commercial all-in-one, acquired 2025
GrowthBook"the OSS one"MIT warehouse-native platform
mSPRT"sequential probability ratio test"Classical sequential procedure

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.