A / B تست ویژگی های LLM GrowthBook، Statsig و مشکل Vibes
Type: Learn
Languages: Python (stdlib, toy sequential test simulator)
Prerequisites: Phase 17 · 13 (Observability), Phase 17 · 20 (Progressive Deployment)
Time: ~60 minutes
اهداف یادگیری
- تشخیص ارزیابی ها ("آیا مدل می تواند کار را انجام دهد") را از آزمایش های A / B ("کاربری ها اهمیت می دهند") متمایز کنید.
- سه محور قابل آزمایش (مطابق، مدل، پارامتر) را لیست کنید و متریک را برای هر یک انتخاب کنید.
- CUPED، آزمایشات دنباله دار و اصلاحات مقایسه چندگانه بینجامینی-هچبرگ را توضیح دهید.
- Statsig یا GrowthBook را بر اساس وضعیت مخزن-SQL و موضع خرید شرکت انتخاب کنید.
مشکل
شما یک پیام رسان سیستم را به دست تنظیم کرده اید. احساس بهتری دارد. شما آن را ارسال می کنید. تغییرات تبدیل توسط صدا. شما متریک را مقصر می کنید. یا شما یک مدل جدید را ارسال کرده اید و تبدیل حرکت نکرد؟ آیا مدل کاهش یافته است یا تغییر بسیار کوچک است که قابل تشخیص است؟ شما نمی دانید، زیرا شما بدون A / B ارسال شده است.
Evals پاسخ می دهد که آیا مدل می تواند یک کار را در یک مجموعه برچسب گذاری شده انجام دهد. آنها پاسخ نمی دهند که آیا کاربران محصول را ترجیح می دهند. تنها یک آزمایش آنلاین کنترل شده پاسخ می دهد که، و تنها اگر آزمایش قدرت کافی، کنترل برای غیر تعیین گرایی و اصلاح برای مقایسه های متعدد.
مفهوم
آزمایشات Evals در مقابل آزمایشات A/B
Evals غیر فعال، مجموعه برچسب گذاری شده، قاضی (روبی یا LLM- به عنوان قاضی یا انسان). پاسخ: "آیا محصول درست / مفید / ایمن در این توزیع ثابت است؟"
A/B test کاربران آنلاین، کاربران زنده، تصادفی. پاسخ: "آیا نوع جدید متریک سطح کاربر را تغییر می دهد که اهمیت دارد؟"
هر دو مورد مورد مورد نیاز است. Evals بازپسین قبل از قرار گرفتن در معرض قرار می گیرد. A / B اثر محصول را پس از آن تأیید می کند.
چه چیزی را آزمایش کنید
- Prompt engineering عبارت، ساختار سیستم-پروکت، مثال ها. متریک: موفقیت کار، حفظ کاربر، هزینه/تغییر.
- Model selection GPT-4 در مقابل GPT-3.5-Turbo در مقابل Llama-OSS. متریک: دقت (کار) + هزینه / درخواست + تاخیر P99.
- Generation parameters درجه حرارت، top-p، max_tokens. متریک: مشخص برای وظایف (تنوع محصول در مقابل تعیین کننده).
CUPED کاهش تفاوت
آزمایشات کنترل شده با استفاده از داده های پیش از آزمایش. قبل از مقایسه دوره، تفاوت قبل از دوره را بازگردانید. کاهش تفاوت معمولی: 30-70٪. اندازه نمونه موثر به صورت رایگان افزایش می یابد.
اجرای: هر دو Statsig و GrowthBook اجرا می کنند.
آزمایشات دنباله دار
A / B کلاسیک اندازه نمونه ثابت را فرض می کند. آزمایشات دنباله دار ("پیک-ان-قرر") نرخ مثبت نادرست را تحت نگاه های مکرر کنترل می کنند. روش های دنباله دار همیشه معتبر (mSPRT، تسلسل اعتماد هاوارد) به شما اجازه می دهد که زودتر در مورد برنده های واضح متوقف شوید.
اصلاحات مقایسه چندگانه
اجرای 20 تست A / B با اعتماد 95٪ یک مثبت نادرست به طور تصادفی تولید می کند. اصلاح Bonferroni α را در هر آزمایش سخت می کند؛ بنیامینین-هچبرگ نرخ کشف نادرست را کنترل می کند. GrowthBook هر دو را اجرا می کند.
عدم مطابقت نسبت نمونه SRM
هاش تعيين کاربران را به گونه تصادفی به گونه های مختلف می کند. اگر 50/50 تقسیم 47/53 را ارائه دهد، چیزی شکسته است.
Statsig vs GrowthBook
Statsig:
- توسط OpenAI برای 1.1 میلیارد دلار (ستمبر 2025) خریداری شد. میزبان، SaaS.
- آزمایشات دنباله ای، CUPED، جمعیت های ماندگار.
- همه در یک: پرچم های ویژگی + آزمایش + مشاهده
- بهترین مناسب: تیم قبلاً یک محصول بسته ای می خواهد، به مالکیت OpenAI اهمیت نمی دهد.
GrowthBook:
- منبع باز (MIT) ؛ مخزن بومی (به طور مستقیم از Snowflake / BigQuery / Redshift خوانده می شود).
- موتورهای چندگانه: بیزیانی، فرکانت، تسلسل
- CUPED، SRM، Bonferroni، اصلاحات BH
- خود میزبان یا ابر مدیریت شده
- بهترین مناسب: فروشگاه مخزن-SQL، تیم داده ها لایه متریک را کنترل می کند، می خواهد OSS.
عدم تعیین کننده قدرت را پیچیده می کند
یک پرامپت مشابه تولیدات متفاوت را تولید می کند. محاسبات قدرت سنتی مشاهدات IID را فرض می کند. با غیر تعیین کننده LLM، اندازه نمونه موثر کمتر از نامینی است. اندازه نمونه مورد نیاز را به عنوان مارجین ایمنی با ~1.3-1.5x ضرب کنید.
نتایج واقعی پرونده
- نوع مدل پاداش چت بات: +70٪ طول مکالمه، +30٪ حفظ.
- خط های موضوعی بعدی: +1% CTR پس از اصلاح عملکرد پاداش.
- Khan Academy Khanmigo: تجارت تکراری تاخیر در مقابل دقت ریاضی
ضد الگوی: حمل و نقل در وایب
هر مهندس ارشد می تواند یک ویژگی را نام دهد که ارسال شده است زیرا "به نظر می رسد بهتر است" بدون A / B. اکثر آنها متریک محصول عقب نشینی است که تیم ماه ها متوجه نشده است. A / B عملکرد مجبور کننده است.
شماره هایی که باید به یاد داشته باشی
- Statsig توسط OpenAI خریداری شد: 1.1 میلیارد دلار، سپتامبر 2025.
- GrowthBook: MIT منبع باز؛ Bayesian + Frequentist + Sequential.
- کاهش تفاوت CUPED: 30-70%.
- غیر تعیین کننده LLM → +30-50٪ پوشه اندازه نمونه
ازش استفاده کن
code/main.pyیک تست A/B دنباله دار با مرزهای ثابت و دنباله دار را شبیه سازی می کند. نشان می دهد که چگونه دنباله دار اجازه می دهد تا شما زودتر متوقف شوید.
-باده
این درس به ما کمک می کندoutputs/skill-ab-plan.md. با توجه به تغییر ویژگی، بار کار، خط پایه، انتخاب سیستم عامل، دروازه ها، اندازه نمونه
تمرینات
- فرار کن
code/main.pyبرای یک ارتفاع انتظار می رود 5 درصد با 3 درصد تبدیل، چه اندازه نمونه ای تا 80 درصد قدرت؟ - برای مشتری محلی تحت مقررات مراقبت های بهداشتی، Statsig یا GrowthBook را انتخاب کنید.
- طراحی یک A/B که GPT-4 به مقابل GPT-3.5 را بر اساس هزینه هر بلیط حل شده تست کند.
- اونم از اونم که اونم از اونم مياد
- CUPED را به یک دوره قبل از زمان با 60٪ از تفاوت پست اعمال کنید. افزایش موثر اندازه نمونه را محاسبه کنید.
اصطلاحات کلیدی
| Term | What people say | What it actually means |
|---|---|---|
| Eval | "offline test" | Labeled-set evaluation of model capability |
| A/B test | "experiment" | Live randomized comparison on users |
| CUPED | "variance reduction" | Pre-period regression to reduce variance |
| Sequential test | "peek-ok test" | Always-valid procedure allowing early stop |
| Multiple comparison | "the family error" | Running many tests inflates false positives |
| Bonferroni | "tight correction" | Divide α by number of tests |
| Benjamini-Hochberg | "BH FDR" | False-discovery-rate control, less conservative |
| SRM | "bad split" | Sample ratio mismatch; assignment bug |
| Statsig | "OpenAI owned" | Commercial all-in-one, acquired 2025 |
| GrowthBook | "the OSS one" | MIT warehouse-native platform |
| mSPRT | "sequential probability ratio test" | Classical sequential procedure |
خواندن بیشتر
- GrowthBook — How to A/B Test AI
- Statsig — Beyond Prompts: Data-Driven LLM Optimization
- Statsig vs GrowthBook comparison
- Deng et al. — CUPED
- Howard — Confidence Sequences
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.