Phase 17: Infrastructure & Production

A / B تست ویژگی های LLM GrowthBook، Statsig و مشکل Vibes

آزمایش های سنتی A/B برای LLM های غیر تعیین کننده ساخته نشده است. تفاوت مهم: ارزیابی پاسخ "آیا مدل می تواند کار را انجام دهد؟" تست های A / B پاسخ "آیا کاربران اهمیت می دهند؟" هر دو مورد مورد نیاز است؛ ارسال در بررسی های ویب تمام شده است. چه چیزی را در سال 2026 آزمایش کنید: مهندسی سریع (برنامه سازی) ، انتخاب مدل (GPT-4 در مقابل GPT-3.5 در برابر OSS؛ دقت در برابر هزینه در برابر تاخیر) ، پارامترهای تولید (طمراتور، top-p). موارد واقعی: یک نوع مدل پاداش چتبات +70٪ طول مکالمه و +30٪ حفظ را ارائه داد. آزمایش های موضوعی AI Nextdoor +1٪ CTR را پس از اصلاح عملکرد پاداش ارائه داد. Khan Academy Khanmigo بر اساس محور تاخیر در برابر دقت ریاضی تکرار شد. تقسیم پلتفرم: Statsig(به عنوان یک شرکت OpenAI در سپتامبر 2025 به قیمت 1.1 میلیارد دلار خریداری شد) آزمایشات دنباله دار، CUPED، همه در یک. GrowthBook منبع باز، ذخیره سازی بومی، موتورهای Bayesian + Frequentist + Sequential، CUPED، چک SRM، اصلاحات Benjamini-Hochberg + Bonferroni. شما بر اساس اولویت های ذخیره سازی SQL انتخاب می کنید و اینکه آیا "به دست آمده توسط OpenAI" برای سازمان شما مهم است.

Type: Learn

Languages: Python (stdlib, toy sequential test simulator)

Prerequisites: Phase 17 · 13 (Observability), Phase 17 · 20 (Progressive Deployment)

Time: ~60 minutes

اهداف یادگیری

  • تشخیص ارزیابی ها ("آیا مدل می تواند کار را انجام دهد") را از آزمایش های A / B ("کاربری ها اهمیت می دهند") متمایز کنید.
  • سه محور قابل آزمایش (مطابق، مدل، پارامتر) را لیست کنید و متریک را برای هر یک انتخاب کنید.
  • CUPED، آزمایشات دنباله دار و اصلاحات مقایسه چندگانه بینجامینی-هچبرگ را توضیح دهید.
  • Statsig یا GrowthBook را بر اساس وضعیت مخزن-SQL و موضع خرید شرکت انتخاب کنید.

مشکل

شما یک پیام رسان سیستم را به دست تنظیم کرده اید. احساس بهتری دارد. شما آن را ارسال می کنید. تغییرات تبدیل توسط صدا. شما متریک را مقصر می کنید. یا شما یک مدل جدید را ارسال کرده اید و تبدیل حرکت نکرد؟ آیا مدل کاهش یافته است یا تغییر بسیار کوچک است که قابل تشخیص است؟ شما نمی دانید، زیرا شما بدون A / B ارسال شده است.

Evals پاسخ می دهد که آیا مدل می تواند یک کار را در یک مجموعه برچسب گذاری شده انجام دهد. آنها پاسخ نمی دهند که آیا کاربران محصول را ترجیح می دهند. تنها یک آزمایش آنلاین کنترل شده پاسخ می دهد که، و تنها اگر آزمایش قدرت کافی، کنترل برای غیر تعیین گرایی و اصلاح برای مقایسه های متعدد.

مفهوم

آزمایشات Evals در مقابل آزمایشات A/B

Evals غیر فعال، مجموعه برچسب گذاری شده، قاضی (روبی یا LLM- به عنوان قاضی یا انسان). پاسخ: "آیا محصول درست / مفید / ایمن در این توزیع ثابت است؟"

A/B test کاربران آنلاین، کاربران زنده، تصادفی. پاسخ: "آیا نوع جدید متریک سطح کاربر را تغییر می دهد که اهمیت دارد؟"

هر دو مورد مورد مورد نیاز است. Evals بازپسین قبل از قرار گرفتن در معرض قرار می گیرد. A / B اثر محصول را پس از آن تأیید می کند.

چه چیزی را آزمایش کنید

  1. Prompt engineering عبارت، ساختار سیستم-پروکت، مثال ها. متریک: موفقیت کار، حفظ کاربر، هزینه/تغییر.
  2. Model selection GPT-4 در مقابل GPT-3.5-Turbo در مقابل Llama-OSS. متریک: دقت (کار) + هزینه / درخواست + تاخیر P99.
  3. Generation parameters درجه حرارت، top-p، max_tokens. متریک: مشخص برای وظایف (تنوع محصول در مقابل تعیین کننده).

CUPED کاهش تفاوت

آزمایشات کنترل شده با استفاده از داده های پیش از آزمایش. قبل از مقایسه دوره، تفاوت قبل از دوره را بازگردانید. کاهش تفاوت معمولی: 30-70٪. اندازه نمونه موثر به صورت رایگان افزایش می یابد.

اجرای: هر دو Statsig و GrowthBook اجرا می کنند.

آزمایشات دنباله دار

A / B کلاسیک اندازه نمونه ثابت را فرض می کند. آزمایشات دنباله دار ("پیک-ان-قرر") نرخ مثبت نادرست را تحت نگاه های مکرر کنترل می کنند. روش های دنباله دار همیشه معتبر (mSPRT، تسلسل اعتماد هاوارد) به شما اجازه می دهد که زودتر در مورد برنده های واضح متوقف شوید.

اصلاحات مقایسه چندگانه

اجرای 20 تست A / B با اعتماد 95٪ یک مثبت نادرست به طور تصادفی تولید می کند. اصلاح Bonferroni α را در هر آزمایش سخت می کند؛ بنیامینین-هچبرگ نرخ کشف نادرست را کنترل می کند. GrowthBook هر دو را اجرا می کند.

عدم مطابقت نسبت نمونه SRM

هاش تعيين کاربران را به گونه تصادفی به گونه های مختلف می کند. اگر 50/50 تقسیم 47/53 را ارائه دهد، چیزی شکسته است.

Statsig vs GrowthBook

Statsig:

  • توسط OpenAI برای 1.1 میلیارد دلار (ستمبر 2025) خریداری شد. میزبان، SaaS.
  • آزمایشات دنباله ای، CUPED، جمعیت های ماندگار.
  • همه در یک: پرچم های ویژگی + آزمایش + مشاهده
  • بهترین مناسب: تیم قبلاً یک محصول بسته ای می خواهد، به مالکیت OpenAI اهمیت نمی دهد.

GrowthBook:

  • منبع باز (MIT) ؛ مخزن بومی (به طور مستقیم از Snowflake / BigQuery / Redshift خوانده می شود).
  • موتورهای چندگانه: بیزیانی، فرکانت، تسلسل
  • CUPED، SRM، Bonferroni، اصلاحات BH
  • خود میزبان یا ابر مدیریت شده
  • بهترین مناسب: فروشگاه مخزن-SQL، تیم داده ها لایه متریک را کنترل می کند، می خواهد OSS.

عدم تعیین کننده قدرت را پیچیده می کند

یک پرامپت مشابه تولیدات متفاوت را تولید می کند. محاسبات قدرت سنتی مشاهدات IID را فرض می کند. با غیر تعیین کننده LLM، اندازه نمونه موثر کمتر از نامینی است. اندازه نمونه مورد نیاز را به عنوان مارجین ایمنی با ~1.3-1.5x ضرب کنید.

نتایج واقعی پرونده

  • نوع مدل پاداش چت بات: +70٪ طول مکالمه، +30٪ حفظ.
  • خط های موضوعی بعدی: +1% CTR پس از اصلاح عملکرد پاداش.
  • Khan Academy Khanmigo: تجارت تکراری تاخیر در مقابل دقت ریاضی

ضد الگوی: حمل و نقل در وایب

هر مهندس ارشد می تواند یک ویژگی را نام دهد که ارسال شده است زیرا "به نظر می رسد بهتر است" بدون A / B. اکثر آنها متریک محصول عقب نشینی است که تیم ماه ها متوجه نشده است. A / B عملکرد مجبور کننده است.

شماره هایی که باید به یاد داشته باشی

  • Statsig توسط OpenAI خریداری شد: 1.1 میلیارد دلار، سپتامبر 2025.
  • GrowthBook: MIT منبع باز؛ Bayesian + Frequentist + Sequential.
  • کاهش تفاوت CUPED: 30-70%.
  • غیر تعیین کننده LLM → +30-50٪ پوشه اندازه نمونه

ازش استفاده کن

code/main.pyیک تست A/B دنباله دار با مرزهای ثابت و دنباله دار را شبیه سازی می کند. نشان می دهد که چگونه دنباله دار اجازه می دهد تا شما زودتر متوقف شوید.

-باده

این درس به ما کمک می کندoutputs/skill-ab-plan.md. با توجه به تغییر ویژگی، بار کار، خط پایه، انتخاب سیستم عامل، دروازه ها، اندازه نمونه

تمرینات

  1. فرار کنcode/main.pyبرای یک ارتفاع انتظار می رود 5 درصد با 3 درصد تبدیل، چه اندازه نمونه ای تا 80 درصد قدرت؟
  2. برای مشتری محلی تحت مقررات مراقبت های بهداشتی، Statsig یا GrowthBook را انتخاب کنید.
  3. طراحی یک A/B که GPT-4 به مقابل GPT-3.5 را بر اساس هزینه هر بلیط حل شده تست کند.
  4. اونم از اونم که اونم از اونم مياد
  5. CUPED را به یک دوره قبل از زمان با 60٪ از تفاوت پست اعمال کنید. افزایش موثر اندازه نمونه را محاسبه کنید.

اصطلاحات کلیدی

TermWhat people sayWhat it actually means
Eval"offline test"Labeled-set evaluation of model capability
A/B test"experiment"Live randomized comparison on users
CUPED"variance reduction"Pre-period regression to reduce variance
Sequential test"peek-ok test"Always-valid procedure allowing early stop
Multiple comparison"the family error"Running many tests inflates false positives
Bonferroni"tight correction"Divide α by number of tests
Benjamini-Hochberg"BH FDR"False-discovery-rate control, less conservative
SRM"bad split"Sample ratio mismatch; assignment bug
Statsig"OpenAI owned"Commercial all-in-one, acquired 2025
GrowthBook"the OSS one"MIT warehouse-native platform
mSPRT"sequential probability ratio test"Classical sequential procedure

خواندن بیشتر

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.