اختبار A / B ميزات LLM GrowthBook، Statsig، ومشكلة Vibes
Type: Learn
Languages: Python (stdlib, toy sequential test simulator)
Prerequisites: Phase 17 · 13 (Observability), Phase 17 · 20 (Progressive Deployment)
Time: ~60 minutes
أهداف التعلم
- تمييز تقييمات ("هل يمكن أن يقوم النموذج بالعمل") عن اختبارات A / B ("هل يهتم المستخدمون").
- قم بإدراج ثلاثة محورات قابلة للتحقق (المرحلة، النموذج، المعلمات) واختيار الميتر لكل منها.
- شرح CUPED، اختبار تسلسل، وبينامين-هوتشبرغ تعديلات المقارنة المتعددة.
- اختر Statsig أو GrowthBook بناء على وضع المستودع-SQL وموقف الاستحواذ الشركي.
المشكلة
لقد قمت بتحديث طلب النظام يدوياً. يشعر الأمر بتحسن. تقوم بتسليمها. تغيرات التحويل عن طريق الضوضاء. تلوم المقياسات. أو قمت بتسليم نموذج جديد ولم يتحرك التحويل. هل تدهورت النموذج أو كان التغيير صغيرًا جدًا للكشف عنه؟ لا تعرف، لأنك قمت بتسليم دون A / B.
الإجابة على ما إذا كان النموذج يمكن أن يقوم بمهمة على مجموعة معينة. لا يجيبون على ما إذا كان المستخدمون يفضلون الخروج. فقط تجربة على الإنترنت المتحكم تجيب على ذلك، و فقط إذا كان التجربة لديها قدرة كافية، التحكم في عدم التحديد، وتصحيح للمقارنات المتعددة.
المفهوم
اختبارات Evals مقابل اختبارات A/B
Evals خارج الاتصال، المجموعة الملصقة، القضاة (المرجعية أو LLM-as-judge أو البشرية). الجواب: "هل الخروج صحيح / مفيد / آمن على هذا التوزيع الثابت؟"
A/B test على الإنترنت، المستخدمين الحية، عشوائية. الجواب: "هل يغير التنوع الجديد المقياس على مستوى المستخدم الذي يهم؟"
كلتا الحالتين مطلوبة. التسجيلات التخفيضية قبل التعرض؛ A/B تؤكد تأثير المنتج بعد.
ما الذي يجب اختباره
- Prompt engineering صياغة، هيكل نظامية، أمثلة. مقياس: نجاح المهمة، الاحتفاظ بالمستخدم، التكلفة/طلب.
- Model selection GPT-4 مقابل GPT-3.5-Turbo مقابل Llama-OSS. المقياس: دقة (المهمة) + التكلفة / الطلب + تأخير P99.
- Generation parameters درجة الحرارة، أعلى-p، أقصى_أعلام. الميتر: محدد للمهام (تنوع الخروج مقابل تحديد).
كوبيد تقليل التباين
التجارب المسيطر عليها باستخدام بيانات ما قبل التجارب. قم بتعويض التباينات قبل الفترة قبل مقارنة الفترة ما بعد. انخفاض التباينات النموذجي: 30-70٪. يزيد حجم العينة الفعالة مجانا.
تنفيذ: تنفيذ Statsig و GrowthBook.
الاختبار التسلسل
يفترض A / B الكلاسيكي حجم العينة ثابت. تختبر الاختبارات التسلسلية ("التطلع والقرار") معدل الإيجابية الخاطئة تحت النظر المتكررة. الإجراءات التسلسلية المفعلة دائمًا (mSPRT ، تسلسلات ثقة هوارد) تسمح لك بالتوقف مبكرا على الفائزين الواضحين.
تصحيحات المقارنة المتعددة
إدارة 20 اختبارًا A / B عند ثقة 95% تنتج إيجابية كاذبة واحدة عشوائياً. تصحيح بونفيروني يضيق α لكل اختبار. يسيطر بنيامين-هوتشبرغ على معدل اكتشاف كاذب. تنفيذ GrowthBook كليهما.
عدم مطابقة نسبة SRM العينات
تعطي الاختلافات المستخدمين بشكل عشوائي. إذا كان التقسيم 50/50 يسفر عن 47/53 ، ففي الواقع ، هناك شيء مكسور.
ستاتسيج مقابل GrowthBook
Statsig:
- تم شراؤها من قبل OpenAI مقابل 1.1 مليار دولار (سبتمبر 2025) .
- اختبار تسلسل، CUPED، السكان المتمرسون.
- كل شيء في واحد: علامات ميزة + تجارب + قابلية للملاحظة.
- أفضل تناسب: الفريق يريد بالفعل منتجًا مشتركًا، لا يهتم بملكية OpenAI.
GrowthBook:
- المصدر المفتوح (MIT) ؛ مستودع الأصلي (يقرأ من Snowflake / BigQuery / Redshift مباشرة).
- محركات متعددة: بايزيونية، متكررة، تسلسلية.
- (كوبيد) ، (سيرم) ، (بونفيروني) ، (بيه)
- مضيف ذاتي أو سحابة مديرة
- أفضل مناسبة: متجر مخزن SQL، فريق البيانات يسيطر على الطبقة الميترية، يريد OSS.
عدم التحديد يزيد من تعقيد السلطة
نفس المكالمة تنتج نتائج مختلفة. تفترض حسابات الطاقة التقليدية ملاحظات IID. مع عدم التحديد LLM ، يكون حجم العينة الفعلي أقل من الاسم. ضاعف حجم العينة المطلوب بنحو 1.3-1.5x كحافة سلامة.
النتائج الحقيقية للحالة
- تغيير نموذج مكافأة الـ "تشاتبوت": + 70% طول المحادثة، + 30% الاحتفاظ.
- الخطوط الموضوعية التالية: +1% CTR بعد تحسين وظيفة الجائزة.
- أكاديمية خان خانميغو: التجارة المتكررة التأخير مقابل دقة الرياضيات.
النمط المضاد: الشحن على الاهتزازات
كل مهندس كبير يستطيع أن يذكر ميزة تم شحنها لأنه "يشعر بتحسن" بدون A / B. معظمها تعديلات منتج رجعت الفريق لم يلاحظها لشهور. A / B هو وظيفة القوة.
أرقام يجب أن تتذكر
- استحوذت شركة ستاتسيج على شركة OpenAI: 1.1 مليار دولار، سبتمبر 2025.
- كتاب النمو: مصدر مفتوح MIT؛ بايسيون + متكرر + تسلسل.
- خفض التباينات في CUPED: 30-70%.
- عدم تحديد القانون الدولي → +30-50٪ حافظ على حجم العينات.
استخدمها
code/main.pyيحتاكي اختبار A/B متسلسل مع حدود ثابتة وتسلسل. يظهر كيف التسلسل يسمح لك بالتوقف مبكرا.
أرسله
هذا الدرس يُنتجoutputs/skill-ab-plan.md. نظراً لتغيير الميزات، وحمل العمل، الخط الأساسي، اختيار المنصة، البوابات، حجم العينة.
التمارين
- أركض
code/main.py. لرفع متوقع بنسبة 5% مع تحويل 3% في خط الأساس، ما حجم العينة إلى 80% طاقة؟ - اختر Statsig أو GrowthBook لعميل في الموقع الذي ينظم الرعاية الصحية.
- تصميم A / B التي تختبر GPT-4 مقابل GPT-3.5 على تكلفة كل تذكرة حل. ما هو المقياس الأولية، المقياس الحراسة، الثانوية؟
- تمكنت من إصلاح النتائج ولكن الـ A/B يظهر تحويل -1.2٪ هل ترسل؟
- تطبيق CUPED على فترة ما قبل مع 60% من التباين من البحث. حساب الزيادة الفعلية في حجم العينة.
الشروط الرئيسية
| Term | What people say | What it actually means |
|---|---|---|
| Eval | "offline test" | Labeled-set evaluation of model capability |
| A/B test | "experiment" | Live randomized comparison on users |
| CUPED | "variance reduction" | Pre-period regression to reduce variance |
| Sequential test | "peek-ok test" | Always-valid procedure allowing early stop |
| Multiple comparison | "the family error" | Running many tests inflates false positives |
| Bonferroni | "tight correction" | Divide α by number of tests |
| Benjamini-Hochberg | "BH FDR" | False-discovery-rate control, less conservative |
| SRM | "bad split" | Sample ratio mismatch; assignment bug |
| Statsig | "OpenAI owned" | Commercial all-in-one, acquired 2025 |
| GrowthBook | "the OSS one" | MIT warehouse-native platform |
| mSPRT | "sequential probability ratio test" | Classical sequential procedure |
المزيد من القراءة
- GrowthBook — How to A/B Test AI
- Statsig — Beyond Prompts: Data-Driven LLM Optimization
- Statsig vs GrowthBook comparison
- Deng et al. — CUPED
- Howard — Confidence Sequences
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.