Phase 17: Infrastructure & Production

اختبار A / B ميزات LLM GrowthBook، Statsig، ومشكلة Vibes

لم يتم بناء اختبار A / B التقليدي للاستكشافات القضائية غير القرارية. التمييز الحاسم: تقييمات الإجابة "هل يمكن أن يقوم النموذج بالعمل؟" اختبارات A / B الإجابة "هل يهتم المستخدمون؟" كلا مطلوبين؛ شحن على التحققات الوهم انتهى. ما يجب اختباره في عام 2026: هندسة سريعة (تصميم الكلمات) ، اختيار النموذج (GPT-4 مقابل GPT-3.5 مقابل OSS؛ الدقة مقابل التكلفة مقابل التأخير) ، معايير توليد (الدرجة الحرارة ، أعلى-p). الحالات الحقيقية: أدى تغير نموذج مكافأة الـ "تشات بوت" إلى +70% من طول المحادثة و +30% من الاحتفاظ بها؛ وقدمت تجارب خط الموضوع من "نيكستور" AI +1% من CTR بعد تحسين وظيفة مكافأة؛ وتكررت Khan Academy Khanmigo على محور التخفيف مقابل دقة الرياضيات. تقسيم المنصة: Statsig(تشتريها شركة OpenAI مقابل 1.1 مليار دولار في سبتمبر 2025) اختبار متسلسل، CUPED، كل شيء في واحد. GrowthBook مفتوح المصدر، مستودع الأصلي، بايسيون + المتردد + محركات تسلسل، CUPED، شيكات SRM، بنيامين-هوتشبرغ + Bonferroni تصحيحات. تختار بناء على تفضيل مستودع-SQL وما إذا كان "تم الحصول على من قبل OpenAI" مهمة لمنظمتك.

Type: Learn

Languages: Python (stdlib, toy sequential test simulator)

Prerequisites: Phase 17 · 13 (Observability), Phase 17 · 20 (Progressive Deployment)

Time: ~60 minutes

أهداف التعلم

  • تمييز تقييمات ("هل يمكن أن يقوم النموذج بالعمل") عن اختبارات A / B ("هل يهتم المستخدمون").
  • قم بإدراج ثلاثة محورات قابلة للتحقق (المرحلة، النموذج، المعلمات) واختيار الميتر لكل منها.
  • شرح CUPED، اختبار تسلسل، وبينامين-هوتشبرغ تعديلات المقارنة المتعددة.
  • اختر Statsig أو GrowthBook بناء على وضع المستودع-SQL وموقف الاستحواذ الشركي.

المشكلة

لقد قمت بتحديث طلب النظام يدوياً. يشعر الأمر بتحسن. تقوم بتسليمها. تغيرات التحويل عن طريق الضوضاء. تلوم المقياسات. أو قمت بتسليم نموذج جديد ولم يتحرك التحويل. هل تدهورت النموذج أو كان التغيير صغيرًا جدًا للكشف عنه؟ لا تعرف، لأنك قمت بتسليم دون A / B.

الإجابة على ما إذا كان النموذج يمكن أن يقوم بمهمة على مجموعة معينة. لا يجيبون على ما إذا كان المستخدمون يفضلون الخروج. فقط تجربة على الإنترنت المتحكم تجيب على ذلك، و فقط إذا كان التجربة لديها قدرة كافية، التحكم في عدم التحديد، وتصحيح للمقارنات المتعددة.

المفهوم

اختبارات Evals مقابل اختبارات A/B

Evals خارج الاتصال، المجموعة الملصقة، القضاة (المرجعية أو LLM-as-judge أو البشرية). الجواب: "هل الخروج صحيح / مفيد / آمن على هذا التوزيع الثابت؟"

A/B test على الإنترنت، المستخدمين الحية، عشوائية. الجواب: "هل يغير التنوع الجديد المقياس على مستوى المستخدم الذي يهم؟"

كلتا الحالتين مطلوبة. التسجيلات التخفيضية قبل التعرض؛ A/B تؤكد تأثير المنتج بعد.

ما الذي يجب اختباره

  1. Prompt engineering صياغة، هيكل نظامية، أمثلة. مقياس: نجاح المهمة، الاحتفاظ بالمستخدم، التكلفة/طلب.
  2. Model selection GPT-4 مقابل GPT-3.5-Turbo مقابل Llama-OSS. المقياس: دقة (المهمة) + التكلفة / الطلب + تأخير P99.
  3. Generation parameters درجة الحرارة، أعلى-p، أقصى_أعلام. الميتر: محدد للمهام (تنوع الخروج مقابل تحديد).

كوبيد تقليل التباين

التجارب المسيطر عليها باستخدام بيانات ما قبل التجارب. قم بتعويض التباينات قبل الفترة قبل مقارنة الفترة ما بعد. انخفاض التباينات النموذجي: 30-70٪. يزيد حجم العينة الفعالة مجانا.

تنفيذ: تنفيذ Statsig و GrowthBook.

الاختبار التسلسل

يفترض A / B الكلاسيكي حجم العينة ثابت. تختبر الاختبارات التسلسلية ("التطلع والقرار") معدل الإيجابية الخاطئة تحت النظر المتكررة. الإجراءات التسلسلية المفعلة دائمًا (mSPRT ، تسلسلات ثقة هوارد) تسمح لك بالتوقف مبكرا على الفائزين الواضحين.

تصحيحات المقارنة المتعددة

إدارة 20 اختبارًا A / B عند ثقة 95% تنتج إيجابية كاذبة واحدة عشوائياً. تصحيح بونفيروني يضيق α لكل اختبار. يسيطر بنيامين-هوتشبرغ على معدل اكتشاف كاذب. تنفيذ GrowthBook كليهما.

عدم مطابقة نسبة SRM العينات

تعطي الاختلافات المستخدمين بشكل عشوائي. إذا كان التقسيم 50/50 يسفر عن 47/53 ، ففي الواقع ، هناك شيء مكسور.

ستاتسيج مقابل GrowthBook

Statsig:

  • تم شراؤها من قبل OpenAI مقابل 1.1 مليار دولار (سبتمبر 2025) .
  • اختبار تسلسل، CUPED، السكان المتمرسون.
  • كل شيء في واحد: علامات ميزة + تجارب + قابلية للملاحظة.
  • أفضل تناسب: الفريق يريد بالفعل منتجًا مشتركًا، لا يهتم بملكية OpenAI.

GrowthBook:

  • المصدر المفتوح (MIT) ؛ مستودع الأصلي (يقرأ من Snowflake / BigQuery / Redshift مباشرة).
  • محركات متعددة: بايزيونية، متكررة، تسلسلية.
  • (كوبيد) ، (سيرم) ، (بونفيروني) ، (بيه)
  • مضيف ذاتي أو سحابة مديرة
  • أفضل مناسبة: متجر مخزن SQL، فريق البيانات يسيطر على الطبقة الميترية، يريد OSS.

عدم التحديد يزيد من تعقيد السلطة

نفس المكالمة تنتج نتائج مختلفة. تفترض حسابات الطاقة التقليدية ملاحظات IID. مع عدم التحديد LLM ، يكون حجم العينة الفعلي أقل من الاسم. ضاعف حجم العينة المطلوب بنحو 1.3-1.5x كحافة سلامة.

النتائج الحقيقية للحالة

  • تغيير نموذج مكافأة الـ "تشاتبوت": + 70% طول المحادثة، + 30% الاحتفاظ.
  • الخطوط الموضوعية التالية: +1% CTR بعد تحسين وظيفة الجائزة.
  • أكاديمية خان خانميغو: التجارة المتكررة التأخير مقابل دقة الرياضيات.

النمط المضاد: الشحن على الاهتزازات

كل مهندس كبير يستطيع أن يذكر ميزة تم شحنها لأنه "يشعر بتحسن" بدون A / B. معظمها تعديلات منتج رجعت الفريق لم يلاحظها لشهور. A / B هو وظيفة القوة.

أرقام يجب أن تتذكر

  • استحوذت شركة ستاتسيج على شركة OpenAI: 1.1 مليار دولار، سبتمبر 2025.
  • كتاب النمو: مصدر مفتوح MIT؛ بايسيون + متكرر + تسلسل.
  • خفض التباينات في CUPED: 30-70%.
  • عدم تحديد القانون الدولي → +30-50٪ حافظ على حجم العينات.

استخدمها

code/main.pyيحتاكي اختبار A/B متسلسل مع حدود ثابتة وتسلسل. يظهر كيف التسلسل يسمح لك بالتوقف مبكرا.

أرسله

هذا الدرس يُنتجoutputs/skill-ab-plan.md. نظراً لتغيير الميزات، وحمل العمل، الخط الأساسي، اختيار المنصة، البوابات، حجم العينة.

التمارين

  1. أركضcode/main.py. لرفع متوقع بنسبة 5% مع تحويل 3% في خط الأساس، ما حجم العينة إلى 80% طاقة؟
  2. اختر Statsig أو GrowthBook لعميل في الموقع الذي ينظم الرعاية الصحية.
  3. تصميم A / B التي تختبر GPT-4 مقابل GPT-3.5 على تكلفة كل تذكرة حل. ما هو المقياس الأولية، المقياس الحراسة، الثانوية؟
  4. تمكنت من إصلاح النتائج ولكن الـ A/B يظهر تحويل -1.2٪ هل ترسل؟
  5. تطبيق CUPED على فترة ما قبل مع 60% من التباين من البحث. حساب الزيادة الفعلية في حجم العينة.

الشروط الرئيسية

TermWhat people sayWhat it actually means
Eval"offline test"Labeled-set evaluation of model capability
A/B test"experiment"Live randomized comparison on users
CUPED"variance reduction"Pre-period regression to reduce variance
Sequential test"peek-ok test"Always-valid procedure allowing early stop
Multiple comparison"the family error"Running many tests inflates false positives
Bonferroni"tight correction"Divide α by number of tests
Benjamini-Hochberg"BH FDR"False-discovery-rate control, less conservative
SRM"bad split"Sample ratio mismatch; assignment bug
Statsig"OpenAI owned"Commercial all-in-one, acquired 2025
GrowthBook"the OSS one"MIT warehouse-native platform
mSPRT"sequential probability ratio test"Classical sequential procedure

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.