Phase 18: Ethics, Safety & Alignment

خانواده بهینه سازی اولویت های مستقیم

رافائلوف و همکارانش (2023) نشان داد که بهینه سازی RLHF دارای فرم بسته در مورد داده های ترجیح است، بنابراین شما می توانید از مدل پاداش صریح خارج شوید و سیاست را مستقیما بهینه کنید. این بینش باعث ایجاد یک خانواده IPO، KTO، SimPO، ORPO، BPO شد که هر کدام یک از حالت شکست DPO را اصلاح می کردند. در سال 2026، الگوریتم های تعاونی مستقیم، دویدن های پس از آموزش در مرز بیشتری را از PPO ارسال می کنند. اما منحنی بهینه سازی بیش از حد از درس 2 هنوز هم اعمال می شود: DAAs از گودارت فرار نمی کنند، آنها فقط به جایی که گاز می گیرد حرکت می کنند.

Type: Learn

Languages: Python (stdlib, six-variant preference-loss comparator)

Prerequisites: Phase 18 · 01 (InstructGPT), Phase 18 · 02 (Reward hacking), Phase 10 · 08 (DPO basics)

Time: ~75 minutes

اهداف یادگیری

  • شکل بسته DPO را از RLHF-with-KL-optimum اخذ کنید.
  • حالت شکست هر یک از راه حل های IPO، KTO، SimPO، ORPO، BPO را در DPO بیان کنید.
  • تفاوت بین "شکاف اجر ضمنی" و "قوة ترجیح" را تشخیص دهید و توضیح دهید که چرا نقشه برداری هویت IPO مهم است.
  • توضیح دهید چرا Rafailov و همکاران (NeurIPS 2024) نشان می دهد که DAAs با وجود عدم وجود RM صریح بیش از حد بهینه سازی می کنند.

مشکل

هدف RLHF (درس اول):

max_pi E_{x,y~pi} [ r(x, y) ] - beta * KL(pi || pi_ref)

دارای یک بهینه شناخته شده است:

pi*(y|x) = (1/Z(x)) * pi_ref(y|x) * exp(r(x, y) / beta)

پس پاداش به طور ضمنی توسط نسبت سیاست مطلوب به مرجع تعریف می شود:

r(x, y) = beta * log(pi*(y|x) / pi_ref(y|x)) + beta * log Z(x)

اينو به احتمالي برادلي-تيري و تابع قسمتي تبديل کنZ(x)لغو ميکنه چون فقط بستگی دارهx. آنچه باقی مانده تنها یک ضرر در پارامترهای سیاست است هیچ مدل پاداش مورد نیاز نیست.

مروارید: مشتق فرض می کند که مطلوب قابل دستیابی است، داده های ترجیحی در توزیع است، و سیاست مرجع لنگر حالت واقعی است. هیچ یک از این موارد دقیقاً درست نیست. هر عضو خانواده فرضیه ای متفاوت را اصلاح می کند.

مفهوم

DPO (Rafailov و همکارانش، 2023)

L_DPO = -log sigmoid(
  beta * log(pi(y_w | x) / pi_ref(y_w | x))
  - beta * log(pi(y_l | x) / pi_ref(y_l | x))
)

چه اتفاقی می تواند پیش بیاد؟

  • شکاف ضمنی پاداشbeta * (log(pi/pi_ref)_w - log(pi/pi_ref)_l)یک ترجیح کوچک می تواند شکاف بزرگی را ایجاد کند.
  • این درایو از دست دادن، سوابق انتخاب شده و رد شده را در جهت های مخالف هدایت می کند. می تواند سوابق مطلق انتخاب شده را تا زمانی که سوابق رد شده سریعتر سقوط کند، پایین بکشد. این پدیده واکنش انتخاب شده است.
  • ترجیحات خارج از توزیع (دو زوج نادر به مقابل دو زوج نادر نادر) پاداش های ضمنی تعمیری را ایجاد می کند.

IPO (Azar و همکارانش، 2024)

بهینه سازی اولویت هویت، log-sigmoid را با نقشه برداری هویت بر روی احتمال اولویت جایگزین می کند. از دست دادن یک خطای مربع در یک هدف محدود می شود:

L_IPO = (log(pi(y_w | x) / pi_ref(y_w | x)) - log(pi(y_l | x) / pi_ref(y_l | x)) - 1/(2 beta))^2

حاشیه توسط 1/(2 beta). قدرت ترجیح و تفاوت ضمنی پاداش متناسب است . هیچ انفجار

KTO (Ethayarajh و همکارانش، 2024)

بهینه سازی کانمن-تفرسکی ساختار جفت را کاملاً کاهش می دهد. با توجه به یک خروجی واحد برچسب گذاری شده و یک سیگنال دوگانه "خواسته" یا "غیرخواسته" ، آن را به یک ابزار نظریه چشم انداز نقشه می زند:

v(x, y) = sigma(beta * log(pi(y|x) / pi_ref(y|x)) - z_ref)

با وزن های مختلف برای سود و خسارت (حوادث از دست دادن) مزایای: شما می توانید از داده های غیر جفت استفاده کنید که بسیار فراوان تر است.

SimPO (Meng و همکارانش، 2024)

بهینه سازی ساده ترجیحات سیگنال آموزش را با تولید هماهنگ می کند. سیاست مرجع را کاملا حذف کنید و احتمال ثبت را با طول عادی کنید:

L_SimPO = -log sigmoid(
  (beta / |y_w|) * log pi(y_w | x)
  - (beta / |y_l|) * log pi(y_l | x)
  - gamma
)

با یک حاشیهgammaبه طور معمول، این انگیزه را برای بهره برداری از حالت شکست در طول DPO حذف می کند (در طولy_wبا ساخت یک شکاف بزرگ تر از لاگ-برابر می دهد).

ORPO (Hong و همکارانش، 2024)

بهینه سازی ترجیحات نسبت احتمالات رادای احتمال منفی SFT یک اصطلاح ترجیح را اضافه می کند:

L_ORPO = L_NLL(y_w) + lambda * L_OR
L_OR = -log sigmoid(log(odds(y_w) / odds(y_l)))

هیچ سیاست مرجعی اصطلاح SFT تنظیم کننده است. در یک مرحله از مدل پایه تا مدل هموار. هیچ نقطه کنترل SFT جداگانه ای نیست.

BPO (پیشنهاد ICLR 2026, OpenReview id=b97EwMUWu7)

مشکل ردای منتخب پایین را شناسایی می کند: DPO رتبه بندی را حفظ می کند y_w > y_lاما آزمايشات مطلقy_wBPO اضافه می کند یک خط اصلاح که مجازات حرکت پایین روی پاسخ انتخاب شده است. گزارش دقیق +10.1% در Llama-3.1-8B-Instruct در استدلال ریاضی بر DPO.

نتیجه جهانی: DAAs هنوز بیش از حد بهینه سازی می کنند

رافیلوف و همکاران "قوانینی مقیاس بندی برای بهینه سازی بیش از حد مدل پاداش در الگوریتم های هماهنگی مستقیم" (NeurIPS 2024) سیاست های آموزش داده شده را با DPO، IPO، SLiC در مجموعه داده های متعدد در بودجه های KL انجام می دهند. منحنیات طلا- پاداش به مقابل KL دارای شکل قله و سقوط Gao و همکاران هستند. درخواست های ضمنی پاداش نمونه های خارج از توزیع در طول آموزش است؛ تنظیمات KL این را ثابت نمی کند.

DAAs از گودارت فرار نمی کنند. آنها سطح را از "نموذج پاداش بیش از حد بهینه سازی شده" به "نسب سیاست مرجع بیش از حد بهینه سازی شده" تغییر می دهند.

انتخاب در میان آنها (2026)

  • اگر داده های بزرگ انتخاب های جفتی دارید: DPO با بتا محافظه کار، SimPO اگر تعصب طول آشکار باشد.
  • اگر شما بازخورد دوگانه ای را نداشته باشید: KTO.
  • اگر می خواهید یک خط لوله یک مرحله از یک مدل پایه: ORPO.
  • اگر در دفترچه های DPO سوابق سوابق انتخاب شده ای را ببینید: BPO.
  • اگر نقاط ترجیح بسیار متفاوت باشد و DPO اشباع کننده باشد: IPO.

هر لابراتوار پنج تا را با یک باتری اجرا می کند و برنده را برای هر کار انتخاب می کند. هیچ دلیلی وجود ندارد که بهینه برای استدلال ریاضی و ایمنی یکسان باشد.

ازش استفاده کن

code/main.pyدر این مجموعه، 6 ضرر (DPO، IPO، KTO، SimPO، ORPO، BPO) در یک مجموعه داده های ترجیح بازی را مقایسه می کند که در آن قدرت واقعی ترجیح با جفت متفاوت است. هر ضرر با یک نمونه 500 جفت با سیاست نرم کم بهینه سازی می شود. نرخ پیروزی نهایی، انحراف انتخاب شده از لاگ-پروب و انتشار پاداش ضمنی در هر روش را نشان می دهد.

-باده

این درس به ما کمک می کندoutputs/skill-preference-loss-selector.mdبا توجه به آمار مجموعه داده ها (در مقایسه با جفت و غیر جفت، قدرت متغیر و یکسانی اولویت، توزیع طول) و هدف (در مرحله ی یک یا SFT پس از اولویت) ، یک از دست دادن اولویت را توصیه کنید و از حالت شکست که از آن محافظت می کند گزارش کنید.

تمرینات

  1. فرار کنcode/main.pyگزارش آخرین کاهش انتخاب شده در مورد DPO و BPO. BPO باید احتمال مطلق انتخاب شده را بالاتر نگه دارد این را تایید کنید.
  1. اطلاعات ترجیح را تغییر دهید تا همه جفت ها دارای قدرت برابر باشند. کدام یک از شش روش قوی تر است؟ کدام درجه؟ مزایای IPO را در اینجا توضیح دهید.
  1. پاسخ های رد شده را به طور متوسط دو برابر طولانی تر از انتخاب شده کنید. بدون تغییر چیزی دیگر، بهره برداری طول DPO را به صورت عددی و سمپو را ثابت کنید.
  1. Rafailov et al. (NeurIPS 2024) ادعا می کنند DAAs بیش از حد بهینه سازی می کنند. نسخه یک نقطه را تولید می کنند: انحراف KL انتخاب شده-منصوری رد شده و بهینه سازی بیش از حد در DPO در بتا بزرگ را مشاهده می کنند.
  1. خلاصه مقاله BPO را بخوانید (OpenReview b97EwMUWu7). اصلاح یک خطی را که BPO به DPO اضافه می کند بنویسید.code/main.py. .

اصطلاحات کلیدی

TermWhat people sayWhat it actually means
DPO"RLHF without a reward model"Loss derived from the closed-form RLHF optimum; policy parameters only
Implicit reward"the log-ratio"beta * log(pi(y|x) / pi_ref(y|x)) — the DPO-implied reward
IPO"bounded DPO"Replaces log-sigmoid with identity; implicit reward gap capped by 1/(2 beta)
KTO"unpaired DPO"Prospect-theory utility over single labels with loss aversion
SimPO"reference-free DPO"Length-normalized log-likelihood + margin; no reference policy
ORPO"one-stage DPO"NLL + odds-ratio preference term; trains from base model in one pass
BPO"chosen-preserving DPO"DPO plus a penalty for decreasing the chosen response's absolute log-prob
Degraded Chosen"chosen goes down"DPO decreases chosen log-prob so long as rejected falls faster
DAA"direct alignment algorithm"Any preference-loss method that skips an explicit RM

خواندن بیشتر

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.