एजेंटों के लिए सहमति और बीजान्टिन दोष सहिष्णुता
Type: Learn + Build
Languages: Python (stdlib)
Prerequisites: Phase 16 · 07 (Society of Mind and Debate), Phase 16 · 13 (Shared Memory)
Time: ~75 minutes
समस्या
आप N LLM एजेंटों प्रत्येक एक जवाब का उत्पादन करते हैं। वे असहमत हैं। बहुमत वोट गलत एक का चयन करता है क्योंकि दो एजेंटों के संबंध (एक ही आधार मॉडल, एक ही प्रशिक्षण डेटा, एक ही विफलता मोड) । एक तीसरा एजेंट एक उपन्यास तरीके से गलत होता है इसलिए बहुमत एक झूठा बहुमत है।
अब एक धोखा देने वाला एजेंट जोड़ेंः यह जानबूझकर झूठ बोलता है। या एक साइकोफैंटिक एजेंटः यह जो भी आखिरी बात की है के साथ सहमत है। शास्त्रीय BFT में, यह धारणा है कि बीजान्टिन नोड्स एक अंश हैं।f < n/32026 की वास्तविकता यह है कि एलएलएम नोड्स ईमानदार होने पर भी स्टोकास्टिक हैं, मॉडल के बीच सहसंबंधित हैं, और एक दूसरे के आउटपुट से प्रभावित हैं. आप उन्हें स्वतंत्र बर्नौली मतदाता के रूप में नहीं देख सकते हैं।
क्लासिकल बीएफटी (पीबीएफटी, 1999) गलत नहीं है यह अपूर्ण है। यह मनमानी बिट-फ्लपिंग को संभालता है। यह "तीन ईमानदार एजेंटों को एक भ्रम साझा करता है क्योंकि वे प्रशिक्षण डेटा साझा करते हैं" को संभालता नहीं है। यह सबक पीबीएफटी की नींव और तीन 2025-2026 अनुकूलन पर परतों से बना है।
अवधारणा
क्लासिक BFT आपको क्या देता है
व्यावहारिक बीजान्टिन दोष सहिष्णुता (कास्त्रो और लिस्कोव, ओएसडीआई 1999) सहिष्णुता f < n/3बीजान्टिन नोड्स. प्रोटोकॉल में तीन चरण (प्रि-प्रिपेयर, तैयार, कमिट) और दो आदिम (हस्ताक्षरित संदेश, क्वारम प्रमाणपत्र) हैं।n >= 3f + 1ईमानदार-या-दुष्ट नोड्स।
गारंटीएं मजबूत हैं, लेकिन यह मान लेंः
- Independent faults.बीजान्टिन समन्वय नहीं करते हैं।
- Honest nodes are truly honest.ईमानदार आउटपुट की सटीकता कोई मुद्दा नहीं है; प्रोटोकॉल केवल असहमति को संरेखित करता है।
- The question has a ground-truth answer.गलत तथ्य पर सहमति अभी भी सहमति है।
एक "ईमानदार" एलएलएम अभी भी भ्रम पैदा करता है और अस्पष्ट प्रश्नों पर, "सत्य" वह है जो एजेंटों का निर्णय है कि कोई बाहरी अध्यापक नहीं है।
तीन एलएलएम विशिष्ट हमलों
Byzantine lie.एक एजेंट जानबूझकर गलत उत्तर देता है. क्लासिकल BFT इस तरह से संभालता है अगरf < n/3. .
Sycophantic conformity.एक एजेंट वोट देने से पहले दूसरों के उत्तरों को पढ़ता है और अंतिम बोले जाने वाले व्यक्ति के साथ aligns होता है। यह दुर्भावनापूर्ण नहीं है, लेकिन सबसे ज्यादा आवाज के साथ सहसंबंधित है। क्लासिकल बीएफटी इस बात को नहीं रोकता क्योंकि एजेंट हर हस्ताक्षर जांच पास करता है।
Correlated-error monoculture.तीन एजेंट एक आधार मॉडल साझा करते हैं। वे एक ही गलत उत्तर का भ्रम करते हैं। बहुमत गलत है। क्लासिकल बीएफटी मदद नहीं करता है क्योंकि तीनों "ईमानदारी से" सहमत हैं।
2025-2026 के उत्तर
CP-WBFT(arXiv:2511.10400) आत्मविश्वास-प्रोफेड वेटेड बीएफटी। प्रत्येक मतदाता अपने उत्तर (एक स्व-रिपोर्ट की संभावना, या एक अलग माप मॉडल की भविष्यवाणी) के लिए एक विश्वास जांच संलग्न करता है। वोट आत्मविश्वास के साथ वजन पैमाने पर रिपोर्ट +85.71% बीएफटी सुधार पर पूर्ण ग्राफ। मिटावः साइकोफैंटिक अनुरूपता (अनुपालन एजेंटों को अपनी स्वयंसेवक स्थिति पर कम विश्वास करने की प्रवृत्ति होती है) ।
DecentLLMs(arXiv:2507.14928) लीडरलेस. श्रमिक एजेंट समानांतर में प्रस्ताव प्रस्तुत करते हैं, मूल्यांकनकर्ता एजेंट प्रस्तावों को स्कोर करते हैं, अंतिम उत्तर स्कोर किए गए पदों का ज्यामितीय मध्य है। जब मजबूत f < n/2. मिथक और संबद्ध त्रुटियों के लिए विनियमन (भौगोलिक मध्यस्थता अप्रासंगिक तक मजबूत है और घने क्लस्टर की ओर खींचती है, न कि मॉडल-पक्षीय औसत) ।
WBFT(arXiv:2505.05103) पदानुक्रम संरचना क्लस्टरिंग के साथ वजन BFT। वोट वजन प्रतिक्रिया गुणवत्ता के आधार पर सौंपा जाता है और इतिहास से सीखे गए विश्वास स्कोर के आधार पर। कोर और एज में क्लस्टर एजेंट; कोर एजेंटों को पहले सहमति हासिल करनी चाहिए, एज एज एजेंटों का पालन करना चाहिए। स्केलेबिलिटी के लिए मिट्याग (कोर सहमति छोटी और तेज है) और आंशिक रूप से मोनोकल्चर के लिए (कौर विविधता के लिए चुना जा सकता है) ।
अनुभवजन्य: "क्या एआई एजेंट सहमत हो सकते हैं?
पेपर कई सीमा मॉडल के बीच स्केलर समझौते (एलएलएम एजेंट एक ही संख्यात्मक मूल्य पर सहमत) को मापता है। निष्कर्ष असहज हैः
- यहां तक कि बिना किसी प्रतिद्वंद्वी के, एलएलएम एजेंट कई बेंचमार्क पर 30% से अधिक दरों पर स्केल प्रश्नों पर असहमत होते हैं।
- एक एकल एजेंट जो एक धोखाधड़ी व्यक्ति को अपनाता है, वह ईमानदार आधार रेखा से मिश्रण एजेंट सहमति 40+ प्रतिशत अंक निकाल सकता है।
- असहमति दर मॉडल विविधता के साथ सहसंबंधित है विषम समूह समान समूहों की तुलना में अधिक असहमत हैं (अच्छेः असहमत त्रुटियां) लेकिन धीमी गति से भी बहते हैं (बुरेः अधिक समय तक समझौता करने के लिए) ।
BFT आपको आउटपुट को संरेखित करने के लिए मशीनरी देता है, लेकिन यह आपको नहीं बताता है कि संरेखित आउटपुट सही है या नहीं। सत्यापन (चरण 16 · 08 भूमिका विशेषज्ञता), विविधता (चरण 16 · 15 बहस संस्करण) और मूल्यांकन एजेंट (चरण 16 · 24 बेंचमार्क) के साथ संयोजन करें।
कोर प्रोटोकॉल, नीचे उतार दिया
LLM एजेंटों के लिए न्यूनतम BFT राउंडः
1. task arrives; each agent i produces answer a_i
2. each agent attaches confidence probe c_i in [0, 1]
3. aggregator collects (a_i, c_i) from all n agents
4. aggregator groups by semantic cluster (equivalent answers)
5. aggregator computes weight for each cluster C:
w(C) = sum_{i in C} c_i
6. winner = cluster with max weight, if max > threshold * sum(c_i)
else: retry or escalate
7. minority clusters logged with provenance for post-hoc auditअर्थिक क्लस्टरिंग चरण एलएलएम-विशिष्ट मोड़ है। दो उत्तर "अध्ययन रिपोर्ट 4.2%" और "4.2% सुधार" एक ही क्लस्टर हैं। एक साफ़ स्ट्रिंग-समता जांच इसे याद करेगी। उत्पादन में, सस्ते एम्बेडिंग मॉडल या स्पष्ट कैनोनिकेशन का उपयोग करें।
सीमा समायोजन
thresholdपैरामीटर तय करता है कब स्वीकार करने के लिए और जब पुनः प्रयास करने के लिए. बहुत कमः आप स्वीकार कमजोर बहुमत. बहुत उच्चः आप कभी भी स्वीकार नहीं करते हैं। अनुभवजन्य सीमाः 0.5-0.67 के लिए n=5-7छोटे के लिए अधिकnएक सीमा से नीचे, एक मानव या एक अलग एजेंट समूह में वृद्धि.
जहां सहमति मदद नहीं करती है
- Ambiguous questions.यदि प्रश्न में कोई आधारभूत सत्य नहीं है, तो सहमति एक राय है। इसे ऐसा कहें।
- Compound questions."कोड लिखें और समझाएं" दो उत्तर। प्रत्येक पर स्वतंत्र रूप से वोट दें।
- Adversarial multi-round.यदि एजेंट पहले के राउंड का निरीक्षण कर सकते हैं और अनुकरण कर सकते हैं (Du 2023 बहस), तो वे सच्चाई के बावजूद एक दूसरे के साथ सहमत होने लगते हैं। राउंड को सीमित करें (2-3 आमतौर पर) ।
इसे बनाओ
code/main.pyकार्य करता हैः
AgentVoterएक स्क्रिप्ट नीति के साथ (जवाब, विश्वास) ।MajorityVoteशास्त्रीय बहुलता।CPWBFTअर्थिक समूहबद्धता के साथ विश्वास-वजनित मतदान।DecentLLMsस्कोर किए गए प्रस्तावों पर ज्यामितीय-मध्य संश्लेषण।Scenarioप्रत्येक एग्रीगेटर को तीन हमले के पैटर्न के तहत चलाता है।
हमले के पैटर्न लागू किए गएः
byzantineएक एजेंट उच्च आत्मविश्वास के साथ झूठ बोलता है।sycophancy: एक एजेंट पहले जवाब को कॉपी करता है जो वह देखता है, एक ही आत्मविश्वास के साथ।monoculture: तीन एजेंटों को एक गलत उत्तर (संदर्भित त्रुटि) के साथ मध्यम आत्मविश्वास है।
दौड़ें:
python3 code/main.pyअपेक्षित आउटपुटः एक तालिका (हमला, संकलितकर्ता) -> अंतिम उत्तर, सही उत्तर को उजागर किया गया है। बहुलता मोनोकल्चर मामले में विफल रहता है। CPWBFT का आत्मविश्वास वजन साइकोफैन्सी को कम करता है। डेसेंटएलएलएम का ज्यामितीय-मध्यमान ईमानदार क्लस्टर की ओर खींचता है जब मोनोकल्चर आधी आबादी से कम है।
इसका प्रयोग करें
outputs/skill-consensus-designer.mdबहु-एजेंट समूह के लिए एक सहमति प्रोटोकॉल डिजाइन करता हैः क्लस्टरिंग विधि, वजन, सीमा और उप-सीमा राउंड के लिए वृद्धि नीति।
इसे भेजें
किसी भी सहमति तंत्र को भेजने से पहलेः
- Attack-test with at least the three patternsआपके प्रोटोकॉल को चुपके से नहीं, बल्कि पूर्वानुमानित रूप से विफल होना चाहिए।
- Log every minority clusterअल्पसंख्यक समूहों संबद्ध त्रुटियों के लिए अपने प्रारंभिक चेतावनी प्रणाली हैं।
- Enforce bounded rounds.कोई "समझने तक बहस जारी रखें" नहीं जो सिकोफेंस को पुरस्कृत करता है।
- Separate agreement from correctness.सहमति आउटपुट एक सत्यापितकर्ता को जाता है; सत्यापितकर्ता समूह से स्वतंत्र है।
- Monitor the agreement rate.तेज वृद्धि का अर्थ है अनुपालन पूर्वाग्रह; तेज गिरावट का अर्थ है मॉडल बहाव।
व्यायाम
- दौड़ें
code/main.py. बहुलता की पुष्टि करें मोनोकल्चर हमले में विफलता होती है लेकिन सीपीडब्ल्यूबीएफटी मोनोकल्चर आत्मविश्वास 0.7 से नीचे होने पर इसे आंशिक रूप से कम करता है। - एक चौथा हमले पैटर्न जोड़ेंः silent abstention एक एजेंट जवाब देने से इनकार करता है ("मुझे नहीं पता") प्रत्येक एग्रीगेटर को अपने निर्णय को लागू करने के लिए कैसे व्यवहार करना चाहिए?
- स्ट्रिंग कैनोनिकेशन से सिमेंटिक क्लस्टरिंग को एम्बेडिंग-समानता (किसी भी ओपन-सोर्स एम्बेडिंग मॉडल का उपयोग करें) में स्विच करें। सिकोफेंसी हमले का क्या होता है?
- CP-WBFT (arXiv:2511.10400) पढ़ें। आत्मविश्वास-सोंद का माप चरण लागू करें (एक अलग माप मॉडल प्रत्येक एजेंट के आत्म-रिपोर्ट किए गए आत्मविश्वास की जांच करता है) । मोनोकल्चर परिदृश्य पर सटीकता वृद्धि को मापें।
- "क्या एआई एजेंट सहमत हो सकते हैं? " (arXiv:2603.01213) पढ़ें। एक सरलीकृत स्कालर-अग्रीमेंट प्रयोग दोहराएंः तीन एजेंट, एक स्कालर प्रश्न, धोखा देने वाले व्यक्ति का संकेत। क्या CPWBFT या DecentLLMs इसे पकड़ते हैं?
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| BFT | "Byzantine fault tolerance" | Castro-Liskov 1999 protocol for consensus with f < n/3 arbitrary faults. |
| Byzantine | "Any bad behavior" | A node that can lie, drop messages, fail silently — anything but crash safely. |
| Confidence probe | "How sure are you?" | Self-reported or calibrator-predicted probability attached to a vote. |
| Semantic clustering | "Same answer, different words" | Grouping equivalent answers before counting votes. |
| Geometric median | "Robust center" | The point minimizing sum of distances to sample points. Robust to outliers, unlike the mean. |
| Monoculture | "Same model, same failures" | Correlated errors when agents share training data or base model. |
| Sycophantic conformity | "Agreeing with the loud voice" | An agent's vote biases toward whoever spoke first/loudest. |
| Core/Edge | "Hierarchical BFT" | WBFT split: small Core consensus first, Edge nodes follow. Bounds latency. |
आगे पढ़ना
- Castro & Liskov — Practical Byzantine Fault Tolerance (OSDI 1999) फाउंडेशन
- CP-WBFT — Confidence-Probe Weighted BFT विश्वास द्वारा वोटों का भार
- DecentLLMs — leaderless multi-agent consensus ज्यामितीय-मध्य संश्लेषण
- WBFT — Weighted BFT with Hierarchical Structure Clustering सीमांकित विलंबता के लिए कोर/एज विभाजन
- Can AI Agents Agree? स्केलर-एग्रीमेंट की नाजुकता और धोखाधड़ी-व्यक्तिगत हमला
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.