Phase 16: Multi-Agent & Swarms

एजेंट अर्थव्यवस्थाएं, टोकन प्रोत्साहन, प्रतिष्ठा

लंबी दूरी के स्वायत्त एजेंटों (METR के 1 से 8 घंटे के कार्य वक्र) को आर्थिक एजेंट की आवश्यकता होती है।5-layer stackहै: DePIN(भौतिक गणना) → Identity(W3C DIDs + प्रतिष्ठा पूंजी) → Cognition(RAG + MCP) → Settlement(खातिर विवरण) → Governanceउत्पादन एजेंट-उत्तेजक नेटवर्क में शामिल हैं Bittensor(TAO उप-नेट कार्य-विशिष्ट मॉडल को पुरस्कृत करते हैं), Fetch.ai / ASI Alliance(ASI-1 Mini LLM + FET टोकन), और Gonkaअकादमिक कार्यः एएएमएएस 2025 के विकेन्द्रीकृत लामास उपयोग Shapley-value credit attributionयोगदानकर्ता एजेंटों को उचित रूप से पुरस्कृत करने के लिए; Google रिसर्च "बड़े भाषा मॉडल के लिए तंत्र डिजाइन" का प्रस्ताव token auctionsइस पाठ में एक न्यूनतम एजेंट बाजार का निर्माण किया गया है, एक बहु-एजेंट पाइपलाइन पर शैपली मूल्य क्रेडिट श्रेय लागू किया गया है, और एक दूसरी कीमत टोकन नीलामी चलाया गया है ताकि खेल-सैद्धांतिक मशीनरी ठोस रूप से भूमि।

Type: Learn

Languages: Python (stdlib)

Prerequisites: Phase 16 · 16 (Negotiation and Bargaining), Phase 16 · 09 (Parallel Swarm Networks)

Time: ~75 minutes

समस्या

बहु-एजेंट प्रणाली जटिल हो जाती है जब एजेंट संयुक्त रूप से मूल्य उत्पन्न करते हैं लेकिन उन्हें व्यक्तिगत रूप से पुरस्कृत करने की आवश्यकता होती है। शास्त्रीय तंत्र समान विभाजन, अंतिम योगदानकर्ता-सब लेता है अन्यायपूर्ण या खेल योग्य हैं। शेपली मानों के माध्यम से गठबंधन आधारित पुरस्कार निर्माण द्वारा निष्पक्ष है लेकिन गणना करने के लिए महंगा है। 2025-2026 साहित्य उपयोगी अनुमानों को आगे बढ़ाता हैः शैपली नमूनाकरण, एकांत संग्रह नीलामी, और श्रृंखला पर प्रतिष्ठा जो पुष्टि योगदान से उत्पन्न होती है।

क्रेडिट श्रेय से परे, क्षेत्र वास्तविक आर्थिक एजेंटों की ओर रुख कर रहा हैः बिट्टेंसर टीएओ उप-नेट-विशिष्ट मॉडल को ठीक करने के लिए खनन कंप्यूटिंग को पुरस्कृत करता है, Fetch.ai/ASI FET टोकन के साथ ASI-1 मिनी एलएलएम उपयोग को पुरस्कृत करता है, Gonka उत्पादक AI कार्यों के लिए ट्रांसफार्मर प्रूफ-ऑफ-वर्क को फिर से आवंटित करता है। एजेंट जो स्वायत्त रूप से लेनदेन करते हैं, आज मौजूद हैं; सवाल यह है कि प्रोत्साहन को कैसे संरेखित किया जाए।

यह पाठ एजेंट अर्थव्यवस्थाओं को एक विशिष्ट समस्या परिवार के रूप में व्यवहार करता है क्रेडिट श्रेय, तंत्र डिजाइन, और प्रतिष्ठा और प्रत्येक को न्यूनतम गणित के साथ बनाता है ताकि विचार चिपके रहें।

अवधारणा

5 परत एजेंट-अर्थव्यवस्था स्टैक

  1. DePIN (physical compute).विकेन्द्रीकृत बुनियादी ढांचा जो GPU, भंडारण, बैंडविड्थ किराए पर देता है. बिटेंसर उप-नेटवर्क, रेंडर नेटवर्क, आकाश. एजेंट विशिष्ट नहीं; एजेंटों का उपयोग करते हैं.
  2. Identity.W3C विकेंद्रीकृत पहचानकर्ता (DID) प्रत्येक एजेंट को किसी भी प्लेटफॉर्म से स्वतंत्र एक टिकाऊ आईडी देते हैं। प्रतिष्ठा DID पर जमा होती है। एजेंट नेटवर्क प्रोटोकॉल (ANP) DID को खोज परत के रूप में उपयोग करता है।
  3. Cognition.एजेंट का तर्क लूप: LLM + RAG + MCP. यह है कि अन्य चरणों का निर्माण.
  4. Settlement.खाता निष्कर्षण (ERC-4337) एजेंटों को ईटीएच के बिना अपने बैलेंस से गैस का भुगतान करने देता है। एजेंट सेवाओं के लिए भुगतान कर सकते हैं, एक दूसरे के लिए या गणना कर सकते हैं।
  5. Governance.एजेंटिक डीएओः शासन संरचनाएं जहां मानव और एजेंट प्रोटोकॉल परिवर्तनों पर मतदान करते हैं, जिसमें प्रतिष्ठा से संबंधित मतदान शक्ति होती है।

हर उत्पादन प्रणाली में पांचों का उपयोग नहीं किया जाता है। बिटेंसर 1, 2, आंशिक रूप से 3, आंशिक रूप से 4, का उपयोग करता है। 5. ओपनएआई एजेंटों में से कोई भी 3 के अलावा उपयोग नहीं करता है। स्टैक एक संदर्भ नक्शा है, कोई आवश्यकता नहीं है।

बिटेंसर, Fetch.ai, Gonka क्या चल रहा है

Bittensor (TAO).उप-नेट विशिष्ट कार्य हैं (भाषा मॉडलिंग, छवि निर्माण, पूर्वानुमान) । खनिक मॉडल आउटपुट प्रस्तुत करते हैं। वेलिडेटर उन्हें रैंक करते हैं; दांव-वजनित स्कोरिंग TAO पुरस्कारों को वितरित करता है। प्रत्येक उप-नेट का अपना मूल्यांकन होता है। आर्थिक पाठः कार्य-विशिष्ट आउटपुट गुणवत्ता के लिए भुगतान करें, उपयोग किए गए गणना नहीं।

Fetch.ai / ASI Alliance.ASI-1 मिनी LLM Fetch.ai के नेटवर्क पर चलता है; उपयोगकर्ता निष्कर्ष के लिए FET टोकन का भुगतान करते हैं। एजेंट-ए-पीयर कथा यहां अधिक मजबूत हैः Fetch पर एक एजेंट किसी अन्य को एक कार्य के लिए कॉल कर सकता है और FET में भुगतान कर सकता है।

Gonka.ट्रांसफार्मर प्रूफ-ऑफ-वर्कः "वर्क" ट्रांसफार्मर के आगे के पास है। खनिक ऐसे निष्कर्ष कार्यों को चलाने से अर्जित करते हैं जिनके पास सही आउटपुट (प्रशिक्षण डेटा से) हैं। हैश-आधारित पॉड के बजाय संसाधन-उत्पादक पॉड।

तीनों अप्रैल 2026 तक उत्पादन-ग्रेड हैं। भुगतान वितरण भिन्न है। बिटेंसर उप-नेट वैधकर्ताओं के सापेक्ष गुणवत्ता को पुरस्कृत करता है; भुगतान उपयोगकर्ताओं द्वारा मापा गया फ़ेच पुरस्कार उपयोगिता; गोंका पुरस्कार सत्यापित निष्कर्ष कार्य।

शैपली मूल्य क्रेडिट श्रेय

तीन एजेंट एक कार्य पर सहयोग करते हैं। आउटपुट स्कोर 0.8. किसने क्या योगदान दिया?

Shapley मानः चार अक्षय (प्रभावशीलता, सममितता, रैखिकता, शून्य) को पूरा करने वाला अद्वितीय क्रेडिट आवंटन।i:

shapley(i) = (1/N!) * sum over all orderings O of (v(S_i_O ∪ {i}) - v(S_i_O))

कहाँS_i_Oपहले के एजेंटों का सेट है iक्रम में O. व्यवहार में: सभी परमुटेशनों को सूचीबद्ध करें, प्रत्येक परमुटेशन में प्रत्येक एजेंट के मार्जिनल योगदान को रिकॉर्ड करें, औसत।

N=3 एजेंट के लिए, 6 परमुटेशन हैं। N=10, 3.6M के लिए, इसलिए व्यवहार में आप क्रम को सूचीबद्ध करने के बजाय नमूना करते हैं।

संश्लेषण के लिए दूसरी कीमत नीलामी

गूगल रिसर्च ("बड़ी भाषा मॉडल के लिए तंत्र डिजाइन") LLM आउटपुट को एकत्रित करने के लिए दूसरी कीमत टोकन नीलामी का प्रस्ताव देता है। सेटअपः N एजेंट प्रत्येक एक पूरा प्रस्ताव; प्रत्येक के लिए एक निजी मूल्य है चयनित करने के लिए। नीलामीकर्ता सबसे अधिक मूल्य प्रस्ताव चुनता है और दूसरा सबसे अधिक मूल्य का भुगतान करता है। एकांत संश्लेषण के तहत (मूल्य इस बात पर निर्भर करता है कि किस प्रस्ताव का चयन किया गया है, न कि कितने बोली दिए गए हैं), यह सत्य है एजेंट अपने वास्तविक मूल्य की बोली लगा रहे हैं।

LLM प्रणाली के लिए यह महत्वपूर्ण क्यों हैः आप विभिन्न कीमतों के साथ कई एजेंटों को पूरा करने के लिए आउटसोर्स कर सकते हैं; नीलामी सबसे अच्छा चुनती है + निष्पक्ष भुगतान करती है, और एजेंटों के पास गलत रिपोर्ट करने के लिए कोई प्रोत्साहन नहीं है।

प्रतिष्ठा पूंजी

DID-बाउंड प्रतिष्ठा स्कोर पुष्टि योगदान से जमा होता है। एक सरल अद्यतन नियमः

rep(i, t+1) = alpha * rep(i, t) + (1 - alpha) * contribution_quality(i, t)

क्षय कारक के साथ alpha1. प्रतिष्ठाः

  • मार्ग निर्धारण निर्णयों के लिए पढ़ने के लिए सस्ता है ("उच्च प्रतिनिधि एजेंटों को कठिन कार्य भेजें") ।
  • बनाने में महंगी है (समय के साथ जमा होती है, डीआईडी से जुड़ी होती है) ।
  • कटौती की जा सकती हैः सत्यापन में विफल योगदान घटाने।

एएमएएस 2025 विकेन्द्रीकृत लामास

लामास प्रस्ताव (एएएमएएस 2025) में शामिल हैंः डीआईडी पहचान, शैपली मूल्य क्रेडिट श्रेय, और एक सरल नीलामी तंत्र। मुख्य दावाः क्रेडिट श्रेय चरण को विकेंद्रीकृत करना सिस्टम को लेखापरीक्षण योग्य और एकल-बिंदु हेरफेर से प्रतिरक्षा देता है।

जहां अर्थव्यवस्था टूट जाती है

  • Price oracle manipulation.यदि क्रेडिट फ़ंक्शन को गेम किया जा सकता है, तो एजेंट इसे गेम करेंगे। प्रत्येक तंत्र को एक विरोधी परीक्षण की आवश्यकता होती है।
  • Sybil attacks.एक ऑपरेटर ने N नकली एजेंटों को अपने योगदान को बढ़ाने के लिए स्पिन किया। डीआईडी धीमी गति से लेकिन इसे नहीं रोकते; प्रतिष्ठा लागत-से-नकली को कम करना है।
  • Verification cost.क्रेडिट श्रेय सत्यापितकर्ता के समान ही निष्पक्ष है। यदि सत्यापन सस्ता है (छोटा LLM), तो इसे गेम किया जा सकता है; यदि महंगा है (मानव पैनल), तो प्रणाली पैमाने पर नहीं है।
  • Regulatory overhang.एजेंट अर्थव्यवस्थाएं वित्तीय विनियमन के साथ चौराहे पर हैं। बिटेंसर, फेच और गोंका सभी 2026 से कुछ न्यायालयों में कानूनी ग्रे क्षेत्रों में काम करते हैं।

जब एजेंट अर्थव्यवस्थाओं का अर्थ होता है

  • Open networks with heterogeneous operators.कोई भी एक टीम सभी एजेंटों को नियंत्रित नहीं करती है।
  • Verifiable outputs.सत्यापन के बिना, क्रेडिट श्रेय एक अनुमान है।
  • Long-horizon workflows.एक शॉट के कामों को प्रतिष्ठा जमा करने से लाभ नहीं मिलता है।
  • Tokenized payments are legally viableआपके अधिकार क्षेत्र में।

बंद कॉर्पोरेट प्रणालियों में, अर्थशास्त्र सरल आवंटन (प्रबंधक कार्य सौंपते हैं, माप आंतरिक हैं) के लिए जगह देता है। अर्थशास्त्र साहित्य ज्यादातर खुले नेटवर्क पर लागू होता है।

इसे बनाओ

code/main.pyकार्य करता हैः

  • shapley(value_fn, agents) छोटे N के लिए गणना द्वारा सटीक Shapley गणना।
  • second_price_auction(bids) सत्यतापूर्ण तंत्र; विजेता दूसरा सबसे अधिक भुगतान करता है।
  • Reputation तेजी से गिरावट और कटौती के साथ डीआईडी-बाउंड प्रतिष्ठा।
  • डेमो 1: तीन एजेंट सहयोग, सटीक शैप्ली श्रेय श्रेय.
  • डेमो 2: पांच एजेंटों ने एक टास्क स्लॉट के लिए बोली लगाई; दूसरी कीमत नीलामी विजेता + भुगतान का चयन करती है।
  • डेमो 3: विषम प्रतिनिधि वाले एजेंटों को कार्य सौंपने के 100 दौर; प्रतिनिधि-वजनित रूटिंग यादृच्छिक धड़कन।

दौड़ें:

python3 code/main.py

अपेक्षित आउटपुटः प्रत्येक एजेंट के लिए शैपली मान; नीलामी परिणाम जो सत्य-बेड संतुलन दिखाता है; रिप-वेटेड राउटिंग जो वार्पअप के बाद यादृच्छिक पर 10-20% गुणवत्ता लाभ दिखाता है।

इसका प्रयोग करें

outputs/skill-economy-designer.mdन्यूनतम एजेंट अर्थव्यवस्था का निर्माण करता हैः पहचान परत का चयन, क्रेडिट श्रेय तंत्र, भुगतान तंत्र, प्रतिष्ठा नियम।

इसे भेजें

2026 में एजेंट अर्थव्यवस्था चला रहा हैः

  • Start with reputation, not tokens.प्रतिष्ठा को लागू करना सस्ता और अकेले मूल्यवान है; टोकन कानूनी और आर्थिक जटिलता जोड़ते हैं।
  • Verify before you reward.बिना स्वतंत्र सत्यापन चरण के क्रेडिट कभी वितरित न करें। स्व-रिपोर्ट गुणवत्ता सिबिल गेम्स में बढ़ जाती है।
  • Shapley-sample, not Shapley-exact.नमूना 100-1000 आदेश; सटीक गणना पैमाने नहीं है।
  • Cap decay factor and floor reputation.असीमित क्षय वैध योगदानकर्ताओं को मिटा देता है; बहुत धीमी क्षय पुरस्कार पुराने उच्च प्रतिक्रिया एजेंटों को।
  • Audit mechanisms adversarially.नेटवर्क खोलने से पहले रेड-टीम परिदृश्य चलाएं. प्रत्येक तंत्र में एक खेल सिद्धांत है; आप छेद ढूंढना चाहते हैं, हमलावरों को नहीं।

व्यायाम

  1. दौड़ेंcode/main.py. शेपली मानों के योग को कुल मूल्य (प्रभावशीलता अक्षय) की पुष्टि करें। मूल्य समारोह को बदलें; क्या शेपली आवंटन अपेक्षित दिशा में बदलते हैं?
  2. Shapley sampling (Monte Carlo over K orders) को लागू करें। K अनुमान सटीकता को कैसे प्रभावित करता है? N=4 के लिए सटीक की तुलना करें।
  3. नीलामी से पहले गठबंधन बनाने का कदम लागू करेंः एजेंट टीमों में विलय कर सकते हैं और इकाई के रूप में बोली लगा सकते हैं। कौन से गठबंधन बनते हैं? क्या परिणाम व्यक्तिगत बोली लगाने से बेहतर है?
  4. गूगल रिसर्च के तंत्र डिजाइन पोस्ट पढ़ें. एक धारणा की पहचान करें कि, अगर उल्लंघन किया जाता है, सत्यता को तोड़ता है. LLM सेटिंग में विफलता मोड कैसा दिखता है?
  5. AAMAS 2025 विकेन्द्रीकृत LaMAS पेपर पढ़ें. एक सिंथेटिक कार्य पर उनके Shapley कदम 10 एजेंटों पर लागू करें. सटीक गणना में कितना समय लगता है? नमूना लेने 100 ड्रॉ के साथ कितना करीब आता है?

प्रमुख शर्तें

TermWhat people sayWhat it actually means
DePIN"Decentralized physical infrastructure"Token-incentivized compute/storage/bandwidth. Bittensor, Akash, Render.
DID"Decentralized identifier"W3C spec for portable IDs. Agent reputation binds to DID, not to a platform.
ERC-4337"Account abstraction"Contract accounts that can sponsor gas, enabling agent payments.
Shapley value"Fair credit attribution"Unique allocation satisfying efficiency, symmetry, linearity, null.
Second-price auction"Vickrey auction"Truthful mechanism: winner pays second-highest bid. Monotone aggregation compatible.
Reputation capital"Accumulated quality score"DID-bound score from confirmed contributions; decays over time.
Agentic DAO"Agents + humans govern"DAO with agent voters as first-class, voting power tied to reputation.
TAO / FET / GPU credits"Token denominations"Bittensor TAO, Fetch.ai FET, various DePIN tokens.

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.