जनरेटिव एजेंट और उभरते सिमुलेशन
Type: Learn + Build
Languages: Python (stdlib)
Prerequisites: Phase 16 · 04 (Primitive Model), Phase 16 · 13 (Shared Memory)
Time: ~75 minutes
समस्या
अधिकांश मल्टी-एजेंट सिस्टम सख्ती से स्क्रिप्ट की गई टीम हैंः प्लानर योजनाएं, कोड कोड, समीक्षक समीक्षाएं। यह अच्छी तरह से परिभाषित कार्यों के लिए काम करता है। यह उभरते, अनस्क्रिप्ट किए गए व्यवहार को कैप्चर नहीं करता है जो तब उत्पन्न होता है जब एजेंटों के पास स्मृति, प्राथमिकताएं और एक खुली दुनिया होती है। अनुसंधान, समाज सिमुलेशन और तेजी से खेल एआई को इस दूसरी तरह की आवश्यकता होती है।
स्मालविले वास्तुकला इसके लिए बेंचमार्क है। पार्क 2023 तक, सबसे अच्छा एजेंट सिमुलेशन क्षैतिज स्क्रिप्ट-फॉलोअर थे; इसके बाद, पैटर्न खुला दुनिया में जनरेटिव एजेंटों के लिए डिफ़ॉल्ट है। यदि आप 2026 में एक एजेंट सिमुलेशन बनाते हैं, तो आप या तो स्मालविले के तीन घटकों का उपयोग कर रहे हैं या स्पष्ट रूप से यह उचित ठहरा रहे हैं कि आप क्यों नहीं हैं।
अवधारणा
तीन घटक
Memory stream.प्रत्येक प्रविष्टि में एक समय टिकट, एक प्रकार, एक विवरण (प्राकृतिक भाषा) और व्युत्पन्न मेटाडेटा हैःrecency,importance(एजेंट द्वारा 1-10 का स्व-मूल्यांकन) और relevance(वर्तमान क्वेरी के साथ कॉसिन समानता) ।
[2026-02-14 09:12:03] observation: Isabella Rodriguez asked me if I like jazz
[2026-02-14 09:14:22] reflection: I enjoy long conversations about music
[2026-02-14 10:05:00] plan: Attend Isabella's Valentine's Day party tonightस्मृति पुनर्प्राप्ति तीन स्कोर को जोड़ती हैः score = w_recency e^(-decay age) + w_importance importance + w_relevance cos_sim. शीर्ष-के प्रविष्टियों वर्तमान संकेत दर्ज करें.
Reflection.आवधिक रूप से (प्रत्येक N यादें या महत्वपूर्ण घटनाओं पर), एजेंट हालिया यादों से उच्च-क्रम संश्लेषण उत्पन्न करता है। प्रतिबिंब प्रविष्टियां धारा में वापस जाती हैं और किसी भी अन्य स्मृति की तरह पुनः प्राप्त की जा सकती हैं। इस तरह एजेंट "समझाने" का निर्माण करते हैं।
Plan.शीर्ष-डाउन विघटन। पहले, एक दिन स्तर की योजना व्यापक स्ट्रोक में ("काम पर जाएं, क्लाउस के साथ रात का खाना खाएं") । फिर घंटे स्तर की योजनाएं। फिर कार्रवाई स्तर की योजनाएं। योजनाएं संशोधित की जा सकती हैंः जब एक अवलोकन एक योजना के विपरीत होता है, तो एजेंट प्रभावित खंड को फिर से योजना बनाता है।
तीनों का महत्व क्यों है (अवधान)
पार्क और अन्य ने अवलोकन, चिंतन और योजना के प्रत्येक को छोड़ने वाले अपवर्तन चलाए। प्रत्येक अपवर्तन विश्वसनीयता को नुकसान पहुंचाता हैः
- बिनाobservationएजेंट संदर्भ को याद करता है और पुराने विश्वासों पर काम करता है।
- बिनाreflectionएजेंट उच्चतम क्रम के विश्वासों का गठन नहीं कर सकता; बातचीत क्षैतिज रहती है।
- बिनाplanव्यवहार प्रतिक्रियाशील शोर बन जाता है; लक्ष्य विरघल जाते हैं।
मानव रेटिंग से विश्वसनीयता स्कोर तीनों में सबसे अधिक है; किसी भी को गिराकर मापने योग्य प्रतिगमन होता है।
वेलेंटाइन डे का उद्भव
एक एजेंट, इसाबेल रोड्रिगेज, को लक्ष्य के साथ बीज दिया गया है "14 फरवरी को शाम 5 बजे हॉब्स कैफे में वेलेंटाइन डे पार्टी आयोजित करना चाहता है।" अन्य 24 एजेंटों को ऐसा बीज नहीं मिलता है।
- इसाबेल की योजना में लोगों को आमंत्रित करना शामिल है।
- हर निमंत्रण एक पड़ोसी की स्मृति धारा में एक अवलोकन बन जाता है।
- उस पड़ोसी की प्रतिबिंब से विश्वास पैदा होता हैः "इसाबेल पार्टी कर रही है।"
- पड़ोस की योजना में "14 फरवरी को पार्टी में शामिल हों" शामिल है।
- पड़ोसियों को बताएं, आमंत्रण बिना किसी केंद्रीय समन्वय के फैलता है।
- 14 फरवरी को शाम 5 बजे, हॉब्स कैफे में कई एजेंट एकत्रित हुए।
यह तकनीकी अर्थ में उभरना हैः सिस्टम-स्तर का व्यवहार (एक पार्टी) एक केंद्रीय ऑर्केस्ट्रेटर के बिना स्थानीय बातचीत (दो पक्षीय निमंत्रण + व्यक्तिगत योजना) से उत्पन्न हुआ।
प्रलेखित विफलता मोड
पार्क व अन्य स्पष्ट रूप से दस्तावेजः
- Spatial norm errors.एजेंट बंद दुकानों में जाते हैं। एजेंट एक ही एकल व्यक्ति बाथरूम का उपयोग करने की कोशिश करते हैं। एजेंट खाने के लिए नहीं बनाए गए कमरों में खाते हैं। मॉडल केवल पर्यावरण से सामाजिक-भौतिक मानदंडों का अनुमान नहीं लगाता है।
- Memory overflow.गहन सिमुलेशन रन मेमोरी-रिकवरी लागत को बढ़ाने का कारण बनते हैं। व्यावहारिक उपायः आवधिक मेमोरी कॉम्पैक्शन (संक्षेप-और-संकेतन) और कम महत्व वाले प्रविष्टियों पर गिरावट।
- Reflection hallucination.प्रतिबिंब उन संबंधों का आविष्कार कर सकते हैं जो मेमोरी स्ट्रीम में मौजूद नहीं हैं। मिट्यागः प्रतिबिंब प्रमाणीकरण में स्रोत मेमोरी आईडी शामिल करें और पुनर्प्राप्ति समय पर सत्यापित करें।
ये उत्पादन से संबंधित विफलता मोड हैंः 2026 एजेंट सिमुलेशन उन्हें विरासत में देता है।
तीन घटक कार्यान्वयन नियम
- Memory is append-only.कभी भी मेमोरी प्रविष्टि को उत्परिवर्तन न करें। सुधार नए प्रविष्टियों हैं।
- Importance scores are cheap.LLM को कॉल करें और लेखन के समय महत्व 1-10 की रेटिंग दें। स्कोर को कैश करें।
- Retrieval is ranked, not filtered.संयुक्त स्कोर द्वारा शीर्ष-के; हार्ड फिल्टर का उपयोग न करें (जो संदर्भ खो देते हैं) ।
- Reflection runs periodically.ट्रिगर जब अप्रसंस्कृत यादों के महत्व का योग एक सीमा (जैसे 150) से अधिक हो।
- Plans are revisable.जब कोई नया अवलोकन किसी योजना के विपरीत हो, तो केवल प्रभावित खंड को पुनर्जीवित करें, न कि पूरी योजना को।
स्मोलविले के बाहर जनरेटिव एजेंट
2024-2026 के अनुवर्ती साहित्य में वास्तुकला का विस्तार किया गया हैः
- Multi-agent social simulation for policy / market research.स्मालविले जैसी आबादी सुविधाओं के जवाब में उपयोगकर्ता व्यवहार का अनुकरण करती है। ए / बी परीक्षणों से तेज; सटीकता पर सवाल है।
- NPC AI for games.स्मालविले एजेंटों के साथ आरपीजी स्क्रिप्टेड क्वेस्ट के बजाय उभरती कहानी लाइनें उत्पन्न करते हैं।
- Generative-agent evaluation benchmarks.कार्य सटीकता के बजाय, मेट्रिक लंबे समय तक व्यवहार की विश्वसनीयता + सुसंगतता बन जाती है।
वास्तुकला संदर्भ है। विस्तार प्रतिस्थापन घटक (मेमोरी के लिए वेक्टर भंडारण, पुनर्प्राप्ति-बढ़ती प्रतिबिंब, न्यूरोसिंबलिक योजना) लेकिन तीन भागों की संरचना को बनाए रखें।
बहु-एजेंट इंजीनियरिंग के लिए यह महत्वपूर्ण क्यों है
स्मालविले अवधारणा का प्रमाण है कि बहु-एजेंट उदय सस्ता है जब घटक सही हैं। वास्तुकला अब ओपन-सोर्स मॉडल पर दोहराया गया है (छोटे एलएलएम ने गंभीरता से विश्वसनीयता खो दी है, तेज नहीं) । किसी भी उत्पादन प्रणाली को जो आवश्यकता होती है emergent social behaviorइस आकार का उपयोग करता है. किसी भी प्रणाली की जरूरत हैtight task executionइस चरण में पहले से पर्यवेक्षक / भूमिकाओं / आदिम पैटर्न का उपयोग करता है।
इसे बनाओ
code/main.pyस्क्रिप्ट एजेंट नीतियों (कोई वास्तविक एलएलएम नहीं) के साथ stdlib पायथन में तीन घटकों को लागू करता है। डेमो में वेलेंटाइन पार्टी के उदय को लघु रूप में प्रस्तुत किया गया हैः
MemoryStreamहाल/महत्व/संदर्भता प्राप्ति के साथ केवल अनुलग्नक लॉग।reflect(stream)हाल ही में हुई महत्वपूर्ण यादों पर स्क्रिप्ट पर विचार।plan(agent_state)वर्तमान मान्यताओं के आधार पर दिन-स्तर और घंटे-स्तर की योजनाएं।- परिदृश्यः 5 एजेंट. एजेंट 1 "संध्या के 5 बजे फेंक पार्टी" के साथ शुरू होता है. सिम्युलेटेड टिक के माध्यम से, निमंत्रण फैलता है और एजेंटों को एक साथ आते हैं.
दौड़ें:
python3 code/main.pyअपेक्षित आउटपुटः टिक-टिक ट्रैक। अंतिम टिक तक, 5 एजेंटों में से कम से कम 3 अपनी योजना में पार्टी को दिखाते हैं, और वे पार्टी स्थान पर एकजुट होते हैं। एकल बीज ने बिना किसी ऑर्केस्ट्रेटर के समन्वयित आगमन का उत्पादन किया।
इसका प्रयोग करें
outputs/skill-simulation-designer.mdएक जनरेटिव एजेंट सिमुलेशन डिजाइन करता हैः एजेंटों की संख्या, मेमोरी स्कीम, प्रतिबिंबता क्रम, योजना क्षितिज और मूल्यांकन मीट्रिक।
इसे भेजें
उत्पादन सिमुलेशन के नियमः
- Memory is the database.एक वास्तविक स्टोर चुनें (वेक्टर डीबी, पोस्टग्रेस) पैमाने पर। स्मृति में stdlib प्रोटोटाइप के लिए है।
- Log the retrieval trace.प्रत्येक क्रिया के लिए, शीर्ष-के यादों को रिकॉर्ड करें जो इसे चलाया। यह आपकी डिबग क्षमता है।
- Budget per-agent tokens.प्रत्येक एजेंट की प्रति टिक प्राप्त + प्रतिबिंब + योजना O(k) LLM कॉल है। N एजेंट × T टिक × कॉल-प्रति टिक आपके बजट को छोटा कर सकते हैं।
- Compact memory periodically.कम महत्व वाले प्रविष्टियों का सारांश और कटौती करें। प्रतिधारण नीति एक डिजाइन निर्णय है, एक विवरण नहीं।
- Detect spatial / social norm violationsवास्तुकला उन्हें नहीं सीखती।
व्यायाम
- दौड़ें
code/main.pyपार्टी में 3+ एजेंटों के अभिसरण की पुष्टि करें एजेंटों को 10 तक बढ़ाएं क्या उदय अभी भी होता है? - प्रतिबिंब चरण को हटा दें। व्यवहार कैसा दिखता है? पार्क 2023 में अपवर्तन खोज का नक्शा।
- एक प्रतिस्पर्धी लक्ष्य प्रस्तुत करें ("क्लाउस 5 बजे एक शोध भाषण देना चाहता है") क्या एजेंट विभाजित हैं, या क्या एक लक्ष्य हावी है? क्या यह निर्धारित करता है?
- अंतरिक्ष की सीमाओं को जोड़ेंः हॉब्स कैफे में अधिकतम 4 एजेंट हैं। क्या सिमुलेशन हैंडल सुरुचिपूर्ण रूप से ओवरफ्लो करता है, या क्या यह "एकल व्यक्ति बाथरूम" विफलता पैटर्न से मिलता है?
- पार्क और अन्य पढ़ें (arXiv:2304.03442) अनुभाग 6 (उत्पादक व्यवहार प्रयोग) । अपने लघुचित्र में पुनरुत्पादित नहीं होने वाले एक व्यवहार की पहचान करें। वास्तुकला के किस घटक को आपको बढ़ाने की आवश्यकता होगी?
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| Memory stream | "The agent's diary" | Append-only log of observations, actions, reflections, plans. |
| Recency | "How new is the memory" | Exponential-decay score by age. |
| Importance | "How much does the agent care" | Self-rated 1-10 at write time. Cached. |
| Relevance | "How related to the current query" | Cosine similarity (embedding-based). |
| Reflection | "Higher-order belief" | Synthesis generated from recent memories, re-ingested as a new memory. |
| Plan | "Day/hour/action decomposition" | Top-down plan tree. Revisable when observations contradict. |
| Smallville | "Park 2023's sandbox" | 25-agent simulation that produced the Valentine's Day emergence. |
| Believability | "The quality metric" | Human-rater score for whether behavior seems like a plausible agent. |
आगे पढ़ना
- Park et al. — Generative Agents: Interactive Simulacra of Human Behavior संदर्भ वास्तुकला
- UIST '23 paper page प्रकाशन स्थल
- Smallville code release संदर्भ पायथन कार्यान्वयन
- Hayes-Roth 1985 — A Blackboard Architecture for Control संरचित स्मृति एजेंटों के लिए पूर्व कला
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.