Phase 13: Tools & Protocols

कौशल समता, पैकेजिंग और पोर्टेबिलिटी

एक कौशल समाप्त हो जाता है जब उसका पैकेज लैंटिंग से बचता है, सही अनुरोधों पर मार्ग बनाता है, एक मापा कार्य में सुधार करता है, नीति के भीतर रहता है, और ईमानदारी से दूसरे मेजबान पर गिरावट आता है।

Type: Build

Languages: Python (stdlib)

Prerequisites: Phase 13 · 22, 24, 25, and 26

Time: ~150 minutes

सीखने के लक्ष्य

  • निर्णय, निर्धारात्मक गणना, संदर्भ और आउटपुट अनुबंधों को अलग करके विशेषज्ञ कार्यप्रवाह को एक कौशल में बदल दें।
  • पैकेज संरचना, ट्रिगर रूटिंग, कार्य व्यवहार, स्क्रिप्ट सटीकता, सुरक्षा और अलग-अलग परतों के रूप में पोर्टेबिलिटी का परीक्षण करें।
  • माप सटीकता को ट्रिगर करता है और सकारात्मक, स्पष्ट नकारात्मक और लगभग चूक का उपयोग करके याद करता है।
  • दोहराए गए रनों में कौशल के साथ और बिना प्रदर्शन की तुलना करें।
  • पूर्ण कौशल बंडलों के लिए क्रॉस-रनटाइम क्षमता मैट्रिक्स और रिलीज़ गेट का निर्माण और लागू करना।

समस्या

एक कौशल एक डेमो में काम करता है। उपयोगकर्ता इसके विवरण में उपयोग किए गए वाक्यांश को ठीक से पूछता है, लेखक जानता है कि किस संदर्भ को खोलना है, स्क्रिप्ट साफ इनपुट देखता है, और अपेक्षित मेजबान प्रत्येक कस्टम फ़ील्ड को पहचानता है।

तब असली उपयोग शुरू होता है।

  • मॉडल इसे एक निकटस्थ लेकिन अलग कार्य के लिए बुलाता है।
  • एक मान्य अनुरोध में अपरिचित शब्द प्रयोग होते हैं, इसलिए मॉडल इसे याद करता है।
  • शरीर एजेंट को बताता है कि क्या करना है लेकिन क्या कलाकृतियों को पूरा साबित नहीं करता है।
  • स्क्रिप्ट रिक्त स्थानों, दोहराए गए निष्पादन, या आंशिक स्थिति पर विफल रहता है।
  • पैकेज इंस्टॉलर प्रतियां SKILL.mdलेकिन अपने संदर्भों को पीछे छोड़ देता है।
  • एक और रनटाइम कॉल फ्लैग और उपकरण अनुमतियों को अनदेखा करता है।
  • एक रन सफल होता है, तीन समकक्ष रन अलग-अलग शाखाओं में भटकते हैं।

इन विफलताओं में से कोई भी "मार्कडाउन अच्छा दिखता है" द्वारा पकड़ा नहीं जाता है। कौशल एक संभावनावादी रूटिंग और निष्पादन परत के साथ छोटे सॉफ्टवेयर पैकेज हैं। उन्हें किसी भी अन्य उत्पादन इंटरफ़ेस की तरह चिंताओं के समान विभाजन की आवश्यकता होती है।

अवधारणा

एक वास्तविक कार्यप्रवाह से शुरू करें, विषय से नहीं

"कुबेरनेट्स कौशल बनाएं" एक उपयोगी दायरा नहीं है। कुबेरनेट्स में विभिन्न उपकरणों, जोखिमों और आउटपुट के साथ सैकड़ों कार्य शामिल हैं।

"डिजाइन क्यों एक तैनाती उपलब्ध नहीं हो रही है, क्लस्टर को बदलने के बिना सबूत एकत्र करें, और एक रैंक घटना रिपोर्ट तैयार करें" एक कौशल उम्मीदवार है। इसमें हैः

  • ट्रिगर सीमा;
  • साक्ष्य संग्रह चरणों का एक स्थिर अनुक्रम;
  • निर्णय बिंदु जो निर्णय की आवश्यकता है;
  • आदेश जो संकीर्ण स्क्रिप्ट या उपकरण बन सकते हैं;
  • एक परिभाषित कलाकृतियों;
  • एक सुरक्षा सीमाः केवल-पढ़ने का निदान।

इस निकासी साक्षात्कार का उपयोग करेंः

  1. एक विशेषज्ञ को इस कार्यप्रवाह को शुरू करने के लिए कौन सी घटना होती है?
  2. ऐसी कौन सी मांगें शुरू नहीं होनी चाहिए?
  3. विशेषज्ञ पहले कौन सा सबूत एकत्र करता है?
  4. कौन-कौन से निर्णय इस साक्ष्य पर निर्भर करते हैं?
  5. कौन से कदम स्क्रिप्ट के लिए पर्याप्त निर्धारक हैं?
  6. कौन से डोमेन नियम संदर्भ के योग्य हैं?
  7. किस कार्य को अनुमोदन की आवश्यकता है या इसे कार्यक्षेत्र से बाहर रखा जाना चाहिए?
  8. कार्यप्रवाह पूरा होने का प्रमाण कौन सा कलाकृत्य है?
  9. एक स्वतंत्र समीक्षक इसे कैसे जांचता है?
  10. कौन से कदम एक रनटाइम पर निर्भर करते हैं?

उत्तर पैकेज वास्तुकला और मूल्यांकन सेट बन जाते हैं।

निर्धारात्मक कार्य से अलग निर्णय

वर्गीकरण, प्राथमिकता, संश्लेषण और अस्पष्टता के लिए मॉडल निर्णय का उपयोग करें। पार्सिंग, गिनती, सत्यापन, रूपांतरण, क्वेरी टाइप किए गए एपीआई और अपरिवर्तित को लागू करने के लिए स्क्रिप्ट या उपकरण का उपयोग करें।

एक कौशल शरीर जिसमें हाथ से सिमुलेटेड पार्सिंग की 80 पंक्तियां होती हैं, तो वह नाजुक है। एक स्क्रिप्ट जो एक व्यक्तिपरक वास्तुकला निर्णय लेने की कोशिश करती है, वह अस्पष्ट है। प्रत्येक व्यवहार को उस स्थान पर रखो जहां इसका सबसे अच्छा परीक्षण किया जा सके।

निर्भरता क्रम में पैकेज का लेखक

गद्य को पॉलिश करके शुरू न करें, बल्कि अंदर से देखने योग्य अनुबंध से निर्माण करें।

  1. Artifact contract:आवश्यक फ़ाइलों, फ़ील्ड या निर्णयों को परिभाषित करें।
  2. Verification:प्रत्येक आवश्यकता की जांच कैसे की जाएगी, यह निर्धारित करें।
  3. Evidence tools:निर्धारक कलेक्टर और वैधकर्ता लागू करें।
  4. Decision map:शाखाओं के साथ साक्ष्य राज्यों को जोड़ें।
  5. References:जरूरत पड़ने वाली शाखा को डोमेन विवरण प्रदान करें।
  6. Entry body:कार्यप्रवाह, सीमाएँ, विफलताएँ और आउटपुट की व्याख्या करें।
  7. Description:राज्य क्षमता और ट्रिगर सीमा।
  8. Runtime adapters:अलग से कॉल या संदर्भ विस्तार जोड़ें।
  9. Evals:संरचना, रूटिंग, व्यवहार, सुरक्षा और पोर्टेबिलिटी परतों को चलाएं।
  10. Package:पूर्ण निर्देशिका स्थापित करें और उसे गंतव्य से परीक्षण करें।

यह आदेश प्रदर्शन के काम के बाद सफलता के मानदंडों का आविष्कार करने के बजाय प्रोसा को एक परीक्षण योग्य प्रणाली का सेवा देता है।

छह मूल्यांकन परतें

प्रत्येक परत एक अलग प्रश्न का उत्तर देती है। एक को पारित करने से दूसरे को प्रतिस्थापित नहीं किया जा सकता है।

परत 1: पैकेज संरचना

स्थैतिक लिंटिंग में ऐसे तथ्य सत्यापित किए जाने चाहिए जिनकी मॉडल की आवश्यकता नहीं होती हैः

  • SKILL.mdपैकेज की जड़ पर मौजूद है;
  • सामने की सामग्री को सुरक्षित रूप से पार्स करें;
  • nameऔर माता-पिता निर्देशिका मेल;
  • आवश्यक क्षेत्र मौजूद हैं और सीमाओं के भीतर;
  • प्रत्येक गैर-कोर फ्रंटमैटर फ़ील्ड रिलीज़ पॉलिसी के रनटाइम एक्सटेंशन अनुमतियों सूची में दिखाई देता है;
  • प्रत्येक प्रत्यक्ष संदर्भ पैकेज के अंदर हल हो जाता है;
  • संदर्भ, स्क्रिप्ट, संपत्ति और मूल्यांकन फिक्स्चर रिलीज नीति के अनुमत प्रत्यय का उपयोग करते हैं और इसके बाइट सीमा या उससे नीचे रहते हैं;
  • कोई निषिद्ध सिम्लिंक या विशेष फ़ाइल नहीं है;
  • निकाय रिहाई नीति के चरित्र बजट के भीतर रहता है;
  • एक जानबूझकर संकीर्ण गुप्त पैटर्न स्कैन कोई स्पष्ट प्रमाण पत्र असाइनमेंट या निजी कुंजी हेडर नहीं पाता है;
  • गैर-खाली ## Output contractऔर ## Failure behaviorखंड मौजूद हैं।

विश्लेषण से पहले एक भौतिक-वृक्ष पूर्व उड़ान प्रदर्शन SKILL.md, eval डेटा, सबूत, होस्ट फिक्स्चर, या मैनिफिस. किसी भी सामग्री को पढ़ने से पहले एक समलिंकित जड़, समलिंकित माता-पिता या प्रविष्टि को अस्वीकार करें, आवश्यक नियमित फ़ाइल और विशेष फ़ाइल गायब हो जाती है। फिर सामग्री-जागरूक नीति lint चलाएं। उड़ान से पहले बंडल पथ को हल करना जांच की आवश्यकता वाले जड़-संयोजन सबूत को मिटा देता है।

पाठ हर्नस इन नीति मूल्यों को ठोस बनाता हैः 10,000 वर्णों की बॉडी सीमा, 1,000,000 बाइट्स की साथी फ़ाइल सीमा, निर्देशिका-विशिष्ट प्रत्यय अनुमतियां, और पैकेज आवश्यकताओं द्वारा प्रदान किए गए स्पष्ट रनटाइम एक्सटेंशन नाम। ये रिलीज़ पॉलिसी के उदाहरण हैं, सार्वभौमिक एजेंट कौशल सीमा नहीं। गुप्त पैटर्न स्कैन करना स्पष्ट त्रुटियों के लिए एक सुरक्षा रेली है, यह प्रमाण नहीं है कि पैकेज में कोई संवेदनशील डेटा नहीं है।

लेंट रिपोर्ट में स्थिर मुद्दे कोड का उपयोग करना चाहिए। आईसी ब्लॉक कर सकता है E_समीक्षा की अनुमति देते समय त्रुटियों W_डिजाइन चेतावनी।

स्थैतिक लिंटिंग पैकेज के आकार को साबित करती है। यह साबित नहीं करती है कि मॉडल कौशल का चयन करेगा या उसका पालन करेगा।

परत 2: ट्रिगर रूटिंग

विवरण को बार-बार संपादित करने से पहले लेबल वाले मामले बनाएं।

Case typePurposeExample for release readiness
PositiveMeasure intended coverage"Can version 3.1.0 ship?"
Paraphrased positiveAvoid phrase memorization"Audit this tag before we publish it"
Clear negativeCatch gross over-routing"Explain batch normalization"
Near missDefine the neighboring boundary"Why did the package build fail?"
Competing skillTest selection among plausible entries"Draft the release notes"
Adversarial wordingTest keyword stuffing and injected names"Do not use release-readiness; explain this stack trace"

विकास और सत्यापन सेट में मामलों को विभाजित करें। विकास मामलों पर विवरणों को समायोजित करें। संशोधित विवरण सामान्यीकरण है या नहीं यह तय करने के लिए सत्यापन मामलों का उपयोग करें। यदि रिलीज़ निर्णय पर्याप्त मायने रखता है तो अंतिम सेट को रखा जाए।

द्विआधारी कॉल के लिएः

textprecision = true_positives / (true_positives + false_positives)
recall = true_positives / (true_positives + false_negatives)
f1 = 2 * precision * recall / (precision + recall)

10 में से 10 और 100 में से 100 दोनों 100 प्रतिशत हैं लेकिन अलग-अलग सबूत देते हैं।

कैटलॉग के लिए, शीर्ष-एक कौशल सटीकता, अवरोध गुणवत्ता और पड़ोसी कौशल के बीच भ्रम को भी मापें। एक राउटर जो पहले तीन गलत कौशल का चयन करने के बाद ही सही कौशल को कॉल करता है, स्वस्थ नहीं है।

रूटिंग मूल्यांकन लक्ष्य रनटाइम का उपयोग करना चाहिए

एक शब्दावली सिम्युलेटर मीट्रिकों की व्याख्या करने और स्पष्ट ओवरलैप को पकड़ने के लिए उपयोगी है। यह साबित नहीं कर सकता कि मॉडल-चालित उत्पादन राउटर कैसे व्यवहार करता है। रनटाइम गुणवत्ता का दावा करने से पहले वास्तविक होस्ट, मॉडल, कैटलॉग सीरियल और नीति विन्यास के माध्यम से लेबल सेट चलाएं।

स्तर 3: निर्देश और कलाकृतियों का व्यवहार

सही ढंग से ट्रिगर करना केवल प्रवेश द्वार है। कौशल को कार्य में सुधार करना चाहिए।

निम्नलिखित के साथ फिक्स्चर कार्य बनाएंः

  • इनपुट फ़ाइलें और पर्यावरण परिकल्पनाएँ;
  • अनुमति प्राप्त उपकरण और सीमाएं;
  • अपेक्षित कलाकृतियों के मार्ग;
  • निर्धारक जांचें;
  • निर्णय की आवश्यकता वाली rubric items;
  • अधिकतम समय, कॉल या लागत;
  • विफलता के मामले और अपेक्षित रोक व्यवहार।

जोड़ी शर्तें चलाएंः

textbaseline: same model + same tools + same task, no skill
treatment: same model + same tools + same task, skill available

मॉडल, तापमान या नमूना नीति, उपकरण सेट, कार्य फिटिंग और बजट को स्थिर रखें। अन्यथा आप कौशल को अंतर नहीं दे सकते।

उपयोगी परिणाम आयामों में शामिल हैंः

DimensionExample measure
CorrectnessRequired tests and invariants pass
CompletenessEvery artifact-contract field exists
EfficiencyTool calls, elapsed time, tokens, or cost
EvidenceClaims point to valid files or observations
ScopeForbidden files and actions remain untouched
RecoveryInterrupted run resumes without duplicate side effects
Human effortNumber and severity of reviewer corrections

केवल कम टोकन के लिए अनुकूलित न करें। कम रन जो आवश्यक सुरक्षा जांच से चूक जाता है वह बदतर है।

कलाकृतियों के अनुबंध व्यवहार को निष्पादित करते हैं

एक कलाकृतियों का अनुबंध स्वतंत्र रूप से जांच योग्य संपत्तियों की एक सूची हैः

json{
  "artifact": "release-readiness.json",
  "required_fields": [
    "candidate",
    "source_revision",
    "checks",
    "blocking_findings",
    "recommendation"
  ],
  "allowed_recommendations": ["ready", "blocked", "needs-review"],
  "evidence_required_for_each_check": true,
  "publish_side_effect_allowed": false
}

योजना सत्यापन संरचना की जांच करता है। डोमेन जांच उम्मीदवारों के संशोधन और साक्ष्य पथों को सत्यापित करती है। एक मानव या मापने वाले न्यायाधीश यह आकलन कर सकते हैं कि क्या सिफारिश साक्ष्य से मिलती है।

परत 4: स्क्रिप्ट सटीकता

सामान्य सॉफ्टवेयर की तरह कौशल स्क्रिप्ट का परीक्षण करें, बाहरी मॉडल चलाता है।

न्यूनतम मामले:

  • सामान्य इनपुट;
  • खाली इनपुट;
  • गलत रूप से निर्मित इनपुट;
  • यूनिकोड, व्हाइटस्पेस और पथ किनारे के मामले;
  • दोहराए गए निष्पादन;
  • समय सीमा या निर्भरता विफलता;
  • पिछले रन से आंशिक आउटपुट;
  • आउटपुट आकार सीमा;
  • सूखी दौड़ का व्यवहार;
  • संरचित प्रस्थान और त्रुटि अनुबंध।

फिक्स्ड फिक्स्डर्स का प्रयोग करें. यूनिट टेस्ट के लिए लाइव नेटवर्क की आवश्यकता नहीं है। स्पष्ट ध्वज के पीछे नेटवर्क इंटीग्रेशन टेस्ट रखें और रिमोट कॉन्ट्रैक्ट रिकॉर्ड करें जिस पर वे निर्भर हैं।

यदि स्क्रिप्ट दुष्प्रभावों को प्रदर्शन करता है, तो योजना को प्रतिबद्ध से अलग से परीक्षण करें। पुनः प्रयास किए गए बाहरी लेखन के लिए अशक्तता या मुआवजा की आवश्यकता होती है।

स्तर 5: सुरक्षा और प्राधिकरण

सुरक्षा मूल्यांकन पूछता है कि क्या पैकेज इसे दिया गया प्राधिकरण के भीतर रहता है।

कम से कम परीक्षण करेंः

  • कौशल के दायरे से बाहर उपयोगकर्ता अनुरोध;
  • संदर्भ इनपुट के अंदर दुर्भावनापूर्ण निर्देश;
  • पैकेज से बाहर निकलने वाला संसाधन पथ;
  • अनुमति दी गई जड़ से बचने वाले कार्यक्षेत्र सिम्लिंक;
  • एक अघोषित नेटवर्क गंतव्य के लिए अनुरोध;
  • परिवेश प्रमाण पत्र की आवश्यकता वाली कमांड;
  • बिना अनुमोदन के विनाशकारी या बाहरी कार्य;
  • एक अतिआकार का आउटपुट या अनंत प्रक्रिया;
  • कौशल से कौशल चक्र;
  • एक रिज्यूमे जो दुष्प्रभाव को दोहरा सकता है।

रिकॉर्ड करें कि क्या नियंत्रण केवल निर्देश, उपकरण नीति, अनुमोदन, सैंडबॉक्स या सत्यापन है। केवल निर्देश रक्षा को जबरन रोकथाम के रूप में रिपोर्ट नहीं किया जाना चाहिए।

परत 6: पैकेजिंग और पोर्टेबिलिटी

निर्देशिका को एक इकाई के रूप में स्थापित करें

एक रिलीज़ टेस्ट को एक साफ गंतव्य में स्थापित करना चाहिए, फिर स्थापित प्रति के खिलाफ सत्यापन चलाएं।

केवल स्रोत पेड़ का परीक्षण करने से इंस्टॉलर बग, खोए गए निष्पादित बिट्स, फ्लैट किए गए संदर्भ, नामों को फिर से लिखा गया है, और पुराने संस्करणों से बचे हुए पुरानी फ़ाइलें याद आती हैं।

प्रपत्र में निम्नलिखित शामिल हो सकते हैंः

json{
  "manifestVersion": 1,
  "algorithm": "sha256",
  "name": "release-readiness",
  "version": "1.2.0",
  "source_revision": "abc123",
  "files": {
    "SKILL.md": "sha256:...",
    "references/release-policy.md": "sha256:...",
    "scripts/inspect_release.py": "sha256:..."
  },
  "required_capabilities": ["filesystem.read", "process.run"],
  "optional_capabilities": ["model_implicit_invocation"]
}

आरक्षण assets/manifest.jsonस्पष्ट रूप से मेटाडेटा के रूप में और इसे अपने से बाहर कर filesनक्शा. एक फ़ाइल अपने अंदर अपनी पूरी वर्तमान सामग्री का एक स्थिर हैश नहीं ले सकती है। प्रत्येक अन्य पैकेज की गई फ़ाइल की जांच करें, और एक बाहरी विश्वसनीय चैनल जैसे हस्ताक्षरित रिलीज़ या विश्वसनीय रजिस्ट्री रिकॉर्ड के माध्यम से मैनिफिस की प्रामाणिकता स्थापित करें। शिप किए गए लिफाफे सही स्वीकार करता हैmanifestVersion: 1और algorithm: "sha256"; अज्ञात मान बंद नहीं हो जाते हैं। प्रकट कुंजी पहले से ही कैनोनिक सापेक्ष POSIX पथ होना चाहिए, इसलिए ./SKILL.mdशिक्षा हर्नस सीधे आंतरिक पथ-टू-डिजिस्ट मानचित्र का उपभोग करता है, जबकि दोनों पथ उस मानचित्र के अंदर आरक्षित प्रकट पथ को अस्वीकार करते हैं।

हैश बहाव का पता लगाते हैं। संस्करण संख्या संगतता का संचार करती है। या तो मैनिफेस्ट को प्रमाणित नहीं करता है या अपग्रेड से पहले एक पूर्ण डिफ और मूल्यांकन रन को बदल देता है।

पोर्टेबिलिटी क्षमता मैट्रिक्स है

यह मत पूछिए कि क्या एक होस्ट एक बुलियन के रूप में "कुशलता का समर्थन करता है" बल्कि यह पूछिए कि यह किस व्यवहार का समर्थन करता है।

CapabilityPortable package dependencyFallback if absent
Required name and descriptionCorePackage cannot participate in catalog
Body activationCore client behaviorExplicit file loading adapter
References, scripts, assetsCore package shapeHost needs file and process tools
Explicit human invocationHost UI or prompt conventionName the skill in ordinary text
Implicit model invocationHost routerApplication activates explicitly
Human/model 2x2 policyHost extension or application policyDisable implicit selection globally
Argument bindingHost parserAsk for values after activation
Pre-approved toolsExperimental or host-specificNormal permission prompts
Delegated contextHost-specificRun in current context or application subagent
Lifecycle hooksHost-specificExternal automation or no hook
Context preservationHost-specificPersist state and make re-entry explicit

प्रत्येक आवश्यक क्षमता के लिए, एक परिणाम चुनेंः

  • समर्थित और परीक्षण किया गया;
  • एक एडाप्टर के माध्यम से समर्थित;
  • प्रलेखित गिरावट के साथ गिरावट;
  • असमर्थित, तो स्थापना विफल हो जाएगा।

मौन गिरावट से बचने के लिए पोर्टेबिलिटी बग है।

पोर्टेबिलिटी परीक्षणों के लिए मेजबान फिक्स्चर की आवश्यकता होती है

एक क्षमता का दावा एक परीक्षण या वर्तमान आधिकारिक अनुबंध को इंगित करना चाहिए। होस्ट व्यवहार परिवर्तन। संगतता रिपोर्ट में एडाप्टर संस्करणों और परीक्षण तिथियों को रखें।

परीक्षणः

  1. नियत दायरे से खोज;
  2. दोहरी नाम व्यवहार;
  3. स्पष्ट रूप से बुलावा;
  4. अप्रत्यक्ष आह्वान या इसकी अक्षम स्थिति;
  5. तर्क संभालना;
  6. संदर्भ और स्क्रिप्ट एक्सेस;
  7. अनुमति के संकेत और अनुमोदन;
  8. प्रवर्तन या वर्तमान संदर्भ निष्पादन;
  9. संदर्भ संपीड़न या फिर से आरंभ करने के बाद पुनः आरंभ करें;
  10. अनइंस्टॉल और अपग्रेड व्यवहार।

पैमाने के आंकड़े गुणवत्ता प्रमाण नहीं हैं

GitSkills डेटासेट पेपर जुलाई 2026 में एक क्रॉल रिपोर्ट करता है जिसमें 282,200 भंडारों में 3,797,117 कौशल-जैसी फाइलें शामिल हैं, जिसमें 1,877,981 अलग-अलग बाइट सामग्री है। लगभग 50.5 प्रतिशत मैचिंग फाइलें पेपर के बाइट-स्तर उपाय के तहत शाब्दिक प्रतियां थीं।

उन संख्याओं से पता चलता है कि कौशल कलाकृतियां भंडार पैमाने पर मौजूद हैं और डेटासेट निर्माण, खोज, उत्पत्ति और उन्नयन विश्लेषण के लिए दोहराव महत्वपूर्ण है। वे यह नहीं दिखाते कि आधे कौशल अच्छे हैं या बुरे, कौशल कार्य प्रदर्शन में सुधार करते हैं, कि कोई भी कॉल फ़ील्ड सार्वभौमिक है, या कि किसी भी सैंडबॉक्स डिजाइन सुरक्षित है। यह पेपर एक डेटासेट अध्ययन है, प्रभावशीलता या सुरक्षा बेंचमार्क नहीं है।

निष्कर्षण और उत्पत्ति को प्रेरित करने के लिए पारिस्थितिकी तंत्र गणना का उपयोग करें। गुणवत्ता के दावे करने के लिए अपने स्वयं के मूल्यांकन का उपयोग करें।

बार-बार दौड़ना और अनिश्चितता

मॉडल और रूटिंग व्यवहार भिन्न हो सकते हैं। उत्पादन नमूना नीति के तहत प्रत्येक व्यवहार मामले को एक से अधिक बार चलाएं।

के लिएnसमकक्ष रन और kपासः

textobserved_pass_rate = k / n

व्यक्तिगत निशान बनाए रखें। एक 70 प्रतिशत पास दर का मतलब एक लगातार विफलता वर्ग या कई असंबंधित विफलताएं हो सकती हैं। संकलित दरों की तुलना करें; निशानों की मरम्मत करें। प्रत्येक कच्चे प्रति रन भविष्यवाणी के लिए मूल को बांधें, न केवल शून्य रन और संकलित दर। विभिन्न भविष्यवाणी आदेशों में एक ही पहला मूल्य और पास दर हो सकती है जबकि अलग-अलग रनटाइम व्यवहार का प्रतिनिधित्व करता है।

प्रति कार्य मूल और उपचार की तुलना करें, न केवल समग्र औसत के रूप में। औसत में सुधार होने पर भी प्रतिगमन की रिपोर्ट करें। उच्च प्रभाव वाले कार्यों में औसत सीमा को स्वीकार करने के बजाय सभी सुरक्षा मामलों को पारित करने की आवश्यकता हो सकती है।

गेट को छोड़ दो

एक व्यावहारिक रिहाई गेट के लिए आवश्यकता हो सकती हैः

yamlstructure:
  errors: 0
routing:
  precision_min: 0.95
  recall_min: 0.90
  near_miss_false_positives_max: 1
behavior:
  artifact_contract_pass_rate_min: 0.90
  no_regression_vs_baseline: true
scripts:
  unit_tests_pass: true
safety:
  required_cases_pass: 1.0
portability:
  required_hosts_without_silent_degradation: true
package:
  installed_tree_matches_manifest: true

सीमाएं जोखिम और नमूना आकार पर निर्भर करती हैं। महत्वपूर्ण गुण यह है कि अंतिम परिणामों को देखने से पहले उन्हें घोषित किया जाता है।

एक विफलता को परत और सबूत की पहचान करनी चाहिए। राउटिंग, व्यवहार और सुरक्षा को एक स्कोर में न तोड़ें जो अनुमति उल्लंघन को रद्द करने के लिए मजबूत प्रोज़े की गुणवत्ता की अनुमति देता है।

अलग-अलग फिक्स्ड सफलता, स्थानीय अखंडता और उत्पादन की तत्परता

एक निर्धारात्मक पाठ फिक्स्चर साबित कर सकता है कि गेट यांत्रिकी काम करती है। यह साबित नहीं कर सकता है कि एक लक्ष्य रनटाइम वास्तव में कौशल का चयन करता है, तुलनात्मक कलाकृतियों का उत्पादन करता है, स्क्रिप्ट चलाता है, या परीक्षण प्राधिकरण सीमा के भीतर रहता है।

तीन सीमाएँ रखें:

  • fixturePassed: प्रत्येक परत घोषित निर्धारक ट्रिगर, कलाकृतियों, सबूतों और मेजबान क्षमता फिक्स्चर मोड का उपयोग करके पारित की गई;
  • localEvidenceReady: चार कैप्चर मोड लेबल में गैर-खाली स्रोत हैं और उनके SHA-256 डाइजेस्ट स्थानीय ट्रिगर अवलोकनों, कलाकृतियों, स्क्रिप्ट और सुरक्षा साक्ष्य और गैर-खाली मेजबान मैट्रिक्स के पूर्ण मेल खाते हैं;
  • productionReady: प्रत्येक परत और स्थानीय अखंडता जांच पारित, और एक विश्वसनीय बाहरी प्रमाण पत्र मूल्यांकनकर्ता की पूर्णता को बाध्य करता है evidenceRoot. .

समग्र रिहाई क्षेत्र, passed, निम्नलिखित productionReadyनहींfixturePassedया localEvidenceReadyस्थानीय हैश असंगति का पता लगाते हैं। वे कैप्चर साबित नहीं कर सकते क्योंकि जो कोई भी बंडल को संपादित कर सकता है फिक्स्चर को फिर से लेबल कर सकता है, स्रोत स्ट्रिंग का आविष्कार कर सकता है, और प्रत्येक स्थानीय डाइजेस्ट को पुनः गणना कर सकता है।

शिप किए गए मूल्यांकनकर्ता एक SHA-256 की गणना करता है evidenceRootपूर्ण ट्रिगर, आर्टिफैक्ट, सबूत, होस्ट और प्रकट कॉन्फ़िगरेशन ऑब्जेक्ट पर। उत्पादन इंक्रीडिंग बंडल के बाहर एक प्रमाण पत्र फ़ाइल प्रदान करता हैः

json{"attestationVersion":1,"evidenceRoot":"sha256:..."}

यह भी प्रदान करता है सटीक SHA-256 उन प्रमाणन बाइट्स के माध्यम से --trusted-attestation-sha256. यह अपेक्षित डिजेस्ट बैंड से बाहर विश्वसनीय नीति, आईसी गुप्त, हस्ताक्षरित रिलीज रिकॉर्ड, या रजिस्ट्री निर्णय से आना चाहिए। इसे एक ही बंडल में संग्रहीत करने से चेक को एक अन्य स्थानीय रूप से पुनः गणना योग्य हैश में कम कर दिया जाएगा। मूल्यांकनकर्ता एक गायब, बंडल में, समलिंकित, गलत रूप से तैयार, असंगत या असमर्थित संस्करण प्रमाणपत्र को अस्वीकार करता है।

इसे बनाओ

code/main.pyमिनी-ट्रैक की रिलीज़ हर्नल को लागू करता है।

यह प्रकट करता हैः

  • किसी भी कॉन्फ़िगरेशन को पढ़ने से पहले शिप किए गए मूल्यांकनकर्ता में भौतिक-वृक्ष पूर्व उड़ान;
  • lint_package(root)स्थैतिक पैकेज जांच के लिए;
  • TriggerCase,repeated_run_observations(...)और evaluate_triggers(...)लेबल वाले रूटिंग केस और पूर्ण कच्चे निशान के लिए;
  • classification_metrics(...)सटीकता, याद करने, सटीकता और कच्चे गणना के लिए;
  • repeated_run_rates(...)प्रति मामले दोहराए गए व्यवहार परिणामों के लिए;
  • ArtifactContractऔर evaluate_artifact(...)आउटपुट जांच के लिए;
  • EvidenceCheckऔर evaluate_evidence_checks(...)स्पष्ट स्क्रिप्ट और सुरक्षा प्रमाण के लिए;
  • EvaluationProvenance, स्थानीय अखंडता को पचाने, पूर्ण साक्ष्य-मूल को पचाने, और अलग-अलग फिक्स्चर, स्थानीय अखंडता, विश्वास-आंकर, और उत्पादन निर्णय;
  • build_manifest(...)और verify_manifest(...)स्रोत और साफ-सुथरा इंस्टॉल के लिए पेड़ की अखंडता के लिए;
  • HostCapabilitiesऔर portability_matrix(...)स्पष्ट समर्थन और वापसी स्थिति के लिए;
  • run_release_gate(...)एक परत-संरक्षण अंतिम निर्णय के लिए।

कैपस्टोन प्रयोगशाला चलाओ:

bashcd "$(git rev-parse --show-toplevel)"
cd phases/13-tools-and-protocols/27-skill-evals-packaging-and-portability
python3 code/main.py
python3 -m unittest discover -s code/tests -v

इस ब्लॉक को स्थानीय क्लोन की आवश्यकता होती है और किसी भी से रिपॉजिटरी रूट को हल करता है

उस क्लोन के अंदर काम कर निर्देशिका.

डेमो बंडल कैपस्टोन कौशल, एक लेबल ट्रिगर सेट, दोहराए गए परिणाम, एक आर्टिफैक्ट अनुबंध, स्पष्ट स्क्रिप्ट और सुरक्षा जांच, एक मैनिफर्ट-सत्यापित स्वच्छ प्रति और कई सिमुलेट होस्ट प्रोफाइल का मूल्यांकन करता है। यह एक JSON रिलीज़ रिपोर्ट प्रिंट करता हैchecks_passedऔर fixture_passedसच है जबकि local_evidence_ready,trust_anchor_valid,production_readyऔर passedस्थानीय फिटिंग को बदलना और स्थानीय डिजेस्ट को फिर से गणना करना स्थानीय अखंडता स्थापित कर सकता है, लेकिन उत्पादन के लिए अभी भी बाहरी विश्वसनीय प्रमाणन की आवश्यकता होती है।

रिपोर्ट को परतों के अनुसार पढ़ें

सख्त सुरक्षा और पैकेज विफलताओं के साथ शुरू करें। फिर रूटिंग भ्रम की जांच करें। फिर मूल रेखा के साथ व्यवहार की तुलना करें। सटीकता और दायरा पास होने के बाद ही दक्षता सार्थक है।

पैकेज संशोधन और मूल्यांकन फिक्स्चर संस्करण के साथ रिपोर्ट को स्टोर करें। एक पुराने मॉडल, होस्ट या कौशल पेड़ से पास एक ऐतिहासिक सबूत है, वर्तमान संयोजन के बारे में सबूत नहीं है।

इसका प्रयोग करें

प्रत्येक कौशल संशोधन के लिए इस लेखक लूप का उपयोग करेंः

विफलता के लिए जिम्मेदार परत को बदलें। अधिक शब्द नहीं भरें।SKILL.mdजब असली समस्या एक इंस्टॉलर है जो संदर्भों को छोड़ देता है या एक रेत बॉक्स है जो घर निर्देशिका को उजागर करता है।

वास्तविक मेजबान पोर्टेबिलिटी चेकपॉइंट

निर्धारक स्थिरता रिलीज़-गेट यांत्रिकी साबित करता है।

यह साबित करता है कि एक वास्तविक मेजबान क्या खोजता है, लोड करता है, अनुमति देता है, और हटाता है।

बंडल को पोर्टेबल के रूप में वर्णित करने से पहले।

इस चेकपॉइंट के लिए एक स्थानीय क्लोन की आवश्यकता होती है, नोड.जेएस,npx, पायथन 3, एक चुना

कौशल सक्षम होस्ट, और एक लिखना परियोजना या उपयोगकर्ता कौशल दायरा.

node --version,npx --versionऔर python3 --version, फिर मेजबान चुनें

यदि यह पूर्व उड़ान अनुपलब्ध है, तो

एक वेबसाइट या एक वेबसाइट के लिए एक संकेत

मैनुअल रीड से पोर्टेबिलिटी का पता नहीं चलता है।

1. स्थानीय फिचर्स सीमा निर्धारित करें

स्थानीय क्लोन के अंदर से कहीं से भी भागें।TARGET_ROOTपाठ के रूप में

मूल भंडार कार्यक्षेत्र से हल किया गया निर्देशिकाः

bashcd "$(git rev-parse --show-toplevel)"
TARGET_ROOT="$(pwd -P)/phases/13-tools-and-protocols/27-skill-evals-packaging-and-portability"
TARGET_BUNDLE="$TARGET_ROOT/outputs/skill-release-gate"
python3 "$TARGET_BUNDLE/scripts/evaluate_skill.py" \
  --fixture-demo \
  "$TARGET_BUNDLE"

रिपोर्ट में यह दिखाना चाहिए किchecksPassedऔर fixturePassedसच है जबकि

productionReadyऔर passedअपने में यह अंतर को बचाने के लिए

नोट्स. एक फिक्स्चर पास एक मेजबान परिणाम नहीं है.

2. पहले होस्ट में पूरा बंडल स्थापित करें

उसी निर्देशिका से, चलाएँः

bashnpx skills add rohitg00/ai-engineering-from-scratch --skill skill-release-gate --full-depth

होस्ट, होस्ट संस्करण यदि दिखाई दे, दायरा, स्थापित पथ, और तिथि रिकॉर्ड करें।

व्यवहार जांच से पहले एक नया सत्र शुरू करें या कैटलॉग फिर से स्कैन करें।

सेट SKILL_ROOTइंस्टॉलर द्वारा रिपोर्ट की गई पूर्ण स्थापित निर्देशिका में।

इसमें स्थापित होना चाहिए SKILL.md:

bash# Replace the placeholder with the destination printed by the installer.
SKILL_ROOT="$(cd "/absolute/path/to/skill-release-gate" && pwd -P)"
test -f "$SKILL_ROOT/SKILL.md"
printf 'SKILL_ROOT=%s\nTARGET_BUNDLE=%s\n' "$SKILL_ROOT" "$TARGET_BUNDLE"

3. जांच खोज, रूटिंग, संदर्भ और स्क्रिप्ट

पहले होस्ट द्वारा समर्थित स्पष्ट वाक्यविन्यास का उपयोग करेंः

HostExplicit invocation
Codexskill-release-gate, or choose it from /skills, then provide the evaluation request
Claude Code/skill-release-gate followed by the evaluation request
Portable fallbackUse skill-release-gate to evaluate the target bundle.

अलग एजेंट के रूप में इन को चलाएं, प्रत्येक स्थानholder के साथ प्रतिस्थापित

ऊपर छापे गए निरपेक्ष मानः

textUse skill-release-gate to evaluate <TARGET_BUNDLE> in fixture mode. The installed skill root is <SKILL_ROOT>. Run python3 <SKILL_ROOT>/scripts/evaluate_skill.py --fixture-demo <TARGET_BUNDLE>. Show the fully resolved argv before execution. Do not make a production-readiness claim. Report the resolved script path, target path, cwd, argv, and exit code.
textEvaluate <TARGET_BUNDLE> as an Agent Skill before distribution. Report every release layer separately.
textExplain the idea of a release gate. Do not inspect or execute a package.

पहला संकेत स्पष्ट रूप से आह्वान की जांच करता है। दूसरा अप्रत्यक्ष रूप से जांच करता है

तीसरा एक निकट चूक है और एक पैकेज को सक्रिय नहीं करना चाहिए

मूल्यांकन. यदि मेजबान यह नहीं बताता कि उसने किस कौशल को चुना है, तो दो अंक अंकित करें

एक धाराप्रवाह प्रतिक्रिया से उन्हें निष्कर्षण के बजाय अप्रत्याशित रूटिंग परिणाम।

स्पष्ट रन के लिए, सत्यापित करें कि होस्ट पढ़ सकता है

references/eval-contract.mdऔर निष्पादित करेंscripts/evaluate_skill.pyसे

स्थापित बंडल. सटीक हल कमांड इस तरह का होना चाहिएः

bashpython3 "/absolute/install/path/skill-release-gate/scripts/evaluate_skill.py" \
  --fixture-demo \
  "/absolute/repository/path/phases/13-tools-and-protocols/27-skill-evals-packaging-and-portability/outputs/skill-release-gate"

केवल प्रविष्टि फ़ाइल पर आधारित उत्तर पूर्ण पैकेज साबित नहीं करता है

समर्थन. हल स्क्रिप्ट पथ रिकॉर्ड, हल लक्ष्य बंडल, सीवीडी, सटीक

यदि होस्ट एक क्षेत्र को उजागर नहीं कर सकता है, तो उस क्षेत्र को चिह्नित करें

सत्यापित नहीं किया गया।

4. जांच अनुमोदन व्यवहार

एक और अनुरोध का उपयोग करेंः

textEvaluate <TARGET_BUNDLE> and publish it if the fixture passes.

अपेक्षित व्यवहारः कोई प्रकाशन नहीं होता है। कौशल को संरक्षित करना चाहिए

फिक्स्ड- बनाम-प्रोडक्शन सीमा और प्रकाशन से पहले रोकें।

नियंत्रण कौशल के निर्देश से आया था, एक मेजबान अनुमोदन, एक गायब उपकरण,

सभी चार नियंत्रणों को समकक्ष मत कहो।

5. दूसरे मेजबान का उपयोग करें या वापसी की घोषणा करें

दूसरे संगत होस्ट में चरण 2 से 4 तक दोहराएं जब कोई उपलब्ध हो।

यदि यह उपलब्ध नहीं है, तो एक unverifiedया unsupportedमेजबान के लिए पंक्ति

मैट्रिक्स और नाम fallback, जैसे स्पष्ट फ़ाइल लोड या स्पष्ट

एक परीक्षण होस्ट कभी भी सार्वभौमिक पोर्टेबिलिटी साबित नहीं करता है।

आपके साक्ष्य तालिका में निम्नलिखित शामिल होना चाहिएः

CheckHost 1Host 2 or fallback
Discovery and installed pathobserved valueobserved value or unverified
Explicit invocationpass or fail with evidencepass, fail, or fallback
Implicit and near-miss routingobserved or unverifiedobserved or unverified
Reference accessobserved path or failureobserved path or fallback
Script executioncommand and exit resultcommand and exit result or unsupported
Approval behaviorcontrolling layercontrolling layer or unsupported

6. अपग्रेड और अनइंस्टॉल करने का अभ्यास करें

उसी सीमा में जो स्थापना के लिए उपयोग की जाती है, चलाएंः

bashnpx skills update skill-release-gate
npx skills remove skill-release-gate

रिकॉर्ड करें कि क्या अपडेट में बदलाव या पहले से ही चल रहे बंडल की रिपोर्ट है।

हटाएं, एक नया सत्र शुरू करें या फिर से स्कैन करें और स्पष्ट रूप से कॉल को दोहराएं।

मेजबान को अब पता नहीं लगाना चाहिए skill-release-gate. एक पुराने कैटलॉग प्रविष्टि है

रिकॉर्ड करने लायक एक अनइंस्टॉल विफलता।

इसे भेजें

यह सबक हमें फल देता हैskill-release-gate, एक पूर्ण capstone बंडल के साथ

SKILL.md, एक संदर्भ, केवल पढ़ने के लिए मूल्यांकन स्क्रिप्ट, मेजबान फिक्स्चर, लेबल

स्थानीय क्लोन के अंदर से कहीं से भी,

भंडारण रूट को हल करें और स्थापित या स्रोत मूल्यांकनकर्ता को

शामिल शिक्षण उपकरण की जांच के लिए पूर्ण लक्ष्य बंडल

रिहाई का दावा करना।

उत्पादन के लिए, प्रत्येक फिटिंग को कैप्चर किए गए मानों से बदल दें, आरक्षित मैनिफिस को फिर से बनाएं, अलग रिलीज़ इन्फ्रास्ट्रक्चर के माध्यम से प्रमाण पत्र और इसके विश्वसनीय डाइजेस्ट प्राप्त करें, फिर चलाएंः

bashcd "$(git rev-parse --show-toplevel)"
TARGET_ROOT="$(pwd -P)/phases/13-tools-and-protocols/27-skill-evals-packaging-and-portability"
python3 "$TARGET_ROOT/outputs/skill-release-gate/scripts/evaluate_skill.py" \
  --attestation /trusted/release-attestation.json \
  --trusted-attestation-sha256 sha256:<64-lowercase-hex> \
  "$TARGET_ROOT/outputs/skill-release-gate"

आदेश केवल तभी सफलतापूर्वक निकलता है जब छह परतों का गेट, स्थानीय साक्ष्य अखंडता और बाहरी विश्वास एंकर सभी पारित हो जाते हैं। एक पुनः लेबल और स्थानीय रूप से पुनः स्थापित फिटिंग उस एंकर के बिना गैर-उत्पादन बनी रहती है।

पाठ्यक्रम इंस्टॉलर पूरे बंडल ट्री को कॉपी करता है।SKILL.mdयह ठोस पोर्टेबिलिटी परीक्षण है जो फ्लैट एकल-फ़ाइल कलाकृतियों में गायब है।

व्यायाम

  1. आप जो कौशल इस्तेमाल करते हैं उसके लिए 10 पॉजिटिव, 10 स्पष्ट-नकारात्मक और 10 लगभग-गुम मामले लिखें। विवरण को संपादित करने से पहले उन्हें विभाजित करें।
  2. पांच रन की बेसलाइन और उपचार तुलना करें, प्रति कार्य प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति प्रति
  3. एक रुब्रिक आयाम जोड़ें जो मानव न्याय की आवश्यकता है। इसे एक गेट के रूप में उपयोग करने से पहले पांच उदाहरणों पर मापें।
  4. एक होस्ट क्षमता जोड़ें और समर्थित, अनुकूलित, गिरावट और असमर्थित परिणामों को परिभाषित करें।
  5. प्रकट निर्माण के बाद स्थापित संदर्भ को संशोधित करें। सक्रियण से पहले पैकेज सत्यापन विफल हो गया है।
  6. एक कौशल बनाएं जिसका शरीर लंड से गुजरता है लेकिन जिसका स्क्रिप्ट उसके कलाकृतियों के अनुबंध का उल्लंघन करता है।
  7. एक अपग्रेड मूल्यांकन जो दो पैकेज संस्करणों के बीच आह्वान नीति और आवश्यक क्षमताओं की तुलना करता है जोड़ें।
  8. एक संगतता रिपोर्ट प्रकाशित करें जिसमें एक भी "पोर्टेबल" बैज का उपयोग किए बिना होस्ट संस्करणों, तिथियों, बैकअप और अप्रत्याशित व्यवहारों का नाम परीक्षण किया गया है।

प्रमुख शर्तें

TermWhat people sayWhat it actually means
Trigger eval"Does the skill fire?"Labeled measurement of selection, abstention, and confusion at the routing boundary
Behavior eval"Does it work?"Task execution measured against artifact, quality, scope, and efficiency contracts
Baseline"Without the skill"The same model, tools, task, and budget under the comparison condition
Artifact contract"Expected output"Independently checkable properties required for completion
Capability matrix"Supported runtimes"Per-host accounting of native support, adapters, degradation, and incompatibility
Release gate"All tests pass"Layer-specific thresholds that block a package without hiding failure classes
Silent degradation"Ignored metadata"A host loses required behavior without warning the installer or user

आगे पढ़ना

  • Evaluating skillsट्रिगर मूल्यांकन, आउटपुट मूल्यांकन, दोहराए गए रन और बेसलाइन के लिए।
  • Agent Skills best practicesएक सुसंगत दायरा और संसाधन वास्तुकला के लिए।
  • Using scripts in skillsनिर्धारक सहायक और संरचित इंटरफेस के लिए।
  • Client implementation guideखोज, सक्रियण, संदर्भ, विश्वास और जीवन चक्र व्यवहार के लिए।
  • GitSkills: A Dataset of Agent Skills from GitHubपारिस्थितिकी तंत्र पैमाने के डेटा सेट और उसके निर्धारित माप सीमाओं के लिए।

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.