کارت های مدل، سیستم و مجموعه داده
Type: Build
Languages: Python (stdlib, model-card + datasheet + system-card generator)
Prerequisites: Phase 18 · 18 (safety frameworks), Phase 18 · 24 (regulatory)
Time: ~60 minutes
اهداف یادگیری
- کارت مدل اصلی Mitchell et al. 2019 و ورق داده Gebru et al. 2018 را توصیف کنید.
- طبقه بندی تلسکوپی/پیرسکوپ/مایکروسکوپ کارت داده ها را شرح دهید.
- کارت های سیستم و پوشش کامل آنها را شرح دهید.
- سه پیشرفت سال 2024 تا 2025 را بیان کنید (تولید خودکار، گواهینامه های قابل تأیید، گزارشات پایداری).
مشکل
چارچوب های نظارتی (درسی 24) و سیاست های ایمنی آزمایشگاه (درسی 18) هر دو نیاز به اسناد دارند. فرمت های اسناد از مدل خاص (کاردهای مدل) به مجموعه داده خاص (صفحات داده) به سیستم خاص (کاردهای سیستم) تکامل یافته است. هر کدام از آنها به دامنه های مختلف شفافیت پرداختند. کار اتوماسیون و تأیید قابل تأیید از سال های 2024 تا 2025 به مشکل طولانی مدت پذیرش پرداختند.
مفهوم
کارت های مدل (Mitchell و همکاران 2019)
بخش ها:
- جزئیات مدل
- استفاده ای که قصدش را داشت.
- عوامل (فاکتورهای دموگرافی یا محیطی مربوط به ارزیابی)
- متریک
- داده های ارزیابی
- اطلاعات آموزش
- تجزیه و تحلیل های کمی (به لحاظ عوامل تجزیه و تحلیل شده)
- ملاحظات اخلاقی
- گاو ها و توصیه ها
مشکل پذیرش: Oreamuno و همکارانش در سال 2023 بررسی کارت های مدل Hugging Face تنها 0.3 درصد از نظر های اخلاقی را نشان می دهند.
ورق های داده برای مجموعه داده ها (Gebru et al. 2018)
مقایسه برقی با ورق داده بخش:
- انگیزه (چرا مجموعه داده ها ایجاد شد).
- ترکیب (چیزی که در آن است)
- فرآیند جمع آوری (چگونه جمع آوری شد).
- برچسب گذاری (اگر قابل اطلاق باشد)
- استفاده (مقصد، ممنوع، خطرات)
- توزیع
- نگهداري
منتشر شده در CACM 2021. ورق داده ها اسناد پیشرو است؛ کارت مدل بستگی به دقت ورق داده دارد.
کارت های داده (Pushkarna et al., Google 2022)
جزئیات مدلل و لایه ای. سه سطح زوم:
- Telescopic.خلاصه ی سطح بالا برای غیر متخصصین
- Periscopic.دیدگاه عمومی سطح متوسط برای تمرین کنندگان ML
- Microscopic.اسناد دقیق در سطح ویژگی برای حسابرسان.
چارچوب بندی موضوعی: خوانندگان مختلف اطلاعات متفاوتی را از یک سند استخراج می کنند.
کارت های سیستم
دامنه: سیستم هوش مصنوعی از انت به انت شامل مدل + ستک ایمنی + زمینه استفاده. بخش ها معمولا شامل:
- قابلیت های امنیتی
- محافظت از تزریق فوری.
- تشخیص اکسلتراسیون داده ها
- هماهنگی با ارزش های انسانی اعلام شده
- واکنش به حادثه
کار شفافیت در سطح سیستم Sidhpurwala 2024 و Meta. "بلوپرنت های اعتماد" (arXiv: 2509.20394) سیستم کارت را به عنوان یک مکمل طبقه ی تعین به مدل کارت ها رسمی می کند.
پیشرفت های سال 2024 تا 2025
- CardGen (Liu et al. 2024).تولید خودکار کارت های مدل از طریق LLM؛ گزارشات عینیتی بالاتر از بسیاری از کارت های انسانی در زمینه های استاندارد میچل 2019 است.
- Download correlation (Liang et al. 2024).کارت های مدل مفصل با نرخ دانلود تا 29٪ بالاتر در HF فشار پذیرش در حال حاضر به بازار هدایت شده است، نه تنها به رعایت.
- Laminator (Duddu et al. 2024).گواهینامه های قابل تأیید از طریق TEE سخت افزاری / امضا رمزنگاری اجازه می دهد تا کارت مدل یک اثبات ادعا را داشته باشد، نه فقط یک ادعا.
- Sustainability (Jouneaux et al. July 2025).اضافه کردن برای کربن، آب و پاورپوینت انرژی محاسباتی؛ استاندارد های جدید ISO.
- Regulatory cards.قانون هوش مصنوعی اتحادیه اروپا (درسی 24) فصل شفافیت کد عمل GPAI به عنوان یک آرتیفاکت مطابق با قوانین می گوید که کارت های مدل را باید استفاده کنند.
جایی که این در مرحله 18 قرار داره
درس 24-25 لایه های نظارتی و CVE است. درس 26 لایه اسناد است. درس 27 مدیریت اطلاعات آموزشی است که جریان بالا ورق داده است. درس 28 اکوسیستم تحقیقاتی است که ارزیابی های مرجع شده در کارت ها را تولید می کند.
ازش استفاده کن
code/main.pyیک کارت مدل، یک ورق داده و یک کارت سیستم برای یک کارگردانی اسباب بازی تولید می کند. هر کدام از آنها از ساختار بخش های قنونیک پیروی می کند. شما می توانید فرمت را بررسی کنید و سه دامنه را مقایسه کنید.
-باده
این درس به ما کمک می کندoutputs/skill-card-audit.md. با داشتن یک کارت مدل، ورق داده یا کارت سیستم، بررسی پوشش بخش، تجزیه عددی و وجود گواهی های قابل تأیید را انجام می دهد.
تمرینات
- فرار کن
code/main.pyکارت های تولید شده را بررسی کنید. بخش های ضعیف را شناسایی کنید (تنها برای نگهدارندگان مکان) و مشخص کنید که چه شواهد می تواند آنها را تقویت کند.
- گسترش کارت مدل با تجزیه و تحلیل کمی در دو گروه جمعیتی (درسی 20)
- Oreamuno et al. 2023 در مورد نرخ پذیرش 0.3٪ مطالعه کنید. یک تغییر ساختاری در مشخصات کارت مدل را پیشنهاد کنید که پذیرش ملاحظات اخلاقی را افزایش دهد.
- Laminator (Duddu و همکاران 2024) از TEEs برای گواهینامه های قابل تأیید استفاده می کند. یک میدان مدل کارت طراحی کنید که گواهینامه رمزنگاری نتایج ارزیابی را در خود داشته باشد و نقش تأیید کننده را توصیف کند.
- یک کارت سیستم (کارتی سیستم نه کارت مدل) را برای یکی از پروژه های گذشته یا یک پیاده سازی فرضی خود بنویسید. بخش با بالاترین ارزش را برای حسابداران شخص ثالث شناسایی کنید.
اصطلاحات کلیدی
| Term | What people say | What it actually means |
|---|---|---|
| Model Card | "the Mitchell card" | Mitchell et al. 2019 standard documentation for ML models |
| Datasheet | "the Gebru datasheet" | Gebru et al. 2018 standard documentation for datasets |
| Data Card | "the Pushkarna card" | Google 2022 modular layered data documentation |
| System Card | "the deployment card" | End-to-end AI system documentation including safety stack |
| Boundary object | "different readers, one doc" | Data Cards framing: same document serves diverse audiences |
| Verifiable attestation | "the Laminator attestation" | Cryptographic or TEE proof attached to a documentation claim |
| Sustainability field | "carbon / water footprint" | Emerging 2025 addition for environmental accounting |
خواندن بیشتر
- Mitchell et al. — Model Cards for Model Reporting (arXiv:1810.03993, FAT* 2019) کارت مدل کنونی
- Gebru et al. — Datasheets for Datasets (CACM 2021, arXiv:1803.09010) ورق داده
- Pushkarna et al. — Data Cards (Google 2022) اسناد داده های لایه ای
- Sidhpurwala et al. — Blueprints of Trust (arXiv:2509.20394) رسمیت رسانی کارت سیستم
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.