Phase 17: Infrastructure & Production

एज इन्फरेंस एप्पल न्यूरल इंजन, क्वालकॉम हेक्सागोन, वेबजीपीयू/वेबएलएलएम, जेटसन

कोर किनारे की बाधा मेमोरी बैंडविड्थ है, गणना नहीं। मोबाइल DRAM 50-90 GB/s पर बैठता है; डेटा सेंटर HBM3 2-3 TB/s 30-50x अंतर को साफ करता है। डिकोड मेमोरी-बंद है इसलिए अंतर निर्णायक है। 2026 में, परिदृश्य चार भागों में विभाजित हो जाएगा। एप्पल एम 4 / ए 18 न्यूरल इंजन 38 TOPS के साथ एकीकृत मेमोरी (कोई सीपीयू एनपीयू प्रतिलिपि नहीं) पर पहुंचता है। क्वालकॉम स्नैपड्रैगन एक्स एलिट / 8 जेन 4 हेक्सागन 45 TOPS को हिट करता है। WebGPU + WebLLM M3 मैक्स पर ~ 41 tok/s पर Llama 3.1 8B (Q4) चलाता है (लगभग 70-80% मूल); 17.6k GitHub सितारे, OpenAI संगत एपीआई, ~70-75% मोबाइल कवरेज। NVIDIA जेटसन ओरिन नैनो सुपर (8GB) Llama 3.2 3B / Phi-3 के साथ फिट बैठता है; AGX ओरिन ~ 40 टोक / सेकंड पर vLLM के माध्यम से gpt-oss-20b चलाता है; जेटसन T4000 (जेटपैक 7.1) 2x AGX ओरिन है। TensorRT Edge-LLM EAGLE-3, NVFP4, CHUNKED प्रीफिल को सिस 2026 में बोश, थंडरसॉफ्ट, मीडियाटेक द्वारा दिखाया गया है।

Type: Learn

Languages: Python (stdlib, toy bandwidth-bound decode simulator)

Prerequisites: Phase 17 · 04 (Serving Engine Internals), Phase 17 · 09 (Production Quantization)

Time: ~60 minutes

सीखने के लक्ष्य

  • बताएं कि मोबाइल एलएलएम निष्कर्षण मेमोरी-बैंडविड्थ-बंद क्यों है और गणना माध्यमिक क्यों है।
  • चार किनारे लक्ष्य (एप्पल एएनई, क्वालकॉम हेक्सागन, वेबजीपीयू/वेबएलएलएम, एनवीडिया जेटसन) को सूचीबद्ध करें और प्रत्येक को एक उपयोग मामले से मेल खाता है।
  • 2026 वेबजीपीयू कवरेज अंतर (फायरफ़ॉक्स एंड्रॉइड पकड़) और सफारी आईओएस 26 लैंडिंग का नाम दें।
  • प्रत्येक लक्ष्य के लिए एक क्वांटिज़ेशन प्रारूप चुनें (एएनई के लिए कोर एमएल INT4 + एफपी16, हेक्सागन के लिए क्यूएनएन INT8/INT4, ब्राउज़र के लिए वेबजीपीयू क्यू4, जेटसन थोर के लिए एनवीएफपी4) ।

समस्या

एक ग्राहक एक डिवाइस पर चैटबॉट चाहता हैः वॉयस-फर्स्ट, प्राइवेट-बाय डिफ़ॉल्ट, ऑफ़लाइन काम करता है। मैकबुक प्रो एम 3 मैक्स पर, लामा 3.1 8 बी क्यू 4 ~ 55 टोक / सेकंड पर चलता है। एक आईफोन 16 प्रो पर, एक ही मॉडल 3 टोक / सेकंड पर चलता है। स्नैपड्रैगन 8 जेन 3, 7 टोक / सेकंड के साथ एक मध्य-दायरा एंड्रॉइड पर। क्रोम एंड्रॉइड v121 + पर वेबजीपीयू के माध्यम से ब्राउज़र में, डिवाइस के आधार पर 4-8 टोक / सेकंड।

आउटपुट वैरिएंस पोर्टिंग समस्या नहीं है। यह बैंडविड्थ गैप गुना क्वांटिज़ेशन प्रारूप गुना है कि क्या NPU उपयोगकर्ता-स्थान से सुलभ है। 2026 में एज इन्फेरेंस चार अलग-अलग समाधानों के साथ चार अलग-अलग समस्याएं हैं।

अवधारणा

बैंडविड्थ वास्तविक छत है

डिकोड प्रत्येक टोकन के लिए वजन का पूरा सेट पढ़ता है। Q4 में एक 7B मॉडल 3.5 GB है। 50 GB / s पर 3.5 GB पढ़ना 70 ms लेता है। ~ 14 tok / s की सैद्धांतिक सीमा। 90 GB / s (उच्च अंत मोबाइल DRAM) पर छत ~ 25 tok / s तक जाती है। इस संख्या से नीचे कोई भी गणना की मात्रा मदद नहीं करती है।

3TB/s पर डेटा सेंटर HBM3 1.2ms में 3.5GB को समान साफ़ करता है 830 tok/s है। एक ही मॉडल, एक ही वजन। अलग-अलग मेमोरी उप-प्रणाली।

एप्पल न्यूरल इंजन (M4 / A18)

  • 38 तक TOPS। एकीकृत मेमोरी (सीपीयू और एएनई एक ही पूल साझा करते हैं) कोई कॉपी ओवरहेड नहीं।
  • कोर एमएल + के माध्यम से पहुँच.mlmodelसंकलित मॉडल, या PyTorch के माध्यम से धातु प्रदर्शन छायांकन (MPS) के माध्यम से।
  • Llama.cpp धातु बैकेंड सीधे एएनई नहीं, एमपीएस का उपयोग करता है; मूल एएनई को कोर एमएल रूपांतरण की आवश्यकता होती है।
  • 2026 में आईओएस ऐप के लिए सर्वश्रेष्ठ व्यावहारिक मार्गः INT4 वजन + FP16 सक्रियण के साथ कोर एमएल।

क्वालकॉम हेक्सागोन (स्न्यापड्रैगन एक्स एलिट / 8 जेन 4)

  • 45 तक TOPS. सीपीयू और GPU के साथ एकीकृत SoC लेकिन अलग स्मृति डोमेन.
  • QNN (क्वालकॉम न्यूरल नेटवर्क) SDK और AI हब PyTorch/ONNX से रूपांतरण प्रदान करते हैं।
  • चैट टेम्पलेट्स, Llama 3.2, Phi-3 सभी एआई हब पर प्रथम श्रेणी के कलाकृतियों के रूप में जहाज.

इंटेल / एएमडी एनपीयू (लूनर लेक, राइज़ेन एआई 300)

  • 40-50 TOPS. सॉफ्टवेयर Apple/Qualcomm से पीछे है; OpenVINO सुधार रहा है लेकिन आला।
  • विंडोज एआरएम सह पायलट अनुप्रयोगों के लिए सबसे अच्छा; स्थानीय-पहले के लिए एएमडी / इंटेल डेस्कटॉप पर मूल।

वेबजीपीयू + वेबएलएम

  • वेबजीपीयू कम्प्यूटिंग शेडर के माध्यम से ब्राउज़र में मॉडल चलाएं; कोई स्थापना नहीं।
  • Llama 3.1 8B Q4 ~ 41 tok/s पर M3 Max लगभग 70-80% मूल के माध्यम से एक ही बैकेंड।
  • 17.6k GitHub वेबएलएलएम पर सितारों; ओपनएआई संगत जेएस एपीआई; अपाचे 2.0।
  • 2026 कवरेजः क्रोम एंड्रॉइड v121+, सफारी आईओएस 26 GA, फ़ायरफ़ॉक्स एंड्रॉइड अभी भी पकड़ रहा है। कुल मिलाकर ~ 70-75% मोबाइल कवरेज।

एनवीडीए जेटसन परिवार

  • ओरिन नैनो सुपर (8 जीबी): ल्लामा 3.2 3 बी, फाइ-3 पर अच्छी टोक/सेक पर फिट।
  • AGX Orin: gpt-oss-20b को vLLM के माध्यम से ~40 tok/s पर चलाता है।
  • Thor / T4000 (JetPack 7.1): 2x AGX Orin प्रदर्शन, EAGLE-3 और NVFP4 समर्थित।
  • TensorRT एज-एलएलएम (2026) EAGLE-3 अटकलों का डिकोडिंग, NVFP4 वजन, टुकड़े पूर्व भरने डेटा सेंटर अनुकूलन को किनारे पर पोर्ट करता है।

प्रति लक्ष्य को मात्राबद्ध करने का विकल्प

TargetFormatNotes
Apple ANEINT4 weights + FP16 activationsCore ML conversion path
Qualcomm HexagonQNN INT8 / INT4AI Hub converters
WebGPU / WebLLMQ4 MLC (q4f16_1)Use mlc_llm convert_weight + compiled .wasm; GGUF is not supported
Jetson Orin NanoQ4 GGUF or TRT-LLM INT4Memory-bound
Jetson AGX / ThorNVFP4 + FP8 KVEdge-LLM path

लम्बे संदर्भ की फंसी किनारे पर

Llama 3.1 का 128K संदर्भ एक डेटा सेंटर सुविधा है। 8 GB रैम वाले फोन पर, 32K टोकन के लिए 4 GB मॉडल + 2 GB KV कैश + OS ओवरहेड = OOM। एज तैनाती 4K-8K पर संदर्भ रखती है जब तक कि आक्रामक KV क्वांटिज़ेशन (Q4 KV) स्वीकार नहीं किया जाता है।

आवाज एक हत्यारा ऐप है

वॉयस एजेंट लटेंसी-संवेदनशील हैं (पहला टोकन <500 ms) । स्थानीय अनुमान नेटवर्क लटेंसी को पूरी तरह से समाप्त करता है। भाषण-से-पाठ (स्विपर टर्बो संस्करणों को किनारे पर चलाया जाता है) के साथ संयुक्त करें और किनारे अनुमान उत्पादन-गुणवत्ता वाली आवाज लूप बन जाता है।

संख्याओं को याद रखना चाहिए

  • एप्पल एम 4 / ए 18 एएनई: 38 टॉप।
  • क्वालकॉम हेक्सागन एसडी एक्स एलिट: 45 TOPS।
  • WebLLM M3 Max: Llama 3.1 8B Q4 पर ~41 tok/s।
  • AGX Orin: ~ 40 tok/s gpt-oss-20b पर vLLM के माध्यम से।
  • डेटा सेंटर के किनारे बैंडविड्थ अंतरः 30-50x.
  • वेबजीपीयू मोबाइल कवरेजः ~ 70-75% (फायरफ़ॉक्स एंड्रॉइड में देरी) ।

इसका प्रयोग करें

code/main.pyसीमा लक्ष्यों के पार बैंडविड्थ-बंद गणित से सैद्धांतिक डिकोड पारगमन सीमाओं की गणना करता है। यह उन अवलोकन बेंचमार्क और हाइलाइट्स की तुलना करता है जहां बैंडविड्थ, गणना नहीं, बोतल गला है।

इसे भेजें

यह सबक हमें फल देता हैoutputs/skill-edge-target-picker.md. प्लेटफॉर्म (iOS/Android/browser/Jetson), मॉडल और लटेंसी/मेमोरी बजट को देखते हुए, क्वांटिज़ेशन प्रारूप और रूपांतरण पाइपलाइन का चयन करता है।

व्यायाम

  1. दौड़ेंcode/main.py. स्नैपड्रैगन 8 जेन 3 (~77 जीबी / सेकंड बैंडविड्थ) पर Q4 में 7 बी मॉडल के लिए, डिकोड की छत की गणना करें। 6-8 टोक / सेकंड की तुलना में देखा गया क्या रनटाइम कुशल है?
  2. एंड्रॉइड पर वेबजीपीयू को क्रोम v121+ की आवश्यकता होती है। पुराने ब्राउज़रों के लिए एक बैकअप डिज़ाइन करें उसी ओपनएआई-संगत एपीआई के माध्यम से सर्वर-साइड।
  3. आपके आईओएस ऐप को 4K-संदर्भ स्ट्रीमिंग की आवश्यकता है। कौन सा मॉडल/फॉर्मेट संयोजन आपको iPhone 16 पर 4GB सक्रिय मेमोरी से कम रहने देता है?
  4. जेटसन AGX Orin 40 टोक / सेकंड पर जीपीटी-ऑस-20b चलाता है जेटसन नैनो केवल एक 3B फिट बैठता है. यदि आपके उत्पाद दोनों को लक्षित करता है, तो आप निष्कर्ष स्टैक को कैसे एकीकृत करते हैं?
  5. तर्क दें कि क्या "वेबएलएलएम 2026 में उत्पादन के लिए तैयार है।" कवरेज, प्रदर्शन और फ़ायरफ़ॉक्स एंड्रॉइड अंतर का उल्लेख करें।

प्रमुख शर्तें

TermWhat people sayWhat it actually means
ANE"Apple neural engine"On-device NPU in M-series and A-series; unified memory
Hexagon"Qualcomm NPU"Snapdragon NPU; QNN SDK for access
WebGPU"browser GPU"W3C-standardized browser GPU API; Chrome/Safari 2026
WebLLM"browser LLM runtime"MLC-LLM project; Apache 2.0; OpenAI-compatible JS
Jetson"NVIDIA edge"Orin Nano / AGX / Thor / T4000 family
TRT Edge-LLM"edge TensorRT"2026 edge port of TensorRT-LLM; EAGLE-3 + NVFP4
Unified memory"shared pool"CPU and NPU see same RAM; no copy overhead
Bandwidth-bound"memory limited"Decode gated by bytes/sec reading weights
Core ML"Apple conversion"Apple framework for ANE-native models
QNN"Qualcomm stack"Qualcomm Neural Network SDK

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.