एज इन्फरेंस एप्पल न्यूरल इंजन, क्वालकॉम हेक्सागोन, वेबजीपीयू/वेबएलएलएम, जेटसन
Type: Learn
Languages: Python (stdlib, toy bandwidth-bound decode simulator)
Prerequisites: Phase 17 · 04 (Serving Engine Internals), Phase 17 · 09 (Production Quantization)
Time: ~60 minutes
सीखने के लक्ष्य
- बताएं कि मोबाइल एलएलएम निष्कर्षण मेमोरी-बैंडविड्थ-बंद क्यों है और गणना माध्यमिक क्यों है।
- चार किनारे लक्ष्य (एप्पल एएनई, क्वालकॉम हेक्सागन, वेबजीपीयू/वेबएलएलएम, एनवीडिया जेटसन) को सूचीबद्ध करें और प्रत्येक को एक उपयोग मामले से मेल खाता है।
- 2026 वेबजीपीयू कवरेज अंतर (फायरफ़ॉक्स एंड्रॉइड पकड़) और सफारी आईओएस 26 लैंडिंग का नाम दें।
- प्रत्येक लक्ष्य के लिए एक क्वांटिज़ेशन प्रारूप चुनें (एएनई के लिए कोर एमएल INT4 + एफपी16, हेक्सागन के लिए क्यूएनएन INT8/INT4, ब्राउज़र के लिए वेबजीपीयू क्यू4, जेटसन थोर के लिए एनवीएफपी4) ।
समस्या
एक ग्राहक एक डिवाइस पर चैटबॉट चाहता हैः वॉयस-फर्स्ट, प्राइवेट-बाय डिफ़ॉल्ट, ऑफ़लाइन काम करता है। मैकबुक प्रो एम 3 मैक्स पर, लामा 3.1 8 बी क्यू 4 ~ 55 टोक / सेकंड पर चलता है। एक आईफोन 16 प्रो पर, एक ही मॉडल 3 टोक / सेकंड पर चलता है। स्नैपड्रैगन 8 जेन 3, 7 टोक / सेकंड के साथ एक मध्य-दायरा एंड्रॉइड पर। क्रोम एंड्रॉइड v121 + पर वेबजीपीयू के माध्यम से ब्राउज़र में, डिवाइस के आधार पर 4-8 टोक / सेकंड।
आउटपुट वैरिएंस पोर्टिंग समस्या नहीं है। यह बैंडविड्थ गैप गुना क्वांटिज़ेशन प्रारूप गुना है कि क्या NPU उपयोगकर्ता-स्थान से सुलभ है। 2026 में एज इन्फेरेंस चार अलग-अलग समाधानों के साथ चार अलग-अलग समस्याएं हैं।
अवधारणा
बैंडविड्थ वास्तविक छत है
डिकोड प्रत्येक टोकन के लिए वजन का पूरा सेट पढ़ता है। Q4 में एक 7B मॉडल 3.5 GB है। 50 GB / s पर 3.5 GB पढ़ना 70 ms लेता है। ~ 14 tok / s की सैद्धांतिक सीमा। 90 GB / s (उच्च अंत मोबाइल DRAM) पर छत ~ 25 tok / s तक जाती है। इस संख्या से नीचे कोई भी गणना की मात्रा मदद नहीं करती है।
3TB/s पर डेटा सेंटर HBM3 1.2ms में 3.5GB को समान साफ़ करता है 830 tok/s है। एक ही मॉडल, एक ही वजन। अलग-अलग मेमोरी उप-प्रणाली।
एप्पल न्यूरल इंजन (M4 / A18)
- 38 तक TOPS। एकीकृत मेमोरी (सीपीयू और एएनई एक ही पूल साझा करते हैं) कोई कॉपी ओवरहेड नहीं।
- कोर एमएल + के माध्यम से पहुँच
.mlmodelसंकलित मॉडल, या PyTorch के माध्यम से धातु प्रदर्शन छायांकन (MPS) के माध्यम से। - Llama.cpp धातु बैकेंड सीधे एएनई नहीं, एमपीएस का उपयोग करता है; मूल एएनई को कोर एमएल रूपांतरण की आवश्यकता होती है।
- 2026 में आईओएस ऐप के लिए सर्वश्रेष्ठ व्यावहारिक मार्गः INT4 वजन + FP16 सक्रियण के साथ कोर एमएल।
क्वालकॉम हेक्सागोन (स्न्यापड्रैगन एक्स एलिट / 8 जेन 4)
- 45 तक TOPS. सीपीयू और GPU के साथ एकीकृत SoC लेकिन अलग स्मृति डोमेन.
- QNN (क्वालकॉम न्यूरल नेटवर्क) SDK और AI हब PyTorch/ONNX से रूपांतरण प्रदान करते हैं।
- चैट टेम्पलेट्स, Llama 3.2, Phi-3 सभी एआई हब पर प्रथम श्रेणी के कलाकृतियों के रूप में जहाज.
इंटेल / एएमडी एनपीयू (लूनर लेक, राइज़ेन एआई 300)
- 40-50 TOPS. सॉफ्टवेयर Apple/Qualcomm से पीछे है; OpenVINO सुधार रहा है लेकिन आला।
- विंडोज एआरएम सह पायलट अनुप्रयोगों के लिए सबसे अच्छा; स्थानीय-पहले के लिए एएमडी / इंटेल डेस्कटॉप पर मूल।
वेबजीपीयू + वेबएलएम
- वेबजीपीयू कम्प्यूटिंग शेडर के माध्यम से ब्राउज़र में मॉडल चलाएं; कोई स्थापना नहीं।
- Llama 3.1 8B Q4 ~ 41 tok/s पर M3 Max लगभग 70-80% मूल के माध्यम से एक ही बैकेंड।
- 17.6k GitHub वेबएलएलएम पर सितारों; ओपनएआई संगत जेएस एपीआई; अपाचे 2.0।
- 2026 कवरेजः क्रोम एंड्रॉइड v121+, सफारी आईओएस 26 GA, फ़ायरफ़ॉक्स एंड्रॉइड अभी भी पकड़ रहा है। कुल मिलाकर ~ 70-75% मोबाइल कवरेज।
एनवीडीए जेटसन परिवार
- ओरिन नैनो सुपर (8 जीबी): ल्लामा 3.2 3 बी, फाइ-3 पर अच्छी टोक/सेक पर फिट।
- AGX Orin: gpt-oss-20b को vLLM के माध्यम से ~40 tok/s पर चलाता है।
- Thor / T4000 (JetPack 7.1): 2x AGX Orin प्रदर्शन, EAGLE-3 और NVFP4 समर्थित।
- TensorRT एज-एलएलएम (2026) EAGLE-3 अटकलों का डिकोडिंग, NVFP4 वजन, टुकड़े पूर्व भरने डेटा सेंटर अनुकूलन को किनारे पर पोर्ट करता है।
प्रति लक्ष्य को मात्राबद्ध करने का विकल्प
| Target | Format | Notes |
|---|---|---|
| Apple ANE | INT4 weights + FP16 activations | Core ML conversion path |
| Qualcomm Hexagon | QNN INT8 / INT4 | AI Hub converters |
| WebGPU / WebLLM | Q4 MLC (q4f16_1) | Use mlc_llm convert_weight + compiled .wasm; GGUF is not supported |
| Jetson Orin Nano | Q4 GGUF or TRT-LLM INT4 | Memory-bound |
| Jetson AGX / Thor | NVFP4 + FP8 KV | Edge-LLM path |
लम्बे संदर्भ की फंसी किनारे पर
Llama 3.1 का 128K संदर्भ एक डेटा सेंटर सुविधा है। 8 GB रैम वाले फोन पर, 32K टोकन के लिए 4 GB मॉडल + 2 GB KV कैश + OS ओवरहेड = OOM। एज तैनाती 4K-8K पर संदर्भ रखती है जब तक कि आक्रामक KV क्वांटिज़ेशन (Q4 KV) स्वीकार नहीं किया जाता है।
आवाज एक हत्यारा ऐप है
वॉयस एजेंट लटेंसी-संवेदनशील हैं (पहला टोकन <500 ms) । स्थानीय अनुमान नेटवर्क लटेंसी को पूरी तरह से समाप्त करता है। भाषण-से-पाठ (स्विपर टर्बो संस्करणों को किनारे पर चलाया जाता है) के साथ संयुक्त करें और किनारे अनुमान उत्पादन-गुणवत्ता वाली आवाज लूप बन जाता है।
संख्याओं को याद रखना चाहिए
- एप्पल एम 4 / ए 18 एएनई: 38 टॉप।
- क्वालकॉम हेक्सागन एसडी एक्स एलिट: 45 TOPS।
- WebLLM M3 Max: Llama 3.1 8B Q4 पर ~41 tok/s।
- AGX Orin: ~ 40 tok/s gpt-oss-20b पर vLLM के माध्यम से।
- डेटा सेंटर के किनारे बैंडविड्थ अंतरः 30-50x.
- वेबजीपीयू मोबाइल कवरेजः ~ 70-75% (फायरफ़ॉक्स एंड्रॉइड में देरी) ।
इसका प्रयोग करें
code/main.pyसीमा लक्ष्यों के पार बैंडविड्थ-बंद गणित से सैद्धांतिक डिकोड पारगमन सीमाओं की गणना करता है। यह उन अवलोकन बेंचमार्क और हाइलाइट्स की तुलना करता है जहां बैंडविड्थ, गणना नहीं, बोतल गला है।
इसे भेजें
यह सबक हमें फल देता हैoutputs/skill-edge-target-picker.md. प्लेटफॉर्म (iOS/Android/browser/Jetson), मॉडल और लटेंसी/मेमोरी बजट को देखते हुए, क्वांटिज़ेशन प्रारूप और रूपांतरण पाइपलाइन का चयन करता है।
व्यायाम
- दौड़ें
code/main.py. स्नैपड्रैगन 8 जेन 3 (~77 जीबी / सेकंड बैंडविड्थ) पर Q4 में 7 बी मॉडल के लिए, डिकोड की छत की गणना करें। 6-8 टोक / सेकंड की तुलना में देखा गया क्या रनटाइम कुशल है? - एंड्रॉइड पर वेबजीपीयू को क्रोम v121+ की आवश्यकता होती है। पुराने ब्राउज़रों के लिए एक बैकअप डिज़ाइन करें उसी ओपनएआई-संगत एपीआई के माध्यम से सर्वर-साइड।
- आपके आईओएस ऐप को 4K-संदर्भ स्ट्रीमिंग की आवश्यकता है। कौन सा मॉडल/फॉर्मेट संयोजन आपको iPhone 16 पर 4GB सक्रिय मेमोरी से कम रहने देता है?
- जेटसन AGX Orin 40 टोक / सेकंड पर जीपीटी-ऑस-20b चलाता है जेटसन नैनो केवल एक 3B फिट बैठता है. यदि आपके उत्पाद दोनों को लक्षित करता है, तो आप निष्कर्ष स्टैक को कैसे एकीकृत करते हैं?
- तर्क दें कि क्या "वेबएलएलएम 2026 में उत्पादन के लिए तैयार है।" कवरेज, प्रदर्शन और फ़ायरफ़ॉक्स एंड्रॉइड अंतर का उल्लेख करें।
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| ANE | "Apple neural engine" | On-device NPU in M-series and A-series; unified memory |
| Hexagon | "Qualcomm NPU" | Snapdragon NPU; QNN SDK for access |
| WebGPU | "browser GPU" | W3C-standardized browser GPU API; Chrome/Safari 2026 |
| WebLLM | "browser LLM runtime" | MLC-LLM project; Apache 2.0; OpenAI-compatible JS |
| Jetson | "NVIDIA edge" | Orin Nano / AGX / Thor / T4000 family |
| TRT Edge-LLM | "edge TensorRT" | 2026 edge port of TensorRT-LLM; EAGLE-3 + NVFP4 |
| Unified memory | "shared pool" | CPU and NPU see same RAM; no copy overhead |
| Bandwidth-bound | "memory limited" | Decode gated by bytes/sec reading weights |
| Core ML | "Apple conversion" | Apple framework for ANE-native models |
| QNN | "Qualcomm stack" | Qualcomm Neural Network SDK |
आगे पढ़ना
- On-Device LLMs State of the Union 2026 परिदृश्य और बेंचमार्क।
- NVIDIA Jetson Edge AI ओरिन / एजीएक्स / थोर।
- NVIDIA TensorRT Edge-LLM 2026 के लिए एज पोर्ट घोषणा।
- WebLLM (arXiv:2412.15803) डिजाइन और बेंचमार्क।
- Apple Core ML एक-देशी रूपांतरण।
- Qualcomm AI Hub हेक्सागोन के लिए पूर्व-परिवर्तित मॉडल।
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.