Mac Studio M4 को अनबॉक्स करना और अपना पहला LLM चलाना
ताज़ा M4 Max, Ollama इंस्टॉल, स्थानीय स्तर पर Llama 3, और एक निजी RAG पाइपलाइन पर एक दोपहर में मैकटॉप से वास्तविक रीडिंग
लंबे समय तक गहरे गोता लगाने के लिए एक छोटा, स्किम-पठनीय साथी। संपूर्ण पूर्वाभ्यास के लिए, यहां जाएं लंबा लेख.
डेस्क पर रखा बॉक्स अब एक एआई उपकरण है
मैंने M4 Max चिप, 128 GB एकीकृत मेमोरी, 40 GPU कोर, 16 CPU कोर और 2 टीबी SSD के साथ एक नया Mac Studio अनबॉक्स किया। एक दोपहर के भीतर यह Ollama के माध्यम से स्थानीय रूप से Llama 3.1 8B चला रहा था, मेरे स्वयं के दस्तावेज़ एम्बेड कर रहा था, और एक छोटी RAG पाइपलाइन के माध्यम से उन पर सवालों के जवाब दे रहा था। कोई क्लाउड बिल नहीं, कोई API कुंजी नहीं, कोई डेटा कमरे से बाहर नहीं जा रहा।
यह ब्लॉग लघु संस्करण है. पूरा लेख उसी वर्कफ़्लो पर गहराई से चलता है।
60 सेकंड में अनबॉक्सिंग
YouTube पर अनबॉक्सिंग शॉर्ट देखें: https://youtube.com/shorts/HUlUoHNsyNM
क्लासिक ऐप्पल अनबॉक्सिंग: न्यूनतम कार्डबोर्ड, एक ढाले हुए अवकाश में मशीन, एक पावर केबल। Mac Studio का घेरा लगभग 7.7 इंच वर्गाकार और घना है; जैसे ही आप इसे उठाते हैं आपको इसकी निर्माण गुणवत्ता का एहसास होता है। सेटअप वास्तव में तेज़ है - Apple ID, भाषा, FileVault, हो गया।
पहला बूट - मैकटॉप से वास्तविक रीडिंग
/img/mac-studio-mactop-firstboot.png बाद में इसे स्वैप करने के लिए।उपरोक्त संख्याएं ही एकमात्र ठोस आंकड़े हैं जिनका मैं हवाला दूंगा। वे जमीनी सच्चाई से हैं mactop मेरी मशीन पर 37 मिनट के अपटाइम पर:
- M4 Max - 16 कोर (4 ई + 12 पी), 784 मेगाहर्ट्ज पर 40 एक्सपीआर0एक्स कोर, 16-कोर एएनई।
- 128 GB एकीकृत मेमोरी - 16.62 GB निष्क्रिय अवस्था में उपयोग में (लगभग 13%)।
- 6.48 डब्ल्यू कुल निष्क्रिय शक्ति, 46.33 W अधिकतम देखी गई। थर्मल: नाममात्र.
- 2 टीबी एसएसडी, प्रारंभिक सेटअप के बाद 1.9 टीबी मुफ़्त।
128 GB प्रयोग करने योग्य मेमोरी वाले डेस्कटॉप के लिए निष्क्रिय स्थिति में 6.48 W मेरे लिए हेडलाइन नंबर है। यह बॉक्स वास्तव में एक कम-शक्ति वाला, हमेशा चालू रहने वाला एआई उपकरण है जिसे आप बिजली बिल के बारे में सोचे बिना 24x7 चालू रख सकते हैं।
यह हार्डवेयर क्यों खास है - एक पैराग्राफ में एकीकृत मेमोरी
पारंपरिक पीसी पर, आपके CPU में सिस्टम रैम है और आपके GPU में अलग VRAM है। GPU चलाने से पहले एक मॉडल को PCIe पर कॉपी करना होगा; यदि मॉडल वीआरएएम से बड़ा है, तो यह फिट नहीं बैठता है। Apple Silicon पर, CPU, GPU, न्यूरल इंजन और मीडिया इंजन साझा करते हैं एक 128 GB पूल। कुछ भी कॉपी नहीं किया गया है. Q4_K_M पर एक 70B-पैरामीटर LLM (डिस्क पर लगभग 40 GB, सार्वजनिक अनुमान) लगभग 80 GB के साथ लोड होता है जो अभी भी संदर्भ, एप्लिकेशन और टूल के लिए निःशुल्क है। यही कारण है कि मैक पर स्थानीय LLM अलग महसूस होते हैं।
तीन कमांड में बॉक्स से पहले LLM तक
brew install ollama
ollama serve &
ollama run llama3.1:8b "Explain unified memory in 3 sentences."
वास्तव में यही संपूर्ण पालन-पोषण है। पहला रन मॉडल को डाउनलोड करता है (Llama 3.1 8B Q4_K_M डिस्क पर लगभग 4.7 GB है, सार्वजनिक अनुमान) और इसे एकीकृत मेमोरी में लोड करता है। उसके बाद, बातचीत की स्ट्रीमिंग सुचारू होती है, ध्यान देने योग्य प्रथम-टोकन विलंब और प्रतिक्रिया के माध्यम से स्थिर आउटपुट के साथ। मैं उचित बेंचमार्क पद्धति के बिना जानबूझकर यहां प्रति सेकंड टोकन संख्या प्रकाशित नहीं कर रहा हूं; लंबा लेख तर्क में जाता है।
पायथन की 60 से कम लाइनों में स्थानीय RAG
स्थानीय LLM के साथ आप जो सबसे उपयोगी चीज़ कर सकते हैं, वह है इसे अपने दस्तावेज़ों पर इंगित करना। न्यूनतम व्यवहार्य स्टैक है:
- PyMuPDF या
unstructuredपार्सिंग के लिए - nomic-embed-text एम्बेडिंग के लिए Ollama के माध्यम से
- ChromaDB वेक्टर स्टोर के लिए
- Llama 3.1 8B पीढ़ी के लिए Ollama के माध्यम से
पूरा कोड इसमें है लंबा लेख. शीर्षक है: सब कुछ Mac Studio पर चलता है, कोई बाहरी API कुंजी नहीं, कोई प्रति-टोकन बिलिंग नहीं, मशीन से कोई डेटा नहीं निकलता।
Mac Studio बनाम क्लाउड - ईमानदार निर्णय मैट्रिक्स
Mac Studio इसके लिए जीतता है: हमेशा निजी अनुमान पर, आपके अपने डेटा पर RAG, IDE सह-पायलट, एजेंट प्रोटोटाइप, स्टैक सीखना, और होम लैब। क्लाउड इन के लिए जीतता है: बर्स्ट प्रशिक्षण नौकरियां, >70B उत्पादन बड़े पैमाने पर सेवा, अप्रत्याशित वैश्विक ट्रैफ़िक, और वर्कलोड जिन्हें 8x A100/H100 समानता की आवश्यकता होती है। अधिकांश टीमें दोनों का उपयोग करना बंद कर देंगी। लंबे लेख में एसवीजी के रूप में पूर्ण निर्णय मैट्रिक्स है।
एक सप्ताह के बाद पाँच पाठ
- गोपनीयता नए उपयोग के मामलों को खोलती है। जब मॉडल स्थानीय होता है, तो मैं बिना किसी हिचकिचाहट के उत्पादन लॉग, आंतरिक दस्तावेज़ और ग्राहक ईमेल पेस्ट करता हूं। इससे मेरे काम करने का तरीका बदल जाता है।
- प्रति-क्वेरी लागत मनोवैज्ञानिक होने के साथ-साथ वित्तीय भी है। किसी बिल का मतलब अधिक प्रश्न, अधिक प्रयोग, अधिक जिज्ञासा नहीं है।
- 128 GB सबसे अच्छी जगह है। 64 GB गंभीर कार्य के लिए मंजिल है। 128 GB आपको Q4_K_M पर 70B चलाने के लिए हेडरूम देता है और बाकी सभी चीजों के लिए अभी भी जगह है।
- Ollama आसान ऑन-रैंप है। एलएम स्टूडियो एक मॉडल ब्राउज़र के रूप में बहुत अच्छा है, यदि आप पाइथॉन में नए सिरे से शुरुआत कर रहे हैं तो एमएलएक्स बहुत अच्छा है, llama.cpp इस सब पर आधारित है।
- बादल मरा नहीं है. यह अभी भी प्रशिक्षण, स्केल-आउट सर्विंग और अज्ञात-लोड कार्यभार के लिए सही उपकरण है।
अगला क्या है
भविष्य के लेखों में Apple Silicon पर MLX फाइन-ट्यूनिंग, EXO के साथ मल्टी-मैक अनुमान क्लस्टर, एजेंट स्टैक (LangGraph + Ollama), और एक गहन बेंचमार्क पद्धति का हिस्सा शामिल होगा। यदि आप सभी आरेख, कोड और निर्णय मैट्रिक्स के साथ लंबा संस्करण चाहते हैं, तो पढ़ें लंबा लेख. यदि आप दृश्य संस्करण चाहते हैं, तो देखें यूट्यूब लघु. किसी भी तरह - श्रृंखला के शेष भाग के लिए सदस्यता लें।