Workstation Logo
एआई समाधान
एआई वर्कस्टेशनAI SME Packagesप्राइवेट एआईजीपीयू क्लस्टरएज एआईएंटरप्राइज एआई लैबउद्योग अनुसार एआईWSL ProxyRing Promoter
उत्पाद
AI SME PackagesCRMमार्केटिंगOpenAI एजेंट्सWSL ProxyRing Promoter
हमारे बारे में
साझेदारग्राहक कहानियाँ
लेख
प्रलेखन
ब्लॉग
संपर्क करेंLogin
Workstation

AI workstations, AI Multi Agentic Software, GPU infrastructure, and intelligent agent solutions for modern businesses.

UK Office: 77-79 Marlowes, Hemel Hempstead HP1 1LF - Directions - Take Junction 20 off M25 Outer London
Company No: 11641870
Mon - Fri: 9:00 AM - 6:00 PM GMT
+44 7515 356 146

Belgium Office: Workstation SRL, Rue Vanderkindere 34, 1180 Uccle, Brussels
BE 0751.518.683
Mon - Fri: 9:00 AM - 6:00 PM CET
+32 492 45 67 46

AI Solutions

AI WorkstationsAI SME PackagesPrivate AIGPU ClustersEdge AIEnterprise AIWSL ProxyRing Promoter

Resources

ArticlesDocumentationBlogSearch

Company

About UsPartnersContact

© 2026 Workstation AI. All rights reserved.

PrivacyCookies
Home / Articles / Technology
AIApple SiliconLLMहार्डवेयर

Mac Studio M4 को अनबॉक्स करना और अपना पहला LLM चलाना

Apple Silicon पर पहले बूट से निजी RAG पाइपलाइन तक का संपूर्ण पूर्वाभ्यास: 128 GB एकीकृत मेमोरी, Ollama, Llama 3, Continue.dev, ChromaDB, और एक ईमानदार क्लाउड-बनाम-स्थानीय निर्णय मैट्रिक्स

May 15, 2026Technology26 min read

यह दीर्घ-रूप वाला डीप-डाइव है। त्वरित, स्किम-पठनीय संस्करण के लिए, देखें साथी ब्लॉग पोस्ट.

1. परिचय: स्थानीय AI के लिए Mac Studio क्यों?

स्थानीय एआई अब शौक़ीन लोगों की जिज्ञासा नहीं रह गई है। मेटा, मिस्ट्रल, क्वेन और माइक्रोसॉफ्ट के ओपन-वेट मॉडल तेजी से परिपक्व हो रहे हैं, और Apple Silicon की एकीकृत मेमोरी 128 GB सीमा को पार कर रही है, अब आप एक ही डेस्क-साइड मशीन पर सक्षम बड़े भाषा मॉडल, एम्बेडिंग पाइपलाइन और पूर्ण RAG स्टैक चला सकते हैं - चुपचाप, एक सामान्य वर्कस्टेशन GPU के पावर बजट के एक अंश में।

यह आलेख अनबॉक्सिंग के बारे में बताता है Mac Studio M4 Max चिप के साथ, पहला बूट, वास्तविक ऑन-डिवाइस रीडिंग mactop, और "बॉक्स मेरे डेस्क पर है" से "मैं स्थानीय रूप से चल रहे Llama 3 के साथ चैट कर रहा हूं और RAG के साथ अपने स्वयं के दस्तावेज़ों को क्वेरी कर रहा हूं" तक एक व्यावहारिक पथ। यहां प्रत्येक सिफ़ारिश उस चीज़ पर आधारित है जो मैंने वास्तव में मशीन पर देखी थी। कोई आविष्कृत बेंचमार्क नंबर नहीं, कोई मार्केटिंग फ़्लफ़ नहीं - बस वर्कफ़्लो।

यदि आप एक इंजीनियर, एक एआई बिल्डर, एक एसआरई, या एक तकनीकी नेतृत्वकर्ता हैं जो यह तय कर रहे हैं कि Mac Studio आपकी टीम के हार्डवेयर मिश्रण में है या नहीं, तो यह मार्गदर्शिका आपके लिए है।

Mac Studio M4 Max + स्थानीय AI कवर

2. Mac Studio M4 Max को अनबॉक्स करना

अनबॉक्सिंग अनुभव क्लासिक ऐप्पल जैसा है: न्यूनतम कार्डबोर्ड, एक ढाले हुए अवकाश में रखी मशीन, एक छोटी काली पावर केबल, और बस इतना ही। कोई फूला हुआ सहायक बंडल नहीं. Mac Studio वही कॉम्पैक्ट एल्युमीनियम-एक्सट्रूज़न एनक्लोजर है जिसे मूल M1 अल्ट्रा के साथ पेश किया गया था: लगभग 7.7 इंच वर्गाकार, हाथ में घना, नीचे की तरफ परिचित स्लैटेड इनटेक और पीछे की तरफ पोर्ट की एक श्रृंखला के साथ।

YouTube पर अनबॉक्सिंग शॉर्ट देखें: https://youtube.com/shorts/HUlUoHNsyNM

मैंने अनबॉक्सिंग की एक छोटी क्लिप शूट की - ऊपर YouTube शॉर्ट देखें। इस प्रारूप के लिए शॉर्ट के इतनी अच्छी तरह से काम करने का कारण यह है कि वास्तविक सेटअप वास्तव में तेज़ है। पहला प्लग-इन, मॉनिटर वेक-अप, ऐप्पल आईडी साइन-इन, भाषा और क्षेत्र, फाइलवॉल्ट, और आप कुछ ही मिनटों में उपयोग करने योग्य डेस्कटॉप पर होंगे।

2.1 पहला बूट - वास्तविक रीडिंग mactop

सिस्टम का आरंभिक सिंक समाप्त होने के बाद मैंने जो पहला काम किया वह था इंस्टॉल करना मैकटॉप - एक उत्कृष्ट ओपन-सोर्स टीयूआई डैशबोर्ड जो वास्तविक समय में Apple Silicon के आंतरिक काउंटरों को प्रदर्शित करता है। 37 मिनट के अपटाइम पर वह ताज़ा-इंस्टॉल डैशबोर्ड कुछ इस तरह दिखता था:

ताजा Mac Studio M4 Max पर मैकटॉप डैशबोर्ड: 128 GB एकीकृत मेमोरी, 40 GPU कोर, 6.48 W पर निष्क्रिय
ताजा Mac Studio M4 Max पर मैकटॉप - 128 GB एकीकृत मेमोरी, 40 GPU कोर, 6.48 W पर निष्क्रिय। यह SVG फ़ॉलबैक है; एक वास्तविक पीएनजी यहां छोड़ें /img/mac-studio-mactop-firstboot.png बाद में इसे स्वैप करने के लिए।

उस स्क्रीनशॉट की संख्याएँ ही एकमात्र कठिन संख्याएँ हैं जिनका मैं इस लेख में उल्लेख करूँगा। वे नए सेटअप पर निष्क्रिय पड़ी मेरी मशीन के लिए जमीनी सच्चाई हैं:

  • Apple Silicon: M4 Max
  • CPU: कुल 16 कोर - 4 दक्षता कोर + 12 प्रदर्शन कोर; 1.6 गीगाहर्ट्ज़ पर ई-क्लस्टर, 0.2 गीगाहर्ट्ज़ पर पी-क्लस्टर; 37 सी पर पैकेज
  • GPU: 784 मेगाहर्ट्ज, 30 सी पर 40 कोर
  • तंत्रिका इंजन (एएनई): 16-कोर, निष्क्रिय अवस्था में 0.00 वॉट खींच रहा है
  • एकीकृत स्मृति: कुल 128.00 GB, निष्क्रिय अवस्था में 16.62 GB उपयोग में (लगभग 13%)
  • शक्ति: कुल 6.48 W - CPU 0.10 W, GPU 0.02 W, ANE 0 W, DRAM 0.36 W, सिस्टम 6.01 W। सत्र में अधिकतम 46.33 W देखा गया। थर्मल: नाममात्र।
  • भंडारण: 2.0 टीबी मैक एचडी, 1.9 टीबी मुफ़्त; 53.9 GB OS और प्रारंभिक सेटअप द्वारा उपयोग किया गया
  • नेटवर्क: वाई-फाई 6, बैकग्राउंड सिंक के दौरान 19.0 केबी/एस अपलोड और 156.8 केबी/एस डाउनलोड की नमूना रीडिंग के साथ

दो बातें सामने आती हैं. पहला, निष्क्रिय अवस्था में 6.48 W 128 GB उपयोग योग्य मेमोरी वाले डेस्कटॉप के लिए यह उल्लेखनीय है - जो कि स्क्रीन बंद होने पर कई लैपटॉप की तुलना में कम है। दूसरा, GPU 40 कोर उपलब्ध होने के साथ 784 मेगाहर्ट्ज पर है; जैसे ही आप उसके सामने LLM रखेंगे, वह पूल वास्तविक कार्य करने के लिए तैयार हो जाएगा।

3. Mac Studio M4 Max स्थानीय AI के लिए अद्भुत क्यों है?

यह समझने के लिए कि यह हार्डवेयर स्थानीय एआई के लिए इतना उपयुक्त क्यों है - और क्यों "एकीकृत मेमोरी" एक मार्केटिंग लाइन से अधिक है - इसे सीधे विहित विकल्प के साथ तुलना करने में मदद मिलती है: एक पीसी में एक अलग GPU कार्ड, PCIe पर सिस्टम रैम के साथ संचार करता है।

Apple Silicon एकीकृत मेमोरी बनाम असतत GPU मॉडल: 128 GB साझा पूल बनाम PCIe कॉपी टोंटी के साथ सीमित VRAM

3.1 सरल भाषा में एकीकृत मेमोरी

पारंपरिक पीसी एआई रिग पर, आपके पास दो मेमोरी पूल हैं। जब आप उन्हें डिस्क से लोड करते हैं तो सिस्टम रैम (आमतौर पर DDR5 का 64-256 GB) OS, एप्लिकेशन और मॉडल का वजन रखता है। GPU का अपना VRAM है - RTX 4090 पर 24 GB, 5090 पर 32 GB, A100 पर 80 GB। इससे पहले कि GPU एकल मैटमुल चला सके, मॉडल का होना जरूरी है की नकल की PCIe बस में सिस्टम RAM से VRAM में। यदि मॉडल वीआरएएम से बड़ा है, तो यह या तो बिल्कुल लोड नहीं होता है, या इसे पीसीआईई के माध्यम से क्रूर लागत पर पेज किया जाता है (अक्सर वीआरएएम में पूरी तरह से चलने की तुलना में 10-100x धीमा)।

Apple Silicon इन दोनों पूलों को एक में समेट देता है। CPU, GPU, न्यूरल इंजन और मीडिया इंजन सभी देखते हैं वही भौतिक स्मृति. कोई प्रति नहीं है. कोई PCIe बाधा नहीं है. एक मॉडल जो डिस्क पर 40 GB है, एकीकृत मेमोरी में 40 GB है, और GPU इसे सीधे पढ़ सकता है।

स्थानीय LLMs के लिए, यह बेहतरीन सुविधा है। Q4_K_M के लिए परिमाणित एक 70B-पैरामीटर मॉडल डिस्क पर लगभग 40 GB है (उस मात्रा स्तर पर Llama-श्रेणी के वजन के लिए सार्वजनिक रूप से उद्धृत आंकड़ा - अनुमानित मानें)। 24 GB उपभोक्ता GPU पर, वह मॉडल बिल्कुल फिट नहीं बैठता है। 128 GB एकीकृत मेमोरी पर, यह संदर्भ, एप्लिकेशन कोड और टूल के लिए लगभग 80 GB के साथ लोड होता है।

3.2 शक्ति दक्षता जिस पर विश्वास करना कठिन है

मैकटॉप स्क्रीनशॉट निष्क्रिय अवस्था में 6.48 वॉट और सत्र के दौरान अधिकतम 46.33 वॉट दिखाता है। इसे परिप्रेक्ष्य में रखने के लिए: एक एकल RTX 4090 शेष सिस्टम के शीर्ष पर 15-25 W पर निष्क्रिय रहता है, और लोड के तहत 450 W तक खींचता है। Mac Studio एक डेस्क-साइड AI बॉक्स है जिसे आप बिजली बिल पर ध्यान दिए बिना 24/7 चालू रख सकते हैं। यह मौन है. अनुमान कार्यभार के दौरान प्रशंसक लगभग कभी नहीं घूमते। यही वह चीज़ है जो इसे एक के रूप में व्यवहार्य बनाती है हमेशा चालू रहने वाला डेव बॉक्स इस तरह से कि एक असतत GPU पीसी शायद ही कभी होता है।

3.3 एप्पल न्यूरल इंजन वास्तव में क्या करता है

एएनई एक 16-कोर फिक्स्ड-फ़ंक्शन एक्सेलेरेटर है जो कोरएमएल द्वारा उत्पादित टेंसर संचालन के प्रकार के लिए अनुकूलित है। 2026 में अधिकांश ओपन-वेट LLM वर्कलोड के लिए (GGUF प्रारूप llama.cpp या Ollama के माध्यम से चल रहा है), ANE हॉट पथ में नहीं है - GPU, मेटल परफॉर्मेंस शेडर्स के माध्यम से है। ANE CoreML-परिवर्तित मॉडल, ऑन-डिवाइस वाक् पहचान, छवि विभाजन और समान निश्चित-आकार वर्कलोड के लिए चमकता है। जब यह चलता है तो यह अत्यधिक शक्ति-कुशल भी होता है। यह जानना उपयोगी है कि यह वहां है; यह अपेक्षा न करें कि प्रत्येक LLM स्टैक इसका उपयोग करेगा।

4. AI कार्य के लिए Mac Studio की स्थापना

मानक macOS ऑनबोर्डिंग के बाद, यहाँ सटीक जानकारी दी गई है जिसका मैं एक ताज़ा Mac Studio के लिए अनुसरण कर रहा हूँ जिसे मैं स्थानीय AI डेव बॉक्स के रूप में उपयोग करना चाहता हूँ।

4.1 होमब्रू, एक्सकोड सीएलटी और बुनियादी बातें स्थापित करें

/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"

xcode-select --install

brew install git wget jq python@3.12 node pyenv
brew install --cask iterm2 visual-studio-code

होमब्रू यूनिक्स टूलिंग लाता है, एक्सकोड कमांड लाइन टूल्स कंपाइलर और लिंकर प्रदान करता है, पायथन और नोड आपको ऐप कोड के लिए रनटाइम देते हैं, और iTerm2 + वीएस कोड संपादक + टर्मिनल जोड़ी हैं जिन्हें मैं डिफ़ॉल्ट रूप से उपयोग करता हूं।

4.2 Ollama स्थापित करें

Ollama MacOS पर ओपन-वेट LLM को डाउनलोड करने, चलाने और परोसने का सबसे आसान तरीका है। हुड के नीचे यह लपेटता है llama.cpp मेटल एक्सेलेरेशन के साथ और पोर्ट 11434 पर एक सरल HTTP API प्रदान करता है।

brew install ollama

ollama serve &

ollama --version

आप आधिकारिक के माध्यम से भी इंस्टॉल कर सकते हैं .dmg ollama.com से, जो एक मेनू-बार ऐप सेट करता है। कोई भी रास्ता काम करता है. मैं हेडलेस बॉक्स के लिए ब्रू इंस्टाल और डेली-ड्राइवर मैक के लिए डीएमजी को प्राथमिकता देता हूं।

4.3 एलएम स्टूडियो स्थापित करें (वैकल्पिक लेकिन इसके लायक)

एलएम स्टूडियो जीजीयूएफ मॉडल के साथ ब्राउज़िंग, डाउनलोडिंग और चैटिंग के लिए एक डेस्कटॉप यूआई है। यह एक OpenAI-संगत API को भी उजागर करता है। मैं इसे Ollama के साथ स्थापित करता हूं क्योंकि मॉडल ब्राउज़र उत्कृष्ट है और जब आप Q4_K_M और Q5_K_M के बीच निर्णय ले रहे हैं तो प्रति-मॉडल प्रदर्शन ट्यूनिंग यूआई अनुकूल है।

4.4 वीएस कोड में Continue.dev स्थापित करें

Continue.dev आपको VS कोड के अंदर ChatGPT-शैली की सहायता देता है, लेकिन आपके स्थानीय Ollama की ओर इशारा करता है। एक्सटेंशन इंस्टॉल करने के बाद इसे अपने में छोड़ दें ~/.continue/config.json:

{
  "models": [
    {
      "title": "Llama 3.1 8B (local)",
      "provider": "ollama",
      "model": "llama3.1:8b",
      "apiBase": "http://localhost:11434"
    },
    {
      "title": "Qwen 2.5 Coder 14B (local)",
      "provider": "ollama",
      "model": "qwen2.5-coder:14b",
      "apiBase": "http://localhost:11434"
    }
  ],
  "tabAutocompleteModel": {
    "title": "Codestral (local)",
    "provider": "ollama",
    "model": "codestral:latest",
    "apiBase": "http://localhost:11434"
  }
}

अब आपके पास इनलाइन चैट, संपादन और स्वत: पूर्णता है - सभी हिट मॉडल जो आपके संपादक के समान डेस्क पर रहते हैं। शून्य डेटा मशीन छोड़ देता है।

5. अपना पहला LLM चलाना

Mac Studio पर स्थानीय AI स्टैक: मॉडल, रनटाइम, त्वरण, ऐप्स

सत्य के क्षण का समय। एक मॉडल खींचें और उसे चलाएं.

5.1 Llama 3.1 8B खींचना

ollama pull llama3.1:8b

ollama list

ollama run llama3.1:8b "Explain unified memory architecture to me in 3 sentences."

पुल Q4_K_M GGUF डाउनलोड करता है (Q4_K_M पर Llama 3.1 8B डिस्क पर लगभग 4.7 GB है - सार्वजनिक रूप से उद्धृत आंकड़ा, अनुमानित मानें)। मेरे जैसे वाई-फाई 6 कनेक्शन पर, डाउनलोड में कुछ मिनट लगते हैं; वायर्ड गीगाबिट पर यह तेज़ है। एक बार यह उतर जाए तो सबसे पहले ollama run इसमें एकीकृत मेमोरी में एक बार का मॉडल लोड शामिल है - आप पहले टोकन स्ट्रीम से पहले एक संक्षिप्त विराम देखेंगे - और फिर बाद के रन तेज़ होंगे।

मैं जानबूझकर यहां अपनी मशीन के लिए टोकन-प्रति-सेकंड संख्याएं उद्धृत नहीं करूंगा, क्योंकि मैंने युग्मित पद्धति के साथ नियंत्रित बेंचमार्क सूट नहीं चलाया है। मैं जो कहूंगा वह यह है कि हार्डवेयर के इस वर्ग (40 GPU कोर के साथ M4 Max) पर आपको उम्मीद करनी चाहिए सहज, संवादात्मक स्ट्रीमिंग Q4_K_M पर 8B मॉडल से, ध्यान देने योग्य प्रारंभिक लोड विलंब और संपूर्ण प्रतिक्रिया के दौरान स्थिर आउटपुट के साथ। यदि आपने कहीं और "मुझे अपने मैक पर प्रति सेकंड 60 टोकन मिलते हैं" जैसे दावे पढ़े हैं, तो उन्हें बॉलपार्क मार्गदर्शन के रूप में मानें; आपकी वास्तविक संख्याएँ प्रॉम्प्ट लंबाई, संदर्भ विंडो, परिमाणीकरण स्तर, मॉडल आर्किटेक्चर और जो कुछ भी चल रहा है, उसके आधार पर अलग-अलग होंगी।

5.2 परिमाणीकरण चुनना - Q4_K_M, Q5_K_M, Q8_0

क्वांटिज़ेशन मॉडल वज़न की सटीकता को कम करके उन्हें डिस्क और मेमोरी में सिकोड़ देता है। समझौता गुणवत्तापूर्ण है। यहां वह मोटा मानसिक मॉडल है जिसका उपयोग मैं स्थानीय अनुमान के लिए मात्रा चुनते समय करता हूं:

बल्ली से ढकेलना8बी के लिए अनुमानित आकारगुणवत्ता बनाम FP16कब उपयोग करें
Q4_K_M~4.7 GBबहुत बढ़िया, छोटी सी बूंदगलती करना। चैट और कोड के लिए सर्वोत्तम गति/गुणवत्ता संतुलन।
Q5_K_M~5.7 GBFP16 के करीबजब आपको स्पर्श की अधिक सटीकता और अतिरिक्त मेमोरी की आवश्यकता हो।
Q8_0~8.5 GBलगभग दोषरहितजब आपको छोटे मॉडलों पर अधिकतम गुणवत्ता और न्यूनतम शोर की आवश्यकता होती है।

सभी आकार अनुमानित हैं, Llama-क्लास 8B वज़न के लिए सार्वजनिक रूप से उद्धृत आंकड़े। सापेक्ष क्रम ही मायने रखता है।

5.3 32, 64, और 128 GB में क्या फिट बैठता है

एकीकृत स्मृतियथार्थवादी आराम क्षेत्र (Q4_K_M)खिंचाव (सावधानी के साथ)
32 GB7बी/8बी/13बी20-22बी सख्त संदर्भ में
64 GB13बी/20बी/34बीकड़े संदर्भ में 40-50बी
128 GB34बी/70बी/विशेषज्ञों का मिश्रण वेरिएंटसख्त संदर्भ में 100-120बी

"कम्फर्ट ज़ोन" का अर्थ है कि मॉडल एक उदार संदर्भ विंडो, एक केवी कैश और अन्य अनुप्रयोगों को चलाने के लिए पर्याप्त जगह के साथ लोड होता है। "स्ट्रेच" का अर्थ है कि यह लोड होता है लेकिन आप संदर्भ की लंबाई और अन्य कार्यभार के साथ तालमेल बिठाना शुरू कर देते हैं। अपने 128 GB बॉक्स पर मैं Q4_K_M पर 70B चला सकता हूं और अभी भी VS कोड, क्रोम और कुछ पायथन प्रक्रियाओं के लिए लगभग 80 GB का हेडरूम है - जो, स्पष्ट रूप से, एक शानदार एहसास है।

5.4 नोड और पायथन से Ollama को कॉल करना

Ollama एक HTTP API को उजागर करता है http://localhost:11434. एक छोटा नोड फ़ेच इस तरह दिखता है:

// node 20+
const res = await fetch("http://localhost:11434/api/generate", {
  method: "POST",
  headers: { "Content-Type": "application/json" },
  body: JSON.stringify({
    model: "llama3.1:8b",
    prompt: "Write a one-paragraph summary of unified memory architecture.",
    stream: false
  })
});

const data = await res.json();
console.log(data.response);

और पायथन से:

import requests

r = requests.post(
    "http://localhost:11434/api/generate",
    json={
        "model": "llama3.1:8b",
        "prompt": "Explain HNSW indexes briefly.",
        "stream": False,
    },
    timeout=120,
)
print(r.json()["response"])

यह वह सब कुछ है जो आपको स्थानीय LLM को CLI टूल, स्लैक बॉट, शॉर्टकट, माइक्रोसर्विस या आंतरिक स्वचालन से जोड़ने के लिए आवश्यक है। कोई चाबियाँ नहीं, कोई दर सीमा नहीं, कोई कोटा नहीं।

6. Mac Studio पर चलने के लिए सर्वोत्तम मॉडल

किसी मॉडल को चुनना आंशिक रूप से प्रदर्शन, आंशिक रूप से लाइसेंस, आंशिक रूप से जीवंतता है। यहाँ वह है जो मैं वास्तव में बॉक्स पर चलाता हूँ, जिसे आकार स्तर के आधार पर समूहीकृत किया गया है।

6.1 छोटे (10बी से कम): प्रतिदिन तेज गति से काम करने वाले घोड़े

  • Llama 3.1 8B - उत्कृष्ट सामान्य प्रयोजन बातचीत और तर्क; चेतावनियों के साथ अनुमेय मेटा लाइसेंस।
  • मिस्ट्रल 7बी/मिनस्ट्रल 8बी - मजबूत तर्क, अपाचे-लाइसेंस प्राप्त संस्करण उपलब्ध हैं।
  • क्वेन 2.5 7बी - बहुत मजबूत बहुभाषी और कोड प्रदर्शन।
  • फाई-3.5 मिनी - छोटा, आश्चर्यजनक रूप से सक्षम, आदर्श जब आपको थ्रूपुट और कम विलंबता की आवश्यकता होती है।
  • कोडेस्ट्रल / क्वेन 2.5 कोडर 7बी - आईडीई कार्य के लिए तेज़ इनलाइन स्वतः पूर्णता।

6.2 मध्य (10बी-40बी): 64-128 एक्सपीआर0एक्स पर सबसे अच्छा स्थान

  • Llama 3.1 / 3.3 70B (Q4_K_M) - यदि आपके पास 128 GB है, तो यह हेडलाइन मॉडल है; निकट-सीमांत गुणवत्ता, आराम से चलती है।
  • क्वेन 2.5 32बी - उत्कृष्ट गुणवत्ता-से-आकार अनुपात; RAG के साथ अच्छी जोड़ी।
  • डीपसीक-कोडर 33बी - कोड जनरेशन कार्यों में मजबूत।
  • मिक्सट्रल 8x7B - विशेषज्ञों का मिश्रण, एक समय में केवल 2 विशेषज्ञों को सक्रिय करता है, आराम से फिट बैठता है।

6.3 बड़ा (70बी और ऊपर): केवल 96-128 एक्सपीआर0एक्स पर और केवल क्यू4 पर

128 GB पर Q4_K_M पर 70B श्रेणी के मॉडल के लिए दरवाजा खुला है। वे हैं और धीमा 8बी मॉडल की तुलना में, लेकिन उन कार्यों के लिए गुणवत्ता में उछाल महत्वपूर्ण है जो व्यापक विश्व ज्ञान और लंबे तर्क से लाभान्वित होते हैं। प्रथम-टोकन विलंबता लंबी होने और स्ट्रीमिंग गति कम होने की अपेक्षा करें, लेकिन वास्तविक अनुभव कई वर्कफ़्लो के लिए उपयोग योग्य बना हुआ है।

7. एक स्थानीय RAG पाइपलाइन का निर्माण

एक बार जब आपके पास स्थानीय LLM हो, तो सबसे उपयोगी चीज़ जो आप इसके साथ कर सकते हैं, वह है इसे अपने दस्तावेज़ों पर इंगित करना। यह पुनर्प्राप्ति-संवर्धित पीढ़ी है, और यह कार्यभार है जहां Mac Studio वास्तव में क्लाउड API के निजी विकल्प के रूप में चमकता है।

Mac Studio पर स्थानीय RAG पाइपलाइन: उत्तर देने के लिए स्थानीय LLM पर पुनः प्राप्त करने के लिए ChromaDB में एम्बेडिंग के लिए चंकर के लिए PDF

7.1 ढेर

  • दस्तावेज़ पार्सर - पीडीएफ के लिए PyMuPDF, unstructured मिश्रित-प्रारूप अंतर्ग्रहण के लिए.
  • चंकर - लैंगचेन RecursiveCharacterTextSplitter या एक टोकन-जागरूक विभाजक। ओवरलैप के 64-128 टोकन के साथ विशिष्ट खंड आकार 512-1024 टोकन।
  • एंबेडिंग - nomic-embed-text या mxbai-embed-large, दोनों Ollama के माध्यम से उपलब्ध हैं। दोनों स्थानीय GPU पर चलते हैं।
  • वेक्टर स्टोर - डिफ़ॉल्ट रूप से ChromaDB. शून्य-सर्वर विकल्प के लिए SQLite-VSS। यदि आप एकल-फ़ाइल एम्बेडेड विकल्प चाहते हैं जो स्केल करता है तो LanceDB।
  • जनक - तेजी से बदलाव के लिए Llama 3.1 8B, या यदि आप उच्चतम गुणवत्ता वाले उत्तर चाहते हैं तो 70B।

7.2 न्यूनतम पायथन उदाहरण - अंत से अंत तक

pip install chromadb requests pypdf

import os, glob, requests, chromadb
from chromadb.utils import embedding_functions
from pypdf import PdfReader

OLLAMA = "http://localhost:11434"
EMBED_MODEL = "nomic-embed-text"
GEN_MODEL   = "llama3.1:8b"

def embed(text: str) -> list[float]:
    r = requests.post(f"{OLLAMA}/api/embeddings", json={
        "model": EMBED_MODEL, "prompt": text,
    }, timeout=60)
    return r.json()["embedding"]

def generate(prompt: str) -> str:
    r = requests.post(f"{OLLAMA}/api/generate", json={
        "model": GEN_MODEL, "prompt": prompt, "stream": False,
    }, timeout=300)
    return r.json()["response"]

def chunk(text: str, size: int = 1000, overlap: int = 150):
    out, i = [], 0
    while i < len(text):
        out.append(text[i:i+size])
        i += size - overlap
    return out

client = chromadb.PersistentClient(path="./rag-db")
col = client.get_or_create_collection("docs")

for path in glob.glob("./docs/**/*.pdf", recursive=True):
    reader = PdfReader(path)
    full = "\n".join(p.extract_text() or "" for p in reader.pages)
    for j, c in enumerate(chunk(full)):
        col.add(
            ids=[f"{os.path.basename(path)}::{j}"],
            documents=[c],
            embeddings=[embed(c)],
            metadatas=[{"source": path, "chunk": j}],
        )

def ask(q: str, k: int = 5) -> str:
    qe = embed(q)
    res = col.query(query_embeddings=[qe], n_results=k)
    ctx = "\n\n".join(res["documents"][0])
    prompt = (
        "Answer the question using only the context below. "
        "If the answer is not in the context, say you do not know.\n\n"
        f"Context:\n{ctx}\n\nQuestion: {q}\nAnswer:"
    )
    return generate(prompt)

print(ask("What is unified memory and why does it matter for LLMs?"))

यह Python की 60 से कम लाइनों में एक पूर्ण स्थानीय RAG पाइपलाइन है। पूरी चीज़ Mac Studio पर चलती है। कोई बाहरी API कुंजियाँ नहीं, कोई प्रति-टोकन बिलिंग नहीं, कोई डेटा मशीन से बाहर नहीं जा रहा। एक बड़े पीडीएफ सेट के पहले अंतर्ग्रहण में कुछ मिनट लगेंगे; बाद की क्वेरीज़ त्वरित हैं.

7.3 ट्यूनिंग नोट्स

  • खंड आकार - 1000 वर्णों और 150 ओवरलैप के साथ प्रारंभ करें; यदि आपके स्रोतों में लंबे संरचित अनुभाग (कानूनी, तकनीकी विवरण) हैं और रिट्रीवर उत्तरों को खंडित कर रहा है, तो आगे बढ़ें।
  • टॉप-कश्मीर - 4-8 व्यावहारिक सीमा है. बहुत अधिक ऊपर जाने से शीघ्रता बढ़ती है और स्पष्ट लाभ के बिना पीढ़ी धीमी हो जाती है।
  • पुनः रैंकिंग - उच्चतम गुणवत्ता के लिए, टॉप-20 को पुनः प्राप्त करें और क्रॉस-एनकोडर के साथ पुनः रैंक करें (उदाहरण के लिए) bge-reranker). Mac Studio पर यह सस्ता है।
  • मेटाडेटा फ़िल्टरिंग - टुकड़ों को उनके स्रोत पथ, दिनांक और अनुभाग के साथ टैग करें; वेक्टर खोज से पहले क्वेरी समय पर फ़िल्टर करें। यह सबसे बड़ी सटीक जीत है।
  • स्ट्रीमिंग - बदलना stream को true Ollama में त्वरित UX के लिए क्लाइंट को कॉल और स्ट्रीम टोकन।

8. दिन-प्रतिदिन का डेवलपर लूप

Mac Studio पर कुछ हफ़्तों के बाद मेरा दैनिक लूप इस तरह दिखता है:

  1. वीएस कोड खोलें, Continue.dev Ollama के विरुद्ध जागता है।
  2. मेरे नोट्स के विरुद्ध लंबी बातचीत वाले प्रश्नोत्तरी के लिए ओपन वेबयूआई (या एलएम स्टूडियो) में एक चैट खोलें।
  3. कोड कार्य के लिए: कोडस्ट्रल या क्वेन कोडर मॉडल पर टैब-स्वतः पूर्ण, Llama 3.1 8B पर लंबी चैट, कार्य की आवश्यकता होने पर 70B पर गहन तर्क सत्र।
  4. आंतरिक RAG के लिए, एक पायथन स्क्रिप्ट जो प्रोजेक्ट के डॉक्स/फ़ोल्डर और एक क्रोमा डेटाबेस को इंगित करती है।
  5. एजेंट प्रोटोटाइपिंग के लिए, लैंगग्राफ या एक छोटा कस्टम लूप जो Ollama एंडपॉइंट को कॉल करता है - समान पैटर्न, अलग गोंद।

जब आपका LLM स्थानीय होता है तो जो चीज़ वास्तव में बदल जाती है वह है आपके उपयोग करने का तरीका। किसी प्रश्न की कोई वृद्धिशील लागत नहीं है, इसलिए आप मॉडल से अधिक प्रश्न पूछते हैं। गोपनीयता की कोई चिंता नहीं है, इसलिए आप उत्पादन लॉग, आंतरिक दस्तावेज़, ग्राहक ईमेल पेस्ट करें। आप छोटी सीएलआई स्क्रिप्ट लिखते हैं जो एक संरचित सारांश निकालने के लिए 200 दस्तावेजों से गुजरती हैं, और आप प्रति-टोकन बिल के बारे में दो बार नहीं सोचते हैं, क्योंकि कोई बिल नहीं है।

9. बेंचमार्क और ईमानदार तुलना बनाम क्लाउड

मुझे बहुत स्पष्ट होने दें: मैं टोकन-प्रति-सेकंड संख्याएं प्रकाशित नहीं करने जा रहा हूं जो मैंने कसकर नियंत्रित बेंचमार्क पद्धति के साथ तैयार नहीं की हैं। इंटरनेट ऐसे नंबरों से भरा पड़ा है, जो अक्सर अलग-अलग परिमाणीकरण स्तरों और संदर्भ लंबाई और शीघ्र प्रारूपों की तुलना करते हैं, और वे स्पष्ट करने की तुलना में अधिक भ्रमित करते हैं। इसके बजाय मैं एक निर्णय मैट्रिक्स प्रकाशित करूंगा जो कैप्चर करता है Mac Studio वास्तव में किस प्रकार के कार्यभार पर जीतता है, जहां यह नहीं है, और जहां सही उत्तर "दोनों का उपयोग करें" है।

निर्णय मैट्रिक्स: लागत, गोपनीयता, विलंबता, अनुकूलन, स्केलिंग, लॉक-इन, ब्रेक-ईवन पर Mac Studio M4 Max बनाम AWS g5, AWS p4d, और क्लाउड LLM API

9.1 सम-विच्छेद गणित

128 GB एकीकृत मेमोरी और 2 टीबी SSD के साथ एक Mac Studio M4 Max, हमेशा ऑन-क्लाउड GPU उदाहरण के कुछ महीनों के लगभग समान मूल्य बैंड में आता है। सभी विशिष्ट डॉलर आंकड़ों को अनुमानित और क्षेत्र तथा छूट के कार्य के रूप में मानें:

  • एक Mac Studio M4 Max, अच्छी तरह से कॉन्फ़िगर किया गया: लगभग $4,000-$6,000 एक बार (अनुमानित; कॉन्फ़िगरेशन भिन्न होता है)।
  • एक एडब्लूएस g5.xlarge (एकल ए10जी, 24 एक्सपीआर0एक्स वीआरएएम) 24x7 ऑन-डिमांड चल रहा है: $700-$900 प्रति माह (क्षेत्र-निर्भर) के क्रम में।
  • एक एडब्लूएस p4d.24xlarge (8x ए100): ऑन-डिमांड $20,000-$30,000 प्रति माह का ऑर्डर यदि आपने इसे किसी तरह छोड़ दिया है (आप ऐसा नहीं करेंगे, लेकिन यह विरोधाभास को स्पष्ट करता है)।

अंकगणित कहता है कि हमेशा चालू रहने वाले डेव बॉक्स के लिए, Mac Studio एक तुलनीय हमेशा चालू रहने वाले क्लाउड उदाहरण की तुलना में कुछ महीनों में अपने लिए भुगतान करता है, और वर्षों तक बिजली के मामले में अपने लिए भुगतान करना जारी रखता है। बर्स्ट ट्रेनिंग नौकरियों के लिए गणित उलट जाता है: एक घंटे के लिए किराया लें, दौड़ें, इसे वापस सौंप दें। इस काम के लिए सही उपकरण का उपयोग करें।

9.2 जब बादल सही उत्तर है

  • आपको 128 GB में फिट होने वाले मॉडल से बड़े मॉडल को प्रशिक्षित या फाइन-ट्यून करने की आवश्यकता है।
  • आपको सख्त एसएलओ और लोचदार क्षमता के साथ वैश्विक उपयोगकर्ता आधार को बड़े पैमाने पर सेवा देने की आवश्यकता है।
  • आप एक प्रयोग चला रहे हैं जो 8x A100 या H100 समानता से लाभान्वित होता है।
  • आपके संगठन की अनुपालन स्थिति कहती है कि अनुमान विशिष्ट ऑडिट ट्रेल्स के साथ एक विशिष्ट क्लाउड क्षेत्र में चलना चाहिए।

9.3 जब Mac Studio सही उत्तर है

  • आप अपनी टीम के लिए हमेशा चालू रहने वाला निजी अनुमान बॉक्स चाहते हैं।
  • आप RAG, एजेंट, या IDE सहपायलट बना रहे हैं जहां डेटा रेजिडेंसी और गोपनीयता मायने रखती है।
  • आप एक शांत, कम-शक्ति वाला डेव बॉक्स चाहते हैं जिसके लिए सर्वर रूम की आवश्यकता नहीं है।
  • आप तेजी से प्रोटोटाइप कर रहे हैं और क्लाउड API की प्रति-टोकन बिलिंग आपके रास्ते में है।
  • आप स्टैक सीखना चाहते हैं - एक मॉडल का मालिक, एक रनटाइम का मालिक, एक वेक्टर स्टोर का मालिक, लूप का मालिक।

10. चुनौतियाँ और सीमाएँ

यदि मैं खुरदुरे किनारों का नाम नहीं बताऊंगा तो इस लेख पर कोई उपकार नहीं करूंगा। Apple Silicon स्थानीय AI के लिए उत्कृष्ट है, लेकिन इसमें कुछ वास्तविक चेतावनियाँ भी हैं।

10.1 प्रशिक्षण अभी भी अनुमान से कमजोर कहानी है

Apple Silicon AI की कहानी बहुत मजबूत है अनुमान के लिए की तुलना में प्रशिक्षण. PyTorch का MPS बैकएंड काफी परिपक्व हो गया है, और Apple का अपना MLX ढांचा वास्तव में अच्छा है, लेकिन CUDA-केवल प्रशिक्षण टूलींग की चौड़ाई अभी भी व्यापक है। यदि आपका दिन का काम उपन्यास मॉडल आर्किटेक्चर या बड़े पैमाने पर फाइन-ट्यूनिंग है, तो आप उन छेदों को पार करेंगे जो आप लिनक्स + एनवीआईडीआईए पर नहीं करते हैं।

10.2 पारिस्थितिकी तंत्र कई स्थानों पर CUDA मानता है

कई AI रिपो अभी भी CUDA मान्यताओं पर डिफ़ॉल्ट हैं। अधिकांश अनुरक्षित परियोजनाओं में अब धातु/एमपीएस पथ हैं, लेकिन कभी-कभी घर्षण की उम्मीद होती है: एक पुस्तकालय जिसे स्रोत से निर्माण की आवश्यकता होती है, एक कर्नेल जिसमें कोई धातु समकक्ष नहीं होता है, एक बेंचमार्क सूट जो केवल एनवीआईडीआईए पर चलता है। इसके लिए समय की योजना बनाएं.

10.3 स्केलिंग आउट DIY है

एक Mac Studio एक सिंगल बॉक्स है। उपकरण जैसे EXO और अन्य आपको कई उपकरणों पर बहुत बड़े मॉडल चलाने के लिए मैक को क्लस्टर करने देते हैं, लेकिन यह वह परिष्कृत कहानी नहीं है जो आपको जी5एस के कुबेरनेट्स क्लस्टर के साथ मिलती है। यदि आपके कार्यभार को क्षैतिज लोच की आवश्यकता है, तो क्लाउड अभी भी बेहतर है।

10.4 मरम्मत योग्यता और उन्नयन

आप बाद में RAM नहीं जोड़ सकते. आप SSD को बाद में स्वैप नहीं कर सकते (व्यावहारिक रूप से)। आपको जो चाहिए वह खरीदें, फिर प्लस वन - विशेष रूप से स्मृति पर। 128 GB टियर वह है जिसे मैं गंभीर AI कार्य के लिए अनुशंसित करूंगा; 64 GB मंजिल है.

निरंतर लोड के तहत 10.5 थर्मल

Mac Studio निष्क्रिय होने पर ठंडा और शांत चलता है (ऊपर दिया गया स्क्रीनशॉट 37 C और 30 C दिखाता है, जबकि पंखे सुनाई नहीं दे रहे हैं)। लगातार भारी LLM लोड के तहत, पंखे घूमते हैं - जोर से नहीं, बल्कि सुनने में - और चिप गर्म हो जाती है। यह नाममात्र थर्मल लिफाफे के भीतर है; बस इस बात से अवगत रहें कि "मौन" एक निष्क्रिय और हल्का-फुल्का लक्षण वर्णन है, निरपेक्ष नहीं।

11. Apple Silicon पर स्थानीय AI का भविष्य

तीन रुझान एक साथ आ रहे हैं जो Apple Silicon पर स्थानीय AI के लिए अगले 12-24 महीनों को रोमांचक बनाते हैं।

पहला, ओपन-वेट मॉडल क्षमता खोए बिना छोटे होते रहते हैं. Phi-3.5, Qwen 2.5 छोटा, और Llama 3.x परिवार 8B पर अपने भार वर्ग से ऊपर है। 2026 8बी मॉडल कई कार्यों में गुणवत्ता में लगभग 2023 70बी के बराबर है। इसका मतलब है कि अधिक कार्यभार एकीकृत मेमोरी के 32-64 GB में आराम से फिट हो जाता है, और 128 GB Mac Studio एक मल्टी-मॉडल सर्विंग बॉक्स बन जाता है।

दूसरा, Apple के अपने MLX ढांचे में सुधार होता रहता है. एमएलएक्स एक NumPy-जैसा API, आलसी मूल्यांकन, डिफ़ॉल्ट रूप से एकीकृत मेमोरी जागरूकता और गतिशील गणना ग्राफ़ प्रदान करता है। एमएलएक्स समुदाय तेजी से क्लिप पर मॉडल, टोकननाइज़र और प्रशिक्षण लूप पोर्ट कर रहा है। यदि आप आज मैक पर एक नया एमएल प्रोजेक्ट शुरू कर रहे हैं, तो एमएलएक्स स्वाभाविक विकल्प है; यदि आप PyTorch का उपयोग कर रहे हैं, तो MPS बैकएंड प्रत्येक रिलीज़ के लिए अधिक उपयोगी है।

तीसरा, परिमाणीकरण और केवी-कैश संपीड़न बेहतर होते जा रहे हैं. Q4_K_M, IQ-फ़ैमिली क्वांट्स और GGUF सुधार जैसी तकनीकों का मतलब है कि वही मॉडल कम गुणवत्ता हानि के साथ छह महीने पहले की तुलना में कम मेमोरी में फिट बैठता है। स्थानीय एआई एक ऐसे मोड़ पर है जहां मॉडल + क्वांट पेयरिंग की प्रत्येक पीढ़ी उपभोक्ता-मूल्य वाले हार्डवेयर की व्यावहारिक पहुंच बढ़ाती है।

इन सब में भविष्य की एम-सीरीज़ चिप्स (एम5, भविष्य के अल्ट्रस, स्टूडियो रिफ्रेश) के बारे में अफवाहें जोड़ें, और प्रक्षेपवक्र स्पष्ट है: डेस्क-साइड एआई बॉक्स यहाँ है, और यह बेहतर होता जा रहा है.

12. Mac Studio को टीम AI बॉक्स के रूप में सख्त करना

यदि आप अपने Mac Studio को एक छोटी टीम के साथ साझा करना चाहते हैं - मान लीजिए, Ollama, एक ओपन WebUI इंस्टेंस, और एक RAG एंडपॉइंट को मुट्ठी भर सहकर्मियों के सामने प्रदर्शित करें - तो यहां मैं जो कठोर परिश्रम कर रहा हूं वह है:

  1. फ़ाइलवॉल्ट चालू और एक मजबूत लॉगिन पासवर्ड। इसे यूपीएस पर रखें.
  2. टेलस्केल बॉक्स पर ताकि इसे सार्वजनिक इंटरनेट पर उजागर किए बिना आपकी टीम के उपकरणों से पहुंचा जा सके।
  3. Ollama को लोकलहोस्ट से बाइंड करें और इसके सामने एक पतली ऑथ प्रॉक्सी (कैडी, ट्रैफिक, या एक छोटा नोड/पायथन सर्वर) है जो अग्रेषित करने से पहले प्रमाणीकरण और दर सीमित करने का काम संभालती है। 11434.
  4. डॉकर डेस्कटॉप में ओपन वेबयूआई चलाएँ लगातार मात्रा के साथ; इसे स्थानीय Ollama समापन बिंदु पर इंगित करें।
  5. बैकअप एन्क्रिप्टेड बाहरी SSD या टाइम मशीन लक्ष्य के लिए RAG डेटाबेस के लिए।
  6. ऑटो अपडेट एक शेड्यूल पर macOS और Homebrew पैकेज; नवीनतम ऑटो-पुलिंग के बजाय जानबूझकर Ollama और मॉडल संस्करणों को पिन करें।

अच्छा हुआ, आपके पास एक निजी, ऑडिट-अनुकूल एआई एंडपॉइंट है जिसे आपकी टीम हर दिन उपयोग करती है और जो कभी भी बिल्डिंग के नेटवर्क से टोकन नहीं भेजती है।

13. निष्कर्ष: डेस्क पर एक शांत क्रांति

2026 में Mac Studio M4 Max को अनबॉक्स करना एक डेस्कटॉप खरीदने जैसा कम और एक छोटा AI उपकरण खरीदने जैसा लगता है जो एक मैक भी होता है। एकीकृत मेमोरी के 128 GB, 40 GPU कोर, 16 CPU कोर, एक न्यूरल इंजन, हार्डवेयर मीडिया एनकोडर, एक 2 टीबी एसएसडी, और एकल वाट में मापा गया एक निष्क्रिय पावर ड्रॉ - सभी एक बॉक्स में आप एक हाथ से उठा सकते हैं।

सेटअप तेज़ है, पहला LLM एक घंटे के भीतर चालू हो जाता है, और एक दोपहर के भीतर आपके पास एक निजी RAG पाइपलाइन होती है जो आपके दस्तावेज़ों पर प्रश्नों का उत्तर देती है। पूरी चीज़ आपके डेस्क पर होती है, पृष्ठभूमि में कोई क्लाउड बिल टिक-टिक नहीं करता है। यह एआई के साथ आपके निर्माण के तरीके को इस तरह से बदल देता है कि जब तक आप इसे आज़मा नहीं लेते तब तक बताना मुश्किल होता है।

यदि आप मूल्यांकन कर रहे हैं कि Mac Studio आपकी टीम के हार्डवेयर मिश्रण में है या नहीं, तो मुझे आशा है कि इस लेख ने आपको एक जमीनी दृष्टिकोण दिया है: क्या आश्चर्यजनक है, क्या कठिन है, क्लाउड अभी भी कहाँ जीतता है, और आपके डेस्क पर बॉक्स कहाँ बेहतर उत्तर है। साथी लघु ब्लॉग साझा करने के लिए उसी वर्कफ़्लो को 5 मिनट की रीड में वितरित करता है।

यदि यह उपयोगी होता - यूट्यूब पर अनबॉक्सिंग देखें (https://youtube.com/shorts/HUlUoHNsyNM), अनुवर्ती ट्यूटोरियल (एमएलएक्स फाइन-ट्यूनिंग, मल्टी-मैक अनुमान, एजेंट स्टैक) के लिए चैनल की सदस्यता लें, और श्रृंखला के अगले लेख के लिए यहां वापस देखें। Apple Silicon पर स्थानीय AI अभी शुरू हो रहा है, और स्टैक परिपक्व होने पर मैं लिखना जारी रखूंगा।


इस आलेख के लिए SEO स्नैपशॉट

  • एसईओ शीर्षक: Mac Studio M4 को अनबॉक्स करना: अपना पहला LLM स्थानीय रूप से चलाएं
  • मेटा विवरण: 128 GB एकीकृत मेमोरी के साथ Mac Studio M4 Max को अनबॉक्स करें, Ollama इंस्टॉल करें, Llama 3 को स्थानीय रूप से चलाएं, और एक निजी RAG पाइपलाइन बनाएं। वास्तविक अध्ययन, ईमानदार तुलना।
  • प्राथमिक कीवर्ड: Mac Studio AI, Mac Studio LLM, Mac Studio पर LLM चलाना, Ollama Mac Studio, Apple Silicon AI, स्थानीय AI सेटअप, Mac Studio
  • ट्विटर/एक्स (280 अक्षरों से कम): एक Mac Studio M4 Max को अनबॉक्स किया। 128 GB एकीकृत मेमोरी। 6.48 W पर निष्क्रिय। Llama 3.1 8B को Ollama के माध्यम से खींचा, एक दोपहर में एक स्थानीय RAG पाइपलाइन बनाई, कोई क्लाउड बिल नहीं। संपूर्ण 4000 शब्दों का वॉकथ्रू + 6 आरेख + यूट्यूब लघु। #AppleSilicon #LocalLLM
  • लिंक्डइन पोस्ट: नया Mac Studio मैंने छह मूल आरेखों, एक ईमानदार क्लाउड-बनाम-स्थानीय निर्णय मैट्रिक्स और एक खंड जहां क्लाउड अभी भी जीतता है, के साथ संपूर्ण वर्कफ़्लो लिखा। यदि आप अपनी टीम के लिए स्थानीय एआई का मूल्यांकन कर रहे हैं, तो यह शुरुआत करने के लिए एक जमीनी जगह है।

Watch

Mac Studio M4 को अनबॉक्स करना और अपना पहला LLM चलाना
Click to open in new window
Share this article

More in Technology

LLM बाधाओं का खुलासा: ऑब्ज़र्वेबिलिटी, OTEL और लागत नियंत्रण

LLM बाधाओं का खुलासा: ऑब्ज़र्वेबिलिटी, OTEL और लागत नियंत्रण

तकनीकी ब्रीफ: OTEL स्पैन स्कीमा, कलेक्टर, FinOps PromQL, एजेंट बजट, स्कोरिंग, और प्रोडक्शन एजेंटों के लिए LLM प्लेटफ़ॉर्म

Read more
टर्बोचार्जिंग LLMs

टर्बोचार्जिंग LLMs

तकनीकी संक्षिप्त: ओएस-शैली केवी पेजिंग, लगभग-शून्य-अपशिष्ट सेवा, एजेंट डिबग लूप, वर्कस्टेशन टोकन जेनरेशन, और एम्बेडिंग-गेटेड अव्यक्त ध्यान

Read more
Rust Async ब्लॉकिंग, Rayon और आधुनिक अनुप्रयोग

Rust Async ब्लॉकिंग, Rayon और आधुनिक अनुप्रयोग

तकनीकी संक्षिप्त: सहकारी शेड्यूलिंग, spawn_blocking बनाम Rayon बनाम समर्पित थ्रेड, और आधुनिक एप्लिकेशन एस्टेट के लिए Workstation पॉलीग्लॉट मार्गदर्शन

Read more