AI और मशीन लर्निंग गाइड

Mac Mini M4 पर LLMs कैसे चलाएं (Llama, Mistral, Phi)

Apple Silicon की यूनिफाइड मेमोरी आर्किटेक्चर, Mac Mini M4 को बड़े लैंग्वेज मॉडल लोकली चलाने के लिए सबसे किफ़ायती प्लेटफ़ॉर्मों में से एक बनाती है। यह गाइड वास्तविक बेंचमार्क और व्यावहारिक कोड उदाहरणों के साथ Ollama, llama.cpp और MLX को कवर करती है।

20 मिनट का पठन मार्च 2026 में अपडेट किया गया मध्यम

1. LLMs के लिए Mac Mini M4 क्यों?

Apple Silicon की आर्किटेक्चर की बदौलत Mac Mini M4 बड़े लैंग्वेज मॉडल चलाने के लिए विशिष्ट रूप से उपयुक्त है। पारंपरिक GPU सर्वरों के विपरीत, जहां VRAM मॉडल के आकार को सीमित करता है, M4 की यूनिफाइड मेमोरी CPU, GPU और Neural Engine को एक ही मेमोरी पूल साझा करने देती है -- मतलब एक 24GB Mac Mini ऐसे मॉडल लोड कर सकता है जिनके लिए 24GB VRAM वाले एक महंगे GPU की आवश्यकता होगी।

🧠

यूनिफाइड मेमोरी आर्किटेक्चर

अलग VRAM वाले NVIDIA GPUs के विपरीत, M4 की यूनिफाइड मेमोरी GPU को पूरी सिस्टम RAM तक पहुंच देती है। एक 24GB Mac Mini के पास मॉडल लोडिंग के लिए प्रभावी रूप से 24GB "VRAM" होता है, बिना PCI-E बैंडविड्थ बॉटलनेक के।

Neural Engine

M4 का 16-core Neural Engine 38 TOPS तक की ML प्रदर्शन क्षमता देता है। CoreML और MLX जैसे फ़्रेमवर्क ट्रांसफ़ॉर्मर इनफेरेंस के लिए महत्वपूर्ण त्वरित मैट्रिक्स ऑपरेशनों हेतु इसका लाभ उठाते हैं।

🔌

पावर दक्षता

Mac Mini M4 सामान्य LLM इनफेरेंस लोड के तहत केवल 5-15W खर्च करता है, जबकि एक NVIDIA A100 के लिए 300-450W। इसका मतलब है नाटकीय रूप से कम होस्टिंग लागत और किसी विशेष कूलिंग की आवश्यकता नहीं।

💰

किफ़ायती

16GB वाले एक डेडिकेटेड Mac Mini M4 के लिए $85/माह से शुरू, आपको प्रति-टोकन API लागत के बिना पूर्वानुमेय मूल्य निर्धारण मिलता है। GPU क्लाउड मूल्य के एक अंश पर 24/7 असीमित इनफेरेंस अनुरोध चलाएं।

मुख्य अंतर्दृष्टि: इनफेरेंस वर्कलोड (ट्रेनिंग नहीं) के लिए, Mac Mini M4 उद्योग में सर्वश्रेष्ठ प्रदर्शन-प्रति-डॉलर अनुपात प्रदान करता है। आपको बिना किसी नॉइज़ी नेबर के डेडिकेटेड हार्डवेयर, कोई प्रति-टोकन बिलिंग नहीं, और Apple Silicon की 120 GB/s तक की मेमोरी बैंडविड्थ मिलती है।

2. LLM फ़्रेमवर्क तुलना

तीन फ़्रेमवर्क Apple Silicon LLM इकोसिस्टम पर हावी हैं। आपके उपयोग के मामले के आधार पर प्रत्येक की अलग-अलग खूबियां हैं।

विशेषता Ollama llama.cpp MLX
सेटअप की सरलता बहुत आसान मध्यम आसान
Metal GPU सपोर्ट हाँ (स्वचालित) हाँ (flag) हाँ (नेटिव)
API सर्वर बिल्ट-इन बिल्ट-इन मैनुअल
मॉडल फ़ॉर्मेट GGUF (ऑटो-डाउनलोड) GGUF SafeTensors / MLX
प्रदर्शन अच्छा GGUF के लिए सर्वश्रेष्ठ Apple Silicon के लिए सर्वश्रेष्ठ
मॉडल लाइब्रेरी क्यूरेटेड (ollama.com) HuggingFace GGUF HuggingFace MLX
भाषा Go (CLI/API) C++ (CLI/API) Python
सर्वश्रेष्ठ किसके लिए त्वरित डिप्लॉयमेंट, API सर्विंग अधिकतम नियंत्रण, कस्टम बिल्ड्स Python ML पाइपलाइन, अनुसंधान

3. Ollama के साथ सेटअप

Mac Mini M4 पर LLMs के साथ शुरुआत करने का सबसे आसान तरीका Ollama है। यह एक ही बाइनरी के साथ मॉडल डाउनलोडिंग, क्वांटाइज़ेशन और API सर्विंग को संभालता है।

चरण 1: Ollama इंस्टॉल करें

# Download and install Ollama
curl -fsSL https://ollama.com/install.sh | sh

# Verify installation
ollama --version
# ollama version 0.5.4

चरण 2: मॉडल डाउनलोड करें

# Download Llama 3 8B (4.7GB, fits 16GB RAM)
ollama pull llama3:8b

# Download Mistral 7B (4.1GB)
ollama pull mistral:7b

# Download Phi-3 Mini (2.3GB, great for constrained setups)
ollama pull phi3:mini

# Download Llama 3 70B (requires 48GB+ RAM)
ollama pull llama3:70b

# List downloaded models
ollama list
# NAME            SIZE     MODIFIED
# llama3:8b       4.7 GB   2 minutes ago
# mistral:7b      4.1 GB   5 minutes ago
# phi3:mini       2.3 GB   8 minutes ago

चरण 3: इंटरैक्टिव चैट चलाएं

# Start an interactive chat session
ollama run llama3:8b

# Example interaction:
# >>> What is the capital of France?
# The capital of France is Paris. It is the largest city in France
# and serves as the country's political, economic, and cultural center.

चरण 4: एक API के रूप में सर्व करें

Ollama स्वचालित रूप से पोर्ट 11434 पर एक REST API सर्वर शुरू करता है। आप OpenAI-संगत API का उपयोग करके किसी भी एप्लिकेशन से इसे क्वेरी कर सकते हैं।

# The Ollama server starts automatically, listening on localhost:11434

# Query using curl (OpenAI-compatible endpoint)
curl http://localhost:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "llama3:8b",
    "messages": [
      {"role": "system", "content": "You are a helpful coding assistant."},
      {"role": "user", "content": "Write a Python function to calculate fibonacci numbers."}
    ],
    "temperature": 0.7,
    "max_tokens": 500
  }'

# Native Ollama API endpoint
curl http://localhost:11434/api/generate \
  -d '{
    "model": "llama3:8b",
    "prompt": "Explain quantum computing in 3 sentences.",
    "stream": false
  }'

चरण 5: Python से उपयोग करें

# pip install openai
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:11434/v1",
    api_key="ollama"  # Ollama doesn't require an API key
)

response = client.chat.completions.create(
    model="llama3:8b",
    messages=[
        {"role": "system", "content": "You are a senior Python developer."},
        {"role": "user", "content": "Write a FastAPI endpoint for user registration."}
    ],
    temperature=0.7,
    max_tokens=1000
)

print(response.choices[0].message.content)

चरण 6: Ollama को एक बैकग्राउंड सेवा के रूप में चलाएं

# Create a launchd plist for auto-start on boot
cat <<EOF > ~/Library/LaunchAgents/com.ollama.server.plist
<?xml version="1.0" encoding="UTF-8"?>
<!DOCTYPE plist PUBLIC "-//Apple//DTD PLIST 1.0//EN"
  "http://www.apple.com/DTDs/PropertyList-1.0.dtd">
<plist version="1.0">
<dict>
    <key>Label</key>
    <string>com.ollama.server</string>
    <key>ProgramArguments</key>
    <array>
        <string>/usr/local/bin/ollama</string>
        <string>serve</string>
    </array>
    <key>RunAtLoad</key>
    <true/>
    <key>KeepAlive</key>
    <true/>
</dict>
</plist>
EOF

# Load the service
launchctl load ~/Library/LaunchAgents/com.ollama.server.plist

# Verify it's running
curl http://localhost:11434/api/tags

4. llama.cpp के साथ सेटअप

llama.cpp आपको इनफेरेंस पैरामीटर पर अधिकतम नियंत्रण देता है और अपने हाथ से ऑप्टिमाइज़ किए गए Metal बैकएंड की बदौलत अक्सर Apple Silicon पर सर्वश्रेष्ठ रॉ प्रदर्शन देता है।

चरण 1: Metal के साथ क्लोन और बिल्ड करें

# Install dependencies
brew install cmake

# Clone the repository
git clone https://github.com/ggerganov/llama.cpp.git
cd llama.cpp

# Build with Metal GPU acceleration (Apple Silicon)
mkdir build && cd build
cmake .. -DLLAMA_METAL=ON -DCMAKE_BUILD_TYPE=Release
cmake --build . --config Release -j$(sysctl -n hw.ncpu)

# Verify Metal support
./bin/llama-cli --help | grep metal

चरण 2: GGUF मॉडल डाउनलोड करें

# Install huggingface-cli for easy downloads
pip install huggingface_hub

# Download Llama 3 8B Q4_K_M (best quality/speed balance)
huggingface-cli download \
  TheBloke/Llama-3-8B-GGUF \
  llama-3-8b.Q4_K_M.gguf \
  --local-dir ./models

# Download Mistral 7B Q4_K_M
huggingface-cli download \
  TheBloke/Mistral-7B-Instruct-v0.2-GGUF \
  mistral-7b-instruct-v0.2.Q4_K_M.gguf \
  --local-dir ./models

# Download Phi-3 Mini Q4
huggingface-cli download \
  microsoft/Phi-3-mini-4k-instruct-gguf \
  Phi-3-mini-4k-instruct-q4.gguf \
  --local-dir ./models

चरण 3: इनफेरेंस चलाएं

# Run Llama 3 8B with Metal GPU offloading (all layers)
./build/bin/llama-cli \
  -m ./models/llama-3-8b.Q4_K_M.gguf \
  -ngl 99 \
  -c 4096 \
  -t 8 \
  --temp 0.7 \
  -p "Explain how transformers work in machine learning:"

# Key flags:
# -ngl 99     : Offload all layers to Metal GPU
# -c 4096     : Context window size
# -t 8        : Number of CPU threads (M4 has 10 cores)
# --temp 0.7  : Temperature for sampling

चरण 4: API सर्वर शुरू करें

# Start OpenAI-compatible API server
./build/bin/llama-server \
  -m ./models/llama-3-8b.Q4_K_M.gguf \
  -ngl 99 \
  -c 4096 \
  --host 0.0.0.0 \
  --port 8080 \
  --parallel 4

# Test the API
curl http://localhost:8080/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "llama-3-8b",
    "messages": [{"role": "user", "content": "Hello!"}]
  }'

5. MLX के साथ सेटअप

MLX, Apple का अपना मशीन लर्निंग फ़्रेमवर्क है, जिसे विशेष रूप से Apple Silicon के लिए डिज़ाइन किया गया है। यह M4 के GPU और Neural Engine के साथ सबसे मज़बूत एकीकरण प्रदान करता है, जो इसे Python-आधारित ML वर्कफ़्लो के लिए आदर्श बनाता है।

चरण 1: MLX इंस्टॉल करें

# Create a virtual environment
python3 -m venv ~/mlx-env
source ~/mlx-env/bin/activate

# Install MLX and the LLM package
pip install mlx mlx-lm

# Verify installation
python3 -c "import mlx.core as mx; print(mx.default_device())"
# Device(gpu, 0)

चरण 2: MLX के साथ इनफेरेंस चलाएं

# Run Llama 3 8B using mlx-lm CLI
mlx_lm.generate \
  --model mlx-community/Meta-Llama-3-8B-Instruct-4bit \
  --prompt "Write a Python decorator for rate limiting:" \
  --max-tokens 500 \
  --temp 0.7

# Run Mistral 7B
mlx_lm.generate \
  --model mlx-community/Mistral-7B-Instruct-v0.3-4bit \
  --prompt "Explain microservices architecture:" \
  --max-tokens 500

चरण 3: Python एकीकरण

from mlx_lm import load, generate

# Load the model (downloads on first run)
model, tokenizer = load("mlx-community/Meta-Llama-3-8B-Instruct-4bit")

# Generate text
prompt = "Write a bash script to monitor disk usage and send alerts:"
response = generate(
    model,
    tokenizer,
    prompt=prompt,
    max_tokens=500,
    temp=0.7,
    top_p=0.9
)
print(response)

# Streaming generation
from mlx_lm import stream_generate

for token in stream_generate(
    model, tokenizer,
    prompt="Explain Docker networking:",
    max_tokens=300
):
    print(token, end="", flush=True)

चरण 4: MLX के साथ एक सरल API बनाएं

# pip install fastapi uvicorn mlx-lm
from fastapi import FastAPI
from fastapi.responses import StreamingResponse
from mlx_lm import load, stream_generate
import json

app = FastAPI()
model, tokenizer = load("mlx-community/Meta-Llama-3-8B-Instruct-4bit")

@app.post("/v1/completions")
async def completions(request: dict):
    prompt = request.get("prompt", "")
    max_tokens = request.get("max_tokens", 256)

    response = ""
    for token in stream_generate(model, tokenizer, prompt=prompt, max_tokens=max_tokens):
        response += token

    return {"choices": [{"text": response}]}

@app.post("/v1/chat/completions")
async def chat(request: dict):
    messages = request.get("messages", [])
    prompt = tokenizer.apply_chat_template(messages, tokenize=False)

    response = ""
    for token in stream_generate(model, tokenizer, prompt=prompt, max_tokens=512):
        response += token

    return {
        "choices": [{
            "message": {"role": "assistant", "content": response}
        }]
    }

# Run: uvicorn server:app --host 0.0.0.0 --port 8000

6. प्रदर्शन बेंचमार्क

Q4_K_M क्वांटाइज़ेशन के साथ Ollama का उपयोग करके मापे गए वास्तविक-दुनिया के बेंचमार्क। सभी टेस्ट 512 टोकन प्रॉम्प्ट, 256 टोकन जनरेशन और डिफ़ॉल्ट सैंपलिंग पैरामीटर का उपयोग करते हैं।

हार्डवेयर मॉडल टोकन/सेकंड पहले टोकन तक का समय लागत/माह
Mac Mini M4 16GB Llama 3 8B Q4 ~35 tok/s ~180ms $85
Mac Mini M4 16GB Mistral 7B Q4 ~38 tok/s ~160ms $85
Mac Mini M4 24GB Llama 3 13B Q4 ~22 tok/s ~320ms $95
Mac Mini M4 Pro 48GB Llama 3 70B Q4 ~12 tok/s ~850ms $179
RTX 4090 (cloud) Llama 3 8B Q4 ~120 tok/s ~50ms $500+

नोट: जबकि NVIDIA GPUs अधिक रॉ थ्रूपुट प्रदान करते हैं, Mac Mini M4 इंटरैक्टिव उपयोग के मामलों के लिए लागत के एक अंश पर उत्कृष्ट टोकन/सेकंड देता है। 35 tok/s पर, चैट एप्लिकेशनों के लिए प्रतिक्रियाएं तात्कालिक महसूस होती हैं। असली फ़ायदा लागत है: $85/माह असीमित बनाम प्रति-टोकन भुगतान वाला API मूल्य जो आसानी से $500/माह से अधिक हो सकता है।

7. कौन से मॉडल किस कॉन्फ़िग में फ़िट होते हैं?

मुख्य कारक यूनिफाइड मेमोरी है। Q4 क्वांटाइज़ेशन के साथ, मॉडल प्रति अरब पैरामीटर लगभग 0.5-0.6 GB का उपयोग करते हैं, साथ ही कॉन्टेक्स्ट और OS के लिए ओवरहेड।

मेमोरी मॉडल आकार सीमा उदाहरण मॉडल मूल्य/माह
16 GB 7B - 13B (Q4) Llama 3 8B, Mistral 7B, Phi-3 Mini, Gemma 7B $85
24 GB 13B - 34B (Q4) Llama 3 13B, CodeLlama 34B, Yi 34B $95
48 GB 34B - 70B (Q4) Llama 3 70B, Mixtral 8x7B, DeepSeek 67B $179
64 GB+ 70B+ (Q4/Q6) Llama 3 70B Q6, Mixtral 8x22B, Command-R+ $249+
# Quick formula to estimate memory requirements:
# Memory needed = (Parameters in B * Bits per weight / 8) + context overhead
#
# Example: Llama 3 70B at Q4 quantization
# = (70 * 4 / 8) GB = 35 GB model weights
# + ~4 GB context/overhead
# = ~39 GB total → fits in 48GB Mac Mini M4 Pro
#
# Check current memory usage while running a model:
ollama ps
# NAME          SIZE     PROCESSOR    UNTIL
# llama3:8b     5.1 GB   100% GPU     4 minutes from now

8. उपयोग के मामले

निजी AI असिस्टेंट

एक ChatGPT-जैसा असिस्टेंट चलाएं जो सभी डेटा आपके सर्वर पर रखता है। कोई डेटा आपके इंफ्रास्ट्रक्चर से बाहर नहीं जाता। संवेदनशील दस्तावेज़ों, ग्राहक डेटा या स्वामित्व वाले कोड को संभालने के लिए एकदम सही।

अनुशंसित: 16GB पर Llama 3 8B

RAG पाइपलाइन

एक Retrieval-Augmented Generation सिस्टम बनाएं जो आपके दस्तावेज़ खोजता है और उत्तर उत्पन्न करता है। जनरेशन के लिए Ollama के साथ एम्बेडिंग हेतु ChromaDB या Qdrant का उपयोग करें।

अनुशंसित: 16GB पर Mistral 7B

कोड जनरेशन

ऑटोकम्प्लीट, कोड रिव्यू और स्वचालित रीफैक्टरिंग के लिए CodeLlama या DeepSeek Coder जैसे विशेष कोडिंग मॉडल का उपयोग करें। Continue.dev के जरिए VS Code या JetBrains के साथ एकीकृत करें।

अनुशंसित: 48GB पर CodeLlama 34B

कंटेंट जनरेशन

बड़े पैमाने पर मार्केटिंग कॉपी, ब्लॉग पोस्ट, उत्पाद विवरण और ईमेल टेम्पलेट उत्पन्न करें। प्रति-टोकन API लागत बढ़े बिना रात भर बैच जॉब्स चलाएं।

अनुशंसित: 48GB पर Llama 3 70B

9. प्रदर्शन युक्तियाँ

सही क्वांटाइज़ेशन चुनें

क्वांटाइज़ेशन स्तर गति और गुणवत्ता दोनों को नाटकीय रूप से प्रभावित करता है। अधिकांश उपयोग के मामलों के लिए Q4_K_M सर्वश्रेष्ठ संतुलन प्रदान करता है।

# Quantization levels (from fastest to best quality):
# Q2_K  - Fastest, lowest quality, smallest size
# Q3_K  - Fast, acceptable quality
# Q4_K_M - Best balance of speed and quality (RECOMMENDED)
# Q5_K_M - Slower, better quality
# Q6_K  - Slow, near-original quality
# Q8_0  - Slowest, best quality, largest size
# F16   - Full precision, requires 2x memory

# Example: Download Q4_K_M for best balance
ollama pull llama3:8b-instruct-q4_K_M

Metal GPU ऑफ़लोडिंग को अधिकतम करें

अधिकतम प्रदर्शन के लिए सुनिश्चित करें कि सभी मॉडल लेयर GPU पर चलें। आंशिक CPU ऑफ़लोडिंग थ्रूपुट को काफ़ी कम कर देती है।

# llama.cpp: offload all layers to GPU
./llama-cli -m model.gguf -ngl 99

# Check GPU utilization
sudo powermetrics --samplers gpu_power -n 1 -i 1000

# Monitor memory pressure
memory_pressure
# System-wide memory free percentage: 45%

बैच साइज़ और कॉन्टेक्स्ट को ऑप्टिमाइज़ करें

कॉन्टेक्स्ट विंडो का आकार घटाने से मेमोरी मुक्त होती है और थ्रूपुट बेहतर हो सकता है। केवल उतना ही कॉन्टेक्स्ट उपयोग करें जितनी आपके एप्लिकेशन को वास्तव में आवश्यकता है।

# Default context is often 4096 or 8192 tokens
# Reduce if you don't need long context:
ollama run llama3:8b --num-ctx 2048

# For llama.cpp, set context and batch size:
./llama-server -m model.gguf -ngl 99 \
  -c 2048 \      # Context window
  -b 512 \       # Batch size for prompt processing
  --parallel 2   # Concurrent request slots

मॉडल को मेमोरी में हॉट रखें

डिस्क से एक मॉडल लोड करने में कई सेकंड लगते हैं। तात्कालिक प्रतिक्रियाओं के लिए अक्सर उपयोग किए जाने वाले मॉडल को मेमोरी में रखें।

# Ollama: set keep-alive to keep model in memory indefinitely
curl http://localhost:11434/api/generate -d '{
  "model": "llama3:8b",
  "keep_alive": -1
}'

# Or set environment variable for default behavior
export OLLAMA_KEEP_ALIVE=-1

# Check which models are loaded
ollama ps

10. अक्सर पूछे जाने वाले प्रश्न

क्या मैं Mac Mini M4 पर ChatGPT-स्तर के मॉडल चला सकता हूँ?

हाँ। Llama 3 8B और Mistral 7B जैसे मॉडल कई कार्यों के लिए GPT-3.5 के बराबर गुणवत्ता देते हैं। GPT-4-स्तर की गुणवत्ता के लिए, आपको एक 70B मॉडल की आवश्यकता होगी जिसके लिए 48GB+ यूनिफाइड मेमोरी (Mac Mini M4 Pro) चाहिए। कोडिंग सहायता, दस्तावेज़ Q&A और कंटेंट जनरेशन के लिए अनुभव उत्कृष्ट है।

क्या रीयल-टाइम चैट के लिए 35 टोकन/सेकंड पर्याप्त तेज़ है?

बिल्कुल। औसत मानव पढ़ने की गति लगभग 4-5 शब्द प्रति सेकंड है, जो मोटे तौर पर 5-7 टोकन प्रति सेकंड के बराबर होती है। 35 tok/s पर, मॉडल एक मानव के पढ़ने की तुलना में 5-7x तेज़ी से टेक्स्ट उत्पन्न करता है। चैट एप्लिकेशनों के लिए, यह पूरी तरह तात्कालिक महसूस होता है।

एक Mac Mini M4 कितने समवर्ती उपयोगकर्ताओं को संभाल सकता है?

एक 7B मॉडल के साथ, एक अकेला Mac Mini M4 स्वीकार्य लेटेंसी के साथ 2-4 समवर्ती अनुरोधों को संभाल सकता है। अधिक समवर्तीता के लिए, आप एक लोड बैलेंसर के पीछे कई Mac Minis चला सकते हैं। Ollama और llama.cpp दोनों सर्वर समवर्ती अनुरोध कतारबद्धता को सपोर्ट करते हैं।

क्या मैं Mac Mini M4 पर मॉडल फ़ाइन-ट्यून कर सकता हूँ?

हाँ, सीमाओं के साथ। आप MLX या Hugging Face PEFT लाइब्रेरी का उपयोग करके 16GB डिवाइस पर LoRA/QLoRA के साथ 7B मॉडल फ़ाइन-ट्यून कर सकते हैं। बड़े मॉडलों की पूर्ण फ़ाइन-ट्यूनिंग के लिए अधिक मेमोरी की आवश्यकता होती है। 70B+ मॉडलों की प्रोडक्शन फ़ाइन-ट्यूनिंग के लिए, GPU सर्वर अधिक व्यावहारिक हैं।

मुझे कौन सा फ़्रेमवर्क चुनना चाहिए: Ollama, llama.cpp या MLX?

यदि आप सबसे तेज़ सेटअप और आसान API सर्विंग चाहते हैं तो Ollama चुनें। इनफेरेंस पैरामीटर पर अधिकतम नियंत्रण और सर्वश्रेष्ठ GGUF मॉडल प्रदर्शन के लिए llama.cpp चुनें। यदि आप Python ML पाइपलाइन बना रहे हैं और नेटिव Apple Silicon ऑप्टिमाइज़ेशन चाहते हैं तो MLX चुनें। कई उपयोगकर्ता Ollama से शुरू करते हैं और जैसे-जैसे उनकी ज़रूरतें बढ़ती हैं, llama.cpp या MLX पर चले जाते हैं।

संबंधित गाइड्स

Apple Silicon पर LLMs चलाना शुरू करें

एक डेडिकेटेड Mac Mini M4 सर्वर प्राप्त करें और असीमित इनफेरेंस के साथ Llama, Mistral या Phi चलाएं। $85/माह से।

और जानकारी चाहिए?

चरण-दर-चरण सेटअप, कॉन्फ़िगरेशन संदर्भ और समस्या-निवारण के लिए संपूर्ण दस्तावेज़ देखें।

दस्तावेज़ खोलें →