How to Run Claude Code & OpenCode FREE Locally? In-Depth Review 🤔
Evaluates Claude Code, OpenCode and native Inferencer using Qwen4 Exp on Mac Studio M3 Ultra via Tic-Tac-Toe generation, modifications, image inferencing and token usage comparisons.
| Hardware profile | ||||
|---|---|---|---|---|
| Hardware | Memory | Bandwidth | Computing power | vLLM |
| M3 UltraApple Mac Studio M3 Ultra 80-core GPU configuration with 96 GB unified memory | 96 GBUnified RAM | 819 GB/s | ~120 TOPS | no |
| Compatible models Estimated speeds, not benchmark results: calculated from memory bandwidth and model size. Real results can differ significantly because there is no precise formula for deriving LLM generation speed from hardware specifications alone. | |||
|---|---|---|---|
| Model | Size | Approx. Q4 memory | Estimated generation |
| Mistral Medium 3.5Dense | 128B | 76.8 GB | 5 tok/s4-bit quantization |
| Qwen 3.8 Flash NextMoE | 125Bactive 6B | 75 GB | 83 tok/s4-bit quantization |
| Ling 3.0 Flash VLMoE | 124Bactive 5.5B | 74.4 GB | 90 tok/s4-bit quantization |
| Ling 3.0 FlashMoE | 124Bactive 5.1B | 74.4 GB | 96 tok/s4-bit quantization |
| Qwen 3.5 122BMoE | 122Bactive 10B | 73.2 GB | 52 tok/s4-bit quantization |
| Nemotron 3 SuperMoE | 120Bactive 12B | 72 GB | 44 tok/s4-bit quantization |
| Mistral Small 4MoE | 119Bactive 6.5B | 71.4 GB | 77 tok/s4-bit quantization |
| Laguna S 2.1MoE | 118Bactive 8B | 70.8 GB | 64 tok/s4-bit quantization |
| GPT-OSS 120BMoE | 116.8Bactive 5.1B | 70.1 GB | 96 tok/s4-bit quantization |
| Sarvam 105BMoE | 105Bactive 10.3B | 63 GB | 51 tok/s4-bit quantization |
| Qwen 3 Coder Next 80BMoE | 80Bactive 3B | 48 GB | 148 tok/s4-bit quantization |
| Ornith 1.0 35BMoE | 35Bactive 3B | 21 GB | 148 tok/s4-bit quantization |
| Ornith 1.5 35BMoE | 35Bactive 3B | 21 GB | 148 tok/s4-bit quantization |
| Qwen 3.6 35BMoE | 35Bactive 3B | 21 GB | 148 tok/s4-bit quantization |
| Laguna XS 2.1MoE | 33Bactive 3B | 19.8 GB | 148 tok/s4-bit quantization |
| Qwen 2.5 32BDense | 32.5B | 19.5 GB | 22 tok/s4-bit quantization |
| Gemma 4 31BDense | 31B | 18.6 GB | 23 tok/s4-bit quantization |
| Qwen 3 Coder 30BMoE | 30.5Bactive 3.3B | 18.3 GB | 137 tok/s4-bit quantization |
| Granite 4.1 30BDense | 30B | 18 GB | 24 tok/s4-bit quantization |
| Granite 4.2 30BDense | 30B | 18 GB | 24 tok/s4-bit quantization |
| Muse GlimmerDense | 30B | 18 GB | 24 tok/s4-bit quantization |
| GLM 4.7 FlashMoE | 30Bactive 3B | 18 GB | 148 tok/s4-bit quantization |
| Nemotron 3.5 LightningMoE | 30Bactive 3B | 18 GB | 148 tok/s4-bit quantization |
| Fara 1.5 27BDense | 27B | 16.2 GB | 27 tok/s4-bit quantization |
| Qwen 3.6 27BDense | 27B | 16.2 GB | 27 tok/s4-bit quantization |
| Qwen 3.8 27BDense | 27B | 16.2 GB | 27 tok/s4-bit quantization |
| Gemma 4 26BMoE | 26Bactive 4B | 15.6 GB | 117 tok/s4-bit quantization |
| GPT-OSS 20BMoE | 20.9Bactive 3.6B | 12.5 GB | 128 tok/s4-bit quantization |
| Instella-MoE 16B ThinkMoE | 16Bactive 2.8B | 9.6 GB | 156 tok/s4-bit quantization |
| Qwen 3 14BDense | 14B | 8.4 GB | 51 tok/s4-bit quantization |
| Gemma 3 12BDense | 12B | 7.2 GB | 59 tok/s4-bit quantization |
| Gemma 4 12BDense | 12B | 7.2 GB | 59 tok/s4-bit quantization |
| Fara 1.5 9BDense | 9B | 5.4 GB | 78 tok/s4-bit quantization |
| Ornith 1.0 9BDense | 9B | 5.4 GB | 78 tok/s4-bit quantization |
| Ornith 1.5 9BDense | 9B | 5.4 GB | 78 tok/s4-bit quantization |
| Qwen 3.5 9BDense | 9B | 5.4 GB | 78 tok/s4-bit quantization |
| Qwythos 9BDense | 9B | 5.4 GB | 78 tok/s4-bit quantization |
| Granite 4.1 8BDense | 8B | 4.8 GB | 87 tok/s4-bit quantization |
| Granite 4.2 8BDense | 8B | 4.8 GB | 87 tok/s4-bit quantization |
| Qwen 3 8BDense | 8B | 4.8 GB | 87 tok/s4-bit quantization |
| Ling 3.0 TinyMoE | 7.9Bactive 1.3B | 4.7 GB | 265 tok/s4-bit quantization |
| Fara 1.5 4BDense | 4B | 2.4 GB | 164 tok/s4-bit quantization |
| Gemma 3 4BDense | 4B | 2.4 GB | 164 tok/s4-bit quantization |
| Qwen 3 4B Instruct 2507Dense | 4B | 2.4 GB | 164 tok/s4-bit quantization |
| Qwen 3.5 4BDense | 4B | 2.4 GB | 164 tok/s4-bit quantization |
| Spark X2.5 4BDense | 4B | 2.4 GB | 164 tok/s4-bit quantization |
| Granite 4.1 3BDense | 3B | 1.8 GB | 210 tok/s4-bit quantization |
| Granite 4.2 3BDense | 3B | 1.8 GB | 210 tok/s4-bit quantization |
| Llama 3.2 3B InstructDense | 3B | 1.8 GB | 210 tok/s4-bit quantization |
| Ministral 3 3BDense | 3B | 1.8 GB | 210 tok/s4-bit quantization |
| Nanbeige 4.2 3BDense | 3B | 1.8 GB | 210 tok/s4-bit quantization |
Evaluates Claude Code, OpenCode and native Inferencer using Qwen4 Exp on Mac Studio M3 Ultra via Tic-Tac-Toe generation, modifications, image inferencing and token usage comparisons.
Runs DeepSeek-V4.1-MLX-Q4i via Inferencer v2.2.8 on Mac Studio M3 Ultra 512, testing math, coding, logic, office apps, canvas animations, 3D simulations, games, and image generation.
Evaluates GLM 5.3 MLX Q4i on Mac Studio M3 Ultra across Low, High, Max and MinMax thinking modes using coding tasks and complex simulations.
Tests Hy4 Preview against GLM 5.3 using Inferencer App Q4-INF quantization on Mac Studio M3 Ultra 512 GiB via thinking mode performance, UI testing, censorship checks, complex code modification, game
Tests DeepSeek-V4-Flash-Vision-Exp-MLX on Mac Studio M3 Ultra using Inferencer v2.2.7 for image-to-game generation, thinking modes, AAA graphics, face recreation, OCR, procedural assets, logic, coding
Compares a $60,000 512GB Mac Studio cluster running Kimi K3 against a $10/month cloud coding agent to evaluate performance differences.
Evaluates Zhipu GLM-5.3 using Inferencer App on Mac Studio M3 Ultra 512 GiB with GLM-5.3-MLX-Q4-INF, testing thinking modes, coding stress tests and logic against cloud performance.
Runs GLM-5-Flash using Inferencer App v2.3.5 on an M3 Ultra 512 GiB system with the inferencerlabs/GLM-5.3-Flash-MLX-Q9 quantization via local testing.
Evaluates Qwen3.8-Flash-Next-MLX-Q9 and Q4 variants using Inferencer App v2.3.4 on an M3 Ultra 512 GiB system via local testing.
Evaluates Ling-3.0-flash using Inferencer App v2.3.4 on M3 Ultra 512 GiB, noting its Kimi K3 attention architecture and origin from Qwen's sibling company.
Evaluates Ornith-1.5-397B-MLX-Q9 performance using Inferencer App on M3 Ultra 512 GiB against claims of surpassing GLM 5.2, Opus and Qwen 3.8 MAX.
Tests Qwen 3.8 using Inferencer App v2.3.3 on M3 Ultra 512 GiB across 2 million tokens, varying temperature, quantization levels, and thinking modes.
Evaluates Qwen3.8-27B-MLX-Q9 performance using Inferencer App v2.3.2 on M3 Ultra 512 GiB across one million tokens.
Benchmark comparisons of Muse Glimmer against Qwen and Kimi K3 using Inferencer App v2.3.2 on M3 Ultra 512 GiB hardware.
Evaluates Inkling-Small MLX Q9 using Inferencer App on M3 Ultra 512 GiB hardware, highlighting its status as a benchmark-topping open weight model with multimodal inference capabilities.
Speed test of DeepSeek-V4-Flash-0731-MLX using Inferencer App v2.2.3 and DSpark on Mac Studio M3 Ultra 512 GiB.
Evaluates DeepSeek-V4-Flash-0731-MLX using Inferencer App v2.2.3 on M3 Ultra 512 GiB across local and cloud setups against GLM 5.2 benchmarks.
Evaluates Inferencer Labs' Macaron-V1 LoRA for GLM-5.2 on an M3 Ultra 512GB using music generation, human anatomy, game development tasks and photorealistic face creation tests.
Tests Laguna S2.1 using Inferencer App v2.2.2 on M3 Ultra 512 GiB against DeepSeek and GLM based on benchmarks claiming superiority.
Tests Intern S2 Preview 397B MLX Q9 against Claude and Kimi K3 using Inferencer App v2.2.2 on Mac Studio M3 Ultra 512 GiB for scientific research tasks.
Evaluates Inkling MLX Q3 using Inferencer App v2.2.1 on M3 Ultra 512 GiB across maths, safety, vision tasks, gaming simulations, image inference and audio capabilities.
Compares local GLM 5.2 on M3 Ultra 512GB via Inferencer App against cloud Claude Sonnet 5 and Opus 4.8 using CometAPI in Chat, Terminal, and AI Agent OpenCode modes for speed and capability.
Ornith-1.0-397B is tested using Inferencer App v2.0.6 on M3 Ultra 512GB, reportedly topping GLM 5.2 and Claude Opus in benchmarks.
Tests the speed impact of Multi-Token Prediction on GLM 5.2 using Inferencer App v2.0.6 on an M3 Ultra 512GB system.
Compares local models GLM 5.2 and Kimi K2.7 Code against cloud options Gemini Pro, Claude Sonnet, and Claude Fable using Inferencer App on Mac Studio M3 Ultra 512GB across game development tasks.
Evaluates GLM 5.2 performance using Inferencer App on M3 Ultra 512GB across photorealism, sound generation, 3D game dev, coding, maths, logic tests and AI safety.
Evaluates Kimi K2.7 Code performance using Inferencer App on M3 Ultra 512GB, comparing local, clustered, and cloud inference against Claude Max across sound, photorealism, coding, vision, logic, and m
Evaluates Macaron-V1 LoRA for GLM-5.1 against Claude using Inferencer App on M3 Ultra 512GB across coding, maths, logic, thinking, photorealistic face generation and Flappy Birds tasks.
Nex-AGI updates Qwen 397B to top GLM 5.1 and Claude Opus in benchmarks using Inferencer App on Mac Studio M3 Ultra 512GB with Nex-N2-Pro.
Evaluates NVIDIA Nemotron 3 Ultra using Inferencer App on M3 Ultra 512GB hardware against state-of-the-art models under the new Open License.
Compares multiprocessing, batching, and distributed compute speed using Inferencer App v2.0 on M3 Ultra 512GB and M4 Max 128GB systems.