LLM model: Spark X2.5 4B

Model profile
Model Size Approximate size
Spark X2.5 4BModel source: provider1,048,576 tokens max native context 4B 2.4 GB4-bit quantization
Compatible hardware Estimated speeds, not benchmark results: calculated from memory bandwidth and model size. Real results can differ significantly because there is no precise formula for deriving LLM generation speed from hardware specifications alone.
Hardware Memory Bandwidth vLLM Estimated generation
DDR4 16GB Computer 16 GBRAM 51.2 GB/s no 11 tok/s4-bit quantization
DDR5 16GB Computer 16 GBRAM 89.6 GB/s no 20 tok/s4-bit quantization
DDR5 32GB Computer 32 GBRAM 89.6 GB/s no 20 tok/s4-bit quantization
Mac mini M4 24 GBUnified RAM 120 GB/s no 26 tok/s4-bit quantization
RTX 2000 Ada 16 GBGPU VRAM 224 GB/s yes 49 tok/s4-bit quantization
Radeon 8060S 96GB 96 GBUnified RAM 256 GB/s yes 56 tok/s4-bit quantization
M4 Pro 24 GBUnified RAM 273 GB/s no 59 tok/s4-bit quantization
DGX Spark 128 GBUnified RAM 273 GB/s yes 59 tok/s4-bit quantization
RTX 4060 Ti 16GB 16 GBGPU VRAM 288 GB/s yes 62 tok/s4-bit quantization
M5 Pro 64 GBUnified RAM 307 GB/s no 66 tok/s4-bit quantization
RTX 3060 12GB 12 GBGPU VRAM 360 GB/s yes 77 tok/s4-bit quantization
RTX 5060 Ti 16GB 16 GBGPU VRAM 448 GB/s yes 95 tok/s4-bit quantization
M5 Max 128 GBUnified RAM 614 GB/s no 127 tok/s4-bit quantization
M3 Ultra 96 GBUnified RAM 819 GB/s no 164 tok/s4-bit quantization
RTX 5080 16 GBGPU VRAM 960 GB/s yes 188 tok/s4-bit quantization
RTX 3090 Ti 24 GBGPU VRAM 1008 GB/s yes 196 tok/s4-bit quantization
M5 Ultra 256 GBUnified RAM 1200 GB/s no 227 tok/s4-bit quantization
RTX 5090 32 GBGPU VRAM 1792 GB/s yes 313 tok/s4-bit quantization
RTX PRO 6000 96 GBGPU VRAM 1792 GB/s yes 313 tok/s4-bit quantization
DGX H200 1128 GBGPU HBM3e 4800 GB/s yes 602 tok/s4-bit quantization
DGX Station 748 GBCoherent Memory 7100 GB/s yes 732 tok/s4-bit quantization
ET900N G3 748 GBCoherent Memory 7100 GB/s yes 732 tok/s4-bit quantization
DGX B200 1440 GBGPU HBM3e 8000 GB/s yes 771 tok/s4-bit quantization
GB200 NVL72 13400 GBGPU HBM3e 8000 GB/s yes 771 tok/s4-bit quantization
GB300 NVL72 20000 GBGPU HBM3e 8000 GB/s yes 771 tok/s4-bit quantization
3 videos found Showing 1-3

Ai4Users.com

Copyright © 2026 Piotr Szawdyński. All rights reserved.