Compare LLM Models
Select 2-5 models to compare side by side.
Select models to compare
0 / 5 selected
Select 2-5 models
| Attribute |
🤖
Qwen3-8B
|
|---|---|
| Company | |
| Release Date | 2025-04-29 |
| Parameters (B) | 8.2 |
| Architecture | Transformer |
| Context Window | 128000 |
| Input Modalities | text |
| Open Source | Yes |
| License | apache-2.0 |
| Score | 8.5 |
| VRAM (GB) | 16 |
| Compute | Single NVIDIA GPU with at least 16GB VRAM for BF16 inference (~15.9GB measured); ~6GB with AWQ-INT4 quantization. Runs on CUDA GPUs via Transformers, vLLM, or SGLang; also supports CPU inference via Ollama and llama.cpp. |
| Benchmark: GSM8K | 89.8 |
| Benchmark: HumanEval | 67.7 |
| Benchmark: MMLU | 87.5 |
| Pricing (Input) | — |
| Pricing (Output) | — |