AI Agent Hub

Compare LLM Models

Select 2-5 models to compare side by side.

Select models to compare 0 / 5 selected
Select 2-5 models
Attribute
🤖 Qwen3-8B
Company
Release Date 2025-04-29
Parameters (B) 8.2
Architecture Transformer
Context Window 128000
Input Modalities text
Open Source Yes
License apache-2.0
Score 8.5
VRAM (GB) 16
Compute Single NVIDIA GPU with at least 16GB VRAM for BF16 inference (~15.9GB measured); ~6GB with AWQ-INT4 quantization. Runs on CUDA GPUs via Transformers, vLLM, or SGLang; also supports CPU inference via Ollama and llama.cpp.
Benchmark: GSM8K 89.8
Benchmark: HumanEval 67.7
Benchmark: MMLU 87.5
Pricing (Input)
Pricing (Output)