AI Agent Hub

LLM Models

Browse the world's large language models. Compare parameters, benchmarks, VRAM and more.

562 models for "Vision" Compare
Florence-2-large logo
Florence-2-large
microsoft

Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks

Multimodal 0.77B ↓ 387.6K
SmolVLM-256M-Instruct logo
SmolVLM-256M-Instruct
HuggingFaceTB

SmolVLM-256M is the smallest multimodal model in the world. It accepts arbitrary sequences of image and text inputs to produce text outputs. It's designed for efficiency. SmolVLM can answer questions about images, describe visual content, or transcribe text. Its lightweight archi…

Multimodal 0.256B ↓ 380.8K
Phi-3-mini-4k-instruct logo
Phi-3-mini-4k-instruct
microsoft

🎉 Phi-3.5 : [[mini-instruct]](https://huggingface.co/microsoft/Phi-3.5-mini-instruct); [[MoE-instruct]](https://huggingface.co/microsoft/Phi-3.5-MoE-instruct) ; [[vision-instruct]](https://huggingface.co/microsoft/Phi-3.5-vision-instruct)

Open Source ↓ 366.6K
Phi-3.5-mini-instruct logo
Phi-3.5-mini-instruct
microsoft

🎉 Phi-4 : [multimodal-instruct onnx]; [mini-instruct onnx]

Open Source ↓ 364.5K
Kimi-K2.5 logo
Kimi-K2.5
moonshotai

📰   Tech Blog         📄   Paper

Open Source ↓ 335.9K
granite-3.3-2b-instruct logo
granite-3.3-2b-instruct
ibm-granite

Model Summary: Granite-3.3-2B-Instruct is a 2-billion parameter 128K context length language model fine-tuned for improved reasoning and instruction-following capabilities. Built on top of Granite-3.3-2B-Base, the model delivers significant gains on benchmarks for measuring gener…

Open Source 2.0B ↓ 328.7K
OLMo-2-0425-1B logo
OLMo-2-0425-1B
allenai

We introduce OLMo 2 1B, the smallest model in the OLMo 2 family. OLMo 2 was pre-trained on OLMo-mix-1124 and uses Dolmino-mix-1124 for mid-training.

Open Source 1.0B ↓ 314.9K
granite-docling-258M logo
granite-docling-258M
ibm-granite

granite-docling-258m Granite Docling is a multimodal Image-Text-to-Text model engineered for efficient document conversion. It preserves the core features of Docling while maintaining seamless integration with DoclingDocuments to ensure full compatibility.

Multimodal 0.258B ↓ 276K
medgemma-27b-it logo
medgemma-27b-it
google

Multimodal 27.0B ↓ 248.8K
paligemma-3b-pt-224 logo
paligemma-3b-pt-224
google

Multimodal 3.0B ↓ 235.5K
medgemma-1.5-4b-it logo
medgemma-1.5-4b-it
google

Multimodal 4.0B ↓ 231.8K
Kimi-VL-A3B-Instruct logo
Kimi-VL-A3B-Instruct
moonshotai

📄 Tech Report     📄 Github     💬 Chat Web

Multimodal 16.0B ↓ 228.5K