AI Agent Hub

LLM Models

Browse the world's large language models. Compare parameters, benchmarks, VRAM and more.

562 models for "Vision" Compare
InternVL3-78B-AWQ logo
InternVL3-78B-AWQ
OpenGVLab

[\[📂 GitHub\]](https://github.com/OpenGVLab/InternVL) [\[📜 InternVL 1.0\]](https://huggingface.co/papers/2312.14238) [\[📜 InternVL 1.5\]](https://huggingface.co/papers/2404.16821) [\[📜 InternVL 2.5\]](https://huggingface.co/papers/2412.05271) [\[📜 InternVL2.5-MPO\]](https://huggi…

Multimodal 78.0B ↓ 702
SmolVLM2-2.2B-Base logo
SmolVLM2-2.2B-Base
HuggingFaceTB

This is the base model for SmolVLM2-2.2B, a lightweight multimodal model designed to analyze video content. The model processes videos, images, and text inputs to generate text outputs - whether answering questions about media files, comparing visual content, or transcribing text…

Multimodal 2.2B ↓ 689
JanusCoderV-7B logo
JanusCoderV-7B
internlm

💻Github Repo • 🤗Model Collections • 📜Technical Report

Code 7.0B ↓ 689
Falcon-E-1B-Base logo
Falcon-E-1B-Base
tiiuae

0. TL;DR 1. Model Details 2. Training Details 3. Usage 4. Evaluation 5. Citation

Open Source 1.0B ↓ 689
ERNIE-4.5-VL-424B-A47B-PT logo
ERNIE-4.5-VL-424B-A47B-PT
baidu

[!NOTE] Note: " -Paddle " models use PaddlePaddle weights, while " -PT " models use Transformer-style PyTorch weights.

Multimodal 424.0B ↓ 685
cogvlm-grounding-generalist-hf logo
cogvlm-grounding-generalist-hf
zai-org

CogVLM 是一个强大的开源视觉语言模型(VLM)。CogVLM-17B 拥有 100 亿视觉参数和 70 亿语言参数,在 10 个经典跨模态基准测试上取得了 SOTA 性能,包括 NoCaps、Flicker30k captioning、RefCOCO、RefCOCO+、RefCOCOg、Visual7W、GQA、ScienceQA、VizWiz VQA 和 TDIUC,而在 VQAv2、OKVQA、TextVQA、COCO captioning 等方面则排名第二,超越或与 PaLI-X 55B 持平。您可以通过线上 demo 体验 CogVLM 多…

Multimodal 17.0B ↓ 678
Hy-Embodied-VLM-1.0 logo
Hy-Embodied-VLM-1.0
tencent

Hy-Embodied-VLM-1.0 Efficient Physical-World Agents Tencent Robotics X × Hy Vision Team × Futian Laboratory

Multimodal ↓ 659
cogagent-vqa-hf logo
cogagent-vqa-hf
zai-org

CogAgent is an open-source visual language model improved based on CogVLM .

Multimodal 18.0B ↓ 654
HY-Embodied-0.5-X logo
HY-Embodied-0.5-X
tencent

HY-Embodied-0.5-X An Enhanced Embodied Foundation Model for Real-World Agents Tencent Robotics X × HY Vision Team

Open Source ↓ 651
UI-TARS-72B-DPO logo
UI-TARS-72B-DPO
ByteDance-Seed

UI-TARS-72B-DPO UI-TARS-2B-SFT     UI-TARS-7B-SFT     UI-TARS-7B-DPO (Recommended)     UI-TARS-72B-SFT     UI-TARS-72B-DPO (Recommended) Introduction

Open Source 72.0B ↓ 643
Tencent-Hunyuan-Large logo
Tencent-Hunyuan-Large
tencent

&nbsp GITHUB &nbsp&nbsp &nbsp&nbsp🖥️&nbsp&nbsp official website &nbsp&nbsp|&nbsp&nbsp🕖&nbsp&nbsp HunyuanAPI |&nbsp&nbsp🐳&nbsp&nbsp Gitee Technical Report &nbsp&nbsp|&nbsp&nbsp Demo &nbsp&nbsp&nbsp|&nbsp&nbsp Tencent Cloud TI &nbsp&nbsp&nbsp

Open Source ↓ 641
InternVL3_5-1B-Instruct logo
InternVL3_5-1B-Instruct
OpenGVLab

[\[📂 GitHub\]](https://github.com/OpenGVLab/InternVL) [\[📜 InternVL 1.0\]](https://huggingface.co/papers/2312.14238) [\[📜 InternVL 1.5\]](https://huggingface.co/papers/2404.16821) [\[📜 InternVL 2.5\]](https://huggingface.co/papers/2412.05271) [\[📜 InternVL2.5-MPO\]](https://huggi…

Multimodal 1.0B ↓ 641