Language models: prices and hardware for each
709 models. For the 25 that clouds sell per token, what each cloud charges; for every open model, the GPU memory it needs and the cheapest hardware that holds it.
Sold per token
- OpenAI gpt-oss 120B
- OpenAI gpt-oss 20B
- Llama 3.3 70B
- Llama 4 Maverick 17B
- Llama 4 Scout 17B
- Qwen3 32B
- Cohere Command A
- DeepSeek V3.1
- Llama 3.1 405B
- Mistral Small
- GPT-4o
- GPT-5
- Qwen3 235B A22B
- Amazon Nova Lite
- Amazon Nova Pro
- Claude Haiku 4.5
- Claude Sonnet 4.5
- Gemini 2.5 Flash
- Gemini 2.5 Flash Lite
- Gemini 2.5 Pro
- Llama 3.1 70B
- Llama 3.1 8B
- Phi-4
- Mistral 7B
- Mistral Large
01.AI
- Yi-34B-Chat (34.39 B)
- Yi-6B-Chat (6.06 B)
- Yi-6B-200K (6.06 B)
- Yi-1.5-9B-Chat (8.83 B)
- Yi-1.5-34B-Chat (34.39 B)
AI Singapore
- Qwen-SEA-LION-v4-32B-IT (32.76 B)
Ai2
- Olmo-3-7B-Instruct (7.3 B)
- Olmo-3-7B-Think (7.3 B)
- OLMo-2-0425-1B (1.48 B)
- wildguard (7.25 B)
- OLMoE-1B-7B-0125-Instruct (6.92 B)
- Olmo-3-1025-7B (7.3 B)
- OLMoE-1B-7B-0924 (6.92 B)
- OLMo-2-0425-1B-Instruct (1.48 B)
- OLMo-1B-hf (1.18 B)
- Olmo-3-32B-Think-SFT (32.23 B)
- OLMo-2-0325-32B-Instruct (32.23 B)
- Olmo-3-7B-Instruct-SFT (7.3 B)
- OLMo-2-1124-7B-Instruct (7.3 B)
- Olmo-3-1125-32B (32.23 B)
- Molmo-7B-D-0924 (8.02 B)
- OLMoE-1B-7B-0924-Instruct (6.92 B)
- Olmo-3.1-32B-Think (32.23 B)
- OLMo-2-1124-13B-Instruct (13.72 B)
- Llama-3.1-Tulu-3-8B-SFT (8.03 B)
- Olmo-3.1-32B-Instruct (32.23 B)
- Olmo-Hybrid-7B (7.43 B)
Amazon
Anthropic
Baidu
- ERNIE-4.5-21B-A3B-Thinking (21.83 B)
- ERNIE-4.5-21B-A3B-PT (21.95 B)
BigScience
- bloomz-560m (0.56 B)
- bloom-560m (0.56 B)
ByteDance
- Ouro-1.4B (1.43 B)
- Ouro-1.4B-Thinking (1.43 B)
Cohere
DeepSeek
- DeepSeek V3.1 (671 B)
- DeepSeek-V4-Flash-0731 (304.18 B)
- DeepSeek-V3.2 (685.36 B)
- DeepSeek-V3-0324 (684.53 B)
- DeepSeek-V4-Flash (290.94 B)
- DeepSeek-R1 (684.49 B)
- DeepSeek-R1-Distill-Qwen-1.5B (1.78 B)
- DeepSeek-Coder-V2-Lite-Instruct (15.71 B)
- DeepSeek-V4.1-Flash (763.21 B)
- DeepSeek-R1-0528-Qwen3-8B (8.19 B)
- deepseek-coder-7b-instruct-v1.5 (6.91 B)
- DeepSeek-V4-Pro (1598.84 B)
- DeepSeek-R1-Distill-Qwen-32B (32.76 B)
- DeepSeek-R1-Distill-Qwen-14B (14.77 B)
- DeepSeek-R1-Distill-Qwen-7B (7.62 B)
- DeepSeek-V2-Lite (15.71 B)
- DeepSeek-R1-0528 (684.53 B)
- DeepSeek-R1-Distill-Llama-8B (8.03 B)
- deepseek-coder-6.7b-instruct (6.74 B)
- DeepSeek-V2-Lite-Chat (15.71 B)
- deepseek-coder-6.7b-base (6.74 B)
- DeepSeek-V4-Pro-0813 (1650.5 B)
- DeepSeek-R1-Distill-Llama-70B (70.55 B)
- DeepSeek-V3.2-Exp (685.4 B)
- deepseek-coder-1.3b-instruct (1.35 B)
- DeepSeek-V2 (235.74 B)
- deepseek-moe-16b-chat (16.38 B)
- DeepSeek-V3.1-Terminus (684.53 B)
- DeepSeek-V3.1-Base (684.53 B)
- DeepSeek-V2-Chat (235.74 B)
EleutherAI
- pythia-6.9b (6.99 B)
- gpt-neox-20b (20.74 B)
- pythia-410m (0.51 B)
- pythia-1.4b (1.52 B)
- pythia-1b (1.08 B)
- pythia-410m-deduped (0.51 B)
- gpt-neo-1.3B (1.37 B)
- pythia-2.8b (2.91 B)
- pythia-1b-deduped (1.08 B)
- pythia-12b (12 B)
- pythia-1.4b-deduped (1.41 B)
- Gemini 2.5 Flash
- Gemini 2.5 Flash Lite
- Gemini 2.5 Pro
- gemma-4-26B-A4B-it (25.81 B)
- gemma-4-31b-it (31.27 B)
- gemma-3-1b-it (google) (1 B)
- gemma-4-12B-it (11.96 B)
- gemma-3-4b-it (4.3 B)
- gemma-2-9b-it (9.24 B)
- gemma-2-2b-it (google) (2.61 B)
- gemma-3-12b-it (12.19 B)
- gemma-3-27b-it (27.43 B)
- gemma-2-2b (2.61 B)
- gemma-2b (2.51 B)
- gemma-3-270m-it (0.27 B)
- gemma-3-1b-pt (1 B)
- gemma-1.1-2b-it (2.51 B)
- gemma-4-26B-A4B (26.54 B)
- codegemma-7b-it (8.54 B)
- gemma-2-9b (9.24 B)
- gemma-7b-it (8.54 B)
- medgemma-27b-text-it (27.01 B)
- gemma-2-27b-it (27.23 B)
- gemma-2b-it (google) (2.51 B)
- gemma-7b (8.54 B)
Hugging Face
- SmolLM3-3B (3.08 B)
- SmolLM2-1.7B-Instruct (1.71 B)
- SmolLM3-3B-Base (3.08 B)
- zephyr-7b-beta (7.24 B)
- SmolLM-1.7B (1.71 B)
- SmolLM2-1.7B (1.71 B)
IBM
- granite-4.1-3b (3.4 B)
- granite-4.1-30b (28.87 B)
- granite-4.1-8b (8.79 B)
- granite-4.2-8b (8.79 B)
- granite-3.0-1b-a400m-instruct (1.33 B)
- granite-3.3-8b-instruct (8.17 B)
- granite-4.0-tiny-preview (6.67 B)
- granite-4.0-h-tiny (6.94 B)
- granite-guardian-4.1-8b (8.38 B)
- granite-3.1-8b-instruct (8.17 B)
- granite-3.2-8b-instruct (8.17 B)
- granite-4.1-8b-fp8 (8.79 B)
- granite-4.2-3b (3.66 B)
- granite-3.3-2b-instruct (2.53 B)
- granite-4.0-1b-base (1.63 B)
- granite-3b-code-base-2k (3.48 B)
- granite-4.2-30b (29.28 B)
- granite-4.0-micro (3.4 B)
- granite-4.0-h-small (32.21 B)
- granite-swash-2b (2.14 B)
- granite-3.0-8b-instruct (8.17 B)
- granite-swash-3b-a600m (3.02 B)
- granite-3.0-1b-a400m-base (1.38 B)
- granite-4.0-1b (1.63 B)
InternLM
- internlm2-chat-7b (7.74 B)
- internlm3-8b-instruct (8.8 B)
- internlm2_5-7b-chat (7.74 B)
- internlm2-chat-20b (19.86 B)
- Intern-S1 (240.71 B)
- Intern-S1-mini (8.54 B)
Meta
- Llama 3.3 70B (70 B)
- Llama 4 Maverick 17B (400 B)
- Llama 4 Scout 17B (109 B)
- Llama 3.1 405B (405 B)
- Llama 3.1 70B (70 B)
- Llama 3.1 8B (8 B)
- Llama-3.2-1B-Instruct (meta-llama) (1.24 B)
- Llama-3.2-3B-Instruct (meta-llama) (3.21 B)
- Meta-Llama-3-8B-Instruct (meta-llama) (8.03 B)
- Llama-2-7b-hf (6.74 B)
- Llama-3.2-1B (meta-llama) (1.24 B)
- Llama-3.1-8B (meta-llama) (8.03 B)
- Llama-3.1-405B-FP8 (405.87 B)
- Llama-2-7b-chat-hf (6.74 B)
- Llama-3.2-3B (meta-llama) (3.21 B)
- Meta-Llama-3-8B (meta-llama) (8.03 B)
- Llama-2-13b-chat-hf (13.02 B)
- Meta-Llama-3-70B-Instruct (70.55 B)
- Meta-Llama-3-70B (70.55 B)
- Llama-3.1-405B (405.85 B)
- Llama-4-Maverick-17B-128E-Instruct-FP8 (401.65 B)
- Llama-Guard-3-8B (8.03 B)
- Llama-3.1-70B (70.55 B)
- Llama-Guard-3-1B (meta-llama) (1.5 B)
- Llama-2-13b-hf (13.02 B)
- Llama-Guard-3-8B-INT8 (8.03 B)
- Llama-2-70b-chat-hf (68.98 B)
Microsoft
- Phi-4 (14 B)
- Phi-3.5-vision-instruct (4.15 B)
- phi-2 (2.78 B)
- Phi-3.5-mini-instruct (3.82 B)
- Phi-4-mini-instruct (3.84 B)
- Phi-3-mini-4k-instruct (3.82 B)
- Phi-4-multimodal-instruct (5.57 B)
- Phi-3-mini-128k-instruct (3.82 B)
- Phi-3.5-MoE-instruct (41.87 B)
- Phi-tiny-MoE-instruct (3.76 B)
- phi-1_5 (1.42 B)
- Phi-4-mini-reasoning (3.84 B)
- Phi-3-vision-128k-instruct (4.15 B)
- Phi-mini-MoE-instruct (7.65 B)
- Phi-4-reasoning (14.66 B)
- Phi-3-small-8k-instruct (7.39 B)
- phi-1 (1.42 B)
- Phi-3-medium-4k-instruct (13.96 B)
MiniMax
- MiniMax-M2.7 (228.69 B)
- MiniMax-M2.5 (228.7 B)
- MiniMax-M2 (228.69 B)
- MiniMax-M3-MXFP8 (440.28 B)
- MiniMax-M1-40k (456.09 B)
Mistral
- Mistral Small (24 B)
- Mistral 7B (7 B)
- Mistral Large
- Mistral-7B-Instruct-v0.2 (7.24 B)
- Mistral-7B-v0.1 (7.24 B)
- Mistral-Nemo-Instruct-2407 (12.25 B)
- Mixtral-8x7B-Instruct-v0.1 (46.7 B)
- Mistral-7B-Instruct-v0.1 (7.24 B)
- Mistral-Medium-3.5-128B (127.7 B)
- Devstral-2-123B-Instruct-2512 (125.03 B)
- Magistral-Small-2509 (24.01 B)
Moonshot AI
- Kimi-K3 (2779.93 B)
- Kimi-K2.6 (1026.88 B)
- Kimi-K2-Instruct (1026.41 B)
- Kimi-Linear-48B-A3B-Instruct (49.12 B)
- Kimi-Linear-48B-A3B-Base (49.12 B)
- Kimi-K2.7-Code (1026.88 B)
- Kimi-K2-Instruct-0905 (1026.47 B)
- Moonlight-16B-A3B-Instruct (15.96 B)
Nous Research
- Hermes-3-Llama-3.1-8B (8.03 B)
- Meta-Llama-3.1-8B-Instruct (NousResearch) (8.03 B)
- Meta-Llama-3.1-8B (NousResearch) (8.03 B)
- Meta-Llama-3-8B-Instruct (NousResearch) (8.03 B)
- Meta-Llama-3-8B (NousResearch) (8.03 B)
- Llama-3.2-1B (NousResearch) (1.24 B)
- Hermes-2-Pro-Mistral-7B (7.24 B)
- Nous-Hermes-llama-2-7b (6.74 B)
NVIDIA
- Qwen3.6-35B-A3B-NVFP4 (35.11 B)
- NVIDIA-Nemotron-3-Nano-4B-BF16 (3.97 B)
- Gemma-4-31B-IT-NVFP4 (31.27 B)
- Qwen2.5-VL-7B-Instruct-NVFP4 (8.29 B)
- NVIDIA-Nemotron-3-Super-120B-A12B-BF16 (123.61 B)
- Qwen3.5-122B-A10B-NVFP4 (122.56 B)
- Gemma-4-26B-A4B-NVFP4 (25.81 B)
- NVIDIA-Nemotron-3-Nano-30B-A3B-BF16 (31.58 B)
- NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 (32.91 B)
- NVIDIA-Nemotron-3-Super-120B-A12B-NVFP4 (123.61 B)
- Qwen3-14B-NVFP4 (14.77 B)
- Qwen3.8-27B-NVFP4 (27.36 B)
- NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16 (31.58 B)
- Qwen3.6-27B-NVFP4 (27.36 B)
- GLM-5.2-NVFP4 (743.38 B)
- NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16 (560.52 B)
- NVIDIA-Nemotron-Nano-9B-v2 (8.89 B)
- NVIDIA-Nemotron-3-Nano-30B-A3B-FP8 (31.58 B)
- NVIDIA-Nemotron-Nano-9B-v2-FP8 (8.89 B)
- NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4 (560.52 B)
- Kimi-K2-Thinking-NVFP4 (1026.41 B)
- Qwen3-8B-NVFP4 (8.19 B)
- NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DSpark (0.76 B)
- Llama-3_3-Nemotron-Super-49B-v1_5-FP8 (49.87 B)
- Nemotron-Labs-Diffusion-8B-Base (8.49 B)
- diffusiongemma-26B-A4B-it-NVFP4 (25.82 B)
- NVIDIA-Nemotron-3.5-Lightning-30B-A3B-Base-BF16 (31.58 B)
- NVIDIA-Nemotron-3-Nano-30B-A3B-Base-BF16 (31.58 B)
- Nemotron-Labs-Diffusion-3B (3.83 B)
- Llama-3_3-Nemotron-Super-49B-v1_5 (49.87 B)
- NVIDIA-Nemotron-3-Super-120B-A12B-FP8 (123.61 B)
- gpt-oss-120b-Eagle3-v3 (0.79 B)
- Nemotron-H-8B-Base-8K (8.1 B)
- Llama-3.1-8B-Instruct-FP8 (8.03 B)
- Mistral-NeMo-Minitron-8B-Instruct (8.41 B)
- Llama-3_3-Nemotron-Super-49B-v1 (49.87 B)
- gpt-oss-120b-Eagle3-short-context (0.79 B)
- GLM-5.3-NVFP4 (nvidia) (753.33 B)
- Llama-3.1-Nemotron-70B-Instruct-HF (70.55 B)
- Qwen3-30B-A3B-NVFP4 (30.53 B)
- Qwen3-14B-FP8 (nvidia) (14.77 B)
- Nemotron-Labs-Diffusion-8B (8.49 B)
- Nemotron-Labs-Diffusion-14B (13.51 B)
- Llama-3.1-Nemotron-Nano-8B-v1 (8.03 B)
- MiniMax-M2.5-NVFP4 (228.69 B)
OpenAI
- OpenAI gpt-oss 120B (117 B)
- OpenAI gpt-oss 20B (21 B)
- GPT-4o
- GPT-5
- whisper-large-v3-turbo (0.81 B)
- gpt-oss-safeguard-20b (21.51 B)
Other
- dolphin-2.9.1-yi-1.5-34b (34.39 B)
- OTel-2.0-LLM-31B-IT (31.27 B)
- JiRackUltra_1b (1.78 B)
- moondream2 (1.93 B)
- TinyLlama-1.1B-Chat-v1.0 (1.1 B)
- gpt2-large (0.81 B)
- dots.ocr (3.04 B)
- MiniCPM5-2B (2.52 B)
- Ornith-1.5-35B-A3B-NVFP4 (35.95 B)
- Bonsai-27B-mlx-1bit (1.72 B)
- JiRackUltra_14b (14.77 B)
- OpenELM-1_1B-Instruct (1.08 B)
- Ornith-1.5-9B-NVFP4 (9.65 B)
- Apertus-v1.5-8B (8.9 B)
- JiRackDeltaNet_27b (27.32 B)
- Llama-3.2-3B-Instruct-FP8-dynamic (3.61 B)
- PowerMoE-3b (3.37 B)
- gte-Qwen2-1.5B-instruct (1.78 B)
- Ornith-1.5-35B-A3B-FP8 (35.95 B)
- Ornith-1.5-9B (9.65 B)
- Apertus-8B-Instruct-2509 (8.05 B)
- LLaDA-8B-Instruct (8.02 B)
- gemma4-e4b-claims-comparison (7.94 B)
- MiniCPM5-1B (1.08 B)
- Ornith-1.5-397B-NVFP4 (396.8 B)
- Qwen3-32B-NVFP4 (34.71 B)
- CodeLlama-7b-hf (6.74 B)
- saiga_llama3_8b (8.03 B)
- Qwen3-0.6B (PrimeIntellect) (0.75 B)
- Qwen3.8-27B-MTP-NVFP4 (51.71 B)
- Llama-Guard-3-1B (alpindale) (1.5 B)
- EuroLLM-22B-Instruct-2512 (22.64 B)
- Ornith-1.5-397B-FP8 (403.4 B)
- Ornith-1.5-397B (403.4 B)
- Ornith-1.0-35B-FP8 (ornith-ai) (35.11 B)
- gemma-4-31B-it-NVFP4-turbo (61.81 B)
- EXAONE-3.5-7.8B-Instruct (7.82 B)
- TwIL-LM3 (3.08 B)
- Qwen3.8-27B-DFlash2 (incoai) (1.92 B)
- Qwen3-Coder-Next-FP8-dynamic (79.75 B)
- Laguna-S-2.1-NVFP4 (211.78 B)
- Ornith-1.0-397B-FP8 (396.8 B)
- e5-mistral-7b-instruct (7.11 B)
- llama-7b (6.74 B)
- Agents-A1-4B (4.54 B)
- Ornith-1.5-35B-A3B (35.95 B)
- indic-parler-tts (0.94 B)
- t5-3b (2.85 B)
- dots.mocr (3.04 B)
- Laguna-XS.2 (33.44 B)
- Llama-3.2-1B-Instruct-FP8-dynamic (1.5 B)
- Qwen3.8-27B-DSpark (1.86 B)
- EuroLLM-1.7B-Instruct (1.66 B)
- LightOnOCR-2-1B (1.01 B)
- Laguna-M.1 (225.8 B)
- MOSS-Transcribe-Diarize (0.91 B)
- Zamba2-1.2B-instruct (1.22 B)
- LLaDA2.0-mini (16.26 B)
- Laguna-XS-2.1 (33.44 B)
- Step-3.5-Flash (199.38 B)
- Laguna-XS-2.1-NVFP4 (64.97 B)
- Fanar-2-27B-Instruct (27.01 B)
- Qwen3.8-27B-DFlash2 (z-lab) (1.92 B)
- natural-sql-7b (6.91 B)
- VLX-Seek-1.5-10B (10.02 B)
- lucid-v1-nemo (12.25 B)
- Llama-3.2-3B-Instruct-FP8 (3.61 B)
- Ornith-1.0-397B (396.8 B)
- LLaMmlein_1B_prerelease (1.1 B)
- sarvam-30b (32.15 B)
- MonkeyOCRv2-B-Parsing (0.88 B)
- Laguna-S-2.1 (117.56 B)
- VLM2Vec-Full (4.15 B)
- bge-reranker-v2.5-gemma2-lightweight (9.24 B)
- qwen3-4b-base-dapo-v4 (4.02 B)
- Qwen3.6-27B-Text-NVFP4-MTP (28.84 B)
- Llama-3.1-70B-LatamGPT-SFT-1.0 (70.55 B)
- Meta-Llama-3.1-70B-Instruct-FP8 (70.55 B)
- Qwen2.5-1.5B-quantized.w8a8 (1.78 B)
- JEV-9B (8.95 B)
- sarashina2.2-0.5b-instruct-v0.1 (0.79 B)
- Meta-Llama-3.1-8B-Instruct-FP8 (8.03 B)
- DeepSeek-Coder-V2-Lite-Instruct-FP8 (15.71 B)
- Llama-3.3-70B-Instruct-FP8-dynamic (70.56 B)
- LFM2.5-1.2B-Instruct (1.17 B)
- LLaDA2.1-mini (16.26 B)
- gpt-oss-20b-RichardErkhov-heresy (21.51 B)
- moondream3-preview (9.27 B)
- gte-Qwen2-7B-instruct (7.61 B)
- Kartoffel_Orpheus-3B_german_natural-v0.1 (3.3 B)
- LFM2.5-2.6B (2.7 B)
- 3b-de-ft-research_release (3.3 B)
- higgs-tts-3-4b (4.65 B)
- c4ai-command-r-v01 (34.98 B)
- HarmBench-Llama-2-13b-cls (13.02 B)
- kimi-k2.6-eagle3-mla (3.02 B)
- Llama-xLAM-2-8b-fc-r (8.03 B)
- Qwen3-1.7B (PrimeIntellect) (2.03 B)
- bge-reranker-v2-gemma (2.51 B)
- h2o-danube3-500m-chat (0.51 B)
- GLM-5.3-CYBERSECURITY-FP8 (753.33 B)
- Nanbeige4.2-3B (4.17 B)
- gpt2-xl (1.61 B)
- mxbai-rerank-large-v2 (1.54 B)
- GLM-5.3-NVFP4 (RadixArk) (743.38 B)
- Qwen3-30B-A3B.w8a8 (30.55 B)
- LFM2-1.2B (1.17 B)
- TinyLlama-1.1B-intermediate-step-1431k-3T (1.1 B)
- Dream-v0-Instruct-7B (7.62 B)
- OneRec-1.7B (2.13 B)
- transformer-1.3B-100B (1.36 B)
- ZAYA1-VL-8B (9.72 B)
- Llama-3.2-1B-Instruct-FP8 (1.5 B)
- MioTTS-2.6B (2.59 B)
- JiRackUltra_32b (32.76 B)
- JiRackUltra_7b (7.62 B)
- sweep-next-edit-1.5B (1.38 B)
- gemma-2-2b-it (Efficient-Large-Model) (2.61 B)
- typhoon2.5-qwen3-30b-a3b (30.53 B)
- qwen3-4b-mamba3-hybrid-stage2b-kd-bias0 (4.74 B)
- XCurOS0.1-8B-Instruct (7.62 B)
- TIPO-500M-ft (0.51 B)
- EXAONE-3.5-2.4B-Instruct (2.41 B)
- starcoder2-3b (3.03 B)
- step3 (320.97 B)
- Xing4.0-29B-A4B (31.22 B)
- phonellm-alpha-1 (31.58 B)
- Seed-OSS-36B-Instruct (36.15 B)
- Vikhr-Nemo-12B-Instruct-R-21-09-24 (12.25 B)
- svara-tts-v1 (3.3 B)
- Qwen3.6-27B-DFlash (1.73 B)
- GLM-5.3-Flash-DFlash2 (1.17 B)
- LLaMA3.1-8B-Instruct-DFlash-UltraChat (1.05 B)
- Audio8-ASR-Infinite (4.09 B)
- Apertus-8B-2509 (8.05 B)
- Apertus-70B-2509 (70.6 B)
- moondream-caption (1.87 B)
- Spark-X2.5-4B (4.11 B)
- Llama-3.2-1B (osllmai-community) (1.24 B)
- K2-Horizon-0.9B (1.08 B)
- A.X-K2 (691.69 B)
- antares-1b (1.84 B)
- SedibaLM (1.54 B)
- A.X-4.0-Light (7.26 B)
- tofu_ft_phi-1.5 (1.42 B)
- CodeLlama-7b-Instruct-hf (6.74 B)
- EVE-27b-XENO-HAT-DeepSeek-V4-Flash (27.78 B)
- PowerLM-3b (3.51 B)
- SOLAR-10.7B-Instruct-v1.0 (10.73 B)
- gemma-4-26b-a4b-it-fp8 (25.82 B)
- GritLM-7B (7.24 B)
- Nex-N2.5-Pro (396.8 B)
- TinyLlama-1.1B-step-50K-105b (1.1 B)
- LFM2.5-8B-A1B (8.47 B)
- llava-onevision-qwen2-7b-ov (8.03 B)
- HyperCLOVAX-SEED-Think-14B (14.75 B)
- Seed-OSS-36B-Base (36.15 B)
- gpt_bigcode-santacoder (1.12 B)
- Llama-3-8B-Instruct-Gradient-1048k (8.03 B)
- h2ovl-mississippi-800m (0.83 B)
- EXAONE-3.5-32B-Instruct (32 B)
- orpheus-3b-0.1-ft (canopylabs) (3.78 B)
- NeoHorse-1-4B (4.21 B)
- LightOnOCR-1B-1025 (1.16 B)
- EXAONE-4.0-32B (32 B)
- TLive-Omni-4B (5.82 B)
- TIPO-500M (0.51 B)
- K2-Horizon-7B (9 B)
- phi-4-FP8-dynamic (14.66 B)
- Qwen3-1.7B-MLX-bf16 (1.72 B)
- pico-decoder-large (0.57 B)
- starcoder2-7b (7.17 B)
- lynx-instruct-30b (30.53 B)
- salamandra-7b-instruct (7.77 B)
- GLM-4.7-Flash-Coder (29.94 B)
- EuroLLM-9B-Instruct-2512 (9.15 B)
- KONI-Llama3.1-8B-Instruct-20241024 (8.03 B)
- uno-qwen3-8B (8.19 B)
- NeuralMonarch-7B (7.24 B)
- AI21-Jamba-Reasoning-3B (3.2 B)
- Ministral-3b-instruct (3.32 B)
- Midm-2.0-Mini-Instruct (2.31 B)
- sarvam-105b (106.03 B)
- CodeLlama-34b-Instruct-hf (33.74 B)
- SpatialLM1.1-Qwen-0.5B (0.6 B)
- Ornith-1.0-35B-FP8 (protoLabsAI) (35.11 B)
- openthaigpt1.5-7b-instruct (7.62 B)
- h2ovl-mississippi-2b (2.15 B)
- LLaDA-8B-Base (8.02 B)
- Midm-2.0-Base-Instruct (11.55 B)
- LongCat-Flash-Chat (561.86 B)
- qwen-base-invoicev1.01-1.5B (1.54 B)
- Qwen3.8-Whittle-MoE-27B-A17.8B (26.92 B)
- EXAONE-4.0-1.2B (1.28 B)
- Mellum2-12B-A2.5B-Base (12.15 B)
- K2-Horizon-3.7B (5.06 B)
- Apertus-70B-Instruct-2509 (70.6 B)
- Llama-3.2-0.5B-Instruct (0.51 B)
- Foundation-Sec-8B-Reasoning (8.03 B)
- llm-jp-4-8b-base (8.59 B)
- Dolphin-Mistral-24B-Venice-Edition (24.01 B)
- aya-expanse-8b (8.03 B)
- K2-Horizon-MoVA-36B-A4B (37.44 B)
- Agents-A1 (35.11 B)
- LFM2-1.2B-MLX-bf16 (1.17 B)
- HRM-Text-1B (1.18 B)
- LLaDA-1.5 (8.02 B)
- academic-ds-9B (9.37 B)
- MixTAO-7Bx2-MoE-v8.1 (12.88 B)
- Qwen3-4B-DFlash-b16 (0.54 B)
- LFM2-8B-A1B (8.34 B)
- K-EXAONE-236B-A23B (237.1 B)
- Trinity-Mini (26.12 B)
- llm-jp-4-8b-thinking (8.59 B)
- Qwen3-14B-Instruct (14.77 B)
- DeepSeek-V4-Flash-Vision-Exp-FP8-DSpark (304.65 B)
- Meta-Llama-3.1-8B-Instruct-FP8-dynamic (8.03 B)
- Apertus-v1.5-70B (72.01 B)
- vllm-translategemma-12b-it (13.19 B)
- llm-jp-3-1.8b (1.87 B)
- idefics-9b (8.93 B)
- huginn-0125 (3.91 B)
- OCC-RAG-1.7B (1.72 B)
- EXAONE-3.0-7.8B-Instruct (7.82 B)
- stella-pl-retrieval-8k (1.54 B)
- parler-tts-mini-v1 (0.88 B)
- SDAR-1.7B-Chat (2.03 B)
- sarashina2.2-3b-instruct-v0.1 (3.36 B)
- Vistral-24B-Instruct (23.57 B)
- EuroLLM-9B-Instruct (9.15 B)
- YanoljaNEXT-EEVE-Instruct-10.8B (10.8 B)
- internlm2-chat-7b-ExPO (7.74 B)
- gemma-4-31B-it-DFlash (1.54 B)
- Llama-3.2-3B-Instruct-pythonic (3.21 B)
- AI21-Jamba2-3B (3.03 B)
- Llama3-Chinese-8B-Instruct (8.03 B)
- internlm2-chat-20b-ExPO (19.86 B)
- Tess-2.0-Llama-3-8B (8.03 B)
- Le_Triomphant-ECE-TW3 (72.29 B)
- YiSM-34B-0rn (34.39 B)
- TW3-JRGL-v2 (72.29 B)
- starcoder (15.82 B)
- stella_en_1.5B_v5 (1.54 B)
- Ling-3.0-tiny (7.89 B)
- LFM2.5-1.2B-Base (1.17 B)
- 72B-Qwen2.5-Kunou-v1 (72.71 B)
- llama-3-typhoon-v1.5-8b (8.03 B)
- SkillRouter-Reranker-0.6B (0.6 B)
- Ministral-3-14B-Instruct-2512-FP8-dynamic (13.95 B)
- Foundation-Sec-8B (8.03 B)
- MiniMax-M3-EAGLE3 (3.26 B)
- K2-Horizon-375B-A23B (379.17 B)
- Qwen3-VL-235B-A22B-Instruct-FP8-dynamic (235.76 B)
- Dobby-Mini-Unhinged-Llama-3.1-8B (8.03 B)
- llava-v1.6-mistral-7b (7.57 B)
- Goedel-Prover-V2-32B (32.76 B)
- gepard-1.0 (0.56 B)
Qwen
- Qwen3 32B (32 B)
- Qwen3 235B A22B (235 B)
- Qwen3-0.6B (Qwen) (0.75 B)
- Qwen3-8B (Qwen) (8.19 B)
- Qwen3.5-9B (9.65 B)
- Qwen3-Embedding-0.6B (0.6 B)
- Qwen2.5-0.5B-Instruct (0.49 B)
- Qwen2.5-7B-Instruct (Qwen) (7.62 B)
- Qwen3-4B (4.02 B)
- Qwen2.5-1.5B-Instruct (Qwen) (1.54 B)
- Qwen3.8-27B (27.78 B)
- Qwen2.5-VL-7B-Instruct (8.29 B)
- Qwen2.5-3B-Instruct (Qwen) (3.09 B)
- Qwen3-4B-Instruct-2507 (Qwen) (4.02 B)
- Qwen3-14B (14.77 B)
- Qwen3.6-35B-A3B (35.95 B)
- Qwen3-1.7B (Qwen) (2.03 B)
- Qwen3-Embedding-8B (7.57 B)
- Qwen2.5-Coder-7B-Instruct (Qwen) (7.62 B)
- Qwen3-Reranker-4B (4.02 B)
- Qwen2-VL-2B-Instruct (2.21 B)
- Qwen2.5-32B-Instruct (32.76 B)
- Qwen3-Embedding-4B (4.02 B)
- Qwen3-Reranker-0.6B (0.6 B)
- Qwen2.5-Coder-14B-Instruct (14.77 B)
- Qwen2.5-14B-Instruct (Qwen) (14.77 B)
- Qwen3-30B-A3B (30.53 B)
- Qwen3-4B-Instruct-2507-FP8 (4.41 B)
- Qwen3-Coder-Next-FP8 (Qwen) (79.68 B)
- Qwen-72B (72.29 B)
- Qwen3-Coder-30B-A3B-Instruct-FP8 (30.53 B)
- Qwen3-30B-A3B-Instruct-2507 (30.53 B)
- Qwen2.5-Coder-32B-Instruct (32.76 B)
- Qwen2.5-VL-32B-Instruct (33.45 B)
- Qwen2.5-7B (7.62 B)
- Qwen3-8B-Base (8.19 B)
- Qwen2-VL-7B-Instruct (8.29 B)
- Qwen3-0.6B-Base (0.6 B)
- Qwen3-1.7B-Base (1.72 B)
- Qwen3-Coder-480B-A35B-Instruct-FP8 (480.18 B)
- Qwen2.5-1.5B (1.54 B)
- Qwen3-4B-Base (4.02 B)
- Qwen3-Coder-Next (79.67 B)
- Qwen2-1.5B-Instruct (1.54 B)
- Qwen3-4B-Thinking-2507 (4.02 B)
- Qwen3-8B-FP8 (8.19 B)
- Qwen2.5-Coder-3B-Instruct (3.09 B)
- Qwen2.5-Coder-7B (7.62 B)
- Qwen2.5-Coder-1.5B-Instruct (1.54 B)
- Qwen-Image-Edit-2509 (20.43 B)
- Qwen3-Coder-30B-A3B-Instruct (30.53 B)
- Qwen3-VL-30B-A3B-Instruct (31.07 B)
- Qwen3-Reranker-8B (8.19 B)
- Qwen2.5-Coder-1.5B (1.54 B)
- Qwen3-235B-A22B-Instruct-2507-FP8 (235.11 B)
- Qwen3-30B-A3B-Instruct-2507-FP8 (30.53 B)
- Qwen3-VL-235B-A22B-Instruct (235.67 B)
- Qwen2.5-Math-1.5B-Instruct (1.54 B)
- Qwen1.5-MoE-A2.7B (14.32 B)
- Qwen3.5-397B-A17B (403.4 B)
- Qwen2-0.5B-Instruct (0.49 B)
- Qwen-Image-Edit-2511 (20.43 B)
- Qwen2.5-3B (3.09 B)
- Qwen2.5-72B-Instruct (72.71 B)
- Qwen2-7B-Instruct (7.62 B)
- Qwen3-Next-80B-A3B-Instruct (81.32 B)
- Qwen-Image (20.43 B)
- Qwen3-0.6B-FP8 (0.75 B)
- Qwen2-7B (7.62 B)
- Qwen3-30B-A3B-FP8 (30.53 B)
- Qwen3-235B-A22B-Instruct-2507 (235.09 B)
- Qwen2.5-Math-1.5B (1.54 B)
- Qwen3Guard-Gen-0.6B (0.75 B)
- Qwen3-32B-FP8 (32.76 B)
- Qwen3-VL-30B-A3B-Instruct-FP8 (31.07 B)
- Qwen3-Next-80B-A3B-Instruct-FP8 (81.33 B)
- Qwen1.5-1.8B-Chat (1.84 B)
- Qwen2-1.5B (1.54 B)
- Qwen-Image-Edit (20.43 B)
- Qwen3-14B-Base (14.77 B)
- Qwen3-30B-A3B-Thinking-2507 (30.53 B)
- Qwen2.5-14B (14.77 B)
- Qwen3-4B-FP8 (4.41 B)
- Qwen1.5-7B (7.72 B)
- Qwen2.5-7B-Instruct-1M (7.62 B)
- Qwen2.5-VL-72B-Instruct (73.41 B)
- Qwen2.5-Math-7B-Instruct (7.62 B)
- Qwen1.5-0.5B-Chat (0.62 B)
- Qwen-7B (7.72 B)
- Qwen3Guard-Gen-4B (4.41 B)
- Qwen3-30B-A3B-Base (30.53 B)
- Qwen3-14B-FP8 (Qwen) (14.77 B)
- Qwen-7B-Chat (7.72 B)
- QwQ-32B (32.76 B)
- Qwen-Image-2512 (20.43 B)
- Qwen2-VL-72B-Instruct (73.41 B)
- Qwen3-Next-80B-A3B-Thinking (81.32 B)
- Qwen2.5-Math-7B (7.62 B)
- Qwen1.5-0.5B (0.62 B)
- Qwen3-235B-A22B-Thinking-2507-FP8 (235.11 B)
- Qwen2.5-Coder-3B (3.09 B)
- Qwen3-Coder-480B-A35B-Instruct (480.15 B)
- Qwen3.8-2.4T-A95B (2446.18 B)
- Qwen1.5-32B-Chat (32.51 B)
- Qwen2.5-32B (32.76 B)
- Qwen3Guard-Gen-8B (8.19 B)
- Qwen2.5-14B-Instruct-1M (14.77 B)
- Qwen1.5-MoE-A2.7B-Chat (14.32 B)
- Qwen3-1.7B-FP8 (2.03 B)
- Qwen2-72B (72.71 B)
- Qwen3-235B-A22B-FP8 (235.11 B)
- Qwen2-72B-Instruct (72.71 B)
- Qwen3-30B-A3B-Thinking-2507-FP8 (30.53 B)
- Qwen1.5-4B-Chat (3.95 B)
- Qwen2.5-72B (72.71 B)
- Qwen3-235B-A22B-Thinking-2507 (235.09 B)
- Qwen3.8-2.4T-A95B-FP8 (2446.18 B)
Stability AI
- stablelm-3b-4e1t (2.8 B)
Tencent
- Hy3 (298.79 B)
- Hy3-preview (298.79 B)
- Hunyuan-A13B-Instruct (80.39 B)
- Hy3-FP8 (298.79 B)
- Hy-MT2-1.8B (2.04 B)
- Hy4-preview (779.96 B)
TII
- falcon-7b (7.22 B)
- Falcon-H1-0.5B-Base (0.52 B)
- falcon-7b-instruct (7.22 B)
- falcon-mamba-7b (7.27 B)
- Falcon-H1-7B-Instruct (7.59 B)
- Falcon-H1-3B-Instruct (3.15 B)
- falcon-mamba-7b-instruct (7.27 B)
Unsloth
- Llama-3.2-1B-Instruct (unsloth) (1.24 B)
- Llama-3.2-3B-Instruct (unsloth) (3.21 B)
- Meta-Llama-3.1-8B-Instruct (unsloth) (8.03 B)
- Qwen2.5-7B-Instruct (unsloth) (7.62 B)
- Qwen2.5-Coder-7B-Instruct (unsloth) (7.62 B)
- Qwen3-Coder-Next-FP8 (unsloth) (79.68 B)
- Llama-3.1-8B-Instruct (8.03 B)
- Llama-3.2-1B (unsloth) (1.24 B)
- gpt-oss-20b-BF16 (20.91 B)
- Meta-Llama-3.1-8B (unsloth) (8.03 B)
- Qwen3-8B (unsloth) (8.19 B)
- Llama-3.2-3B (unsloth) (3.21 B)
- orpheus-3b-0.1-ft (unsloth) (3.3 B)
- gemma-3-1b-it (unsloth) (1 B)
- Llama-3.3-70B-Instruct (70.55 B)
- Qwen2.5-14B-Instruct (unsloth) (14.77 B)
- gemma-2b-it (unsloth) (2.51 B)
- gemma-2-2b-it (unsloth) (2.61 B)
- Mistral-Small-24B-Instruct-2501 (23.57 B)
- llama-3-8b-Instruct (8.03 B)
- llama-2-7b-chat (6.74 B)
- Qwen3-4B-Instruct-2507 (unsloth) (4.02 B)
- llama-2-7b (6.74 B)
- Qwen2.5-1.5B-Instruct (unsloth) (1.54 B)
- Qwen2.5-3B-Instruct (unsloth) (3.09 B)
- gemma-2-27b (27.23 B)
- GLM-4.7-Flash (unsloth) (31.22 B)
- Llama-3.1-8B (unsloth) (8.03 B)
- gpt-oss-20b (20.91 B)
- Meta-Llama-3.1-70B (70.55 B)
Xiaomi
- MiMo-V2.5 (310.78 B)
- MiMo-V2-Flash (309.79 B)
- MiMo-7B-RL (7.83 B)
- MiMo-V2.5-Pro (1023.18 B)
- MiMo-7B-Base (7.83 B)
Z.ai
- GLM-5.3-Flash (321.32 B)
- GLM-4.7-Flash (zai-org) (31.22 B)
- GLM-5.3 (753.33 B)
- GLM-5.2 (753.33 B)
- GLM-5.2-FP8 (753.33 B)
- GLM-4.5-Air (110.47 B)
- GLM-5 (753.86 B)
- GLM-5.1 (753.86 B)
- GLM-4.5 (358.34 B)
- GLM-4.7 (358.34 B)
- GLM-4.5-Air-FP8 (110.51 B)
- GLM-5.3-BF16 (753.33 B)
- GLM-5.1-FP8 (753.91 B)
- GLM-Z1-32B-0414 (32.57 B)
- GLM-5-FP8 (753.91 B)
- codegeex4-all-9b (9.4 B)
- GLM-4.6 (356.79 B)
- GLM-4-9B-0414 (9.4 B)