Reasoning Tools JSON Open weights

Strong GLM coding model for agentic engineering, terminals, and repository generation

zhipuai/glm-5.1 2026-04-07 200K context $1.4/M input $4.4/M output
45 providers
Reasoning Tools JSON Open weights

Open Gemma instruction model for efficient chat and self-hosted deployments

google/gemma-4-26b-a4b-it 2026-04-02 262.144K context $0.042/M input $0.22/M output
22 providers
Reasoning Open weights

StepFun flash model for efficient multimodal reasoning, coding, and tool use

stepfun/step-3.5-flash-2603 2026-04-02 256K context $0.1/M input $0.3/M output
6 providers
Reasoning Tools JSON Open weights

Largest Gemma 4 instruction model for open, self-hosted chat and reasoning

google/gemma-4-31b-it 2026-04-02 262.144K context $0.09/M input $0.34/M output
33 providers
Reasoning Tools JSON Open weights

Open Gemma instruction model for efficient chat and self-hosted deployments

google/gemma-4-E4B-it 2026-04-02 131.072K context $0.02/M input $0.1/M output
2 providers
Reasoning Tools JSON Open weights

Open Gemma instruction model for efficient chat and self-hosted deployments

google/gemma-4-E2B-it 2026-04-02 131.072K context $0.04/M input $0.08/M output
2 providers
Reasoning Tools Open weights

Reasoning-optimized 398B MoE agent model with extended thinking for long-horizon and multi-turn tool use

arcee-ai/trinity-large-thinking 2026-04-01 524.288K context $0.25/M input $0.9/M output
5 providers
Open weights

Reranking model for improving retrieval quality in search and recommendation systems

nvidia/llama-nemotron-rerank-vl-1b-v2 2026-03-31 128K context Input not listed Output not listed
1 provider
Open weights

Nemotron model for efficient reasoning, coding, and specialized AI agents

nvidia/nemotron-cascade-2-30b-a3b 2026-03-24 256K context Input not listed Output not listed
1 provider
Reasoning Tools Open weights

Low-latency M2.7 variant for interactive coding plans and agent loops

minimax/MiniMax-M2.7-highspeed 2026-03-18 204.8K context $0.6/M input $2.4/M output
13 providers
Reasoning Tools Open weights

Open MiniMax flagship for coding agents, office automation, and complex environments

minimax/MiniMax-M2.7 2026-03-18 204.8K context $0.3/M input $1.2/M output
35 providers
Tools Open weights

Nemotron multimodal model for visual reasoning and agentic AI workflows

nvidia/nemotron-voicechat 2026-03-16 128K context Input not listed Output not listed
1 provider
Tools Open weights

Efficient Mistral model for fast chat, extraction, and production assistants

mistral/mistral-small-latest 2026-03-16 256K context $0.15/M input $0.6/M output
5 providers
Reasoning Tools Open weights

Fast Mistral production model for chat, extraction, and cost-sensitive agents

mistral/mistral-small-2603 2026-03-16 256K context $0.15/M input $0.6/M output
12 providers
Reasoning Open weights

Nemotron middle tier for collaborative agents and high-volume reasoning workloads

nvidia/nemotron-3-super-120b-a12b 2026-03-11 262.144K context $0.2/M input $0.8/M output
15 providers
Reasoning Tools JSON Open weights

Qwen vision-language model for visual reasoning, documents, and agent tasks

alibaba/qwen3.5-35b-a3b 2026-02-23 262.144K context $0.25/M input $2/M output
11 providers
Reasoning Tools JSON Open weights

Qwen vision-language model for visual reasoning, documents, and agent tasks

alibaba/qwen3.5-122b-a10b 2026-02-23 262.144K context $0.4/M input $3.2/M output
16 providers
Tools Open weights

Qwen vision-language model for visual reasoning, documents, and agent tasks

alibaba/qwen3.5-27b 2026-02-23 262.144K context $0.3/M input $2.4/M output
14 providers
Reasoning Tools Open weights

Qwen instruction model for multilingual chat, reasoning, and tool use

alibaba/qwen3.5-9b 2026-02-23 262.144K context $0.04/M input $0.15/M output
16 providers
Open weights

Turkish-language multimodal instruct model built on Gemma 3 12B for e-commerce text, chat, and image-text tasks

trendyol/asure-12b 2026-02-19 131.072K context $0.1/M input $0.5/M output
1 provider
Reasoning Tools Open weights

Efficient Indian-language reasoning model for chat, coding, and multilingual work

sarvam/sarvam-30b 2026-02-18 128K context $0.02/M input $0.1/M output
2 providers
Reasoning Tools JSON Open weights

Large open Qwen multimodal MoE for visual agents and long technical tasks

alibaba/qwen3.5-397b-a17b 2026-02-15 262.144K context $0.6/M input $3.6/M output
18 providers
Reasoning Tools Open weights

High-speed MiniMax model for low-latency coding and agent workflows

minimax/MiniMax-M2.5-highspeed 2026-02-13 204.8K context $0.6/M input $2.4/M output
7 providers
Reasoning Tools Open weights

Prior MiniMax coding model for agent workflows, office edits, and automation

minimax/MiniMax-M2.5 2026-02-12 204.8K context $0.3/M input $1.2/M output
34 providers
Reasoning Tools Open weights

General GLM flagship for coding, analysis, and tool-heavy engineering workflows

zhipuai/glm-5 2026-02-12 204.8K context $1/M input $3.2/M output
37 providers
Open weights

Embedding model for semantic search, retrieval, clustering, and ranking pipelines

nvidia/llama-nemotron-embed-vl-1b-v2 2026-02-10 32.768K context Input not listed Output not listed
1 provider
Tools JSON Open weights

Open-weight Qwen coding model for agents, repository edits, and multi-turn tool use

alibaba/qwen3-coder-next 2026-02-03 262.144K context $0.108/M input $0.675/M output
13 providers
Open weights

StepFun flash lane for quick multimodal reasoning and coding assistance

stepfun/step-3.5-flash 2026-01-29 256K context $0.1/M input $0.3/M output
14 providers
Tools Open weights

Lightly post-trained 398B MoE chat model for creative work, long-context prompts, and tool-using agents

arcee-ai/trinity-large-preview 2026-01-27 524.288K context Input not listed Output not listed
1 provider
Reasoning Open weights

Safety model for policy screening, moderation, and risk-aware routing workflows

nvidia/nemotron-content-safety-reasoning-4b 2026-01-22 128K context Input not listed Output not listed
1 provider
Reasoning Tools Open weights

Efficient GLM model for fast reasoning, coding, and agent workflows

zhipuai/glm-4.7-flashx 2026-01-19 200K context $0.07/M input $0.4/M output
5 providers
Reasoning Tools Open weights

Budget GLM lane for fast coding help, routing, and everyday automation

zhipuai/glm-4.7-flash 2026-01-19 200K context $0.06/M input $0.4/M output
14 providers
Tools Open weights

Earlier Kimi frontier model for long-context agents, coding, and multimodal work

moonshotai/kimi-k2.5 2026-01 262.144K context $0.3/M input $1.9/M output
45 providers
Reasoning Tools Open weights

Earlier MiniMax agent model for practical coding and productivity tasks

minimax/MiniMax-M2.1 2025-12-23 204.8K context $0.3/M input $1.2/M output
15 providers
Reasoning Tools Open weights

Mature GLM model for dependable coding, reasoning, and structured agent tasks

zhipuai/glm-4.7 2025-12-22 204.8K context $0.6/M input $2.2/M output
30 providers
Reasoning Tools Open weights

MiMo flash model for fast multimodal assistance and agent workflows

xiaomi/mimo-v2-flash 2025-12-16 262.144K context $0.14/M input $0.28/M output
7 providers
Open weights

Small Nemotron 3 MoE for efficient coding, math, and long-context agents

nvidia/nemotron-3-nano-30b-a3b 2025-12-15 262.144K context $0.05/M input $0.2/M output
11 providers
Tools Open weights

Mistral's coding-agent model for repository work, terminal tasks, and software fixes

mistral/devstral-2512 2025-12-09 262.144K context $0.4/M input $2/M output
13 providers
Reasoning Tools Open weights

GLM vision model for visual reasoning, documents, and multimodal agents

zhipuai/glm-4.6v 2025-12-08 128K context $0.3/M input $0.9/M output
9 providers
Reasoning Tools Open weights

Lightweight GLM vision model for visual reasoning, documents, and multimodal agents

zhipuai/glm-4.6v-flash 2025-12-08 128K context $0.3/M input $0.9/M output
2 providers
Tools Open weights

Mistral coding agent model for repository tasks and software engineering workflows

mistral/devstral-medium-latest 2025-12-02 262.144K context $0.4/M input $2/M output
3 providers
Open weights

Experimental chat-tuned 6B MoE model with 1B active parameters for low-resource chat and instruction following

arcee-ai/trinity-nano-preview 2025-12-01 131.072K context Input not listed Output not listed
Tools Open weights

DeepSeek chat model for instruction following, coding, and analysis

deepseek/deepseek-chat 2025-12-01 1M context $0.147/M input $0.295/M output
8 providers
Reasoning Tools JSON Open weights

Hybrid-reasoning DeepSeek model with thinking and non-thinking modes, sparse attention, and tool-use

deepseek/deepseek-v3.2 2025-12-01 128K context $0.18/M input $0.35/M output
23 providers
Open weights

DeepSeek reasoning model for multi-step analysis, math, coding, and tools

deepseek/deepseek-reasoner 2025-12-01 1M context $0.147/M input $0.295/M output
6 providers
Reasoning Tools Open weights

Reasoning-tuned 26B MoE model with 3B active parameters for agents, tools, and multi-step workloads

arcee-ai/trinity-mini 2025-12-01 131.072K context $0.045/M input $0.15/M output
2 providers
Tools Open weights

Thinking Kimi model for slower research passes, planning, and hard technical questions

moonshotai/kimi-k2-thinking 2025-11-06 262.144K context $0.4/M input $2.5/M output
22 providers
Reasoning Tools Open weights

Kimi reasoning model for long-horizon research, planning, and tool use

moonshotai/kimi-k2-thinking-turbo 2025-11-06 262.144K context $1.15/M input $8/M output
3 providers
Reasoning Open weights

Safety model for policy screening, moderation, and risk-aware routing workflows

openai/gpt-oss-safeguard-20b 2025-10-29 131.072K context $0.07/M input $0.2/M output
7 providers
Reasoning Tools JSON Open weights

Safety model for policy screening, moderation, and risk-aware routing workflows

openai/gpt-oss-safeguard-120b 2025-10-29 131.072K context $0.15/M input $0.6/M output
4 providers