3 models
Ranked by Terminal-Bench Hard
Open weights 15.9

Mistral's largest general model for enterprise agents, coding, and multilingual reasoning

mistral/mistral-large-2512 2025-12-02 262.144K context $0.5/M input $1.5/M output
13 providers
Tools Open weights 15.2

Smaller Qwen coder for efficient local agents and repo-level fixes

alibaba/qwen3-coder-30b-a3b-instruct 2025-04 262.144K context $0.45/M input $2.25/M output
13 providers
Reasoning Tools Open weights 6.1

Classic open reasoning model for transparent math, coding, and deliberate problem solving

deepseek/deepseek-r1 2025-01-20 128K context $0.7/M input $2.5/M output
14 providers