Model Library / Benchmarks / MMMLU (Multilingual)

Multilingual

MMMLU (Multilingual)

Multitask knowledge and reasoning on professionally translated MMLU across 14 languages. Source: OpenAI simple-evals results (averaged across languages, shown as %).

Features measured

Multilingual Reasoning

Use cases unlocked

Knowledge Q&A Cross-lingual assistants Multilingual content

Leaderboard

Higher is better · accuracy %
1 o3 (high) 88.8%
2 o1 87.7%
3 o4-mini (high) 85.2%
4 GPT-4.5 preview 85.1%
5 GPT-4.1 83.7%
6 GPT-4o (2024-11-20) 81.4%
7 o3-mini (high) 80.7%
8 GPT-4.1 mini 78.5%

Bars scaled from 70 so close scores stay legible — the figure at right is the actual accuracy %.

Benchmark source ↗

← All benchmarks