Skip to content

evaluation

MMLU

Massive Multitask Language Understanding, a benchmark testing AI knowledge across 57 academic subjects from elementary to professional level. MMLU evaluates a model's breadth and depth of knowledge in areas like medicine, law, mathematics, and history.

In practice

GPT-4 scores around 86% on MMLU, approaching expert-level performance across diverse subjects.