evaluation
MMLU
Massive Multitask Language Understanding, a benchmark testing AI knowledge across 57 academic subjects from elementary to professional level. MMLU evaluates a model's breadth and depth of knowledge in areas like medicine, law, mathematics, and history.
In practice
GPT-4 scores around 86% on MMLU, approaching expert-level performance across diverse subjects.