Материал Как понять какая LLM лучше и почему?
0%

Как понять какая LLM лучше и почему?

cover Как понять какая LLM лучше и почему?

MMLU (аббревиатура от Measuring Massive Multitask Language Understanding) — это эталонный набор задач (бенчмарк), предназначенный для оценки способностей больших языковых моделей (LLM) по широкому кругу предметных областей.

Бенчмарк был разработан в 2020 году командой исследователей под руководством Дэна Хендрикса (Dan Hendrycks) из UC Berkeley и опубликован на конференции ICLR в 2021 году.

Цель MMLU — проверить, насколько модель усваивает разнообразные знания и умения, приобретённые на этапе предобучения.

MMLU-Pro, например, использует 12к вопросов вместо 4-ёх :D

• Источник: https://systems-analysis.ru/wiki/MMLU_benchmark • GitHub: https://github.com/hendrycks/test • Публикация: https://arxiv.org/abs/2009.03300 • Пост на kaggle как это может работать: https://huggingface.co/blog/open-llm-leaderboard-mmlu • Пост на huggingfacce про open llm leaderboard: https://huggingface.co/blog/open-llm-leaderboard-mmlu • И еще можно гуглить про MMLU-Pro: дашик вот https://artificialanalysis.ai/evaluations/mmlu-pro

Оригинал в Telegram

Нашли неточность? Выделите фрагмент текста — рядом появится жучок.

Нужен разбор именно вашей ситуации?

Статья описывает общий случай. Если у вас частный — можно разобрать его отдельно, платно. А если не хватает целого материала, предложите тему: её оплачивают вскладчину, и она выходит открытой для всех.

Доска запросов