
simple-evals-ru
Бенчмарк для больших языковых моделей
simple-evals-ru применим для оценки качества работающих на русском больших языковых моделей.
Оценка производится с помощью содержащихся в популярных англоязычных бенчмарках (MGSM, MATH, HumanEval, MBPP, BBH, MMLU-Pro, QPQA) заданий по математике, программированию и логике.
В simple-evals-ru сравнивается как средний результат решения задач, так и цена за использование 1 млн токенов для каждой из моделей.
Бенчмарк был представлен «Лабораторией анализа данных Александра Кукушкина» в феврале 2025 года. Доступен как открытое ПО.

