Перейти к основному содержимому

Основы

Как читать бенчмарки ИИ, не поддаваясь заблуждению

Число из бенчмарка выглядит точным, из-за чего легко довериться ему сверх меры. Что на самом деле измеряет оценка вроде MMLU или HumanEval, распространённые способы, которыми числа бенчмарков вводят в заблуждение, и что проверить, прежде чем считать одну из них значимой для вашего случая.

Все разборы · Последняя проверка:

Бенчмарк — это один фиксированный тест, а не общая мера способностей

Известные бенчмарки вроде MMLU (общие знания с выбором ответа), HumanEval (короткие задачи по программированию) или GSM8K (текстовые задачи по математике уровня начальной школы) каждый проверяет узкий, конкретный навык в определённом формате. Модель может хорошо показать себя в одном и хуже в задаче, которая человеку кажется похожей, но устроена иначе — например, объёмное программирование против коротких изолированных функций или свободное письмо против выбора ответа из вариантов.

Вопросы бенчмарка могут просочиться в обучающие данные

Популярные бенчмарки публичны, и их вопросы широко циркулируют в вебе, статьях и обсуждениях на форумах — именно на таком тексте обучаются крупные модели. Когда модель фактически уже видела ответ, её оценка отражает запоминание этого конкретного теста, а не общую способность, которую бенчмарк должен был отражать. Это называется контаминацией, и постороннему читателю трудно распознать её по одной оценке.

Заявленная оценка может сильно зависеть от того, как модель спрашивали

Одна и та же модель может показать очень разные результаты в зависимости от формата промпта, количества решённых примеров, показанных перед реальным вопросом, и разрешалось ли ей рассуждать пошагово перед ответом. Провайдер, сообщающий свой лучший результат при благоприятных условиях, не лжёт, но это число может не соответствовать тому, что вы получите с обычным повседневным промптом.

Бенчмарки насыщаются — и перестают быть полезными, когда их проходит большинство моделей

Когда большинство ведущих моделей набирают баллы, близкие к максимуму по бенчмарку, он перестаёт значимо различать их, хотя старое число часто продолжают цитировать. Почти идеальная оценка на насыщенном бенчмарке говорит меньше, чем раньше; новые, более сложные бенчмарки обычно заменяют его, и маркетинговое сравнение, опирающееся на старое насыщенное число, стоит перепроверить.

Одна средняя оценка скрывает именно те места, где модель реально спотыкается

Общая оценка бенчмарка — это среднее по множеству вопросов разной сложности и типа. Модель может иметь хорошее среднее и при этом быть ненадёжной в конкретной подкатегории, важной для вас, — определённом типе рассуждений, конкретной области, определённой длине задачи. Среднее — это резюме, а резюме отбрасывает именно ту деталь, которая обычно важнее всего для реального решения.

Относитесь к бенчмарку как к отправной точке, а не как к вердикту

Оценка бенчмарка наиболее полезна как грубый первоначальный фильтр — чтобы явно исключить неподходящую модель или составить короткий список для дальнейшего тестирования, — а не как последнее слово о том, какую модель использовать. См. как оценивать модели ИИ для того, что реально предсказывает соответствие после сужения списка: тестирование на собственных репрезентативных задачах, которое ни один опубликованный бенчмарк заменить не может.

Частые вопросы

Что на самом деле тестирует бенчмарк вроде MMLU или HumanEval?
Фиксированный, конкретный набор вопросов в определённом формате — MMLU это общие знания с выбором ответа, HumanEval это короткие задачи по программированию. Каждый измеряет узкий навык, а не общий интеллект или способность в любой задаче.
Почему оценки бенчмарков от разных провайдеров иногда кажутся противоречивыми?
Оценки могут зависеть от формата промпта, количества примеров, показанных перед реальным вопросом, и разрешалось ли пошаговое рассуждение. Разные условия отчётности дают разные числа для одной и той же базовой модели.
Что такое контаминация бенчмарка?
Когда публичные вопросы бенчмарка попадают в обучающие данные модели, из-за чего она фактически уже видела ответы до тестирования. Полученная оценка отражает запоминание, а не способность, которую бенчмарк был призван измерить.
Стоит ли мне полностью игнорировать оценки бенчмарков?
Нет — они разумный первоначальный фильтр для исключения явно неподходящих моделей или составления короткого списка. Просто не относитесь к итоговому числу как к вердикту; протестируйте короткий список на собственных репрезентативных задачах, прежде чем принимать решение.

Лучше попробовать, чем читать

ClawAI не публикует собственный рейтинг бенчмарков и не заявляет фирменную оценку ни для одной модели — вместо этого его панель прозрачности маршрутизации показывает реальный класс стоимости, класс задержки и уверенность маршрутизации за конкретным ответом, чтобы вы могли судить об ответе по своему собственному запросу, а не по опубликованному набору тестов, который вы не можете проверить.