Как сравнить две нейросети на одной задаче: протокол без рейтинга из воздуха
Одинаковые входные данные, заранее заданные критерии и сохранённые версии помогают выбрать модель под конкретную работу.

Редакционная иллюстрация создана с помощью ИИ. Это вымышленная сцена, а не результат тестирования инструмента.
Сначала назовите решение, которое нужно принять
«Какая модель лучше?» слишком общий вопрос. Сформулируйте рабочий: какая точнее извлекает сумму из короткого русского письма; какая удерживает формат; какая отвечает достаточно быстро на вашем компьютере. Результат относится к этому сценарию, версии модели и настройкам.
Если два сервиса используют разные правила цензуры, лимиты контекста или инструменты, запишите это до сравнения. Не называйте тест одинаковым, если один участник получил больше исходных данных или дополнительную инструкцию.
Соберите набор задач до первого запуска
Возьмите несколько реальных, но безопасных примеров: обычный случай, неоднозначный текст, пропуск обязательного поля и длинный ввод. Уберите персональные данные и коммерческие секреты. Для каждого входа заранее напишите ожидаемый ответ или критерии, по которым редактор проверит результат.
Набор должен отражать работу, а не помогать одной конкретной модели. Если вы увидели ответ первой модели и после этого переписали задание, зафиксируйте изменение и повторите его для обеих. Иначе сравниваются разные задачи.
Зафиксируйте условия
Запишите имя и версию модели, дату, системную инструкцию, настройки генерации, подключённые инструменты и длину контекста. При локальном запуске добавьте компьютер, память и способ запуска. При облачном сервисе отметьте ограничения тарифа, если они повлияли на запрос.
Воспроизводимый тест не требует сложной платформы: таблица и папка с примерами подходят для небольшого набора. Для формальной оценки больших языковых моделей существуют отдельные фреймворки, например lm-evaluation-harness; он не отменяет проверки, что тест отражает именно вашу задачу.
Оцените результат по критериям
Поставьте бинарные отметки там, где это возможно: число сохранено, все обязательные поля есть, формат разбирается кодом, в ответ не добавлено фактов вне источника. Для текста с несколькими допустимыми формулировками используйте короткую шкалу с описанием каждого балла.
Синтаксически правильный JSON не равен правильному ответу. Схема структурированного вывода может помочь проверить форму, но смысловые поля нужно сравнить с источником. Сохраняйте рядом сырой ответ, оценку и причину ошибки.
Сравните затраты и повторяемость
Измерьте время ответа на одном устройстве или в одинаковых условиях сервиса. Для платного API учитывайте фактические расходы по доступному отчёту. Если цена или токены неизвестны, пометьте поле как неизвестное, а не как ноль. Не переносите результаты одного вечера на все версии продукта.
Повторите несколько запросов, если сервис может менять ответы при одинаковой настройке. В итоге сформулируйте узкий вывод: «для извлечения реквизитов на этом наборе победила модель X по точности, Y отвечала быстрее». Если выбор зависит от ошибки, решающей может быть одна конкретная ошибка, а не средний балл.