Хорошая прогнозная модель должна не просто часто угадывать победителя. Если она говорит «60%», то на длинной серии таких прогнозов событие должно происходить примерно в шести случаях из десяти. Это и есть калибровка — проверка соответствия заявленной вероятности реальной частоте результата. Для более точной оценки полезно сопоставить этот подход с Бэктест спортивной модели: как проверять прогнозы на истории и Как находить переоцененные спортивные линии: сравнение своей вероятности с коэффициентом. Базовые ориентиры по этой задаче собраны также в разделе основам вероятностного прогнозирования.

Вероятность не равна уверенности

Если модель выдает прогнозы в диапазоне 50–60%, полезно собрать их в отдельную группу и сравнить заявленную вероятность с фактической частотой события. При больших отклонениях модель систематически завышает или занижает уверенность. Это можно исправлять отдельной калибровкой. Точность победителя может выглядеть хорошо даже у плохо откалиброванной модели. Например, прогнозы 70% и 90% способны часто выбирать правильную сторону, но если реальные частоты ближе к 60% и 75%, риск в числовых вероятностях завышен. Для ставок это принципиальная разница. В разделе «Вероятность не равна уверенности» сначала важно разделить сам показатель и его привычную интерпретацию: цифра может хорошо описывать прошлое, но не помогать прогнозировать будущее.

Калибровка проверяет, соответствует ли заявленная вероятность фактической частоте события. Модель, которая часто называет 70%, но выигрывает только примерно в половине таких случаев, может быть полезна для ранжирования, но плохо сообщает уровень уверенности.

Что значит прогноз 60%

Для корректного разбора «Что значит прогноз 60%» сначала убедитесь, что данные сравнимы: одинаково названные показатели имеют смысл для сравнения только при единых правилах сбора и расчёта.

Для проверки нужны большие группы прогнозов. На короткой серии даже хорошо откалиброванная модель будет выглядеть нестабильно, потому что случайные результаты заметно влияют на доли попаданий.

Большая выборка нужна обязательно

График калибровки особенно полезен при сравнении нескольких моделей. Одна может иметь лучшую точность, другая — более надежные вероятности. Для решений, где важен размер преимущества, второй показатель часто оказывается важнее.

График калибровки

Brier score и логарифмическая потеря помогают оценивать не только исход, но и качество самой вероятности. Прогноз 51% и 90% не должны считаться одинаково хорошими, если событие произошло: цена чрезмерной уверенности должна учитываться.

Brier score простыми словами

Улучшать калибровку стоит только после проверки на отложенных данных. Если настройка заметно улучшает результат на той же выборке, где подбирались параметры, это может быть обычным переобучением.

Смещение модели

Ключевой ориентир для «Смещение модели»: Прогноз 51% и 90% не должны считаться одинаково хорошими, если событие произошло: цена чрезмерной уверенности должна учитываться.

Переобучение

Ключевой ориентир для «Переобучение»: Если настройка заметно улучшает результат на той же выборке, где подбирались параметры, это может быть обычным переобучением.

Главный вывод

Калибровка отвечает на важный вопрос: можно ли доверять числу, которое модель называет вероятностью. Высокая точность не гарантирует хорошей калибровки, потому что модель может правильно выбирать фаворита, но сильно завышать или занижать степень уверенности.

Поэтому проверять нужно распределение вероятностей на достаточно большой выборке. Если прогнозы с оценкой около 60% действительно реализуются примерно в шести случаях из десяти, вероятность имеет практический смысл. Если нет, модель стоит калибровать на отдельном периоде и затем снова проверять на новых данных.

По теме