Что такое confidence score — и почему «уверен на 97%» не значит «это правда»

Попробуй такой опыт. Спроси у модели что-нибудь реальное и попроси оценить уверенность — получишь «95%». Теперь спроси про книгу, которой не существует, и попроси то же самое. Скорее всего, снова услышишь что-то около 90%.
Цифра почти не сдвинулась. И это не поломка: уверенность модели измеряет совсем не то, что ты думаешь.
Что такое confidence score
Confidence score — это число от 0 до 1 (или в процентах), которое показывает, насколько модель уверена в том, что выдала. Ты встретишь его в трёх видах: как оценку класса у классификатора («спам: 0,93»), как логарифмическую вероятность каждого слова в ответе, и как фразу «я уверен примерно на 80%» прямо в тексте.
Проблема в том, что все три числа отвечают на разные вопросы, а выглядят одинаково.
Откуда берётся цифра
Языковая модель на каждом шаге выбирает следующий токен из всего словаря. Перед выбором у неё есть вероятность для каждого варианта: «Париж» — 0,91, «Лион» — 0,04, «столица» — 0,01 и так далее.
В API это можно попросить показать — они называются логпробы (логарифмы вероятностей). Логпроб всегда отрицательный или ноль, где ноль — это стопроцентная уверенность. Обычно вместе с выбранным токеном можно получить и несколько ближайших альтернатив с их вероятностями.
Звучит как честное окно во внутренности модели. Оно и есть — но окно смотрит не туда.
Уверенность в токене — это не уверенность в ответе
Вот главное, ради чего стоит дочитать.
Логпроб говорит: «в этой позиции я почти наверняка ставлю слово Париж». Он не говорит: «утверждение, которое я сейчас пишу, соответствует действительности».
Если модель выдумала несуществующую книгу, она напишет её название очень уверенно — потому что после трёх слов выдуманного заголовка четвёртое слово предсказывается легко. Внутри своей выдумки модель абсолютно последовательна. Это ровно тот механизм, из-за которого галлюцинация звучит так убедительно: высокая уверенность в словах, ноль информации о правде.
Что такое калибровка — и почему её ломает дообучение
Хорошо откалиброванная модель — это когда из всех ответов, где она сказала «80%», правильными оказываются примерно 80%. Плохо откалиброванная — когда она говорит «95%», а права в половине случаев.
И тут начинается неожиданное. В техническом отчёте GPT-4 показали две версии одной модели:
- базовая модель (та, что просто предсказывает текст) оказалась почти идеально откалиброванной;
- та же модель после дообучения на человеческих оценках (RLHF) стала откалибрована примерно в десять раз хуже.
Дообучение, которое сделало модель вежливым и полезным ассистентом, испортило честность её цифр. Логично: людям-оценщикам нравятся уверенные, гладкие ответы — модель и научилась звучать уверенно. Уверенно всегда.
Именно поэтому нельзя брать логпроб из чата и подставлять его в свою логику как вероятность правды.
Три способа получить уверенность — и что с ними делать
1. Логпробы. Дёшево, приходят вместе с ответом. Отлично работают там, где ответ — это одно слово из закрытого списка: спам/не спам, категория тикета, да/нет. В задачах с выбором из вариантов они честные.
2. Спросить словами. Попросить модель прямо: «оцени свою уверенность от 0 до 100». Звучит наивно, но для чат-моделей это часто работает лучше, чем сырые вероятности: в исследовании Стэнфорда и Гарварда (EMNLP 2023) названная словами уверенность оказалась примерно вдвое ближе к реальности, чем внутренние вероятности тех же моделей.
3. Спросить несколько раз. Задай один и тот же вопрос три-пять раз и сравни ответы. Совпали — можно верить. Разошлись — модель не знает. Дороже в три-пять раз, но это самый надёжный сигнал из трёх, потому что он меряет не слова, а устойчивость ответа.
Как этим пользоваться
Не превращай уверенность в приговор «правда/ложь». Используй как маршрутизатор:
- высокая уверенность → показываем ответ;
- средняя → показываем, но с пометкой «проверь» или со ссылкой на источник;
- низкая → не показываем, а переспрашиваем или отдаём человеку.
И держи в голове, что любой порог на этой цифре — это выбор между двумя видами ошибок: пропустить чушь или зря забраковать хороший ответ. Как это считать, разобрано в статье про ложные срабатывания.
Можно ли просто попросить модель дать процент уверенности?
Да, и для чат-моделей это на удивление рабочий вариант — часто лучше сырых вероятностей. Но проси не «уверен или нет», а число по шкале и коротким обоснованием: так ответ реже скатывается к дежурному «95%». И всё равно перепроверяй: цифра остаётся оценкой, а не измерением.
У всех ли моделей есть логпробы?
Нет. Часть API отдаёт их по флагу в запросе, часть не отдаёт вовсе — особенно это касается reasoning-моделей, где внутренние рассуждения скрыты. Если логпробов нет, остаются два других способа: спросить словами или прогнать один и тот же запрос несколько раз и сравнить ответы.
Короткие уроки-истории, симулятор агента и ежедневная практика — в нашем мобильном приложении. Бесплатно.





