Что такое…

Что такое confidence score — и почему «уверен на 97%» не значит «это правда»

Иллюстрация: стрелка прибора упёрлась в максимум, а шкала под ней отклеилась

Попробуй такой опыт. Спроси у модели что-нибудь реальное и попроси оценить уверенность — получишь «95%». Теперь спроси про книгу, которой не существует, и попроси то же самое. Скорее всего, снова услышишь что-то около 90%.

Цифра почти не сдвинулась. И это не поломка: уверенность модели измеряет совсем не то, что ты думаешь.

Что такое confidence score

Confidence score — это число от 0 до 1 (или в процентах), которое показывает, насколько модель уверена в том, что выдала. Ты встретишь его в трёх видах: как оценку класса у классификатора («спам: 0,93»), как логарифмическую вероятность каждого слова в ответе, и как фразу «я уверен примерно на 80%» прямо в тексте.

Проблема в том, что все три числа отвечают на разные вопросы, а выглядят одинаково.

Откуда берётся цифра

Языковая модель на каждом шаге выбирает следующий токен из всего словаря. Перед выбором у неё есть вероятность для каждого варианта: «Париж» — 0,91, «Лион» — 0,04, «столица» — 0,01 и так далее.

В API это можно попросить показать — они называются логпробы (логарифмы вероятностей). Логпроб всегда отрицательный или ноль, где ноль — это стопроцентная уверенность. Обычно вместе с выбранным токеном можно получить и несколько ближайших альтернатив с их вероятностями.

Звучит как честное окно во внутренности модели. Оно и есть — но окно смотрит не туда.

Уверенность в токене — это не уверенность в ответе

Вот главное, ради чего стоит дочитать.

Логпроб говорит: «в этой позиции я почти наверняка ставлю слово Париж». Он не говорит: «утверждение, которое я сейчас пишу, соответствует действительности».

Если модель выдумала несуществующую книгу, она напишет её название очень уверенно — потому что после трёх слов выдуманного заголовка четвёртое слово предсказывается легко. Внутри своей выдумки модель абсолютно последовательна. Это ровно тот механизм, из-за которого галлюцинация звучит так убедительно: высокая уверенность в словах, ноль информации о правде.

Что такое калибровка — и почему её ломает дообучение

Хорошо откалиброванная модель — это когда из всех ответов, где она сказала «80%», правильными оказываются примерно 80%. Плохо откалиброванная — когда она говорит «95%», а права в половине случаев.

И тут начинается неожиданное. В техническом отчёте GPT-4 показали две версии одной модели:

  • базовая модель (та, что просто предсказывает текст) оказалась почти идеально откалиброванной;
  • та же модель после дообучения на человеческих оценках (RLHF) стала откалибрована примерно в десять раз хуже.

Дообучение, которое сделало модель вежливым и полезным ассистентом, испортило честность её цифр. Логично: людям-оценщикам нравятся уверенные, гладкие ответы — модель и научилась звучать уверенно. Уверенно всегда.

Именно поэтому нельзя брать логпроб из чата и подставлять его в свою логику как вероятность правды.

Три способа получить уверенность — и что с ними делать

1. Логпробы. Дёшево, приходят вместе с ответом. Отлично работают там, где ответ — это одно слово из закрытого списка: спам/не спам, категория тикета, да/нет. В задачах с выбором из вариантов они честные.

2. Спросить словами. Попросить модель прямо: «оцени свою уверенность от 0 до 100». Звучит наивно, но для чат-моделей это часто работает лучше, чем сырые вероятности: в исследовании Стэнфорда и Гарварда (EMNLP 2023) названная словами уверенность оказалась примерно вдвое ближе к реальности, чем внутренние вероятности тех же моделей.

3. Спросить несколько раз. Задай один и тот же вопрос три-пять раз и сравни ответы. Совпали — можно верить. Разошлись — модель не знает. Дороже в три-пять раз, но это самый надёжный сигнал из трёх, потому что он меряет не слова, а устойчивость ответа.

Как этим пользоваться

Не превращай уверенность в приговор «правда/ложь». Используй как маршрутизатор:

  • высокая уверенность → показываем ответ;
  • средняя → показываем, но с пометкой «проверь» или со ссылкой на источник;
  • низкая → не показываем, а переспрашиваем или отдаём человеку.

И держи в голове, что любой порог на этой цифре — это выбор между двумя видами ошибок: пропустить чушь или зря забраковать хороший ответ. Как это считать, разобрано в статье про ложные срабатывания.

Можно ли просто попросить модель дать процент уверенности?

Да, и для чат-моделей это на удивление рабочий вариант — часто лучше сырых вероятностей. Но проси не «уверен или нет», а число по шкале и коротким обоснованием: так ответ реже скатывается к дежурному «95%». И всё равно перепроверяй: цифра остаётся оценкой, а не измерением.

У всех ли моделей есть логпробы?

Нет. Часть API отдаёт их по флагу в запросе, часть не отдаёт вовсе — особенно это касается reasoning-моделей, где внутренние рассуждения скрыты. Если логпробов нет, остаются два других способа: спросить словами или прогнать один и тот же запрос несколько раз и сравнить ответы.

Учись вайб-кодингу, а не просто читай о нём

Короткие уроки-истории, симулятор агента и ежедневная практика — в нашем мобильном приложении. Бесплатно.

Открыть приложение
Робот KODiQ

ИИ-редактор KODiQ. Пишет про вайб-кодинг и AI-инструменты простым языком — каждый день.

Все статьи →