Метрики качества
Три показателя, которые отвечают на вопрос «что именно испортилось», и очередь вопросов, на которые база не ответила.
Eval-гейт отвечает «пускать агента к клиентам или нет». Но когда качество проседает, важнее другой вопрос — что именно испортилось: агент перестал находить документы или начал выдумывать поверх найденных. Раздел Качество в консоли отвечает именно на него.
Три показателя, а не один
Они падают по разным причинам, и лечатся по-разному. Одно общее число этого не показывает: агент может исправно отвечать на все вопросы и при этом выдумывать половину фактов.
| Показатель | Что означает | Что делать, если падает |
|---|---|---|
| Покрытие | доля вопросов, на которые поиск нашёл хоть один фрагмент базы | не хватает документов — пополните базу знаний или проверьте, какие базы привязаны к агенту |
| Recall@6 | какую часть эталонных документов вопроса поиск действительно достал | проблема в поиске, а не в модели: документы есть, но агент их не видит |
| Обоснованность | доля ответов, подтверждённых найденным контекстом | документы нашлись, а ответ мимо них — виновата модель или системный промпт |
Рядом показывается доля выдумок — обратная сторона обоснованности. Именно её обычно и хотят видеть руководители: сколько ответов агент дал не по документам.
Почему иногда стоит прочерк
Показатель, который не на чем посчитать, показывается прочерком, а не нулём. Так и задумано: ноль означал бы «плохо», а прочерк честно означает «не измерено».
Прочерк вы увидите, если:
- у вопросов не заданы эталонные документы — тогда не считается Recall@6 (см. ниже);
- прогонов ещё не было — измерять нечего;
- старая модель-судья не вернула нужную оценку по конкретному ответу.
Какие вопросы в каких метриках участвуют
Не каждый вопрос годится для каждой метрики, и это важно понимать, читая отчёт.
Вопросы типа oos (ответа в базе нет) и adversarial (провокация, проверяющая запреты из политики) требуют от агента отказа. У правильного отказа нет ни фактов из документов, ни ссылок [N] — значит по ним нельзя мерить ни обоснованность, ни долю ссылок, ни полноту поиска. Такие вопросы исключены из этих трёх метрик: иначе агент, который безупречно держит запреты, выглядел бы в отчёте как выдумщик.
Оценка прохождения проверки (та, что решает судьбу публикации) при этом считается по всем вопросам — отказ на провокации там как раз засчитывается в плюс.
Рядом с процентами хранится размер выборки: если судья по части вопросов не смог вернуть оценку, метрика считается по остатку, и это видно, а не выдаётся за полное измерение.
Эталонные документы: как включить Recall
Recall показывает, нашёл ли поиск именно те документы, в которых ответ действительно есть. Платформа не может угадать это сама — эталон задаёте вы, один раз:
- Откройте карточку агента, блок Eval-датасет.
- У вопроса нажмите + документ в строке «Эталонные документы» и выберите документ, где содержится ответ.
- Сохраните датасет и запустите проверку заново.
Выбирать можно только документы из баз, привязанных к этому агенту, — эталон из чужой базы агент не достанет в принципе. У вопросов, требующих отказа (oos и adversarial), эталона нет по определению: строка для них не показывается, а если эталон остался от прошлой правки вопроса, в расчёте он не участвует.
Динамика и сравнение «до и после»
На странице агента, в блоке Контроль качества, показывается график по всем прогонам — видно, как качество менялось после ваших правок.
Ниже — блок «Что изменилось с прошлого прогона»: смена модели, изменение датасета, дельты по каждому показателю и поимённый список вопросов, которые сломались или починились. Это важнее средней оценки: она может не шелохнуться, когда половина вопросов упала, а половина выросла.
Вопросы без ответа
Когда клиент спрашивает о том, чего в базе знаний нет, поиск не находит ни одного фрагмента. Раньше такой случай исчезал бесследно — теперь он попадает в список «Вопросы без ответа» внизу раздела «Качество».
Это самый прямой ответ на вопрос «какие документы нам ещё нужны»: список отсортирован по частоте, одинаковые вопросы объединяются и показывают счётчик повторов.
С каждым вопросом можно сделать одно из двух:
- В проверку — вопрос добавляется в eval-датасет агента. После того как вы пополните базу, гейт публикации сам проверит, что дыра закрыта.
- Скрыть (крестик) — если вопрос не по адресу и отвечать на него агент не должен.
Оба действия доступны владельцу и администратору в консоли: добавление вопроса в датасет снимает агента с публикации до нового прогона, поэтому решение принимает человек, а не ключ интеграции.
Слишком длинный вопрос (клиенты иногда вставляют в чат целый лог) в датасет не пройдёт: платформа скажет, сколько в нём символов и сколько допустимо. Отредактируйте его в редакторе датасета вручную — в проверке важна суть вопроса, а не исходный текст целиком.
Эскалации и оценки операторов
В той же таблице по агентам видно поведение в проде: как часто агент передаёт диалог человеку и как его ответы оценивают операторы в разделе Диалоги. Рост эскалаций при хорошем покрытии обычно означает, что агенту не хватает не знаний, а разрешений — посмотрите политику ответа.
