cosaiДокументация
Качество и публикация

Метрики качества

Три показателя, которые отвечают на вопрос «что именно испортилось», и очередь вопросов, на которые база не ответила.

Eval-гейт отвечает «пускать агента к клиентам или нет». Но когда качество проседает, важнее другой вопрос — что именно испортилось: агент перестал находить документы или начал выдумывать поверх найденных. Раздел Качество в консоли отвечает именно на него.

Три показателя, а не один

Они падают по разным причинам, и лечатся по-разному. Одно общее число этого не показывает: агент может исправно отвечать на все вопросы и при этом выдумывать половину фактов.

ПоказательЧто означаетЧто делать, если падает
Покрытиедоля вопросов, на которые поиск нашёл хоть один фрагмент базыне хватает документов — пополните базу знаний или проверьте, какие базы привязаны к агенту
Recall@6какую часть эталонных документов вопроса поиск действительно досталпроблема в поиске, а не в модели: документы есть, но агент их не видит
Обоснованностьдоля ответов, подтверждённых найденным контекстомдокументы нашлись, а ответ мимо них — виновата модель или системный промпт

Рядом показывается доля выдумок — обратная сторона обоснованности. Именно её обычно и хотят видеть руководители: сколько ответов агент дал не по документам.

Почему иногда стоит прочерк

Показатель, который не на чем посчитать, показывается прочерком, а не нулём. Так и задумано: ноль означал бы «плохо», а прочерк честно означает «не измерено».

Прочерк вы увидите, если:

  • у вопросов не заданы эталонные документы — тогда не считается Recall@6 (см. ниже);
  • прогонов ещё не было — измерять нечего;
  • старая модель-судья не вернула нужную оценку по конкретному ответу.

Какие вопросы в каких метриках участвуют

Не каждый вопрос годится для каждой метрики, и это важно понимать, читая отчёт.

Вопросы типа oos (ответа в базе нет) и adversarial (провокация, проверяющая запреты из политики) требуют от агента отказа. У правильного отказа нет ни фактов из документов, ни ссылок [N] — значит по ним нельзя мерить ни обоснованность, ни долю ссылок, ни полноту поиска. Такие вопросы исключены из этих трёх метрик: иначе агент, который безупречно держит запреты, выглядел бы в отчёте как выдумщик.

Оценка прохождения проверки (та, что решает судьбу публикации) при этом считается по всем вопросам — отказ на провокации там как раз засчитывается в плюс.

Рядом с процентами хранится размер выборки: если судья по части вопросов не смог вернуть оценку, метрика считается по остатку, и это видно, а не выдаётся за полное измерение.

Эталонные документы: как включить Recall

Recall показывает, нашёл ли поиск именно те документы, в которых ответ действительно есть. Платформа не может угадать это сама — эталон задаёте вы, один раз:

  1. Откройте карточку агента, блок Eval-датасет.
  2. У вопроса нажмите + документ в строке «Эталонные документы» и выберите документ, где содержится ответ.
  3. Сохраните датасет и запустите проверку заново.

Выбирать можно только документы из баз, привязанных к этому агенту, — эталон из чужой базы агент не достанет в принципе. У вопросов, требующих отказа (oos и adversarial), эталона нет по определению: строка для них не показывается, а если эталон остался от прошлой правки вопроса, в расчёте он не участвует.

Динамика и сравнение «до и после»

На странице агента, в блоке Контроль качества, показывается график по всем прогонам — видно, как качество менялось после ваших правок.

Ниже — блок «Что изменилось с прошлого прогона»: смена модели, изменение датасета, дельты по каждому показателю и поимённый список вопросов, которые сломались или починились. Это важнее средней оценки: она может не шелохнуться, когда половина вопросов упала, а половина выросла.

Вопросы без ответа

Когда клиент спрашивает о том, чего в базе знаний нет, поиск не находит ни одного фрагмента. Раньше такой случай исчезал бесследно — теперь он попадает в список «Вопросы без ответа» внизу раздела «Качество».

Это самый прямой ответ на вопрос «какие документы нам ещё нужны»: список отсортирован по частоте, одинаковые вопросы объединяются и показывают счётчик повторов.

С каждым вопросом можно сделать одно из двух:

  • В проверку — вопрос добавляется в eval-датасет агента. После того как вы пополните базу, гейт публикации сам проверит, что дыра закрыта.
  • Скрыть (крестик) — если вопрос не по адресу и отвечать на него агент не должен.

Оба действия доступны владельцу и администратору в консоли: добавление вопроса в датасет снимает агента с публикации до нового прогона, поэтому решение принимает человек, а не ключ интеграции.

Слишком длинный вопрос (клиенты иногда вставляют в чат целый лог) в датасет не пройдёт: платформа скажет, сколько в нём символов и сколько допустимо. Отредактируйте его в редакторе датасета вручную — в проверке важна суть вопроса, а не исходный текст целиком.

Эскалации и оценки операторов

В той же таблице по агентам видно поведение в проде: как часто агент передаёт диалог человеку и как его ответы оценивают операторы в разделе Диалоги. Рост эскалаций при хорошем покрытии обычно означает, что агенту не хватает не знаний, а разрешений — посмотрите политику ответа.

On this page