ИИ-агент можно проверить по тестовому сценарию — но этого недостаточно: реальные пользователи формулируют запросы иначе, используют неожиданные сочетания условий и вызывают инструменты в последовательности, которую трудно полностью предусмотреть заранее.
В targetai эти два типа контроля объединены в один цикл. Ночной симулятор регулярно перепроверяет версии агента на закреплённых сценариях, а автосудья разбирает уже завершённые диалоги с реальными пользователями. В результате команда получает два независимых сигнала о качестве: что сломалось в ожидаемом сценарии и что пошло не так в реальной работе.
Коротко: симулятор отвечает на вопрос «по-прежнему ли агент выполняет то, что мы от него требуем?», а автосудья — «как он фактически отработал с клиентами?».
1. Контроль начинается с конкретной версии агента
Версии позволяют отделять изменение агента от изменения реального трафика. Сохранение создаёт новую версию или обновляет черновик, но само по себе не переключает на неё пользователей. Публикация выполняется из истории изменений. Для нового агента первая версия публикуется автоматически, а следующее сохранение опубликованной версии создаёт черновик.
Если нужно проверить изменение на реальном трафике, к опубликованной версии можно добавить вторую версию в A/B-тест — в интерфейсе она получает 50% трафика. Это отдельный механизм от ночного симулятора: A/B-тест показывает поведение двух версий на реальных пользователях, а симулятор регулярно прогоняет закреплённые тестовые сценарии.
2. Ночной симулятор: регулярная проверка на закреплённых сценариях
Ночной симулятор берёт рабочие версии ИИ-агентов и прогоняет их через заранее закреплённые тестовые сценарии без участия человека. Задача механизма — регулярно замечать регрессии в инструкции или логике агента, не превращая проверку в ручной ритуал после каждого изменения.
В рабочем окружении проход запускается ежедневно в 00:00 UTC. За один проход отправляется не более двух версий, а суточный бюджет при доступном Redis составляет до 500 версий. Приоритет получают версии с большим реальным трафиком, но распределение устроено так, чтобы менее активные версии не выпадали из контроля.
Почему проверка ночная
Окно выбрано так, чтобы фоновые прогоны не конкурировали за ресурсы с реальными диалогами: ночью нагрузка от пользователей минимальна, а результаты появляются к началу рабочего дня команды. 00:00 UTC — это 3:00 по Москве, то есть проверка проходит до того, как в контакт-центр придёт утренний поток обращений.
Отсюда и ограничения на объём: не более двух версий за проход и до 500 версий в сутки. Симулятор не пытается перепроверить всё сразу, он размазывает нагрузку по дням и держит каждую версию под регулярным контролем.
Важно: ночной симулятор по умолчанию выключен. Его нужно включить для конкретного окружения. Версия также должна быть связана с требованиями и тестовыми сценариями — иначе симулятору нечего проверять.
Фоновые ночные симуляции не тарифицируются - это встроено в стоимость аренды платформы targetos.
Инструкцию правили в пятницу. Когда вы узнаете, что агент стал отвечать хуже? Посмотреть targetos 3. Автосудья: проверка реальных диалогов
Симулятор видит только то, что заранее описано в сценариях. Поэтому второй контур контроля работает уже на реальных диалогах.
Автосудья выбирает завершённые диалоги, которые ещё не получили автоматическую оценку, и анализирует стенограмму, вызовы инструментов и до трёх примеров симуляций той же задачи. Эти примеры служат ориентиром того, как должен выглядеть корректный результат.
На выходе команда получает не абстрактный «скор», а понятный результат «приемлемо / неприемлемо» и замечания, связанные с конкретными репликами агента. Установка "приемлемого" и не "приемлемого ответа" задается на уровне сценария и логики агента нашим LLM-инженером.
Автоматическая оценка регулярно проверяет около 20% диалогов каждого ИИ-агента за последние 7 дней. При этом система всегда оценивает как минимум один диалог, даже если объём обращений небольшой. Проверка выполняется в фоновом режиме и не влияет на основную работу агентов: нагрузка распределяется равномерно, а за один цикл система может отобрать для оценки до 5 000 диалогов.
В отличие от ночного симулятора, автосудья включен по умолчанию.
«Тестовый сценарий проверяет то, что мы уже придумали. Реальный диалог проверяет то, что мы не придумали. Поэтому два контура не дублируют друг друга: симулятор ловит регрессию в известном поведении, автосудья показывает, где сценарий вообще не был предусмотрен. Команда получает не общий процент качества, а конкретные реплики, к которым есть вопросы».
4. Результаты можно вынести в аналитику
Автоматическая оценка полезна не только как отметка внутри конкретного диалога. В аналитике её можно превратить в отдельный график — например, группировать по конкретным показателям.
После сохранения такой график появляется в общем разделе аналитики и может использоваться как регулярная точка контроля качества.
5. Как два механизма дополняют друг друга
Полный цикл выглядит так:
- Команда формулирует требования к агенту и закрепляет тестовые сценарии.
- Изменения сохраняются в новой версии; публикация и переключение трафика управляются отдельно.
- Ночной симулятор регулярно перепроверяет версии по известным сценариям.
- Агент продолжает работать с реальными пользователями.
- Автосудья разбирает часть завершённых диалогов и находит отклонения, которые тестовые сценарии могли не предусмотреть.
- Команда использует оба сигнала для следующей итерации агента — и при необходимости проверяет новую версию через A/B-тест.
Сочетание двух контуров важно: симулятор ловит регрессию в ожидаемом поведении, автосудья — проблемы в реальном использовании.
Голосовой агент на первой линии банка. Как там удерживают качество на потоке? Смотреть кейс 6. Ключевые параметры по умолчанию
| Механизм | Что проверяет | Режим / ограничение |
|---|---|---|
| Ночной симулятор | Версии по тестовым сценариям | 00:00 UTC ежедневно |
| Ночной симулятор | За проход | ≤ 2 версии |
| Ночной симулятор | Суточный бюджет | до 500 версий (Redis) |
| Автосудья | Доля очереди | ~20%; минимум 1 диалог |
| Автосудья | Окно | 7 дней |
| Автосудья | Параллельно | ≤ 5 обращений |
| Автосудья | За проход | ≤ 5000 кандидатов |
Что получает команда
Для команды это постоянный фоновый контур качества вместо ручных прогонов: быстрее видны регрессии, ошибки на реальных диалогах и системное ухудшение конкретной версии. Проверки идут порциями и ограничены по нагрузке, поэтому не требуют прогонять весь массив сразу.
Разберём контроль качества
на ваших сценариях
Покажем, как закрепить требования и тестовые сценарии за версиями агента, включить ночной симулятор в вашем окружении и вывести оценки автосудьи в отдельный дашборд. Разбор идёт на ваших диалогах, а не на демо-данных.