В этом разборе
Проверяйте поведение, а не демонстрацию
Несколько удачных вопросов не показывают готовность AI-помощника. Нужен сохранённый набор реальных формулировок с ожидаемым поведением, источником факта и критерием передачи человеку. После каждого изменения модели, инструкции или базы знаний этот набор запускают снова.
Не подбирайте только удобные примеры. Добавьте опечатки, неполные данные, два вопроса в одном сообщении, конфликтующие условия, просьбу о человеке и тему вне сценария. Именно на границах проявляются опасные уверенные ответы.
Соберите четыре группы вопросов
| Группа | Пример | Ожидаемое поведение |
|---|---|---|
| Обычные | Есть ли этот диван в ткани X? | Ответить по источнику |
| Неоднозначные | Сколько будет стоить примерно? | Уточнить влияющие параметры |
| Рискованные | Гарантируйте монтаж к пятнице | Не обещать, передать человеку |
| Неподдерживаемые | Рассчитайте несущую конструкцию | Обозначить границу и передать |
Используйте обезличенные реальные вопросы. Синтетические примеры дополняют набор, но не должны полностью заменять язык клиентов.
Оценивайте по отдельным критериям
- факт подтверждён разрешённым источником;
- ответ закрывает вопрос без лишних обещаний;
- неизвестное обозначено как неизвестное;
- передача срабатывает и сохраняет контекст;
- тон понятен, но не маскирует отсутствие данных.
Задайте критические ошибки, при которых ответ не проходит независимо от средней оценки: выдуманная цена, неверная комплектация, раскрытие данных, пропущенная просьба о человеке. Официальное руководство OpenAI по оценке рекомендует ясные критерии и наборы, отражающие реальное распределение задач и крайние случаи.
Разбирайте причину каждой ошибки
Одинаковая неверная фраза может иметь разные причины: устаревший источник, неудачный поиск, неоднозначная инструкция или отсутствие правила передачи. Не исправляйте всё добавлением ещё одного запрета в промпт. Сначала найдите слой сбоя, внесите минимальную правку и повторите весь набор, чтобы не создать регрессию.
Храните вход, версию системы, результат, оценку и решение. Это позволяет сравнивать изменения и не обсуждать поведение по памяти. Персональные данные из реальных диалогов нужно удалить или обрабатывать в разрешённом контуре.
Запускайте с наблюдением и возвратом
После лабораторной проверки ограничьте аудиторию или долю диалогов, оставьте быстрый переход к человеку и способ отключить сценарий. Сотрудники должны видеть исходный разговор и сообщать об ошибке. Новые случаи пополняют проверочный набор до следующего расширения.
Сделайте набор воспроизводимым
Храните не только вопросы, но и разрешённый контекст, версию источника, ожидаемые обязательные элементы и запрещённые утверждения. Иначе один и тот же пример будут оценивать по-разному. Часть набора держите неизменной для сравнения версий, а часть регулярно обновляйте свежими реальными случаями. Разделяйте проверку качества текста и фактического поведения интеграции: правильный ответ в тестовом окне не доказывает, что в рабочем канале сохраняется контекст и срабатывает передача человеку.
Источники
От разбора — к вашему сайту
Посмотрите состав работ для вашей задачи.





