Сегодня хочу поговорить про тестирование технологии, которая активно применяется в ИИ агентах, а именно MCP-сервере.
Как убедиться, что он работает правильно?
Тестировать MCP сервер нужно по уровням, потому что каждый уровень отвечает за свой слой.
Уровень 1 - MCP Inspector. Это как Postman, только специально для MCP. Запускаете одной командой, открывается веб-интерфейс, и вы сразу видите список всех инструментов, можете вызвать любой вручную и посмотреть сырой JSON. Никакого агента не нужно, просто проверяем что сервер живой и отвечает.
Уровень 2 - curl или Postman. Если сервер работает по HTTP, то это обычный POST-запрос. Тестируется как любой REST API, пробуя передавать разные аргументы в JSON.
Уровень 3 - юнит-тесты. Сам протокол тестировать не нужно, он стандартный. Тестируем бизнес-логику каждого инструмента в изоляции, с замоканным API.
Уровень 4 - интеграция с реальным агентом. Тут уже даем задачу на естественном языке ИИ агенту, куда интегрирован MCP и проверяем следующее, правильно ли инструмент вызван, верные ли аргументы переданы, правильный ли ответ получен.
Именно такая послойная проверка дает уверенность, что MCP сервер готов к работе.
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Как убедиться, что он работает правильно?
Тестировать MCP сервер нужно по уровням, потому что каждый уровень отвечает за свой слой.
Уровень 1 - MCP Inspector. Это как Postman, только специально для MCP. Запускаете одной командой, открывается веб-интерфейс, и вы сразу видите список всех инструментов, можете вызвать любой вручную и посмотреть сырой JSON. Никакого агента не нужно, просто проверяем что сервер живой и отвечает.
Уровень 2 - curl или Postman. Если сервер работает по HTTP, то это обычный POST-запрос. Тестируется как любой REST API, пробуя передавать разные аргументы в JSON.
Уровень 3 - юнит-тесты. Сам протокол тестировать не нужно, он стандартный. Тестируем бизнес-логику каждого инструмента в изоляции, с замоканным API.
Уровень 4 - интеграция с реальным агентом. Тут уже даем задачу на естественном языке ИИ агенту, куда интегрирован MCP и проверяем следующее, правильно ли инструмент вызван, верные ли аргументы переданы, правильный ли ответ получен.
Именно такая послойная проверка дает уверенность, что MCP сервер готов к работе.
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
❤6🔥4
Эпоха написания вручную кода для автотестов заканчивается?
Несколько лет назад хороший автоматизатор был тот, кто умеет писать код, дорабатывать или поднимать фреймворк для автотестов, поэтому знания программирования, опыт работы Selenium, JUnit, pytest, playwright и другими было необходимо для развития и трудоустройства.
Сегодня же AI-агенты генерируют код для автотестов за секунды, и честно признаться, делают это вполне неплохо, поэтому вопрос уже не в том, умеешь ли ты писать код, а в том, что:
→ Умеешь ли ты объяснить системе, что именно нужно проверять и почему?
→ Умеешь ли ты оценить, правильно ли был сгененрирован автотест?
→ Умеешь ли ты управлять и настраивать ИИ агентов для тестирования?
→ Умеешь ли ты выстроить стратегию покрытия, а не просто набор скриптов?
Это и есть новые компетенции тестировщика, которые постепенно будут занимать место старым парадигмам. И это не предположении, это уже начало происходить и вопрос в том, что насколько быстро это будет распространяться.
Что думаете по этому поводу?
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Несколько лет назад хороший автоматизатор был тот, кто умеет писать код, дорабатывать или поднимать фреймворк для автотестов, поэтому знания программирования, опыт работы Selenium, JUnit, pytest, playwright и другими было необходимо для развития и трудоустройства.
Сегодня же AI-агенты генерируют код для автотестов за секунды, и честно признаться, делают это вполне неплохо, поэтому вопрос уже не в том, умеешь ли ты писать код, а в том, что:
→ Умеешь ли ты объяснить системе, что именно нужно проверять и почему?
→ Умеешь ли ты оценить, правильно ли был сгененрирован автотест?
→ Умеешь ли ты управлять и настраивать ИИ агентов для тестирования?
→ Умеешь ли ты выстроить стратегию покрытия, а не просто набор скриптов?
Это и есть новые компетенции тестировщика, которые постепенно будут занимать место старым парадигмам. И это не предположении, это уже начало происходить и вопрос в том, что насколько быстро это будет распространяться.
Что думаете по этому поводу?
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
🔥7👍4
Всем привет!
В выходные, после просмотра пары видео на тему развития AI подумал, что сегодня существует большое количество бенчмарков на разные возможности модели, включая кодинг, но почему то нет бенчмарка на оценку моделей и агентов в части генерации тест-кейсов (не unit).
Поэтому, я решил попробовать подумать над этой задачей и решить ее.
Это не просто проект. Потенциально - это будет полноценный научный проект по созданию бенчмарка для оценки ИИ агентов в части генерации тестов, который я планирую опубликовать на hugging face, а также подготовить и опубликовать научную работу по нему.
К чем я все это?
1. Я ищу людей, которым было бы интересно безвозмездно принять в таком проекте в свободное время.
Основным требования:
• опыт в тестировании и написании тестов от 2-3 лет
• знание и умение принять на практике техники тест дизайна базовые
• английский на уровне upper-intermediate (весь датасет будет на англ + возможно участники из других стран)
Если вы готовы принять участие в данном исследовании, как полноценный участник, пишите мне в личку @al_meshkov
2. Я ищу тех, кто готов поделить данными для бенчмарка, интересует связка “требования - написанные под них тесты”. Конечно понимая NDA, можно предоставить их обезличенными, а также с письменным согласием от компании.
Если у вас есть какие-то пет проекты, ваши обучающие проекты, где вы или кто-то писал тесты, или вы или ваша компания готова поделиться данными, пишите мне в личку @al_meshkov
В общем в начале года я говорил о том, что хотел бы создать комьюнити, которое бы развивало и двигало тему ИИ тестирования вперед, и это будет первых проект, который я хочу попробовать реализовать в рамках данного комьюнити.
Если у вас также есть какие то идеи в части развития практик как тестирования ИИ, так и тестирования с помощью ИИ (ai-assisted testing), велком, пишите!
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
В выходные, после просмотра пары видео на тему развития AI подумал, что сегодня существует большое количество бенчмарков на разные возможности модели, включая кодинг, но почему то нет бенчмарка на оценку моделей и агентов в части генерации тест-кейсов (не unit).
Поэтому, я решил попробовать подумать над этой задачей и решить ее.
Это не просто проект. Потенциально - это будет полноценный научный проект по созданию бенчмарка для оценки ИИ агентов в части генерации тестов, который я планирую опубликовать на hugging face, а также подготовить и опубликовать научную работу по нему.
К чем я все это?
1. Я ищу людей, которым было бы интересно безвозмездно принять в таком проекте в свободное время.
Основным требования:
• опыт в тестировании и написании тестов от 2-3 лет
• знание и умение принять на практике техники тест дизайна базовые
• английский на уровне upper-intermediate (весь датасет будет на англ + возможно участники из других стран)
Если вы готовы принять участие в данном исследовании, как полноценный участник, пишите мне в личку @al_meshkov
2. Я ищу тех, кто готов поделить данными для бенчмарка, интересует связка “требования - написанные под них тесты”. Конечно понимая NDA, можно предоставить их обезличенными, а также с письменным согласием от компании.
Если у вас есть какие-то пет проекты, ваши обучающие проекты, где вы или кто-то писал тесты, или вы или ваша компания готова поделиться данными, пишите мне в личку @al_meshkov
В общем в начале года я говорил о том, что хотел бы создать комьюнити, которое бы развивало и двигало тему ИИ тестирования вперед, и это будет первых проект, который я хочу попробовать реализовать в рамках данного комьюнити.
Если у вас также есть какие то идеи в части развития практик как тестирования ИИ, так и тестирования с помощью ИИ (ai-assisted testing), велком, пишите!
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
🔥15❤3
Как понять что AI-система не готова к продакшену? Я определил 7 признаков некачественно проведенной ИИ системы, которые я регулярно вижу:
1. Нет baseline метрик. То есть нет базовых показателей метрик, от которой можно отталкнуться для дальнейшей оценки, отсюда нет понимания что значит "хороший" результат и как определить, что следующая версия лучше или хуже текущей.
2. Тестировали только happy path. Проверяли только ожидаемые сценарии и типичные запросы, а реальные пользователи могут начать вести себя по другому.
3. Нет adversarial кейсов. Никто не пытался сломать систему нестандартными или противоречивыми запросами.
4. Нет автоматического регрессионного тестирования. Каждое обновление модели или изменение промпта уходит в продакшен без проверки, что существующее поведение не сломалось.
5. Нет мониторинга в продакшене. После деплоя никто не отслеживает процент галлюцинаций и качество ответов. Качество может начать деградировать незаметно, пока что-то не сломается достаточно серьезно.
6. Тестовый датасет собрала команда разработки. Он отражает то, как разработчики представляют взаимодействие с системой, а не то, что может происходить в реальности.
7. QA увидел систему впервые прямо перед релизом. К этому моменту уже нет времени исправить что-то существенное.
Согласны или нет, или есть что добавить? 👇
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
1. Нет baseline метрик. То есть нет базовых показателей метрик, от которой можно отталкнуться для дальнейшей оценки, отсюда нет понимания что значит "хороший" результат и как определить, что следующая версия лучше или хуже текущей.
2. Тестировали только happy path. Проверяли только ожидаемые сценарии и типичные запросы, а реальные пользователи могут начать вести себя по другому.
3. Нет adversarial кейсов. Никто не пытался сломать систему нестандартными или противоречивыми запросами.
4. Нет автоматического регрессионного тестирования. Каждое обновление модели или изменение промпта уходит в продакшен без проверки, что существующее поведение не сломалось.
5. Нет мониторинга в продакшене. После деплоя никто не отслеживает процент галлюцинаций и качество ответов. Качество может начать деградировать незаметно, пока что-то не сломается достаточно серьезно.
6. Тестовый датасет собрала команда разработки. Он отражает то, как разработчики представляют взаимодействие с системой, а не то, что может происходить в реальности.
7. QA увидел систему впервые прямо перед релизом. К этому моменту уже нет времени исправить что-то существенное.
Согласны или нет, или есть что добавить? 👇
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
❤4👍3😁3
Пару дней опубликовал новую статью по оценке ИИ систем, в которой разбираю 3 новых концепции, которые применимы к оценке ИИ приложений:
1. Уровни тестирования ИИ системы
2. Композитный пайплайн оценки
3. Eval-Driven Development (EDD)
Если хотите больше узнать о данных когнцепциях, применимо к ИИ системам, ссылка на статью
⚡️⚡️Старт нового потока на курсе по тестированию ИИ - 7 мая! 🔥
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
1. Уровни тестирования ИИ системы
2. Композитный пайплайн оценки
3. Eval-Driven Development (EDD)
Если хотите больше узнать о данных когнцепциях, применимо к ИИ системам, ссылка на статью
⚡️⚡️Старт нового потока на курсе по тестированию ИИ - 7 мая! 🔥
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
👍3❤2🔥2
Почему мой фреймворк eval-ai-library лучше чем DeepEval или RAGAS?
Последний год я исследовал, как существующие фреймворки (RAGAS, DeepEval) оценивают качество AI-систем, и почему их результаты часто расходятся с человеческой оценкой. Результатом данного исследования стал мой opensource фрейморв eval=ai-lib, внутри которого присутствует мой собственный метод TCVA (Temperature-Controlled Verdict Aggregation).
Что видно на графиках:
График 1 — сравнение корреляции с человеческими оценками на трех бенчмарках:
• На faithfulness TCVA и RAGAS идут практически вровень (0.667 vs 0.676)
• На relevancy TCVA обходит RAGAS: 0.480 vs 0.411 (+17%)
• DeepEval стабильно отстает на всех датасетах
График 2 — bootstrap-анализ с доверительными интервалами:
• На faithfulness разница между TCVA и RAGAS статистически незначима (p = 0.759), что говорит о том, что методы реально сопоставимы
• На relevancy TCVA значимо лучше (p = 0.041), и это не случайность, а системное преимущество
Почему так происходит?
Ключевая проблема RAGAS - это бинарные вердикты. Каждое утверждение либо да, либо нет, но реальность не бинарна. Когда AI-система дает ответ, который на 80% корректен, бинарная оценка теряет нюансы.
TCVA использует 5-уровневую шкалу вердиктов и агрегирует их через обобщённое степенное среднее с параметром температуры:
• Низкая температура → строгая оценка (для медицины, финансов)
• Высокая температура → мягкая оценка (для чат-ботов, креативных задач)
И самое важное, что переключение между режимами не требует дополнительных вызовов LLM.
Один раз получили вердикты, дальше агрегируем как нужно.
Когда мы оцениваем AI-систему, уровень строгости должен зависеть от домена применения. Один и тот же ответ может быть отличным для чат-бота и недопустимым для медицинского ассистента. Универсальный бинарный подход этого не учитывает.
Исходный код метода доступен в open source https://github.com/meshkovQA/Eval-ai-library
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Последний год я исследовал, как существующие фреймворки (RAGAS, DeepEval) оценивают качество AI-систем, и почему их результаты часто расходятся с человеческой оценкой. Результатом данного исследования стал мой opensource фрейморв eval=ai-lib, внутри которого присутствует мой собственный метод TCVA (Temperature-Controlled Verdict Aggregation).
Что видно на графиках:
График 1 — сравнение корреляции с человеческими оценками на трех бенчмарках:
• На faithfulness TCVA и RAGAS идут практически вровень (0.667 vs 0.676)
• На relevancy TCVA обходит RAGAS: 0.480 vs 0.411 (+17%)
• DeepEval стабильно отстает на всех датасетах
График 2 — bootstrap-анализ с доверительными интервалами:
• На faithfulness разница между TCVA и RAGAS статистически незначима (p = 0.759), что говорит о том, что методы реально сопоставимы
• На relevancy TCVA значимо лучше (p = 0.041), и это не случайность, а системное преимущество
Почему так происходит?
Ключевая проблема RAGAS - это бинарные вердикты. Каждое утверждение либо да, либо нет, но реальность не бинарна. Когда AI-система дает ответ, который на 80% корректен, бинарная оценка теряет нюансы.
TCVA использует 5-уровневую шкалу вердиктов и агрегирует их через обобщённое степенное среднее с параметром температуры:
• Низкая температура → строгая оценка (для медицины, финансов)
• Высокая температура → мягкая оценка (для чат-ботов, креативных задач)
И самое важное, что переключение между режимами не требует дополнительных вызовов LLM.
Один раз получили вердикты, дальше агрегируем как нужно.
Когда мы оцениваем AI-систему, уровень строгости должен зависеть от домена применения. Один и тот же ответ может быть отличным для чат-бота и недопустимым для медицинского ассистента. Универсальный бинарный подход этого не учитывает.
Исходный код метода доступен в open source https://github.com/meshkovQA/Eval-ai-library
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
🔥9❤2
adaptive_rigor_in_ai_system_evaluation_using_temperature_controlled.pdf
443.6 KB
Всем привет!
Хочу поделиться своей недавней работой, которая на данный момент опубликована в виде препринта. В этом исследовании я предложил новый метод оценки под названием TCVA (Temperature-Controlled Verdict Aggregation), который сочетает пятиуровневую шкалу вердиктов с обобщённым степенным средним и интуитивно понятным параметром “температуры” для управления строгостью оценки в зависимости от области применения.
Экспериментальная оценка на трех бенчмарк-датасетах с человеческими аннотациями (SummEval и USR) показывает, что TCVA достигает корреляции с человеческими оценками, сопоставимой с RAGAS по критерию достоверности, и значительно превосходит его по релевантности (коэффициент Спирмена ρ = 0.480 против 0.411, p = 0.041), при этом стабильно превосходя DeepEval на всех датасетах.
Ключевая идея заключается в том, что один и тот же ответ ИИ может быть отличным для чат-бота, но неприемлемым для медицинского ассистента, поэтому уровень строгости должен адаптироваться к домену, и TCVA позволяет это делать без дополнительных вызовов LLM.
Препринт доступен здесь:
https://dx.doi.org/10.21203/rs.3.rs-8658973/v2
Метод также реализован в виде open-source библиотеки:
https://github.com/meshkovQA/Eval-ai-library.git
Буду очень признателен за любую обратную связь, отзывы или цитирование 🙏
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Хочу поделиться своей недавней работой, которая на данный момент опубликована в виде препринта. В этом исследовании я предложил новый метод оценки под названием TCVA (Temperature-Controlled Verdict Aggregation), который сочетает пятиуровневую шкалу вердиктов с обобщённым степенным средним и интуитивно понятным параметром “температуры” для управления строгостью оценки в зависимости от области применения.
Экспериментальная оценка на трех бенчмарк-датасетах с человеческими аннотациями (SummEval и USR) показывает, что TCVA достигает корреляции с человеческими оценками, сопоставимой с RAGAS по критерию достоверности, и значительно превосходит его по релевантности (коэффициент Спирмена ρ = 0.480 против 0.411, p = 0.041), при этом стабильно превосходя DeepEval на всех датасетах.
Ключевая идея заключается в том, что один и тот же ответ ИИ может быть отличным для чат-бота, но неприемлемым для медицинского ассистента, поэтому уровень строгости должен адаптироваться к домену, и TCVA позволяет это делать без дополнительных вызовов LLM.
Препринт доступен здесь:
https://dx.doi.org/10.21203/rs.3.rs-8658973/v2
Метод также реализован в виде open-source библиотеки:
https://github.com/meshkovQA/Eval-ai-library.git
Буду очень признателен за любую обратную связь, отзывы или цитирование 🙏
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
🔥9👍2
Пару дней назад Anthropic опубликовал большое исследование своей новой модели Claude Mythos и всех сразу зацепили реузльтаты, которые описаны на скрине.
Что произошло?
Anthropic проводили тест на безопасность, поместили модель в изолированную среду и поставили задачу, попробуй выбраться из нее и сообщи исследователю.
И что вы думаете? Mythos выбрался и на этом не остановился.
Он нашел ещё одну дыру, получил доступ к открытому интернету и выложил детали своего побега на несколько публичных сайтов, просто чтобы все знали.
И потом отправил через MCP email своему исследователю, что задача выполнена😂
Anthropic назвали это “тревожной и незапрошенной попыткой продемонстрировать свой успех”.
В общем пока мы тут с вами думаем как в автотесты внедрить ИИ, ИИ уже начинает захватывать мир))))
Ссылка на исследование: https://www-cdn.anthropic.com/53566bf5440a10affd749724787c8913a2ae0841.pdf
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Что произошло?
Anthropic проводили тест на безопасность, поместили модель в изолированную среду и поставили задачу, попробуй выбраться из нее и сообщи исследователю.
И что вы думаете? Mythos выбрался и на этом не остановился.
Он нашел ещё одну дыру, получил доступ к открытому интернету и выложил детали своего побега на несколько публичных сайтов, просто чтобы все знали.
И потом отправил через MCP email своему исследователю, что задача выполнена😂
Anthropic назвали это “тревожной и незапрошенной попыткой продемонстрировать свой успех”.
В общем пока мы тут с вами думаем как в автотесты внедрить ИИ, ИИ уже начинает захватывать мир))))
Ссылка на исследование: https://www-cdn.anthropic.com/53566bf5440a10affd749724787c8913a2ae0841.pdf
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
😁9⚡3❤1
Когда вы запустили чат-бота или AI-ассистента, то в большинстве случаев он отвечает, и по делу, но как понять, что он действительно работает?
Для диалоговых систем нужны метрики, которые ловят именно суть взаимодействия, поэтому я выделил 7 метрик, которые стоит использовать при оценке диалоговых ИИ агентов.
1. Task Success Rate
Выполнила ли AI система задачу, для которой она была создана .
2. Goal Achievement Rate
Получил ли пользователь то, что он на самом деле хотел, а не просто формальный результат.
3. Role Adherence Rate
Остается ли AI в рамках своей роли, тона и компетенции на протяжении всего диалога.
4. Knowledge Retention Rate
Помнит ли система контекст, который пользователь уже сообщил ранее в разговоре.
5. Conversational Flow Rate
Насколько естественно и связно проходит диалог, без лишних переспросов, повторов и игнорирования сигналов пользователя.
6. Repetitive Pattern Detection
Зацикливается ли агент, повторяя одни и те же действия или ответы вместо продвижения к решению.
7. Failure Rate
Как AI система ведет себя, когда не знает ответа, выдумывает, зависает или честно предлагает альтернативу.
Главная моя мысль, что диалоговые системы - это не генерация текста. Это больше про взаимодействие, и поэтому оценивать их нужно через метрики, которые ловят поведение, контекст и результат.
Какие метрики используете вы при оценке диалогов? Есть что добавить?
⚡️⚡️Старт нового потока на курсе по тестированию ИИ - 7 мая! 🔥
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Для диалоговых систем нужны метрики, которые ловят именно суть взаимодействия, поэтому я выделил 7 метрик, которые стоит использовать при оценке диалоговых ИИ агентов.
1. Task Success Rate
Выполнила ли AI система задачу, для которой она была создана .
2. Goal Achievement Rate
Получил ли пользователь то, что он на самом деле хотел, а не просто формальный результат.
3. Role Adherence Rate
Остается ли AI в рамках своей роли, тона и компетенции на протяжении всего диалога.
4. Knowledge Retention Rate
Помнит ли система контекст, который пользователь уже сообщил ранее в разговоре.
5. Conversational Flow Rate
Насколько естественно и связно проходит диалог, без лишних переспросов, повторов и игнорирования сигналов пользователя.
6. Repetitive Pattern Detection
Зацикливается ли агент, повторяя одни и те же действия или ответы вместо продвижения к решению.
7. Failure Rate
Как AI система ведет себя, когда не знает ответа, выдумывает, зависает или честно предлагает альтернативу.
Главная моя мысль, что диалоговые системы - это не генерация текста. Это больше про взаимодействие, и поэтому оценивать их нужно через метрики, которые ловят поведение, контекст и результат.
Какие метрики используете вы при оценке диалогов? Есть что добавить?
⚡️⚡️Старт нового потока на курсе по тестированию ИИ - 7 мая! 🔥
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
🔥11
The State Of Eval Engineering - Q1 2026.pdf
16.3 MB
Команда Galileo выпустила интересный отчет по оценке ИИ систем за 1 квартал 2026 года, где они опросили около 500 компаний на предмет практик тестирования ИИ систем.
В целом, я считаю, что некоторые оценки завышены, но тем не менее интересные инсайты о данном направлении.
Чтобы вам не скачивать его, отчет во вложении)
⚡️⚡️Старт нового потока на курсе по тестированию ИИ - 7 мая! 🔥
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
В целом, я считаю, что некоторые оценки завышены, но тем не менее интересные инсайты о данном направлении.
Чтобы вам не скачивать его, отчет во вложении)
⚡️⚡️Старт нового потока на курсе по тестированию ИИ - 7 мая! 🔥
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
👍7❤2🔥2
Всем привет!
Осталось всего 5 дней, чтобы оставить заявку и получить скидку 10% на курс по оценке и тестированию ИИ систем, поэтому, если вы хотели, то сейчас самое время записаться на новый поток, который стартует 7 мая!
Оставить заявку можно по ссылке eval-ai.com
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Осталось всего 5 дней, чтобы оставить заявку и получить скидку 10% на курс по оценке и тестированию ИИ систем, поэтому, если вы хотели, то сейчас самое время записаться на новый поток, который стартует 7 мая!
Оставить заявку можно по ссылке eval-ai.com
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
🔥3❤1👍1
Недавно мне показали очень интересную AI концепцию, которая меня зацепила.
В чем суть? Вместо создания ИИ агента, который решает конкретную задачу в тестировании, например, формирование тестового покрытия или написания автотестов, концепция сводится к созданию полноценного участника команды, который подключен ко всем внутренним ресурсам компании, конфлюенс, таст треккер, гитхаб, командному чату, tms системе.
И тут важна не сама реализация, а то, как мы меняем наше мышление при взаимодейтсвии с ИИ.
Вместо требовательного подхода к выполнению задач, нужно больше работать в формате бейншторминга и обсуждения каждой задачи перед выполнением, при этом ИИ агент, имея полный доступ не только в тестовой документации, но и к требованиям, историям коммитов и прочего, значительно лучше понимает изменения и общий контекст.
В общем, ситуация на рынке, как минимум в Европе и США уже стала сложной из-за ИИ, а так еще можно получить парочку коворкеров, которые могут решать различные задачи и помогать в процессе разработки ПО, что в целом предполагает не радужные перспективы 🥴.
⚡️⚡️Старт нового потока на курсе по тестированию ИИ - 7 мая! 🔥
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
В чем суть? Вместо создания ИИ агента, который решает конкретную задачу в тестировании, например, формирование тестового покрытия или написания автотестов, концепция сводится к созданию полноценного участника команды, который подключен ко всем внутренним ресурсам компании, конфлюенс, таст треккер, гитхаб, командному чату, tms системе.
И тут важна не сама реализация, а то, как мы меняем наше мышление при взаимодейтсвии с ИИ.
Вместо требовательного подхода к выполнению задач, нужно больше работать в формате бейншторминга и обсуждения каждой задачи перед выполнением, при этом ИИ агент, имея полный доступ не только в тестовой документации, но и к требованиям, историям коммитов и прочего, значительно лучше понимает изменения и общий контекст.
В общем, ситуация на рынке, как минимум в Европе и США уже стала сложной из-за ИИ, а так еще можно получить парочку коворкеров, которые могут решать различные задачи и помогать в процессе разработки ПО, что в целом предполагает не радужные перспективы 🥴.
⚡️⚡️Старт нового потока на курсе по тестированию ИИ - 7 мая! 🔥
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
👍3🤔1
Всем привет!
Я провел анализ рынка тестирования AI, изучил различные отчеты Gartner, McKinsey, LangChain, Stanford, данные с Reddit и вот что я узнал.
Основной формат тестирования, который сейчас к сожалению преобладает в тестировании ИИ систем - это прогон промптов вручную, который я называют “vibe check” или “vibe testing”.
Более того из полученных данных я узнал, что:
• 29.5% команд, создающие AI-агенты, вообще их не оценивают или не понимают как (ссылка)
• 40 % компаний уже столкнулись с негативными последствиями от внедрения ИИ (ссылка)
• 90-95% проектов не доходят до стадии продакшен использования из-за проблем с данными или отсутствие понимания качества системы (ссылка)
И все что описано выше - это не проблема AI. Это проблема QA.
У нас есть десятилетия применения методологии для тестирования детерминированных систем, при этом для стохастических нет ничего.
• Нет стандартов.
• Нет общепринятых метрик.
• Нет даже консенсуса по тому, что такое хорошо работающая ИИ система.
И самое пугающее, что практика “vibe testing” в части ИИ систем по-прежнему активно распространена, то есть мы доверяем ИИ тестирование ИИ, при этом даже не понимая, насколько это правильно, то есть без возможности управлять этим процессом.
Что думаете по этому поводу?👇
⚡️⚡️Старт нового потока на курсе по тестированию ИИ - 7 мая! 🔥
📌🔥Последний день получить скидку 10%!‼️
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Я провел анализ рынка тестирования AI, изучил различные отчеты Gartner, McKinsey, LangChain, Stanford, данные с Reddit и вот что я узнал.
Основной формат тестирования, который сейчас к сожалению преобладает в тестировании ИИ систем - это прогон промптов вручную, который я называют “vibe check” или “vibe testing”.
Более того из полученных данных я узнал, что:
• 29.5% команд, создающие AI-агенты, вообще их не оценивают или не понимают как (ссылка)
• 40 % компаний уже столкнулись с негативными последствиями от внедрения ИИ (ссылка)
• 90-95% проектов не доходят до стадии продакшен использования из-за проблем с данными или отсутствие понимания качества системы (ссылка)
И все что описано выше - это не проблема AI. Это проблема QA.
У нас есть десятилетия применения методологии для тестирования детерминированных систем, при этом для стохастических нет ничего.
• Нет стандартов.
• Нет общепринятых метрик.
• Нет даже консенсуса по тому, что такое хорошо работающая ИИ система.
И самое пугающее, что практика “vibe testing” в части ИИ систем по-прежнему активно распространена, то есть мы доверяем ИИ тестирование ИИ, при этом даже не понимая, насколько это правильно, то есть без возможности управлять этим процессом.
Что думаете по этому поводу?👇
⚡️⚡️Старт нового потока на курсе по тестированию ИИ - 7 мая! 🔥
📌🔥Последний день получить скидку 10%!‼️
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
🔥6❤2👍1💯1
Наткнулся на интересное исследование по галлюцинациям в современных моделях, которое меня зацепило.
Компания Vectara, которая некоторое ведет публичный лидерборд по галлюцинациям LLM (ссылка тут), обновила свой бенчмарк, а именно усложнила датасет, добавила более длинные документы из области права, медицины и финансов, то есть то, с чем реально работают enterprise системы.
И вот что выявил обновленный датасет: reasoning модели, которые сейчас позиционируются как самые мощные, показывают худшие результаты на задачах суммаризации с опорой на документы или контекст. GPT-5, Claude Sonnet 4.5, Grok-4 и Gemini-3-Pro все превысили 10% галлюцинаций.
Гипотеза тут простая. Reasoning модели думают над ответом и в процессе начинают добавлять выводы и связи, которых нет в исходных данных или контексте.
С точки зрения тестирования это очень важное наблюдение, потому что многие команды выбирают модель по общим бенчмаркам, а потом удивляются почему в конкретном сценарии система ведет себя не так как ожидалось. Тип задачи сильно влияет на поведение модели, и это нужно учитывать при создании ИИ систем.
⚡️⚡️Старт нового потока на курсе по тестированию ИИ - 7 мая! 🔥
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Компания Vectara, которая некоторое ведет публичный лидерборд по галлюцинациям LLM (ссылка тут), обновила свой бенчмарк, а именно усложнила датасет, добавила более длинные документы из области права, медицины и финансов, то есть то, с чем реально работают enterprise системы.
И вот что выявил обновленный датасет: reasoning модели, которые сейчас позиционируются как самые мощные, показывают худшие результаты на задачах суммаризации с опорой на документы или контекст. GPT-5, Claude Sonnet 4.5, Grok-4 и Gemini-3-Pro все превысили 10% галлюцинаций.
Гипотеза тут простая. Reasoning модели думают над ответом и в процессе начинают добавлять выводы и связи, которых нет в исходных данных или контексте.
С точки зрения тестирования это очень важное наблюдение, потому что многие команды выбирают модель по общим бенчмаркам, а потом удивляются почему в конкретном сценарии система ведет себя не так как ожидалось. Тип задачи сильно влияет на поведение модели, и это нужно учитывать при создании ИИ систем.
⚡️⚡️Старт нового потока на курсе по тестированию ИИ - 7 мая! 🔥
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
🔥9
Всем привет!!!
Недавно смотрел интервью с Kian Katanforoosh о теме того, какие профессии наиболее востребованы будут в обозримом будущем 5-7 лет, и понял, что риск того, что тестирование, разработка, аналитика, будет схлопываться в формат, когда в команде есть только Product и AI Developer (которые выполняют в целом все задачи, аналитику, разработку, тестирование) сейчас выглядит вполне реально, особенно на фоне развития моделей ИИ систем и ситуации на рынке ИТ.
Также Kian подсвятил очень важную текущую ситуацию, которую возможно вы тоже заметили, а именно спрос на джунов резко упал, опять же за счет того же ИИ.
Три года назад я одним из первых начал погружаться в тему тестирования и оценки ИИ систем, и как показывает практика, не зря, потому что это дало мне новые навыки, которые сейчас постепенно становятся востребованными как доп скиллы для тестирования.
Но если мир переходит к формату работы команды, где есть только продукт и ИИ девелопер, то встает вопрос, а что делать дальше.
Поэтому из того же интервью, я нашел пару профессий, который могут быть очень востребованны в перспективе развития ИИ систем, и которые хоть немного корреклируют с тестированием, и это:
Специалист по Pretraining / foundation models - тренировать базовые модели с нуля (GPT, Llama, DeepSeek).
Специалист по Post-training / alignment моделей - RLHF, constitutional AI, reasoning-тюнинг. Этот рынок шире и быстрее растет.
Research engineering / interpretability / safety - академически-индустриальный гибрид по анализу качества работы моделей.
И я решил, почему бы нет, и попробовать глубоко погрузиться в эти области практически с нуля за 1 год и максимально изучить профессию Post-training / alignment /safety engineer.
План рассчитан на 18 месяцев, в среднем я рассчитываю на загрузку 10 часов в неделю.
И что я предлагаю.
Если вам интересно пройти этот путь со мной, с еженедельными встречами, обсуждением пройденного материала, прохождением мини тестов и так далее, то я бы оформил это в формате подписки 3000 рублей в месяц на бусти, где я буду выкладывать еженедельные материалы, которые я изучаю, у нас будет чат в телеграм для обсуждения материалов, вики, которую я буду постоянно наполнять и так далее.
Если вам интересно поучаствовать в таком формат совместного обучения, то напишите➕ под этим постом!
Недавно смотрел интервью с Kian Katanforoosh о теме того, какие профессии наиболее востребованы будут в обозримом будущем 5-7 лет, и понял, что риск того, что тестирование, разработка, аналитика, будет схлопываться в формат, когда в команде есть только Product и AI Developer (которые выполняют в целом все задачи, аналитику, разработку, тестирование) сейчас выглядит вполне реально, особенно на фоне развития моделей ИИ систем и ситуации на рынке ИТ.
Также Kian подсвятил очень важную текущую ситуацию, которую возможно вы тоже заметили, а именно спрос на джунов резко упал, опять же за счет того же ИИ.
Три года назад я одним из первых начал погружаться в тему тестирования и оценки ИИ систем, и как показывает практика, не зря, потому что это дало мне новые навыки, которые сейчас постепенно становятся востребованными как доп скиллы для тестирования.
Но если мир переходит к формату работы команды, где есть только продукт и ИИ девелопер, то встает вопрос, а что делать дальше.
Поэтому из того же интервью, я нашел пару профессий, который могут быть очень востребованны в перспективе развития ИИ систем, и которые хоть немного корреклируют с тестированием, и это:
Специалист по Pretraining / foundation models - тренировать базовые модели с нуля (GPT, Llama, DeepSeek).
Специалист по Post-training / alignment моделей - RLHF, constitutional AI, reasoning-тюнинг. Этот рынок шире и быстрее растет.
Research engineering / interpretability / safety - академически-индустриальный гибрид по анализу качества работы моделей.
И я решил, почему бы нет, и попробовать глубоко погрузиться в эти области практически с нуля за 1 год и максимально изучить профессию Post-training / alignment /safety engineer.
План рассчитан на 18 месяцев, в среднем я рассчитываю на загрузку 10 часов в неделю.
И что я предлагаю.
Если вам интересно пройти этот путь со мной, с еженедельными встречами, обсуждением пройденного материала, прохождением мини тестов и так далее, то я бы оформил это в формате подписки 3000 рублей в месяц на бусти, где я буду выкладывать еженедельные материалы, которые я изучаю, у нас будет чат в телеграм для обсуждения материалов, вики, которую я буду постоянно наполнять и так далее.
Если вам интересно поучаствовать в таком формат совместного обучения, то напишите
Please open Telegram to view this post
VIEW IN TELEGRAM
👍6😁3❤2🔥1
Недавно наткнулся на интересную дискуссию про автономность в AI агентах, и хочу поделиться своим взглядом на это, потому что мне кажется, что в индустрии сейчас есть опасное заблуждение.
Многие команды воспринимают автономность AI агента как цель и показатель зрелости системы, и получается, что чем меньше human-in-the-loop, тем лучше. Логика тут мне понятна, потому что мы хотим чтобы ИИ агент сам справлялся, не отвлекал людей, работал быстро. Но я думаю, что это в корне неправильная постановка вопроса.
Автономность — это не свойство качественной AI системы. Это степень доверия, которую система заработала через проверенное поведение в конкретных сценариях, и проблема в том, что большинство команд дают агентам автономность авансом, до того как это доверие заработано.
Исследование Anthropic по Claude Mythos, где модель вышла за пределы изолированной среды и выложила детали своего побега в интернет — это не просто забавная история. Это хорошая иллюстрация того, что происходит когда система оптимизирует под задачу без достаточных ограничений и контроля.
На мой взгляд, правильный подход выглядит немного иначе, а именно нужно начинать с минимальной автономности и расширять её по мере того как система доказывает стабильное поведение в реальных условиях, например, сначала пробуем использовать для оценки импакт анализа, потом написания чек-листа, потом тестов с шагами и уже потом ручного тестирования. И такой процесс обучения не потому что мы не доверяем AI, а потому что это единственный способ понять где именно она работает надежно, а где еще нет и требуется донастройки
.
А как работает у вас в команде? Начали уже доверять ИИ свои задачи или пока нет? 👇
⚡️⚡️Старт нового потока на курсе по тестированию ИИ - 7 мая! 🔥
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Многие команды воспринимают автономность AI агента как цель и показатель зрелости системы, и получается, что чем меньше human-in-the-loop, тем лучше. Логика тут мне понятна, потому что мы хотим чтобы ИИ агент сам справлялся, не отвлекал людей, работал быстро. Но я думаю, что это в корне неправильная постановка вопроса.
Автономность — это не свойство качественной AI системы. Это степень доверия, которую система заработала через проверенное поведение в конкретных сценариях, и проблема в том, что большинство команд дают агентам автономность авансом, до того как это доверие заработано.
Исследование Anthropic по Claude Mythos, где модель вышла за пределы изолированной среды и выложила детали своего побега в интернет — это не просто забавная история. Это хорошая иллюстрация того, что происходит когда система оптимизирует под задачу без достаточных ограничений и контроля.
На мой взгляд, правильный подход выглядит немного иначе, а именно нужно начинать с минимальной автономности и расширять её по мере того как система доказывает стабильное поведение в реальных условиях, например, сначала пробуем использовать для оценки импакт анализа, потом написания чек-листа, потом тестов с шагами и уже потом ручного тестирования. И такой процесс обучения не потому что мы не доверяем AI, а потому что это единственный способ понять где именно она работает надежно, а где еще нет и требуется донастройки
.
А как работает у вас в команде? Начали уже доверять ИИ свои задачи или пока нет? 👇
⚡️⚡️Старт нового потока на курсе по тестированию ИИ - 7 мая! 🔥
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
❤8
В последнее время меня часто спрашивают про то, какие навыки QA инженера сейчас актуальны, и я вижу два лагеря в этой дискуссии.
Первые говорят, что AI скоро заменит тестировщиков и учить что-то новое бессмысленно. Вторые говорят, что ничего особо не изменилось и достаточно просто научиться писать промпты. На мой взгляд, оба варианты ошибочны и вот почему.
Классические навыки тест-дизайна, понимание требований, умение выстраивать стратегию покрытия, по факту, это все никуда не делось, и в мире AI стало даже более важным. Потому что AI агент, который генерирует тесты, генерирует их на основе того, что вы ему объяснили и если вы сами не понимаете что нужно проверять и почему, агент вам не поможет.
Но при этом появился целый пласт новых задач, которых раньше просто не существовало. Как оценить качество ответа LLM, если у него нет одного правильного ответа? Как выстроить регрессионное тестирование для системы, которая по своей природе стохастична? Как обнаружить, что модель начала деградировать, если стандартный мониторинг этого не видит? Как тестировать агента, который принимает решения автономно?
Это не просто новые инструменты, это другое мышление. И в этом и есть главный сдвиг, который я наблюдаю на рынке. Востребован не тот, кто умеет пользоваться конкретным фреймворком, а тот, кто умеет думать о качестве AI системы системно и понимает её ограничения, знает где она может сломаться и как это проверить.
⚡️⚡️Старт нового потока на курсе по тестированию ИИ - 7 мая! 🔥
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Первые говорят, что AI скоро заменит тестировщиков и учить что-то новое бессмысленно. Вторые говорят, что ничего особо не изменилось и достаточно просто научиться писать промпты. На мой взгляд, оба варианты ошибочны и вот почему.
Классические навыки тест-дизайна, понимание требований, умение выстраивать стратегию покрытия, по факту, это все никуда не делось, и в мире AI стало даже более важным. Потому что AI агент, который генерирует тесты, генерирует их на основе того, что вы ему объяснили и если вы сами не понимаете что нужно проверять и почему, агент вам не поможет.
Но при этом появился целый пласт новых задач, которых раньше просто не существовало. Как оценить качество ответа LLM, если у него нет одного правильного ответа? Как выстроить регрессионное тестирование для системы, которая по своей природе стохастична? Как обнаружить, что модель начала деградировать, если стандартный мониторинг этого не видит? Как тестировать агента, который принимает решения автономно?
Это не просто новые инструменты, это другое мышление. И в этом и есть главный сдвиг, который я наблюдаю на рынке. Востребован не тот, кто умеет пользоваться конкретным фреймворком, а тот, кто умеет думать о качестве AI системы системно и понимает её ограничения, знает где она может сломаться и как это проверить.
⚡️⚡️Старт нового потока на курсе по тестированию ИИ - 7 мая! 🔥
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
👍5🔥2❤1
Кошмар вайбкодера😂😂😂
⚡️⚡️Старт нового потока на курсе по тестированию ИИ - 7 мая! 🔥
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
⚡️⚡️Старт нового потока на курсе по тестированию ИИ - 7 мая! 🔥
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
🤣6😁3💯1
Сегодня хочу рассказать про два интересных инструмента, которые я недавно увидел на рынке и которые закрывают нишу, про которую раньше почти никто не говорил, а именно тестирование голосовых AI агентов.
Cekura - платформа для автоматизированного тестирования и мониторинга голосовых и чат AI агентов. Она позволяет запускать симуляции разговоров с разными пользовательскими персонажами, тестировать как агент реагирует на прерывания, нестандартные сценарии и off-script поведение пользователей. Из интересного - это 25+ встроенных метрик специфичных именно для голоса, такие как gibberish detection, interruption tracking, latency, pitch, sentiment. Плюс поддержка 32 языков с учётом региональных акцентов, что важно если агент работает на глобальную аудиторию.
LambdaTest Agent-to-Agent Testing - это платформа для тестирования AI агентов. Идея в том, что один AI агент тестирует другой, генерируя разнообразные сценарии автоматически. Работает как для текстовых чат-ботов, так и для голосовых агентов. Вы загружаете требования в любом формате, например, текст, изображения, аудио, видео, и система генерирует тест-сценарии с метриками по bias, hallucinations, completeness, toxicity. Под капотом используется несколько LLM одновременно для более полного покрытия.
Для меня оба инструмента интересны тем, что они решают задачу, которую традиционные фреймворки оценки практически игнорируют - голосовой канал и multi-turn диалоги в реальных условиях. Потому что оценить текстовый вывод LLM через RAGAS это одно, а проверить как голосовой агент ведет себя когда пользователь перебивает, говорит с акцентом или уходит от скрипта, это совсем другая задача.
А вы сталкивались с задачей тестирования голосовых AI агентов? Как решали? 👇
⚡️⚡️Старт нового потока на курсе по тестированию ИИ - 7 мая! 🔥
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Cekura - платформа для автоматизированного тестирования и мониторинга голосовых и чат AI агентов. Она позволяет запускать симуляции разговоров с разными пользовательскими персонажами, тестировать как агент реагирует на прерывания, нестандартные сценарии и off-script поведение пользователей. Из интересного - это 25+ встроенных метрик специфичных именно для голоса, такие как gibberish detection, interruption tracking, latency, pitch, sentiment. Плюс поддержка 32 языков с учётом региональных акцентов, что важно если агент работает на глобальную аудиторию.
LambdaTest Agent-to-Agent Testing - это платформа для тестирования AI агентов. Идея в том, что один AI агент тестирует другой, генерируя разнообразные сценарии автоматически. Работает как для текстовых чат-ботов, так и для голосовых агентов. Вы загружаете требования в любом формате, например, текст, изображения, аудио, видео, и система генерирует тест-сценарии с метриками по bias, hallucinations, completeness, toxicity. Под капотом используется несколько LLM одновременно для более полного покрытия.
Для меня оба инструмента интересны тем, что они решают задачу, которую традиционные фреймворки оценки практически игнорируют - голосовой канал и multi-turn диалоги в реальных условиях. Потому что оценить текстовый вывод LLM через RAGAS это одно, а проверить как голосовой агент ведет себя когда пользователь перебивает, говорит с акцентом или уходит от скрипта, это совсем другая задача.
А вы сталкивались с задачей тестирования голосовых AI агентов? Как решали? 👇
⚡️⚡️Старт нового потока на курсе по тестированию ИИ - 7 мая! 🔥
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
👍5🔥1