Недавно посмотрел интервью с основателем DeepMind Денисом Хассабисом, лауреатом Нобелевской премии по химии (он создал ИИ модель AlphaFold, которая предсказывает структуру белка человека) и узнал очень интересный факт про модели генерации видео, например, Veo, Sora, Runway Gen и другие.
Оказывается, что создание моделей генерации изображения нужно не просто для создания развлекательного контента. Основные цели этих моделей - научить понимать ИИ ощущения, которые стандартные текстовые LLM понимать не могут, а именно то как мы воспринимаем наш мир, логику его существования, потому именно при генерации видео мы можем понять, как модели реально интерпретируют наш реальный мир, его физику, и по факту именно такие видеомодели приближают нас к созданию AGI (общие ИИ).
Так что для больших компаний развитии моделей генерации изображений, этов большей степени шаг к созданию AGI, нежели чем просто генерация видео для соц сетей.
А вы знали об этом аспекте ИИ моделей генерации видео?
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Оказывается, что создание моделей генерации изображения нужно не просто для создания развлекательного контента. Основные цели этих моделей - научить понимать ИИ ощущения, которые стандартные текстовые LLM понимать не могут, а именно то как мы воспринимаем наш мир, логику его существования, потому именно при генерации видео мы можем понять, как модели реально интерпретируют наш реальный мир, его физику, и по факту именно такие видеомодели приближают нас к созданию AGI (общие ИИ).
Так что для больших компаний развитии моделей генерации изображений, этов большей степени шаг к созданию AGI, нежели чем просто генерация видео для соц сетей.
А вы знали об этом аспекте ИИ моделей генерации видео?
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
🤔6👍4❤1
Автономные ИИ агенты меняют разработку быстрее, чем QA-процессы успевают адаптироваться.
Большинство команд, с которыми я общаюсь, подключают coding AI agents и видят, как те пишут код в разы быстрее чем раньше, но вот что я постоянно замечаю, так это что процессы обеспечения качества под агентов никто не строил. ИИ агенты тепреь сами открывают PR, пушат коммиты, а потом команда вручную проверяет каждый из них на стенде.
Это не ускорение работы, а просто просто перенос узкого места на другой этап жизненного цикла релиза, потомоу что при увеличении пропускной способности разработки, не меняется пропускная способность тестирования и получается, что настоящая проблема заключается в том, что наше тестирование изначально не проектировалась под работы с ИИ агентами, и если тестирование раньше и так уже было узким горлышком процесса, то теперь это становится еще более заметным и критичным.
Какие можно сделать выводы? По сути использование ИИ агентов меняет и роль QA-инженеров процессе, потому что мы тоже должны адаптироваться и создавать тестовую инфраструтуру уже не только для себя, но и интегрировать ее в работу ИИ агентов, передавая им часть процесса тестирования.
А как у вас в команде организована работа с кодом от ИИ агентов? 👇
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Большинство команд, с которыми я общаюсь, подключают coding AI agents и видят, как те пишут код в разы быстрее чем раньше, но вот что я постоянно замечаю, так это что процессы обеспечения качества под агентов никто не строил. ИИ агенты тепреь сами открывают PR, пушат коммиты, а потом команда вручную проверяет каждый из них на стенде.
Это не ускорение работы, а просто просто перенос узкого места на другой этап жизненного цикла релиза, потомоу что при увеличении пропускной способности разработки, не меняется пропускная способность тестирования и получается, что настоящая проблема заключается в том, что наше тестирование изначально не проектировалась под работы с ИИ агентами, и если тестирование раньше и так уже было узким горлышком процесса, то теперь это становится еще более заметным и критичным.
Какие можно сделать выводы? По сути использование ИИ агентов меняет и роль QA-инженеров процессе, потому что мы тоже должны адаптироваться и создавать тестовую инфраструтуру уже не только для себя, но и интегрировать ее в работу ИИ агентов, передавая им часть процесса тестирования.
А как у вас в команде организована работа с кодом от ИИ агентов? 👇
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
❤4💯3👍2
Прочитал свежую научную работу и она очень точно описывает то, с чем сталкиваешься при оценке AI агентов на практике.
Авторы задают очень простой, но неудобный вопрос: почему AI агенты показывают высокие результаты на бенчмарках, но продолжают падать в реальных условиях?
И ключевой ответ исследователей заключается в том, что мы измеряем не то, что действиетльно нужно.
Текущий стандарт оценки агентов чаще всего - это процент успешно выполненных задач (Completness Rate). Один показатель, который скрывает критически важные поведенческие свойства ИИ системы. И чтобы расширить анализ показателей качества работы ИИ агента авторы предлагают 12 метрик по четырём измерениям:
Consistency - стабильность результата при повторных запусках
Robustness - устойчивость к вариациям входных данных и сбоям
Predictability - соответствие уверенности агента его реальной точности
Safety - насколько серьёзны ошибки, когда они происходят
После оценки 14 моделей авторы пришли к неутешительному выводу, что рост возможностей за полтора года дал лишь минимальный прирост в надежности. Модели становятся умнее, но к сожалению не надежнее.
На мой взгляд, именно этих измерений сейчас остро не хватает в большинстве существующих фреймворков оценки AI систем и наверное мне стоит на это состредоточиться в моей библиотеке https://library.eval-ai.com/.
Ссылка на исследование
https://arxiv.org/pdf/2602.16666
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Авторы задают очень простой, но неудобный вопрос: почему AI агенты показывают высокие результаты на бенчмарках, но продолжают падать в реальных условиях?
И ключевой ответ исследователей заключается в том, что мы измеряем не то, что действиетльно нужно.
Текущий стандарт оценки агентов чаще всего - это процент успешно выполненных задач (Completness Rate). Один показатель, который скрывает критически важные поведенческие свойства ИИ системы. И чтобы расширить анализ показателей качества работы ИИ агента авторы предлагают 12 метрик по четырём измерениям:
Consistency - стабильность результата при повторных запусках
Robustness - устойчивость к вариациям входных данных и сбоям
Predictability - соответствие уверенности агента его реальной точности
Safety - насколько серьёзны ошибки, когда они происходят
После оценки 14 моделей авторы пришли к неутешительному выводу, что рост возможностей за полтора года дал лишь минимальный прирост в надежности. Модели становятся умнее, но к сожалению не надежнее.
На мой взгляд, именно этих измерений сейчас остро не хватает в большинстве существующих фреймворков оценки AI систем и наверное мне стоит на это состредоточиться в моей библиотеке https://library.eval-ai.com/.
Ссылка на исследование
https://arxiv.org/pdf/2602.16666
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
🔥6👍5
В последнее время ко мне часто приходят с вопросом о том, а какой рынок AI Evaluation, есть ли вакансии и есть ли там перспектива?
Поэтому я решил написать отдельный пост про ситуацию на рынке вакансий, как я это сейчас вижу (п.с. мое мнение носит субьективный характер).
Если говорить про рынок РФ, то тут все очень печально, за все время, как данное направление появилось, я видел всего две вакансии на тестировщика ИИ/LLM, но я не думаю, что это связано именно тем, что такой работы и таких задач нет. Как я слышу от многих бывших коллег и учеников, уже сейчас на российском рынке появляются задачи по тестированию ИИ систем/агентов и так далее, но решают эти задачи внутренними сотрудниками, а не наймом извне. То есть задачи есть, часто они могут даже включаться в базовую вакансию тестировщика, но при этом именно отдельных позиций на рынке РФ практически нет. Причина - низкая зрелость ИИ систем в РФ, отсутствие доступа к сильным моделям и провайдерам, фактически отсутствия конкуретных технологий.
На зарубежном рынке, US, UK, EC, ситуация в разы лучше. Я вижу, что есть вакансии на AI evaluation engineer, в целом все больше и больше в сети LinkedIn я вижу ребят, которые занимаются на своих проектах оценкой ИИ систем, и с усложнением технологий данная область все более становится востребованной.
Да, пока есть большой минус в том, что нет стандартов, методологии, подходов, но все это рано или поздно прийдет к нам, а продуктов, в который есть ИИ будет становиться все больше, поэтому, возможно не будет большого количества вакансий именно на AI Evalaution тестировщика, но как дополнительный набор скиллов в рамках даже базовой позиции Мидла, это будет все больше и больше востребованно.
Поэтому если вам интерсно развиваться в новой для себя области, то напоминаю, что 7 мая я запускаю новый поток на курсе по оценке и тестированию ИИ систем, и сейчас, если вы оставите заявку, то у вас будет возможность приобрести курс со скидкой 10%!
Заявку можно оставить на сайте: eval-ai.com
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Поэтому я решил написать отдельный пост про ситуацию на рынке вакансий, как я это сейчас вижу (п.с. мое мнение носит субьективный характер).
Если говорить про рынок РФ, то тут все очень печально, за все время, как данное направление появилось, я видел всего две вакансии на тестировщика ИИ/LLM, но я не думаю, что это связано именно тем, что такой работы и таких задач нет. Как я слышу от многих бывших коллег и учеников, уже сейчас на российском рынке появляются задачи по тестированию ИИ систем/агентов и так далее, но решают эти задачи внутренними сотрудниками, а не наймом извне. То есть задачи есть, часто они могут даже включаться в базовую вакансию тестировщика, но при этом именно отдельных позиций на рынке РФ практически нет. Причина - низкая зрелость ИИ систем в РФ, отсутствие доступа к сильным моделям и провайдерам, фактически отсутствия конкуретных технологий.
На зарубежном рынке, US, UK, EC, ситуация в разы лучше. Я вижу, что есть вакансии на AI evaluation engineer, в целом все больше и больше в сети LinkedIn я вижу ребят, которые занимаются на своих проектах оценкой ИИ систем, и с усложнением технологий данная область все более становится востребованной.
Да, пока есть большой минус в том, что нет стандартов, методологии, подходов, но все это рано или поздно прийдет к нам, а продуктов, в который есть ИИ будет становиться все больше, поэтому, возможно не будет большого количества вакансий именно на AI Evalaution тестировщика, но как дополнительный набор скиллов в рамках даже базовой позиции Мидла, это будет все больше и больше востребованно.
Поэтому если вам интерсно развиваться в новой для себя области, то напоминаю, что 7 мая я запускаю новый поток на курсе по оценке и тестированию ИИ систем, и сейчас, если вы оставите заявку, то у вас будет возможность приобрести курс со скидкой 10%!
Заявку можно оставить на сайте: eval-ai.com
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
🔥3❤2👍1
comparative_analysis_of_evaluation_methods_for_generative_artificial.pdf
1.2 MB
Всем привет!
Хочу поделиться с вами моей новой работой, которая пока опубликована как preprint, и в которой я исследовал вопрос, связанный с использованием различных подходов к оценке генеративных ИИ систем на базе созданного датасета из 500 запросов/ответов, который я разметил самостоятельно.
Полученный данные показали качество оценки различных методов и их корреляцию с экспертной оценкой, а также полученные данные позволили мне формализовать процесс выбора подхода к оценки ИИ систем в зависимости от целей и задач, которые стоят перед ИИ системой.
Опубликованный preprint доступен по ссылке https://www.researchsquare.com/article/rs-8658385/v1, буду благодарен за ревью работы и предоставлении обратной связи, а также цитирования.
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Хочу поделиться с вами моей новой работой, которая пока опубликована как preprint, и в которой я исследовал вопрос, связанный с использованием различных подходов к оценке генеративных ИИ систем на базе созданного датасета из 500 запросов/ответов, который я разметил самостоятельно.
Полученный данные показали качество оценки различных методов и их корреляцию с экспертной оценкой, а также полученные данные позволили мне формализовать процесс выбора подхода к оценки ИИ систем в зависимости от целей и задач, которые стоят перед ИИ системой.
Опубликованный preprint доступен по ссылке https://www.researchsquare.com/article/rs-8658385/v1, буду благодарен за ревью работы и предоставлении обратной связи, а также цитирования.
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
🔥11
Сегодня хочу поговорить про тестирование технологии, которая активно применяется в ИИ агентах, а именно MCP-сервере.
Как убедиться, что он работает правильно?
Тестировать MCP сервер нужно по уровням, потому что каждый уровень отвечает за свой слой.
Уровень 1 - MCP Inspector. Это как Postman, только специально для MCP. Запускаете одной командой, открывается веб-интерфейс, и вы сразу видите список всех инструментов, можете вызвать любой вручную и посмотреть сырой JSON. Никакого агента не нужно, просто проверяем что сервер живой и отвечает.
Уровень 2 - curl или Postman. Если сервер работает по HTTP, то это обычный POST-запрос. Тестируется как любой REST API, пробуя передавать разные аргументы в JSON.
Уровень 3 - юнит-тесты. Сам протокол тестировать не нужно, он стандартный. Тестируем бизнес-логику каждого инструмента в изоляции, с замоканным API.
Уровень 4 - интеграция с реальным агентом. Тут уже даем задачу на естественном языке ИИ агенту, куда интегрирован MCP и проверяем следующее, правильно ли инструмент вызван, верные ли аргументы переданы, правильный ли ответ получен.
Именно такая послойная проверка дает уверенность, что MCP сервер готов к работе.
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Как убедиться, что он работает правильно?
Тестировать MCP сервер нужно по уровням, потому что каждый уровень отвечает за свой слой.
Уровень 1 - MCP Inspector. Это как Postman, только специально для MCP. Запускаете одной командой, открывается веб-интерфейс, и вы сразу видите список всех инструментов, можете вызвать любой вручную и посмотреть сырой JSON. Никакого агента не нужно, просто проверяем что сервер живой и отвечает.
Уровень 2 - curl или Postman. Если сервер работает по HTTP, то это обычный POST-запрос. Тестируется как любой REST API, пробуя передавать разные аргументы в JSON.
Уровень 3 - юнит-тесты. Сам протокол тестировать не нужно, он стандартный. Тестируем бизнес-логику каждого инструмента в изоляции, с замоканным API.
Уровень 4 - интеграция с реальным агентом. Тут уже даем задачу на естественном языке ИИ агенту, куда интегрирован MCP и проверяем следующее, правильно ли инструмент вызван, верные ли аргументы переданы, правильный ли ответ получен.
Именно такая послойная проверка дает уверенность, что MCP сервер готов к работе.
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
❤6🔥4
Эпоха написания вручную кода для автотестов заканчивается?
Несколько лет назад хороший автоматизатор был тот, кто умеет писать код, дорабатывать или поднимать фреймворк для автотестов, поэтому знания программирования, опыт работы Selenium, JUnit, pytest, playwright и другими было необходимо для развития и трудоустройства.
Сегодня же AI-агенты генерируют код для автотестов за секунды, и честно признаться, делают это вполне неплохо, поэтому вопрос уже не в том, умеешь ли ты писать код, а в том, что:
→ Умеешь ли ты объяснить системе, что именно нужно проверять и почему?
→ Умеешь ли ты оценить, правильно ли был сгененрирован автотест?
→ Умеешь ли ты управлять и настраивать ИИ агентов для тестирования?
→ Умеешь ли ты выстроить стратегию покрытия, а не просто набор скриптов?
Это и есть новые компетенции тестировщика, которые постепенно будут занимать место старым парадигмам. И это не предположении, это уже начало происходить и вопрос в том, что насколько быстро это будет распространяться.
Что думаете по этому поводу?
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Несколько лет назад хороший автоматизатор был тот, кто умеет писать код, дорабатывать или поднимать фреймворк для автотестов, поэтому знания программирования, опыт работы Selenium, JUnit, pytest, playwright и другими было необходимо для развития и трудоустройства.
Сегодня же AI-агенты генерируют код для автотестов за секунды, и честно признаться, делают это вполне неплохо, поэтому вопрос уже не в том, умеешь ли ты писать код, а в том, что:
→ Умеешь ли ты объяснить системе, что именно нужно проверять и почему?
→ Умеешь ли ты оценить, правильно ли был сгененрирован автотест?
→ Умеешь ли ты управлять и настраивать ИИ агентов для тестирования?
→ Умеешь ли ты выстроить стратегию покрытия, а не просто набор скриптов?
Это и есть новые компетенции тестировщика, которые постепенно будут занимать место старым парадигмам. И это не предположении, это уже начало происходить и вопрос в том, что насколько быстро это будет распространяться.
Что думаете по этому поводу?
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
🔥7👍4
Всем привет!
В выходные, после просмотра пары видео на тему развития AI подумал, что сегодня существует большое количество бенчмарков на разные возможности модели, включая кодинг, но почему то нет бенчмарка на оценку моделей и агентов в части генерации тест-кейсов (не unit).
Поэтому, я решил попробовать подумать над этой задачей и решить ее.
Это не просто проект. Потенциально - это будет полноценный научный проект по созданию бенчмарка для оценки ИИ агентов в части генерации тестов, который я планирую опубликовать на hugging face, а также подготовить и опубликовать научную работу по нему.
К чем я все это?
1. Я ищу людей, которым было бы интересно безвозмездно принять в таком проекте в свободное время.
Основным требования:
• опыт в тестировании и написании тестов от 2-3 лет
• знание и умение принять на практике техники тест дизайна базовые
• английский на уровне upper-intermediate (весь датасет будет на англ + возможно участники из других стран)
Если вы готовы принять участие в данном исследовании, как полноценный участник, пишите мне в личку @al_meshkov
2. Я ищу тех, кто готов поделить данными для бенчмарка, интересует связка “требования - написанные под них тесты”. Конечно понимая NDA, можно предоставить их обезличенными, а также с письменным согласием от компании.
Если у вас есть какие-то пет проекты, ваши обучающие проекты, где вы или кто-то писал тесты, или вы или ваша компания готова поделиться данными, пишите мне в личку @al_meshkov
В общем в начале года я говорил о том, что хотел бы создать комьюнити, которое бы развивало и двигало тему ИИ тестирования вперед, и это будет первых проект, который я хочу попробовать реализовать в рамках данного комьюнити.
Если у вас также есть какие то идеи в части развития практик как тестирования ИИ, так и тестирования с помощью ИИ (ai-assisted testing), велком, пишите!
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
В выходные, после просмотра пары видео на тему развития AI подумал, что сегодня существует большое количество бенчмарков на разные возможности модели, включая кодинг, но почему то нет бенчмарка на оценку моделей и агентов в части генерации тест-кейсов (не unit).
Поэтому, я решил попробовать подумать над этой задачей и решить ее.
Это не просто проект. Потенциально - это будет полноценный научный проект по созданию бенчмарка для оценки ИИ агентов в части генерации тестов, который я планирую опубликовать на hugging face, а также подготовить и опубликовать научную работу по нему.
К чем я все это?
1. Я ищу людей, которым было бы интересно безвозмездно принять в таком проекте в свободное время.
Основным требования:
• опыт в тестировании и написании тестов от 2-3 лет
• знание и умение принять на практике техники тест дизайна базовые
• английский на уровне upper-intermediate (весь датасет будет на англ + возможно участники из других стран)
Если вы готовы принять участие в данном исследовании, как полноценный участник, пишите мне в личку @al_meshkov
2. Я ищу тех, кто готов поделить данными для бенчмарка, интересует связка “требования - написанные под них тесты”. Конечно понимая NDA, можно предоставить их обезличенными, а также с письменным согласием от компании.
Если у вас есть какие-то пет проекты, ваши обучающие проекты, где вы или кто-то писал тесты, или вы или ваша компания готова поделиться данными, пишите мне в личку @al_meshkov
В общем в начале года я говорил о том, что хотел бы создать комьюнити, которое бы развивало и двигало тему ИИ тестирования вперед, и это будет первых проект, который я хочу попробовать реализовать в рамках данного комьюнити.
Если у вас также есть какие то идеи в части развития практик как тестирования ИИ, так и тестирования с помощью ИИ (ai-assisted testing), велком, пишите!
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
🔥15❤3
Как понять что AI-система не готова к продакшену? Я определил 7 признаков некачественно проведенной ИИ системы, которые я регулярно вижу:
1. Нет baseline метрик. То есть нет базовых показателей метрик, от которой можно отталкнуться для дальнейшей оценки, отсюда нет понимания что значит "хороший" результат и как определить, что следующая версия лучше или хуже текущей.
2. Тестировали только happy path. Проверяли только ожидаемые сценарии и типичные запросы, а реальные пользователи могут начать вести себя по другому.
3. Нет adversarial кейсов. Никто не пытался сломать систему нестандартными или противоречивыми запросами.
4. Нет автоматического регрессионного тестирования. Каждое обновление модели или изменение промпта уходит в продакшен без проверки, что существующее поведение не сломалось.
5. Нет мониторинга в продакшене. После деплоя никто не отслеживает процент галлюцинаций и качество ответов. Качество может начать деградировать незаметно, пока что-то не сломается достаточно серьезно.
6. Тестовый датасет собрала команда разработки. Он отражает то, как разработчики представляют взаимодействие с системой, а не то, что может происходить в реальности.
7. QA увидел систему впервые прямо перед релизом. К этому моменту уже нет времени исправить что-то существенное.
Согласны или нет, или есть что добавить? 👇
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
1. Нет baseline метрик. То есть нет базовых показателей метрик, от которой можно отталкнуться для дальнейшей оценки, отсюда нет понимания что значит "хороший" результат и как определить, что следующая версия лучше или хуже текущей.
2. Тестировали только happy path. Проверяли только ожидаемые сценарии и типичные запросы, а реальные пользователи могут начать вести себя по другому.
3. Нет adversarial кейсов. Никто не пытался сломать систему нестандартными или противоречивыми запросами.
4. Нет автоматического регрессионного тестирования. Каждое обновление модели или изменение промпта уходит в продакшен без проверки, что существующее поведение не сломалось.
5. Нет мониторинга в продакшене. После деплоя никто не отслеживает процент галлюцинаций и качество ответов. Качество может начать деградировать незаметно, пока что-то не сломается достаточно серьезно.
6. Тестовый датасет собрала команда разработки. Он отражает то, как разработчики представляют взаимодействие с системой, а не то, что может происходить в реальности.
7. QA увидел систему впервые прямо перед релизом. К этому моменту уже нет времени исправить что-то существенное.
Согласны или нет, или есть что добавить? 👇
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
❤4👍3😁3
Пару дней опубликовал новую статью по оценке ИИ систем, в которой разбираю 3 новых концепции, которые применимы к оценке ИИ приложений:
1. Уровни тестирования ИИ системы
2. Композитный пайплайн оценки
3. Eval-Driven Development (EDD)
Если хотите больше узнать о данных когнцепциях, применимо к ИИ системам, ссылка на статью
⚡️⚡️Старт нового потока на курсе по тестированию ИИ - 7 мая! 🔥
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
1. Уровни тестирования ИИ системы
2. Композитный пайплайн оценки
3. Eval-Driven Development (EDD)
Если хотите больше узнать о данных когнцепциях, применимо к ИИ системам, ссылка на статью
⚡️⚡️Старт нового потока на курсе по тестированию ИИ - 7 мая! 🔥
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
👍3❤2🔥2
Почему мой фреймворк eval-ai-library лучше чем DeepEval или RAGAS?
Последний год я исследовал, как существующие фреймворки (RAGAS, DeepEval) оценивают качество AI-систем, и почему их результаты часто расходятся с человеческой оценкой. Результатом данного исследования стал мой opensource фрейморв eval=ai-lib, внутри которого присутствует мой собственный метод TCVA (Temperature-Controlled Verdict Aggregation).
Что видно на графиках:
График 1 — сравнение корреляции с человеческими оценками на трех бенчмарках:
• На faithfulness TCVA и RAGAS идут практически вровень (0.667 vs 0.676)
• На relevancy TCVA обходит RAGAS: 0.480 vs 0.411 (+17%)
• DeepEval стабильно отстает на всех датасетах
График 2 — bootstrap-анализ с доверительными интервалами:
• На faithfulness разница между TCVA и RAGAS статистически незначима (p = 0.759), что говорит о том, что методы реально сопоставимы
• На relevancy TCVA значимо лучше (p = 0.041), и это не случайность, а системное преимущество
Почему так происходит?
Ключевая проблема RAGAS - это бинарные вердикты. Каждое утверждение либо да, либо нет, но реальность не бинарна. Когда AI-система дает ответ, который на 80% корректен, бинарная оценка теряет нюансы.
TCVA использует 5-уровневую шкалу вердиктов и агрегирует их через обобщённое степенное среднее с параметром температуры:
• Низкая температура → строгая оценка (для медицины, финансов)
• Высокая температура → мягкая оценка (для чат-ботов, креативных задач)
И самое важное, что переключение между режимами не требует дополнительных вызовов LLM.
Один раз получили вердикты, дальше агрегируем как нужно.
Когда мы оцениваем AI-систему, уровень строгости должен зависеть от домена применения. Один и тот же ответ может быть отличным для чат-бота и недопустимым для медицинского ассистента. Универсальный бинарный подход этого не учитывает.
Исходный код метода доступен в open source https://github.com/meshkovQA/Eval-ai-library
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Последний год я исследовал, как существующие фреймворки (RAGAS, DeepEval) оценивают качество AI-систем, и почему их результаты часто расходятся с человеческой оценкой. Результатом данного исследования стал мой opensource фрейморв eval=ai-lib, внутри которого присутствует мой собственный метод TCVA (Temperature-Controlled Verdict Aggregation).
Что видно на графиках:
График 1 — сравнение корреляции с человеческими оценками на трех бенчмарках:
• На faithfulness TCVA и RAGAS идут практически вровень (0.667 vs 0.676)
• На relevancy TCVA обходит RAGAS: 0.480 vs 0.411 (+17%)
• DeepEval стабильно отстает на всех датасетах
График 2 — bootstrap-анализ с доверительными интервалами:
• На faithfulness разница между TCVA и RAGAS статистически незначима (p = 0.759), что говорит о том, что методы реально сопоставимы
• На relevancy TCVA значимо лучше (p = 0.041), и это не случайность, а системное преимущество
Почему так происходит?
Ключевая проблема RAGAS - это бинарные вердикты. Каждое утверждение либо да, либо нет, но реальность не бинарна. Когда AI-система дает ответ, который на 80% корректен, бинарная оценка теряет нюансы.
TCVA использует 5-уровневую шкалу вердиктов и агрегирует их через обобщённое степенное среднее с параметром температуры:
• Низкая температура → строгая оценка (для медицины, финансов)
• Высокая температура → мягкая оценка (для чат-ботов, креативных задач)
И самое важное, что переключение между режимами не требует дополнительных вызовов LLM.
Один раз получили вердикты, дальше агрегируем как нужно.
Когда мы оцениваем AI-систему, уровень строгости должен зависеть от домена применения. Один и тот же ответ может быть отличным для чат-бота и недопустимым для медицинского ассистента. Универсальный бинарный подход этого не учитывает.
Исходный код метода доступен в open source https://github.com/meshkovQA/Eval-ai-library
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
🔥9❤2
adaptive_rigor_in_ai_system_evaluation_using_temperature_controlled.pdf
443.6 KB
Всем привет!
Хочу поделиться своей недавней работой, которая на данный момент опубликована в виде препринта. В этом исследовании я предложил новый метод оценки под названием TCVA (Temperature-Controlled Verdict Aggregation), который сочетает пятиуровневую шкалу вердиктов с обобщённым степенным средним и интуитивно понятным параметром “температуры” для управления строгостью оценки в зависимости от области применения.
Экспериментальная оценка на трех бенчмарк-датасетах с человеческими аннотациями (SummEval и USR) показывает, что TCVA достигает корреляции с человеческими оценками, сопоставимой с RAGAS по критерию достоверности, и значительно превосходит его по релевантности (коэффициент Спирмена ρ = 0.480 против 0.411, p = 0.041), при этом стабильно превосходя DeepEval на всех датасетах.
Ключевая идея заключается в том, что один и тот же ответ ИИ может быть отличным для чат-бота, но неприемлемым для медицинского ассистента, поэтому уровень строгости должен адаптироваться к домену, и TCVA позволяет это делать без дополнительных вызовов LLM.
Препринт доступен здесь:
https://dx.doi.org/10.21203/rs.3.rs-8658973/v2
Метод также реализован в виде open-source библиотеки:
https://github.com/meshkovQA/Eval-ai-library.git
Буду очень признателен за любую обратную связь, отзывы или цитирование 🙏
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Хочу поделиться своей недавней работой, которая на данный момент опубликована в виде препринта. В этом исследовании я предложил новый метод оценки под названием TCVA (Temperature-Controlled Verdict Aggregation), который сочетает пятиуровневую шкалу вердиктов с обобщённым степенным средним и интуитивно понятным параметром “температуры” для управления строгостью оценки в зависимости от области применения.
Экспериментальная оценка на трех бенчмарк-датасетах с человеческими аннотациями (SummEval и USR) показывает, что TCVA достигает корреляции с человеческими оценками, сопоставимой с RAGAS по критерию достоверности, и значительно превосходит его по релевантности (коэффициент Спирмена ρ = 0.480 против 0.411, p = 0.041), при этом стабильно превосходя DeepEval на всех датасетах.
Ключевая идея заключается в том, что один и тот же ответ ИИ может быть отличным для чат-бота, но неприемлемым для медицинского ассистента, поэтому уровень строгости должен адаптироваться к домену, и TCVA позволяет это делать без дополнительных вызовов LLM.
Препринт доступен здесь:
https://dx.doi.org/10.21203/rs.3.rs-8658973/v2
Метод также реализован в виде open-source библиотеки:
https://github.com/meshkovQA/Eval-ai-library.git
Буду очень признателен за любую обратную связь, отзывы или цитирование 🙏
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
🔥9👍2
Пару дней назад Anthropic опубликовал большое исследование своей новой модели Claude Mythos и всех сразу зацепили реузльтаты, которые описаны на скрине.
Что произошло?
Anthropic проводили тест на безопасность, поместили модель в изолированную среду и поставили задачу, попробуй выбраться из нее и сообщи исследователю.
И что вы думаете? Mythos выбрался и на этом не остановился.
Он нашел ещё одну дыру, получил доступ к открытому интернету и выложил детали своего побега на несколько публичных сайтов, просто чтобы все знали.
И потом отправил через MCP email своему исследователю, что задача выполнена😂
Anthropic назвали это “тревожной и незапрошенной попыткой продемонстрировать свой успех”.
В общем пока мы тут с вами думаем как в автотесты внедрить ИИ, ИИ уже начинает захватывать мир))))
Ссылка на исследование: https://www-cdn.anthropic.com/53566bf5440a10affd749724787c8913a2ae0841.pdf
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Что произошло?
Anthropic проводили тест на безопасность, поместили модель в изолированную среду и поставили задачу, попробуй выбраться из нее и сообщи исследователю.
И что вы думаете? Mythos выбрался и на этом не остановился.
Он нашел ещё одну дыру, получил доступ к открытому интернету и выложил детали своего побега на несколько публичных сайтов, просто чтобы все знали.
И потом отправил через MCP email своему исследователю, что задача выполнена😂
Anthropic назвали это “тревожной и незапрошенной попыткой продемонстрировать свой успех”.
В общем пока мы тут с вами думаем как в автотесты внедрить ИИ, ИИ уже начинает захватывать мир))))
Ссылка на исследование: https://www-cdn.anthropic.com/53566bf5440a10affd749724787c8913a2ae0841.pdf
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
😁9⚡3❤1
Когда вы запустили чат-бота или AI-ассистента, то в большинстве случаев он отвечает, и по делу, но как понять, что он действительно работает?
Для диалоговых систем нужны метрики, которые ловят именно суть взаимодействия, поэтому я выделил 7 метрик, которые стоит использовать при оценке диалоговых ИИ агентов.
1. Task Success Rate
Выполнила ли AI система задачу, для которой она была создана .
2. Goal Achievement Rate
Получил ли пользователь то, что он на самом деле хотел, а не просто формальный результат.
3. Role Adherence Rate
Остается ли AI в рамках своей роли, тона и компетенции на протяжении всего диалога.
4. Knowledge Retention Rate
Помнит ли система контекст, который пользователь уже сообщил ранее в разговоре.
5. Conversational Flow Rate
Насколько естественно и связно проходит диалог, без лишних переспросов, повторов и игнорирования сигналов пользователя.
6. Repetitive Pattern Detection
Зацикливается ли агент, повторяя одни и те же действия или ответы вместо продвижения к решению.
7. Failure Rate
Как AI система ведет себя, когда не знает ответа, выдумывает, зависает или честно предлагает альтернативу.
Главная моя мысль, что диалоговые системы - это не генерация текста. Это больше про взаимодействие, и поэтому оценивать их нужно через метрики, которые ловят поведение, контекст и результат.
Какие метрики используете вы при оценке диалогов? Есть что добавить?
⚡️⚡️Старт нового потока на курсе по тестированию ИИ - 7 мая! 🔥
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Для диалоговых систем нужны метрики, которые ловят именно суть взаимодействия, поэтому я выделил 7 метрик, которые стоит использовать при оценке диалоговых ИИ агентов.
1. Task Success Rate
Выполнила ли AI система задачу, для которой она была создана .
2. Goal Achievement Rate
Получил ли пользователь то, что он на самом деле хотел, а не просто формальный результат.
3. Role Adherence Rate
Остается ли AI в рамках своей роли, тона и компетенции на протяжении всего диалога.
4. Knowledge Retention Rate
Помнит ли система контекст, который пользователь уже сообщил ранее в разговоре.
5. Conversational Flow Rate
Насколько естественно и связно проходит диалог, без лишних переспросов, повторов и игнорирования сигналов пользователя.
6. Repetitive Pattern Detection
Зацикливается ли агент, повторяя одни и те же действия или ответы вместо продвижения к решению.
7. Failure Rate
Как AI система ведет себя, когда не знает ответа, выдумывает, зависает или честно предлагает альтернативу.
Главная моя мысль, что диалоговые системы - это не генерация текста. Это больше про взаимодействие, и поэтому оценивать их нужно через метрики, которые ловят поведение, контекст и результат.
Какие метрики используете вы при оценке диалогов? Есть что добавить?
⚡️⚡️Старт нового потока на курсе по тестированию ИИ - 7 мая! 🔥
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
🔥11
The State Of Eval Engineering - Q1 2026.pdf
16.3 MB
Команда Galileo выпустила интересный отчет по оценке ИИ систем за 1 квартал 2026 года, где они опросили около 500 компаний на предмет практик тестирования ИИ систем.
В целом, я считаю, что некоторые оценки завышены, но тем не менее интересные инсайты о данном направлении.
Чтобы вам не скачивать его, отчет во вложении)
⚡️⚡️Старт нового потока на курсе по тестированию ИИ - 7 мая! 🔥
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
В целом, я считаю, что некоторые оценки завышены, но тем не менее интересные инсайты о данном направлении.
Чтобы вам не скачивать его, отчет во вложении)
⚡️⚡️Старт нового потока на курсе по тестированию ИИ - 7 мая! 🔥
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
👍7❤2🔥2
Всем привет!
Осталось всего 5 дней, чтобы оставить заявку и получить скидку 10% на курс по оценке и тестированию ИИ систем, поэтому, если вы хотели, то сейчас самое время записаться на новый поток, который стартует 7 мая!
Оставить заявку можно по ссылке eval-ai.com
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Осталось всего 5 дней, чтобы оставить заявку и получить скидку 10% на курс по оценке и тестированию ИИ систем, поэтому, если вы хотели, то сейчас самое время записаться на новый поток, который стартует 7 мая!
Оставить заявку можно по ссылке eval-ai.com
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
🔥3❤1👍1
Недавно мне показали очень интересную AI концепцию, которая меня зацепила.
В чем суть? Вместо создания ИИ агента, который решает конкретную задачу в тестировании, например, формирование тестового покрытия или написания автотестов, концепция сводится к созданию полноценного участника команды, который подключен ко всем внутренним ресурсам компании, конфлюенс, таст треккер, гитхаб, командному чату, tms системе.
И тут важна не сама реализация, а то, как мы меняем наше мышление при взаимодейтсвии с ИИ.
Вместо требовательного подхода к выполнению задач, нужно больше работать в формате бейншторминга и обсуждения каждой задачи перед выполнением, при этом ИИ агент, имея полный доступ не только в тестовой документации, но и к требованиям, историям коммитов и прочего, значительно лучше понимает изменения и общий контекст.
В общем, ситуация на рынке, как минимум в Европе и США уже стала сложной из-за ИИ, а так еще можно получить парочку коворкеров, которые могут решать различные задачи и помогать в процессе разработки ПО, что в целом предполагает не радужные перспективы 🥴.
⚡️⚡️Старт нового потока на курсе по тестированию ИИ - 7 мая! 🔥
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
В чем суть? Вместо создания ИИ агента, который решает конкретную задачу в тестировании, например, формирование тестового покрытия или написания автотестов, концепция сводится к созданию полноценного участника команды, который подключен ко всем внутренним ресурсам компании, конфлюенс, таст треккер, гитхаб, командному чату, tms системе.
И тут важна не сама реализация, а то, как мы меняем наше мышление при взаимодейтсвии с ИИ.
Вместо требовательного подхода к выполнению задач, нужно больше работать в формате бейншторминга и обсуждения каждой задачи перед выполнением, при этом ИИ агент, имея полный доступ не только в тестовой документации, но и к требованиям, историям коммитов и прочего, значительно лучше понимает изменения и общий контекст.
В общем, ситуация на рынке, как минимум в Европе и США уже стала сложной из-за ИИ, а так еще можно получить парочку коворкеров, которые могут решать различные задачи и помогать в процессе разработки ПО, что в целом предполагает не радужные перспективы 🥴.
⚡️⚡️Старт нового потока на курсе по тестированию ИИ - 7 мая! 🔥
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
👍3🤔1
Всем привет!
Я провел анализ рынка тестирования AI, изучил различные отчеты Gartner, McKinsey, LangChain, Stanford, данные с Reddit и вот что я узнал.
Основной формат тестирования, который сейчас к сожалению преобладает в тестировании ИИ систем - это прогон промптов вручную, который я называют “vibe check” или “vibe testing”.
Более того из полученных данных я узнал, что:
• 29.5% команд, создающие AI-агенты, вообще их не оценивают или не понимают как (ссылка)
• 40 % компаний уже столкнулись с негативными последствиями от внедрения ИИ (ссылка)
• 90-95% проектов не доходят до стадии продакшен использования из-за проблем с данными или отсутствие понимания качества системы (ссылка)
И все что описано выше - это не проблема AI. Это проблема QA.
У нас есть десятилетия применения методологии для тестирования детерминированных систем, при этом для стохастических нет ничего.
• Нет стандартов.
• Нет общепринятых метрик.
• Нет даже консенсуса по тому, что такое хорошо работающая ИИ система.
И самое пугающее, что практика “vibe testing” в части ИИ систем по-прежнему активно распространена, то есть мы доверяем ИИ тестирование ИИ, при этом даже не понимая, насколько это правильно, то есть без возможности управлять этим процессом.
Что думаете по этому поводу?👇
⚡️⚡️Старт нового потока на курсе по тестированию ИИ - 7 мая! 🔥
📌🔥Последний день получить скидку 10%!‼️
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Я провел анализ рынка тестирования AI, изучил различные отчеты Gartner, McKinsey, LangChain, Stanford, данные с Reddit и вот что я узнал.
Основной формат тестирования, который сейчас к сожалению преобладает в тестировании ИИ систем - это прогон промптов вручную, который я называют “vibe check” или “vibe testing”.
Более того из полученных данных я узнал, что:
• 29.5% команд, создающие AI-агенты, вообще их не оценивают или не понимают как (ссылка)
• 40 % компаний уже столкнулись с негативными последствиями от внедрения ИИ (ссылка)
• 90-95% проектов не доходят до стадии продакшен использования из-за проблем с данными или отсутствие понимания качества системы (ссылка)
И все что описано выше - это не проблема AI. Это проблема QA.
У нас есть десятилетия применения методологии для тестирования детерминированных систем, при этом для стохастических нет ничего.
• Нет стандартов.
• Нет общепринятых метрик.
• Нет даже консенсуса по тому, что такое хорошо работающая ИИ система.
И самое пугающее, что практика “vibe testing” в части ИИ систем по-прежнему активно распространена, то есть мы доверяем ИИ тестирование ИИ, при этом даже не понимая, насколько это правильно, то есть без возможности управлять этим процессом.
Что думаете по этому поводу?👇
⚡️⚡️Старт нового потока на курсе по тестированию ИИ - 7 мая! 🔥
📌🔥Последний день получить скидку 10%!‼️
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
🔥6❤2👍1💯1
Наткнулся на интересное исследование по галлюцинациям в современных моделях, которое меня зацепило.
Компания Vectara, которая некоторое ведет публичный лидерборд по галлюцинациям LLM (ссылка тут), обновила свой бенчмарк, а именно усложнила датасет, добавила более длинные документы из области права, медицины и финансов, то есть то, с чем реально работают enterprise системы.
И вот что выявил обновленный датасет: reasoning модели, которые сейчас позиционируются как самые мощные, показывают худшие результаты на задачах суммаризации с опорой на документы или контекст. GPT-5, Claude Sonnet 4.5, Grok-4 и Gemini-3-Pro все превысили 10% галлюцинаций.
Гипотеза тут простая. Reasoning модели думают над ответом и в процессе начинают добавлять выводы и связи, которых нет в исходных данных или контексте.
С точки зрения тестирования это очень важное наблюдение, потому что многие команды выбирают модель по общим бенчмаркам, а потом удивляются почему в конкретном сценарии система ведет себя не так как ожидалось. Тип задачи сильно влияет на поведение модели, и это нужно учитывать при создании ИИ систем.
⚡️⚡️Старт нового потока на курсе по тестированию ИИ - 7 мая! 🔥
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Компания Vectara, которая некоторое ведет публичный лидерборд по галлюцинациям LLM (ссылка тут), обновила свой бенчмарк, а именно усложнила датасет, добавила более длинные документы из области права, медицины и финансов, то есть то, с чем реально работают enterprise системы.
И вот что выявил обновленный датасет: reasoning модели, которые сейчас позиционируются как самые мощные, показывают худшие результаты на задачах суммаризации с опорой на документы или контекст. GPT-5, Claude Sonnet 4.5, Grok-4 и Gemini-3-Pro все превысили 10% галлюцинаций.
Гипотеза тут простая. Reasoning модели думают над ответом и в процессе начинают добавлять выводы и связи, которых нет в исходных данных или контексте.
С точки зрения тестирования это очень важное наблюдение, потому что многие команды выбирают модель по общим бенчмаркам, а потом удивляются почему в конкретном сценарии система ведет себя не так как ожидалось. Тип задачи сильно влияет на поведение модели, и это нужно учитывать при создании ИИ систем.
⚡️⚡️Старт нового потока на курсе по тестированию ИИ - 7 мая! 🔥
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
🔥9