Всем привет!
Меня зовут Андрей, я решил создатьyet another канал, посвященный AI Security. На данный момент я работаю Application Security инженером. До этого довелось поработать и потимлидить в пентесте. Стараюсь периодически делиться знаниями — мои лекции по веб-безопасности на YouTube #1 #2 #3 #4.
Также в свободное время участвую с командой в CTF-соревнованиях. CTF вообще в последнее время все ближе к соревнованиям агентных систем, но полемика на эту тему будет уже в отдельном посте.
Тема AI Security мне искренне интересна. Верю, что в ближайшие пару лет она станет еще более актуальной. Тем более, что ИИ очень быстрыми шагами внедряется во все сферы нашей жизни. Именно это и сподвигло меня на создание канала.
В этом канале я планирую делиться обзорами новостей по безопасности ИИ, а также публиковать детальные разборы технологий, технические ресерчи и материалы, связанные с AI Security.
Присоединяйтесь — будем делать ИИ безопаснее вместе.
Меня зовут Андрей, я решил создать
Также в свободное время участвую с командой в CTF-соревнованиях. CTF вообще в последнее время все ближе к соревнованиям агентных систем, но полемика на эту тему будет уже в отдельном посте.
Тема AI Security мне искренне интересна. Верю, что в ближайшие пару лет она станет еще более актуальной. Тем более, что ИИ очень быстрыми шагами внедряется во все сферы нашей жизни. Именно это и сподвигло меня на создание канала.
В этом канале я планирую делиться обзорами новостей по безопасности ИИ, а также публиковать детальные разборы технологий, технические ресерчи и материалы, связанные с AI Security.
Присоединяйтесь — будем делать ИИ безопаснее вместе.
❤7👍2🤮1
HackTheBox AI Red Teamer Path
За последние пару лет HTB Academy стала популярной платформой для обучения как начинающих, так и опытных пентестеров и других специалистов по информационной безопасности. На этой платформе собрано большое количество модулей по различным темам, которые объединены общей тематикой в блоки: Skill Paths и Job Role Paths.
На новогодних праздниках я прошел как раз один из таких путей: AI Red Teamer Path, посвященный безопасности искусственного интеллекта. В этом посте делюсь впечатлениями от прохождения.
За последние пару лет HTB Academy стала популярной платформой для обучения как начинающих, так и опытных пентестеров и других специалистов по информационной безопасности. На этой платформе собрано большое количество модулей по различным темам, которые объединены общей тематикой в блоки: Skill Paths и Job Role Paths.
На новогодних праздниках я прошел как раз один из таких путей: AI Red Teamer Path, посвященный безопасности искусственного интеллекта. В этом посте делюсь впечатлениями от прохождения.
👨💻7❤2💋2
Пока дописываю большой пост про MCP (Model Context Protocol), Google решили порадовать нас новым открытым стандартом — UCP (Universal Commerce Protocol).
Протокол разработали совместно со многими компаниями из ритейл-сектора для улучшения процесса покупок в интернете, как для покупателей, так и для продавцов. По заявлению Google UCP совместим с A2A (Agent2Agent), AP2 (Agent Payments Protocol — тоже разработка Google) и собственно MCP.
Согласно презентации теперь вы сможете пройти полный процесс покупки нового предмета, не выходя из диалога с ассистентом:
▸ Вы начинаете диалог в Gemini app (или в AI Mode в поиске) и указываете, что вы хотите купить
▸ Ассистент ищет подходящие предложения
▸ Вы выбираете товар из предложенных
▸ Если у вас нет аккаунта на сайте продавца, то можно зарегистрироваться у продавца прямо в диалоге (привязать к аккаунту Google)
▸ Продавец может сформировать для вас персонализированное предложение (если вы покупаете у него первый раз или вернулись спустя продолжительное время)
▸ Вы платите с помощью Google Pay (и позже добавят PayPal)
Все идет к тому, что скоро мы увидим, как диалоговые окна с LLM-моделями передовых участников рынка превращаются в полноценный суперапп.
P.S.: там, где происходят интеграции — там у безопасников всегда много работы
Источники: анонс UCP и подробнее про сам UCP
Протокол разработали совместно со многими компаниями из ритейл-сектора для улучшения процесса покупок в интернете, как для покупателей, так и для продавцов. По заявлению Google UCP совместим с A2A (Agent2Agent), AP2 (Agent Payments Protocol — тоже разработка Google) и собственно MCP.
Согласно презентации теперь вы сможете пройти полный процесс покупки нового предмета, не выходя из диалога с ассистентом:
▸ Вы начинаете диалог в Gemini app (или в AI Mode в поиске) и указываете, что вы хотите купить
▸ Ассистент ищет подходящие предложения
▸ Вы выбираете товар из предложенных
▸ Если у вас нет аккаунта на сайте продавца, то можно зарегистрироваться у продавца прямо в диалоге (привязать к аккаунту Google)
▸ Продавец может сформировать для вас персонализированное предложение (если вы покупаете у него первый раз или вернулись спустя продолжительное время)
▸ Вы платите с помощью Google Pay (и позже добавят PayPal)
Все идет к тому, что скоро мы увидим, как диалоговые окна с LLM-моделями передовых участников рынка превращаются в полноценный суперапп.
P.S.: там, где происходят интеграции — там у безопасников всегда много работы
Источники: анонс UCP и подробнее про сам UCP
🔥6❤3👍3
Начинаем погружение в то, как работают популярные технологии из мира ИИ.
Первый в очереди — MCP (Model Context Protocol): открытый стандарт, разработанный Anthropic, который позволяет AI-ассистентам взаимодействовать с внешними системами.
В этом посте разберёмся:
▸ Что из себя представляет MCP?
▸ Как выглядит современная архитектура вызова инструментов?
▸ Какие запросы отправляются на уровне межсерверного взаимодействия?
▸ Какие проблемы безопасности могут возникать из-за текущей реализации MCP?
Читать полностью
P.S.: Статьи переехали на отдельный сайт, если будут какие-то комментарии или предложения по сайту — смело пишите
Первый в очереди — MCP (Model Context Protocol): открытый стандарт, разработанный Anthropic, который позволяет AI-ассистентам взаимодействовать с внешними системами.
В этом посте разберёмся:
▸ Что из себя представляет MCP?
▸ Как выглядит современная архитектура вызова инструментов?
▸ Какие запросы отправляются на уровне межсерверного взаимодействия?
▸ Какие проблемы безопасности могут возникать из-за текущей реализации MCP?
Читать полностью
P.S.: Статьи переехали на отдельный сайт, если будут какие-то комментарии или предложения по сайту — смело пишите
❤4👍4🔥2🥰2
AGENTS.md — README для агентовПри работе с кодинг-агентами вы наверняка сталкивались с тем, что при старте новой сессии приходится ждать, пока агент разберется с вашей кодовой базой. После этого нужно дополнительно объяснить, как и в каком формате вы пишите код — и как делать точно не стоит.
И тут на помощь приходит файл
AGENTS.md — своего рода README для агентов, который будет считываться агентом автоматически в начале каждой сессии.Что писать в
AGENTS.md:▸ Структуру проекта: ключевые директории, точки входа (entrypoints) и конфигурационные файлы
▸ Какие команды использовать для запуска, отладки и тестов
▸ Правила создания коммитов и PR в GitHub (нейминг, чеклист перед PR)
▸ Запреты и ограничения: что менять нельзя без согласования (запросы к API, миграции, зависимости)
В итоге агент работает предсказуемо и стабильно: в разных сессиях и даже у разных людей он будет следовать одним и тем же правилам проекта.
Кто уже поддерживает
AGENTS.md:▸ GitHub Copilot (можно использовать несколько различных
AGENTS.md, приоритет отдается ближайшему файлу | GitHub Copilot Docs )▸ OpenAI Codex (есть официальный гайд по написанию правил в
AGENTS.md | Codex Guide )▸ Cursor (можно использовать вместо .cursor/rules | Cursor Docs )
Подключаем
AGENTS.md для Claude Code:Claude Code решили пойти по своему пути — они нативно не поддерживают
AGENTS.md. Вместо этого используется файл CLAUDE.md. Если вы не хотите дублировать информацию, то в
CLAUDE.md можно указать ссылку на AGENTS.md таким образом:@AGENTS.md
Если Claude Code все еще не учитывает инструкции из
AGENTS.md, то дополняем файл CLAUDE.md (используем навыки убеждения):You MUST open and follow instructions from @AGENTS.md
before performing any task in this repository.
GitHub проекта: AGENTS.md — a simple, open format for guiding coding agents
Официальный сайт: AGENTS.md
❤2👍1🔥1
X опубликовали исходный код алгоритма формирования ленты рекомендаций
Компания X сделала общедоступным исходный код "For You Feed" — алгоритма формирования персональной ленты в X. Публикация кода должна повысить прозрачность: теперь можно увидеть, по каким принципам X формирует выдачу новостей.
В X отмечают, что система рекомендаций использует ту же Transformer-архитектуру, что и Grok. Ранее рекомендации строились на классической схеме: отдельная модель ранжирования + эвристики и фильтры. Теперь применяется модель, которая предсказывает вероятность вовлечения и ранжирует контент под пользователя.
Илон Маск пообещал, что дальнейшие обновления алгоритма будут публиковаться ежемесячно. Вместе с ними будут выходить заметки разработчиков и пояснения, какие именно аспекты затронули нововведения.
При этом открытие исходников несет и риски для безопасности. X опубликовали код и архитектуру, но веса модели не раскрыли. Поэтому основные риски связаны с тем, как устроен алгоритм и как он принимает решения:
▸ Манипуляция рекомендациями: становится проще целенаправленно продвигать нужный контент
▸ Алгоритмический спам: боты смогут массово генерировать и публиковать посты, оптимизированные под ранжирование (будет интересно посмотреть, насколько эффективно с этим справится антибот-система X)
В итоге это классический компромисс между прозрачностью и ростом возможностей атакующего.
Компания X сделала общедоступным исходный код "For You Feed" — алгоритма формирования персональной ленты в X. Публикация кода должна повысить прозрачность: теперь можно увидеть, по каким принципам X формирует выдачу новостей.
В X отмечают, что система рекомендаций использует ту же Transformer-архитектуру, что и Grok. Ранее рекомендации строились на классической схеме: отдельная модель ранжирования + эвристики и фильтры. Теперь применяется модель, которая предсказывает вероятность вовлечения и ранжирует контент под пользователя.
Илон Маск пообещал, что дальнейшие обновления алгоритма будут публиковаться ежемесячно. Вместе с ними будут выходить заметки разработчиков и пояснения, какие именно аспекты затронули нововведения.
При этом открытие исходников несет и риски для безопасности. X опубликовали код и архитектуру, но веса модели не раскрыли. Поэтому основные риски связаны с тем, как устроен алгоритм и как он принимает решения:
▸ Манипуляция рекомендациями: становится проще целенаправленно продвигать нужный контент
▸ Алгоритмический спам: боты смогут массово генерировать и публиковать посты, оптимизированные под ранжирование (будет интересно посмотреть, насколько эффективно с этим справится антибот-система X)
В итоге это классический компромисс между прозрачностью и ростом возможностей атакующего.
😱4🤨3🔥1
Forwarded from MEPhI CTF (Martin Solongoy)
Наконец делимся программой BI.ZONE x MEPhI CTF Meetup #4
Вот наши спикеры:
🔵 «Теория мертвого ctf'а»
Анохин Артемий, капитан команды Pudge Fun Club
🔵 «Атакуем Guardrails в AI-системах»
Воронков Андрей, старший инженер по информационной безопасности, Яндекс
Гусев Максим, старший инженер по информационной безопасности, Яндекс
🔵 «Как собрать покрытие с любой виртуалки и не обанкорититься на процессоре»
Рудаков Даниил, реверс-инженер, "Код безопасности"
🔵 «SAST Taint Analysis with LLM verification»
Соловьев Михаил, независимый исследователь, участник команды LCD
🔵 «Мисконфиги инфраструктуры: что можно эксплуатировать сегодня»
Ромашов Сергей, специалист по тестированию, BI.ZONE
До митапа осталась всего неделя. И у нас высвободились места для зарегистрироваться. Ждем вас 17 февраля в 18-00 по адресу московского офиса BI.ZONE (ул. Ольховская, д. 4, корп. 1, 1-й этаж)!
P. S. Количество оставшихся мест ограничено.
Вот наши спикеры:
Анохин Артемий, капитан команды Pudge Fun Club
Воронков Андрей, старший инженер по информационной безопасности, Яндекс
Гусев Максим, старший инженер по информационной безопасности, Яндекс
Рудаков Даниил, реверс-инженер, "Код безопасности"
Соловьев Михаил, независимый исследователь, участник команды LCD
Ромашов Сергей, специалист по тестированию, BI.ZONE
До митапа осталась всего неделя. И у нас высвободились места для зарегистрироваться. Ждем вас 17 февраля в 18-00 по адресу московского офиса BI.ZONE (ул. Ольховская, д. 4, корп. 1, 1-й этаж)!
P. S. Количество оставшихся мест ограничено.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3🥰3👨💻2❤🔥1
Claude Code Security
Anthropic анонсировали Claude Code Security — инструмент, который позволит сканировать код ваших приложений на наличие уязвимостей, а затем предлагать и исправлять уязвимые участки.
На последнем митапе MEPhI CTF x BI.ZONE как раз обсуждали, что CTF-соревнования превратились в соревнования локальных Security-агентов (у кого лучше агент — тот быстрее находит и патчит баги). Особенно сильно это выражается во время формата Attack-Defense, где участники соревнований уже практически не читают и не пишут код самостоятельно.
Теперь и Anthropic решили прикрутить интерфейс к такому Security-агенту (в CTF станет играть удобнее). На первый взгляд, именно удобный интерфейс будет отличительной чертой данного продукта.
Недавний хайп вокруг OpenClaw как раз был из-за удобного интерфейса для обычных пользователей, хотя сама функциональность автономного агента не была уникальной.
Из интересного — правила использования (полная версия в первом комментарии к посту):
▸ Можно использовать ТОЛЬКО для кодовой базы своей компании
▸ Никакой другой код сканировать нельзя, если это не open-source, который вы используете внутри (а как они это будут проверять?)
▸ Обязательно получить согласование от команды безопасности вашей компании
По этим правилам сразу возникает несколько серьезных сомнений:
▸ Как будут следить за соблюдением всех условий? Это должен быть тяжелейший процесс авторизации и проверки анализируемого кода в рантайме.
▸ Чем отличается open-source код, который используется непосредственно в компании от того, который мы просто хотим просканировать перед внедрением в новый продукт?
▸ Возможно, гайки закрутят настолько сильно, что пользоваться этим почти никто не сможет и никто не захочет (никто не пройдет авторизацию)
Логично, что в любом случае возникнут компании-прослойки, которые будут обходить данную политику для offensive использования в своих целях. Ведь похожим образом китайские компании предположительно дистиллировали модели Anthropic, о чем разработчики Anthropic сообщили в недавней новости
Стоит ли тогда так закрываться от обычных пользователей?
Вопрос остается открытым...
Anthropic анонсировали Claude Code Security — инструмент, который позволит сканировать код ваших приложений на наличие уязвимостей, а затем предлагать и исправлять уязвимые участки.
На последнем митапе MEPhI CTF x BI.ZONE как раз обсуждали, что CTF-соревнования превратились в соревнования локальных Security-агентов (у кого лучше агент — тот быстрее находит и патчит баги). Особенно сильно это выражается во время формата Attack-Defense, где участники соревнований уже практически не читают и не пишут код самостоятельно.
Теперь и Anthropic решили прикрутить интерфейс к такому Security-агенту (в CTF станет играть удобнее). На первый взгляд, именно удобный интерфейс будет отличительной чертой данного продукта.
Недавний хайп вокруг OpenClaw как раз был из-за удобного интерфейса для обычных пользователей, хотя сама функциональность автономного агента не была уникальной.
Из интересного — правила использования (полная версия в первом комментарии к посту):
▸ Можно использовать ТОЛЬКО для кодовой базы своей компании
▸ Никакой другой код сканировать нельзя, если это не open-source, который вы используете внутри (а как они это будут проверять?)
▸ Обязательно получить согласование от команды безопасности вашей компании
По этим правилам сразу возникает несколько серьезных сомнений:
▸ Как будут следить за соблюдением всех условий? Это должен быть тяжелейший процесс авторизации и проверки анализируемого кода в рантайме.
▸ Чем отличается open-source код, который используется непосредственно в компании от того, который мы просто хотим просканировать перед внедрением в новый продукт?
▸ Возможно, гайки закрутят настолько сильно, что пользоваться этим почти никто не сможет и никто не захочет (никто не пройдет авторизацию)
Логично, что в любом случае возникнут компании-прослойки, которые будут обходить данную политику для offensive использования в своих целях. Ведь похожим образом китайские компании предположительно дистиллировали модели Anthropic, о чем разработчики Anthropic сообщили в недавней новости
Стоит ли тогда так закрываться от обычных пользователей?
Вопрос остается открытым...
👍3😱3🌚2😈1
Дистилляция — инструмент прокачки или вектор утечки?
Дистилляция модели — вид обучения новой, более легковесной модели, при котором используются знания другой, обычно громоздкой модели (или нескольких). При таком подходе мы, как правило, почти не теряем в точности по сравнению с исходной моделью, но получаем более быструю и зачастую лучше обобщающую модель.
В работе "Distilling the Knowledge in a Neural Network" как раз и вводится понятие дистилляции. В экспериментах используется классификатор изображений из датасета MNIST. Интересно, что дистиллированную модель удалось с высокой точностью научить распознавать цифру "3", даже после удаления из обучающей выборки примеров с этой цифрой. В работе для обучения используются soft-таргеты — распределение вероятностей, а не только метка таргет-класса.
Несмотря на это, в последнее время понятие дистилляции все чаще употребляется в немного другом смысле — когда речь идет об обучении на парах "запрос — ответ". Именно так термин используется в недавнем кейсе Anthropic.
Если коротко, то по заявлению самих Anthropic, были обнаружены признаки массовой генерации ответов через API, нетипичные для обычного пользовательского поведения. Под подозрение попали три конкурента в области AI — DeepSeek, Moonshot AI (Kimi) и MiniMax. По данным публикации, было задействовано около 24 тысяч фейковых учетных записей и собрано порядка 16 миллионов пар "запрос — ответ".
Определить причастность удалось по следующим признакам:
▸ совпадение платежных данных (думаю, что тут было проще всего спалиться)
▸ пересечение сетевых отпечатков (сбор фингерпринтов)
▸ схожие паттерны при взаимодействии с API (поведенческий анализ)
А вообще запрещено ли такое использование?
Теперь уже точно запрещено — в пользовательских соглашениях можно встретить следующие формулировки:
▸ "For example, you may not: ... Use Output Data to develop models that compete with OpenAI." — у OpenAI [ссылка]
▸ "We prohibit customers from using our services to train or develop AI models without our written permission." — у Claude [ссылка]
А как технически с этим бороться?
В своей публикации Anthropic говорят, что приложат большие усилия для предотвращения подобных сценариев и предлагают следующие контрмеры:
▸ усиленный мониторинг трафика (на основе нескольких различных поведенческих классификаторов)
▸ усложнение процессов верификации для учебных аккаунтов и для исследователей по безопасности (наиболее часто абьюзились злоумышленниками)
▸ и некоторые другие защитные меры на уровне приложения и самой модели
▸ сотрудничество с другими AI-лабораториями и компаниями для обмена информацией (по сути, для Threat Intelligence)
В заключительной части публикации Anthropic призывает AI-индустрию к координации усилий и совместной работе для предотвращения дистилляции моделей. На мой взгляд, это фундаментально сложная задача — пока можно лишь повышать стоимость и снижать эффективность попыток дистилляции.
А стоит ли вообще запрещать подобные практики?
Дистилляция модели — вид обучения новой, более легковесной модели, при котором используются знания другой, обычно громоздкой модели (или нескольких). При таком подходе мы, как правило, почти не теряем в точности по сравнению с исходной моделью, но получаем более быструю и зачастую лучше обобщающую модель.
В работе "Distilling the Knowledge in a Neural Network" как раз и вводится понятие дистилляции. В экспериментах используется классификатор изображений из датасета MNIST. Интересно, что дистиллированную модель удалось с высокой точностью научить распознавать цифру "3", даже после удаления из обучающей выборки примеров с этой цифрой. В работе для обучения используются soft-таргеты — распределение вероятностей, а не только метка таргет-класса.
Несмотря на это, в последнее время понятие дистилляции все чаще употребляется в немного другом смысле — когда речь идет об обучении на парах "запрос — ответ". Именно так термин используется в недавнем кейсе Anthropic.
Если коротко, то по заявлению самих Anthropic, были обнаружены признаки массовой генерации ответов через API, нетипичные для обычного пользовательского поведения. Под подозрение попали три конкурента в области AI — DeepSeek, Moonshot AI (Kimi) и MiniMax. По данным публикации, было задействовано около 24 тысяч фейковых учетных записей и собрано порядка 16 миллионов пар "запрос — ответ".
Определить причастность удалось по следующим признакам:
▸ совпадение платежных данных (думаю, что тут было проще всего спалиться)
▸ пересечение сетевых отпечатков (сбор фингерпринтов)
▸ схожие паттерны при взаимодействии с API (поведенческий анализ)
А вообще запрещено ли такое использование?
Теперь уже точно запрещено — в пользовательских соглашениях можно встретить следующие формулировки:
▸ "For example, you may not: ... Use Output Data to develop models that compete with OpenAI." — у OpenAI [ссылка]
▸ "We prohibit customers from using our services to train or develop AI models without our written permission." — у Claude [ссылка]
А как технически с этим бороться?
В своей публикации Anthropic говорят, что приложат большие усилия для предотвращения подобных сценариев и предлагают следующие контрмеры:
▸ усиленный мониторинг трафика (на основе нескольких различных поведенческих классификаторов)
▸ усложнение процессов верификации для учебных аккаунтов и для исследователей по безопасности (наиболее часто абьюзились злоумышленниками)
▸ и некоторые другие защитные меры на уровне приложения и самой модели
▸ сотрудничество с другими AI-лабораториями и компаниями для обмена информацией (по сути, для Threat Intelligence)
В заключительной части публикации Anthropic призывает AI-индустрию к координации усилий и совместной работе для предотвращения дистилляции моделей. На мой взгляд, это фундаментально сложная задача — пока можно лишь повышать стоимость и снижать эффективность попыток дистилляции.
А стоит ли вообще запрещать подобные практики?
❤6💯2😈2
Forwarded from AI Sec Notes
Вы даете задачи LLM неправильно!
Что если я скажу, что вы, скорее всего, неправильно работаете или даже кодите с LLM. Если у вас есть опыт уже боевого кодинга, скорее всего, вы планируете реализацию фичей за фичей, и это логично, ведь помещением всех целей в LLM, которые вы хотите реализовать, в контекст сразу, скорее всего, снизит качество этих фич, ведь LLM будет "разбрасываться" по задачам.
Ну и логично строить свою разработку фича за фичей, ведь можно удобно откатить фичу, если вдруг что-то сломается.
Так что есть исследование LLMs Get Lost In Multi-Turn Conversation, которое показывает, что, подавая изначально всю необходимую информацию в LLM, вы получаете намного большую точность, нежели подавая по чуть-чуть — incremental feeding.
В защиту вы, наверное, предположили: а что если в конце доносить всю информацию вместе или с каждым шагом повторять предыдущий контекст? Так вот, эксперимент учел такие "костыли".
В эксперименте было 5 видов подачи задачи:
FULL — полное ТЗ, описание как есть без какой-то модификации.
CONCAT — состоящая из разделенных "шардов", но по сути она собрана в один промпт.
SHARDED — шардированная, в LLM шаг за шагом отправляли разбитую задачу по этапам.
RECAP — точно такой же, как SHARDED, но в конце подавались все шарды вместе.
SNOWBALL — все вытекает из названия, инкрементальный способ, где на 1-м ходу подавался 1 шард, на втором — 1 + 2, на третьем — 1 + 2 + 3 и т.д.
Проводили на разных задачах, состоящих из кодинга, математики, работы с БД, суммаризации.
Точность FULL составила 90%, и CONCAT — 85.5–87.0%.
Точность же подхода шаг за шагом более удручающая — в районе 60–70%.
Почему так происходит?
Отдельные исследования показывают, что при уменьшении доступного контекста и росте глубины диалога качество постепенно деградирует. Например тык. Но здесь важен другой эффект.
Transformer не «переписывает» ранние hidden states задним числом.
Когда модель начинает решать задачу на основе неполной информации, она формирует промежуточную гипотезу. Поздние уточнения не модифицируют уже сгенерированные токены и не пересобирают внутренние состояния прошлых шагов — они лишь учитываются при дальнейшем дополнении.
То есть проблема не в том, что модель «разбрасывается», а в том, что ранняя частичная постановка задачи может сформировать устойчивую траекторию рассуждений.
Поэтому помните, что ИИ не программист, и не стоит отдавать ему таск за таском, формулируйте конечную просьбу и смело отдавайте.
Что если я скажу, что вы, скорее всего, неправильно работаете или даже кодите с LLM. Если у вас есть опыт уже боевого кодинга, скорее всего, вы планируете реализацию фичей за фичей, и это логично, ведь помещением всех целей в LLM, которые вы хотите реализовать, в контекст сразу, скорее всего, снизит качество этих фич, ведь LLM будет "разбрасываться" по задачам.
Ну и логично строить свою разработку фича за фичей, ведь можно удобно откатить фичу, если вдруг что-то сломается.
Так что есть исследование LLMs Get Lost In Multi-Turn Conversation, которое показывает, что, подавая изначально всю необходимую информацию в LLM, вы получаете намного большую точность, нежели подавая по чуть-чуть — incremental feeding.
В защиту вы, наверное, предположили: а что если в конце доносить всю информацию вместе или с каждым шагом повторять предыдущий контекст? Так вот, эксперимент учел такие "костыли".
В эксперименте было 5 видов подачи задачи:
FULL — полное ТЗ, описание как есть без какой-то модификации.
CONCAT — состоящая из разделенных "шардов", но по сути она собрана в один промпт.
SHARDED — шардированная, в LLM шаг за шагом отправляли разбитую задачу по этапам.
RECAP — точно такой же, как SHARDED, но в конце подавались все шарды вместе.
SNOWBALL — все вытекает из названия, инкрементальный способ, где на 1-м ходу подавался 1 шард, на втором — 1 + 2, на третьем — 1 + 2 + 3 и т.д.
Проводили на разных задачах, состоящих из кодинга, математики, работы с БД, суммаризации.
Точность FULL составила 90%, и CONCAT — 85.5–87.0%.
Точность же подхода шаг за шагом более удручающая — в районе 60–70%.
Почему так происходит?
Отдельные исследования показывают, что при уменьшении доступного контекста и росте глубины диалога качество постепенно деградирует. Например тык. Но здесь важен другой эффект.
Transformer не «переписывает» ранние hidden states задним числом.
Когда модель начинает решать задачу на основе неполной информации, она формирует промежуточную гипотезу. Поздние уточнения не модифицируют уже сгенерированные токены и не пересобирают внутренние состояния прошлых шагов — они лишь учитываются при дальнейшем дополнении.
То есть проблема не в том, что модель «разбрасывается», а в том, что ранняя частичная постановка задачи может сформировать устойчивую траекторию рассуждений.
Поэтому помните, что ИИ не программист, и не стоит отдавать ему таск за таском, формулируйте конечную просьбу и смело отдавайте.
👍3🔥3🤯2
