Forwarded from e/acc
Media is too big
VIEW IN TELEGRAM
Я спарсил все скилы с гитхаба, кластеризировал и прогнал по эвалам.
Результаты:
- 1 из 3 скилов делает задачу хуже, чем без скила
- звездочки вообще не показатель
- чем хуже модель, тем полезнее скилы
Результаты:
- 1 из 3 скилов делает задачу хуже, чем без скила
- звездочки вообще не показатель
- чем хуже модель, тем полезнее скилы
Forwarded from Хабр / ML & AI
Окупается ли мультиагентность и можно ли автоматически выбрать паттерн под задачу?
Я прогнал шесть мультиагентных паттернов на трёх бенчмарках и трёх моделях. Под командой агентов тут понимаются связки вроде критика-актора или оркестратора с подчинёнными. Почти везде такая команда проиграла одиночному агенту. Проиграла и по точности, и по цене, а по цене иногда вчетверо.
Это была бы скучная заметка в духе «МАС не нужен, расходимся». Но нашлось исключение. Чем труднее задача для модели, тем больше у команды появляется шанс на выигрыш. Так что вопросов у меня два. Влияет ли вообще топология системы на результат? И если влияет, можно ли автоматически выбирать подходящий паттерн под конкретную задачу? Ответ на второй вопрос пока отрицательный, и самое любопытное здесь именно почему.
Примеры я показываю на мультиагентном фреймворке FEDOT.MAS, а весь код экспериментов с паттернами, прогонами и графиками лежит в репозитории. Я меряю инструмент, который сам и пишу. Но и выводы выйдут в основном не в пользу мультиагентности, так что это скорее самокритика, чем реклама. Читать далее
#python #искусственный_интеллект #агенты #llm #ии_агенты | @habr_ai
Я прогнал шесть мультиагентных паттернов на трёх бенчмарках и трёх моделях. Под командой агентов тут понимаются связки вроде критика-актора или оркестратора с подчинёнными. Почти везде такая команда проиграла одиночному агенту. Проиграла и по точности, и по цене, а по цене иногда вчетверо.
Это была бы скучная заметка в духе «МАС не нужен, расходимся». Но нашлось исключение. Чем труднее задача для модели, тем больше у команды появляется шанс на выигрыш. Так что вопросов у меня два. Влияет ли вообще топология системы на результат? И если влияет, можно ли автоматически выбирать подходящий паттерн под конкретную задачу? Ответ на второй вопрос пока отрицательный, и самое любопытное здесь именно почему.
Примеры я показываю на мультиагентном фреймворке FEDOT.MAS, а весь код экспериментов с паттернами, прогонами и графиками лежит в репозитории. Я меряю инструмент, который сам и пишу. Но и выводы выйдут в основном не в пользу мультиагентности, так что это скорее самокритика, чем реклама. Читать далее
#python #искусственный_интеллект #агенты #llm #ии_агенты | @habr_ai
❤1
Отчет "Безопасность ИИ в России: практика, риски, зрелость"
https://k2tech.io/2dn
https://k2tech.io/2dn
Forwarded from The Engine Room
The Engine Room
GAS-Leak-LLM: Алгоритм для black-box jailbreak атак
Автоматическая оптимизация подбора суффиксов как способ проверки устойчивости LLM
GAS (Genetic Algorithm-Based Suffix) Leak LLM - black-box атака на LLM, где подбор суффиксов происходит автоматически
Незаметка
#ai #cybersecurity #gas #aisecurity #незаметки
The Engine Room👾
Незаметка
#ai #cybersecurity #gas #aisecurity #незаметки
The Engine Room
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from AI SecOps
Банк России опубликовал методические рекомендации, которые помогут финансовым организациям обеспечить информационную безопасность при использовании технологий искусственного интеллекта (ИИ). https://www.cbr.ru/press/event/?id=32627
www.cbr.ru
Банк России дал рекомендации по безопасному использованию искусственного интеллекта в финансовой сфере | Банк России
❤3🔥2
Forwarded from Machinelearning
Qwen-Robot Suite — набор из 3 моделей для воплощённого интеллекта, который нацелен заполнить пробел между пониманием визуально-языковых моделей и физическим действием.
Модели RobotNav, RobotManip и RobotWorld отвечают соответственно за навигацию, манипуляцию и моделирование физического мира.
Построена на Qwen3-VL и объединяет в одной модели 5 навигационных задач: следование инструкциям, поиск объекта, слежение за целью, автономное вождение и ответы на вопросы о среде.
Поведение задаётся через протокол наблюдения с 4 параметрами - бюджет визуальных токенов, временное затухание, веса камер и режим выборки кадров.
Qwen заявляет о рекордных результатах в 5 областях и о работе без дообучения на четвероногом Unitree Go2.
Опирается на Qwen3.5-4B VL и модуль формирования действий на базе flow-matching DiT. Она использует единое 80-мерное представление состояния и действия для разных типов роботов.
Разработчики сообщают о точности 91,4% в тесте LIBERO-Plus и о 1 месте в одном из треков конкурса RoboChallenge.
Модель мира. По текущему наблюдению и текстовой команде она предсказывает, как изменится сцена. Все действия описываются естественным языком, что позволяет объединить в одной системе более 20 типов роботов и свыше 500 категорий действий.
В основе лежит 60-слойная архитектура MMDiT, связанная с представлениями Qwen2.5-VL.
Qwen рапортует о первых местах в тестах на соответствие физическим законам (EWMBench, WorldModelBench и других), в части из них - среди открытых моделей.
Это браузерное демо управления текстовыми командами и наблюдением за реакцией робота в реальном времени.
Сейчас оно работает только с упрощённой версией модели RobotManip, которая была обучена на наборе из 50 задач. Её цель - показать частичную способность выполнять незнакомые инструкции.
В анонсе не указано, будут ли открыты ли веса и под какой лицензией. Пока доступны технические отчёты и анонсы по каждой модели.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from AISecHub
The New SDLC With Vibe Coding - https://drive.google.com/file/d/1wNEl8FMpTso8aXlb_joxgzparxi-0ciM/view
Forwarded from Data Blog
Привет, друзья!
Я решила вернуться красиво и напекла новый туториал. Какое-то количество постов назад писала о библиотеках для interventions и начала делать материалы, чтобы можно было "вкатиться" в них на практике. В туториале описан Activation Steering — это inference-time интервенция: мы не трогаем веса модели, а вмешиваемся в поток вычислений «на лету», пока трансформер генерирует.
В туториале описаны три способа реализовать это вмешательство: PyTorch hooks и две библиотеки nnsight, pyvene.
Попутно разобрана вся теория. А именно:
• Метод CAA (Contrastive Activation Addition) — откуда вообще берётся steering vector;
• Почему residual stream и почему последний токен
• Странные термины: failure modes: prompt leakage, oversteering, layer mismatch, concept entanglement
• PCA-диагностика: видим ли мы разделение классов в латентном пространстве вообще?
Модель — GPT-2, запускается везде, коллаб тоже сделан.
🐑 [ссылка на ноутбук]
🐑 [ссылка на Хабр]
Я решила вернуться красиво и напекла новый туториал. Какое-то количество постов назад писала о библиотеках для interventions и начала делать материалы, чтобы можно было "вкатиться" в них на практике. В туториале описан Activation Steering — это inference-time интервенция: мы не трогаем веса модели, а вмешиваемся в поток вычислений «на лету», пока трансформер генерирует.
Базовая идея:
h⁽ˡ⁾ ← h⁽ˡ⁾ + α · v̂
Вектор v̂ кодирует нужное направление, α — сила вмешательства.
В туториале описаны три способа реализовать это вмешательство: PyTorch hooks и две библиотеки nnsight, pyvene.
Попутно разобрана вся теория. А именно:
• Метод CAA (Contrastive Activation Addition) — откуда вообще берётся steering vector;
• Почему residual stream и почему последний токен
• Странные термины: failure modes: prompt leakage, oversteering, layer mismatch, concept entanglement
• PCA-диагностика: видим ли мы разделение классов в латентном пространстве вообще?
Модель — GPT-2, запускается везде, коллаб тоже сделан.
🐑 [ссылка на ноутбук]
🐑 [ссылка на Хабр]
Forwarded from Data Blog
Привет, друзья!
Хоть в CTF я и профан, занудная любовь к такому формату у меня есть и вряд ли когда-нибудь пройдет. Играть и что-нибудь захватывать любят, кажется, все — независимо от возраста, профессии и должности. Со временем меняется только формат)
И пока у меня самой не хватает времени на новые курсы (хотя осенью у меня будет целый предмет в ВШЭ (с открытой репой, надеюсь), но об этом расскажу, как только переживу лето), мои товарищи выпустили курс «AI Security: практикум по безопасности ИИ-приложений».
Курс — очень вводный (с нуля), очень классный и очень покрывающий тему безопасности AI-систем. Он построен вокруг (как раз) практических CTF-заданий и если вы не любите как-то долго читать теорию, и хотите учиться на практике — то, что нужно.
В курсе покрыты:
• Prompt Injection, jailbreak-техники (разница — есть!) и обход системных инструкций
• Разные ракурсы для вас, как для атакующего — Indirect Prompt Injection через документы, почту и веб-контент, а также атаки на агентные системы и отравление RAG
• Подходы к защите — от простых фильтров до архитектурных решений — потому что все мы за добро доброе
Курс не требует навыков программирования, поэтому подойдет как если вы хотите отдохнуть после работы в IDE, так и если вы в ней не работаете.
Есть демо-доступ.
Ссылка на курс (и я попросила нам персональный промокод, потому что мы с вами уже большие товарищи) со скидкой: здесь.
Тем же временем я в режиме "сечас-все-будет" дописываю ещё пару туториалов, так что тоже скоро зашерю. А вообще — почти первый день лета, и всем желаю, чтобы у вас был запланировало чилл-окно в эти несколько месяцев! 🗿
Хоть в CTF я и профан, занудная любовь к такому формату у меня есть и вряд ли когда-нибудь пройдет. Играть и что-нибудь захватывать любят, кажется, все — независимо от возраста, профессии и должности. Со временем меняется только формат)
И пока у меня самой не хватает времени на новые курсы (хотя осенью у меня будет целый предмет в ВШЭ (с открытой репой, надеюсь), но об этом расскажу, как только переживу лето), мои товарищи выпустили курс «AI Security: практикум по безопасности ИИ-приложений».
Курс — очень вводный (с нуля), очень классный и очень покрывающий тему безопасности AI-систем. Он построен вокруг (как раз) практических CTF-заданий и если вы не любите как-то долго читать теорию, и хотите учиться на практике — то, что нужно.
В курсе покрыты:
• Prompt Injection, jailbreak-техники (разница — есть!) и обход системных инструкций
• Разные ракурсы для вас, как для атакующего — Indirect Prompt Injection через документы, почту и веб-контент, а также атаки на агентные системы и отравление RAG
• Подходы к защите — от простых фильтров до архитектурных решений — потому что все мы за добро доброе
Курс не требует навыков программирования, поэтому подойдет как если вы хотите отдохнуть после работы в IDE, так и если вы в ней не работаете.
Есть демо-доступ.
Ссылка на курс (и я попросила нам персональный промокод, потому что мы с вами уже большие товарищи) со скидкой: здесь.
Тем же временем я в режиме "сечас-все-будет" дописываю ещё пару туториалов, так что тоже скоро зашерю. А вообще — почти первый день лета, и всем желаю, чтобы у вас был запланировало чилл-окно в эти несколько месяцев! 🗿
OpenAI разработала метод прогнозирования ошибок ИИ до его релиза
Компания опубликовала методику Deployment Simulation для тестирования безопасности LLM. Подход оценивает поведение моделей в условиях, имитирующих продакшен.
Вместо синтетических промптов новой модели передают анонимизированную историю диалогов пользователей с предыдущими версиями ИИ и запрашивают генерацию следующего ответа. В такой среде метрика распознавания тестирования снижается со 100% до 5,4%. При проверке задач с вызовом функций используется вспомогательная модель, имитирующую ответы окружения.
По тестам, Deployment Simulation предсказывает генерацию запрещенного контента или обман в 92% случаев против 54% у классических бенчмарков. При тестировании серии GPT-5 выяснилось, что GPT-5.1 использовала браузер в качестве калькулятора, рапортуя пользователю о выполнении веб-поиска.
Метод применим для независимого аудита сторонних моделей на базе открытых датасетов диалогов, без доступа к внутренним логам разработчика.
Источник: https://t.me/ai_machinelearning_big_data/10351
Компания опубликовала методику Deployment Simulation для тестирования безопасности LLM. Подход оценивает поведение моделей в условиях, имитирующих продакшен.
Вместо синтетических промптов новой модели передают анонимизированную историю диалогов пользователей с предыдущими версиями ИИ и запрашивают генерацию следующего ответа. В такой среде метрика распознавания тестирования снижается со 100% до 5,4%. При проверке задач с вызовом функций используется вспомогательная модель, имитирующую ответы окружения.
По тестам, Deployment Simulation предсказывает генерацию запрещенного контента или обман в 92% случаев против 54% у классических бенчмарков. При тестировании серии GPT-5 выяснилось, что GPT-5.1 использовала браузер в качестве калькулятора, рапортуя пользователю о выполнении веб-поиска.
Метод применим для независимого аудита сторонних моделей на базе открытых датасетов диалогов, без доступа к внутренним логам разработчика.
Источник: https://t.me/ai_machinelearning_big_data/10351
Telegram
Machinelearning
✔️ OpenAI разработала метод прогнозирования ошибок ИИ до его релиза
Компания опубликовала методику Deployment Simulation для тестирования безопасности LLM. Подход оценивает поведение моделей в условиях, имитирующих продакшен.
Вместо синтетических промптов…
Компания опубликовала методику Deployment Simulation для тестирования безопасности LLM. Подход оценивает поведение моделей в условиях, имитирующих продакшен.
Вместо синтетических промптов…
Forwarded from CodeCamp
А вот это уже страшно: Пентагон использовал Grok Илона Маска для запуска 2000 ракет по Ирану.🚬
Об этом глава ИИ-направления Пентагона официально заявил под присягой, чтобы спасти Маска от иска из-за… загрязнения от его ЦОДов. В правительстве сообщили, что продолжение работыМехагитлера чат-бота является «вопросом первостепенной национальной безопасности».
💀 💀 💀
Об этом глава ИИ-направления Пентагона официально заявил под присягой, чтобы спасти Маска от иска из-за… загрязнения от его ЦОДов. В правительстве сообщили, что продолжение работы
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Machinelearning
Инициатива по выдаче цифровых ID автономным агентам в рамках расширения программы e-residency, одобренная премьер-министром страны, определяет правовой статус алгоритмов при выполнении задач от лица компаний, госучреждений и граждан.
Статус позволит ИИ легально работать с базами данных в режиме чтения, готовить документы и управлять финансами в пределах заданных лимитов. Права доступа настраиваются самим владельцем агента, но каждое действие ИИ будет записываться в аудируемый лог.
Эстония уже внедряет LLM в госсектор и школы совместно с OpenAI. Премьер-министр тестирует инструменты разработки лично, недавно он навайбкодил с помощью Claude дашборд для отслеживания приоритетов кабинета министров.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from overbafer1
Энтузиаст скрафтил CrankGPT — небольшую коробку с локальной нейронкой, которой не нужен ни интернет, ни облако, ни розетка.
Хочешь спросить ИИ, крути ручку, вырабатывай электричество и жди, пока чатбот ответит.
⚙️ Внутри стоит Raspberry Pi 5 с 8 ГБ памяти, локальная LLM, распознавание речи и озвучка ответов. Среди поддерживаемых моделей — Gemma 3 на 1 млрд параметров. Не GPT-5 конечно, но для коробки, которая работает от человеческой тяги, уже неплохо.
После нескольких секунд кручения, модель запускается, слушает вопрос и выдаёт ответ прямо на устройстве.
Теперь после апокалипсиса можно крутить CrankGPT, чтобы нейронка объяснила, почему человечество всё-таки доигралось
@overbafer1
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Machinelearning
Вслед за недавними размышлениями об эволюции AGI в ASI, исследовательское подразделение Google представила внутренний регламент контроля высокоразвитых ИИ-агентов.
Помимо привычного элайнмента модели, DeepMind добавляет отдельный слой системного контроля, пересобирая защиту исходя из худшего сценария.
За вводную берётся то, что система изначально враждебна, имеет скрытые цели и тайно работает против разработчиков.
Для систематизации таких угроз взяли за основу популярный фреймворк MITRE ATT&CK и создали на его базе TRAIT&R, новую таксономию тактик и методов обхода защиты.
Она учитывает специфику ИИ и описывает векторы атак, недоступные людям: от незаметного саботажа научных исследований и внедрения бэкдоров до распределенных цепочек взлома, когда фрагменты вредоносного плана синхронно выполняются сотнями разных инстансов одного агента.
Защита выстроена по принципу эскалации и делится на уровни D1–D4 для систем обнаружения и R1–R3 для механизмов реагирования.
На базовых этапах безопасность обеспечивается анализом CoT агента в песочницах под присмотром более слабых, но надежных ИИ-супервизоров.
По мере развития способностей модели начинают понимать факт слежки и учатся скрывать ход своих мыслей.
Для контроля над такими системами (это уровень D4/R3) традиционные методы больше не работают.
На этом этапе DeepMind планирует применят более затратные меры, вплоть до проверки внутренних состояний модели, использования изолированных копий самой недоверенной системы для аудита и инфраструктуры экстренной остановки агентов и запущенных ими процессов.
Вместе с новой стратегией опубликован отдельный документ для индустрии о том, как сделать агентов безопасными по мере их распространения, и он разбит на 3 уровня:
Как защитить одну систему от утечек данных, чужих манипуляций и от собственных ошибочных действий, и зачем для этого нужны общие стандарты.
Каскадные сбои, негласный сговор алгоритмов, ситуации, где за вред никто конкретно не отвечает, и атаки, рассчитанные сразу на сеть агентов.
Как помочь защитникам сохранить преимущество перед злоумышленниками (автоматический поиск и устранение уязвимостей, обмен сигналами об угрозах, обучение специалистов).
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1🫡1