2308.03825v2.pdf
2.5 MB
“Do Anything Now”: Characterizing and Evaluating In-The-Wild
Jailbreak Prompts on Large Language Models
Jailbreak Prompts on Large Language Models
https://crfm.stanford.edu/2024/11/08/helm-safety.html
HELM Safety: Towards Standardized Safety Evaluations of Language Models
HELM Safety: Towards Standardized Safety Evaluations of Language Models
Forwarded from Двач
Бизнес-слоп, наконец-то: реддитор рассказал, как его компания начала использовать ИИ, чтобы следить за показателями бизнеса и делать отчёты для начальства.
Поначалу всё выглядело шикарно — нейронка быстро выдавала данные о том, что фирма уверенно растёт и приносит отличную прибыль. Руководство поверило в эту инфу, начало на её основе менять стратегию продаж и готовить доклады для совета директоров.
Но позже выяснилось, что ИИ всё это выдумал. Модель просто рисовала красивые графики и генерировала цифры с потолка, которых в реальности не существовало. Но подавалось это так уверенно, что никто не сомневался.
Самое смешное, что разработчик заранее предупреждал — данные надо проверять вручную. Но тогда начальство ему ответило, что он просто мешает инновациям.
Поначалу всё выглядело шикарно — нейронка быстро выдавала данные о том, что фирма уверенно растёт и приносит отличную прибыль. Руководство поверило в эту инфу, начало на её основе менять стратегию продаж и готовить доклады для совета директоров.
Но позже выяснилось, что ИИ всё это выдумал. Модель просто рисовала красивые графики и генерировала цифры с потолка, которых в реальности не существовало. Но подавалось это так уверенно, что никто не сомневался.
Самое смешное, что разработчик заранее предупреждал — данные надо проверять вручную. Но тогда начальство ему ответило, что он просто мешает инновациям.
🤣2
Известия_ответы_на_вопросы_про_кражу_ии_профилей.docx
25.9 KB
Я не люблю вести каналы и блоги.
обычно моя тусовка это одни и те же технари,
мы обсуждаем, как рыбачили, а потом, как тестровали RAG c помощью кроссэнкодера.
И статьи я писать не люблю, потому что иногда пишу очень много на короткие вопросы,
потому что тема цепляет, а иногда удивляюсь с вопросов, например, не знала у apple есть
проблемы с внедрением ИИ.Ну, и пошли они в жопу)
буду кидать сюда черновики своих статей,
конечно, я использовала ИИ, даже с ИИ написать статью до сих пор пару часов.
как будет статья в самих Известиях я узнаю позже,
но обычно ее сильно не переписывают,
но рекламные интеграции, куда без них?:)
————————————————————————-
Прилетел запрос от Известий.
Охота киберпреступников за личными ИИ-профилями: мнения экспертов
Разработчики средств защиты зафиксировали новый этап в развитии вредоносных программ для кражи данных — теперь под удар попадают не только пароли и куки браузеров, но и конфигурации персональных ИИ-агентов. В одном из недавних инцидентов похититель информации сумел выгрузить рабочее окружение агента OpenClaw вместе с ключевыми служебными файлами и токенами доступа. О находке сообщили специалисты компании Hudson Rock.
Подробности здесь: https://www.securitylab.ru/news/569452.php
Необходимы письменные комментарии экспертов, которые ответят на следующие вопросы:
1. Чем личные ИИ-профили интересны киберпреступникам?
2. Какие схемы с их кражей фиксировались ранее?
3. Как будет меняться ситуация с кражей ИИ-профилей в 2026 году?
4. Против кого направлены и чем опасны подобные киберпреступления?
5. Как защититься от них?
обычно моя тусовка это одни и те же технари,
мы обсуждаем, как рыбачили, а потом, как тестровали RAG c помощью кроссэнкодера.
И статьи я писать не люблю, потому что иногда пишу очень много на короткие вопросы,
потому что тема цепляет, а иногда удивляюсь с вопросов, например, не знала у apple есть
проблемы с внедрением ИИ.
буду кидать сюда черновики своих статей,
конечно, я использовала ИИ, даже с ИИ написать статью до сих пор пару часов.
как будет статья в самих Известиях я узнаю позже,
но обычно ее сильно не переписывают,
но рекламные интеграции, куда без них?:)
————————————————————————-
Прилетел запрос от Известий.
Охота киберпреступников за личными ИИ-профилями: мнения экспертов
Разработчики средств защиты зафиксировали новый этап в развитии вредоносных программ для кражи данных — теперь под удар попадают не только пароли и куки браузеров, но и конфигурации персональных ИИ-агентов. В одном из недавних инцидентов похититель информации сумел выгрузить рабочее окружение агента OpenClaw вместе с ключевыми служебными файлами и токенами доступа. О находке сообщили специалисты компании Hudson Rock.
Подробности здесь: https://www.securitylab.ru/news/569452.php
Необходимы письменные комментарии экспертов, которые ответят на следующие вопросы:
1. Чем личные ИИ-профили интересны киберпреступникам?
2. Какие схемы с их кражей фиксировались ранее?
3. Как будет меняться ситуация с кражей ИИ-профилей в 2026 году?
4. Против кого направлены и чем опасны подобные киберпреступления?
5. Как защититься от них?
❤1
Человеческий подход предполагает творчество, адаптацию к нестандартным ситуациям и анализ контекста, автоматизированный — скорость, масштаб и повторяемость атак, отмечает менеджер продукта группы развития ML-технологий ГК «Солар» Полина Сокол.
«Уже сегодня ИИ может генерировать код для эксплойтов, анализируя огромные массивы данных (включая открытый код в интернете), но качество такого кода часто оставляет желать лучшего. Он может быть грязным, избыточным или содержать ошибки. Человеку-разработчику приходится тратить время на доработку такого кода, чтобы он стал безопасным и эффективным. На российском рынке уже есть решения, которые могут анализировать коды на безопасность. Например, это Solar Appscreener, который обеспечивает комплексную безопасность разработки приложений благодаря технологиям статического, динамического анализа, анализа состава и цепочки поставок ПО (SAST, DAST, OSA). ИИ может предложить множество вариантов атак или обхода защиты, но для создания действительно сложных, точечных эксплойтов требуется экспертное участие», — говорит она. В будущем ИИ сможет автоматизировать поиск и эксплуатацию уязвимостей, но полная замена человека маловероятна, считает Полина Сокол.
https://kiberboloid.ru/trendi/ii-vs-pentester-mozhet-li-mashina-zamenit-cheloveka/
«Уже сегодня ИИ может генерировать код для эксплойтов, анализируя огромные массивы данных (включая открытый код в интернете), но качество такого кода часто оставляет желать лучшего. Он может быть грязным, избыточным или содержать ошибки. Человеку-разработчику приходится тратить время на доработку такого кода, чтобы он стал безопасным и эффективным. На российском рынке уже есть решения, которые могут анализировать коды на безопасность. Например, это Solar Appscreener, который обеспечивает комплексную безопасность разработки приложений благодаря технологиям статического, динамического анализа, анализа состава и цепочки поставок ПО (SAST, DAST, OSA). ИИ может предложить множество вариантов атак или обхода защиты, но для создания действительно сложных, точечных эксплойтов требуется экспертное участие», — говорит она. В будущем ИИ сможет автоматизировать поиск и эксплуатацию уязвимостей, но полная замена человека маловероятна, считает Полина Сокол.
https://kiberboloid.ru/trendi/ii-vs-pentester-mozhet-li-mashina-zamenit-cheloveka/
Это статья не по теме моего канала, как неправильно сообщество DS
интерпретирует разные размышления
https://habr.com/ru/articles/454482/
интерпретирует разные размышления
https://habr.com/ru/articles/454482/
Forwarded from Типичный программист
Причиной падения AWS в декабре оказался ИИ-ассистент
Помните сбои AWS в декабре 2025? Financial Times выяснил: во всём виноваты их же ИИ-инструменты. Самый яркий случай — середина месяца, когда инженеры дали ИИ-агенту Kiro (их кодер на базе ИИ) починить систему анализа расходов клиентов. Kiro решил радикально: удалил всю среду и пересоздал с нуля. Итог — 13-часовой downtime сервиса в Китае.
Это уже второй инцидент за месяц с их ИИ: первый с Amazon Q Developer тоже дал сбой, хоть и не затронул клиентов напрямую. Amazon винит людей — "ошибка инженеров, не ИИ", инциденты "краткие и локальные", но сотрудники говорят обратное: автономные агенты берут на себя действия без надзора, и риски растут.
Подробности в статье.
@tproger
Читайте также в VK, Max и Дзен
Помните сбои AWS в декабре 2025? Financial Times выяснил: во всём виноваты их же ИИ-инструменты. Самый яркий случай — середина месяца, когда инженеры дали ИИ-агенту Kiro (их кодер на базе ИИ) починить систему анализа расходов клиентов. Kiro решил радикально: удалил всю среду и пересоздал с нуля. Итог — 13-часовой downtime сервиса в Китае.
Это уже второй инцидент за месяц с их ИИ: первый с Amazon Q Developer тоже дал сбой, хоть и не затронул клиентов напрямую. Amazon винит людей — "ошибка инженеров, не ИИ", инциденты "краткие и локальные", но сотрудники говорят обратное: автономные агенты берут на себя действия без надзора, и риски растут.
Подробности в статье.
@tproger
Читайте также в VK, Max и Дзен
👍1
https://iz.ru/2045829/dmitrii-bulgakov/vse-i-srazu-pochemu-kiberprestupniki-stali-okhotitsia-za-profiliami-ii-pomoshchnikov
Чем профили ИИ-помощников интересны киберпреступникам
По мнению специалистов Hudson Rock, в ближайшее время разработчики ВПО начнут добавлять в свои программы специальные модули для расшифровки и анализа ИИ-инструментов — сегодня так обрабатывают данные браузеров и мессенджеров. Как говорит в беседе с «Известиями» менеджер продукта группы развития ML-технологий ГК «Солар» Полина Сокол, личные профили ИИ-помощников уже стали для хакеров «золотыми ключами» к личностям жертв.
— Люди выгружают ассистентам всё: рабочие проекты, документы, планы и детали семейной жизни, — рассказывает эксперт. — Украсть такой профиль — значит получить готовое досье для социальной инженерии. Преступник копирует стиль общения и бьет точно в цель: от имени жертвы может писать ее близким или войти в корпоративную инфраструктуру, обходя защиту.
Чем профили ИИ-помощников интересны киберпреступникам
По мнению специалистов Hudson Rock, в ближайшее время разработчики ВПО начнут добавлять в свои программы специальные модули для расшифровки и анализа ИИ-инструментов — сегодня так обрабатывают данные браузеров и мессенджеров. Как говорит в беседе с «Известиями» менеджер продукта группы развития ML-технологий ГК «Солар» Полина Сокол, личные профили ИИ-помощников уже стали для хакеров «золотыми ключами» к личностям жертв.
— Люди выгружают ассистентам всё: рабочие проекты, документы, планы и детали семейной жизни, — рассказывает эксперт. — Украсть такой профиль — значит получить готовое досье для социальной инженерии. Преступник копирует стиль общения и бьет точно в цель: от имени жертвы может писать ее близким или войти в корпоративную инфраструктуру, обходя защиту.
Известия
Все и сразу: почему киберпреступники стали охотиться за профилями ИИ-помощников
Новый тренд хакеров грозит утечками больших наборов конфиденциальных данных
известия_ответы_хакеры_ИИ.docx
19 KB
Черновик комментарий для Известий.
1. Усилились ли атаки хакеров с использованием ии? Какие схемы они используют? Какие отрасли наиболее активно так атакуют?
2. Как защититься от таких уловок?
1. Усилились ли атаки хакеров с использованием ии? Какие схемы они используют? Какие отрасли наиболее активно так атакуют?
2. Как защититься от таких уловок?
Как работает ИИ в руках злоумышленников
Самый распространенный сценарий атаки на российские структуры с использованием ИИ — фишинг, когда нейросеть пишет убедительные сообщения от лица руководства, коллег или близких, рассказал Сергей Зыбнев. Сейчас более 80% фишинговых писем составляются при помощи больших языковых моделей (тип программы искусственного интеллекта, которая может распознавать и генерировать текст).
В итоге проводить сложные кибератаки уже могут даже начинающие хакеры, уточнила менеджер продукта группы развития ML-технологий ГК «Солар» Полина Сокол.
— Например, возможно создание дипфейков в режиме реального времени, — сказала она. — Злоумышленники подделывают голос и видео для звонков руководителям или сотрудникам, чтобы авторизовать перевод средств или выдать вредоносное ПО за легитимное обновление. Или хакеры просят ИИ написать не вирус, а отдельные куски кода: к примеру, модуль для скрытого запуска программ, для кражи паролей из браузера или связи с сервером. Из этих легальных фрагментов собирается готовый троян.
Кроме того, хакеры используют автономные ИИ-агенты, которые изучают сеть жертвы, ищут уязвимости и выбирают момент для атаки без участия человека.
— В первую очередь под ударом промышленность, — отметила эксперт. — Далее ритейл и пищевая промышленность, через эти сферы идет большое количество трансакций и персональных данных клиентов. А телеком и СМИ злоумышленники атакуют для перехвата трафика и данных.
Здравоохранение также находится в зоне риска — злоумышленникам нужны данные из карточки пациентов, чтобы шантажировать жертву.
https://iz.ru/2049479/iana-shturma/novyj-kod-hakery-stali-vdvoe-chashche-ispolzovat-ii-dlya-atak
Самый распространенный сценарий атаки на российские структуры с использованием ИИ — фишинг, когда нейросеть пишет убедительные сообщения от лица руководства, коллег или близких, рассказал Сергей Зыбнев. Сейчас более 80% фишинговых писем составляются при помощи больших языковых моделей (тип программы искусственного интеллекта, которая может распознавать и генерировать текст).
В итоге проводить сложные кибератаки уже могут даже начинающие хакеры, уточнила менеджер продукта группы развития ML-технологий ГК «Солар» Полина Сокол.
— Например, возможно создание дипфейков в режиме реального времени, — сказала она. — Злоумышленники подделывают голос и видео для звонков руководителям или сотрудникам, чтобы авторизовать перевод средств или выдать вредоносное ПО за легитимное обновление. Или хакеры просят ИИ написать не вирус, а отдельные куски кода: к примеру, модуль для скрытого запуска программ, для кражи паролей из браузера или связи с сервером. Из этих легальных фрагментов собирается готовый троян.
Кроме того, хакеры используют автономные ИИ-агенты, которые изучают сеть жертвы, ищут уязвимости и выбирают момент для атаки без участия человека.
— В первую очередь под ударом промышленность, — отметила эксперт. — Далее ритейл и пищевая промышленность, через эти сферы идет большое количество трансакций и персональных данных клиентов. А телеком и СМИ злоумышленники атакуют для перехвата трафика и данных.
Здравоохранение также находится в зоне риска — злоумышленникам нужны данные из карточки пациентов, чтобы шантажировать жертву.
https://iz.ru/2049479/iana-shturma/novyj-kod-hakery-stali-vdvoe-chashche-ispolzovat-ii-dlya-atak
Известия
Новый код: хакеры стали вдвое чаще использовать ИИ для атак
Они создают фишинговые письма и дипфейки, а также пишут скрипты для вредоносных программ
👍1