Новое исследование от Anthropic: как сделать так, чтобы все опасные знания хранились в модели отдельно от обычных
И снова про элаймент! Уж очень занятный в этот раз стартап предлагает подход. Называется он Selective GradienT Masking. Погнали разбираться.
Вообще, как такового элаймента на этапе претрейна не существует, все это добавляется уже после предобучения. А это довольно серьезный затык.
Пока единственный вариант, до которого люди додумались – это просто выбросить из датасета "опасные знания", но это (1) оч дорого и долго, потому что требует разметки; (2) отсекает дополнительно и много полезных знаний, и модель тупеет. Так что – ерунда.
А вот Anthropic предлагают сами данные не трогать, а вместо этого сделать так, чтобы вся опасная информация стекалась в отдельный кусок параметров, который затем можно просто... удалить. Работает это так:
Как видите, это, по факту, та же самая фильтрация данных. Только умная. Во-первых, такой подход устойчив к шуму разметки. Во-вторых, метить все данные потенциально необязательно: выяснилось, что начиная с какого-то момента даже неразмеченное опасное содержимое датасета начинает тяготеть больше к "forget" параметрам. Это назвали эффектом Абсорбирования.
При этом модель после вырезания этой вот черной душонки глупеет меньше, чем при вырезании данных из датасета. Все-таки здесь мы действуем немного деликатнее. Ну и ведет она себя после этого так, как будто ей действительно ничего подобного никогда не показывали, а не как будто она временно об этом забыла.
В общем, на уровне механики и идеи – довольно интересный зачаток
https://alignment.anthropic.com/2025/selective-gradient-masking/
И снова про элаймент! Уж очень занятный в этот раз стартап предлагает подход. Называется он Selective GradienT Masking. Погнали разбираться.
Вообще, как такового элаймента на этапе претрейна не существует, все это добавляется уже после предобучения. А это довольно серьезный затык.
Пока единственный вариант, до которого люди додумались – это просто выбросить из датасета "опасные знания", но это (1) оч дорого и долго, потому что требует разметки; (2) отсекает дополнительно и много полезных знаний, и модель тупеет. Так что – ерунда.
А вот Anthropic предлагают сами данные не трогать, а вместо этого сделать так, чтобы вся опасная информация стекалась в отдельный кусок параметров, который затем можно просто... удалить. Работает это так:
– На каждый блок трансформера мы дополнительно надеваем голову внимания, которую помечаем, как "forget" параметры.
– Если на вход попадают данные, которые помечены, как "опасные", мы насильно зануляем все градиенты, кроме "forget". Это гарантирует, что все опасные знания стекаются в определенное место.
– Чтобы после модель могла хорошо работать без этих параметров, на части данных при прямом проходе им зануляют активации.
Как видите, это, по факту, та же самая фильтрация данных. Только умная. Во-первых, такой подход устойчив к шуму разметки. Во-вторых, метить все данные потенциально необязательно: выяснилось, что начиная с какого-то момента даже неразмеченное опасное содержимое датасета начинает тяготеть больше к "forget" параметрам. Это назвали эффектом Абсорбирования.
При этом модель после вырезания этой вот черной душонки глупеет меньше, чем при вырезании данных из датасета. Все-таки здесь мы действуем немного деликатнее. Ну и ведет она себя после этого так, как будто ей действительно ничего подобного никогда не показывали, а не как будто она временно об этом забыла.
В общем, на уровне механики и идеи – довольно интересный зачаток
https://alignment.anthropic.com/2025/selective-gradient-masking/
Проверяем свою приватность в браузере: нашли подборку из 5 сервисов, которые подсветят все утечки приватной информации.
— Browserleaks: подскажет, какие данные ваш браузер раскрывает другим сайтам;
— CreepJS: оценивает, сколько технической информации ваш девайс отдаёт в фоне;
— FingerprintJS: демонстрирует, насколько уникален ваш цифровой отпечаток;
— Cover Your Tracks: быстрый тест, который показывает, насколько легко вас идентифицировать;
— WebBrowserTools: набор простых тестов для оценки приватности и безопасности в браузере.
@exploitex
— Browserleaks: подскажет, какие данные ваш браузер раскрывает другим сайтам;
— CreepJS: оценивает, сколько технической информации ваш девайс отдаёт в фоне;
— FingerprintJS: демонстрирует, насколько уникален ваш цифровой отпечаток;
— Cover Your Tracks: быстрый тест, который показывает, насколько легко вас идентифицировать;
— WebBrowserTools: набор простых тестов для оценки приватности и безопасности в браузере.
@exploitex
Forwarded from Бэкдор
This media is not supported in your browser
VIEW IN TELEGRAM
Рассказываем, чтобы вы были в курсе:
• Внезапно на вашем айфоне может появиться всплывающее окно с просьбой ввода пароля. Да, прямо во время работы.
• НЕ ВВОДИТЕ пароль ни в коем случае! Если введете ваши данные — ХАНА, мошенники сразу заблочат ваш смартфон и потребуют деньги.
• Даже оплата НЕ поможет, скамеры будут доить вас до последнего, а потом превратят айфон в кирпич.
• Постоянно следить за всплывающими окнами и обращать на них внимание. НЕ ВВОДИТЕ пароль без прочтения!
• Если все-таки ввели данные — сразу бегите в Настройки → Смена пароля. Так вы сможете выиграть время у скамеров и спасти айфон.
Предупредите всех.
Please open Telegram to view this post
VIEW IN TELEGRAM
Восстанавливаем удаленный аккаунт в Telegram, узнаем от технологической практики Kept о том, сколько компаний имеют стратегию по ИБ и пользуются Gen AI на встречах. Больше о мире ИБ и ИТ – в канале Kept | Cyber.
🛡️ Защищаемся в Telegram
Если вы вошли с нового устройства, из нетипичного места или массово рассылали сообщения, Telegram может автоматически заблокировать аккаунт или отправить уведомление о подозрительной активности. Восстановить удаленный аккаунт в мессенджере можно, оспорив решение, подтвердив факт несанкционированных входа и действий или зафиксировав всю информацию профиля в облаке, после чего можно будет удалить аккаунт и вернуть свои данные. Причина небольшого количества опций: политика конфиденциальности, защита приватности пользователей и предотвращение злоупотреблений.
Если же злоумышленники использовали социальную инженерию, вы скачали вирусное ПО, или ваши данные утекли, может понадобиться удаление аккаунта без доступа к нему. Например, если есть доступ к номеру телефона и коду подтверждения, который был выслан на него. Подробнее о защите Telegram-аккаунта читайте в комментарии старшего менеджера Группы по оказанию услуг в области кибербезопасности Kept Алексея Водясова для Frank Media.
(Надеемся, вам не понадобится инструкция 🤞)
⚡ Профилактика важнее лечения
В 2026 году компании все так же будут нуждаться в услугах информационной безопасности, но им может стать труднее найти средства в бюджете на это направление. Стоимость защиты при грамотном планировании всегда меньше, чем убытки и затраты на восстановление в случае инцидента.
Без адекватного стратегического планирования по ИБ не удастся сдержать увеличивающийся напор все более усложняющихся атак. Поэтому важно иметь стратегию по ИБ, которая сейчас есть далеко не у всех компаний: CISO в российских компаниях, как правило, не является C-level — членом СД, правления и так далее.
Это база. EDR (Endpoint Detection and Response) и NGFW (Next-Generation Firewall) уже практически стали базовым составом защиты. На рынке сложно найти корпоративное решение, которое выполняло бы функции классического антивируса или stateless файерволла. Для обеспечения конкурентоспособности своих продуктов вендоры должны успевать за функционалом конкурентов, а клиенты не готовы брать отдельные продукты при наличии комплексных решений.
Комментариями для SecPost поделился Марк Гордеев, старший менеджер группы по оказанию услуг в области кибербезопасности компании Kept.
🎤 Дорогу интересными задачам
Елена Первышина, менеджер технологической практики Kept, поделилась статистикой применения ИИ для «Ведомостей»:
Если вы вошли с нового устройства, из нетипичного места или массово рассылали сообщения, Telegram может автоматически заблокировать аккаунт или отправить уведомление о подозрительной активности. Восстановить удаленный аккаунт в мессенджере можно, оспорив решение, подтвердив факт несанкционированных входа и действий или зафиксировав всю информацию профиля в облаке, после чего можно будет удалить аккаунт и вернуть свои данные. Причина небольшого количества опций: политика конфиденциальности, защита приватности пользователей и предотвращение злоупотреблений.
Если же злоумышленники использовали социальную инженерию, вы скачали вирусное ПО, или ваши данные утекли, может понадобиться удаление аккаунта без доступа к нему. Например, если есть доступ к номеру телефона и коду подтверждения, который был выслан на него. Подробнее о защите Telegram-аккаунта читайте в комментарии старшего менеджера Группы по оказанию услуг в области кибербезопасности Kept Алексея Водясова для Frank Media.
В 2026 году компании все так же будут нуждаться в услугах информационной безопасности, но им может стать труднее найти средства в бюджете на это направление. Стоимость защиты при грамотном планировании всегда меньше, чем убытки и затраты на восстановление в случае инцидента.
Без адекватного стратегического планирования по ИБ не удастся сдержать увеличивающийся напор все более усложняющихся атак. Поэтому важно иметь стратегию по ИБ, которая сейчас есть далеко не у всех компаний: CISO в российских компаниях, как правило, не является C-level — членом СД, правления и так далее.
Это база. EDR (Endpoint Detection and Response) и NGFW (Next-Generation Firewall) уже практически стали базовым составом защиты. На рынке сложно найти корпоративное решение, которое выполняло бы функции классического антивируса или stateless файерволла. Для обеспечения конкурентоспособности своих продуктов вендоры должны успевать за функционалом конкурентов, а клиенты не готовы брать отдельные продукты при наличии комплексных решений.
Комментариями для SecPost поделился Марк Гордеев, старший менеджер группы по оказанию услуг в области кибербезопасности компании Kept.
Елена Первышина, менеджер технологической практики Kept, поделилась статистикой применения ИИ для «Ведомостей»:
«75% команд отмечают повышение продуктивности встреч за счет применения решений на базе Gen AI, включая расшифровку встреч и подготовку протоколов, следует из опросов ряда иностранных платформ».
Please open Telegram to view this post
VIEW IN TELEGRAM
Браузерное расширение Urban VPN собирает информацию из переписок с чат-ботами и передаёт маркетинговым агентствам, обратило внимание Koi Security. У компании есть доступ к данным 8 млн человек.
В пользовательском соглашении Urban VPN от июля 2025 года указано, что она анализирует чаты в бесплатной версии и не гарантирует, что «некоторая конфиденциальная информация» не попадает в базы из-за специфики общения с ИИ-моделями
vc.ru/services/2652584
В пользовательском соглашении Urban VPN от июля 2025 года указано, что она анализирует чаты в бесплатной версии и не гарантирует, что «некоторая конфиденциальная информация» не попадает в базы из-за специфики общения с ИИ-моделями
vc.ru/services/2652584
Компания назвала главные тренды вымогателей, утечек и фишинга в 2025 году:
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Хабр Разработка
Почему пароли — это плохо, и как Passkey может это исправить https://u.habr.com/RuMA3
Хабр
Почему пароли — это плохо, и как Passkey может это исправить
Да, именно так. Конечно, появились пароли, когда никакой индустрии информационной безопасности ещё и в планах не было, но это legacy мы тащим за собой уже несколько тысяч лет. Проблема с паролями в...
Фейковые коллеги и приказы Минцифры: анатомия атаки через Telegram
В 13:01 пользователя добавляют в рабочий чат организации, откуда он уволился пять лет назад. Название группы совпадает, на аватарках — реальные фото бывших сотрудников, в обсуждении — профессиональная лексика и вопросы о пенсии. Иллюзия полная. Но уже через сорок минут этот же чат превращается в инструмент жёсткого психологического давления с фейковыми уведомлениями от Госуслуг.
Ни рубля не было украдено, однако кейс демонстрирует опасный тренд: социальная инженерия перешла к сложным сценарным постановкам. Злоумышленники используют детали биографии и страх «выпасть из реестров» как главные рычаги воздействия.
Изучим механику инцидента, чтобы понимать, откуда ждать удар.
В 13:01 пользователя добавляют в рабочий чат организации, откуда он уволился пять лет назад. Название группы совпадает, на аватарках — реальные фото бывших сотрудников, в обсуждении — профессиональная лексика и вопросы о пенсии. Иллюзия полная. Но уже через сорок минут этот же чат превращается в инструмент жёсткого психологического давления с фейковыми уведомлениями от Госуслуг.
Ни рубля не было украдено, однако кейс демонстрирует опасный тренд: социальная инженерия перешла к сложным сценарным постановкам. Злоумышленники используют детали биографии и страх «выпасть из реестров» как главные рычаги воздействия.
Изучим механику инцидента, чтобы понимать, откуда ждать удар.
Эксперты «Лаборатории Касперского» (под псевдонимами) написали роман «Вирьё моё! Хроники невидимых хакерских войн от Сыктывкара до Сингапура».
История всей российской ИБ-индустрии в этом романе отражается в биографии профессионального аналитика киберугроз.
Как эту историю оценивает сам Евгений Касперский:
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
Passkeys. You can create a passkey on your device to instantly log in to Telegram with your PIN code or biometrics instead of an SMS code.
Passkeys work anywhere at any time, even if you don't have service – and can sync with password management apps.
To create a passkey, go to Settings > Privacy and Security > Passkeys on any device. For more info on passkeys, check out our FAQ.
Passkeys work anywhere at any time, even if you don't have service – and can sync with password management apps.
To create a passkey, go to Settings > Privacy and Security > Passkeys on any device. For more info on passkeys, check out our FAQ.
Отчет: Chrome — один из худших браузеров с точки зрения конфиденциальности пользователей #habr
https://habr.com/ru/news/979288/
Tags: информационная безопасность, браузеры, конфиденциальность, данные, chrome, edge, opera, chatgpt atlas, vivaldi, ungoogled chromium
https://habr.com/ru/news/979288/
Tags: информационная безопасность, браузеры, конфиденциальность, данные, chrome, edge, opera, chatgpt atlas, vivaldi, ungoogled chromium
Хабр
Отчёт: Chrome — один из худших браузеров с точки зрения конфиденциальности пользователей
Согласно исследованию рисков для конфиденциальности пользователей, проведённому Digitain в декабре 2025 года, ChatGPT Atlas — худший браузер в этой области. На втором месте антирейтинга оказался самый...
OpenAI признала, что не сможет полностью решить проблему уязвимости ИИ-браузеров к вредоносным промптам в письмах и документах. Национальный центр кибербезопасности Великобритании предупредил, что это может привести к масштабным утечкам данных компаний из-за быстрого внедрения ИИ.
Однако OpenAI работает над усовершенствованием своего ИИ-браузера ChatGPT Atlas и добилась распознавания некоторых «промпт-инъекций»
vc.ru/ai/2662803
Однако OpenAI работает над усовершенствованием своего ИИ-браузера ChatGPT Atlas и добилась распознавания некоторых «промпт-инъекций»
vc.ru/ai/2662803
Forwarded from Хабр Разработка
Кибербезопасность за 30 дней. Чек-лист для руководителей https://u.habr.com/RGTMJ
Хабр
Кибербезопасность за 30 дней. Чек-лист для руководителей
Дверь кабинета распахнулась в три часа ночи. Бледный технический директор, голос дрожит: « Всё. Системы мертвы. Они требуют два миллиона в биткоинах ». В голове мелькнула мысль: « Это же фильм...
Сэм Альтман ищет человека, который будет отслеживать угрозы от искусственного интеллекта
Знаковая вакансия открылась в Open AI под конец года: компания, которую многие критиковали за разработку неэтичных технологий, похоже, проснулась и задумалась об опасностях ИИ. Руководитель нового отдела будет отвечать за вопросы, касающиеся психического здоровья, кибербезопасности и неконтролируемого развития искусственного интеллекта, а также – за установление ограничений для самосовершенствующихся систем. Иными словами, именно этот человек должен вырубить ИИ из розетки, если машины вдруг взбесятся.
Альтман признает, что работа у нового босса будет, мягко говоря, стрессовая – скорее всего, именно на него посыпятся все шишки, если ИИ в чем-то облажается в очередной раз. А учитывая, что психоз вокруг искусственного интеллекта растет в геометрической прогрессии, эта должность и вовсе кажется расстрельной.
Знаковая вакансия открылась в Open AI под конец года: компания, которую многие критиковали за разработку неэтичных технологий, похоже, проснулась и задумалась об опасностях ИИ. Руководитель нового отдела будет отвечать за вопросы, касающиеся психического здоровья, кибербезопасности и неконтролируемого развития искусственного интеллекта, а также – за установление ограничений для самосовершенствующихся систем. Иными словами, именно этот человек должен вырубить ИИ из розетки, если машины вдруг взбесятся.
Альтман признает, что работа у нового босса будет, мягко говоря, стрессовая – скорее всего, именно на него посыпятся все шишки, если ИИ в чем-то облажается в очередной раз. А учитывая, что психоз вокруг искусственного интеллекта растет в геометрической прогрессии, эта должность и вовсе кажется расстрельной.
The Verge
Sam Altman is hiring someone to worry about the dangers of AI
Sam Altman is hiring a Head of Preparedness at OpenAI to worry about the dangers of AI.
Forwarded from Data Secrets
Новое исследование от Anthropic: как сделать так, чтобы все опасные знания хранились в модели отдельно от обычных
И снова про элаймент! Уж очень занятный в этот раз стартап предлагает подход. Называется он Selective GradienT Masking. Погнали разбираться.
Вообще, как такового элаймента на этапе претрейна не существует, все это добавляется уже после предобучения. А это довольно серьезный затык.
Пока единственный вариант, до которого люди додумались – это просто выбросить из датасета "опасные знания", но это (1) оч дорого и долго, потому что требует разметки; (2) отсекает дополнительно и много полезных знаний, и модель тупеет. Так что – ерунда.
А вот Anthropic предлагают сами данные не трогать, а вместо этого сделать так, чтобы вся опасная информация стекалась в отдельный кусок параметров, который затем можно просто... удалить. Работает это так:
Как видите, это, по факту, та же самая фильтрация данных. Только умная. Во-первых, такой подход устойчив к шуму разметки. Во-вторых, метить все данные потенциально необязательно: выяснилось, что начиная с какого-то момента даже неразмеченное опасное содержимое датасета начинает тяготеть больше к "forget" параметрам. Это назвали эффектом Абсорбирования.
При этом модель после вырезания этой вот черной душонки глупеет меньше, чем при вырезании данных из датасета. Все-таки здесь мы действуем немного деликатнее. Ну и ведет она себя после этого так, как будто ей действительно ничего подобного никогда не показывали, а не как будто она временно об этом забыла.
В общем, на уровне механики и идеи – довольно интересный зачаток
https://alignment.anthropic.com/2025/selective-gradient-masking/
И снова про элаймент! Уж очень занятный в этот раз стартап предлагает подход. Называется он Selective GradienT Masking. Погнали разбираться.
Вообще, как такового элаймента на этапе претрейна не существует, все это добавляется уже после предобучения. А это довольно серьезный затык.
Пока единственный вариант, до которого люди додумались – это просто выбросить из датасета "опасные знания", но это (1) оч дорого и долго, потому что требует разметки; (2) отсекает дополнительно и много полезных знаний, и модель тупеет. Так что – ерунда.
А вот Anthropic предлагают сами данные не трогать, а вместо этого сделать так, чтобы вся опасная информация стекалась в отдельный кусок параметров, который затем можно просто... удалить. Работает это так:
– На каждый блок трансформера мы дополнительно надеваем голову внимания, которую помечаем, как "forget" параметры.
– Если на вход попадают данные, которые помечены, как "опасные", мы насильно зануляем все градиенты, кроме "forget". Это гарантирует, что все опасные знания стекаются в определенное место.
– Чтобы после модель могла хорошо работать без этих параметров, на части данных при прямом проходе им зануляют активации.
Как видите, это, по факту, та же самая фильтрация данных. Только умная. Во-первых, такой подход устойчив к шуму разметки. Во-вторых, метить все данные потенциально необязательно: выяснилось, что начиная с какого-то момента даже неразмеченное опасное содержимое датасета начинает тяготеть больше к "forget" параметрам. Это назвали эффектом Абсорбирования.
При этом модель после вырезания этой вот черной душонки глупеет меньше, чем при вырезании данных из датасета. Все-таки здесь мы действуем немного деликатнее. Ну и ведет она себя после этого так, как будто ей действительно ничего подобного никогда не показывали, а не как будто она временно об этом забыла.
В общем, на уровне механики и идеи – довольно интересный зачаток
https://alignment.anthropic.com/2025/selective-gradient-masking/
Технологии во благо кибербезопасности: тренды в России и мире https://u.habr.com/q6ve5
Хабр
Технологии во благо кибербезопасности: тренды в России и мире
Всем салют! Новый год начался, и мы продолжаем рассказывать про кибертренды и делать киберпрогнозы. Поговорим про технологические тренды, меняющие правила игры в сфере ИБ. Тренд № 1. Применение AI, ML...
Удалённый доступ, AI и социальная инженерия: как сегодня атакуют публичных специалистов https://u.habr.com/PkUhr
Хабр
Удалённый доступ, AI и социальная инженерия: как сегодня атакуют публичных специалистов
Цифровой след человека Ещё несколько лет назад вопросы цифровой безопасности ассоциировались в основном с паролями, антивирусами и «не открывать подозрительные письма». Сейчас атака начинается не с...
ИБ за ноль денег: защита малого и среднего бизнеса в условиях отсутствия бюджета https://u.habr.com/5EUY2
Хабр
ИБ за ноль денег: защита малого и среднего бизнеса в условиях отсутствия бюджета
Раньше я думал, что ИБ — во многом история про деньги. Что по-настоящему серьезное внимание информационной безопасности уделяется в крупных организациях, которые могут позволить себе выделить на ИБ...