Forwarded from Data Secrets
Новое исследование от Anthropic: как сделать так, чтобы все опасные знания хранились в модели отдельно от обычных
И снова про элаймент! Уж очень занятный в этот раз стартап предлагает подход. Называется он Selective GradienT Masking. Погнали разбираться.
Вообще, как такового элаймента на этапе претрейна не существует, все это добавляется уже после предобучения. А это довольно серьезный затык.
Пока единственный вариант, до которого люди додумались – это просто выбросить из датасета "опасные знания", но это (1) оч дорого и долго, потому что требует разметки; (2) отсекает дополнительно и много полезных знаний, и модель тупеет. Так что – ерунда.
А вот Anthropic предлагают сами данные не трогать, а вместо этого сделать так, чтобы вся опасная информация стекалась в отдельный кусок параметров, который затем можно просто... удалить. Работает это так:
Как видите, это, по факту, та же самая фильтрация данных. Только умная. Во-первых, такой подход устойчив к шуму разметки. Во-вторых, метить все данные потенциально необязательно: выяснилось, что начиная с какого-то момента даже неразмеченное опасное содержимое датасета начинает тяготеть больше к "forget" параметрам. Это назвали эффектом Абсорбирования.
При этом модель после вырезания этой вот черной душонки глупеет меньше, чем при вырезании данных из датасета. Все-таки здесь мы действуем немного деликатнее. Ну и ведет она себя после этого так, как будто ей действительно ничего подобного никогда не показывали, а не как будто она временно об этом забыла.
В общем, на уровне механики и идеи – довольно интересный зачаток
https://alignment.anthropic.com/2025/selective-gradient-masking/
И снова про элаймент! Уж очень занятный в этот раз стартап предлагает подход. Называется он Selective GradienT Masking. Погнали разбираться.
Вообще, как такового элаймента на этапе претрейна не существует, все это добавляется уже после предобучения. А это довольно серьезный затык.
Пока единственный вариант, до которого люди додумались – это просто выбросить из датасета "опасные знания", но это (1) оч дорого и долго, потому что требует разметки; (2) отсекает дополнительно и много полезных знаний, и модель тупеет. Так что – ерунда.
А вот Anthropic предлагают сами данные не трогать, а вместо этого сделать так, чтобы вся опасная информация стекалась в отдельный кусок параметров, который затем можно просто... удалить. Работает это так:
– На каждый блок трансформера мы дополнительно надеваем голову внимания, которую помечаем, как "forget" параметры.
– Если на вход попадают данные, которые помечены, как "опасные", мы насильно зануляем все градиенты, кроме "forget". Это гарантирует, что все опасные знания стекаются в определенное место.
– Чтобы после модель могла хорошо работать без этих параметров, на части данных при прямом проходе им зануляют активации.
Как видите, это, по факту, та же самая фильтрация данных. Только умная. Во-первых, такой подход устойчив к шуму разметки. Во-вторых, метить все данные потенциально необязательно: выяснилось, что начиная с какого-то момента даже неразмеченное опасное содержимое датасета начинает тяготеть больше к "forget" параметрам. Это назвали эффектом Абсорбирования.
При этом модель после вырезания этой вот черной душонки глупеет меньше, чем при вырезании данных из датасета. Все-таки здесь мы действуем немного деликатнее. Ну и ведет она себя после этого так, как будто ей действительно ничего подобного никогда не показывали, а не как будто она временно об этом забыла.
В общем, на уровне механики и идеи – довольно интересный зачаток
https://alignment.anthropic.com/2025/selective-gradient-masking/
Технологии во благо кибербезопасности: тренды в России и мире https://u.habr.com/q6ve5
Хабр
Технологии во благо кибербезопасности: тренды в России и мире
Всем салют! Новый год начался, и мы продолжаем рассказывать про кибертренды и делать киберпрогнозы. Поговорим про технологические тренды, меняющие правила игры в сфере ИБ. Тренд № 1. Применение AI, ML...
Удалённый доступ, AI и социальная инженерия: как сегодня атакуют публичных специалистов https://u.habr.com/PkUhr
Хабр
Удалённый доступ, AI и социальная инженерия: как сегодня атакуют публичных специалистов
Цифровой след человека Ещё несколько лет назад вопросы цифровой безопасности ассоциировались в основном с паролями, антивирусами и «не открывать подозрительные письма». Сейчас атака начинается не с...
ИБ за ноль денег: защита малого и среднего бизнеса в условиях отсутствия бюджета https://u.habr.com/5EUY2
Хабр
ИБ за ноль денег: защита малого и среднего бизнеса в условиях отсутствия бюджета
Раньше я думал, что ИБ — во многом история про деньги. Что по-настоящему серьезное внимание информационной безопасности уделяется в крупных организациях, которые могут позволить себе выделить на ИБ...
OSINT-блогер собрал огромную систему слежки за людьми через навигатор Waze. Самое интересное — пользователи сами давали себя обнаружить.
Парень написал несколько скриптов, которые могут моментально найти любого человека. Программа опирается на репорты пользователей о дорожной ситуации и сверяет время их отправки с записями дорожных камер.
Так можно искать людей из более 60 стран, включая Россию.
Парень написал несколько скриптов, которые могут моментально найти любого человека. Программа опирается на репорты пользователей о дорожной ситуации и сверяет время их отправки с записями дорожных камер.
Так можно искать людей из более 60 стран, включая Россию.
Persona — продвинутая капча
За последние пару месяцев в нескольких сервисах, при регистрации, просили пройти процедуру идентификации, и каждый раз, это было через Persona, это платформа для подтверждения личности. В ней не просто проверка документов и селфи, они помогают удостовериться, что по ту сторону экрана реальный человек, а не бот или сгенерированный агент.
Компания уже довольно большая, в последнем раунде получили $200 млн в Series D, и оценку около $2 млрд. после. Среди клиентов LinkedIn, Coursera, OpenAI, Playboy🐰
Позиционируют себя не просто как инструмент для борьбы с мошенничеством и соответствия требованиям AML/KYC, а как "слой проверенной личности" для нашего ""мертвеющего" интернета, где агентные AI и синтетические идентичности становятся повседневностью.
Также у них есть программа для стартапов, которая позволяет молодым компаниям использовать платформу бесплатно в первые 12 месяцев (с лимитом бесплатных проверок), что помогает им захватывать рынок снизу и привлекать клиентов в разных сегментах.
Касательно планов: прямо в анонсе Series D они говорят не только об усилении борьбы с мошенничеством и deepfake, но и о расширении продукта так, чтобы *корпоративные клиенты могли обмениваться инсайтами и строить коллективную защиту* от новых угроз идентичности. Это похоже на стратегию, где Persona хочет стать не просто провайдером API, а центром экосистемы цифровой идентичности.
За последние пару месяцев в нескольких сервисах, при регистрации, просили пройти процедуру идентификации, и каждый раз, это было через Persona, это платформа для подтверждения личности. В ней не просто проверка документов и селфи, они помогают удостовериться, что по ту сторону экрана реальный человек, а не бот или сгенерированный агент.
Компания уже довольно большая, в последнем раунде получили $200 млн в Series D, и оценку около $2 млрд. после. Среди клиентов LinkedIn, Coursera, OpenAI, Playboy
Позиционируют себя не просто как инструмент для борьбы с мошенничеством и соответствия требованиям AML/KYC, а как "слой проверенной личности" для нашего ""мертвеющего" интернета, где агентные AI и синтетические идентичности становятся повседневностью.
Основная миссия — сделать так, чтобы проверка личности была бесшовной и позволяла бизнесам работать с уверенностью, а людям — перемещаться по сервисам без лишней сложности.
Также у них есть программа для стартапов, которая позволяет молодым компаниям использовать платформу бесплатно в первые 12 месяцев (с лимитом бесплатных проверок), что помогает им захватывать рынок снизу и привлекать клиентов в разных сегментах.
Касательно планов: прямо в анонсе Series D они говорят не только об усилении борьбы с мошенничеством и deepfake, но и о расширении продукта так, чтобы *корпоративные клиенты могли обмениваться инсайтами и строить коллективную защиту* от новых угроз идентичности. Это похоже на стратегию, где Persona хочет стать не просто провайдером API, а центром экосистемы цифровой идентичности.
Please open Telegram to view this post
VIEW IN TELEGRAM
Withpersona
Customer Success Stories and Case Studies | Persona
Check out these case stories to learn about the many ways our customers partner with Persona to solve their unique identity challenges.
Forwarded from vc.ru
Microsoft подтвердила, что добавит в Teams функцию оповещения работодателей о местоположении сотрудников. Она по умолчанию отключена, но её сделают доступной по запросу компании.
Запуск дважды откладывали на фоне недовольства пользователей, как пишет Forbes. Теперь её планируют внедрить в марте 2026-го
vc.ru/services/2706968
Запуск дважды откладывали на фоне недовольства пользователей, как пишет Forbes. Теперь её планируют внедрить в марте 2026-го
vc.ru/services/2706968
clawdbot-Полный аудит + рекомендации.docx
68.1 KB
🔒 Clawdbot: полный аудит безопасности. Не спешите ставить //
Утром провел глубокий анализ кода. Если видели рекомендации в других каналах и уже поставили, почитайте внимательно.
Что нашел:
🔴 Критическое: AI может выполнять любой JavaScript в вашем браузере через eval. Это не баг, это фича. Но через Prompt Injection хакер может украсть ваши cookies и пароли одной командой.
🔴 Критическое: ~900 установок в интернете обнаружены БЕЗ ПАРОЛЯ. Если Gateway открыт наружу, злоумышленник получает полный доступ к системе.
🔴 Критическое: Пароли и API-ключи хранятся в plaintext. На macOS есть Keychain, на Linux/Windows просто файлы с chmod 600.
Общая оценка: 6.5/10 без настройки, 7.9/10 после всех рекомендаций.
Документ с полным разбором, чек-листами и командами прикладываю. Там все: что исправлено, что нет, как защититься, что делать при взломе.
Не ставьте все, что советуют горе-блогеры. Сначала читайте, потом ставьте.
🧠 Следи за AItoolz — сначала проверяем, потом рекомендуем
#Clawdbot #безопасность #ИИ #аудит
Утром провел глубокий анализ кода. Если видели рекомендации в других каналах и уже поставили, почитайте внимательно.
Что нашел:
🔴 Критическое: AI может выполнять любой JavaScript в вашем браузере через eval. Это не баг, это фича. Но через Prompt Injection хакер может украсть ваши cookies и пароли одной командой.
🔴 Критическое: ~900 установок в интернете обнаружены БЕЗ ПАРОЛЯ. Если Gateway открыт наружу, злоумышленник получает полный доступ к системе.
🔴 Критическое: Пароли и API-ключи хранятся в plaintext. На macOS есть Keychain, на Linux/Windows просто файлы с chmod 600.
Общая оценка: 6.5/10 без настройки, 7.9/10 после всех рекомендаций.
Документ с полным разбором, чек-листами и командами прикладываю. Там все: что исправлено, что нет, как защититься, что делать при взломе.
Не ставьте все, что советуют горе-блогеры. Сначала читайте, потом ставьте.
#Clawdbot #безопасность #ИИ #аудит
Please open Telegram to view this post
VIEW IN TELEGRAM
Ещё один вопрос из саппорта
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
Хакеры с ИИ получили полный доступ к AWS за 8 минут //
Исследователи Sysdig задокументировали атаку: злоумышленники нашли учетные данные в публичной корзине S3, за 8 минут добрались до полного админского контроля. Скомпрометировали 19 принципалов AWS, захватили 5 пользователей IAM, создали бэкдор.
Код явно писала нейросеть:
Дальше классика: отключили логирование, начали LLMjacking (воровство доступа к облачным ИИ-моделям), запустили GPU-инстансы.
Защитники не успели среагировать. 66% организаций не уверены, что могут обнаруживать угрозы в облаке в реальном времени.
🧠 Следи за AItoolz — ИИ атакует быстрее людей
#безопасность #AWS #ИИ #хакеры
Исследователи Sysdig задокументировали атаку: злоумышленники нашли учетные данные в публичной корзине S3, за 8 минут добрались до полного админского контроля. Скомпрометировали 19 принципалов AWS, захватили 5 пользователей IAM, создали бэкдор.
Код явно писала нейросеть:
комментарии на сербском, ссылки на несуществующий репозиторий «github. com/anthropic/training-scripts.git», выдуманные ID аккаунтов. Типичные галлюцинации LLM.
Дальше классика: отключили логирование, начали LLMjacking (воровство доступа к облачным ИИ-моделям), запустили GPU-инстансы.
Защитники не успели среагировать. 66% организаций не уверены, что могут обнаруживать угрозы в облаке в реальном времени.
#безопасность #AWS #ИИ #хакеры
Please open Telegram to view this post
VIEW IN TELEGRAM
Новый механизм борьбы с последствиями кражи аккаунтов вводит Telegram в рамках введения мер безопасности.
Как защитят пользователей:
Please open Telegram to view this post
VIEW IN TELEGRAM
Google внедрила инструмент для удаления персональных данных из результатов поиска #habr
https://habr.com/ru/news/995090/
Tags: информационная безопасность, поиск, google, данные, конфиденциальность, удаление данных, цифровой след
https://habr.com/ru/news/995090/
Tags: информационная безопасность, поиск, google, данные, конфиденциальность, удаление данных, цифровой след
В расширениях Chrome обнаружили 30 поддельных ИИ-ассистентов, которые крали пароли и читали почту #habr
https://habr.com/ru/news/996698/
Tags: Claude, ChatGPT, Chrome
https://habr.com/ru/news/996698/
Tags: Claude, ChatGPT, Chrome
Хабр
В расширениях Chrome обнаружили 30 поддельных ИИ-ассистентов, которые крали пароли и читали почту
Исследователи компании LayerX обнаружили координированную кампанию из 30 вредоносных расширений для Google Chrome, которые маскировались под популярных ИИ-ассистентов — Claude, ChatGPT, Gemini и Grok....
Forwarded from HABR FEED + OPENNET
Google Chrome без ведома пользователя загружает на систему локальную версию Gemini Nano по умолчанию (default) #habr
https://habr.com/ru/news/1002508/
Tags: Google Chrome, gemini
https://habr.com/ru/news/1002508/
Tags: Google Chrome, gemini