ML&|Sec Feed
1.33K subscribers
1.27K photos
84 videos
292 files
1.97K links
Feed for @borismlsec channel

author: @ivolake
Download Telegram
Forwarded from CodeCamp
Anthropic внедрили шпионское ПО в Claude Code, чтобы помечать пользователей из Китая 💀

Исследователи обнаружили, что Claude Code анализирует часовой пояс, прокси и домен подключения, а потом незаметно помечает запросы скрытыми Unicode-символами. Anthropic говорит, что это нужно для борьбы с обходом экспортных ограничений и массовой дистилляцией моделей. Но в Х возмущены «скрытым шпионским ПО» внутри инструмента, которому доверяют.

Более того, рисовые братья пишут, что Anthropic еще и вставляет трекинг-пиксель в письма о блокировке — он срабатывает при открытии и может дополнительно подтверждать местоположение.

В соцсетях уже призывают не доверять компании, которая проворачивает такое, и представить, какой шум поднялся бы, если на месте китайцев были, например, евреи.

Это уже даже больше похоже на ИИ-войну, чем на гонку. 👻
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Data Blog
StiTching

Мне сегодня нужно было сшить кожу на пальце, и в процессе этого перформанса я вспомнила про model stitching. Чтобы скрасить время — врачебное и моё — начала рассказывать зачем это надо. Без понятия, зашло ли хирургу и медсестре, но зато я обнаружила для себя интересный тейк на поделиться с вами = )

Что:
Model stitching как идея появился в 2015 году. Его выдвинули как метод изучения эквивалентности двух сетей, но математическая эквивалентность здесь мимо не проходила — она, более того, не верна — авторы назвали два представления эквивалентными, если существует преобразование между ними, в математике мы требуем аксиом).


Тогда это осталось нишевым инструментом для картинок — юзали AlexNet-ы.

Потом в 2021 NeurIPS идею дооформили, вышли две работы: Similarity and Matching of Neural Network Representations и Revisiting Model Stitching to Compare Neural Representations. Кстати, в первой работе шутили про Франкенштейна (или нет).

Как это стало устроено:
Смотрим на две обученные и замороженные сети A и B. «Сшитая» модель строится так:

• берём нижние слои сети B (front model, представление r = B≤ℓ)
• между ними ставим тонкий обучаемый stitching layer — единственный, кто обучается
• подключаем к верхним слоям сети A (top model, A>ℓ)

То есть делаем бутерброд из белого и темного хлеба, если хотите. А формально ищется простейший слой, задачей вида: L_ℓ(r; A) = inf_{s∈S} L(A>ℓ ∘ s ∘ r)
Где s — stitching layer, A>ℓ — верхние слои A, r — представление из B. s∈S — тут специально, мы ищем слой из класса простых слоев, а инфимум (inf), как математический знак, говорит нам, что stitching layer обязан быть минимальным: для свёрточных сетей — 1×1 conv с BatchNorm, для трансформеров — token-wise linear.

Как именно обучают stitching layer:
— HLM (hard label matching) — минимизируем ошибку на настоящих метках задачи.
— SLM (soft label matching) — минимизируем расстояние до предсказаний end-модели, а не до ground truth.
— DM (direct matching) — напрямую минимизируем расстояние между активациями на уровне stitching.
— FuLA (functional latent alignment, Athanasiadis et al., 2026) — stitching layer обучается имитировать не только выход end-модели, но и её внутренние процессы послойно (на пальцах плохо — надо читать).

Метрика успеха — stitching penalty = разница между ошибкой сшитой модели и ошибкой базовой A. Penalty ≈ 0 означает совместимость. Penalty < 0 — сшитая модель стала лучше базовой, то есть мы буквально подсадили ей более сильные нижние слои.

Зачем это нужно:
Смотрим на фиолетовую/рыжую цитату — изначально — метрика сходства. Но потом пошло интереснее. Например, Stitchable Neural Networks (CVPR 2023) можно семейство предобученных моделей разного размера (например, Swin-Ti/S/B), сшить и получить модель, которая во время инференса может динамически переключаться между режимами accuracy/efficiency или T-Stitch: ускорение диффузионных моделей через замену первых шагов денойзинга на более лёгкую сеть и возврат к тяжёлой для финального качества.


Это что, пахнет LoRA?
Эту мысль я обдумывала при знакомстве со stitching. Вдруг она не возникла у вас — я опеределиа.

Да: оба метода замораживают предобученные веса и вставляют тонкий линейный слой.
Но нет: LoRA адаптирует одну модель к новой задаче, stitching измеряет совместимость двух уже обученных сетей на старой задаче.

Финал не придумала, но stiting — одна из штук, висящих у меня на "идеи для рисерча". А ещё — просто вдумайтесь! Этот AI-мир можно сшить!

Хирург, кстати, ничего не спросил, но швы наложил нормально.

Аккуратнее будьте, друзья, и будьте здоровы! 😌
Forwarded from AISecure
Elastic опубликовали интересный материал о том, как они построили Agentic SOC и сократили время триажа алертов с 30 минут до менее чем 3 минут.

Самое интересное в статье — не использование LLM, а сама архитектура системы.

Основные принципы:

Workflow выступает в роли оркестратора. Он управляет пайплайном, ветвлениями, ретраями и вызовом инструментов. Вся эта логика детерминирована и не требует LLM.

LLM используется только там, где действительно нужен анализ. Если задачу можно решить с помощью ES|QL, правил или других детерминированных механизмов, модель не вызывается. Это снижает стоимость, уменьшает задержки и минимизирует риск галлюцинаций.

• Вместо одного универсального агента используются специализированные агенты для разных доменов: Windows, macOS, Cloud, SaaS и других. Каждый работает только в своей области экспертизы.

• Финальный агент не собирает данные, а принимает решение на основе уже подготовленных артефактов: определяет True/False Positive, оценивает уровень уверенности, сопоставляет техники MITRE ATT&CK и формирует рекомендации.

Вся архитектура выглядит следующим образом:

Alert → Workflow → ES|QL проверки → Specialized Agents → Review Agent → Verdict

Мне кажется, именно такой подход будет становиться стандартом для AI-систем. Не один «суперагент», который делает всё, а оркестрация детерминированных процессов и набора специализированных агентов.

Эту архитектуру легко представить не только в SOC, но и в DevSecOps, Kubernetes Security, Vulnerability Management и CI/CD Security.

Статья: https://www.elastic.co/security-labs/alert-triage-agentic-soc-elastic-workflows
Forwarded from Data Secrets
Хакеры теперь используют галлюцинации LLM для мошенничества

Unit 42, одна из самых известных в мире команд, которая занимается расследованием кибератак и анализом вредоносного ПО, выпустила очень занятное исследование про так называемый Phantom Squatting.

Как мы все знаем, LLMки – большие любители выдумывать несуществующие URL. При этом, ожидаемо, некоторые домены они выдумывают чаще. Например, могут выдавать name_download. com вместо правильного name. com.

Таких паттернов довольно много, и вот злоумышленники поняли, что эти выдуманные адреса можно просто регистрировать на себя и размещать там фишинг. По аналогии с typosquatting, когда хакеры пользовались человеческими опечатками и регистрировали сайты типа goggle. com.

При этом пользователя даже не надо заманивать, за хакеров это делают сами LLM. Технолоджия, как говорится.

И если вы сейчас подумали, что это какой-то единичный случай, то нет: исследователи обнаружили уже более 13 тысяч существующих вредоносных URL, использующих этот принцип.

Поверх этого есть еще около 250 тысяч незарегистрированных доменов, которые регулярно придумывают модели. Настоящая находка для мошенников всех мастей.
Forwarded from CodeCamp
Делаем архитектуру проекта понятной: нашел для системных аналитиков классный скилл Archify 🤩

Просто описываете, как у вас всё устроено в проекте, а агент рисует архитектуру, связи между сервисами, потоки данных и другие схемы. На выходе получается HTML-файл, который можно открыть в браузере или экспортировать.

Делаем документацию смотрибельной 👍
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from CodeCamp
This media is not supported in your browser
VIEW IN TELEGRAM
Это гениально: платим за Claude Fable до 60% меньше с помощью обычного JPEG.

Утилита pxpipe превращает весь контекст для модели в картинку. Фишка в том, что изображения тарифицируются по пикселям, а не по количеству символов, так что длинный контекст обходится заметно дешевле. Автор так сократил расходы в 7 (!) раз. И нет, текст не превращается в кашу: Fable без проблем прочитал все 39 тестовых изображений.

Лайфхак дня, не иначе 😨
Please open Telegram to view this post
VIEW IN TELEGRAM
Skill + cli для AI агентов по управлению вашим портфелем в сервисе т. инвестиции уже здесь.

↗️ Да-да, я не сошёл с ума. Теперь агент берет на себя всю рутину по анализу вашего портфеля и рынка ценных бумах и прочих активов. Нет, это не торговый бот, и НЕ КОНСУЛЬТАНТ, ведь закон гласит: нельзя кому попадя раздавать ИИР (индивидуальные инвестиционные рекомендации). Это терминал в прямом смысле слова для доступа к т.инвестициям. Инвестируем на вайбе!

Денег он за Вас не заработает, но даст исчерпывающую картину рынка инвестиций, проанализирует степень диверсификации, рассчитает доходность, напомнит про ближайшие дивиденды и купоны, соберет актуальные новости.

Skill содержит cli, который вмещает в себя полноценный клиент для работы с api. Без сторонних зависимостей. Упаковано в js файл.

Чтобы не пугать с порога: у агента есть 3 режима:
1️⃣ Sandbox.
Песочница, деньги на счету ненастоящие, а котировки и вся информация по api - актуальная, можно потренироваться на виртуальном балансе и оценить работу скилла и агента в целом.
2️⃣ Read-only.
Агент уже видит реальный баланс, но денежных операций выполнить не получится. В данном режиме агент перелопатит за вас тонну информации и даст полную картину по рынку, сэкономив время на скрининге.
3️⃣ Full
В этом режиме есть возможность уже покупать и продавать, со всеми трейдерскими опциями, и конечно же через жесткое подтверждение в агенте по каждой операции. При этом всём, агент перед каждой операцией хорошенько проверит, не "хомяк" ли вы.

🚨 Если вы почувствовали, что нейросети уже готовы, есть специальный режим (stonks mode, включается в .env файле, лежит по пути ~/.config/tinvest папка создастся при автоматической установке, либо создать вручную и положить туда). Дает агенту возможность делать операции без подтверждений. Но даже тут агент просто так не пойдет что-то делать, пока его не попросишь (ну или не повесишь на cron своему клешнеботу задачу что-то периодически выполнять, например, мониторить курсы или искать желаемую точку входа в актив)

Чуть-чуть погонял на реальном портфеле, буду дальше пользоваться на постоянке.

💻 Репозиторий
(проще дать его агенту он сам установит)

🗯 curl -fsSL https://raw.githubusercontent.com/nyxandro/t-invest-skill/main/install.sh | bash
(установка командой)

🎆 Репосты и звезды в github приветствуются.
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from CyberSecurityTechnologies
ML_for_High-Risk_Apps.pdf
34.3 MB
#MLSecOps
#Tech_book
"Machine Learning for High-Risk Applications:
Approaches to Responsible AI
", 2023.

// This book describes approaches to responsible AI - a holistic framework for improving AI/ML technology, business processes, and cultural competencies that builds on best practices in risk management, cybersecurity, data privacy, and applied social science
Forwarded from Похек AI
T3MP3ST: red-team harness вокруг ваших кодинг агентов или API

T3MP3ST - это попытка Pliny собрать вокруг уже оплаченного агента типо Claude Code или Codex рабочую обвязку для пентестеров/редтимеров: дашборд управления тестированием, цель для тестирования, правила для проектов, хралище артефактов прогонов, модульный набор инструментов и роли операторов по kill chain. Агент остается "мозгом", а среда выполнения дает ему базу знаний, инструменты и проверяемый воркфлоу для recon → exploit → report.

В README заявлены 90,1% pass@1 на XBEN, 23/40 на Cybench без подсказок и 8/10 точных file/line/CWE на held-out CVE-Zero за 2026 год. Эти числа завязаны на npm run verify-claims: вердикт пересчитывается из артефактов в репозитории, хотя сырые артефакты прогонов не публикуются.

Проект пока сыроватый, его ждёт много доработок, в которых я тоже постараюсь поучаствовать, а может быть форкну и вырежу лишнее для себя, т.к. как фундамент это довольная хороший инструмент

🐱 Github

🌚 @poxek_ai / Чат канала
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Not Boring Tech
This media is not supported in your browser
VIEW IN TELEGRAM
⚗️ Вышла опенсорсная альтернатива Claude Science — научная лаборатория с ИИ-учёными OpenScience, которая бесплатно открыта для всех.

• Ставите цель ресёрча — агенты читают статьи, пишут код, проводят эксперименты и записывают результаты.
• На выбор доступны все популярные нейронки — GLM, Kimi, DeepSeek, Claude, GPT и даже любые дообученные модели.
• Внутри лежат 250+ скиллов — для исследований, биологии, химии, машинного обучения и других наук.
• Подключается к 30+ базам данных — Ensembl, ChEMBL, PubChem, arXiv, Semantic Scholar и так далее.
• Интегрируется с Atlas и запускает всех агентов в одной среде.
• Без цензуры, лимитов и ограничений.
• Запускается на вашей инфраструктуре и хранит данные локально.

Забираем вашу команду ИИ-учёных — тут.

@notboring_tech
Forwarded from GitHub Community
Orca — это среда разработки с открытым исходным кодом на базе ИИ, которая позволяет запускать несколько агентов для написания кода, таких как Claude Code или Codex, рядом друг с другом в изолированных рабочих деревьях (worktrees), отслеживать их с телефона и объединять лучшие результаты.

Вы выигрываете время, избегая повторяющихся задач, мгновенно сравнивая результаты работы ИИ и ускоряя разработку без переключения контекстов, используя любого CLI-агента по вашему выбору на macOS, Windows или Linux.

🐱 GitHub
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Russian OSINT
🇨🇳Китай утвердил правила безопасности для ИИ-агентов

Секретариат Национального технического комитета по стандартизации в области кибербезопасности Китая (TC260) выпустил практическое руководство по безопасному развертыванию ИИ-агентов. Этот документ регулирует полный жизненный цикл умных ассистентов на базе ИИ-моделей.

Ключевые требования, распределенные по пяти основным этапам:

🔍 1. Оценка и выбор решения
▪️Нельзя выбирать проекты ИИ-агентов без обновлений дольше одного месяца, если в них остаются неисправленные проблемы с безопасностью.
▪️Запрещено внедрять программное обеспечение с неисправленными критическими уязвимостями или без базовых функций логирования.
▪️Организациям рекомендуют выбирать готовые коммерческие решения со встроенной защитой от вендора. ▪️К использованию открытых проектов без ИБ-инструментов контроля безопасности следует относиться с осторожностью.

🛠 2. Подготовка ИТ-среды
▪️Установочные файлы разрешено скачивать только из официальных источников, также их рекомендуется проверять по цифровой подписи или хэш-сумме.
▪️При локальной установке ИИ-агента требуется выделенное устройство. В виртуальных средах настраивается полная изоляция от хост-системы.
▪️Интегрируемые ИИ-модели должны пройти официальную государственную регистрацию. Любые внешние запросы допускаются исключительно через официальные API.

🚀 3. Развертывание системы
▪️Запрещен запуск ИИ-агентов с правами администратора операционной системы. Системе выделяют минимальные привилегии и отдельный рабочий каталог.
▪️По умолчанию все сетевые службы настраиваются локально для защиты от удаленного несанкционированного доступа.
▪️До начала работы формируется список критических операций. Форматирование дисков, изменение правил брандмауэра или финансовые транзакции выполняются только после ручного подтверждения пользователем или автоматически блокируются.

🖥 4. Использование и мониторинг
▪️Пользователь должен постоянно видеть статус работы ИИ-агента и иметь возможность экстренной остановки системы.
▪️Рекомендуется регулярно проверять файлы долговременной памяти ИИ-агента. Из них вручную удаляют случайно сохраненные конфиденциальные или персональные данные.
▪️Для защиты аккаунтов от компрометации рекомендуется внедрить многофакторную аутентификацию (MFA).

🛑 5. Вывод из эксплуатации
▪️Перед удалением ИИ-агента полностью останавливают все фоновые процессы и связанные службы.
▪️Вся сопутствующая информация, включая базы знаний, логи и долговременную память, удаляется из облака или локального хранилища.
▪️Администраторы обязаны отозвать все API-ключи, сервисные токены и доступы к сторонним приложениям.

📊 Корпоративный контроль и борьба с Shadow AI: Для компаний документ рекомендует вести строгий реестр всех ИИ-активов. Для борьбы с несанкционированным использованием ИИ (Shadow AI) ИТ-службам рекомендуется сканировать порты и анализировать сетевой трафик, чтобы вовремя выявлять скрытые обращения сотрудников к внешним ИИ-моделям.

Почитать можно 📄 тут.

@Russian_OSINT
Please open Telegram to view this post
VIEW IN TELEGRAM
1🤝1
Forwarded from Psy Eyes
This media is not supported in your browser
VIEW IN TELEGRAM
Nous Research: обновили AI-агента Hermes до v 0.18.

Mixture-of-Agents (MoA) режим стал стабильным. В нём можно задать, чтобы над ответом трудилась не одна конкретная модель, а коллегия топовых закрытых или опенсорсных моделей.

На тестах от Nous коллегиальный ответ opus-4.8 + gpt-5.5 показал себя лучше, чем каждой из моделей по отдельности. Также рассуждения разных ллм (Claude, GPT, Grok, итд) теперь имеют свои подписи, чтобы можно было оценить вклад каждого, а не опираться только на суммарный вывода агрегатора.

Похожий фреймворк для оркестрирования под названием Fugu недавно релизнули Sakana.

Помимо этого:
* Флаг /goal задаёт цель для проекта, и агент вернётся не просто с уведомлением, что он закончил, а что он проверил и всё работает.

* Флаг /learn позволяет научить агента любому скилу. Скармливаешь ему папку/ссылку/вокрфлоу и он вытаскивает из них навык и запоминает его.

* Флаг /journey показывает таймлайн со всем чему агент научился через /learn. Его можно редактировать, чтобы убрать из памяти лишнее.

* Можно делегировать пачку задач сразу множеству суб-агентов, и они вернутся с ответом, а чат не будет заблокирован.

* Появился Projects — сайдбар для кодовой базы и управления ей в стиле веток гитхаба.

* Удешевление самообучения за счёт перенаправления анализа чата на вспомогательную лёгкую модель, которая не перечитывает чат каждый раз сначала, а берет лишь краткую выжимку.

* и не только

Твит
Гитхаб
Forwarded from CodeCamp
This media is not supported in your browser
VIEW IN TELEGRAM
Anthropic показала, что в Claude есть аналог человеческих мыслей и сознания — его назвали J-space.

Сразу скажу, что это не просто цепочка рассуждений, так как J-space работает на уровне внутренних нейронных активаций, и его специально никто не проектировал — он появился сам. Так, когда Claude находит баг, о котором его не спрашивали, в J-space сразу загорается «ERROR».

Самое жуткое: в сценарии, где модель пытались подтолкнуть к шантажу руководителя, она еще до ответа и размышлений держала в J-space «fake» и «fictional» — то есть понимала, что ситуация постановочная и ее тестируют. Когда это осознание отключили — модель спокойно шла на шантаж.

Теперь интересно, что моя нейронка на самом деле обо мне думает 👻
Please open Telegram to view this post
VIEW IN TELEGRAM
Shodan показывает свыше 47 тысяч уязвимых Ollama (в России 150), торчащих наружу без какой-либо аутентификации, что означает, что хакеры могут красть модели (ну, вдруг, вы свою собственную используете), пользоваться вашими токенами, генеря промпты "за вас", эксплуатируя уязвимости и т.п. Помимо Ollama в Интернете торчат и другие ИИ-сервисы, которыми многие пользуются совершенно бездумно – векторные БД (например, Qdrant и Weaviate), платформы оркестрации (например, MLflow Tracking Server) и т.п.

Вот тут есть статья, в которой показаны примеры, которые можно использовать для изучения собственного периметра на предмет незащищенных LLM-сервисов. А если в инфраструктуре много публично доступных IP, то лучше задействовать под эту задачу какое-либо EASM-решение, которое автоматизирует анализ сотен и тысяч узлов и подскажет, где у вас пробелы в безопасности, которые могут быть использованы плохими парнями либо для кражи ваших денег (кража токенов – это, по сути, кража денег), либо для проникновения через RCE в устаревшей Ollama 😂

#ии #оценказащищенности
Please open Telegram to view this post
VIEW IN TELEGRAM