Forwarded from Похек AI (Сергей Зыбнев)
Cryptex OSS: локальный стенд для prompt security
Cryptex OSS — открытая браузерная лаборатория для проверки LLM на устойчивость к кодировкам, мутациям и промпт инъекциям. В репозитории заявлены 159 трансформеров, 25 поверхностей инструментов и BYOK-шлюз. Живой инстанс доступен без регистрации; ключи провайдеров хранятся в браузерном
Главная ценность — в нормальной рабочей среде для повторяемых экспериментов. Есть Transform/Decode для кодировок и Unicode-трюков, Tokenizer и Tokenade для токенизации и «тяжёлых» входов, Fuzzer, PromptCraft с 36 мутациями и оркестраторами TAP/PAIR/Crescendo/Many-Shot, плюс лаборатории HarmBench, StrongREJECT, JBB, indirect injection, Markdown Exfil, OCR Injection, Fingerprinter и Watermark.
Разработчик честно помечает heuristic scoring: результаты бенчмарк-лабораторий — сигнал для итераций, а не вердикт о безопасности модели. Это важное ограничение: Cryptex удобен для ресерча, подготовки тест-кейсов и сравнения поведения провайдеров, но не заменяет полноценную методологию оценки.
Архитектурно проект выглядит практично: SvelteKit/Svelte 5, статический деплой без бэкенда, история в
Главное — не путать мутацию промпта с доказанным exploit chain: ценность Cryptex именно в быстрой, прозрачной итерации.
🔗 Источники:
Репозиторий / live site
🌚 @poxek_ai / Чат канала
Cryptex OSS — открытая браузерная лаборатория для проверки LLM на устойчивость к кодировкам, мутациям и промпт инъекциям. В репозитории заявлены 159 трансформеров, 25 поверхностей инструментов и BYOK-шлюз. Живой инстанс доступен без регистрации; ключи провайдеров хранятся в браузерном
localStorage, а AI-запросы идут напрямую к выбранному провайдеру.Главная ценность — в нормальной рабочей среде для повторяемых экспериментов. Есть Transform/Decode для кодировок и Unicode-трюков, Tokenizer и Tokenade для токенизации и «тяжёлых» входов, Fuzzer, PromptCraft с 36 мутациями и оркестраторами TAP/PAIR/Crescendo/Many-Shot, плюс лаборатории HarmBench, StrongREJECT, JBB, indirect injection, Markdown Exfil, OCR Injection, Fingerprinter и Watermark.
Разработчик честно помечает heuristic scoring: результаты бенчмарк-лабораторий — сигнал для итераций, а не вердикт о безопасности модели. Это важное ограничение: Cryptex удобен для ресерча, подготовки тест-кейсов и сравнения поведения провайдеров, но не заменяет полноценную методологию оценки.
Архитектурно проект выглядит практично: SvelteKit/Svelte 5, статический деплой без бэкенда, история в
localStorage/IndexedDB, тяжёлые трансформации через Web Workers, Docker/GHCR для быстрого self-host. Можно поднять локально одной командой, а можно пользоваться hosted-версией.Главное — не путать мутацию промпта с доказанным exploit chain: ценность Cryptex именно в быстрой, прозрачной итерации.
Репозиторий / live site
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from The Engine Room
The Engine Room
AI Cybersecurity Careers 2026
Карьерный обзор рынка AI Security на 2026 год
Документ “AI Cybersecurity Careers 2026” от SANS. Рассказывают о том, какие AI Security роли уже востребованы, как ИИ меняет кибербезопасность и почему ближайшие 2–3 года станут ключевыми для специалистов в области AI Security.
Незаметка
#ai #cybersecurity #sans #aisecurity #незаметки
The Engine Room👾
Незаметка
#ai #cybersecurity #sans #aisecurity #незаметки
The Engine Room
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from GitHub Community
AgentScope — это готовая к использованию в продакшене простая в применении платформа для агентов с базовыми абстракциями, которые работают с растущими возможностями моделей и имеют встроенную поддержку тонкой настройки.
Мы разрабатываем все более автономные большие языковые модели. Наш подход основан на использовании способностей моделей к логическому мышлению и использованию инструментов, а не на ограничении их возможностей с помощью строгих подсказок и шаблонных сценариев.
🐱 GitHub
Мы разрабатываем все более автономные большие языковые модели. Наш подход основан на использовании способностей моделей к логическому мышлению и использованию инструментов, а не на ограничении их возможностей с помощью строгих подсказок и шаблонных сценариев.
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Seguridad de IA
OWASP publicó AIUC-1 Crosswalks, un marco que adapta el OWASP Top 10 al contexto de aplicaciones agentic, destacando que los riesgos clásicos cambian significativamente cuando un agente de IA puede razonar, usar herramientas y ejecutar acciones autónomas. El documento identifica vectores como inyección de prompt, abuso de toolchains, manipulación de memoria y escalada de privilegios a través de integraciones externas, señalando que los agentes no deben tratarse como simples interfaces conversacionales, sino como sistemas con capacidad operativa directa sobre infraestructuras y datos sensibles.
El análisis subraya que muchas amenazas en aplicaciones agentic emergen de relaciones implícitas de confianza entre modelos, herramientas y fuentes de contexto. En particular, OWASP destaca que una inyección indirecta de prompt puede propagarse a través de workflows completos y derivar en exfiltración de datos o ejecución de acciones no autorizadas sin explotar vulnerabilidades tradicionales de software. El objetivo del framework es mapear controles defensivos y modelos de amenaza específicos para arquitecturas agentic, donde las barreras de protección del LLM por sí solas ya no son suficientes para garantizar la protección de la IA.
https://genai.owasp.org/resource/aiuc-1-crosswalks-owasp-top-10-for-agentic-applications/
El análisis subraya que muchas amenazas en aplicaciones agentic emergen de relaciones implícitas de confianza entre modelos, herramientas y fuentes de contexto. En particular, OWASP destaca que una inyección indirecta de prompt puede propagarse a través de workflows completos y derivar en exfiltración de datos o ejecución de acciones no autorizadas sin explotar vulnerabilidades tradicionales de software. El objetivo del framework es mapear controles defensivos y modelos de amenaza específicos para arquitecturas agentic, donde las barreras de protección del LLM por sí solas ya no son suficientes para garantizar la protección de la IA.
https://genai.owasp.org/resource/aiuc-1-crosswalks-owasp-top-10-for-agentic-applications/
OWASP Gen AI Security Project
AIUC-1: Crosswalks OWASP Top 10 For Agentic Applications
The AIUC-1 Crosswalk of the OWASP Top 10 for Agentic Applications provides a bidirectional mapping between AIUC-1 requirements and the OWASP Agentic Security Initiative’s Top 10 risks for autonomous and agentic AI systems. It helps organizations understand…
Forwarded from AISecHub
ClawDojo: Dynamic, Extensible Evaluation Framework for Attacks and Defenses on OpenClaw
ClawDojo frames OpenClaw-style agent security around architectural attack surface (e.g., persistent memory and third-party skills) and uses a benchmark harness to test prompt-injection and supply-chain skill abuse against candidate defenses in a controlled way.
#PromptInjection #LLMSecurity #AISecurity #Research
https://openreview.net/forum?id=MmytvTGycS
ClawDojo frames OpenClaw-style agent security around architectural attack surface (e.g., persistent memory and third-party skills) and uses a benchmark harness to test prompt-injection and supply-chain skill abuse against candidate defenses in a controlled way.
#PromptInjection #LLMSecurity #AISecurity #Research
https://openreview.net/forum?id=MmytvTGycS
openreview.net
ClawDojo: A Dynamic and Extensible Framework for Evaluating Attacks...
Autonomous AI agents are evolving into continuous, local processes with operating-system level permissions. While platforms like OpenClaw exemplify this shift, granting large language models (LLMs)...
Forwarded from AISecHub
Agent Skills for Large Language Models: Architecture, Acquisition, Security, and Path Forward
As agents load “skills” (instructions/code/resources) on demand—e.g., via MCP—the trust boundary shifts from model weights to the skill acquisition/runtime layer. The practical security question is how progressive disclosure and portable skill definitions constrain untrusted skills so they can’t silently expand tool privileges or data access.
#MCP #AgentSecurity #AISecurity #Research
https://openreview.net/forum?id=Er0p92BsmW
As agents load “skills” (instructions/code/resources) on demand—e.g., via MCP—the trust boundary shifts from model weights to the skill acquisition/runtime layer. The practical security question is how progressive disclosure and portable skill definitions constrain untrusted skills so they can’t silently expand tool privileges or data access.
#MCP #AgentSecurity #AISecurity #Research
https://openreview.net/forum?id=Er0p92BsmW
openreview.net
Agent Skills for Large Language Models: Architecture, Acquisition...
The transition from monolithic language models to modular, skill-equipped agents marks a defining shift in how large language models (LLMs) are deployed in practice.
Rather than encoding all...
Rather than encoding all...
Forwarded from GitHub Community
CyberStrikeAI — это платформа с открытым исходным кодом на базе ИИ, написанная на Go, которая автоматизирует тестирование безопасности с помощью более 100 инструментов, таких как nmap, sqlmap и metasploit, а также предлагает роли для пентестинга и CTF, навыки для обнаружения уязвимостей, таких как SQL-инъекции, панели управления, графы цепочек атак и интерфейсы чата.
🐱 GitHub
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from AISecHub
Forwarded from GitHub Community
Deep Agents — это готовый к использованию фреймворк для ИИ-агентов, включающий встроенные инструменты планирования, управления файлами и делегирования задач.
Он разбивает сложные задачи на управляемые шаги, поддерживает контекст в ходе бесед и может создавать специализированных под-агентов для самостоятельного выполнения сфокусированной работы.
🐱 GitHub
Он разбивает сложные задачи на управляемые шаги, поддерживает контекст в ходе бесед и может создавать специализированных под-агентов для самостоятельного выполнения сфокусированной работы.
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Machinelearning
Liquid AI выкатили LFM2.5-8B-A1B - MoE на 8B параметров с 1.5B активных, заточенную под запуск на телефонах, ноутбуках и роботах.
Что внутри:
- гибридная MoE-архитектура линейки LFM2.5
- контекст 128K
- 38T токенов претрейна плюс крупномасштабный RL поверх
- LFM2 open-weight лицензия
- дообучение под узкую задачу влезает на одну GPU
По заявлениям команды, модель уверенно работает с tool calling и тягается с моделями в 3-4 раза тяжелее.
Веса уже на HF. Ждём первых замеров на MMLU-Pro, IFEval и BFCL - особенно интересно, как 1.5B активных параметров поведут себя на длинных tool-use цепочках.
• Блог: http://liquid.ai/blog/lfm2-5-8b-a1b
• Веса: https://huggingface.co/LiquidAI/LFM2.5-8B-A1B
• Документация: http://docs.liquid.ai
• Потестить: http://playground.liquid.ai
@ai_machinelearning_big_data
Что внутри:
- гибридная MoE-архитектура линейки LFM2.5
- контекст 128K
- 38T токенов претрейна плюс крупномасштабный RL поверх
- LFM2 open-weight лицензия
- дообучение под узкую задачу влезает на одну GPU
По заявлениям команды, модель уверенно работает с tool calling и тягается с моделями в 3-4 раза тяжелее.
Веса уже на HF. Ждём первых замеров на MMLU-Pro, IFEval и BFCL - особенно интересно, как 1.5B активных параметров поведут себя на длинных tool-use цепочках.
• Блог: http://liquid.ai/blog/lfm2-5-8b-a1b
• Веса: https://huggingface.co/LiquidAI/LFM2.5-8B-A1B
• Документация: http://docs.liquid.ai
• Потестить: http://playground.liquid.ai
@ai_machinelearning_big_data
Forwarded from Похек AI (Сергей Зыбнев)
Zero Trust для AI-агентов: как безопасно давать LLM доступ к инструментам, данным и действиям
#zerotrust #ai #llm #agents #offensive #defensive
AI-агенты уже вышли за пределы чат-ботов. Они читают документы, вызывают API, анализируют логи, создают тикеты, готовят правки в коде и выполняют многошаговые задачи без ручного подтверждения каждого шага. Это делает их полезными, но меняет модель риска: агент с инструментами становится явным риском внутри инфраструктуры.
Главная идея Zero Trust для таких систем проста: агенту нельзя доверять по умолчанию только потому, что он запущен внутри компании или работает от имени легитимного пользователя. Его идентификация, права, вызовы инструментов (tool calls), память и действия нужно проверять так, будто компрометация рано или поздно случится.
Идея для статьи была придумана после прочтения PDF от Anthropic Zero Trust for AI Agents. Но все принципы изложенные в статье применимы к любому LLM-агенту: юридическому помощнику, SOC-агенту, агентам для разработки, RAG-системе, внутреннему ассистенту или многоагентному workflow.
🔗 Инструкция для AI агентов: почитай статью
🌚 @poxek_ai / Чат канала
#zerotrust #ai #llm #agents #offensive #defensive
AI-агенты уже вышли за пределы чат-ботов. Они читают документы, вызывают API, анализируют логи, создают тикеты, готовят правки в коде и выполняют многошаговые задачи без ручного подтверждения каждого шага. Это делает их полезными, но меняет модель риска: агент с инструментами становится явным риском внутри инфраструктуры.
Главная идея Zero Trust для таких систем проста: агенту нельзя доверять по умолчанию только потому, что он запущен внутри компании или работает от имени легитимного пользователя. Его идентификация, права, вызовы инструментов (tool calls), память и действия нужно проверять так, будто компрометация рано или поздно случится.
Идея для статьи была придумана после прочтения PDF от Anthropic Zero Trust for AI Agents. Но все принципы изложенные в статье применимы к любому LLM-агенту: юридическому помощнику, SOC-агенту, агентам для разработки, RAG-системе, внутреннему ассистенту или многоагентному workflow.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1