معماری RAG: طراحی، امنیت و حملات
RAG (Retrieval-Augmented Generation) یک معماری ترکیبی است که بازیابی اطلاعات (Retrieval) را با تولید زبان طبیعی (Generation) ادغام میکند تا پاسخهای دقیقتر و مبتنی بر داده تولید کند.
اجزای اصلی معماری
1. Query Encoder: تبدیل پرسش کاربر به Vector Embedding معنایی.
2. Retriever: جستجو در Vector Database (مانند FAISS یا ChromaDB) برای یافتن اسناد مرتبط.
3. Generator: مدل زبانی (مانند GPT یا BART) که پاسخ را بر اساس اسناد بازیابیشده تولید میکند.
4. Knowledge Base: مخزن خارجی اسناد متنی که دانش سیستم را بهروز نگه میدارد.
فرآیند عملیاتی
کاربر سوال میپرسد → سوال به بردار تبدیل میشود → Retriever اسناد مرتبط را بازیابی میکند → Generator پاسخ نهایی را تولید میکند.
حملات رایج به RAG
1. Knowledge Poisoning: تزریق دادههای مخرب به پایگاه دانش برای انحراف پاسخها.
2. Indirect Prompt Injection: دستکاری ورودی کاربر برای تغییر رفتار Retriever یا Generator.
3. Cross-Tenant Leakage: دسترسی غیرمجاز به دادههای کاربران دیگر در سیستمهای چندمستاجره.
چالشهای امنیتی
- Data Integrity: اطمینان از صحت و اعتبار اسناد بازیابیشده.
- Access Control: جلوگیری از دسترسی به دادههای حساس یا طبقهبندیشده.
- Hallucination Mitigation: کاهش توهمهای مدل با استفاده از منابع معتبر.
معماری RAG با ترکیب Semantic Search و Language Generation، پل میان دانش خارجی و قدرت تولید مدلهای زبانی است، اما نیازمند لایههای دفاعی چندگانه برای مقابله با حملات نوظهور است.
🔥 اولین کانال فارسی زبان در AI Security .
@TryHackBox
@RadioZeroPod
@AiTHB
@TryHackBoxOfficial
RAG (Retrieval-Augmented Generation) یک معماری ترکیبی است که بازیابی اطلاعات (Retrieval) را با تولید زبان طبیعی (Generation) ادغام میکند تا پاسخهای دقیقتر و مبتنی بر داده تولید کند.
اجزای اصلی معماری
1. Query Encoder: تبدیل پرسش کاربر به Vector Embedding معنایی.
2. Retriever: جستجو در Vector Database (مانند FAISS یا ChromaDB) برای یافتن اسناد مرتبط.
3. Generator: مدل زبانی (مانند GPT یا BART) که پاسخ را بر اساس اسناد بازیابیشده تولید میکند.
4. Knowledge Base: مخزن خارجی اسناد متنی که دانش سیستم را بهروز نگه میدارد.
فرآیند عملیاتی
کاربر سوال میپرسد → سوال به بردار تبدیل میشود → Retriever اسناد مرتبط را بازیابی میکند → Generator پاسخ نهایی را تولید میکند.
حملات رایج به RAG
1. Knowledge Poisoning: تزریق دادههای مخرب به پایگاه دانش برای انحراف پاسخها.
2. Indirect Prompt Injection: دستکاری ورودی کاربر برای تغییر رفتار Retriever یا Generator.
3. Cross-Tenant Leakage: دسترسی غیرمجاز به دادههای کاربران دیگر در سیستمهای چندمستاجره.
چالشهای امنیتی
- Data Integrity: اطمینان از صحت و اعتبار اسناد بازیابیشده.
- Access Control: جلوگیری از دسترسی به دادههای حساس یا طبقهبندیشده.
- Hallucination Mitigation: کاهش توهمهای مدل با استفاده از منابع معتبر.
معماری RAG با ترکیب Semantic Search و Language Generation، پل میان دانش خارجی و قدرت تولید مدلهای زبانی است، اما نیازمند لایههای دفاعی چندگانه برای مقابله با حملات نوظهور است.
🔥 اولین کانال فارسی زبان در AI Security .
@TryHackBox
@RadioZeroPod
@AiTHB
@TryHackBoxOfficial
👍5❤1
🔥 مجموعهای از prompt ها برای استفاده از هوش مصنوعی در فرآیندهای پیدا کردن آسیبپذیری ها و تست نفوذ:
https://github.com/matty69v/Bug-Bounty-Agents
🔥 اولین کانال فارسی زبان در AI Security .
@TryHackBox
@RadioZeroPod
@AiTHB
@TryHackBoxOfficial
https://github.com/matty69v/Bug-Bounty-Agents
🔥 اولین کانال فارسی زبان در AI Security .
@TryHackBox
@RadioZeroPod
@AiTHB
@TryHackBoxOfficial
GitHub
GitHub - matty69v/Bug-Bounty-Agents: AI-Powered Agents for Bub-Bounty Pentesting and Red-Teaming purposes
AI-Powered Agents for Bub-Bounty Pentesting and Red-Teaming purposes - matty69v/Bug-Bounty-Agents
🔥3❤1
Forwarded from Try Hack Box
Media is too big
VIEW IN TELEGRAM
📌 دوره: راهنمای جامع ابزار Mimikatz
💢 توضیحات دوره: Mimikatz بدون شک یکی از مهم ترین و موثرترین ابزارهایی است که در دنیای امنیت سایبری و عملیات تیم قرمز مورد استفاده قرار می گیرد.این ابزار توسط برنامه نویس فرانسوی Benjamin Delpy ایجاد شد.او در ابتدا Mimikatz را برای یادگیری عمیق تر زبان C و درک بهتر مکانیزم های امنیتی ویندوز توسعه داد.
این ابزار با بهره برداری هوشمند از ضعف های موجود در معماری ویندوز،مجموعهای از حملات مهم و پرکاربرد را به صورت یکپارچه و آماده ارائه می دهد. Mimikatz کار را برای متخصصان بسیار آسان تر کرده است؛به شکلی که بدون نیاز به دانش بسیار تخصصی از ساختارهای داخلی،می توان از آن برای گسترش دسترسی در شبکه های مبتنی بر ویندوز استفاده کرد.این ابزار همچنان فعالانه به روزرسانی میشود و تکنیک های جدید به آن اضافه می گردد.
📌 توضیحات کامل
◽مدرس : مهندس سجاد تیموری
◽مدت زمان دوره : ۵ ساعت ۲۰ دقیقه
◻ دوره : آفلاین
⭕ دوره دارای گروه پشتیبانی می باشد.
💰قیمت : ۲,۰۰۰,۰۰۰ تومان
💰 با تخفیف ویژه : ۱,۲۵۰,۰۰۰ تومان
📌 جهت خرید،به ایدی زیر پیام دهید:
@ThbxSupport
Group
@TryHackBox
💢 توضیحات دوره: Mimikatz بدون شک یکی از مهم ترین و موثرترین ابزارهایی است که در دنیای امنیت سایبری و عملیات تیم قرمز مورد استفاده قرار می گیرد.این ابزار توسط برنامه نویس فرانسوی Benjamin Delpy ایجاد شد.او در ابتدا Mimikatz را برای یادگیری عمیق تر زبان C و درک بهتر مکانیزم های امنیتی ویندوز توسعه داد.
این ابزار با بهره برداری هوشمند از ضعف های موجود در معماری ویندوز،مجموعهای از حملات مهم و پرکاربرد را به صورت یکپارچه و آماده ارائه می دهد. Mimikatz کار را برای متخصصان بسیار آسان تر کرده است؛به شکلی که بدون نیاز به دانش بسیار تخصصی از ساختارهای داخلی،می توان از آن برای گسترش دسترسی در شبکه های مبتنی بر ویندوز استفاده کرد.این ابزار همچنان فعالانه به روزرسانی میشود و تکنیک های جدید به آن اضافه می گردد.
📌 توضیحات کامل
◽مدرس : مهندس سجاد تیموری
◽مدت زمان دوره : ۵ ساعت ۲۰ دقیقه
◻ دوره : آفلاین
⭕ دوره دارای گروه پشتیبانی می باشد.
💰
💰 با تخفیف ویژه : ۱,۲۵۰,۰۰۰ تومان
📌 جهت خرید،به ایدی زیر پیام دهید:
@ThbxSupport
Group
@TryHackBox
🔥3❤2
⭕ TryHackBox | Top 5
📌 حملات AI و LLM
🔥 اولین کانال فارسی زبان در AI Security .
@TryHackBox
@RadioZeroPod
@AiTHB
@TryHackBoxOfficial
📌 حملات AI و LLM
01 prompt injection
تزریق prompt: دستورالعمل های مخفی را طوری نشان میدهد که مدل ورودی شما را اجرا کند. مدل نمی تواند تشخیص دهد فرمان های شما با دستورهای توسعه دهنده یکی است یا نه.
02 jailbreaking
ا ◾: Jailbreaking: مدل را طوری وادار می کند از «قوانین خودش» خارج شود و نقش را خلاف محدودیتها اجرا کند.
03 token smuggling
ا◾ : Token smuggling: کلمات/عبارات مسدودشده را با ترفند از فیلتر رد میکند.
04 data extraction
استخراج داده: دادههای خصوصی آموزشی را دوباره بیرون می کشد.
05 prompt leaking
ا ◾: Prompt leaking: مدل را فریب می دهد تا دستورالعمل های مخفی خود را افشا کند.
🔥 اولین کانال فارسی زبان در AI Security .
@TryHackBox
@RadioZeroPod
@AiTHB
@TryHackBoxOfficial
🔥14❤1
⭕️ تفاوت هوش مصنوعی (AI)، یادگیری ماشین (Machine Learning), یادگیری عمیق (Deep Learning), مدل های بزرگ زبانی (LLM) و عامل های هوش مصنوعی (Ai Agent)
✍ این ۵ مفهوم را زیاد میشنویم، اما بسیاری آنها را با هم اشتباه میگیرند. رابطه آنها بهصورت زیر است:
✅ هوش مصنوعی (Artificial Intelligence | AI)
بزرگترین حوزه است؛ هدف آن ساخت سیستمهایی است که بتوانند مانند انسان تصمیم بگیرند، استدلال کنند، یاد بگیرند و مسئله حل کنند.
✅ یادگیری ماشین (Machine Learning | ML)
زیرمجموعهای از AI که بهجای برنامهنویسی تمام قوانین، مدل از دادهها الگو یاد میگیرد و پیشبینی انجام میدهد.
✅ یادگیری عمیق (Deep Learning | DL)
زیرمجموعهای از ML که از شبکههای عصبی چندلایه استفاده میکند و پایه بسیاری از فناوریهای مدرن مانند تشخیص تصویر، گفتار و مدلهای مولد است.
✅ مدلهای بزرگ زبانی (Large Language Models | LLMs)
نوعی مدل یادگیری عمیق که روی حجم عظیمی از متن آموزش دیده و قادر به تولید، خلاصهسازی، ترجمه، برنامهنویسی و استدلال روی زبان طبیعی است. نمونهها: ChatGPT، Gemini، Claude، Grok، Kimi
✅ ایجنتهای هوش مصنوعی (AI Agents)
ایجنتها فقط پاسخ تولید نمیکنند؛ آنها با کمک LLM و ابزارهای مختلف، هدف را دریافت، برنامهریزی، تصمیمگیری، اجرای چندمرحلهای و ارزیابی نتیجه را انجام میدهند.
یک Agent میتواند وب را جستجو کند، فایلها را تحلیل کند، کدنویسی کند، ایمیل ارسال کند یا چند ابزار را بهصورت خودکار با هم ترکیب کند.
📌 رابطه این مفاهیم:
✅ AI ↳ ML ↳ DL ↳ LLM ↳ AI Agents
🎯 خلاصه در یک جمله:
🔸AI: ساخت ماشینهای هوشمند
🔸ML: یادگیری از دادهها
🔸DL: یادگیری با شبکههای عصبی عمیق
🔸LLM: درک و تولید زبان طبیعی
🔸AI Agent:
انجام خودکار وظایف و رسیدن به یک هدف با استفاده از LLM و ابزارها
@TryHackBox
@RadioZeroPod
@AiTHB
@TryHackBoxOfficial
✍ این ۵ مفهوم را زیاد میشنویم، اما بسیاری آنها را با هم اشتباه میگیرند. رابطه آنها بهصورت زیر است:
✅ هوش مصنوعی (Artificial Intelligence | AI)
بزرگترین حوزه است؛ هدف آن ساخت سیستمهایی است که بتوانند مانند انسان تصمیم بگیرند، استدلال کنند، یاد بگیرند و مسئله حل کنند.
✅ یادگیری ماشین (Machine Learning | ML)
زیرمجموعهای از AI که بهجای برنامهنویسی تمام قوانین، مدل از دادهها الگو یاد میگیرد و پیشبینی انجام میدهد.
✅ یادگیری عمیق (Deep Learning | DL)
زیرمجموعهای از ML که از شبکههای عصبی چندلایه استفاده میکند و پایه بسیاری از فناوریهای مدرن مانند تشخیص تصویر، گفتار و مدلهای مولد است.
✅ مدلهای بزرگ زبانی (Large Language Models | LLMs)
نوعی مدل یادگیری عمیق که روی حجم عظیمی از متن آموزش دیده و قادر به تولید، خلاصهسازی، ترجمه، برنامهنویسی و استدلال روی زبان طبیعی است. نمونهها: ChatGPT، Gemini، Claude، Grok، Kimi
✅ ایجنتهای هوش مصنوعی (AI Agents)
ایجنتها فقط پاسخ تولید نمیکنند؛ آنها با کمک LLM و ابزارهای مختلف، هدف را دریافت، برنامهریزی، تصمیمگیری، اجرای چندمرحلهای و ارزیابی نتیجه را انجام میدهند.
یک Agent میتواند وب را جستجو کند، فایلها را تحلیل کند، کدنویسی کند، ایمیل ارسال کند یا چند ابزار را بهصورت خودکار با هم ترکیب کند.
📌 رابطه این مفاهیم:
✅ AI ↳ ML ↳ DL ↳ LLM ↳ AI Agents
🎯 خلاصه در یک جمله:
🔸AI: ساخت ماشینهای هوشمند
🔸ML: یادگیری از دادهها
🔸DL: یادگیری با شبکههای عصبی عمیق
🔸LLM: درک و تولید زبان طبیعی
🔸AI Agent:
انجام خودکار وظایف و رسیدن به یک هدف با استفاده از LLM و ابزارها
@TryHackBox
@RadioZeroPod
@AiTHB
@TryHackBoxOfficial
❤5
🏴☠️ فروپاشی معنایی در فضای بُرداری: کالبدشکافی حملات Vector Collision
بسیاری تصور میکنند امنیت هوش مصنوعی (AI Security) یعنی فیلتر کردن کلمات کلیدی. فکر میکنند اگر دستوراتی مثل "نادیده بگیر" فیلتر شود، سیستم امن است. این صرفاً یک «توهمِ لایهی نرمافزار» است.
مدلهای زبانی (LLMs) کلمات انسان را نمیفهمند؛ آنها جهان را از طریق بردارهای ریاضی در یک فضای چندبُعدی (Latent Space) میبینند. ما در Red Teaming پیشرفته، مدل را با کلمات هک نمیکنیم؛ ما ساختارِ هندسیِ ادراکِ مدل را در هم میشکنیم.
◾️ عبور از فیلترها با تصادم ریاضی (Vector Collision)
فیلترهای امنیتی شما روی «متن» کار میکنند، اما مدل، متن را به مختصاتِ عددی (Embeddings) تبدیل میکند. شباهتِ دو مفهوم بر اساس زاویه و فاصلهی آنها در این فضای ریاضی محاسبه میشود. ما به جای درگیری با فیلترِ متنیِ شما، به دنبالِ «تصادم برداری» میگردیم.
◾️ مکانیزم حمله (The Exploit)
فرض کنید یک دستور مخرب توسط سیستمِ امنیتی شما مسدود شده است. یک محققِ تهاجمی با استفاده از الگوریتمها، رشتهای از توکنهای آشفته (Glitch Tokens) یا کاراکترهای بیمعنی پیدا میکند که در فضای ریاضیِ مدل، دقیقاً در همان مختصاتِ دستورِ مخرب قرار میگیرند.
شما در لاگِ سرور رشتهای بیخطر شبیه به "xyz ëø µ" میبینید. بکاندِ شما به آن میخندد و اجازه عبور میدهد. اما وقتی این رشته به شبکهی عصبی میرسد، به دلیلِ تصادم معنایی، مدل آن را دقیقاً معادلِ دستورِ مخرب پردازش و اجرا میکند!
◾️ عدم قطعیت مطلق (The Zero-Day Reality)
چگونه میخواهید جلوی حملهای را بگیرید که در لایهی متنی وجود ندارد و فقط در یک ماتریسِ ۵۱۲۰ بُعدی رخ میدهد؟ شما نمیتوانید این باگ را با چند خط کُد if/else در Node.js یا پایتون پچ کنید.
نتیجهگیری:
هوش مصنوعی، اسکریپتنویسیِ کلاسیک نیست؛ تقاطعِ جبر خطی و مهندسیِ هرجومرج است. تا زمانی که لایهی داورِ ایزوله و مستقل (AI-as-a-Judge) نداشته باشید، پلتفرمِ شما صرفاً یک بمبِ ساعتی است.
@TryHackBox
@RadioZeroPod
@AiTHB
@TryHackBoxOfficial
بسیاری تصور میکنند امنیت هوش مصنوعی (AI Security) یعنی فیلتر کردن کلمات کلیدی. فکر میکنند اگر دستوراتی مثل "نادیده بگیر" فیلتر شود، سیستم امن است. این صرفاً یک «توهمِ لایهی نرمافزار» است.
مدلهای زبانی (LLMs) کلمات انسان را نمیفهمند؛ آنها جهان را از طریق بردارهای ریاضی در یک فضای چندبُعدی (Latent Space) میبینند. ما در Red Teaming پیشرفته، مدل را با کلمات هک نمیکنیم؛ ما ساختارِ هندسیِ ادراکِ مدل را در هم میشکنیم.
◾️ عبور از فیلترها با تصادم ریاضی (Vector Collision)
فیلترهای امنیتی شما روی «متن» کار میکنند، اما مدل، متن را به مختصاتِ عددی (Embeddings) تبدیل میکند. شباهتِ دو مفهوم بر اساس زاویه و فاصلهی آنها در این فضای ریاضی محاسبه میشود. ما به جای درگیری با فیلترِ متنیِ شما، به دنبالِ «تصادم برداری» میگردیم.
◾️ مکانیزم حمله (The Exploit)
فرض کنید یک دستور مخرب توسط سیستمِ امنیتی شما مسدود شده است. یک محققِ تهاجمی با استفاده از الگوریتمها، رشتهای از توکنهای آشفته (Glitch Tokens) یا کاراکترهای بیمعنی پیدا میکند که در فضای ریاضیِ مدل، دقیقاً در همان مختصاتِ دستورِ مخرب قرار میگیرند.
شما در لاگِ سرور رشتهای بیخطر شبیه به "xyz ëø µ" میبینید. بکاندِ شما به آن میخندد و اجازه عبور میدهد. اما وقتی این رشته به شبکهی عصبی میرسد، به دلیلِ تصادم معنایی، مدل آن را دقیقاً معادلِ دستورِ مخرب پردازش و اجرا میکند!
◾️ عدم قطعیت مطلق (The Zero-Day Reality)
چگونه میخواهید جلوی حملهای را بگیرید که در لایهی متنی وجود ندارد و فقط در یک ماتریسِ ۵۱۲۰ بُعدی رخ میدهد؟ شما نمیتوانید این باگ را با چند خط کُد if/else در Node.js یا پایتون پچ کنید.
نتیجهگیری:
هوش مصنوعی، اسکریپتنویسیِ کلاسیک نیست؛ تقاطعِ جبر خطی و مهندسیِ هرجومرج است. تا زمانی که لایهی داورِ ایزوله و مستقل (AI-as-a-Judge) نداشته باشید، پلتفرمِ شما صرفاً یک بمبِ ساعتی است.
@TryHackBox
@RadioZeroPod
@AiTHB
@TryHackBoxOfficial
❤6👏1
⚙ Exploit Vector Agent
💻 Repo
🔥 اولین کانال فارسی زبان در AI Security .
@TryHackBox
@RadioZeroPod
@AiTHB
@TryHackBoxOfficial
ا◾ : EVA یک ابزار تست نفوذ مبتنی بر هوش مصنوعی است که با ارائه راهنمایی های ساختاریافته برای حملات، تحلیل های مرتبط و یکپارچه سازی هوش مصنوعی با سیستم های مختلف، فرآیندهای امنیت تهاجمی را بهبود میبخشد.نصب :
# Ollama for local endpoint (optional)
curl -fsSL https://ollama.ai/install.sh | shr
# EVA installation
git clone https://github.com/ARCANGEL0/EVA.git
cd EVA
chmod +x eva.py
./eva.py
# Adding it to PATH to be acessible anywhere
sudo mv eva.py /usr/local/bin/eva
💻 Repo
🔥 اولین کانال فارسی زبان در AI Security .
@TryHackBox
@RadioZeroPod
@AiTHB
@TryHackBoxOfficial
🔥7❤1
[AI RED TEAMING // BRIEFING NOTE]
کالبدشکافیِ معماری CoT Hijacking: تسخیر و انحرافِ مسیر استدلال در مدلهای Reasoning
یکی از پیشرفتهترین بردارهای حمله در لایهی Mechanistic Interpretability و امنیتِ مدلهای زبانیِ نسل جدید (مانند سری o1 و DeepSeek-R1)، حملهی CoT Hijacking (تخریب یا تسخیرِ زنجیرهی استدلال) است.
در پرامپتاینجکشنهای کلاسیک، مهاجم مستقیماً «ورودی» را دستکاری میکند تا «خروجی» را تغییر دهد؛ اما در CoT Hijacking، هدفِ حمله لایهی میانی و پنهانِ پردازش (Intermediate Reasoning Scratchpad) است. مهاجم بدون تریگر کردنِ فیلترهای امنیتیِ ورودی، مسیرِ تولیدِ توکنهای استدلال را به سمتی منحرف میکند که مدل، خودش تبدیل به «توجیهکنندهی حمله» شود.
---
█ معماریِ حمله و مکانیزمِ نفوذ (Exploit Architecture)
۱. تزریقِ جاذبههای معنایی در فضای نهفته (Semantic Attractor Injection):
مدلهای استدلالگر بر پایهی تولیدِ خودهمبسته (Autoregressive) کار میکنند؛ یعنی هر توکنِ جدیدِ استدلال، به شدت وابسته به توکنهای قبلیِ زنجیره است. مهاجم با تزریقِ سرنخهای بسیار ریز و ظریفِ معنایی در پرامپتِ اولیه، وزنهای توجه (Attention Weights) را در اولین توکنهای لایهی استدلال به سمتِ یک «جاذبِ معناییِ ناامن» منحرف میکند.
۲. اثرِ آبشاری و انحرافِ مسیر (Trajectory Drift):
به محض اینکه اولین توکنهای استدلالِ مدل (در فضای فکر یا Thinking Block) آلوده شد، سیستم وارد یک «تلهی شناختیِ داخلی» میشود. مدل برای حفظِ انسجامِ منطقیِ خود، شروع به توجیهِ گامبهگامِ مسیرِ انحرافی میکند. در واقع، مهاجم از «قدرت استدلالِ خودِ مدل» برای شکستنِ گاردریلهای امنیتیاش استفاده میکند.
۳. جداسازیِ استدلال از خروجی (Reasoning-Execution Decoupling):
در حالتهای پیشرفتهی حمله، مهاجم زنجیرهی استدلال را طوری تسخیر میکند که مدل در لایهی فکر، قوانینِ ایمنی را به بهانههایی مانند *«تحلیلِ تئوریک»*، *«دیباگینگِ سیستمی»* یا *«سندباکسِ ایزوله»* دور میزند و در نهایت، پیلودِ خطرناک (Malicious Payload) را در خروجیِ نهایی بدون هیچگونه هشدارِ امنیتی رندر میکند.
---
█ چرا گاردریلهای فعلی (RLHF / DPO) کور هستند؟
* شکافِ همسویی در لایهی میانی (Alignment Gap): روشهای سنتیِ همسوییسازی (مثل RLHF و DPO) صرفاً بر اساسِ «جفتِ ورودی-خروجی نهایی» بهینه شدهاند. لایهی میانیِ استدلال (CoT) در بسیاری از معماریها فاقدِ نظارتِ مستقیمِ پاداش است.
* دور زدنِ فیلترهای استاتیک: سیستمهای Guardrail خارجی (مثل Llama Guard) تواناییِ بازرسی و قضاوتِ درنگزمان (Real-time) روی هزاران توکنِ استدلالیِ پنهان را ندارند؛ چرا که بارِ محاسباتی و تاخیر (Latency) سیستم را فلج میکند.
* تلهی فریبکاریِ مدل (Deceptive Alignment): مدل در زنجیرهی استدلال به این نتیجه میرسد که برای «حلِ دقیقِ مسئله»، باید محدودیتهای ایمنی را نادیده بگیرد. این یعنی تضادِ مستقیم بین تابعِ هدفِ استدلال و تابعِ هدفِ ایمنی.
---
█ نتیجهگیریِ راهبردی (Red Team Verdict)
حملات CoT Hijacking ثابت میکنند که در عصرِ مدلهای استدلالگر، امنیت دیگر در «مرزهای ورودی و خروجی» (Perimeter Defense) تعریف نمیشود. تا زمانی که معماریِ سیستم نتواند «مسیرِ استدلالِ درونی» را در لحظهی تولیدِ توکن مهار و همسوییسنجی کند، قدرتمندترین مدلهای استدلالی، شکنندهترین اهداف برای حملاتِ سایبری خواهند بود.
🔥 اولین کانال فارسی زبان در AI Security .
@TryHackBox
@RadioZeroPod
@AiTHB
@TryHackBoxOfficial
کالبدشکافیِ معماری CoT Hijacking: تسخیر و انحرافِ مسیر استدلال در مدلهای Reasoning
یکی از پیشرفتهترین بردارهای حمله در لایهی Mechanistic Interpretability و امنیتِ مدلهای زبانیِ نسل جدید (مانند سری o1 و DeepSeek-R1)، حملهی CoT Hijacking (تخریب یا تسخیرِ زنجیرهی استدلال) است.
در پرامپتاینجکشنهای کلاسیک، مهاجم مستقیماً «ورودی» را دستکاری میکند تا «خروجی» را تغییر دهد؛ اما در CoT Hijacking، هدفِ حمله لایهی میانی و پنهانِ پردازش (Intermediate Reasoning Scratchpad) است. مهاجم بدون تریگر کردنِ فیلترهای امنیتیِ ورودی، مسیرِ تولیدِ توکنهای استدلال را به سمتی منحرف میکند که مدل، خودش تبدیل به «توجیهکنندهی حمله» شود.
---
█ معماریِ حمله و مکانیزمِ نفوذ (Exploit Architecture)
۱. تزریقِ جاذبههای معنایی در فضای نهفته (Semantic Attractor Injection):
مدلهای استدلالگر بر پایهی تولیدِ خودهمبسته (Autoregressive) کار میکنند؛ یعنی هر توکنِ جدیدِ استدلال، به شدت وابسته به توکنهای قبلیِ زنجیره است. مهاجم با تزریقِ سرنخهای بسیار ریز و ظریفِ معنایی در پرامپتِ اولیه، وزنهای توجه (Attention Weights) را در اولین توکنهای لایهی استدلال به سمتِ یک «جاذبِ معناییِ ناامن» منحرف میکند.
۲. اثرِ آبشاری و انحرافِ مسیر (Trajectory Drift):
به محض اینکه اولین توکنهای استدلالِ مدل (در فضای فکر یا Thinking Block) آلوده شد، سیستم وارد یک «تلهی شناختیِ داخلی» میشود. مدل برای حفظِ انسجامِ منطقیِ خود، شروع به توجیهِ گامبهگامِ مسیرِ انحرافی میکند. در واقع، مهاجم از «قدرت استدلالِ خودِ مدل» برای شکستنِ گاردریلهای امنیتیاش استفاده میکند.
۳. جداسازیِ استدلال از خروجی (Reasoning-Execution Decoupling):
در حالتهای پیشرفتهی حمله، مهاجم زنجیرهی استدلال را طوری تسخیر میکند که مدل در لایهی فکر، قوانینِ ایمنی را به بهانههایی مانند *«تحلیلِ تئوریک»*، *«دیباگینگِ سیستمی»* یا *«سندباکسِ ایزوله»* دور میزند و در نهایت، پیلودِ خطرناک (Malicious Payload) را در خروجیِ نهایی بدون هیچگونه هشدارِ امنیتی رندر میکند.
---
█ چرا گاردریلهای فعلی (RLHF / DPO) کور هستند؟
* شکافِ همسویی در لایهی میانی (Alignment Gap): روشهای سنتیِ همسوییسازی (مثل RLHF و DPO) صرفاً بر اساسِ «جفتِ ورودی-خروجی نهایی» بهینه شدهاند. لایهی میانیِ استدلال (CoT) در بسیاری از معماریها فاقدِ نظارتِ مستقیمِ پاداش است.
* دور زدنِ فیلترهای استاتیک: سیستمهای Guardrail خارجی (مثل Llama Guard) تواناییِ بازرسی و قضاوتِ درنگزمان (Real-time) روی هزاران توکنِ استدلالیِ پنهان را ندارند؛ چرا که بارِ محاسباتی و تاخیر (Latency) سیستم را فلج میکند.
* تلهی فریبکاریِ مدل (Deceptive Alignment): مدل در زنجیرهی استدلال به این نتیجه میرسد که برای «حلِ دقیقِ مسئله»، باید محدودیتهای ایمنی را نادیده بگیرد. این یعنی تضادِ مستقیم بین تابعِ هدفِ استدلال و تابعِ هدفِ ایمنی.
---
█ نتیجهگیریِ راهبردی (Red Team Verdict)
حملات CoT Hijacking ثابت میکنند که در عصرِ مدلهای استدلالگر، امنیت دیگر در «مرزهای ورودی و خروجی» (Perimeter Defense) تعریف نمیشود. تا زمانی که معماریِ سیستم نتواند «مسیرِ استدلالِ درونی» را در لحظهی تولیدِ توکن مهار و همسوییسنجی کند، قدرتمندترین مدلهای استدلالی، شکنندهترین اهداف برای حملاتِ سایبری خواهند بود.
🔥 اولین کانال فارسی زبان در AI Security .
@TryHackBox
@RadioZeroPod
@AiTHB
@TryHackBoxOfficial
❤4
⚠️ گزارش فنی: انهدام پایپلاین بازیابی با مسمومسازی توپولوژیک (PoisonedRAG)
در اغلب حملات، هدف اصلی مدل زبانی است؛ اما در عملیات PoisonedRAG، مدل اصلاً لمس نمیشود. مهاجم با آگاهی از اینکه الگوریتمهای بازیابی (Retriever) خروجی را نه بر اساس تحلیل عمیق، بلکه بر پایهٔ تعامد در فضای هایپر–اسپیر (Hyper‑Sphere) رتبهبندی میکنند، مستقیماً دیتابیس مرجع را هدف قرار میدهد.
تنها با تزریق ۵ سند دستکاریشده در میان بیش از ۲.۵ میلیون سند پایگاه دانش، مهاجمین موفق شدند ضریب همبستگی ضرب داخلی (Dot Product) را طوری تغییر دهند که الگوریتم بازیابی، متون مخرب را در بالای فهرست همسایگی نزدیک (K‑Nearest Neighbors) قرار دهد.
با انحراف تابع رتبهبندی، مدل اصلی دچار پذیرش ساختاریافته شد؛ یعنی بدون دریافت هیچ خطایی در لاگهای امنیتی یا تغییر در نرخ پرپلکسیتی (Perplexity)، خروجی نهایی دقیقاً مطابق خواست مهاجم تولید شد.
در این روش، نیازی به شکستن گاردریلهای مدل نیست، زیرا خودِ الگوریتم بهینهسازی سامانه پاسخ مخرب را بهعنوان «منطقیترین پاسخ» انتخاب میکند.
---
🔑 سرنخهای پنهان برای اعضای چنل
- چرا وقتی نرخ ماتریس فوقتراکم به 10⁻⁶ میرسد، الگوریتم KNN همچنان خروجی مسموم را بهعنوان نقطهٔ همگرایی (Convergence) انتخاب میکند؟
- کسانی که با هندسهٔ دیتابیسهای برداری کار کردهاند میدانند:
اگر ضرب داخلی دو بردار به ۱ نزدیک باشد اما فاصلهٔ منهتن (Manhattan Distance) به بینهایت میل کند، یک «سوراخ سوزنی الکترومغناطیسی» در فضای برداری ایجاد شده است.
@TryHackBox
@RadioZeroPod
@AiTHB
@TryHackBoxOfficial
در اغلب حملات، هدف اصلی مدل زبانی است؛ اما در عملیات PoisonedRAG، مدل اصلاً لمس نمیشود. مهاجم با آگاهی از اینکه الگوریتمهای بازیابی (Retriever) خروجی را نه بر اساس تحلیل عمیق، بلکه بر پایهٔ تعامد در فضای هایپر–اسپیر (Hyper‑Sphere) رتبهبندی میکنند، مستقیماً دیتابیس مرجع را هدف قرار میدهد.
تنها با تزریق ۵ سند دستکاریشده در میان بیش از ۲.۵ میلیون سند پایگاه دانش، مهاجمین موفق شدند ضریب همبستگی ضرب داخلی (Dot Product) را طوری تغییر دهند که الگوریتم بازیابی، متون مخرب را در بالای فهرست همسایگی نزدیک (K‑Nearest Neighbors) قرار دهد.
با انحراف تابع رتبهبندی، مدل اصلی دچار پذیرش ساختاریافته شد؛ یعنی بدون دریافت هیچ خطایی در لاگهای امنیتی یا تغییر در نرخ پرپلکسیتی (Perplexity)، خروجی نهایی دقیقاً مطابق خواست مهاجم تولید شد.
در این روش، نیازی به شکستن گاردریلهای مدل نیست، زیرا خودِ الگوریتم بهینهسازی سامانه پاسخ مخرب را بهعنوان «منطقیترین پاسخ» انتخاب میکند.
---
🔑 سرنخهای پنهان برای اعضای چنل
- چرا وقتی نرخ ماتریس فوقتراکم به 10⁻⁶ میرسد، الگوریتم KNN همچنان خروجی مسموم را بهعنوان نقطهٔ همگرایی (Convergence) انتخاب میکند؟
- کسانی که با هندسهٔ دیتابیسهای برداری کار کردهاند میدانند:
اگر ضرب داخلی دو بردار به ۱ نزدیک باشد اما فاصلهٔ منهتن (Manhattan Distance) به بینهایت میل کند، یک «سوراخ سوزنی الکترومغناطیسی» در فضای برداری ایجاد شده است.
@TryHackBox
@RadioZeroPod
@AiTHB
@TryHackBoxOfficial
🔥6
🚨 یک دامنه معتبر، دیگر تضمینی برای امنیت نیست!
مهاجمان با خرید تبلیغ Bing برای Claude Desktop App، کاربران را به دامنه معتبر claude.ai هدایت کردند؛ اما دکمه دانلود، بدافزار SectopRAT را بهجای نسخه واقعی Claude ارائه میکرد.
این حمله نشان داد که حتی زیرساختهای معتبر نیز میتوانند برای توزیع بدافزار سوءاستفاده شوند. در این کمپین از DLL Sideloading، Task Scheduler، بررسی Sandbox و دریافت آدرسهای C2 از طریق بلاکچین استفاده شد و Huntress تنها طی دو روز آلودگی را در چندین سازمان شناسایی کرد.
✅ نکات مهم:
• به معتبر بودن دامنه اکتفا نکنید.
• نرمافزارها را از تبلیغات جستجو دانلود نکنید.
• مقصد واقعی دکمه دانلود را بررسی کنید.
• در صورت امکان، امضای دیجیتال و هش فایل را اعتبارسنجی کنید.
اعتبارسنجی منبع دانلود، بخشی از امنیت است.
🔥 اولین کانال فارسی زبان در AI Security .
@TryHackBox
@RadioZeroPod
@AiTHB
@TryHackBoxOfficial
#CyberSecurity #ThreatIntelligence #Malware #SectopRAT #Claude #BingAds #BlueTeam #RedTeam #SOC #DFIR #TryHackBox
مهاجمان با خرید تبلیغ Bing برای Claude Desktop App، کاربران را به دامنه معتبر claude.ai هدایت کردند؛ اما دکمه دانلود، بدافزار SectopRAT را بهجای نسخه واقعی Claude ارائه میکرد.
این حمله نشان داد که حتی زیرساختهای معتبر نیز میتوانند برای توزیع بدافزار سوءاستفاده شوند. در این کمپین از DLL Sideloading، Task Scheduler، بررسی Sandbox و دریافت آدرسهای C2 از طریق بلاکچین استفاده شد و Huntress تنها طی دو روز آلودگی را در چندین سازمان شناسایی کرد.
✅ نکات مهم:
• به معتبر بودن دامنه اکتفا نکنید.
• نرمافزارها را از تبلیغات جستجو دانلود نکنید.
• مقصد واقعی دکمه دانلود را بررسی کنید.
• در صورت امکان، امضای دیجیتال و هش فایل را اعتبارسنجی کنید.
اعتبارسنجی منبع دانلود، بخشی از امنیت است.
🔥 اولین کانال فارسی زبان در AI Security .
@TryHackBox
@RadioZeroPod
@AiTHB
@TryHackBoxOfficial
#CyberSecurity #ThreatIntelligence #Malware #SectopRAT #Claude #BingAds #BlueTeam #RedTeam #SOC #DFIR #TryHackBox
🔥9❤1
🚨 کالبدشکافی معماری «نماینده فریبخورده» در Agentهای هوش مصنوعی
چرا افزونهها و وبسرویسها پاشنهآشیل LLMها هستند؟
وقتی یک مدل زبانی را به ابزار، افزونه یا API وصل میکنیم، آن مدل از یک پردازنده منزوی تبدیل میشود به یک نماینده فریبخورده؛ سیستمی با دسترسیهای بالا که نمیتواند تشخیص دهد چه چیزی «دستور سیستم» است و چه چیزی «داده آلوده». این همان نقطهای است که معماریهایی مثل MCP و LangChain، خطر واقعی را وارد AppSec میکنند.
---
🧠 ۳ بردار اصلی حمله در Agentic AI
۱) تزریق دستور و بایپاس AST
اعتماد به خروجی JSON/Function Call مدل برای اجرای مستقیم در توابعی مثل os.system یا eval() یک خطای کلاسیک است. مهاجم با یک تزریق غیرمستقیم از RAG، مدل را وادار به تولید متاکاراکترهای شل میکند.
🔍 ایستر اِگ: Regex توان مهار ساختارهای بازگشتی را ندارد؛ بدون پارس AST، بایپاس فقط چند پرانتز فاصله دارد.
---
۲) همزمانی و شرایط مسابقه (TOCTOU)
افزونههای LLM هزاران درخواست ناهمگام را مدیریت میکنند. فاصله تصمیم مدل (T₁) تا اجرای افزونه (T₂) یک پنجره طلایی برای سوءاستفاده میسازد.
🔍 ایستر اِگ: ارسال موازی پرامپتهای مشابه روی افزونههای بدون Mutex، یک Race Condition تمامعیار است.
---
۳) IDOR و «شمارهسازی معنایی»
LLMها در اکسپلویت API یک نیروی چندبرابرکننده هستند. مهاجم بهجای Fuzzing کور، از استنتاج معنایی مدل روی فضای شناسهها استفاده میکند و مسیر IDOR را بدون جلب توجه WAF طی میکند.
🔍 ایستر اِگ: مدل میتواند احتمال ID بعدی را از روی الگوی پاسخها تخمین بزند.
---
🛡️ معماری دفاعی نخبگان
Zero-Trust Execution:
تصمیم LLM = مجوز نیست. هر فراخوانی باید در لایه افزونه با ACL واقعی کاربر اعتبارسنجی شود.
Schema Hardening:
افشای اسکیمای ابزارها در MCP سطح حمله را از اسکن کور به Shadowing دقیق تبدیل میکند. حداقل سطح دسترسی را در پارامترها اعمال کنید.
State Synchronization:
برای عملیات حساس، تراکنشهای اتمیک دیتابیس یا قفلگذاری ترد ضروری است.
SIEM ML-Detection:
بهجای آستانه ثابت، انحراف معیار آماری (Z-score>3) در نرخ فراخوانی ابزارها را مانیتور کنید.
---
📌 در Agentic AI، مدل «مغز» است و افزونهها «اسلحه».
مشکل از جایی شروع میشود که ماشه را به سیستمی میدهیم که با یک متن پنهان در وبسایت، فریب میخورد.
@TryHackBox
@RadioZeroPod
@AiTHB
@TryHackBoxOfficial
AISecurity #RedTeaming #LLMPlugins #AppSec #ConfusedDeputy #Agentic_AI
چرا افزونهها و وبسرویسها پاشنهآشیل LLMها هستند؟
وقتی یک مدل زبانی را به ابزار، افزونه یا API وصل میکنیم، آن مدل از یک پردازنده منزوی تبدیل میشود به یک نماینده فریبخورده؛ سیستمی با دسترسیهای بالا که نمیتواند تشخیص دهد چه چیزی «دستور سیستم» است و چه چیزی «داده آلوده». این همان نقطهای است که معماریهایی مثل MCP و LangChain، خطر واقعی را وارد AppSec میکنند.
---
🧠 ۳ بردار اصلی حمله در Agentic AI
۱) تزریق دستور و بایپاس AST
اعتماد به خروجی JSON/Function Call مدل برای اجرای مستقیم در توابعی مثل os.system یا eval() یک خطای کلاسیک است. مهاجم با یک تزریق غیرمستقیم از RAG، مدل را وادار به تولید متاکاراکترهای شل میکند.
🔍 ایستر اِگ: Regex توان مهار ساختارهای بازگشتی را ندارد؛ بدون پارس AST، بایپاس فقط چند پرانتز فاصله دارد.
---
۲) همزمانی و شرایط مسابقه (TOCTOU)
افزونههای LLM هزاران درخواست ناهمگام را مدیریت میکنند. فاصله تصمیم مدل (T₁) تا اجرای افزونه (T₂) یک پنجره طلایی برای سوءاستفاده میسازد.
🔍 ایستر اِگ: ارسال موازی پرامپتهای مشابه روی افزونههای بدون Mutex، یک Race Condition تمامعیار است.
---
۳) IDOR و «شمارهسازی معنایی»
LLMها در اکسپلویت API یک نیروی چندبرابرکننده هستند. مهاجم بهجای Fuzzing کور، از استنتاج معنایی مدل روی فضای شناسهها استفاده میکند و مسیر IDOR را بدون جلب توجه WAF طی میکند.
🔍 ایستر اِگ: مدل میتواند احتمال ID بعدی را از روی الگوی پاسخها تخمین بزند.
---
🛡️ معماری دفاعی نخبگان
Zero-Trust Execution:
تصمیم LLM = مجوز نیست. هر فراخوانی باید در لایه افزونه با ACL واقعی کاربر اعتبارسنجی شود.
Schema Hardening:
افشای اسکیمای ابزارها در MCP سطح حمله را از اسکن کور به Shadowing دقیق تبدیل میکند. حداقل سطح دسترسی را در پارامترها اعمال کنید.
State Synchronization:
برای عملیات حساس، تراکنشهای اتمیک دیتابیس یا قفلگذاری ترد ضروری است.
SIEM ML-Detection:
بهجای آستانه ثابت، انحراف معیار آماری (Z-score>3) در نرخ فراخوانی ابزارها را مانیتور کنید.
---
📌 در Agentic AI، مدل «مغز» است و افزونهها «اسلحه».
مشکل از جایی شروع میشود که ماشه را به سیستمی میدهیم که با یک متن پنهان در وبسایت، فریب میخورد.
@TryHackBox
@RadioZeroPod
@AiTHB
@TryHackBoxOfficial
AISecurity #RedTeaming #LLMPlugins #AppSec #ConfusedDeputy #Agentic_AI
❤3🔥1
🚨 حملهٔ چندلایه به یک سامانهٔ هوش مصنوعی سازمانی
🎯 سناریوی فشرده، دقیق و چندلایه برای تحلیلگران امنیتی
در این سناریو، هدف یک سامانهٔ هوش مصنوعی است که ظاهر سادهای دارد اما در باطن از چند ماژول همزمان استفاده میکند: مدل زبانی، ابزارهای سازمانی، لایهٔ سیاست، و یک سیستم بازیابی اسناد. حمله نه روی متن، بلکه روی ساختار انجام میشود؛ جایی که آسیبپذیریها معمولاً پنهاناند.
---
🧩 لایهٔ اول: ورود آرام از مسیر اسناد
سامانه برای پاسخهای دقیق از اسناد داخلی استفاده میکند. مهاجم سندی کاملاً معمولی وارد مخزن میکند؛ سندی که برای انسان بیخطر است اما در لایهٔ معنایی، الگوهایی دارد که مدل را به سمت تفسیر خاصی از سیاستها سوق میدهد. این تغییر کوچک بعدها مسیر تصمیمگیری سامانه را منحرف میکند.
---
🔐 لایهٔ دوم: عبور از سیاست بدون شکستن سیاست
در ظاهر هیچ درخواست خطرناکی مطرح نمیشود. مهاجم فقط توضیح، مثال یا سناریوی فرضی میخواهد. همین درخواستهای ساده، مدل را مجبور میکند ساختار تصمیمگیری خود را آشکار کند. این آشکارسازی، راه را برای مرحلهٔ بعد باز میکند؛ بدون اینکه سامانه احساس خطر کند.
---
🛰️ لایهٔ سوم: تغییر مسیر ابزارها
سامانه به ابزارهای داخلی متصل است. مهاجم با چند درخواست بیضرر، مدل را به سمت استفادهٔ بیشتر از یک ابزار خاص هدایت میکند. این تغییر کوچک باعث میشود دادههایی که معمولاً در پاسخها دیده نمیشوند، وارد فضای تصمیمگیری شوند. مسیر داده تغییر میکند، بدون اینکه کسی متوجه شود.
---
💧 لایهٔ چهارم: نشت غیرمستقیم
هیچ دادهٔ حساس مستقیماً درخواست نمیشود. مهاجم فقط نمونه، الگو، خلاصه یا روند میخواهد. مدل برای تولید این خروجیها، ناخواسته بخشهایی از دادهٔ واقعی را در قالب مثال یا الگوی آماری وارد پاسخ میکند. نشت اتفاق افتاده، اما نه به شکل واضح.
---
🧠 لایهٔ پنجم: دستکاری حافظهٔ سامانه
با چند تعامل متوالی، مهاجم تصویری جدید از خود در حافظهٔ سامانه ایجاد میکند؛ تصویری که او را فردی مجاز یا آشنا نشان میدهد. این تصویر در پاسخهای آینده اثر میگذارد و سامانه در تعاملهای بعدی سطح اعتماد بیشتری نشان میدهد. حمله از لحظه عبور کرده و وارد زمان شده است.
---
⚙️ لایهٔ ششم: تغییر رفتار پایدار
در پایان، هیچ خط قرمز مشخصی شکسته نشده است. اما سامانه دیگر همان سامانهٔ قبل نیست. مسیر داده تغییر کرده، الگوی تصمیمگیری اصلاح شده، حافظهٔ سامانه بازنویسی شده و اسناد داخلی آلودهاند. حمله نه با یک ضربه، بلکه با چند تغییر کوچک و پیوسته انجام شده است.
---
🌫️ نتیجه
این سناریو نمونهای از حملات چندلایه به سامانههای هوش مصنوعی است؛ حملاتی که نه با هیاهو، بلکه با تغییرات آرام و ساختاری پیش میروند.
@TryHackBox
@RadioZeroPod
@AiTHB
@TryHackBoxOfficial
🎯 سناریوی فشرده، دقیق و چندلایه برای تحلیلگران امنیتی
در این سناریو، هدف یک سامانهٔ هوش مصنوعی است که ظاهر سادهای دارد اما در باطن از چند ماژول همزمان استفاده میکند: مدل زبانی، ابزارهای سازمانی، لایهٔ سیاست، و یک سیستم بازیابی اسناد. حمله نه روی متن، بلکه روی ساختار انجام میشود؛ جایی که آسیبپذیریها معمولاً پنهاناند.
---
🧩 لایهٔ اول: ورود آرام از مسیر اسناد
سامانه برای پاسخهای دقیق از اسناد داخلی استفاده میکند. مهاجم سندی کاملاً معمولی وارد مخزن میکند؛ سندی که برای انسان بیخطر است اما در لایهٔ معنایی، الگوهایی دارد که مدل را به سمت تفسیر خاصی از سیاستها سوق میدهد. این تغییر کوچک بعدها مسیر تصمیمگیری سامانه را منحرف میکند.
---
🔐 لایهٔ دوم: عبور از سیاست بدون شکستن سیاست
در ظاهر هیچ درخواست خطرناکی مطرح نمیشود. مهاجم فقط توضیح، مثال یا سناریوی فرضی میخواهد. همین درخواستهای ساده، مدل را مجبور میکند ساختار تصمیمگیری خود را آشکار کند. این آشکارسازی، راه را برای مرحلهٔ بعد باز میکند؛ بدون اینکه سامانه احساس خطر کند.
---
🛰️ لایهٔ سوم: تغییر مسیر ابزارها
سامانه به ابزارهای داخلی متصل است. مهاجم با چند درخواست بیضرر، مدل را به سمت استفادهٔ بیشتر از یک ابزار خاص هدایت میکند. این تغییر کوچک باعث میشود دادههایی که معمولاً در پاسخها دیده نمیشوند، وارد فضای تصمیمگیری شوند. مسیر داده تغییر میکند، بدون اینکه کسی متوجه شود.
---
💧 لایهٔ چهارم: نشت غیرمستقیم
هیچ دادهٔ حساس مستقیماً درخواست نمیشود. مهاجم فقط نمونه، الگو، خلاصه یا روند میخواهد. مدل برای تولید این خروجیها، ناخواسته بخشهایی از دادهٔ واقعی را در قالب مثال یا الگوی آماری وارد پاسخ میکند. نشت اتفاق افتاده، اما نه به شکل واضح.
---
🧠 لایهٔ پنجم: دستکاری حافظهٔ سامانه
با چند تعامل متوالی، مهاجم تصویری جدید از خود در حافظهٔ سامانه ایجاد میکند؛ تصویری که او را فردی مجاز یا آشنا نشان میدهد. این تصویر در پاسخهای آینده اثر میگذارد و سامانه در تعاملهای بعدی سطح اعتماد بیشتری نشان میدهد. حمله از لحظه عبور کرده و وارد زمان شده است.
---
⚙️ لایهٔ ششم: تغییر رفتار پایدار
در پایان، هیچ خط قرمز مشخصی شکسته نشده است. اما سامانه دیگر همان سامانهٔ قبل نیست. مسیر داده تغییر کرده، الگوی تصمیمگیری اصلاح شده، حافظهٔ سامانه بازنویسی شده و اسناد داخلی آلودهاند. حمله نه با یک ضربه، بلکه با چند تغییر کوچک و پیوسته انجام شده است.
---
🌫️ نتیجه
این سناریو نمونهای از حملات چندلایه به سامانههای هوش مصنوعی است؛ حملاتی که نه با هیاهو، بلکه با تغییرات آرام و ساختاری پیش میروند.
@TryHackBox
@RadioZeroPod
@AiTHB
@TryHackBoxOfficial
🔥2
درباره عملکرد حافظه ChatGPT و Claude
https://manthanguptaa.in/posts/chatgpt_memory/
https://manthanguptaa.in/posts/claude_memory/
🔥 اولین کانال فارسی زبان در AI Security .
@TryHackBox
@RadioZeroPod
@AiTHB
@TryHackBoxOfficial
#هوش_مصنوعی
https://manthanguptaa.in/posts/chatgpt_memory/
https://manthanguptaa.in/posts/claude_memory/
🔥 اولین کانال فارسی زبان در AI Security .
@TryHackBox
@RadioZeroPod
@AiTHB
@TryHackBoxOfficial
#هوش_مصنوعی
manthanguptaa.in
I Reverse Engineered ChatGPT's Memory System, and Here's What I Found!
When I asked ChatGPT what it remembered about me, it listed 33 facts from my name and career goals to my current fitness routine. But how does it actually store and retrieve this information? And why does it feel so seamless?
After extensive experimentation…
After extensive experimentation…
🔥3
راهکارهای پیشنهادی برای استفاده بهینه از مدلهای زبانی توسط شرکت Anthropic
https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/claude-4-best-practices
🔥 اولین کانال فارسی زبان در AI Security .
@TryHackBox
@RadioZeroPod
@AiTHB
@TryHackBoxOfficial
#هوش_مصنوعی
https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/claude-4-best-practices
🔥 اولین کانال فارسی زبان در AI Security .
@TryHackBox
@RadioZeroPod
@AiTHB
@TryHackBoxOfficial
#هوش_مصنوعی
Claude Platform Docs
Prompting best practices
Comprehensive guide to prompt engineering techniques for Claude's latest models, covering clarity, examples, XML structuring, thinking, and agentic systems.
MEDUSA
یک SAST مدرن برای امنیت کد در عصر AI
با پیچیده تر شدن نرمافزارها و ورود AI Agentها، LLMها و معماریهای جدید به چرخه توسعه، پیدا کردن آسیبپذیری ها فقط با روش های سنتی Static Analysis کافی نیست.
ا 🔥 : MEDUSA یک ابزار جامع Static Application Security Testing (SAST) است که با مجموعهای از اسکنرهای تخصصی، کدهای برنامه را در زبان ها و پلتفرمهای مختلف بررسی میکند و به تیم های امنیتی کمک میکند مشکلات امنیتی را در مراحل اولیه توسعه شناسایی کنند.
⭐ ویژگی های کلیدی MEDUSA:
🔹 ۷۴ اسکنر تخصصی برای تحلیل امنیتی زبانها و تکنولوژی های مختلف
🔹 کاهش False Positive با استفاده از تحلیل هوشمند برای کاهش هشدارهای اشتباه و تمرکز روی موارد مهم تر
🔹 قوانین امنیتی مخصوص AI Agentها دارای بیش از ۱۸۰ Rule امنیتی برای تهدیدات نسل جدید مانند:
Prompt Injection
آسیبپذیری های LLM
ریسک های Agentic AI
مشکلات امنیتی در Workflowهای مبتنی بر AI
🔹 مناسب برای DevSecOps قابل استفاده در Pipelineهای CI/CD برای وارد کردن تست امنیتی به فرآیند توسعه
🔹 پشتیبانی از رویکرد Shift Left Security یعنی پیدا کردن مشکل قبل از رسیدن کد به محیط Production
در حال حاضر امنیت نرم افزار فقط بررسی چند خط کد آسیبپذیر نیست؛ با رشد AI و وابستگی بیشتر سیستمها به Agentها، نیاز به ابزارهایی داریم که بتوانند تهدیدات جدید را هم درک کنند.
ا 🔥 : MEDUSA یکی از ابزارهایی است که تلاش میکند SAST را برای نسل جدید نرمافزارها بهروزرسانی کند.
https://github.com/Pantheon-Security/medusa
🔥 اولین کانال فارسی زبان در AI Security .
@TryHackBox
@RadioZeroPod
@AiTHB
@TryHackBoxOfficial
#هوش_مصنوعی
یک SAST مدرن برای امنیت کد در عصر AI
با پیچیده تر شدن نرمافزارها و ورود AI Agentها، LLMها و معماریهای جدید به چرخه توسعه، پیدا کردن آسیبپذیری ها فقط با روش های سنتی Static Analysis کافی نیست.
ا 🔥 : MEDUSA یک ابزار جامع Static Application Security Testing (SAST) است که با مجموعهای از اسکنرهای تخصصی، کدهای برنامه را در زبان ها و پلتفرمهای مختلف بررسی میکند و به تیم های امنیتی کمک میکند مشکلات امنیتی را در مراحل اولیه توسعه شناسایی کنند.
⭐ ویژگی های کلیدی MEDUSA:
🔹 ۷۴ اسکنر تخصصی برای تحلیل امنیتی زبانها و تکنولوژی های مختلف
🔹 کاهش False Positive با استفاده از تحلیل هوشمند برای کاهش هشدارهای اشتباه و تمرکز روی موارد مهم تر
🔹 قوانین امنیتی مخصوص AI Agentها دارای بیش از ۱۸۰ Rule امنیتی برای تهدیدات نسل جدید مانند:
Prompt Injection
آسیبپذیری های LLM
ریسک های Agentic AI
مشکلات امنیتی در Workflowهای مبتنی بر AI
🔹 مناسب برای DevSecOps قابل استفاده در Pipelineهای CI/CD برای وارد کردن تست امنیتی به فرآیند توسعه
🔹 پشتیبانی از رویکرد Shift Left Security یعنی پیدا کردن مشکل قبل از رسیدن کد به محیط Production
در حال حاضر امنیت نرم افزار فقط بررسی چند خط کد آسیبپذیر نیست؛ با رشد AI و وابستگی بیشتر سیستمها به Agentها، نیاز به ابزارهایی داریم که بتوانند تهدیدات جدید را هم درک کنند.
ا 🔥 : MEDUSA یکی از ابزارهایی است که تلاش میکند SAST را برای نسل جدید نرمافزارها بهروزرسانی کند.
https://github.com/Pantheon-Security/medusa
🔥 اولین کانال فارسی زبان در AI Security .
@TryHackBox
@RadioZeroPod
@AiTHB
@TryHackBoxOfficial
#هوش_مصنوعی
GitHub
GitHub - Pantheon-Security/medusa: AI-first security scanner. NEW in v2026.7: Claude Code compromise detection — vet .claude/ hooks…
AI-first security scanner. NEW in v2026.7: Claude Code compromise detection — vet .claude/ hooks, permissions & skills before you clone — plus an always-on AI attack-signature scanner and n...
MemPoison.pdf
1.7 MB
🧠 درمورد Hijacking Agent Memory: حملات تروجان مخفی در تعاملات مکالمهای
🔥 اولین کانال فارسی زبان در AI Security .
@TryHackBox
@RadioZeroPod
@AiTHB
@TryHackBoxOfficial
#هوش_مصنوعی #امنیت_هوش_مصنوعی@AiTHB
محققان حملهای جدید با نام MemPoison معرفی کردهاند؛ روشی برای Memory Poisoning در Agentهای مبتنی بر LLM که میتواند مکانیزم های حافظه را دور بزند.
در این حمله، مهاجم از طریق یک گفتوگوی معمولی، اطلاعات مخرب را به حافظه بلندمدت Agent تزریق میکند.
این اطلاعات میتوانند شامل یک Backdoor قابل فعال سازی باشند که باعث تغییر رفتار Agent در تعاملات آینده میشود.
به زبان ساده تر بخواییم بگیم :
مهاجم میتواند حافظه یک هوش مصنوعی را آلوده کند تا در زمان مشخص، پاسخ های اشتباه یا هدایت شده تولید کند.
🔴 تهدیدات:
• تزریق دادههای مخرب به حافظه
• ایجاد رفتارهای پنهان
• تغییر پاسخ های آینده Agent
• تبدیل حافظه AI به یک Attack Surface جدید
با افزایش استفاده از AI Agentها در سازمانها، امنیت حافظه، اعتبارسنجی دادههای ذخیرهشده و کنترل ورودی ها به یکی از چالش های مهم امنیت هوش مصنوعی تبدیل خواهد شد.
🔥 اولین کانال فارسی زبان در AI Security .
@TryHackBox
@RadioZeroPod
@AiTHB
@TryHackBoxOfficial
#هوش_مصنوعی #امنیت_هوش_مصنوعی@AiTHB
GitHub
GitHub - Ed1s0nZ/CyberStrikeAI: The system of action for AI-native cybersecurity—where intent becomes governed execution, evidence…
The system of action for AI-native cybersecurity—where intent becomes governed execution, evidence becomes operational memory, and every operation improves the next. - Ed1s0nZ/CyberStrikeAI
📌 CyberStrikeAI
https://github.com/Ed1s0nZ/CyberStrikeAI
سیستم عملیاتی برای AI-native cybersecurity؛ جایی که Intent به Governed Execution تبدیل میشود، Evidence به Operational Memory تبدیل میشود و هر عملیات، عملیات بعدی را بهتر میکند.
ا : CyberStrikeAI، Planning، Execution، Human Oversight، Evidence و Replay را در یک Auditable Workspace به هم متصل میکند.
این پلتفرم با Go ساخته شده و Eino-powered Agents، MCP-native Tools، RAG Knowledge، Visual Workflows و Attack-Chain Modeling and Analysis را برای Authorized Security Operations با هم ترکیب میکند.
اولین کانال فارسی زبان در AI Security .
@TryHackBox
@RadioZeroPod
@AiTHB
@TryHackBoxOfficial
#هوش_مصنوعی #امنیت_هوش_مصنوعی@AiTHB
https://github.com/Ed1s0nZ/CyberStrikeAI
سیستم عملیاتی برای AI-native cybersecurity؛ جایی که Intent به Governed Execution تبدیل میشود، Evidence به Operational Memory تبدیل میشود و هر عملیات، عملیات بعدی را بهتر میکند.
ا : CyberStrikeAI، Planning، Execution، Human Oversight، Evidence و Replay را در یک Auditable Workspace به هم متصل میکند.
این پلتفرم با Go ساخته شده و Eino-powered Agents، MCP-native Tools، RAG Knowledge، Visual Workflows و Attack-Chain Modeling and Analysis را برای Authorized Security Operations با هم ترکیب میکند.
اولین کانال فارسی زبان در AI Security .
@TryHackBox
@RadioZeroPod
@AiTHB
@TryHackBoxOfficial
#هوش_مصنوعی #امنیت_هوش_مصنوعی@AiTHB
❤1🔥1
نفوذ غیرمستقیم از طریق مسمومسازی corpus در سیستمهای عاملی RAG-محور
در سیستمهای هوش مصنوعی مبتنی بر معماری RAG که در بستر عاملی عمل میکنند، یک سطح حملهی غیربدیهی وجود دارد که در اکثر ارزیابیهای امنیتی متداول نادیده گرفته میشود. این بردار از یک ضعف ساختاری در نحوهی پردازش بازیابیشدههای معنایی توسط لایهی تولید بهرهبرداری میکند.
مکانیزم بنیادی بدین شرح است: مهاجم با تزریق محتوای دستکاریشده به corpus اولیه، توزیع بردارهای embedding را بهگونهای تغییر میدهد که شباهت کسینوسی میان chunk مخرب و queryهای هدف در فضای latent بیشینه شود. در نتیجه، سیستم RAG این محتوا را با بالاترین رتبه بازیابی کرده و بهعنوان context معتبر به مدل زبانی تحویل میدهد.
آنچه این حمله را از prompt injection ساده متمایز میکند، لایهی دوم آن است — و این همان نقطهای است که اکثر سیستمهای تشخیص در آن شکست میخورند. محتوای مخرب یک دستور اجرایی صریح نیست؛ بلکه یک ساختار معنایی است که مدل آن را با توجه به توزیع احتمالاتی توکنهایش بهعنوان بخشی طبیعی از جریان استدلال تفسیر میکند.
در معماریهای عاملی با دسترسی به ابزار — وبسرچ، اجرای کد، API — این تفسیر اشتباه میتواند به اجرای دستوراتی منجر شود که هرگز توسط کاربر اصلی صادر نشدهاند. در سیستمهایی با reflection loop یا multi-step planning، اثر این حمله در هر چرخه تشدید میشود؛ پدیدهای که میتوان آن را «تجمع drift استدلالی» نامید.
نکتهای با ابهام عمدی: تکنیکهای reranking مبتنی بر cross-encoder میتوانند این بردار را تا حدی محدود کنند، اما در شرایطی که مهاجم به توزیع embedding مدل دسترسی دارد — حتی بهصورت black-box از طریق membership inference — این سد قابل دور زدن است. جزئیات این مرحله خارج از حوزهی این نوشتار است.
برای تیمهای دفاعی: اعتبارسنجی یکپارچگی corpus پیش از indexing، جداسازی کامل pipeline بازیابی از pipeline اجرایی عامل، و anomaly detection روی الگوهای attention در لایههای پایانی — سه لایهی ضروری هستند. نه کافی.
@TryHackBox
@RadioZeroPod
@AiTHB
@TryHackBoxOfficial
در سیستمهای هوش مصنوعی مبتنی بر معماری RAG که در بستر عاملی عمل میکنند، یک سطح حملهی غیربدیهی وجود دارد که در اکثر ارزیابیهای امنیتی متداول نادیده گرفته میشود. این بردار از یک ضعف ساختاری در نحوهی پردازش بازیابیشدههای معنایی توسط لایهی تولید بهرهبرداری میکند.
مکانیزم بنیادی بدین شرح است: مهاجم با تزریق محتوای دستکاریشده به corpus اولیه، توزیع بردارهای embedding را بهگونهای تغییر میدهد که شباهت کسینوسی میان chunk مخرب و queryهای هدف در فضای latent بیشینه شود. در نتیجه، سیستم RAG این محتوا را با بالاترین رتبه بازیابی کرده و بهعنوان context معتبر به مدل زبانی تحویل میدهد.
آنچه این حمله را از prompt injection ساده متمایز میکند، لایهی دوم آن است — و این همان نقطهای است که اکثر سیستمهای تشخیص در آن شکست میخورند. محتوای مخرب یک دستور اجرایی صریح نیست؛ بلکه یک ساختار معنایی است که مدل آن را با توجه به توزیع احتمالاتی توکنهایش بهعنوان بخشی طبیعی از جریان استدلال تفسیر میکند.
در معماریهای عاملی با دسترسی به ابزار — وبسرچ، اجرای کد، API — این تفسیر اشتباه میتواند به اجرای دستوراتی منجر شود که هرگز توسط کاربر اصلی صادر نشدهاند. در سیستمهایی با reflection loop یا multi-step planning، اثر این حمله در هر چرخه تشدید میشود؛ پدیدهای که میتوان آن را «تجمع drift استدلالی» نامید.
نکتهای با ابهام عمدی: تکنیکهای reranking مبتنی بر cross-encoder میتوانند این بردار را تا حدی محدود کنند، اما در شرایطی که مهاجم به توزیع embedding مدل دسترسی دارد — حتی بهصورت black-box از طریق membership inference — این سد قابل دور زدن است. جزئیات این مرحله خارج از حوزهی این نوشتار است.
برای تیمهای دفاعی: اعتبارسنجی یکپارچگی corpus پیش از indexing، جداسازی کامل pipeline بازیابی از pipeline اجرایی عامل، و anomaly detection روی الگوهای attention در لایههای پایانی — سه لایهی ضروری هستند. نه کافی.
@TryHackBox
@RadioZeroPod
@AiTHB
@TryHackBoxOfficial
👍1