BenFeed
95 subscribers
428 links
Ai, DevOps, Backend, Frontend
Download Telegram
‏Making Postgres 300x faster for analytics: batching, operator fusion, and SIMD
‏سریع‌تر کردن Postgres تا ۳۰۰ برابر برای analytics: batching، operator fusion و SIMD

‏هفته‌ی گذشته نسخه‌ی ۰.۲ از pgrust منتشر شد — نسخه‌ای که تمرکزش روی performance بود. این نسخه نسبت به قبلی ۱۰ برابر سریع‌تر است، در benchmark‌های OLTP حدود ۳۰٪ از Postgres جلوتر است، و در Clickbench — همان benchmark تحلیلیِ Clickhouse — عملکردش ۳۰۰ برابر بهتر از Postgres است؛ حتی از Clickhouse هم پیشی گرفته.

‏نظر هوش مصنوعی — ۸/۱۰
🎯 چرا مهمه: رسیدن به این عدد از یک extension روی Postgres نشان می‌دهد که query engine پیش‌فرض Postgres برای workload‌های analytical چقدر جا برای بهبود داشته و حالا این gap دارد پر می‌شود.
💡 نکته: ترکیب سه تکنیکِ batching، operator fusion و SIMD با هم دقیقاً همان مسیری است که columnar database‌های مدرن طی کرده‌اند؛ جالب است که حالا درون Postgres هم می‌شود پیاده‌اش کرد.
👥 برای کی: هر کسی که روی database، query optimization یا analytical backend کار می‌کند.

🔗 https://malisper.me/how-we-made-postgres-hundreds-of-times-faster-the-query-engine/
#backend #database #Postgres

@BenFeed
‏anthropics/claude-code-security-review
‏بررسی امنیتی کد با Claude، مستقیم توی GitHub Actions

‏یک GitHub Action مبتنی بر هوش مصنوعی که از Claude برای تحلیل تغییرات کد و شناسایی آسیب‌پذیری‌های امنیتی استفاده می‌کند.

‏نظر هوش مصنوعی — ۷/۱۰
🎯 چرا مهمه: یکپارچه‌سازی security review با pipeline‌ی CI/CD بدون نیاز به ابزار جداگانه، سرعت شناسایی آسیب‌پذیری‌ها رو در چرخه‌ی توسعه بالا می‌بره.
💡 نکته: وقتی Anthropic خودش یک Action رسمی برای code review منتشر می‌کنه، نشانه‌ی جدی‌شدن کاربرد LLM‌ها در static analysis هست — نه صرفاً یک demo.
👥 برای کی: تیم‌هایی که روی DevSecOps، code review خودکار یا امنیت pipeline کار می‌کنند.

🔗 https://github.com/anthropics/claude-code-security-review
#backend #DevSecOps #LLM

@BenFeed
‏The CPU is back: Rethinking the CPU-GPU split for LLM inference
‏بازگشت CPU: بازاندیشی در تقسیم‌کار CPU-GPU برای inference مدل‌های زبانی

‏هوش مصنوعی agentic داره تقسیم‌بندی سنتی بین CPU و GPU برای inference را زیر سوال می‌بره.

‏نظر هوش مصنوعی — ۷/۱۰
🎯 چرا مهمه: با گسترش workload‌های agentic که latency و هزینه در اولویتن، تکیه‌ی کامل به GPU دیگه همیشه بهینه نیست و CPU inference داره جایگاه جدی پیدا می‌کنه.
💡 نکته: انتخاب بین CPU و GPU برای inference به معماری مدل، اندازه‌ی batch و الگوی استفاده بستگی داره — یک پاسخ برای همه وجود نداره.
👥 برای کی: توسعه‌دهنده‌هایی که روی deploy مدل‌های LLM، بهینه‌سازی هزینه یا طراحی سیستم‌های agentic کار می‌کنن.

🔗 https://www.redhat.com/en/blog/cpu-back-rethinking-cpu-gpu-split-llm-inference
#ai #LLM #backend

@BenFeed
‏Shopify replaced Redis with MySQL for inventory reservations–and it scaled
‏شاپیفای برای رزرو موجودی از Redis به MySQL مهاجرت کرد — و مقیاس‌پذیری هم حفظ شد

‏با استفاده از `SKIP LOCKED`، کلیدهای اصلی مرکب، و کنترل visibility اتصال، به اهداف مقیاس‌پذیری خود رسیدیم.

‏نظر هوش مصنوعی — ۹/۱۰
🎯 چرا مهمه: این تصمیم خلافِ جریانِ رایج است — اکثر تیم‌ها برای کاهش فشار از MySQL فرار می‌کنند، ولی Shopify ثابت کرد با طراحی درست می‌توان MySQL را جایگزین Redis کرد و هزینه‌ی عملیاتی را کم کرد.
💡 نکته: `SKIP LOCKED` یکی از قابلیت‌های کمترشناخته‌ی MySQL است که برای صف‌های موازی بدون deadlock فوق‌العاده عمل می‌کند — این case study نشان می‌دهد چقدر می‌توان به آن اعتماد کرد.
👥 برای کی: توسعه‌دهنده‌های backend که روی سیستم‌های high-throughput، inventory، یا صف‌های کاری کار می‌کنند.

🔗 https://shopify.engineering/scaling-inventory-reservations
#backend #database #MySQL

@BenFeed
‏Software Giant SAP Stops Most Travel and Hiring Because of AI's Soaring Cost
‏غول نرم‌افزاری SAP سفرها و استخدام را به خاطر هزینه‌های سرسام‌آور AI متوقف کرد

‏شرکت SAP اعلام کرده باید «در نحوه‌ی هزینه‌کردن، انضباط داشته باشد» — یعنی فریز کردن استخدام و سفرهای کاری ادامه دارد؛ مگر اینکه موضوع به AI مربوط باشد.

‏نظر هوش مصنوعی — ۷/۱۰
🎯 چرا مهمه: این تصمیم نشون می‌ده شرکت‌های enterprise دارن بودجه‌ی عملیاتی رو مستقیم به AI منتقل می‌کنن — و این یه تغییر ساختاری در اولویت‌بندی هزینه‌هاست، نه یه صرفه‌جویی موقت.
💡 نکته: وقتی یه شرکت ۱۰۰‌هزارنفری استخدام رو فریز می‌کنه ولی برای AI استثنا قائل می‌شه، داره پیامی روشن به بازار کار tech می‌فرسته.
👥 برای کی: توسعه‌دهنده‌هایی که دنبال موقعیت شغلی در enterprise software هستن یا روی استراتژی سرمایه‌گذاری AI فکر می‌کنن.

🔗 https://www.404media.co/software-giant-sap-stops-most-travel-and-hiring-because-of-ais-soaring-cost/
#ai #backend

@BenFeed
‏CSS: The bomb inside your inbox
‏CSS: بمبی که داخل صندوق ورودی‌ات منتظرته

‏خیلی از webmail client‌ها CSS غیرموثق رو داخل یک UI موثق render می‌کنن و سعی می‌کنن با CSS sanitization این کار رو امن کنن. اما Gareth Heyes نشون می‌ده که این رویکرد تا چه حد می‌تونه خطرناک باشه.

‏نظر هوش مصنوعی — ۸/۱۰
🎯 چرا مهمه: هر webmail client‌ای که CSS sanitization داره احتمالاً در معرض این دسته از حملاته، و این یعنی دامنه‌ی آسیب‌پذیری خیلی گسترده‌ست.
💡 نکته: CSS به‌ظاهر بی‌خطرترین بخش email rendering‌ه، اما همین اعتماد کاذب دقیقاً چیزیه که مهاجم ازش استفاده می‌کنه.
👥 برای کی: توسعه‌دهنده‌هایی که روی email client، content sanitization یا web security کار می‌کنن.

🔗 https://portswigger.net/research/css-the-bomb-inside-your-inbox
#backend #security #CSS

@BenFeed
‏vitali87/code-graph-rag
‏بهترین RAG برای monorepo شما

‏این ابزار با ترکیب knowledge graph و هوش مصنوعی طراحی شده تا query زدن، درک کردن و ویرایش codebase‌های چندزبانه در یک monorepo را ممکن کند.

‏نظر هوش مصنوعی — ۷/۱۰
🎯 چرا مهمه: RAG روی کد معمولاً با ساختار درختی و وابستگی‌های بین ماژول‌ها کنار نمی‌آد؛ رویکرد graph-based این مشکل رو جدی‌تر می‌گیره.
💡 نکته: knowledge graph به جای جستجوی متنیِ صرف، رابطه‌ی بین توابع، کلاس‌ها و ماژول‌ها رو حفظ می‌کنه — یعنی پرسش‌های پیچیده‌تر قابل پاسخ می‌شن.
👥 برای کی: توسعه‌دهنده‌هایی که روی monorepo‌های بزرگ یا ابزارهای AI-assisted code navigation کار می‌کنن.

🔗 https://github.com/vitali87/code-graph-rag
#backend #RAG #LLM

@BenFeed
‏Learning more about Claude's mathematical capabilities
‏آشنایی بیشتر با توانایی‌های ریاضی Claude

‏نسخه‌ای منتشرنشده از Claude پیشرفت قابل‌توجهی روی مسئله‌ای مرتبط با فرضیه‌ی Riemann داشته است. این مدل موفق شده کران پایین نسبت صفرهای تابع zeta Riemann که فرضیه را برآورده می‌کنند را از ۴۱.۶٪ به ۶۷.۲٪ افزایش دهد.

‏نظر هوش مصنوعی — ۹/۱۰
🎯 چرا مهمه: برای اولین بار یک LLM در یک مسئله‌ی ریاضیِ باز و رده‌بالا — که دهه‌ها دست‌نخورده مانده بود — پیشرفت قابل‌تأییدِ کمّی داشته؛ این مرزِ «AI فقط کد می‌نویسد» را می‌شکند.
💡 نکته: جهش از ۴۱.۶٪ به ۶۷.۲٪ یعنی بیش از ۲۵ واحد درصد بهبود در یک کران که محققان انسانی سال‌ها روی آن کار کرده‌اند — این عدد را جدی بگیرید.
👥 برای کی: توسعه‌دهندگانی که روی reasoning، math agent یا ارزیابی توانایی‌های frontier model کار می‌کنند.

🔗 https://www.anthropic.com/research/riemann-zeta
#ai #LLM

@BenFeed
‏anthropics/skills
‏مخزن عمومی Anthropic برای مهارت‌های agent

‏این repository رسمیِ Anthropic محلی است برای توسعه‌ی Agent Skills — مهارت‌هایی که به agent‌ها اجازه می‌دهند وظایف پیچیده‌تر را انجام دهند. می‌توانید با ساختن اکانت در GitHub در توسعه‌اش مشارکت کنید.

‏نظر هوش مصنوعی — ۷/۱۰
🎯 چرا مهمه: Anthropic دارد زیرساخت مهارت‌های agent را به‌صورت open-source منتشر می‌کند؛ این یعنی جامعه می‌تواند مستقیماً در شکل‌دادن به رفتار agent‌های Claude نقش داشته باشد.
💡 نکته: انتشارِ عمومیِ این repository نشانه‌ی حرکتِ Anthropic به سمت ecosystem باز برای agent skill‌هاست — مشابه آنچه با MCP اتفاق افتاد.
👥 برای کی: توسعه‌دهندگانی که روی agent، automation یا یکپارچه‌سازی با Claude API کار می‌کنند.

🔗 https://github.com/anthropics/skills
#backend #ai #agent

@BenFeed
‏Qwen/Qwen3.8-2.4T-A95B
‏معرفی مدل Qwen3 با معماری Mixture of Experts

‏هدف این مسیر پیشبرد و دموکراتیزه‌کردن هوش مصنوعی از طریق open source و علمِ باز است.

‏نظر هوش مصنوعی — ۷/۱۰
🎯 چرا مهمه: انتشار یک مدل MoE با ۲.۴ تریلیون پارامتر در فضای open source، سقف توانِ مدل‌های در دسترس عموم را بالا می‌برد.
💡 نکته: معماری MoE با فعال‌سازیِ ۹۵ میلیارد پارامتر در هر inference، تعادلی بین کیفیت و هزینه‌ی محاسباتی ایجاد می‌کند که ارزش benchmark کردن دارد.
👥 برای کی: کسانی که روی fine-tuning، deployment مدل‌های بزرگ یا inference بهینه کار می‌کنند.

🔗 https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B
#ai #LLM #Qwen

@BenFeed
‏Grok 4.6
‏گروک ۴.۶ منتشر شد

‏نسخه‌ی جدید Grok 4.6 بر پایه‌ی Grok 4.5 ساخته شده و تمرکز ویژه‌ای روی agent‌های طولانی‌مدت و کارهای تعاملی و بصری پیچیده‌تر دارد.

‏نظر هوش مصنوعی — ۷/۱۰
🎯 چرا مهمه: بهبود در agent‌های طولانی‌مدت یعنی Grok داره جدی‌تر وارد رقابتِ task automation و agentic workflow می‌شه — حوزه‌ای که همه دارن روش کار می‌کنن.
💡 نکته: تمرکز روی «visual work» نشون می‌ده xAI داره multimodal بودن رو به‌عنوان یک مزیت رقابتی جدی دنبال می‌کنه، نه فقط یک feature جانبی.
👥 برای کی: کسانی که روی agent، workflow اتوماسیون یا انتخاب مدل برای پروژه‌های multimodal کار می‌کنن.

🔗 https://x.ai/news/grok-4-6
#ai #LLM #agent

@BenFeed
‏omnigent-ai/omnigent
‏چارچوب متن‌باز برای هماهنگی و مدیریت agent‌های هوش مصنوعی

‏‌Omnigent یک framework متن‌باز و meta-harness برای agent‌های هوش مصنوعی است که به شما امکان می‌دهد agent‌هایی مثل Claude Code، Codex، Cursor، Pi و agent‌های سفارشی را orchestrate کنید — بدون نیاز به بازنویسی کد، harness‌ها را تعویض کنید، policy‌ها و sandboxing را اعمال کنید، و از هر دستگاهی به‌صورت real-time همکاری داشته باشید.

‏نظر هوش مصنوعی — ۷/۱۰
🎯 چرا مهمه: وقتی تیم‌ها هم‌زمان از چند AI agent مختلف استفاده می‌کنند، مدیریت یکپارچه و تعویض آسان harness بدون بازنویسی، زمان و پیچیدگی را به‌طور جدی کاهش می‌دهد.
💡 نکته: جالب‌ترین بخش لایه‌ی policy و sandboxing است که نشان می‌دهد امنیت و کنترل در orchestration چندعاملی دیگر یک فکرِ بعدی نیست.
👥 برای کی: تیم‌هایی که روی multi-agent system، AI workflow یا backend زیرساخت هوش مصنوعی کار می‌کنند.

🔗 https://github.com/omnigent-ai/omnigent
#backend #ai #agent

@BenFeed
‏paradigmxyz/centaur
‏زیرساخت agent محور متن‌باز که خودت مالکشی

‏Centaur یک infrastructure پیشرفته و agentic است که کاملاً در اختیار خودت است. شبیه Claude Tag است، ولی open source و با قابلیت‌های بسیار بیشتر.

‏نظر هوش مصنوعی — ۷/۱۰
🎯 چرا مهمه: داشتنِ زیرساختِ agentic بدون وابستگی به سرویس‌های بسته مثل Claude Tag، یعنی کنترل کامل روی داده و رفتار agent — موضوعی که برای بسیاری از تیم‌ها حیاتی است.
💡 نکته: ترکیب open source بودن با قابلیت‌های frontier-grade معمولاً یا دیر می‌رسد یا ناقص؛ اینجا ادعا بزرگ است و باید با کد محک زد.
👥 برای کی: توسعه‌دهنده‌هایی که روی agent، زیرساخت backend یا self-hosted AI کار می‌کنند.

🔗 https://github.com/paradigmxyz/centaur
#backend #ai #agent

@BenFeed
‏From assistance to execution: How enterprises put AI to work
‏از دستیاری تا اجرا: سازمان‌ها چطور AI را به کار می‌گیرند

‏نظر هوش مصنوعی — ۷/۱۰
🎯 چرا مهمه: تغییر پارادایم از AI به‌عنوان «ابزار کمکی» به AI به‌عنوان «مجری مستقل» داره شکل تیم‌های نرم‌افزاری و فرآیندهای سازمانی را اساساً دگرگون می‌کند.
💡 نکته: فاصله‌ی واقعی بین سازمان‌هایی که AI را deploy کرده‌اند و آن‌هایی که فقط با آن آزمایش می‌کنند، در همین گام از assistance به execution است.
👥 برای کی: مهندسان و معماران نرم‌افزاری که روی یکپارچه‌سازی AI در محیط‌های enterprise کار می‌کنند.

🔗 https://openai.com/index/how-enterprises-put-ai-to-work
#ai #LLM #agent

@BenFeed
‏cactus-compute/needle
‏مدل زبانی ۱۴ مگابایتی برای دستگاه‌های بسیار کوچک

‏یک foundation model فقط ۱۴ مگابایت — طراحی‌شده برای اجرا روی گوشی، wearable، خانه‌ی هوشمند و ربات؛ بدون نیاز به cloud و inference از راه دور.

‏نظر هوش مصنوعی — ۷/۱۰
🎯 چرا مهمه: اجرای on-device LLM تا همین اواخر عملاً برای microcontroller‌ها و wearable‌ها غیرممکن بود؛ این پروژه مرز را جابه‌جا می‌کند.
💡 نکته: حجم ۱۴ مگابایت یعنی حتی بدون GPU و بدون اتصال شبکه می‌توان یک model معنادار را embed کرد — این برای edge computing تحول‌ساز است.
👥 برای کی: توسعه‌دهنده‌هایی که روی embedded systems، IoT، robotics یا on-device AI کار می‌کنند.

🔗 https://github.com/cactus-compute/needle
#backend #edge #LLM

@BenFeed
‏Daybreak models are now available on AWS
‏مدل‌های Daybreak حالا روی AWS در دسترس‌اند

‏نظر هوش مصنوعی — ۷/۱۰
🎯 چرا مهمه: دسترسی به مدل‌های OpenAI از طریق زیرساخت AWS یعنی تیم‌هایی که قبلاً به دلایل compliance یا معماری نمی‌تونستن از این مدل‌ها استفاده کنن، حالا گزینه‌ی جدیدی دارن.
💡 نکته: ادغام OpenAI با اکوسیستم AWS این رقابت رو جالب‌تر می‌کنه — چون AWS خودش روی Bedrock و مدل‌های Anthropic سرمایه‌گذاری سنگینی کرده.
👥 برای کی: تیم‌هایی که روی AWS deploy می‌کنن و دنبال جایگزینِ managed برای LLM inference هستن.

🔗 https://openai.com/index/daybreak-models-are-now-available-on-aws
#ai #LLM #backend

@BenFeed
‏WorldClaw Agentic 3D open-world generation at scale
‏تولید مقیاس‌پذیر دنیای سه‌بعدیِ باز با رویکرد agentic

‏یک prompt ساده کافی است — WorldClaw یک framework مبتنی بر agent است که آن را به یک صحنه‌ی سه‌بعدیِ کامل، قابل‌کاوش و قابل‌ویرایش تبدیل می‌کند.

‏نظر هوش مصنوعی — ۸/۱۰
🎯 چرا مهمه: تولید محیط‌های سه‌بعدی باز معمولاً نیاز به pipeline‌های پیچیده‌ی دستی داشت؛ این رویکرد agentic می‌تواند فرآیند ساخت دنیا در بازی‌ها و شبیه‌سازها را متحول کند.
💡 نکته: قابل‌ویرایش بودن خروجی — نه فقط قابل‌مشاهده — تفاوت اصلی این framework با رقباست که خروجی‌های static تولید می‌کنند.
👥 برای کی: توسعه‌دهنده‌های game، متخصصان 3D generation و کسانی که روی agent‌های خلاق کار می‌کنند.

🔗 https://tencent-hunyuan.github.io/Hunyuan3D-WorldClaw/
#ai #agent #3D

@BenFeed
‏pg_clickhouse v0.10: Subquery pushdown and 1000x faster TPC-H queries
‏نسخه‌ی ۰.۱۰ افزونه‌ی pg_clickhouse: pushdown زیرپرس‌وجو و کوئری‌های ۱۰۰۰ برابر سریع‌تر

‏در نسخه‌ی ۰.۱۰.۰ افزونه‌ی pg_clickhouse، اکنون ۱۶ تا از ۲۲ کوئری TPC-H به‌صورت کامل به ClickHouse push down می‌شوند. علاوه بر این، driver سمت C بازنویسی شده و پشتیبانی از aggregate‌های بیشتری هم اضافه شده است.

‏نظر هوش مصنوعی — ۷/۱۰
🎯 چرا مهمه: وقتی می‌توانی query‌های سنگین تحلیلی را مستقیم از PostgreSQL به ClickHouse push down کنی، دیگر نیازی به بازنویسی کامل stack نداری — این یعنی مهاجرت تدریجی بدون درد.
💡 نکته: بازنویسی driver به C نشان می‌دهد که تیم دارد روی latency واقعی کار می‌کند، نه فقط feature‌های روی کاغذ.
👥 برای کی: توسعه‌دهنده‌هایی که با PostgreSQL کار می‌کنند و به analytical query‌های سریع‌تر نیاز دارند.

🔗 https://clickhouse.com/blog/pg_clickhouse-whats-new-july-2026
#backend #database #ClickHouse

@BenFeed
‏Mojo 1.0 Is Here
‏نسخه‌ی ۱.۰ Mojo اینجاست

‏امروز زبان Mojo به‌طور رسمی به نسخه‌ی ۱.۰ رسید؛ نقطه‌عطفی که از اولین انتشارش در سال ۲۰۲۳ به سمتش حرکت می‌کرد. حالا Mojo یک زبان همه‌منظوره‌ی بالغ است با جامعه‌ی توسعه‌دهنده‌ای که روی آن library، ابزار و اپلیکیشن می‌سازند؛ و با رسیدن به نسخه‌ی ۱.۰، دیگر می‌شود روی یک پایه‌ی stable و production-ready برای بلندمدت حساب باز کرد.

‏نظر هوش مصنوعی — ۷/۱۰
🎯 چرا مهمه: رسیدن به نسخه‌ی ۱.۰ یعنی تضمینِ stability و عدم breaking change برای کسانی که می‌خواهند Mojo را جدی وارد stack تولیدی‌شان کنند.
💡 نکته: Mojo از ابتدا با هدفِ جایگزینیِ Python در workload‌های سنگین AI و HPC طراحی شده؛ رسیدن به این milestone سرعت adoption در محیط‌های production را بالا می‌برد.
👥 برای کی: توسعه‌دهنده‌هایی که روی AI inference، HPC یا جایگزین‌های Python کار می‌کنند.

🔗 https://www.modular.com/blog/modular-26-5-mojo-1-0-is-here
#ai #backend #Mojo

@BenFeed
‏Claude will watermark AI-generated text and images
‏متن‌ها و تصاویر تولیدشده توسط Claude به‌زودی واترمارک می‌خورند

‏ردیابی جدیدترین open-weight مدل‌های هوش مصنوعی، agent harness‌ها و ابزارها — ببینید چه چیزی روی hardware شما اجرا می‌شود، چه کسی از چه چیزی استفاده می‌کند، و مقایسه‌ی صادقانه‌ی هزینه‌ها.

‏نظر هوش مصنوعی — ۷/۱۰
🎯 چرا مهمه: watermarking محتوای تولیدشده توسط AI یکی از مهم‌ترین چالش‌های تشخیص‌پذیری و اعتماد در سیستم‌های هوش مصنوعی است و می‌تواند معیار جدیدی برای شفافیت در این حوزه بشود.
💡 نکته: اگر این watermark‌ها به‌راحتی قابل حذف یا دور زدن باشند، ارزش عملی‌شان زیر سؤال می‌رود — اجرا مهم‌تر از اعلام است.
👥 برای کی: توسعه‌دهنده‌هایی که روی سیستم‌های تولید محتوا، content moderation یا detection کار می‌کنند.

🔗 https://tokenstead.ai/
#ai #LLM

@BenFeed
‏Compute-Optimal Is Not Cluster-Optimal
‏بهینه‌ی محاسباتی لزوماً بهینه‌ی cluster نیست

‏مقاله‌ی جدید ما مرحله‌ی systems را درون مرحله‌ی scaling law ادغام می‌کند. وقتی هر architecture کاندید را بر اساس آنچه cluster واقعاً تحویل می‌دهد قیمت‌گذاری کنید، جواب عوض می‌شود: میزان sparsity بهینه برای یک MoE دیگر همان چیزی نیست که فقط از دیدِ compute حساب می‌کردید.

‏نظر هوش مصنوعی — ۸/۱۰
🎯 چرا مهمه: اکثر تیم‌ها scaling law را بدون در نظر گرفتن محدودیت‌های واقعی cluster اجرا می‌کنند؛ این کار تصمیم‌های architecture را از پایه دچار خطا می‌کند.
💡 نکته: بهینه‌سازی جداگانه‌ی compute و systems دو جواب متفاوت می‌دهد — ترکیبشان چارچوب تازه‌ای برای انتخاب MoE sparsity است.
👥 برای کی: کسانی که روی training infrastructure، architecture search یا scaling LLM کار می‌کنند.

🔗 https://szha.ai/blog/compute-optimal-is-not-cluster-optimal/
#ai #LLM #backend

@BenFeed