886 subscribers
45 photos
3 videos
1 file
1.49K links
🕸 Database Academy

حمایت مالی:
https://www.coffeete.ir/mrbardia72

ادمین:
@mrbardia72
Download Telegram
🔵 عنوان مقاله
Evolving Pinterest's Embedding Retrieval Platform (8 minute read)

🟢 خلاصه مقاله:
پلتفرم بازیابی و کاوش بر پایه نشانک‌های تصویری پینترست، در حال حاضر میلیون‌ها نشانک مختلف را در بخش‌های متنوعی مانند فید خانه، جستجو، پین‌های مرتبط، تبلیغات و اعلان‌ها مدیریت می‌کند. این سیستم با بهره‌گیری از فناوری‌های نوین، توانسته است هزینه‌های پردازش را تا ۲۰ تا ۳۰ درصد کاهش دهد؛ یکی از این فناوری‌ها، فشرده‌سازی یا کیوبیزه‌سازی است که میزان نیاز به منابع سروری را به شدت کاهش می‌دهد. همچنین، آزمایش‌هایی که بر روی جستجوهای مبتنی بر الگوریتم‌های تقریبی نزدیک‌ترین همسایگی (ANN) و بر پایه درایوهای حالت‌دار (SSD) انجام شده، باعث محدود کردن نیازهای حافظه و پردازنده می‌شوند و بهبودهای قابل توجهی در کارایی سیستم به همراه داشته است.

در کنار این، پلتفرم پینترست در حال حرکت به سمت استفاده از چند نشانک (multi-embedding) برای بازیابی و رتبه‌بندی بهتر محتوا است. این روش، تغییراتی است که صرفاً بر روی مقایسه یک واژه یا نشانک واحد تمرکز ندارد، بلکه توانایی ارزیابی چند نشانک مختلف و غنی‌تر کردن فرآیند امتیازدهی به کاندیداهای محتوا را داراست. این رویکرد، ما را فراتر از حالت پیشین می‌برد که تنها بر شباهت میان دو وکتور تمرکز داشت و نمونه‌هایی با ویژگی‌های چندگانه و جامع‌تر را بهتر شناسایی می‌کند، در نتیجه تجربه بهتری برای کاربران فراهم می‌آورد و نتایج جستجو را دقیق‌تر و مرتبط‌تر می‌سازد.

در مجموع، این فناوری‌های نوین، سرعت و بهره‌وری پلتفرم پینترست را افزایش داده، هزینه‌ها را کاهش داده و کارایی سیستم را به حد چشمگیری ارتقاء می‌بخشد. آینده این سیستم، بهره‌گیری بیشتر از تکنولوژی‌های پیشرفته برای درک بهتر محتوا و ارائه نتایج جستجوی شخصی‌سازی‌شده‌تر است که جذابیت و رضایت کاربران را افزایش می‌دهد.

#پینترست #هوش_مصنوعی #توسعه_پایدار #فناوری

🟣لینک مقاله:
https://medium.com/pinterest-engineering/evolving-pinterests-embedding-retrieval-platform-aede4e831e01?utm_source=tldrdata

➖➖➖➖➖➖➖➖
👑 @Database_Academy
🔵 عنوان مقاله
The Half-Life of a Query (7 minute read)

🟢 خلاصه مقاله:
در دنیای امروز، ابزارهایی مانند dbt نقش مهمی در تبدیل تحلیل‌های ناپایدار و بدون مستندسازی به سیستم‌هایی قابل تکرار و معتبر ایفا می‌کنند. این ابزارها با ساختن ساختارهای منسجم و استاندارد، فرآیندهای تحلیل داده را پایدارتر و قابل اطمینان‌تر می‌سازند، به طوری که در صورت نیاز، می‌توان به راحتی نتایج قبلی را تایید و بازتولید کرد. این خصوصیت به ویژه در محیط‌های کاری که دقت و سازگاری برای تصمیم‌گیری‌های حیاتی بسیار مهم است، اهمیت فراوانی دارد.

در مقابل، هوش مصنوعی در بسیاری موارد نمی‌تواند محدودیت‌ها و شروط خاص محل کار را به خوبی درک کند. سیستم‌های هوشمند ممکن است فرض‌هایی را بپذیرند که در دنیای واقعی کاربرد ندارند، یا از رعایت محدودیت‌های محیط کار ناتوان باشند. بنابراین، هرچند فناوری‌های نوین قدرتمند هستند، اما در زمینه‌های عملی و محدودیت‌های متنوع شرکت‌ها، نیاز به درک عمیق و نظارت انسانی همچنان احساس می‌شود، و نمی‌توان به طور کامل به هوش مصنوعی اعتماد کرد.

در نتیجه، برای پایداری و صحت تحلیل‌های داده، ترکیب ابزارهای خودکار مانند dbt با نظارت و مدیریت انسانی بهترین راه‌حل است. این روش نه تنها اطمینان می‌دهد که تحلیل‌ها قابل اعتماد هستند، بلکه انعطاف‌پذیری لازم برای انطباق با شرایط متغیر محیط کاری را فراهم می‌آورد.

#تحلیل_داده #مدیریت_پایدار #هوش_مصنوعی #ابزارهای_تحلیلی

🟣لینک مقاله:
https://covertaltruism.substack.com/p/the-half-life-of-a-query?utm_source=tldrdata

➖➖➖➖➖➖➖➖
👑 @Database_Academy
🔵 عنوان مقاله
Postgres Development Activity Over 28 Years

🟢 خلاصه مقاله:
در طول ۲۸ سال فعالیت توسعه PostgreSQL، تغییرات قابل توجهی در روند توسعه این پایگاه داده بزرگ و مهم رخ داده است. در ابتدا، روند فعالیت‌ها نسبتاً کم‌وبیش ثابت بود، اما به تدریج و با گذشت زمان، حجم فعالیت‌های توسعه‌دهندگان به شدت افزایش یافت.

تیترهای نمودارهایی که توماس ارائه داده، نشان می‌دهند که گروه توسعه‌دهندگان و علاقه‌مندان به پروژه، در طول سال‌ها بسیار فعال‌تر شده‌اند. این افزایش فعالیت‌ها در قالب افزایش تعداد ارسال‌های کد، اصلاحات، و افزودن ویژگی‌های جدید نمایان است. هرچند تعداد تغییرات جدید در قالب commits و عملیات افزودن و حذف کدها به صورت آهسته اما پیوسته رشد کرده است، اما این روند نشان‌دهنده توسعه مداوم و پشتکار در مسیر بهبود و توسعه PostgreSQL است.

این رشد مستمر و پیوسته نشان می‌دهد که جامعه توسعه‌دهندگان PostgreSQL چقدر در طول زمان پرجنب‌وجوش و فعال باقی مانده و همواره در حال پیشرفت است. این روند نه تنها نشان‌دهنده پویایی پروژه است، بلکه اهمیت و محبوبیت PostgreSQL را در حوزه بانک‌های اطلاعاتی جهانی نیز بیشتر می‌کند.

پروژه‌ای که پس از این سال‌ها، همچنان در حال رشد و توسعه است و روز به روز بر قدرت و کارایی آن افزوده می‌شود، نشان دهنده تعهد و تلاش بی‌وقفه جامعه توسعه‌دهندگان تخصصی است که از فناوری‌های متن‌باز حمایت می‌کنند.

#پستگرس #توسعه_پایدار #پایگاه‌داده #کدباز

🟣لینک مقاله:
https://vondra.me/posts/postgres-development-activity/

➖➖➖➖➖➖➖➖
👑 @Database_Academy
Forwarded from Gopher Academy
اپدیت به زودی 🚀 تلگرام از میانگین زمان سین زدن و جواب دادن به پیام‌های پیوی! 💬

اینجوریه که مثلا وقتی وارد پروفایل یک شخص میشید، اون قسمت بالای شمارش میزنه بطور میانگین، چقدر سریع به پیام‌ها پاسخ میده؛ مثلا 5 دقیقه، 2 ساعت یا 3 روز! ⏱️
🔵 عنوان مقاله
lists what's still shipping

🟢 خلاصه مقاله:
در این فهرست، مواردی مانند عملیات خودکار موازی (parallel autovacuum) و دستور ON CONFLICT DO SELECT همچنان در حال عرضه و در دسترس هستند. این امکانات، نقش مهمی در بهبود کارایی و مدیریت بهتر بانک‌های اطلاعاتی بازی می‌کنند و نشان می‌دهد تیم توسعه به طور پیوسته در حال افزودن ویژگی‌های جدید و بهبود قابلیت‌های موجود است. کاربران و توسعه‌دهندگانی که به دنبال بهره‌برداری حداکثری از امکانات PostgreSQL هستند، می‌توانند با اطمینان به استفاده از این ویژگی‌ها ادامه دهند و مطمئن باشند که این موارد در نسخه‌های آینده نیز فعال و پشتیبانی می‌شود.

این قابلیت‌ها، امکانات کاربردی و مهمی برای توسعه‌دهندگان و مدیران بانک‌های اطلاعاتی فراهم می‌کنند تا عملیات همزمان و مدیریت خطاها را به شکل بهتری انجام دهند، بدون نگرانی در مورد توقف یا محدودیت‌های سیستم. پیوسته بودن عرضه این ویژگی‌ها، نشانگر رشد و توسعه مداوم اکوسیستم پایگاه داده است که در نهایت موجب بهبود تجربه کاربری و کارایی سیستم‌های مبتنی بر این فناوری می‌شود.

#پایگاه_داده #توسعه_نرم‌افزار #PostgreSQL #ارتقاء_سیستم

🟣لینک مقاله:
https://www.snowflake.com/en/blog/engineering/postgresql-19-release-delay-feature-reverts/

➖➖➖➖➖➖➖➖
👑 @Database_Academy
🔵 عنوان مقاله
Teaching a 4B Model to Write 81% Faster Query Plans

🟢 خلاصه مقاله:
در یک پروژه تعطیلات در مرکز ریکورس، یک توسعه‌دهنده از تکنیک‌های یادگیری تقویتی برای آموزش یک مدل کوچک استفاده کرد تا بتواند برنامه‌های پرس‌وجوی بهبود یافته‌تری را تولید کند. هدف این بود که با کمک این مدل، روند نوشتن برنامه‌های پرس‌وجو که نیاز به بریدن و اتصال‌های پیچیده دارند، سریع‌تر انجام شود. نتایج این تلاش نشان داد که این مدل توانسته است تا ۸۱ درصد سریع‌تر از روش‌های سنتی، طرح‌های پرس‌وجویی را تهیه کند.

در حین آزمایش‌ها، این مدل نه تنها در صرفه‌جویی زمان موفق ظاهر شد، بلکه در برخی موارد، حتی از برنامه‌های خود سیستم مدیریت پایگاه داده پستگرس نیز بهتر عمل کرد. این دستاورد قابل توجه، نشان‌دهنده پتانسیل بالای یادگیری ماشینی در بهبود فرآیندهای مرتبط با نوشتن پرس‌وجوها است و می‌تواند شروعی باشد بر کاربرد گسترده‌تر این فناوری در بهینه‌سازی سیستم‌های پایگاه داده.

این مطالعه جذاب و الهام‌بخش، اثبات می‌کند که با استفاده از روش‌های نوین آموزش ماشین، می‌توان به نتایج شگفت‌انگیزی در زمینه بهبود عملکرد برنامه‌های پایگاه داده دست یافت و آینده‌ای نوین در این حوزه رقم زد.

#یادگیری_تقویتی #پایگاه_داده #بهینه‌سازی_پرس‌وجو #فناوری

🟣لینک مقاله:
https://rohanbansal.com/qorl

➖➖➖➖➖➖➖➖
👑 @Database_Academy
🔵 عنوان مقاله
How Adaptive Tail Sampling Works in the OpenTelemetry Collector (7 minute read)

🟢 خلاصه مقاله:
در فرآیند جمع‌آوری داده‌ها در سیستم‌های پایش و نظارت، روش نمونه‌گیری از بخش‌های انتهایی (tail sampling) نقش مهمی در تعیین صحت و ارزش اطلاعات دارد. روش‌های ثابت که بر اساس نرخ از پیش تعیین‌شده کار می‌کنند، ممکن است نادیده گرفتن موارد نادر یا استثنایی در تریک‌های خاص را در زمان وقوع حوادث ایجاد کنند، زیرا این تریک‌ها اغلب به‌عنوان نمونه‌های کمیاب در نظر گرفته می‌شوند. از سوی دیگر، روش‌های معمول نمونه‌گیری انتهای مسیر (tail sampling)، که بر اساس آمار و ارقام انجام می‌شوند، ممکن است وزن‌های آماری مهم را از دست بدهند و در نتیجه تحلیل‌های دقیق‌تر را مختل کنند.

در این میان، توسعه یک سامانه نمونه‌گیری تطبیقی (adaptive tail sampler) برای جمع‌آوری‌کننده OpenTelemetry، یک پیشرفت مهم محسوب می‌شود. این سامانه قادر است داده‌های تریک را در حافظه موقت نگهداری، قوانین مرتب و استوار را اعمال کند و از طریق تعیین حد نصاب‌های احتمالی W3C، وزن‌های شمارش در مراحل بعدی تحلیل را مجدد تنظیم کند. این ویژگی باعث می‌شود تا مقادیر مربوط به تلاش‌های نظارتی و تشخیص مشکلات با دقت بیشتری ارزیابی شود و اطلاعات مهم حفظ شود، حتی در زمان بارگذاری بالا و حجم زیاد داده‌ها.

علاوه بر این، این سامانه تطبیقی بر اساس مسیر و سرویس‌های مورد استفاده، به گونه‌ای هوشمندانه سازگار می‌شود و حافظه مصرفی را در شرایط فشار کاری محدود می‌کند. این ویژگی‌ها باعث می‌شود سیستم انعطاف‌پذیرتر و کارآمدتر شود، و در مسیر توسعه به سمت نسخه آزمایشی اولیه (آلفا) پیش برود. با این رویکرد، برنامه‌نویسان و تیم‌های نظارتی قادر خواهند بود تا به صورت موثرتری تریک‌های نادر و حیاتی را کنترل و تحلیل کنند، فرآیندی که در نهایت به بهبود کیفیت زیرساخت‌های مانیتورینگ و تجزیه و تحلیل کمک می‌کند.

#نظارت #سامانه_تطبیقی #جمع‌آوری_داده #پایش

🟣لینک مقاله:
https://www.honeycomb.io/blog/how-adaptive-tail-sampling-works?utm_source=tldrdata

➖➖➖➖➖➖➖➖
👑 @Database_Academy
🔵 عنوان مقاله
pgwrh 1.0 Alpha: Read Scaling with Sharded Replicas

🟢 خلاصه مقاله:
در دنیای پایگاه‌های داده، مقیاس‌پذیری و بهبود عملکرد اهمیت بسیار زیادی دارد. یکی از فناوری‌های نوآورانه در این زمینه، پروژه‌ای آزمایشی است که به نام PGWRH 1.0 Alpha شناخته می‌شود. این پروژه به طور خاص به توسعه روش‌های جدید برای افزایش توان عملیاتی و بهره‌وری در سیستم‌های پایگاه داده‌های توزیع‌شده می‌پردازد.

این فناوری نوین با هدف تقسیم‌بندی جداول بزرگ، آن‌ها را در چندین نسخه کپی در نظر می‌گیرد که در قالب «شاردینگ» یا تقسیم‌بندی شید شده‌اند. اما نکته برجسته این است که هر کپی تنها بخشی از داده‌ها را در بر می‌گیرد و در ادامه، بخش‌های باقی‌مانده از طریق ارتباط با سایر رپلیکاهای خواندنی دریافت می‌شود. این رویکرد باعث کاهش فشار روی هر سرور مستقل می‌شود و امکان پاسخ‌دهی سریع‌تر به درخواست‌ها را فراهم می‌آورد. البته باید توجه داشت که این فناوری در مراحل آزمایشی قرار دارد و برای کاربردهای تولیدی مناسب نیست.

در مجموع، این پروژه یک قدم نوآورانه در مسیر توسعه سیستم‌های مقیاس‌پذیر است، که به کمک آن می‌توان در آینده نزدیک راه‌حل‌های قدرتمندتری برای مدیریت داده‌های بزرگ و سیستم‌های توزیع‌شده ارائه کرد. حال، در حالی که این فناوری هنوز در مرحله آزمایش است، نشان می‌دهد که مسیر پیش رو در زمینه مدیریت پایگاه‌های داده چقدر امیدوارکننده و پر از نوآوری است.

#پایگاه_داده #مقیاس_پذیری #توزیع_داده #پروژه_آزمایشی

🟣لینک مقاله:
https://github.com/mkleczek/pgwrh

➖➖➖➖➖➖➖➖
👑 @Database_Academy
🔵 عنوان مقاله
Profile your Polars queries (2 minute read)

🟢 خلاصه مقاله:
در دنیای پردازش داده‌های بزرگ، بهبود کارایی و سرعت اجرای کوئری‌ها اهمیت زیادی دارد. حالا، فریم‌ورک Polars ابزار جدیدی را برای پروفایل کردن کوئری‌ها ارائه کرده است که به توسعه‌دهندگان اجازه می‌دهد عملکرد کوئری‌های محلی و متن‌باز خود را به راحتی ارزیابی و بهبود بخشند. این ابزار، نقش مهمی در شناسایی نقاط ضعف و بهینه‌سازی سریع کدها ایفا می‌کند.

با استفاده از پروفایلر جدید Polars، می‌توانید بخش‌های مختلف اجرای کوئری‌ها را بررسی کنید، زمان صرف شده در هر مرحله را اندازه‌گیری کنید و در نتیجه، تصمیم‌های بهتر برای بهبود عملکرد بگیرید. این قابلیت بخصوص برای توسعه‌دهندگانی که در پروژه‌های متن‌باز و محیط‌های محلی کار می‌کنند، بسیار کاربردی است و سرعت توسعه و تست را به شدت افزایش می‌دهد.

در نهایت، این ویژگی جدید نشان می‌دهد که Polars به عنوان یک ابزار قدرتمند و متن‌باز در حوزه پردازش داده‌های بزرگ، همچنان در حال توسعه و افزودن امکانات کاربرپسند است. بهره‌برداری از پروفایلر این فریم‌ورک می‌تواند به بهبود چشمگیر کارایی پروژه‌های داده‌محور کمک کند و توسعه‌دهندگان را در مسیر بهبود مداوم کدهای خود یاری رساند.

#پردازش_داده #پروفایلر #Polars #کدنویسی عالی

🟣لینک مقاله:
https://pola.rs/posts/profile-local-queries/?utm_source=tldrdata

➖➖➖➖➖➖➖➖
👑 @Database_Academy
Forwarded from AI
با کدوم نام موافق هستی برای هوش مصنوعی
Anonymous Poll
77%
🔴AI = Artificial Intelligence
28%
🔵SI = Super Intelligence
🔵 عنوان مقاله
Real-time LLM guardrails with Jev: comparing latency and cost (13 minute read)

🟢 خلاصه مقاله:
در دنیای پیشرفته هوش مصنوعی، تضمین امنیت و کنترل در لحظه اهمیت فراوانی دارد. سیستم Jev شرکت TypeSafe، با هدف فراهم‌سازی خط‌کش‌های حفاظتی در زمان واقعی، از مدلی تصمیم‌گیری خاص و منحصربه‌فرد بهره می‌برد که قبل از اجرای هر ورودی، پاسخ یا فراخوانی ابزار، آن‌ها را بررسی و کنترل می‌کند. این رویکرد، امکان نظارت و کنترل دقیق بر فعالیت‌های هوش مصنوعی را فراهم می‌سازد و از وقوع خطاها یا سوءاستفاده‌های احتمالی جلوگیری می‌کند.

در آزمایش‌های انجام‌شده توسط شرکت Arize، سیستم Jev توانست همان تصمیماتی را بگیرد که نسخه‌ی کوچک GPT-5.4 nano اتخاذ می‌نمود، اما با سرعتی بین ۱۵ تا ۱۸ برابر بیشتر و با هزینه‌ای تنها ۱۲ تا ۱۴ برابر کمتر در هر درخواست. این نتایج نشان می‌دهد که استفاده از مدل‌های خاص و بهینه‌سازی شده در کنار فناوری‌های زمان‌واقعی، می‌تواند عملکرد سیستم‌های هوش مصنوعی را به شدت بهبود بخشد و هزینه‌های عملیاتی را به طور چشم‌گیری کاهش دهد.

به طور خلاصه، Jev ترکیبی است از امنیت، سرعت و صرفه‌جویی اقتصادی که می‌تواند در توسعه و پیاده‌سازی هوش مصنوعی در صنایع مختلف تاثیرگذار باشد، و راهکارهای آینده‌نگرانه‌ای برای کنترل و مدیریت هوش مصنوعی ارائه دهد. این فناوری نوآورانه، به صنایع امکان می‌دهد ضمن حفظ امنیت، بهره‌وری و هزینه‌های عملیاتی خود را ارتقاء دهند.

#هوش_مصنوعی #کنترل_زمان_واقعی #صرفه‌جویی_هزینه #امنیت_سیستم

🟣لینک مقاله:
https://arize.com/blog/llm-guardrails-jev/?utm_source=tldrdata

➖➖➖➖➖➖➖➖
👑 @Database_Academy
🔵 عنوان مقاله
How Concurrence governs clinical AI at a trillion-token scale with Unity Gateway (7 minute read)

🟢 خلاصه مقاله:
در جهان پیشرفته‌ی مراقبت‌های بهداشتی، مدیریت هوش مصنوعی بالینی در مقیاس عظیم یکی از چالش‌های اصلی است. شرکت Concurrence با بهره‌گیری از پلتفرم قدرتمند Databricks، توانسته است هوش مصنوعی بالینی را در سطحی بی‌نظیر مدیریت و نظارت کند. این سیستم هر سال تقریباً ۱.۲ تریلیون توکن ورودی شامل اطلاعات بیماران، وضعیت عامل‌های هوشمند، نتایج آزمایش‌ها، ارزیابی‌ها و کنترل‌های دسترسی را در بر می‌گیرد. ادغام این داده‌ها در یک بستر واحد امکان مدیریت متمرکز، تحلیل سریع و تضمین امنیت و رعایت استانداردهای مرتبط را فراهم می‌آورد، که در نهایت به افزایش دقت و کارایی در فرآیندهای بالینی منجر می‌شود.

پلتفرم Unity Gateway نقش مهمی در این سیستم ایفا می‌کند؛ این ابزار مرکزیت دسترسی به مدل‌ها و ابزارهای تاییدشده هوش مصنوعی را فراهم می‌آورد. با استفاده از Unity Gateway، شرکت قادر است نحوه استفاده از فناوری‌های هوش مصنوعی را پیگیری کرده، مطمئن شود که تمام فرآیندها مطابق با مقررات و استانداردهای اخلاقی انجام می‌گیرد، و در عین حال توانایی توسعه و گسترش ایمن عامل‌های بالینی و کدگذاری را دارد. این رویکرد، نه تنها امنیت و انطباق را تضمین می‌کند بلکه امکان نوآوری و توسعه سریع در حوزه هوشمندسازی مراقبت‌های بهداشتی را فراهم می‌سازد.

در نتیجه، Concurrence با ترکیب فناوری‌های پیشرفته‌ و استراتژی‌های نظارتی قوی، مسیر را برای آینده‌ی هوش مصنوعی در مراقبت‌های پزشکی هموار می‌سازد و نشان می‌دهد چگونه می‌توان در مقیاس وسیع، همزمان با رعایت استانداردهای بالای ایمنی و کیفیت، فرآیندهای بالینی را بهبود بخشید.

#هوش_مصنوعی #مراقبت‌های_سلامتی #مدیریت_پزشکی #توسعه_مبتنی_بر_داده

🟣لینک مقاله:
https://www.databricks.com/blog/how-concurrence-governs-clinical-ai-trillion-token-scale-unity-gateway?utm_source=tldrdata

➖➖➖➖➖➖➖➖
👑 @Database_Academy
🔵 عنوان مقاله
Benchmarks are more broken than we could have imagined (15 minute read)

🟢 خلاصه مقاله:
در دنیای هوش مصنوعی، معیارها و بنچمارک‌ها نقش مهمی در سنجش و ارزیابی پیشرفت‌های فناوری دارند. ولی بر اساس تحقیقات اخیر، این معیارها بیشتر از آنچه تصور می‌کردیم، ناپایدار و مشکل‌دار شده‌اند. تیم بررسی‌کننده horizon با بررسی بیش از ۵۰۰۰ وظیفه بنچمارک در ۲۰ مجموعه داده مختلف، مشخص کردند که ۲۹ مورد از این بنچمارک‌ها با مشکلات جدی روبه‌رو هستند. این مشکلات شامل نشت پاسخ‌ها، آزمایش‌های ناتمام، graders قابل فریب و راه‌حل‌های مرجع ناقص بودند. این خطاها نه تنها ارزشیابی‌های نادرستی ایجاد می‌کنند، بلکه در برخی موارد باعث بالا رفتن نمرات مدل‌ها شده و در نتیجه تصویر نادرستی از توانایی‌های واقعی آن‌ها به دست می‌دهند. چنین یافته‌هایی نشان می‌دهد که نتایج بنچمارک‌ها در صورت وجود این نواقص، ممکن است اغراقی و گمراه‌کننده باشند؛ زیرا زیرساخت‌های اصلی ارزیابی‌ها قابل اعتماد نبوده و می‌تواند توانایی‌های واقعی مدل‌ها را نادرست نشان دهند.

در نتیجه، این کاستی‌ها اهمیت بازنگری و اصلاح سیستم‌های ارزیابی در حوزه هوش مصنوعی را بیش از پیش روشن می‌کند، تا بتوان تصویر واقعی‌تری از پیشرفت‌های فناوری در اختیار داشت و مسیر توسعه مدل‌های هوشمند را بهتر هدایت کرد.

#هوش_مصنوعی #بنچمارک #ارزیابی_مدل #پیشرفت_هوش

🟣لینک مقاله:
https://www.horizonanalyticslabs.com/research/public-benchmark-dataset-audit?utm_source=tldrdata

➖➖➖➖➖➖➖➖
👑 @Database_Academy
🔵 عنوان مقاله
pgBackRest Compression: How Much CPU is a Smaller Backup Worth?

🟢 خلاصه مقاله:
در دنیای مدیریت پشتیبان‌گیری‌های پایگاه داده، فشرده‌سازی داده‌ها نقش مهمی در کاهش حجم و صرفه‌جویی در فضای ذخیره‌سازی دارد. در این راستا، ابزار pgBackRest یکی از محبوب‌ترین راهکارها است که از الگوریتم‌های مختلف فشرده‌سازی بهره می‌برد. اما سوال این است که چه میزان مصرف CPU برای اجرای این عملیات لازم است و آیا افزایش مصرف CPU در نهایت منجر به کاهش قابل توجه حجم پشتیبان می‌شود؟ در این مطالعه، به بررسی سطح‌های مختلف فشرده‌سازی در pgBackRest و میزان سودمندی هر کدام می‌پردازیم تا تعیین کنیم کجای این فرآیند، دیگر صرف CPU ارزش ندارد و نرخ کاهش حجم داده‌ها به حداقل می‌رسد.

در این ارزیابی، آزمایش‌های متعددی بر روی الگوریتم‌های گوناگون انجام شد تا بهترین تعادل بین مصرف CPU و کاهش حجم پشتیبان پیدا شود. نتایج نشان می‌دهد که در اکثر موارد، استفاده از الگوریتم «Zstandard» در سطوح پایین‌ترین گزینه‌ها، بهترین نتیجه را ارائه می‌دهد؛ یعنی، این الگوریتم در سطح پایین، کم‌ترین مصرف CPU را دارد و در عین حال، بهره‌وری قابل قبولی در کاهش حجم داده‌ها نشان می‌دهد. این کشف، برای مدیران پایگاه داده بسیار حیاتی است، زیرا نشان می‌دهد نیازی نیست برای کسب کاهش حجم بیشتر، صرف منابع بیشتری کرد؛ چراکه سود حاصل در سطح‌های کمتر، بیشتر است.

در نهایت، این مطالعه چراغ راهی است برای تصمیم‌گیری هوشمندانه در تنظیمات پشتیبان‌گیری، تا پیش از صرف هزینه‌های بی‌مورد در مصرف CPU، بهترین کاهش حجم داده‌ها حاصل شود و سیستم‌های پایگاه داده بهینه‌تر و کارآمدتر عمل کنند. نتیجه‌گیری کلیدی این است که در مورد pgBackRest، «زماستند در سطح کم، نقطه عطف استراتژیک است»، که می‌تواند بهره‌وری سیستم پشتیبان‌گیری شما را به طور چشمگیری بهبود بخشد.

#پشتیبان_گیری #مدیریت_کایفا_پایگاه_داده #فشرده‌سازی #زماستند

🟣لینک مقاله:
https://www.percona.com/blog/pgbackrest-compression-how-much-cpu-is-a-smaller-backup-worth/

➖➖➖➖➖➖➖➖
👑 @Database_Academy
🔵 عنوان مقاله
High-Throughput OLTP in Three Simple Steps (6 minute read)

🟢 خلاصه مقاله:
در سیستم‌های تراکنش با حجم بالا، رویکرد هم‌طراحی (co-design) به جای تقلید الگوهای معمول مانند استفاده از استخر ارتباطات (connection pool) از پایگاه‌داده‌های چند منظوره، اهمیت فراوانی دارد. ابزارهای مدرن مانند TigerBeetle بر پایه مفهوم مدل‌سازی انتقال‌های متصل و هم‌زمان کار می‌کنند، به گونه‌ای که انتقال‌های مرتبط به صورت اتمی ثبت می‌شوند. این سیستم به جای پردازش‌های تکراری و زمان‌بر، به جمع‌آوری موجودی‌ها بدون نیاز به اسکن‌های مکرر کمک می‌کند، عملیات‌ها را به صورت گروهی و به‌طور خودکار در حین درخواست‌هایی که در جریان است، دسته‌بندی می‌کند و فرآیند تشخیص یکنواختی و جلوگیری از تکرار را با شناسه‌های زمان‌مرتب شده تسریع می‌کند.

این رویکردهای پیشرفته در طراحی، نقش مهمی در بهبود کارایی و سرعت سیستم‌های تراکنش با حجم بالا دارند. بر اساس نتایج benchmarkهای انجام‌شده، مشخص شده است که استفاده از دسته‌بندی عملیات‌ و شناسه‌های زمان‌مرتب می‌تواند بیشتر از افزودن مشتریان جدید، تأثیر گذار باشد. این نکات نشان می‌دهد که بهینه‌سازی ساختار و نظم داده‌ها در سیستم‌های تراکنش، کلید دستیابی به عملکرد بهتر و پاسخگویی سریع‌تر است و می‌تواند راهکاری مؤثر برای مدیریت حجم عظیم درخواست‌ها باشد.

#سیستم_تراکنش #بهینه‌سازی_پایگاه‌داده #مدیریت_حجم_بالا #عملکرد_بهتر

🟣لینک مقاله:
https://tigerbeetle.com/blog/2026-09-17-performant-use-of-tigerbeetle?utm_source=tldrdata

➖➖➖➖➖➖➖➖
👑 @Database_Academy
❤1
🔵 عنوان مقاله
Introducing prompt_jev(): bringing Jev to MotherDuck SQL (5 minute read)

🟢 خلاصه مقاله:
شرکت MotherDuck به تازگی از یک ویژگی جدید به نام prompt_jev رونمایی کرده است که امکان استفاده از فناوری Jev را مستقیماً در محیط SQL فراهم می‌کند. این ابزار به کاربران اجازه می‌دهد متن‌ها را در مقیاس تحلیل و دسته‌بندی کنند و امتیازدهی انجام دهند، بدون نیاز به آموزش مدل‌های پیچیده یا تفسیر پاسخ‌های مدل‌های زبانی بزرگ (LLM). در آزمایش‌های استاندارد خود با ۱۰۰ هزار ردیف داده، Jev توانست با دقت ۸۹ درصد در عرض تنها ۴۰ ثانیه و با هزینه حدود ۵۰۰ سنت، نتایج قابل توجهی ارائه دهد. این فناوری نه تنها از لحاظ سرعت بالاتر از مدل‌های زبانی مختلف قرار دارد، بلکه از نظر هزینه و دقت نیز برتر است و می‌تواند راهکاری مقرون‌به‌صرفه و کارآمد برای تحلیل داده‌های بزرگ باشد، چیزی که در دنیای امروز بسیار مورد نیاز است.

در نتیجه، این نوآوری، فرصت‌های جدیدی برای کسب‌وکارها و تحلیلگران فراهم می‌آورد تا بتوانند در عرض چند ثانیه اطلاعات مهم را استخراج کنند و تصمیم‌گیری‌های سریع‌تر و هوشمندانه‌تری داشته باشند. با این قابلیت، سطح جدیدی از بهره‌وری در تحلیل داده‌ها و بهره‌برداری از فناوری‌های نوین در دنیای داده‌ها رقم می‌خورد که بدون نیاز به تخصص عمیق در مدل‌سازی، می‌تواند برتری قابل توجهی در رقابت‌های تجاری ایجاد کند.

#تحلیل_داده #هوش_مصنوعی #مدلسازی #پیشرفت_تکنولوژی

🟣لینک مقاله:
https://motherduck.com/blog/motherduck-supports-jev/?utm_source=tldrdata

➖➖➖➖➖➖➖➖
👑 @Database_Academy
🔵 عنوان مقاله
We ported the original Doom to SQL (25 minute read)

🟢 خلاصه مقاله:
در این مقاله، تیم CedarDB موفق شد نسخه اصلی بازی Doom را تقریباً به طور کامل به زبان SQL پورت کند. این پروژه شامل انتقال منطق گیم‌پلی و سیستم رندرینگ بازی است که در نتیجه، بازی در حلقه اصلی خود با سرعت ۳۵ هرتز اجرا می‌شد و بخش رندرینگ آن تا حداکثر ۶۰ فریم بر ثانیه به نمایش درمی‌آمد. این آزمایش نشان می‌دهد که منطق زمان‌بر و نسبتاً پیچیده در لحظه، با مدل مبتنی بر مجموعه‌های SQL تا حد قابل توجهی قابل اجرا است، در حالی که امکانات پایگاه داده‌هایی مانند تراکنش‌ها، کنترل دسترسی و حالت‌های مشترک، اجرای بازی چندنفره را بسیار طبیعی و هم‌سطح می‌کند.

تلاش تیم CedarDB نشان می‌دهد که فناوری‌های پایگاه داده حتی در حوزه‌هایی مانند بازی‌های با زمان‌گذاری حساس و نیازمند پردازش سریع، قابلیت‌های قابل توجهی دارند. این نوآوری به توسعه‌دهندگان کمک می‌کند تا با بهره‌گیری از مزایای SQL، تجربه‌های نوآورانه و کارآمدتری در توسعه بازی‌های چندنفره و سیستم‌های تعاملی پیشرفته ایجاد کنند.

#بازی #توسعه_نرم_افزار #پایگاه_داده #توسعه_بازی

🟣لینک مقاله:
https://cedardb.com/blog/sqldoom/?utm_source=tldrdata

➖➖➖➖➖➖➖➖
👑 @Database_Academy
❤1
🔵 عنوان مقاله
pgColumnar 1.0 Alpha 4: A Columnar Table Access Method

🟢 خلاصه مقاله:
روش دسترسی به جداول ستونی pgColumnar 1.0 Alpha 4: یک روش جدید برای دسترسی به داده‌ها در جداول ستونی است که در پایگاه داده پستگرس توسعه یافته است. این امکان، نوعی فضای ذخیره‌سازی ستونی را در اختیار کاربران قرار می‌دهد که نقش مهمی در بهبود کارایی و سرعت عملیات‌های مختلف دارد. نسخه آزمایشی (آلفا) این ابزار، قابلیت‌های جدیدی ارائه می‌دهد که می‌تواند روند پردازش داده‌های بزرگ را بسیار بهبود بخشد.

در این نسخه، یکی از ویژگی‌های برجسته، استفاده از مسیر منحنی هیلبرت برای قرار دادن داده‌ها در فضا است. این فناوری کمک می‌کند که داده‌ها به صورت منظمی در صفحات ذخیره شوند که منجر به افزایش بهره‌وری در عملیات‌های فیلترینگ و خواندن داده‌ها می‌شود. به طور خاص، این روش باعث کاهش تعداد گروه‌های ردیف مورد نیاز برای خواندن در عملیات‌های محدوده‌ای می‌شود، به طوری که تا دو برابر کمتر نسبت به روش Z-order، داده‌ها بازخوانی می‌شوند و در نتیجه سرعت کلی عملیات افزایش می‌یابد.

در مجموع، pgColumnar 1.0 Alpha 4 یک ابزار قدرتمند است که توسعه‌دهندگان پایگاه داده را قادر می‌سازد تا داده‌ها را به صورت موثرتری مدیریت و تجزیه و تحلیل کنند. این فناوری نوآورانه، چشم‌اندازهای جدیدی را در زمینه ساختارهای داده‌ای و بهینه‌سازی عملیات‌های پیچیده ارائه می‌دهد، و می‌تواند نقش مهمی در توسعه سیستم‌های پردازش داده‌های بزرگ ایفا کند.

#پستگرس #دیتابیس #ذخیره‌سازی_ستونی #بهینه‌سازی

🟣لینک مقاله:
https://www.commandprompt.com/blog/pgcolumnar-10-alpha4-released/

➖➖➖➖➖➖➖➖
👑 @Database_Academy
🔵 عنوان مقاله
Earn your Master of Translational Data Analytics online from The Ohio State University. (Sponsor)

🟢 خلاصه مقاله:
در دنیای امروز، تحلیل داده‌های کاربردی نقش حیاتی در تصمیم‌گیری‌های استراتژیک دارد. دانشگاه اوهایو با ارائه برنامه‌ی آنلاین «کارشناسی ارشد در تجزیه و تحلیل داده‌های ترانسلی»، فرصتی منحصربه‌فرد برای علاقه‌مندان فراهم کرده است تا در این حوزه به تخصص برسند. این برنامه‌ی چندرشته‌ای، مهارت‌هایی مانند یادگیری ماشین، تجربه کاربری، تصویرسازی داده و تفکر طراحی را در کنار یکدیگر جمع آورده است تا دانش‌آموختگان بتوانند داده‌ها را به صورت مؤثر تفسیر و به دیگران منتقل کنند.

این دوره آموزشی به طور ویژه بر آموزش نحوه‌ی داستان‌سرایی با داده‌ها تمرکز دارد، به‌طوری که شرکت‌کنندگان قادر خواهند بود یافته‌های خود را به شکل روایت‌های جذاب و قابل فهم برای عموم ارائه دهند. با فراگیری این مهارت‌ها، افراد نه تنها می‌توانند داده‌ها را تحلیل کنند، بلکه پیام‌های مهم را به شیوه‌ای قانع‌کننده و قابل درک برای تصمیم‌گیرندگان و مخاطبان گسترده‌تر منتقل نمایند. این برنامه، بهترین فرصت برای کسانی است که می‌خواهند در حوزه تحلیل داده‌ها توانمندسازی شده و راهکارهای نوآورانه ارائه دهند.

همین حالا فرصت را از دست ندهید و در برنامه‌ی آنلاین کارشناسی ارشد در تحلیل داده‌های ترانسلی شرکت کنید تا مسیر حرفه‌ای خود را به سمت موفقیت هموار سازید.

#تحلیل_داده #یادگیری_ماشین #داستان‌سرایی_با_داده #آموزش_آنلاین

🟣لینک مقاله:
https://online.osu.edu/masters-degree/master-data-analytics/?lead_source=Response-Solutions&utm_campaign=oaa_oso_tda-student-recruitment_fy27_tldr&channel=Other-Paid&utm_source=3rd-Party-Display&utm_medium=ENewsletter&sp=cMJq3vO_CoP6pShNBTnQzrgF

➖➖➖➖➖➖➖➖
👑 @Database_Academy