پروژه Datayar مشکل پراکندگی جستوجوی دیتاست و ریپازیتوری بین چند منبع مختلف رو کمتر کنه.
امکانات اصلی:
جستوجوی همزمان در Hugging Face، GitHub، Kaggle و OpenML
مقایسه نتایج از چند منبع
امکان سؤال پرسیدن درباره هر Dataset یا Repository به صورت اختصاصی
استخراج و ساختاردهی اطلاعات مهم قبل از ارسال به مدل
یکپارچهسازی مسیر جستوجو، بررسی و انتخاب منابع
کاهش توکن سوزی ایجنت ها برای مراحل ریسرچ پروژه ها
https://github.com/Elcapunnn/Datayar.git
@ | <MohammadAmin/>
امکانات اصلی:
جستوجوی همزمان در Hugging Face، GitHub، Kaggle و OpenML
مقایسه نتایج از چند منبع
امکان سؤال پرسیدن درباره هر Dataset یا Repository به صورت اختصاصی
استخراج و ساختاردهی اطلاعات مهم قبل از ارسال به مدل
یکپارچهسازی مسیر جستوجو، بررسی و انتخاب منابع
کاهش توکن سوزی ایجنت ها برای مراحل ریسرچ پروژه ها
https://github.com/Elcapunnn/Datayar.git
@ | <MohammadAmin/>
GitHub
GitHub - Elcapunnn/Datayar: AI-powered discovery engine for datasets and code repositories across Hugging Face, GitHub, OpenML…
AI-powered discovery engine for datasets and code repositories across Hugging Face, GitHub, OpenML, and Kaggle. - Elcapunnn/Datayar
🔵 عنوان مقاله
Why Spotify is not using Bayesian A/B testing (12 minute read)
🟢 خلاصه مقاله:
در دنیای آزمایشهای مقایسهای، روشهای متعددی برای ارزیابی تفاوتهای احتمالی در دادهها وجود دارد، اما اسپاتیفای نشان میدهد که استفاده از رویکرد بیزی در آزمایشهای A/B چه تفاوتهایی با سایر روشها دارد. بیزین نمونهگیری، در واقع به مجموعهای از تصمیمات مرتبط با انتخاب فرضیه شروع، روشهای احتمال و قواعد توقف بستگی دارد. این شرکت ثابت کرده است که استفاده از آستانههای احتمالاتی مبتنی بر فرضیههای پایه ثابت و بدون تغییر میتواند همان عملکرد آزمایشهای متداول فرکانسگرایانه در فهم پنهانسازیها یا "peek" کردنهای پایانناپذیر را داشته باشد. اما تفاوت مهم این است که فاکتورهای بیزی میتوانند کنترل خوبی بر روی نتایج نادرست و مثبت کاذب زمانی که آزمایشها به صورت اختیاری متوقف میشوند، ارائه دهند.
برای اجرای موفقیتآمیز آزمایشهای بیزی، باید از ابتدا تصمیم بگیرید که چه تضمینهایی برای صحت و اعتبار برنامه آزمایش در نظر گرفتهاید، و سپس تنظیمات استنباط یا تفسیر دادهها را بر اساس این اولویتها انجام دهید. انتخابهای اولیه در طراحی آزمایش، تاثیر مستقیم بر روی نتایج نهایی و درستی نتیجهگیری دارند؛ بنابراین، تعیین استراتژی و رعایت قواعد آن اهمیت حیاتی دارد.
در نهایت، اسپاتیفای ثابت کرده است که با انتخاب سیاستهای مناسب و تمرکز بر تضمینهای پایه در طراحی آزمایش، میتوان بهرهوری و دقت تجزیه و تحلیل دادهها را در مسیر توسعه و بهبود خدمات تضمین کرد. این رویکرد میتواند راهی موثر برای کنترل خطاهای احتمالی و بهبود تصمیمگیریهای مبتنی بر داده باشد، بدون اینکه نیاز باشد به روشهای سنتی و مرسوم که ممکن است ناپایدار یا نادرست باشند، تکیه کنیم.
#آزمایش_آیبی #تجربه_کاربری #تحلیل_داده #تصمیم_گیری
🟣لینک مقاله:
https://engineering.atspotify.com/2026/9/why-spotify-is-not-using-bayesian-a-b-testing?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Why Spotify is not using Bayesian A/B testing (12 minute read)
🟢 خلاصه مقاله:
در دنیای آزمایشهای مقایسهای، روشهای متعددی برای ارزیابی تفاوتهای احتمالی در دادهها وجود دارد، اما اسپاتیفای نشان میدهد که استفاده از رویکرد بیزی در آزمایشهای A/B چه تفاوتهایی با سایر روشها دارد. بیزین نمونهگیری، در واقع به مجموعهای از تصمیمات مرتبط با انتخاب فرضیه شروع، روشهای احتمال و قواعد توقف بستگی دارد. این شرکت ثابت کرده است که استفاده از آستانههای احتمالاتی مبتنی بر فرضیههای پایه ثابت و بدون تغییر میتواند همان عملکرد آزمایشهای متداول فرکانسگرایانه در فهم پنهانسازیها یا "peek" کردنهای پایانناپذیر را داشته باشد. اما تفاوت مهم این است که فاکتورهای بیزی میتوانند کنترل خوبی بر روی نتایج نادرست و مثبت کاذب زمانی که آزمایشها به صورت اختیاری متوقف میشوند، ارائه دهند.
برای اجرای موفقیتآمیز آزمایشهای بیزی، باید از ابتدا تصمیم بگیرید که چه تضمینهایی برای صحت و اعتبار برنامه آزمایش در نظر گرفتهاید، و سپس تنظیمات استنباط یا تفسیر دادهها را بر اساس این اولویتها انجام دهید. انتخابهای اولیه در طراحی آزمایش، تاثیر مستقیم بر روی نتایج نهایی و درستی نتیجهگیری دارند؛ بنابراین، تعیین استراتژی و رعایت قواعد آن اهمیت حیاتی دارد.
در نهایت، اسپاتیفای ثابت کرده است که با انتخاب سیاستهای مناسب و تمرکز بر تضمینهای پایه در طراحی آزمایش، میتوان بهرهوری و دقت تجزیه و تحلیل دادهها را در مسیر توسعه و بهبود خدمات تضمین کرد. این رویکرد میتواند راهی موثر برای کنترل خطاهای احتمالی و بهبود تصمیمگیریهای مبتنی بر داده باشد، بدون اینکه نیاز باشد به روشهای سنتی و مرسوم که ممکن است ناپایدار یا نادرست باشند، تکیه کنیم.
#آزمایش_آیبی #تجربه_کاربری #تحلیل_داده #تصمیم_گیری
🟣لینک مقاله:
https://engineering.atspotify.com/2026/9/why-spotify-is-not-using-bayesian-a-b-testing?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Spotify Engineering
Why Spotify Is Not Using Bayesian A/B Testing | Spotify Engineering
Forwarded from VIP
💼 به دنبال استخدام برنامهنویس هستید؟ یا به دنبال فرصت شغلی مناسب میگردید؟
🟢 کارفرمایان:
اگر به دنبال جذب برنامهنویس هستید، آگهی استخدام خود را برای ما ارسال کنید تا منتشر شود.
🟢 کارجویان:
اگر به دنبال فرصت شغلی هستید، رزومه خود را برای ما ارسال کنید تا در صورت وجود موقعیت مناسب، به شرکتها و کارفرمایان معرفی شوید. 🚀
👤 ادمین:
@mrbardia72
📄 لطفاً موارد زیر را به همراه فایل PDF رزومه ارسال کنید:
✅ نام و نام خانوادگی (اجباری)
✅ سابقه کار (اجباری)
✅ محل سکونت (اجباری)
✅ امکان نقل مکان برای کار (اجباری)
🔹 لینک LinkedIn (اختیاری)
🔹 لینک GitHub (اختیاری)
👇توی چنل زیر قرار میگیره 👇
https://t.me/job_labdon
🟢 کارفرمایان:
اگر به دنبال جذب برنامهنویس هستید، آگهی استخدام خود را برای ما ارسال کنید تا منتشر شود.
🟢 کارجویان:
اگر به دنبال فرصت شغلی هستید، رزومه خود را برای ما ارسال کنید تا در صورت وجود موقعیت مناسب، به شرکتها و کارفرمایان معرفی شوید. 🚀
👤 ادمین:
@mrbardia72
📄 لطفاً موارد زیر را به همراه فایل PDF رزومه ارسال کنید:
✅ نام و نام خانوادگی (اجباری)
✅ سابقه کار (اجباری)
✅ محل سکونت (اجباری)
✅ امکان نقل مکان برای کار (اجباری)
🔹 لینک LinkedIn (اختیاری)
🔹 لینک GitHub (اختیاری)
👇توی چنل زیر قرار میگیره 👇
https://t.me/job_labdon
🔵 عنوان مقاله
Cloudfloe's query engine in a celld cell (9 minute read)
🟢 خلاصه مقاله:
در این مقاله، به بررسی عملکرد موتور جستوجوی Cloudfloe در یک سلول واحد (Cell) پرداخته شده است. Cloudfloe یک رابط کاربری وب است که امکان استعلام دادههای Iceberg را روی سرویس S3 با بهرهگیری از DuckDB فراهم میکند. آزمایشهایی که انجام شده نشان میدهد که این سیستم چگونه میتواند جایگزین کانتینرهای مجزا برای هر درخواست شود که این موضوع اهمیت زیادی دارد، زیرا کاهش نیاز به ایجاد کانتینرهای جدید میتواند سرعت و کارایی سیستم را بهبود بخشد.
در این آزمایش، با استفاده از نسخه وباسمبلی DuckDB، یک جدول Iceberg شامل ۳۷،۵۳۷ رکورد در عرض ۱۴۸ میلیثانیه خوانده شد. اما زمانی که سلولهای سرورلس حالت سرد داشتند یا تازه بیدار شده بودند، زمان پاسخ به بازهای بین ۲۵۰ تا ۳۲۰ میلیثانیه میرسید و اکثر حافظه خود را حفظ کرده بودند. این نشان میدهد که راهاندازی و بیدار کردن مجدد سلولها هزینهبر است و بنابراین، حفظ نگهداری سلولهای فعال، راهکار موثرتری است.
در ادامه، متوجه میشویم که نگهداشتن اتصال دائمی و گرم نگه داشتن سلولها، تکرار درخواستها را به طور قابل توجهی کاهش میدهد؛ در واقع، پاسخها در این حالت تنها حدود ۳ میلیثانیه طول میکشید. این موضوع نشان میدهد که سیاستهای مدیریت چرخه عمر سلولها، کلید اصلی در طراحی سیستم است و نه تنها خاموش یا روشن کردن سریع سلولها؛ بلکه ماندگاری آنها و نگهداری فعال بودنشان، نقش بسیار مهمی در کارایی سامانه دارد.
در جمعبندی، این آزمایش نشان میدهد که ارتقاء و توسعه سیستمهای سرورلس باید تمرکز بر مدیریت وضعیت و ماندگاری سلولها داشته باشد تا پاسخ سریعتر و بهینهتری به کاربران ارائه دهند و هزینههای مربوط به راهاندازی مجدد و خاموش کردن سلولها را کاهش دهند.
#هوش_مرزی #سرورلس #پایگاههای_داده #کلودفلو
🟣لینک مقاله:
https://gordonmurray.ie/data/2026/09/05/cloudfloes-query-engine-in-a-celld-cell.html?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Cloudfloe's query engine in a celld cell (9 minute read)
🟢 خلاصه مقاله:
در این مقاله، به بررسی عملکرد موتور جستوجوی Cloudfloe در یک سلول واحد (Cell) پرداخته شده است. Cloudfloe یک رابط کاربری وب است که امکان استعلام دادههای Iceberg را روی سرویس S3 با بهرهگیری از DuckDB فراهم میکند. آزمایشهایی که انجام شده نشان میدهد که این سیستم چگونه میتواند جایگزین کانتینرهای مجزا برای هر درخواست شود که این موضوع اهمیت زیادی دارد، زیرا کاهش نیاز به ایجاد کانتینرهای جدید میتواند سرعت و کارایی سیستم را بهبود بخشد.
در این آزمایش، با استفاده از نسخه وباسمبلی DuckDB، یک جدول Iceberg شامل ۳۷،۵۳۷ رکورد در عرض ۱۴۸ میلیثانیه خوانده شد. اما زمانی که سلولهای سرورلس حالت سرد داشتند یا تازه بیدار شده بودند، زمان پاسخ به بازهای بین ۲۵۰ تا ۳۲۰ میلیثانیه میرسید و اکثر حافظه خود را حفظ کرده بودند. این نشان میدهد که راهاندازی و بیدار کردن مجدد سلولها هزینهبر است و بنابراین، حفظ نگهداری سلولهای فعال، راهکار موثرتری است.
در ادامه، متوجه میشویم که نگهداشتن اتصال دائمی و گرم نگه داشتن سلولها، تکرار درخواستها را به طور قابل توجهی کاهش میدهد؛ در واقع، پاسخها در این حالت تنها حدود ۳ میلیثانیه طول میکشید. این موضوع نشان میدهد که سیاستهای مدیریت چرخه عمر سلولها، کلید اصلی در طراحی سیستم است و نه تنها خاموش یا روشن کردن سریع سلولها؛ بلکه ماندگاری آنها و نگهداری فعال بودنشان، نقش بسیار مهمی در کارایی سامانه دارد.
در جمعبندی، این آزمایش نشان میدهد که ارتقاء و توسعه سیستمهای سرورلس باید تمرکز بر مدیریت وضعیت و ماندگاری سلولها داشته باشد تا پاسخ سریعتر و بهینهتری به کاربران ارائه دهند و هزینههای مربوط به راهاندازی مجدد و خاموش کردن سلولها را کاهش دهند.
#هوش_مرزی #سرورلس #پایگاههای_داده #کلودفلو
🟣لینک مقاله:
https://gordonmurray.ie/data/2026/09/05/cloudfloes-query-engine-in-a-celld-cell.html?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
gordonmurray.ie
Cloudfloe's query engine in a celld cell | Gordon Murray
Cloudfloe is a web interface I made a while back for querying Apache Iceberg data on S3 with DuckDB. A user saves a connection, writes SQL, runs it, and can ...
🔵 عنوان مقاله
The Scary Postgres 19 Patch Contest
🟢 خلاصه مقاله:
در حالی که هنوز هالووین فرا نرسیده است، اما در یک گفتوگو جذاب در لیست پستی pgsql-hackers، رابرت هاس و کلود به بررسی و ارزیابی مخزنهای نسخه ۱۹ پستگرس پرداختند و تصمیم گرفتند مشخص کنند کدام یک از این آپدیتها ترسناکترین هستند. یکی از این اصلاحات، مربوط به ویژگی گرافهای اموال SQL/PGQ بود که پس از مدتی از نسخه ۱۹ حذف شد؛ اما هنوز پنج مورد دیگر باقی ماندهاند و همچنان موضوع بحث و بررسی هستند. این مسابقه جذاب نشان میدهد که توسعه دهندگان پستگرس چگونه با چالشهای فنی و تصمیمات دشوار روبرو میشوند، هرکدام با ویژگیها و تغییراتی که ممکن است در نگاه اول معمولی به نظر برسند، اما در واقع تأثیرات قابلتوجهی روی کارایی، امنيت و قابلیتهای این سیستم قدرتمند دارند. رقابت بر سر این که کدام تغییرات بیشترین ترس و دغدغه را در دل جامعه توسعه دهندگان ایجاد میکنند، نشاندهنده دغدغههای فنی و نیازهای رو به رشد این پایگاه داده محبوب است.
#پستگرس #نسخه۱۹ #توسعه_پایگاه_داده #گرافهای_SQL
🟣لینک مقاله:
https://www.postgresql.org/message-id/CA%2BTgmob9NY6m0YNFTQ4nFH2d0iC9SQRruDYxfndGKKzh8OC80w%40mail.gmail.com
➖➖➖➖➖➖➖➖
👑 @Database_Academy
The Scary Postgres 19 Patch Contest
🟢 خلاصه مقاله:
در حالی که هنوز هالووین فرا نرسیده است، اما در یک گفتوگو جذاب در لیست پستی pgsql-hackers، رابرت هاس و کلود به بررسی و ارزیابی مخزنهای نسخه ۱۹ پستگرس پرداختند و تصمیم گرفتند مشخص کنند کدام یک از این آپدیتها ترسناکترین هستند. یکی از این اصلاحات، مربوط به ویژگی گرافهای اموال SQL/PGQ بود که پس از مدتی از نسخه ۱۹ حذف شد؛ اما هنوز پنج مورد دیگر باقی ماندهاند و همچنان موضوع بحث و بررسی هستند. این مسابقه جذاب نشان میدهد که توسعه دهندگان پستگرس چگونه با چالشهای فنی و تصمیمات دشوار روبرو میشوند، هرکدام با ویژگیها و تغییراتی که ممکن است در نگاه اول معمولی به نظر برسند، اما در واقع تأثیرات قابلتوجهی روی کارایی، امنيت و قابلیتهای این سیستم قدرتمند دارند. رقابت بر سر این که کدام تغییرات بیشترین ترس و دغدغه را در دل جامعه توسعه دهندگان ایجاد میکنند، نشاندهنده دغدغههای فنی و نیازهای رو به رشد این پایگاه داده محبوب است.
#پستگرس #نسخه۱۹ #توسعه_پایگاه_داده #گرافهای_SQL
🟣لینک مقاله:
https://www.postgresql.org/message-id/CA%2BTgmob9NY6m0YNFTQ4nFH2d0iC9SQRruDYxfndGKKzh8OC80w%40mail.gmail.com
➖➖➖➖➖➖➖➖
👑 @Database_Academy
PostgreSQL Mailing List Archives
scary patch contest
I asked Claude to evaluate which v19 patches were the scariest based on the number and type of bugs fixed …
🔵 عنوان مقاله
Refreshing the Travel-Time Map Behind Lyft's Marketplace: Rebuilding Neighborhood Reachability Signals (12 minute read)
🟢 خلاصه مقاله:
در دنیای حملونقل مدرن، داشتن دادههای دقیق و بهروز درباره زمان سفر در محلهها اهمیت بسیاری دارد. شرکت Lyft با بازآفرینی و بروزرسانی مجموعه دادههای قدیمی خود درمورد زمان سفرهای محلی، تلاش کرده است تا اطلاعات بهتر و معتبرتری ارائه دهد. این بهروزرسانی شامل تخمینهای زمان سفر با دقت بیشتری است، حوزههای پشتیبانی گستردهتری دارد و فیلترهای مربوط به مکانهای قابل حرکت و مسیرهای قابل رانندگی به آن افزوده شده است. بهعلاوه، بخشهای مربوط به سرویسهای خودکار و مدیریت میدان دید در سامانهاش بهبود یافته است، که نتیجه آن بهبود در فرایند قیمتگذاری و تهیه نقشههای حرارتی رانندگان است، چراکه این دادهها به آنها کمک میکند تا بهطور دقیقتری تقاضا و عرضه را در نزدیکی محل کار و زندگی خود ارزیابی کنند.
این بهروزرسانیها قرار است هر شش ماه یکبار انجام شوند تا اطلاعات همواره بهروز باقی بمانند. همچنین، بر اساس برنامهریزیهای جدید، زمانهای سفر تخمینی به نحوی تنظیم خواهند شد که تغییرات ترافیکی در طول هفته را بهتر منعکس کنند، از اینرو رانندگان و کاربران تنها بر اساس نتایج واقعی و قابل اعتماد برنامهریزی خواهند کرد. این استراتژی به Lyft امکان میدهد تا تجربه مشترک و کارآمدتری در سفرهای روزمره ارائه دهد و رضایت کاربران و رانندگان خود را افزایش دهد.
در نتیجه، با این بهروزرسانیها، سیستمهای مسیریابی و قیمتگذاری Lyft بسیار هوشمندتر و انعطافپذیرتر میشوند، و این امر به نفع تمام افرادی است که در شبکه آن فعالیت میکنند، یا در جستوجوی سفرهای مطمئن و سریع هستند.
#هوشمندسازی_سفر #ترافیک_لحظه_ای #تکنولوژی_موبایل #نقشههای_حرارتی
🟣لینک مقاله:
https://eng.lyft.com/refreshing-the-travel-time-map-behind-lyfts-marketplace-rebuilding-neighborhood-reachability-5be3efbc82ea?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Refreshing the Travel-Time Map Behind Lyft's Marketplace: Rebuilding Neighborhood Reachability Signals (12 minute read)
🟢 خلاصه مقاله:
در دنیای حملونقل مدرن، داشتن دادههای دقیق و بهروز درباره زمان سفر در محلهها اهمیت بسیاری دارد. شرکت Lyft با بازآفرینی و بروزرسانی مجموعه دادههای قدیمی خود درمورد زمان سفرهای محلی، تلاش کرده است تا اطلاعات بهتر و معتبرتری ارائه دهد. این بهروزرسانی شامل تخمینهای زمان سفر با دقت بیشتری است، حوزههای پشتیبانی گستردهتری دارد و فیلترهای مربوط به مکانهای قابل حرکت و مسیرهای قابل رانندگی به آن افزوده شده است. بهعلاوه، بخشهای مربوط به سرویسهای خودکار و مدیریت میدان دید در سامانهاش بهبود یافته است، که نتیجه آن بهبود در فرایند قیمتگذاری و تهیه نقشههای حرارتی رانندگان است، چراکه این دادهها به آنها کمک میکند تا بهطور دقیقتری تقاضا و عرضه را در نزدیکی محل کار و زندگی خود ارزیابی کنند.
این بهروزرسانیها قرار است هر شش ماه یکبار انجام شوند تا اطلاعات همواره بهروز باقی بمانند. همچنین، بر اساس برنامهریزیهای جدید، زمانهای سفر تخمینی به نحوی تنظیم خواهند شد که تغییرات ترافیکی در طول هفته را بهتر منعکس کنند، از اینرو رانندگان و کاربران تنها بر اساس نتایج واقعی و قابل اعتماد برنامهریزی خواهند کرد. این استراتژی به Lyft امکان میدهد تا تجربه مشترک و کارآمدتری در سفرهای روزمره ارائه دهد و رضایت کاربران و رانندگان خود را افزایش دهد.
در نتیجه، با این بهروزرسانیها، سیستمهای مسیریابی و قیمتگذاری Lyft بسیار هوشمندتر و انعطافپذیرتر میشوند، و این امر به نفع تمام افرادی است که در شبکه آن فعالیت میکنند، یا در جستوجوی سفرهای مطمئن و سریع هستند.
#هوشمندسازی_سفر #ترافیک_لحظه_ای #تکنولوژی_موبایل #نقشههای_حرارتی
🟣لینک مقاله:
https://eng.lyft.com/refreshing-the-travel-time-map-behind-lyfts-marketplace-rebuilding-neighborhood-reachability-5be3efbc82ea?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Medium
Refreshing the Travel-Time Map Behind Lyft’s Marketplace: Rebuilding Neighborhood Reachability Signals
Every time Lyft calculates pricing to balance a market, nudges a driver toward an under-served pocket of a city, or paints a heatmap of…
🔵 عنوان مقاله
118 million queries per second on Neki (9 minute read)
🟢 خلاصه مقاله:
پلانیتاسکیل تصمیم گرفت در آزمایشی بینظیر، یک میلیون درخواست در ثانیه بر روی سیستم جدید و شارد شدهی خودش به نام نکی، اجرا کند. این آزمایش در همان ابتدا، به سرعت و تقریباً بلافاصله با استفاده از ۵ شارد، به این هدف رسید. سپس با ادامه آزمایش و افزودن شاردهای بیشتر، تعداد شاردها تا ۵۱۲ افزایش پیدا کرد و در نتیجه، توانست در مجموع به ۱۱۸ میلیون درخواست در ثانیه دست یابد. این حجم از درخواستها، بر روی دادههایی به حجم ۱.۲۲ پتابایبای قرار داشتند.
در حقیقت، نوع بار کاری مورد آزمایش بسیار خاص و محدود است: انجام یک درخواست نقطهای در یک شارد، که تنها یک ردیف مشخص را بر اساس کلید اصلی بازیابی میکند؛ بدون نوشتن، عملیاتهای اتصال (join) یا درخواستهای میان شاردی. این محدودیتها و سادگی، سبب میشود نتایج و منحنی مقیاسپذیری بسیار واضح و منظم باشد، چون تقاضای سیستم در این حالت کمتر پیچیده است و منابع به شکل بهینه و مستقیم استفاده میشوند.
در این نمونه، توانایی سیستم در مدیریت حجم بینظیر درخواستها، نشان میدهد که چگونه یک معماری شاردینگ هوشمند و طراحی مناسب، میتواند عملیات عظیم و بوتسلم درخواستها را به راحتی تحمل کند. این آزمایش، نمونهای است برای نشان دادن پتانسیل مقیاسپذیری سیستمهای پایگاه داده در آینده، جایی که نیازمند پاسخگویی سریع و حجم بالای درخواستها هستیم.
#پایگاه_داده #مقیاسپذیری #سیستمهای_پایگاه #کلود
🟣لینک مقاله:
https://planetscale.com/blog/118-million-queries-per-second-on-neki?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
118 million queries per second on Neki (9 minute read)
🟢 خلاصه مقاله:
پلانیتاسکیل تصمیم گرفت در آزمایشی بینظیر، یک میلیون درخواست در ثانیه بر روی سیستم جدید و شارد شدهی خودش به نام نکی، اجرا کند. این آزمایش در همان ابتدا، به سرعت و تقریباً بلافاصله با استفاده از ۵ شارد، به این هدف رسید. سپس با ادامه آزمایش و افزودن شاردهای بیشتر، تعداد شاردها تا ۵۱۲ افزایش پیدا کرد و در نتیجه، توانست در مجموع به ۱۱۸ میلیون درخواست در ثانیه دست یابد. این حجم از درخواستها، بر روی دادههایی به حجم ۱.۲۲ پتابایبای قرار داشتند.
در حقیقت، نوع بار کاری مورد آزمایش بسیار خاص و محدود است: انجام یک درخواست نقطهای در یک شارد، که تنها یک ردیف مشخص را بر اساس کلید اصلی بازیابی میکند؛ بدون نوشتن، عملیاتهای اتصال (join) یا درخواستهای میان شاردی. این محدودیتها و سادگی، سبب میشود نتایج و منحنی مقیاسپذیری بسیار واضح و منظم باشد، چون تقاضای سیستم در این حالت کمتر پیچیده است و منابع به شکل بهینه و مستقیم استفاده میشوند.
در این نمونه، توانایی سیستم در مدیریت حجم بینظیر درخواستها، نشان میدهد که چگونه یک معماری شاردینگ هوشمند و طراحی مناسب، میتواند عملیات عظیم و بوتسلم درخواستها را به راحتی تحمل کند. این آزمایش، نمونهای است برای نشان دادن پتانسیل مقیاسپذیری سیستمهای پایگاه داده در آینده، جایی که نیازمند پاسخگویی سریع و حجم بالای درخواستها هستیم.
#پایگاه_داده #مقیاسپذیری #سیستمهای_پایگاه #کلود
🟣لینک مقاله:
https://planetscale.com/blog/118-million-queries-per-second-on-neki?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Planetscale
118 million queries per second on Neki — PlanetScale
We ran a massive, sharded Postgres database at 118.5 million queries per second, with 200k queries per second on each shard across 512 shards.
🔵 عنوان مقاله
Now everyone can put data to work (3 minute read)
🟢 خلاصه مقاله:
امروزه، تمامی افراد قادرند از دادهها برای کسب و کار خود بهرهبرداری کنند. با ورود ابزارهای نوینی مانند عامل داده در ChatGPT Work، فرآیند دسترسی و تحلیل دادهها بسیار سادهتر و کارآمدتر شده است. این ابزار به کارکنان امکان میدهد با استفاده از زبان طبیعی، سؤالات خود را درباره دادههای شرکت مطرح کرده و داشبوردهای قابل اشتراکگذاری ایجاد کنند، بدون نیاز به مهارتهای فنی پیچیده.
این سیستم به خوبی با ساختارهای مجوزهای موجود هماهنگ است و با عمده پلتفرمهای داده و ابزارهای تجزیهوتحلیل کسبوکار (BI) سازگار است. علاوه بر این، میتواند پیشنهاداتی برای اقدامات بعدی ارائه دهد یا حتی اقدامات تاییدشده را انجام دهد، که این امر، فرآیندهای تصمیمگیری را بسیار تسهیل میکند. به این ترتیب، هر فرد در سازمان، از مدیران گرفته تا کارکنان تیمهای عملیاتی، امکان بهرهبرداری سریع و هوشمندانه از دادهها را پیدا میکند و به ارتقای کارایی و تصمیمگیریهای دقیق کمک مینماید.
#داده_پایه_سازی #تحلیل_هوشمند #راحتی_در_کار #هوش_مصنوعی
🟣لینک مقاله:
https://openai.com/index/put-data-to-work/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Now everyone can put data to work (3 minute read)
🟢 خلاصه مقاله:
امروزه، تمامی افراد قادرند از دادهها برای کسب و کار خود بهرهبرداری کنند. با ورود ابزارهای نوینی مانند عامل داده در ChatGPT Work، فرآیند دسترسی و تحلیل دادهها بسیار سادهتر و کارآمدتر شده است. این ابزار به کارکنان امکان میدهد با استفاده از زبان طبیعی، سؤالات خود را درباره دادههای شرکت مطرح کرده و داشبوردهای قابل اشتراکگذاری ایجاد کنند، بدون نیاز به مهارتهای فنی پیچیده.
این سیستم به خوبی با ساختارهای مجوزهای موجود هماهنگ است و با عمده پلتفرمهای داده و ابزارهای تجزیهوتحلیل کسبوکار (BI) سازگار است. علاوه بر این، میتواند پیشنهاداتی برای اقدامات بعدی ارائه دهد یا حتی اقدامات تاییدشده را انجام دهد، که این امر، فرآیندهای تصمیمگیری را بسیار تسهیل میکند. به این ترتیب، هر فرد در سازمان، از مدیران گرفته تا کارکنان تیمهای عملیاتی، امکان بهرهبرداری سریع و هوشمندانه از دادهها را پیدا میکند و به ارتقای کارایی و تصمیمگیریهای دقیق کمک مینماید.
#داده_پایه_سازی #تحلیل_هوشمند #راحتی_در_کار #هوش_مصنوعی
🟣لینک مقاله:
https://openai.com/index/put-data-to-work/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
OpenAI
Now everyone can put data to work
Meet the Data agent in ChatGPT Work. Connect company data, uncover insights, and build interactive dashboards with AI using natural language.
🔵 عنوان مقاله
Tom Lane on the Architectural Decisions That Shaped 30 Years of Postgres (41 minute read)
🟢 خلاصه مقاله:
در طول سی سال فعالیت، تام لِین نقش مهمی در توسعه و شکلگیری پایگاه داده پراجکت بازی کرده است. او در این مقاله بر تصمیمات معماریای تمرکز میکند که به موفقیتهای این پروژه کمک کردهاند و برخی از چالشها و انتخابهای کلیدی را توضیح میدهد. اولین این تصمیمات، استفاده از الگوی ارتباط هر پردازش با یک اتصال مجزا است که باعث سهولت در نوشتن و توسعه کد شد. همچنین، لِین به معرفی سیستم ثبت شرکت در نگارش ۸.۰ اشاره میکند که تحولی بزرگ در پایداری و مقیاسپذیری پراجکت ایجاد کرد و آن را از یک پروژه ساده به یک پایگاه داده حرفهای تبدیل نمود.
در ادامه، او به مکانیزم MVCC اشاره میکند، روشی که عملیات نگهداری و تعمیرات پایگاه را به قسمتهای پسزمینه و عملیات وکیوم انتقال داد. این تصمیم باعث شد تا فرآیند نگهداری دادهها در حین فعالیت سیستم بدون کاهش کارایی انجام شود. لِین همچنین از تاثیرات مجوز آزاد دانشگاه برکی، که باعث ادامه حیات پروژه حتی در شرایط سخت شد، تمجید میکند.
او در عین حال، ظاهر انتقادی دارد و نسخه ۱۳ را یکباره پر از خطا و نقص میداند و در پایان، اگر اختیار داشت، علاقهمند بود تا سیستم تقسیمبندی جداول را حذف کند، زیرا معتقد است این ویژگی در حال حاضر محدودیتهایی دارد که نیازمند بازنگری است.
این مقاله نگاهی عمیق به تصمیمات، چالشها و آینده پراجکت پراجکت پراجکت دارد و نشان میدهد چگونه انتخابهای معماری میتواند بر مسیر توسعه و موفقیت یک پایگاه داده تاثیرگذار باشد.
#پروجکت #پایگاهداده #معماری_سیستم #نوآوری
🟣لینک مقاله:
https://www.snowflake.com/en/blog/engineering/30-years-of-postgres-architecture-tom-lane/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Tom Lane on the Architectural Decisions That Shaped 30 Years of Postgres (41 minute read)
🟢 خلاصه مقاله:
در طول سی سال فعالیت، تام لِین نقش مهمی در توسعه و شکلگیری پایگاه داده پراجکت بازی کرده است. او در این مقاله بر تصمیمات معماریای تمرکز میکند که به موفقیتهای این پروژه کمک کردهاند و برخی از چالشها و انتخابهای کلیدی را توضیح میدهد. اولین این تصمیمات، استفاده از الگوی ارتباط هر پردازش با یک اتصال مجزا است که باعث سهولت در نوشتن و توسعه کد شد. همچنین، لِین به معرفی سیستم ثبت شرکت در نگارش ۸.۰ اشاره میکند که تحولی بزرگ در پایداری و مقیاسپذیری پراجکت ایجاد کرد و آن را از یک پروژه ساده به یک پایگاه داده حرفهای تبدیل نمود.
در ادامه، او به مکانیزم MVCC اشاره میکند، روشی که عملیات نگهداری و تعمیرات پایگاه را به قسمتهای پسزمینه و عملیات وکیوم انتقال داد. این تصمیم باعث شد تا فرآیند نگهداری دادهها در حین فعالیت سیستم بدون کاهش کارایی انجام شود. لِین همچنین از تاثیرات مجوز آزاد دانشگاه برکی، که باعث ادامه حیات پروژه حتی در شرایط سخت شد، تمجید میکند.
او در عین حال، ظاهر انتقادی دارد و نسخه ۱۳ را یکباره پر از خطا و نقص میداند و در پایان، اگر اختیار داشت، علاقهمند بود تا سیستم تقسیمبندی جداول را حذف کند، زیرا معتقد است این ویژگی در حال حاضر محدودیتهایی دارد که نیازمند بازنگری است.
این مقاله نگاهی عمیق به تصمیمات، چالشها و آینده پراجکت پراجکت پراجکت دارد و نشان میدهد چگونه انتخابهای معماری میتواند بر مسیر توسعه و موفقیت یک پایگاه داده تاثیرگذار باشد.
#پروجکت #پایگاهداده #معماری_سیستم #نوآوری
🟣لینک مقاله:
https://www.snowflake.com/en/blog/engineering/30-years-of-postgres-architecture-tom-lane/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Snowflake
30 Years of Postgres Architecture: Tom Lane Interview
Explore 30 years of Postgres architecture with core committer Tom Lane. Learn about process isolation, MVCC, write-ahead logging, and threads.
🔵 عنوان مقاله
Investigating Spark Waste Across the Stack (10 minute read)
🟢 خلاصه مقاله:
در مطالعهای جامع درباره بهرهوری فرآیندهای اسپارک، محققان موفق شدند با تحلیل دقیق زبالههای پنهان در سیستم، راههایی برای بهبود کارایی ارائه دهند. این پژوهش چهار مورد کاربردی در تولید اسپارک را مورد بررسی قرار داده است که با شناسایی و رفع زبالههای مخفی، مدت زمان اجرا، نیازهای محاسباتی، عملیات در سرویس S3، و در نتیجه هزینهها به شدت کاهش یافته است. این روش تحلیل عمیق، فراتر از نگرانیهای مرسوم درباره مصرف CPU و حافظه، به مدیران سیستم امکان میدهد مشکلات زیرین را شناسایی و برطرف کنند، و اثربخشی فرآیندهای دادهمحور را به طور چشمگیری ارتقاء دهند.
در این مطالعه، با رصد دقیق و استانداردسازی مراحل مختلف، مشکلات پنهانی که منجر به هدررفت منابع میشدند، آشکار شدند. تیم تحقیق آنالیز دقیقی انجام داد تا نشان دهد که چه تعداد عملیات غیرضروری و ضایعات نرمافزاری یا سختافزاری در جریان اجرای اسپارک وجود دارد و چگونه این موارد میتوانند بر هزینهها و زمانبندی نهایی اثرگذار باشند. این یافتهها به توسعه دهندگان و مدیران داده امکان میدهد استراتژیهای موثری برای کاهش سربارهای بیفایده و پاکسازی منابع اتخاذ کنند، و در نتیجه بهرهوری سیستمهای پردازش داده را بهینهتر سازند.
در نتیجه، استفاده از این رویکردهای تحلیلی پیشرفته، نه تنها عملیات کارآمدتری را رقم میزند، بلکه هزینههای مربوط به زیرساختهای ابری و محاسباتی را نیز تا حد چشمگیری کاهش میدهد. این مطالعه نشان میدهد که با نظارت دقیق بر زبالههای سیستم و اصلاح آنها، میتوان زمان اجرا، عملیات در سرویس S3 و هزینههای کلی سیستمهای اسپارک را به بهترین شکل بهبود بخشید. این رویکرد، آینده توسعه دادههای بزرگ و سیستمهای توزیع شده را نوید میدهد و به تیمهای فناوری اطلاعات ابزار قدرتمندی برای مدیریت منابع میدهد.
#بهینهسازی_اسپارک #مدیریت_منابع #کاهش_هزینه #تحلیل_پنهان
🟣لینک مقاله:
https://blog.dataengineerthings.org/investigating-spark-waste-across-the-stack-188aa622e12a?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Investigating Spark Waste Across the Stack (10 minute read)
🟢 خلاصه مقاله:
در مطالعهای جامع درباره بهرهوری فرآیندهای اسپارک، محققان موفق شدند با تحلیل دقیق زبالههای پنهان در سیستم، راههایی برای بهبود کارایی ارائه دهند. این پژوهش چهار مورد کاربردی در تولید اسپارک را مورد بررسی قرار داده است که با شناسایی و رفع زبالههای مخفی، مدت زمان اجرا، نیازهای محاسباتی، عملیات در سرویس S3، و در نتیجه هزینهها به شدت کاهش یافته است. این روش تحلیل عمیق، فراتر از نگرانیهای مرسوم درباره مصرف CPU و حافظه، به مدیران سیستم امکان میدهد مشکلات زیرین را شناسایی و برطرف کنند، و اثربخشی فرآیندهای دادهمحور را به طور چشمگیری ارتقاء دهند.
در این مطالعه، با رصد دقیق و استانداردسازی مراحل مختلف، مشکلات پنهانی که منجر به هدررفت منابع میشدند، آشکار شدند. تیم تحقیق آنالیز دقیقی انجام داد تا نشان دهد که چه تعداد عملیات غیرضروری و ضایعات نرمافزاری یا سختافزاری در جریان اجرای اسپارک وجود دارد و چگونه این موارد میتوانند بر هزینهها و زمانبندی نهایی اثرگذار باشند. این یافتهها به توسعه دهندگان و مدیران داده امکان میدهد استراتژیهای موثری برای کاهش سربارهای بیفایده و پاکسازی منابع اتخاذ کنند، و در نتیجه بهرهوری سیستمهای پردازش داده را بهینهتر سازند.
در نتیجه، استفاده از این رویکردهای تحلیلی پیشرفته، نه تنها عملیات کارآمدتری را رقم میزند، بلکه هزینههای مربوط به زیرساختهای ابری و محاسباتی را نیز تا حد چشمگیری کاهش میدهد. این مطالعه نشان میدهد که با نظارت دقیق بر زبالههای سیستم و اصلاح آنها، میتوان زمان اجرا، عملیات در سرویس S3 و هزینههای کلی سیستمهای اسپارک را به بهترین شکل بهبود بخشید. این رویکرد، آینده توسعه دادههای بزرگ و سیستمهای توزیع شده را نوید میدهد و به تیمهای فناوری اطلاعات ابزار قدرتمندی برای مدیریت منابع میدهد.
#بهینهسازی_اسپارک #مدیریت_منابع #کاهش_هزینه #تحلیل_پنهان
🟣لینک مقاله:
https://blog.dataengineerthings.org/investigating-spark-waste-across-the-stack-188aa622e12a?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Medium
Investigating Spark Waste Across the Stack
Why you can’t rely only on utilization
🔵 عنوان مقاله
PostgreSQL CDC Backfills at Scale: Running a Multi-Day Backfill While Production Keeps Writing (15 minute read)
🟢 خلاصه مقاله:
در پروژههای پایش تغییرات دیتابیس با استفاده از PostgreSQL، اجرای عملیات بازپختهسازی تاریخچه دادهها (Backfill) در مقیاس بزرگ چالشهای زیادی دارد. یکی از مهمترین نکات، این است که چگونه میتوان فرآیند بازپختهسازی چندروزه را به گونهای انجام داد که در حالی که عملیات تولید دادههای زنده ادامه دارد، سیستم همچنان به ثبت و بازیابی دادههای قدیمی بپردازد. این فرآیند نیازمند برنامهریزی دقیق و استفاده از روشهای نوین است تا کارایی و پایداری سیستم حفظ شود.
در بسیاری از موارد، شکست در عملیاتهای بزرگ بازپختهسازی PostgreSQL بیشتر به دلیل مشکلات مربوط به خواندنهای تاریخی (Historical Reads) نیست، بلکه ناشی از مسائل مرتبط با نگهداری لاگ تغییرات (WAL)، تأخیر در تأیید مواضع (Slot Acknowledgments)، تراکنشهای طولانی یا شکستن حالتهای قدیمی در سیستم است. این عوامل میتوانند منجر به مصرف بیرویه فضای WAL، تأخیر در عملیاتهای تکراری و اصطکاک در روند بازیابی دادهها شوند. بنابراین، طراحیهای ایمن باید به گونهای باشند که فرآیندهای خواندن در حین عملیات ادامهدار، مانند خواندنهای بخشبندیشده، حفظ پیشرفتها با checkpoints، و مدیریت تداخلها با استفاده از مرزهای زمانی و ماسکها، انجام شوند.
یکی از استراتژیهای مؤثر، حفظ جریان مداوم مصرف WAL هنگام خواندنهای بخشبندیشده است. این کار تضمین میکند که فرآیند بازپختهسازی، نسبت به تغییرات زنده بیوقفه و بدون اختلال ادامه پیدا کند. علاوه بر این، اعمال پیشرفت checkpoints در طول عملیات، کمک میکند تا در صورت بروز خطا یا توقف ناگهانی، بتوان عملیات را به سرعت از سرگیری کرد و از ازدسترفتن دادهها جلوگیری نمود. همچنین، تنظیم تداخلها با استفاده از آبمُرکها (Watermarks) و «حلقههای حفاظتی» (Fences) اجازه میدهد تا بین دادههای تاریخی و دادههای جاری تداخل کمتری صورت گیرد و همزمانی بهتری برقرار شود.
در نهایت، اندازهگیری مناسب بر اساس نرخ نوشتن واقعی در دیتابیس، نقش کلیدی در بهینهسازی فرآیندهای بازپختهسازی دارد. با تقسیم عملیات به بخشهای کوچکتر و تطابق آنها با نرخهای نوشتاری، میتوان از فشار بیمورد بر سیستم جلوگیری کرده و کارایی عملیات را تضمین کرد. این رویکردها و فنون سبب میشوند که عملیات بازپختهسازی در مقیاس بزرگ، همزمان با ادامه فعالیتهای جاری، به شکل ایمن و مؤثر انجام شود و موجب پایداری و صحت سیستم گردد.
#PostgreSQL #بازپختهسازی #توسعه_پایدار #پایش_تغییرات
🟣لینک مقاله:
https://estuary.dev/blog/postgres-cdc-backfill?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
PostgreSQL CDC Backfills at Scale: Running a Multi-Day Backfill While Production Keeps Writing (15 minute read)
🟢 خلاصه مقاله:
در پروژههای پایش تغییرات دیتابیس با استفاده از PostgreSQL، اجرای عملیات بازپختهسازی تاریخچه دادهها (Backfill) در مقیاس بزرگ چالشهای زیادی دارد. یکی از مهمترین نکات، این است که چگونه میتوان فرآیند بازپختهسازی چندروزه را به گونهای انجام داد که در حالی که عملیات تولید دادههای زنده ادامه دارد، سیستم همچنان به ثبت و بازیابی دادههای قدیمی بپردازد. این فرآیند نیازمند برنامهریزی دقیق و استفاده از روشهای نوین است تا کارایی و پایداری سیستم حفظ شود.
در بسیاری از موارد، شکست در عملیاتهای بزرگ بازپختهسازی PostgreSQL بیشتر به دلیل مشکلات مربوط به خواندنهای تاریخی (Historical Reads) نیست، بلکه ناشی از مسائل مرتبط با نگهداری لاگ تغییرات (WAL)، تأخیر در تأیید مواضع (Slot Acknowledgments)، تراکنشهای طولانی یا شکستن حالتهای قدیمی در سیستم است. این عوامل میتوانند منجر به مصرف بیرویه فضای WAL، تأخیر در عملیاتهای تکراری و اصطکاک در روند بازیابی دادهها شوند. بنابراین، طراحیهای ایمن باید به گونهای باشند که فرآیندهای خواندن در حین عملیات ادامهدار، مانند خواندنهای بخشبندیشده، حفظ پیشرفتها با checkpoints، و مدیریت تداخلها با استفاده از مرزهای زمانی و ماسکها، انجام شوند.
یکی از استراتژیهای مؤثر، حفظ جریان مداوم مصرف WAL هنگام خواندنهای بخشبندیشده است. این کار تضمین میکند که فرآیند بازپختهسازی، نسبت به تغییرات زنده بیوقفه و بدون اختلال ادامه پیدا کند. علاوه بر این، اعمال پیشرفت checkpoints در طول عملیات، کمک میکند تا در صورت بروز خطا یا توقف ناگهانی، بتوان عملیات را به سرعت از سرگیری کرد و از ازدسترفتن دادهها جلوگیری نمود. همچنین، تنظیم تداخلها با استفاده از آبمُرکها (Watermarks) و «حلقههای حفاظتی» (Fences) اجازه میدهد تا بین دادههای تاریخی و دادههای جاری تداخل کمتری صورت گیرد و همزمانی بهتری برقرار شود.
در نهایت، اندازهگیری مناسب بر اساس نرخ نوشتن واقعی در دیتابیس، نقش کلیدی در بهینهسازی فرآیندهای بازپختهسازی دارد. با تقسیم عملیات به بخشهای کوچکتر و تطابق آنها با نرخهای نوشتاری، میتوان از فشار بیمورد بر سیستم جلوگیری کرده و کارایی عملیات را تضمین کرد. این رویکردها و فنون سبب میشوند که عملیات بازپختهسازی در مقیاس بزرگ، همزمان با ادامه فعالیتهای جاری، به شکل ایمن و مؤثر انجام شود و موجب پایداری و صحت سیستم گردد.
#PostgreSQL #بازپختهسازی #توسعه_پایدار #پایش_تغییرات
🟣لینک مقاله:
https://estuary.dev/blog/postgres-cdc-backfill?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Estuary
PostgreSQL CDC Backfill at Scale: A Production Guide
How to run a PostgreSQL CDC backfill on a very large database while production keeps writing: WAL retention, chunk size, and recovering a run that fails.
🔵 عنوان مقاله
Why DuckDB 2.0 is faster (15 minute read)
🟢 خلاصه مقاله:
نسخه جدید DuckDB 2.0 با ارائههای جدید و بهبودهای قابل توجه، عملکرد بینظیری را در اجرای Queryها ارائه میدهد. یکی از مهمترین قابلیتهای این نسخه، افزایش سرعت در پاسخدهی به درخواستهای مرتبط با دادههای S3 است. بهطور خاص، DuckDB 2.0 توانسته است با استفاده از فناوری I/O غیرهمزمان، سرعت اجرای این درخواستها را دو تا سه برابر افزایش دهد. این بهبود، بهویژه در محیطهای دادهمحور بزرگ و پیچیده، تاثیر چشمگیری در کاهش زمان پاسخگویی داشته است.
علاوه بر این، در نسخه جدید، بهبودهای قابل توجهی در اجرای پرسوجوهای عمیق و بازگشتی صورت گرفته است. این نوع Queryها، که در تحلیلهای دادههای ساختاریافته و پیچیده کاربرد دارند، در گذشته ممکن بود باعث کاهش سرعت و کارایی سیستم شوند، اما حالا با فناوریهای جدید در DuckDB 2.0، این پرسوجوها بسیار سریعتر و کارآمدتر اجرا میشوند. همچنین، ساختار دادههای نیمهساختاری مانند دادههای Variant که معمولا در قالب JSON قرار دارند، در این نسخه کوچکتر و سریعتر شدهاند، که به بهبود عملکرد کل سیستم کمک میکند.
در کنار این بهبودهای فنی، ویژگیهای کاربردی و مهمی نیز به زبان SQL افزوده شده است. امکان استفاده از تریگرها، اسکیماهای تو در تو، و عبارتهای دادهمحور با قابلیت تغییر دادهها (Data-modifying CTEs) از جمله ویژگیهایی است که به توسعهدهندگان امکان مدیریت و پردازش دادهها را بسیار آسانتر کرده است. این امکانات، کار با پایگاههای داده را انعطافپذیرتر و قدرتمندتر ساخته است و DuckDB را برای پروژههای پیشرفته و دادهمحور، گزینهای جذابتر میکند.
در مجموع، DuckDB 2.0 با ترکیبی از بهبودهای فنی و امکانات جدید، راهکاری سریعتر، انعطافپذیرتر و قدرتمندتر در حوزه مدیریت و تحلیل دادههای نوین ارائه میدهد. این نسخه، گامی بزرگ در توسعه ابزارهای تحلیل داده است که میتواند فرآیندهای دادهمحور را به شکل چشمگیری بهبود بخشد.
#DuckDB #تحلیل_داده #پایگاه_داده #هوش_مصنوعی
🟣لینک مقاله:
https://motherduck.com/blog/why-duckdb-20-is-faster/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Why DuckDB 2.0 is faster (15 minute read)
🟢 خلاصه مقاله:
نسخه جدید DuckDB 2.0 با ارائههای جدید و بهبودهای قابل توجه، عملکرد بینظیری را در اجرای Queryها ارائه میدهد. یکی از مهمترین قابلیتهای این نسخه، افزایش سرعت در پاسخدهی به درخواستهای مرتبط با دادههای S3 است. بهطور خاص، DuckDB 2.0 توانسته است با استفاده از فناوری I/O غیرهمزمان، سرعت اجرای این درخواستها را دو تا سه برابر افزایش دهد. این بهبود، بهویژه در محیطهای دادهمحور بزرگ و پیچیده، تاثیر چشمگیری در کاهش زمان پاسخگویی داشته است.
علاوه بر این، در نسخه جدید، بهبودهای قابل توجهی در اجرای پرسوجوهای عمیق و بازگشتی صورت گرفته است. این نوع Queryها، که در تحلیلهای دادههای ساختاریافته و پیچیده کاربرد دارند، در گذشته ممکن بود باعث کاهش سرعت و کارایی سیستم شوند، اما حالا با فناوریهای جدید در DuckDB 2.0، این پرسوجوها بسیار سریعتر و کارآمدتر اجرا میشوند. همچنین، ساختار دادههای نیمهساختاری مانند دادههای Variant که معمولا در قالب JSON قرار دارند، در این نسخه کوچکتر و سریعتر شدهاند، که به بهبود عملکرد کل سیستم کمک میکند.
در کنار این بهبودهای فنی، ویژگیهای کاربردی و مهمی نیز به زبان SQL افزوده شده است. امکان استفاده از تریگرها، اسکیماهای تو در تو، و عبارتهای دادهمحور با قابلیت تغییر دادهها (Data-modifying CTEs) از جمله ویژگیهایی است که به توسعهدهندگان امکان مدیریت و پردازش دادهها را بسیار آسانتر کرده است. این امکانات، کار با پایگاههای داده را انعطافپذیرتر و قدرتمندتر ساخته است و DuckDB را برای پروژههای پیشرفته و دادهمحور، گزینهای جذابتر میکند.
در مجموع، DuckDB 2.0 با ترکیبی از بهبودهای فنی و امکانات جدید، راهکاری سریعتر، انعطافپذیرتر و قدرتمندتر در حوزه مدیریت و تحلیل دادههای نوین ارائه میدهد. این نسخه، گامی بزرگ در توسعه ابزارهای تحلیل داده است که میتواند فرآیندهای دادهمحور را به شکل چشمگیری بهبود بخشد.
#DuckDB #تحلیل_داده #پایگاه_داده #هوش_مصنوعی
🟣لینک مقاله:
https://motherduck.com/blog/why-duckdb-20-is-faster/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
MotherDuck
Why DuckDB 2.0 is faster | MotherDuck
DuckDB 2.0 alpha vs 1.5.5 on one laptop: recursive CTEs up to 90x, VARIANT 6x faster than JSON text, async I/O 2.4x on S3. What changes, and how to model data to get the speedup.
🔵 عنوان مقاله
It passed CI. It passed your evals. The customer still got the wrong answer (11 minute read)
🟢 خلاصه مقاله:
در حالی که هوش مصنوعی توانسته است نتایج موفقیتآمیز و پایهدار ارائه کند و از نظر ارزیابی شما نیز پاسخهای خوبی داشته باشد، هنوز هم ممکن است نتیجه نادرستی به مشتری ارائه شود. این موضوع به این دلیل است که سیستمهای هوشمند ممکن است اطلاعات نادرستی را بازیابی کنند یا مسیر اجرای نادرستی را دنبال نمایند. بنابراین، حتی وقتی پاسخها ظاهر صحیح دارند، ممکن است در واقعیت نادرست باشند.
برای رفع این مشکل، نیاز است که فرآیند خطایابی به صورت جامع و کامل انجام شود. این یعنی باید تمام مسیرهای عملکرد مدل، تماسهای با ابزارهای مختلف، ورودیهای بازیابی اطلاعات و خروجیها به صورت دقیق ثبت و پیگیری شوند. علاوه بر این، لازم است تستهایی مجزا بر روی رفتار سیستم در شرایط مشخص انجام شود تا تضمین شود که پاسخها هم از نظر کیفیت و هم از نظر دقت، قابل اعتماد هستند.
در واقع، پیادهسازی چنین فرآیندهای نظارتی و تستهای جامع، کلید حل مشکل احتمال خطا در سیستمهای هوشمند است. این کار نه تنها باعث افزایش اعتمادپذیری پاسخها میشود، بلکه فرآیند عیبیابی و بهبود مدل را نیز سادهتر میکند و از ارائه پاسخهای نادرست به مشتریان جلوگیری میکند.
#هوش_اصطناعی #تست_سیستم #پایش_کیفیت #مدیریت_خطا
🟣لینک مقاله:
https://thenewstack.io/ai-agent-trace-debugging/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
It passed CI. It passed your evals. The customer still got the wrong answer (11 minute read)
🟢 خلاصه مقاله:
در حالی که هوش مصنوعی توانسته است نتایج موفقیتآمیز و پایهدار ارائه کند و از نظر ارزیابی شما نیز پاسخهای خوبی داشته باشد، هنوز هم ممکن است نتیجه نادرستی به مشتری ارائه شود. این موضوع به این دلیل است که سیستمهای هوشمند ممکن است اطلاعات نادرستی را بازیابی کنند یا مسیر اجرای نادرستی را دنبال نمایند. بنابراین، حتی وقتی پاسخها ظاهر صحیح دارند، ممکن است در واقعیت نادرست باشند.
برای رفع این مشکل، نیاز است که فرآیند خطایابی به صورت جامع و کامل انجام شود. این یعنی باید تمام مسیرهای عملکرد مدل، تماسهای با ابزارهای مختلف، ورودیهای بازیابی اطلاعات و خروجیها به صورت دقیق ثبت و پیگیری شوند. علاوه بر این، لازم است تستهایی مجزا بر روی رفتار سیستم در شرایط مشخص انجام شود تا تضمین شود که پاسخها هم از نظر کیفیت و هم از نظر دقت، قابل اعتماد هستند.
در واقع، پیادهسازی چنین فرآیندهای نظارتی و تستهای جامع، کلید حل مشکل احتمال خطا در سیستمهای هوشمند است. این کار نه تنها باعث افزایش اعتمادپذیری پاسخها میشود، بلکه فرآیند عیبیابی و بهبود مدل را نیز سادهتر میکند و از ارائه پاسخهای نادرست به مشتریان جلوگیری میکند.
#هوش_اصطناعی #تست_سیستم #پایش_کیفیت #مدیریت_خطا
🟣لینک مقاله:
https://thenewstack.io/ai-agent-trace-debugging/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
The New Stack
It passed CI. It passed your evals. The customer still got the wrong answer.
Your AI agent returned a 200, passed its faithfulness check, and still answered the wrong question. The evidence that explains why lives in the trace.
🔵 عنوان مقاله
▶️ an hour-long video
🟢 خلاصه مقاله:
در این ویدیوی یکساعته، مصاحبه کامل با الیزابت گرت کریستنسن و تام لین به طور جامع ارائه شده است. این مصاحبه فرصت مناسبی است تا بینندگان بتوانند نظرات، دیدگاهها و تجربیات این دو فرد برجسته را در زمینههای مختلف دریافت کنند. ارائه کامل چنین گفتوگوهایی به ترویج اطلاعات دقیق و تعمیق درک موضوعات مورد بحث کمک میکند و مخاطبان را به درک بهتر مسائل هدایت میکند.
این ویدیو نه تنها برای علاقهمندان به موضوعات مطرح شده مفید است، بلکه میتواند منبع ارزشمندی برای پژوهشگران و علاقمندان به آشنایی با دیدگاههای مختلف در حوزههای مرتبط باشد. تماشای مصاحبه کامل، فرصت مناسبی است برای کسب اطلاعات افقی و عمقی درباره موضوعات مهم، و درک عمیقتر دیدگاههای این دو شخصیت برجسته.
در مجموع، این ویدیو یک مستند جامع است که به صورت کامل در یک قالب یک ساعته در اختیار علاقهمندان قرار میگیرد تا از محتوا بهرهمند شوند و دانش خود را گسترش دهند.
#مصاحبه #آموزش #محتوا #دانش
🟣لینک مقاله:
https://www.youtube.com/watch?v=2ajXkLeVXxQ
➖➖➖➖➖➖➖➖
👑 @Database_Academy
▶️ an hour-long video
🟢 خلاصه مقاله:
در این ویدیوی یکساعته، مصاحبه کامل با الیزابت گرت کریستنسن و تام لین به طور جامع ارائه شده است. این مصاحبه فرصت مناسبی است تا بینندگان بتوانند نظرات، دیدگاهها و تجربیات این دو فرد برجسته را در زمینههای مختلف دریافت کنند. ارائه کامل چنین گفتوگوهایی به ترویج اطلاعات دقیق و تعمیق درک موضوعات مورد بحث کمک میکند و مخاطبان را به درک بهتر مسائل هدایت میکند.
این ویدیو نه تنها برای علاقهمندان به موضوعات مطرح شده مفید است، بلکه میتواند منبع ارزشمندی برای پژوهشگران و علاقمندان به آشنایی با دیدگاههای مختلف در حوزههای مرتبط باشد. تماشای مصاحبه کامل، فرصت مناسبی است برای کسب اطلاعات افقی و عمقی درباره موضوعات مهم، و درک عمیقتر دیدگاههای این دو شخصیت برجسته.
در مجموع، این ویدیو یک مستند جامع است که به صورت کامل در یک قالب یک ساعته در اختیار علاقهمندان قرار میگیرد تا از محتوا بهرهمند شوند و دانش خود را گسترش دهند.
#مصاحبه #آموزش #محتوا #دانش
🟣لینک مقاله:
https://www.youtube.com/watch?v=2ajXkLeVXxQ
➖➖➖➖➖➖➖➖
👑 @Database_Academy
YouTube
Celebrating 30 Years of Postgres: A Conversation with Tom Lane
Join Elizabeth Christensen from the Postgres team at Snowflake as she sits down with Tom Lane, the original Postgres developer, to celebrate 30 years of Postgres as an open-source project. Discover the technical and architectural decisions that have shaped…
🔵 عنوان مقاله
pgrust 0.3: A Rust Rewrite of Postgres, Now Ready to Try
🟢 خلاصه مقاله:
نسخه ۰.۳ pgrust، بازنویسی زبان Rust برای پایگاه داده PostgreSQL، اکنون آماده است تا مورد آزمایش قرار گیرد. این پروژه که چندی است به عنوان یک جایگزین منبع باز برای PostgreSQL در حال توسعه است، نشان دهنده یک گام مهم در بهبود و سادهسازی عملکرد این پایگاه داده قدرتمند است.
در این نسخه جدید، توسعهدهندگان و علاقهمندان دعوت شدهاند تا pgrust را در محیطهای عملی و واقعی آزمایش کنند، البته در محیطهای غیر بحرانی و آزمایشی. هدف اصلی از انتشار این نسخه، جمعآوری بازخورد و بررسی عملکرد آن تحت بارهای مختلف است تا در نسخههای آتی توسعههای بیشتری صورت گیرد و قابلیت اطمینان آن افزایش یابد. هرچند هنوز در مرحلهی آزمایشی است، اما این پروژه نشان میدهد که آیندهای جالب در انتظار پایگاههای داده مبتنی بر Rust میباشد و فرصت خوبی برای توسعهدهندگان است تا در مسیر پیشرفت این فناوری مشارکت کنند.
این آغاز راهی است برای کسانی که به دنبال راهحلی سبک، سریع و امن برای پایگاه دادههای خود هستند و میخواهند در پروژهای نوآورانه و آیندهنگر نقش داشته باشند. با ادامه توسعه و بهبود، pgrust میتواند جایگاه ویژهای در میان ابزارهای مدیریت دادههای مدرن پیدا کند.
#پایگاه_داده #Rust #پروژههای_باز #توسعه_نرمافزار
🟣لینک مقاله:
https://pgrust.com/blog/pgrust-v0-3/
➖➖➖➖➖➖➖➖
👑 @Database_Academy
pgrust 0.3: A Rust Rewrite of Postgres, Now Ready to Try
🟢 خلاصه مقاله:
نسخه ۰.۳ pgrust، بازنویسی زبان Rust برای پایگاه داده PostgreSQL، اکنون آماده است تا مورد آزمایش قرار گیرد. این پروژه که چندی است به عنوان یک جایگزین منبع باز برای PostgreSQL در حال توسعه است، نشان دهنده یک گام مهم در بهبود و سادهسازی عملکرد این پایگاه داده قدرتمند است.
در این نسخه جدید، توسعهدهندگان و علاقهمندان دعوت شدهاند تا pgrust را در محیطهای عملی و واقعی آزمایش کنند، البته در محیطهای غیر بحرانی و آزمایشی. هدف اصلی از انتشار این نسخه، جمعآوری بازخورد و بررسی عملکرد آن تحت بارهای مختلف است تا در نسخههای آتی توسعههای بیشتری صورت گیرد و قابلیت اطمینان آن افزایش یابد. هرچند هنوز در مرحلهی آزمایشی است، اما این پروژه نشان میدهد که آیندهای جالب در انتظار پایگاههای داده مبتنی بر Rust میباشد و فرصت خوبی برای توسعهدهندگان است تا در مسیر پیشرفت این فناوری مشارکت کنند.
این آغاز راهی است برای کسانی که به دنبال راهحلی سبک، سریع و امن برای پایگاه دادههای خود هستند و میخواهند در پروژهای نوآورانه و آیندهنگر نقش داشته باشند. با ادامه توسعه و بهبود، pgrust میتواند جایگاه ویژهای در میان ابزارهای مدیریت دادههای مدرن پیدا کند.
#پایگاه_داده #Rust #پروژههای_باز #توسعه_نرمافزار
🟣لینک مقاله:
https://pgrust.com/blog/pgrust-v0-3/
➖➖➖➖➖➖➖➖
👑 @Database_Academy
pgrust
pgrust v0.3: the bug-smashing release
On a held-out corpus of 164,000 cases, divergences from Postgres fell from 1,454 in v0.2 to 11 in v0.3.
Forwarded from Persian Post
امروز، ۲۶ شهریور، زادروز پسر کوروش بزرگه؛ روزی که بهعنوان «روز پسر» نامگذاری شده.
❤1
🔵 عنوان مقاله
The Lifecycle of a Sharded Postgres Query
🟢 خلاصه مقاله:
در دنیای بانکهای اطلاعاتی مدرن، مقیاسپذیری و کارایی اهمیت ویژهای پیدا کرده است. شرکت پلنتاسکیل به تازگی سیستم جدیدی به نام نکی را معرفی کرده است که بر پایه ساختارشدگی (Sharding) در پایگاه دادههای پستگرس ساخته شده است. این سیستم، یک نوع معماری متمایز دارد، جایی که یک روتر قادر است پروتکل ارتباطی را مستقیماً درک کند و درخواستهای کوئری را به صورت توزیعشده در بین بخشهای مختلف سرورهای پستگرس استاندارد، هدایت کند. این رویکرد، امکان مدیریت بهتر حجمهای بزرگ داده و افزایش سرعت پاسخگویی به درخواستها را فراهم میآورد، بدون نیاز به تعویض کامل سیستم پایه.
در این مقاله، فرآیند جاری این سیستم جدید و نحوه عملکرد آن به صورت گرافیکی و توضیحی مورد بررسی قرار میگیرد. این مسیر، روشی جذاب و آموزنده است که نشان میدهد چگونه درخواستهای کاربر در مرحله اول به روتر میرسند و سپس به بخشهایی تقسیم میشوند که هر کدام روی یک shard جداگانه قرار دارند. در ادامه، روتر با استفاده از پروتکل خاص خود، تمام این درخواستها را به صورت همزمان در سرورهای مختلف مدیریت میکند، نتایج را جمعآوری و در قالب پاسخ نهایی به کاربر بازمیگرداند. این تکنولوژی نوآورانه، به توسعهدهندگان و مدیران دیتابیس امکان میدهد تا با اطمینان بیشتری به مقیاسپذیری و بهینگی سیستمهای خود بپردازند، بدون اینکه نگران پیچیدگیهای معمول در مدیریت چنین ساختارهای توزیعشده باشند.
در نهایت، مطالعه این نوع معماری، نشان میدهد که چگونه رویکردهای نوین میتوانند آینده بانکهای اطلاعاتی را تغییر دهند. سیستم نکی، با ساختار شاردینگ و مدیریت هوشمند درخواستها، راهی است برای رسیدن به سطوح جدیدی از کارایی و انعطافپذیری در مدیریت دادهها. این مقاله تصویری، راهنمایی ارزشمند برای توسعهدهندگان و متخصصان حوزه دیتابیس است که میخواهند بر چالشهای مقیاسپذیر بودن غلبه کنند و به سمت فناوریهای پیشرفتهتر حرکت کنند.
#پایگاه_داده #شاردینگ #پستگرس #فناوری_نوین
🟣لینک مقاله:
https://planetscale.com/blog/the-lifecycle-of-a-sharded-postgres-query
➖➖➖➖➖➖➖➖
👑 @Database_Academy
The Lifecycle of a Sharded Postgres Query
🟢 خلاصه مقاله:
در دنیای بانکهای اطلاعاتی مدرن، مقیاسپذیری و کارایی اهمیت ویژهای پیدا کرده است. شرکت پلنتاسکیل به تازگی سیستم جدیدی به نام نکی را معرفی کرده است که بر پایه ساختارشدگی (Sharding) در پایگاه دادههای پستگرس ساخته شده است. این سیستم، یک نوع معماری متمایز دارد، جایی که یک روتر قادر است پروتکل ارتباطی را مستقیماً درک کند و درخواستهای کوئری را به صورت توزیعشده در بین بخشهای مختلف سرورهای پستگرس استاندارد، هدایت کند. این رویکرد، امکان مدیریت بهتر حجمهای بزرگ داده و افزایش سرعت پاسخگویی به درخواستها را فراهم میآورد، بدون نیاز به تعویض کامل سیستم پایه.
در این مقاله، فرآیند جاری این سیستم جدید و نحوه عملکرد آن به صورت گرافیکی و توضیحی مورد بررسی قرار میگیرد. این مسیر، روشی جذاب و آموزنده است که نشان میدهد چگونه درخواستهای کاربر در مرحله اول به روتر میرسند و سپس به بخشهایی تقسیم میشوند که هر کدام روی یک shard جداگانه قرار دارند. در ادامه، روتر با استفاده از پروتکل خاص خود، تمام این درخواستها را به صورت همزمان در سرورهای مختلف مدیریت میکند، نتایج را جمعآوری و در قالب پاسخ نهایی به کاربر بازمیگرداند. این تکنولوژی نوآورانه، به توسعهدهندگان و مدیران دیتابیس امکان میدهد تا با اطمینان بیشتری به مقیاسپذیری و بهینگی سیستمهای خود بپردازند، بدون اینکه نگران پیچیدگیهای معمول در مدیریت چنین ساختارهای توزیعشده باشند.
در نهایت، مطالعه این نوع معماری، نشان میدهد که چگونه رویکردهای نوین میتوانند آینده بانکهای اطلاعاتی را تغییر دهند. سیستم نکی، با ساختار شاردینگ و مدیریت هوشمند درخواستها، راهی است برای رسیدن به سطوح جدیدی از کارایی و انعطافپذیری در مدیریت دادهها. این مقاله تصویری، راهنمایی ارزشمند برای توسعهدهندگان و متخصصان حوزه دیتابیس است که میخواهند بر چالشهای مقیاسپذیر بودن غلبه کنند و به سمت فناوریهای پیشرفتهتر حرکت کنند.
#پایگاه_داده #شاردینگ #پستگرس #فناوری_نوین
🟣لینک مقاله:
https://planetscale.com/blog/the-lifecycle-of-a-sharded-postgres-query
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Planetscale
The lifecycle of a sharded Postgres query — PlanetScale
Follow a SQL query through the router, across four Postgres shards, and back.
🔵 عنوان مقاله
TPC-H Query 15 - Scalar Constants and Materialisation (5 minute read)
🟢 خلاصه مقاله:
در این مقاله به یکی از مفاهیم مهم در بهینهسازی کوئریهای پایگاه دادهها میپردازیم، جایی که اشاره میشود استفاده مجدد از یک عبارت تعریفشده در قسمت Common Table Expression (CTE) در یک کوئری، میتواند مسئلهای مهم در عملکرد سیستم باشد. زمانی که یک CTE در یک کوئری چندینبار مورد استفاده قرار میگیرد، سوال این است که سیستم مدیریت پایگاه داده (DBMS) نتیجه این عبارت را فقط یکبار محاسبه میکند و در حافظه نگهداری میکند یا هر بار که به آن نیاز است، مجدداً همان محاسبات را انجام میدهد. این موضوع عملکرد کوئری را به شدت متاثر میکند، مخصوصاً در جایی که کوئریهای پیچیده و پرحجم دارند.
در بخش بعدی، به اهمیت این موضوع در بهبود کارایی سیستم اشاره میشود، جایی که سیستمهای مختلف ممکن است رفتار متفاوتی نشان دهند. برخی از سیستمها با استفاده از تکنیکهای مادیسازی نتایج، نتیجههای محاسبهشده را ذخیره میکنند، در حالی که برخی دیگر ممکن است هر بار نتیجه را مجدداً محاسبه کنند، که این امر منجر به کاهش کارایی میشود. بررسی این جنبهها در هنگام نوشتن کوئریهای بهینه اهمیت ویژهای دارد، مخصوصاً زمانی که از مقادیر ثابت (Scalar Constants) استفاده میشود که در صورت مادیسازی، میتوانند به شدت در زمان اجرای کوئری صرفهجویی کنند.
در نهایت، یکی از نکات کلیدی در این مطالعه، نحوه تأثیرگذاری این رفتار بر اجرای کوئری است. آزمایشهایی که با استفاده از نمونههای مختلف انجام شده نشان میدهد که رفرنس دادن مجدد به همان CTE، در صورت عدم استفاده از مادیسازی، منجر به انجام مجدد تمام عملیاتهای مربوطه میشود که کاملاً ممکن است بر زمان اجرای کوئری تأثیر منفی بگذارد. بنابراین، فهمیدن اینکه آیا سیستم به صورت خودکار نتایج را مادیسازی میکند یا نه، اهمیت زیادی در طراحی کوئریهای بهینه دارد.
در نتیجه، آگاهی از نحوه عملکرد سیستمهای مدیریت پایگاه داده در تائید و بهرهبرداری موثر از CTEها، کلید طلایی در بهبود عملکرد است. توسعهدهندگان پایگاه داده و افراد فعال در حوزه داده باید این نکات را در نظر داشته باشند تا کوئریهایی سریعتر و بهینهتر نوشته و اجرا کنند.
#پایگاه_داده #بهینهسازی_کوئری #CTE #مادیسازی
🟣لینک مقاله:
https://database-doctor.com/posts/tpch-q15?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
TPC-H Query 15 - Scalar Constants and Materialisation (5 minute read)
🟢 خلاصه مقاله:
در این مقاله به یکی از مفاهیم مهم در بهینهسازی کوئریهای پایگاه دادهها میپردازیم، جایی که اشاره میشود استفاده مجدد از یک عبارت تعریفشده در قسمت Common Table Expression (CTE) در یک کوئری، میتواند مسئلهای مهم در عملکرد سیستم باشد. زمانی که یک CTE در یک کوئری چندینبار مورد استفاده قرار میگیرد، سوال این است که سیستم مدیریت پایگاه داده (DBMS) نتیجه این عبارت را فقط یکبار محاسبه میکند و در حافظه نگهداری میکند یا هر بار که به آن نیاز است، مجدداً همان محاسبات را انجام میدهد. این موضوع عملکرد کوئری را به شدت متاثر میکند، مخصوصاً در جایی که کوئریهای پیچیده و پرحجم دارند.
در بخش بعدی، به اهمیت این موضوع در بهبود کارایی سیستم اشاره میشود، جایی که سیستمهای مختلف ممکن است رفتار متفاوتی نشان دهند. برخی از سیستمها با استفاده از تکنیکهای مادیسازی نتایج، نتیجههای محاسبهشده را ذخیره میکنند، در حالی که برخی دیگر ممکن است هر بار نتیجه را مجدداً محاسبه کنند، که این امر منجر به کاهش کارایی میشود. بررسی این جنبهها در هنگام نوشتن کوئریهای بهینه اهمیت ویژهای دارد، مخصوصاً زمانی که از مقادیر ثابت (Scalar Constants) استفاده میشود که در صورت مادیسازی، میتوانند به شدت در زمان اجرای کوئری صرفهجویی کنند.
در نهایت، یکی از نکات کلیدی در این مطالعه، نحوه تأثیرگذاری این رفتار بر اجرای کوئری است. آزمایشهایی که با استفاده از نمونههای مختلف انجام شده نشان میدهد که رفرنس دادن مجدد به همان CTE، در صورت عدم استفاده از مادیسازی، منجر به انجام مجدد تمام عملیاتهای مربوطه میشود که کاملاً ممکن است بر زمان اجرای کوئری تأثیر منفی بگذارد. بنابراین، فهمیدن اینکه آیا سیستم به صورت خودکار نتایج را مادیسازی میکند یا نه، اهمیت زیادی در طراحی کوئریهای بهینه دارد.
در نتیجه، آگاهی از نحوه عملکرد سیستمهای مدیریت پایگاه داده در تائید و بهرهبرداری موثر از CTEها، کلید طلایی در بهبود عملکرد است. توسعهدهندگان پایگاه داده و افراد فعال در حوزه داده باید این نکات را در نظر داشته باشند تا کوئریهایی سریعتر و بهینهتر نوشته و اجرا کنند.
#پایگاه_داده #بهینهسازی_کوئری #CTE #مادیسازی
🟣لینک مقاله:
https://database-doctor.com/posts/tpch-q15?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Database-Doctor
TPC-H Query 15 - Scalar Constants and Materialisation
TPC-H Query 15 - Scalar Constants and MaterialisationToday's TPC-H query is the first one to use a clause. The same expression is used twice, and the query quietlytests for a simple, yet powerful, optimisation: materialisation.
🔵 عنوان مقاله
a browser-based demo
🟢 خلاصه مقاله:
در دنیای فناوری، آزمایش نرمافزارها قبل از نصب آنها اهمیت زیادی دارد؛ مخصوصاً زمانی که بتوانید نسخۀ آزمایشی آنلاین و بدون نیاز به دانلود و نصب دریافت کنید. در این حالت، کاربران میتوانند به راحتی و با سرعت، عملکرد و امکانات برنامه را ارزیابی کرده و تصمیم بگیرند که آیا مناسب نیازهایشان است یا خیر. در این راستا، نسخه دمو مبتنی بر مرورگر یکی از بهترین روشها است، چرا که امکان دسترسی آسان و فوری را فراهم میسازد.
نسخههای دمو مبتنی بر مرورگر، این فرصت را میدهند که کاربران بدون هیچگونه دغدغهای و تنها با چند کلیک، قابلیتها و رابط کاربری نرمافزار را مشاهده و آزمایش کنند. این رویکرد، علاوه بر صرفهجویی در زمان و منابع، کاربران را قادر میسازد تا قبل از تعهد به نصب، از تمامی امکانات آن بهرهمند شوند و با اطمینان بیشتری تصمیمگیری کنند.
در مجموع، این روش آزمایش سریع و کاربرپسند، روند انتخاب و ارزیابی نرمافزار را بسیار آسانتر و انعطافپذیر تر میکند، و شرکتها نیز میتوانند تعامل بهتری با کاربران خود داشته باشند و بازخوردهای ارزشمندی جمعآوری کنند. در نهایت، امکان آزمودن بدون نیاز به نصب، یکی از کلیدهای موفقیت در ارائه خدمات دیجیتال است.
#آزمایش_آنلاین #نسخه_مرورگر #تست_نرمافزار #فناوری
🟣لینک مقاله:
https://pgrust.com/
➖➖➖➖➖➖➖➖
👑 @Database_Academy
a browser-based demo
🟢 خلاصه مقاله:
در دنیای فناوری، آزمایش نرمافزارها قبل از نصب آنها اهمیت زیادی دارد؛ مخصوصاً زمانی که بتوانید نسخۀ آزمایشی آنلاین و بدون نیاز به دانلود و نصب دریافت کنید. در این حالت، کاربران میتوانند به راحتی و با سرعت، عملکرد و امکانات برنامه را ارزیابی کرده و تصمیم بگیرند که آیا مناسب نیازهایشان است یا خیر. در این راستا، نسخه دمو مبتنی بر مرورگر یکی از بهترین روشها است، چرا که امکان دسترسی آسان و فوری را فراهم میسازد.
نسخههای دمو مبتنی بر مرورگر، این فرصت را میدهند که کاربران بدون هیچگونه دغدغهای و تنها با چند کلیک، قابلیتها و رابط کاربری نرمافزار را مشاهده و آزمایش کنند. این رویکرد، علاوه بر صرفهجویی در زمان و منابع، کاربران را قادر میسازد تا قبل از تعهد به نصب، از تمامی امکانات آن بهرهمند شوند و با اطمینان بیشتری تصمیمگیری کنند.
در مجموع، این روش آزمایش سریع و کاربرپسند، روند انتخاب و ارزیابی نرمافزار را بسیار آسانتر و انعطافپذیر تر میکند، و شرکتها نیز میتوانند تعامل بهتری با کاربران خود داشته باشند و بازخوردهای ارزشمندی جمعآوری کنند. در نهایت، امکان آزمودن بدون نیاز به نصب، یکی از کلیدهای موفقیت در ارائه خدمات دیجیتال است.
#آزمایش_آنلاین #نسخه_مرورگر #تست_نرمافزار #فناوری
🟣لینک مقاله:
https://pgrust.com/
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Pgrust
pgrust v0.3 — postgres, rewritten in rust
pgrust v0.3 targets PostgreSQL 18.6 compatibility. Read the release update or try the experimental browser demo. Not production ready.
🔵 عنوان مقاله
Stale data makes agents fail confidently (Sponsor)
🟢 خلاصه مقاله:
در دنیای هوش مصنوعی، بسیاری از عاملها یا رباتهای هوشمند با اعتماد به نفس پایین و نه با صدای بلند، دچار مشکل میشوند. این عاملها معمولاً بر پایه دادههای قدیمی یا منسوخ عمل میکنند و نتیجه این امر، ارائهی پاسخهای نادرست مانند بازپرداختهای اشتباه، قیمتهای نادرست و تصمیمات متضاد است. مشکل اصلی در این است که بسیاری از این سیستمها از دادههای لحظهای و بهروز استفاده نمیکنند و در نتیجه تصمیماتی میگیرند که بر پایه اطلاعات منسوخ استوار است.
برای مقابله با این مشکل، یک موتور زمینه یا کانتکستژن راهحلی مؤثر ارائه میدهد؛ این فناوری قادر است در هر لحظه، مقادیر واقعی و بهروز را محاسبه کند و بر اساس آن تصمیمگیری کند. در نتیجه، عاملهای هوشمند میتوانند در زمان واقعی، بر اساس اطلاعات صحیح و جاری، اقدام و پاسخ دهند. این شیوه نه تنها دقت و اطمینان را افزایش میدهد، بلکه از خطاهای ناشی از دادههای قدیمی جلوگیری میکند و کارایی کل سیستم را بهبود میدهد.
برای مشاهده دقیقتر و فهمیدن چگونگی عملکرد این فناوری، میتوانید جزئیات مربوط به نحوه کار آن را بررسی کنید و ببینید چگونه این موتور زمینه، به تطابق لحظهای دادهها کمک میکند و تضمین مینماید که تصمیمات مبتنی بر اطلاعات جدید و معتبر باشد.
#هوش_مصنوعی #موتور_زمینه #تکنولوژی_روز #تصمیمگیری_هوشمند
🟣لینک مقاله:
https://chalk.ai/blog/what-is-a-context-engine?utm_source=tldr&utm_medium=referral&utm_campaign=2026-09-14_contextengineblog&utm_term=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Stale data makes agents fail confidently (Sponsor)
🟢 خلاصه مقاله:
در دنیای هوش مصنوعی، بسیاری از عاملها یا رباتهای هوشمند با اعتماد به نفس پایین و نه با صدای بلند، دچار مشکل میشوند. این عاملها معمولاً بر پایه دادههای قدیمی یا منسوخ عمل میکنند و نتیجه این امر، ارائهی پاسخهای نادرست مانند بازپرداختهای اشتباه، قیمتهای نادرست و تصمیمات متضاد است. مشکل اصلی در این است که بسیاری از این سیستمها از دادههای لحظهای و بهروز استفاده نمیکنند و در نتیجه تصمیماتی میگیرند که بر پایه اطلاعات منسوخ استوار است.
برای مقابله با این مشکل، یک موتور زمینه یا کانتکستژن راهحلی مؤثر ارائه میدهد؛ این فناوری قادر است در هر لحظه، مقادیر واقعی و بهروز را محاسبه کند و بر اساس آن تصمیمگیری کند. در نتیجه، عاملهای هوشمند میتوانند در زمان واقعی، بر اساس اطلاعات صحیح و جاری، اقدام و پاسخ دهند. این شیوه نه تنها دقت و اطمینان را افزایش میدهد، بلکه از خطاهای ناشی از دادههای قدیمی جلوگیری میکند و کارایی کل سیستم را بهبود میدهد.
برای مشاهده دقیقتر و فهمیدن چگونگی عملکرد این فناوری، میتوانید جزئیات مربوط به نحوه کار آن را بررسی کنید و ببینید چگونه این موتور زمینه، به تطابق لحظهای دادهها کمک میکند و تضمین مینماید که تصمیمات مبتنی بر اطلاعات جدید و معتبر باشد.
#هوش_مصنوعی #موتور_زمینه #تکنولوژی_روز #تصمیمگیری_هوشمند
🟣لینک مقاله:
https://chalk.ai/blog/what-is-a-context-engine?utm_source=tldr&utm_medium=referral&utm_campaign=2026-09-14_contextengineblog&utm_term=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Chalk
What is a Context Engine? | Chalk
Looking for a feature store? A context engine is what the category becomes when the consumer is an agent: values computed at the request, not read from a table.
🔵 عنوان مقاله
PostgreSQL Migrator 1.0: Migrate Oracle and MySQL to Postgres
🟢 خلاصه مقاله:
نسخه ۱.۰ مهاجرتگر پستگرسول، ابزاری قدرتمند و چندمنظوره برای انتقال پایگاههای داده اوراکل و مایاسکیوال/ماریا دیبی است. این ابزار، با عرضه یک بسته نرمافزاری واحد، فرآیند مهاجرت را بسیار سادهتر و کارآمدتر میکند. علاوه بر این، رابط کاربری وب اطلاحشده که در این نسخه ارائه شده است، امکان شناسایی سریع مشکلات و بررسی دقیق روند انتقال دادهها را فراهم میکند.
این ابزار مبتنی بر فناوریهای نوین، با استفاده از روشهای سریع کپی (COPY) قادر است حجم عظیمی از اطلاعات را در کوتاهترین زمان منتقل کند. هدف اصلی آن ارائه راه حلی یکپارچه و قابل اطمینان برای توسعهدهندگان و مدیران پایگاه داده است که میخواهند به راحتی و بدون نگرانی، سیستمهای خود را به پستگرسول مهاجرت دهند. این نسخه جدید، نقطه عطف مهمی در کاهش پیچیدگیهای انتقال دادهها و افزایش بهرهوری در مدیریت پایگاههای داده است.
#پستگرسول #مهاجرت_پایگاه_داده #Oracle #MySQL
🟣لینک مقاله:
https://blog.dalibo.com/2026/09/07/postgresql-migrator-1-en.html
➖➖➖➖➖➖➖➖
👑 @Database_Academy
PostgreSQL Migrator 1.0: Migrate Oracle and MySQL to Postgres
🟢 خلاصه مقاله:
نسخه ۱.۰ مهاجرتگر پستگرسول، ابزاری قدرتمند و چندمنظوره برای انتقال پایگاههای داده اوراکل و مایاسکیوال/ماریا دیبی است. این ابزار، با عرضه یک بسته نرمافزاری واحد، فرآیند مهاجرت را بسیار سادهتر و کارآمدتر میکند. علاوه بر این، رابط کاربری وب اطلاحشده که در این نسخه ارائه شده است، امکان شناسایی سریع مشکلات و بررسی دقیق روند انتقال دادهها را فراهم میکند.
این ابزار مبتنی بر فناوریهای نوین، با استفاده از روشهای سریع کپی (COPY) قادر است حجم عظیمی از اطلاعات را در کوتاهترین زمان منتقل کند. هدف اصلی آن ارائه راه حلی یکپارچه و قابل اطمینان برای توسعهدهندگان و مدیران پایگاه داده است که میخواهند به راحتی و بدون نگرانی، سیستمهای خود را به پستگرسول مهاجرت دهند. این نسخه جدید، نقطه عطف مهمی در کاهش پیچیدگیهای انتقال دادهها و افزایش بهرهوری در مدیریت پایگاههای داده است.
#پستگرسول #مهاجرت_پایگاه_داده #Oracle #MySQL
🟣لینک مقاله:
https://blog.dalibo.com/2026/09/07/postgresql-migrator-1-en.html
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Dalibo
PostgreSQL Migrator 1.0 stable