Forwarded from AI
با کدوم نام موافق هستی برای هوش مصنوعی
Anonymous Poll
77%
🔴AI = Artificial Intelligence
27%
🔵SI = Super Intelligence
🔵 عنوان مقاله
Real-time LLM guardrails with Jev: comparing latency and cost (13 minute read)
🟢 خلاصه مقاله:
در دنیای پیشرفته هوش مصنوعی، تضمین امنیت و کنترل در لحظه اهمیت فراوانی دارد. سیستم Jev شرکت TypeSafe، با هدف فراهمسازی خطکشهای حفاظتی در زمان واقعی، از مدلی تصمیمگیری خاص و منحصربهفرد بهره میبرد که قبل از اجرای هر ورودی، پاسخ یا فراخوانی ابزار، آنها را بررسی و کنترل میکند. این رویکرد، امکان نظارت و کنترل دقیق بر فعالیتهای هوش مصنوعی را فراهم میسازد و از وقوع خطاها یا سوءاستفادههای احتمالی جلوگیری میکند.
در آزمایشهای انجامشده توسط شرکت Arize، سیستم Jev توانست همان تصمیماتی را بگیرد که نسخهی کوچک GPT-5.4 nano اتخاذ مینمود، اما با سرعتی بین ۱۵ تا ۱۸ برابر بیشتر و با هزینهای تنها ۱۲ تا ۱۴ برابر کمتر در هر درخواست. این نتایج نشان میدهد که استفاده از مدلهای خاص و بهینهسازی شده در کنار فناوریهای زمانواقعی، میتواند عملکرد سیستمهای هوش مصنوعی را به شدت بهبود بخشد و هزینههای عملیاتی را به طور چشمگیری کاهش دهد.
به طور خلاصه، Jev ترکیبی است از امنیت، سرعت و صرفهجویی اقتصادی که میتواند در توسعه و پیادهسازی هوش مصنوعی در صنایع مختلف تاثیرگذار باشد، و راهکارهای آیندهنگرانهای برای کنترل و مدیریت هوش مصنوعی ارائه دهد. این فناوری نوآورانه، به صنایع امکان میدهد ضمن حفظ امنیت، بهرهوری و هزینههای عملیاتی خود را ارتقاء دهند.
#هوش_مصنوعی #کنترل_زمان_واقعی #صرفهجویی_هزینه #امنیت_سیستم
🟣لینک مقاله:
https://arize.com/blog/llm-guardrails-jev/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Real-time LLM guardrails with Jev: comparing latency and cost (13 minute read)
🟢 خلاصه مقاله:
در دنیای پیشرفته هوش مصنوعی، تضمین امنیت و کنترل در لحظه اهمیت فراوانی دارد. سیستم Jev شرکت TypeSafe، با هدف فراهمسازی خطکشهای حفاظتی در زمان واقعی، از مدلی تصمیمگیری خاص و منحصربهفرد بهره میبرد که قبل از اجرای هر ورودی، پاسخ یا فراخوانی ابزار، آنها را بررسی و کنترل میکند. این رویکرد، امکان نظارت و کنترل دقیق بر فعالیتهای هوش مصنوعی را فراهم میسازد و از وقوع خطاها یا سوءاستفادههای احتمالی جلوگیری میکند.
در آزمایشهای انجامشده توسط شرکت Arize، سیستم Jev توانست همان تصمیماتی را بگیرد که نسخهی کوچک GPT-5.4 nano اتخاذ مینمود، اما با سرعتی بین ۱۵ تا ۱۸ برابر بیشتر و با هزینهای تنها ۱۲ تا ۱۴ برابر کمتر در هر درخواست. این نتایج نشان میدهد که استفاده از مدلهای خاص و بهینهسازی شده در کنار فناوریهای زمانواقعی، میتواند عملکرد سیستمهای هوش مصنوعی را به شدت بهبود بخشد و هزینههای عملیاتی را به طور چشمگیری کاهش دهد.
به طور خلاصه، Jev ترکیبی است از امنیت، سرعت و صرفهجویی اقتصادی که میتواند در توسعه و پیادهسازی هوش مصنوعی در صنایع مختلف تاثیرگذار باشد، و راهکارهای آیندهنگرانهای برای کنترل و مدیریت هوش مصنوعی ارائه دهد. این فناوری نوآورانه، به صنایع امکان میدهد ضمن حفظ امنیت، بهرهوری و هزینههای عملیاتی خود را ارتقاء دهند.
#هوش_مصنوعی #کنترل_زمان_واقعی #صرفهجویی_هزینه #امنیت_سیستم
🟣لینک مقاله:
https://arize.com/blog/llm-guardrails-jev/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Arize AI
Real-time LLM guardrails with Jev: comparing latency and cost
Compare Jev and GPT-5.4 nano for real-time LLM guardrails, with demo results on latency, cost, and checks on agent inputs, replies, and tool calls.
🔵 عنوان مقاله
How Concurrence governs clinical AI at a trillion-token scale with Unity Gateway (7 minute read)
🟢 خلاصه مقاله:
در جهان پیشرفتهی مراقبتهای بهداشتی، مدیریت هوش مصنوعی بالینی در مقیاس عظیم یکی از چالشهای اصلی است. شرکت Concurrence با بهرهگیری از پلتفرم قدرتمند Databricks، توانسته است هوش مصنوعی بالینی را در سطحی بینظیر مدیریت و نظارت کند. این سیستم هر سال تقریباً ۱.۲ تریلیون توکن ورودی شامل اطلاعات بیماران، وضعیت عاملهای هوشمند، نتایج آزمایشها، ارزیابیها و کنترلهای دسترسی را در بر میگیرد. ادغام این دادهها در یک بستر واحد امکان مدیریت متمرکز، تحلیل سریع و تضمین امنیت و رعایت استانداردهای مرتبط را فراهم میآورد، که در نهایت به افزایش دقت و کارایی در فرآیندهای بالینی منجر میشود.
پلتفرم Unity Gateway نقش مهمی در این سیستم ایفا میکند؛ این ابزار مرکزیت دسترسی به مدلها و ابزارهای تاییدشده هوش مصنوعی را فراهم میآورد. با استفاده از Unity Gateway، شرکت قادر است نحوه استفاده از فناوریهای هوش مصنوعی را پیگیری کرده، مطمئن شود که تمام فرآیندها مطابق با مقررات و استانداردهای اخلاقی انجام میگیرد، و در عین حال توانایی توسعه و گسترش ایمن عاملهای بالینی و کدگذاری را دارد. این رویکرد، نه تنها امنیت و انطباق را تضمین میکند بلکه امکان نوآوری و توسعه سریع در حوزه هوشمندسازی مراقبتهای بهداشتی را فراهم میسازد.
در نتیجه، Concurrence با ترکیب فناوریهای پیشرفته و استراتژیهای نظارتی قوی، مسیر را برای آیندهی هوش مصنوعی در مراقبتهای پزشکی هموار میسازد و نشان میدهد چگونه میتوان در مقیاس وسیع، همزمان با رعایت استانداردهای بالای ایمنی و کیفیت، فرآیندهای بالینی را بهبود بخشید.
#هوش_مصنوعی #مراقبتهای_سلامتی #مدیریت_پزشکی #توسعه_مبتنی_بر_داده
🟣لینک مقاله:
https://www.databricks.com/blog/how-concurrence-governs-clinical-ai-trillion-token-scale-unity-gateway?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
How Concurrence governs clinical AI at a trillion-token scale with Unity Gateway (7 minute read)
🟢 خلاصه مقاله:
در جهان پیشرفتهی مراقبتهای بهداشتی، مدیریت هوش مصنوعی بالینی در مقیاس عظیم یکی از چالشهای اصلی است. شرکت Concurrence با بهرهگیری از پلتفرم قدرتمند Databricks، توانسته است هوش مصنوعی بالینی را در سطحی بینظیر مدیریت و نظارت کند. این سیستم هر سال تقریباً ۱.۲ تریلیون توکن ورودی شامل اطلاعات بیماران، وضعیت عاملهای هوشمند، نتایج آزمایشها، ارزیابیها و کنترلهای دسترسی را در بر میگیرد. ادغام این دادهها در یک بستر واحد امکان مدیریت متمرکز، تحلیل سریع و تضمین امنیت و رعایت استانداردهای مرتبط را فراهم میآورد، که در نهایت به افزایش دقت و کارایی در فرآیندهای بالینی منجر میشود.
پلتفرم Unity Gateway نقش مهمی در این سیستم ایفا میکند؛ این ابزار مرکزیت دسترسی به مدلها و ابزارهای تاییدشده هوش مصنوعی را فراهم میآورد. با استفاده از Unity Gateway، شرکت قادر است نحوه استفاده از فناوریهای هوش مصنوعی را پیگیری کرده، مطمئن شود که تمام فرآیندها مطابق با مقررات و استانداردهای اخلاقی انجام میگیرد، و در عین حال توانایی توسعه و گسترش ایمن عاملهای بالینی و کدگذاری را دارد. این رویکرد، نه تنها امنیت و انطباق را تضمین میکند بلکه امکان نوآوری و توسعه سریع در حوزه هوشمندسازی مراقبتهای بهداشتی را فراهم میسازد.
در نتیجه، Concurrence با ترکیب فناوریهای پیشرفته و استراتژیهای نظارتی قوی، مسیر را برای آیندهی هوش مصنوعی در مراقبتهای پزشکی هموار میسازد و نشان میدهد چگونه میتوان در مقیاس وسیع، همزمان با رعایت استانداردهای بالای ایمنی و کیفیت، فرآیندهای بالینی را بهبود بخشید.
#هوش_مصنوعی #مراقبتهای_سلامتی #مدیریت_پزشکی #توسعه_مبتنی_بر_داده
🟣لینک مقاله:
https://www.databricks.com/blog/how-concurrence-governs-clinical-ai-trillion-token-scale-unity-gateway?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
🔵 عنوان مقاله
Benchmarks are more broken than we could have imagined (15 minute read)
🟢 خلاصه مقاله:
در دنیای هوش مصنوعی، معیارها و بنچمارکها نقش مهمی در سنجش و ارزیابی پیشرفتهای فناوری دارند. ولی بر اساس تحقیقات اخیر، این معیارها بیشتر از آنچه تصور میکردیم، ناپایدار و مشکلدار شدهاند. تیم بررسیکننده horizon با بررسی بیش از ۵۰۰۰ وظیفه بنچمارک در ۲۰ مجموعه داده مختلف، مشخص کردند که ۲۹ مورد از این بنچمارکها با مشکلات جدی روبهرو هستند. این مشکلات شامل نشت پاسخها، آزمایشهای ناتمام، graders قابل فریب و راهحلهای مرجع ناقص بودند. این خطاها نه تنها ارزشیابیهای نادرستی ایجاد میکنند، بلکه در برخی موارد باعث بالا رفتن نمرات مدلها شده و در نتیجه تصویر نادرستی از تواناییهای واقعی آنها به دست میدهند. چنین یافتههایی نشان میدهد که نتایج بنچمارکها در صورت وجود این نواقص، ممکن است اغراقی و گمراهکننده باشند؛ زیرا زیرساختهای اصلی ارزیابیها قابل اعتماد نبوده و میتواند تواناییهای واقعی مدلها را نادرست نشان دهند.
در نتیجه، این کاستیها اهمیت بازنگری و اصلاح سیستمهای ارزیابی در حوزه هوش مصنوعی را بیش از پیش روشن میکند، تا بتوان تصویر واقعیتری از پیشرفتهای فناوری در اختیار داشت و مسیر توسعه مدلهای هوشمند را بهتر هدایت کرد.
#هوش_مصنوعی #بنچمارک #ارزیابی_مدل #پیشرفت_هوش
🟣لینک مقاله:
https://www.horizonanalyticslabs.com/research/public-benchmark-dataset-audit?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Benchmarks are more broken than we could have imagined (15 minute read)
🟢 خلاصه مقاله:
در دنیای هوش مصنوعی، معیارها و بنچمارکها نقش مهمی در سنجش و ارزیابی پیشرفتهای فناوری دارند. ولی بر اساس تحقیقات اخیر، این معیارها بیشتر از آنچه تصور میکردیم، ناپایدار و مشکلدار شدهاند. تیم بررسیکننده horizon با بررسی بیش از ۵۰۰۰ وظیفه بنچمارک در ۲۰ مجموعه داده مختلف، مشخص کردند که ۲۹ مورد از این بنچمارکها با مشکلات جدی روبهرو هستند. این مشکلات شامل نشت پاسخها، آزمایشهای ناتمام، graders قابل فریب و راهحلهای مرجع ناقص بودند. این خطاها نه تنها ارزشیابیهای نادرستی ایجاد میکنند، بلکه در برخی موارد باعث بالا رفتن نمرات مدلها شده و در نتیجه تصویر نادرستی از تواناییهای واقعی آنها به دست میدهند. چنین یافتههایی نشان میدهد که نتایج بنچمارکها در صورت وجود این نواقص، ممکن است اغراقی و گمراهکننده باشند؛ زیرا زیرساختهای اصلی ارزیابیها قابل اعتماد نبوده و میتواند تواناییهای واقعی مدلها را نادرست نشان دهند.
در نتیجه، این کاستیها اهمیت بازنگری و اصلاح سیستمهای ارزیابی در حوزه هوش مصنوعی را بیش از پیش روشن میکند، تا بتوان تصویر واقعیتری از پیشرفتهای فناوری در اختیار داشت و مسیر توسعه مدلهای هوشمند را بهتر هدایت کرد.
#هوش_مصنوعی #بنچمارک #ارزیابی_مدل #پیشرفت_هوش
🟣لینک مقاله:
https://www.horizonanalyticslabs.com/research/public-benchmark-dataset-audit?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Horizonanalyticslabs
Benchmarks are more broken than we could have imagined.
We audited public AI benchmark datasets from well-known vendors and found leaked answers, incomplete tests, gameable graders, and tasks their own solutions could not pass.
🔵 عنوان مقاله
pgBackRest Compression: How Much CPU is a Smaller Backup Worth?
🟢 خلاصه مقاله:
در دنیای مدیریت پشتیبانگیریهای پایگاه داده، فشردهسازی دادهها نقش مهمی در کاهش حجم و صرفهجویی در فضای ذخیرهسازی دارد. در این راستا، ابزار pgBackRest یکی از محبوبترین راهکارها است که از الگوریتمهای مختلف فشردهسازی بهره میبرد. اما سوال این است که چه میزان مصرف CPU برای اجرای این عملیات لازم است و آیا افزایش مصرف CPU در نهایت منجر به کاهش قابل توجه حجم پشتیبان میشود؟ در این مطالعه، به بررسی سطحهای مختلف فشردهسازی در pgBackRest و میزان سودمندی هر کدام میپردازیم تا تعیین کنیم کجای این فرآیند، دیگر صرف CPU ارزش ندارد و نرخ کاهش حجم دادهها به حداقل میرسد.
در این ارزیابی، آزمایشهای متعددی بر روی الگوریتمهای گوناگون انجام شد تا بهترین تعادل بین مصرف CPU و کاهش حجم پشتیبان پیدا شود. نتایج نشان میدهد که در اکثر موارد، استفاده از الگوریتم «Zstandard» در سطوح پایینترین گزینهها، بهترین نتیجه را ارائه میدهد؛ یعنی، این الگوریتم در سطح پایین، کمترین مصرف CPU را دارد و در عین حال، بهرهوری قابل قبولی در کاهش حجم دادهها نشان میدهد. این کشف، برای مدیران پایگاه داده بسیار حیاتی است، زیرا نشان میدهد نیازی نیست برای کسب کاهش حجم بیشتر، صرف منابع بیشتری کرد؛ چراکه سود حاصل در سطحهای کمتر، بیشتر است.
در نهایت، این مطالعه چراغ راهی است برای تصمیمگیری هوشمندانه در تنظیمات پشتیبانگیری، تا پیش از صرف هزینههای بیمورد در مصرف CPU، بهترین کاهش حجم دادهها حاصل شود و سیستمهای پایگاه داده بهینهتر و کارآمدتر عمل کنند. نتیجهگیری کلیدی این است که در مورد pgBackRest، «زماستند در سطح کم، نقطه عطف استراتژیک است»، که میتواند بهرهوری سیستم پشتیبانگیری شما را به طور چشمگیری بهبود بخشد.
#پشتیبان_گیری #مدیریت_کایفا_پایگاه_داده #فشردهسازی #زماستند
🟣لینک مقاله:
https://www.percona.com/blog/pgbackrest-compression-how-much-cpu-is-a-smaller-backup-worth/
➖➖➖➖➖➖➖➖
👑 @Database_Academy
pgBackRest Compression: How Much CPU is a Smaller Backup Worth?
🟢 خلاصه مقاله:
در دنیای مدیریت پشتیبانگیریهای پایگاه داده، فشردهسازی دادهها نقش مهمی در کاهش حجم و صرفهجویی در فضای ذخیرهسازی دارد. در این راستا، ابزار pgBackRest یکی از محبوبترین راهکارها است که از الگوریتمهای مختلف فشردهسازی بهره میبرد. اما سوال این است که چه میزان مصرف CPU برای اجرای این عملیات لازم است و آیا افزایش مصرف CPU در نهایت منجر به کاهش قابل توجه حجم پشتیبان میشود؟ در این مطالعه، به بررسی سطحهای مختلف فشردهسازی در pgBackRest و میزان سودمندی هر کدام میپردازیم تا تعیین کنیم کجای این فرآیند، دیگر صرف CPU ارزش ندارد و نرخ کاهش حجم دادهها به حداقل میرسد.
در این ارزیابی، آزمایشهای متعددی بر روی الگوریتمهای گوناگون انجام شد تا بهترین تعادل بین مصرف CPU و کاهش حجم پشتیبان پیدا شود. نتایج نشان میدهد که در اکثر موارد، استفاده از الگوریتم «Zstandard» در سطوح پایینترین گزینهها، بهترین نتیجه را ارائه میدهد؛ یعنی، این الگوریتم در سطح پایین، کمترین مصرف CPU را دارد و در عین حال، بهرهوری قابل قبولی در کاهش حجم دادهها نشان میدهد. این کشف، برای مدیران پایگاه داده بسیار حیاتی است، زیرا نشان میدهد نیازی نیست برای کسب کاهش حجم بیشتر، صرف منابع بیشتری کرد؛ چراکه سود حاصل در سطحهای کمتر، بیشتر است.
در نهایت، این مطالعه چراغ راهی است برای تصمیمگیری هوشمندانه در تنظیمات پشتیبانگیری، تا پیش از صرف هزینههای بیمورد در مصرف CPU، بهترین کاهش حجم دادهها حاصل شود و سیستمهای پایگاه داده بهینهتر و کارآمدتر عمل کنند. نتیجهگیری کلیدی این است که در مورد pgBackRest، «زماستند در سطح کم، نقطه عطف استراتژیک است»، که میتواند بهرهوری سیستم پشتیبانگیری شما را به طور چشمگیری بهبود بخشد.
#پشتیبان_گیری #مدیریت_کایفا_پایگاه_داده #فشردهسازی #زماستند
🟣لینک مقاله:
https://www.percona.com/blog/pgbackrest-compression-how-much-cpu-is-a-smaller-backup-worth/
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Percona
pgBackRest Compression: How Much CPU Is a Smaller Backup Worth?
In this blog post, we’ll compare pgBackRest’s compression algorithms and levels to find where spending more CPU stops buying a meaningfully smaller backup. The short version of the answer, which we’ll build up to with real numbers, is that Zstandard at a…
🔵 عنوان مقاله
High-Throughput OLTP in Three Simple Steps (6 minute read)
🟢 خلاصه مقاله:
در سیستمهای تراکنش با حجم بالا، رویکرد همطراحی (co-design) به جای تقلید الگوهای معمول مانند استفاده از استخر ارتباطات (connection pool) از پایگاهدادههای چند منظوره، اهمیت فراوانی دارد. ابزارهای مدرن مانند TigerBeetle بر پایه مفهوم مدلسازی انتقالهای متصل و همزمان کار میکنند، به گونهای که انتقالهای مرتبط به صورت اتمی ثبت میشوند. این سیستم به جای پردازشهای تکراری و زمانبر، به جمعآوری موجودیها بدون نیاز به اسکنهای مکرر کمک میکند، عملیاتها را به صورت گروهی و بهطور خودکار در حین درخواستهایی که در جریان است، دستهبندی میکند و فرآیند تشخیص یکنواختی و جلوگیری از تکرار را با شناسههای زمانمرتب شده تسریع میکند.
این رویکردهای پیشرفته در طراحی، نقش مهمی در بهبود کارایی و سرعت سیستمهای تراکنش با حجم بالا دارند. بر اساس نتایج benchmarkهای انجامشده، مشخص شده است که استفاده از دستهبندی عملیات و شناسههای زمانمرتب میتواند بیشتر از افزودن مشتریان جدید، تأثیر گذار باشد. این نکات نشان میدهد که بهینهسازی ساختار و نظم دادهها در سیستمهای تراکنش، کلید دستیابی به عملکرد بهتر و پاسخگویی سریعتر است و میتواند راهکاری مؤثر برای مدیریت حجم عظیم درخواستها باشد.
#سیستم_تراکنش #بهینهسازی_پایگاهداده #مدیریت_حجم_بالا #عملکرد_بهتر
🟣لینک مقاله:
https://tigerbeetle.com/blog/2026-09-17-performant-use-of-tigerbeetle?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
High-Throughput OLTP in Three Simple Steps (6 minute read)
🟢 خلاصه مقاله:
در سیستمهای تراکنش با حجم بالا، رویکرد همطراحی (co-design) به جای تقلید الگوهای معمول مانند استفاده از استخر ارتباطات (connection pool) از پایگاهدادههای چند منظوره، اهمیت فراوانی دارد. ابزارهای مدرن مانند TigerBeetle بر پایه مفهوم مدلسازی انتقالهای متصل و همزمان کار میکنند، به گونهای که انتقالهای مرتبط به صورت اتمی ثبت میشوند. این سیستم به جای پردازشهای تکراری و زمانبر، به جمعآوری موجودیها بدون نیاز به اسکنهای مکرر کمک میکند، عملیاتها را به صورت گروهی و بهطور خودکار در حین درخواستهایی که در جریان است، دستهبندی میکند و فرآیند تشخیص یکنواختی و جلوگیری از تکرار را با شناسههای زمانمرتب شده تسریع میکند.
این رویکردهای پیشرفته در طراحی، نقش مهمی در بهبود کارایی و سرعت سیستمهای تراکنش با حجم بالا دارند. بر اساس نتایج benchmarkهای انجامشده، مشخص شده است که استفاده از دستهبندی عملیات و شناسههای زمانمرتب میتواند بیشتر از افزودن مشتریان جدید، تأثیر گذار باشد. این نکات نشان میدهد که بهینهسازی ساختار و نظم دادهها در سیستمهای تراکنش، کلید دستیابی به عملکرد بهتر و پاسخگویی سریعتر است و میتواند راهکاری مؤثر برای مدیریت حجم عظیم درخواستها باشد.
#سیستم_تراکنش #بهینهسازی_پایگاهداده #مدیریت_حجم_بالا #عملکرد_بهتر
🟣لینک مقاله:
https://tigerbeetle.com/blog/2026-09-17-performant-use-of-tigerbeetle?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Tigerbeetle
High-Throughput OLTP in Three Simple Steps
TigerBeetle is a transaction-processing database. Its double-entry accounting primitives are simple and powerful: they can represent the movement or exchange of any quantity, including financial transactions such as real-time payments, billing, or credits…
❤1
🔵 عنوان مقاله
Introducing prompt_jev(): bringing Jev to MotherDuck SQL (5 minute read)
🟢 خلاصه مقاله:
شرکت MotherDuck به تازگی از یک ویژگی جدید به نام prompt_jev رونمایی کرده است که امکان استفاده از فناوری Jev را مستقیماً در محیط SQL فراهم میکند. این ابزار به کاربران اجازه میدهد متنها را در مقیاس تحلیل و دستهبندی کنند و امتیازدهی انجام دهند، بدون نیاز به آموزش مدلهای پیچیده یا تفسیر پاسخهای مدلهای زبانی بزرگ (LLM). در آزمایشهای استاندارد خود با ۱۰۰ هزار ردیف داده، Jev توانست با دقت ۸۹ درصد در عرض تنها ۴۰ ثانیه و با هزینه حدود ۵۰۰ سنت، نتایج قابل توجهی ارائه دهد. این فناوری نه تنها از لحاظ سرعت بالاتر از مدلهای زبانی مختلف قرار دارد، بلکه از نظر هزینه و دقت نیز برتر است و میتواند راهکاری مقرونبهصرفه و کارآمد برای تحلیل دادههای بزرگ باشد، چیزی که در دنیای امروز بسیار مورد نیاز است.
در نتیجه، این نوآوری، فرصتهای جدیدی برای کسبوکارها و تحلیلگران فراهم میآورد تا بتوانند در عرض چند ثانیه اطلاعات مهم را استخراج کنند و تصمیمگیریهای سریعتر و هوشمندانهتری داشته باشند. با این قابلیت، سطح جدیدی از بهرهوری در تحلیل دادهها و بهرهبرداری از فناوریهای نوین در دنیای دادهها رقم میخورد که بدون نیاز به تخصص عمیق در مدلسازی، میتواند برتری قابل توجهی در رقابتهای تجاری ایجاد کند.
#تحلیل_داده #هوش_مصنوعی #مدلسازی #پیشرفت_تکنولوژی
🟣لینک مقاله:
https://motherduck.com/blog/motherduck-supports-jev/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Introducing prompt_jev(): bringing Jev to MotherDuck SQL (5 minute read)
🟢 خلاصه مقاله:
شرکت MotherDuck به تازگی از یک ویژگی جدید به نام prompt_jev رونمایی کرده است که امکان استفاده از فناوری Jev را مستقیماً در محیط SQL فراهم میکند. این ابزار به کاربران اجازه میدهد متنها را در مقیاس تحلیل و دستهبندی کنند و امتیازدهی انجام دهند، بدون نیاز به آموزش مدلهای پیچیده یا تفسیر پاسخهای مدلهای زبانی بزرگ (LLM). در آزمایشهای استاندارد خود با ۱۰۰ هزار ردیف داده، Jev توانست با دقت ۸۹ درصد در عرض تنها ۴۰ ثانیه و با هزینه حدود ۵۰۰ سنت، نتایج قابل توجهی ارائه دهد. این فناوری نه تنها از لحاظ سرعت بالاتر از مدلهای زبانی مختلف قرار دارد، بلکه از نظر هزینه و دقت نیز برتر است و میتواند راهکاری مقرونبهصرفه و کارآمد برای تحلیل دادههای بزرگ باشد، چیزی که در دنیای امروز بسیار مورد نیاز است.
در نتیجه، این نوآوری، فرصتهای جدیدی برای کسبوکارها و تحلیلگران فراهم میآورد تا بتوانند در عرض چند ثانیه اطلاعات مهم را استخراج کنند و تصمیمگیریهای سریعتر و هوشمندانهتری داشته باشند. با این قابلیت، سطح جدیدی از بهرهوری در تحلیل دادهها و بهرهبرداری از فناوریهای نوین در دنیای دادهها رقم میخورد که بدون نیاز به تخصص عمیق در مدلسازی، میتواند برتری قابل توجهی در رقابتهای تجاری ایجاد کند.
#تحلیل_داده #هوش_مصنوعی #مدلسازی #پیشرفت_تکنولوژی
🟣لینک مقاله:
https://motherduck.com/blog/motherduck-supports-jev/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
MotherDuck
prompt_jev(): Text Classification in SQL, 50x Faster at 1% the Cost | MotherDuck
Classify text in SQL with prompt_jev(), powered by TypeSafe's Jev. 100,000 rows labeled in 40 seconds for $0.50 at frontier-LLM accuracy. Live on paid plans.
🔵 عنوان مقاله
We ported the original Doom to SQL (25 minute read)
🟢 خلاصه مقاله:
در این مقاله، تیم CedarDB موفق شد نسخه اصلی بازی Doom را تقریباً به طور کامل به زبان SQL پورت کند. این پروژه شامل انتقال منطق گیمپلی و سیستم رندرینگ بازی است که در نتیجه، بازی در حلقه اصلی خود با سرعت ۳۵ هرتز اجرا میشد و بخش رندرینگ آن تا حداکثر ۶۰ فریم بر ثانیه به نمایش درمیآمد. این آزمایش نشان میدهد که منطق زمانبر و نسبتاً پیچیده در لحظه، با مدل مبتنی بر مجموعههای SQL تا حد قابل توجهی قابل اجرا است، در حالی که امکانات پایگاه دادههایی مانند تراکنشها، کنترل دسترسی و حالتهای مشترک، اجرای بازی چندنفره را بسیار طبیعی و همسطح میکند.
تلاش تیم CedarDB نشان میدهد که فناوریهای پایگاه داده حتی در حوزههایی مانند بازیهای با زمانگذاری حساس و نیازمند پردازش سریع، قابلیتهای قابل توجهی دارند. این نوآوری به توسعهدهندگان کمک میکند تا با بهرهگیری از مزایای SQL، تجربههای نوآورانه و کارآمدتری در توسعه بازیهای چندنفره و سیستمهای تعاملی پیشرفته ایجاد کنند.
#بازی #توسعه_نرم_افزار #پایگاه_داده #توسعه_بازی
🟣لینک مقاله:
https://cedardb.com/blog/sqldoom/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
We ported the original Doom to SQL (25 minute read)
🟢 خلاصه مقاله:
در این مقاله، تیم CedarDB موفق شد نسخه اصلی بازی Doom را تقریباً به طور کامل به زبان SQL پورت کند. این پروژه شامل انتقال منطق گیمپلی و سیستم رندرینگ بازی است که در نتیجه، بازی در حلقه اصلی خود با سرعت ۳۵ هرتز اجرا میشد و بخش رندرینگ آن تا حداکثر ۶۰ فریم بر ثانیه به نمایش درمیآمد. این آزمایش نشان میدهد که منطق زمانبر و نسبتاً پیچیده در لحظه، با مدل مبتنی بر مجموعههای SQL تا حد قابل توجهی قابل اجرا است، در حالی که امکانات پایگاه دادههایی مانند تراکنشها، کنترل دسترسی و حالتهای مشترک، اجرای بازی چندنفره را بسیار طبیعی و همسطح میکند.
تلاش تیم CedarDB نشان میدهد که فناوریهای پایگاه داده حتی در حوزههایی مانند بازیهای با زمانگذاری حساس و نیازمند پردازش سریع، قابلیتهای قابل توجهی دارند. این نوآوری به توسعهدهندگان کمک میکند تا با بهرهگیری از مزایای SQL، تجربههای نوآورانه و کارآمدتری در توسعه بازیهای چندنفره و سیستمهای تعاملی پیشرفته ایجاد کنند.
#بازی #توسعه_نرم_افزار #پایگاه_داده #توسعه_بازی
🟣لینک مقاله:
https://cedardb.com/blog/sqldoom/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Cedardb
We ported the original Doom to SQL
CedarDB is a database system that delivers unmatched performance for transactions and analytics, from small writes to handling billions of rows. Built on cutting-edge research to power today’s tools and tomorrow’s challenges.
❤1
🔵 عنوان مقاله
pgColumnar 1.0 Alpha 4: A Columnar Table Access Method
🟢 خلاصه مقاله:
روش دسترسی به جداول ستونی pgColumnar 1.0 Alpha 4: یک روش جدید برای دسترسی به دادهها در جداول ستونی است که در پایگاه داده پستگرس توسعه یافته است. این امکان، نوعی فضای ذخیرهسازی ستونی را در اختیار کاربران قرار میدهد که نقش مهمی در بهبود کارایی و سرعت عملیاتهای مختلف دارد. نسخه آزمایشی (آلفا) این ابزار، قابلیتهای جدیدی ارائه میدهد که میتواند روند پردازش دادههای بزرگ را بسیار بهبود بخشد.
در این نسخه، یکی از ویژگیهای برجسته، استفاده از مسیر منحنی هیلبرت برای قرار دادن دادهها در فضا است. این فناوری کمک میکند که دادهها به صورت منظمی در صفحات ذخیره شوند که منجر به افزایش بهرهوری در عملیاتهای فیلترینگ و خواندن دادهها میشود. به طور خاص، این روش باعث کاهش تعداد گروههای ردیف مورد نیاز برای خواندن در عملیاتهای محدودهای میشود، به طوری که تا دو برابر کمتر نسبت به روش Z-order، دادهها بازخوانی میشوند و در نتیجه سرعت کلی عملیات افزایش مییابد.
در مجموع، pgColumnar 1.0 Alpha 4 یک ابزار قدرتمند است که توسعهدهندگان پایگاه داده را قادر میسازد تا دادهها را به صورت موثرتری مدیریت و تجزیه و تحلیل کنند. این فناوری نوآورانه، چشماندازهای جدیدی را در زمینه ساختارهای دادهای و بهینهسازی عملیاتهای پیچیده ارائه میدهد، و میتواند نقش مهمی در توسعه سیستمهای پردازش دادههای بزرگ ایفا کند.
#پستگرس #دیتابیس #ذخیرهسازی_ستونی #بهینهسازی
🟣لینک مقاله:
https://www.commandprompt.com/blog/pgcolumnar-10-alpha4-released/
➖➖➖➖➖➖➖➖
👑 @Database_Academy
pgColumnar 1.0 Alpha 4: A Columnar Table Access Method
🟢 خلاصه مقاله:
روش دسترسی به جداول ستونی pgColumnar 1.0 Alpha 4: یک روش جدید برای دسترسی به دادهها در جداول ستونی است که در پایگاه داده پستگرس توسعه یافته است. این امکان، نوعی فضای ذخیرهسازی ستونی را در اختیار کاربران قرار میدهد که نقش مهمی در بهبود کارایی و سرعت عملیاتهای مختلف دارد. نسخه آزمایشی (آلفا) این ابزار، قابلیتهای جدیدی ارائه میدهد که میتواند روند پردازش دادههای بزرگ را بسیار بهبود بخشد.
در این نسخه، یکی از ویژگیهای برجسته، استفاده از مسیر منحنی هیلبرت برای قرار دادن دادهها در فضا است. این فناوری کمک میکند که دادهها به صورت منظمی در صفحات ذخیره شوند که منجر به افزایش بهرهوری در عملیاتهای فیلترینگ و خواندن دادهها میشود. به طور خاص، این روش باعث کاهش تعداد گروههای ردیف مورد نیاز برای خواندن در عملیاتهای محدودهای میشود، به طوری که تا دو برابر کمتر نسبت به روش Z-order، دادهها بازخوانی میشوند و در نتیجه سرعت کلی عملیات افزایش مییابد.
در مجموع، pgColumnar 1.0 Alpha 4 یک ابزار قدرتمند است که توسعهدهندگان پایگاه داده را قادر میسازد تا دادهها را به صورت موثرتری مدیریت و تجزیه و تحلیل کنند. این فناوری نوآورانه، چشماندازهای جدیدی را در زمینه ساختارهای دادهای و بهینهسازی عملیاتهای پیچیده ارائه میدهد، و میتواند نقش مهمی در توسعه سیستمهای پردازش دادههای بزرگ ایفا کند.
#پستگرس #دیتابیس #ذخیرهسازی_ستونی #بهینهسازی
🟣لینک مقاله:
https://www.commandprompt.com/blog/pgcolumnar-10-alpha4-released/
➖➖➖➖➖➖➖➖
👑 @Database_Academy
CommandPrompt Inc.
PgColumnar: The Postgres Analytics engine
pgColumnar is a columnar storage table access method for PostgreSQL, written as a clean-room, MIT-licensed implementation. It reads and writes its own native format, PGCN v1, and supports chunk-group skipping from zone maps, bloom filters and star-schema…
🔵 عنوان مقاله
Earn your Master of Translational Data Analytics online from The Ohio State University. (Sponsor)
🟢 خلاصه مقاله:
در دنیای امروز، تحلیل دادههای کاربردی نقش حیاتی در تصمیمگیریهای استراتژیک دارد. دانشگاه اوهایو با ارائه برنامهی آنلاین «کارشناسی ارشد در تجزیه و تحلیل دادههای ترانسلی»، فرصتی منحصربهفرد برای علاقهمندان فراهم کرده است تا در این حوزه به تخصص برسند. این برنامهی چندرشتهای، مهارتهایی مانند یادگیری ماشین، تجربه کاربری، تصویرسازی داده و تفکر طراحی را در کنار یکدیگر جمع آورده است تا دانشآموختگان بتوانند دادهها را به صورت مؤثر تفسیر و به دیگران منتقل کنند.
این دوره آموزشی به طور ویژه بر آموزش نحوهی داستانسرایی با دادهها تمرکز دارد، بهطوری که شرکتکنندگان قادر خواهند بود یافتههای خود را به شکل روایتهای جذاب و قابل فهم برای عموم ارائه دهند. با فراگیری این مهارتها، افراد نه تنها میتوانند دادهها را تحلیل کنند، بلکه پیامهای مهم را به شیوهای قانعکننده و قابل درک برای تصمیمگیرندگان و مخاطبان گستردهتر منتقل نمایند. این برنامه، بهترین فرصت برای کسانی است که میخواهند در حوزه تحلیل دادهها توانمندسازی شده و راهکارهای نوآورانه ارائه دهند.
همین حالا فرصت را از دست ندهید و در برنامهی آنلاین کارشناسی ارشد در تحلیل دادههای ترانسلی شرکت کنید تا مسیر حرفهای خود را به سمت موفقیت هموار سازید.
#تحلیل_داده #یادگیری_ماشین #داستانسرایی_با_داده #آموزش_آنلاین
🟣لینک مقاله:
https://online.osu.edu/masters-degree/master-data-analytics/?lead_source=Response-Solutions&utm_campaign=oaa_oso_tda-student-recruitment_fy27_tldr&channel=Other-Paid&utm_source=3rd-Party-Display&utm_medium=ENewsletter&sp=cMJq3vO_CoP6pShNBTnQzrgF
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Earn your Master of Translational Data Analytics online from The Ohio State University. (Sponsor)
🟢 خلاصه مقاله:
در دنیای امروز، تحلیل دادههای کاربردی نقش حیاتی در تصمیمگیریهای استراتژیک دارد. دانشگاه اوهایو با ارائه برنامهی آنلاین «کارشناسی ارشد در تجزیه و تحلیل دادههای ترانسلی»، فرصتی منحصربهفرد برای علاقهمندان فراهم کرده است تا در این حوزه به تخصص برسند. این برنامهی چندرشتهای، مهارتهایی مانند یادگیری ماشین، تجربه کاربری، تصویرسازی داده و تفکر طراحی را در کنار یکدیگر جمع آورده است تا دانشآموختگان بتوانند دادهها را به صورت مؤثر تفسیر و به دیگران منتقل کنند.
این دوره آموزشی به طور ویژه بر آموزش نحوهی داستانسرایی با دادهها تمرکز دارد، بهطوری که شرکتکنندگان قادر خواهند بود یافتههای خود را به شکل روایتهای جذاب و قابل فهم برای عموم ارائه دهند. با فراگیری این مهارتها، افراد نه تنها میتوانند دادهها را تحلیل کنند، بلکه پیامهای مهم را به شیوهای قانعکننده و قابل درک برای تصمیمگیرندگان و مخاطبان گستردهتر منتقل نمایند. این برنامه، بهترین فرصت برای کسانی است که میخواهند در حوزه تحلیل دادهها توانمندسازی شده و راهکارهای نوآورانه ارائه دهند.
همین حالا فرصت را از دست ندهید و در برنامهی آنلاین کارشناسی ارشد در تحلیل دادههای ترانسلی شرکت کنید تا مسیر حرفهای خود را به سمت موفقیت هموار سازید.
#تحلیل_داده #یادگیری_ماشین #داستانسرایی_با_داده #آموزش_آنلاین
🟣لینک مقاله:
https://online.osu.edu/masters-degree/master-data-analytics/?lead_source=Response-Solutions&utm_campaign=oaa_oso_tda-student-recruitment_fy27_tldr&channel=Other-Paid&utm_source=3rd-Party-Display&utm_medium=ENewsletter&sp=cMJq3vO_CoP6pShNBTnQzrgF
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Ohio State Online
Master of Translational Data Analytics
Start using data to tell your story with a Master of Translational Data Analytics online from The Ohio State University.
🔵 عنوان مقاله
When Deleting Old Rows Costs More Than the Work
🟢 خلاصه مقاله:
حذف سطرهای قدیمی گاهی هزینهبرتر از انجام خود عملیات نوشتن است. این موضوع مخصوصا در جدولهای بزرگ نمونهبارز است، جایی که حذف دستهای دادهها میتواند هزینههای زیادی به همراه داشته باشد، بهگونهای که هزینه انجام آن بیشتر از نگارشهای جدید بر روی دادهها میشود. این مقاله درسهایی را برای مدیرانی که با جداول بزرگ سر و کار دارند، ارائه میدهد تا بتوانند از چنین مشکلاتی پیشگیری کنند.
تیم مهندسان شرکت DBOS چند راهکار مؤثر برای حل این مشکل پیشنهاد دادهاند. یکی از این راهکارها جایگزینی حذفهای زنجیرهای یا Cascade با حذفهای دستهای و کنترلشده است، که این کار باعث کاهش فشار بر سرور و صرفهجویی در زمان میشود. علاوه بر این، اجرای منظم عملیات Vacuum به صورت دستی، به بهبود کارایی پایگاه داده کمک میکند و از تجمع دادههای قدیمی و فضاهای خالی غیرضروری جلوگیری میکند، در نتیجه عملکرد سیستم بهتر و پایدارتر میشود.
در نتیجه، در مدیریت دادههای بزرگ، باید با آگاهی و برنامهریزی مناسب، هزینههای مرتبط با عملیات حذف را به حداقل رساند و از بروز مشکلات عملیاتی جلوگیری کرد. استفاده از تکنیکهای بهینه و انجام نگهداریهای منظم، کلید موفقیت در نگهداری پایگاههای داده حجیم است تا سیستم همواره با کارایی بالا عمل کند.
#پایگاه_داده #مدیریت_داده #بهینهسازی #تکنیکهای_کاربردی
🟣لینک مقاله:
https://www.dbos.dev/blog/scaling-deletions-in-postgres
➖➖➖➖➖➖➖➖
👑 @Database_Academy
When Deleting Old Rows Costs More Than the Work
🟢 خلاصه مقاله:
حذف سطرهای قدیمی گاهی هزینهبرتر از انجام خود عملیات نوشتن است. این موضوع مخصوصا در جدولهای بزرگ نمونهبارز است، جایی که حذف دستهای دادهها میتواند هزینههای زیادی به همراه داشته باشد، بهگونهای که هزینه انجام آن بیشتر از نگارشهای جدید بر روی دادهها میشود. این مقاله درسهایی را برای مدیرانی که با جداول بزرگ سر و کار دارند، ارائه میدهد تا بتوانند از چنین مشکلاتی پیشگیری کنند.
تیم مهندسان شرکت DBOS چند راهکار مؤثر برای حل این مشکل پیشنهاد دادهاند. یکی از این راهکارها جایگزینی حذفهای زنجیرهای یا Cascade با حذفهای دستهای و کنترلشده است، که این کار باعث کاهش فشار بر سرور و صرفهجویی در زمان میشود. علاوه بر این، اجرای منظم عملیات Vacuum به صورت دستی، به بهبود کارایی پایگاه داده کمک میکند و از تجمع دادههای قدیمی و فضاهای خالی غیرضروری جلوگیری میکند، در نتیجه عملکرد سیستم بهتر و پایدارتر میشود.
در نتیجه، در مدیریت دادههای بزرگ، باید با آگاهی و برنامهریزی مناسب، هزینههای مرتبط با عملیات حذف را به حداقل رساند و از بروز مشکلات عملیاتی جلوگیری کرد. استفاده از تکنیکهای بهینه و انجام نگهداریهای منظم، کلید موفقیت در نگهداری پایگاههای داده حجیم است تا سیستم همواره با کارایی بالا عمل کند.
#پایگاه_داده #مدیریت_داده #بهینهسازی #تکنیکهای_کاربردی
🟣لینک مقاله:
https://www.dbos.dev/blog/scaling-deletions-in-postgres
➖➖➖➖➖➖➖➖
👑 @Database_Academy
www.dbos.dev
Taking Out The Garbage In Postgres | DBOS
A detailed explanation of Postgres deletions and how to avoid poor deletion and garbage collection performance.
🔵 عنوان مقاله
Host- and Domain-Level Web Graphs July, August, and September 2026 (3 minute read)
🟢 خلاصه مقاله:
در سه ماه سوم سال ۲۰۲۶، شرکت Common Crawl مجموعهای از نمودارهای شبکه وب را منتشر کرد که اطلاعات گستردهای را درباره میزبانها و دامنههای اینترنت ارائه میدهد. این دادهها شامل جزئیات مربوط به بیش از ۲۴۵ میلیون میزبان (Host) و حدود ۱۳۳ میلیون دامنه (Domain) است که نشاندهنده ابعاد وسیع و تنوع بالای ساختار شبکه وب جهانی است. این نمودارها در قالبهایی ارائه شدهاند که به محققان و توسعهدهندگان امکان میدهد تحلیلهای عمیقی درباره ساختار و ارتباطات در فضای اینترنت انجام دهند و بدین ترتیب پژوهشهای مرتبط با فناوری، سئو، امنیت و تحلیل شبکههای پیچیده اینترنتی توسعه یابد.
در این مجموعه، دادهها در قالبهای سطح میزبان (Host-Level) و سطح دامنه (Domain-Level) سازماندهی شدهاند، که هر کدام بر جنبههای مختلف ساختار اینترنت تمرکز دارند. نمودارهای سطح میزبان، ارتباطات و تعاملات میان سرورهای مختلف را نشان میدهند، در حالی که نمودارهای سطح دامنه به روابط و زیرمجموعههای دامنههای اصلی میپردازند. این دستهبندی به پژوهشگران کمک میکند تا به تفکیک بیشتری در تحلیلهای خود برسند و نقش هر بخش در شبکه جهانی را بهتر درک کنند.
این منابع ارزشمند برای محققان، توسعهدهندگان و سازمانهایی که قصد تحلیل و درک عمیقتری از ساختار وب جهانی دارند، بسیار مفید هستند. در واقع، انتشار چنین دادههایی نویدبخش تحقیقات پیشرفته در زمینههای مختلف مانند امنیت سایبری، بهینهسازی موتورهای جستجو، و تحلیل رفتار کاربر است. این اطلاعات، با توجه به حجم و دقت بالایشان، ابزارهای قدرتمندی برای توسعه فناوریهای نوین در فضای دیجیتال فراهم میآورند و به پیشرفت فعالیتهای علمی و فنی در سطح جهانی کمک میکنند.
#وب_پژوهی #ساختار_وب #تحلیل_شبکه #دیتای_باز
🟣لینک مقاله:
https://commoncrawl.org/blog/host--and-domain-level-web-graphs-july-august-and-september-2026?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Host- and Domain-Level Web Graphs July, August, and September 2026 (3 minute read)
🟢 خلاصه مقاله:
در سه ماه سوم سال ۲۰۲۶، شرکت Common Crawl مجموعهای از نمودارهای شبکه وب را منتشر کرد که اطلاعات گستردهای را درباره میزبانها و دامنههای اینترنت ارائه میدهد. این دادهها شامل جزئیات مربوط به بیش از ۲۴۵ میلیون میزبان (Host) و حدود ۱۳۳ میلیون دامنه (Domain) است که نشاندهنده ابعاد وسیع و تنوع بالای ساختار شبکه وب جهانی است. این نمودارها در قالبهایی ارائه شدهاند که به محققان و توسعهدهندگان امکان میدهد تحلیلهای عمیقی درباره ساختار و ارتباطات در فضای اینترنت انجام دهند و بدین ترتیب پژوهشهای مرتبط با فناوری، سئو، امنیت و تحلیل شبکههای پیچیده اینترنتی توسعه یابد.
در این مجموعه، دادهها در قالبهای سطح میزبان (Host-Level) و سطح دامنه (Domain-Level) سازماندهی شدهاند، که هر کدام بر جنبههای مختلف ساختار اینترنت تمرکز دارند. نمودارهای سطح میزبان، ارتباطات و تعاملات میان سرورهای مختلف را نشان میدهند، در حالی که نمودارهای سطح دامنه به روابط و زیرمجموعههای دامنههای اصلی میپردازند. این دستهبندی به پژوهشگران کمک میکند تا به تفکیک بیشتری در تحلیلهای خود برسند و نقش هر بخش در شبکه جهانی را بهتر درک کنند.
این منابع ارزشمند برای محققان، توسعهدهندگان و سازمانهایی که قصد تحلیل و درک عمیقتری از ساختار وب جهانی دارند، بسیار مفید هستند. در واقع، انتشار چنین دادههایی نویدبخش تحقیقات پیشرفته در زمینههای مختلف مانند امنیت سایبری، بهینهسازی موتورهای جستجو، و تحلیل رفتار کاربر است. این اطلاعات، با توجه به حجم و دقت بالایشان، ابزارهای قدرتمندی برای توسعه فناوریهای نوین در فضای دیجیتال فراهم میآورند و به پیشرفت فعالیتهای علمی و فنی در سطح جهانی کمک میکنند.
#وب_پژوهی #ساختار_وب #تحلیل_شبکه #دیتای_باز
🟣لینک مقاله:
https://commoncrawl.org/blog/host--and-domain-level-web-graphs-july-august-and-september-2026?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
commoncrawl.org
Common Crawl - Blog - Host- and Domain-Level Web Graphs July, August, and September 2026
We are absolutely thrilled to announce the release of our September 2026 Web Graph, comprising data from July, August, and September 2026.
🔵 عنوان مقاله
Partition Finalization in Pinterest's Next-Generation DB Ingestion Framework (9 minute read)
🟢 خلاصه مقاله:
پینترست یک لایه نهاییسازی را به چارچوب جدید وارد کردن داده در پایگاهدادههای خود اضافه کرده است. این لایه در مسیر کاری شامل Kafka، Flink، Spark و Iceberg CDC قرار دارد و هدف آن این است که وظایف بعدی بتوانند بهدرستی تشخیص دهند که آیا بخشهای زمانی، مثلا بخشهای ساعتی، آماده برای خواندن هستند یا خیر. این کار به طرز قابل توجهی روند مدیریت دادهها را بسیار بهتر میکند، زیرا تضمین میکند که دادههای جدید و کامل با هم مطابقت دارند و خواندن آنها منجر به خطا یا ناهماهنگی نمیشود.
در این سیستم، گردآوری آمارهای بر اساس زمان رویدادها توسط نقطهچینهای Flink انجام میشود. این آمارت ها به عنوان متادیتای عکسلحظهای (اسنپشات) در Iceberg ذخیره میشوند و همچنین یک نشانگر علامتی (watermark) ارائه میدهند که نشان میدهد چه زمانی دادهها کامل و قابلاعتماد هستند. این نشانگر، با بازتولید مجدد سریع و بدون نیاز به ایجاد سرویس هماهنگی جدید، امکان تشخیص سریع و دقیق وضعیت دادهها را فراهم میآورد و کل فرآیند را بسیار موثر میسازد.
این رویکرد نوآورانه، نشاندهندهی تحول در مدیریت داده و بهبود سرعت و دقت فرآیندهای پایگاهداده است، به طوری که نیازی به سیستمهای ذکر شده جداگانه برای کنترل و سازماندهی دادههای زمانبندی شده نیست و از این طریق فرآیندهای قرینه سازی، فشردهسازی و تحلیل به شدت تسریع مییابد.
#پینترست #مدیریت_داده # Iceberg #فناورینوین
🟣لینک مقاله:
https://medium.com/pinterest-engineering/partition-finalization-in-pinterests-next-generation-db-ngestion-framework-4c7da6e4cc8f?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Partition Finalization in Pinterest's Next-Generation DB Ingestion Framework (9 minute read)
🟢 خلاصه مقاله:
پینترست یک لایه نهاییسازی را به چارچوب جدید وارد کردن داده در پایگاهدادههای خود اضافه کرده است. این لایه در مسیر کاری شامل Kafka، Flink، Spark و Iceberg CDC قرار دارد و هدف آن این است که وظایف بعدی بتوانند بهدرستی تشخیص دهند که آیا بخشهای زمانی، مثلا بخشهای ساعتی، آماده برای خواندن هستند یا خیر. این کار به طرز قابل توجهی روند مدیریت دادهها را بسیار بهتر میکند، زیرا تضمین میکند که دادههای جدید و کامل با هم مطابقت دارند و خواندن آنها منجر به خطا یا ناهماهنگی نمیشود.
در این سیستم، گردآوری آمارهای بر اساس زمان رویدادها توسط نقطهچینهای Flink انجام میشود. این آمارت ها به عنوان متادیتای عکسلحظهای (اسنپشات) در Iceberg ذخیره میشوند و همچنین یک نشانگر علامتی (watermark) ارائه میدهند که نشان میدهد چه زمانی دادهها کامل و قابلاعتماد هستند. این نشانگر، با بازتولید مجدد سریع و بدون نیاز به ایجاد سرویس هماهنگی جدید، امکان تشخیص سریع و دقیق وضعیت دادهها را فراهم میآورد و کل فرآیند را بسیار موثر میسازد.
این رویکرد نوآورانه، نشاندهندهی تحول در مدیریت داده و بهبود سرعت و دقت فرآیندهای پایگاهداده است، به طوری که نیازی به سیستمهای ذکر شده جداگانه برای کنترل و سازماندهی دادههای زمانبندی شده نیست و از این طریق فرآیندهای قرینه سازی، فشردهسازی و تحلیل به شدت تسریع مییابد.
#پینترست #مدیریت_داده # Iceberg #فناورینوین
🟣لینک مقاله:
https://medium.com/pinterest-engineering/partition-finalization-in-pinterests-next-generation-db-ngestion-framework-4c7da6e4cc8f?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Medium
Partition Finalization in Pinterest’s Next-Generation DB Ingestion Framework
Qianrui Zhang | Sr Software Engineer, Logging Platform Kanchi Masalia | Software Engineer II, Stream Processing Platform Liang Mou | Sr…
🔵 عنوان مقاله
ALP: Adaptive Lossless Floating-Point Encoding in Apache Parquet (7 minute read)
🟢 خلاصه مقاله:
در بهروزرسانی جدید Apache Parquet، فناوریای به نام ALP معرفی شده است که نوعی رمزگذاری بدون از دست دادن اطلاعات برای دادههای عددی در قالب شناور (floating-point) است. این فناوری توانسته است نرخ فشردهسازی را تا حد قابلتوجهی نزدیک به الگوریتم قدرتمند ZSTD برساند؛ اما نکته مهمتر این است که فرآیند رمزگشایی با ALP تقریباً ده برابر سریعتر انجام میشود. این ویژگی باعث میشود که عملیات خواندن و دسترسی تصادفی به دادهها بسیار سریعتر انجام شود، و بهخصوص در محیطهایی که نیاز به پردازش حجم زیادی از دادههای عددی، مانند قیمتها، مختصات جغرافیایی یا اندازهگیریهای علمی باشد، کاربرد بسیار مناسبی پیدا کند.
این فناوری جدید نه تنها قابلیت فشردهسازی مؤثر را فراهم میکند، بلکه میتواند سرعت پردازش و تحلیل دادهها را در سیستمهای بزرگ و پیچیده به طور چشمگیری ارتقاء دهد. بنابراین، ALP به عنوان یک ابزار کمکی قدرتمند در بهبود کارایی سیستمهای دادهمحور و تسهیل عملیاتهای تحلیلی و علمی شناخته میشود، که این مسئله اهمیت زیادی برای توسعهدهندگان و محققان در حوزههایی مانند دادههای بزرگ، علوم پایه و فناوریهای مالی دارد.
#فناوری #دادههای_بزرگ #فناوری_اطلاعات #تحلیل_داده
🟣لینک مقاله:
https://parquet.apache.org/blog/2026/09/22/alp-adaptive-lossless-floating-point-encoding-in-apache-parquet/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
ALP: Adaptive Lossless Floating-Point Encoding in Apache Parquet (7 minute read)
🟢 خلاصه مقاله:
در بهروزرسانی جدید Apache Parquet، فناوریای به نام ALP معرفی شده است که نوعی رمزگذاری بدون از دست دادن اطلاعات برای دادههای عددی در قالب شناور (floating-point) است. این فناوری توانسته است نرخ فشردهسازی را تا حد قابلتوجهی نزدیک به الگوریتم قدرتمند ZSTD برساند؛ اما نکته مهمتر این است که فرآیند رمزگشایی با ALP تقریباً ده برابر سریعتر انجام میشود. این ویژگی باعث میشود که عملیات خواندن و دسترسی تصادفی به دادهها بسیار سریعتر انجام شود، و بهخصوص در محیطهایی که نیاز به پردازش حجم زیادی از دادههای عددی، مانند قیمتها، مختصات جغرافیایی یا اندازهگیریهای علمی باشد، کاربرد بسیار مناسبی پیدا کند.
این فناوری جدید نه تنها قابلیت فشردهسازی مؤثر را فراهم میکند، بلکه میتواند سرعت پردازش و تحلیل دادهها را در سیستمهای بزرگ و پیچیده به طور چشمگیری ارتقاء دهد. بنابراین، ALP به عنوان یک ابزار کمکی قدرتمند در بهبود کارایی سیستمهای دادهمحور و تسهیل عملیاتهای تحلیلی و علمی شناخته میشود، که این مسئله اهمیت زیادی برای توسعهدهندگان و محققان در حوزههایی مانند دادههای بزرگ، علوم پایه و فناوریهای مالی دارد.
#فناوری #دادههای_بزرگ #فناوری_اطلاعات #تحلیل_داده
🟣لینک مقاله:
https://parquet.apache.org/blog/2026/09/22/alp-adaptive-lossless-floating-point-encoding-in-apache-parquet/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Parquet
ALP: Adaptive Lossless Floating-Point Encoding in Apache Parquet
A technical overview of ALP's design, performance, and adoption across the Apache Parquet ecosystem.
🔵 عنوان مقاله
Trading a Cloud Identity for Your Own: Workload Attestation on Managed Compute (7 minute read)
🟢 خلاصه مقاله:
در مقالهای که در مدت هفت دقیقه قابل مطالعه است، نحوهی جایگزینی هویت ابری با هویت داخلی برای وظایف محاسباتی مورد بحث قرار گرفته است. نتفلیکس توضیح میدهد که چگونه وظایف اسپارک در محیطهای محاسباتی مدیریتشده، بهجای نقش اجرای ابری، از هویت داخلی و معتبر وظیفه محاسباتی بهره میبرند. این فرآیند شامل امضای یک Payload متادیتا و اثبات هویت در سرویس آمازون وِب سرویس (AWS) است که قبل از صدور گواهینامههای کوتاهمدت برای ارتباط امن mutual TLS، تایید میشوند.
این الگو از جداسازی مجوزهای ارائهدهندهی خدمات ابری از اعتماد به اپلیکیشنها، بهرهمند است. نتیجه این است که پلتفرم قادر است هویت وظیفه محاسباتی قویتری ارائه داده و حد و مرزهای دسترسی را بهطور قابلردیابیتری مدیریت کند. این رویکرد، امنیت و کنترل بهتری روی نحوهی دسترسی و فعالیتهای داخلی سیستمهای محاسباتی فراهم میکند و استانداردهای امنیتی را در محیطهای ابری ارتقاء میدهد.
#امنیت #هویت_سیستم #محاسبات_مدیریتشده #امنیت_درابری
🟣لینک مقاله:
https://netflixtechblog.com/trading-a-cloud-identity-for-your-own-workload-attestation-on-managed-compute-516d5a29b252?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Trading a Cloud Identity for Your Own: Workload Attestation on Managed Compute (7 minute read)
🟢 خلاصه مقاله:
در مقالهای که در مدت هفت دقیقه قابل مطالعه است، نحوهی جایگزینی هویت ابری با هویت داخلی برای وظایف محاسباتی مورد بحث قرار گرفته است. نتفلیکس توضیح میدهد که چگونه وظایف اسپارک در محیطهای محاسباتی مدیریتشده، بهجای نقش اجرای ابری، از هویت داخلی و معتبر وظیفه محاسباتی بهره میبرند. این فرآیند شامل امضای یک Payload متادیتا و اثبات هویت در سرویس آمازون وِب سرویس (AWS) است که قبل از صدور گواهینامههای کوتاهمدت برای ارتباط امن mutual TLS، تایید میشوند.
این الگو از جداسازی مجوزهای ارائهدهندهی خدمات ابری از اعتماد به اپلیکیشنها، بهرهمند است. نتیجه این است که پلتفرم قادر است هویت وظیفه محاسباتی قویتری ارائه داده و حد و مرزهای دسترسی را بهطور قابلردیابیتری مدیریت کند. این رویکرد، امنیت و کنترل بهتری روی نحوهی دسترسی و فعالیتهای داخلی سیستمهای محاسباتی فراهم میکند و استانداردهای امنیتی را در محیطهای ابری ارتقاء میدهد.
#امنیت #هویت_سیستم #محاسبات_مدیریتشده #امنیت_درابری
🟣لینک مقاله:
https://netflixtechblog.com/trading-a-cloud-identity-for-your-own-workload-attestation-on-managed-compute-516d5a29b252?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Medium
Trading a Cloud Identity for Your Own: Workload Attestation on Managed Compute
By Dhruv Pratap