Linuxor ?
31.7K subscribers
1.88K photos
507 videos
12 files
1.66K links
اخبار لحظه ای تکنولوژی و معرفی ابزار های کامپیوتری و برنامه نویسی!

ارتباطات و تبلیغات :
@LinuxorContact
Download Telegram
This media is not supported in your browser
VIEW IN TELEGRAM
اوففف انویدیا هاگینگ فیس رو خریده داره چیکار می‌کنه! یه مدل داده بیرون 8 نفرم که همزمان صحبت می‌کنن می‌تونه بفهمه و مجزا هرکدوم رو تبدیل به متن کنه! و فقط 100 میلیون پارامتر داره اسمش Nemotron 3 Diarization هستش


تست آنلاین:
huggingface.co/spaces/nvidia/nemotron-diarization

توضیحاتش:
huggingface.co/blog/nvidia/nemotron-diarization

@Linuxor
Media is too big
VIEW IN TELEGRAM
یه نفر یه پروژه جالب منتشر کرده که می‌تونه هر وب‌کم رو تبدیل کنه به چندتا تشخیص‌دهنده‌ی زنده‌ی AI؛ از تشخیص احساسات و شمارش گرفته تا تشخیص اشیا، اونم با اجرای کاملاً لوکال روی دستگاه.


سرعتش بالاست، روی Apple M5، اجرای PyTorch/MPS با FP16 حدود 210ms و اجرای MLX با 8-bit حدود 160ms در p50 تأخیر داشته؛ یعنی برای پردازش زنده‌ی تصویر، به سرعت قابل توجهی رسیده.

توی بنچمارک کنترل‌شده‌ی 9 سؤالی هم latency از 358.5ms به 259.6ms رسیده؛ یعنی 27.6٪ کاهش تأخیر. جالب‌تر اینکه هر 84 تصمیم از 84 تصمیم بین روش‌های مقایسه‌شده با هم match شدن.

علاوه بر کد کلی از تجربه ارزشمندش هم نوشته:

github.com/yoheinakajima/glance-speedlab

@Linuxor
Media is too big
VIEW IN TELEGRAM
یه نفر با Opus 5.5 و کتابخونه three.js بازی اسپایدرمن ساخته این بازی رو اگه چند سال پیش یه نفر می‌ساخت و توی یه استور گیمر ها برای فروش می‌ذاشت میلیون ها دلار درآمد داشت.

البته کسی که اینو ساخته (xikhar) اینطوری نبوده که به هوش مصنوعی بگه برو برام فلان بازی رو بساز و هوش مصنوعی هم بسازتش! طرف برنامه نویس هستش و سال ها تجربه داره و یه ضرب هم ساخته نشده و به مرور با توسعه و دیباگ ساخته شده پس حتی قوی ترین مدل ها هم اینطوری نیستن که ولشون کنید خودشون به امون خدا براتون بسازن نیاز به دانش خود شما هم دارن، برای همینه همیشه می‌گم یادگیری رو بخاطر هوش مصنوعی کنار نزارید چون هوش مصنوعی فرصت های خوبی براتون می‌سازه اما خودتون هیچی بلد نباشید نمی‌تونید به خوبی ازش استفاده کنید.


@Linuxor
This media is not supported in your browser
VIEW IN TELEGRAM
ورژن جدید رتبه بندی مدل های تصمیم گیر مثل Jev منتشر شده!

ورژن قبلی که اینجا توی کانال منتشر شد کمی دقیق نبود حالا پارامتر های دقیق تری بهش اضافه شده، همچنین مدل AutoJev-27B که مربوط به Perplexity و CTO اون، Denis Yarats، هستش، بین مدل‌های اوپن ویت فعلا بالاترین جایگاه رو گرفته، ولی هنوز 0.8 امتیاز از مدل Jev عقب‌تره.

huggingface.co/spaces/multimodalart/jev-decision-index


@Linuxor
This media is not supported in your browser
VIEW IN TELEGRAM
این اسکیل هم جدید بود براتون آیکون های سه بعدی می‌سازه البته مستقیم این کارو نمی‌کنه با هر درخواستی که ازش می‌کنید

ابتدا تصویر ثابت 3D رو می‌سازه
بعد تبدیلش می‌کنه به انیمیشن
بعدش پس‌زمینه از تک‌تک فریم‌هارو حذف می‌کنه
در نهایت خروجی animated WebP با transparency واقعی می‌ده بهتون
همچنین برای اینکه انیمیشن آخرش seamless loop بشه، همون تصویر اولیه رو به عنوان first frame و last frame به مدل ویدیو می‌ده:

github.com/samyost1/3dicon


@Linuxor
This media is not supported in your browser
VIEW IN TELEGRAM
این ویدیوی کوتاه برای معرفی محصول ساخت دستیش شاید روز ها طول بکشه اما با یه پرامپت ساده چند دقیقه ای با Opus 5.5 ساخته شده پرامپتش رو به بقیه هوش مصنوعی ها هم می‌تونید بدید:

"I want you to create a highly professional SaaS product launch video. Go and find some SaaS, preferably just one that people know, so it's easier to identify with it. Pick that, and then make sure to get actual assets and images and all of that stuff from the internet. Turn it into these typical, very professionally edited, motion-graphics-styled product launch videos that you see people making on Twitter when they launch new SaaS products (which are showing off the features, the benefits, and all of these things)."


@Linuxor
جدیدا شرکتا برای اثبات قوی بودن مدلشون می‌فرستنشون سراغ مسائل حل نشده بشری! آنتروپیک گفته :

کلود یک سیستم آنزیمی که قبلاً ناشناخته بوده رو در DNA باکتریوفاژها کشف کرده؛ یعنی ویروس‌هایی که باکتری‌ها رو آلوده می‌کنن. در کنار ژن این آنزیم، یک آرایه طولانی از بخش‌های تکرارشونده DNA قرار گرفته که ساختارش تا حدی شبیه CRISPR به نظر می‌رسه.

هنوز دقیقاً نمی‌دونیم این سیستم چه کاری انجام می‌ده، اما فقط تعداد انگشت‌شماری از سیستم‌های شناخته‌شده ویژگی‌های مشابهی با اون دارن و همه اون‌ها توانایی بریدن، کپی کردن و چسبوندن DNA رو دارن.

از نظر تاریخی، کشف چنین سیستم‌های قابل برنامه‌ریزی‌ای به ایجاد تحول بزرگی در پزشکی کمک کرده. برای مثال، CRISPR الان به یکی از پایه‌های اصلی درمان‌های ژنتیکی تبدیل شده.

با این حال، برای اینکه بفهمیم این سیستم دقیقاً چه کاری انجام می‌ده و آیا می‌شه از اون به روشی مشابه استفاده کرد یا نه، هنوز تحقیقات و کار خیلی بیشتری لازمه.


@Linuxor
This media is not supported in your browser
VIEW IN TELEGRAM
اگه خواستید سریع یه لوگو یا آیکون یا فونت بسازید برید توی این سایت خروجی png یا svg و ... هم می‌تونید ازش بگیرید:

etienne.design/tools/inbetween


@Linuxoe
یه نفر پرسیده وسط کار کردن (کد زدن) چه پادکست و یا موسیقی ای گوش بدیم؟

جوابش هیچیه! یعنی چی اصلا مگه مغزتون میتونه مولتی پروسس کار کنه؟😁
اصلا حتی تب اضافی هم نباید باز کنید؛ ولی بعضی مواقع که کار سبک تره و کار یدی تره می‌شه این حرکت هارو زد مثلا دارید محصول به سایت اضافه می‌کنید یا خبر و پست برای وبلاگتون جمع می‌کنید.... ولی به این قضیه هم توجه کنید اگه هنوز دارید وقتتون رو با کار یدی می‌گذرونید بهتره یه تجدید نظری کنید چون کارای غیر فکری و یدی رو تقریبا باید بسپرید به AI و بجای موسیقی و پادکست برید قشنگ لم بدید فیلم ببینید.


@Linuxor
Media is too big
VIEW IN TELEGRAM
یه نفر با three.js و هوش مصنوعی بازی سایبرپانک رو ساخته! همچنین توی سورس کدش تمام بخش‌های مهم پروژه رو مستند کرده و برای ایجنت‌های هوش مصنوعی هم دستورالعمل‌های مشخصی شامل بایدها و نبایدها (Do's & Don'ts) آماده کرده تا بتونید خودتون از روش یاد بگیرید.

تست آنلاین (دقت کنید حتما مرورگرتون به کارت گرافیکتون دسترسی داشته باشه):

threejspunk.vercel.app

سورس کد:
github.com/ektogamat/threejs-conference

@Linuxor
Media is too big
VIEW IN TELEGRAM
من که سنم دیگه از بازی مازی گذشته ولی این بازی دستم خورد روی لینکش کلیک کردم خیلی باحال بود یه نفر با Opus 5.5 ساختتش و در اصل از روی بازی تیر اندازی رنگ Splatoon که مخصوص نینتندو هستش ساخته شده.

قیمت بازی واقعی رو سرچ کردم 50 دلاره مال بچه پولدارس از اونایی که گریه می‌کنن باباشون براشون می‌خره، ولی انصافا باحاله تستش کنید😁:

inkwave-six.vercel.app


@Linuxor
This media is not supported in your browser
VIEW IN TELEGRAM
اگه با LLMها کار کرده باشی، احتمالاً با این مشکل برخوردی از مدل می‌خوای یه JSON مشخص برگردونه، ولی مدل ممکنه ساختار رو خراب کنه یا مقداری خارج از چیزی که خواستی بده. TypeLLM اومده این مشکل رو از ریشه حل کنه؛ به‌جای اینکه فقط خروجی رو بعداً validate کنه، موقع تولید جواب، فضای انتخاب مدل رو محدود می‌کنه.

مثلاً اگه بگی مقدار type فقط می‌تونه billing ،technical یا account باشه، مدل عملاً فقط اجازه داره یکی از همین گزینه‌ها رو انتخاب کنه. یعنی به‌جای اینکه مدل آزادانه متن تولید کنه و بعد امیدوار باشیم JSON درست باشه، decoding از همون اول با schema هماهنگ می‌شه.

جالب‌تر اینکه TypeLLM برای این کار از constrained decoding و token probabilities استفاده می‌کنه و کنار SGLang و مدل‌های open-source اجرا می‌شه. حتی می‌تونه بخش reasoning رو آزاد بذاره و فقط موقع تولید جواب نهایی، محدودیت schema رو اعمال کنه؛ یعنی thinking آزاد، خروجی نهایی type-safe.

github.com/TypeLLM/TypeLLM


@Linuxor
بعضی برنامه ها مثل یوتیوب و تلگرام خیلی پر رو شدن ویژگی کلاینت هم بهتون میفروشن :)

مثلا یوتیوب برای اینکه بتونی آهنگ گوش بدی و از برنامه بیای بیرون و قطع نشه باید پرمیوم کنی یا تلگرام برای اینکه بیشتر از 3 تا اکانت داشته باشی روی یه اپ باید پرمیوم کنی! اینا ویژگی کلاینته ویژگی سرور که نیست می‌فروشینش😁

@Linuxor
پرداخت اینترنتی توی ایران و کشور های همسایه از چه سالی شروع شد؟

البته این جدول یه نکاتی داره مثلا عربسان قبل 2018 هم پرداخت اینترنتی داشت و فقط یکپارچه نبود و کارت های محدودی ساپورتش می‌کردن و همچنین ویزا و مستر کارت هم وجود داشت که بین المللیه.

@Linuxor
This media is not supported in your browser
VIEW IN TELEGRAM
علی‌بابا تازه ControlNet Union رو برای Qwen-Image-2.1 منتشر کرده؛ یه checkpoint واحد برای کارهایی مثل Canny، Depth، Pose، Lineart، Scribble و موارد دیگه.

یعنی می‌تونی ساختار و فرم اصلی هر عکس یا ژستی رو حفظ کنی و در عین حال بقیه چیزها رو از نو بازطراحی و بازتصور کن

huggingface.co/spaces/hugging-apps/qwen-image-2-1-controlnet-union-demo


@Linuxor
دیدید که توی پلتفرما همیشه به کاربرای تازه ثبت نام شده یه تخفیفی چیز رایگانی میدن که مشتری بشه، حتی اخیرا یه چیزی از اسنپ هم منتشر شد که قیمت هارو به دوتا کاربر مختلف، متفاوت نشون میدادن! همیشه برام سوال بوده با یه سیم کارت 100 هزار تومنی اگه با ربات توی همه پلتفرما لاگین کنی میشه حداکثر چقدر سود کرد؟😁


@Linuxor
This media is not supported in your browser
VIEW IN TELEGRAM
هوش مصنوعی پزشکی داره همچنان بی سروصدا پیشرفت می‌کنه حالا می‌تونی استخوان‌ها رو از عکس رادیولوژی قفسه سینه حذف کنی

شرکت Qure AI مدلی منتشر کرده که تصویر رادیوگرافی رو به بافت نرم، استخوان و ریه‌ها تفکیک می‌کنه؛ در نتیجه دنده‌ها دیگه چیزی رو که پشتشون قرار گرفته پنهان نمی‌کنن

تست آنلاین :

huggingface.co/spaces/hugging-apps/bone-suppression-chest-xray

@Linuxor
This media is not supported in your browser
VIEW IN TELEGRAM
یه پروژه جالب به اسم Valen اومده که به‌جای اینکه مدل بعد از دیدن تصویر بشینه reasoning طولانی تولید کنه، مستقیماً از روی تصویر/متن، احتمال action های مختلف رو حساب می‌کنه؛ یعنی ورودی میره داخل مدل و خروجی میشه تصمیم آماده برای اجرا.

روی Qwen3.5-2B ساخته شده و یه Decision Head به مدل اضافه می‌کنه. مثلاً برای یه بازی می‌تونه خروجی‌ای شبیه Left: 0.05 / Right: 0.72 / Up: 0.18 / Down: 0.05 بده و Agent هم سریع‌ترین action رو انتخاب کنه. این معماری برای بازی‌ها، UI Agentها، moderation و سیستم‌های real-time خیلی جالبه.

توی benchmark مربوط به Sokoban، Valen با 9 تصمیم مجموعاً حدود 1.13 ثانیه latency داشته، درحالی‌که Qwen3.8-27B Think برای همون سناریو حدود 198.05 ثانیه زمان گرفته. نکته مهم اینه که این اعداد مربوط به همین task و setup هستن، نه اینکه 2B در همه‌چیز جای 27B رو بگیره.

تست آنلاین :
huggingface.co/spaces/yuhangzang/Valen-Preview-0923
سورس کد :

github.com/Liuziyu77/Valen

@Linuxor
یه فرمولی برای تولید محتوا که تقریبا پابلیکه و اکثر تولید کننده های محتوا ازش استفاده می‌کنن (مثلا مستر بیست) و حتی شما هم میدونینش پول خرج کردنه، جالبه یعنی به هر صورتی پول خرج بشه برای مردم جذابه چه پول رو بسوزونی، چه رایگان بدیش به یکی، بری چیز بخری نشون مردم بدی و هر کار دیگه کنی حتما توجه مردم رو جلب میکنی.

دیدید توی روانشناسی میگن هدف اصلی و اول انسان بقاست و بقیه اهداف زیر مجموعه این هدفن؟ توی تولید محتوا هم هدف پول خرج کردنه بقیه اهداف زیر مجموعه اینن؛ در واقع هرچی یه منبع برای انسان باارزش‌تر باشه، دیدنِ نحوه خرج شدن، از دست رفتن، به دست اومدن یا به خطر افتادن اون منبع می‌تونه جذاب‌تر باشه😁


@Linuxor
This media is not supported in your browser
VIEW IN TELEGRAM
خالق روبی روی ریل، DHH بزرگوار
حرفای جالبی راجع به هوش مصنوعی و آینده نامعلوم برنامه‌نویسی میزنه،‌
جالبترین جاش اینجاس که میگه :
من به عنوان کسی که قراره خودش کد بزنه، از Rust متنفرم ولی اگر ایجنت قراره بزنه عاشقشم. میگه اگر قراره ما به عنوان بلک باکس به زبانهای برنامه نویسی نگاه کنیم و با اینکه ندونیم توش چخبره، نرم افزار توسعه بدیم، خب دیگه چه کاریه بیایم از زبانهای خیلی سطح بالا و developer friendly استفاده کنیم؟ کدنویسی با زبانهای خفن ارزون شده و احتمالا یسری از معماریا هم که برای نگه‌داری و توسعه انسان بود احتمالا به مرور مهم نباشه دیگه ....

mrbug.ir/fa/blog/ruby-on-rails-ai-dhh


@Linuxor ~ Ralireza11
This media is not supported in your browser
VIEW IN TELEGRAM
نسخه های چند وجهی Jev (اونایی که به غیر از متن می‌تونن عکس و مدیا هم بفهمن) می‌تونن یه انقلاب خوبی توی صنعت Manufacturing به وجود بیارن مثلا می‌شه فهمید :

قطعه سالمه یا خراب و معیوب؟
این جوش درست انجام شده؟
این محصول scratch داره؟
کارگر کلاه ایمنی داره؟
چیزی وارد محدوده خطر شده؟
دستگاه رفتار غیرعادی داره؟
این قطعه باید reject بشه یا نه؟

اینجا لیستی از Jev های چند وجهی رو جمع کرده و با تعدادی تصاویر اونارو بنچمارک کرده:

benchmarkheaven.com/image-jev-bench


@Linuxor