Linuxor ?
31.7K subscribers
1.88K photos
507 videos
12 files
1.66K links
اخبار لحظه ای تکنولوژی و معرفی ابزار های کامپیوتری و برنامه نویسی!

ارتباطات و تبلیغات :
@LinuxorContact
Download Telegram
This media is not supported in your browser
VIEW IN TELEGRAM
یه مدل جایگزین مدل معروف Jev اومده که می‌گه 9 برابر سریع تر استنتاج می‌کنه، در حالی که توی کارهایی مثل کار با کامپیوتر، گیمینگ و Tool Calling عملکردی در حد Jev داره.

اسمش CLM-8B هستش و ایده اصلیش اینه که به‌جای پردازش دوباره همه‌چیز، State و Action رو از هم جدا می‌کنه تا بتونه Embeddingهاشون رو جداگانه Cache کنه و دوباره استفاده کنه. این یعنی وقتی محیط مدام تغییر می‌کنه ولی Actionهای ممکن ثابت می‌مونن، کلی محاسبه اضافه حذف می‌شه.

جالب‌تر اینکه با یه Fine-tuning سبک، روی بنچمارک‌های سخت Agentic Coding به 81.6% توی DeepSWE و 87.6% توی Terminal-Bench 2.1 رسیده و ادعای SOTA داده. یعنی فقط بحث سرعت نیست و برای Coding Agentهای چندمرحله‌ای هم عملکرد جدی‌ای داره.

تیم سازنده در نهایت Scaling Lawهای CLM رو هم بررسی کرده و نشون داده Contrastive Loss با افزایش Compute، اندازه مدل و اندازه دیتاست، به شکل قابل‌پیش‌بینی کاهش پیدا می‌کنه. خلاصه اینکه ایده اصلی CLM اینه: State و Action رو از هم جدا کن، Cache کن و با هزینه خیلی کمتر و سرعت بالاتر تصمیم بگیر:
github.com/Contrastive-LM/CLM

@Linuxor
همیشه می‌بینم می‌گن آقا برای پیشرفت توی کاراتون منتور بگیرید، من خودم نمی‌دونم چرا اصلا با کلمه منتور حال نمی‌کنم تابحال هم کسی توی زندگیم نگفته فلان کارو کن از قضا مسیر های اشتباه زیادی هم رفتم و هزینه های زیادی هم دادم...

حتی الانم برگردم عقب هم منتور نمی‌گیرم البته اون موقع پول نداشتم ولی الان که دارم هم نمی‌گیرم چون حس میکنم انسان اصلا بدون اشتباهات هزینه دار رشد نمی‌کنه چه بسا اصلا من توی اون دوران قدیم هم کلی مردم رندوم راهنماییم کردن اونا هم یه جور منتور های رایگان بودن دیگه ولی اون موقع توی کتم نرفته بهشون گوش بدم دقیقا مثل اون بچه ای که بهش می‌گی درس بخون نمی‌خونه؛ به نظرم آدمی زاد خیلی احمق تر از اون حرفاست که بخواد با حرف های بقیه چیزی توی کلش بره شاید وانمود کنه به حرف ها گوش می‌ده ولی تا هزینه نده فکر نمیکنم بهش عمل کنه😁

@Linuxor
10
This media is not supported in your browser
VIEW IN TELEGRAM
اوففف انویدیا هاگینگ فیس رو خریده داره چیکار می‌کنه! یه مدل داده بیرون 8 نفرم که همزمان صحبت می‌کنن می‌تونه بفهمه و مجزا هرکدوم رو تبدیل به متن کنه! و فقط 100 میلیون پارامتر داره اسمش Nemotron 3 Diarization هستش


تست آنلاین:
huggingface.co/spaces/nvidia/nemotron-diarization

توضیحاتش:
huggingface.co/blog/nvidia/nemotron-diarization

@Linuxor
Media is too big
VIEW IN TELEGRAM
یه نفر یه پروژه جالب منتشر کرده که می‌تونه هر وب‌کم رو تبدیل کنه به چندتا تشخیص‌دهنده‌ی زنده‌ی AI؛ از تشخیص احساسات و شمارش گرفته تا تشخیص اشیا، اونم با اجرای کاملاً لوکال روی دستگاه.


سرعتش بالاست، روی Apple M5، اجرای PyTorch/MPS با FP16 حدود 210ms و اجرای MLX با 8-bit حدود 160ms در p50 تأخیر داشته؛ یعنی برای پردازش زنده‌ی تصویر، به سرعت قابل توجهی رسیده.

توی بنچمارک کنترل‌شده‌ی 9 سؤالی هم latency از 358.5ms به 259.6ms رسیده؛ یعنی 27.6٪ کاهش تأخیر. جالب‌تر اینکه هر 84 تصمیم از 84 تصمیم بین روش‌های مقایسه‌شده با هم match شدن.

علاوه بر کد کلی از تجربه ارزشمندش هم نوشته:

github.com/yoheinakajima/glance-speedlab

@Linuxor
Media is too big
VIEW IN TELEGRAM
یه نفر با Opus 5.5 و کتابخونه three.js بازی اسپایدرمن ساخته این بازی رو اگه چند سال پیش یه نفر می‌ساخت و توی یه استور گیمر ها برای فروش می‌ذاشت میلیون ها دلار درآمد داشت.

البته کسی که اینو ساخته (xikhar) اینطوری نبوده که به هوش مصنوعی بگه برو برام فلان بازی رو بساز و هوش مصنوعی هم بسازتش! طرف برنامه نویس هستش و سال ها تجربه داره و یه ضرب هم ساخته نشده و به مرور با توسعه و دیباگ ساخته شده پس حتی قوی ترین مدل ها هم اینطوری نیستن که ولشون کنید خودشون به امون خدا براتون بسازن نیاز به دانش خود شما هم دارن، برای همینه همیشه می‌گم یادگیری رو بخاطر هوش مصنوعی کنار نزارید چون هوش مصنوعی فرصت های خوبی براتون می‌سازه اما خودتون هیچی بلد نباشید نمی‌تونید به خوبی ازش استفاده کنید.


@Linuxor
This media is not supported in your browser
VIEW IN TELEGRAM
ورژن جدید رتبه بندی مدل های تصمیم گیر مثل Jev منتشر شده!

ورژن قبلی که اینجا توی کانال منتشر شد کمی دقیق نبود حالا پارامتر های دقیق تری بهش اضافه شده، همچنین مدل AutoJev-27B که مربوط به Perplexity و CTO اون، Denis Yarats، هستش، بین مدل‌های اوپن ویت فعلا بالاترین جایگاه رو گرفته، ولی هنوز 0.8 امتیاز از مدل Jev عقب‌تره.

huggingface.co/spaces/multimodalart/jev-decision-index


@Linuxor
This media is not supported in your browser
VIEW IN TELEGRAM
این اسکیل هم جدید بود براتون آیکون های سه بعدی می‌سازه البته مستقیم این کارو نمی‌کنه با هر درخواستی که ازش می‌کنید

ابتدا تصویر ثابت 3D رو می‌سازه
بعد تبدیلش می‌کنه به انیمیشن
بعدش پس‌زمینه از تک‌تک فریم‌هارو حذف می‌کنه
در نهایت خروجی animated WebP با transparency واقعی می‌ده بهتون
همچنین برای اینکه انیمیشن آخرش seamless loop بشه، همون تصویر اولیه رو به عنوان first frame و last frame به مدل ویدیو می‌ده:

github.com/samyost1/3dicon


@Linuxor
This media is not supported in your browser
VIEW IN TELEGRAM
این ویدیوی کوتاه برای معرفی محصول ساخت دستیش شاید روز ها طول بکشه اما با یه پرامپت ساده چند دقیقه ای با Opus 5.5 ساخته شده پرامپتش رو به بقیه هوش مصنوعی ها هم می‌تونید بدید:

"I want you to create a highly professional SaaS product launch video. Go and find some SaaS, preferably just one that people know, so it's easier to identify with it. Pick that, and then make sure to get actual assets and images and all of that stuff from the internet. Turn it into these typical, very professionally edited, motion-graphics-styled product launch videos that you see people making on Twitter when they launch new SaaS products (which are showing off the features, the benefits, and all of these things)."


@Linuxor
جدیدا شرکتا برای اثبات قوی بودن مدلشون می‌فرستنشون سراغ مسائل حل نشده بشری! آنتروپیک گفته :

کلود یک سیستم آنزیمی که قبلاً ناشناخته بوده رو در DNA باکتریوفاژها کشف کرده؛ یعنی ویروس‌هایی که باکتری‌ها رو آلوده می‌کنن. در کنار ژن این آنزیم، یک آرایه طولانی از بخش‌های تکرارشونده DNA قرار گرفته که ساختارش تا حدی شبیه CRISPR به نظر می‌رسه.

هنوز دقیقاً نمی‌دونیم این سیستم چه کاری انجام می‌ده، اما فقط تعداد انگشت‌شماری از سیستم‌های شناخته‌شده ویژگی‌های مشابهی با اون دارن و همه اون‌ها توانایی بریدن، کپی کردن و چسبوندن DNA رو دارن.

از نظر تاریخی، کشف چنین سیستم‌های قابل برنامه‌ریزی‌ای به ایجاد تحول بزرگی در پزشکی کمک کرده. برای مثال، CRISPR الان به یکی از پایه‌های اصلی درمان‌های ژنتیکی تبدیل شده.

با این حال، برای اینکه بفهمیم این سیستم دقیقاً چه کاری انجام می‌ده و آیا می‌شه از اون به روشی مشابه استفاده کرد یا نه، هنوز تحقیقات و کار خیلی بیشتری لازمه.


@Linuxor
This media is not supported in your browser
VIEW IN TELEGRAM
اگه خواستید سریع یه لوگو یا آیکون یا فونت بسازید برید توی این سایت خروجی png یا svg و ... هم می‌تونید ازش بگیرید:

etienne.design/tools/inbetween


@Linuxoe
یه نفر پرسیده وسط کار کردن (کد زدن) چه پادکست و یا موسیقی ای گوش بدیم؟

جوابش هیچیه! یعنی چی اصلا مگه مغزتون میتونه مولتی پروسس کار کنه؟😁
اصلا حتی تب اضافی هم نباید باز کنید؛ ولی بعضی مواقع که کار سبک تره و کار یدی تره می‌شه این حرکت هارو زد مثلا دارید محصول به سایت اضافه می‌کنید یا خبر و پست برای وبلاگتون جمع می‌کنید.... ولی به این قضیه هم توجه کنید اگه هنوز دارید وقتتون رو با کار یدی می‌گذرونید بهتره یه تجدید نظری کنید چون کارای غیر فکری و یدی رو تقریبا باید بسپرید به AI و بجای موسیقی و پادکست برید قشنگ لم بدید فیلم ببینید.


@Linuxor
Media is too big
VIEW IN TELEGRAM
یه نفر با three.js و هوش مصنوعی بازی سایبرپانک رو ساخته! همچنین توی سورس کدش تمام بخش‌های مهم پروژه رو مستند کرده و برای ایجنت‌های هوش مصنوعی هم دستورالعمل‌های مشخصی شامل بایدها و نبایدها (Do's & Don'ts) آماده کرده تا بتونید خودتون از روش یاد بگیرید.

تست آنلاین (دقت کنید حتما مرورگرتون به کارت گرافیکتون دسترسی داشته باشه):

threejspunk.vercel.app

سورس کد:
github.com/ektogamat/threejs-conference

@Linuxor
Media is too big
VIEW IN TELEGRAM
من که سنم دیگه از بازی مازی گذشته ولی این بازی دستم خورد روی لینکش کلیک کردم خیلی باحال بود یه نفر با Opus 5.5 ساختتش و در اصل از روی بازی تیر اندازی رنگ Splatoon که مخصوص نینتندو هستش ساخته شده.

قیمت بازی واقعی رو سرچ کردم 50 دلاره مال بچه پولدارس از اونایی که گریه می‌کنن باباشون براشون می‌خره، ولی انصافا باحاله تستش کنید😁:

inkwave-six.vercel.app


@Linuxor
This media is not supported in your browser
VIEW IN TELEGRAM
اگه با LLMها کار کرده باشی، احتمالاً با این مشکل برخوردی از مدل می‌خوای یه JSON مشخص برگردونه، ولی مدل ممکنه ساختار رو خراب کنه یا مقداری خارج از چیزی که خواستی بده. TypeLLM اومده این مشکل رو از ریشه حل کنه؛ به‌جای اینکه فقط خروجی رو بعداً validate کنه، موقع تولید جواب، فضای انتخاب مدل رو محدود می‌کنه.

مثلاً اگه بگی مقدار type فقط می‌تونه billing ،technical یا account باشه، مدل عملاً فقط اجازه داره یکی از همین گزینه‌ها رو انتخاب کنه. یعنی به‌جای اینکه مدل آزادانه متن تولید کنه و بعد امیدوار باشیم JSON درست باشه، decoding از همون اول با schema هماهنگ می‌شه.

جالب‌تر اینکه TypeLLM برای این کار از constrained decoding و token probabilities استفاده می‌کنه و کنار SGLang و مدل‌های open-source اجرا می‌شه. حتی می‌تونه بخش reasoning رو آزاد بذاره و فقط موقع تولید جواب نهایی، محدودیت schema رو اعمال کنه؛ یعنی thinking آزاد، خروجی نهایی type-safe.

github.com/TypeLLM/TypeLLM


@Linuxor
بعضی برنامه ها مثل یوتیوب و تلگرام خیلی پر رو شدن ویژگی کلاینت هم بهتون میفروشن :)

مثلا یوتیوب برای اینکه بتونی آهنگ گوش بدی و از برنامه بیای بیرون و قطع نشه باید پرمیوم کنی یا تلگرام برای اینکه بیشتر از 3 تا اکانت داشته باشی روی یه اپ باید پرمیوم کنی! اینا ویژگی کلاینته ویژگی سرور که نیست می‌فروشینش😁

@Linuxor
پرداخت اینترنتی توی ایران و کشور های همسایه از چه سالی شروع شد؟

البته این جدول یه نکاتی داره مثلا عربسان قبل 2018 هم پرداخت اینترنتی داشت و فقط یکپارچه نبود و کارت های محدودی ساپورتش می‌کردن و همچنین ویزا و مستر کارت هم وجود داشت که بین المللیه.

@Linuxor
This media is not supported in your browser
VIEW IN TELEGRAM
علی‌بابا تازه ControlNet Union رو برای Qwen-Image-2.1 منتشر کرده؛ یه checkpoint واحد برای کارهایی مثل Canny، Depth، Pose، Lineart، Scribble و موارد دیگه.

یعنی می‌تونی ساختار و فرم اصلی هر عکس یا ژستی رو حفظ کنی و در عین حال بقیه چیزها رو از نو بازطراحی و بازتصور کن

huggingface.co/spaces/hugging-apps/qwen-image-2-1-controlnet-union-demo


@Linuxor
دیدید که توی پلتفرما همیشه به کاربرای تازه ثبت نام شده یه تخفیفی چیز رایگانی میدن که مشتری بشه، حتی اخیرا یه چیزی از اسنپ هم منتشر شد که قیمت هارو به دوتا کاربر مختلف، متفاوت نشون میدادن! همیشه برام سوال بوده با یه سیم کارت 100 هزار تومنی اگه با ربات توی همه پلتفرما لاگین کنی میشه حداکثر چقدر سود کرد؟😁


@Linuxor
This media is not supported in your browser
VIEW IN TELEGRAM
هوش مصنوعی پزشکی داره همچنان بی سروصدا پیشرفت می‌کنه حالا می‌تونی استخوان‌ها رو از عکس رادیولوژی قفسه سینه حذف کنی

شرکت Qure AI مدلی منتشر کرده که تصویر رادیوگرافی رو به بافت نرم، استخوان و ریه‌ها تفکیک می‌کنه؛ در نتیجه دنده‌ها دیگه چیزی رو که پشتشون قرار گرفته پنهان نمی‌کنن

تست آنلاین :

huggingface.co/spaces/hugging-apps/bone-suppression-chest-xray

@Linuxor
This media is not supported in your browser
VIEW IN TELEGRAM
یه پروژه جالب به اسم Valen اومده که به‌جای اینکه مدل بعد از دیدن تصویر بشینه reasoning طولانی تولید کنه، مستقیماً از روی تصویر/متن، احتمال action های مختلف رو حساب می‌کنه؛ یعنی ورودی میره داخل مدل و خروجی میشه تصمیم آماده برای اجرا.

روی Qwen3.5-2B ساخته شده و یه Decision Head به مدل اضافه می‌کنه. مثلاً برای یه بازی می‌تونه خروجی‌ای شبیه Left: 0.05 / Right: 0.72 / Up: 0.18 / Down: 0.05 بده و Agent هم سریع‌ترین action رو انتخاب کنه. این معماری برای بازی‌ها، UI Agentها، moderation و سیستم‌های real-time خیلی جالبه.

توی benchmark مربوط به Sokoban، Valen با 9 تصمیم مجموعاً حدود 1.13 ثانیه latency داشته، درحالی‌که Qwen3.8-27B Think برای همون سناریو حدود 198.05 ثانیه زمان گرفته. نکته مهم اینه که این اعداد مربوط به همین task و setup هستن، نه اینکه 2B در همه‌چیز جای 27B رو بگیره.

تست آنلاین :
huggingface.co/spaces/yuhangzang/Valen-Preview-0923
سورس کد :

github.com/Liuziyu77/Valen

@Linuxor
یه فرمولی برای تولید محتوا که تقریبا پابلیکه و اکثر تولید کننده های محتوا ازش استفاده می‌کنن (مثلا مستر بیست) و حتی شما هم میدونینش پول خرج کردنه، جالبه یعنی به هر صورتی پول خرج بشه برای مردم جذابه چه پول رو بسوزونی، چه رایگان بدیش به یکی، بری چیز بخری نشون مردم بدی و هر کار دیگه کنی حتما توجه مردم رو جلب میکنی.

دیدید توی روانشناسی میگن هدف اصلی و اول انسان بقاست و بقیه اهداف زیر مجموعه این هدفن؟ توی تولید محتوا هم هدف پول خرج کردنه بقیه اهداف زیر مجموعه اینن؛ در واقع هرچی یه منبع برای انسان باارزش‌تر باشه، دیدنِ نحوه خرج شدن، از دست رفتن، به دست اومدن یا به خطر افتادن اون منبع می‌تونه جذاب‌تر باشه😁


@Linuxor