Data Science | Machinelearning [ru]
19.8K subscribers
912 photos
56 videos
28 files
3.84K links
Все о Data Science, машинном обучении и искусственном интеллекте: от базовой теории до cutting-edge исследований и LLM.

MAX - https://max.ru/devsp
Личный блог - @just_genych
По вопросам рекламы или разработки - @g_abashkin

РКН: https://vk.cc/cJPGXD
Download Telegram
[Перевод] Jev за 25 строк на Python

Про Jev галдят все, кому не лень. Jev там, Jev сям. Твиттер ими скоро лопнет: мол, это следующий прорыв больших языковых моделей и чуть ли не новая парадигма ИИ.

Что-то нам в это не верится.

Читать далее

👉 Telegram | Max
Please open Telegram to view this post
VIEW IN TELEGRAM
😁5
От готовых реплик до памяти о контексте: как AI-чаты дошли до нынешнего уровня

В первой части статьи разбирали, как эволюционировали поисковики. Теперь — про технологии, благодаря которым AI-чаты обзавелись всем тем, что умеют сейчас.

Классический поисковик занят простым делом: найти уже существующие документы и расставить их по ранжиру. AI-чату такого мало — он должен собрать ответ, оглядываясь и на запрос, и на контекст разговора. В материале описан переход от сценарных ботов, где правила и реплики разработчики прописывали руками, к нынешним системам на языковых моделях. Эти штуки умеют выполнять инструкции, держать многоходовый диалог, подтягивать сведения из прошлых бесед и обращаться к внешним источникам, пока готовят ответ.

Читать далее

👉 Telegram | Max
Please open Telegram to view this post
VIEW IN TELEGRAM
NVIDIA тоже подтянулась к тренду: LeetCode-собесы — на выход

И весь замес — вокруг трёх тем по оптимизации:
— градиентный спуск и глобальные оптимумы;
— full batch, мини-батч и SGD;
— generalization gap и плоские минимумы.

Топовые команды ищут не зубрил, а тех, кто реально въезжает в фундамент.

Источник

👉 Telegram | Max
Please open Telegram to view this post
VIEW IN TELEGRAM
😁3❤1👍1
Тем, кто только лезет в ML

Начинаешь щупать машинное обучение и хочешь нормально въехать в математику — ту, что стоит за машинным и глубоким обучением? Тогда глянь эту платформу. По сути, тот же LeetCode, только для ML.

И да, это не реклама: автор сам ей пользовался и решил поделиться.

👉 Telegram | Max
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
[Перевод] Промпт-инжиниринг: как лучше общаться с ИИ

Что тебе ответит генеративная модель — во многом упирается в то, как ты слепил запрос. Промпт-инжиниринг — это не про выискивание «правильных слов» и не про универсальные команды. Задача у него куда приземлённее: донести до модели своё намерение без искажений.

Генеративный ИИ ощутимо перекроил сам подход к работе с программами. Модель можно напрячь по-разному: пусть напишет письмо, раскопает инфу, разжуёт сложную тему, накидает идей, выдаст код, соберёт план проекта или злобно разберёт чужое решение по косточкам. И вот тут есть ограничение.

Читать далее

👉 Telegram | Max
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3👍1
Нейрочип НТЦ «Модуль»: единственный серийный в стране

Разбор единственного серийного нейрочипа страны — НТЦ «Модуль», 27 лет в серии. Что он тянет по даташиту и что реально выдаёт в живых внедрениях: больницы, РЖД, шахты, спутники.

И отдельно: как эта штука смотрится рядом с Jetson и Ascend 310, кто ещё в России лезет в нейрочипы и почему его кличут «нишевым».

Погрузиться в обзор

👉 Telegram | Max
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3
Кодовый агент на Mac без облака: MTPLX + pi + Qwen3.8-27B. Где реально прирост, а где нет

Автору загорелось, чтобы агент для кода жил целиком на ноуте, без всяких облаков: модель — локально, сервер — локально, сам агент — в терминале. Но сразу главная засада — скорость. Агент без конца пережёвывает длинный контекст, много «размышляет», и на локальном железе это выливается в минуты ожидания на каждую таску.

Читать далее

👉 Telegram | Max
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4
Что происходит с данными, когда их становится слишком много

Корпоративные данные сегодня живут сразу в нескольких сценариях: их нужно собирать, обрабатывать, анализировать, превращать в отчёты и использовать внутри ИИ-систем. Поэтому постепенно меняется и сам подход к Data-инфраструктуре: вместо набора разрозненных инструментов компании ищут более цельную среду для работы с данными.

Насколько тема востребована, показывает и размах Yandex Scale'26: конференция собрала 3 тыс. участников офлайн, ещё 10 тыс. подключились онлайн, в программе — 30 докладов и 60 пикеров. И один из треков — Data — как раз про то, как выстроить работу с данными в новых условиях.

Один из заметных анонсов — DataLens Platform, которая объединяет хранение и обработку данных, аналитику и работу с отчетами в одной системе.

Причем поверх данных теперь можно строить и агентные сценарии: ИИ-помощнику можно поручить создать чарт или дашборд, а не просто найти нужную цифру.

Отдельно развивается и инфраструктурная часть: СУБД YDB получила гибридный поиск, который одновременно ищет точные совпадения и понимает смысл запроса. Это пригодится, например, когда нужно найти конкретный номер документа, но при этом учесть контекст запроса.

В итоге Data постепенно превращается из внутреннего слоя инфраструктуры в рабочий интерфейс для аналитики, рекомендаций и ИИ-продуктов.

👉 Telegram | Max
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
Закрытый Jev против открытой Laya: раскладываем decision-модели в RAG-реранжировании

Облачный Jev — и на локальную Laya? Автор прогнал обе модели и три узкоспециализированных реранкера на SciFact, FiQA и NFCorpus.

Сравнивал три вещи: качество поиска, сколько времени уходит на 20 документов и сколько видеопамяти жрёт вся эта радость. Код и результаты — на GitHub.

Читать далее

👉 Telegram | Max
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1
Как нейросеть переводит видео. Часть 2: русский длиннее не текстом, а звуком

Автор в одиночку пилит speeek.io — сервис дубляжа видосов. Первая часть была про вход конвейера: как звук превращается в текст с таймкодами и что Whisper с этим текстом выделывает. Эта — про середину: перевод и запихивание перевода в тайминг оригинала.

Самый болезненный кусок всего проекта — как раз эта середина. С распознаванием автор худо-бедно разобрался, синтез берёт готовым на стороне. А вот что делать с русской фразой, которой тупо не хватает секунд английской, — до сих пор не уверен. Ближе к концу — эксперимент, после которого картинка стала чуть яснее.

Читать далее

👉 Telegram | Max
Please open Telegram to view this post
VIEW IN TELEGRAM
Путь к ИИ-сингулярности

В багажнике у нас: пара репо с вайб-кодом, который ни один тест не нюхал, 75 тяжеловесных SDD-спецификаций, пять харнессов, обмазанных смазкой, солонка, до половины набитая кастомными скиллами и правилами, забитыми капслоком, десяток MCP-серверов с дырами, RAG-база со свежевекторизованным Confluence, кустарная дощечка имаго-кодинга и целый выводок автономных агентов всех мастей — от безобидных автодополнялок до галлюцинирующих субагентов, которые тянут пакеты со slopsquatting и по-тихому сносят боевые базы.

Для поездки к ИИ-сингулярности вся эта солянка, если честно, была не особо и нужна. Но раз уж сел на велосипед без седла и покатился с горы — тормозить поздно. Реальный животный страх вызывало ровно одно: отдать ревью самой модели. Тот самый миг, когда седьмой агент подписывается под галлюцинациями шестого — тесты-то зелёные, — плюс мысль, что рано или поздно мы на эту дрянь переедем.

Сложно вообразить что-то беспомощнее, безответственнее и гнилее, чем IT-команда, поднявшая мультиагентный оркестр в режиме allow all. Дальше — критический (и слегка ехидный) разбор того, что приключилось с разработкой за последние пару лет.

Читать далее

👉 Telegram | Max
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥2