Data Science | Machinelearning [ru]
19.8K subscribers
915 photos
56 videos
28 files
3.84K links
Все о Data Science, машинном обучении и искусственном интеллекте: от базовой теории до cutting-edge исследований и LLM.

MAX - https://max.ru/devsp
Личный блог - @just_genych
По вопросам рекламы или разработки - @g_abashkin

РКН: https://vk.cc/cJPGXD
Download Telegram
Нейрочип НТЦ «Модуль»: единственный серийный в стране

Разбор единственного серийного нейрочипа страны — НТЦ «Модуль», 27 лет в серии. Что он тянет по даташиту и что реально выдаёт в живых внедрениях: больницы, РЖД, шахты, спутники.

И отдельно: как эта штука смотрится рядом с Jetson и Ascend 310, кто ещё в России лезет в нейрочипы и почему его кличут «нишевым».

Погрузиться в обзор

👉 Telegram | Max
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3
Кодовый агент на Mac без облака: MTPLX + pi + Qwen3.8-27B. Где реально прирост, а где нет

Автору загорелось, чтобы агент для кода жил целиком на ноуте, без всяких облаков: модель — локально, сервер — локально, сам агент — в терминале. Но сразу главная засада — скорость. Агент без конца пережёвывает длинный контекст, много «размышляет», и на локальном железе это выливается в минуты ожидания на каждую таску.

Читать далее

👉 Telegram | Max
Please open Telegram to view this post
VIEW IN TELEGRAM
❤5
Что происходит с данными, когда их становится слишком много

Корпоративные данные сегодня живут сразу в нескольких сценариях: их нужно собирать, обрабатывать, анализировать, превращать в отчёты и использовать внутри ИИ-систем. Поэтому постепенно меняется и сам подход к Data-инфраструктуре: вместо набора разрозненных инструментов компании ищут более цельную среду для работы с данными.

Насколько тема востребована, показывает и размах Yandex Scale'26: конференция собрала 3 тыс. участников офлайн, ещё 10 тыс. подключились онлайн, в программе — 30 докладов и 60 пикеров. И один из треков — Data — как раз про то, как выстроить работу с данными в новых условиях.

Один из заметных анонсов — DataLens Platform, которая объединяет хранение и обработку данных, аналитику и работу с отчетами в одной системе.

Причем поверх данных теперь можно строить и агентные сценарии: ИИ-помощнику можно поручить создать чарт или дашборд, а не просто найти нужную цифру.

Отдельно развивается и инфраструктурная часть: СУБД YDB получила гибридный поиск, который одновременно ищет точные совпадения и понимает смысл запроса. Это пригодится, например, когда нужно найти конкретный номер документа, но при этом учесть контекст запроса.

В итоге Data постепенно превращается из внутреннего слоя инфраструктуры в рабочий интерфейс для аналитики, рекомендаций и ИИ-продуктов.

👉 Telegram | Max
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3
Закрытый Jev против открытой Laya: раскладываем decision-модели в RAG-реранжировании

Облачный Jev — и на локальную Laya? Автор прогнал обе модели и три узкоспециализированных реранкера на SciFact, FiQA и NFCorpus.

Сравнивал три вещи: качество поиска, сколько времени уходит на 20 документов и сколько видеопамяти жрёт вся эта радость. Код и результаты — на GitHub.

Читать далее

👉 Telegram | Max
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1
Как нейросеть переводит видео. Часть 2: русский длиннее не текстом, а звуком

Автор в одиночку пилит speeek.io — сервис дубляжа видосов. Первая часть была про вход конвейера: как звук превращается в текст с таймкодами и что Whisper с этим текстом выделывает. Эта — про середину: перевод и запихивание перевода в тайминг оригинала.

Самый болезненный кусок всего проекта — как раз эта середина. С распознаванием автор худо-бедно разобрался, синтез берёт готовым на стороне. А вот что делать с русской фразой, которой тупо не хватает секунд английской, — до сих пор не уверен. Ближе к концу — эксперимент, после которого картинка стала чуть яснее.

Читать далее

👉 Telegram | Max
Please open Telegram to view this post
VIEW IN TELEGRAM
Путь к ИИ-сингулярности

В багажнике у нас: пара репо с вайб-кодом, который ни один тест не нюхал, 75 тяжеловесных SDD-спецификаций, пять харнессов, обмазанных смазкой, солонка, до половины набитая кастомными скиллами и правилами, забитыми капслоком, десяток MCP-серверов с дырами, RAG-база со свежевекторизованным Confluence, кустарная дощечка имаго-кодинга и целый выводок автономных агентов всех мастей — от безобидных автодополнялок до галлюцинирующих субагентов, которые тянут пакеты со slopsquatting и по-тихому сносят боевые базы.

Для поездки к ИИ-сингулярности вся эта солянка, если честно, была не особо и нужна. Но раз уж сел на велосипед без седла и покатился с горы — тормозить поздно. Реальный животный страх вызывало ровно одно: отдать ревью самой модели. Тот самый миг, когда седьмой агент подписывается под галлюцинациями шестого — тесты-то зелёные, — плюс мысль, что рано или поздно мы на эту дрянь переедем.

Сложно вообразить что-то беспомощнее, безответственнее и гнилее, чем IT-команда, поднявшая мультиагентный оркестр в режиме allow all. Дальше — критический (и слегка ехидный) разбор того, что приключилось с разработкой за последние пару лет.

Читать далее

👉 Telegram | Max
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥5
Локальный ассистент для зумов, часть 8: модель, из-за которой я перекроил диаризацию за один вечер

В третьей части я уверенно заявлял: чужой модели, ради которой стоило бы ломать текущую связку, не вижу. Схема была такая — sherpa-onnx на диаризации, сверху мой второй проход. Канал из двадцатиминутного созвона размечался минуток за семь. Жить можно, терпимо.

23 сентября NVIDIA выкатила Nemotron 3 Diarization. Вечером 28-го я уже прикрутил её к разбору собственных созвонов. Тот же самый канал — три секунды.

Читать далее

👉 Telegram | Max
Please open Telegram to view this post
VIEW IN TELEGRAM
Про Ember-1 сейчас гудят на Hacker News.

Исследователи дообучили Kimi K3 так, что рассуждать она стала короче процентов на 40. Качество при этом не просело ни на грамм, зато по скорости и цене выигрыш — те же самые ~40%.

И это, между прочим, неплохой пример того, как сегодня вообще имеет смысл подходить к передовым LLM. Завелись у тебя лишние несколько десятков миллионов долларов — с нуля новую модель учить необязательно. Хватай уже готовую сильную и вливай весь бюджет в её дообучение. Источник А ещё Ember-1 уже подвезли в Cline, причём в том числе в новом десктопном приложении.

👉 Telegram | Max
Please open Telegram to view this post
VIEW IN TELEGRAM
Из Москвы в Миннеаполис — с тремя решениями для улучшения персонализации в рекомендательных системах

Команда Т-Банка приехала на конференцию ACM RecSys 2026, которая проходит с 28 сентября по 2 октября в Миннеаполисе, и представила там сразу три разработки. Главная — Scikit‑Rank, библиотека, которая позволяет применять нейросетевые модели ранжирования в совместимом с scikit-learn процессе работы с табличными данными, сокращая количество дополнительного кода.

Фреймворк Perseus объединяет разные действия пользователя в экосистеме в единую последовательность и позволяет использовать ее для улучшения качества персонализации.

ScaL³AE, масштабируемая версия L³AE, которая заменяет тяжелые вычисления на компактные представления при работе с каталогами промышленных масштабов, сохраняя качество рекомендаций товаров, о которых доступно мало данных. В общем, в США съездили не с пустыми руками.

👉 Telegram | Max
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍7🔥4
Две ИИ-фабрики в Армении: что там отгрохали и на кого это в итоге пашет

В августе в Раздане поднялась AI-фабрика Firebird: 6144 ускорителя NVIDIA B200, 15 МВт, а вся стройка уложилась чуть больше чем в полгода. Вторая — Eleveight — крутится с июня: 512 B300 в селе Гагарин у Севана.

Чипы приезжают по каналу, который легальный и американский: меморандум с Трампом, экспортные лицензии, вложения CoreWeave. Но ключевой вопрос тут не «как собрали», а «под кого»: на своём сайте Firebird обещает открыть 90% мощностей американским компаниям региона.

Внутри — что представляет собой каждая из фабрик, откуда тянулся канал от VivaTech до приезда Вэнса, и подсчёт, на кого в финале трудятся армянские вычисления. А про энергетическую базу и её потолок — уже во второй статье. Погрузиться в анализ

👉 Telegram | Max
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3❤1