Data Science | Machinelearning [ru]
19.8K subscribers
929 photos
56 videos
28 files
3.85K links
Все о Data Science, машинном обучении и искусственном интеллекте: от базовой теории до cutting-edge исследований и LLM.

MAX - https://max.ru/devsp
Личный блог - @just_genych
По вопросам рекламы или разработки - @g_abashkin

РКН: https://vk.cc/cJPGXD
Download Telegram
🤣 Правильно расставленные приоритеты в моей жизни би лайк:

💥 xCode Journal
Please open Telegram to view this post
VIEW IN TELEGRAM
😁14❤3
😅 Айтишник отправил в одну компанию три одинаковых резюме и только одно дошло до финала

Опыт везде был один и тот же, отличались только формулировки и ключевые слова. Первое резюме сразу ушло в помойку из-за алгоритмов, второе получило отказ после предварительной переписки и тестового, так как «опыт не совсем подходит», а вот третье дошло до финала.

✖️ xCode Journal
Please open Telegram to view this post
VIEW IN TELEGRAM
😁1
Какую LLM брать: пилим свой бенчмарк

Обычно выбор модели стартует с рейтингов. Только в этих таблицах ни черта не видно: потянет ли она твои задачи и в какую сумму это выльется — там не написано.

В лаборатории авторов есть электронный лабораторный журнал — по сути база, куда валятся данные всех экспериментов и измерений, а ИИ-ассистент по ней отвечает на вопросы. И встал вопрос: какую модель поставить рулить этим ассистентом? Публичные рейтинги внятного ответа не давали.

Пришлось пилить свой бенчмарк: 24 вопроса по собственной работе, прогнанные по живому журналу через MCP на DeepSeek, ChatGPT и Claude. В материале — как эти 24 вопроса родились, что на них показали девятнадцать комбинаций модели и уровня усилий при рассуждении (reasoning effort) примерно в 450 прогонах, и как собрать такой же тест под свою задачу.

Читать далее

👉 Telegram | Max
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1
Приложение для поиска по PDF: ковыряем PageIndex, Streamlit и ссылки на страницы

«Срок гарантии — 18 месяцев». Красиво звучит, да? А если в договоре стоит 12? Или эта восемнадцатка затесалась в раздел про хранение, а модель просто уцепилась за циферку? В чате такой косяк не видно — его прячет гладкая формулировка. Автору хотелось другого маршрута: спросить у PDF, получить ответ и одним кликом открыть ту самую физическую страницу файла, на которую сослалась модель. Отсюда и вырос PDF Desk — мелкое приложение на Python, Streamlit, PageIndex и PDFium.

Один активный документ. Базы пользователей нет. Индекс и исходник PDF лежат на твоей машине; но если подключаешь внешнюю модель — текст дока всё равно уезжает её провайдеру.

Дальше разбираем: где заканчивается SDK и начинается приложение, почему голый /models не годится для проверки коннекта, из чего собирается идентификатор индекса и почему ссылка на существующую страницу ещё не значит, что ответ доказан. А под конец — живой прогон DeepSeek, вместе с браузером, и сценарии, для которых такого прогона мало.

Читать далее

👉 Telegram | Max
Please open Telegram to view this post
VIEW IN TELEGRAM
Modern Robotics: Mechanics, Planning, and Control — скинь в закладки, пусть лежит.

Это не очередные статейки на пару экранов, а нормальный магистерский учебник по робототехнике. Написали его Кевин Линч и Фрэнк Парк, выпустил Cambridge University Press.

Что там внутри: конфигурационные пространства, кинематика, динамика, генерация траекторий, планирование движения, управление роботами. Короче — современная математическая база того, как роботы ездят, шевелятся и взаимодействуют с миром вокруг.

MR.pdf

👉 Telegram | Max
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2🔥2
Мы как мир

Всё, чем ты себя обставил, — это сразу два в одном: отпечаток твоих мыслей и то, чем ты эти мысли гоняешь. Дороги рисуют географию, скорость, дистанцию, простор. Хлам на комоде — память и эмоции. Тулзы на столе — планы и скиллы.

Окружение нихрена не командует тобой — оно тебя ведёт. Где-то помягче, где-то пожёстче. Но ты — не просто мозг, запертый в черепной коробке. Ты ещё и то, что наворотили до тебя, и то, что наворотил ты сам.

Статья ниже — про то, что нас обступает, и как это цепляется за LLM и агентов. Читать далее

👉 Telegram | Max
Please open Telegram to view this post
VIEW IN TELEGRAM
AI Overviews на русском: половина источников в ответе — вообще не из топа

Принято считать, что ИИ-обзоры в Google — чисто западная движуха, которая до российских сайтов не дотягивается. Автор прогнал больше тысячи русских вопросов из полусотни ниш и поснимал по ним выдачу Google с регионом Россия в настройках запроса.

ИИ-обзор вылез над выдачей в 93% случаев. И половина его источников — не с первой страницы обычного поиска. То есть залезть в обзор можно и без места в топе.

Читать далее

👉 Telegram | Max
Please open Telegram to view this post
VIEW IN TELEGRAM
Один агент — и уже AI-холдинг: как раздувают автономные AI-системы

Отдельные задачи ИИ, ясен пень, ускоряет. Но вот когда процессов и проектов становится всё больше, управление ими всё ещё висит на человеке.

Автор на своих экспериментах показывает дорожку от одного агента к AI-организации и объясняет, на кой чёрт под несколько направлений может понадобиться AI-холдинг.

Читать на Habr

👉 Telegram | Max
Please open Telegram to view this post
VIEW IN TELEGRAM
Защитит ли ИИ от дрона? Разрабатываем умный прицел

За последние годы война пережила самую настоящую дроновую революцию: FPV-птички массово жгут и технику, и живую силу. И фишка тут не в наворотах — прошлые революции как раз строились на крутых технологиях и таком же крутом ценнике. А эти берут ценой. Один копеечный аппарат разбирает железо, которое дороже его в тысячи раз, а порой и снаряд ПВО тянет заметно больше самой цели.

Военная техника кое-как огрызается: обросла антидроновыми «зонтиками» и «усами», навесила активную защиту и антидроновые турели. А вот с переносным, которое реально вытащит пехотинца, всё куда печальнее.

Читать далее

👉 Telegram | Max
Please open Telegram to view this post
VIEW IN TELEGRAM
Парсить текст без LLM? Проект Real AI SA всё ещё дышит

С прошлого поста об этой штуке прошло больше двух лет. Автор наконец-то вылез из норы и поведал, чем живёт проект и во сколько он уже влетел.

Без воды: сожжено 8 000 000 рублей, в базу знаний анализатора закинули порядка 5000 понятий, а ещё прогнали бесплатный пилот. Напоминаем суть: тут пилят семантический анализатор, который собирает граф из текста и при этом обходится без больших языковых моделей (LLM).

Читать далее

👉 Telegram | Max
Please open Telegram to view this post
VIEW IN TELEGRAM
😁1
Яндекс открыл YTsaurus Flow: обработка данных в реальном времени для более точных рекомендаций

Рекомендательные системы и реклама живут на свежих данных о пользователях. Но клики и заказы обычно не летят в обработку сразу, а сначала накапливаются, и задержка может растянуться на часы. За это время интересы человека могут смениться.

Теперь технология в опенсорсе: Flow разгребает такие события по мере поступления. Под капотом exactly-once (ни потерь, ни дублей), устойчивость к сбоям и работа в рамках платформы YTsaurus, где накопленная и свежая информация учитывается в одной системе.

Flow уже крутится в Маркете, антифроде и Рекламе Яндекса. В Рекламе через него ежесекундно идёт больше 100 ГБ, подготовка данных для дообучения части моделей раньше занимала больше 10 часов — теперь эту задержку почти полностью убрали. Вне рекламы Flow сгодится для ML-датасетов, онлайн-счётчиков просмотров и заказов и обновления информации на сайтах и в приложениях. Лицензия Apache 2.0 не мешает использовать его и в коммерческих проектах.

Читать далее

👉 Telegram | Max
Please open Telegram to view this post
VIEW IN TELEGRAM
👍4⚡1🔥1
Please open Telegram to view this post
VIEW IN TELEGRAM