Data Science | Machinelearning [ru]
19.8K subscribers
873 photos
56 videos
28 files
3.8K links
Все о Data Science, машинном обучении и искусственном интеллекте: от базовой теории до cutting-edge исследований и LLM.

MAX - https://max.ru/devsp
Личный блог - @just_genych
По вопросам рекламы или разработки - @g_abashkin

РКН: https://vk.cc/cJPGXD
Download Telegram
31 августа Google выпустила TimesFM-3 — новую фундаментальную модель для работы с временными рядами. Задача семейства TimesFM — прогнозировать поведение системы на основе ретроспективных данных. В третьей версии исследователи применили токенизацию групп временных отсчетов, сам трансформер — decoder-only, а также заявлена поддержка множественных переменных (multi-variate).

Автор поста вспомнил полуторагодовалую задачу классификации сценариев поведения пользователя по данным энергопотребления. Задача нетипична для TimesFM, созданной для предсказания эволюции, но ради интереса он проверил, как с ней справятся современные ИИ-агенты. В итоге получился экспресс-тест разных подходов к вайб-кодингу: DeepSeek, OpenCode и Freebuff.

Читать далее

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
[Перевод] Ты не ChaGPT, когда голоден. Snickers выпустил «батончик» для нейросетей

ChatGPT часто врёт. Он может уверенно выдать неправильный факт, согласиться с откровенно плохой идеей пользователя или написать 12 абзацев там, где достаточно двух предложений. У Snickers есть своё объяснение: ChatGPT просто голодный. Звучит как шутка, но компания действительно запустила рекламную кампанию Hungr.AI, в рамках которой предлагает пользователям буквально «покормить» чат-бота. И самое интересное — за всей этой историей стоит вполне реальный приём работы с LLM.

Читать далее
2
6 бесплатных AI API‑шлюзов: модели, лимиты и реальные RPM

Проверили шесть AI API-сервисов с бесплатным доступом: VyceAI, Experiential, Dahl, APInex, ModelRouter и TokenForge. Сравнили доступные модели, стартовые лимиты, RPM и поведение API на практике.

Читать далее

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
Автоматизация перевода технической документации с помощью инструментов вокруг LLM

Авторы запилили автоперевод технической документации, а вокруг LLM навесили отдельный слой — и именно он выполнял всю основную работу.

Читать далее

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
Как научить нейросеть чужому стилю без дообучения

Обычно агента, который пишет голосом бренда, получают дообучением: выгружают архив постов, собирают датасет, арендуют A100 и оставляют LoRA учиться на ночь. Автор вместо этого написал два навыка для Claude Code / Codex. Они снимают манеру автора с готовых текстов и переписывают по ней любой нейрослоп — без обучения, датасета и видеокарты.

В тесте текст ChatGPT расходился с манерой одного крупного телеграм-канала по 14 признакам из 31, после работы навыков осталось 2. Вся работа занимает вечер, а результат переносится на любую модель: правила стиля лежат в промпте, а не в весах.

Первый навык читает выгрузку канала и снимает профиль стиля: скрипт замеряет десятки признаков — от длины фразы и абзаца до частоты тире, эмодзи и обращений к читателю, а модель превращает замеры в правила. Второй берёт правила и переписывает по ним любой черновик. Профиль снимается один раз и живёт обычным текстовым файлом в git, а текстов по нему пишется сколько угодно.

Источник: habr.com

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
2👍1
Как говорить с искусственным интеллектом: книга о промптах

Камиль Гадеев — автор книги «Промт-инжиниринг и работа с LLM. Как говорить с искусственным интеллектом» о работе с большими языковыми моделями (LLM). Она основана на статьях из его научно-философского блога на Хабре.

В книге рассматриваются внутреннее устройство промптов, галлюцинации искусственного интеллекта и приёмы, позволяющие эффективно получать от машины информативные и достоверные ответы. Книгу можно купить на сайте издательства.

В статье — рассказ Камиля Гадеева о том, как устроена книга, как с ней работать и для кого она предназначена. Читать далее

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
4
Qwen и Grok отгадывают советские загадки на внимательность

Кто лучше справляется с советскими загадками на внимательность — Qwen, Grok или человек? Сравнили две классические головоломки и получили любопытные результаты.

Читать далее

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
ИИ сделает формальную верификацию мейнстримом — прогноз Мартина Клеппманна

Привет, Хаброжители! Мы перевели для вас свежую статью Мартина Клеппманна о том, почему формальная верификация благодаря ИИ вот-вот перестанет быть уделом единиц и станет обычной практикой.

Сейчас много говорят о влиянии ИИ на разработку, но есть ракурс, который почти не рассматривают. Клеппманн считает, что ИИ превратит формальную верификацию, десятилетиями жившую на периферии, в программно-инженерный мейнстрим.

Читать далее: https://habr.com/ru/companies/piter/articles/1079352/

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
🌐 Твоё ИИ-решение — в одной из крупнейших энергетических компаний России

Получи подготовленные данные и разработай ИИ-ассистента для энергетики на соревновании от ПАО «Интер РАО» при поддержке «Яндекса». Лучшие проекты смогут стать частью экосистемы компании. Призовой фонд — 750 000 рублей.

Регистрация открыта до 27 сентября.

Можно участвовать одному или командой до 5 человек. Идеальный состав: разработчик, специалист по машинному обучению, аналитик и дизайнер.

Стартуем 28 сентября. Придумай концепт проекта: самые сильные идеи участники доработают под руководством экспертов с 9 по 23 октября. Финал в Москве — 3 ноября.

Задачи соревнования — за какую возьмешься?
1️⃣ ИИ-помощник для подготовки презентаций.
Создай инструмент генерации презентации в корпоративном стиле из текстового брифа.

2️⃣ Помощник для анализа документов из судов.
Разработай систему, которая сможет распознавать, классифицировать и заносить судебные и исполнительные документы в базу данных.

3️⃣ Ассистент для создания ИТ/ИБ-дайджестов.
Напиши ассистента, который будет регулярно анализировать релевантные новости из различных источников и формировать краткую сводку.

4️⃣ Архитектор BPMN-диаграмм.
Создай генератор BPMN-диаграмм, который позволит из текстового описания процесса собрать валидную схему в формате BPMN 2.0.


Получи сильную строчку в портфолио и уникальный опыт работы под руководством экспертов Группы «Интер РАО».

Регистрируйся: https://cnrlink.com/interraohack26dsml
Please open Telegram to view this post
VIEW IN TELEGRAM
3
Разбор DeepSeek R1: техника, деньги и обвал рынка

В январе 2025 года небольшая китайская компания DeepSeek за один день обвалила американский фондовый рынок. 20 января она выложила модель R1 под MIT-лицензией, а уже 26 января приложение DeepSeek вышло на первое место в App Store США, обогнав ChatGPT.

27 января акции Nvidia упали на 17% — $589 млрд капитализации за один день, крупнейшее однодневное падение в истории фондового рынка США. Nasdaq потерял около 3%, суммарная просадка рынка — примерно $1 трлн. За неделю до этого анонсировали Stargate с вложениями до полутриллиона долларов в дата-центры, а OpenAI собирал раунд на $40 млрд. Обе цифры подкреплялись уверенностью, что количество видеокарт даёт преимущество, которое нельзя обесценить за семь дней.

Читать далее

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
2
Робот-секретарь для банка? Никто не просил — а он уже запилен

Этот чел тащится решать нерешаемые проблемы, обожает упрощать людям жизнь и вечно тестит гипотезы. Его конек — собирать продукты, от которых глаз горит. Именно с таким багажом его позвали в Уралсиб. Ну а там он взял и забахал робота-секретаря: тот разруливает встречи и созвоны.

Читать далее

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
2
Документы нужно передать наружу, но перед этим — убрать персональные данные: фамилии, телефоны, адреса, подписи. Всё происходит в закрытом контуре, без интернета, на одной машине с одной видеокартой.

С фамилиями автор разобрался за неделю. На подписи ушло полтора месяца — и примерно половина этого времени ушла на то, чтобы похоронить очевидные решения.

Читать далее: https://habr.com/ru/articles/1079484/

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
🤣 Наконец-то батя покажет, как он в детстве ходил в школу за 100 верст

💥 xCode Journal
Please open Telegram to view this post
VIEW IN TELEGRAM
😁11
🤩 Нашли репу с десятками практических проектов для прокачки навыков и резюме

Внутри 54 проекта разной сложности по Terraform, Kubernetes, Docker, CI/CD, DevSecOps, AWS, Azure, безопасности и мониторингу.

Есть полноценные лабораторные с кодом и конфигами и также пошаговые гайды — так что можно разобраться, повторить всё своими руками и положить результат в портфолио.

✖️ xCode Journal
Please open Telegram to view this post
VIEW IN TELEGRAM
6
Забудь про Whisper: русская диктовка работает мгновенно и без видеокарты

Автор краем уха услышал, что у Сбера есть открытая модель, которая на бенчмарках по русскому уделывает Whisper. Пошёл проверять — и оказалось, что она не просто не сливает, а шпарит моментально на обычном камне, без GPU, текст вылезает раньше, чем успеваешь отпустить клавишу. Потом сколотил диктовку для себя, скинул корешам, те подсели, посыпались хотелки — и за пару недель из этого вырос полноценный продукт.

Жмёшь правый ⌘ command, говоришь, отпускаешь — и текст с запятыми и заглавными уже воткнут туда, где стоял курсор. Цифры: фраза на 6 сек вставляется за 0.08 сек, запись на 30 сек распознаётся меньше чем за полсекунды, модель подгружается 0,22 сек. Всё локально, звук никуда с компа не уходит, модель весит 204 МБ, приложение 32 МБ, крутится на процессоре, видюху не трогаем, код открыт, лицензия MIT. С именем выпендриваться не стал — раз пишет под диктовку, пусть будет Писарь.

Почему Писарь, а не Whisper: Whisper — модель прекрасная, но она универсал на сотню языков, и русский там далеко не в приоритете, плюс тяжёлая, на процессоре еле ползёт, поэтому обёртки тащат её на видюху, мак греется, комп тормозит, а текст всё равно приходит с задержкой, да и с русским у Whisper беда — падежи, окончания, пунктуация. GigaAM, на которой собран Писарь, Сбер обучал именно под русский, и на нём она заметно точнее, плюс сама расставляет пунктуацию и заглавные, а английские вкрапления в русской речи (термины, названия) переваривает как надо.

Читать далее

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
😁53👍2
Мы научили песок думать

Сегодня один из главных вопросов звучит так: а ИИ, часом, не разогнался дальше, чем нужно?

Марк Андриссен, венчурный инвестор, недавно сжал весь этот движ в одну фразу: «Мы научили песок думать».

Читать далее

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
4😁1
Утечка на 3.5 часа вперёд: как модель полтора месяца надувала сама себя — и как её застукали

Классика ML на временных рядах: на истории всё шикарно, а в бою — слив. Вот и тут модель заглядывала в будущее на 3.5 часа, а виноват кривой ресемплинг 4-часовых свечей.

Дальше — анатомия этой утечки, математика позиционного теста, которым такое ловится, и сниппет, чтобы больше в это не влетать.

Читать далее

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3🔥1
Как 17B активных разносят 70B плотных: анатомия Mixture-of-Experts (MoE)

Прохлопал тот момент, когда разработчики нейронок мерились, у кого циферка рядом с названием модели толще? А когда протёр глаза — нихрена себе, уже модно выпендриваться скромным числом активных параметров. Тогда эта статья ровно для тебя.

Сегодня разжуют без соплей: с какого такого перепуга все опенсорсные флагманы разом уехали в MoE, почему Qwen3.5 на 397 миллиардов параметров строчит токены так, будто у неё всего 17, и почему на видеокартах при этом никто не разорился. А тем, кто зашёл «только спросить», сольют тайну: и в каком кабинете, собственно, обитает тот самый медицинский эксперт.

Читать далее

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
4
Захотел проверить, правда ли AI-инженеров сейчас рвут с руками. Спойлер: 84% вакансий про ИИ — тишина

Сел я на досуге подумать: а сколько вообще на рынке нужно народу, который шарят в AI? Ощущение у всех одинаковое — ИИ повсюду, без него никуда, каждый второй пост в ленте про агентов. А что по факту с рынком труда?

Спарсил, значит, hh.ru (без помощи LLM, ясное дело, не обошлось), взял все активные вакансии в 25 категориях раздела «Информационные технологии» по России — набралось 34 053 штуки. Потом прикинул, в скольких из них вообще есть упоминания языковых моделей и всего смежного: LLM, GPT, RAG, агенты, промпты, Cursor, LangChain, GigaChat и ещё пара десятков терминов. И отдельно — сколько прошёл по полному тексту описания: 853 вакансии.

Правду ищи — habr.com

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
4
Когда ИИ-подписки отправят в отмену? Разбираем, что реально дают за $20

Поначалу автор думал, что просто тупит и не может нарыть нужное в настройках: а сколько токенов вообще насыпают по подписке? ChatGPT Plus, Claude Pro и Google AI Pro держатся где-то у $20, и жирные тарифы тоже подозрительно дружно упираются в те же $100 и $200. Вроде всё сходится: осталось выяснить, где токенов отсыпают больше, и брать там.

Ага, щас.

Читать далее

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
😁1
Manticore Search 29.9.0: chunked auto-embeddings и mmap-доступ к columnar-атрибутам

В Manticore Search 29.9.0 появились chunked и multi-vector auto-embeddings, ограничение входа для embedding-моделей, UTF-8 идентификаторы, а также mmap-доступ к columnar-атрибутам по умолчанию.

Кроме того, релиз включает исправления для hybrid search, KNN, bulk ingestion и группировки.

Читать далее

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM