Ученые представили EGGROLL (Evolution Guided General Optimization via Low-rank Learning) — новый алгоритм для обучения огромных нейросетей без обратного распространения ошибки. Метод использует хитрые математические приемы, чтобы сделать эволюционные стратегии быстрыми и экономичными даже для моделей с миллиардами параметров. EGGROLL не уступает по качеству существующим методам, но требует значительно меньше памяти и вычислений.
👉 DataFrog | #datascience
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2
This media is not supported in your browser
VIEW IN TELEGRAM
Не хотите подключать целый ML-трекер только чтобы давать экспериментам понятные имена вроде eternal-rabbit-123?
Для этой задачи есть минималистичная библиотека
Установка:
Репозиторий: https://github.com/nebbles/hruid-python
👉 DataFrog | #datascience #code
Для этой задачи есть минималистичная библиотека
hruid. Она делает ровно одно — генерирует уникальные и читаемые идентификаторы по шаблону число-прилагательное-существительное-глагол-наречие.import hruid
generator = hruid.Generator()
phrase = generator.random()
print(phrase)
11-suspicious-owls-consume-eagerly
Установка:
pip install hruidРепозиторий: https://github.com/nebbles/hruid-python
Please open Telegram to view this post
VIEW IN TELEGRAM
Перестаньте бояться алгоритмов! Они ваш друг, а не враг 🤝
Многие разработчики панически боятся алгоритмов на собеседованиях: «Я не олимпиадник!», «Зачем это, если есть Pandas?». Но спешу успокоить — алгосекция проверяет не знание экзотических структур данных, а нечто гораздо более важное.
Что на самом деле проверяют на собеседовании?
▪️ Умение мыслить структурно и декомпозировать задачу.
▪️Способность продумывать решение до написания кода.
▪️Внимательность к деталям и краевым случаям.
По сути, интервьюер хочет убедиться: с вами можно работать в команде, и вы не создадите тонну багов.
Почему алгоритмы — это прокачка навыков?
Представьте, что вы жмёте штангу в зале. Вы ведь не будете делать это в реальной жизни? Но это тренирует мышцы, которые пригодятся everywhere.
С алгоритмами та же история. Решая задачу о ступеньках, вы вряд ли будете применять это на практике. Но ваш мозг учится:
▪️Видеть закономерности
▪️Оптимизировать решения
▪️Предвидеть ошибки
Вывод:
Алгоритмы — это не препятствие, а ваш союзник. Они качают навыки, которые делают вас сильнее как разработчика. На собеседовании важна не идеальность решения, а демонстрация системного подхода😊
👉 DataFrog | #datascience #алгоритмы
Многие разработчики панически боятся алгоритмов на собеседованиях: «Я не олимпиадник!», «Зачем это, если есть Pandas?». Но спешу успокоить — алгосекция проверяет не знание экзотических структур данных, а нечто гораздо более важное.
Что на самом деле проверяют на собеседовании?
▪️ Умение мыслить структурно и декомпозировать задачу.
▪️Способность продумывать решение до написания кода.
▪️Внимательность к деталям и краевым случаям.
По сути, интервьюер хочет убедиться: с вами можно работать в команде, и вы не создадите тонну багов.
Почему алгоритмы — это прокачка навыков?
Представьте, что вы жмёте штангу в зале. Вы ведь не будете делать это в реальной жизни? Но это тренирует мышцы, которые пригодятся everywhere.
С алгоритмами та же история. Решая задачу о ступеньках, вы вряд ли будете применять это на практике. Но ваш мозг учится:
▪️Видеть закономерности
▪️Оптимизировать решения
▪️Предвидеть ошибки
Как правильно подходить к решению?❌ Плохо:
Сразу писать код, надеясь на авось.✅ Хорошо:
Читаешь задачу → пишешь тесты.
Проговариваешь решение → ловишь баги в голове.
Только потом кодишь.
И вот уже у тебя не просто решение, а решение, которое выглядит профессионально. Интервьюер думает: «ага, с этим чуваком можно работать».
Совет по подготовке:
▪️Сфокусируйтесь на LeetCode Easy/Medium
▪️Практикуйтесь мыслить вслух. Даже если ошибся — ничего страшного, это норм. Хуже молчать и сидеть с каменным лицом.
▪️Составьте шпаргалку с паттернами (two pointers, хеш-таблицы, динамическое программирование)
Вывод:
Алгоритмы — это не препятствие, а ваш союзник. Они качают навыки, которые делают вас сильнее как разработчика. На собеседовании важна не идеальность решения, а демонстрация системного подхода
Please open Telegram to view this post
VIEW IN TELEGRAM
Подготовили ML-словарик
Читайте и сохраняйте, что-то из этого наверняка вам пригодится на собеседованиях👀
👉 DataFrog | #datascience #ml
Читайте и сохраняйте, что-то из этого наверняка вам пригодится на собеседованиях
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2
Классика жанра по оценке ML-моделей
Нашел отличный материал для закрепления основ — статья «Model Evaluation, Model Selection, and Algorithm Selection in Machine Learning»
Если чувствуете, что в фундаментальных знаниях есть пробелы, или нужно объяснить коллегам "как правильно" — эта статья идеальный вариант. Читается довольно быстро и расставляет все по полочкам.
👉 DataFrog | #datascience #machinelearning
Нашел отличный материал для закрепления основ — статья «Model Evaluation, Model Selection, and Algorithm Selection in Machine Learning»
Это, по сути, готовый учебник на 49 страницах, где разжеваны все ключевые моменты корректной работы с моделями:
- Как правильно оценивать качество модели.
- Как избежать утечки данных (data leakage) — главной причины неработающих моделей на проде.
- Как честно сравнивать между собой разные алгоритмы.
Если чувствуете, что в фундаментальных знаниях есть пробелы, или нужно объяснить коллегам "как правильно" — эта статья идеальный вариант. Читается довольно быстро и расставляет все по полочкам.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥4
This media is not supported in your browser
VIEW IN TELEGRAM
Тем временем в Сан-Франциско прямо сейчас проходит OpenAI DevDay. Вот что уже показали:
➡️ Realtime api с минимальной задержкой. Это возможность встроить в свое приложение настоящий speech-to-speech. Будет доступно по цене базовой модели.
➡️ Vision файнтюнинг. Теперь можно тюнить свои модели с использованием изображений.
➡️ Завозят набор инструментов для кастомных дистилляций и ускорения моделей.
➡️ Finally: кэширование промптов, которое уже давно появилось у DeepSeek и Anthropic. На кэшированные промпты цена будет в половину меньше.
➡️ Интрумент для оценки моделей: можно будет нормально эвалить свои приложения.
👉 DataFrog | #datascience
Please open Telegram to view this post
VIEW IN TELEGRAM
Третий месяц рассылаешь резюме на ML/DS вакансии. На hh, на Хабре, везде. В ответ тишина, даже до собеседования не доходишь. А на редкие, которые всё-таки случаются, приходишь и валишься на технике.
Знакомо?
Я Богдан, ML-инженер с 6+ годами опыта. Веду канал «Раскатываем ML кабины». Честно разбираю собесы, рынок и реальные кейсы учеников.
Например, недавно расписал кейс аналитика. 4 года в данных, зарабатывал 200к, хотел вырасти. За 7 месяцев перекатился в ML. Финал: 8 офферов от 350к, выбрал лучший на 500к на руки в крупной российской компании. Полный разбор подготовки и переговоров в канале.
А ещё у нас крутая пиратская тематика 🏴☠️
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2
Модель обучается, но результаты нестабильны? Метрики скачут, признаки мешают друг другу, а причина неочевидна. Часто проблема скрыта в данных: корреляция и мультиколлинеарность искажают результат.
🦾 На открытом уроке разберём, как выявлять зависимые признаки и работать с размерностью данных. Покажем, как применять метод анализа главных компонент (PCA) для выделения действительно значимой информации.
Вы увидите, как упрощать пространство признаков, повышать устойчивость моделей и улучшать качество прогнозирования, особенно в задачах временных рядов. Это важный этап, без которого сложно перейти от экспериментов к стабильным решениям.
Реклама. ООО «Отус онлайн-образование», ОГРН 1177746618576Please open Telegram to view this post
VIEW IN TELEGRAM
На Stepik вышел курс — «RAG-системы на векторных базах данных».
RAG нельзя оценивать по ощущению: «вроде отвечает нормально».
Нужны тестовые вопросы, метрики retrieval, контроль порога «не знаю» и понимание, где система теряет релевантные документы.
В курсе разбираем:
- Qdrant, Weaviate, FAISS
- эмбеддинги и чанкинг
- HNSW, IVF-PQ и индексы для скорости/памяти
- hybrid search: ANN + BM25
- Recall@K, Precision@K, nDCG, MRR
- порог для отсечения нерелевантных ответов
- мониторинг качества и CI/CD для RAG
Внутри — практика с рецензированием и реальные боевые задачи: собрать RAG-пайплайн, настроить retrieval, подобрать метрики и понять, почему система теряет релевантные документы.
Курс для тех, кто хочет выкатывать AI-поиск не вслепую, а через измеримые критерии качества.
Скидка 25% действует 72 часа.
Открыть курс
RAG нельзя оценивать по ощущению: «вроде отвечает нормально».
Нужны тестовые вопросы, метрики retrieval, контроль порога «не знаю» и понимание, где система теряет релевантные документы.
В курсе разбираем:
- Qdrant, Weaviate, FAISS
- эмбеддинги и чанкинг
- HNSW, IVF-PQ и индексы для скорости/памяти
- hybrid search: ANN + BM25
- Recall@K, Precision@K, nDCG, MRR
- порог для отсечения нерелевантных ответов
- мониторинг качества и CI/CD для RAG
Внутри — практика с рецензированием и реальные боевые задачи: собрать RAG-пайплайн, настроить retrieval, подобрать метрики и понять, почему система теряет релевантные документы.
Курс для тех, кто хочет выкатывать AI-поиск не вслепую, а через измеримые критерии качества.
Скидка 25% действует 72 часа.
Открыть курс
⚠Хотите разобраться, как обучать интеллектуальных
агентов в нестандартных задачах для бизнеса? Начните обучение на курсе «Reinforcement Learning».
🎁Записывайтесь на 3 бесплатных вебинара — познакомьтесь с программой обучения и преподавателями. Задайте свои вопросы экспертам!
Вебинар 1: «Обучение с подкреплением - гибкий подход для сложных задач. Создаем собственные окружения».
⏰7 июля в 20:00 мск
Программа вебинара:
1. Краткое введение в обучение с подкреплением.
2. Обзор существующих сред и переход к созданию собственного RL-окружения на Python.
3. Напишем свою среду на основе gym.Env и подключим к ней обучающегося агента.
Вебинар 2: «Visual DQN: Как научить ИИ-модель видеть мир глазами игрока».
⏰15 июля в 20:00 мск
Программа вебинара:
1. Разберем, как DQN работает с изображениями:
как агент получает состояние не в виде чисел, а в виде сырых пикселей с экрана.
2. Изучим архитектуру DeepMind-подхода.
3. Запустим обучение DQN в среде Atari Pinball и посмотрим, как агент постепенно учится играть лучше человека.
Вебинар 3: «Алгоритм DQN - учим нейросеть принимать решение без помощи человека».
⏰21 июля в 20:00 мск
Программа вебинара:
1. Разберем устройство алгоритма DQN: как нейросеть заменяет Q-таблицу и учится выбирать лучшие действия.
2. Изучим ключевые механизмы DQN.
3. Обучим агента решать задачу в среде Gymnasium и проанализируем процесс обучения.
Записывайтесь ➡ https://clck.su/xYlCF
Реклама. ООО «Отус онлайн-образование», ОГРН 1177746618576
агентов в нестандартных задачах для бизнеса? Начните обучение на курсе «Reinforcement Learning».
🎁Записывайтесь на 3 бесплатных вебинара — познакомьтесь с программой обучения и преподавателями. Задайте свои вопросы экспертам!
Вебинар 1: «Обучение с подкреплением - гибкий подход для сложных задач. Создаем собственные окружения».
⏰7 июля в 20:00 мск
Программа вебинара:
1. Краткое введение в обучение с подкреплением.
2. Обзор существующих сред и переход к созданию собственного RL-окружения на Python.
3. Напишем свою среду на основе gym.Env и подключим к ней обучающегося агента.
Вебинар 2: «Visual DQN: Как научить ИИ-модель видеть мир глазами игрока».
⏰15 июля в 20:00 мск
Программа вебинара:
1. Разберем, как DQN работает с изображениями:
как агент получает состояние не в виде чисел, а в виде сырых пикселей с экрана.
2. Изучим архитектуру DeepMind-подхода.
3. Запустим обучение DQN в среде Atari Pinball и посмотрим, как агент постепенно учится играть лучше человека.
Вебинар 3: «Алгоритм DQN - учим нейросеть принимать решение без помощи человека».
⏰21 июля в 20:00 мск
Программа вебинара:
1. Разберем устройство алгоритма DQN: как нейросеть заменяет Q-таблицу и учится выбирать лучшие действия.
2. Изучим ключевые механизмы DQN.
3. Обучим агента решать задачу в среде Gymnasium и проанализируем процесс обучения.
Записывайтесь ➡ https://clck.su/xYlCF
Реклама. ООО «Отус онлайн-образование», ОГРН 1177746618576
Pandas Workout: 200
exercises to make you
a stronger data analyst
Автор: Lerner Reuven
Год издания: 2024
#ds #en
Скачать книгу
exercises to make you
a stronger data analyst
Автор: Lerner Reuven
Год издания: 2024
#ds #en
Скачать книгу
Роадмап по математике для начинающих ML специалистов
Все, кто начинает путь в машинном обучении, сталкиваются с вопросом: «Какую математику нужно знать и в каком порядке?». Огромный объем информации пугает.
Автор блога The Palindrome предлагает четкий и структурированный путь, который разбивает на части эту большую задачу.
Главная идея роадмапа: не зубрежка, а понимание связей🔆
Оригинал статьи с более глубоким погружением: The Roadmap of Mathematics for Machine Learning
👉 DataFrog | #datascience #ml
Все, кто начинает путь в машинном обучении, сталкиваются с вопросом: «Какую математику нужно знать и в каком порядке?». Огромный объем информации пугает.
Автор блога The Palindrome предлагает четкий и структурированный путь, который разбивает на части эту большую задачу.
Что конкретно в ней освещается:
1. Линейная алгебра (Linear Algebra) — язык данных
Данные в ML — это векторы и матрицы. Линейная алгебра — инструмент для работы с ними.
2. Математический анализ (Calculus) — основа оптимизации
ML — это поиск оптимальных параметров модели. Анализ дает инструменты для этого поиска.
3. Многомерный анализ (Multivariable Calculus) — двигатель градиентного спуска
Реальные модели имеют тысячи параметров. Нужно уметь оптимизировать в многомерных пространствах.
4. Теория вероятностей (Probability Theory) — работа с неопределенностью
Мир данных не детерминирован. Вероятность дает язык для описания неопределенности и построения моделей, которые работают с шумом.
Главная идея роадмапа: не зубрежка, а понимание связей
Оригинал статьи с более глубоким погружением: The Roadmap of Mathematics for Machine Learning
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3🥰1
Игровая платформа анонсировала функцию Build, которая превращает простой запрос в готовую базу игры.
Под капотом целый набор ИИ-моделей, открытых и собственных - они отвечают за игровые механики, окружение, персонажей, визуальный стиль и звук.
В геймдеве опасаются, что когда порог входа падает до текстового запроса, платформу зальёт поток AI-слопа, а авторам придётся конкурировать с ИИ-контентом, который штампуется в разы быстрее ручной работы.
Общее настроение индустрии при этом тревожное - по свежему опросу конференции GDC, 52% профессионалов игровой отрасли считают, что генеративный ИИ вредит геймдеву.
Ответ Roblox - ранжирование по удержанию игроков, как и для обычных игр. То есть если в игру никто не играет, её никто и не найдёт.
Публичное альфа-тестирование Build стартует 28 июля в Новой Зеландии для пользователей от 9 лет с подтверждённым возрастом.
Публиковать свои творения на глобальную аудиторию смогут те, кому исполнилось 16. Будет бесплатная базовая версия и платные тарифы.
Roblox также готовит ИИ-агентов, которые помогут авторам с плейтестами и аналитикой, а ещё с ноября прошлого года обучает модель, генерирующую редактируемые 3D-сцены.
На этом фоне компания закрывает видеозвонки через аватаров Roblox Connect, запущенные в 2023 году.
Приоритеты, судя по всему, расставлены.
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1👍1🔥1
This media is not supported in your browser
VIEW IN TELEGRAM
Вышла KIMI K3
Новая мощная китайская модель, которую очень хвалят. 2,8 трлн параметров. Хвалят до того, что называют ее третьей по уровню интеллекта моделью после Fable 5 и GPT-5.6.
Я решил проверить ее на создании WebGL-сайта выдуманной студии. Один промпт, 16 мин работы, ни единой правки.
Люблю тестить новые модельки на threejs проектах, новая KIMI молодец!
Тут тестим KIMI K3
А тут можно посмотреть сайт, который я с ней сделал поближе.
Новая мощная китайская модель, которую очень хвалят. 2,8 трлн параметров. Хвалят до того, что называют ее третьей по уровню интеллекта моделью после Fable 5 и GPT-5.6.
Я решил проверить ее на создании WebGL-сайта выдуманной студии. Один промпт, 16 мин работы, ни единой правки.
Люблю тестить новые модельки на threejs проектах, новая KIMI молодец!
Тут тестим KIMI K3
А тут можно посмотреть сайт, который я с ней сделал поближе.
👍4❤1
Как Netflix использует ИИ?
В квартальном отчёте перед инвесторами компания рассказала, что нейросети применялись в создании примерно 300 проектов этого года. Речь об использовании на любых стадиях производства: от концептов до постпродакшена. В отчёте выделили создание «сложных сцен» с помощью ИИ для:
🟣 индийского спортивного триллера «Слава»
🟣 американского исторического мини-сериала «Американский эксперимент»
🟣 бразильской футбольной драмы «Бразилия 70’: Третья звезда».
В них нейросети использовали для прорисовки толпы, исторических баталий и экспозиционных кадров. При этом глава Netflix Тед Сарандос отметил, что не собирается заменять нейросетями креативных экспертов.
А вы стали замечать больше следов нейросетей в сериалах и фильмах?
В квартальном отчёте перед инвесторами компания рассказала, что нейросети применялись в создании примерно 300 проектов этого года. Речь об использовании на любых стадиях производства: от концептов до постпродакшена. В отчёте выделили создание «сложных сцен» с помощью ИИ для:
В них нейросети использовали для прорисовки толпы, исторических баталий и экспозиционных кадров. При этом глава Netflix Тед Сарандос отметил, что не собирается заменять нейросетями креативных экспертов.
А вы стали замечать больше следов нейросетей в сериалах и фильмах?
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1🔥1
📉 На валидации 0.92. В проде 0.61.
Модель прекрасно работала в ноутбуке и развалилась, как только увидела настоящие данные. Утечка в признаках, дрейф, метрика, которая мерила не то.
Data Scientist: от данных до деплоя моделей — про весь путь после ноутбука.
⚙️ Данные и признаки: EDA, feature engineering, data leakage, стабильность признаков
📊 Обучение и оценка: baseline и gradient boosting, experiment tracking, error analysis, ложное улучшение качества
🚀 Прод: inference API, batch-инференс, quality gates, CI/CD, мониторинг data drift
▶️ 9 секций, 46 уроков. Первые уроки открыты — посмотреть можно бесплатно
🧩 Нужен Python и pandas; если просядете, тренажёры на платформе бесплатные
🏷 Внутри промокод ML_BOOKS — 30%, двое суток
➜ Открыть первый урок
Модель прекрасно работала в ноутбуке и развалилась, как только увидела настоящие данные. Утечка в признаках, дрейф, метрика, которая мерила не то.
Data Scientist: от данных до деплоя моделей — про весь путь после ноутбука.
⚙️ Данные и признаки: EDA, feature engineering, data leakage, стабильность признаков
📊 Обучение и оценка: baseline и gradient boosting, experiment tracking, error analysis, ложное улучшение качества
🚀 Прод: inference API, batch-инференс, quality gates, CI/CD, мониторинг data drift
▶️ 9 секций, 46 уроков. Первые уроки открыты — посмотреть можно бесплатно
🧩 Нужен Python и pandas; если просядете, тренажёры на платформе бесплатные
🏷 Внутри промокод ML_BOOKS — 30%, двое суток
➜ Открыть первый урок