#life
Наконец появилась в открытом доступе запись нашего с Димой выступления на PyCon!
https://www.youtube.com/watch?v=ZyZWUISEWg8
Наконец появилась в открытом доступе запись нашего с Димой выступления на PyCon!
https://www.youtube.com/watch?v=ZyZWUISEWg8
YouTube
Дмитрий Тихомиров. Полное погружение в Causal Inference. Практическое применение в HypEx
Дмитрий Тихомиров
Руководитель направления по исследованию данных, Сбер
Мастер-класс: Полное погружение в Causal Inference. Практическое применение в HypEx
В этом мастер-классе мы погрузимся в технические детали и практическое применение библиотеки HypEx…
Руководитель направления по исследованию данных, Сбер
Мастер-класс: Полное погружение в Causal Inference. Практическое применение в HypEx
В этом мастер-классе мы погрузимся в технические детали и практическое применение библиотеки HypEx…
🔥3
#life
Часть 2: цели на 2025
Порядок произвольный.
🧘♂ Найти духовный и физический баланс. В духовном плане это разнообразие деятельности. Больший акцент на творчестве. В физическом плане я целюсь в прохождение скрининга здоровья и дебагинга проблем, если они обнаружаться, далее программа ухода за кожей, ну и в каких-то конкретных метриках - сброс 10 кг.
🏯 Завершить в прямом смысле долгострой - ремонт в своей хате и переехать. Отчасти тоже чать духовного балансирования.
🗽 Поклеить красавца на изображении 1.
📖 Изучить библиотеку ClustPy и все связанные с ней статьи.
📖 Прочитать минимум 3 книги: "Внутри CPython", "Чистый Python", "Чистая архитектура". Как видите, стремимся к чистоте.
🤲 Open-source. Тут амбициозно. Реализовать 12 архитектуру HypEx. Надеюсь, что книги по архитектуре будут тут полезны. И разработать исследовательский стенд кластеризации на базе HypEx.
👩💻 😶🌫 Реализовать кальянную базу знаний. В основном, про табаки и миксы.
✏️ Реализовать фреймворк формальной структуаризации знаний. Это графовая структура с формальной семантикой блоков и не формальными блоками на естественном языке с автоматической визуализацией.
Целей много и они весьма амбициозные. Не факт, что все получится за год. Но направляющие такие.
Часть 2: цели на 2025
Порядок произвольный.
🧘♂ Найти духовный и физический баланс. В духовном плане это разнообразие деятельности. Больший акцент на творчестве. В физическом плане я целюсь в прохождение скрининга здоровья и дебагинга проблем, если они обнаружаться, далее программа ухода за кожей, ну и в каких-то конкретных метриках - сброс 10 кг.
🏯 Завершить в прямом смысле долгострой - ремонт в своей хате и переехать. Отчасти тоже чать духовного балансирования.
🗽 Поклеить красавца на изображении 1.
📖 Прочитать минимум 3 книги: "Внутри CPython", "Чистый Python", "Чистая архитектура". Как видите, стремимся к чистоте.
Целей много и они весьма амбициозные. Не факт, что все получится за год. Но направляющие такие.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2🔥2
Forwarded from AbstractDL
DeepSeek-R1 для чайников
Ну и наделала же DeepSeek шуму. Мне пришлось целый хабропост написать 😁
TLDR: мало слов про сравнение с ChatGPT и метрики, много слов про технические детали обучения, датасеты, GRPO и якобы эмерджентный «Aha! moment».
Ну и наделала же DeepSeek шуму. Мне пришлось целый хабропост написать 😁
TLDR: мало слов про сравнение с ChatGPT и метрики, много слов про технические детали обучения, датасеты, GRPO и якобы эмерджентный «Aha! moment».
😁1
Dmatryusофрения
dmlab.pdf
#dmml_lab
#hypex
Иногда пора вспомнить старое. Ещё до HypEx я начинал работать с ML пайпланами в либе DmML-lab.
Эти идеи легли в основу ядра новой архитектуры HypEx, но были в нем развиты гораздо сильнее. Результаты HypEx сделали бессмысленной дальнейшую работу над StatBox и DmML-lab, так как их идеи лучше реализуемы в рамках ядра HypEx. Поэтому я создал форк от HypEx, где будет только ядро. Сейчас там не актуальная версия, так что ссылку не даю.
Сейчас я как раз начал лучше прорабатывать ML пайплайны в HypEx и возвращение к этой схеме стало источником вдохновения.
Так же сейчас мы проводим весьма интересное исследование с применением ML, что (как обычно) сподвигло меня выносить интересные решения в минипакет с утилками. Пока нигде его не публикую, но если интересно, можете глянуть.
В дальнейшем эти утилки должны сталь экзекуторами на базе HypEx core и тогда можно будет сделать новую версию либы DmML-lab.
#hypex
Иногда пора вспомнить старое. Ещё до HypEx я начинал работать с ML пайпланами в либе DmML-lab.
Эти идеи легли в основу ядра новой архитектуры HypEx, но были в нем развиты гораздо сильнее. Результаты HypEx сделали бессмысленной дальнейшую работу над StatBox и DmML-lab, так как их идеи лучше реализуемы в рамках ядра HypEx. Поэтому я создал форк от HypEx, где будет только ядро. Сейчас там не актуальная версия, так что ссылку не даю.
Сейчас я как раз начал лучше прорабатывать ML пайплайны в HypEx и возвращение к этой схеме стало источником вдохновения.
Так же сейчас мы проводим весьма интересное исследование с применением ML, что (как обычно) сподвигло меня выносить интересные решения в минипакет с утилками. Пока нигде его не публикую, но если интересно, можете глянуть.
В дальнейшем эти утилки должны сталь экзекуторами на базе HypEx core и тогда можно будет сделать новую версию либы DmML-lab.
GitHub
dmml-lab/utils at main · Dmatryus/dmml-lab
Contribute to Dmatryus/dmml-lab development by creating an account on GitHub.
👌2
Dmatryusофрения
#dmml_lab #hypex Иногда пора вспомнить старое. Ещё до HypEx я начинал работать с ML пайпланами в либе DmML-lab. Эти идеи легли в основу ядра новой архитектуры HypEx, но были в нем развиты гораздо сильнее. Результаты HypEx сделали бессмысленной дальнейшую…
#dmml_lab
Обзор полезностей в утилках. Часть 1.
ModelData
В файле dataset.py лежит класс
В
Обзор полезностей в утилках. Часть 1.
ModelData
В файле dataset.py лежит класс
ModelData. Мне очень не нравится классические X_train, y_train и т.д. Всегда раздражало эта запись, ещё и не питонячая. В
ModelData можно передать фичи и таргет и выполнить разбиение на группы или передать готовое. При этом нужный сабсет получается удобной функцией get_data("train", "features"). Бонусом умеет скачивать и встраивать в свой объект классический датасет для регрессии о домах Калифорнии.Forwarded from ИИ Песочница Sber AI Lab
Library Innovation Lab Гарварда недавно зарелизил открытое хранилище госдатасетов, собранных из различных источников, которые имеют ценность для ресерчей, DS-задач и просто любопытных умов.
Сейчас хранилище включает 311k датасетов (16 ТБ) из data.gov. Хранилище будет обновляться ежедневно, по мере добавления новых данных в data.gov и другие источники, что обеспечит более надёжное сохранение данных. Данные можно брать по названию или сразу пакетом файлов.
Чекайте, вдруг пригодится
#обзоры
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
Остался последний рывок для релиза новой архитектуры HypEx. Сейчас мы делаем последние фиксы, дописываем тесты и можно пользоваться!
Надо сказать, что релиз у нас будет не идеальный. Мы не везде написали докстринги, тесты пока поверхностные, и не все методы и классы написаны идеально. Но к совершенству можно стремиться вечно, а штука уже рабочая и на её основе мы пилим платформу. Где-то в новой версии функциональности больше, где-то меньше.
В общем, тут пока релиз с ворнингами о переходе на новую архитектуру и микрофиксами. Но уже скоро будет и новая архитектура!
Надо сказать, что релиз у нас будет не идеальный. Мы не везде написали докстринги, тесты пока поверхностные, и не все методы и классы написаны идеально. Но к совершенству можно стремиться вечно, а штука уже рабочая и на её основе мы пилим платформу. Где-то в новой версии функциональности больше, где-то меньше.
В общем, тут пока релиз с ворнингами о переходе на новую архитектуру и микрофиксами. Но уже скоро будет и новая архитектура!
❤🔥2
Forwarded from HypEx (Дмитрий Тихомиров)
Друзья, у нас большие новости! Уже совсем скоро HypEx обновится и перейдёт на новую архитектуру, что приведёт к значительным изменениям в API библиотеки
Мы хотим, чтобы этот переход прошёл максимально комфортно для всех пользователей, поэтому заранее предупреждаем о грядущих изменениях.
- Новый интерфейс библиотеки: изменятся пути импорта, методы классов и структура API.
- Старые версия (0.1.10 и младше) больше не будет поддерживаться, но её всё ещё можно будет использовать.
Мы приглашаем всех протестировать новую версию HypEx уже сейчас! Это отличная возможность заранее познакомиться с изменениями и дать нам обратную связь. Чтобы установить последнюю бета-версию, используйте команду:
pip install --upgrade --pre hypex
- Новые туториалы: мы подготовили подробные инструкции, чтобы вам было проще адаптироваться к обновлениям.
Что делать, если я не хочу ничего менять?
Если вы пока не готовы к обновлениям, вы можете продолжить использовать старую версию:
pip install hypex==0.1.10
Мы ценим ваше мнение! Если у вас есть вопросы, пожелания или вы столкнулись с проблемами, пишите нам в Telegram или создавайте issue на GitHub. Ваши отзывы помогут нам сделать HypEx ещё лучше!
Готовы к обновлениям? Тогда давайте тестировать вместе!
Please open Telegram to view this post
VIEW IN TELEGRAM
GitHub
HypEx/examples/tutorials at dev/architecture_v11 · sb-ai-lab/HypEx
Fast and customizable framework for automatic and quick Causal Inference in Python - sb-ai-lab/HypEx
🔥4
#review #iron
Обзор новейшей GPD WIN 4 (2025). Часть 1. Технические характеристики.
Сейчас это мой основной переносной компьютер.
Размер
Штука по размерам меньше Маленькости, хотя и толще (Изображения). За такие размеры его без лукавства можно назвать корманным. По крайней мере я его спокойно носил в кармане куртки. Кроме того он ещё и легче, чем Маленькость, которая тяжёлая из-за металлического корпуса. Тут корпус пластиковый зато массивное турбированное охлаждение.
Мощность
На борту у нас AMD Ryzen AI9 HX 370. Свежеиспеченный амдшный проц с нейроускорителями. Если честно, особо обзоров на него не смотрел. Поэтому расскажу больше про практический опыт в следующей части. По характеристикам весьма достойный ноутбучный проц. По мощности сопостовим с яблочным M4.
Видяха
Radeon 890M интеграшка. Тяжёлые игры не запускал, но машинка в целом чуть мощнее Steam Deck. Так что тянет все то же, но с чуть большим FPS.
Память
32 GB RAM, 2 TB SSD. Много, но по ощущениям медленная. А ещё это маркетинговые цифры, которые криво считаются на в двоичных метриках, а в десятиричных. Поэтому, реальной памяти меньше. Заметно, но не критично.
Питание
Кушает компьютер из аккумулятора на 45 Wh, что стандарт для устройств такого формата. При этом TDP процессора 28 W. Прошивка позволяет ограничить TDP. Я например играю в Darkest Dungeon на 5 W. Теоретически можно так играть 8 часов. На практике не проверял. Так что выходит, что время жизни устройства от 1 до 8 часов в зависимости от нагрузок. Поддерживается зарядка до 65 W. Зарядиться от такой зарядки можно довольно быстро.
Порты
У устройства всего 3 порта: 2 USB C и Oculink. Начнём с последнего. По сути это порт для внешней видяхи фирменной. Говорят, что по мощности схожа с 3070. Мне не надо, так что особо не интересовался. Скоость передачи 63 Gb/s. Так же внишнюю видяху (не фирменную) можно подключить через одни из USB C портов но со скоростью 40 Gb/s.
Экран
Нуу... Он есть) 6 дюймовый сенсорный IPS с высокой плотностью пикселей 60 герц, 1080p, Corning Gorilla Glass 5.
В следующем посте расскажу об опыте использования.
Обзор новейшей GPD WIN 4 (2025). Часть 1. Технические характеристики.
Сейчас это мой основной переносной компьютер.
Размер
Штука по размерам меньше Маленькости, хотя и толще (Изображения). За такие размеры его без лукавства можно назвать корманным. По крайней мере я его спокойно носил в кармане куртки. Кроме того он ещё и легче, чем Маленькость, которая тяжёлая из-за металлического корпуса. Тут корпус пластиковый зато массивное турбированное охлаждение.
Мощность
На борту у нас AMD Ryzen AI9 HX 370. Свежеиспеченный амдшный проц с нейроускорителями. Если честно, особо обзоров на него не смотрел. Поэтому расскажу больше про практический опыт в следующей части. По характеристикам весьма достойный ноутбучный проц. По мощности сопостовим с яблочным M4.
Видяха
Radeon 890M интеграшка. Тяжёлые игры не запускал, но машинка в целом чуть мощнее Steam Deck. Так что тянет все то же, но с чуть большим FPS.
Память
32 GB RAM, 2 TB SSD. Много, но по ощущениям медленная. А ещё это маркетинговые цифры, которые криво считаются на в двоичных метриках, а в десятиричных. Поэтому, реальной памяти меньше. Заметно, но не критично.
Питание
Кушает компьютер из аккумулятора на 45 Wh, что стандарт для устройств такого формата. При этом TDP процессора 28 W. Прошивка позволяет ограничить TDP. Я например играю в Darkest Dungeon на 5 W. Теоретически можно так играть 8 часов. На практике не проверял. Так что выходит, что время жизни устройства от 1 до 8 часов в зависимости от нагрузок. Поддерживается зарядка до 65 W. Зарядиться от такой зарядки можно довольно быстро.
Порты
У устройства всего 3 порта: 2 USB C и Oculink. Начнём с последнего. По сути это порт для внешней видяхи фирменной. Говорят, что по мощности схожа с 3070. Мне не надо, так что особо не интересовался. Скоость передачи 63 Gb/s. Так же внишнюю видяху (не фирменную) можно подключить через одни из USB C портов но со скоростью 40 Gb/s.
Экран
Нуу... Он есть) 6 дюймовый сенсорный IPS с высокой плотностью пикселей 60 герц, 1080p, Corning Gorilla Glass 5.
В следующем посте расскажу об опыте использования.
🤔2🦄2
🤝2❤1
#book@dm_projects_log
#viz
📚 Новая книга! Меня очень увлекает построение диаграмм, и я кайфую от крутых визуализаций данных. Книг на эту тему не много тем более на русском языке, поэтому я её взял даже особо не полистав.
🤓В аспирантуре я готовил миниисследование результатом которого стала высокоуровневая архитектура системы автоматического построения графиков по данным. Я выступал с этой работой на небольшой научной конференции, но в статью это так и не оформил. Одной из главных причин чему - отсутствие длстаточного количества хороших источников по теме. Так что тогда эта книга была бы весьма кстати. Преза и драфт статьи в следующем посте.
Сейчас это исследование выглядит несколько архаично в силу развития LLM, но тогда только вышла GPT 3 и хайп только-только поднимался.
Первый относительнопростой подход, который я бы предложил: это был бы агент с эвристикой/моделью анализирующей датасет, генератором промтов, LLM генерирующей код для рисования графиков и собственно экзекутором, который строил бы графики и сохранял их в заданном формате.
На самом деле подход генерацией кода, [О ужас 😱] его автоматическим исполнением мне не нравится. В идеале хотелось бы некоторый генератор пайплайнов по выходу из анализатора данных, ну и собственно фреймворк поддерживающий эти пайплайны. Я начинал что-то такое делать. Посмотреть можно здесь: https://github.com/Dmatryus/PlotAdapter . Сейчас я бы делал это по-другому.
#viz
📚 Новая книга! Меня очень увлекает построение диаграмм, и я кайфую от крутых визуализаций данных. Книг на эту тему не много тем более на русском языке, поэтому я её взял даже особо не полистав.
🤓В аспирантуре я готовил миниисследование результатом которого стала высокоуровневая архитектура системы автоматического построения графиков по данным. Я выступал с этой работой на небольшой научной конференции, но в статью это так и не оформил. Одной из главных причин чему - отсутствие длстаточного количества хороших источников по теме. Так что тогда эта книга была бы весьма кстати. Преза и драфт статьи в следующем посте.
Сейчас это исследование выглядит несколько архаично в силу развития LLM, но тогда только вышла GPT 3 и хайп только-только поднимался.
Первый относительнопростой подход, который я бы предложил: это был бы агент с эвристикой/моделью анализирующей датасет, генератором промтов, LLM генерирующей код для рисования графиков и собственно экзекутором, который строил бы графики и сохранял их в заданном формате.
На самом деле подход генерацией кода, [О ужас 😱] его автоматическим исполнением мне не нравится. В идеале хотелось бы некоторый генератор пайплайнов по выходу из анализатора данных, ну и собственно фреймворк поддерживающий эти пайплайны. Я начинал что-то такое делать. Посмотреть можно здесь: https://github.com/Dmatryus/PlotAdapter . Сейчас я бы делал это по-другому.