Dmatryusофрения
dmlab.pdf
#dmml_lab
#hypex
Иногда пора вспомнить старое. Ещё до HypEx я начинал работать с ML пайпланами в либе DmML-lab.
Эти идеи легли в основу ядра новой архитектуры HypEx, но были в нем развиты гораздо сильнее. Результаты HypEx сделали бессмысленной дальнейшую работу над StatBox и DmML-lab, так как их идеи лучше реализуемы в рамках ядра HypEx. Поэтому я создал форк от HypEx, где будет только ядро. Сейчас там не актуальная версия, так что ссылку не даю.
Сейчас я как раз начал лучше прорабатывать ML пайплайны в HypEx и возвращение к этой схеме стало источником вдохновения.
Так же сейчас мы проводим весьма интересное исследование с применением ML, что (как обычно) сподвигло меня выносить интересные решения в минипакет с утилками. Пока нигде его не публикую, но если интересно, можете глянуть.
В дальнейшем эти утилки должны сталь экзекуторами на базе HypEx core и тогда можно будет сделать новую версию либы DmML-lab.
#hypex
Иногда пора вспомнить старое. Ещё до HypEx я начинал работать с ML пайпланами в либе DmML-lab.
Эти идеи легли в основу ядра новой архитектуры HypEx, но были в нем развиты гораздо сильнее. Результаты HypEx сделали бессмысленной дальнейшую работу над StatBox и DmML-lab, так как их идеи лучше реализуемы в рамках ядра HypEx. Поэтому я создал форк от HypEx, где будет только ядро. Сейчас там не актуальная версия, так что ссылку не даю.
Сейчас я как раз начал лучше прорабатывать ML пайплайны в HypEx и возвращение к этой схеме стало источником вдохновения.
Так же сейчас мы проводим весьма интересное исследование с применением ML, что (как обычно) сподвигло меня выносить интересные решения в минипакет с утилками. Пока нигде его не публикую, но если интересно, можете глянуть.
В дальнейшем эти утилки должны сталь экзекуторами на базе HypEx core и тогда можно будет сделать новую версию либы DmML-lab.
GitHub
dmml-lab/utils at main · Dmatryus/dmml-lab
Contribute to Dmatryus/dmml-lab development by creating an account on GitHub.
👌2
Dmatryusофрения
#dmml_lab #hypex Иногда пора вспомнить старое. Ещё до HypEx я начинал работать с ML пайпланами в либе DmML-lab. Эти идеи легли в основу ядра новой архитектуры HypEx, но были в нем развиты гораздо сильнее. Результаты HypEx сделали бессмысленной дальнейшую…
#dmml_lab
Обзор полезностей в утилках. Часть 1.
ModelData
В файле dataset.py лежит класс
В
Обзор полезностей в утилках. Часть 1.
ModelData
В файле dataset.py лежит класс
ModelData. Мне очень не нравится классические X_train, y_train и т.д. Всегда раздражало эта запись, ещё и не питонячая. В
ModelData можно передать фичи и таргет и выполнить разбиение на группы или передать готовое. При этом нужный сабсет получается удобной функцией get_data("train", "features"). Бонусом умеет скачивать и встраивать в свой объект классический датасет для регрессии о домах Калифорнии.Forwarded from ИИ Песочница Sber AI Lab
Library Innovation Lab Гарварда недавно зарелизил открытое хранилище госдатасетов, собранных из различных источников, которые имеют ценность для ресерчей, DS-задач и просто любопытных умов.
Сейчас хранилище включает 311k датасетов (16 ТБ) из data.gov. Хранилище будет обновляться ежедневно, по мере добавления новых данных в data.gov и другие источники, что обеспечит более надёжное сохранение данных. Данные можно брать по названию или сразу пакетом файлов.
Чекайте, вдруг пригодится
#обзоры
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
Остался последний рывок для релиза новой архитектуры HypEx. Сейчас мы делаем последние фиксы, дописываем тесты и можно пользоваться!
Надо сказать, что релиз у нас будет не идеальный. Мы не везде написали докстринги, тесты пока поверхностные, и не все методы и классы написаны идеально. Но к совершенству можно стремиться вечно, а штука уже рабочая и на её основе мы пилим платформу. Где-то в новой версии функциональности больше, где-то меньше.
В общем, тут пока релиз с ворнингами о переходе на новую архитектуру и микрофиксами. Но уже скоро будет и новая архитектура!
Надо сказать, что релиз у нас будет не идеальный. Мы не везде написали докстринги, тесты пока поверхностные, и не все методы и классы написаны идеально. Но к совершенству можно стремиться вечно, а штука уже рабочая и на её основе мы пилим платформу. Где-то в новой версии функциональности больше, где-то меньше.
В общем, тут пока релиз с ворнингами о переходе на новую архитектуру и микрофиксами. Но уже скоро будет и новая архитектура!
❤🔥2
Forwarded from HypEx (Дмитрий Тихомиров)
Друзья, у нас большие новости! Уже совсем скоро HypEx обновится и перейдёт на новую архитектуру, что приведёт к значительным изменениям в API библиотеки
Мы хотим, чтобы этот переход прошёл максимально комфортно для всех пользователей, поэтому заранее предупреждаем о грядущих изменениях.
- Новый интерфейс библиотеки: изменятся пути импорта, методы классов и структура API.
- Старые версия (0.1.10 и младше) больше не будет поддерживаться, но её всё ещё можно будет использовать.
Мы приглашаем всех протестировать новую версию HypEx уже сейчас! Это отличная возможность заранее познакомиться с изменениями и дать нам обратную связь. Чтобы установить последнюю бета-версию, используйте команду:
pip install --upgrade --pre hypex
- Новые туториалы: мы подготовили подробные инструкции, чтобы вам было проще адаптироваться к обновлениям.
Что делать, если я не хочу ничего менять?
Если вы пока не готовы к обновлениям, вы можете продолжить использовать старую версию:
pip install hypex==0.1.10
Мы ценим ваше мнение! Если у вас есть вопросы, пожелания или вы столкнулись с проблемами, пишите нам в Telegram или создавайте issue на GitHub. Ваши отзывы помогут нам сделать HypEx ещё лучше!
Готовы к обновлениям? Тогда давайте тестировать вместе!
Please open Telegram to view this post
VIEW IN TELEGRAM
GitHub
HypEx/examples/tutorials at dev/architecture_v11 · sb-ai-lab/HypEx
Fast and customizable framework for automatic and quick Causal Inference in Python - sb-ai-lab/HypEx
🔥4
#review #iron
Обзор новейшей GPD WIN 4 (2025). Часть 1. Технические характеристики.
Сейчас это мой основной переносной компьютер.
Размер
Штука по размерам меньше Маленькости, хотя и толще (Изображения). За такие размеры его без лукавства можно назвать корманным. По крайней мере я его спокойно носил в кармане куртки. Кроме того он ещё и легче, чем Маленькость, которая тяжёлая из-за металлического корпуса. Тут корпус пластиковый зато массивное турбированное охлаждение.
Мощность
На борту у нас AMD Ryzen AI9 HX 370. Свежеиспеченный амдшный проц с нейроускорителями. Если честно, особо обзоров на него не смотрел. Поэтому расскажу больше про практический опыт в следующей части. По характеристикам весьма достойный ноутбучный проц. По мощности сопостовим с яблочным M4.
Видяха
Radeon 890M интеграшка. Тяжёлые игры не запускал, но машинка в целом чуть мощнее Steam Deck. Так что тянет все то же, но с чуть большим FPS.
Память
32 GB RAM, 2 TB SSD. Много, но по ощущениям медленная. А ещё это маркетинговые цифры, которые криво считаются на в двоичных метриках, а в десятиричных. Поэтому, реальной памяти меньше. Заметно, но не критично.
Питание
Кушает компьютер из аккумулятора на 45 Wh, что стандарт для устройств такого формата. При этом TDP процессора 28 W. Прошивка позволяет ограничить TDP. Я например играю в Darkest Dungeon на 5 W. Теоретически можно так играть 8 часов. На практике не проверял. Так что выходит, что время жизни устройства от 1 до 8 часов в зависимости от нагрузок. Поддерживается зарядка до 65 W. Зарядиться от такой зарядки можно довольно быстро.
Порты
У устройства всего 3 порта: 2 USB C и Oculink. Начнём с последнего. По сути это порт для внешней видяхи фирменной. Говорят, что по мощности схожа с 3070. Мне не надо, так что особо не интересовался. Скоость передачи 63 Gb/s. Так же внишнюю видяху (не фирменную) можно подключить через одни из USB C портов но со скоростью 40 Gb/s.
Экран
Нуу... Он есть) 6 дюймовый сенсорный IPS с высокой плотностью пикселей 60 герц, 1080p, Corning Gorilla Glass 5.
В следующем посте расскажу об опыте использования.
Обзор новейшей GPD WIN 4 (2025). Часть 1. Технические характеристики.
Сейчас это мой основной переносной компьютер.
Размер
Штука по размерам меньше Маленькости, хотя и толще (Изображения). За такие размеры его без лукавства можно назвать корманным. По крайней мере я его спокойно носил в кармане куртки. Кроме того он ещё и легче, чем Маленькость, которая тяжёлая из-за металлического корпуса. Тут корпус пластиковый зато массивное турбированное охлаждение.
Мощность
На борту у нас AMD Ryzen AI9 HX 370. Свежеиспеченный амдшный проц с нейроускорителями. Если честно, особо обзоров на него не смотрел. Поэтому расскажу больше про практический опыт в следующей части. По характеристикам весьма достойный ноутбучный проц. По мощности сопостовим с яблочным M4.
Видяха
Radeon 890M интеграшка. Тяжёлые игры не запускал, но машинка в целом чуть мощнее Steam Deck. Так что тянет все то же, но с чуть большим FPS.
Память
32 GB RAM, 2 TB SSD. Много, но по ощущениям медленная. А ещё это маркетинговые цифры, которые криво считаются на в двоичных метриках, а в десятиричных. Поэтому, реальной памяти меньше. Заметно, но не критично.
Питание
Кушает компьютер из аккумулятора на 45 Wh, что стандарт для устройств такого формата. При этом TDP процессора 28 W. Прошивка позволяет ограничить TDP. Я например играю в Darkest Dungeon на 5 W. Теоретически можно так играть 8 часов. На практике не проверял. Так что выходит, что время жизни устройства от 1 до 8 часов в зависимости от нагрузок. Поддерживается зарядка до 65 W. Зарядиться от такой зарядки можно довольно быстро.
Порты
У устройства всего 3 порта: 2 USB C и Oculink. Начнём с последнего. По сути это порт для внешней видяхи фирменной. Говорят, что по мощности схожа с 3070. Мне не надо, так что особо не интересовался. Скоость передачи 63 Gb/s. Так же внишнюю видяху (не фирменную) можно подключить через одни из USB C портов но со скоростью 40 Gb/s.
Экран
Нуу... Он есть) 6 дюймовый сенсорный IPS с высокой плотностью пикселей 60 герц, 1080p, Corning Gorilla Glass 5.
В следующем посте расскажу об опыте использования.
🤔2🦄2
🤝2❤1
#book@dm_projects_log
#viz
📚 Новая книга! Меня очень увлекает построение диаграмм, и я кайфую от крутых визуализаций данных. Книг на эту тему не много тем более на русском языке, поэтому я её взял даже особо не полистав.
🤓В аспирантуре я готовил миниисследование результатом которого стала высокоуровневая архитектура системы автоматического построения графиков по данным. Я выступал с этой работой на небольшой научной конференции, но в статью это так и не оформил. Одной из главных причин чему - отсутствие длстаточного количества хороших источников по теме. Так что тогда эта книга была бы весьма кстати. Преза и драфт статьи в следующем посте.
Сейчас это исследование выглядит несколько архаично в силу развития LLM, но тогда только вышла GPT 3 и хайп только-только поднимался.
Первый относительнопростой подход, который я бы предложил: это был бы агент с эвристикой/моделью анализирующей датасет, генератором промтов, LLM генерирующей код для рисования графиков и собственно экзекутором, который строил бы графики и сохранял их в заданном формате.
На самом деле подход генерацией кода, [О ужас 😱] его автоматическим исполнением мне не нравится. В идеале хотелось бы некоторый генератор пайплайнов по выходу из анализатора данных, ну и собственно фреймворк поддерживающий эти пайплайны. Я начинал что-то такое делать. Посмотреть можно здесь: https://github.com/Dmatryus/PlotAdapter . Сейчас я бы делал это по-другому.
#viz
📚 Новая книга! Меня очень увлекает построение диаграмм, и я кайфую от крутых визуализаций данных. Книг на эту тему не много тем более на русском языке, поэтому я её взял даже особо не полистав.
🤓В аспирантуре я готовил миниисследование результатом которого стала высокоуровневая архитектура системы автоматического построения графиков по данным. Я выступал с этой работой на небольшой научной конференции, но в статью это так и не оформил. Одной из главных причин чему - отсутствие длстаточного количества хороших источников по теме. Так что тогда эта книга была бы весьма кстати. Преза и драфт статьи в следующем посте.
Сейчас это исследование выглядит несколько архаично в силу развития LLM, но тогда только вышла GPT 3 и хайп только-только поднимался.
Первый относительнопростой подход, который я бы предложил: это был бы агент с эвристикой/моделью анализирующей датасет, генератором промтов, LLM генерирующей код для рисования графиков и собственно экзекутором, который строил бы графики и сохранял их в заданном формате.
На самом деле подход генерацией кода, [О ужас 😱] его автоматическим исполнением мне не нравится. В идеале хотелось бы некоторый генератор пайплайнов по выходу из анализатора данных, ну и собственно фреймворк поддерживающий эти пайплайны. Я начинал что-то такое делать. Посмотреть можно здесь: https://github.com/Dmatryus/PlotAdapter . Сейчас я бы делал это по-другому.
Forwarded from HypEx (Дмитрий Тихомиров)
Всем привет!
Мы начинаем серию постов об обновлениях HypEx! И первый пост посвящен Dataset - новой ключевой сущности в HypEx!
Теперь данные надо передавать в HypEx в виде DataFrame или просто пути к файлу.
Главное новшество - теперь у каждого столбца есть роли! Это разметка данных, которая помогает HypEx понимать, как с ними работать в контексте экспериментов.
from hypex.dataset import Dataset, InfoRole, TreatmentRole, TargetRole, DefaultRole, FeatureRole
from hypex import Matching
data = Dataset(
roles={
"user_id": InfoRole(int), # InfoRole для ID
"treat": TreatmentRole(int), # TreatmentRole для определения группы (контроль/таргет)
"post_spends": TargetRole(float) # TargetRole для целевой переменной
},
data="data.csv",
default_role=FeatureRole(), # Остальные столбцы - обычные фичи
)
📊 Роли в Dataset
Роли зависят от задачи, но есть и универсальные
- InfoRole - идентификаторы
- TreatmentRole - разметка групп
- TargetRole - целевая переменная. (в АА тесте TargetRole размечаются фичи, по которым нужна однородность)
- FeatureRole - признаки для поиска похожих объектов в мэтчинге
Читать подробнее
Теперь работа с данными в HypEx стала проще и гибче! В следующем посте расскажем про AA-тестирование. Оставайтесь с нами!
Please open Telegram to view this post
VIEW IN TELEGRAM
GitHub
HypEx/examples/tutorials/DatasetTutorial.ipynb at master · sb-ai-lab/HypEx
Fast and customizable framework for automatic and quick Causal Inference in Python - sb-ai-lab/HypEx
🔥4🆒2
Forwarded from HypEx (Дмитрий Тихомиров)
Всем привет! 👋
Продолжаем серию постов об обновлениях HypEx!😊
Сегодня говорим о том, как запускать Matching в новой архитектуре!😍
👩💻 Вот обновленный код:
🔗 Подробнее в туториале:
HypEx Matching Tutorial
В следующем посте – о проверке однородности!
Продолжаем серию постов об обновлениях HypEx!
Сегодня говорим о том, как запускать Matching в новой архитектуре!
from hypex.dataset import Dataset, InfoRole, TreatmentRole, TargetRole, DefaultRole, FeatureRole
from hypex import Matching
# Описываем датасет
data = Dataset(
roles={
"user_id": InfoRole(int), # InfoRole для ID
"treat": TreatmentRole(int), # TreatmentRole для определения групп (контроль/таргет)
"post_spends": TargetRole(float) # TargetRole для целевой переменной
},
data="data.csv",
default_role=FeatureRole(), # Остальные столбцы - фичи
)
# Запуск Matching
test = Matching() # Классический Matching (Maha distance + full metrics)
test = Matching(metric="att") # Только ATT
test = Matching(distance="l2") # Выбор метрики
# Получение результатов
result = test.execute(data)
result.resume # Краткое резюме
result.full_data # Ранее df_matched. Wide df с парами
result.indexes # Только индексы пар
🔗 Подробнее в туториале:
HypEx Matching Tutorial
В следующем посте – о проверке однородности!
Please open Telegram to view this post
VIEW IN TELEGRAM
GitHub
HypEx/examples/tutorials/MatchingTutorial.ipynb at master · sb-ai-lab/HypEx
Fast and customizable framework for automatic and quick Causal Inference in Python - sb-ai-lab/HypEx
Интересный эксперимент. Сам хотел с чем-то таким поиграться. Правда изначально был план сделать это без использования LLM. Но сейчас я активно изучаю возможности программирования с LLM. Пока в отпуске, работаю над кое-чем интересным. Как получится что-то конкретное, поделюсь 😊
👍3