Dmatryusофрения
42 subscribers
291 photos
10 videos
15 files
148 links
Пишу о книгах, лидерстве, технологиях, opensource, своих проектах и наверное чем-то ещё. Ну и репосты IT приколямб.
Download Telegram
Forwarded from HypEx (Дмитрий Тихомиров)
🆕🆕🆕🆕
Всем привет!
🚀

Мы начинаем серию постов об обновлениях HypEx! И первый пост посвящен Dataset - новой ключевой сущности в HypEx!

🔄 Зачем нужен Dataset?
Теперь данные надо передавать в HypEx в виде DataFrame или просто пути к файлу.

Главное новшество - теперь у каждого столбца есть роли! Это разметка данных, которая помогает HypEx понимать, как с ними работать в контексте экспериментов.

👩‍💻 Пример кода:
from hypex.dataset import Dataset, InfoRole, TreatmentRole, TargetRole, DefaultRole, FeatureRole
from hypex import Matching

data = Dataset(
roles={
"user_id": InfoRole(int), # InfoRole для ID
"treat": TreatmentRole(int), # TreatmentRole для определения группы (контроль/таргет)
"post_spends": TargetRole(float) # TargetRole для целевой переменной
},
data="data.csv",
default_role=FeatureRole(), # Остальные столбцы - обычные фичи
)


📊 Роли в Dataset
Роли зависят от задачи, но есть и универсальные
- InfoRole - идентификаторы
- TreatmentRole - разметка групп
- TargetRole - целевая переменная. (в АА тесте TargetRole размечаются фичи, по которым нужна однородность)
- FeatureRole - признаки для поиска похожих объектов в мэтчинге

Полный туториал:
Читать подробнее

Теперь работа с данными в HypEx стала проще и гибче! В следующем посте расскажем про AA-тестирование. Оставайтесь с нами! ❤️📍
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥4🆒2
Forwarded from HypEx (Дмитрий Тихомиров)
Всем привет! 👋

Продолжаем серию постов об обновлениях HypEx! 😊

Сегодня говорим о том, как запускать Matching в новой архитектуре!😍

👩‍💻 Вот обновленный код:
from hypex.dataset import Dataset, InfoRole, TreatmentRole, TargetRole, DefaultRole, FeatureRole
from hypex import Matching

# Описываем датасет

data = Dataset(
roles={
"user_id": InfoRole(int), # InfoRole для ID
"treat": TreatmentRole(int), # TreatmentRole для определения групп (контроль/таргет)
"post_spends": TargetRole(float) # TargetRole для целевой переменной
},
data="data.csv",
default_role=FeatureRole(), # Остальные столбцы - фичи
)

# Запуск Matching

test = Matching() # Классический Matching (Maha distance + full metrics)
test = Matching(metric="att") # Только ATT
test = Matching(distance="l2") # Выбор метрики

# Получение результатов
result = test.execute(data)
result.resume # Краткое резюме
result.full_data # Ранее df_matched. Wide df с парами
result.indexes # Только индексы пар


🔗 Подробнее в туториале:
HypEx Matching Tutorial

В следующем посте – о проверке однородности!
Please open Telegram to view this post
VIEW IN TELEGRAM
Интересный эксперимент. Сам хотел с чем-то таким поиграться. Правда изначально был план сделать это без использования LLM. Но сейчас я активно изучаю возможности программирования с LLM. Пока в отпуске, работаю над кое-чем интересным. Как получится что-то конкретное, поделюсь 😊
👍3
Forwarded from Градиент обреченный (Sergei Averkiev)
LLM и черные дыры

Игрался тут на выходных — просил разные модели сгенерировать код для отрисовки черной дыры с аккреционным диском как в Интерстелларе.

Была надежда, что получится, потому что, во-первых, есть статья с кучей формул — Gravitational Lensing by Spinning Black Holes, где в соавторах указан Кип Торн, делавший расчеты для фильма (даже книгу про это написал). Во-вторых, есть клевое видео, где человек делится своей версией подобной трассировки и выкладывает упрощенную версию кода.

В итоге ничего похожего не получилось. DeepResearch'и, рассуждения и подкладывание дополнительных материалов в контекст не помогли. Хотя может я все делал не правильно и у вас получится. Если так, то поделитесь.

P.S. Некоторые модели писали очень изощренный код, который минут за 30 рисовал квадрат Малевича.
👍2😁1
#open_source@dm_projects_log

Замутил новую минилибу. Идея проста и банальна, но мне не хватало такой тулзы. Собственно идея в том, чтобы держать небольшую базу знаний по моделям, для подбора моделей в целях локального развертывания. Либа анализирует состояние системы (количество оперативы, места на диске, гпу и врам) и предлагает подходящие модели. Пока есть конфигурации для диффузионок и ЛЛМ. Знания складываются в YAML файлы. Пока они там больше ради примера, чем действительно для использования. Так же присутствует ранжирование. Ранг настраиваются вручную в конфигах, но идейно должны формироваться из реальных лидербордов.

Git | pip
#open_source@dm_projects_log
#myproject@dm_projects_log

Для курса по статистике баловался с визуализацией случайных величин. Затея не на 100% увенчалась успехом в рамках курса, но добавил эту минифичу в miniutils. Может потом удалю. Пример можно посмотреть здесь.
#book@dm_projects_log

Новая книга! На этот раз геймдев. Это просто не закрытый гештальт. Каждый год я собираюсь сделать игру и каждый год не захожу особо далеко в этом стремлении. Мне всегда казалось, что такие вещи нужно изучать не в книгах, а на курсах, но уж очень любопытно было, как зайти через книгу, к тому же это намного более бюджетный вариант. Данная книга про последнюю на сегодня версию Unity, так что несколько лет будет актуальна, но проблема в том, что её актуальность непременно пройдет.

https://www.piter.com/collection/all/product/razrabotka-igr-na-unity-4-e-izd
Dmatryusофрения
#review Китайский сериал "Задача трёх тел". Недавно вышел ещё на Netflix. Но эту версию, вероятно, я смотреть не буду. Просмотр китайского сериала - необычный опыт. Мне потребовалось пару часов, чтобы научиться отличать персонажей, да и китайский на фоне…
#review

Я так и не посмотрел сериал от Netflix, но посмотрел обзор на него. В общих чертах убедился, что лично мне, как тому ещё душниле, лучше подходит китайский сериал, который довольно близок к книге.

Сериал от Netflix более зрелищный и наверное лучше подходит для нормисов. Там опущено большинство физических концепций, и все очень сильно упрощено, иногда до абсурда. Однако именно, как сериал на посмотреть после работы подходит гораздо лучше, так как он короче, проще и зрелищнее, но в то же время упущено значительное количество идей, заложенных автором. Я его врядли буду смотреть, так как нахожу кайфовым некоторую долю занудства в китайском сериале, и в нем видится изначальная склонность автора книги придерживаться близости к научному представлению вещей.

В целом, это не научная фантастика, а просто фантастика, но ещё раз могу рекомендовать к ознакомлению.
#open_source
#model

https://nvlabs.github.io/Sana/

Вышла новая интересная диффузионка о Nvidia Sana!

Ключевой особенностью является то, что она способна выдавать высокого качества изображения и при этом не требовательна к ресурсам! Пишут, что качество сопостовимо с Flux-12b, но при этом модель в 7.5 раз меньше и в 100 раз быстрее. Это действительно впечатляет.

Вот вам примеры генерации волков.

Лично меня качество пока не впечатляет. Но это быстрая генерация без заморочек. На каждое изображение ушло примерно 2 секунды. Можно добавить шагов инференса при локальном развертывание и может стать лучше.
#fun

Кажется модели больше всего преуспели в генерировании людей, котов и каджитов.
👍3