Dmatryusофрения
42 subscribers
291 photos
10 videos
15 files
148 links
Пишу о книгах, лидерстве, технологиях, opensource, своих проектах и наверное чем-то ещё. Ну и репосты IT приколямб.
Download Telegram
🔥Хранилище датасетов от Гарварда

Library Innovation Lab Гарварда недавно зарелизил открытое хранилище госдатасетов, собранных из различных источников, которые имеют ценность для ресерчей, DS-задач и просто любопытных умов.

Сейчас хранилище включает 311k датасетов (16 ТБ) из data.gov. Хранилище будет обновляться ежедневно, по мере добавления новых данных в data.gov и другие источники, что обеспечит более надёжное сохранение данных. Данные можно брать по названию или сразу пакетом файлов.

Чекайте, вдруг пригодится


#обзоры
@sb_ai_lab
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
Остался последний рывок для релиза новой архитектуры HypEx. Сейчас мы делаем последние фиксы, дописываем тесты и можно пользоваться!

Надо сказать, что релиз у нас будет не идеальный. Мы не везде написали докстринги, тесты пока поверхностные, и не все методы и классы написаны идеально. Но к совершенству можно стремиться вечно, а штука уже рабочая и на её основе мы пилим платформу. Где-то в новой версии функциональности больше, где-то меньше.

В общем, тут пока релиз с ворнингами о переходе на новую архитектуру и микрофиксами. Но уже скоро будет и новая архитектура!
❤‍🔥2
Forwarded from HypEx (Дмитрий Тихомиров)
🌟 HypEx переходит на новую архитектуру! 🌟

Друзья, у нас большие новости! Уже совсем скоро HypEx обновится и перейдёт на новую архитектуру, что приведёт к значительным изменениям в API библиотеки😳
Мы хотим, чтобы этот переход прошёл максимально комфортно для всех пользователей, поэтому заранее предупреждаем о грядущих изменениях.😉

🍄 Что изменится?🍄

- Новый интерфейс библиотеки: изменятся пути импорта, методы классов и структура API.
- Старые версия (0.1.10 и младше) больше не будет поддерживаться, но её всё ещё можно будет использовать.

🚀 Как протестировать новую версию?

Мы приглашаем всех протестировать новую версию HypEx уже сейчас! Это отличная возможность заранее познакомиться с изменениями и дать нам обратную связь. Чтобы установить последнюю бета-версию, используйте команду:

pip install --upgrade --pre hypex


- Новые туториалы: мы подготовили подробные инструкции, чтобы вам было проще адаптироваться к обновлениям.

Что делать, если я не хочу ничего менять?☹️

Если вы пока не готовы к обновлениям, вы можете продолжить использовать старую версию:

pip install hypex==0.1.10



Мы ценим ваше мнение! Если у вас есть вопросы, пожелания или вы столкнулись с проблемами, пишите нам в Telegram или создавайте issue на GitHub. Ваши отзывы помогут нам сделать HypEx ещё лучше!

Готовы к обновлениям? Тогда давайте тестировать вместе! 🎉
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥4
#review #iron

Обзор новейшей GPD WIN 4 (2025). Часть 1. Технические характеристики.

Сейчас это мой основной переносной компьютер.

Размер
Штука по размерам меньше Маленькости, хотя и толще (Изображения). За такие размеры его без лукавства можно назвать корманным. По крайней мере я его спокойно носил в кармане куртки. Кроме того он ещё и легче, чем Маленькость, которая тяжёлая из-за металлического корпуса. Тут корпус пластиковый зато массивное турбированное охлаждение.

Мощность
На борту у нас AMD Ryzen AI9 HX 370. Свежеиспеченный амдшный проц с нейроускорителями. Если честно, особо обзоров на него не смотрел. Поэтому расскажу больше про практический опыт в следующей части. По характеристикам весьма достойный ноутбучный проц. По мощности сопостовим с яблочным M4.

Видяха
Radeon 890M интеграшка. Тяжёлые игры не запускал, но машинка в целом чуть мощнее Steam Deck. Так что тянет все то же, но с чуть большим FPS.

Память
32 GB RAM, 2 TB SSD. Много, но по ощущениям медленная. А ещё это маркетинговые цифры, которые криво считаются на в двоичных метриках, а в десятиричных. Поэтому, реальной памяти меньше. Заметно, но не критично.

Питание
Кушает компьютер из аккумулятора на 45 Wh, что стандарт для устройств такого формата. При этом TDP процессора 28 W. Прошивка позволяет ограничить TDP. Я например играю в Darkest Dungeon на 5 W. Теоретически можно так играть 8 часов. На практике не проверял. Так что выходит, что время жизни устройства от 1 до 8 часов в зависимости от нагрузок. Поддерживается зарядка до 65 W. Зарядиться от такой зарядки можно довольно быстро.

Порты
У устройства всего 3 порта: 2 USB C и Oculink. Начнём с последнего. По сути это порт для внешней видяхи фирменной. Говорят, что по мощности схожа с 3070. Мне не надо, так что особо не интересовался. Скоость передачи 63 Gb/s. Так же внишнюю видяху (не фирменную) можно подключить через одни из USB C портов но со скоростью 40 Gb/s.

Экран
Нуу... Он есть) 6 дюймовый сенсорный IPS с высокой плотностью пикселей 60 герц, 1080p, Corning Gorilla Glass 5.

В следующем посте расскажу об опыте использования.
🤔2🦄2
#source

Куча ссылок с обучающими материалами по ML

https://deep-learning-drizzle.github.io/
🤝21
#book@dm_projects_log
#viz

📚 Новая книга! Меня очень увлекает построение диаграмм, и я кайфую от крутых визуализаций данных. Книг на эту тему не много тем более на русском языке, поэтому я её взял даже особо не полистав.

🤓В аспирантуре я готовил миниисследование результатом которого стала высокоуровневая архитектура системы автоматического построения графиков по данным. Я выступал с этой работой на небольшой научной конференции, но в статью это так и не оформил. Одной из главных причин чему - отсутствие длстаточного количества хороших источников по теме. Так что тогда эта книга была бы весьма кстати. Преза и драфт статьи в следующем посте.

Сейчас это исследование выглядит несколько архаично в силу развития LLM, но тогда только вышла GPT 3 и хайп только-только поднимался.

Первый относительнопростой подход, который я бы предложил: это был бы агент с эвристикой/моделью анализирующей датасет, генератором промтов, LLM генерирующей код для рисования графиков и собственно экзекутором, который строил бы графики и сохранял их в заданном формате.
На самом деле подход генерацией кода, [О ужас 😱] его автоматическим исполнением мне не нравится. В идеале хотелось бы некоторый генератор пайплайнов по выходу из анализатора данных, ну и собственно фреймворк поддерживающий эти пайплайны. Я начинал что-то такое делать. Посмотреть можно здесь: https://github.com/Dmatryus/PlotAdapter . Сейчас я бы делал это по-другому.
Время репостов
Forwarded from HypEx (Дмитрий Тихомиров)
🆕🆕🆕🆕
Всем привет!
🚀

Мы начинаем серию постов об обновлениях HypEx! И первый пост посвящен Dataset - новой ключевой сущности в HypEx!

🔄 Зачем нужен Dataset?
Теперь данные надо передавать в HypEx в виде DataFrame или просто пути к файлу.

Главное новшество - теперь у каждого столбца есть роли! Это разметка данных, которая помогает HypEx понимать, как с ними работать в контексте экспериментов.

👩‍💻 Пример кода:
from hypex.dataset import Dataset, InfoRole, TreatmentRole, TargetRole, DefaultRole, FeatureRole
from hypex import Matching

data = Dataset(
roles={
"user_id": InfoRole(int), # InfoRole для ID
"treat": TreatmentRole(int), # TreatmentRole для определения группы (контроль/таргет)
"post_spends": TargetRole(float) # TargetRole для целевой переменной
},
data="data.csv",
default_role=FeatureRole(), # Остальные столбцы - обычные фичи
)


📊 Роли в Dataset
Роли зависят от задачи, но есть и универсальные
- InfoRole - идентификаторы
- TreatmentRole - разметка групп
- TargetRole - целевая переменная. (в АА тесте TargetRole размечаются фичи, по которым нужна однородность)
- FeatureRole - признаки для поиска похожих объектов в мэтчинге

Полный туториал:
Читать подробнее

Теперь работа с данными в HypEx стала проще и гибче! В следующем посте расскажем про AA-тестирование. Оставайтесь с нами! ❤️📍
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥4🆒2
Forwarded from HypEx (Дмитрий Тихомиров)
Всем привет! 👋

Продолжаем серию постов об обновлениях HypEx! 😊

Сегодня говорим о том, как запускать Matching в новой архитектуре!😍

👩‍💻 Вот обновленный код:
from hypex.dataset import Dataset, InfoRole, TreatmentRole, TargetRole, DefaultRole, FeatureRole
from hypex import Matching

# Описываем датасет

data = Dataset(
roles={
"user_id": InfoRole(int), # InfoRole для ID
"treat": TreatmentRole(int), # TreatmentRole для определения групп (контроль/таргет)
"post_spends": TargetRole(float) # TargetRole для целевой переменной
},
data="data.csv",
default_role=FeatureRole(), # Остальные столбцы - фичи
)

# Запуск Matching

test = Matching() # Классический Matching (Maha distance + full metrics)
test = Matching(metric="att") # Только ATT
test = Matching(distance="l2") # Выбор метрики

# Получение результатов
result = test.execute(data)
result.resume # Краткое резюме
result.full_data # Ранее df_matched. Wide df с парами
result.indexes # Только индексы пар


🔗 Подробнее в туториале:
HypEx Matching Tutorial

В следующем посте – о проверке однородности!
Please open Telegram to view this post
VIEW IN TELEGRAM
Интересный эксперимент. Сам хотел с чем-то таким поиграться. Правда изначально был план сделать это без использования LLM. Но сейчас я активно изучаю возможности программирования с LLM. Пока в отпуске, работаю над кое-чем интересным. Как получится что-то конкретное, поделюсь 😊
👍3
Forwarded from Градиент обреченный (Sergei Averkiev)
LLM и черные дыры

Игрался тут на выходных — просил разные модели сгенерировать код для отрисовки черной дыры с аккреционным диском как в Интерстелларе.

Была надежда, что получится, потому что, во-первых, есть статья с кучей формул — Gravitational Lensing by Spinning Black Holes, где в соавторах указан Кип Торн, делавший расчеты для фильма (даже книгу про это написал). Во-вторых, есть клевое видео, где человек делится своей версией подобной трассировки и выкладывает упрощенную версию кода.

В итоге ничего похожего не получилось. DeepResearch'и, рассуждения и подкладывание дополнительных материалов в контекст не помогли. Хотя может я все делал не правильно и у вас получится. Если так, то поделитесь.

P.S. Некоторые модели писали очень изощренный код, который минут за 30 рисовал квадрат Малевича.
👍2😁1