Dmatryusофрения
41 subscribers
291 photos
10 videos
15 files
148 links
Пишу о книгах, лидерстве, технологиях, opensource, своих проектах и наверное чем-то ещё. Ну и репосты IT приколямб.
Download Telegram
#life@dm_projects_log

Форточки нового телефончика.
🔥3🤩3👍2
#fun

Часть моделей могут банально не подойти для "продакшн-решений", так как либо требуют слишком больших затрат по подготовке данных (например, SARIMA), либо сложно настраиваются (хороший пример – SARIMA), либо требуют частого переобучения на новых данных (опять SARIMA), поэтому зачастую гораздо проще бывает выделить несколько признаков из имеющегося временного ряда и построить по ним обычную линейную регрессию.
Channel photo updated
Новые книги. Левую начал читать.
🔥3
#life
#book

Немного ночного флуда...

Нашёл банальный способ обоготить преобзоры на книги. Раньше я читал оглавление и описание, и немного листал книги. Вы могли заметить, что все они от издательства Питер. Я заказываю книги напрямую от издательства. Причины:
1. У меня уже скопилось приличная скидка
2. Покупая бумажную версию, становится доступна электронная, которую можно начать читать, пока ждёшь доставку.
3. Удобная доставка за 4 дня (в среднем)

Собственно подписался на их тележку, где они пишут TL;DR на некоторые книги. Это повод делать больше книжного контента, обогощая его.

Теперь расскажу о книге, которую сейчас читаю (фото). Книга хардкорная. Читать тяжело. Но она позволяет достаточно глубоко понять, как работает Python под копотом. Конспектировать её не просто, так как она во многом практическая, а такие вещи не добавить нормально в конспект. Нужно брать и пробовать лапками.
Спят корова, конь и хрюшка,
Спит полярная звезда,
Но не спит твоя видюшка,
Ни за что и никогда
Без особенного смысла
Вычисляет чудо-числа
Числа редкой простоты,
Вычисляет... Эх мечты
Засыпай скорей и ты
😁2
Forwarded from Научный опенсорс (Nikolay Nikitin)
Коллеги из СберТеха сегодня опубликовали своё opensource-исследование. Тоже таким занимаемся, так что почитать было весьма интересно.

Исследование основано на анализе большого числа открытых профилей и репозиториев на github-е. Интересного много, от оценок активности в репозиториях до популярных инструментов СI/CD.

Про наш недавний материал тоже упоминают, с выводами - соглашаются)

Полная версия - тут, данные - в репо на gitverse.
#open_source@dm_projects_log

Наверное все уже слышали о том, что модели от китайских исследователей DeepSeek-R1 и DeepSeek-R1-Zero выложены в открытый доступ и показывают результаты на уровне o1.

Мини обзор

Попробовать: полная R1 доступна на официальном сайте в режиме DeepThink. Насколько мне известно, есть ограничения на количество запросов/токенов, но с ходу не нашел об этом конкеретной информации.

Приложение: мобильное приложение работает бесплатно, ссылки есть тут.

Я в свою очередь пробую развернуть на Neil II дистиллированную версию на 32B параметров. Я не особо часто пользуюсь LLM, но потестить интересно.
#life

Январь кончается, а значит самое время подвести итоги года и рассказать о планах на следующий.

Часть 1: Итоги 2024

С одной стороны год был очень насыщенным, с другой рассказать особенно нечего. Так что расскажу то, что придёт в голову.

😩 Почти не сошёл с ума из-за потрясения в начале года

🦾 Разработали 11 поколений новой архитектуры HypEx. Сейчас тестим, правим баги и готовим к релизу. Думаю над 12 поколением, но планов на его реализацию в ближайшем будущем нет. Наверное пока буду по факту в своём форке понемногу мутить.

🤖 Прокачал железо

💚 Завёл новых друзей

📖 В очередной раз переосмыслил подход к книге, вернувшись к первоначальной концепции, но расширив содержание (Изображение 1).

🖌 Начал осваивать покрас минек (изображение 2). Благо есть наставник.

📖 Прочитал 2 книги. Мало, конечно, но выработал привычку читать регулярно.

Переосмылил свой подход к жизни и приоритеты.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
#life

Часть 2: цели на 2025

Порядок произвольный.

🧘‍♂ Найти духовный и физический баланс. В духовном плане это разнообразие деятельности. Больший акцент на творчестве. В физическом плане я целюсь в прохождение скрининга здоровья и дебагинга проблем, если они обнаружаться, далее программа ухода за кожей, ну и в каких-то конкретных метриках - сброс 10 кг.

🏯 Завершить в прямом смысле долгострой - ремонт в своей хате и переехать. Отчасти тоже чать духовного балансирования.

🗽 Поклеить красавца на изображении 1.

📖 Изучить библиотеку ClustPy и все связанные с ней статьи.

📖 Прочитать минимум 3 книги: "Внутри CPython", "Чистый Python", "Чистая архитектура". Как видите, стремимся к чистоте.

🤲 Open-source. Тут амбициозно. Реализовать 12 архитектуру HypEx. Надеюсь, что книги по архитектуре будут тут полезны. И разработать исследовательский стенд кластеризации на базе HypEx.

👩‍💻😶🌫 Реализовать кальянную базу знаний. В основном, про табаки и миксы.

✏️ Реализовать фреймворк формальной структуаризации знаний. Это графовая структура с формальной семантикой блоков и не формальными блоками на естественном языке с автоматической визуализацией.

Целей много и они весьма амбициозные. Не факт, что все получится за год. Но направляющие такие.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2🔥2
Forwarded from AbstractDL
DeepSeek-R1 для чайников

Ну и наделала же DeepSeek шуму. Мне пришлось целый хабропост написать 😁

TLDR: мало слов про сравнение с ChatGPT и метрики, много слов про технические детали обучения, датасеты, GRPO и якобы эмерджентный «Aha! moment».
😁1
Dmatryusофрения
dmlab.pdf
#dmml_lab
#hypex

Иногда пора вспомнить старое. Ещё до HypEx я начинал работать с ML пайпланами в либе DmML-lab.

Эти идеи легли в основу ядра новой архитектуры HypEx, но были в нем развиты гораздо сильнее. Результаты HypEx сделали бессмысленной дальнейшую работу над StatBox и DmML-lab, так как их идеи лучше реализуемы в рамках ядра HypEx. Поэтому я создал форк от HypEx, где будет только ядро. Сейчас там не актуальная версия, так что ссылку не даю.

Сейчас я как раз начал лучше прорабатывать ML пайплайны в HypEx и возвращение к этой схеме стало источником вдохновения.

Так же сейчас мы проводим весьма интересное исследование с применением ML, что (как обычно) сподвигло меня выносить интересные решения в минипакет с утилками. Пока нигде его не публикую, но если интересно, можете глянуть.

В дальнейшем эти утилки должны сталь экзекуторами на базе HypEx core и тогда можно будет сделать новую версию либы DmML-lab.
👌2
Dmatryusофрения
#dmml_lab #hypex Иногда пора вспомнить старое. Ещё до HypEx я начинал работать с ML пайпланами в либе DmML-lab. Эти идеи легли в основу ядра новой архитектуры HypEx, но были в нем развиты гораздо сильнее. Результаты HypEx сделали бессмысленной дальнейшую…
#dmml_lab

Обзор полезностей в утилках. Часть 1.

ModelData


В файле dataset.py лежит класс ModelData. Мне очень не нравится классические X_train, y_train и т.д. Всегда раздражало эта запись, ещё и не питонячая.

В ModelData можно передать фичи и таргет и выполнить разбиение на группы или передать готовое. При этом нужный сабсет получается удобной функцией get_data("train", "features"). Бонусом умеет скачивать и встраивать в свой объект классический датасет для регрессии о домах Калифорнии.
🔥Хранилище датасетов от Гарварда

Library Innovation Lab Гарварда недавно зарелизил открытое хранилище госдатасетов, собранных из различных источников, которые имеют ценность для ресерчей, DS-задач и просто любопытных умов.

Сейчас хранилище включает 311k датасетов (16 ТБ) из data.gov. Хранилище будет обновляться ежедневно, по мере добавления новых данных в data.gov и другие источники, что обеспечит более надёжное сохранение данных. Данные можно брать по названию или сразу пакетом файлов.

Чекайте, вдруг пригодится


#обзоры
@sb_ai_lab
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
Остался последний рывок для релиза новой архитектуры HypEx. Сейчас мы делаем последние фиксы, дописываем тесты и можно пользоваться!

Надо сказать, что релиз у нас будет не идеальный. Мы не везде написали докстринги, тесты пока поверхностные, и не все методы и классы написаны идеально. Но к совершенству можно стремиться вечно, а штука уже рабочая и на её основе мы пилим платформу. Где-то в новой версии функциональности больше, где-то меньше.

В общем, тут пока релиз с ворнингами о переходе на новую архитектуру и микрофиксами. Но уже скоро будет и новая архитектура!
❤‍🔥2