Dmatryusофрения
41 subscribers
291 photos
10 videos
15 files
148 links
Пишу о книгах, лидерстве, технологиях, opensource, своих проектах и наверное чем-то ещё. Ну и репосты IT приколямб.
Download Telegram
#open_source
Слишком годный пост, чтобы что-то дополнительно комментить.
Forwarded from эйай ньюз
🔥Llama 4 — Scout, Maverick и Behemoth

Все модели мультимодальные — нативно воспринимают текст, изображения и видео. Тренировали на 30 триллионах токенов, причём токенов с других языков теперь в 10x больше по сравнению с Llama 3. Идёт в трёх размерах:

Scout (109B)— модель с 10 миллионами токенов контекста, что рекорд для релизнутой модели. По бенчам бьёт Gemma 3 и Gemini 2.0 Flash Lite, слегка не дотягивая до полноценной Flash 2.0. Это MoE модель с 16 экспертами, 109B параметров при 17B активных. С квантизацией влезает в одну GPU.

Maverick (400B)— лучше Gemini 2.0 Flash с GPT 4o, примерно на одном уровне с обновлённым DeepSeek V3, но при этом модель мультимодальная и заметно меньше в размерах. Контекст — 1 миллион токенов, меньше чем у Scout, но сильно лучше чем у других конкурентов. Активных параметров всё те же 17B, но экспертов уже 128, поэтому и 400B параметров, Модель можно запустить в fp8 на одной ноде с 8xH100.

Behemoth — гигантская модель на два триллиона параметров (288B активных, 16 экспертов). Бьёт вообщё все Instruct модели с заметным отрывом. Бегемота ещё тренируют, но его ранние версии уже были дистиллированы в Scout и Maverick, что сильно бустануло их перформанс.

Это всё ещё Instruct релиз, но Llama 4 Reasoning тоже скоро будет.

Веса

@ai_newz
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
#iron #llm

Наконец нашёл способ использовать свои 2 RTX 3090 вместе. Что позволяет запускать некоторые модели 70B. В частности на скрине запустил codellama-70b. Модель на моем тесте отработала разочаровательно.

Пробовал запустить deepseek-r1-70b, но там немного не влезает в память GPU из-за чего чрезмерно долго работает.

Других кандидатов на 2 видяхи не пробовал ещё.
🤔3
#llm

Столько шума вокруг ИИ и вайбкодинга. Я около месяца исследую тему и вот мои выводы:
1. Выйбкодинг - это весело, если делаешь что-нибудь интересное, что нравится.
2. LLM все ещё не способны сами писать работающий код, только его небольшие куски.
3. Это абсолютно бесполезное занятие, если сам не понимаешь, что надо делать и потому не в состоянии поправить тот бред, что выдаёт нейронка.

Я тут решил ради опыта попробовать написать программу на незнакомом языке, фреймворке, а вдобавок я вообще не представляю, как эту программу написать. На первых шагах самые примитивные функции написать получилось, но навайбкодить хотябы MVP таким образом не выйдет.
Dmatryusофрения
#iron #llm Наконец нашёл способ использовать свои 2 RTX 3090 вместе. Что позволяет запускать некоторые модели 70B. В частности на скрине запустил codellama-70b. Модель на моем тесте отработала разочаровательно. Пробовал запустить deepseek-r1-70b, но там…
#iron #llm

2 видяхи круто для кодинга, так как одновременно можно хостить достаточно большую модель, как для автокомплитинга в коде, так и для встроенный в IDE контекстный чат. На одной видеокарте приходится идти на компромиссы.
🔥2
#book@dm_projects_log

Во время исследования вайбкодинга пробовал писать кроссплатформенное приложение. Dart + Flutter мне понравились для реализации фронта. Так что вот буду изучать, чтобы понимать, что там вообще происходит. Сегодня начал читать.
🔥4
#life@dm_projects_log

Наблюдение... Чтение перед сном ещё хуже, чем сериалы и игры. Особенно для тех, кто читает так же медленно, как я. Правда моя скорость усугубляется тем фактом, что я ещё и конспект пишу. Вообще говоря, на конспект уходит бОльшая часть времени. В общем, лёг в 3:45. Надо было дочитать раздел с типизацией.
👍2😱1
Привет всем! Пропал на месяц. Связано со сменой работы, адаптацией к этому всему. На самом деле все еще в процессе адаптации, но кажется стало появляться внимание на что-то еще. Планирую цикл небольших заметок. Пока без подробностей, чтобы не расстраивать тех, кому это будет интересно, в случае, если что-то пойдёт не по плану 😅
👍6🆒1
#hypex

Вышла любопытная статейка с использованием нашей либы. Рекомендую!

https://habr.com/ru/companies/tbank/articles/915674/
👍2
#fun #classic #ml

Если вы вдруг забыли, что такое дерево решений. То вот вам база)

Дерево решений - это модель, построенная путем рекурсивного разбиения пространства признаков на несколько непересекающихся областей (узлов дерева) в соответствии со значениями некоторых разделяющих атрибутов.
Атрибуты обычно представляют собой двоичные переменные, которые идентифицируют, что какой-либо признак превышает некоторый порог. Каждой конечной области (листу дерева) присваивается значение, которое является оценкой реакции в область для задачи регрессии или прогнозируемая метка класса в случае задачи классификации.
🤡2
#classic #ml

Наверное все знают, что не только CatBoost может обрабатывать категориальные фичи автоматически. LGBM тоже может, но они это делают по-разному.

LGBM на каждом шаге градиента делает TargetEncoding. Процесс не самый быстрый и требует приличное количество памяти, так как каждый энкодинг надо мапить. Процесс интересный, однако сами разрабы LGBM рекомендуют энкодить категории до подачи в модель.
👍2
#classic #ml
Продолжаем тему кодирования категорий. В прошлый раз затронули LGBM. Сегодня подробнее поговорим про CatBoost.

Итак в CatBoost используется для энкодинга так же Target Statistic (TS).
Есть разные стратегии работы с TS.

Жадная TS (Greedy TS):
* Использует среднее значение целевой переменной для каждой категории.
* Включает сглаживание с помощью параметра a и априорного значения p
* Подвержена условному сдвигу, так как использует целевое значение самого примера
😜 Это то, что мы используем чаще всего, когда сами энкодим таргетом

TS с исключением (Holdout TS):
* Разделяет данные на две части
* Вычисляет TS на одной части
* Обучает модель на другой
* Устраняет условный сдвиг, но использует меньше данных
😒 Жертвовать данными ради энкодинга ну такое себе

TS с исключением одного (Leave-one-out TS):
* Вычисляет TS на основе всех примеров, кроме текущего
* Несмотря на кажущуюся эффективность, всё равно подвержен сдвигу

Упорядоченная TS (Ordered TS):
* Использует случайную перестановку примеров
* Вычисляет TS только на основе предыдущих примеров в перестановке
* Эффективно использует все данные для обучения
* Устраняет условный сдвиг
🐈 Является базовой стратегией в CatBoost

Эксперименты показывают, что упорядоченная TS значительно превосходит другие подходы. Например, на датасете Amazon улучшение составляет 40% по logloss по сравнению с жадной TS и 8.3% по сравнению с holdout TS.

Важное преимущество упорядоченной TS - она позволяет эффективно использовать все обучающие данные как для вычисления целевых статистик, так и для обучения модели.

Процесс вычисления:
1. Для k-го примера берется подмножество Dk - все предыдущие примеры в перестановке
2. Вычисляется среднее значение целевой переменной по всем примерам из Dk с таким же категориальным значением
3. При этом само значение yk не участвует в вычислении

Для уменьшения влияния случайности:
* Используется несколько независимых перестановок
* Значения TS усредняются по всем перестановкам
* Это снижает дисперсию оценок, особенно для первых примеров в перестановке
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3
#classic #ml

Не так давно вышла версия xgboost 2.0.

В основном там улучшение производительности, в частности лучшее управление кэшем процессора и оптимизация федеративного обучения в том числе в рамках PySpark.
🤩3
#fun

Первые крашенные миньки.
🔥4