#open_source
Слишком годный пост, чтобы что-то дополнительно комментить.
Слишком годный пост, чтобы что-то дополнительно комментить.
Forwarded from эйай ньюз
Все модели мультимодальные — нативно воспринимают текст, изображения и видео. Тренировали на 30 триллионах токенов, причём токенов с других языков теперь в 10x больше по сравнению с Llama 3. Идёт в трёх размерах:
Scout (109B)— модель с 10 миллионами токенов контекста, что рекорд для релизнутой модели. По бенчам бьёт Gemma 3 и Gemini 2.0 Flash Lite, слегка не дотягивая до полноценной Flash 2.0. Это MoE модель с 16 экспертами, 109B параметров при 17B активных. С квантизацией влезает в одну GPU.
Maverick (400B)— лучше Gemini 2.0 Flash с GPT 4o, примерно на одном уровне с обновлённым DeepSeek V3, но при этом модель мультимодальная и заметно меньше в размерах. Контекст — 1 миллион токенов, меньше чем у Scout, но сильно лучше чем у других конкурентов. Активных параметров всё те же 17B, но экспертов уже 128, поэтому и 400B параметров, Модель можно запустить в fp8 на одной ноде с 8xH100.
Behemoth — гигантская модель на два триллиона параметров (288B активных, 16 экспертов). Бьёт вообщё все Instruct модели с заметным отрывом. Бегемота ещё тренируют, но его ранние версии уже были дистиллированы в Scout и Maverick, что сильно бустануло их перформанс.
Это всё ещё Instruct релиз, но Llama 4 Reasoning тоже скоро будет.
Веса
@ai_newz
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
Dmatryusофрения
#open_source@dm_projects_log #myproject@dm_projects_log Для курса по статистике баловался с визуализацией случайных величин. Затея не на 100% увенчалась успехом в рамках курса, но добавил эту минифичу в miniutils. Может потом удалю. Пример можно посмотреть…
#open_source@dm_projects_log
#myproject@dm_projects_log
Поразмыслив, решил, что визуализация статистики все же не укладывается в концепцию миниутилок. Так что выпелил.
Зато навайбкодил XML валидатор. https://github.com/Dmatryus/miniutils
#myproject@dm_projects_log
Поразмыслив, решил, что визуализация статистики все же не укладывается в концепцию миниутилок. Так что выпелил.
Зато навайбкодил XML валидатор. https://github.com/Dmatryus/miniutils
GitHub
GitHub - Dmatryus/miniutils: A set of small scripts for simple tasks.
A set of small scripts for simple tasks. Contribute to Dmatryus/miniutils development by creating an account on GitHub.
👍2
#iron #llm
Наконец нашёл способ использовать свои 2 RTX 3090 вместе. Что позволяет запускать некоторые модели 70B. В частности на скрине запустил codellama-70b. Модель на моем тесте отработала разочаровательно.
Пробовал запустить deepseek-r1-70b, но там немного не влезает в память GPU из-за чего чрезмерно долго работает.
Других кандидатов на 2 видяхи не пробовал ещё.
Наконец нашёл способ использовать свои 2 RTX 3090 вместе. Что позволяет запускать некоторые модели 70B. В частности на скрине запустил codellama-70b. Модель на моем тесте отработала разочаровательно.
Пробовал запустить deepseek-r1-70b, но там немного не влезает в память GPU из-за чего чрезмерно долго работает.
Других кандидатов на 2 видяхи не пробовал ещё.
🤔3
#llm
Столько шума вокруг ИИ и вайбкодинга. Я около месяца исследую тему и вот мои выводы:
1. Выйбкодинг - это весело, если делаешь что-нибудь интересное, что нравится.
2. LLM все ещё не способны сами писать работающий код, только его небольшие куски.
3. Это абсолютно бесполезное занятие, если сам не понимаешь, что надо делать и потому не в состоянии поправить тот бред, что выдаёт нейронка.
Я тут решил ради опыта попробовать написать программу на незнакомом языке, фреймворке, а вдобавок я вообще не представляю, как эту программу написать. На первых шагах самые примитивные функции написать получилось, но навайбкодить хотябы MVP таким образом не выйдет.
Столько шума вокруг ИИ и вайбкодинга. Я около месяца исследую тему и вот мои выводы:
1. Выйбкодинг - это весело, если делаешь что-нибудь интересное, что нравится.
2. LLM все ещё не способны сами писать работающий код, только его небольшие куски.
3. Это абсолютно бесполезное занятие, если сам не понимаешь, что надо делать и потому не в состоянии поправить тот бред, что выдаёт нейронка.
Я тут решил ради опыта попробовать написать программу на незнакомом языке, фреймворке, а вдобавок я вообще не представляю, как эту программу написать. На первых шагах самые примитивные функции написать получилось, но навайбкодить хотябы MVP таким образом не выйдет.
Dmatryusофрения
#iron #llm Наконец нашёл способ использовать свои 2 RTX 3090 вместе. Что позволяет запускать некоторые модели 70B. В частности на скрине запустил codellama-70b. Модель на моем тесте отработала разочаровательно. Пробовал запустить deepseek-r1-70b, но там…
#iron #llm
2 видяхи круто для кодинга, так как одновременно можно хостить достаточно большую модель, как для автокомплитинга в коде, так и для встроенный в IDE контекстный чат. На одной видеокарте приходится идти на компромиссы.
2 видяхи круто для кодинга, так как одновременно можно хостить достаточно большую модель, как для автокомплитинга в коде, так и для встроенный в IDE контекстный чат. На одной видеокарте приходится идти на компромиссы.
🔥2
#book@dm_projects_log
Во время исследования вайбкодинга пробовал писать кроссплатформенное приложение. Dart + Flutter мне понравились для реализации фронта. Так что вот буду изучать, чтобы понимать, что там вообще происходит. Сегодня начал читать.
Во время исследования вайбкодинга пробовал писать кроссплатформенное приложение. Dart + Flutter мне понравились для реализации фронта. Так что вот буду изучать, чтобы понимать, что там вообще происходит. Сегодня начал читать.
🔥4
#life@dm_projects_log
Наблюдение... Чтение перед сном ещё хуже, чем сериалы и игры. Особенно для тех, кто читает так же медленно, как я. Правда моя скорость усугубляется тем фактом, что я ещё и конспект пишу. Вообще говоря, на конспект уходит бОльшая часть времени. В общем, лёг в 3:45. Надо было дочитать раздел с типизацией.
Наблюдение... Чтение перед сном ещё хуже, чем сериалы и игры. Особенно для тех, кто читает так же медленно, как я. Правда моя скорость усугубляется тем фактом, что я ещё и конспект пишу. Вообще говоря, на конспект уходит бОльшая часть времени. В общем, лёг в 3:45. Надо было дочитать раздел с типизацией.
👍2😱1
Привет всем! Пропал на месяц. Связано со сменой работы, адаптацией к этому всему. На самом деле все еще в процессе адаптации, но кажется стало появляться внимание на что-то еще. Планирую цикл небольших заметок. Пока без подробностей, чтобы не расстраивать тех, кому это будет интересно, в случае, если что-то пойдёт не по плану 😅
👍6🆒1
#hypex
Вышла любопытная статейка с использованием нашей либы. Рекомендую!
https://habr.com/ru/companies/tbank/articles/915674/
Вышла любопытная статейка с использованием нашей либы. Рекомендую!
https://habr.com/ru/companies/tbank/articles/915674/
👍2
#fun #classic #ml
Если вы вдруг забыли, что такое дерево решений. То вот вам база)
Дерево решений - это модель, построенная путем рекурсивного разбиения пространства признаков на несколько непересекающихся областей (узлов дерева) в соответствии со значениями некоторых разделяющих атрибутов.
Атрибуты обычно представляют собой двоичные переменные, которые идентифицируют, что какой-либо признак превышает некоторый порог. Каждой конечной области (листу дерева) присваивается значение, которое является оценкой реакции в область для задачи регрессии или прогнозируемая метка класса в случае задачи классификации.
Если вы вдруг забыли, что такое дерево решений. То вот вам база)
Дерево решений - это модель, построенная путем рекурсивного разбиения пространства признаков на несколько непересекающихся областей (узлов дерева) в соответствии со значениями некоторых разделяющих атрибутов.
Атрибуты обычно представляют собой двоичные переменные, которые идентифицируют, что какой-либо признак превышает некоторый порог. Каждой конечной области (листу дерева) присваивается значение, которое является оценкой реакции в область для задачи регрессии или прогнозируемая метка класса в случае задачи классификации.
🤡2
#classic #ml
Наверное все знают, что не только CatBoost может обрабатывать категориальные фичи автоматически. LGBM тоже может, но они это делают по-разному.
LGBM на каждом шаге градиента делает TargetEncoding. Процесс не самый быстрый и требует приличное количество памяти, так как каждый энкодинг надо мапить. Процесс интересный, однако сами разрабы LGBM рекомендуют энкодить категории до подачи в модель.
Наверное все знают, что не только CatBoost может обрабатывать категориальные фичи автоматически. LGBM тоже может, но они это делают по-разному.
LGBM на каждом шаге градиента делает TargetEncoding. Процесс не самый быстрый и требует приличное количество памяти, так как каждый энкодинг надо мапить. Процесс интересный, однако сами разрабы LGBM рекомендуют энкодить категории до подачи в модель.
👍2
#classic #ml
Продолжаем тему кодирования категорий. В прошлый раз затронули LGBM. Сегодня подробнее поговорим про CatBoost.
Итак в CatBoost используется для энкодинга так же Target Statistic (TS).
Есть разные стратегии работы с TS.
Жадная TS (Greedy TS):
* Использует среднее значение целевой переменной для каждой категории.
* Включает сглаживание с помощью параметра a и априорного значения p
* Подвержена условному сдвигу, так как использует целевое значение самого примера
😜 Это то, что мы используем чаще всего, когда сами энкодим таргетом
TS с исключением (Holdout TS):
* Разделяет данные на две части
* Вычисляет TS на одной части
* Обучает модель на другой
* Устраняет условный сдвиг, но использует меньше данных
😒 Жертвовать данными ради энкодинга ну такое себе
TS с исключением одного (Leave-one-out TS):
* Вычисляет TS на основе всех примеров, кроме текущего
* Несмотря на кажущуюся эффективность, всё равно подвержен сдвигу
Упорядоченная TS (Ordered TS):
* Использует случайную перестановку примеров
* Вычисляет TS только на основе предыдущих примеров в перестановке
* Эффективно использует все данные для обучения
* Устраняет условный сдвиг
🐈 Является базовой стратегией в CatBoost
Эксперименты показывают, что упорядоченная TS значительно превосходит другие подходы. Например, на датасете Amazon улучшение составляет 40% по logloss по сравнению с жадной TS и 8.3% по сравнению с holdout TS.
Важное преимущество упорядоченной TS - она позволяет эффективно использовать все обучающие данные как для вычисления целевых статистик, так и для обучения модели.
Процесс вычисления:
1. Для k-го примера берется подмножество Dk - все предыдущие примеры в перестановке
2. Вычисляется среднее значение целевой переменной по всем примерам из Dk с таким же категориальным значением
3. При этом само значение yk не участвует в вычислении
Для уменьшения влияния случайности:
* Используется несколько независимых перестановок
* Значения TS усредняются по всем перестановкам
* Это снижает дисперсию оценок, особенно для первых примеров в перестановке
Продолжаем тему кодирования категорий. В прошлый раз затронули LGBM. Сегодня подробнее поговорим про CatBoost.
Итак в CatBoost используется для энкодинга так же Target Statistic (TS).
Есть разные стратегии работы с TS.
Жадная TS (Greedy TS):
* Использует среднее значение целевой переменной для каждой категории.
* Включает сглаживание с помощью параметра a и априорного значения p
* Подвержена условному сдвигу, так как использует целевое значение самого примера
😜 Это то, что мы используем чаще всего, когда сами энкодим таргетом
TS с исключением (Holdout TS):
* Разделяет данные на две части
* Вычисляет TS на одной части
* Обучает модель на другой
* Устраняет условный сдвиг, но использует меньше данных
TS с исключением одного (Leave-one-out TS):
* Вычисляет TS на основе всех примеров, кроме текущего
* Несмотря на кажущуюся эффективность, всё равно подвержен сдвигу
Упорядоченная TS (Ordered TS):
* Использует случайную перестановку примеров
* Вычисляет TS только на основе предыдущих примеров в перестановке
* Эффективно использует все данные для обучения
* Устраняет условный сдвиг
🐈 Является базовой стратегией в CatBoost
Эксперименты показывают, что упорядоченная TS значительно превосходит другие подходы. Например, на датасете Amazon улучшение составляет 40% по logloss по сравнению с жадной TS и 8.3% по сравнению с holdout TS.
Важное преимущество упорядоченной TS - она позволяет эффективно использовать все обучающие данные как для вычисления целевых статистик, так и для обучения модели.
Процесс вычисления:
1. Для k-го примера берется подмножество Dk - все предыдущие примеры в перестановке
2. Вычисляется среднее значение целевой переменной по всем примерам из Dk с таким же категориальным значением
3. При этом само значение yk не участвует в вычислении
Для уменьшения влияния случайности:
* Используется несколько независимых перестановок
* Значения TS усредняются по всем перестановкам
* Это снижает дисперсию оценок, особенно для первых примеров в перестановке
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3