DS & ML
589 subscribers
1.17K photos
238 videos
240 files
1.41K links
Download Telegram
Forwarded from эйай ньюз
Sophia: новый оптимизатор, который 2x быстрее, чем Adam для тренировки LLM

До сих пор все тренируем со старым добрым Адамом. А ему уже 7 лет!

Не так давно я писал о многообещающем оптимизаторе LION. Ну, а теперь появился еще один интересный кандидат.

Sophia — это оптимизатор, который использует быструю оценку Гессиана (матрица вторых производных) для того чтобы быстрее двигаться в плоских областях ландшафта функции потерь, где именно Адам довольно медленно продвигается. Вторые производные тут как раз помогают более точно понять, в каком направлении нужно оптимизировать параметры.

Вычислять Гессиан в общем случае довольно медленно, поэтому методы второго порядка так и не получии распространения в DL.
На картинке есть псевдокод, из которого видно, что оценить диагональные элементы Гессиана можно довольно быстро.

Sophia ускоряет обучение LLM в 2 раза (!). Протестировали на GPT-2 моделях масштаба от 125M до 770M параметров. Тренд на дальнейшее масштабирование выглядит хорошо.

❱❱ Arxiv | Code

@ai_newz
👍1
Основы работы с большими данными: Data Science Orientation

Этот курс – введение в сложную и многогранную область науки по работе с большими данными – Data Science.
Вопросы, на которые вы получите ответы:
📍Что представляет собой Data Science и как она связана с большими данными (Big Data)?
📍Как «приложить» Data Science к вашему бизнесу и нужно ли?
📍Какие данные можно использовать для анализа?
📍Где именно искать и какие результаты ожидать?

Для кого этот курс?
📍Руководители компаний и подразделений
📍Линейные менеджеры
📍Бизнес-аналитики
📍Разработчики
📍Другие сотрудники, вовлеченные в аналитическую деятельность компании

Вы поймете, как подготовить компанию и сотрудников к практическому применению больших данных (Big Data) в работе.
Вы сможете повысить эффективность принятия решений за счет грамотного сбора, структурирования и применения современных техник анализа больших данных (Big Data).

Дополнение по курсу

#cours
Forwarded from эйай ньюз
🦍 Gorilla: Large Language Model Connected with Massive APIs

Языковые модели иногда врут и голлюцинируют и по умолчанию имеют доступ только к срезу данных, на которых обучались. Чтобы хоть частично решить эти проблемы, решено было дать им доступ к интернету, чтобы они гуглили и научить их пользоваться сторонними инструментами (через плагины). Вот тут я писал про плагины к ChatGPT, о которых позаботилась OpenAI.

А как же домашние LLM?
И тут опенсоурс не отстаёт. В этой работе парни прикрутили более 1600 API к LLaMa-7B. И их затюненая LLaMa обошла по качеству API вызовов даже GPT-4 и Claude AI!

Е-е-е, оупен-сорс вперёд!

Основной фокус этой статьи — вызовы нейронок через API с платформ Torch Hub, HuggingFace и Tensorflow Hub. То есть ты пишешь "я хочу детектировать и трекать голубей на видео" и модель выдаст вам какие API запросы нужно сделать. И это можно выстраивать в умные пайплайны, где по желанию пользователя будут вызываться разные модели.

Попробуй Гориллу за 60 сек (колаб)
Код
Сайт проекта

@ai_newz
👍1
Forwarded from Пикабу
🖼 При помощи нейросети от Photoshop, дорисовал популярные картины

1. Утро в сосновом лесу. Картина – Иван Иванович Шишкин и Константин Аполлонович Савицкий.
2. Девятый вал. Картина – Иван Константинович Айвазовский.
3. Богатыри. Картина Васнецова.
4. Постоянство памяти. Картина – Сальвадор Дали.
5. Рожь. Картина – Иван Иванович Шишкин.
6. Грачи прилетели. Картина – Алексей Кондратьевич Саврасов.
7. Московский дворик. Картина – Василий Поленов.

Автор на Пикабу: Mafiloda
Комментарии: pikabu.ru/link/EYzWTN9Hd9

#нейросети
Forwarded from Эксплойт
Нейросеть Generative Fill нашла свое предназначение.

Только посмотрите, как ИИ бережно восстанавливает семейные архивы этих милых людей.

@exploitex
Forwarded from эйай ньюз
This media is not supported in your browser
VIEW IN TELEGRAM
Вот это новость от AMD! Как долго я этого ждал.

AMD наконец вступила в Deep Learning игру и показывает серьезную заявку пошатнуть монополию NVIDIA на рынке AI чипов.

Сегодня они представили новую видеокарту для обучения и инференса нейронных сетей — AMD MI300X.

Эта крошка вполне может тягаться с Nvidia H100.

Вот её характеристики:
— 192 Gb VRAM на одном чипе, (против 80Gb у H100, NVL версия не в счёт)
— 5.2Tb пропускная способность памяти (против 3.35 y H100)
— Бенчмарков по скорости пока нет, но одна Mi300X легко тянет 40B языковую модель Falcon в риалтайме (см на видео). Это первая видеокарта, которая вмещает модель такого размера полность в своей памяти.

Ещё (это очень важно) AMD договорились с Pytorch Foundation о том, что их софтовый стэк ROCm и все обновления будет поддерживаться и сразу запиливаться в Pytorch 2.0. То есть теперь гонять сети на картах AMD станет также легко как и на гпу от Nvidia! Это чудесные новости!

@ai_newz