DS & ML
589 subscribers
1.17K photos
238 videos
240 files
1.41K links
Download Telegram
Forwarded from эйай ньюз
Sophia: новый оптимизатор, который 2x быстрее, чем Adam для тренировки LLM

До сих пор все тренируем со старым добрым Адамом. А ему уже 7 лет!

Не так давно я писал о многообещающем оптимизаторе LION. Ну, а теперь появился еще один интересный кандидат.

Sophia — это оптимизатор, который использует быструю оценку Гессиана (матрица вторых производных) для того чтобы быстрее двигаться в плоских областях ландшафта функции потерь, где именно Адам довольно медленно продвигается. Вторые производные тут как раз помогают более точно понять, в каком направлении нужно оптимизировать параметры.

Вычислять Гессиан в общем случае довольно медленно, поэтому методы второго порядка так и не получии распространения в DL.
На картинке есть псевдокод, из которого видно, что оценить диагональные элементы Гессиана можно довольно быстро.

Sophia ускоряет обучение LLM в 2 раза (!). Протестировали на GPT-2 моделях масштаба от 125M до 770M параметров. Тренд на дальнейшее масштабирование выглядит хорошо.

❱❱ Arxiv | Code

@ai_newz
👍1
Основы работы с большими данными: Data Science Orientation

Этот курс – введение в сложную и многогранную область науки по работе с большими данными – Data Science.
Вопросы, на которые вы получите ответы:
📍Что представляет собой Data Science и как она связана с большими данными (Big Data)?
📍Как «приложить» Data Science к вашему бизнесу и нужно ли?
📍Какие данные можно использовать для анализа?
📍Где именно искать и какие результаты ожидать?

Для кого этот курс?
📍Руководители компаний и подразделений
📍Линейные менеджеры
📍Бизнес-аналитики
📍Разработчики
📍Другие сотрудники, вовлеченные в аналитическую деятельность компании

Вы поймете, как подготовить компанию и сотрудников к практическому применению больших данных (Big Data) в работе.
Вы сможете повысить эффективность принятия решений за счет грамотного сбора, структурирования и применения современных техник анализа больших данных (Big Data).

Дополнение по курсу

#cours
Forwarded from эйай ньюз
🦍 Gorilla: Large Language Model Connected with Massive APIs

Языковые модели иногда врут и голлюцинируют и по умолчанию имеют доступ только к срезу данных, на которых обучались. Чтобы хоть частично решить эти проблемы, решено было дать им доступ к интернету, чтобы они гуглили и научить их пользоваться сторонними инструментами (через плагины). Вот тут я писал про плагины к ChatGPT, о которых позаботилась OpenAI.

А как же домашние LLM?
И тут опенсоурс не отстаёт. В этой работе парни прикрутили более 1600 API к LLaMa-7B. И их затюненая LLaMa обошла по качеству API вызовов даже GPT-4 и Claude AI!

Е-е-е, оупен-сорс вперёд!

Основной фокус этой статьи — вызовы нейронок через API с платформ Torch Hub, HuggingFace и Tensorflow Hub. То есть ты пишешь "я хочу детектировать и трекать голубей на видео" и модель выдаст вам какие API запросы нужно сделать. И это можно выстраивать в умные пайплайны, где по желанию пользователя будут вызываться разные модели.

Попробуй Гориллу за 60 сек (колаб)
Код
Сайт проекта

@ai_newz
👍1
Forwarded from Пикабу
🖼 При помощи нейросети от Photoshop, дорисовал популярные картины

1. Утро в сосновом лесу. Картина – Иван Иванович Шишкин и Константин Аполлонович Савицкий.
2. Девятый вал. Картина – Иван Константинович Айвазовский.
3. Богатыри. Картина Васнецова.
4. Постоянство памяти. Картина – Сальвадор Дали.
5. Рожь. Картина – Иван Иванович Шишкин.
6. Грачи прилетели. Картина – Алексей Кондратьевич Саврасов.
7. Московский дворик. Картина – Василий Поленов.

Автор на Пикабу: Mafiloda
Комментарии: pikabu.ru/link/EYzWTN9Hd9

#нейросети
Forwarded from Эксплойт
Нейросеть Generative Fill нашла свое предназначение.

Только посмотрите, как ИИ бережно восстанавливает семейные архивы этих милых людей.

@exploitex
Forwarded from эйай ньюз
This media is not supported in your browser
VIEW IN TELEGRAM
Вот это новость от AMD! Как долго я этого ждал.

AMD наконец вступила в Deep Learning игру и показывает серьезную заявку пошатнуть монополию NVIDIA на рынке AI чипов.

Сегодня они представили новую видеокарту для обучения и инференса нейронных сетей — AMD MI300X.

Эта крошка вполне может тягаться с Nvidia H100.

Вот её характеристики:
— 192 Gb VRAM на одном чипе, (против 80Gb у H100, NVL версия не в счёт)
— 5.2Tb пропускная способность памяти (против 3.35 y H100)
— Бенчмарков по скорости пока нет, но одна Mi300X легко тянет 40B языковую модель Falcon в риалтайме (см на видео). Это первая видеокарта, которая вмещает модель такого размера полность в своей памяти.

Ещё (это очень важно) AMD договорились с Pytorch Foundation о том, что их софтовый стэк ROCm и все обновления будет поддерживаться и сразу запиливаться в Pytorch 2.0. То есть теперь гонять сети на картах AMD станет также легко как и на гпу от Nvidia! Это чудесные новости!

@ai_newz
Forwarded from Дизраптор
Про китайский ИИ

ChatGPT об OpenAI уже стал навыком, которые работодатели указывают в требовании к вакансии. Bard от Google успел неплохо разогнаться. Даже Сбер с Яндексом выкатили свои ИИшки.

А китайцы все молчат. Нет, конечно, периодически появляются некоторые новости. То сам Кай-Фу Ли возглавит китайский ИИ-проект, то каждый из технологических гигантов обещает вложить миллиарды в свой искусственный интеллект. Теперь вот пишут, что Baidu a.k.a. "китайский Гугл" создаст венчурный фонд для китайских ИИ-стартапов. Да и вообще, вроде бы в Китае разных LLM уже под сотню.

Короче говоря, нет сомнений, что совсем скоро Китай будет в лидерах по ИИ. Рано или поздно китайцы получат ИИшки в открытый доступ (разумеется, те, чей социальный рейтинг не ниже 10).

Вероятно, китайские модели будут очень сильно отличаться от западных собратьев. Дело в том, что разработать большую языковую модель не так уж и сложно. Другое дело - эффективно ее обучить на больших данных. И вот тут у западных и китайских ИИ может случиться серьезное расхождение в подходах.

Во-первых, пока западные модели обучаются практически на всем мире, китайские будут кормиться только внутри "Великого файервола". Это может иметь очень значимые последствия. Помимо того, что социальные и потребительские привычки китайцев ооочень сильно отличаются от остального мира, китайские данные могут иметь принципиально другой уровень глубины.

В Китае львиная доля цифровой активности происходит внутри цифровых экосистем и суперсервисов - в первую очередь, WeChat, но есть и другие. В них как генерится контент, так и делаются транзакции. Следовательно, ИИ может кормиться не только текстами и кодом, но и реальными данными о платежах, перемещениях, заказах и много чем еще. OpenAI или Google о таком могут только мечтать, даже при наличии плагинов.

Поэтому, с одной стороны, китайский ИИ может быть очень сильно деформирован под китайский рынок. Но с другой - быть глубже и многослойнее, чем западные аналоги. Примерно как китайская культура, философия и все остальное.

В общем, уверен, что китайцы смогут сделать свой крутой ИИ. Однако, как и многие другие цифровые продукты из Поднебесной, китайский ИИ может оказаться малополезен за пределами страны (даже если китайцы заходят его "экспортировать", что тоже далеко не факт).

Disruptors