This media is not supported in your browser
VIEW IN TELEGRAM
Что скрывает LLM?
Вместе с Google DeepMind изучим, не используют ли модели неявное многошаговое рассуждение.
Чтобы понять, о чём речь, задам вопрос, на который вы, скорее всего, легко ответите. Как назывался корабль, на котором первый в истории космонавт отправился в космос?
Может, вам и не придётся вспоминать Гагарина, потому что вы знаете название корабля. А вот модели это необходимо. Имя космонавта в данном случае является так называемой связующей сущностью (bridge entity).
К каким выводам пришли спецы DeepMind:
🚀 сначала модель должна понять, о ком идёт речь, а потом вспомнить название “Восток-1”
🚀 при обработке подобных запросов LLM ищут в своём латентном пространстве эмбеддинги слов, соответствующих предполагаемому связующему объекту
🚀 уже на моменте “первый в истории космонавт” модель будет пытаться подставлять на это место “Юрий Гагарин” .
Способность к такой многоходовочке улучшается с увеличением размера модели, особенно на этапе определения сущностей.
А вот на втором шаге, во время генерации финального ответа, влияние размера не очень заметно.
Видео создано для канала Душа Питона с помощью Kandinsky Video
Вместе с Google DeepMind изучим, не используют ли модели неявное многошаговое рассуждение.
Чтобы понять, о чём речь, задам вопрос, на который вы, скорее всего, легко ответите. Как назывался корабль, на котором первый в истории космонавт отправился в космос?
Может, вам и не придётся вспоминать Гагарина, потому что вы знаете название корабля. А вот модели это необходимо. Имя космонавта в данном случае является так называемой связующей сущностью (bridge entity).
К каким выводам пришли спецы DeepMind:
🚀 сначала модель должна понять, о ком идёт речь, а потом вспомнить название “Восток-1”
🚀 при обработке подобных запросов LLM ищут в своём латентном пространстве эмбеддинги слов, соответствующих предполагаемому связующему объекту
🚀 уже на моменте “первый в истории космонавт” модель будет пытаться подставлять на это место “Юрий Гагарин” .
Способность к такой многоходовочке улучшается с увеличением размера модели, особенно на этапе определения сущностей.
А вот на втором шаге, во время генерации финального ответа, влияние размера не очень заметно.
Видео создано для канала Душа Питона с помощью Kandinsky Video
👍14❤1🔥1
Как побороть нехватку качественных данных при сборке датасета
В Google DeepMind предложили новый метод улучшения обучения визуально-языковых моделей (VLM), используя синтетические данные. Он позволяет обходить проблему дефицита хороших датасетов с аннотациями изображений.
Чтобы создать пары ненастоящих изображений и текстов, Synth^2 использует LLM и модели генерации картинок.
Как это делали:
✍️ Gemini Pro генерила описание картинки (похожее на человеческое) с неким заданным предметом
🎓 изображение создавал дообученный VQ-GAN
✨ VQ-GAN предоставлял только эмбеддинг изображения, а не полностью сгенерированную картинку (так сборка датасета идёт быстрее и эффективнее)
🎮 финальную VLM модель собрали из того же VQ-GAN и Chinchilla 400M.
Эксперименты показали, что VLM, обученная даже на небольшом количестве синтетических данных, лучше тех, для которых брали только “реальные” пары объектов.
С добавлением всего миллиона синтетических примеров качество генерируемых описаний на датасете COCO (метрика CIDEr-COCO) выросло на 17%.
Изображение Synth^2
В Google DeepMind предложили новый метод улучшения обучения визуально-языковых моделей (VLM), используя синтетические данные. Он позволяет обходить проблему дефицита хороших датасетов с аннотациями изображений.
Чтобы создать пары ненастоящих изображений и текстов, Synth^2 использует LLM и модели генерации картинок.
Как это делали:
Эксперименты показали, что VLM, обученная даже на небольшом количестве синтетических данных, лучше тех, для которых брали только “реальные” пары объектов.
С добавлением всего миллиона синтетических примеров качество генерируемых описаний на датасете COCO (метрика CIDEr-COCO) выросло на 17%.
Изображение Synth^2
Please open Telegram to view this post
VIEW IN TELEGRAM
👍11👏4❤2
Количество слов, включённых в открытый датасет Common Corpus, поражает. На сегодня это самый крупный набор данных. Стоит ожидать наплыва новых моделей с большим контекстным окном. Представлены английский, французский, голландский, испанский, немецкий и итальянский языки. Инглиш — самый охваченный (180 млрд слов).
Есть важная деталь⚠️
С авторским правом не будет абсолютно никаких проблем, поскольку в датасете нет защищённого им контента. Создатели признаются, что это только начало обработки огромного количества источников.
Время занимает именно тщательная проверка всех моментов, связанных с правообладателями. Так-то работы непочатый край, поэтому сбор открытых данных продолжается.
Есть важная деталь
С авторским правом не будет абсолютно никаких проблем, поскольку в датасете нет защищённого им контента. Создатели признаются, что это только начало обработки огромного количества источников.
Время занимает именно тщательная проверка всех моментов, связанных с правообладателями. Так-то работы непочатый край, поэтому сбор открытых данных продолжается.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍18❤2😁1
Новый чемпион опенсорса: DBRX победила Grok (и всех остальных)
И это несмотря на то, что размеры детища Маска превышают разработку от Databricks в два раза.
Больше подробностей:
⌛ LLM использует архитектуру Mixture of Experts
⌛ общее количество параметров 132 млрд, из которых 36 активны при любом вводе
⌛ обучена с помощью 3 000 H100 и 12 трлн токенов текстовых данных и кода
⌛ максимальная длина контекста — 32 тысячи токенов
⌛ датасет — более совершенный, чем тот, что использовали для обучения моделей семейства MPT
⌛ в модели задействовано в два раза больше экспертов: 16 (активных 4) при 8 у конкурентов (при активных 2)
⌛ соответственно, в 65 раз больше возможных комбинаций экспертов
DBRX Base и DBRX Instruct доступны для скачивания на Hugging Face. Репозиторий моделей DBRX можно найти на GitHub.
Больше информации в блоге разработчика.
Изображение DBRX
И это несмотря на то, что размеры детища Маска превышают разработку от Databricks в два раза.
Больше подробностей:
DBRX Base и DBRX Instruct доступны для скачивания на Hugging Face. Репозиторий моделей DBRX можно найти на GitHub.
Больше информации в блоге разработчика.
Изображение DBRX
Please open Telegram to view this post
VIEW IN TELEGRAM
👏11👍9🔥4❤1
Что на картинке: находим объекты на изображении вместе с AI
Мультимодальная модель Mixture of all Intelligence (MoAI) от Корейского института передовых технологий KAIST объединяет способности целого ряда инструментов.
MoAI использует одновременно:
1️⃣ panopticum segmentation для определения силуэтов и границ объектов
2️⃣ open-world object detection для анализа деталей, которые “не увидел” panopticum segmentation
3️⃣ scene graph generation позволяет получить текстовое описание отношений между объектами
4️⃣ optical character recognition распознаёт тексты
Работают два созданных в KAIST модуля: MoAI-Compressor и MoAI-Mixer. Первый превращает текстовые вводы всех 4 моделей выше в дополнительные токены. Второй делает финальный прогноз на основе всей информации.
За основу MoAI взяли InternLM-7B, с визуалом имел дело CLIP-L/14.
На бенчмарках (Q-Bench, SQA-IMG, POPE и прочих) MoAI лучше открытых Qwen-VL и LLaVA 1.5. Относительно проприетарных моделей показатели не хуже (сопоставимы с GPT-4V и Gemini Pro).
Изображение создано для канала Душа Питона с помощью Kandinsky
Мультимодальная модель Mixture of all Intelligence (MoAI) от Корейского института передовых технологий KAIST объединяет способности целого ряда инструментов.
MoAI использует одновременно:
Работают два созданных в KAIST модуля: MoAI-Compressor и MoAI-Mixer. Первый превращает текстовые вводы всех 4 моделей выше в дополнительные токены. Второй делает финальный прогноз на основе всей информации.
За основу MoAI взяли InternLM-7B, с визуалом имел дело CLIP-L/14.
На бенчмарках (Q-Bench, SQA-IMG, POPE и прочих) MoAI лучше открытых Qwen-VL и LLaVA 1.5. Относительно проприетарных моделей показатели не хуже (сопоставимы с GPT-4V и Gemini Pro).
Изображение создано для канала Душа Питона с помощью Kandinsky
Please open Telegram to view this post
VIEW IN TELEGRAM
👍8🔥4❤1
This media is not supported in your browser
VIEW IN TELEGRAM
Вчерашний лидер повержен. Встречаем нового!
Теперь это нейросеть Samba-CoE v0.2 от SambaNova, положившая DBRX на лопатки менее чем за сутки. Вот это скорость!
Кстати, о скорости. Именно этот показатель модели впечатляет прежде всего — 330 токенов в секунду, при этом без ущерба для точности.
Но важно и то, что LLM справляется всего при 8 RDU (реконфигурируемых процессоров для обработки данных). Эти процессоры разработали в SambaNova. Между составными частями RDU работает трёхмерная коммутирующая матрица (switching fabric) с высокой скоростью передачи данных.
В то время как конкурентам, в одно мгновение оказавшимся позади, требуется не меньше 576 GPU (при меньшей производительности).
Разработчики, сообщившие о запуске в Х, говорят, что секрет успеха в той самой уникальной архитектуре Composition of Experts (CoE), на которой основана Samba-1. В Samba-CoE v0.2 работают 5 моделей-экспертов (в каждой по 7 млрд параметров).
Новая модель обошла Gemma-7B, Mixtral-8x7B, Qwen-72B, Falcon-180B и BLOOM-176B.
Вскоре пообещали запустить и Samba-CoE v0.3
Теперь это нейросеть Samba-CoE v0.2 от SambaNova, положившая DBRX на лопатки менее чем за сутки. Вот это скорость!
Кстати, о скорости. Именно этот показатель модели впечатляет прежде всего — 330 токенов в секунду, при этом без ущерба для точности.
Но важно и то, что LLM справляется всего при 8 RDU (реконфигурируемых процессоров для обработки данных). Эти процессоры разработали в SambaNova. Между составными частями RDU работает трёхмерная коммутирующая матрица (switching fabric) с высокой скоростью передачи данных.
В то время как конкурентам, в одно мгновение оказавшимся позади, требуется не меньше 576 GPU (при меньшей производительности).
Разработчики, сообщившие о запуске в Х, говорят, что секрет успеха в той самой уникальной архитектуре Composition of Experts (CoE), на которой основана Samba-1. В Samba-CoE v0.2 работают 5 моделей-экспертов (в каждой по 7 млрд параметров).
Новая модель обошла Gemma-7B, Mixtral-8x7B, Qwen-72B, Falcon-180B и BLOOM-176B.
Вскоре пообещали запустить и Samba-CoE v0.3
👍11❤9🔥7
Media is too big
VIEW IN TELEGRAM
AI для геймеров от Google DeepMind
Компания выпустила универсального агента для прохождения игр Scalable Instructable Multiworld Agent (SIMA). Он выполняет данные пользователем команды на естественном языке и проходит задания в игровых локациях.
Но надо знать разрабов DeepMind, чтобы догадаться, что тренировали SIMA не только для игр😉 Тот, кто взаимодействует с визуальными мирами, сориентируется и на реальной местности.
SIMA был обучен в сотрудничестве с 8 игровыми студиями на 9 видеоиграх (и No Man’s Sky от Hello Games, и Teardown от Tuxedo Labs тоже).
Чему научили агента
⚡️ владеет широким спектром навыков (простая навигация, использование меню, добыча ресурсов, управление космическим кораблём, изготовление предметов)
⚡️ включает в себя визуальную модель для перевода происходящего на экране в текст
⚡️ есть видео-модель для прогнозов, что появится в игре после выполнения какого-то действия
⚡️ может работать без доступа к исходному коду или специализированным API
⚡️ требует лишь визуал с экрана и инструкции на естественном языке
Управляет игрой как обычно — мышкой 🐀 и клавишами 🎹
Что может? Хорошо обобщает знания: превосходит специализированных агентов, обученных на каждой игре в отдельности, а не на 9 сразу.
Более того, когда в экспериментах одну из игр исключали из тренировки, SIMA всё равно мог играть в неё почти без потери качества, опираясь на уже полученные навыки👍
Компания выпустила универсального агента для прохождения игр Scalable Instructable Multiworld Agent (SIMA). Он выполняет данные пользователем команды на естественном языке и проходит задания в игровых локациях.
Но надо знать разрабов DeepMind, чтобы догадаться, что тренировали SIMA не только для игр
SIMA был обучен в сотрудничестве с 8 игровыми студиями на 9 видеоиграх (и No Man’s Sky от Hello Games, и Teardown от Tuxedo Labs тоже).
Чему научили агента
Управляет игрой как обычно — мышкой 🐀 и клавишами 🎹
Что может? Хорошо обобщает знания: превосходит специализированных агентов, обученных на каждой игре в отдельности, а не на 9 сразу.
Более того, когда в экспериментах одну из игр исключали из тренировки, SIMA всё равно мог играть в неё почти без потери качества, опираясь на уже полученные навыки
Please open Telegram to view this post
VIEW IN TELEGRAM
👍14🤔4❤🔥1👏1
Как повысить качество ответов LLM без долгого файнтюнинга
Google представили новую разработку Cappy.
Модель-рефери с всего 360 млн параметров обучена на основе RoBERTa. Её основная задача — улучшение процесса выбора финального результата генерации другой модели (candidate selection).
Как работает Cappy:
🧑💻 ставит скор от 0 до 1 каждому из вариантов ответов LLM на заданный промпт
🧑💻 вариант с наибольшим результатом выбирается как окончательный
🧑💻 в генерации текста, где нет фиксированных вариантов ответа, Cappy служит вспомогательным модулем внутри LLM, улучшающим декодинг
🧑💻 в задачах, где варианты ответа известны заранее, Cappy выступает как отдельный классификатор, который на основе переданного текста сам выдаёт наиболее вероятный лейбл (к примеру, на вопрос “На основе отзыва скажи, понравился ли покупателю товар” можно ответить только “да” или “нет”)
Важно, что при использовании в ансамбле с LLM Cappy не требует доступа к параметрам модели, с которой работает. Это позволяет поддерживать в том числе и закрытые модели, доступные по API.
Результаты тестов работы с использованием модели:
⭐️ улучшился перформанс FLAN-T5 по сравнению с другими методами декодинга
⭐️ на бенчмарке Big-Bench метрика Rogue-L, отражающая сходство генераций модели и верных ответов, превысила значение 35 (популярные top-p, beam search и self-scoring набрали 30 и ниже)
Изображение Google Research
Google представили новую разработку Cappy.
Модель-рефери с всего 360 млн параметров обучена на основе RoBERTa. Её основная задача — улучшение процесса выбора финального результата генерации другой модели (candidate selection).
Как работает Cappy:
Важно, что при использовании в ансамбле с LLM Cappy не требует доступа к параметрам модели, с которой работает. Это позволяет поддерживать в том числе и закрытые модели, доступные по API.
Результаты тестов работы с использованием модели:
Изображение Google Research
Please open Telegram to view this post
VIEW IN TELEGRAM
👍8👏3❤1
OpenAI за высокое искусство
Тем более, что Sora позволяет воплощать самые безграничные фантазии.
Ролики новой подборки создавали режиссёры, дизайнеры и художники — люди с хорошим воображением и опытом. Отзывы о работе с моделью и её пользе они дали самые положительные.
А мы всё ещё ждём доступа к возможности создавать чудеса для всех желающих.
Тем более, что Sora позволяет воплощать самые безграничные фантазии.
Ролики новой подборки создавали режиссёры, дизайнеры и художники — люди с хорошим воображением и опытом. Отзывы о работе с моделью и её пользе они дали самые положительные.
А мы всё ещё ждём доступа к возможности создавать чудеса для всех желающих.
👍12🔥6😁5
This media is not supported in your browser
VIEW IN TELEGRAM
Как слышно? Три новых AI-инструмента, понимающих речь
Неделя получилась урожайной на решения из сферы голосового AI. Кое-кто даже конкурирует с OpenAI. Но обо всём по порядку.
🎤 Российские разработчики создали AI-ассистента, решающего массу рутинных рабочих задач. Его можно использовать для расшифровки речи участников видеоконференций, создавать с его помощью краткое резюме по итогам онлайн-мероприятий, ставить задачи ответственным и определять сроки их исполнения. А ещё он может работать как персональный бизнес-ассистент: создавать тексты, вести переписку, готовить документы и презентации на разных языках.
🎤 Ещё один AI-помощник для бизнеса носит многообещающее название “Ловец Инсайтов”. Инструмент помогает улучшить телефонные диалоги операторов контакт-центров с клиентами. "Ловец Инсайтов" может записать, расшифровать и проанализировать разговор. В составленных им отчётах будут показаны важные фрагменты беседы, реакции клиентов и контекст озвученных проблем.
🎤 Разработка Hugging Face Distil-Whisper v3 для распознавания речи и правда великолепна. Основана на модели Whisper от OpenAI, но меньше по параметрам (на 50%) и летает гораздо быстрее (скорость вывода в 6 раз больше, чем у модели команды Альтмана). В модель можно загрузить аудио (как mp3 или аудиодорожку из видео) и она фактически транскрибирует его. Распознаёт, кто что говорил в подкасте, интервью или на лекции, и переводит в текст.
Видео создано для канала Душа Питона с помощью Kandinsky Video
Неделя получилась урожайной на решения из сферы голосового AI. Кое-кто даже конкурирует с OpenAI. Но обо всём по порядку.
Видео создано для канала Душа Питона с помощью Kandinsky Video
Please open Telegram to view this post
VIEW IN TELEGRAM
👍11🔥6🤔3❤1
Полупроводники для AI, качество изображений и важные документы
Каким будет следующий этап развития AI? Решают и общественные организации, и компании-разработчики, и обычные пользователи.
✅ Встречаем первую резолюцию Генассамблеи ООН по AI. 120 стран договорились о том, как делать системы безопасными и надёжными, но прозрачными. Также в документе уделяется внимание авторским правам и защите данных.
✅ Разработчики тем временем поддерживают принцип доступности. Gemini 1.5 Pro открыта пользователям! Плюсы — миллион токенов и бесплатность. Минусы — в отдельных странах для использования придётся включать VPN. Также Google начала развёртывать поддержку API.
✅ А вот на российском сервисе “Авто.ру” ML-алгоритмы помогают абсолютно всем желающим. Инструменты подключили к анализу состояния б/у-автомобиля. Нейросеть сканирует фото машины, отбирает ракурсы, находит царапины, сколы, некачественный ремонт, коррозию Авто присваивается категория, которую учитывают при формировании стоимости. Оценщики считают, что алгоритмы неплохо справляются.
✅ К производителям совершенно новых полупроводников для нужд AI присоединяется Samsung. Недавно в похожий проект вложился SoftBank. А корейская компания создаёт лабораторию AGI Computing Lab. Будут искать дизайн чипов, сокращающий затраты ресурсов.
✅ У Stability AI в API появился апскейлер. Поднимаем качество изображений и видео до 4K без ущерба для детализации. Разработчики представили инструмент в ряду обновлений графических сервисов. Теперь можем одним промптом автофургон в конфеты одеть, волосы мне перекрасить, космонавту под ноги траву подстелить.
Изображение Donald Iain Smith/Tetra images/Getty Image
Каким будет следующий этап развития AI? Решают и общественные организации, и компании-разработчики, и обычные пользователи.
Изображение Donald Iain Smith/Tetra images/Getty Image
Please open Telegram to view this post
VIEW IN TELEGRAM
👍16💯3🤔2❤1
Элементарный способ определить текст, написанный LLM
Команда учёных из Колумбийского университета и Университета Ратгерса нашла эффективный и на удивление простой метод детектировать сгенерированный AI текст — Raidar
Существующие способы, как правило, полагаются на статистический анализ и подсчёт вероятностей появления слов в тексте (это основывается на том, что некоторые слова и выражения LLM употребляют чаще, чем люди). Авторы работы попросили LLM переписывать тексты, в которых нужно найти генерации, и оценили, насколько они поменялись на выходе.
Логика такая:
Исходя из принципа обучения, LLM выдают текст, который считают наиболее статистически вероятным. Следовательно, им тяжело переписать его иными словами. Это означает, что они вынуждены подбирать менее оптимальные слова, чем использованные в оригинале.
А поскольку в человеческих текстах паттерн выбора слов иной, для AI-систем не составляет проблемы подобрать синонимы на “реальных данных”.👍
Проверяли метод детекции на генерациях GPT-3 и GPT-3.5, данные представляли собой разнообразный набор из кода, статей на arxiv, отзывов на yelp, студенческих эссе и так далее.
Raidar обогнал более сложные существующие модели детекции (Ghostbuster, DetectGPT). По метрике F1 (сочетает в себе полноту и точность классификации) отрыв составлял вплоть до 29% в пользу Raidar.
Изображение Columbia University
Команда учёных из Колумбийского университета и Университета Ратгерса нашла эффективный и на удивление простой метод детектировать сгенерированный AI текст — Raidar
Существующие способы, как правило, полагаются на статистический анализ и подсчёт вероятностей появления слов в тексте (это основывается на том, что некоторые слова и выражения LLM употребляют чаще, чем люди). Авторы работы попросили LLM переписывать тексты, в которых нужно найти генерации, и оценили, насколько они поменялись на выходе.
Логика такая:
Исходя из принципа обучения, LLM выдают текст, который считают наиболее статистически вероятным. Следовательно, им тяжело переписать его иными словами. Это означает, что они вынуждены подбирать менее оптимальные слова, чем использованные в оригинале.
А поскольку в человеческих текстах паттерн выбора слов иной, для AI-систем не составляет проблемы подобрать синонимы на “реальных данных”.
Проверяли метод детекции на генерациях GPT-3 и GPT-3.5, данные представляли собой разнообразный набор из кода, статей на arxiv, отзывов на yelp, студенческих эссе и так далее.
Raidar обогнал более сложные существующие модели детекции (Ghostbuster, DetectGPT). По метрике F1 (сочетает в себе полноту и точность классификации) отрыв составлял вплоть до 29% в пользу Raidar.
Изображение Columbia University
Please open Telegram to view this post
VIEW IN TELEGRAM
👏11🔥9❤4👍1
Подборка моделей: анимация, 3D и генерация любых движений
Эволюционируют, работают всё быстрее и продолжают соревноваться.
🔤 Как вам идея генератора, который будет штамповать новые модели сам? Видится вполне реальным после разработки стартапа Sakana AI. Алгоритм сам выбирает модели из существующих открытых, комбинирует слои и смешивает веса, изучая множество разных комбинаций. Затем выводит вариант, который достигает SOTA-результатов 🤩
🔤 3D-изображение по промпту и меньше чем за 1 с. На это способна LATTE3D от Nvidia. Работает даже на одном Nvidia RTX A6000 и способна генерить сразу несколько вариантов 3D-объекта. Результат можно улучшить и сразу экспортировать в приложения или на платформы.
🔤 Оживляем картинку по частям. По клику и промпту начнёт двигаться именно тот фрагмент, который вы выбрали. Большая и сложная динамика китайскому фреймворку Follow-Your-Click пока недоступна, но AI-анимация определённо становится интереснее.
🔤 CLIP + Stable Diffusion XL. Что получится? Модель MindEye2, которая может показать, что видит человек. Используются данные фМРТ мозга, по которым воссоздаётся картинка зрительного восприятия человека.
🔤 Ещё один новый инструмент Stability AI генерит код, решает математические задачи и помогает в разработке ПО. В кодинге выдаёт SOTA-результаты, при этом превосходит CodeLlama 7B Instruct* и выступает не хуже StarChat 15B. Веса и код в доступе.
* Продукт экстремистской организации, деятельность которой запрещена на территории РФ.
Изображение Stability AI
Эволюционируют, работают всё быстрее и продолжают соревноваться.
* Продукт экстремистской организации, деятельность которой запрещена на территории РФ.
Изображение Stability AI
Please open Telegram to view this post
VIEW IN TELEGRAM
👍11🔥6❤2🤔1
Миксуем методы в обучении LLM
Branch-Train-Mix (BTX)* — новый способ от Meta**, объединяющий Mixture of Experts (MoE) и Branch-Train-Merge (BTM) подходы.
Что есть MoE:
🌀 в рамках одной модели обучаются несколько экспертов, специализирующихся каждый на своём домене
🌀 во время инференса сигнал перенаправляется роутером к самому подходящему эксперту (или нескольким)
А Branch-Train-Merge:
🌀 в нём просто усредняются веса независимых друг от друга моделей
Branch-Train-Mix* же:
⭐️ начинает с создания отдельных копий LLM
⭐️ обучает их под конкретный домен
⭐️ после этого их feedforward-параметры объединяются в слои общей MoE модели, а остальные усредняются
В итоге BTX сочетает в себе достоинства обоих подходов: от MоE остаётся возможность файнтюнинга одной финальной модели, а от BMT сохраняется асинхронный подход к обучению, который позволяет существенно снизить вычислительные затраты.
Для экспериментов авторы использовали модель Llama-2 7B*, обученную на данных из математики, написания кода и Wikipedia. В сравнении с перформансом обычной Llama-2*, BTX-модель существенно лучше справляется с программированием и математикой на GSM8K, MATH, HumanEval, MBPP.
* продукт деятельности экстремистской организации, деятельность которой запрещена на территории РФ.
** экстремистская организация, деятельность которой запрещена на территории РФ.
Изображение Branch-Train-Mix
Branch-Train-Mix (BTX)* — новый способ от Meta**, объединяющий Mixture of Experts (MoE) и Branch-Train-Merge (BTM) подходы.
Что есть MoE:
🌀 в рамках одной модели обучаются несколько экспертов, специализирующихся каждый на своём домене
🌀 во время инференса сигнал перенаправляется роутером к самому подходящему эксперту (или нескольким)
А Branch-Train-Merge:
🌀 в нём просто усредняются веса независимых друг от друга моделей
Branch-Train-Mix* же:
В итоге BTX сочетает в себе достоинства обоих подходов: от MоE остаётся возможность файнтюнинга одной финальной модели, а от BMT сохраняется асинхронный подход к обучению, который позволяет существенно снизить вычислительные затраты.
Для экспериментов авторы использовали модель Llama-2 7B*, обученную на данных из математики, написания кода и Wikipedia. В сравнении с перформансом обычной Llama-2*, BTX-модель существенно лучше справляется с программированием и математикой на GSM8K, MATH, HumanEval, MBPP.
* продукт деятельности экстремистской организации, деятельность которой запрещена на территории РФ.
** экстремистская организация, деятельность которой запрещена на территории РФ.
Изображение Branch-Train-Mix
Please open Telegram to view this post
VIEW IN TELEGRAM
👍10🤔3👏2❤1
Media is too big
VIEW IN TELEGRAM
Рисуем фотореалистичную картинку с помощью AI
Попробовала один из AI-инструментов на Freepik. Функция real time sketch позволяет генерить на ходу, когда ты сразу видишь, что получается, и можешь менять/корректировать изображение.
🪄 Сначала генернула фон с помощью фигуры из левого меню и цвета. Обратите внимание, что обычную зелень генератор сделал травой в тот момент, когда я “посадила” на него дерево 🍀 Голубую поверхность с лодкой он вероятнее всего превратил бы в воду 💦
🪄 В отличие от КRЕА, в которую картинки-оригиналы необходимо собирать самостоятельно, здесь масса иконок на выбор. Поиск в помощь! Ну, если уж вам нужно нечто совсем редкое, за основу берите что-то формальное и доводите до ума промптом.
🪄 Собственно, промпт и есть главный герой истории. В верхнем поле к изначальной “рыбе” masterpiece, finest quality, 4K, sharp focus добавляем детали. Из дерева генерится пальма, кошка становится диким зверем 🤬
🪄 Важно, что композиция — в твоих руках. В промпте не приходится выписывать, что за чем стоит и из-за чего выглядывает. Ручной дизайнерский инструмент нам оставили, совместив его с AI-функцией. Всё можно расставлять по своим местам обычным перетаскиванием и контролировать!
Подробности в ролике, пробуем тут
Попробовала один из AI-инструментов на Freepik. Функция real time sketch позволяет генерить на ходу, когда ты сразу видишь, что получается, и можешь менять/корректировать изображение.
Подробности в ролике, пробуем тут
Please open Telegram to view this post
VIEW IN TELEGRAM
👍15🔥8👏3
Объём словарного запаса терминов, которые знает планшет-переводчик от концерна "Росэнергоатом", позволяет обсуждать с иностранными партнёрами широкий круг направлений деятельности.
Использовали экономический, технический и производственный английский, включая терминологию атомной отрасли.
Распознаёт и переводит речь ML-алгоритм, который обучали более 900 часов. Может обрабатывать большие объёмы данных и длительные диалоги, адаптироваться к акцентам.
Гаджет солидный😎 , так как качественно работать он должен и в сложных условиях, в том числе на шумных производственных объектах и на улице.
Использовали экономический, технический и производственный английский, включая терминологию атомной отрасли.
Распознаёт и переводит речь ML-алгоритм, который обучали более 900 часов. Может обрабатывать большие объёмы данных и длительные диалоги, адаптироваться к акцентам.
Гаджет солидный
Please open Telegram to view this post
VIEW IN TELEGRAM
🥰11👍6😁4👏2🏆1
This media is not supported in your browser
VIEW IN TELEGRAM
Что повысит разрешение у визуальной модели
Разбираемся в разработке MIT FeatUp. Она улучшает качество изображения в 16 раз.
Суть работы FeatUp в том, что высококачественная картинка реконструируется по нескольким низкокачественным генерациям:
✈️ на вход подаются видоизменённые варианты исходного изображения (обрезанное, перевёрнутое, зашумленное)
✈️ из латентных низкокачественных представлений можно собрать одну хорошую картинку, так как алгоритм анализирует реакцию модели на смещение каждого пикселя
При обучении FeatUp тренируется создавать латентное представление высокого разрешения так, чтобы при уменьшении размерности получалось представление исходной низкокачественной модели.
Инструмент работает с любой архитектурой и задачами (например, для сегментации или предсказания глубины картинки)👍 Исключение: модели, генерирующие с нуля, без исходной референсной картинки или видео.
В ходе экспериментов размерность VisualTransformer выросла в 16 раз, превзойдя аналогичные модели (CARAFE, IndexNet и FADE).
Видео Mark Hamilton
Разбираемся в разработке MIT FeatUp. Она улучшает качество изображения в 16 раз.
Суть работы FeatUp в том, что высококачественная картинка реконструируется по нескольким низкокачественным генерациям:
При обучении FeatUp тренируется создавать латентное представление высокого разрешения так, чтобы при уменьшении размерности получалось представление исходной низкокачественной модели.
Инструмент работает с любой архитектурой и задачами (например, для сегментации или предсказания глубины картинки)
В ходе экспериментов размерность VisualTransformer выросла в 16 раз, превзойдя аналогичные модели (CARAFE, IndexNet и FADE).
Видео Mark Hamilton
Please open Telegram to view this post
VIEW IN TELEGRAM
👏8👍6❤2🏆1