OpenAI за высокое искусство
Тем более, что Sora позволяет воплощать самые безграничные фантазии.
Ролики новой подборки создавали режиссёры, дизайнеры и художники — люди с хорошим воображением и опытом. Отзывы о работе с моделью и её пользе они дали самые положительные.
А мы всё ещё ждём доступа к возможности создавать чудеса для всех желающих.
Тем более, что Sora позволяет воплощать самые безграничные фантазии.
Ролики новой подборки создавали режиссёры, дизайнеры и художники — люди с хорошим воображением и опытом. Отзывы о работе с моделью и её пользе они дали самые положительные.
А мы всё ещё ждём доступа к возможности создавать чудеса для всех желающих.
👍12🔥6😁5
This media is not supported in your browser
VIEW IN TELEGRAM
Как слышно? Три новых AI-инструмента, понимающих речь
Неделя получилась урожайной на решения из сферы голосового AI. Кое-кто даже конкурирует с OpenAI. Но обо всём по порядку.
🎤 Российские разработчики создали AI-ассистента, решающего массу рутинных рабочих задач. Его можно использовать для расшифровки речи участников видеоконференций, создавать с его помощью краткое резюме по итогам онлайн-мероприятий, ставить задачи ответственным и определять сроки их исполнения. А ещё он может работать как персональный бизнес-ассистент: создавать тексты, вести переписку, готовить документы и презентации на разных языках.
🎤 Ещё один AI-помощник для бизнеса носит многообещающее название “Ловец Инсайтов”. Инструмент помогает улучшить телефонные диалоги операторов контакт-центров с клиентами. "Ловец Инсайтов" может записать, расшифровать и проанализировать разговор. В составленных им отчётах будут показаны важные фрагменты беседы, реакции клиентов и контекст озвученных проблем.
🎤 Разработка Hugging Face Distil-Whisper v3 для распознавания речи и правда великолепна. Основана на модели Whisper от OpenAI, но меньше по параметрам (на 50%) и летает гораздо быстрее (скорость вывода в 6 раз больше, чем у модели команды Альтмана). В модель можно загрузить аудио (как mp3 или аудиодорожку из видео) и она фактически транскрибирует его. Распознаёт, кто что говорил в подкасте, интервью или на лекции, и переводит в текст.
Видео создано для канала Душа Питона с помощью Kandinsky Video
Неделя получилась урожайной на решения из сферы голосового AI. Кое-кто даже конкурирует с OpenAI. Но обо всём по порядку.
Видео создано для канала Душа Питона с помощью Kandinsky Video
Please open Telegram to view this post
VIEW IN TELEGRAM
👍11🔥6🤔3❤1
Полупроводники для AI, качество изображений и важные документы
Каким будет следующий этап развития AI? Решают и общественные организации, и компании-разработчики, и обычные пользователи.
✅ Встречаем первую резолюцию Генассамблеи ООН по AI. 120 стран договорились о том, как делать системы безопасными и надёжными, но прозрачными. Также в документе уделяется внимание авторским правам и защите данных.
✅ Разработчики тем временем поддерживают принцип доступности. Gemini 1.5 Pro открыта пользователям! Плюсы — миллион токенов и бесплатность. Минусы — в отдельных странах для использования придётся включать VPN. Также Google начала развёртывать поддержку API.
✅ А вот на российском сервисе “Авто.ру” ML-алгоритмы помогают абсолютно всем желающим. Инструменты подключили к анализу состояния б/у-автомобиля. Нейросеть сканирует фото машины, отбирает ракурсы, находит царапины, сколы, некачественный ремонт, коррозию Авто присваивается категория, которую учитывают при формировании стоимости. Оценщики считают, что алгоритмы неплохо справляются.
✅ К производителям совершенно новых полупроводников для нужд AI присоединяется Samsung. Недавно в похожий проект вложился SoftBank. А корейская компания создаёт лабораторию AGI Computing Lab. Будут искать дизайн чипов, сокращающий затраты ресурсов.
✅ У Stability AI в API появился апскейлер. Поднимаем качество изображений и видео до 4K без ущерба для детализации. Разработчики представили инструмент в ряду обновлений графических сервисов. Теперь можем одним промптом автофургон в конфеты одеть, волосы мне перекрасить, космонавту под ноги траву подстелить.
Изображение Donald Iain Smith/Tetra images/Getty Image
Каким будет следующий этап развития AI? Решают и общественные организации, и компании-разработчики, и обычные пользователи.
Изображение Donald Iain Smith/Tetra images/Getty Image
Please open Telegram to view this post
VIEW IN TELEGRAM
👍16💯3🤔2❤1
Элементарный способ определить текст, написанный LLM
Команда учёных из Колумбийского университета и Университета Ратгерса нашла эффективный и на удивление простой метод детектировать сгенерированный AI текст — Raidar
Существующие способы, как правило, полагаются на статистический анализ и подсчёт вероятностей появления слов в тексте (это основывается на том, что некоторые слова и выражения LLM употребляют чаще, чем люди). Авторы работы попросили LLM переписывать тексты, в которых нужно найти генерации, и оценили, насколько они поменялись на выходе.
Логика такая:
Исходя из принципа обучения, LLM выдают текст, который считают наиболее статистически вероятным. Следовательно, им тяжело переписать его иными словами. Это означает, что они вынуждены подбирать менее оптимальные слова, чем использованные в оригинале.
А поскольку в человеческих текстах паттерн выбора слов иной, для AI-систем не составляет проблемы подобрать синонимы на “реальных данных”.👍
Проверяли метод детекции на генерациях GPT-3 и GPT-3.5, данные представляли собой разнообразный набор из кода, статей на arxiv, отзывов на yelp, студенческих эссе и так далее.
Raidar обогнал более сложные существующие модели детекции (Ghostbuster, DetectGPT). По метрике F1 (сочетает в себе полноту и точность классификации) отрыв составлял вплоть до 29% в пользу Raidar.
Изображение Columbia University
Команда учёных из Колумбийского университета и Университета Ратгерса нашла эффективный и на удивление простой метод детектировать сгенерированный AI текст — Raidar
Существующие способы, как правило, полагаются на статистический анализ и подсчёт вероятностей появления слов в тексте (это основывается на том, что некоторые слова и выражения LLM употребляют чаще, чем люди). Авторы работы попросили LLM переписывать тексты, в которых нужно найти генерации, и оценили, насколько они поменялись на выходе.
Логика такая:
Исходя из принципа обучения, LLM выдают текст, который считают наиболее статистически вероятным. Следовательно, им тяжело переписать его иными словами. Это означает, что они вынуждены подбирать менее оптимальные слова, чем использованные в оригинале.
А поскольку в человеческих текстах паттерн выбора слов иной, для AI-систем не составляет проблемы подобрать синонимы на “реальных данных”.
Проверяли метод детекции на генерациях GPT-3 и GPT-3.5, данные представляли собой разнообразный набор из кода, статей на arxiv, отзывов на yelp, студенческих эссе и так далее.
Raidar обогнал более сложные существующие модели детекции (Ghostbuster, DetectGPT). По метрике F1 (сочетает в себе полноту и точность классификации) отрыв составлял вплоть до 29% в пользу Raidar.
Изображение Columbia University
Please open Telegram to view this post
VIEW IN TELEGRAM
👏11🔥9❤4👍1
Подборка моделей: анимация, 3D и генерация любых движений
Эволюционируют, работают всё быстрее и продолжают соревноваться.
🔤 Как вам идея генератора, который будет штамповать новые модели сам? Видится вполне реальным после разработки стартапа Sakana AI. Алгоритм сам выбирает модели из существующих открытых, комбинирует слои и смешивает веса, изучая множество разных комбинаций. Затем выводит вариант, который достигает SOTA-результатов 🤩
🔤 3D-изображение по промпту и меньше чем за 1 с. На это способна LATTE3D от Nvidia. Работает даже на одном Nvidia RTX A6000 и способна генерить сразу несколько вариантов 3D-объекта. Результат можно улучшить и сразу экспортировать в приложения или на платформы.
🔤 Оживляем картинку по частям. По клику и промпту начнёт двигаться именно тот фрагмент, который вы выбрали. Большая и сложная динамика китайскому фреймворку Follow-Your-Click пока недоступна, но AI-анимация определённо становится интереснее.
🔤 CLIP + Stable Diffusion XL. Что получится? Модель MindEye2, которая может показать, что видит человек. Используются данные фМРТ мозга, по которым воссоздаётся картинка зрительного восприятия человека.
🔤 Ещё один новый инструмент Stability AI генерит код, решает математические задачи и помогает в разработке ПО. В кодинге выдаёт SOTA-результаты, при этом превосходит CodeLlama 7B Instruct* и выступает не хуже StarChat 15B. Веса и код в доступе.
* Продукт экстремистской организации, деятельность которой запрещена на территории РФ.
Изображение Stability AI
Эволюционируют, работают всё быстрее и продолжают соревноваться.
* Продукт экстремистской организации, деятельность которой запрещена на территории РФ.
Изображение Stability AI
Please open Telegram to view this post
VIEW IN TELEGRAM
👍11🔥6❤2🤔1
Миксуем методы в обучении LLM
Branch-Train-Mix (BTX)* — новый способ от Meta**, объединяющий Mixture of Experts (MoE) и Branch-Train-Merge (BTM) подходы.
Что есть MoE:
🌀 в рамках одной модели обучаются несколько экспертов, специализирующихся каждый на своём домене
🌀 во время инференса сигнал перенаправляется роутером к самому подходящему эксперту (или нескольким)
А Branch-Train-Merge:
🌀 в нём просто усредняются веса независимых друг от друга моделей
Branch-Train-Mix* же:
⭐️ начинает с создания отдельных копий LLM
⭐️ обучает их под конкретный домен
⭐️ после этого их feedforward-параметры объединяются в слои общей MoE модели, а остальные усредняются
В итоге BTX сочетает в себе достоинства обоих подходов: от MоE остаётся возможность файнтюнинга одной финальной модели, а от BMT сохраняется асинхронный подход к обучению, который позволяет существенно снизить вычислительные затраты.
Для экспериментов авторы использовали модель Llama-2 7B*, обученную на данных из математики, написания кода и Wikipedia. В сравнении с перформансом обычной Llama-2*, BTX-модель существенно лучше справляется с программированием и математикой на GSM8K, MATH, HumanEval, MBPP.
* продукт деятельности экстремистской организации, деятельность которой запрещена на территории РФ.
** экстремистская организация, деятельность которой запрещена на территории РФ.
Изображение Branch-Train-Mix
Branch-Train-Mix (BTX)* — новый способ от Meta**, объединяющий Mixture of Experts (MoE) и Branch-Train-Merge (BTM) подходы.
Что есть MoE:
🌀 в рамках одной модели обучаются несколько экспертов, специализирующихся каждый на своём домене
🌀 во время инференса сигнал перенаправляется роутером к самому подходящему эксперту (или нескольким)
А Branch-Train-Merge:
🌀 в нём просто усредняются веса независимых друг от друга моделей
Branch-Train-Mix* же:
В итоге BTX сочетает в себе достоинства обоих подходов: от MоE остаётся возможность файнтюнинга одной финальной модели, а от BMT сохраняется асинхронный подход к обучению, который позволяет существенно снизить вычислительные затраты.
Для экспериментов авторы использовали модель Llama-2 7B*, обученную на данных из математики, написания кода и Wikipedia. В сравнении с перформансом обычной Llama-2*, BTX-модель существенно лучше справляется с программированием и математикой на GSM8K, MATH, HumanEval, MBPP.
* продукт деятельности экстремистской организации, деятельность которой запрещена на территории РФ.
** экстремистская организация, деятельность которой запрещена на территории РФ.
Изображение Branch-Train-Mix
Please open Telegram to view this post
VIEW IN TELEGRAM
👍10🤔3👏2❤1
Media is too big
VIEW IN TELEGRAM
Рисуем фотореалистичную картинку с помощью AI
Попробовала один из AI-инструментов на Freepik. Функция real time sketch позволяет генерить на ходу, когда ты сразу видишь, что получается, и можешь менять/корректировать изображение.
🪄 Сначала генернула фон с помощью фигуры из левого меню и цвета. Обратите внимание, что обычную зелень генератор сделал травой в тот момент, когда я “посадила” на него дерево 🍀 Голубую поверхность с лодкой он вероятнее всего превратил бы в воду 💦
🪄 В отличие от КRЕА, в которую картинки-оригиналы необходимо собирать самостоятельно, здесь масса иконок на выбор. Поиск в помощь! Ну, если уж вам нужно нечто совсем редкое, за основу берите что-то формальное и доводите до ума промптом.
🪄 Собственно, промпт и есть главный герой истории. В верхнем поле к изначальной “рыбе” masterpiece, finest quality, 4K, sharp focus добавляем детали. Из дерева генерится пальма, кошка становится диким зверем 🤬
🪄 Важно, что композиция — в твоих руках. В промпте не приходится выписывать, что за чем стоит и из-за чего выглядывает. Ручной дизайнерский инструмент нам оставили, совместив его с AI-функцией. Всё можно расставлять по своим местам обычным перетаскиванием и контролировать!
Подробности в ролике, пробуем тут
Попробовала один из AI-инструментов на Freepik. Функция real time sketch позволяет генерить на ходу, когда ты сразу видишь, что получается, и можешь менять/корректировать изображение.
Подробности в ролике, пробуем тут
Please open Telegram to view this post
VIEW IN TELEGRAM
👍15🔥8👏3
Объём словарного запаса терминов, которые знает планшет-переводчик от концерна "Росэнергоатом", позволяет обсуждать с иностранными партнёрами широкий круг направлений деятельности.
Использовали экономический, технический и производственный английский, включая терминологию атомной отрасли.
Распознаёт и переводит речь ML-алгоритм, который обучали более 900 часов. Может обрабатывать большие объёмы данных и длительные диалоги, адаптироваться к акцентам.
Гаджет солидный😎 , так как качественно работать он должен и в сложных условиях, в том числе на шумных производственных объектах и на улице.
Использовали экономический, технический и производственный английский, включая терминологию атомной отрасли.
Распознаёт и переводит речь ML-алгоритм, который обучали более 900 часов. Может обрабатывать большие объёмы данных и длительные диалоги, адаптироваться к акцентам.
Гаджет солидный
Please open Telegram to view this post
VIEW IN TELEGRAM
🥰11👍6😁4👏2🏆1
This media is not supported in your browser
VIEW IN TELEGRAM
Что повысит разрешение у визуальной модели
Разбираемся в разработке MIT FeatUp. Она улучшает качество изображения в 16 раз.
Суть работы FeatUp в том, что высококачественная картинка реконструируется по нескольким низкокачественным генерациям:
✈️ на вход подаются видоизменённые варианты исходного изображения (обрезанное, перевёрнутое, зашумленное)
✈️ из латентных низкокачественных представлений можно собрать одну хорошую картинку, так как алгоритм анализирует реакцию модели на смещение каждого пикселя
При обучении FeatUp тренируется создавать латентное представление высокого разрешения так, чтобы при уменьшении размерности получалось представление исходной низкокачественной модели.
Инструмент работает с любой архитектурой и задачами (например, для сегментации или предсказания глубины картинки)👍 Исключение: модели, генерирующие с нуля, без исходной референсной картинки или видео.
В ходе экспериментов размерность VisualTransformer выросла в 16 раз, превзойдя аналогичные модели (CARAFE, IndexNet и FADE).
Видео Mark Hamilton
Разбираемся в разработке MIT FeatUp. Она улучшает качество изображения в 16 раз.
Суть работы FeatUp в том, что высококачественная картинка реконструируется по нескольким низкокачественным генерациям:
При обучении FeatUp тренируется создавать латентное представление высокого разрешения так, чтобы при уменьшении размерности получалось представление исходной низкокачественной модели.
Инструмент работает с любой архитектурой и задачами (например, для сегментации или предсказания глубины картинки)
В ходе экспериментов размерность VisualTransformer выросла в 16 раз, превзойдя аналогичные модели (CARAFE, IndexNet и FADE).
Видео Mark Hamilton
Please open Telegram to view this post
VIEW IN TELEGRAM
👏8👍6❤2🏆1
Зажигаем звёзды, создаём белки и моделируем молекулы: AI в науке
Новые разработки для изучения Вселенной и человека⭐️ 🧑🏼
🔔 Научное сообщество решает, как грамотно использовать AI в исследованиях и на практике. В новом докладе Центра научного будущего эксперты разных стран изложили стратегию интеграции разработки в национальные системы.
🔔 ML-алгоритмы помогли американским биохимикам обнаружить на коже африканского сома пептид с сильными антибактериальными свойствами. Вещество, которым рыба защищается от инфекций, в перспективе может стать средством борьбы с устойчивыми бактериями и использоваться как антибиотик.
🔔 Как вспыхивают и гаснут звёзды? Знает AI. С помощью радиотелескопа астрофизики изучили состав газа далёкой галактики. А машинное обучение выделило молекулы, указывающие на рождение, развитие или смерть звёзд.
🔔 Языковые модели заходят в биомолекулярное моделирование. В системе 3D-MoLM, разработанной учёными Китая и Сингапура, модель работает вместе с 3D-молекулярным энкодером. Это позволяет ей лучше анализировать и интерпретировать трёхмерные молекулярные структуры, составлять точные описания и выполнять другие задачи.
🔔 Вслед за AlphaFold, прогнозирующим структуру белков, новый шаг в AI-биоинженерии делает ML-метод ProteinMPNN. Его можно использовать для создания различных искусственных вариантов флуоресцентных белков и в целом для реинжиниринга белков без потери нужных свойств.
Изображение ALMA (ESO/NAOJ/NRAO), N. Harada et al
Новые разработки для изучения Вселенной и человека
Изображение ALMA (ESO/NAOJ/NRAO), N. Harada et al
Please open Telegram to view this post
VIEW IN TELEGRAM
👍9🔥7👏3🏆1
При такой низкой стоимости ($140 или 12 650 рублей) китайский чип DeepEdge 10Max даёт производительность 48 TOPS. По этому показателю H100 ему, конечно, не догнать (у Nvidia в 30 раз выше). Но он всё равно отлично выполняет 90% AI-задач.
Доступность, похоже, ключевое для производителя. В 2024-м он также планирует выпустить GPU и по более низкой цене мощностью в 24 TOPS. А в 2025-м появится модель на 96 TOPS🎁
Доступность, похоже, ключевое для производителя. В 2024-м он также планирует выпустить GPU и по более низкой цене мощностью в 24 TOPS. А в 2025-м появится модель на 96 TOPS
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥15❤2❤🔥1😁1🏆1
This media is not supported in your browser
VIEW IN TELEGRAM
Microsoft, OpenAI и Amazon: новая гонка за лидерством
Сразу несколько гигантов AI-рынка планируют строительство новых дата-центров.
При этом Microsoft и OpenAI здесь (как и везде) работают в паре, зато в Amazon выделили больше средств. Есть ещё и Google, которая так или иначе инвестирует средства в оборудование для обработки данных по всему миру.
Посмотрим, у кого какие планы🏄♂️
“Stargate” (Microsoft + OpenAI):
⭐️ будет крупнейшим в мире
⭐️ включит в себя кластер с AI-суперкомпьютером
⭐️ запустят уже в 2028 году
⭐️ вложено $100 млрд
ЦОДы от Amazon:
✨ точное количество дата-центров не сообщается
✨ срок, на который рассчитано строительство — 15 лет
✨ средства на финансирование — ~$150 млрд
Google громких заявлений не делает — масштабируется спокойно, но уверенно🔼 В начале года сообщали о планах потратить $1 млрд на создание ЦОД в Великобритании, а месяц назад уже развернули стройку в €600 млн в Норвегии (запуск в 2026 году).
Очевидно, что компании пытаются справиться со спросом на AI-разработки, поэтому и денег не жалеют🤓
Сразу несколько гигантов AI-рынка планируют строительство новых дата-центров.
При этом Microsoft и OpenAI здесь (как и везде) работают в паре, зато в Amazon выделили больше средств. Есть ещё и Google, которая так или иначе инвестирует средства в оборудование для обработки данных по всему миру.
Посмотрим, у кого какие планы
“Stargate” (Microsoft + OpenAI):
ЦОДы от Amazon:
Google громких заявлений не делает — масштабируется спокойно, но уверенно
Очевидно, что компании пытаются справиться со спросом на AI-разработки, поэтому и денег не жалеют
Please open Telegram to view this post
VIEW IN TELEGRAM
👍9👏2😁2❤🔥1🎉1
Решила обновить обложки своих плейлистов на стриминговом сервисе, и, конечно, дело не обошлось без AI-помощников.
Кину вам пару примеров от разных нейронок. Не обещаю, что возьму ту, которая победит в голосовалке, но ваш выбор учту! 🙏
Генерила по промпту:
Включаю любимый трек и с нетерпением жду ваших реакций🎶
❤️ Leonardo.Ai
👍 Ideogram
🔥 Dezgo
💯 Kandinsky
👏 Artbreeder
Кину вам пару примеров от разных нейронок. Не обещаю, что возьму ту, которая победит в голосовалке, но ваш выбор учту! 🙏
Генерила по промпту:
audio speaker sound waves flows over, zoom photo, high quality, 8k, highly detailed matte painting, deep color, intricate detail, splash screen, complementary colors, fantasy concept art
Включаю любимый трек и с нетерпением жду ваших реакций
❤️ Leonardo.Ai
👍 Ideogram
🔥 Dezgo
💯 Kandinsky
👏 Artbreeder
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍18❤10👏7💯5
This media is not supported in your browser
VIEW IN TELEGRAM
Много рассказывала вам про Gaussian Splatting, но на словах — одно, другое дело — самому попробовать.
Как это выглядит на конкретном примере, смотрите на видео. А делать такое можно в приложении для 3D-сканирования Scaniverse. Gaussian Splatting туда уже добавили.
Как использовать функцию Splat, чтобы получить такие фотореалистичные 3D-сцены, подскажут инструкции на экране:
🌐 поскольку изображение меняется в зависимости от ракурса, важно снять объект с разных точек (не забудьте о хорошем освещении 😊 и плавных движениях 🙌 )
⌛ минуту снимок обрабатывается, а после его можно и улучшить
😵💫 крутите ролики на смартфоне, постите в соцсетях
Пока опция доступна только для iOS, начиная с модели iPhone 11 и нескольких версий iPad. Но вскоре обещают добавить версию для Android и более поздних моделей iPhone. Также появится обрезка и редактирование.
Зато уже сейчас можно обрабатывать и старые сканы (если вы сохранили данные🔒 ).
Как это выглядит на конкретном примере, смотрите на видео. А делать такое можно в приложении для 3D-сканирования Scaniverse. Gaussian Splatting туда уже добавили.
Как использовать функцию Splat, чтобы получить такие фотореалистичные 3D-сцены, подскажут инструкции на экране:
Пока опция доступна только для iOS, начиная с модели iPhone 11 и нескольких версий iPad. Но вскоре обещают добавить версию для Android и более поздних моделей iPhone. Также появится обрезка и редактирование.
Зато уже сейчас можно обрабатывать и старые сканы (если вы сохранили данные
Please open Telegram to view this post
VIEW IN TELEGRAM
👍11🔥6😍3🏆1