Forwarded from эйай ньюз
📑RedPajama: текстовый датасет на 1.2 триллиона токенов!
Недавно я писал про открытую модель Dolly 2.0. Теперь таких моделей станет больше, ведь подъехал самосвал с текстовыми данными!
RedPajama - это датасет на 1.2 триллиона текстовых токенов, созданный с целью воспроизведения передовых LLM. Датасет был воссоздан, следуя рецепту описанному в статье о LLaMA (то есть LLaMA училась на чем-то похожем). Кайф в том, что RedPajama-Data-1T является открытым и доступным для скачивания, то есть на нем можно обучать свои модельки.
RedPajama-Data-1T - это 2048 json файлов, которые включают 7 сегментов данных:
- CommonCrawl: 5 дампов
- C4 датасет
- GitHub код, отфильтрованный по лицензиям
- arXiv: Научные статьи
- Books: Корпус открытых книг
- Wikipedia: Подмножество страниц
- StackExchange: скроулили 28 крупнейших сайтов платформы
Кажется, что через пару месяцев мы увидим в open-source полностью открытую версию LLaMA, обученную с нуля с использованием этого набора данных.
Блогпост
Скачать датасет
@ai_newz
Недавно я писал про открытую модель Dolly 2.0. Теперь таких моделей станет больше, ведь подъехал самосвал с текстовыми данными!
RedPajama - это датасет на 1.2 триллиона текстовых токенов, созданный с целью воспроизведения передовых LLM. Датасет был воссоздан, следуя рецепту описанному в статье о LLaMA (то есть LLaMA училась на чем-то похожем). Кайф в том, что RedPajama-Data-1T является открытым и доступным для скачивания, то есть на нем можно обучать свои модельки.
RedPajama-Data-1T - это 2048 json файлов, которые включают 7 сегментов данных:
- CommonCrawl: 5 дампов
- C4 датасет
- GitHub код, отфильтрованный по лицензиям
- arXiv: Научные статьи
- Books: Корпус открытых книг
- Wikipedia: Подмножество страниц
- StackExchange: скроулили 28 крупнейших сайтов платформы
Кажется, что через пару месяцев мы увидим в open-source полностью открытую версию LLaMA, обученную с нуля с использованием этого набора данных.
Блогпост
Скачать датасет
@ai_newz
Forwarded from Пикабу
Таблица с самыми популярными нейросетями в каждом из направлений
Автор на Пикабу: Lifehack
Комментарии: pikabu.ru/link/1xcB_s7gfS
Автор на Пикабу: Lifehack
Комментарии: pikabu.ru/link/1xcB_s7gfS
Forwarded from Russian OSINT
👆🤔GPT-4 не работает. Если выбрать 4 версию и спросить "какую модель ты используешь?", то он выдает в ответе GPT-3.
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Интернет-Розыск
Список бесплатных сайтов-зеркал ChatGPT, постоянно обновляемый.
▫️https://github.com/LiLittleCat/awesome-free-chatgpt
😉👍 Подписывайтесь на @irozysk
▫️https://github.com/LiLittleCat/awesome-free-chatgpt
😉👍 Подписывайтесь на @irozysk
GitHub
GitHub - LiLittleCat/awesome-free-chatgpt: 🆓免费的 ChatGPT 镜像网站列表,持续更新。List of free ChatGPT mirror sites, continuously updated.
🆓免费的 ChatGPT 镜像网站列表,持续更新。List of free ChatGPT mirror sites, continuously updated. - LiLittleCat/awesome-free-chatgpt
👍1
Forwarded from Эксплойт
This media is not supported in your browser
VIEW IN TELEGRAM
Энтузиасты собрали все самые интересные языковые модели в одном месте — всем этим добром можно пользоваться бесплатно.
Если не уверены, какая именно модель вам нужна — можно закинуть один запрос сразу нескольким моделям одновременно, а затем сравнить результат. И да, даже есть GPT-4, но для нее придется активировать бесплатный двухнедельный пробный период.
Пользуемся по ссылке.
@exploitex
Если не уверены, какая именно модель вам нужна — можно закинуть один запрос сразу нескольким моделям одновременно, а затем сравнить результат. И да, даже есть GPT-4, но для нее придется активировать бесплатный двухнедельный пробный период.
Пользуемся по ссылке.
@exploitex
Forwarded from Библиотека программиста
https://github.com/openai/openai-cookbook
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from эйай ньюз
OpenLLaMA: An Open Reproduction of LLaMA
Полундра! Тут челы из университета Berkeley зарелизили полностью опен-соурсную репродукцию LLaMA 7B с лицензией Apache 2.0. Пока натренировали модель на 200 миллиардах токенов из датасета RedPajama, о котором я недавно рассказывал.
Чекпоинт, который доступен уже сейчас, выдает результаты на различных бенчмарках как минимум не хуже оригинальной LLaMA от Meta. И ребята продолжаю тренить, чтобы модель увидела хотя бы триллион различных токенов, как это было у оригинальной LLaMA. Ожидают, что когда полностью закончат тренировку на триллионе токенов из RedPajama, OpenLLaMA превзойдет оригинал.
Скачать веса на PyTorch и JAX
@ai_newz
Полундра! Тут челы из университета Berkeley зарелизили полностью опен-соурсную репродукцию LLaMA 7B с лицензией Apache 2.0. Пока натренировали модель на 200 миллиардах токенов из датасета RedPajama, о котором я недавно рассказывал.
Чекпоинт, который доступен уже сейчас, выдает результаты на различных бенчмарках как минимум не хуже оригинальной LLaMA от Meta. И ребята продолжаю тренить, чтобы модель увидела хотя бы триллион различных токенов, как это было у оригинальной LLaMA. Ожидают, что когда полностью закончат тренировку на триллионе токенов из RedPajama, OpenLLaMA превзойдет оригинал.
Скачать веса на PyTorch и JAX
@ai_newz
Forwarded from Архив Программиста
Forwarded from Open Source
Open LLMs
Список открытых LLM (больших языковых моделей), доступных для коммерческого использования.
https://github.com/eugeneyan/open-llms
Список открытых LLM (больших языковых моделей), доступных для коммерческого использования.
https://github.com/eugeneyan/open-llms
Forwarded from Эксплойт
Собрали для вас удобную подборку бесплатных нейросетей, которые помогут с чем угодно:
Для работы с фото:
Watermark Remover — убирает водяные знаки с фото;
CleanUp Picture — быстро убрать лишние элементы с изображения;
Upscayl — повышает качество картинки в 4 раза;
OnlineOCR — вычленить текст с фотографии;
Background Remover — удаляет фон.
Переводим что угодно на другой язык:
Deepl — самый лучший текстовый ИИ-переводчик, учитывающий жаргонизмы и диалекты;
NeuroDub — переводит видео, доступен невероятно большой перечень доступных языков;
Whisper JAX — делает текстовую транскрипцию любого аудио и (по желанию) переводит ее на английский язык.
Создаем уникальный контент:
D-ID — «оживит» ваше фото и заставит говорить то, что вы напишите. Есть возможность вместо текста использовать аудиодорожку;
UberDuck — огромная библиотека виртуальных голосов знаменитостей и персонажей из медиа;
Bark — реалистично озвучит ваш текст с сохранением интонации;
Musicfy — позволяет создать ИИ-песню с голосом выбранного исполнителя;
GEN-1 — лучшая нейросеть для генерации коротких видео. Именно с ее помощью создают «нейронную рекламу»;
SwapFace — для простых дипфейков;
Wavtool — музыка по текстовым подсказкам.
Для дизайнеров:
Mokker — идеальный фон для фотографии;
Flair — оформляет идеальные карточки товаров;
GyreAI — бесплатный аналог Фотошопа с ИИ на борту.
Для учебы:
BabyAgi — составляет пошаговые гайды для любой задачи;
CourseAI — создает курсы на заданную тему;
Tome — для красивых презентаций на русском языке;
Explain like i'm 5 — поможет понять любую тему.
@exploitex
Для работы с фото:
Watermark Remover — убирает водяные знаки с фото;
CleanUp Picture — быстро убрать лишние элементы с изображения;
Upscayl — повышает качество картинки в 4 раза;
OnlineOCR — вычленить текст с фотографии;
Background Remover — удаляет фон.
Переводим что угодно на другой язык:
Deepl — самый лучший текстовый ИИ-переводчик, учитывающий жаргонизмы и диалекты;
NeuroDub — переводит видео, доступен невероятно большой перечень доступных языков;
Whisper JAX — делает текстовую транскрипцию любого аудио и (по желанию) переводит ее на английский язык.
Создаем уникальный контент:
D-ID — «оживит» ваше фото и заставит говорить то, что вы напишите. Есть возможность вместо текста использовать аудиодорожку;
UberDuck — огромная библиотека виртуальных голосов знаменитостей и персонажей из медиа;
Bark — реалистично озвучит ваш текст с сохранением интонации;
Musicfy — позволяет создать ИИ-песню с голосом выбранного исполнителя;
GEN-1 — лучшая нейросеть для генерации коротких видео. Именно с ее помощью создают «нейронную рекламу»;
SwapFace — для простых дипфейков;
Wavtool — музыка по текстовым подсказкам.
Для дизайнеров:
Mokker — идеальный фон для фотографии;
Flair — оформляет идеальные карточки товаров;
GyreAI — бесплатный аналог Фотошопа с ИИ на борту.
Для учебы:
BabyAgi — составляет пошаговые гайды для любой задачи;
CourseAI — создает курсы на заданную тему;
Tome — для красивых презентаций на русском языке;
Explain like i'm 5 — поможет понять любую тему.
@exploitex
Forwarded from Интернет-Розыск
ChatALL может одновременно отправлять подсказки нескольким ИИ-ботам (ChatGPT, Bing Chat, bard, Alpaca, Vincuna, Claude, ChatGLM, MOSS, iFlytek Spark, ERNIE и многим другим), помогая вам найти наилучшие результаты на ваш запрос
▫️https://github.com/sunner/ChatALL
😉👍 Подписывайтесь на @irozysk
▫️https://github.com/sunner/ChatALL
😉👍 Подписывайтесь на @irozysk
Forwarded from эйай ньюз
This media is not supported in your browser
VIEW IN TELEGRAM
Наконец-то к параметрической голове приделали шею. Теперь по фотографии можно зафитить 3D голову на шее, а не без нее, как было раньше.
Тема крутая, потому что с такой моделью можно более реалистично анимировать говорящие головы. Авторы собрали огромный датасет сканов, чтобы обучить параметрическую модель.
❱❱ Статья: HACK: Learning a Parametric Head and Neck Model for High-fidelity Animation
❱❱ Код
Если хотите узнать больше про 3D Human Modeling, то вот тут я делал подборку материалов и лекций.
@ai_newz
Тема крутая, потому что с такой моделью можно более реалистично анимировать говорящие головы. Авторы собрали огромный датасет сканов, чтобы обучить параметрическую модель.
❱❱ Статья: HACK: Learning a Parametric Head and Neck Model for High-fidelity Animation
❱❱ Код
Если хотите узнать больше про 3D Human Modeling, то вот тут я делал подборку материалов и лекций.
@ai_newz