Интересное что-то
624 subscribers
2.8K photos
255 videos
143 files
4.66K links
Материалы и мысли, понадерганные отовсюду
Блог: https://t.me/asisakov_channel
Чат: https://t.me/youknowds_chat
Download Telegram
Forwarded from Data Secrets
RNN в картинках

Объясняем как работют рекуррентные нейронные сети по такому рецепту: минимум слов, максимум схем и примеров.
Forwarded from Data Secrets
Пул всех text2video моделей до Sora по порядку. Как всегда, все начинается с Google
Forwarded from Data Secrets
Там у Microsoft вышел новый бесплатный курс по генеративкам для начинающих. Все что нужно для прохождения — это доступ к OpenAI API и на базовом уровне уметь писать код на Python.

В курсе содержится 18 текстовых уроков, которые расскажут про базовые принципы работы с большими языковыми моделями, ИИ-агентами и тем, как это всё использовать в разработке собственных проектов.

Ссылка на курс: https://github.com/microsoft/generative-ai-for-beginners/tree/main
Forwarded from Data Secrets
HalvingSearch – ускорение поиска по сетке

Подбор гперпараметров – сложная и распросраненная задача. Для ее решения часто используют поиск по сетке, но этот алгоритм очень уж медленный. Поэтому сегодня давайте обратим внимание на halving search. Его относительно недавно добавили в sklearn, и пришло время разобраться, как с ним работать.
Forwarded from Сиолошная
Зачастую самая сложная часть использования ChatGPT-like ассистентов — это составление промпта. Не так, чтоб в 1-2 предложениях, а вот прям по нормальному! К примеру, для перевода своего блогпоста с русского на английский я составил промпт в 1800 токенов/5k символов. Что-то придумал сам, что-то взял из прошлых итераций, а что-то докрутил конкретно под эту задачу — не без помощи GPT-4, конечно.

Anthropic в ходе подготовки к релизу Claude 3 решили сесть подумать и составить «мета-промпт», чтобы помочь в составлении промпта. Вставили промпт в промпт чтобы можно было работать над промптом пока работаешь с промптом 🙂

В их промпте, который заставит Claude 3 генерировать длинный промпт по вашему короткому описанию задаче, больше 6000 токенов (и 25'000 знаков). Мне понравилось, что по запросу дополнительно генерируются входные переменные, которые могут меняться в рамках вашей задачи. Например, при переводе важно учитывать целевую аудиторию, кто читать-то будет? Claude 3 сама прикинет, какие полезные инпуты можно получить, и впишет их в выходной промпт.

Я попробовал на двух примерах — ну, не так хорошо, как сделал бы сам за вечер, но точно поможет обычным пользователям добиваться чуть более приятных результатов.

Поиграться тут (нужен API ключ)
Официальный гайд по промптингу от Anthropic здесь
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Сиолошная
OpenAI выпустили отладчик... для трансформера (модели нейросети, лежащей в основе языковых моделей). Инструмент называется TDB, и это — логические продолжение прошлой работы из этого направления, Language models can explain neurons in language models.

TDB позволяет поставить генерацию LLM (хотя скорее SLM — мы пока только на них тренируемся, интерпретация — очень сложный топик) на паузу с мотать вперёд и назад, и анализировать, как разные слова влияют на конкретное поведение.

Его можно использовать для ответа на такие вопросы, как: «Почему в этом запросе модель выводит токен A вместо токена B?» или «Почему в этом промпте модель направляет своё внимание на символ T?» Делается это путем выявления конкретных компонентов (нейронов, голов внимания, и дополнительно обучаемых автоэнкодеров), которые способствуют поведению.

Вот на картинке в верхней части вы видите, что какие-то слова раскрашиваются в разные цвета. Бирюзовый показывает, какое слово передаёт свой смысл с большей степенью, а розовый — куда он передаётся. Но это один случай одной головы внимания, а их десятки, ещё и в разных слоях, коих тоже десятки. Так много глазами не насмотришь, правда?

И тут в игру вступает GPT-4 из цитируемой работы. Грубо говоря сначала находятся другие тексты, которые имеют схожий паттерн активации, а затем они подаются в GPT-4 для того, чтобы она текстом объяснила, какую зависимость видит. И вам показывается результат, который помогает понять, что заставляет какие-то части сети активироваться наиболее сильно.

Всё это нужно для того, чтобы развивать интерпретируемость модели и выявлять паттерны. Чуть более подробно рассказывал вот тут в лекции (даже ту же статью упоминал, на которой OpenAI пример приводят). Сейчас всё настолько плохо, что самая большая обнаруженная логическая схема в модели состоит из 26 компонент (суммарно в моделях их тысячи, а комбинаций...) и решает примитивнейшую задачу. И это — в самой маленькой GPT-2.