AI Notes
21 subscribers
36 photos
29 videos
12 files
187 links
About new GenAI and other things, cutting-edge info
Download Telegram
Forwarded from Vladislav Vasilenko
This media is not supported in your browser
VIEW IN TELEGRAM
А если смонтировать с музыкой, можно сделать такой видео-коллаж
Кажется я начинаю подсаживаться на "Common Side Effects"
у сериала 8.7 рейтинг на IMDB и растущая популярность... 98 место в рейтинге "Most Popular TV Shows" крупнейшего кинопортала планеты
This media is not supported in your browser
VIEW IN TELEGRAM
AI Kiss - загружаешь свое фото и девушки, получаешь видео.

Ставь лайк, если хочешь такой сервис затестить
This media is not supported in your browser
VIEW IN TELEGRAM
AI Hug - твое фото и с кем хочешь обняться

Ставь лайк, если хочешь такой сервис затестить
Media is too big
VIEW IN TELEGRAM
Представлена Llama 4 в двух версиях Scout и Maverick (05.04.2025). Также скоро Behemoth, всего 3 версии модели:

Llama 4 Behemoth
288B active parameter, 16 experts
2T total parameters
The most intelligent teacher model for distillation

LIama 4 Maverick
17B active parameters, 128 experts
400B total parameters
Native multimodal with 1M context length

Llama 4 Scout
17B active parameters, 16 experts
109B total parameters
Industry leading 10M context length
Optimized inference

статья анонс: https://ai.meta.com/blog/llama-4-multimodal-intelligence/

Особенно впечатляет развитие контекста до 10М токенов в Scount (самый небольшой модели по числу гиперпараметров). Из фишек, Scout можно запустить на 1 GPU, это быстрая мультимодальная модель
Llama 4 по ценам тоже все круто, если запускать в облаке Meta
Тарифная война Дональда Трампа не осталась незамеченной
Джесси_Шелл_— Геймдизайн_Как_создать_игру,_в_которую_будут_играть.txt
1.1 MB
Джесси Шелл – один из известнейших геймдизайнеров, который работал на Walt Disney Company, делится своими секретами и подробно рассказывает, как создать игру, которая завоюет если не весь мир, то большую его часть. Сегодня видеоигры везде, и все они работают по определенным законам.

В них миллионы тонкостей и нюансов, которые известны только геймдизайнерам. Как все учесть? Как соединить звуковой и видеоряд, подобрать верный баланс наград и попасть в целевую аудиторию? Что вообще представляет собой геймдизайн? Джесси Шелл готов отвечать на вопросы. Цель книги – сделать из вас лучшего геймдизайнера.
This media is not supported in your browser
VIEW IN TELEGRAM
Новый способ генерировать контент для Соц.сетей / Рекламы / Маркетплейсов
Forwarded from Data Secrets
В Apple изучили законы масштабирования дистилляции и написали об этом интересную работу

Дистилляция в последнее время уж очень всем полюбилась. С помощью нее можно как бы "перекачивать" знания из большой модели-учителя в маленькую модель-ученика, заставляя ученика предсказывать генерации и иногда промежуточные состояния учителя. Таким образом было получено ну очень много моделей, которыми мы пользуемся и особенно которые запускаем локально.

С другой стороны дистилляция непредсказуема. Например, насколько глупее учителя получается ученик в зависимости от разницы в количестве параметров? Насколько это эффективнее обучения с нуля? Или насколько быстро обучение выходит на плато?

Apple изучали как раз такие вопросы и вот к каким выводам эмпирически пришли:

➖ Кажется, что чем мощнее учитель, тем лучше получится дистилляция. Оказалось, это миф. Слишком мощный учитель может ухудшить обучение ученика из-за capacity gap, при котором ученик не может эффективно усваивать "уроки".

➖ На дистилляцию распространяется общий закон масштабирования моделей. Это значит, что добавление данных и увеличение модели снижает ошибку, но с убывающей отдачей. Работает и для учителя, и для ученика.

➖ Есть способ оптимизировать дистилляцию и описывается он вполне конкретным уравнением, которое зависит от размера ученика и доступного бюджета вычислений.

➖ От выбора учителя тоже много чего зависит. Чем больше ученик, тем мощнее должен быть учитель, но эта зависимость следует степенному закону, так что нужно очень внимательно подбирать соотношение параметров.

➖ И да, дистилляция эффективнее ванильного обучения, но только в пределах определённого бюджета вычислений. Если данных и вычислений достаточно, супервизионное обучение всегда будет лучше.


Супер-полезное исследование для практики, на самом деле. Прямо готовые рецепты удачного обучения arxiv.org/pdf/2502.08606
Please open Telegram to view this post
VIEW IN TELEGRAM