This media is not supported in your browser
VIEW IN TELEGRAM
AI Kiss - загружаешь свое фото и девушки, получаешь видео.
Ставь лайк, если хочешь такой сервис затестить
Ставь лайк, если хочешь такой сервис затестить
This media is not supported in your browser
VIEW IN TELEGRAM
AI Hug - твое фото и с кем хочешь обняться
Ставь лайк, если хочешь такой сервис затестить
Ставь лайк, если хочешь такой сервис затестить
Media is too big
VIEW IN TELEGRAM
Представлена Llama 4 в двух версиях Scout и Maverick (05.04.2025). Также скоро Behemoth, всего 3 версии модели:
Llama 4 Behemoth
288B active parameter, 16 experts
2T total parameters
The most intelligent teacher model for distillation
LIama 4 Maverick
17B active parameters, 128 experts
400B total parameters
Native multimodal with 1M context length
Llama 4 Scout
17B active parameters, 16 experts
109B total parameters
Industry leading 10M context length
Optimized inference
статья анонс: https://ai.meta.com/blog/llama-4-multimodal-intelligence/
Особенно впечатляет развитие контекста до 10М токенов в Scount (самый небольшой модели по числу гиперпараметров). Из фишек, Scout можно запустить на 1 GPU, это быстрая мультимодальная модель
Llama 4 Behemoth
288B active parameter, 16 experts
2T total parameters
The most intelligent teacher model for distillation
LIama 4 Maverick
17B active parameters, 128 experts
400B total parameters
Native multimodal with 1M context length
Llama 4 Scout
17B active parameters, 16 experts
109B total parameters
Industry leading 10M context length
Optimized inference
статья анонс: https://ai.meta.com/blog/llama-4-multimodal-intelligence/
Особенно впечатляет развитие контекста до 10М токенов в Scount (самый небольшой модели по числу гиперпараметров). Из фишек, Scout можно запустить на 1 GPU, это быстрая мультимодальная модель
Forwarded from reels bot
Media is too big
VIEW IN TELEGRAM
Runway of Tariffs https://www.youtube.com/watch?v=i9Kw_jMTttk
This media is not supported in your browser
VIEW IN TELEGRAM
Make America Great Again
Джесси_Шелл_— Геймдизайн_Как_создать_игру,_в_которую_будут_играть.txt
1.1 MB
Джесси Шелл – один из известнейших геймдизайнеров, который работал на Walt Disney Company, делится своими секретами и подробно рассказывает, как создать игру, которая завоюет если не весь мир, то большую его часть. Сегодня видеоигры везде, и все они работают по определенным законам.
В них миллионы тонкостей и нюансов, которые известны только геймдизайнерам. Как все учесть? Как соединить звуковой и видеоряд, подобрать верный баланс наград и попасть в целевую аудиторию? Что вообще представляет собой геймдизайн? Джесси Шелл готов отвечать на вопросы. Цель книги – сделать из вас лучшего геймдизайнера.
В них миллионы тонкостей и нюансов, которые известны только геймдизайнерам. Как все учесть? Как соединить звуковой и видеоряд, подобрать верный баланс наград и попасть в целевую аудиторию? Что вообще представляет собой геймдизайн? Джесси Шелл готов отвечать на вопросы. Цель книги – сделать из вас лучшего геймдизайнера.
This media is not supported in your browser
VIEW IN TELEGRAM
Новый способ генерировать контент для Соц.сетей / Рекламы / Маркетплейсов
Forwarded from Data Secrets
В Apple изучили законы масштабирования дистилляции и написали об этом интересную работу
Дистилляция в последнее время уж очень всем полюбилась. С помощью нее можно как бы "перекачивать" знания из большой модели-учителя в маленькую модель-ученика, заставляя ученика предсказывать генерации и иногда промежуточные состояния учителя. Таким образом было получено ну очень много моделей, которыми мы пользуемся и особенно которые запускаем локально.
С другой стороны дистилляция непредсказуема. Например, насколько глупее учителя получается ученик в зависимости от разницы в количестве параметров? Насколько это эффективнее обучения с нуля? Или насколько быстро обучение выходит на плато?
Apple изучали как раз такие вопросы и вот к каким выводам эмпирически пришли:
Супер-полезное исследование для практики, на самом деле. Прямо готовые рецепты удачного обучения arxiv.org/pdf/2502.08606
Дистилляция в последнее время уж очень всем полюбилась. С помощью нее можно как бы "перекачивать" знания из большой модели-учителя в маленькую модель-ученика, заставляя ученика предсказывать генерации и иногда промежуточные состояния учителя. Таким образом было получено ну очень много моделей, которыми мы пользуемся и особенно которые запускаем локально.
С другой стороны дистилляция непредсказуема. Например, насколько глупее учителя получается ученик в зависимости от разницы в количестве параметров? Насколько это эффективнее обучения с нуля? Или насколько быстро обучение выходит на плато?
Apple изучали как раз такие вопросы и вот к каким выводам эмпирически пришли:
➖ Кажется, что чем мощнее учитель, тем лучше получится дистилляция. Оказалось, это миф. Слишком мощный учитель может ухудшить обучение ученика из-за capacity gap, при котором ученик не может эффективно усваивать "уроки".➖ На дистилляцию распространяется общий закон масштабирования моделей. Это значит, что добавление данных и увеличение модели снижает ошибку, но с убывающей отдачей. Работает и для учителя, и для ученика.➖ Есть способ оптимизировать дистилляцию и описывается он вполне конкретным уравнением, которое зависит от размера ученика и доступного бюджета вычислений.➖ От выбора учителя тоже много чего зависит. Чем больше ученик, тем мощнее должен быть учитель, но эта зависимость следует степенному закону, так что нужно очень внимательно подбирать соотношение параметров.➖ И да, дистилляция эффективнее ванильного обучения, но только в пределах определённого бюджета вычислений. Если данных и вычислений достаточно, супервизионное обучение всегда будет лучше.
Супер-полезное исследование для практики, на самом деле. Прямо готовые рецепты удачного обучения arxiv.org/pdf/2502.08606
Please open Telegram to view this post
VIEW IN TELEGRAM
LeetCode это сложно.
В FAANG считается стандартом для прохождения собеседований, решения задач на LeetCode. Причем там могут быть задачи: на структуры данных, алгоритмы, жадные алгоритмы, динамическое программирование.
По сути это задачи, уровня олимпиадного программирования вида: сделайте все возможные виды бинарные деревьев с числом узлом k=5
Всего около 7 тысяч задачи. Но говорят, что значение 18 шаблонов закрывает 70% всех задач.
В FAANG считается стандартом для прохождения собеседований, решения задач на LeetCode. Причем там могут быть задачи: на структуры данных, алгоритмы, жадные алгоритмы, динамическое программирование.
По сути это задачи, уровня олимпиадного программирования вида: сделайте все возможные виды бинарные деревьев с числом узлом k=5
Всего около 7 тысяч задачи. Но говорят, что значение 18 шаблонов закрывает 70% всех задач.
😁1