Media is too big
VIEW IN TELEGRAM
Представлена Llama 4 в двух версиях Scout и Maverick (05.04.2025). Также скоро Behemoth, всего 3 версии модели:
Llama 4 Behemoth
288B active parameter, 16 experts
2T total parameters
The most intelligent teacher model for distillation
LIama 4 Maverick
17B active parameters, 128 experts
400B total parameters
Native multimodal with 1M context length
Llama 4 Scout
17B active parameters, 16 experts
109B total parameters
Industry leading 10M context length
Optimized inference
статья анонс: https://ai.meta.com/blog/llama-4-multimodal-intelligence/
Особенно впечатляет развитие контекста до 10М токенов в Scount (самый небольшой модели по числу гиперпараметров). Из фишек, Scout можно запустить на 1 GPU, это быстрая мультимодальная модель
Llama 4 Behemoth
288B active parameter, 16 experts
2T total parameters
The most intelligent teacher model for distillation
LIama 4 Maverick
17B active parameters, 128 experts
400B total parameters
Native multimodal with 1M context length
Llama 4 Scout
17B active parameters, 16 experts
109B total parameters
Industry leading 10M context length
Optimized inference
статья анонс: https://ai.meta.com/blog/llama-4-multimodal-intelligence/
Особенно впечатляет развитие контекста до 10М токенов в Scount (самый небольшой модели по числу гиперпараметров). Из фишек, Scout можно запустить на 1 GPU, это быстрая мультимодальная модель
Forwarded from reels bot
Media is too big
VIEW IN TELEGRAM
Runway of Tariffs https://www.youtube.com/watch?v=i9Kw_jMTttk
This media is not supported in your browser
VIEW IN TELEGRAM
Make America Great Again
Джесси_Шелл_— Геймдизайн_Как_создать_игру,_в_которую_будут_играть.txt
1.1 MB
Джесси Шелл – один из известнейших геймдизайнеров, который работал на Walt Disney Company, делится своими секретами и подробно рассказывает, как создать игру, которая завоюет если не весь мир, то большую его часть. Сегодня видеоигры везде, и все они работают по определенным законам.
В них миллионы тонкостей и нюансов, которые известны только геймдизайнерам. Как все учесть? Как соединить звуковой и видеоряд, подобрать верный баланс наград и попасть в целевую аудиторию? Что вообще представляет собой геймдизайн? Джесси Шелл готов отвечать на вопросы. Цель книги – сделать из вас лучшего геймдизайнера.
В них миллионы тонкостей и нюансов, которые известны только геймдизайнерам. Как все учесть? Как соединить звуковой и видеоряд, подобрать верный баланс наград и попасть в целевую аудиторию? Что вообще представляет собой геймдизайн? Джесси Шелл готов отвечать на вопросы. Цель книги – сделать из вас лучшего геймдизайнера.
This media is not supported in your browser
VIEW IN TELEGRAM
Новый способ генерировать контент для Соц.сетей / Рекламы / Маркетплейсов
Forwarded from Data Secrets
В Apple изучили законы масштабирования дистилляции и написали об этом интересную работу
Дистилляция в последнее время уж очень всем полюбилась. С помощью нее можно как бы "перекачивать" знания из большой модели-учителя в маленькую модель-ученика, заставляя ученика предсказывать генерации и иногда промежуточные состояния учителя. Таким образом было получено ну очень много моделей, которыми мы пользуемся и особенно которые запускаем локально.
С другой стороны дистилляция непредсказуема. Например, насколько глупее учителя получается ученик в зависимости от разницы в количестве параметров? Насколько это эффективнее обучения с нуля? Или насколько быстро обучение выходит на плато?
Apple изучали как раз такие вопросы и вот к каким выводам эмпирически пришли:
Супер-полезное исследование для практики, на самом деле. Прямо готовые рецепты удачного обучения arxiv.org/pdf/2502.08606
Дистилляция в последнее время уж очень всем полюбилась. С помощью нее можно как бы "перекачивать" знания из большой модели-учителя в маленькую модель-ученика, заставляя ученика предсказывать генерации и иногда промежуточные состояния учителя. Таким образом было получено ну очень много моделей, которыми мы пользуемся и особенно которые запускаем локально.
С другой стороны дистилляция непредсказуема. Например, насколько глупее учителя получается ученик в зависимости от разницы в количестве параметров? Насколько это эффективнее обучения с нуля? Или насколько быстро обучение выходит на плато?
Apple изучали как раз такие вопросы и вот к каким выводам эмпирически пришли:
➖ Кажется, что чем мощнее учитель, тем лучше получится дистилляция. Оказалось, это миф. Слишком мощный учитель может ухудшить обучение ученика из-за capacity gap, при котором ученик не может эффективно усваивать "уроки".➖ На дистилляцию распространяется общий закон масштабирования моделей. Это значит, что добавление данных и увеличение модели снижает ошибку, но с убывающей отдачей. Работает и для учителя, и для ученика.➖ Есть способ оптимизировать дистилляцию и описывается он вполне конкретным уравнением, которое зависит от размера ученика и доступного бюджета вычислений.➖ От выбора учителя тоже много чего зависит. Чем больше ученик, тем мощнее должен быть учитель, но эта зависимость следует степенному закону, так что нужно очень внимательно подбирать соотношение параметров.➖ И да, дистилляция эффективнее ванильного обучения, но только в пределах определённого бюджета вычислений. Если данных и вычислений достаточно, супервизионное обучение всегда будет лучше.
Супер-полезное исследование для практики, на самом деле. Прямо готовые рецепты удачного обучения arxiv.org/pdf/2502.08606
Please open Telegram to view this post
VIEW IN TELEGRAM
LeetCode это сложно.
В FAANG считается стандартом для прохождения собеседований, решения задач на LeetCode. Причем там могут быть задачи: на структуры данных, алгоритмы, жадные алгоритмы, динамическое программирование.
По сути это задачи, уровня олимпиадного программирования вида: сделайте все возможные виды бинарные деревьев с числом узлом k=5
Всего около 7 тысяч задачи. Но говорят, что значение 18 шаблонов закрывает 70% всех задач.
В FAANG считается стандартом для прохождения собеседований, решения задач на LeetCode. Причем там могут быть задачи: на структуры данных, алгоритмы, жадные алгоритмы, динамическое программирование.
По сути это задачи, уровня олимпиадного программирования вида: сделайте все возможные виды бинарные деревьев с числом узлом k=5
Всего около 7 тысяч задачи. Но говорят, что значение 18 шаблонов закрывает 70% всех задач.
😁1
Media is too big
VIEW IN TELEGRAM
https://seed.bytedance.com/en/seedance
Seedance 1.0, an AI video generation model from ByteDance, was released in June 2025. Specifically, Seedance 1.0 Pro was released on June 11, 2025.
Paper:
Seedance 1.0: Exploring the Boundaries of
Video Generation Models
https://arxiv.org/pdf/2506.09113
Seedance 1.0, an AI video generation model from ByteDance, was released in June 2025. Specifically, Seedance 1.0 Pro was released on June 11, 2025.
Paper:
Seedance 1.0: Exploring the Boundaries of
Video Generation Models
https://arxiv.org/pdf/2506.09113
Чтобы понять как работает генерация изображений и видео на базе наиболее популярных score-based моделй Diffusion (Scode-based модели) и Flow Matching (Normalizing Flow модели)... нужно такие лекции https://www.youtube.com/watch?v=GCoP2w-Cqtg&list=PL57nT7tSGAAUDnli1LhTOoCxlEPGS19vH
даже я как инженер, ощущаю высокий уровень сложности) но интересно. По сути открывают занавес за Midjourney (Diffusion), Sora (DiT), SeeDance (Flow Matching)
даже я как инженер, ощущаю высокий уровень сложности) но интересно. По сути открывают занавес за Midjourney (Diffusion), Sora (DiT), SeeDance (Flow Matching)
YouTube
MIT 6.S184: Flow Matching and Diffusion Models - Lecture 01 - Generative AI with SDEs (2025)
Updated 2026 version of the class: https://youtube.com/playlist?list=PL57nT7tSGAAXwjhDYcxEycx5W7YoSrZyt&si=PFAcDRQ2-dhYKR2p
Lecture notes: https://diffusion.csail.mit.edu/docs/2025/lecture-notes.pdf
Slides: https://diffusion.csail.mit.edu/2025/index.html…
Lecture notes: https://diffusion.csail.mit.edu/docs/2025/lecture-notes.pdf
Slides: https://diffusion.csail.mit.edu/2025/index.html…
😁1