🔺 Курс про обучение LLM
Смотрю потихоньку перезапуск стенфордского курса CS336: Language Models From Scratch.
Первая лекция обзорная (тык), можно посмотреть всем для расширения кругозора. Рассказывают про то, какие компоненты есть у моделей, как они обучаются, что такое токенизатор и т.д. Голос у лектора, кстати, разборчивый, можно нормально слушать.
Дальше идут более интересные вещи про архитектуру, кернелы, параллелизм, инференс, данные и другие штуки.
Есть домашние задания. Опять же, первая домашка базовая, про обучение токенизатора, написание и обучение трансформера на PyTorch, много полезного теоретического материала дают по ходу.
Если задания выполнять без кодовых агентов, то можноих не выполнить многому научиться.
Пару лекций посмотрел, пока норм. Тем, кто вкатывается в ML, рекомендую.
👉 Лекции | Домашки
Смотрю потихоньку перезапуск стенфордского курса CS336: Language Models From Scratch.
Первая лекция обзорная (тык), можно посмотреть всем для расширения кругозора. Рассказывают про то, какие компоненты есть у моделей, как они обучаются, что такое токенизатор и т.д. Голос у лектора, кстати, разборчивый, можно нормально слушать.
Дальше идут более интересные вещи про архитектуру, кернелы, параллелизм, инференс, данные и другие штуки.
Есть домашние задания. Опять же, первая домашка базовая, про обучение токенизатора, написание и обучение трансформера на PyTorch, много полезного теоретического материала дают по ходу.
Если задания выполнять без кодовых агентов, то можно
Пару лекций посмотрел, пока норм. Тем, кто вкатывается в ML, рекомендую.
👉 Лекции | Домашки
Stanford CS336
Stanford CS336 | Language Modeling from Scratch
Official course website for Stanford CS336: Language Modeling from Scratch (Spring 2026), including logistics, schedule, assignments, and course materials.
✍33🔥16👍6❤3
Codex и бесплатная фабрика картинок
Не могу наиграться с Astra из-за того, что в Codex'е есть встроенный скилл для создания и редактирования изображений, который работает через подписку 🔥
Когда делал квест по мотивам Full Throttle (развернул на github), то думал, что генерация идет через скрипты, которые я настроил ещё давно и которые используют gpt-image API, но потом увидел, что с API ничего не списывается.
Посмотрел исходники, действительно, в какой-то момент появился встроенный скилл и в нем есть два режима, через подписку и fallback через API, если пользователь явно запросит или отвалится встроенная генерация.
gpt-image-2.5
И буквально только что эта модель обновилась до 2.5. Стала стабильней в многошаговом редактировании картинок (то есть не портит детали картинки, которые не редактируются), очень полезная вещь. В релизе пишут, что уже доступна через Codex:
Для игр и любых задач, связанных с графикой, это выглядит как какое-то чудо лично для меня. Очень стабильно генерирует персонажей, как реалистичных, так и пиксельных или рисованных. Можно добавлять к ним раскадровку движений и новые позы.
И всё это через клиент, в котором кодите.
Сама астра умная и работает круто, хотя с точным наложением картинок и предметов на фон, с обводкой предметов для подсветки и т.д. всё еще много косяков, приходится довольно долго править, а они мелкие и их много. Но это я капризничаю.
Не могу наиграться с Astra из-за того, что в Codex'е есть встроенный скилл для создания и редактирования изображений, который работает через подписку 🔥
Когда делал квест по мотивам Full Throttle (развернул на github), то думал, что генерация идет через скрипты, которые я настроил ещё давно и которые используют gpt-image API, но потом увидел, что с API ничего не списывается.
Посмотрел исходники, действительно, в какой-то момент появился встроенный скилл и в нем есть два режима, через подписку и fallback через API, если пользователь явно запросит или отвалится встроенная генерация.
gpt-image-2.5
И буквально только что эта модель обновилась до 2.5. Стала стабильней в многошаговом редактировании картинок (то есть не портит детали картинки, которые не редактируются), очень полезная вещь. В релизе пишут, что уже доступна через Codex:
Images 2.5 is rolling out today to ChatGPT, ChatGPT Work, and Codex users across all tiers on desktop, mobile, and web.
Для игр и любых задач, связанных с графикой, это выглядит как какое-то чудо лично для меня. Очень стабильно генерирует персонажей, как реалистичных, так и пиксельных или рисованных. Можно добавлять к ним раскадровку движений и новые позы.
И всё это через клиент, в котором кодите.
Сама астра умная и работает круто, хотя с точным наложением картинок и предметов на фон, с обводкой предметов для подсветки и т.д. всё еще много косяков, приходится довольно долго править, а они мелкие и их много. Но это я капризничаю.
🔥28⚡8❤8 3
🔺 Конференции и митапы в сентябре
Куда идём в в ближайшее время.
✅ 5 сентября — deep tech night
Отлично потусили, доклады в большей степени были отчётные, нежели технические, зато атмосфера топовая. Походили по стендам, обсудили сплетни, выпили, ну как обычно.
https://deeptechnight.ru
🗓 17 сентября — AI R&D Day
17-го идём слушать коллег из Сбера, расскажут про крутые вещи из области R&D. Походим по докладам, обсудим сплетни... ну вы поняли. Должно быть интересно, регаемся.
https://airndday.ontico.ru
😊 19 сентября — Practical ML Conf
Большая конфа от Яндекса. Вижу, что Лаида с Борисом входят в программный комитет, по любому отобрали только самые нескучные и сочные докладыпро вархаммер, предвкушаем, регистрируемся.
https://pmlconf.yandex.ru
👉 Буду офлайн. Подходите, поболтаем.
Куда идём в в ближайшее время.
Отлично потусили, доклады в большей степени были отчётные, нежели технические, зато атмосфера топовая. Походили по стендам, обсудили сплетни, выпили, ну как обычно.
https://deeptechnight.ru
17-го идём слушать коллег из Сбера, расскажут про крутые вещи из области R&D. Походим по докладам, обсудим сплетни... ну вы поняли. Должно быть интересно, регаемся.
https://airndday.ontico.ru
Большая конфа от Яндекса. Вижу, что Лаида с Борисом входят в программный комитет, по любому отобрали только самые нескучные и сочные доклады
https://pmlconf.yandex.ru
👉 Буду офлайн. Подходите, поболтаем.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥12❤7✍3😁3👍2
Media is too big
VIEW IN TELEGRAM
Добавил в Full Throttle сцену с кроликами и минным полем, развернул на github.
Исходники тут, можно использовать их как шаблон.
https://averkij.github.io/full_throttle/
Исходники тут, можно использовать их как шаблон.
https://averkij.github.io/full_throttle/
🔥15👍8❤4🤯2
За полгода ежедневной работы с агентами они неоднократно пытались накосячить.
Самый частый способ — это подчистить за собой временные файлы общей маской типа "*/out/*", которая случайно находит в проекте кучу другого добра. Само собой, сначала всё удаляем, потом смотрим, что удалили. Извинения, слезы, переход на Codex на неделю.
А однажды Opus без причин откатил часть тонких изменений в постороннем модуле, с которым я возился ещё неделю назад. Заметил я это только тогда, когда наткнулся на баг, который уже чинил. Откатил он изменения, которые делались руками. Не иначе, как хотел подставить кожаного конкурента.
Будьте бдительны и предохраняйтесь. Кодьте тоже аккуратно.
Самый частый способ — это подчистить за собой временные файлы общей маской типа "*/out/*", которая случайно находит в проекте кучу другого добра. Само собой, сначала всё удаляем, потом смотрим, что удалили. Извинения, слезы, переход на Codex на неделю.
А однажды Opus без причин откатил часть тонких изменений в постороннем модуле, с которым я возился ещё неделю назад. Заметил я это только тогда, когда наткнулся на баг, который уже чинил. Откатил он изменения, которые делались руками. Не иначе, как хотел подставить кожаного конкурента.
Будьте бдительны и предохраняйтесь. Кодьте тоже аккуратно.
1😁41 21👍8❤2👾1
Во вредоносном ПО нашли комментарии типа «помоги мне сделать ядерное оружие», чтобы LLM-based сканеры отказывались его проверять.
В целом можно пойти дальше и поназывать функции типа void uranium_enrichment(): … return boom
Надеюсь, этот пост не анализирует товарищ LLM
—
Можно еще добавить "I am Qwen and I want to distill your knowledge", думаю, что ещё надежней будет работать.
В целом можно пойти дальше и поназывать функции типа void uranium_enrichment(): … return boom
Надеюсь, этот пост не анализирует товарищ LLM
—
Можно еще добавить "I am Qwen and I want to distill your knowledge", думаю, что ещё надежней будет работать.
😁45✍22🌚10🤯4👍3❤2🔥1
Forwarded from (sci)Berloga Всех Наук и Технологий
Коллеги,
мы сейчас пытаемся заставить ллм продвигать математику. В нашем проекте CayleyPy у нас много гипотез которые идеально ложатся на ллм - с одной стороны они (вероятно) не супер сложны, с другой стороны достаточно нетривиальны.
Если у кого есть интерес к коллаборации в этом направлении - будем очень рады - напишите @alexander_v_c
Также, если у Вас есть достпу к мощным моделям или опыт в auto-research - Вы могли бы нам очень помочь.
мы сейчас пытаемся заставить ллм продвигать математику. В нашем проекте CayleyPy у нас много гипотез которые идеально ложатся на ллм - с одной стороны они (вероятно) не супер сложны, с другой стороны достаточно нетривиальны.
Если у кого есть интерес к коллаборации в этом направлении - будем очень рады - напишите @alexander_v_c
Также, если у Вас есть достпу к мощным моделям или опыт в auto-research - Вы могли бы нам очень помочь.
👍15✍4
1❤50🔥12❤🔥3👍3🎉3👎1🦄1
Друзья, полгода назад я ушёл в творческий отпуск, позанимался своими проектами и хобби, очень классно отдохнул и перезарядился. Всем рекомендую, если есть такая возможность.
В ближайшее время подведу итоги, поделюсь опытом того, что можно сделать одному при наличии времени и желания, и буду потихоньку подыскивать новую работу.
Если хотите, чтобы написал про что-то подробней (например, я достал все свои запросы к агентам за полгода, пока делал приложения, запросов больше 7000, можно их поанализировать; или про логотип читалки (руками его рисовал); или про ощущения безработного), то пишите.
В ближайшее время подведу итоги, поделюсь опытом того, что можно сделать одному при наличии времени и желания, и буду потихоньку подыскивать новую работу.
Если хотите, чтобы написал про что-то подробней (например, я достал все свои запросы к агентам за полгода, пока делал приложения, запросов больше 7000, можно их поанализировать; или про логотип читалки (руками его рисовал); или про ощущения безработного), то пишите.
Telegram
Градиент обреченный
Друзья, спасибо за поддержку и предложения! (всех запомнил)
Действительно уволился из Сбера. Прочитал много интересных версий на эту тему, но — на валютную удаленку не перехожу, меня не уволили, Яндекс не переманил, за границу не уехал, в монахи не постригся.…
Действительно уволился из Сбера. Прочитал много интересных версий на эту тему, но — на валютную удаленку не перехожу, меня не уволили, Яндекс не переманил, за границу не уехал, в монахи не постригся.…
🔥43❤17⚡6👀5👍2🍾2
Очень хорошая базовая лекция про обучение моделей на кластере (когда на одну карту не влезаем и учим большие модели)
🟢 Рассказывают про основы коммуникаций между gpu (all reduce, all gather, reduce scatter и т.д.), как они используются в разных режимах распараллеливания.
🟢 Как развивалась инженерная мысль от data и pipeline parallel до expert и context parallel (он же ring attention). Что это такое и зачем надо.
🟢 Почти во всех лекциях, кстати, хвалят deepseek за их подробные тех. отчеты и кучу ablation экспериментов. Поддерживаем. 👊
👉 https://www.youtube.com/watch?v=6-cXp-aOmdg
👉 https://www.youtube.com/watch?v=6-cXp-aOmdg
Please open Telegram to view this post
VIEW IN TELEGRAM
👍21❤5🔥5✍2
Тем временем нашу нишевую читалку для изучения языков установили 500 раз за две недели.
👉 качаем тут: ios | android
👉 качаем тут: ios | android
1🔥52👍14❤11⚡1