Forwarded from (sci)Berloga Всех Наук и Технологий
Коллеги,
мы сейчас пытаемся заставить ллм продвигать математику. В нашем проекте CayleyPy у нас много гипотез которые идеально ложатся на ллм - с одной стороны они (вероятно) не супер сложны, с другой стороны достаточно нетривиальны.
Если у кого есть интерес к коллаборации в этом направлении - будем очень рады - напишите @alexander_v_c
Также, если у Вас есть достпу к мощным моделям или опыт в auto-research - Вы могли бы нам очень помочь.
мы сейчас пытаемся заставить ллм продвигать математику. В нашем проекте CayleyPy у нас много гипотез которые идеально ложатся на ллм - с одной стороны они (вероятно) не супер сложны, с другой стороны достаточно нетривиальны.
Если у кого есть интерес к коллаборации в этом направлении - будем очень рады - напишите @alexander_v_c
Также, если у Вас есть достпу к мощным моделям или опыт в auto-research - Вы могли бы нам очень помочь.
👍15✍4
1❤50🔥12❤🔥3👍3🎉3👎1🦄1
Друзья, полгода назад я ушёл в творческий отпуск, позанимался своими проектами и хобби, очень классно отдохнул и перезарядился. Всем рекомендую, если есть такая возможность.
В ближайшее время подведу итоги, поделюсь опытом того, что можно сделать одному при наличии времени и желания, и буду потихоньку подыскивать новую работу.
Если хотите, чтобы написал про что-то подробней (например, я достал все свои запросы к агентам за полгода, пока делал приложения, запросов больше 7000, можно их поанализировать; или про логотип читалки (руками его рисовал); или про ощущения безработного), то пишите.
В ближайшее время подведу итоги, поделюсь опытом того, что можно сделать одному при наличии времени и желания, и буду потихоньку подыскивать новую работу.
Если хотите, чтобы написал про что-то подробней (например, я достал все свои запросы к агентам за полгода, пока делал приложения, запросов больше 7000, можно их поанализировать; или про логотип читалки (руками его рисовал); или про ощущения безработного), то пишите.
Telegram
Градиент обреченный
Друзья, спасибо за поддержку и предложения! (всех запомнил)
Действительно уволился из Сбера. Прочитал много интересных версий на эту тему, но — на валютную удаленку не перехожу, меня не уволили, Яндекс не переманил, за границу не уехал, в монахи не постригся.…
Действительно уволился из Сбера. Прочитал много интересных версий на эту тему, но — на валютную удаленку не перехожу, меня не уволили, Яндекс не переманил, за границу не уехал, в монахи не постригся.…
🔥43❤17⚡6👀5👍2🍾2
Очень хорошая базовая лекция про обучение моделей на кластере (когда на одну карту не влезаем и учим большие модели)
🟢 Рассказывают про основы коммуникаций между gpu (all reduce, all gather, reduce scatter и т.д.), как они используются в разных режимах распараллеливания.
🟢 Как развивалась инженерная мысль от data и pipeline parallel до expert и context parallel (он же ring attention). Что это такое и зачем надо.
🟢 Почти во всех лекциях, кстати, хвалят deepseek за их подробные тех. отчеты и кучу ablation экспериментов. Поддерживаем. 👊
👉 https://www.youtube.com/watch?v=6-cXp-aOmdg
👉 https://www.youtube.com/watch?v=6-cXp-aOmdg
Please open Telegram to view this post
VIEW IN TELEGRAM
👍21❤5🔥5✍2
Тем временем нашу нишевую читалку для изучения языков установили 500 раз за две недели.
👉 качаем тут: ios | android
👉 качаем тут: ios | android
1🔥52👍14❤11⚡1
Тусим сегодня на AI RnD Day от Сбера, доклады пока отличные, множество знакомых лиц, все красавцы.
👍19❤4🔥3😁2
Люблю господина Сергея Николенко. Что в ЧКГ он мне всегда нравился, что книжки классные по ML у него есть, рекомендую для вкатывания.
- Говорит, что математика, кажется, всё, но математики это переживут.
- Обсудили коммунистический подход агентов, ломавших HF.
- Поразмышляли над архитектурами моделей лет через пять.
- Возможно, что следующие топовые архитектуры будут придуманы уже не нами.
- Говорит, что математика, кажется, всё, но математики это переживут.
- Обсудили коммунистический подход агентов, ломавших HF.
- Поразмышляли над архитектурами моделей лет через пять.
- Возможно, что следующие топовые архитектуры будут придуманы уже не нами.
❤16👍11💯5🤓2😭1👨💻1
Ещё вчера был классный доклад про рекурсивные архитектуры
Есть ряд статей про такие архитектуры — HRM, TRM и URM (гуглим). Суть в том, что небольшая сеть, переиспользуя свои собственные веса, может многократно уточнять решение какой-то задачи, прежде чем выдать ответ.
Оказалось, что это хорошо ложится на логические задачи типа задач с ограничениями (судоку и другие варианты латинских квадратов, какуро и т.п.), лабиринтов, автоматов типа игры в жизнь и в целом задач с абстрактным рассуждением (ARC-AGI бенчмарк).
Из минусов то, что не получается загнать все такие таски в одну сеть, надо обучать под конкретную задачу. Из плюсов то, что одна модель может на своей задаче давать качество лучше любой LLM, быть сильно дешевле, быстрее и т.д.
Ребята собрали свою архитектуру на этой базе — STARM (Single Task Algorithmic Reasoning Models), оптимизировали её, получили SOTA качество. Выложили код.
👉 Хабр | GitHub
Есть ряд статей про такие архитектуры — HRM, TRM и URM (гуглим). Суть в том, что небольшая сеть, переиспользуя свои собственные веса, может многократно уточнять решение какой-то задачи, прежде чем выдать ответ.
Оказалось, что это хорошо ложится на логические задачи типа задач с ограничениями (судоку и другие варианты латинских квадратов, какуро и т.п.), лабиринтов, автоматов типа игры в жизнь и в целом задач с абстрактным рассуждением (ARC-AGI бенчмарк).
Из минусов то, что не получается загнать все такие таски в одну сеть, надо обучать под конкретную задачу. Из плюсов то, что одна модель может на своей задаче давать качество лучше любой LLM, быть сильно дешевле, быстрее и т.д.
Ребята собрали свою архитектуру на этой базе — STARM (Single Task Algorithmic Reasoning Models), оптимизировали её, получили SOTA качество. Выложили код.
👉 Хабр | GitHub
🔥14❤5👍5✍1