Градиент обреченный
8.8K subscribers
1.01K photos
28 videos
10 files
547 links
Download Telegram
OpenAI сказали, что приостанавливают новые подписки за $200 долларов в связи с большим спросом, чтобы поддержать качество для тех, кто уже подписан.

Поэтому... второй раз за неделю сбросили лимиты. Ну мы не против.
🔥23😁1542🎉2
Коллеги,
мы сейчас пытаемся заставить ллм продвигать математику. В нашем проекте CayleyPy у нас много гипотез которые идеально ложатся на ллм - с одной стороны они (вероятно) не супер сложны, с другой стороны достаточно нетривиальны.

Если у кого есть интерес к коллаборации в этом направлении - будем очень рады - напишите @alexander_v_c

Также, если у Вас есть достпу к мощным моделям или опыт в auto-research - Вы могли бы нам очень помочь.
👍154
😁104💯9🔥4💊1
Добавил в нашу читалку татарский и башкирский языки, подготовил на них несколько рассказов.

Скачать можно тут — ios , android
150🔥12❤‍🔥3👍3🎉3👎1🦄1
Друзья, полгода назад я ушёл в творческий отпуск, позанимался своими проектами и хобби, очень классно отдохнул и перезарядился. Всем рекомендую, если есть такая возможность.

В ближайшее время подведу итоги, поделюсь опытом того, что можно сделать одному при наличии времени и желания, и буду потихоньку подыскивать новую работу.

Если хотите, чтобы написал про что-то подробней (например, я достал все свои запросы к агентам за полгода, пока делал приложения, запросов больше 7000, можно их поанализировать; или про логотип читалки (руками его рисовал); или про ощущения безработного), то пишите.
🔥43176👀5👍2🍾2
Очень хорошая базовая лекция про обучение моделей на кластере (когда на одну карту не влезаем и учим большие модели)

🟢 Рассказывают про основы коммуникаций между gpu (all reduce, all gather, reduce scatter и т.д.), как они используются в разных режимах распараллеливания.

🟢 Как развивалась инженерная мысль от data и pipeline parallel до expert и context parallel (он же ring attention). Что это такое и зачем надо.

🟢 Почти во всех лекциях, кстати, хвалят deepseek за их подробные тех. отчеты и кучу ablation экспериментов. Поддерживаем. 👊

👉 https://www.youtube.com/watch?v=6-cXp-aOmdg
Please open Telegram to view this post
VIEW IN TELEGRAM
👍215🔥52
Тем временем нашу нишевую читалку для изучения языков установили 500 раз за две недели.

👉 качаем тут: ios | android
1🔥52👍14111
Слушайте, а давно клод-код стал сам возобновлять таски, которые умерли по лимиту?

- limit resets 9:40pm
- сontinuing automatically at 9:40pm
34🔥8👍5
Тусим сегодня на AI RnD Day от Сбера, доклады пока отличные, множество знакомых лиц, все красавцы.
👍194🔥3😁2
Люблю господина Сергея Николенко. Что в ЧКГ он мне всегда нравился, что книжки классные по ML у него есть, рекомендую для вкатывания.

- Говорит, что математика, кажется, всё, но математики это переживут.
- Обсудили коммунистический подход агентов, ломавших HF.
- Поразмышляли над архитектурами моделей лет через пять.
- Возможно, что следующие топовые архитектуры будут придуманы уже не нами.
16👍11💯5🤓2😭1👨‍💻1
Ещё вчера был классный доклад про рекурсивные архитектуры

Есть ряд статей про такие архитектуры — HRM, TRM и URM (гуглим). Суть в том, что небольшая сеть, переиспользуя свои собственные веса, может многократно уточнять решение какой-то задачи, прежде чем выдать ответ.

Оказалось, что это хорошо ложится на логические задачи типа задач с ограничениями (судоку и другие варианты латинских квадратов, какуро и т.п.), лабиринтов, автоматов типа игры в жизнь и в целом задач с абстрактным рассуждением (ARC-AGI бенчмарк).

Из минусов то, что не получается загнать все такие таски в одну сеть, надо обучать под конкретную задачу. Из плюсов то, что одна модель может на своей задаче давать качество лучше любой LLM, быть сильно дешевле, быстрее и т.д.

Ребята собрали свою архитектуру на этой базе — STARM (Single Task Algorithmic Reasoning Models), оптимизировали её, получили SOTA качество. Выложили код.

👉 Хабр | GitHub
🔥145👍51