Love. Death. Transformers.
24.5K subscribers
4.62K photos
525 videos
82 files
3.02K links
❤️☠️🤗

Указанные действия не являются ресерчем, поскольку:
а) Мы не ученые;
б) Оно работает.
@transformerslovedeatch по всем вопросам
Все ситуации вымышлены, любые совпадения с реальности плот вашей фантазии.
Download Telegram
😁110184
]
20👍5
Forwarded from AbstractDL
Do Large Language Models Latently Perform Multi-Hop Reasoning? (by Google)

Авторы обнаружили, что если вопрос сформулирован неявно, то LLM уже во время его чтения "пытаются" подставить промежуточный шаг рассуждений в латентном пространстве. Например, для эмбеддингов последних токенов этого вопроса
Сколько людей живут в крупнейшем городе Европы?

растут логиты, соответствующие слову "Стамбул".

Выходит, что на промежуточных слоях происходит multi-hop reasoning. Пока авторы нашли подтверждение этому максимум до 2 шагов рассуждений, причём качество первого шага растёт по мере увеличения модели, а вот второй шаг размазывается по всем слоям и почему-то не сильно зависит от размеров LLM.

Статья
🔥48👍104
Генеративные модели достигли в программировании уровня сеньоров
83😁73🤩3
Forwarded from Complete AI (Andrey Kuznetsov)
Вот и статья про Sora пожаловала от OpenAI
(А точнее от Lehigh University и Microsoft Research)

Сделать разбор статьи о том, что внутри?

PDF

@complete_ai
👍115🤡8👎3🤔1
Forwarded from igor tokarev
😁192👍64
чат, лень гуглить, подкиньте физические движки с питон апишкой чтобы катать шары, была простая soft body и можно было легко собрать логи(вектора, координаты и прочее)

а и желательно ++ бекенд или просто быстрый и без gilов
3123😁2
Еще подход к оптимизации LLM трейна через копирование слоев с рлем

Раз в несколько итераций трейна спрашивем рльную полиси (маленький MLP) какой слой копирнуть в вышестойщий. В статье этот механизм называется "связыванием", он определяет, когда слои тренируются и копируются. В самом начале тренируется только первый слой. Со временем остальные слои размораживаются через копирование из нижестоящих или тренируются независимо от других (когда полиси сказала, чтобы он был завязан сам на себя). Так понял.

На входе (s) - вектор с размерностью количества слоев в ллмке, где на каждой позиции стоит минимальный индекс "связанного" слоя, с которого веса копируются (когда надо).
Сама полиси тренируется вместе с LLMкой.

reward = -perplexity на батче

Получили:
BERT тратит на 1 эпоху ~ 2 раза меньше времени
GPT2 в пике потребяла ~ 3 раза меньше памяти чем при обычном трейне, но учится чуть дольше

Dynamic Layer Tying for Parameter-Efficient Transformers
https://arxiv.org/abs/2401.12819
🔥342👎2🤔2👍1
Да я в корпе просто так для души подрабатываю, так то у меня куча ресерч пропозалов
😁141👍42
#чтивонаночь
LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens


Про RoPE слышали? короче у rotary эмбедов есть проблема - сколько учишь, столько получишь, учишь 2048 - будь добр не суй больше 2048, ppl порветься(ну точнее взорвется)

Rope обычный работает так что Kый токен будет притворяться токеном на позиции которые трансформер в оригинале видел. Конечно такой схематоз надо обучать, но куда без этого. К слову можно учить LoRA, так что все не так плохо.

Что же докидывают microsoft?
Они перебирают разные варианты возможных позиций и подсовывают в модель. Типа работает сильно лучше потому что это подобранная эвристика. Ну и соотвественно с названием это все можно скелйить в 2m токенов(если гпу на инференс хватит)

paper
кода нет, но обещают
16🔥4👍21
so true
😁95155🤩4😢2👍1
Forwarded from ML-легушька (Николай Кутузов)
8025👍7👏2
ебала жаба гадюку

Маск подал в суд на Саму и опен аи, потому что схема работы openai крайне сложная и не похожа non-profit организацию
76😁29176👍5🔥5
Forwarded from Roman Buzko
Musk vs Altman and OpenAI 2024.pdf
1.5 MB
Илон Маск предъявил иск к Сэму Альтману и группе OpenAI.

Основания для иска:

1/ Нарушение договора
2/ Promissory estoppel
3/ Нарушение фидуциарных обязательств
4/ Недобросовестная конкуренция

Интересные детали из иска и юридический разбор будут в этом канале в ближайшее время, а пока что прикладываю сам документ для вашего самостоятельного изучения.

Надо сказать, что Маска в этом деле представляют не его обычные юристы, а относительно небольшая юрфирма. Это говорит об оппортунистическим характере иска, например, чтобы получить информацию в рамках процесса discovery (мы как раз писали об этом в последнем посте из цикла #KrasExamination).

@buzko_hub
👍125🤡321
А, те в рамках процесса получится вытащит инфу о гпт4, умно😬
Please open Telegram to view this post
VIEW IN TELEGRAM
😁4917👍3🔥1🤡1
Love. Death. Transformers.
Поясните пожалуйста за математику, я правильно понимаю что для 70В модели надо иметь 300+ карт(20к usd каждая, те 11м USD за все). А dgx h100 способный в mp=8 выдавать те же 500т/с стоит 300к USD и при этом может не только инферить модельки но и учить?(для…
Собственно, в подтверждение моим мыслям про groq вышел любопытный блогпост про экономику инференса.
- грок оптимизирован под latency, это возможно на железкаах Nvidia, но не очень экономически целесообразно
-текущие провайдеры LLM в лучшем случае имеют небольшую марж

Выводы:
-цена инференса вероятно не упадет заметно пока Nvidia монополист на рынке *pu



блог
👍2431🔥1