Machinelearning

🖥

Google анонсировала Ironwood TPU — специализированный чип, созданный для ускоренного инференса ИИ-моделей.

Ironwood — это TPU седьмого поколения, конкурент Blackwell B200 от NVIDIA.

10× прирост производительности по сравнению с предыдущим поколением.

🔧 Что важно знать:
⚡️ Ironwood TPU = высокая плотность + эффективность: на 67% больше FLOPS/ватт, чем v5p и 4 614 TFLOPS на чип (FP8) и 192 ГБ HBM.

Производительность чипов растёт, а энергоэффективность выходит на новый уровень.

🌐 Интеграция с Google Cloud:
Ironwood TPUs уже работают в дата-центрах с жидкостным охлаждением, интегрированы в Vertex AI .

📈 Под капотом — высокоскоростная сеть с пропускной способностью 3.5 Тбит/с, обеспечивающая быструю связность для масштабных моделей.

💡 И да — теперь TPU поддерживают vLLM, а значит, можно легко гонять PyTorch-инференс прямо на TPU, без магии и костылей.

🟡

Подробнее

@ai_machinelearning_big_data

#google #TPU

Please open Telegram to view this post

VIEW IN TELEGRAM

Please open Telegram to view this post

VIEW IN TELEGRAM

1👍71🔥20❤11🤔6🥰1

18.9K views14:59

Machinelearning

✔️

Stanford и Google представили Marin — первую полностью открытую LLM, разработанную на JAX

Что делает Marin особенной:
— Полностью открыты не только веса, но показан весь процесс обучения: код, данные, гиперпараметры модели, логи, эксперименты — всё доступно на GitHub
— Модель обучена на 12.7 трлн токенов и в 14 из 19 тестов обошла Llama 3.1 8B
— Лицензия Apache 2.0, всё можно использовать, модифицировать и воспроизводить
— Levanter + JAX обеспечивают bit‑exact повторяемость и масштабируемость на TPU/GPU

Проект позиционируется как открытая лаборатория: каждый эксперимент оформляется через pull request, логируется в WandB, обсуждается в issue и фиксируется в истории репозитория. Даже неудачные эксперименты сохраняются ради прозрачности.

Выпущены две версии:
- Marin‑8B‑Base — сильный base-модель, превосходит Llama 3.1 8B
- Marin‑8B‑Instruct — обучена с помощью SFT, обгоняет OLMo 2, немного уступает Llama 3.1 Tulu

Это не просто открытые веса, а новый стандарт для научных вычислений в эпоху больших моделей.

* JAX — это фреймворк от Google для научных и численных вычислений, особенно популярен в сфере машинного обучения.

**TPU (Tensor Processing Unit) — это специализированный чип от Google, созданный для ускорения AI-задач.

🟠

Github: https://github.com/stanford-crfm/marin

🟠

Блог: https://developers.googleblog.com/en/stanfords-marin-foundation-model-first-fully-open-model-developed-using-jax/

🟠

Гайд: https://docs.jax.dev/en/latest/quickstart.html

@ai_machinelearning_big_data

#ai #ml #tpu #jax #google

Please open Telegram to view this post

VIEW IN TELEGRAM

Please open Telegram to view this post

VIEW IN TELEGRAM

🔥73❤25👍19🥰2💯2🤔1

27.3K views13:01

Machinelearning

📌

Анатомии GPU и TPU: 12 глава пособия "How to Scale Your Model"

Группа инженеров из Google DeepMind опубликовали 12-ю главу своего он-лайн учебника "How to Scale Your Model: A Systems View of LLMs on TPUs"

How to Scale Your Model - практико-ориентированное руководство по масштабированию LLM из 12 разделов для разработчиков и исследователей. Оно объясняет, как анализировать и оптимизировать производительность модели, учитывая системные ресурсы: вычисления, память и пропускную способность.

Пособие научит выбирать оптимальные стратегии параллелизма, оценивать стоимость и время обучения и инференса, а также глубже понять взаимодействие между TPU/GPU и алгоритмами масштабирования как на одном, так и на тысячах ускорителей.

12-я глава - глубокое техническое руководство по архитектуре GPU и стратегиям масштабирования больших моделей. В ней детально разбирается устройство современных GPU NVIDIA: Streaming Multiprocessors, Tensor Cores, иерархия памяти (HBM, L2, SMEM), все это с подробными сравнительными таблицами характеристик для разных поколений чипов.

Очень подробно выполнено сравнение архитектур GPU и TPU, с объясняем ключевого различия между модульностью GPU и монолитностью TPU.

Особое внимание, что редкость для обучающих материалов, уделено сетевой организации кластеров. Авторы доступно объясняют как GPU соединяются внутри узлов через NVLink/NVSwitch и между узлами через InfiniBand в топологии "Fat tree", и как пропускная способность на каждом уровне влияет на реальную производительность коллективных операций (AllReduce, AllGather).

Описаны основные стратегии параллелизма: Data Parallelism, Tensor Parallelism, Expert Parallelism и Pipeline Parallelism, с разбором их ограничений и примеров из реальных проектов.

В конце главы есть хороший анализ новых возможностей архитектуры Blackwell.

@ai_machinelearning_big_data

#AI #ML #LLM #Scaling #GPU #TPU

Please open Telegram to view this post

VIEW IN TELEGRAM

Please open Telegram to view this post

VIEW IN TELEGRAM

👍61❤32🔥18🥰3

24.7K views09:01

About

Blog

Apps

Platform