Европа вступает в гонку языковых моделей: Германия впервые выпустила модель с результатом почти 97% в математике.
Kolibri от Aleph Alpha: 78 млрд параметров. 3,46 млрд активных. Контекст до 1 млн токенов. Открытые веса под лицензией Apache 2.0.
Для дообучения использовали ответы китайских моделей: GLM от Zhipu и Qwen от Alibaba.
Хорошие небольшие модели могут создавать не только в США и Китае.😋
Kolibri от Aleph Alpha: 78 млрд параметров. 3,46 млрд активных. Контекст до 1 млн токенов. Открытые веса под лицензией Apache 2.0.
Для дообучения использовали ответы китайских моделей: GLM от Zhipu и Qwen от Alibaba.
Хорошие небольшие модели могут создавать не только в США и Китае.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
«Основы компьютерного зрения» — бесплатная онлайн-книга издательства MIT Press, которая даёт широкое введение в компьютерное зрение с точки зрения обработки изображений и машинного обучения.
В ней разбираются формирование изображений, обучение и обратное распространение ошибки, фильтрация изображений и анализ Фурье, CNN, RNN и трансформеры, генеративные модели, обучение представлений, трёхмерная геометрия, оценка движения, распознавание объектов, модели, работающие с изображениями и текстом, и многое другое.
Особенно мне нравится, что вся книга доступна прямо в HTML: с понятной и удобной вёрсткой, множеством схем и визуализаций, которые помогают разобраться в концепциях.
https://visionbook.mit.edu
В ней разбираются формирование изображений, обучение и обратное распространение ошибки, фильтрация изображений и анализ Фурье, CNN, RNN и трансформеры, генеративные модели, обучение представлений, трёхмерная геометрия, оценка движения, распознавание объектов, модели, работающие с изображениями и текстом, и многое другое.
Особенно мне нравится, что вся книга доступна прямо в HTML: с понятной и удобной вёрсткой, множеством схем и визуализаций, которые помогают разобраться в концепциях.
https://visionbook.mit.edu
This media is not supported in your browser
VIEW IN TELEGRAM
Начни изучать программирование GPU с одной полностью анимированной лекции на YouTube. Это первое видео в серии о программировании GPU с Triton.
Каждая идея объясняется наглядно, с помощью анимации — как в GIF из этого поста, только на протяжении целого часа.
Ты каждый день пишешь
В лекции разбираются:
— Как GPU встроен в компьютер: PCIe, NVLink, серверы и кластеры.
— Что внутри NVIDIA H100: потоковые мультипроцессоры, вычислительные линии FP32, планировщик варпов, тензорные ядра и разделяемая память.
— Потоки, варпы, блоки и сетки — и как каждый поток находит свой элемент.
— Память: SRAM и DRAM, DDR, GDDR и HBM, кеши, задержка и пропускная способность.
— Как ускорить работу с памятью: скрытие задержек, объединение обращений к памяти и слияние ядер.
— Зачем нужен Triton и как он позволяет мыслить тайлами вместо потоков.
— Ограничения по пропускной способности памяти и вычислительной мощности, арифметическая интенсивность и модель Roofline.
— Механизм внимания, матрица N × N и то, как FlashAttention решает связанную с ней проблему.
Знание CUDA и устройства железа не требуется.
Что дальше:
— Лекция 2: построчно напишем наше первое ядро на Triton для сложения векторов. Опубликую через несколько дней.
— Новые лекции о программировании GPU и оптимизации инференса.
— Запланированная серия о глубоком обучении для аудио.
Полная лекция:
https://youtu.be/dEZP1qUNTOk
Каждая идея объясняется наглядно, с помощью анимации — как в GIF из этого поста, только на протяжении целого часа.
Ты каждый день пишешь
c = a + b в PyTorch. Эта лекция показывает, что GPU на самом деле делает с этим выражением.В лекции разбираются:
— Как GPU встроен в компьютер: PCIe, NVLink, серверы и кластеры.
— Что внутри NVIDIA H100: потоковые мультипроцессоры, вычислительные линии FP32, планировщик варпов, тензорные ядра и разделяемая память.
— Потоки, варпы, блоки и сетки — и как каждый поток находит свой элемент.
— Память: SRAM и DRAM, DDR, GDDR и HBM, кеши, задержка и пропускная способность.
— Как ускорить работу с памятью: скрытие задержек, объединение обращений к памяти и слияние ядер.
— Зачем нужен Triton и как он позволяет мыслить тайлами вместо потоков.
— Ограничения по пропускной способности памяти и вычислительной мощности, арифметическая интенсивность и модель Roofline.
— Механизм внимания, матрица N × N и то, как FlashAttention решает связанную с ней проблему.
Знание CUDA и устройства железа не требуется.
Что дальше:
— Лекция 2: построчно напишем наше первое ядро на Triton для сложения векторов. Опубликую через несколько дней.
— Новые лекции о программировании GPU и оптимизации инференса.
— Запланированная серия о глубоком обучении для аудио.
Полная лекция:
https://youtu.be/dEZP1qUNTOk
«Разбираемся в трансформерах и механизмах внимания» — краткое математическое введение в механизм внимания, одну из ключевых идей современных языковых моделей.
Документ разбирает токенизацию и эмбеддинги, запросы, ключи и значения, оценки и веса внимания, многоголовое внимание, самовнимание, причинное внимание и маскирование, перекрёстное внимание и базовую структуру архитектуры Transformer.
Также в нём представлены важные методы, которые делают механизм внимания в современных LLM эффективнее: KV-кеширование, внимание с группировкой запросов (GQA), многозапросное внимание (MQA) и латентное внимание.
https://arxiv.org/pdf/2604.00965
Документ разбирает токенизацию и эмбеддинги, запросы, ключи и значения, оценки и веса внимания, многоголовое внимание, самовнимание, причинное внимание и маскирование, перекрёстное внимание и базовую структуру архитектуры Transformer.
Также в нём представлены важные методы, которые делают механизм внимания в современных LLM эффективнее: KV-кеширование, внимание с группировкой запросов (GQA), многозапросное внимание (MQA) и латентное внимание.
https://arxiv.org/pdf/2604.00965
Видеолекции от Раджа Дандекаря:
— Создаём LLM с нуля
— Создаём DeepSeek с нуля
— Принципы диффузионных моделей
— Создаём диффузионную языковую модель с нуля
— Создаём LLM с нуля
— Создаём DeepSeek с нуля
— Принципы диффузионных моделей
— Создаём диффузионную языковую модель с нуля
Google выпустила EmbeddingGemma 2.
Это первая открытая мультимодальная модель для эмбеддингов, изначально работающая с текстом, кодом, изображениями, видео и аудио.
740 млн параметров. Модульная архитектура. Модель создана для запуска прямо на устройстве, а не в дата-центре.
При этом она обходит некоторые специализированные модели, которые более чем вдвое крупнее.
В паре с Gemma 4 можно собрать полностью локальный RAG с упором на приватность.
https://huggingface.co/google/embeddinggemma-2
https://huggingface.co/unsloth/embeddinggemma-2-GGUF
Это первая открытая мультимодальная модель для эмбеддингов, изначально работающая с текстом, кодом, изображениями, видео и аудио.
740 млн параметров. Модульная архитектура. Модель создана для запуска прямо на устройстве, а не в дата-центре.
При этом она обходит некоторые специализированные модели, которые более чем вдвое крупнее.
В паре с Gemma 4 можно собрать полностью локальный RAG с упором на приватность.
https://huggingface.co/google/embeddinggemma-2
https://huggingface.co/unsloth/embeddinggemma-2-GGUF
1. Математические основы машинного обучения
https://t.co/6jaPNJW9wH
2. Математические основы генеративных моделей
https://t.co/LTmMWZcZNS
3. Математические основы генеративного ИИ
https://t.co/EURxtNfMmx
https://t.co/6jaPNJW9wH
2. Математические основы генеративных моделей
https://t.co/LTmMWZcZNS
3. Математические основы генеративного ИИ
https://t.co/EURxtNfMmx
Тестируйте торговые стратегии на основе машинного обучения на исторических рыночных данных, прежде чем рисковать реальными деньгами.
- Проверяйте стратегии на множестве финансовых инструментов одновременно.
- Обучайте модели, имитирующие реальную торговлю.
- Получайте рыночные данные из Yahoo и Alpaca.
https://github.com/edtechre/pybroker
- Проверяйте стратегии на множестве финансовых инструментов одновременно.
- Обучайте модели, имитирующие реальную торговлю.
- Получайте рыночные данные из Yahoo и Alpaca.
https://github.com/edtechre/pybroker