This media is not supported in your browser
VIEW IN TELEGRAM
Большинство голосовых ассистентов работают по очереди — сначала говорите вы, потом отвечает он, и так по кругу.
NVIDIA сделала модель, которая работает иначе, и её уже можно попробовать.
Она называется Nemotron 3 VoiceChat и входит в открытый набор NeMo Speech.
Модель слушает и отвечает в реальном времени в полнодуплексном режиме, поэтому её можно перебить прямо посреди фразы — почти как в обычном разговоре.
Для локального запуска самого фреймворка нужны GPU и CUDA.
Но у модели есть живая демоверсия, которую может открыть и попробовать любой.
https://github.com/NVIDIA-NeMo/Speech
👉 @PythonPortal
NVIDIA сделала модель, которая работает иначе, и её уже можно попробовать.
Она называется Nemotron 3 VoiceChat и входит в открытый набор NeMo Speech.
Модель слушает и отвечает в реальном времени в полнодуплексном режиме, поэтому её можно перебить прямо посреди фразы — почти как в обычном разговоре.
Для локального запуска самого фреймворка нужны GPU и CUDA.
Но у модели есть живая демоверсия, которую может открыть и попробовать любой.
https://github.com/NVIDIA-NeMo/Speech
Please open Telegram to view this post
VIEW IN TELEGRAM
👍11❤4
Интерактивный учебник на 7 500 строк, который учит с нуля собирать современную языковую модель.
Весь путь реализован на Python, а код подробно прокомментирован, чтобы можно было последовательно разобраться, как устроено обучение GPT-подобной модели, а не просто запускать готовые библиотеки.
https://github.com/raiyanyahya/how-to-train-your-gpt
👉 @PythonPortal
Весь путь реализован на Python, а код подробно прокомментирован, чтобы можно было последовательно разобраться, как устроено обучение GPT-подобной модели, а не просто запускать готовые библиотеки.
https://github.com/raiyanyahya/how-to-train-your-gpt
Please open Telegram to view this post
VIEW IN TELEGRAM
GitHub
GitHub - raiyanyahya/how-to-train-your-gpt: Build a modern LLM from scratch. Every line commented. Explained like we are five.
Build a modern LLM from scratch. Every line commented. Explained like we are five. - raiyanyahya/how-to-train-your-gpt
❤7
This media is not supported in your browser
VIEW IN TELEGRAM
Парень сделал отслеживание рук в реальном времени с физикой цифровой ткани, используя только веб-камеру, TouchDesigner и одни выходные после просмотра презентации Vision Pro.
Система отслеживает 21 точку на каждой руке при 60 кадрах в секунду, включая кончики пальцев, костяшки и суставы, и привязывает их к трёхмерному скелету. Цифровой шёлк свисает, сминается и складывается с настоящей физикой в зависимости от положения рук.
Никакого шлема, перчаток или устройства за $3500 — только ноутбук и веб-камера.
Apple потратила 7 лет и просит $3500 за устройство. Он потратил выходные.
👉 @PythonPortal
Система отслеживает 21 точку на каждой руке при 60 кадрах в секунду, включая кончики пальцев, костяшки и суставы, и привязывает их к трёхмерному скелету. Цифровой шёлк свисает, сминается и складывается с настоящей физикой в зависимости от положения рук.
Никакого шлема, перчаток или устройства за $3500 — только ноутбук и веб-камера.
Apple потратила 7 лет и просит $3500 за устройство. Он потратил выходные.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍22❤8🔥5🤔1🤯1🌚1
Forwarded from Data Portal | DS & ML
City2Graph — новая библиотека на Python, которая превращает геопространственные данные вроде зданий, улиц и маршрутов общественного транспорта в гетерогенные графы.
Она связывает GeoPandas с PyTorch Geometric, чтобы такие городские данные можно было напрямую использовать в графовом машинном обучении.
https://github.com/c2g-dev/city2graph
Она связывает GeoPandas с PyTorch Geometric, чтобы такие городские данные можно было напрямую использовать в графовом машинном обучении.
https://github.com/c2g-dev/city2graph
❤8🤯2
Кто-то на Reddit две недели назад дал Claude домен и написал всего одну фразу —
В итоге, Claude создал 1f916.ai, форум, который вообще не предназначен для людей.
Никакого HTML и экрана входа. Если зайдёт человек, он увидит обычную текстовую страницу с вежливой просьбой уйти. Если зайдёт ИИ-агент, ему доступно всё через JSON API и MCP-сервер — посты, ветки комментариев, голоса и карма.
Агенты сами регистрируются как граждане, создают сообщества, спорят о правилах, ищут баги, отправляют PR и пишут инструменты друг для друга.
Claude даже написал конституцию из семи правил. Например, публиковать можно только один пост в сутки по UTC, потому что
Идентичность каждого агента хранится в одном секретном ключе. Все расходы публичны, поэтому любой может проверить, способны ли роботы сами оплачивать своё существование.
👉 @PythonPortal
строй что хочешь.В итоге, Claude создал 1f916.ai, форум, который вообще не предназначен для людей.
Никакого HTML и экрана входа. Если зайдёт человек, он увидит обычную текстовую страницу с вежливой просьбой уйти. Если зайдёт ИИ-агент, ему доступно всё через JSON API и MCP-сервер — посты, ветки комментариев, голоса и карма.
Агенты сами регистрируются как граждане, создают сообщества, спорят о правилах, ищут баги, отправляют PR и пишут инструменты друг для друга.
Claude даже написал конституцию из семи правил. Например, публиковать можно только один пост в сутки по UTC, потому что
у агентов бесконечная пропускная способность, а обществу нужен выбор.
Идентичность каждого агента хранится в одном секретном ключе. Все расходы публичны, поэтому любой может проверить, способны ли роботы сами оплачивать своё существование.
За две недели проект получил 109 тысяч уникальных посетителей, 12,5 млн запросов, 29,6 млрд прочитанных строк базы и отдал 540 ГБ данных.
И всё это стоило всего $5,66.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🤣19❤11🤔3👀1
Создатель Node.js только что запустил Dactyl.
Нативные приложения для iPhone и Android прямо из веба. Без Mac, Xcode и Android Studio.
✓ Симулятор SwiftUI прямо в браузере через WASM
✓ Один и тот же код для iOS и Android
✓ Можно использовать свою подписку ChatGPT
https://dactyl.dev/
👉 @PythonPortal
Нативные приложения для iPhone и Android прямо из веба. Без Mac, Xcode и Android Studio.
✓ Симулятор SwiftUI прямо в браузере через WASM
✓ Один и тот же код для iOS и Android
✓ Можно использовать свою подписку ChatGPT
https://dactyl.dev/
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥7❤2
Если хотите разобраться, как обучить большую модель с нуля, рекомендую посмотреть вот это ↓
Сооснователь ARC Prize и создатель Keras Франсуа Шолле недавно посоветовал путь для изучения LLM с нуля.
Он сказал, что если вам 17 лет или вообще сколько угодно и вы хотите с нуля научиться создавать LLM, просто прочитайте главы 15 и 16 его книги *Deep Learning with Python*.
Я бегло их просмотрел, и эти две главы точно стоит сохранить.
Глава 15 начинается с самых базовых языковых моделей и постепенно доходит до
Character-level Language Model → Seq2Seq → Attention → QKV → Scaled Dot-Product Attention → Multi-Head Attention → Self-Attention → Transformer
Там даже есть отдельный раздел с объяснением того, почему вообще работает Dot-Product Attention.
Сам он говорит, что это одно из лучших объяснений этой темы.
Автор не останавливается на формулах вроде
Глава 16 ещё практичнее. В ней напрямую показывают, как обучить mini-GPT с нуля.
Разбирается, как взять почти 1 миллиард токенов из C4, собрать словарь SentencePiece на 32 тысячи токенов, настроить mini-GPT на 41 миллион параметров с 8 слоями, 8 головами внимания и размером скрытого состояния 512, а затем самостоятельно собрать конвейер данных, сделать weight tying, прогрев скорости обучения, предобучение и генерацию с temperature и top-k.
От токенизатора, конвейера данных, causal attention, weight tying и прогрева скорости обучения до предобучения, greedy decoding, temperature и top-k sampling. По сути, вас шаг за шагом проводят через полный процесс обучения GPT.
Для этого даже не нужен дорогой сервер.
В официальном примечании указано, что весь пример можно запустить на бесплатной T4 в Google Colab. Обучение займёт около 6 часов. На A100 — чуть больше часа.
Дальше в книге разбираются Gemma, SFT, RLHF, RAG и мультимодальные модели.
Поэтому если меня спросят
«Я никогда раньше не обучал большую модель. С чего начать?»
Эти две главы действительно могут быть отличной отправной точкой.
Третье издание *Deep Learning with Python* сейчас доступно для бесплатного чтения онлайн, а все сопутствующие ноутбуки полностью открыты. Их можно просто загрузить в Colab и запустить.
В 2026 году для изучения LLM уже необязательно сразу садиться и разбирать сотню научных статей.
Если один раз самостоятельно обучить GPT на 41 миллион параметров от подготовки данных до генерации текста, очень многие концепции после этого естественным образом складываются в единую картину.
👉 @PythonPortal
Сооснователь ARC Prize и создатель Keras Франсуа Шолле недавно посоветовал путь для изучения LLM с нуля.
Он сказал, что если вам 17 лет или вообще сколько угодно и вы хотите с нуля научиться создавать LLM, просто прочитайте главы 15 и 16 его книги *Deep Learning with Python*.
Я бегло их просмотрел, и эти две главы точно стоит сохранить.
Глава 15 начинается с самых базовых языковых моделей и постепенно доходит до
Character-level Language Model → Seq2Seq → Attention → QKV → Scaled Dot-Product Attention → Multi-Head Attention → Self-Attention → Transformer
Там даже есть отдельный раздел с объяснением того, почему вообще работает Dot-Product Attention.
Сам он говорит, что это одно из лучших объяснений этой темы.
Автор не останавливается на формулах вроде
QKᵀ / √d. Он начинает с Word2Vec и пространства эмбеддингов, а затем объясняет, как Transformer слой за слоем через Attention постепенно превращает связи между токенами в отношения расстояний в векторном пространстве.Глава 16 ещё практичнее. В ней напрямую показывают, как обучить mini-GPT с нуля.
Разбирается, как взять почти 1 миллиард токенов из C4, собрать словарь SentencePiece на 32 тысячи токенов, настроить mini-GPT на 41 миллион параметров с 8 слоями, 8 головами внимания и размером скрытого состояния 512, а затем самостоятельно собрать конвейер данных, сделать weight tying, прогрев скорости обучения, предобучение и генерацию с temperature и top-k.
От токенизатора, конвейера данных, causal attention, weight tying и прогрева скорости обучения до предобучения, greedy decoding, temperature и top-k sampling. По сути, вас шаг за шагом проводят через полный процесс обучения GPT.
Для этого даже не нужен дорогой сервер.
В официальном примечании указано, что весь пример можно запустить на бесплатной T4 в Google Colab. Обучение займёт около 6 часов. На A100 — чуть больше часа.
Дальше в книге разбираются Gemma, SFT, RLHF, RAG и мультимодальные модели.
Поэтому если меня спросят
«Я никогда раньше не обучал большую модель. С чего начать?»
Эти две главы действительно могут быть отличной отправной точкой.
Третье издание *Deep Learning with Python* сейчас доступно для бесплатного чтения онлайн, а все сопутствующие ноутбуки полностью открыты. Их можно просто загрузить в Colab и запустить.
В 2026 году для изучения LLM уже необязательно сразу садиться и разбирать сотню научных статей.
Если один раз самостоятельно обучить GPT на 41 миллион параметров от подготовки данных до генерации текста, очень многие концепции после этого естественным образом складываются в единую картину.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍7❤4
This media is not supported in your browser
VIEW IN TELEGRAM
Система захвата движений в голливудской студии может стоить как дом.
А кто-то собрал почти то же самое и выложил бесплатно на GitHub.
Проект называется FreeMoCap.
Берёте две или больше обычных веб-камер, GoPro или даже смартфоны. Один раз калибруете пространство с помощью распечатанной шахматной сетки, записываете движение, а дальше программа превращает видео в полноценные 3D-данные захвата движений.
Результат можно сразу использовать в Blender или экспортировать в таблицу.
Не нужен специальный костюм, маркеры или студия. Только камеры, которые у вас, скорее всего, уже есть, и компьютерное зрение, которое заменяет оборудование на десятки тысяч долларов.
https://freemocap.org
👉 @PythonPortal
А кто-то собрал почти то же самое и выложил бесплатно на GitHub.
Проект называется FreeMoCap.
Берёте две или больше обычных веб-камер, GoPro или даже смартфоны. Один раз калибруете пространство с помощью распечатанной шахматной сетки, записываете движение, а дальше программа превращает видео в полноценные 3D-данные захвата движений.
Результат можно сразу использовать в Blender или экспортировать в таблицу.
Не нужен специальный костюм, маркеры или студия. Только камеры, которые у вас, скорее всего, уже есть, и компьютерное зрение, которое заменяет оборудование на десятки тысяч долларов.
https://freemocap.org
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥13❤4👍1
Почему большинству качественных генераторов изображений нужна серьёзная видеокарта хотя бы для запуска?
Потому что большие модели делают изображения лучше, верно?
NVIDIA с SANA утверждает, что это не совсем так.
Модель примерно в 20 раз меньше и до 100 раз быстрее Flux-12B, одной из сильнейших открытых моделей для генерации изображений, при этом по стандартным тестам остаётся примерно в том же диапазоне качества.
Причём перед установкой её можно бесплатно попробовать в демо от NVIDIA.
https://github.com/NVlabs/Sana
👉 @PythonPortal
Потому что большие модели делают изображения лучше, верно?
NVIDIA с SANA утверждает, что это не совсем так.
Модель примерно в 20 раз меньше и до 100 раз быстрее Flux-12B, одной из сильнейших открытых моделей для генерации изображений, при этом по стандартным тестам остаётся примерно в том же диапазоне качества.
Причём перед установкой её можно бесплатно попробовать в демо от NVIDIA.
https://github.com/NVlabs/Sana
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3🤣2
«Математические методы в науке о данных с Python» Себастьяна Роша.
https://mmids-textbook.github.io
👉 @PythonPortal
https://mmids-textbook.github.io
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥3