Расчет по VRAM для более менее полноценных моделей LLM
Конфигурации для DeepSeek R1 671B
Минимум (с квантизацией Q4/AWQ):
8× H100 80ГБ = 640 ГБ суммарно → 671B в AWQ Q4 (~400 ГБ весов) влезает
Скорость: ~33 tok/s при одном пользователе, ~600 output tok/s при 100 concurrent users
Комфортный вариант (FP8 native):
8× H200 141ГБ = 1128 ГБ → 671B FP8 (~750 ГБ) с запасом на KV cache
Скорость: ~821 output tok/s (vLLM benchmark)
Альтернатива без GPU (экзотика):
Сервер с 768+ ГБ DDR5 RAM + llama.cpp → 671B Q2 работает, но ~1–2 tok/s
@DevsRoot
Конфигурации для DeepSeek R1 671B
Минимум (с квантизацией Q4/AWQ):
8× H100 80ГБ = 640 ГБ суммарно → 671B в AWQ Q4 (~400 ГБ весов) влезает
Скорость: ~33 tok/s при одном пользователе, ~600 output tok/s при 100 concurrent users
Комфортный вариант (FP8 native):
8× H200 141ГБ = 1128 ГБ → 671B FP8 (~750 ГБ) с запасом на KV cache
Скорость: ~821 output tok/s (vLLM benchmark)
Альтернатива без GPU (экзотика):
Сервер с 768+ ГБ DDR5 RAM + llama.cpp → 671B Q2 работает, но ~1–2 tok/s
@DevsRoot
🤣1
AI-модель запечена прямо в кремний
🚀 Taalas HC1: революционный чип, где ИИ-модель "выжжена" в кремнии как татуировка! Полный разбор ТТХ для всех
Мир ИИ меняется на глазах. Обычно модели типа Llama (как мини-ChatGPT) требуют огромных видеокарт NVIDIA — они жрут электричество как слоны, стоят бешеные бабки и греются как печки. А startup Taalas (основан экс-CEO Tenstorrent Ljubisa Bajic с командой) придумали гениальный хак: Direct-to-Silicon. Берут модель Llama 3.1 8B (8 млрд параметров — "нейронов"), кодируют её веса прямо в транзисторы чипа! Никакой внешней памяти (HBM или DDR) — всё внутри, как мозг в черепе. Это HC1 — первое поколение.
Технические характеристики от вендора (просто и по делу):
Процесс: TSMC 6 нм — супер-миниатюрные транзисторы, чип компактный.
Размер: 815 мм² (примерно 28x29 мм — как ноготь большого пальца, но мощнее сервера!).
Транзисторы: 53 миллиарда — большинство для "памяти" модели (ROM) + SRAM для динамики (кэш, тюнинг).
Энергия: 200 Вт TDP (на всю карту; чип сам энергоэффективен — модель "не ищет" данные, они уже на месте).
Скорость инференса: 14 357–17 000 токенов/сек (токен ~ слово). Пример: подробная история WWII за 0.138 сек! На RTX 3090 — ~1700 т/с, на H100 — 1500–2000. В 10 раз быстрее!
Производство: в 20 раз дешевле GPU (нет дорогой HBM, упрощённая упаковка; финальная кастомизация на 2 металлических слоях).
Гибкость: ASIC (заточен под Llama 8B), но с LoRA-адаптерами (маленькие "патчи" для доработки — добавь стиль, знания). Меняй контекстное окно (сколько помнит чат).
Демо на https://chatjimmy.ai/ — бесплатно, API тоже! Ответы мгновенные, скролл не поспевает. Реальное железо, не слайды инвесторов.
Весна 2026: Средняя модель (типа 70B) с улучшенным reasoning (логикой).
Зима 2026: Frontier-модель (супер-мощная) на 2-м поколении чипа (ещё быстрее/дешевле).
Это прорыв для edge-AI: ИИ в смартфонах, машинах, дронах, IoT без облака. Дешёвый, тихий, автономный. Представьте: твой Unity-игрушка с локальным ИИ за копейки! Голова кругом — ждём массовку?
Что думаете: купите такой чип или ждём Llama 405B-версию?
Анонс: https://taalas.com/the-path-to-ubiquitous-ai/
Демо/API: https://chatjimmy.ai/
@DevsRoot
#AI #Taalas #HC1 #Инференс #Чипы #Неросети #Моё
🚀 Taalas HC1: революционный чип, где ИИ-модель "выжжена" в кремнии как татуировка! Полный разбор ТТХ для всех
Мир ИИ меняется на глазах. Обычно модели типа Llama (как мини-ChatGPT) требуют огромных видеокарт NVIDIA — они жрут электричество как слоны, стоят бешеные бабки и греются как печки. А startup Taalas (основан экс-CEO Tenstorrent Ljubisa Bajic с командой) придумали гениальный хак: Direct-to-Silicon. Берут модель Llama 3.1 8B (8 млрд параметров — "нейронов"), кодируют её веса прямо в транзисторы чипа! Никакой внешней памяти (HBM или DDR) — всё внутри, как мозг в черепе. Это HC1 — первое поколение.
Технические характеристики от вендора (просто и по делу):
Процесс: TSMC 6 нм — супер-миниатюрные транзисторы, чип компактный.
Размер: 815 мм² (примерно 28x29 мм — как ноготь большого пальца, но мощнее сервера!).
Транзисторы: 53 миллиарда — большинство для "памяти" модели (ROM) + SRAM для динамики (кэш, тюнинг).
Энергия: 200 Вт TDP (на всю карту; чип сам энергоэффективен — модель "не ищет" данные, они уже на месте).
Скорость инференса: 14 357–17 000 токенов/сек (токен ~ слово). Пример: подробная история WWII за 0.138 сек! На RTX 3090 — ~1700 т/с, на H100 — 1500–2000. В 10 раз быстрее!
Производство: в 20 раз дешевле GPU (нет дорогой HBM, упрощённая упаковка; финальная кастомизация на 2 металлических слоях).
Гибкость: ASIC (заточен под Llama 8B), но с LoRA-адаптерами (маленькие "патчи" для доработки — добавь стиль, знания). Меняй контекстное окно (сколько помнит чат).
Демо на https://chatjimmy.ai/ — бесплатно, API тоже! Ответы мгновенные, скролл не поспевает. Реальное железо, не слайды инвесторов.
Весна 2026: Средняя модель (типа 70B) с улучшенным reasoning (логикой).
Зима 2026: Frontier-модель (супер-мощная) на 2-м поколении чипа (ещё быстрее/дешевле).
Это прорыв для edge-AI: ИИ в смартфонах, машинах, дронах, IoT без облака. Дешёвый, тихий, автономный. Представьте: твой Unity-игрушка с локальным ИИ за копейки! Голова кругом — ждём массовку?
Что думаете: купите такой чип или ждём Llama 405B-версию?
Анонс: https://taalas.com/the-path-to-ubiquitous-ai/
Демо/API: https://chatjimmy.ai/
@DevsRoot
#AI #Taalas #HC1 #Инференс #Чипы #Неросети #Моё
🔥1🤔1
Гугл внедрила LLM в свой хром.
https://developer.chrome.com/docs/ai/built-in?hl=ru
То есть 4гб llm модель будет крутиться на вашем устройстве. Хром будет теперь не только память жрать, но и проц с видюхой.
Что это даст?
Сайтам не нужно использовать сторонние модели по апи, могут обращаться к llm браузера. Быстрый перевод, самаризация, подсказки по сайту.
Учитывая что это только в хроме пока, то вряд ли какие сайты будут сейчас это использовать.
Имхо на данный момент штука бесполезная. В будущем дополнительная головная боль разработчикам сайтов.
В отдалённом будущем может и приживётся.
Как отключить и освободить место:
— введите в адресной строке chrome://flags/
— найдите параметры Optimization Guide On Device Model и Prompt API и отключите их
— перейдите по пути AppData/Local/Google/Chrome/User Data/OptGuideOnDeviceModel
— удалите файл weights.bin
После удаления рекомендуется перезапустить браузер.
@DevsRoot
https://developer.chrome.com/docs/ai/built-in?hl=ru
То есть 4гб llm модель будет крутиться на вашем устройстве. Хром будет теперь не только память жрать, но и проц с видюхой.
Что это даст?
Сайтам не нужно использовать сторонние модели по апи, могут обращаться к llm браузера. Быстрый перевод, самаризация, подсказки по сайту.
Учитывая что это только в хроме пока, то вряд ли какие сайты будут сейчас это использовать.
Имхо на данный момент штука бесполезная. В будущем дополнительная головная боль разработчикам сайтов.
В отдалённом будущем может и приживётся.
Как отключить и освободить место:
— введите в адресной строке chrome://flags/
— найдите параметры Optimization Guide On Device Model и Prompt API и отключите их
— перейдите по пути AppData/Local/Google/Chrome/User Data/OptGuideOnDeviceModel
— удалите файл weights.bin
После удаления рекомендуется перезапустить браузер.
@DevsRoot
Как же ИИ облегчает работу дизайнерам игроделам. Это конечно бомба.
В примере у меня локально ComphyUI крутится панорамки для Unity Приложения генерит
@DevsRoot
В примере у меня локально ComphyUI крутится панорамки для Unity Приложения генерит
@DevsRoot
Forwarded from Ряды Фурье
Тут внезапно вышла работа про то, как делать точную 3D-печать крупных сложных объектов меньше, чем за секунду.
Если очень коротко, то вам нужно:
— Взять ведро
— Залить туда светочувствительный полимер
— Посветить туда фонариком через голографическую маску
— Научиться светить в ведро с жидким фотополимером с разных сторон, чтобы где лучи пересекаются, жидкость затвердевала
— Выкинуть ведро получившейся херни и заморочиться на очень точный подбор параметров света, собрать проектор и довести идею до инженерной реализации за пару лет. Через такую задницу, что вам даже не снилось.
— Повторить уже нормально и опубликоваться в журнале Природа с корабликом и солдатиком.
Солдатик на картинках выше.
Ну а товарищи 王旭康, 马远瞩, 牛一涵, 熊博, 张安科, 张国勋, 陈一帆, 魏威), 方璐, 吴嘉敏 и с примкнувшим к ним 戴琼海, похоже, взяли ещё один святой грааль — теперь мгновенную объёмную печать. Такими темпами взятия суперачивок в прикладной науке граалей на всех не напасёшься.
Известные проблемы:
— Самый старый метод работает примерно как компьютерная томография, только это синтеграфия — вместо нарезки там сборка. Если взять КТ-сканы и отдать на принтер, можно напечатать пациента послойно. Метод медленный и кривой, как и всё медленное и послойное.
— В методах с вёдрами, чтобы просветить ведро со всех сторон, сейчас обычно вращают саму ёмоксть с жидкостью. Это её взбалтывает. Тоже вопрос, нельзя ли наоборот, вращать источник.
— Деталь за время затвердевания может начать тонуть, поэтому надо было использовать очень густые гели типа мёда, чтобы удерживать фигуру. Это неудобно, особенно для медицины — клетки в густом геле живут хуже.
— Потом проблемы с линзами — высокая детализация означает, что у линз будет маленькая глубина резкости, пострадает точность.
Что сделали эти типы:
— Ведро неподвижно; вращается проектор, делает 10 оборотов в секунду.
— Лазерный луч формируется специальным чипом с микрозеркалами, который создает картинку.
— Они используют лазер и софт, который считает, как именно нужно исказить картинку на микрозеркалах, чтобы при прохождении через линзу и жидкость свет собрался в четкую структуру не только в центре, но и на глубине всего объекта (около 1 см). Это работает как голограмма.
— На такой скорости больше не нужны густые гели, можно в вязкости как у воды.
Звучит несколько безумно, да, но они напечатали сложную 3D-модель всего за 0,6 секунды. Воксель около 0,019 мм по всему объему объекта глубиной 1 см. Самая тонкая отдельная деталь, которую смогли напечатать — 11–12 микрометров толщиной. Это в 20 раз лучше по глубине резкости, чем даёт традиционная линза.
Дальше они напечатали всякие кораблики из тестов, медицинские модели, куски сосудов, тканевые каркасы и прочее. Сделали серийную установку — наливаем, бахаем, вымываем деталь, доливаем гель, самокалибруемся, бахаем... На текущей установке метод работает только для объектов около 1 см. Морской катамаран печатайте, пожалуйста, традиционными способами за пару месяцев.
Детали очень сложно и долго считать, и если они у вас разные, то узким местом может стать время подготовки шаблона действий для проектора. Нужна сверхточная электроника и механика, это дофига дорого.
Из-за того, что свет падает под углом, область печати похожа на два конуса, соединенных основаниями в веретено. Это ограничивает геометрию деталей.
Но у нас, кажется, есть первый промышленный репликатор — так что из киберпанка мы постепенно переезжаем в нормальную хардкорную научную фантастику!
Посмотрите первое видео, первые 5-6 секунд люто впечатляют.
--
Вступайте в ряды Фурье! | Самые быстрые посты
— Милая, помнишь, ты говорила, что я дарю тебе мало мягких зверюшек? Вот.
— Ааааа! Мёртвая крыса!
— Но я переломал ей кости, она мягкая!
Если очень коротко, то вам нужно:
— Взять ведро
— Залить туда светочувствительный полимер
— Посветить туда фонариком через голографическую маску
— Научиться светить в ведро с жидким фотополимером с разных сторон, чтобы где лучи пересекаются, жидкость затвердевала
— Выкинуть ведро получившейся херни и заморочиться на очень точный подбор параметров света, собрать проектор и довести идею до инженерной реализации за пару лет. Через такую задницу, что вам даже не снилось.
— Повторить уже нормально и опубликоваться в журнале Природа с корабликом и солдатиком.
Солдатик на картинках выше.
Ну а товарищи 王旭康, 马远瞩, 牛一涵, 熊博, 张安科, 张国勋, 陈一帆, 魏威), 方璐, 吴嘉敏 и с примкнувшим к ним 戴琼海, похоже, взяли ещё один святой грааль — теперь мгновенную объёмную печать. Такими темпами взятия суперачивок в прикладной науке граалей на всех не напасёшься.
Известные проблемы:
— Самый старый метод работает примерно как компьютерная томография, только это синтеграфия — вместо нарезки там сборка. Если взять КТ-сканы и отдать на принтер, можно напечатать пациента послойно. Метод медленный и кривой, как и всё медленное и послойное.
— В методах с вёдрами, чтобы просветить ведро со всех сторон, сейчас обычно вращают саму ёмоксть с жидкостью. Это её взбалтывает. Тоже вопрос, нельзя ли наоборот, вращать источник.
— Деталь за время затвердевания может начать тонуть, поэтому надо было использовать очень густые гели типа мёда, чтобы удерживать фигуру. Это неудобно, особенно для медицины — клетки в густом геле живут хуже.
— Потом проблемы с линзами — высокая детализация означает, что у линз будет маленькая глубина резкости, пострадает точность.
Что сделали эти типы:
— Ведро неподвижно; вращается проектор, делает 10 оборотов в секунду.
— Лазерный луч формируется специальным чипом с микрозеркалами, который создает картинку.
— Они используют лазер и софт, который считает, как именно нужно исказить картинку на микрозеркалах, чтобы при прохождении через линзу и жидкость свет собрался в четкую структуру не только в центре, но и на глубине всего объекта (около 1 см). Это работает как голограмма.
— На такой скорости больше не нужны густые гели, можно в вязкости как у воды.
Звучит несколько безумно, да, но они напечатали сложную 3D-модель всего за 0,6 секунды. Воксель около 0,019 мм по всему объему объекта глубиной 1 см. Самая тонкая отдельная деталь, которую смогли напечатать — 11–12 микрометров толщиной. Это в 20 раз лучше по глубине резкости, чем даёт традиционная линза.
Дальше они напечатали всякие кораблики из тестов, медицинские модели, куски сосудов, тканевые каркасы и прочее. Сделали серийную установку — наливаем, бахаем, вымываем деталь, доливаем гель, самокалибруемся, бахаем... На текущей установке метод работает только для объектов около 1 см. Морской катамаран печатайте, пожалуйста, традиционными способами за пару месяцев.
Детали очень сложно и долго считать, и если они у вас разные, то узким местом может стать время подготовки шаблона действий для проектора. Нужна сверхточная электроника и механика, это дофига дорого.
Из-за того, что свет падает под углом, область печати похожа на два конуса, соединенных основаниями в веретено. Это ограничивает геометрию деталей.
Но у нас, кажется, есть первый промышленный репликатор — так что из киберпанка мы постепенно переезжаем в нормальную хардкорную научную фантастику!
Посмотрите первое видео, первые 5-6 секунд люто впечатляют.
--
Вступайте в ряды Фурье! | Самые быстрые посты
— Ааааа! Мёртвая крыса!
— Но я переломал ей кости, она мягкая!
❤2
Бесконечный Цикл
Сервис MELLOW
Писал уже про Сервис MELLOW.
Вывод зарубежных доходов в рубли.
С 12 января лавочка с выводом на сбер прикрылась, однако список банков не под санкциями еще большой, я выбрал Райф.
Вон что прислали. Молодцы.
И разница курса у них немного улучшилась, сейчас за $ 75,1925руб.
В общем кому требуется получать оплату из-за рубежа, рекомендую.
@DevsRoot
Вывод зарубежных доходов в рубли.
С 12 января лавочка с выводом на сбер прикрылась, однако список банков не под санкциями еще большой, я выбрал Райф.
Вон что прислали. Молодцы.
И разница курса у них немного улучшилась, сейчас за $ 75,1925руб.
В общем кому требуется получать оплату из-за рубежа, рекомендую.
@DevsRoot
❤2👍1
CoPaw VS OpenClaw
Вот честно не могу придумать зачем мне это нужно, но как же их много плодится.
Alibaba выпустила CoPaw - открытый фреймворк для создания персональных ИИ-агентов, позиционируемый как альтернатива OpenClaw. Проект основан на AgentScope, лицензирован под Apache 2.0 и уже набрал тысячи звезд на GitHub (более 5k по свежим данным).
CoPaw — это полноценная рабочая станция для ИИ-ассистента, которую можно запустить локально или в облаке. Установка простая: pip install copaw, затем copaw init и запуск на localhost:8088 с веб-консолью на TypeScript. Поддерживается Docker (docker run agentscope/copaw:latest) и one-click деплой в Alibaba Cloud или ModelScope Studio.
Из коробки интегрируются мессенджеры: Telegram, Discord, DingTalk, Feishu (Lark), QQ, iMessage и кастомные каналы через CLI. Агент работает везде, где общаетесь пользователь, с надежной очередью сообщений и hot-reload конфигов.
Модели гибкие: нативно Qwen от Alibaba, плюс API от OpenAI, Claude, Grok, Anthropic; локально — Ollama, llama.cpp (кросс-платформа), MLX для Apple Silicon. Нет привязки к облаку, полная приватность данных.
Ключевые фичи: ReMe для долгосрочной памяти (запоминает предпочтения, дела), контроль браузера, работа с файлами/документами, skills по спецификации anthropics/skills (автозагрузка из директории, как ClawHub). Heartbeat - агент сам активируется по cron-расписанию для фоновых задач: дайджесты новостей, мониторинг, отчеты.
Архитектура модульная: ReAct-цикл с хуками (компакция контекста по токенам 80%, детекция петель), инструменты (shell, edit_file, search, browser). Skills расширяемы Python-функциями без правки кода. Поддержка multi-agent и автоматизации.
Alibaba позиционирует CoPaw как хаб: комбинируйте западные модели, community-skills, деплоите куда угодно. Не клон, а экосистема для dev'ов - от локального ПК до VPS. Roadmap: мультимодал (голос/видео), коллаборация large-small моделей.
GitHub:
https://github.com/agentscope-ai/CoPaw
Доки:
https://copaw.agentscope.io или copaw.bot.
Наверное подойдет для разработчиков в AI-агентах, приватности и автоматизации, а также всяким гикам.
Лет 20 назад хотелось мне голосом компом управлять, а сейчас не. Только сам)
@DevsRoot
#AI #Нейросети #Моё
Вот честно не могу придумать зачем мне это нужно, но как же их много плодится.
Alibaba выпустила CoPaw - открытый фреймворк для создания персональных ИИ-агентов, позиционируемый как альтернатива OpenClaw. Проект основан на AgentScope, лицензирован под Apache 2.0 и уже набрал тысячи звезд на GitHub (более 5k по свежим данным).
CoPaw — это полноценная рабочая станция для ИИ-ассистента, которую можно запустить локально или в облаке. Установка простая: pip install copaw, затем copaw init и запуск на localhost:8088 с веб-консолью на TypeScript. Поддерживается Docker (docker run agentscope/copaw:latest) и one-click деплой в Alibaba Cloud или ModelScope Studio.
Из коробки интегрируются мессенджеры: Telegram, Discord, DingTalk, Feishu (Lark), QQ, iMessage и кастомные каналы через CLI. Агент работает везде, где общаетесь пользователь, с надежной очередью сообщений и hot-reload конфигов.
Модели гибкие: нативно Qwen от Alibaba, плюс API от OpenAI, Claude, Grok, Anthropic; локально — Ollama, llama.cpp (кросс-платформа), MLX для Apple Silicon. Нет привязки к облаку, полная приватность данных.
Ключевые фичи: ReMe для долгосрочной памяти (запоминает предпочтения, дела), контроль браузера, работа с файлами/документами, skills по спецификации anthropics/skills (автозагрузка из директории, как ClawHub). Heartbeat - агент сам активируется по cron-расписанию для фоновых задач: дайджесты новостей, мониторинг, отчеты.
Архитектура модульная: ReAct-цикл с хуками (компакция контекста по токенам 80%, детекция петель), инструменты (shell, edit_file, search, browser). Skills расширяемы Python-функциями без правки кода. Поддержка multi-agent и автоматизации.
Alibaba позиционирует CoPaw как хаб: комбинируйте западные модели, community-skills, деплоите куда угодно. Не клон, а экосистема для dev'ов - от локального ПК до VPS. Roadmap: мультимодал (голос/видео), коллаборация large-small моделей.
GitHub:
https://github.com/agentscope-ai/CoPaw
Доки:
https://copaw.agentscope.io или copaw.bot.
Наверное подойдет для разработчиков в AI-агентах, приватности и автоматизации, а также всяким гикам.
Лет 20 назад хотелось мне голосом компом управлять, а сейчас не. Только сам)
@DevsRoot
#AI #Нейросети #Моё
GitHub
GitHub - agentscope-ai/QwenPaw at www.weiqimai.com
Your Personal AI Assistant; easy to install, deploy on your own machine or on the cloud; supports multiple chat apps with easily extensible capabilities. - agentscope-ai/QwenPaw
👍1
Испытал эффект зловещей долины (наверное это он), когда опус с чего-то решил меня называть по имени.
Аж прямо покоробило всего.
Имя мое он походу вытащил из переписок, которые саммаризировал и переводил.
Строго запретил такое фамильярство и сказал запомнить, что я просто Хозяин🤣
@DevsRoot
Аж прямо покоробило всего.
Имя мое он походу вытащил из переписок, которые саммаризировал и переводил.
Строго запретил такое фамильярство и сказал запомнить, что я просто Хозяин
@DevsRoot
Please open Telegram to view this post
VIEW IN TELEGRAM
😁3🤣2🤪1
оффлайн-голосовой ввод для любой ОС
Решение для снижения нагрузки на запястья при длительной печати — open-source инструмент Epicenter Whispering. Работает на системном уровне: распознаёт речь локально, вставляет текст в активное поле любой программы (мессенджеры, IDE, браузеры). Горячая клавиша (Ctrl+Shift+;) — зажать, говорить, отпустить. Преимущества: оффлайн-приватность, нет лимитов, нет зависимости от браузера/интернета.
Технические детали:
Архитектура: Electron-приложение с VAD (Voice Activity Detection) на базе Silero VAD для точного срабатывания без кнопки. Транскрипция — NVIDIA NeMo Parakeet (TDT 0.6B v3 INT8, 670 МБ). Автоопределение 100+ языков, точность ~95% на чистой речи (WER <5% для русского/английского).
LLM-фильтр: Интеграция с локальными/облачными LLM (Ollama, Groq, OpenAI). Промпт на лету корректирует текст: из "грубой" речи делает вежливую, форматирует код/списки. Задержка <2 сек на RTX 30xx.
Вывод: Прямая вставка (эмуляция клавиш, авто-Enter), буфер обмена или API. Поддержка GPU (CUDA/Metal) для ускорения.
Производительность: На CPU (i5+8GB RAM) — 1x RT; на GPU — до 5x RT. Размер: <1 ГБ после установки.
Что это даёт:
Эффективность: Скорость набора 150+ слов/мин vs 40-60 клавиатурой. Экономия времени на 30-50% в чатах/кодинге.
Приватность: Нет отправки аудио на серверы (в отличие от Google Voice/Whisper API).
Гибкость: Работает в VS Code, Telegram — с любом окне, где курсор. LLM-фильтр автоматизирует правку (идеально для разработчиков/контент-мейкеров).
По сравнению с альтернативами: Voice In/Brain.in — браузерные, глючные, с лимитами; Whisper.cpp — консольный, без GUI/фильтров. Здесь — полноценный GUI с оффлайн-ИИ.
Установка:
GitHub: https://github.com/EpicenterHQ/epicenter/tree/main/apps/whispering (Releases).
Установка → Settings → Transcription → Parakeet (Local) → Модель INT8 → Activated.
Тестируйте на GPU для max скорости.
@DevsRoot
#AI #Нейросети
Решение для снижения нагрузки на запястья при длительной печати — open-source инструмент Epicenter Whispering. Работает на системном уровне: распознаёт речь локально, вставляет текст в активное поле любой программы (мессенджеры, IDE, браузеры). Горячая клавиша (Ctrl+Shift+;) — зажать, говорить, отпустить. Преимущества: оффлайн-приватность, нет лимитов, нет зависимости от браузера/интернета.
Технические детали:
Архитектура: Electron-приложение с VAD (Voice Activity Detection) на базе Silero VAD для точного срабатывания без кнопки. Транскрипция — NVIDIA NeMo Parakeet (TDT 0.6B v3 INT8, 670 МБ). Автоопределение 100+ языков, точность ~95% на чистой речи (WER <5% для русского/английского).
LLM-фильтр: Интеграция с локальными/облачными LLM (Ollama, Groq, OpenAI). Промпт на лету корректирует текст: из "грубой" речи делает вежливую, форматирует код/списки. Задержка <2 сек на RTX 30xx.
Вывод: Прямая вставка (эмуляция клавиш, авто-Enter), буфер обмена или API. Поддержка GPU (CUDA/Metal) для ускорения.
Производительность: На CPU (i5+8GB RAM) — 1x RT; на GPU — до 5x RT. Размер: <1 ГБ после установки.
Что это даёт:
Эффективность: Скорость набора 150+ слов/мин vs 40-60 клавиатурой. Экономия времени на 30-50% в чатах/кодинге.
Приватность: Нет отправки аудио на серверы (в отличие от Google Voice/Whisper API).
Гибкость: Работает в VS Code, Telegram — с любом окне, где курсор. LLM-фильтр автоматизирует правку (идеально для разработчиков/контент-мейкеров).
По сравнению с альтернативами: Voice In/Brain.in — браузерные, глючные, с лимитами; Whisper.cpp — консольный, без GUI/фильтров. Здесь — полноценный GUI с оффлайн-ИИ.
Установка:
GitHub: https://github.com/EpicenterHQ/epicenter/tree/main/apps/whispering (Releases).
Установка → Settings → Transcription → Parakeet (Local) → Модель INT8 → Activated.
Тестируйте на GPU для max скорости.
@DevsRoot
#AI #Нейросети
GitHub
epicenter/apps/whispering at main · EpicenterHQ/epicenter
Open-source, local-first apps. Contribute to EpicenterHQ/epicenter development by creating an account on GitHub.
🔥2🤔1