Local Ai
443 subscribers
895 photos
250 videos
4 files
811 links
Все про Локальные ИИ на ПК и Смартфонах - программы и модели, которые можно запустить на 96Gb VRAM. (Как сайт: https://t.me/s/ai2local )
ИИ для Здоровья: @Ai2Health
Download Telegram
This media is not supported in your browser
VIEW IN TELEGRAM
📸 Компания PrismML только что выпустила Binary and Ternary Bonsai Image 4B: 1-битные/тернарные диффузионные преобразователи текста в изображение, которые могут работать на 100 % локально в вашем браузере на WebGPU.

Команда PrismML отлично поработала над этими моделями. Их размер составляет всего ~3 ГБ (по сравнению с FLUX.2 Klein 4B, который весит ~16 ГБ). Apache-2.0!

Официальная коллекция на Hugging Face: https://huggingface.co/collections/prism-ml/bonsai-image
Ссылка на демонстрацию: https://huggingface.co/spaces/webml-community/bonsai-image-webgpu
(Обсуждение)
=============
Bonsai Image 4B — чудеса квантизации

Стартап PrismML, специализирующийся на экстремальном сжатии моделек, сделал квантизированную до одного бита FLUX.2 Klein 4B, вышло на удивление достойно. С таким уровнем квантизации Diffusion Transformer занимает всего лишь 930 мегабайт в 1-битном варианте и 1.2 гигабайта в тернарном варианте. Текстовый энкодер настолько же сильно ужать не удалось, поэтому весь комплект весит ~3.5 гига.

Такая квантизация позволяет запускать модель прямо в браузере и на телефонах, используя лишь 2 гигабайта оперативки. На генерацию 512x512 картинки на iPhone 17 Pro Max с такой моделью уходит 9.4 секунды при 4 шагах, что неплохо если учитывать факт офлоадинга. Ждём моделек побольше, для локального деплоймента.
Инференс в браузере
Веса
#PrismML #BonsaiImage4B #BonsaiImage #WebGPU #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
⚡️ Локальный механизм логического вывода DeepSeek 4 Flash для Metal и CUDA

DwarfStar — это небольшой собственный механизм логического вывода, изначально оптимизированный для DeepSeek V4 Flash, с поддержкой DeepSeek V4 PRO на компьютерах с большим объемом оперативной памяти.
Он намеренно узкоспециализированный: это не универсальный исполнитель GGUF и не оболочка для другой среды выполнения, а полностью автономная система. Помимо корректной и быстрой работы с моделью, цель проекта — обеспечить специфичную для DS4 загрузку, мгновенный рендеринг, вызов инструментов, обработку KV-состояний (в оперативной памяти и на диске), серверный API и интегрированный агент кодирования, готовый к работе с агентами кодирования или с помощью предоставленного интерфейса командной строки. Также доступны инструменты для генерации GGUF и imatrix, а также для тестирования качества и скорости.
На форуме пишут: Mac Studio M4 Max с 128 ГБ памяти. DeepSeek 4 Flash стабильно работает со скоростью 25 транзакций в секунду.
И еще: Если вы покупаете Macbook Pro M5 на 128 ГБ, вам стоит обратить внимание на https://github.com/antirez/ds4 . На мой взгляд, это самая современная система для агентских рабочих процессов на вашем устройстве. Она работает на базе Deep Seek v4 Flash, которая превосходит Qwen.

🔗 https://github.com/antirez/ds4
#DwarfStar #DS4 #DeepSeek #DeepSeekV4 #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
🌎 Dobby - Расширение Chrome для Gemini Nano

Запускайте крошечный ИИ Gemma4 (он же Gemini Nano) прямо в Chrome на ПК без графического процессора!
Расширение для Chrome, которое добавляет на боковую панель небольшого чат-помощника. Dobby полностью работает на вашем компьютере, используя встроенную в Chrome модель Gemini Nano — никаких серверов, никаких API-ключей, никаких сетевых запросов для самого чата.
Ничего особенного не требуется, кроме Google Chrome, 16 ГБ оперативной памяти и немного свободного места на диске. Никаких llama.cpp, vllm и т. д.

Расширение: https://chromewebstore.google.com/detail/dobby/ehinjcinljpggpokocmkbcaedpjdbbbe
Проект: https://github.com/herryupmay/Dobby
(Обсуждение)
#Dobby #Chrome #GeminiNano #Gemma4 #AiModel #ModelAi #LocalAi #AiLocal
🥴1
Модель: Gemma-4-Harmonia-31B-Uncensored-Heretic
Это слияние нескольких доработок gemma-4-31B-it, разработанных для целенаправленного подхода к глубокой нейронной консолидации, минимизации регрессии и расширению уникальных возможностей. KLD 0,0047 и 9/100 отказов!

Доступны как в Safetensors, так и в GGUF.
Safetensors: https://huggingface.co/llmfan46/Gemma-4-Harmonia-31B-uncensored-heretic
GGUF: https://huggingface.co/llmfan46/Gemma-4-Harmonia-31B-uncensored-heretic-GGUF
(Обсуждение)
#Gemma4 #Harmonia #Uncensored #Heretic #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Модель: LFM2.5-8B-A1B
LFM2.5 — это новое семейство гибридных моделей, разработанных для использования на устройствах. Оно основано на архитектуре LFM2 с расширенным предварительным обучением и обучением с подкреплением.

Персональный помощник на устройстве: разработан для поддержки реальных приложений, цепочек вызовов инструментов и выполнения сложных инструкций на всех устройствах.

Высокая производительность при сжатии: не уступает гораздо более крупным моделям с высокой плотностью данных и моделями с механизмом обучения на основе примеров в выполнении инструкций и агентных задач.

Непревзойденная пропускная способность: самая быстрая в своем классе модель для логического вывода на процессоре и графическом процессоре, с поддержкой llama.cpp, MLX, vLLM и SGLang с первого дня.

🔗 https://huggingface.co/LiquidAI/LFM2.5-8B-A1B-GGUF
Блог: https://www.liquid.ai/blog/lfm2-5-8b-a1b
(Обсуждение) (И еще тут)
📖 Статья: Вышел локальный ИИ-агент для смартфонов: LFM2.5-8B-A1B обходит модели вчетверо больше
🔗 https://habr.com/ru/news/1041394/
#LFM25 #LFM258BA1B #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
🤖 GhostPen — бесплатный локальный помощник для текстов

Пишите быстрее с помощью автозаполнения на основе локального ИИ!
GhostPen дописывает мысли, меняет тон и перефразирует в нужном стиле. Подходит для заметок и писем.

Бот работает на локальных моделях Gemma и Qwen. Со временем адаптируется под вашу манеру письма.
(Бесплатно для Mac · Apple Silicon)
🔗 https://ghostpen.emanuele.click
#GhostPen #Gemma #Qwen #MacOS #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Media is too big
VIEW IN TELEGRAM
PewDiePie выложил свой ИИ Odysseus в открытый доступ — это его личная замена Claude и ChatGPT.

Odysseus работает локально, умеет выполнять задачи за пользователя, искать инфу в сети, подключаться к почте, заметкам и другим приложениям.

Даже есть поддержка Deep Research!
➡️ https://github.com/pewdiepie-archdaemon/odysseus
Статья: https://habr.com/ru/companies/first/articles/1041970/
(Обсуждение) (И еще) (RCE, который запускается в один клик)
#Odysseus #AiAgent #AgentAi #AiLocal #LocalAi
Please open Telegram to view this post
VIEW IN TELEGRAM
💡 Open Models - Май 2026
Май - у нас появились модели Ring, Command, StepFun, LFM.
Скорос будет MiniMax-M3).
(Обсуждение)
#AiModel #ModelAi #LocalAi #AiLocal
Модель: Step 3.7 Flash

Step 3.7 Flash — это разреженная визуально-языковая модель Mixture-of-Experts (MoE) с 198 миллиардами параметров, которая сочетает в себе языковую основу с 196 миллиардами параметров и визуальный кодировщик с 1,8 миллиардами параметров для естественного понимания изображений. Модель разработана для высокочастотных производственных задач и активирует около 11 миллиардов параметров на токен, обеспечивая пропускную способность до 400 токенов в секунду. Step 3.7 Flash поддерживает контекстное окно размером 256К и предлагает три уровня логического вывода на выбор (низкий, средний и высокий), чтобы разработчики могли легко сбалансировать скорость, стоимость и глубину анализа.
Работает локально на 128 ГБ ОЗУ!
Step 3.7 Flash is available via our API platform (中文/EN), and you can chat with it on the Web (中文/EN) or in our App (iOS/Android).
Если у вас есть возможность установить Stepfun 3.7 Flash в оперативную память, попробуйте! По качеству изображения он близок к GLM 5.1, а по восприятию трехмерного мира — примерно на 80 % к нему.
Однако, учитывая, что его параметры составляют всего 25 % от параметров GLM 5.1 и у него есть встроенная система технического зрения, можно сказать, что на данный момент ему нет равных. (Пример генерации симулятора) и (Sonic-like platformer)

🔗 https://static.stepfun.com/blog/step-3.7-flash/
🔗 https://huggingface.co/stepfun-ai/Step-3.7-Flash
(Обсуждение)
#Step37Flash #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🖥️ Узнаем, какие ИИ-модели потянет ваш компьютер.

LLM Checker — бесплатная утилита, которая анализирует ваше железо (RAM, GPU, CPU) и подбирает из каталога в 200+ моделей подходящие под ваши задачи.
Результат ранжируется по качеству, скорости генерации, размеру и энергопотреблению!
#LLMChecker #AiLocal #LocalAi
Please open Telegram to view this post
VIEW IN TELEGRAM
Media is too big
VIEW IN TELEGRAM
🤖 Hermes Desktop от Nous Research
Агент Который растет Вместе с вами!
- Живёт повсюду
Telegram, Discord, Slack, WhatsApp, Signal, электронная почта, интерфейс командной строки — и это далеко не полный список платформ. Один агент, одна память!
- Постоянная память
Он изучает ваши проекты, автоматически генерирует навыки и никогда не забывает, как решил ту или иную проблему.
- Целенаправленная автоматизация
Планирование отчетов, резервного копирования и брифингов на основе естественного языка — выполняется автоматически через шлюз, что позволяет сосредоточиться на других задачах.
- Делегирование - Умножение задач
Изолированные субагенты с собственными диалогами, терминалами и скриптами Python RPC для конвейеров с нулевыми затратами на контекст.
- Поиск - Просмотр веб-страниц
Веб-поиск, автоматизация браузера, компьютерное зрение, генерация изображений, преобразование текста в речь и мультимодальные рассуждения.
- Изолированная песочница
Пять бэкендов — локальный, Docker, SSH, Singularity, Modal — с усилением защиты контейнеров и изоляцией пространств имен.

🔗 https://hermes-agent.nousresearch.com/desktop
Для: Mac OS, Windows, Linux (Тарифы)
(Обсуждение)
#HermesDesktop #MacOS #Windows #Linux #AiAgent #AgentAi #AiLocal #LocalAi
Please open Telegram to view this post
VIEW IN TELEGRAM
Модель: Holo3.1 35B/9B/4B/0.8B (Qwen 3.5 finetunes)
Holo3.1: быстрые агенты для локального использования на компьютере
Holo3.1
— это новейшее семейство визуально-языковых моделей (Vision-Language Models, VLM) для агентов, использующих компьютер. В отличие от Holo3, эта модель поддерживает не только автоматизацию браузеров и настольных компьютеров, но и мобильные устройства, а также нативную поддержку вызова функций для бесшовной интеграции с фреймворками агентов и локальное развертывание с помощью оптимизированных контрольных точек с квантованием.

Семейство Holo3.1 включает в себя модели с параметрами от 0,8B до 35B-A3B. Holo3.1 обеспечивает высокую производительность при использовании в компьютерах, пользовательских интерфейсах, мобильных устройствах и бизнес-процессах, повышая гибкость развертывания и экономическую эффективность.

Разработано: компанией H
Тип модели: Визуальные языковые модели для навигации и агентов по использованию компьютеров
Доступные модели: Holo3.1-0.8B, Holo3.1-4B, Holo3.1-9B, Holo3.1-35B-A3B
Базовые модели: семейство Qwen 3.5
Поддерживаемые среды: Веб, настольные, мобильные

Доступные варианты квантования для Holo3.1-35B-A3B: BF16, FP8, NVFP4, Q4 GGUF
Запись в блоге: hcompany.ai/holo3.1
Быстрый запуск: hub.hcompany.ai/quickstart
Лицензия: Лицензия Apache 2.0

🔗 https://huggingface.co/Hcompany/Holo-3.1-35B-A3B
🔗 https://huggingface.co/Hcompany/Holo-3.1-35B-A3B-GGUF
🔗 https://huggingface.co/Hcompany/Holo-3.1-9B
🔗 https://huggingface.co/Hcompany/Holo-3.1-4B
🔗 https://huggingface.co/Hcompany/Holo-3.1-0.8B
(Обсуждение)
#Holo31 #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
📝 ToolKitText чистит текст после копипаста

Бесплатный набор утилит для работы с текстом в браузере. Скопировал из PDF, Google Docs или ChatGPT — текст разъехался, переносы кривые, шрифты чужие. Закидываешь сюда, чистишь в один клик.

Что умеет:
• Считает слова, знаки, строки и время на чтение
• Fix PDF — восстанавливает абзацы после копипаста
• Strip AI Formatting — удаляет markdown-разметку и звёздочки после ChatGPT
• Убирает лишние переносы и склеивает текст
Полная очистка от скрытой разметки и чужих шрифтов

Работает локально в браузере — данные не уходят на сервер. Без регистрации, рекламы и трекеров.
🔗 https://toolkittext.com
#ToolKitText #AiText #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
🔍Интересный подход для Deep Research

Автор Dataroom не видит смысла давать эту работу дорогим моделям (в целях экономии токенов) и предлагает делить эту задачу на две фазы:

1/ Локальная модель ищет в вебе, переранжирует источники и складывает всё в структурированный .zip: папки topics/, sources/, data/, summary md и каждый факт с ссылкой на источник.

Это занимает столько времени, сколько ты задашь, ну например час.

2/ Дальше уже дорогой фронтир-агент Claude/Codex читает эти файлы и работает только по ним. Без веба.

Первый вопрос, который у меня возник — ну ладно, локальная модель (автор советует Qwen3.6-35B-A3B), но она же не стоит рядом с тем же фронтир моделями с которыми мы привыкли и как она вообще будет нормально ресёрчить?

Qwen не ресёрчит, eё работа оркестрация инструментов:
• Формулирует поисковые запросы
• Решает какие страницы читать дальше
• Понимает когда тему можно закрывать
• Записывает выжимки в markdown
• Через function calling вызывает инструменты, а не пытается их заменить

А всю работу по поиску в вебе делает Jina CLI, не LLM. Он умеет искать, вытаскивать чистый текст со страниц, ранжировать источники по релевантности и выкидывать повторы, даже если они переписаны другими словами.

Плюс цитирование зашито в сам пайплайн: каждый факт записывается с URL на первоисточник.

Eщё бонус локалки в том, что нет лимита сессий. API Claude обрывает сессию по времени и считает токены.

Qwen на твоём железе только тратит электричество и может крутиться час, два, три. Поэтому ресёрч получается долгим, но именно поэтому и тщательным.

Так что хорошая модель ≠ качественный ресёрч. Качество приходит от пайплайна, а не от мощности модели.

Есть еще Skill для агентов, чтобы они сами запускали Dataroom как API: послал запрос, подождал, скачал zip.
Веб-версия | GitHub (Источник)
#DeepResearch #Dataroom #AiAgent #AgentAi #AiLocal #LocalAi
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM