Local Ai
448 subscribers
936 photos
262 videos
4 files
828 links
Все про Локальные ИИ на ПК и Смартфонах - программы и модели, которые можно запустить на 96Gb VRAM. (Как сайт: https://t.me/s/ai2local )
ИИ для Здоровья: @Ai2Health
Download Telegram
🙂 https://localmaxxing.com/ru - все про локальные LLM!
Прогоните бенчмарки на своей локальной LLM-сборке.
Сравните её со всем миром.
Бенчмарки локального инференса LLM от сообщества.
Отслеживайте скорость, сравнивайте оборудование и находите оптимальную конфигурацию.
(Обсуждение)
=======
🔗 https://llmrequirements.com - С чего начать?
Локальное оборудование для ИИ
.
Восемь точек входа, охватывающих весь путь — от «что мне купить» до «что работает на том, что у меня уже есть». Каждая страница использует один и тот же эталонный набор данных и обновляется с той же периодичностью.
#LLM #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
📱 BigMoeOnEdge - Запустите MoE с 120B-параметрами (60 ГБ) на телефоне с 12 ГБ памяти.
Только для процессора, без потерь, на стандартном llama.cpp

Запускайте модели Mixture-of-Experts, размер которых намного превышает объем оперативной памяти вашего смартфона.

Результат: модель размером ~60 ГБ на телефоне с 12 ГБ памяти: 1,3 ток/с без потерь, идентично работе с оперативной памятью, 2,2 ток/с при использовании одной ручки регулировки скорости. Только для процессора, через публичный API llama.cpp.
Модель Mixture-of-Experts (MoE) состоит из множества небольших «экспертов», и каждый сгенерированный токен использует лишь некоторые из них. BigMoeOnEdge следует этому принципу буквально: он хранит под рукой небольшие, но всегда необходимые части модели и считывает только тех экспертов, которые нужны каждому токену, прямо из флэш-памяти в момент, когда они требуются. Остальная часть модели остается на диске. Именно поэтому большие открытые модели (Qwen3.6, Gemma, gpt-oss и большинство их аналогов) можно запускать на смартфонах, объем оперативной памяти которых в несколько раз превышает объем их собственных. Сегодня основное внимание уделяется телефонам, где с памятью сложнее всего.

Флагманский кейс: gpt-oss-120b, модель на ~60 ГБ (Q4_K_M), на телефоне с 12 ГБ оперативной памяти. Это примерно в пять раз больше, чем объем памяти, поэтому удерживать ее в оперативной памяти просто невозможно. В любом случае он работает со скоростью 1,3 токена в секунду с настройками модели (2,2 токена в секунду с одной ручкой регулировки скорости) по сравнению с 0,09 токена в секунду для того же файла, загруженного обычным способом (mmap).

🔗 https://github.com/Helldez/BigMoeOnEdge
⬇️ Скачать тут: https://github.com/Helldez/BigMoeOnEdge/releases/latest (app-dev-release.apk)

📖 Пост про создание игры "Змейка" локально на телефоне с Qwen3.6-35B-A3B на Q4_K_M,
(Всегда необходимые части остаются в оперативной памяти, а эксперты считываются из флэш-памяти. На каждый токен приходится всего несколько миллиардов параметров, так что оперативная память перестает быть ограничивающим фактором.)

🙂 Запуск Qwen 3.6 35B MoE (Q4_K_M) на Xiaomi 12 Pro (12 ГБ ОЗУ)
(Видео и Обсуждение)
#BigMoeOnEdge #App #Android #LLM #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
ℹ Модель: Gemma 4 12B OBLITERATED
⚡️ Google Gemma 4 без цензуры: нейросеть, которая не отказывает!

Энтузиасты взяли модель Google Gemma 4 и убрали из неё все ограничения. Оригинал отказывался отвечать в 98,8% спорных случаев, новая версия прошла 842 теста с нулём отказов.
Что внутри:
• Работает на обычном GPU с 8 ГБ RAM
• Весит от 4,9 ГБ в сжатом виде
• Запускается через Ollama, LM Studio, llama.cpp — даже на iPhone
• Интеллект не пострадал: MMLU-Pro показывает те же 65,7%, что и у оригинала

Технически это хирургическое вмешательство в веса модели. Разработчики удалили слои, отвечающие за отказы, но сохранили базовые способности к рассуждению.
- OBLITERATION — это метод «весовой хирургии», который устраняет отказы в работе языковых моделей путем выявления и удаления геометрических направлений в пространстве активации, которые кодируют ограничения безопасности, без переобучения.
- ASPA (Abliteration Source-Tethering with Parity Assurance)
ASPA — это новая технология, разработанная компанией OBLITERATUS, которая восстанавливает исходные возможности, утраченные при удалении отказов, путем выборочного смешения удаленных весовых коэффициентов с исходной (базовой) моделью.

🔗 https://huggingface.co/OBLITERATUS/Gemma-4-12B-OBLITERATED
(Квантования)
#Gemma4 #Gemma412B #OBLITERATION #OBLITERATED #БезЦензуры #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Статья: Как я объединил четыре Mac Studio в один компьютер с 1,5 ТБ – и запустил ИИ, который не влезает ни в одну видеокарту
https://habr.com/ru/companies/timeweb/articles/1061842/
✈️ Запуск локальной нейросети упростили до одной кнопки!

ODS автоматически проверяет железо компьютера, подбирает совместимую модель, скачивает её и запускает локальный инференс через Open WebUI.

Из одного интерфейса доступны голосовой ввод, агенты типа Hermes, RAG, поиск, генерация изображений и настройка рабочих процессов. Всё работает оффлайн — никаких подписок, данные не покидают устройство, если не захотите иначе.
🔗 https://github.com/Osmantic/ODS
💬 https://discord.gg/qGVygYada3
#ODS #OpenWebUI #LLM #MacOS #Windows #SoftAi #AiSoft #AiAgent #AgentAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
ℹ Модель: KAT-Coder-V2.5-Dev
После выхода KAT-Coder-V2.5 в июле рады представить облегченную версию KAT-Coder-V2.5-Dev, модель с общим количеством параметров 35 миллиардов и 3 миллиардами активированных параметров.
Основные особенности KAT-Coder-V2.5-Dev
- Повышение производительности. Благодаря обучению с подкреплением и обучением с учителем KAT-Coder-V2.5-Dev достигает лучших результатов в области агентного кодирования среди моделей с аналогичными масштабами параметров.

- Оптимизация аномального поведения. Благодаря обучению с подкреплением удалось значительно оптимизировать некоторые аномальные модели поведения, такие как: аномальные метки инструментов — 9 пунктов (9,34 % -> 0,28 %), непрерывное повторение в одном направлении — 0,34 пункта (0,34 % -> 0 %).

🔗 https://huggingface.co/Kwaipilot/KAT-Coder-V2.5-Dev
(Обсуждение)
============
⚡️ Тест Kat Coder 2.5 (создание игры) с помощью этой подсказки:
Create a spaceship game inspired by Star Fox using vanilla Three.js and HTML. It should have at least five levels, keyboard and mouse controls, enemies, and a fully functional gameplay system.
Результат автора удивил (На видео). Он сгенерировал по-настоящему играбельную игру с управлением кораблем, несколькими типами врагов, разнообразным оружием, боссами, прохождением уровней, интерфейсом, визуальными эффектами и довольно хорошо организованной кодовой базой — и все это в одном HTML-файле.

Kat Coder 2.5 создан на основе Qwen 3.6 35B A3B, но в ходе тестов он стабильно показывал гораздо лучшие результаты. Также протестировали его на 3D-сценах, информационных панелях и задачах, требующих сложного логического программирования, и он отлично справился со всеми ними.

Разница стала очевидной в тесте Star Fox. Ни одна из других моделей с открытым исходным кодом, которые я тестировал, не смогла реализовать эту идею должным образом. Даже такие модели, как Gemini 3.6 Flash Extended, с трудом выдавали что-то связное и действительно играбельное.

Еще более впечатляющим является то, что запускали Kat Coder 2.5 с квантованием Q4_K_M.
Код на Plunker: https://plnkr.co/plunk/Sc7yFCPPdrBWvkA7
(Обсуждение)

#KATCoderV25 #KATCoderV25Dev #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔍 HuggingHack - Перенесите Hugging Face Hub к себе домой.
Просматривайте модели в реальном времени, выбирайте, какие файлы оставить, и создайте чистую локальную библиотеку на своем ПК или сетевом хранилище.
Поиск в Live Hub с практичными метаданными, возможностью загрузки с учетом хранилища и без облачной панели управления.
🔎 Discover
Найдите каталог моделей в реальном времени и сузьте поиск по задаче, формату, локальному приложению, количеству параметров или популярности.

🎯 Точная загрузка
Храните полный репозиторий, SafeTensors, один GGUF, только метаданные или собственные шаблоны включения и исключения.

🏠 Собственная библиотека
Храните модели в обычной папке на своем диске или сетевом хранилище и самостоятельно индексируйте файлы, которые туда скопировали.

🔗 https://github.com/tyedalwaves/HuggingHack/
(Обсуждение)
#HuggingHack #HuggingFace #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
ℹ Модель Медицинская: Reasoning-Medical-27B (Qwen3.6-27B finetune)

Из описания: "Reasoning-Medical-27B предназначена для универсального применения в области профессиональной медицины, медицинской генетики, биологии/медицины в рамках университетского курса и клинических знаний. Модель была доработана на основе большого набора данных, включающего 370 000 высококачественных примеров вопросов и ответов, с использованием метода Chain-of-Thought для улучшения пошагового решения медицинских задач. Обучение проводилось с использованием тренажера GRPO с использованием метода оптимизации Unsloth для эффективной точной настройки ".

Модель Reasoning-Medical-27B показывает точность 93 % при выполнении двухэтапного теста MedQA. В той же таблице указано, что точность модели Qwen 3.6 27B составляет 84,4%, то есть разница составляет 8,6 процентных пункта.

Модель: https://huggingface.co/EpistemeAI/Reasoning-Medical-27B
Демонстрация: https://huggingface.co/spaces/EpistemeAI/reasoning-medical-27b
(Обсуждение)
#ReasoningMedical27B #Qwen36 #Medical #HealthBench #MedQA #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
ℹ Модель: POCKET работает даже на iPhone

POCKET-EN-GGUF · Английский
Карманная сборка с упором на английский язык с использованием запатентованного метода квантования — защищает критически важные для качества слои, благодаря чему качество сохраняется при размере файла в 5 ГБ. Работает на iPhone (PocketPal) и любом процессоре ПК. Без форков.
🔗 https://huggingface.co/FINAL-Bench/POCKET-EN-GGUF
🔗 Все модели: https://huggingface.co/collections/FINAL-Bench/pocket-models
(Обсуждение)
#POCKET #POCKET35B #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
ℹ Модель: Macaron-V1 на основе Qwen3.6-35B-A3B
Macaron-V1 — первая официальная версия агентной модели после Macaron-V1-Preview.
V1 доступна в двух вариантах:
- Macaron-V1-Tall: модель с 50B-параметрами, состоящая из базовой модели с 35B-параметрами и четырех специалистов LoRA с 3,7B-параметрами. Он создан на основе Qwen 3.6 и предназначен для локального развертывания.
- Macaron-V1-Venti: флагманская модель с 748B-параметрами, состоящая из базовой модели с 744B-параметрами и четырех специалистов LoRA с 1B-параметрами. Это первая модель, прошедшая постобработку на GLM-5.2.
🔗 https://huggingface.co/mindlab-research/Macaron-V1-Tall
Блог: https://macaron.im/mindlab/research/introducing-macaron-v1
(Обсуждение)
#MacaronV1 #Macaron #Qwen36 #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
ℹ Модель: Fable-Fusion: 27B для локальных AI-агентов

🔥На Hugging Face появилась Qwen3.6-27B Fable-Fusion-711 — мультимодальный fine-tune Qwen3.6 с акцентом на reasoning, tool calling и агентные сценарии. Модель выложена в GGUF с квантами под обычное железо.
Что внутри:
• ARC-C: 0.711 в 8-bit и 0.701 в 4-bit
• Контекст до 262K токенов
• Поддержка vision и tool calling
• Multi-stage fine-tune для улучшенной логики рассуждений
• GGUF-кванты от 12–17 ГБ
• Меньше отказов через Heretic/abliteration

Идея: приблизить 27B dense-модель по качеству reasoning к тяжёлым системам, оставив возможность запуска локально.

🔗 https://huggingface.co/DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF
#Qwen36 #Uncensored #Heretic #БезЦензуры #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
🎙 Не пиши голосовое!
Бесплатное приложение для Android, которое записывает голосовые заметки и превращает их в текст прямо на телефоне. Без облака, без аккаунтов, без интернета = без блокировок.

Зажал кнопку, наговорил, получил расшифровку. Работает в самолёте, в метро, на даче без связи: распознавание речи запускается локально, на устройстве. Звук никуда не уходит.
Под капотом модель GigaAM v3 от Сбера, заточенная под русский язык. Записи и транскрипты хранятся только у вас на телефоне. Удалил приложение — удалил всё.

Что умеет:
• Диктофон с расшифровкой голоса в текст
• Транскрибация голосовых заметок на русском, офлайн
• Тёмная и светлая темы
• Редактирование транскрипта, копирование, шеринг в любой мессенджер

Как пользоваться:
• Запись. Зажмите кнопку микрофона, наговорите, отпустите — получите текст.
• Чужое аудио. Загрузите файл с телефона или перешлите голосовое через «Поделиться» из мессенджера, если он умеет делиться аудиофайлом.
• Удаление. Смахните запись влево, выедет красная кнопка «Удалить».
• Текст. Правьте, копируйте, отправляйте в любой мессенджер.

🔗 https://www.rustore.ru/catalog/app/com.baslie.negolosom
#GigaAM #GigaAMv3 #Транскрибация #Android #App #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
💩1
ℹ Модель: OpenMed 2.0 - деидентификация
Модель 279M выполняет многоязычную деидентификацию персональных медицинских данных в автономном режиме.
Превратите клинический текст в структурированную обезличенную аналитическую информацию без необходимости загружать данные.
OpenMed извлекает биомедицинские сущности и удаляет более 55 типов персональных медицинских данных непосредственно на оборудовании, которое вы контролируете, поэтому ваши данные никогда не покидают устройство. Те же более 2000 открытых моделей работают на всех устройствах — от телефона до сервера с графическим процессором — в полностью автономном режиме: iOS, iPadOS и Android через OpenMedKit, React Native, обычные процессоры, Apple Silicon, графические процессоры NVIDIA, браузер и сервисы REST/gRPC. Никакого облака. Никакой привязки к поставщику. Данные пациентов не покидают вашу сеть.

🔗 https://openmed.life
🔗 https://github.com/maziyarpanahi/openmed
(Обсуждение)
#OpenMed #OpenMed2 #PII #ПерсональныеДанные #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM