Local Ai
449 subscribers
927 photos
262 videos
4 files
822 links
Все про Локальные ИИ на ПК и Смартфонах - программы и модели, которые можно запустить на 96Gb VRAM. (Как сайт: https://t.me/s/ai2local )
ИИ для Здоровья: @Ai2Health
Download Telegram
ℹ Модель: Nemotron-3-Embed 1B/8B

Nemotron-3-Embed-8B-BF16 — это универсальная модель встраивания текста, обученная компанией NVIDIA и оптимизированная для задач поиска и определения семантического сходства. Она обеспечивает широкие возможности многоязычного и межъязыкового поиска и предназначена для использования в качестве базового компонента в системах генерации с расширенным поиском (Retrieval-Augmented Generation, RAG). Эта модель была протестирована на 34 языках: английском, арабском, ассамском, бенгальском, болгарском, китайском, датском, голландском, финском, французском, немецком, хинди, хинглише, индонезийском, итальянском, японском, корейском, малайском, маратхи, непальском, норвежском, персидском, португальском, румынском, русском, испанском, суахили, шведском, тамильском, телугу, тайском, украинском, урду, вьетнамском.

Модель генерирует плотные векторные эмбеддинги на основе многоязычных текстовых данных, что позволяет осуществлять поиск, семантический поиск и (агентные) рабочие процессы RAG. Являясь ключевым компонентом систем текстового поиска, модель эмбеддинга преобразует текст, например вопросы или отрывки, в плотные векторные представления. Такие модели обычно представляют собой кодировщики-трансформеры, которые обрабатывают входные токены и создают эмбеддинги, подходящие для эффективного сопоставления по сходству.

Nemotron-3-Embed-8B-BF16 демонстрирует самые высокие показатели в многоязычной таблице лидеров RTEB по состоянию на XX июля 2026 года.
Эта модель готова к коммерческому использованию.

🔗 https://huggingface.co/nvidia/Nemotron-3-Embed-8B-BF16
🔗 https://huggingface.co/nvidia/Nemotron-3-Embed-1B-BF16
(Обсуждение)
#Nemotron3 #Nemotron3Embed #Embed #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
ℹ Модель: Bonsai 27B для смартфона и ПК!

🔥 Вышла самая мощная в истории локальная LLM, которая запускается прямо на смартфоне — Bonsai 27B имеет 27 миллиардов (!) параметров и весит меньше 4 ГБ.

→ В основе — сжатая с помощью квантизации Qwen3.6 27B.
→ Ternary-Bonsai 27B Q4_1 весит 1.95 GB, BF16 = 7.29 GB (Скачать)
→ 1-битная версия на 3,8 ГБ работает со скоростью 11 токенов/с на iPhone 17 Pro. Q1_0 = 3.8 GB, Q4_1 = 1.79 GB, BF16 = 7.29 GB (скачать)
→ Версия на 5,9 ГБ сохраняет 95% качества оригинальной Qwen3.6 27B.
(Ternary-Bonsai-27B — это ternary (1.58–1.71 бита на вес) версия, а Bonsai-27B — 1-bit (binary, ~1.125 бита на вес) версия одной и той же базовой модели (Qwen3.6-27B)
- Ternary лучше сохраняет интеллект (особенно reasoning, math, coding, agentic behavior). Она заметно превосходит обычные 2-битные квантизации (типа IQ2_XXS), которые сильно деградируют.
- 1-bit — самая агрессивная компрессия, подходит для устройств с очень жёсткими ограничениями памяти (например, iPhone 17 Pro Max).

Модель поддерживает всё — мультимодальность, ризонинг, кодинг, вызов тулз и агентные сценарии. Это не просто локальный чат с нейронкой, а фундамент для локальных ИИ-агентов.
🔗 Все версии: https://huggingface.co/collections/prism-ml/bonsai-27b
Демо: https://github.com/PrismML-Eng/Bonsai-demo
(Как запустить Prism Bonsai 27B)

🌳 Bonsai 27B WebGPU https://huggingface.co/spaces/webml-community/bonsai-webgpu-kernels - запуск прямо в браузере!
🌐 Run a 1-bit 27B LLM locally in your browser on WebGPU (Обсуждение)

📱 Ternary-Bonsai 8B и 27B уже есть в Locally AI на iOS

(Обсуждение 1) (Обсуждение 2)
#Bonsai #Bonsai27B #Qwen36 #WebGPU #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥3🤯1
This media is not supported in your browser
VIEW IN TELEGRAM
🔈 audio.cpp
✔️ В версии 0.3 добавлены 5 новых моделей: Supertonic 3, MOSS-TTS-Local, MOSS-TTS-Nano, IndexTTS2 и Irodori-TTS.

Поддерживает синтез речи, преобразование текста в речь, генерацию аудио, преобразование голоса, создание музыки и многое другое с высокой степенью оптимизации производительности. Не зависит от Python.
10 часов аудио, сгенерированного за 3 минуты на RTX 5090 (демо включено)! Выпущены Supertonic 3, MOSS-TTS, IndexTTS2 и Irodori-TTS на основе C++/GGML
🔗 https://github.com/0xShug0/audio.cpp
(Обсуждение)

✔️ Выпуск 0.6: dots.tts, MiniMax-H3 text2audio (до 3 раз быстрее реального времени), MiniMax-Music3 (превью) и другие новые аудиомодели. В комплекте более 5 демонстрационных версий.
(Обсуждение и Подробнее)

Про ✔ Версия 0.7 https://t.me/Ai2Local/1078
#audiocpp #audio #AiAudio #Supertonic #TTS #MOSSTTS #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
✨ Google обновляет шаблоны чата Gemma 4, внося существенные исправления в вызов инструментов и уменьшая «ленивость», а также внедряет Flash Attention 4 на графических процессорах Hopper и интерактивное руководство по работе с системой и улучшению ее возможностей!
Пост: https://x.com/googlegemma/status/2077449152062247219
🔗 https://huggingface.co/spaces/google/gemma4_vision_token_budget
(Обсуждение)
🔧 Google обновила Gemma 4 после фидбека сообщества

Веса и версия остались прежними, но набралась пачка исправлений для ежедневной работы.

Скорость: на GPU NVIDIA Hopper включили Flash Attention 4. Обработка промпта ускоряется на 25–70%, время до первого токена сократилось на 31%. Починили чат-шаблон и вызов инструментов — модель больше не вызывает их неточно. Отдельно поджали «лень»: теперь реже обрывает ответ на полуслове.

🖼 По зрению появился понятный рычаг: по умолчанию картинка сжимается до 280 визуальных токенов ради экономии. Для задач с деталями вроде OCR параметр max_soft_tokens поднимается до 1120 — это разрешение 2,51 Мп. Как бюджет токенов влияет на распознавание, можно проверить в интерактивном демо.

Обновлённые модели уже на Hugging Face.

🔗 https://huggingface.co/collections/google/gemma-4
#Gemma4 #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
ℹ Модель: T-Search для корпоративного многошагового поиска на базе Qwen3.6-35B-A3B

«Т-Технологии» выложили в открытый доступ ИИ-модель T-Search для многошагового поиска в корпоративных документах. Модель последовательно собирает релевантный контекст из внутренних баз знаний, что, по данным компании, снижает риск галлюцинаций и повышает качество работы корпоративных ИИ-агентов.
Первая русскоязычная модель для Agentic RAG, которая позволяет ИИ-агентам самостоятельно выполнять многошаговый поиск информации в корпоративных документах.
В отличие от традиционных RAG-систем (Retrieval-Augmented Generation — технологии, при которой ИИ ищет информацию в документах и использует ее для подготовки ответа), T-Search сосредоточен не на генерации ответа, а на многошаговом поиске и сборе релевантного контекста из внутренних баз знаний, говорится в релизе. Затем этот контекст может использовать любая языковая модель.
Решение рассчитано на компании, которым приходится обрабатывать большое количество запросов ко внутренним данным и при этом соблюдать строгие требования к безопасности и затратам, указано в релизе.
По оценке разработчиков, использование T-Search в агентских ИИ-системах позволяет сократить затраты на инференс — то есть выполнение запросов языковыми моделями — на 20–50% в зависимости от сценария.
T-Search построена на базе Qwen3.6-35B-A3B и работает как специализированный агент-ретривер (ИИ для поиска и отбора релевантной информации). Благодаря архитектуре с 35 млрд параметров, из которых одновременно используются только 3 млрд, модель можно запускать на одном графическом процессоре Nvidia H100. По данным разработчиков, это позволяет обрабатывать запросы до трех раз быстрее и снижать затраты на их обработку до пяти раз по сравнению с открытыми моделями сопоставимого качества. Кроме того, архитектура поддерживает параллельную работу нескольких поисковых агентов, что повышает качество поиска до 15%.

🔗 https://huggingface.co/t-tech/T-Search
🔗 Все версии: https://huggingface.co/collections/t-tech/t-search
(Статья) (Еще подробности)
#TSearch #RAG #Qwen36 #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
📱 Модель Bonsai 27B появилась и в приложении Atomic Chat

Bonsai 27B работает локально на iPhone — модель 27B размером: 3,9 ГБ!
Версия Atomic Chat для iPhone/iPad: https://apps.apple.com/de/app/atomic-chat-private-local-ai/id6761720226?l=en-GB
Работает и с 8 ГБ ОЗУ!
Для Android https://play.google.com/store/apps/details?id=chat.atomic.app
(Обсуждение)
#atomicchat #atomic #Bonsai #Bonsai27B #Qwen36 #iPad #iPhone #App #AiModel #ModelAi #LocalAi #AiLocal
This media is not supported in your browser
VIEW IN TELEGRAM
✈️ Ghost - Премиальное рабочее пространство с ИИ в строке меню.
Ghost направляет запросы к локальным и размещенным моделям, выполняет поиск в вашей личной базе знаний, запускает локальные таймеры и проверенные действия на Mac — и все это из одной тихой встроенной панели, которая появляется, когда она вам нужна, и исчезает, когда не нужна.
Ghost — это нативное приложение с панелью меню SwiftUI для macOS, которое объединяет локальные модели, размещенные API, дополнительные клиентские интерфейсы агентов, функции извлечения документов, таймеры и проверенные действия для Mac в одном удобном интерфейсе.

Он работает как вспомогательное приложение — без значка в Dock и без полноэкранного режима. Он появляется по нажатию клавиши, выполняет свою работу и сворачивается. Ваш Mac остается вашим Mac.

Все возможности доступны по умолчанию. Вы подключаете каждую из них — буфер обмена, веб-интерфейс, файлы, автоматизацию, экран, командную строку — в шесть этапов. По умолчанию ничего не включено. Ничто не работает в фоновом режиме без вашего запроса.
Ghost подключается к Ollama (localhost:11434) и LM Studio (localhost:1234) как к первоклассным провайдерам наряду с Claude, Gemini, DeepSeek, OpenCode Go и OpenCode Zen. Вы сами выбираете, какая модель отвечает на тот или иной вопрос.

При первом запуске Ghost проверяет каждую локальную модель, чтобы выяснить, что она на самом деле может делать: поддерживает ли она вызов встроенного инструмента? Режим JSON? Насколько точны ее структурированные выходные данные? Основываясь на результатах, Ghost присваивает каждой модели соглашение о вызове — native_tool_calls, json_action_mode, harness_first или answer_only — таким образом, локальные модели, которые не могут выполнять вызовы функций, по-прежнему получают доступ к инструментам по структурированному пути JSON, а модели, которые производят ненадежные вызовы инструментов, корректно откатываются, вместо того чтобы беззвучно прерываться.

Конфиденциальность: Ключи API хранятся в связке ключей macOS. Локальные провайдеры не могут запускать агентский режим. Когда вы используете Ollama или LM Studio, данные не покидают ваш компьютер.

Цены: 2-дневная бесплатная пробная версия, пожизненная лицензия за 10 долларов. Используйте локальные модели бесплатно навсегда. Для хостинговых моделей нужны собственные ключи API.

🔗 https://integratedagentics.com/ghost
🔗 https://github.com/ryuhemingway/Ghost-App
(Обсуждение)
#Ghost #macOS #Ollama #LMStudio #SoftAi #AiSoft #AiAgent #AgentAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
🤖 Bionic Agent — ИИ-помощник для локальных моделей

LM Studio выпустила агента, который работает с документами, кодом и аудио прямо на твоём компьютере. Данные не улетают в облако — всё остаётся локально.

Что умеет: создаёт и редактирует документы, презентации, PDF; пишет код с автосохранением; расшифровывает речь в реальном времени. Запускается через LM Studio на движках MLX и llama.cpp. Можно подключить облачные модели вроде GLM или Kimi, если задача требует больше мощности.

Поддерживает Windows и macOS. Есть бесплатный тариф.
🔗 https://lmstudio.ai/pricing
#LMStudio #BionicAgent #MLX #llamacpp #Windows #MacOS #SoftAi #AiSoft #AiAgent #AgentAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🖼 SenseNova U1 Pro: китайская модель для генерации картинок обновилась до V3

Китайская модель SenseNova U1 Pro получила 3-ю версию. Теперь она генерирует картинки в разрешении до 8K, умеет создавать ультраширокие и ультравысокие изображения, а ещё — редактировать их.
Вышла специальная версия для текстов и инфографики.

Модель открытая, есть GGUF-версии для 10-12 Гб видеопамяти. Разработчики честно признают: с анатомией пока не всё гладко, работают над этим.

💻 Ещё у них есть SenseNova Vision — модель для распознавания объектов, OCR, работы с интерфейсами, определения глубины и сегментации. Поддерживает мультиракурсный анализ.

🔗 https://github.com/OpenSenseNova/SenseNova-U1
🔗 https://huggingface.co/sensenova/SenseNova-U1-8B-MoT-Infographic-V3
🔗 https://modelscope.cn/models/SenseNova/SenseNova-U1-8B-MoT-Infographic-V3
🔗 https://huggingface.co/spaces/sensenova/sensenova-u1-infographic-v3
🔗 https://github.com/OpenSenseNova/SenseNova-Vision
#SenseNova #SenseNovaU1 #Infographic #SenseNovaVision #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
💡 DFlash ускоряет Qwen3.6 27B в 2,2 раза без потери качества

Команда : Atomic.Chat локально протестировала Qwen3.6-27B тремя способами на одной RTX 6000: базовый режим, MTP, DFlash. Задачи были следующие: быстрая сортировка, создание библиотеки Steam в формате JSON, решение логической головоломки и написание научно-фантастического рассказа.

Результаты:
- Базовый уровень: 44 токена в секунду · 1,00x
- MTP: 65 токенов в секунду · 1,45x · 71% принято
- DFlash: 98 токенов в секунду · 2,20x · 30% принято

DFlash генерирует 15 токенов подряд, поэтому он справляется с повторяющимися или структурированными фрагментами, в которых длинные последовательности действительно работают, например с JSON (152 токена в секунду, в 3,4 раза быстрее). В креативном тексте большинство догадок оказываются неверными, поэтому работа тратится впустую, и скорость может упасть ниже базового уровня — 42 против 44.
MTP генерирует только 3 варианта параллельно внутри модели, поэтому неверная догадка почти ничего не стоит, и скорость никогда не падает ниже базового уровня.

Все три модели выдают одинаковый результат. Поэтому DFlash отлично подходит для программирования, а MTP — для общения или литературного творчества.

Модель Qwen 3.6 27B: https://huggingface.co/Qwen/Qwen3.6-27B
(Обсуждение)
#DFlash #MTP #Qwen36 #AtomicChat #LocalAi #AiLocal
✨ Arandu — приложение, помогающее использовать Llama.cpp.

Arandu — приложение с открытым исходным кодом для простого запуска моделей с помощью llama.cpp. Оно объединяет все в одном месте, предлагая простое управление несколькими версиями llama.cpp, поиск и загрузку моделей HuggingFace, интуитивно понятные аргументы с предустановками и многое другое.
Идея состоит в том, чтобы создать небольшую систему вокруг llama-server без необходимости подключаться к DLL-файлам.

- Управление моделями
- Интеграция с HuggingFace
- Интеграция Llama.cpp с GitHub и управление релизами
- Запуск терминала Llama-server с простой настройкой аргументов и предустановками, внутренними и внешними
- Встроенный интерфейс чата Llama-server
- Аппаратный монитор
- Цветовые темы
🔗 https://github.com/fredconex/Arandu
(Обсуждение)
#Arandu #llamacpp #SoftAi #AiSoft #Windows #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
ℹ Модель: Laguna S 2.1 — открытая ИИ-модель для программирования.

Модель содержит 118 млрд параметров, из которых 8 млрд активны, поддерживает контекст до 262 тысяч токенов. В Terminal-Bench 2.1 набрала 70,2%, показав результат на уровне сильных коммерческих моделей. Laguna S 2.1 уже доступна бесплатно через OpenRouter: Poolside: Laguna S 2.1 (бесплатно)
🔗 https://openrouter.ai/poolside/laguna-s-2.1:free
Laguna S 2.1 — это новейшая модель кодирующего агента от Poolside. Laguna S 2.1 — это модель с общим количеством параметров 118 млрд и 8 млрд активных параметров, набравшая 70,2 % баллов на Terminal-Bench 2.1 и 40,4 % баллов на DeepSWE, что делает ее одной из самых сильных кодирующих моделей в своей категории. Модель с открытым исходным кодом под лицензией OpenMDW-1.1.

Laguna S 2.1 предназначена для разработки программного обеспечения и агентного программирования, и вы несете ответственность за то, чтобы убедиться, что она подходит для ваших целей.
Скачать: https://poolside.ai/get-started

Пишут: Laguna S 2.1 Released: Cheaper than Deepseek v4 Flash, Better than V4 Pro! (Перебила результаты DeepSeek v4 Pro, Gemini 3.6 Flash, Inkling при своём втрое меньшем объёме. Может работать на DGX Spark.)
⬇️ Скачать квант: https://huggingface.co/unsloth/Laguna-S-2.1-GGUF
(Обсуждение)
HF: https://huggingface.co/poolside/Laguna-S-2.1
GGUFs available for use with llama.cpp custom fork: https://huggingface.co/poolside/Laguna-S-2.1-GGUF
Posted on X: https://x.com/poolsideai/status/2079613777343848465?s=20
(Обсуждение)
#Laguna #LagunaS #LagunaS21 #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM