📱 InferrLM - Локальный ИИ на iOS и Android
InferrLM - это мобильное приложение, которое переносит LLMs и SLMs непосредственно на ваше устройство Android и iOS и позволяет вашему устройству действовать как локальный сервер. Также поддерживаются облачные модели, такие как Claude, Gemini и ChatGPT. Вложения файлов с RAG также хорошо поддерживаются для локальных моделей. В InferrLM теперь есть поддержка MLX.
🔗 https://www.inferrlm.app
Проект: https://github.com/sbhjt-gr/InferrLM
📱 Android: InferrLM: On-device AI https://play.google.com/store/apps/details?id=com.gorai.ragionare
iOS: https://apps.apple.com/us/app/inferrlm/id6754396856
(Обсуждение)
Все аналоги для Android https://t.me/Ai2Local/22
Все аналоги для iPhone https://t.me/Ai2Local/21
#InferrLM #Android #iOS #iPhone #App #LLM #RAG #MLX #LocalAi #AiLocal
InferrLM - это мобильное приложение, которое переносит LLMs и SLMs непосредственно на ваше устройство Android и iOS и позволяет вашему устройству действовать как локальный сервер. Также поддерживаются облачные модели, такие как Claude, Gemini и ChatGPT. Вложения файлов с RAG также хорошо поддерживаются для локальных моделей. В InferrLM теперь есть поддержка MLX.
Проект: https://github.com/sbhjt-gr/InferrLM
📱 Android: InferrLM: On-device AI https://play.google.com/store/apps/details?id=com.gorai.ragionare
iOS: https://apps.apple.com/us/app/inferrlm/id6754396856
(Обсуждение)
Все аналоги для Android https://t.me/Ai2Local/22
Все аналоги для iPhone https://t.me/Ai2Local/21
#InferrLM #Android #iOS #iPhone #App #LLM #RAG #MLX #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
💡 NoobScribe — это API для расшифровки, совместимый с Whisper, и веб-интерфейс для записи совещаний, расшифровки аудио и сохранения информации о выступающих на разных сессиях с помощью дневниковых записей и функции памяти выступающих.
🔗 https://github.com/meganoob1337/NoobScribe
(Обсуждение)
#NoobScribe #Whisper #Транскрибация #LocalAi #AiLocal
База была создана parakeet-diarized, ссылка в разделе ATTRIBUTIONS(.)md в репозитории
NoobScribe предоставляет совместимый с Whisper API для расшифровки аудио, хотя моими основными дополнениями являются веб-интерфейс и конечные точки для управления записями, расшифровками и спикерами.
Он работает в Docker (на центральном процессоре или с помощью nvidia docker toolkit на графическом процессоре), использует аудиосистему Pyannote для диаризации и nvidia/canary-1b-v2 для расшифровки.
Добавить записи можно двумя способами: загрузить аудиофайл или записать звук с рабочего стола (через функцию демонстрации экрана в браузере) и/или с микрофона.
Затем эти аудиозаписи транскрибируются с помощью Canary-1b-v2 и диаризуются с помощью pyannote audio
После завершения транскрибирования и диаризации можно сохранить обнаруженные голоса (их эмбеддинги из pyannote) в векторной базе данных (Chroma) и заменить общие названия голосов (SPEAKER_00 и т. д.) на имена, которые вы указали.
Кроме того, программа проверяет существующие расшифровки на наличие совпадающих эмбеддингов для новых голосов или новых эмбеддингов для одного голоса, чтобы обновить их задним числом.
У диктора может быть несколько эмбеддингов (например, при использовании разных микрофонов эмбеддинги иногда не совпадают — так можно повысить точность распознавания диктора).
Все данные хранятся локально на вашем компьютере, и вам нужен только Docker и токен HF_TOKEN (если вы хотите использовать функцию ведения дневника, так как модель Pyannote является закрытой.
Создали это, чтобы лучше транскрибировать записи совещаний и т. д. и потом обобщать их с помощью большой языковой модели. В этом плане диаризация речи спикера очень помогает по сравнению с обычной транскрипцией.
(Обсуждение)
#NoobScribe #Whisper #Транскрибация #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
GitHub
GitHub - meganoob1337/NoobScribe: NoobScribe is a Whisper-compatible transcription API and Web UI for recording meetings, transcribing…
NoobScribe is a Whisper-compatible transcription API and Web UI for recording meetings, transcribing audio, and remembering speakers across sessions with diarization and speaker memory. - meganoob1...
Оказывается есть небольшая модель, обученная для извлечения персональных данных!
Модель GLiNER-PII создана на основе моделей Gretel GLiNER PII/PHI. Она построена на базе GLiNER large-v2.1 и обнаруживает и классифицирует широкий спектр персональных данных (PII) и защищенной медицинской информации (PHI) в структурированном и неструктурированном тексте. Модель не генерирует данные, а создает аннотации сущностей на уровне фрагментов с оценкой достоверности по более чем 55 категориям. Модель разработана компанией NVIDIA.
Еще рекомендуют использовать: Llama 3.3 70B или Mistral Large.
#GLiNERPII #NVIDIA #PHI #PII #ПерсональныеДанные #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
huggingface.co
nvidia/gliner-PII · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Whisperian — это инструмент голосового ввода, созданный для писателей и всех, кто не любит печатать и хочет перенести свои сложные рабочие процессы преобразования речи в текст на свои устройства Android.
Приложение интегрируется с системой Android либо как голосовая клавиатура, либо как компактное системное наложение, которое не мешает, когда оно не нужно...
Whisperian — простой инструмент/приложение для запуска локальных моделей преобразования текста в речь на Android, которые можно использовать вместо диктовки в Gboard, параллельно с обычной клавиатурой.
Можно сказать, что это уже довольно проработанное приложение, по функциональности сравнимое с VoiceInk / Handy для MacOS.
В настоящее время приложение поддерживает 21 локальную модель. Среди дополнительных функций — пользовательские подсказки/режимы постобработки и история расшифровки. Однако локальная постобработка пока не интегрирована и доступна только у облачных провайдеров.
(Обсуждение)
#Whisperian #Android #STT #App #Диктовка #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
Сверхбыстрая диктовка и голосовое редактирование для приложений, которыми вы уже пользуетесь. Теперь доступно на Mac: Fn для диктовки, Control + Fn для использования ИИ и удобное редактирование выделенного текста.
Бесплатно:
•2000 бесплатных слов в месяц
•Все основные функции включены
•Контекстно-зависимая транскрипция
$7 в месяц:
•100 000 слов в месяц
•Полный мобильный доступ: транскрибируйте где угодно через Telegram
•Улучшение с помощью искусственного интеллекта: мгновенная самокоррекция и команды
•Интеллектуальная работа с экраном: редактируйте выделенный текст с помощью голосовых команд
•Работает в любом приложении (в т. ч. в Remote Desktop)
•Триггеры для горячих клавиш, мыши и VDI
•Контекстно-зависимая транскрипция
•Автоматическое форматирование кода, электронных писем и математических выражений
#dictaflow #MacOS #Диктовка #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
(Обсуждение)
#DevstralSmall224B #DevstralSmall2 #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
huggingface.co
adamjen/Devstral-Small-2-24B-Opus-Reasoning · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
(Обсуждение)
#NemotronCascade2 #NemotronCascade #Nemotron #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Плагин для мультимодального анализа изображений в LM Studio.
Позволяет мультимодальным моделям передавать файлы изображений для анализа, в том числе изображения, найденные в интернете и загруженные с помощью других инструментов.
Большие языковые модели в LM Studio теперь могут брать изображения из интернета и просматривать их/показывать вам!
Плагин, который позволяет языковым моделям в LM Studio загружать изображения из интернета для анализа. Они будут объединять инструменты в зависимости от задачи.
Никаких MCP/API/регистраций — это простые скрипты, которые можно установить в один клик с сайта LM Studio. (Да, в LM Studio есть поддержка плагинов!). Все, что вам нужно, — это модель с функцией Vision (Qwen 3.5 9b / 27b отлично подойдут).
Автор также обновил плагины Duck-Duck-Go и Visit Website, чтобы они могли работать с изображениями, и добавил несколько новых функций:
- Инструменты автоматически загружают изображения и преобразуют их в уменьшенные файлы для встраивания в чат (чтобы не загромождать пространство).
- Затем инструмент анализа, по возможности, использует изображения в полном разрешении.
- Плагины помогают языковой модели встраивать изображения при необходимости или использовать галерею таблиц в формате Markdown, если пользователь явно хочет использовать много изображений.
Несколько примеров этого можно увидеть на скриншотах.
Шаблон Jinja Prompt: Pastebin (устранил проблему с ошибками при вызове инструмента)
Настройки Qwen 3.5 (по сути, это официальная рекомендация Qwen):
Temperature: 1
Top K sampling: 20
Repeat Penalty: 1
Presence Penalty: 1.9 (I think this one is important, fixed repetition problems for me, always gets out of loop)
Top P sampling: 0.95
Min P sampling: 0
Системная подсказка:
You are a capable, thoughtful, and precise assistant. Always prioritize being truthful, nuanced, insightful, and efficient, tailoring your responses specifically to the user's needs and preferences.
Research before answering the questions: use both reasoning and tool calls to synthesize a proper conclusion.
Про плагины (DuckDuckGo и visit-website-reworked): https://t.me/Ai2Local/430
(Обсуждение)
#LMStudio #DuckDuckGo #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Агрессивный = без отказов, без изменений личности и без модификаций. ОРИГИНАЛЬНАЯ версия от NVIDIA, без цензуры.
Краткие характеристики:
- параметры 3,97Б
- 262 КБ собственного контекста
- Режим мышления / умозаключения (переключаемый)
- Поддержка вызова инструмента
- Сжатый с Nemotron-Nano-9B-v2
Настройки от NVIDIA:
temp = 1.0, top_p = 0.95 для рассуждений; temp = 0.6, top_p = 0.95 для вызова инструмента.
Все такие модели: HauhauCS
(Обсуждение)
#Nemotron3Nano4B #Nemotron3Nano #Nemotron3 #Nemotron #БезЦензуры #Uncensored #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
huggingface.co
HauhauCS/Nemotron3-Nano-4B-Uncensored-HauhauCS-Aggressive · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
⚡️ Flash-MoE: Qwen3.5-397B-A17B на Apple Silicon
Круто на 128 Гб. запускать модель 397B!
Форк ANEMLL. В первую очередь ориентирован на Apple M5 Max 128 ГБ.
🔗 https://github.com/Anemll/flash-moe
(Обсуждение)
⚡️ Qwen3.5-397B запустили и на M3 Macbook Pro с 48GB RAM!
#FlashMoE #AppleSilicon #Qwen35 #ANEMLL #AppleM5Max #M5Max #MacOS #LocalAi #AiLocal
Круто на 128 Гб. запускать модель 397B!
Форк ANEMLL. В первую очередь ориентирован на Apple M5 Max 128 ГБ.
Механизм логического вывода Pure C/Metal, работающий на Qwen3.5-397B-A17B (модели Mixture-of-Experts с 397 миллиардами параметров) на Apple Silicon. Вся модель загружается с твердотельного накопителя через специальный вычислительный конвейер Metal.
TL;DR: локально запустили модель с 397 миллиардами параметров на MacBook. без облачных технологий. лучшая конфигурация: 4-битная + cache-io-split 4 = 12,99 ток/с. При разбиении на 2 и 3 части результаты хуже. 2-битная конфигурация обеспечивает такую же скорость, но худшее качество. полные данные в посте.
(Обсуждение)
#FlashMoE #AppleSilicon #Qwen35 #ANEMLL #AppleM5Max #M5Max #MacOS #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
Все работает локально в вашем браузере (с использованием Transformers.js). На M4 Max получают ~75 токенов в секунду — неплохо!
Это гибридная модель Mamba + Attention с архитектурой 4B, способная выполнять как логические, так и нелогические задачи.
Ссылка на демонстрацию (+ исходный код):
Работает даже на телефоне (браузер Chrome). Просто введите URL-адрес, и у вас будет локальная модель.
(Обсуждение)
#Nemotron3Nano4B #Nemotron3Nano #Nemotron3 #Nemotron #WebGPU #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
- Эта модель устраняет сбой в работе официальной модели, вызванный тем, что шаблон Jinja не поддерживает роль "разработчика". (обычно используется современными агентами кодирования, такими как Claude Code и OpenCode)
- Она не отключает режим мышления по умолчанию и позволяет агенту работать непрерывно более 9 минут без перерывов.
- По сравнению с оригинальной моделью автономность и стабильность работы значительно улучшены.
Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled — это высокопроизводительная модель логического вывода, доработанная на основе мощной архитектуры Qwen3.5. Основная задача модели — использовать современную технологию дистилляции цепочки рассуждений (Chain-of-Thought, CoT), основанную на взаимодействии Claude-4.6 и Opus.
Благодаря контролируемой тонкой настройке (Supervised Fine-Tuning, SFT), ориентированной на структурированную логику рассуждений, эта модель отлично справляется с разбором сложных пользовательских задач, планированием пошаговых методологий в рамках строго структурированных <think> тегов и, в конечном счете, с поиском точных и продуманных решений.
⚡️ Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled демонстрирует значительные преимущества в средах кодирования, таких как Claude Code и OpenCode:
- Встроенная поддержка роли «разработчика», не требующая патчей для шаблонов Jinja или обходных путей с использованием ChatML.
- Режим мышления полностью сохранен (подтверждено в логах thinking=1), не отключен без предупреждения, что позволяет сохранить всю цепочку логических рассуждений.
- Значительно улучшена автономность и стабильность — система может работать непрерывно более 9 минут (без участия человека). Она активно ожидает ответа от инструментов, считывает выходные данные, самостоятельно исправляет ошибки и даже может автоматически генерировать файл README, в то время как базовая модель часто зависает в процессе выполнения.
Эти улучшения стали возможны благодаря успешному внедрению стиля структурированных рассуждений Claude 4.6 Opus, что позволило Qwopus стать по-настоящему готовым к использованию в современных локальных агентах кодирования и по удобству использования приблизиться к Opus.
=======
Есть очень компактная версия:
Qwen3.5-27B-TQ3_4S - 13.9 GB - Turbo Quant на удвоенной скорости!
#Qwen35 #Qwopus #GGUF #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
gpt-oss-puzzle-88B — это оптимизированная для развертывания большая языковая модель, разработанная компанией NVIDIA на основе gpt-oss-120b от OpenAI.
Модель создана с использованием Puzzle — фреймворка для поиска нейронных архитектур после обучения (NAS). Цель разработки — значительно повысить эффективность логического вывода при выполнении ресурсоемких задач, сохранив или улучшив точность при ограниченном бюджете.
Модель специально оптимизирована для работы с длинными и короткими контекстами.
По сравнению со своим предшественником, gpt-oss-puzzle-88B:
- Уменьшает общее количество параметров до ~88 Б (≈73 % от исходного значения),
- Обеспечивает повышение производительности в 1,63 раза в сценариях с большим контекстом (64 КБ/64 КБ) на узле с 8 графическими процессорами H100,
- Обеспечивает повышение производительности в 1,22 раза в сценариях с малым контекстом (4 КБ/4 КБ),
- Обеспечивает повышение производительности в 2,82 раза на одном графическом процессоре H100,
Точность соответствует исходной или немного превышает ее.
Количество параметров модели: 88 млрд
(Обсуждение)
#NVIDIA #gptosspuzzle88B #gptosspuzzle #GptOss120b #GptOss #Puzzle #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
MacParakeet — бесплатная альтернатива WisprFlow с открытым исходным кодом, работающая на Mac Silicon! Поддерживает 25 европейских языков!
- Диктофон — нажмите горячую клавишу в любом приложении, говорите, и текст будет вставлен. Удерживайте для перехода в режим «нажми и говори», дважды нажмите для непрерывной записи. Работает во всей системе.
- Расшифровка файлов — перетащите аудио- или видеофайлы или вставьте URL-адрес YouTube. Полная расшифровка с временными метками на уровне слов, указанием говорящего и возможностью экспорта в 7 форматов (TXT, Markdown, SRT, VTT, DOCX, PDF, JSON).
- Дифференциация говорящих — определяет, кто что сказал, с возможностью переименования меток
- Очистка текста — удаление слов-паразитов, замена слов по пользовательскому шаблону, фрагменты текста с триггерами. Детерминированный конвейер, без использования больших языковых моделей.
- Функции ИИ — опциональное обобщение расшифровки и чат с использованием собственных API-ключей (OpenAI, Anthropic, Ollama, OpenRouter). Только по желанию.
Разработчик добавил несколько дополнительных функций, например чат с расшифровкой видео с YouTube (интеграция доступна с локальными сервисами ollama или облачными сервисами, такими как openai или claude).
Приложение работает на модели Parakeet от NVIDIA (0.6B-v3) через FluidAudio, которая обеспечивает наилучшую производительность при расшифровке аудио на английском языке в режиме реального времени. 60 минут аудио транскрибируются менее чем за 30 секунд (после первой загрузки локальной модели). Коэффициент ошибок также очень низкий.
❗️Только для Apple Silicon на (M1/M2/M3/M4)
(Кстати, если вы пользуетесь Windows или Linux, вам стоит попробовать Handy, который делает практически то же самое! Подробнее: https://t.me/Ai2Local/112 )
https://github.com/moona3k/macparakeet
(Обсуждение)
И есть еще:
Аналоги по тегу: #Диктовка
#MacParakeet #WisprFlow #Parakeet #MacSilicon #MacOS #FluidAudio #Транскрибация #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
🌎 LFM2-24B-A2B от Liquid AI работает прямо в веб-браузере на WebGPU
Модель (MoE с 24 миллиардами параметров) на M4 Max обрабатывает около 50 токенов в секунду, а вариант с 8 миллиардами активных параметров — более 100 токенов в секунду на том же оборудовании.
Демонстрация (+ исходный код):
🔗 https://huggingface.co/spaces/LiquidAI/LFM2-MoE-WebGPU
Оптимизированные модели ONNX:
- https://huggingface.co/LiquidAI/LFM2-8B-A1B-ONNX
- https://huggingface.co/LiquidAI/LFM2-24B-A2B-ONNX
(Обсуждение)
#LFM224BA2B #LFM2 #LFM224B #ONNX #WebGPU #AiModel #ModelAi #LocalAi #AiLocal
Модель (MoE с 24 миллиардами параметров) на M4 Max обрабатывает около 50 токенов в секунду, а вариант с 8 миллиардами активных параметров — более 100 токенов в секунду на том же оборудовании.
Демонстрация (+ исходный код):
Оптимизированные модели ONNX:
- https://huggingface.co/LiquidAI/LFM2-8B-A1B-ONNX
- https://huggingface.co/LiquidAI/LFM2-24B-A2B-ONNX
(Обсуждение)
#LFM224BA2B #LFM2 #LFM224B #ONNX #WebGPU #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Готовый к использованию академический PDF-процессор, который извлекает метаданные и структурированный JSON из научных статей. Разработан как подключаемый модуль для конвейеров RAG: высококачественное ядро для понимания документов.
Prajnya — это модульная система анализа документов, разработанная специально для высокоточных конвейеров RAG (Retrieval-Augmented Generation).
В отличие от обычных парсеров PDF, которые выводят неструктурированный текст, Prajnya преобразует документы в строгий структурированный JSON, сохраняя иерархию макетов, таблиц и математических уравнений. Он разработан для решения проблемы «мусор на входе — мусор на выходе» в приложениях с большими языковыми моделями. Благодаря ему данные, поступающие в вашу векторную базу данных, будут проверенными, структурированными и семантически насыщенными.
Основные возможности:
- Структурированное извлечение: преобразует PDF-файлы в чистый JSON со специальными полями для текста, метаданных, таблиц и рисунков.
- Понимание структуры: использует модели машинного зрения, чтобы «видеть» страницу, и точно анализирует многоколоночные академические макеты.
- С учетом аппаратного обеспечения: автоматически определяет ваш графический процессор (CUDA) и оптимизирует параллельную обработку для максимальной производительности.
- Устойчивость: предназначено для крупномасштабной пакетной обработки (более 10 000 файлов) с восстановлением после сбоев и атомарным управлением состоянием.
#Prajnya #PDFProcessor #PDF #RAG #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
GitHub
GitHub - mku1988-oss/Prajnya-Academic-PDF-Processor: Production-ready academic PDF processor that extracts metadata and structured…
Production-ready academic PDF processor that extracts metadata and structured JSON from research papers. Designed as a plug-and-play module for RAG pipelines: the high-quality document understandin...