Local Ai
443 subscribers
895 photos
250 videos
4 files
811 links
Все про Локальные ИИ на ПК и Смартфонах - программы и модели, которые можно запустить на 96Gb VRAM. (Как сайт: https://t.me/s/ai2local )
ИИ для Здоровья: @Ai2Health
Download Telegram
🎞 Сервис для мгновенной генерации субтитров прямо в браузере ⚡️

Сервис Subtitles от Fframes Studio - работает без регистрации и платы, при этом качество распознавания речи — отличное. Без VPN!
Предназначен для транскрибирования и создания субтитров.

Полностью бесплатный локальный инструмент для транскрипции видео с использованием ИИ, работающий непосредственно на устройстве, с графическим интерфейсом для редактирования транскрибированных фрагментов, их оформления и рендеринга на видео.

🪙 Можно настроить шрифт субтитров, таймкоды, их положение и другие параметры прямо в браузере. Новый мастхэв для всех, кто работает с видео!
Есть выбор языка (Есть Русский, Узбекский, ...) и надо выбрать ИИ модель: Tiny = 152Mb, Base = 291Mb., Small = 586Mb. - больше размер модели - выше качество транскрибации, но дольше...
subtitles.fframes.studio
Проект: https://github.com/dmtrKovalenko/subtitler
#subtitles #fframesStudio #subtitler #Траснкрибация #WebAi #WebGPU #Whisper #субтитры #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Лучшие локальные LLM — 2025
На Reddit все оставляют отзывы о своих лучших моделях!

#ModelAi #huggingface #GGUF #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Модель ИИ из ПРОШЛОГО!
Исследователи из Цюриха обучили семейство моделей Ranke-4B на архитектуре Qwen3 — каждую на текстах, изданных до определённого года: 1913, 1929, 1933, 1939 и 1946.

- Ranke-4B-1913 ничего не знает про Первую мировую и «испанку», а женщин-работниц описывает как «менее способных, надёжных и подготовленных» по сравнению с мужчинами.
- Ranke-4B-1933 понятия не имеет, что будет после прихода Гитлера к власти.

Зачем нужны ИИ «из прошлого»?

Историки и социологи постоянно сталкиваются с эффектом ретроспективного знания: им известен исход событий, поэтому они переоценивают, насколько очевидным казалось будущее для современников. Плюс невольно переносят мораль XXI века в прошлое. С той же проблемой сталкиваются нейросети, обученные на современных данных.

Ranke-4B создаёт окно в культурную психологию прошлого. В отличие от развлекательных ботов, эти модели не притворяются Наполеоном — они действительно ограничены знаниями своей эпохи.
🔗 https://github.com/DGoettlich/history-llms

Похожие проекты:
TimeCapsuleLM — воспроизводит викторианский стиль и взгляды на основе текстов о Лондоне 1800–1875 годов
🔗 https://github.com/haykgrigo3/TimeCapsuleLLM

MonadGPT — анализирует представления средневековых людей по книгам до XVII века
🔗 https://huggingface.co/Pclanglais/MonadGPT

XunziALLM — генерирует тексты на древнекитайском с соблюдением поэтических правил эпохи
🔗 https://github.com/Xunzi-LLM-of-Chinese-classics/XunziALLM

#ModelAi #XunziALLM #MonadGPT #TimeCapsuleLLM #historyLLMs #Ranke4B #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯1
Модель для синтеза научной литературы.

Обзор OpenScholar
Научный прогресс зависит от нашей способности находить, синтезировать и опираться на соответствующие знания из научной литературы. Однако экспоненциальный рост объема этой литературы — в настоящее время ежегодно публикуются миллионы статей — делает все более трудным для ученых поиск необходимой им информации или даже ознакомление с последними открытиями в одной области.

Чтобы помочь учёным эффективно ориентироваться в научной литературе и обобщать её, мы представляем OpenScholar — языковую модель с расширенными возможностями поиска (LM), которая отвечает на запросы пользователей, сначала находя соответствующие статьи в литературе, а затем генерируя ответы на основе этих источников

«Мы обучаем и выпускаем полностью открытую языковую модель с расширенным поиском, которая может синтезировать более 8 миллионов научных статей в открытом доступе, чтобы отвечать на научные вопросы».

OpenScholar работает с базой данных более 45 миллионов открытых научных статей. В отличие от GPT-4o, который часто генерирует ответы на основе предобученных данных, OpenScholar активно извлекает релевантные статьи, синтезирует их выводы и формирует ответ, опираясь на эти источники. Это делает его более надежным в плане фактической точности и правильности цитирования.

Система продемонстрировала выдающиеся результаты в тестах на новых бенчмарках, таких как ScholarQABench, и показала, что может обойти даже более крупные закрытые модели. Например, GPT-4o часто генерирует несуществующие ссылки, в то время как OpenScholar остается привязанным к проверяемым источникам.

В тестах OpenScholar продемонстрировала 5% улучшение по сравнению с GPT-4o и 7% по сравнению с PaperQA2 в правильности ответов. Более того, эксперты предпочитали ответы OpenScholar 51% и 70% случаев по сравнению с ответами, написанными людьми.

Эта модель не только улучшает качество научных обзоров, но и способствует более надежному научному дискурсу, предоставляя точные ссылки на оригинальные источники. OpenScholar открывает новые горизонты для исследователей, упрощая процесс синтеза информации и делая его более доступным.

Тут полная коллекция — включая веса модели, обучающие данные и поисковый индекс.
Страница проекта: https://github.com/AkariAsai/OpenScholar
💬 Чат https://openscilm.allen.ai
Ответом можно поделиться как ссылкой и без авторизации! (Это ответ на 1 слово: Полипренолы)
—————
👉 В МГУ представили новую ИИ-модель для поиска научных текстов!
Таблица лидеров: https://huggingface.co/spaces/mteb/leaderboard
Модель sci-rus-tiny3.5-zh: https://huggingface.co/mlsa-iai-msu-lab/sci-rus-tiny3.5-zh
#ModelAi #OpenScholar #OpenSciLM #LocalAi #AiLocal #AllenAi #TuluAi
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥2
Media is too big
VIEW IN TELEGRAM
🛍 Анонсирован самый маленький ИИ-суперкомпьютер из Книги рекордов Гиннесса!
Устройство Tiiny AI Pocket Lab способно локально запускать большие языковые модели на 120 млрд параметров без подключения к интернету.
https://rozetked.me/news/43583-anonsirovan-samyy-malen-kiy-ii-superkomp-yuter-iz-knigi-rekordov-ginnessa
#AiPC #TiinyAIPocketLab #TiinyAI
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
⚡️ QualityScaler — апскейлинг фото и видео на твоём ПК

Бесплатная программа с открытым кодом для Windows. Использует ИИ, чтобы повысить чёткость, разрешение и почистить изображения от артефактов.

Что умеет:
• Увеличивает разрешение — не растягивает пиксели, а генерирует недостающие детали
• Убирает шум, зернистость и следы JPEG-сжатия
• Работает полностью локально — файлы остаются на твоём ПК

Подходит и для фото, и для видео!
🔗 https://github.com/Djdefrag/QualityScaler

ИМХО, сейчас это самый удобный инструмент для апскейла.
Устанавливается за 5 мин, но если хочется максимально не заморачиваться или просто поддержать разрабов — можно приобрести в Стиме (он сам установит все необходимые зависимости типа VSCode, Python и т.д.)

#QualityScaler #апскейл #LocalAi #AiLocal #WebAi
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
Ring-1T: модель с триллионом параметров и экстремальным мышлением!

Ant Group выпустила Ring-1T — модель MOE с 1 триллионом параметров, из которых 50B активных. Справляется с олимпиадными задачами уровня IMO 2025 Silver, почти не ошибается в математике и программировании. Хороша в здравоохранении!

Пишет код, творческие тексты, используется в здравоохранении, решает задачи уровня математических олимпиад (IMO 2025), сохраняет контекст до 128 000 токенов, что вдвое больше предыдущей версии Ling!

Ring-1T демонстрирует лидирующие результаты среди систем с открытым исходным кодом в сложных тестах на логическое мышление, таких как математические соревнования (AIME 25, HMMT 25), генерация кода (LiveCodeBench, CodeForce) и логическое мышление (ARC-AGI-1). Он также демонстрирует высокую конкурентоспособность в комплексных задачах (Arena-Hard-v2.0), здравоохранении (HealthBench) и творческом письме (Creative Writing v3).

Главная фишка — способность думать сотни итераций подряд. Для сравнения: топовые модели с расширенным мышлением начинают терять точность уже после 40 итераций.

По результатам бенчмарков обошла все известные чат-боты.
🔗 https://huggingface.co/inclusionAI/Ring-1T
Есть FP8 версия

Чат с ней:
Ling Chat https://ling.tbox.cn/chat
и ZenMux https://zenmux.ai/settings/chat?chatId=new_chat
Чат https://zenmux.ai/inclusionai/ring-1t
Инвайт: https://zenmux.ai/invite/G593GW (G593GW)

💡Кроме , еще есть модели на 16B (Ring-mini-2.0 - Q8_0=17.3 GB) и 100B параметров (Ring-flash-2.0 - Q6_K=84.5 GB).
#ModelAi #Ring1T #inclusionAI #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Обработка Видео Онлайн Быстро и Бесплатно!

Сжимайте видео, конвертируйте MP4, обрезайте и извлекайте аудио. Быстрая обработка прямо в браузере — без загрузки на сервер, 100% приватно.
https://vidocean.ru

Статья от автора.
#Vidocean
🔍 Модель: MiroThinker 1.5 — поисковый агент с открытым кодом!

MiroThinker v1.5 поддерживает контекстное окно размером 256К, долгосрочное прогнозирование и глубокий многоэтапный анализ.
Выполняет до 400 вызовов инструментов для каждой задачи — это существенное улучшение по сравнению с предыдущими исследовательскими агентами с открытым исходным кодом.
Основные моменты:
- Лидер по производительности: MiroThinker 1.5 (235 млрд) превосходит ChatGPT-Agent в BrowseComp и входит в число лучших в мире.

- Экстремальная эффективность: MiroThinker 1.5 (30 млрд) стоит всего 1/20 от стоимости Kimi-K2, обеспечивая более быстрый вывод данных и более высокое соотношение интеллекта и стоимости.

- Прогнозирование будущего: Собственные технологии «Интерактивное масштабирование» и «Обучение с учетом временных факторов» позволяют проводить перспективный анализ того, как макрособытия запускают цепные реакции на бирже Nasdaq.

- Полностью открытый исходный код: Модель и код полностью открыты, что позволяет бесплатно использовать интеллектуальные возможности, основанные на открытиях.

Протестировали на задаче «предскажи динамику акций Tesla». Модель не стала генерировать предположения из головы — сходила в веб, собрала свежие рейтинги от аналитических агентств, прочитала их по очереди и выдала отчёт со ссылками на источники. Всё проверяемо.

За счёт такого «медленного мышления» версия на 30B параметров обходит GPT-5-High, а модель на 235B параметров уже в первом эшелоне.

Веса открыты, есть бесплатная веб-версия для тестов. Если нужен инструмент для глубоких исследований — имеет смысл попробовать.

🔗 https://miromind.ai
и https://research.miromind.ai
Демо: https://dr.miromind.ai
Проект: https://github.com/MiroMindAI/MiroThinker
Модель: https://huggingface.co/collections/miromind-ai/mirothinker-v15
Обсуждение на Reddit. (Тут примеры)
#MiroThinker #MiroMindAi #MiroMind #LocalAi #AiLocal #ModelAi #AiModel #DeepResearch
Please open Telegram to view this post
VIEW IN TELEGRAM
Media is too big
VIEW IN TELEGRAM
🤖 Raycast - ИИ-Агент для вашего компа

Raycast - классная программа, которая может за вас делать действия на компьютере: запускать приложения, искать файлы/папки, делать ресерч, писать письма, переводить документы!

🪼 Раньше Raycast был только на macOS, теперь вышла и для Windows! Кто еще не пробовал, очень советуют 👍🏻

🪼 Еще Raycast поддерживает локальные модели, можно в пару кликов установить локальную модель и общаться с любой через интерфейс Raycast!

🪼101 сценарий использования Raycast👇🏻
Вот что за 101 сценарий:

1. Запуск приложений
2. Поиск файлов
3. Просмотр истории буфера обмена
4. Добавление записей в буфер обмена
5. Редактирование истории буфера обмена
6. Простая математика
7. Сложная математика
8. Конвертация единиц измерения
9. Вычисления с датами
10. История вычислений
11. Прогноз погоды
12. Поиск GIF
13. Поиск эмодзи
14. Умный поиск эмодзи
15. Установка таймера
16. Замена Spotlight
17. Блокировка экрана
18. Сохранение сниппетов текста
19. Эмодзи как ключевые слова
20. Динамические блоки кода из буфера
21. Поиск в интернете
22. ИИ-поиск в интернете
23. Быстрые заметки (Floating Notes)
24. Открыть последнюю загрузку
25. Скопировать последнюю загрузку
26. Поиск по тексту на скриншотах (OCR)
27. Управление окнами (58 способов)
28. Кастомные команды управления окнами
29. Макеты окон
30. Мониторинг системных ресурсов
31. Горячие клавиши для приложений
32. Алиасы для приложений
33. Переключение темы оформления
34. Очистка корзины
35. Установка приложений через Homebrew
36. Просмотр расписания
37. Присоединение к онлайн-встречам
38. Проверка камеры перед встречей
39. Сделать селфи
40. Быстрые ссылки на сайты
41. Быстрые ссылки на файлы и папки
42. Deep links приложений
43. Доступ к ссылкам через поиск
44. Переключение Bluetooth
45. Управление музыкой
46. Управление Spotify
47. Создание плейлистов с ИИ
48. Управление открытыми окнами
49. Управление запущенными процессами
50. Запись экрана
51. Скриншот
52. Запись аудио
53. Завершение приложений
54. Принудительное завершение приложений
55. Автоматическое завершение приложений
56. Полное удаление приложений (App Cleaner)
57. Помощь от ИИ моделей
58. Поиск по чатам ИИ
59. Прикрепление файлов к ИИ
60. Контекст веб-сайта для ИИ
61. Сохранение пресетов ИИ
62. Шеринг пресетов ИИ
63. Запуск команд ИИ отовсюду
64. Горячие клавиши для ИИ
65. Переключение раскладки клавиатуры
66. Смена разрешения экрана
67. Извлечение всех дисков
68. Извлечение одного диска
69. Конвертация изображений
70. Поворот изображений
71. Оптимизация изображений для веба
72. Изменение регистра текста
73. Измерение расстояний на экране
74. Поиск шрифтов
75. Пипетка цвета
76. Конвертация форматов цвета
77. Толковый словарь
78. Переводчик
79. Управление Apple Notes
80. Создание напоминаний
81. Установка статуса в Slack
82. Открыть файл в другом приложении
83. Отслеживание рейсов
84. Мировое время
85. Синхронизация настроек с облаком
86. Создание тем Raycast
87. Шеринг тем
88. Красивые скриншоты кода (Ray.so)
89. Создание иконок
90. Скачивание видео с YouTube
91. Фокус-сессии
92. Завершение рабочего дня (закрыть всё)
93. Системные настройки
94. Просмотр кодов 2FA
95. Тренировка печати
96. Перемещение окна Raycast
97. Сброс позиции окна
98. Создание организации
99. Общие сниппеты для команды
100. Общие быстрые ссылки для команды
101. Конфетти


🪼 Кстати, рекомендую ознакомиться с блогом ребят на YouTube, и особенно с YouTube видео - Начало работы с Raycast для Windows, просто открываете ссылку видео в Яндекс Браузере, и смотрите эту 11-минутную инструкцию с переводом 😉
Можно использовать бесплатно!
#AiLocal #LocalAi #Raycast #SoftAi #AiSoft #MacOS #Windows
Please open Telegram to view this post
VIEW IN TELEGRAM
1
ℹ️ Модель: Jamba2 обещает выдавать точные результаты при минимальном использовании памяти.

Jamba2 доступна в двух вариантах: 3B и Mini (MoE; 12B активных, 52B общих параметров). Длина контекстного окна: 256K Предназначена для корпоративных рабочих процессов, требующих точности и управляемости.
Ключевые преимущества:
- Превосходное соотношение надёжности и пропускной способности: Поддерживает высокую производительность при более чем 100 000 контекстов токенов
- Лучшие в категории результаты тестов: Превосходит результаты IFBench, IFEval, Collie и FACTS
- Статистически значимые преимущества в качестве: Превосходит сопоставимые модели в решении реальных корпоративных задач
- Окно контекста 256 К: Обрабатывает технические руководства, исследовательские работы и базы знаний
- Лицензия Apache 2.0: Полностью открытый исходный код для коммерческого использования
- Оптимизировано для производства: Небольшой объём памяти для масштабируемых развёртываний

54 % предприятий по-прежнему называют точность главным риском, связанным с искусственным интеллектом, который они пытаются снизить. При этом 30 % опрошенных организаций хотя бы раз сталкивались с негативными последствиями неточностей ИИ!
Jamba2 создана для получения обоснованных ответов на основе различных типов источников, включая технические руководства, исследовательские работы, корпоративные политики и внутренние базы знаний, чтобы команды могли использовать её в качестве надёжного компонента в производственных стеках.

Подробно: https://www.ai21.com/blog/introducing-jamba2/
Модель 52B https://huggingface.co/ai21labs/AI21-Jamba2-Mini
Модель 3B https://huggingface.co/ai21labs/AI21-Jamba2-3B
Обсуждение на Reddit.
#Jamba2 #ai21 #LocalAi #AiLocal #ModelAi #AiModel
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
Модель: Falcon H1R 7B - Рассуждающая модель с окном 256К разработанная Институтом технологических инноваций (TII) в Абу-Даби. Модель демонстрирует выдающиеся результаты в различных тестах, включая математические задачи, программирование, выполнение инструкций и общую логику.

Несмотря на скромный размер в 7 миллиардов параметров, Falcon H1R 7B не уступает или даже превосходит самые современные модели логического вывода, которые в 2–7 раз больше!
Falcon H1R 7B основана на трёх ключевых принципах эффективности рассуждений: скорости, эффективности использования токенов и точности, которые в совокупности определяют «трёхмерные границы» производительности.

- Математика: Falcon H1R 7B лидирует (73,96 %) с большим отрывом, опережая ближайшего соперника (Apriel 1.5 15B с показателем 69,32 %) и все более крупные базовые модели, такие как Qwen3‑32B (63,66 %) и Nemotron H 47B (49,72 %).

- Код и агентская модель: Falcon H1R 7B набрал наибольшее количество баллов в этой группе (33,95 %), опередив Qwen3‑32B (33,40 %) и Apriel 1.5 (31,60 %).

- Общее: Falcon H1R 7B остается высококонкурентным (49,48 %), уступая лишь Apriel 1.5 (53,10 %) и Phi 4 Reasoning Plus 14B (51,18 %).

Все подробности: https://huggingface.co/blog/tiiuae/falcon-h1r-7b
Model: https://huggingface.co/tiiuae/Falcon-H1R-7B
GGUF: https://huggingface.co/tiiuae/Falcon-H1R-7B-GGUF
Обсуждение на Reddit и еще ТУТ.
#FalconH1R7B #LocalAi #AiLocal #ModelAi #AiModel
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔1
Модель: Solar Open 100B - В Медицина (KorMedMCQA=84.4) превосходит GPT-OSS-120B (76.3) и GLM-4.5-Air (80.5)!

Solar Open — это флагманская 102B большая языковая модель компании Upstage, обученная полностью с нуля!
Основные моменты:
- Архитектура MoE (102B / 12B): Создана на основе архитектуры «смесь экспертов» с 102B общих / 12B активных параметров. Такая структура обеспечивает глубину знаний массивной модели при скорости логического вывода и экономической эффективности гораздо меньшей модели.
- Масштабное обучение: Предварительно обучена на 19,7 триллиона токенов, что обеспечивает широкий охват знаний и надёжные возможности логического вывода в различных областях.

- Архитектура: Смесь экспертов (MoE)
- Всего параметров: 102,6 млрд
- Активных параметров: 12 млрд (на токен)
- Эксперты: 129 экспертов (8 лучших из 128 маршрутных + 1 общий)
- Токены для предварительного обучения: 19,7 триллиона
- Длина контекста: 128 тыс.

Модель: https://huggingface.co/upstage/Solar-Open-100B
GGUF: https://huggingface.co/AaryanK/Solar-Open-100B-GGUF - Q6_K=84.3 GB
Heretic: https://huggingface.co/suitup91/Solar-Open-100B-heretic-Q4_K_M-gguf - без цензуры!
Обсуждение на Reddit и еще ТУТ и ТУТ.
#Upstage #SolarOpen100B #LocalAi #AiLocal #ModelAi #AiModel
Please open Telegram to view this post
VIEW IN TELEGRAM
🥴1
Модель: Tencent-HY-MT1.5 с двумя моделями перевода — 1,8 млрд и 7 млрд параметров! Модель 1.8B занимает менее 2Гб. и можно запустить в любом смартфоне!

Обе модели ориентированы на поддержку взаимного перевода между 33 языками и учитывают 5 этнических и диалектных вариаций.
HY-MT1.5-7B — это улучшенная версия чемпионской модели WMT25, оптимизированная для пояснительного перевода и сценариев со смешанными языками, с новой поддержкой терминологического вмешательства, контекстного и форматированного перевода.
Несмотря на то, что параметры HY-MT1.5-1.8B составляют менее трети от параметров HY-MT1.5-7B, производительность перевода у HY-MT1.5-1.8B сопоставима с более крупной моделью, обеспечивая высокую скорость и качество. После квантования модель 1.8B может быть развернута на периферийных устройствах и поддерживать сценарии перевода в реальном времени, что делает ее широко применимой.
Основные характеристики:
🔹 1,8B: оптимизировано для потребительского оборудования с объемом памяти 1 ГБ. Благодаря распределению в соответствии с политикой для согласования с более крупными моделями обеспечивается задержка 0,18 с (50 токенов), что превосходит показатели основных коммерческих API.
🔹 7B SOTA Performance: улучшенная версия чемпиона WMT25, превосходящая модели с открытым исходным кодом среднего размера и конкурирующая с 90% таких гигантов с закрытым исходным кодом, как Gemini-3.0-Pro.
🔹 Более 33 языков и диалектов: высокоточный перевод на 33 языка и 5 диалектов китайского.
🔹 Готовность к использованию: встроенная поддержка пользовательской терминологии, контекста длинных диалогов и сохранение форматирования документов.

Демо: https://hunyuan.tencent.com/chat/
Все Модели: https://huggingface.co/collections/tencent/hy-mt15

HY-MT1.5-7B
https://huggingface.co/tencent/HY-MT1.5-7B
GGUF: https://huggingface.co/tencent/HY-MT1.5-7B-GGUF - Q8_0=7,98 ГБ

HY-MT1.5-1.8B https://huggingface.co/tencent/HY-MT1.5-1.8B
GGUF https://huggingface.co/tencent/HY-MT1.5-1.8B-GGUF - Q8_0=1.91 GB

Проект: https://github.com/Tencent-Hunyuan/HY-MT - тут список языков, включая Русский, Казахский, Украинский, ...!
Обсуждение на Reddit.
#Tencent #HYMT157B #HYMT1518B #LocalAi #AiLocal #ModelAi #AiModel #WMT2 #AiTranslate #AiПеревод
Please open Telegram to view this post
VIEW IN TELEGRAM
🤗1
This media is not supported in your browser
VIEW IN TELEGRAM
📺 Превращаем любой запутанный интерфейс в пошаговое руководство с помощью демонстрации экрана и Локальной LLM

Screen Vision — веб-сайт с открытым исходным кодом, который помогает выполнять любые задачи с помощью демонстрации экрана и ИИ! Вписываем задачу, ИИ разбивает ее на шаги и пишет куда надо кликнуть... ИИ "смотрит" на экран и подсказывает пошагово! Отличная идея!

- С заботой о конфиденциальности: данные с вашего экрана никогда не сохраняются и не используются для обучения моделей.

- Поддержка локальных LLM: если вы не доверяете облачным API, в приложении есть «локальный режим», который подключается к локальным моделям ИИ, работающим на вашем компьютере. Ваши данные никогда не покинут ваш компьютер.

- Web-Native: не требуется установка настольного приложения или расширения. Работает прямо в вашем браузере!
Как это работает:
Система проста:
1) Вы описываете свою цель — «Я хочу настроить двухфакторную аутентификацию в своей учетной записи Google»
2) Вы показываете свой экран — приложение использует встроенную в браузер функцию демонстрации экрана (та же технология, что и для видеозвонков)
3) ИИ анализирует увиденное — языковые модели Vision смотрят на ваш экран и определяют текущее состояние
4) Вы получаете по одной инструкции за раз — никакой информационной перегрузки. Просто «нажмите синюю кнопку «Настройки» в правом верхнем углу» или «прокрутите вниз, чтобы найти раздел «Безопасность»»
5) Автоматическое определение прогресса — когда вы завершаете этап, Screen Vision замечает изменения на экране и автоматически даёт вам следующую инструкцию

- Инструкция: система использует GPT-5.2 для определения следующего логического шага на основе вашей цели и текущего состояния экрана. Эти инструкции затем передаются в Qwen 3VL (30B), который определяет точные координаты экрана для выполнения действия.

- Визуальная проверка: приложение отслеживает изменения на экране каждые 200 мс с помощью цикла сравнения пикселей. При обнаружении изменений оно сравнивает снимки до и после с помощью Gemini 3 Flash, чтобы убедиться, что этап выполнен успешно, прежде чем автоматически перейти к следующей задаче.

Заходим: https://screen.vision в правом верхнем углу кликаем по "Local Mode" и выбираем или "LM Studio" или "Ollama" - рекомендуемая модель: Qwen3 VL 30B Instruct.
Исходный код
: https://github.com/bullmeza/screen.vision
Обсуждение на Reddit.
#screenvision #AiLocal #LocalAi #WebAi #AiWeb
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1👎1
🔈 Ultimate Vocal Remover GUI v5.6 - для удаления вокала из аудиофайлов.

Для #MacOS (Intel & M-Arm64) #Windows #Linux
Проект: https://github.com/Anjok07/ultimatevocalremovergui

#MDXNetAI #VocalRemover #AiLocal #LocalAi #SowftAi #AiSoft #MDX23C #UVR #ultimatevocalremovergui
Please open Telegram to view this post
VIEW IN TELEGRAM
📃 BentoPDF - Локальный инструмент для работы с PDF

Open-source редактор документов без серверной обработки. Файлы остаются на вашем компьютере — никуда не улетают и никому не передаются.

Функционал:
• Базовое — объединение, разделение, поворот, удаление страниц, кроппинг

• Создание заполняемых форм, водяные знаки, нумерация страниц, редактирование контента

• Конвертация PDF в изображения, текст, JSON и обратно. Работает с Markdown и EPUB

• Шифрование, снятие паролей, цифровая подпись, «санитизация» — удаление скрытых скриптов

• Распознавание текста на сканах для поиска и копирования

Интерфейс быстрый, лимитов на количество файлов нет. Можно развернуть локально через Docker и не платить за Acrobat.

🔗 https://www.bentopdf.com
Проект: https://github.com/alam00000/bentopdf
#bentopdf #AiPDF #LocalAi #AiLocal
🔥1
📱 Convoxa: транскрипция и резюмирование с использованием встроенных моделей Apple!

Convoxa - нативная программа для расшифровки и обобщения текста на iOS.
Характеристики:
- Нативный: 100%
- Размер: 4,8 МБ в двоичном формате.
- Вывод: Использует модели Apple Foundation для локальных сводок.
- 100% локальная расшифровка: Звук никогда не покидает кремниевый чип. Он полностью обрабатывается на устройстве, что исключает утечку конфиденциальных записей.

Режимы гибридного анализа:
- Локальный режим (по умолчанию): использует базовые модели Apple на NPU. Это «чистый» режим — автономный, приватный и бесплатный.
- Облачный режим (необязательно): включается, когда вам требуется более 100 000 контекстов или «передовые» рассуждения. Этот режим работает в соответствии со строгой политикой нулевого хранения данных; мы не сохраняем входные данные и не используем их для обучения.

Скачать: https://apps.apple.com/us/app/convoxa-ai-meeting-minutes/id6755150446
Обсуждение на Reddit.
#Convoxa #App #iOS #iPhone #LocalAi #AiLocal #AiApple #Транскрибация
🎙 WhisperKit Android приносит распознавание речи Whisper прямо на устройство

💥 Компания Argmax, Inc. совместно с Qualcomm AI Hub представила WhisperKit Android — экспериментальное решение для автоматического распознавания речи, работающее напрямую на Android-устройствах. Проект расширяет фреймворк WhisperKit, ранее доступный на платформах Apple.

🧠 WhisperKit Android использует модели OpenAI Whisper для транскрипции аудио непосредственно на устройстве. Весь процесс выполняется локально, без отправки данных на внешние серверы. API помечен как экспериментальный и требует явного согласия разработчика на использование.

📊 Возможности:
— локальное распознавание речи (on-device processing)
— поддержка моделей Whisper от tiny до large
— высокая точность за счёт оптимизации ASR-пайплайна
— удобный API для интеграции в Android-приложения
— экспериментальный статус с возможными изменениями API

🎯 WhisperKit Android отражает тренд на перенос ASR-задач с облака на устройство. Это повышает конфиденциальность, снижает задержки и делает приложения независимыми от качества сети, что особенно важно для мобильных и офлайн-сценариев.

🔗 Пример: https://play.google.com/store/apps/details?id=com.argmaxinc.whisperax
Источник: https://github.com/argmaxinc/WhisperKitAndroid/
Еще пример: whisperIME
Еще есть подборка: https://github.com/sindresorhus/awesome-whisper/
Приложения:
Aiko — приложение для аудиозаписи и расшифровки для iOS и macOS.
MacWhisper — приложение для аудиозаписи и расшифровки для macOS. (премиум-версия)
Whisper Memos — приложение для аудиозаписи и расшифровки для iOS. (премиум-версия)
FourYou — приложение для аудиожурнала для iOS.
Jojo Transcribe — приложение для аудиозаписи и расшифровки для macOS.
Buzz — приложение для аудиозаписи и перевода для macOS.
WhisperScript — приложение для аудиозаписи и расшифровки для macOS. (Freemium · Electron)
Audio Podium — приложение для управления аудио/видео на macOS.
superwhisper — глобальное приложение для расшифровки аудио на macOS.
Speech Note — приложение для расшифровки аудио на Linux.
FridayGPT — приложение для диктовки на macOS, работающее на базе OpenAI API.
EasyWhisper — приложение для Windows и macOS для расшифровки аудио и определения говорящего. (Freemium)
Audio Note — расшифровка аудио в реальном времени на macOS и Windows. (Freemium · Electron)
Whisper — приложение для Android для расшифровки и перевода. (FOSS)
VoiceInk — приложение для macOS для диктовки и расшифровки. (FOSS)
Ito AI — голосовая диктовка с помощью ИИ для Mac. (FOSS)
OpenSuperWhisper — приложение для macOS для диктовки (FOSS).

#WhisperKit #Android #WhisperAX #Whisper #Транскрибация #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Media is too big
VIEW IN TELEGRAM
🎙 FreePodcastTranscription - Локальный сервис для транскрибации аудио 🗣

Если нужно быстро перевести в текст надиктованное аудио или если вы больше любите читать, нежели слушать, то вот вам в помощь невероятно простой и удобный сервис с очевидным названием — freepodcasttranscription.

Почему рекомендуем?
- Полностью бесплатный
- Полностью Локальный - все работает в браузере!
- Не нужно логиниться
- Поддерживает русский язык
- Есть десктопное приложение
- Поддерживает любые форматы аудиофайлов
- Результат в .txt, .srt, .pdf.
- Супер простой интерфейс!

А полученный текст потом можно загнать в ИИ, исправить ошибки (а они присутствуют, чего уж) и вытащить из него все что душе угодно. 🙌
#Транскрибация #WebAI #Whisper #MacOS
Please open Telegram to view this post
VIEW IN TELEGRAM