👉 PaddleOCR-VL-1.5: Towards a Multi-Task 0.9B VLM for Robust In-the-Wild Document Parsing
PaddleOCR: The Ultimate Document Solution https://aistudio.baidu.com/paddleocr🔗 https://huggingface.co/PaddlePaddle/PaddleOCR-VL-1.5
GOT-OCR: https://huggingface.co/stepfun-ai/GOT-OCR2_0
Granite-docling-258m: https://huggingface.co/ibm-granite/granite-docling-258M
MinerU 2.5: https://huggingface.co/opendatalab/MinerU2.5-2509-1.2B
OCRFlux: https://huggingface.co/ChatDOC/OCRFlux-3B
MonkeyOCR-pro:
- 1.2B: https://huggingface.co/echo840/MonkeyOCR-pro-1.2B
- 3B: https://huggingface.co/echo840/MonkeyOCR-pro-3B
RolmOCR: https://huggingface.co/reducto/RolmOCR
Nanonets OCR: https://huggingface.co/nanonets/Nanonets-OCR2-3B
dots OCR: https://huggingface.co/rednote-hilab/dots.ocr https://modelscope.cn/models/rednote-hilab/dots.ocr-1.5
olmocr 2: https://huggingface.co/allenai/olmOCR-2-7B-1025
Light-On-OCR: https://huggingface.co/lightonai/LightOnOCR-2-1B
Chandra: https://huggingface.co/datalab-to/chandra
Chandra OCR 2 https://huggingface.co/datalab-to/chandra-ocr-2
Jina vlm: https://huggingface.co/jinaai/jina-vlm
HunyuanOCR: https://huggingface.co/tencent/HunyuanOCR
Bytedance Dolphin 2: https://huggingface.co/ByteDance/Dolphin-v2
Deepseek OCR 2: https://huggingface.co/deepseek-ai/DeepSeek-OCR-2
GLM OCR: https://huggingface.co/zai-org/GLM-OCR
Nemotron OCR: https://huggingface.co/nvidia/nemotron-ocr-v1
Qianfan-OCR: https://huggingface.co/baidu/Qianfan-OCR
#OCR #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
This media is not supported in your browser
VIEW IN TELEGRAM
Все пишут одни и те же системные запросы и конфигурации с нуля. Ни у кого нет удобного места, где можно было бы поделиться тем, что действительно работает.
Поэтому создали репозиторий с открытым исходным кодом с подсказками для агентов, правилами для курсора, конфигурациями для Claude, настройками для локальных моделей. Вы можете внести свой вклад или воспользоваться тем, что предложили другие...
Непрерывная синхронизация настроек вашего ИИ с помощью одной команды. Кодовая база с адаптированными навыками агентов, MCP и конфигурационными файлами для Claude Code, Cursor и Codex.
https://github.com/caliber-ai-org/ai-setup
(Обсуждение)
#AiAgent #AgentAi #MCP #caliberai #aisetup #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
🌎 Parchi - ИИ , который живет в вашем браузере.
Parchi — это агент на боковой панели, который читает страницы, заполняет формы, нажимает на кнопки и переключает вкладки. Просто скажите ему, что нужно делать.
🔗 https://parchi.ai
https://github.com/0xSero/parchi - тут есть API URL для настройки.
⬇️ Ставится как Расширение в Chrome.
Наглядно в ВИДЕО - похоже на Comet Perplexity!
#Parchi #ParchiAi #AiAgent #AgentAi #LocalAi #AiLocal
Parchi — это агент на боковой панели, который читает страницы, заполняет формы, нажимает на кнопки и переключает вкладки. Просто скажите ему, что нужно делать.
https://github.com/0xSero/parchi - тут есть API URL для настройки.
Наглядно в ВИДЕО - похоже на Comet Perplexity!
#Parchi #ParchiAi #AiAgent #AgentAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
Полностью локальный голосовой ИИ для iOS. Никаких облачных сервисов, никаких API-ключей, никакого интернета после настройки. STT → LLM → TTS, трансляция в реальном времени на вашем iPhone.
Характеристики:
- Полностью работает на устройстве, используя нейронный процессор, графический процессор и центральный процессор
- Голосовые разговоры в реальном времени
- Прерывание разговора на середине предложения (бардж-ин)
- Аппаратная функция подавления эха, чтобы микрофон не улавливал собственный звук
- При первом запуске загружаются все модели (~2,3 ГБ) с указанием прогресса загрузки для каждой модели
(Обсуждение)
#Volocal #STT #TTS #App #iPhone #FluidAudio #AiVoice #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Elato Local поддерживает многоязычную речь в реальном времени с клонированием голоса и работает на чипах Apple Silicon без отправки данных в облако. Наглядно в ВИДЕО!
Самые продвинутые голоса ИИ в одном гаджете!
Полностью открытый исходный код. Неограниченные приключения, игры, викторины и персонажи с искусственным интеллектом. Смотрите ВИДЕО
#ElatoLocal #ESP32 #OpenToys #CharacterAI #STT #Whisper #ASR #TTS #Qwen3TTS #Chatterbox #AiVoice #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1
This media is not supported in your browser
VIEW IN TELEGRAM
Представьте себе рабочий стол в вашем браузере и искусственный интеллект, который знает, как пользоваться всеми приложениями на нем.
Что такое VibeApps?
VibeApps превращает ваш браузер в полноценный рабочий стол: окна, которые можно перетаскивать и изменять их размер, приложения, которые можно открывать рядом друг с другом, — и все это в чистом интерфейсе в стиле macOS. Но главное отличие — ИИ-агент.
Вместо того чтобы листать меню, просто скажите, что вам нужно:
«Сыграйте что-нибудь джазовое» — и в музыкальном приложении заиграет музыка.
«Запишите в дневник о сегодняшнем походе» — откроется дневник, появится новая запись.
«Давайте сыграем в шахматы» — доска готова.
Агент не просто запускает приложения — он управляет ими. Он считывает данные, запускает действия и обновляет состояние с помощью структурированной системы действий, понятной каждому приложению.
Все работает локально в вашем браузере. Никакого бэкенда, никаких учетных записей, никаких проблем с настройкой. Ваши данные остаются в IndexedDB, там, где им и место.
Встроенные приложения:
🎵 Музыка - Полнофункциональный плеер с плейлистами, элементами управления воспроизведением и обложками альбомов
♟ Шахматы - Классические шахматы с соблюдением всех правил
⚫️ Гомоку - «Пять в ряд» — простые правила, глубокая стратегия
🃏 FreeCell - Пасьянс, в котором главное — мастерство, а не удача
📧 Электронная почта - Входящие, отправленные, черновики — привычный интерфейс электронной почты
📔 Дневник - Дневник с отслеживанием настроения, чтобы фиксировать свои впечатления от дня
🐦 Twitter - Социальная лента, которую вы действительно контролируете
Альбом 📷 - Просматривайте и систематизируйте свои фотоколлекции
📰 CyberNews - Будьте в курсе событий с помощью тщательно отобранного агрегатора новостей
Каждое приложение полностью интегрировано с ИИ-агентом, то есть вы можете взаимодействовать с любым из них с помощью естественного языка.
(Обсуждение)
#OpenRoom #VibeApps #macOS #AiAgent #AgentAi #AiGames #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Local Ai
🤖 Ai2 выпустил открытого браузерного агента MolmoWeb
Команда Molmo запустила open-source агента для браузера. Работает на моделях Molmo 2 (4B и 8B параметров).
Агент анализирует страницу через скриншот и сам решает, куда кликнуть, что ввести и где проскроллить. Для безопасности доступа к паролям и финансам у него нет.
По результатам четырёх бенчмарков — лучший среди открытых решений. Обходит агентов на GPT-4o и побеждает OpenAI CUA в трёх из четырёх тестов.
🔗 https://allenai.org/blog/molmoweb
🔗 https://github.com/allenai/molmoweb
🔗 https://huggingface.co/collections/allenai/molmoweb
🔗 https://playground.allenai.org
#MolmoWeb #MolmoWeb4B #MolmoWeb8B #Molmo2 #LocalAi #AiLocal
Команда Molmo запустила open-source агента для браузера. Работает на моделях Molmo 2 (4B и 8B параметров).
Агент анализирует страницу через скриншот и сам решает, куда кликнуть, что ввести и где проскроллить. Для безопасности доступа к паролям и финансам у него нет.
По результатам четырёх бенчмарков — лучший среди открытых решений. Обходит агентов на GPT-4o и побеждает OpenAI CUA в трёх из четырёх тестов.
#MolmoWeb #MolmoWeb4B #MolmoWeb8B #Molmo2 #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
Найди цену, прочитай статью, разберись с сайтом — и всё это локально без VPN, без подписки и без слежки. Модель работает прямо на твоём компьютере Windows или Mac.
Возможности:
Делает реальные задачи, не просто отвечает!
- Поиск в интернете
Находит актуальную информацию, читает страницы, собирает данные из нескольких источников.
- Работа в браузере
Открывает сайты, заполняет формы, взаимодействует со страницами как человек.
- Модель на твоём ПК
AI-модель запускается прямо на твоём компьютере — даже при плохом интернете. Никаких чужих серверов, никакой зависимости от зарубежных сервисов.
- Выбор модели
Три режима: быстрый (1.7B), сбалансированный (4B) и мощный (8B). Выбирай под задачу — прямо в интерфейсе.
- История чатов
Все разговоры сохраняются на твоём компьютере. Переключайся, переименовывай, возвращайся к старым диалогам.
- Загрузка файлов
Загружай PDF и TXT прямо в чат. Дока прочитает документ и ответит на вопросы по его содержимому — без облака, без утечек.
- Бесплатно навсегда
Базовые возможности бесплатны без ограничений по времени. Никаких подписок.
Примеры задач:
Что можно попросить прямо сейчас:
◎ Найди последние новости про санкции и кратко объясни что изменилось
Ищет по нескольким открытым источникам, собирает в понятный ответ
◈ Открой эту статью и перескажи главное за минуту
Читает страницу по ссылке и выдаёт краткое резюме без лишней воды
◇ Переведи этот английский текст и выдели три главные мысли
Переводит и структурирует — без копипасты в переводчик и обратно
◉ Как получить загранпаспорт через Госуслуги? Какие документы нужны?
Читает актуальные инструкции прямо с официального сайта — никаких устаревших данных
○ Что пишут в открытых источниках об этой компании? Ищу туда работу
Ищет отзывы, новости и упоминания — даёт честную картину до собеседования
◌ Объясни простыми словами что означают эти пункты в договоре аренды
Разбирает юридический текст на человеческий язык, указывает на подводные камни
◫ Напиши вежливый ответ на негативный отзыв о моём магазине
Составит корректный ответ в нужном тоне — хоть для Wildberries, хоть для 2ГИС
◆ «Помоги написать претензию в магазин на русском, по закону о защите прав потребителей»
Составляет документ на понятном русском — без юридического птичьего языка
◪ Вот PDF договора — есть там подводные камни? На что обратить внимание?
Читает загруженный документ и выделяет спорные пункты. Файл остаётся только на твоём компьютере
◫ Возобновим вчерашний разговор — что мы решили про бюджет?
История чатов сохраняется локально — можно вернуться к любому диалогу в любой момент
(Подробный пост Автора)
https://github.com/babikov/doka-site
#dokaai #doka #Windows #MacOS #SoftAi #AiSoft #AiAgent #AgentAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1👎1
This media is not supported in your browser
VIEW IN TELEGRAM
Это версия #Jan с встроенным Google TurboQuant для тех, у кого мало ОЗУ! (На 1-м запуске модель можно не скачивать, а потом ее импортировать, если есть скачанные ранее!)
Первый с Встроенный Google TurboQuant!
- В 8 раз быстрее
TurboQuant вычисляет внимание в 8 раз быстрее, чем стандартные 32-битные модели на графических процессорах H100, поэтому вы получаете ответы в режиме реального времени при любом масштабе.
- В 6 раз Меньше памяти
Кэш KV сжимается как минимум в 6 раз без потери качества, что значительно снижает затраты на инфраструктуру.
- Нулевая Потеря Точности
Сжато до 3 бит — без переобучения, тонкой настройки и снижения производительности модели.
Разработчики исправили llama.cpp с помощью нового метода сжатия TurboQuant от Google, а затем запустили Qwen 3.5–9B на обычном MacBook Air (M4, 16 ГБ) с контекстом из 20 000 токенов.
Раньше на этом устройстве практически невозможно было обрабатывать большие контекстные запросы. Но с новым алгоритмом это стало возможным. Представьте, что вы можете бесплатно использовать OpenClaw на обычном устройстве! Для этого нужен всего лишь MacBook Air или Mac Mini, даже не самая дорогая модель Pro. Он все еще немного тормозит, но новые чипы ускоряют работу.
Графический интерфейс создан на основе Jan, лицензия MIT это позволяет. Однако в llama.cpp добавлен алгоритм Google, который работает вместе с графическим интерфейсом.
(Обсуждение)
Для iPhone/iPad: https://apps.apple.com/de/app/atomic-chat-private-local-ai/id6761720226?l=en-GB
Для Android https://play.google.com/store/apps/details?id=chat.atomic.app
#atomicchat #atomic #GoogleTurboQuant #TurboQuant #MacOS #iPhone #iPad #Android #SoftAi #AiSoft #AiAgent #AgentAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3
This media is not supported in your browser
VIEW IN TELEGRAM
Yagami предлагает вам:
- Агентный веб-поиск: search, search-advanced, code, company, similar
- Детерминированная экстракция: fetch (browse & present)
- Асинхронный глубокий агентный веб-поиск: deep start / deep check
В этом демонстрационном видео используется Yagami MCP, управляемый qwen3.5-9b через vLLM.
Есть расширение pi-yagami-search, которое заменяет Exa!
(Обсуждение)
#Yagmi #Exa #AiAgent #AgentAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
🔍 OpenResearcher — опенсорсный агент на 30B параметров для глубоких исследований
OpenResearcher — это полностью открытая агентная языковая модель (30B-A3B), предназначенная для долгосрочных глубоких исследований. Она демонстрирует впечатляющую точность 54,8% на BrowseComp-Plus, превосходя по этому показателю GPT-4.1, Claude-Opus-4, Gemini-2.5-Pro, DeepSeek-R1 и Tongyi-DeepResearch. Полностью открыли исходный код для обучения и оценки, включая данные, модель, методологию обучения и систему оценки, чтобы каждый мог заниматься глубокими исследованиями.
Модель заточена под анализ больших объёмов информации и построение структурированных выводов.
Nvidia Nemotron интегрировал OpenResearcher в свои инструменты. Модель доступна на GitHub и Hugging Face — можно запустить локально или потестить в демо.
🔗 https://github.com/TIGER-AI-Lab/OpenResearcher
🔗 https://huggingface.co/OpenResearcher/OpenResearcher-30B-A3B
🔗 https://huggingface.co/spaces/OpenResearcher/OpenResearcher
#OpenResearcher #DeepResearch #AiModel #ModelAi #LocalAi #AiLocal
OpenResearcher — это полностью открытая агентная языковая модель (30B-A3B), предназначенная для долгосрочных глубоких исследований. Она демонстрирует впечатляющую точность 54,8% на BrowseComp-Plus, превосходя по этому показателю GPT-4.1, Claude-Opus-4, Gemini-2.5-Pro, DeepSeek-R1 и Tongyi-DeepResearch. Полностью открыли исходный код для обучения и оценки, включая данные, модель, методологию обучения и систему оценки, чтобы каждый мог заниматься глубокими исследованиями.
Модель заточена под анализ больших объёмов информации и построение структурированных выводов.
Nvidia Nemotron интегрировал OpenResearcher в свои инструменты. Модель доступна на GitHub и Hugging Face — можно запустить локально или потестить в демо.
#OpenResearcher #DeepResearch #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Список программ, позволяющих осуществлять поиск в интернете с помощью искусственного интеллекта:
Список организован в виде временной шкалы и содержит программы, поддерживающие следующие сценарии использования:
- Веб-поиск с обобщением результатов с помощью больших языковых моделей и уточняющими вопросами.
- Чат с большими языковыми моделями с поддержкой веб-поиска через вызов функций.
- Веб-исследования с помощью агентов для создания отчетов.
#awesomeaiwebsearch #aiwebsearch
Please open Telegram to view this post
VIEW IN TELEGRAM
GitHub
GitHub - felladrin/awesome-ai-web-search: List of software that allows searching the web with the assistance of AI: https://hf…
List of software that allows searching the web with the assistance of AI: https://hf.co/spaces/felladrin/awesome-ai-web-search - felladrin/awesome-ai-web-search
Собственная функция преобразования речи в текст для вашего Mac с возможностью диктовки на уровне всей системы, расшифровкой файлов, подсказками, профилями, историей, словарем и фрагментами.
Транскрибируйте аудио с помощью встроенных в устройство моделей искусственного интеллекта или облачных API (Groq, OpenAI), а затем обрабатывайте результат с помощью пользовательских подсказок для больших языковых моделей. Ваши голосовые данные остаются на вашем Mac с локальными моделями — или вы можете использовать облачные API для более быстрой обработки.
Транскрипция:
- Восемь движков — WhisperKit (более 99 языков, потоковая передача, перевод), Parakeet TDT v3 (25 европейских языков, очень быстрая), Apple SpeechAnalyzer (macOS 26+, загрузка модели не требуется), Qwen3 ASR (на основе MLX), Voxtral (локальный Voxtral Mini 4B, на основе MLX), Groq Whisper, OpenAI Whisper и OpenAI Compatible (любой API, совместимый с OpenAI)
- На устройстве или в облаке — вся обработка выполняется локально на вашем Mac или с использованием API Groq/OpenAI Whisper для более быстрой обработки.
- Предварительный просмотр трансляции — частичная расшифровка в режиме реального времени во время разговора (WhisperKit)
- Транскрипция файла — пакетная обработка нескольких аудио- и видеофайлов с помощью перетаскивания
- Экспорт субтитров — экспорт расшифровок в формате SRT или WebVTT с указанием временных меток.
- Словарь — термины повышают точность распознавания речи. Функция исправления автоматически устраняет распространенные ошибки при расшифровке. Автоматическое обучение на основе исправлений, внесенных вручную. Включает импортируемые наборы терминов!
(Windows Beta и iOS Alpha доступны для предварительного тестирования.)
Список Дополнений: https://www.typewhisper.com/en/addons/ (Движки скачиваются в этом разделе)
(Обсуждение)
#TypeWhisper #Траснкрибация #Диктовка #WhisperKit #Whisper #Parakeet #Voxtral #Qwen3ASR #ASR #MacOS #SoftAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Больше не нужно ждать, пока ваш Mac загрузится.
Встроенный в macOS сервер MLX с интеллектуальным кэшированием. Claude Code, OpenClaw и Cursor отвечают за 5 секунд, а не за 90.
Создано с учетом того, как на самом деле работают агенты.
Агенты кодирования аннулируют кэш KV десятки раз за сеанс. oMLX сохраняет каждый блок кэша на твердотельном накопителе, поэтому, когда агент возвращается к предыдущему префиксу, он восстанавливается с диска за миллисекунды, а не пересчитывается с нуля.
«Модели Qwen3.5, работающие на oMLX, настолько быстрые, что запускать локальный ИИ на Mac имеет смысл. Он намного быстрее, чем LMStudio, а вызовы инструмента гораздо надежнее».
❓ Чем oMLX отличается от Ollama или LM Studio?
Ollama и LM Studio кэшируют состояние KV в памяти, но при смене контекста в середине сеанса — что постоянно происходит при использовании агентов для написания кода — весь кэш становится недействительным и пересчитывается с нуля. oMLX сохраняет каждый блок кэша KV на SSD, поэтому ранее кэшированные фрагменты всегда можно восстановить. Время до первого результата сокращается с 30–90 секунд до менее чем 5 секунд при работе с длинными контекстами.
❓ Какие модели поддерживаются?
Любая модель в формате MLX от HuggingFace. К ним относятся Qwen, LLaMA, Mistral, Gemma, DeepSeek, MiniMax, GLM и другие. Модели логического вывода (DeepSeek, MiniMax, Qwen) автоматически обрабатывают тег <think>. С версии 0.2.0 поддерживаются визуально-языковые модели с тем же постраничным кэшированием на твердотельных накопителях.
#omlxai #oMLX #Ollama #LMStudio #MLX #MacOS #SoftAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
Детерминированный эталонный монитор с функцией изоляции для локальных рабочих процессов с использованием ИИ-агентов. Его цель — обеспечить безопасную среду для работы вашего агента без риска повреждения ваших данных и личной информации.
У вашего агента есть реальное рабочее пространство для реальной работы, рискованные пересечения границ блокируются или требуют согласования, а каждое важное решение сопровождается квитанцией, чтобы вы могли видеть, что произошло, и не нависать над ним весь день, как встревоженный спасатель.
В настоящее время он поддерживает Openclaw, Claude Code и OpenCode, а также сеть TailScale и телеграм-канал (для OpenClaw используется встроенный телеграм-канал).
(Обсуждение)
#AgentRuler #AiAgent #AgentAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
Компания Cohere выпустила свою первую модель преобразования речи в текст, которая теперь возглавляет рейтинг OpenASR (для английского языка, но модель поддерживает 14 различных языков).
Есть демонстрационная версия на WebGPU: запустить модель полностью локально прямо в браузере!
Ссылка на демонстрационную версию (+ исходный код):
(Обсуждение)
#CohereTranscribe #Transcribe #Транскрибация #STT #WebGPU #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM