very vibe coding
120 subscribers
463 photos
126 videos
13 files
994 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Forwarded from Machinelearning
⚡️ HunyuanOCR: открытая OCR-модель, которая рвёт бенчмарки при размере всего 1B

Tencent выложила в open-source новую модель HunyuanOCR.

Это компактная, быстрая и полностью готовая end-to-end система для OCR, построенная на мультимодальной архитектуре Hunyuan.

Главное - при размере только 1 миллиард параметров она показывает результаты уровня крупных моделей и стоит в разы дешевле в запуске.

⚡ Топ по бенчмаркам
• 860 на OCRBench среди всех моделей до 3B
• 94.1 на OmniDocBench - лучший результат в задачах распознованяисложных документов

🌐 Что умеет HunyuanOCR
Модель закрывает практически все типы OCR задач
• текст на улицах, витринах, табличках
• рукописный текст и художественные шрифты
• сложные документы: таблицы, формулы, встроенный HTML и LaTeX
• субтитры в видео
• перевод текста на фото end-to-end сразу на 14 языков

Это не каскадный пайплайн, а единое решение
Один запрос и одно инференс-прогон дают готовый результат.

Это быстрее, надёжнее и удобнее, чем традиционные OCR-цепочки.

📌 Project Page
web: https://hunyuan.tencent.com/vision/zh?tabIndex=0
mobile: https://hunyuan.tencent.com/open_source_mobile?tab=vision&tabIndex=0
🔗 GitHub
https://github.com/Tencent-Hunyuan/HunyuanOCR
🤗 Hugging Face
https://huggingface.co/tencent/HunyuanOCR
📄 Technical Report
https://github.com/Tencent-Hunyuan/HunyuanOCR/blob/main/HunyuanOCR_Technical_Report.pdf

@ai_machinelearning_big_data


#HunyuanOCR #TencentAI #OCR #VisionAI #DeepLearning #Multimodal #AIModels #OpenSourceAI #ComputerVision #DocumentAI
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
Microsoft выпустил Fara-7B на основе Qwen-2.5 VL 7B. Модель для агентов, самостоятельно работающих на компе. Любопытно
❤2👍1
Forwarded from Refat Talks: Tech & AI
Куда на самом деле движется индустрия LLM (спойлер: вы выбираете не модель - вы выбираете стек).

Пост навеян свежим релизом Opus 4.5, а именно ее доп фичами как Context Editing - нам показывают действительно впечатляющие демки… Но постойте - это же (очередная) не-фича foundation модели. Это не что-то в весах. Это инфраструктурный middleware, который живет между вами и моделью. И если вы проанализируете (особенно глазами разработчика) релизы последнего года, то вы увидите что мы все дальше от бога от LLM как модели, и тем ближе к LLM как infrastructure-as-a-service. Давайте поговорим, куда нас ведет индустрия и что из этого следует, но начнем с начала.

Большинство людей (в том числе многие разработчики) когда говорят про условный ChatGPT не видят весь спектр между "моделью" и "продуктом" - ведь это одновременно и foundation model, и старый добрый completions API, и вполне себе агентный Responses API c Code Interpreter, File Search (RAG прямо в "модельке", ага) и т.д.

Что на самом деле продают вендоры

OpenAI Responses API - это целая инфра, включая NoSQL БД для истории, хранилище файлов и тд. Вы отдали им state management.

Code Interpreter и Code Execution - это PaaS: managed sandbox - $0.03 за сессию платите за инфру, не за "умную модель".

Claude Context Editing - middleware с настраиваемой стратегией pruning (keep last 3 tool uses, clear 5000+ tokens). Оркестрация, а не интеллект.

Google Grounding и Maps tool - dynamic retrieval: модель решает нужен ли поиск, генерит queries, получает доступ к индексу (глубже публичного API), делает reranking, отдает с citations. Вы покупаете gateway к индексу, не модель.

Даже Structured Outputs - это частично заслуга инфры, а не весов - constrained decoding через CFG (конвертит JSON Schema в грамматику, маскирует невалидные токены). Компилятор поверх модели.

Большинство не осознают, как растет пропасть между проприетарными infrastructure-as-a-service от OpenAI/Google/Anthropic и голыми весами open-source моделей. Проприетарные LLM превращаются из inference провайдеров в операционки для intelligence.

Что из этого следует и что следует иметь в виду

1. Понимать уровни зависимости, я выделяю три:
- State (Threads, File API, memory) - критический lock-in, вы не владеете памятью системы
- Execution (Code Interpreter, sandboxes) - средний lock-in, нужна своя инфра для рантайма
- Behavior (Grounding, Computer Use) - средне-высокий, модель часто обучена под "свои" инструменты

Перед использованием любой фичи спрашивайте: "Где живут данные? Кто контролирует логику? Смогу ли я воспроизвести это сам?"

2. Integration Tax vs Migration Tax - ключевая асимметрия. Проприетарные фичи дают быстрый старт, но стоимость выхода растет экспоненциально. Это не обязательно плохо - это trade-off, который нужно делать осознанно.

3. Разделять Core и периферию
Core (ваша уникальная ценность, основа продукта) - инвестируйте в независимость: свой state management, своя оркестрация и тд.
Пример: AI-агент для support как продукт - владение историей диалогов критично, а вот Code Interpreter для внутренней аналитики - это ок.

4. Есть обратная сторона. Чем глубже расходятся продуктовые слои провайдеров, тем сложнее делать model-agnostic продукты, которые работают так же хорошо. Manus поняли это рано - выжали максимум из Anthropic, не пытаясь быть совместимыми со всеми, и сделали продукт-звезду. Возможно, по той же причине Claude Code так хорош?

5. Учитывайте свою стадию. 0→1 (поиск PMF) - максимально используйте проприетарные фичи, скорость важнее. Когда растете - можно строить абстракции: gateway, свой state для core функций. На стадии масштабирования - еще больше контроля и взаимозаменяемости компонентов (interoperability это дорого).

Главное

Проприетарные AI-платформы - это managed infrastructure, как AWS. Вы платите не только деньгами, но и зависимостью. И этот тренд будет расти. Часто это правильный trade-off, особенно на старте. Но это решение нужно принимать с открытыми глазами - понимать, какую часть системы отдаете "в управление", и делать это осознанно для каждого компонента продукта.
❤2🔥2👍1
Ждем на днях новую модель - лидера в генерации видео по тексту
❤2
Кстати, один из лидеров по картинкам - Z-Image от Али-Бабы, опенсорс и работает на машинках с 16Гб памяти. Мне кажется, надо брать
❤3👍1🔥1
Forwarded from Machinelearning
🍌 Awesome Nano Banana - лучшие промпты, стили, приёмы и полезные материалы для визуальных экспериментов.

Всё собрано в одном репозиториит и аккуратно структурировано.

Что внутри
• промпты, которые реально дают сильные и выразительные результаты
• коллекция визуальных стилей для разных задач
• примеры, разборы и ресурсы, помогающие глубже понять механику Nano Banana
• удобный набор ссылок, если хочешь расширять свой набор техник

https://github.com/ZeroLu/awesome-nanobanana-pro

@ai_machinelearning_big_data
❤3👍1🔥1
Forwarded from Data Secrets
⚡️ Вышел DeepSeek-Math-V2

С релиза первой версии прошло почти два года. Новую уже никто и не ждал, но релиз, как это часто бывает в случае с DeepSeek, наступил внезапно.

Сразу кратко о результатах:

– Уровень золотой медали на IMO 2025 и CMO 2024 (Chinese Mathematical Olympiad).

– Почти идеальный результат 118/120 на Putnam 2024. Это сверхсложная математическая олимпиада для студентов университетов США и Канады.

– Бенчмарков мало, нет ни MATH, ни GSM8K, ни AIME, вообще почти ничего. Это странновато, но можно пока посмотреть на сравнения с другими моделями на IMO-ProofBench. Видно, что модель довольно уверенно бьет GPT-5 и на сложных задачах выходит на уровень с Gemini 2.5 Pro. Опять же, интересно, что там с Gemini 3, Grok 4 и GPT-5.1.

Теперь заглянем под капот.

Система основана на DeepSeek-V3.2-Exp-Base. Пайплайн состоит из генератора и верификатора.

Доказательство или решение формируется не за раз, а в результате нескольких проходов и улучшений: большая модель генерирует решение -> оно отправляется в модель-верификатор, где тщательно проверяется каждый шаг и ищутся ошибки -> обратная связь от верификатора возвращается генератору -> так доказательство переписывается и улучшается до 16 раз.

При этом в каждой итерации используются и проверяются сразу несколько (до 64) гипотез и вариантов решения. Получается сотни прогонов для одной задачи. Такое вот умное структурированное масштабирование test-time компьюта.

Сколько стоило решение олимпиады – не раскрывают, но видимо немало. Судя по всему, поэтому результатов по бенчмаркам и нет: денег не хватило 😭

Веса | Статья | Репозиторий
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4👍1🔥1
И новоая моделька на 106B параметров - Intellect 3. Честно говоря, пока мало что о ней можно сказать..
❤3👍1
Forwarded from Machinelearning
🌟 ToolOrchestra: буст ИИ-потенциала за счет координации моделей и инструментов.

NVIDIA совместно с Университетом Гонконга разработала ToolOrchestra - методику обучения дирижеров для ИИ-агентов, и выпустила на ее основе модель Orchestrator-8B.

Это модель, базирующаяся на архитектуре Qwen3 предназначена для оркестрации других моделей и инструментов. Вместо того чтобы решать задачу в одиночку, модель чередует этапы рассуждения с вызовом внешних инструментов.

В ее арсенале поисковые движки, интерпретаторы кода и другие LLM, от узкоспециализированных математических до универсальных гигантов Claude и Llama-Nemotron.

Обучение проводилось с помощью GRPO, который поощрял модель не только за точность, но и за экономическую эффективность.

В результате решение получилось в 2,5 раза быстрее и на 70% дешевле в эксплуатации, чем использование одной лишь флагманской модели для всех этапов задачи, а сама Orchestrator-8B набрала 37,1% в сложнейшем бенчмарке Humanity's Last Exam , обойдя GPT-5 (35,1%).


📌Лицензирование кода : Apache 2.0 License.

📌Лицензирование модели: NVIDIA License.


🟡Страница проекта
🟡Модель
🟡Arxiv
🟡Датасет
🖥GitHub


@ai_machinelearning_big_data

#AI #ML #LLM #Orchestrator #NVIDIA
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2
This media is not supported in your browser
VIEW IN TELEGRAM
✔️ Подробный туториал, который показывает, как с нуля собрать собственную систему распознавания аудио прямо на устройстве.

Используется модель LFM2-Audio-1.5B от LiquidAI, а все данные остаются приватными.

Полностью локальный пайплайн, который можно адаптировать под свои задачи и интегрировать где угодно.

Готовый разбор и код - по ссылке:

https://github.com/Liquid4All/cookbook/tree/main/examples/audio-transcription-cli
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3👍1🔥1
Hugging face тут интересное выкладывает. Кстати, народ говорит, что по подписке за 9 баксов в месяц у них можно получить много инференса на открытых моделях. Тем, кому нужна моделька по апи может быть интересно
❤1
Forwarded from Machinelearning
This media is not supported in your browser
VIEW IN TELEGRAM
🤖 Unitree R1 и G1 демонстрируют свои навыки на одной сцене

Выбери своего БОЙЦА:

❤️ Новый, более доступный и компактный R1
или
🔥 Мощный и уже зарекомендовавший себя на рынке G1, который остаётся флагманом линейки.

@ai_machinelearning_big_data

#ai #robots
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥5
CLAUDE.md
3.1 KB
Кстати, сделали тут с Claude Opus 4.5 файл с основыми инструкциями для Claude Code - попытался прописать туда все основные вопросы, с которыми сталкиваюсь. Как и положено для таких промптов, очень кратко - уложились в 100 строк.

Смотрите, может кому пригодится. Положить этот файл надо в директорию .claude в корень (это для маков) - чтобы открыть доступ к этой скрытой директории в корне директории юзера нажмите Cmnd+Shift+.
❤4👍2🔥1
Ну и кстати, вчера сделал свой первый публичный репозиторий в GitHub с небольшой программкой, на которую ссылаюсь в правилах - это передача паролей в программы с использованием Bitwarden (я раньше писал важный пост, о том, как выстроить систему работы с паролями, доступ к которым есть только у вас).

Теперь никакие пароли и API нигде не видны в виде теста. Программы все-равно получают к ним доступ, и модели в рамках запущенных процессов тоже, но извлечь их из них будет сложнее. Порадовало, что я не один такой, есть и аналоги.

Если делать совсем ультимативное решение, то надо делать МСР сервер, который передает ключи по требованию - может и займусь этим, но история более геморная, мне пока это не нужно. Вот когда продукты будут как-то активно использоваться, нужно будет озаботиться.
❤4👍1🔥1