very vibe coding
120 subscribers
463 photos
126 videos
13 files
993 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
А в то же время лидером по скачиванию на Hugging Face становится VibeThinker-1.5B, крошечная модель, которая размышляет на уровне got-oss-20B. Можно ставить буквально на любом компе
Forwarded from Data Secrets
⚡️ У OpenAI свежая модель для кодинга: GPT-5.1-Codex-Max

Видимо, они хотят хотя бы немного перебить хайп вокруг Gemini. Вот что в релизе действительно интересного:

1️⃣ Это первый Codex, обученный работать в Windows и, в частности, в Powershell. Теперь модель разбирается в особенностях Windows-окружения, структуре файловой системы и тд.

Также для Windows появился Agent mode, с помощью которого агент может работать в терминале автономно (доступы можно настраивать).

2️⃣ Заявляют, что модель может непрерывно самостоятельно работать над задачами более 24 часов! Невероятно, если правда (хотя Anthropic для своей Sonnet 4.5 вообще декларировали 30 часов).

«Претрейн и test-time не уперлись в стену» – написал Ноам Браун про релиз. Это он намекает, что масштабирование продолжается.


При этом благодаря новой фишке – «компакции» – Codex теперь может работать с огромными контекстами. Это как бы аналог краткосрочной и долгосрочной памяти. Когда лимит токенов контекстного окна близок, модель сжимает самую старую информацию, а затем вместе с этой выжимкой + последней актуальной информацией переходит в новое контекстное окно. Процесс может повторяться много раз.

3️⃣ Метрики. На SWE-bench Verified GPT-5.1-Codex-Max (xhigh) показывает 77.9% точности. Это лучше, чем у Gemini 3 и Claude Sonnet 4.5, то есть сота. При этом модель теперь еще больше экономит токены. На среднем уровне рассуждений она достигает результатов предыдущей версии, потребляя на 30% меньше токенов.

Уже доступно в IDE и Codex CLI, в API завезут «soon»

openai.com/index/gpt-5-1-codex-max/
Please open Telegram to view this post
VIEW IN TELEGRAM
Media is too big
VIEW IN TELEGRAM
✔️ HunyuanVideo 1.5 - новая открытая модель для генерации видео, которая сейчас считается самым сильным open-source решением в этой области.

Построенная на архитектуре DiT, модель поднимает планку по качеству и доступности.

Что важно:
⚡️ Всего 8.3B параметров - модель можно запускать даже на потребительских GPU с 14GB VRAM
🖥️ Качество: генерирует 5–10 секунд видео в 480p/720p, а через суперразрешение —ё- до 1080p с киношной детализацией

SOTA-качество с очень низкими требованиями к железу.

🟠Проект: hunyuan.tencent.com/video/zh
🟠GitHub: github.com/Tencent-Hunyuan/HunyuanVideo-1.5
🟠Hugging Face: huggingface.co/tencent/HunyuanVideo-1.5

@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Вообще, на этой неделе Сбер и AIRI прекрасно выступили, запустив кучу русскоязычных опенсорсных моделей. Обязательно буду их пробовать
Replit дает бесплатный доступ к своим агентам на ограниченное время
Forwarded from Data Secrets
This media is not supported in your browser
VIEW IN TELEGRAM
О, вышел Cursor 2.1

– Добавили функцию «Find Issues»: поиск и исправление багов по одной кнопке. Агент делает ревью кода и тут же показывает найденные проблемы в боковой панели. В течение этой недели фичу можно тестить бесплатно.

– Напоминаем, что в Cursor недавно обновили поиск, и теперь он работает на базе векторов (как именно, мы писали тут). Так что для любителей пользоваться старым добрым grep его вынесли отдельно. Работает почти мгновенно и ищет по всей кодовой базе, включая точные совпадения и регулярки.

– Улучшили режим планирования. Теперь агент будет задавать уточняющие вопросы, когда вы утверждаете план действий, и отвечать на них можно прямо в новом интерактивном режиме (выглядит прикольно, пример на видео).

Раскрывают постепенно на всех пользователей (ченчлог)
Forwarded from Denis Sexy IT 🤖
Я тут понял, что второй после ChatGPT AI-продукт который я использую, это Google AI Studio: https://aistudio.google.com/

Я уже нахваливал его пару раз в канале, но в этот раз хотел отдельно рассказать про их кодинг агента который живет под неприметным "Build": https://aistudio.google.com/app/apps

Это что-то вроде бесплатного Lovable, эта фигня не просто соберет вам красивую веб страницу, но она умеет в GenAI пайплайны, в том числе к генерации картинок – вот строительные блоки к которым имеет доступ агент:

🔍 Google Search 

🌐 Google Maps

🟦 Function Declarations (Вы можете сделать свой тул для модели который будет вызываться аппом когда он считает нужным)

✍️ Текст и общие задачи:
gemini-2.5-flash
gemini-3-pro-preview
gemini-flash-lite-latest

🍎 Изображения:
gemini-2.5-flash-image
gemini-3-pro-image-preview (новая нана банана)
imagen-4.0-generate-001

🎬 Видео:
veo-3.1-fast-generate-preview
veo-3.1-generate-preview

🔊 Аудио и речь:
gemini-2.5-flash-native-audio-preview-09-2025
gemini-2.5-flash-preview-tts


Самое клевое, что вы не просто можете один раз вызвать LLM (как в обычном режиме Playground), вы можете заставить ее отвечать в Structured Output (на картинке детали параметров), поменять температуру, и другие настройки семплинга - и даже сделать пайплайн, где ответ от одной модели попадает на вход в другую модель

Если у вас в голове есть идея "А что если отряд LLM-агентов работал бы над какой-то задачей" и все кодинг фреймворки кажутся душными чтобы быстро проверить, вам сюда

Единственное ограничено, которое вы встретите в какой-то момент – это лимит бесплатных запросов в N времени; для того чтобы это снять, можно подключить свой API ключ через кнопку 🔑 и сможете вайбкодить сложные пайплайны которые делают 1000 запросов в минуту к какой-то Gemini Flash 2.5, что за глаза хватает для почти всех идей и стоит копейки (точно также я подключил Nano Banana Pro, потому что она без API ключа в AI Studio не работает)

Короче, Gemini апп мне не нравится, а вот AI Studio реально для АИ инженеров делают, шикарный продукт

P.S. Есть забавный баг, в какой-то момент их агент начинает забывает редактировать код – а пишет будто редактирует, нужно на него накричать капсом и все заведется 💡
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
Forwarded from Machinelearning
🌟 LLM Council: на ваши запросы отвечает совет из языковых моделей.

Андрей Карпаты опять выходит на связь опубликовал очередной vibecode проект.

Его идея в том, что вместо того, чтобы задавать вопрос одной LLM, вы можете объединить их в «Совет моделей».

LLM Council - это простое локальное веб-приложение, с интерфейсом как у ChatGPT, но с той разницей, что запрос отправляется через Openrouter нескольким LLM. Полученные ответы перекрестно оцениваются и ранжируются, и, наконец, «модель-председатель совета» формирует окончательный ответ.

Более подробно процесс выглядит так:

🟢Этап 1: Сбор мнений. 
Запрос отправляется всем моделям по отдельности, и их ответы собираются. Ответы каждой модели отображаются в отдельной вкладке, чтобы можно было их посмотреть вручную.

🟢Этап 2: Рецензирование. 
Каждая модель получает ответы других моделей. При этом идентификаторы анонимизированы, чтобы исключить «игру в любимчиков» при оценке чужих результатов. На этом этапе ответы ранжируются их по точности и глубине анализа.

🟢Этап 3: Итоговый ответ. 
Модель-председатель принимает все ответы моделей и компилирует их в единый окончательный ответ.


⚠️ Для использования нужен API-ключ OpenRouter. На платформе есть бесплатные модели


🖥Github


@ai_machinelearning_big_data

#AI #ML #LLMCouncil #Github
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1
Супер быстрый поиск по файлам и директориям

https://www.voidtools.com/
Forwarded from Сиолошная
https://www.anthropic.com/news/claude-opus-4-5

Claude Opus 4.5 таки смог взять 80% на SWE-bench Verified!

Бонусом в модель добавили effort control — прямо как у OpenAI: high, medium, low, дольше думает = лучше решает.

На бенчмарках... ВНЕЗАПНО ждём, потому что цена упала до $5/$25 за миллион токенов (в 3 раза).
Очередная маленькая умная моделька - надо будет попробовать ее в OCR задачках.

Особенно интересно, что сделана она на основе Qwen-2.5 VL 7B, которую я использую..
Forwarded from Silero News
Мы опубликовали стабильный, быстрый, качественный и доступный синтез для 20 языков России и СНГ

0️⃣ Популярные языки из 🇷🇺🇺🇦🇺🇿🇰🇿🇦🇿🇹🇯🇧🇾🇬🇪🇰🇬🇦🇲;
1️⃣ Всего 20 языков России и стран СНГ, всего 95 голосов;
2️⃣ Модели компактные и быстрые, как наши прошлые релизы;
3️⃣ Поддержка SSML, генерация аудио с SR 8000, 24000, 48000;
4️⃣ Два типа моделей - base под лицензией MIT на наших данных и ext на данных сообщества;
5️⃣ Остались непокрытыми языки Дагестана и ЧР, если хотите помочь с добавлением этих языков пишите на @silero_job.

⭐️Репозиторий - github.com/snakers4/silero-models
⬆️Статья на Хабре - habr.com/ru/articles/968988/
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Machinelearning
⚡️ HunyuanOCR: открытая OCR-модель, которая рвёт бенчмарки при размере всего 1B

Tencent выложила в open-source новую модель HunyuanOCR.

Это компактная, быстрая и полностью готовая end-to-end система для OCR, построенная на мультимодальной архитектуре Hunyuan.

Главное - при размере только 1 миллиард параметров она показывает результаты уровня крупных моделей и стоит в разы дешевле в запуске.

⚡ Топ по бенчмаркам
• 860 на OCRBench среди всех моделей до 3B
• 94.1 на OmniDocBench - лучший результат в задачах распознованяисложных документов

🌐 Что умеет HunyuanOCR
Модель закрывает практически все типы OCR задач
• текст на улицах, витринах, табличках
• рукописный текст и художественные шрифты
• сложные документы: таблицы, формулы, встроенный HTML и LaTeX
• субтитры в видео
• перевод текста на фото end-to-end сразу на 14 языков

Это не каскадный пайплайн, а единое решение
Один запрос и одно инференс-прогон дают готовый результат.

Это быстрее, надёжнее и удобнее, чем традиционные OCR-цепочки.

📌 Project Page
web: https://hunyuan.tencent.com/vision/zh?tabIndex=0
mobile: https://hunyuan.tencent.com/open_source_mobile?tab=vision&tabIndex=0
🔗 GitHub
https://github.com/Tencent-Hunyuan/HunyuanOCR
🤗 Hugging Face
https://huggingface.co/tencent/HunyuanOCR
📄 Technical Report
https://github.com/Tencent-Hunyuan/HunyuanOCR/blob/main/HunyuanOCR_Technical_Report.pdf

@ai_machinelearning_big_data


#HunyuanOCR #TencentAI #OCR #VisionAI #DeepLearning #Multimodal #AIModels #OpenSourceAI #ComputerVision #DocumentAI
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
Microsoft выпустил Fara-7B на основе Qwen-2.5 VL 7B. Модель для агентов, самостоятельно работающих на компе. Любопытно
❤2👍1
Forwarded from Refat Talks: Tech & AI
Куда на самом деле движется индустрия LLM (спойлер: вы выбираете не модель - вы выбираете стек).

Пост навеян свежим релизом Opus 4.5, а именно ее доп фичами как Context Editing - нам показывают действительно впечатляющие демки… Но постойте - это же (очередная) не-фича foundation модели. Это не что-то в весах. Это инфраструктурный middleware, который живет между вами и моделью. И если вы проанализируете (особенно глазами разработчика) релизы последнего года, то вы увидите что мы все дальше от бога от LLM как модели, и тем ближе к LLM как infrastructure-as-a-service. Давайте поговорим, куда нас ведет индустрия и что из этого следует, но начнем с начала.

Большинство людей (в том числе многие разработчики) когда говорят про условный ChatGPT не видят весь спектр между "моделью" и "продуктом" - ведь это одновременно и foundation model, и старый добрый completions API, и вполне себе агентный Responses API c Code Interpreter, File Search (RAG прямо в "модельке", ага) и т.д.

Что на самом деле продают вендоры

OpenAI Responses API - это целая инфра, включая NoSQL БД для истории, хранилище файлов и тд. Вы отдали им state management.

Code Interpreter и Code Execution - это PaaS: managed sandbox - $0.03 за сессию платите за инфру, не за "умную модель".

Claude Context Editing - middleware с настраиваемой стратегией pruning (keep last 3 tool uses, clear 5000+ tokens). Оркестрация, а не интеллект.

Google Grounding и Maps tool - dynamic retrieval: модель решает нужен ли поиск, генерит queries, получает доступ к индексу (глубже публичного API), делает reranking, отдает с citations. Вы покупаете gateway к индексу, не модель.

Даже Structured Outputs - это частично заслуга инфры, а не весов - constrained decoding через CFG (конвертит JSON Schema в грамматику, маскирует невалидные токены). Компилятор поверх модели.

Большинство не осознают, как растет пропасть между проприетарными infrastructure-as-a-service от OpenAI/Google/Anthropic и голыми весами open-source моделей. Проприетарные LLM превращаются из inference провайдеров в операционки для intelligence.

Что из этого следует и что следует иметь в виду

1. Понимать уровни зависимости, я выделяю три:
- State (Threads, File API, memory) - критический lock-in, вы не владеете памятью системы
- Execution (Code Interpreter, sandboxes) - средний lock-in, нужна своя инфра для рантайма
- Behavior (Grounding, Computer Use) - средне-высокий, модель часто обучена под "свои" инструменты

Перед использованием любой фичи спрашивайте: "Где живут данные? Кто контролирует логику? Смогу ли я воспроизвести это сам?"

2. Integration Tax vs Migration Tax - ключевая асимметрия. Проприетарные фичи дают быстрый старт, но стоимость выхода растет экспоненциально. Это не обязательно плохо - это trade-off, который нужно делать осознанно.

3. Разделять Core и периферию
Core (ваша уникальная ценность, основа продукта) - инвестируйте в независимость: свой state management, своя оркестрация и тд.
Пример: AI-агент для support как продукт - владение историей диалогов критично, а вот Code Interpreter для внутренней аналитики - это ок.

4. Есть обратная сторона. Чем глубже расходятся продуктовые слои провайдеров, тем сложнее делать model-agnostic продукты, которые работают так же хорошо. Manus поняли это рано - выжали максимум из Anthropic, не пытаясь быть совместимыми со всеми, и сделали продукт-звезду. Возможно, по той же причине Claude Code так хорош?

5. Учитывайте свою стадию. 0→1 (поиск PMF) - максимально используйте проприетарные фичи, скорость важнее. Когда растете - можно строить абстракции: gateway, свой state для core функций. На стадии масштабирования - еще больше контроля и взаимозаменяемости компонентов (interoperability это дорого).

Главное

Проприетарные AI-платформы - это managed infrastructure, как AWS. Вы платите не только деньгами, но и зависимостью. И этот тренд будет расти. Часто это правильный trade-off, особенно на старте. Но это решение нужно принимать с открытыми глазами - понимать, какую часть системы отдаете "в управление", и делать это осознанно для каждого компонента продукта.
❤2🔥2👍1
Ждем на днях новую модель - лидера в генерации видео по тексту
❤2