very vibe coding
120 subscribers
463 photos
126 videos
13 files
994 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Все ждут выхода Gemini 3 буквально сегодня. На крайняк - до конца недели..
Тестирую Gemini 3 )) пока тяжело сказать, чем отличается от 2.5, буду судить по ошибкам..

Пытаюсь поставить также Gemini Antigravity - IDE от Google, пока с этим что-то сбоит
Не Gemini 3 единым. Сейчас работаю с несколькими модельками, которые помещаются на компе - для OCR. Если все получится, расскажу подробнее.

Поэтому появление новых маленьких умных моделек, как минимум, интересно. Хотя таким бенчам все-таки тяжело.

Подробнее, что крутого в этой модельке, здесь
По ссылке в сообщении ниже - полезная информация от разработчиков Gemini. Вообще, у Google какая безумная куча всевозможных фишек, настроек, плавунов и пр. - разобраться в этом чрезвычайно тяжело. Тяжело и получить базовые простые апи, токены и пр. (хотя стало легче, чем раньше). Но зато у компании самый широкий спектр моделей, в целом омнимодальность - не удивлен, что Баффет вложился именно в Гугл.

Из того, на что стоит обратить внимание - можно пользоваться последними моделями бесплатно, с очень щедрыми лимитами, но Гугл будет использовать ваши данные. Имейте это ввиду. Антропия и чат ОпенЭйАй тоже пытаются сделать что-то такое, но только у них бесплатного кот наплакал. А Гугл может себе это позволить, понимая, что самое ценное сейчас - данные. Если хочется прайваси, видимо тоже надо заплатить за платную подписку

https://t.me/machinelearning_interview/2335
Очень интересная модель SAM-3 от Meta, которая выделяет что-то на картинке и следит за этим на видео. Пригодится нам для анализа видео с птицами на полигонах ))

И да, опен-сорс!
А в то же время лидером по скачиванию на Hugging Face становится VibeThinker-1.5B, крошечная модель, которая размышляет на уровне got-oss-20B. Можно ставить буквально на любом компе
Forwarded from Data Secrets
⚡️ У OpenAI свежая модель для кодинга: GPT-5.1-Codex-Max

Видимо, они хотят хотя бы немного перебить хайп вокруг Gemini. Вот что в релизе действительно интересного:

1️⃣ Это первый Codex, обученный работать в Windows и, в частности, в Powershell. Теперь модель разбирается в особенностях Windows-окружения, структуре файловой системы и тд.

Также для Windows появился Agent mode, с помощью которого агент может работать в терминале автономно (доступы можно настраивать).

2️⃣ Заявляют, что модель может непрерывно самостоятельно работать над задачами более 24 часов! Невероятно, если правда (хотя Anthropic для своей Sonnet 4.5 вообще декларировали 30 часов).

«Претрейн и test-time не уперлись в стену» – написал Ноам Браун про релиз. Это он намекает, что масштабирование продолжается.


При этом благодаря новой фишке – «компакции» – Codex теперь может работать с огромными контекстами. Это как бы аналог краткосрочной и долгосрочной памяти. Когда лимит токенов контекстного окна близок, модель сжимает самую старую информацию, а затем вместе с этой выжимкой + последней актуальной информацией переходит в новое контекстное окно. Процесс может повторяться много раз.

3️⃣ Метрики. На SWE-bench Verified GPT-5.1-Codex-Max (xhigh) показывает 77.9% точности. Это лучше, чем у Gemini 3 и Claude Sonnet 4.5, то есть сота. При этом модель теперь еще больше экономит токены. На среднем уровне рассуждений она достигает результатов предыдущей версии, потребляя на 30% меньше токенов.

Уже доступно в IDE и Codex CLI, в API завезут «soon»

openai.com/index/gpt-5-1-codex-max/
Please open Telegram to view this post
VIEW IN TELEGRAM
Media is too big
VIEW IN TELEGRAM
✔️ HunyuanVideo 1.5 - новая открытая модель для генерации видео, которая сейчас считается самым сильным open-source решением в этой области.

Построенная на архитектуре DiT, модель поднимает планку по качеству и доступности.

Что важно:
⚡️ Всего 8.3B параметров - модель можно запускать даже на потребительских GPU с 14GB VRAM
🖥️ Качество: генерирует 5–10 секунд видео в 480p/720p, а через суперразрешение —ё- до 1080p с киношной детализацией

SOTA-качество с очень низкими требованиями к железу.

🟠Проект: hunyuan.tencent.com/video/zh
🟠GitHub: github.com/Tencent-Hunyuan/HunyuanVideo-1.5
🟠Hugging Face: huggingface.co/tencent/HunyuanVideo-1.5

@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Вообще, на этой неделе Сбер и AIRI прекрасно выступили, запустив кучу русскоязычных опенсорсных моделей. Обязательно буду их пробовать
Replit дает бесплатный доступ к своим агентам на ограниченное время
Forwarded from Data Secrets
This media is not supported in your browser
VIEW IN TELEGRAM
О, вышел Cursor 2.1

– Добавили функцию «Find Issues»: поиск и исправление багов по одной кнопке. Агент делает ревью кода и тут же показывает найденные проблемы в боковой панели. В течение этой недели фичу можно тестить бесплатно.

– Напоминаем, что в Cursor недавно обновили поиск, и теперь он работает на базе векторов (как именно, мы писали тут). Так что для любителей пользоваться старым добрым grep его вынесли отдельно. Работает почти мгновенно и ищет по всей кодовой базе, включая точные совпадения и регулярки.

– Улучшили режим планирования. Теперь агент будет задавать уточняющие вопросы, когда вы утверждаете план действий, и отвечать на них можно прямо в новом интерактивном режиме (выглядит прикольно, пример на видео).

Раскрывают постепенно на всех пользователей (ченчлог)
Forwarded from Denis Sexy IT 🤖
Я тут понял, что второй после ChatGPT AI-продукт который я использую, это Google AI Studio: https://aistudio.google.com/

Я уже нахваливал его пару раз в канале, но в этот раз хотел отдельно рассказать про их кодинг агента который живет под неприметным "Build": https://aistudio.google.com/app/apps

Это что-то вроде бесплатного Lovable, эта фигня не просто соберет вам красивую веб страницу, но она умеет в GenAI пайплайны, в том числе к генерации картинок – вот строительные блоки к которым имеет доступ агент:

🔍 Google Search 

🌐 Google Maps

🟦 Function Declarations (Вы можете сделать свой тул для модели который будет вызываться аппом когда он считает нужным)

✍️ Текст и общие задачи:
gemini-2.5-flash
gemini-3-pro-preview
gemini-flash-lite-latest

🍎 Изображения:
gemini-2.5-flash-image
gemini-3-pro-image-preview (новая нана банана)
imagen-4.0-generate-001

🎬 Видео:
veo-3.1-fast-generate-preview
veo-3.1-generate-preview

🔊 Аудио и речь:
gemini-2.5-flash-native-audio-preview-09-2025
gemini-2.5-flash-preview-tts


Самое клевое, что вы не просто можете один раз вызвать LLM (как в обычном режиме Playground), вы можете заставить ее отвечать в Structured Output (на картинке детали параметров), поменять температуру, и другие настройки семплинга - и даже сделать пайплайн, где ответ от одной модели попадает на вход в другую модель

Если у вас в голове есть идея "А что если отряд LLM-агентов работал бы над какой-то задачей" и все кодинг фреймворки кажутся душными чтобы быстро проверить, вам сюда

Единственное ограничено, которое вы встретите в какой-то момент – это лимит бесплатных запросов в N времени; для того чтобы это снять, можно подключить свой API ключ через кнопку 🔑 и сможете вайбкодить сложные пайплайны которые делают 1000 запросов в минуту к какой-то Gemini Flash 2.5, что за глаза хватает для почти всех идей и стоит копейки (точно также я подключил Nano Banana Pro, потому что она без API ключа в AI Studio не работает)

Короче, Gemini апп мне не нравится, а вот AI Studio реально для АИ инженеров делают, шикарный продукт

P.S. Есть забавный баг, в какой-то момент их агент начинает забывает редактировать код – а пишет будто редактирует, нужно на него накричать капсом и все заведется 💡
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
Forwarded from Machinelearning
🌟 LLM Council: на ваши запросы отвечает совет из языковых моделей.

Андрей Карпаты опять выходит на связь опубликовал очередной vibecode проект.

Его идея в том, что вместо того, чтобы задавать вопрос одной LLM, вы можете объединить их в «Совет моделей».

LLM Council - это простое локальное веб-приложение, с интерфейсом как у ChatGPT, но с той разницей, что запрос отправляется через Openrouter нескольким LLM. Полученные ответы перекрестно оцениваются и ранжируются, и, наконец, «модель-председатель совета» формирует окончательный ответ.

Более подробно процесс выглядит так:

🟢Этап 1: Сбор мнений. 
Запрос отправляется всем моделям по отдельности, и их ответы собираются. Ответы каждой модели отображаются в отдельной вкладке, чтобы можно было их посмотреть вручную.

🟢Этап 2: Рецензирование. 
Каждая модель получает ответы других моделей. При этом идентификаторы анонимизированы, чтобы исключить «игру в любимчиков» при оценке чужих результатов. На этом этапе ответы ранжируются их по точности и глубине анализа.

🟢Этап 3: Итоговый ответ. 
Модель-председатель принимает все ответы моделей и компилирует их в единый окончательный ответ.


⚠️ Для использования нужен API-ключ OpenRouter. На платформе есть бесплатные модели


🖥Github


@ai_machinelearning_big_data

#AI #ML #LLMCouncil #Github
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1
Супер быстрый поиск по файлам и директориям

https://www.voidtools.com/
Forwarded from Сиолошная
https://www.anthropic.com/news/claude-opus-4-5

Claude Opus 4.5 таки смог взять 80% на SWE-bench Verified!

Бонусом в модель добавили effort control — прямо как у OpenAI: high, medium, low, дольше думает = лучше решает.

На бенчмарках... ВНЕЗАПНО ждём, потому что цена упала до $5/$25 за миллион токенов (в 3 раза).
Очередная маленькая умная моделька - надо будет попробовать ее в OCR задачках.

Особенно интересно, что сделана она на основе Qwen-2.5 VL 7B, которую я использую..
Forwarded from Silero News
Мы опубликовали стабильный, быстрый, качественный и доступный синтез для 20 языков России и СНГ

0️⃣ Популярные языки из 🇷🇺🇺🇦🇺🇿🇰🇿🇦🇿🇹🇯🇧🇾🇬🇪🇰🇬🇦🇲;
1️⃣ Всего 20 языков России и стран СНГ, всего 95 голосов;
2️⃣ Модели компактные и быстрые, как наши прошлые релизы;
3️⃣ Поддержка SSML, генерация аудио с SR 8000, 24000, 48000;
4️⃣ Два типа моделей - base под лицензией MIT на наших данных и ext на данных сообщества;
5️⃣ Остались непокрытыми языки Дагестана и ЧР, если хотите помочь с добавлением этих языков пишите на @silero_job.

⭐️Репозиторий - github.com/snakers4/silero-models
⬆️Статья на Хабре - habr.com/ru/articles/968988/
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Machinelearning
⚡️ HunyuanOCR: открытая OCR-модель, которая рвёт бенчмарки при размере всего 1B

Tencent выложила в open-source новую модель HunyuanOCR.

Это компактная, быстрая и полностью готовая end-to-end система для OCR, построенная на мультимодальной архитектуре Hunyuan.

Главное - при размере только 1 миллиард параметров она показывает результаты уровня крупных моделей и стоит в разы дешевле в запуске.

⚡ Топ по бенчмаркам
• 860 на OCRBench среди всех моделей до 3B
• 94.1 на OmniDocBench - лучший результат в задачах распознованяисложных документов

🌐 Что умеет HunyuanOCR
Модель закрывает практически все типы OCR задач
• текст на улицах, витринах, табличках
• рукописный текст и художественные шрифты
• сложные документы: таблицы, формулы, встроенный HTML и LaTeX
• субтитры в видео
• перевод текста на фото end-to-end сразу на 14 языков

Это не каскадный пайплайн, а единое решение
Один запрос и одно инференс-прогон дают готовый результат.

Это быстрее, надёжнее и удобнее, чем традиционные OCR-цепочки.

📌 Project Page
web: https://hunyuan.tencent.com/vision/zh?tabIndex=0
mobile: https://hunyuan.tencent.com/open_source_mobile?tab=vision&tabIndex=0
🔗 GitHub
https://github.com/Tencent-Hunyuan/HunyuanOCR
🤗 Hugging Face
https://huggingface.co/tencent/HunyuanOCR
📄 Technical Report
https://github.com/Tencent-Hunyuan/HunyuanOCR/blob/main/HunyuanOCR_Technical_Report.pdf

@ai_machinelearning_big_data


#HunyuanOCR #TencentAI #OCR #VisionAI #DeepLearning #Multimodal #AIModels #OpenSourceAI #ComputerVision #DocumentAI
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1