very vibe coding
120 subscribers
463 photos
126 videos
13 files
994 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Forwarded from Data Secrets
Новый день – новые модели: Nvidia выпустили прекрасную Nemotron 3 Nano

В ней 31.6B параметров, но активных всего 3.6B (это MoE). Запустить можно на 24ГБ RAM. Зафайнтюнить – на 60ГБ VRAM.

Контекст – 1 миллион токенов.

По метрикам, внимание, обходит Qwen3-30В-А3В-Thinking и GPT-oss-20B-А4В. Получается, модель не просто конкурентоспособная, но и лучшая в своем классе на многих основных бенчмарках: SWE-bench, GPQA и др.

И еще – моделька очень шустрая, выдает больше 350 токенов в секунду. Это в 2-3 раза быстрее того же Qwen.

Nvidia умеют удивлять.

Веса (+датасеты!) | Статья | Блогпост

P.S. Любителям опенсорса напоминаем, что сегодня также ждем новенькую Gemma-3
Media is too big
VIEW IN TELEGRAM
🔉 Meta SAM Audio: Segment Anything Model Audio

SAM Audio — это “Segment Anything”, но для звука: foundation-модель, которая выделяет любой целевой звук (separation) из микса по промпту (текстом) или по отдельным объектам из видео!

Что может модель:

— Аудио сепарация: целевой объект (человек, машина, инструмент) + все остальное (бэкграунд, шум, пространство, реверберация и эхо)

— Visual prompting: можно привязать звук к объекту на кадре (маской/объектом в видео) и отделять “звук этого объекта” от остальных.

— Span prompting: задаёшь временные якоря, где звук есть/нет и модель сама определяет “что именно считать целевым”.

💻 github + модель SAM Audio
👄
Есть демо: можно потыкать по этой ссылке
Forwarded from Machinelearning
This media is not supported in your browser
VIEW IN TELEGRAM
⚡️ Google Code Wiki.

Google запустила в публичное превью платформу Code Wiki. Инструмент сканирует репозиторий и генерирует живую базу знаний, которая перестраивается автоматически после каждого изменения в коде.

Под капотом - естественно Gemini. Разработчики могут общаться с контекстно-зависимым чат-ботом, который понимает структуру конкретного проекта «от и до».

Code Wiki умеет строить диаграммы архитектуры, объяснять логику работы модулей и мгновенно перенаправлять из вики к конкретным определениям функций.

Сейчас веб-версия работает с публичными репозиториями, но в планах - CLI-расширение для развертывания системы в закрытых корпоративных контурах.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Какое-то бесконечное количество новостей и новых моделей. Вот, например, еще для любителей 3D разразились моделями Microsoft и Apple. Тоже что-то пилят..
Forwarded from Machinelearning
🔍 Mistral представила OCR 3 - новую версию своей AI-системы распознавания документов.

Ключевое:
- Существенный рост качества по сравнению с OCR 2, особенно на формах, таблицах и сложных PDF
- Уверенно работает со сканами, рукописным текстом и нестандартной версткой
- Возвращает структурированный результат, а не просто сырой текст
- Подходит для автоматизации Document AI и downstream-аналитики
- Доступен через API и готов к продакшен-использованию

Главное
- На 74% лучше Mistral OCR 2 при работе с формами, сканированными документами, сложными таблицами и рукописным текстом.

- Точность уровня state-of-the-art: Обходит как корпоративные системы обработки документов, так и современные AI-OCR решения.

- Используется в Document AI Playground:
В Mistral AI Studio появился простой drag-and-drop интерфейс для разбора PDF и изображений в чистый текст или структурированный JSON.


https://mistral.ai/news/mistral-ocr-3

@ai_machinelearning_big_data

#ocr #mistal #llm
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
✔️ GPT-5.2-Codex.

OpenAI представила GPT-5.2-Codex, которую называет самым продвинутым инструментом для реальной программной инженерии на сегодняшний день. Модель получила нативную поддержку сжатия контекста, улучшенную интеграцию с терминалом Windows и способность проводить глубокий рефакторинг крупных репозиториев без потери логической нити.

Ключевой апдейт коснулся сферы безопасности - Codex резко прибавил способностей в анализе защищенности кода. Модель уже доступна платным пользователям ChatGPT, а API будет открыт в ближайшие недели.
openai.com

✔️ xAI представила Grok Voice Agent API.

Компания Илона Маска открыла публичный доступ к Grok Voice Agent API — нативному интерфейсу speech-to-speech для создания голосовых ассистентов. Решение построено на полностью собственной архитектуре, что позволило достичь задержки ответа менее 1 секунды.

API поддерживает вызов внешних инструментов, веб-поиск, прямую интеграцию с телефонией через SIP и понимает более 100 языков. В бенчмарке Big Bench Audio модель заняла 1 место с точностью 92,3%, опередив Gemini 2.5 Flash и GPT Realtime.

Главной фишкой стала ценовая политика: единый тариф составляет $0.05 за минуту. Это значительно дешевле, чем у OpenAI и ElevenLabs.
x.ai

✔️ VS Code получил поддержку стандарта Agent Skills.

В VS Code Insiders появилась поддержка Agent Skills - открытого протокола, разработанного Anthropic. Технология позволяет упаковывать инструкции, скрипты и вспомогательные ресурсы в модули, которыми можно пользоваться в разных ИИ-инструментах.

Главное отличие Agent Skills от привычных кастомных инструкций в функциональности: это не текстовые гайдлайны по стилю кода, а полноценные наборы инструментов для автоматизации задач, которые подгружаются в контекст модели динамически и только при необходимости.

Стандарт дает кросс-платформенность: созданный один раз скилл будет работать одинаково как в интерфейсе редактора, так и в CLI-агентах.
code.visualstudio.com

✔️ Google выпустила T5Gemma 2.

T5Gemma 2 получила серьезные архитектурные изменения по сравнению с первой версией. Чтобы снизить потребление памяти, инженеры внедрили tied word embeddings для энкодера и декодера, а также объединили механизмы self-attention и cross-attention в единый слой. Модели доступны в компактных конфигурациях на 270M, 1B и 4B параметров.

Новинка поддерживает контекстное окно до 128 тыс. токенов и умеет обрабатывать не только текст на 140 языках, но и изображения. В бенчмарках T5Gemma 2 обошла базовую Gemma 3 в задачах на длинный контекст, кодинг и мультимодальное понимание. Модели доступны на Hugging Face и Kaggle для исследовательских целей.
blog.google

✔️ ИИ-подразделение Марка Цукерберга открыло аудио-визуальный энкодер PE-AV.

Perception Encoder Audiovisual (PE-AV) - техническое ядро, лежащее в основе SAM Audio. Это мультимодальная модель, которая объединяет аудио, видео и текст в единое пространство эмбеддингов.

PE-AV умеет извлекать векторы признаков из аудио или видеокадров и формировать совместные аудиовизуальные представления. Это повышает точность в задачах кросс-модального поиска, детекции звуков и глубокого понимания сцен, где важен синхронный контекст изображения и звука.

В открытом доступе - 6 чекпоинтов модели разного размера (от Small до Large) с вариациями по количеству обрабатываемых кадров. Код опубликован на GitHub, а веса - на Hugging Face.
huggingface.co


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from эйай ньюз
Kandinsky 5.0 Video на text-to-video арене

На арене появились результаты моделей Kandinsky 5.0 Video Lite и Pro.

Pro-версия — ТОП-1 открытая модель в мире.

На общем фоне Pro-версия уступает SOTA-моделям от Google, OpenAI, Alibaba и KlingAI. Но можно говорить о паритете с Luma Ray 3 и Minimax Hailuo 2.3 (отрыв по ELO максимум 3 балла, при 95% доверительном интервале оценивания +-21 балла). Lite-версия (2B параметров) оказалась лучше первой версии Sora.

Стоит отметить, что сам факт выхода российской генеративной модели на международную арену и её конкуренция с другими игроками — событие довольно редкое, я бы сказал, неожиданное.

По архитектуре это довольно немаленький (19B) DiT с кросс атеншеном на текст. При этом VAE на базе HunyuanVideo. Генерит в 24fps видео длиной 5 или 10 секунд В HD (1280x768)

Арена
Веса
GitHub
Техрепорт

@ai_newz
Вот это реально правильная штука, скачал себе, установил, но как работает не успел проверить. Тема в том, что теперь Клод поможет с тем, чтобы настроить какие-то вещи в интерфейсах программ. Раньше надо было кидать ему скрины того, что не работает, а теперь он сможет посмотреть сам. Ну круто же!
Любопытная история, для тех, у кого есть автоматизация. Текущая проблема в том, что вызов tools у больших моделей жрет много токенов. Вместо этого берем микро-модель, зафайнтьюненную на конкретные tools. Звучит интересно, хотя танцев с бубном для такой реализации надо будет выше крыши..

https://t.me/mishin_learning/1869
Давно не было новостей от Qwen, а тут такая любопытная моделька - разбивает картинку на отдельные слои. Прикольно, и может быть полезно, когда работаешь с генераторами изображений
Есть такая штука Exo Labs, под которую я купил 3 мак мини и сделал кластер. Все работало, но мое главное разочарование было в том, что можно установить только ограниченный набор не самых новых моделей. И второй момент - из 16 гигабайт памяти операционка съедала 6. Это к тому, что 2 машины по 24 дадут больше памяти, чем 3 по 16.

Так вот, сейчас ребята запустили новый механизм распараллеливания вычислений, который не только объединяет память машин, но и ускоряет вычисления. 2 машины - скорость растет в 1,8 раз (не для каждой модели, но все же).

Моделей все еще мало, но это наживное. Вижу как у народа растет интерес - на 4 мак студио по 1 млн каждый можно с нормальной скоростью запустить ЛЮБОЙ опенсорс.

Да, важное дополнение - для коннекта машин нужно использовать thunderbolt 5, который на MacOS Tahoe 26.2 стал в РАЗЫ быстрее. Я, кстати, использую такие провода для внешних дисков, и это удивительно, как сотни гигабайт копируются за считанные минуты.
❤1
Установил себе такую штуковину, должна сильно экономить память Claude-code при использовании tools, гибко управлять контекстом, в том числе, подгружая результаты работы прошлых сессий. Что-то подобное пытался делать своими руками, посмотрим как работает более промышленное решение. Естественно, opensource
Forwarded from Data Secrets
Ученые из Google обнаружили, что если повторять промпт два раза, качество ответов моделей существенно возрастает

На архиве опубликовали коротенькую статью, в которой исследователи делятся занятным хаком:

если повторять запрос, то есть отправлять промпт в LLM не в виде «<QUERY>», а в виде «<QUERY><QUERY>», качество ответов модели в ~67% случаев статистически значимо улучшается


Важно: это работает только для Non-Reasoning. С ризонингом эффект нейтральный или слегка положительный, так что применять смысла особо нет.

Но вот для Non-Reasoning лайфхак должен быть рабочий, и к тому же очень простой и (почти) бесплатный. Авторы показывают, что количество генерируемых токенов от повтора промпта не растет, как и задержка ответа.

Почему вообще это работает?

Все мы уже выучили, что порядок токенов в промте важен. И это потому, что большинство моделей обучаются каузально, то есть предыдущие токены не получают доступа к следующим. Тут в основе та же логика. Грубо говоря, получается, что какие-то токены в промпте никогда не видят другие, а повторяя запрос, мы эту ассиметрию устраняем -> качество растет.

Почему тогда для ризонеров не канает?

Тут тоже есть объяснение. Просто ризонеры уже самостоятельно научились повторять промпт сами себе (вы точно это замечали). То есть здесь еще одно повторение уже не дает такого импакта, а в случае с не-ризонерами этот эффект мы просто выносим в prefill.

Пользуйтесь: arxiv.org/pdf/2512.14982
❤1
Вышла опенсорсная модель GLM-4.7. Она большая, для кодинга, лучше, чем 4.6 (очевидно), обещают, что лучше Sonnet 4.5 и GPT 5.2.

Что интересно, тарифы начинаются от $3 в месяц, и ее можно встраивать в Claude code как субагента и в кучу других подобных агентов.

Скажем так, вайбкодинг для экономных
А между тем опенсорсным лидером в больших текстовых моделях становится Ernie 5.0 от Baidu.

Бонусом - модель омнимодальная, работает и с аудио, и с видео.