very vibe coding
121 subscribers
463 photos
126 videos
13 files
991 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Forwarded from Data Secrets
Праздник опенсорса (теперь уже официального) продолжается: Google намекают, что сегодня выйдет Gemma 4 🔥
Forwarded from Неискусственный интеллект (Илья Склюев)
Компактная LLM впервые вошла в топ-3 бенчмарка MERA

Новая Cotype Light 3 на 9 млрд параметров обошла на русскоязычных задачах даже модели на 100+ млрд параметров, набрав 0,792 балла из 1,0. Разрыв с Qwen3-235B-A22B на 235 млрд составил всего 0,003 в пользу последнего.

В MWS AI говорят, что их модель одинаково точно работает с текстом и визуальными данными в едином контексте: может обрабатывать договоры, технические чертежи, формы, изображения. За счёт этого на Cotype Light 3 удобно строить специализированных агентов: они смогут самостоятельно решать большие задачи на корпоративных материалах.

Фокус в релизе сделали на возможность дообучения под отраслевую специфику и развёртывания в закрытом контуре. Модель в стандартной точности (FP16/BF16) занимает около 18 ГБ видеопамяти. Это позволяет запускать инференс Cotype Light 3 на одном серверном ускорителе — без многокарточных конфигураций и специализированных кластеров.

В ходе тестирования MWS AI также подтвердила полную совместимость моделей семейства Cotype со всеми компонентами отечественных ПАКов, включая «Машину ИИ» от Скала^р (продукт Группы Rubytech).

@anti_agi
⚡️ Карпати собрал второй мозг на LLM

Андрей Карпаты, один из самых влиятельных людей в мире AI, поделился подходом, который может изменить то, как мы работаем с информацией. Он перестал тратить токены LLM на написание кода и переключился на нечто более интересное: построение персональных баз знаний с помощью языковых моделей.

Идея простая, но мощная. Карпаты собирает сырые данные из разных источников (статьи, научные работы, репозитории, датасеты, изображения) в директорию raw/.

Затем LLM инкрементально “компилирует” из этого вики – коллекцию .md файлов с четкой структурой директорий. Модель сама создает саммари, обратные ссылки, категоризирует данные по концептам, пишет статьи для каждого из них и связывает все между собой. Для конвертации веб-статей в .md файлы он использует расширение Obsidian Web Clipper, а все связанные изображения скачивает локально, чтобы LLM мог к ним обращаться.

В качестве IDE выступает Obsidian. Через него Карпаты просматривает сырые данные, скомпилированную вики и визуализации. Важный момент: LLM пишет и поддерживает все данные вики самостоятельно, человек почти не трогает это руками. Плюс Obsidian-плагины вроде Marp позволяют рендерить данные в других форматах, например в слайды.

Еще один крутой прием - LLM-«линтинг» вики. Модель прогоняет проверки здоровья базы, находит противоречивые данные, заполняет пробелы через веб-поиск, обнаруживает интересные связи для новых статей и постепенно повышает целостность данных.

Следующий логичный шаг - синтетическая генерация данных и файнтюнинг, чтобы LLM «знала» данные в своих весах, а не только через контекстное окно. Карпати считает, что здесь есть место для нового крутого продукта, а не просто набора скриптов. И с этим сложно не согласиться.

https://uproger.com/karpati-sobral-vtoroj-mozg-na-llm/

🐍 полезные ресурсы 🚀Max

@machinelearning_interview
Все ругают Антропик за отказ запускать OpenClaw через Claude, но вот возможность подключить к OpenClaw Claude code через acpx никуда не делась… у меня все так и работает. Агент сидит на GPT-5.4, но может вызывать и Claude, и Gemini

https://t.me/ai_machinelearning_big_data/9812
Forwarded from Неискусственный интеллект (Илья Склюев)
Claude, ты варвар

Посторонись, ИИ-редактор Паши Дурова! В дело вступили реальные игроки. Пользователи выяснили, что чат-бот Anthropic в режиме "пещерного человека" тратит в разы меньше токенов почти во всех задачах: например, 45 против 180 токенов в обычном веб-поиске.

Причина? Claude просто не расходует ресурсы на объяснение своих действий. «Задача. Готово. Забирай. Проблема удалить, пока». Никакой вежливости и лишних расшаркиваний. Только суть, только хардкор.

@anti_agi
В ближайшее время опять ждем: DeepSeek 4, GPT - 5.5. Ну и ответ от Антропика. Это должно быть очень круто
Очередной конкурент для Gemma 4 на основе Qwen 3.5 для запуска на машинках с 24-32гб памяти
⚡️ Хочешь собрать GPU с нуля - вот настоящий появился симулятор Mvidia

Нашли для вас сайт, где можно пройти весь путь железа руками. Без теории ради теории, а через интерактив.

• Начинаешь с базы
движение электронов, транзисторы, логика

• Дальше собираешь уровни выше
логические схемы, ALU, простой процессор

• До GPU ещё не дошли
блоки про шейдеры и графику пока в разработке, но фундамент уже есть

На Hacker News проект активно хвалят, особенно за подачу и понятную прогрессию

Хороший способ наконец понять, как всё это реально устроено под капотом, а не на уровне абстракций

Сначала проходишь симулятор потом уже думаешь, как построить Nvidia 2.0

https://jaso1024.com/mvidia/
🚀 GigaChat 3.1 Ultra и GigaChat 3.1 Lightning в опенсорс под MIT лицензией!

Обе модели
• Обучены с нуля — без инициализации зарубежными весами
• MoE + MTP + MLA
• Совместимы с HuggingFace, llama.cpp / vLLM / SGLang

Код и веса уже на платформе GitVerse.

Это не просто релиз весов, а результат большой инженерной работы над качеством, alignment и стабильностью модели. В блоге команда поделилась результатами и своими наработками.
В релизе: высокие результаты на аренах, улучшенный function calling, решённая проблема циклов, DPO в нативном FP8, найденный и зарепорченный баг в SGLang при dp > 1.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
У китайцев на работе начался крысиный тренд — они пытаются использовать ИИ, чтобы уволить своих коллег и сохранить свои рабочие места.

Принцип такой: сотрудники обучают нейронки выполнять задачи своих коллег, а потом идут к начальству предлагают заменить их на ИИ. То же самое делают и сами корпорации — пытаются обучить нейросети, чтобы сэкономить на рабочей силе.

Из-за распространения тенденции умельцы даже изобрели инструмент сопротивления — 反蒸馏 Skill (anti-distill). Сервис добавляется в Claud и мешает нейронке качественно писать тексты и выполнять работу. По итогу она выдаёт с виду красивый текст, который на практике нельзя использовать.
Forwarded from Dealer.AI
Дизайнер Лилло и Stitch, или как навести мосты между разработкой и UI.

В двух словах. Google Stitch (тот самый вайб-дизайн) придумал новый стандарт DESIGN.md. Представлен открытый GitHub-репозиторий с готовыми примерами, чтобы начать пользоваться этим стандартом без лишних усилий и побыстрее. 🤙

🧐 Что такое Google Stitch DESIGN.md?

DESIGN.md — это единый Markdown-файл, который содержит всю информацию о визуальном языке проекта: цвета, типографику, отступы, правила оформления компонентов и даже примеры того, что можно и чего нельзя делать.

Раньше передать дизайн от дизайнера к разработчику или объяснить AI ваши визуальные предпочтения было непросто. Теперь вы просто кладёте файл DESIGN.md в корень проекта, и любой AI-агент (Google Stitch, Claude Code, Cursor, Gemini и другие) сможет прочитать его и создавать интерфейсы, строго следующие заданным правилам.

🚀 Чем полезен для Google Stitch DESIGN.md?

· Единый источник обмена: Файл становится главным документом, который одновременно понимают и дизайнеры, и разработчики, и AI.
· AI-нативный формат: AI отлично понимает Markdown, поэтому ему не нужно разбирать сложные JSON-схемы или экспорты из Figma.
· Мгновенное применение: Вы просто копируете файл в проект и указываете AI его использовать. Ваш любимый редактор сразу начнёт генерировать UI в нужной стилистике.

🛠️ Чем полезен Awesome DESIGN.md от VoltAgent?

Этот репозиторий – готовая библиотека таких файлов, собранная с реально существующих сайтов. Он позволяет вам не создавать дизайн-систему с нуля, а взять за основу уже проверенные решения от ведущих IT-компаний.

· Повышение качества MVP. Вы можете скопировать стиль проверенного продукта (например, Stripe или Linear) и быть уверенными, что ваш прототип будет выглядеть профессионально.
· Обучение на примерах. Изучая эти файлы, вы можете понять, как устроены визуальные языки лучших продуктов, и создать свой на основе этих знаний.
· Быстрый старт и A/B-тесты. Вы можете моментально переключаться между разными визуальными стилями, просто заменяя файл DESIGN.md и заново генерируя интерфейс.

💎 Как это работает вместе и с чего начать?

Схема работы выглядит так:

1. Вы идёте на GitHub-репозиторий VoltAgent и выбираете стиль, который вам нравится.
2. Копируете файл DESIGN.md из папки этого стиля в корень вашего проекта.
3. Запускаете вашего AI-ассистента (например, с помощью Google Stitch или Claude Code) и просите его «создать страницу, используя стиль из DESIGN.md».
4. AI анализирует файл и генерирует код, который идеально соответствует заданным правилам.

Вуаля. Вы получили эскиз, проверили, подвайб-редактили, ну или вручную, и го брр на прод.😮‍💨
В общем, тема. Ускоряемся. 👍
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Machinelearning
This media is not supported in your browser
VIEW IN TELEGRAM
🌟 VoxCPM2: открытая 2B TTS-модель на 30 языках.

VoxCPM2 - крупное обновление открытой системы синтеза речи VoxCPM.

Модель обучена на более 2 млн. часов мультиязычных аудиоданных и поддерживает 30 языков, включая русский, китайский, английский, японский, корейский, арабский и хинди (плюс 9 диалектов китайского).

За проектом стоит OpenBMB, структура при Университете Цинхуа, объединяющая академическую лабораторию THUNLP и коммерческую компанию ModelBest.

THUNLP - одна из сильнейших академических групп по LLM в Азии, которой руководит легенда китайского NLP, профессор Maosong Sun.

OpenBMB известна сериями CPM, MiniCPM, AgentCPM и фреймворками BMTrain и OpenPrompt.


🟡В второй версии VoxCPM отказались от дискретной токенизации аудио.

В отличие современных TTS-систем, VoxCPM2 работает напрямую с непрерывными представлениями в латентном пространстве AudioVAE V2.

Пайплайн состоит из 4 стадий: LocEnc, TSLM, RALM и LocDiT. На выходе - аудио с частотой 48 кГц студийного качества: асимметричная архитектура AudioVAE V2 принимает референс на 16 кГц и повышает разрешение без внешнего апсемплера.

🟡Обновление добавило 2 новые возможности.

🟢Voice Design создает голос по текстовому описанию: достаточно указать пол, возраст, тембр, эмоцию и темп - никакого референсного аудио не нужно.

🟢Controllable Voice Cloning клонирует голос по короткому аудиофрагменту и в довесок позволяет управлять стилем, эмоциями и скоростью речи, сохраняя оригинальный тембр.

Из версии 1.5 перешел режим Ultimate Cloning: если передать вместе с референсом его точный транскрипт, модель воспроизводит ритм, интонации и манеру речи.

🟡Тесты

На Seed-TTS-eval модель показывает WER 1.84% на английском и CER 0.97% на китайском при сходстве голоса (SIM) 75.3% и 79.5% соответственно.

На мультиязычном Minimax-MLS-test система лидирует по SIM в подавляющем большинстве из 24 языков, опережая Minimax, ElevenLabs, FishAudio S2 и Qwen3-TTS.

В задаче генерации голоса по описанию модель набирает лучшие баллы среди open-source решений на InstructTTSEval в английском языке.

🟡Модель потребляет около 8 ГБ VRAM.

Скорость инференса по соотношению времени, затраченного моделью на генерацию аудио к длительности самого аудио - около 0.3 на NVIDIA RTX 4090. На движке Nano-vLLM этот показатель снижается до 0.13 (подходит для стриминга в реальном времени).

Есть скрипты и гайд для SFT (добавления нового языка или домена) или LoRA для глубокой имитации конкретного спикера. LoRA потребует 5–10 минут аудио и 20 ГБ VRAM.

Пример генерации аудио на демо-спейсе HF без клонирования и постобработке - в видеофайле поста.


📌Лицензирование: Apache 2.0 License.


🟡Страница проекта
🟡Документация
🟡Модель
🟡Demo
🖥GitHub


@ai_machinelearning_big_data

#AI #ML #TTS #VoxCPM2 #OpenBNB
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Machinelearning
This media is not supported in your browser
VIEW IN TELEGRAM
⚡️ Z ai выпустила GLM-5.1.

Китайская лаборатория релизнула GLM-5.1 - флагманскую MoE-модель с 754B параметров нового поколения, ориентированную на агентную инженерию.

Фокус релиза - на кодинг и долгие агентные сессии.

🟡Тесты

🟢На SWE-Bench Pro модель берет 58,4, обходя Claude Opus 4.6 (57,3), GPT-5.4 (57,7) и Gemini 3.1 Pro (54,2).

🟢На Terminal-Bench 2.0 результат 63,5, а в связке с Claude Code - 66,5.

🟢В CyberGym GLM-5.1 выбивает 68,7 против 48,3 у предыдущей GLM-5

🟢В BrowseComp - 68,0 без внешнего менеджера контекста.

🟠На бенчмарках HLE, AIME 2026 и GPQA-Diamond модель держится на уровне конкурентов, но не лидирует: здесь впереди Gemini 3.1 Pro и GPT-5.4.

GLM-5.1 построена так, чтобы оставаться продуктивной на длинной дистанции: декомпозировать задачу, запускать эксперименты, читать результаты, находить блокеры и пересматривать стратегию.

Z ai утверждает, что модель устойчиво оптимизирует решение на протяжении сотен итераций и тысяч вызовов инструментов, то есть результат тем заметнее, чем дольше она запускают.

API доступен на платформе Z ai, веб-версия на chat.z.ai обещана в ближайшие дни. Веса опубликованы на Hugging Face под лицензией MIT.

Для локального развертывания уже готовы сборки под SGLang 0.5.10+, vLLM 0.19.0+, xLLM, KTransformers и свежую ветку Transformers.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥У нас новый чемпион?

На арене Artificial Analysis появилась новая таинственная модель Happy Horse, которая уделывает Seedance 2 в генерации видео и из текста и из изображений...

Прикрепляю первые видео и ждем подробностей, пока видны явные проблемы с физикой, но шикарное качество

@creadvice