very vibe coding
120 subscribers
463 photos
126 videos
13 files
991 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
🔭 Вышло огромное исследование на 303 страницы от ведущих китайских лабораторий — подробный разбор того, как создают и обучают модели, ориентированные на написание кода, и как на их основе строят полноценные софт-агенты.

Вот что в нём разбирается:

1. Как формируют модель
- Сбор и очистка гигантских датасетов кода.
- Предобучение: модель впитывает реальные паттерны программирования в промышленных масштабах.
- SFT и RL: дополнительные этапы, где модель учат лучше следовать инструкциям, проходить тесты и избегать очевидных ошибок.

2. Как модели превращают в инженерных агентов
- Агент читает баг-репорт или фичу.
- Планирует шаги.
- Меняет файлы.
- Запускает тесты.
- Повторяет цикл, пока не добьётся результата.

3. Какие проблемы всё ещё остаются
- Работа с огромными репозиториями.
- Безопасность и надёжность генерируемого кода.
- Корректная оценка качества работы агентов.
- Реальные приёмы и лайфхаки, которые используют текущие команды.

Исследование - мощный срез состояния индустрии: от датасетов и архитектур до практических инженерных пайплайнов. Это именно то, как современные LLM превращаются в «второго разработчика» в команде.

https://arxiv.org/abs/2511.18538

@data_analysis_ml
Не подумайте, что я предлагаю вам читать исследование 👆выше. Это для того, чтобы вы грузанули его в модель и извлекли бы что-то полезное при работе над очередным проектом.

На стадии планирования
AIRI представили Wikontic — способ строить графы знаний в 10–20 раз дешевле и без логических ошибок

Индустрия столкнулась с проблемой, что LLM пишут красиво, но часто выдумывают факты. Графы знаний решают это, превращая текст в структурированные и проверяемые триплеты.

Большинство существующих методов (GraphRAG, AriGraph и др.) создают огромные, шумные графы: много дубликатов, неправильные типы сущностей, бессмысленные связи.

Wikontic делает иначе:
1. Берёт любой англоязычный текст общего домена.
2. Извлекает триплеты + квалификаторы с помощью обычных открытых LLM (Llama-3.1-70B, Mixtral, GPT-4o и т.д.).
3. Принудительно проверяет каждый триплет на соответствие онтологии Wikidata.
4. Объединяет одинаковые сущности в один канонический Q-код Wikidata.

Для бизнеса это значит:
- надёжные ответы чат-ботов и агентов,
- экономия на вызовы больших моделей,
- лёгкая проверка и аудит каждого ответа.
Hugging Face написали скиллы для Claude Code, Codex, Gemini, которые позволяют файнтьюнить опенсорсные модели
Google запустил у Gemini 3 режим deep think, правд только для самого дорого тарифа. Продолжаем использовать Claude
🎙️ VibeVoice-Realtime-0.5B: реал-тайм TTS от Microsoft, маленькая, крутая, но только на английском

Microsoft Research открыл новую лёгкую модель для синтеза речи в реальном времени. VibeVoice-Realtime-0.5B — это минималистичная версия VibeVoice с фокусом на очень низкую латенцию (первый слышимый звук за ~300 мс, зависит от железа).

Что пригодится:
0.5B параметров
Streaming text input: модель генерирует речь по мере поступления текста (идеально для LLM-ов, которые пишут ответ словами)
Латенция ~300 мс до первого звука vs. обычные секунды
Один спикер (для multi-speaker — используйте 1.5B версию)
Может генерировать ~10 минут речи одновременно
Бенчмарки: WER 2.00% (Voicebox — 1.90%), speaker similarity 0.695

Технически интересно: Использует diffusion-based подход (DDPM), работает с акустическим токенайзером на 7.5 Hz (суперэффективно для long-form). Базовая LLM — Qwen2.5-0.5B.

Ограничения:
Только английский
Research-only (хотя MIT лицензия технически позволяет commercial use)
В каждый аудиофайл встроен disclaimer "This segment was generated by AI" и imperceptible watermark

Кейс: Представляете — LLM на Groq генерирует ответ word-by-word, а VibeVoice начинает озвучивать с первого токена. Пользователь слышит речь почти сразу, пока LLM ещё думает. Это работает в WebSocket demo.
🔗 Ссылки:
🏠 Hugging Face модель
🐙 GitHub (инструкции по запуску)
📄 Техрепорт на arXiv
🎮 Project Page с демками

Первые впечатления: 👍 Латенция реально выглядит как прорыв для интерактивных сценариев. Размер модели — идеален. Но это research-only, и Microsoft явно осторожничает с misuse prevention. На HackerNews отметили, что инонация ещё немного робкая для production, но для 0.5B параметров — неплохо.
#ai #tts #microsoft
Forwarded from Data Secrets
MWS AI выпустила корпоративную платформу MWS AI AGENTS PLATFORM для создания ИИ-агентов

Все как мы любим: можно создать агента на базе LLM в приятном визуальном интерфейсе, не написав ни одной строчки кода.

Количество возможных бизнес-сценариев огромно: построить можно даже мультимодальные и мультиагентные процессы. Агенты смогут распределять роли и функции, передавать друг другу результаты и проверять их.

Также на платформе есть уже готовые решения «из коробки», а еще инструменты для разметки и подготовки данных. А если с внедрением решения понадобится помощь, то MWS AI предоставят консультационную поддержку, обучение команд и экспертное сопровождение.

Кстати, в разработку платформы компания вложила 4 миллиарда рублей. Система разрабатывалась специально как enterprise-ready решение, так что надежность и устойчивость — на высоте.
🧠 Memlayer: Умный слой памяти для LLM

Memlayer добавляет интеллектуальную память к любому LLM, позволяя агентам запоминать контекст и извлекать структурированные знания. С минимальной настройкой, он обеспечивает быстрый поиск и фильтрацию важной информации.

🚀 Основные моменты:
- Поддержка универсальных LLM (OpenAI, Claude и др.)
- Интеллектуальная фильтрация памяти с тремя режимами
- Гибридный поиск с использованием векторного и графового подходов
- Высокая скорость работы (<100 мс) и локальное хранение данных

📌 GitHub: https://github.com/divagr18/memlayer

#python
Русский-3-й язык мира в ИИ.Конец монополий и взлёт Китая — отчёт фонда a16z и OpenRouter

Это один из значимых анализов по реальному использованию LLM в 2025 году – эмпирический анализ 100 трлн токенов на основе метаданных платформы OpenRouter.

1. Монополий на ИИ-модели больше нет, рынок фрагментирован.
Ни одна модель не удерживает больше 20-25% рынка открытого кода.
Крупнейшие игроки по объему токенов:
DeepSeek — 14,37 трлн (но доминирование разрушено)
Qwen — 5,59 трлн
Meta LLaMA — 3,96 трлн
Mistral AI — 2,92 трлн
Minimax — 1,26 трлн
Открытые модели выросли с почти 0 до ~30% всех токенов за 2 года. Рынок стал по-настоящему мультимодельным.

2. Китай — новый глобальный экспортёр ИИ-инфраструктуры. Об этом мы писали ранее. Их открытые модели в отдельные недели доходили до 30% мирового использования (в среднем 13% за год).
Доля Азии в глобальных расходах на ИИ выросла с 13% до 31% за два года. Это уже экспорт открытых весов и дешёвой мощности по всему миру.

3. Русский язык — в тройке лидеров мира (2,47%) всех токенов после английского (82,87%) и китайского (4,95%).
Третье место — это очень высокий показатель для неанглоязычного сообщества. Но отчёт не углубляется по задачам/моделям для русского.

4. Как люди реально используют ИИ в 2025:
- Программирование — больше 50% всех токенов к концу года
- Ролевые игры, интерактивные истории, творчество — второй по величине сегмент
- Перевод, образование, здоровье — значительно меньше
Получается, что ИИ используют не только (и даже не столько) для «продуктивности», сколько для кодинга и развлечений.

5. Модели с рассуждением — уже стандарт. Более 50% всех токенов обрабатываются моделями, которые «думают» перед ответом и используют инструменты. Средний контекст вырос в 3–4 раза (в программировании часто 20–100K+ токенов).

6. Цена почти не влияет на спрос. Снижение цены на 10% даёт рост использования всего на 0,5–0,7%. Люди платят не за дешевизну, а за то, что модель идеально решает их конкретную задачу.

7. Эффект «хрустальной туфельки». Если модель с первого раза идеально подошла под задачу пользователя — он остаётся с ней навсегда. Когорты Gemini 2.5 Pro (июнь 2025) и Claude 4 Sonnet (май 2025) сохраняют ~40% активных пользователей через 5–6 месяцев. Поздние когорты тех же моделей — в разы хуже. Первая любовь решает всё.

8. Ниши уже сформировались:
- Anthropic Claude — 60–80% всего программирования
- DeepSeek — 60%+ ролевых игр и казуальных диалогов
- xAI Grok Code Fast, Qwen 3 Coder — быстро отъедают долю в коде
- Gemini Flash — рабочая лошадка для массового объёма
Универсального лидера больше не будет.
🚀 Tavily Deep Research: как работает новый поисковый движок Hugging Face

Tavily - это инструмент для глубокого поиска и анализа. Он не просто ищет ссылки, а собирает факты, фильтрует шум и структурирует информацию так, чтобы её мог использовать ИИ для сложных задач.

🔥 Что делает Tavily
• Ищет релевантный контент по вебу
• Отбрасывает лишнее и оставляет только важные фрагменты
• Сжимает и очищает данные перед тем, как их увидит модель
• Экономит токены и ускоряет обработку, потому что не передает «всё подряд»

🧠 Как выглядит процесс Deep Research
1. Поиск по вебу
2. Извлечение полезных частей
3. Сжатие и структурирование информации
4. Формирование финального ответа или отчета

✨ Где это полезно
• Аналитика и исследования
• Подготовка отчетов и обзоров
• Глубокие ответы, где обычный поиск слишком поверхностный

Это подход «не просто найти информацию, а переварить и подать её как исследователь».

https://huggingface.co/blog/Tavily/tavily-deep-research
Qwen вышел с новой моделью текст-в-голос, говорит на русском. Ссылок для скачивания не нашел, видимо, только по апи работает.

Интересно!
Американцев теперь бомбит от того, что весь топовый опенсорс китайский. Стараются догнать и перегнать. О новой модельке на 8В - здесь.

Но у нас теперь свой Sber есть!