very vibe coding
120 subscribers
463 photos
126 videos
13 files
991 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Русский-3-й язык мира в ИИ.Конец монополий и взлёт Китая — отчёт фонда a16z и OpenRouter

Это один из значимых анализов по реальному использованию LLM в 2025 году – эмпирический анализ 100 трлн токенов на основе метаданных платформы OpenRouter.

1. Монополий на ИИ-модели больше нет, рынок фрагментирован.
Ни одна модель не удерживает больше 20-25% рынка открытого кода.
Крупнейшие игроки по объему токенов:
DeepSeek — 14,37 трлн (но доминирование разрушено)
Qwen — 5,59 трлн
Meta LLaMA — 3,96 трлн
Mistral AI — 2,92 трлн
Minimax — 1,26 трлн
Открытые модели выросли с почти 0 до ~30% всех токенов за 2 года. Рынок стал по-настоящему мультимодельным.

2. Китай — новый глобальный экспортёр ИИ-инфраструктуры. Об этом мы писали ранее. Их открытые модели в отдельные недели доходили до 30% мирового использования (в среднем 13% за год).
Доля Азии в глобальных расходах на ИИ выросла с 13% до 31% за два года. Это уже экспорт открытых весов и дешёвой мощности по всему миру.

3. Русский язык — в тройке лидеров мира (2,47%) всех токенов после английского (82,87%) и китайского (4,95%).
Третье место — это очень высокий показатель для неанглоязычного сообщества. Но отчёт не углубляется по задачам/моделям для русского.

4. Как люди реально используют ИИ в 2025:
- Программирование — больше 50% всех токенов к концу года
- Ролевые игры, интерактивные истории, творчество — второй по величине сегмент
- Перевод, образование, здоровье — значительно меньше
Получается, что ИИ используют не только (и даже не столько) для «продуктивности», сколько для кодинга и развлечений.

5. Модели с рассуждением — уже стандарт. Более 50% всех токенов обрабатываются моделями, которые «думают» перед ответом и используют инструменты. Средний контекст вырос в 3–4 раза (в программировании часто 20–100K+ токенов).

6. Цена почти не влияет на спрос. Снижение цены на 10% даёт рост использования всего на 0,5–0,7%. Люди платят не за дешевизну, а за то, что модель идеально решает их конкретную задачу.

7. Эффект «хрустальной туфельки». Если модель с первого раза идеально подошла под задачу пользователя — он остаётся с ней навсегда. Когорты Gemini 2.5 Pro (июнь 2025) и Claude 4 Sonnet (май 2025) сохраняют ~40% активных пользователей через 5–6 месяцев. Поздние когорты тех же моделей — в разы хуже. Первая любовь решает всё.

8. Ниши уже сформировались:
- Anthropic Claude — 60–80% всего программирования
- DeepSeek — 60%+ ролевых игр и казуальных диалогов
- xAI Grok Code Fast, Qwen 3 Coder — быстро отъедают долю в коде
- Gemini Flash — рабочая лошадка для массового объёма
Универсального лидера больше не будет.
🚀 Tavily Deep Research: как работает новый поисковый движок Hugging Face

Tavily - это инструмент для глубокого поиска и анализа. Он не просто ищет ссылки, а собирает факты, фильтрует шум и структурирует информацию так, чтобы её мог использовать ИИ для сложных задач.

🔥 Что делает Tavily
• Ищет релевантный контент по вебу
• Отбрасывает лишнее и оставляет только важные фрагменты
• Сжимает и очищает данные перед тем, как их увидит модель
• Экономит токены и ускоряет обработку, потому что не передает «всё подряд»

🧠 Как выглядит процесс Deep Research
1. Поиск по вебу
2. Извлечение полезных частей
3. Сжатие и структурирование информации
4. Формирование финального ответа или отчета

✨ Где это полезно
• Аналитика и исследования
• Подготовка отчетов и обзоров
• Глубокие ответы, где обычный поиск слишком поверхностный

Это подход «не просто найти информацию, а переварить и подать её как исследователь».

https://huggingface.co/blog/Tavily/tavily-deep-research
Qwen вышел с новой моделью текст-в-голос, говорит на русском. Ссылок для скачивания не нашел, видимо, только по апи работает.

Интересно!
Американцев теперь бомбит от того, что весь топовый опенсорс китайский. Стараются догнать и перегнать. О новой модельке на 8В - здесь.

Но у нас теперь свой Sber есть!
Сейчас в первый раз увидел как Клод, вместо того, чтобы прекратить диалог (а это всегда происходит внезапно, счетчик токенов Антропику ставить западло, хотя у Гугла он есть), пытается ужать диалог для продолжения работы. Не вышло, не заработало, но за попытку зачет
Я ставлю крест на RAG: почему поиск по базе — это теперь задача для джуна, а будущее — за Generic Agent

Байт засчитан =)

Капля истории
Мы с вами начали с фундамента AI-инфраструктуры тестировали Llama на кластерах 4090, показывал вам тюн Whisper и считали экономику on-premise решений
Затем углубились в сложный RAG и Vibe Coding: заняли топ с малыми моделями в Enterprise RAG Challenge изучили Circuit Tracing для поиска галлюцинаций и научились собирать MVP за 7 дней
В середине 2025 перешли к автономным системам: запустили open-source SGR Deep Research доказали эффективность на бенчмарках и выпустили фреймворк SGR Agent Core


Честно говоря к концу 2025 года стало очевидно что RAG превратился в стандартную инженерную задачу которую может собрать джун по туториалам

Настоящий вызов сместился к агентам
И вот тут начинается самое интересное потому что большинство того что называют агентами на рынке это просто красивые цепочки в no-code конструкторах Workflow где вы заранее продумали каждый if-else
Это не агенты это детерминированные пайплайны с LLM внутри

Я потратил последние месяцы на то чтобы понять как строить настоящие автономные системы (Запускал демо ERC3, строил решения для демо в agentic comerce)
Результат всей моей работы оказался тут sgr-agent-core фреймворк уже набрал 815 звезд на GitHub и работает в продакшене у реальных клиентов
Но главное не звезды а то понимание физики процесса которое я получил, и это так же ответ зачем было его делать

Generic Agent = Based Prompt + ReAct+PlanAct + Context Engineering + Memory + Tool Search

Это не просто формула это среда для автономности Based Prompt задает законы физики для модели как она должна думать планировать реагировать на ошибки

ReAct это безальтернативный цикл без которого автономности не существует модель должна рассуждать действовать анализировать результат и корректировать план

Context Engineering потому что контекст не резиновый и агент должен уметь управлять своим вниманием сжимать историю отбрасывать неактуальное держать фокус

Memory это не просто кэш это архитектурное решение о том что помнить что забывать когда делать compaction

Tool Search критически важный компонент для энтерпрайза когда у вас 500 плюс API-ручек вы не можете скормить их все в контекст настоящий агент сначала понимает задачу находит нужный инструмент в репозитории и только потом использует

В ближайшие дни у меня будет несколько площадок где я буду давать очень скромный прогноз без хайпа обещаю

Очень хочу показать что курсы по AI-агентам дают вам базу с langchain или n8n и обещают что теперь вы зарабатываете 300к в наносекунду но они не расскажут про управление форматом и структурами внутри tools про constraint и args про то как на самом деле работает structured output (пришлите в коменты если такой курс есть) как управлять ризонингом в агентах и как его вызывать самому (наш тул reasoning+plan)

Must Read от создателей LLM

Перед тем как что-то изобретать и задавать вопросы прочитайте что говорят те кто делает сами модели

OpenAI A Practical Guide to Building Agents

OpenAI Building Agents Track

Anthropic Building Effective Agents

Anthropic Context Engineering

Anthropic Building Agents with Claude Agent SDK

Все они говорят +- одно начинайте с простого не тащите сразу LangGraph на 20 нод сделайте одного агента с одним инструментом заставьте работать потом масштабируйте

Я строю агентов на локальных моделях и как оказалось что бы строить generic agent нужно мощное железо 🗿
Это не потому что я против OpenAI это потому что я хочу полный контроль над инференсом над латенси над стоимостью
Когда ты делаешь продакшен на локальных моделях ты понимаешь каждый байт контекста каждый вызов инструмента каждую миллисекунду задержки
Это сделать тебя лучшим инженером над API вызовами

По этому далее будет усиление на контент именно про них, про агентов, и про sgr-agent-core будем выводить фреймворк на 10к звезд!
Если ты со мной ставь 🖥 Linux =)


Stay tuned!
Please open Telegram to view this post
VIEW IN TELEGRAM
Прикольный специализированный агент - помогает редактировать научные статьи
🚀 Релиз GLM-4.6V!

• GLM-4.6V (106B) - старшая модель.
• GLM-4.6V-Flash (9B) — лёгкая, быстрая, отлично подходит для локального использования.

🔥 Что внутри:
✅ Нативный multimodal tool calling -заточена на работу с изображениями и документами.
✅ Контекст 128K - переваривает 150-страничные документы или часовые видео за один прогон
✅ Visual → Action pipeline - мультимодальные агенты: “найди эту одежду онлайн” → возвращает структурированный список покупок
✅ На 50% дешевле GLM-4.5V-— ~1$ за миллион входных токенов. (На ModelScope API можно использовать бесплатно.)

→ modelscope.cn/collections/GLM-46V-37fabc27818446
🚀 Вышел Qwen-Image-i2L от DiffSynth-Studio - первый open-source инструмент, который умеет делать LoRA-модель из одной картинки. 🖼️➡️🧠

Что можно извлекать из изображения:

🎨 Style — только стиль и эстетика
🧩 Coarse — стиль + содержание сцены
✨ Fine — улучшение детализации 1024×1024 (используется вместе с Coarse)
⚖️ Bias — подстройка под фирменный визуальный почерк Qwen-Image

Модель построена на SigLIP2 + DINOv3 + Qwen-VL.

Итог — можно взять одну картинку и быстро натренировать под неё собственную LoRA, без больших датасетов.

🔗 ModelScope: modelscope.cn/models/DiffSynth-Studio/Qwen-Image-i2L/summary
💻 Код: github.com/modelscope/DiffSynth-Studio/blob/main/examples/qwen_image/model_inference_low_vram/Qwen-Image-i2L.py
Forwarded from Machinelearning
🚀 Вышло крупное обновление Qwen3-Omni-Flash (версия 2025-12-01)

Что изменилось:

🎙️ Модель намного лучше ведёт разговоры с голосом и видео - общение звучит естественно и непрерывно
✨ Теперь можно задавать характер ИИ через system prompts, например, стиль общения или роль
🗣️ Улучшена поддержка языков: 119 письменных и 19 голосовых
😊 Голоса звучат почти как настоящие люди

Где попробовать:

🎙️ В Qwen Chat - нажмите VoiceChat или VideoChat (правый нижний угол): http://chat.qwen.ai
📝 Подробности в блоге: https://qwen.ai/blog?id=qwen3-omni-20251201
🎧 Онлайн-демо: http://hf.co/spaces/Qwen/Qwen3-Omni-Demo
🎧 Второе демо: http://modelscope.cn/studios/Qwen/Qwen3-Omni-Demo
⚡ Realtime API: https://modelstudio.console.alibabacloud.com/?tab=doc#/doc/?type=model&url=2840914_2&modelId=qwen3-omni-flash-realtime-2025-12-01
📥 Offline API: https://modelstudio.console.alibabacloud.com/?tab=doc#/doc/?type=model&url=2840914_2&modelId=qwen3-omni-flash-2025-12-01

@ai_machinelearning_big_data


#Qwen #llm #ml
Сегодня с утра - пара новых моделей tts - text to speech. Если у VOX-cpm 1.5 только два языка - английский и китайский, то у Google все норм, русский есть. Но не опен сорс..

А вообще прикольно, когда с нейронкой можно говорить, обязательно что-то такое замучу
Ну что, ChatGPT 5.2 вышел, рекордные метрики, любопытно
Для любителей экзотики - маленькая модель text-to-3D. Можно ставить на свой комп
Почему я возлагаю большие надежды на релиз ChatGPT 5.2:

во-первых, и 5.1 был прекрасен в написании кода, причем на недорогих подписках в Claude code модель Opus недоступна, только Sonnet, а chatGPT дает доступ к последним моделям (почти);

во-вторых, теперь она знает то, что происходило до августа 2025 - это удобно, модели, которые обучались давно, местами тупят;

Контекст вырос до 400К - тоже удобно, и этого, в общем, достаточно.

Рекомендую Codex как первую опцию для программирования. Будет меньше заморочек, чем с Claude и Gemini.