Forwarded from Анализ данных (Data analysis)
🔭 Вышло огромное исследование на 303 страницы от ведущих китайских лабораторий — подробный разбор того, как создают и обучают модели, ориентированные на написание кода, и как на их основе строят полноценные софт-агенты.
Вот что в нём разбирается:
1. Как формируют модель
- Сбор и очистка гигантских датасетов кода.
- Предобучение: модель впитывает реальные паттерны программирования в промышленных масштабах.
- SFT и RL: дополнительные этапы, где модель учат лучше следовать инструкциям, проходить тесты и избегать очевидных ошибок.
2. Как модели превращают в инженерных агентов
- Агент читает баг-репорт или фичу.
- Планирует шаги.
- Меняет файлы.
- Запускает тесты.
- Повторяет цикл, пока не добьётся результата.
3. Какие проблемы всё ещё остаются
- Работа с огромными репозиториями.
- Безопасность и надёжность генерируемого кода.
- Корректная оценка качества работы агентов.
- Реальные приёмы и лайфхаки, которые используют текущие команды.
Исследование - мощный срез состояния индустрии: от датасетов и архитектур до практических инженерных пайплайнов. Это именно то, как современные LLM превращаются в «второго разработчика» в команде.
https://arxiv.org/abs/2511.18538
@data_analysis_ml
Вот что в нём разбирается:
1. Как формируют модель
- Сбор и очистка гигантских датасетов кода.
- Предобучение: модель впитывает реальные паттерны программирования в промышленных масштабах.
- SFT и RL: дополнительные этапы, где модель учат лучше следовать инструкциям, проходить тесты и избегать очевидных ошибок.
2. Как модели превращают в инженерных агентов
- Агент читает баг-репорт или фичу.
- Планирует шаги.
- Меняет файлы.
- Запускает тесты.
- Повторяет цикл, пока не добьётся результата.
3. Какие проблемы всё ещё остаются
- Работа с огромными репозиториями.
- Безопасность и надёжность генерируемого кода.
- Корректная оценка качества работы агентов.
- Реальные приёмы и лайфхаки, которые используют текущие команды.
Исследование - мощный срез состояния индустрии: от датасетов и архитектур до практических инженерных пайплайнов. Это именно то, как современные LLM превращаются в «второго разработчика» в команде.
https://arxiv.org/abs/2511.18538
@data_analysis_ml
Не подумайте, что я предлагаю вам читать исследование 👆выше. Это для того, чтобы вы грузанули его в модель и извлекли бы что-то полезное при работе над очередным проектом.
На стадии планирования
На стадии планирования
Forwarded from Все о блокчейн/мозге/space/WEB 3.0 в России и мире
AIRI представили Wikontic — способ строить графы знаний в 10–20 раз дешевле и без логических ошибок
Индустрия столкнулась с проблемой, что LLM пишут красиво, но часто выдумывают факты. Графы знаний решают это, превращая текст в структурированные и проверяемые триплеты.
Большинство существующих методов (GraphRAG, AriGraph и др.) создают огромные, шумные графы: много дубликатов, неправильные типы сущностей, бессмысленные связи.
Wikontic делает иначе:
1. Берёт любой англоязычный текст общего домена.
2. Извлекает триплеты + квалификаторы с помощью обычных открытых LLM (Llama-3.1-70B, Mixtral, GPT-4o и т.д.).
3. Принудительно проверяет каждый триплет на соответствие онтологии Wikidata.
4. Объединяет одинаковые сущности в один канонический Q-код Wikidata.
Для бизнеса это значит:
- надёжные ответы чат-ботов и агентов,
- экономия на вызовы больших моделей,
- лёгкая проверка и аудит каждого ответа.
Индустрия столкнулась с проблемой, что LLM пишут красиво, но часто выдумывают факты. Графы знаний решают это, превращая текст в структурированные и проверяемые триплеты.
Большинство существующих методов (GraphRAG, AriGraph и др.) создают огромные, шумные графы: много дубликатов, неправильные типы сущностей, бессмысленные связи.
Wikontic делает иначе:
1. Берёт любой англоязычный текст общего домена.
2. Извлекает триплеты + квалификаторы с помощью обычных открытых LLM (Llama-3.1-70B, Mixtral, GPT-4o и т.д.).
3. Принудительно проверяет каждый триплет на соответствие онтологии Wikidata.
4. Объединяет одинаковые сущности в один канонический Q-код Wikidata.
Для бизнеса это значит:
- надёжные ответы чат-ботов и агентов,
- экономия на вызовы больших моделей,
- лёгкая проверка и аудит каждого ответа.
huggingface.co
Paper page - Wikontic: Constructing Wikidata-Aligned, Ontology-Aware Knowledge Graphs with Large Language Models
Join the discussion on this paper page
Hugging Face написали скиллы для Claude Code, Codex, Gemini, которые позволяют файнтьюнить опенсорсные модели
huggingface.co
We Got Claude to Fine-Tune an Open Source LLM
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Google запустил у Gemini 3 режим deep think, правд только для самого дорого тарифа. Продолжаем использовать Claude
🎙️ VibeVoice-Realtime-0.5B: реал-тайм TTS от Microsoft, маленькая, крутая, но только на английском
Microsoft Research открыл новую лёгкую модель для синтеза речи в реальном времени. VibeVoice-Realtime-0.5B — это минималистичная версия VibeVoice с фокусом на очень низкую латенцию (первый слышимый звук за ~300 мс, зависит от железа).
Что пригодится:
0.5B параметров
Streaming text input: модель генерирует речь по мере поступления текста (идеально для LLM-ов, которые пишут ответ словами)
Латенция ~300 мс до первого звука vs. обычные секунды
Один спикер (для multi-speaker — используйте 1.5B версию)
Может генерировать ~10 минут речи одновременно
Бенчмарки: WER 2.00% (Voicebox — 1.90%), speaker similarity 0.695
Технически интересно: Использует diffusion-based подход (DDPM), работает с акустическим токенайзером на 7.5 Hz (суперэффективно для long-form). Базовая LLM — Qwen2.5-0.5B.
Ограничения:
Только английский
Research-only (хотя MIT лицензия технически позволяет commercial use)
В каждый аудиофайл встроен disclaimer "This segment was generated by AI" и imperceptible watermark
Кейс: Представляете — LLM на Groq генерирует ответ word-by-word, а VibeVoice начинает озвучивать с первого токена. Пользователь слышит речь почти сразу, пока LLM ещё думает. Это работает в WebSocket demo.
🔗 Ссылки:
🏠 Hugging Face модель
🐙 GitHub (инструкции по запуску)
📄 Техрепорт на arXiv
🎮 Project Page с демками
Первые впечатления: 👍 Латенция реально выглядит как прорыв для интерактивных сценариев. Размер модели — идеален. Но это research-only, и Microsoft явно осторожничает с misuse prevention. На HackerNews отметили, что инонация ещё немного робкая для production, но для 0.5B параметров — неплохо.
#ai #tts #microsoft
Microsoft Research открыл новую лёгкую модель для синтеза речи в реальном времени. VibeVoice-Realtime-0.5B — это минималистичная версия VibeVoice с фокусом на очень низкую латенцию (первый слышимый звук за ~300 мс, зависит от железа).
Что пригодится:
0.5B параметров
Streaming text input: модель генерирует речь по мере поступления текста (идеально для LLM-ов, которые пишут ответ словами)
Латенция ~300 мс до первого звука vs. обычные секунды
Один спикер (для multi-speaker — используйте 1.5B версию)
Может генерировать ~10 минут речи одновременно
Бенчмарки: WER 2.00% (Voicebox — 1.90%), speaker similarity 0.695
Технически интересно: Использует diffusion-based подход (DDPM), работает с акустическим токенайзером на 7.5 Hz (суперэффективно для long-form). Базовая LLM — Qwen2.5-0.5B.
Ограничения:
Только английский
Research-only (хотя MIT лицензия технически позволяет commercial use)
В каждый аудиофайл встроен disclaimer "This segment was generated by AI" и imperceptible watermark
Кейс: Представляете — LLM на Groq генерирует ответ word-by-word, а VibeVoice начинает озвучивать с первого токена. Пользователь слышит речь почти сразу, пока LLM ещё думает. Это работает в WebSocket demo.
🔗 Ссылки:
🏠 Hugging Face модель
🐙 GitHub (инструкции по запуску)
📄 Техрепорт на arXiv
🎮 Project Page с демками
Первые впечатления: 👍 Латенция реально выглядит как прорыв для интерактивных сценариев. Размер модели — идеален. Но это research-only, и Microsoft явно осторожничает с misuse prevention. На HackerNews отметили, что инонация ещё немного робкая для production, но для 0.5B параметров — неплохо.
#ai #tts #microsoft
huggingface.co
microsoft/VibeVoice-Realtime-0.5B · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Forwarded from Data Secrets
MWS AI выпустила корпоративную платформу MWS AI AGENTS PLATFORM для создания ИИ-агентов
Все как мы любим: можно создать агента на базе LLM в приятном визуальном интерфейсе, не написав ни одной строчки кода.
Количество возможных бизнес-сценариев огромно: построить можно даже мультимодальные и мультиагентные процессы. Агенты смогут распределять роли и функции, передавать друг другу результаты и проверять их.
Также на платформе есть уже готовые решения «из коробки», а еще инструменты для разметки и подготовки данных. А если с внедрением решения понадобится помощь, то MWS AI предоставят консультационную поддержку, обучение команд и экспертное сопровождение.
Кстати, в разработку платформы компания вложила 4 миллиарда рублей. Система разрабатывалась специально как enterprise-ready решение, так что надежность и устойчивость — на высоте.
Все как мы любим: можно создать агента на базе LLM в приятном визуальном интерфейсе, не написав ни одной строчки кода.
Количество возможных бизнес-сценариев огромно: построить можно даже мультимодальные и мультиагентные процессы. Агенты смогут распределять роли и функции, передавать друг другу результаты и проверять их.
Также на платформе есть уже готовые решения «из коробки», а еще инструменты для разметки и подготовки данных. А если с внедрением решения понадобится помощь, то MWS AI предоставят консультационную поддержку, обучение команд и экспертное сопровождение.
Кстати, в разработку платформы компания вложила 4 миллиарда рублей. Система разрабатывалась специально как enterprise-ready решение, так что надежность и устойчивость — на высоте.
Forwarded from Анализ данных (Data analysis)
🧠 Memlayer: Умный слой памяти для LLM
Memlayer добавляет интеллектуальную память к любому LLM, позволяя агентам запоминать контекст и извлекать структурированные знания. С минимальной настройкой, он обеспечивает быстрый поиск и фильтрацию важной информации.
🚀 Основные моменты:
- Поддержка универсальных LLM (OpenAI, Claude и др.)
- Интеллектуальная фильтрация памяти с тремя режимами
- Гибридный поиск с использованием векторного и графового подходов
- Высокая скорость работы (<100 мс) и локальное хранение данных
📌 GitHub: https://github.com/divagr18/memlayer
#python
Memlayer добавляет интеллектуальную память к любому LLM, позволяя агентам запоминать контекст и извлекать структурированные знания. С минимальной настройкой, он обеспечивает быстрый поиск и фильтрацию важной информации.
🚀 Основные моменты:
- Поддержка универсальных LLM (OpenAI, Claude и др.)
- Интеллектуальная фильтрация памяти с тремя режимами
- Гибридный поиск с использованием векторного и графового подходов
- Высокая скорость работы (<100 мс) и локальное хранение данных
📌 GitHub: https://github.com/divagr18/memlayer
#python
Forwarded from Все о блокчейн/мозге/space/WEB 3.0 в России и мире
Русский-3-й язык мира в ИИ.Конец монополий и взлёт Китая — отчёт фонда a16z и OpenRouter
Это один из значимых анализов по реальному использованию LLM в 2025 году – эмпирический анализ 100 трлн токенов на основе метаданных платформы OpenRouter.
1. Монополий на ИИ-модели больше нет, рынок фрагментирован.
Ни одна модель не удерживает больше 20-25% рынка открытого кода.
Крупнейшие игроки по объему токенов:
DeepSeek — 14,37 трлн (но доминирование разрушено)
Qwen — 5,59 трлн
Meta LLaMA — 3,96 трлн
Mistral AI — 2,92 трлн
Minimax — 1,26 трлн
Открытые модели выросли с почти 0 до ~30% всех токенов за 2 года. Рынок стал по-настоящему мультимодельным.
2. Китай — новый глобальный экспортёр ИИ-инфраструктуры. Об этом мы писали ранее. Их открытые модели в отдельные недели доходили до 30% мирового использования (в среднем 13% за год).
Доля Азии в глобальных расходах на ИИ выросла с 13% до 31% за два года. Это уже экспорт открытых весов и дешёвой мощности по всему миру.
3. Русский язык — в тройке лидеров мира (2,47%) всех токенов после английского (82,87%) и китайского (4,95%).
Третье место — это очень высокий показатель для неанглоязычного сообщества. Но отчёт не углубляется по задачам/моделям для русского.
4. Как люди реально используют ИИ в 2025:
- Программирование — больше 50% всех токенов к концу года
- Ролевые игры, интерактивные истории, творчество — второй по величине сегмент
- Перевод, образование, здоровье — значительно меньше
Получается, что ИИ используют не только (и даже не столько) для «продуктивности», сколько для кодинга и развлечений.
5. Модели с рассуждением — уже стандарт. Более 50% всех токенов обрабатываются моделями, которые «думают» перед ответом и используют инструменты. Средний контекст вырос в 3–4 раза (в программировании часто 20–100K+ токенов).
6. Цена почти не влияет на спрос. Снижение цены на 10% даёт рост использования всего на 0,5–0,7%. Люди платят не за дешевизну, а за то, что модель идеально решает их конкретную задачу.
7. Эффект «хрустальной туфельки». Если модель с первого раза идеально подошла под задачу пользователя — он остаётся с ней навсегда. Когорты Gemini 2.5 Pro (июнь 2025) и Claude 4 Sonnet (май 2025) сохраняют ~40% активных пользователей через 5–6 месяцев. Поздние когорты тех же моделей — в разы хуже. Первая любовь решает всё.
8. Ниши уже сформировались:
- Anthropic Claude — 60–80% всего программирования
- DeepSeek — 60%+ ролевых игр и казуальных диалогов
- xAI Grok Code Fast, Qwen 3 Coder — быстро отъедают долю в коде
- Gemini Flash — рабочая лошадка для массового объёма
Универсального лидера больше не будет.
Это один из значимых анализов по реальному использованию LLM в 2025 году – эмпирический анализ 100 трлн токенов на основе метаданных платформы OpenRouter.
1. Монополий на ИИ-модели больше нет, рынок фрагментирован.
Ни одна модель не удерживает больше 20-25% рынка открытого кода.
Крупнейшие игроки по объему токенов:
DeepSeek — 14,37 трлн (но доминирование разрушено)
Qwen — 5,59 трлн
Meta LLaMA — 3,96 трлн
Mistral AI — 2,92 трлн
Minimax — 1,26 трлн
Открытые модели выросли с почти 0 до ~30% всех токенов за 2 года. Рынок стал по-настоящему мультимодельным.
2. Китай — новый глобальный экспортёр ИИ-инфраструктуры. Об этом мы писали ранее. Их открытые модели в отдельные недели доходили до 30% мирового использования (в среднем 13% за год).
Доля Азии в глобальных расходах на ИИ выросла с 13% до 31% за два года. Это уже экспорт открытых весов и дешёвой мощности по всему миру.
3. Русский язык — в тройке лидеров мира (2,47%) всех токенов после английского (82,87%) и китайского (4,95%).
Третье место — это очень высокий показатель для неанглоязычного сообщества. Но отчёт не углубляется по задачам/моделям для русского.
4. Как люди реально используют ИИ в 2025:
- Программирование — больше 50% всех токенов к концу года
- Ролевые игры, интерактивные истории, творчество — второй по величине сегмент
- Перевод, образование, здоровье — значительно меньше
Получается, что ИИ используют не только (и даже не столько) для «продуктивности», сколько для кодинга и развлечений.
5. Модели с рассуждением — уже стандарт. Более 50% всех токенов обрабатываются моделями, которые «думают» перед ответом и используют инструменты. Средний контекст вырос в 3–4 раза (в программировании часто 20–100K+ токенов).
6. Цена почти не влияет на спрос. Снижение цены на 10% даёт рост использования всего на 0,5–0,7%. Люди платят не за дешевизну, а за то, что модель идеально решает их конкретную задачу.
7. Эффект «хрустальной туфельки». Если модель с первого раза идеально подошла под задачу пользователя — он остаётся с ней навсегда. Когорты Gemini 2.5 Pro (июнь 2025) и Claude 4 Sonnet (май 2025) сохраняют ~40% активных пользователей через 5–6 месяцев. Поздние когорты тех же моделей — в разы хуже. Первая любовь решает всё.
8. Ниши уже сформировались:
- Anthropic Claude — 60–80% всего программирования
- DeepSeek — 60%+ ролевых игр и казуальных диалогов
- xAI Grok Code Fast, Qwen 3 Coder — быстро отъедают долю в коде
- Gemini Flash — рабочая лошадка для массового объёма
Универсального лидера больше не будет.
OpenRouter
State of AI 2025: 100T Token LLM Usage Study | OpenRouter
Read OpenRouter's 2025 State of AI report — an empirical 100 trillion token study of real LLM usage, model trends, and developer insights.
Forwarded from Machine learning Interview
🚀 Tavily Deep Research: как работает новый поисковый движок Hugging Face
Tavily - это инструмент для глубокого поиска и анализа. Он не просто ищет ссылки, а собирает факты, фильтрует шум и структурирует информацию так, чтобы её мог использовать ИИ для сложных задач.
🔥 Что делает Tavily
• Ищет релевантный контент по вебу
• Отбрасывает лишнее и оставляет только важные фрагменты
• Сжимает и очищает данные перед тем, как их увидит модель
• Экономит токены и ускоряет обработку, потому что не передает «всё подряд»
🧠 Как выглядит процесс Deep Research
1. Поиск по вебу
2. Извлечение полезных частей
3. Сжатие и структурирование информации
4. Формирование финального ответа или отчета
✨ Где это полезно
• Аналитика и исследования
• Подготовка отчетов и обзоров
• Глубокие ответы, где обычный поиск слишком поверхностный
Это подход «не просто найти информацию, а переварить и подать её как исследователь».
https://huggingface.co/blog/Tavily/tavily-deep-research
Tavily - это инструмент для глубокого поиска и анализа. Он не просто ищет ссылки, а собирает факты, фильтрует шум и структурирует информацию так, чтобы её мог использовать ИИ для сложных задач.
🔥 Что делает Tavily
• Ищет релевантный контент по вебу
• Отбрасывает лишнее и оставляет только важные фрагменты
• Сжимает и очищает данные перед тем, как их увидит модель
• Экономит токены и ускоряет обработку, потому что не передает «всё подряд»
🧠 Как выглядит процесс Deep Research
1. Поиск по вебу
2. Извлечение полезных частей
3. Сжатие и структурирование информации
4. Формирование финального ответа или отчета
✨ Где это полезно
• Аналитика и исследования
• Подготовка отчетов и обзоров
• Глубокие ответы, где обычный поиск слишком поверхностный
Это подход «не просто найти информацию, а переварить и подать её как исследователь».
https://huggingface.co/blog/Tavily/tavily-deep-research
Qwen вышел с новой моделью текст-в-голос, говорит на русском. Ссылок для скачивания не нашел, видимо, только по апи работает.
Интересно!
Интересно!
Американцев теперь бомбит от того, что весь топовый опенсорс китайский. Стараются догнать и перегнать. О новой модельке на 8В - здесь.
Но у нас теперь свой Sber есть!
Но у нас теперь свой Sber есть!
Пропустил очень интересную новость про создание Lux - нового агентского окружения. Опенсорс, и при этом лучше коммерческих аналогов. Стоит обратить внимание
https://t.me/nobilix/188
https://t.me/nobilix/188
Telegram
Refat Talks: Tech & AI
#ReDigest
Продолжаем субботнюю рубрику, тут я кратко рассказываю про новости из мира технологий и AI, которые привлекли мое внимание.
Дайджест недели:
- Anthropic купили Bun - runtime среду для JS и TS и поделились что Claude Code всего через полгода после…
Продолжаем субботнюю рубрику, тут я кратко рассказываю про новости из мира технологий и AI, которые привлекли мое внимание.
Дайджест недели:
- Anthropic купили Bun - runtime среду для JS и TS и поделились что Claude Code всего через полгода после…
Сейчас в первый раз увидел как Клод, вместо того, чтобы прекратить диалог (а это всегда происходит внезапно, счетчик токенов Антропику ставить западло, хотя у Гугла он есть), пытается ужать диалог для продолжения работы. Не вышло, не заработало, но за попытку зачет
Forwarded from Валера Ковальский
Я ставлю крест на RAG: почему поиск по базе — это теперь задача для джуна, а будущее — за Generic Agent
Байт засчитан =)
Капля истории
Мы с вами начали с фундамента AI-инфраструктуры тестировали Llama на кластерах 4090, показывал вам тюн Whisper и считали экономику on-premise решений
Затем углубились в сложный RAG и Vibe Coding: заняли топ с малыми моделями в Enterprise RAG Challenge изучили Circuit Tracing для поиска галлюцинаций и научились собирать MVP за 7 дней
В середине 2025 перешли к автономным системам: запустили open-source SGR Deep Research доказали эффективность на бенчмарках и выпустили фреймворк SGR Agent Core
Честно говоря к концу 2025 года стало очевидно что RAG превратился в стандартную инженерную задачу которую может собрать джун по туториалам
Настоящий вызов сместился к агентам
И вот тут начинается самое интересное потому что большинство того что называют агентами на рынке это просто красивые цепочки в no-code конструкторах Workflow где вы заранее продумали каждый if-else
Это не агенты это детерминированные пайплайны с LLM внутри
Я потратил последние месяцы на то чтобы понять как строить настоящие автономные системы (Запускал демо ERC3, строил решения для демо в agentic comerce)
Результат всей моей работы оказался тут sgr-agent-core фреймворк уже набрал 815 звезд на GitHub и работает в продакшене у реальных клиентов
Но главное не звезды а то понимание физики процесса которое я получил, и это так же ответ зачем было его делать
Generic Agent = Based Prompt + ReAct+PlanAct + Context Engineering + Memory + Tool Search
Это не просто формула это среда для автономности Based Prompt задает законы физики для модели как она должна думать планировать реагировать на ошибки
ReAct это безальтернативный цикл без которого автономности не существует модель должна рассуждать действовать анализировать результат и корректировать план
Context Engineering потому что контекст не резиновый и агент должен уметь управлять своим вниманием сжимать историю отбрасывать неактуальное держать фокус
Memory это не просто кэш это архитектурное решение о том что помнить что забывать когда делать compaction
Tool Search критически важный компонент для энтерпрайза когда у вас 500 плюс API-ручек вы не можете скормить их все в контекст настоящий агент сначала понимает задачу находит нужный инструмент в репозитории и только потом использует
В ближайшие дни у меня будет несколько площадок где я буду давать очень скромный прогноз без хайпа обещаю
Очень хочу показать что курсы по AI-агентам дают вам базу с langchain или n8n и обещают что теперь вы зарабатываете 300к в наносекунду но они не расскажут про управление форматом и структурами внутри tools про constraint и args про то как на самом деле работает structured output (пришлите в коменты если такой курс есть) как управлять ризонингом в агентах и как его вызывать самому (наш тул reasoning+plan)
Must Read от создателей LLM
Перед тем как что-то изобретать и задавать вопросы прочитайте что говорят те кто делает сами модели
OpenAI A Practical Guide to Building Agents
OpenAI Building Agents Track
Anthropic Building Effective Agents
Anthropic Context Engineering
Anthropic Building Agents with Claude Agent SDK
Все они говорят +- одно начинайте с простого не тащите сразу LangGraph на 20 нод сделайте одного агента с одним инструментом заставьте работать потом масштабируйте
Я строю агентов на локальных моделях и как оказалось что бы строить generic agent нужно мощное железо🗿
Это не потому что я против OpenAI это потому что я хочу полный контроль над инференсом над латенси над стоимостью
Когда ты делаешь продакшен на локальных моделях ты понимаешь каждый байт контекста каждый вызов инструмента каждую миллисекунду задержки
Это сделать тебя лучшим инженером над API вызовами
По этому далее будет усиление на контент именно про них, про агентов, и про sgr-agent-core будем выводить фреймворк на 10к звезд!
Если ты со мной ставь🖥 Linux =)
Stay tuned!
Капля истории
Мы с вами начали с фундамента AI-инфраструктуры тестировали Llama на кластерах 4090, показывал вам тюн Whisper и считали экономику on-premise решений
Затем углубились в сложный RAG и Vibe Coding: заняли топ с малыми моделями в Enterprise RAG Challenge изучили Circuit Tracing для поиска галлюцинаций и научились собирать MVP за 7 дней
В середине 2025 перешли к автономным системам: запустили open-source SGR Deep Research доказали эффективность на бенчмарках и выпустили фреймворк SGR Agent Core
Честно говоря к концу 2025 года стало очевидно что RAG превратился в стандартную инженерную задачу которую может собрать джун по туториалам
Настоящий вызов сместился к агентам
И вот тут начинается самое интересное потому что большинство того что называют агентами на рынке это просто красивые цепочки в no-code конструкторах Workflow где вы заранее продумали каждый if-else
Это не агенты это детерминированные пайплайны с LLM внутри
Я потратил последние месяцы на то чтобы понять как строить настоящие автономные системы (Запускал демо ERC3, строил решения для демо в agentic comerce)
Результат всей моей работы оказался тут sgr-agent-core фреймворк уже набрал 815 звезд на GitHub и работает в продакшене у реальных клиентов
Но главное не звезды а то понимание физики процесса которое я получил, и это так же ответ зачем было его делать
Generic Agent = Based Prompt + ReAct+PlanAct + Context Engineering + Memory + Tool Search
Это не просто формула это среда для автономности Based Prompt задает законы физики для модели как она должна думать планировать реагировать на ошибки
ReAct это безальтернативный цикл без которого автономности не существует модель должна рассуждать действовать анализировать результат и корректировать план
Context Engineering потому что контекст не резиновый и агент должен уметь управлять своим вниманием сжимать историю отбрасывать неактуальное держать фокус
Memory это не просто кэш это архитектурное решение о том что помнить что забывать когда делать compaction
Tool Search критически важный компонент для энтерпрайза когда у вас 500 плюс API-ручек вы не можете скормить их все в контекст настоящий агент сначала понимает задачу находит нужный инструмент в репозитории и только потом использует
В ближайшие дни у меня будет несколько площадок где я буду давать очень скромный прогноз без хайпа обещаю
Очень хочу показать что курсы по AI-агентам дают вам базу с langchain или n8n и обещают что теперь вы зарабатываете 300к в наносекунду но они не расскажут про управление форматом и структурами внутри tools про constraint и args про то как на самом деле работает structured output (пришлите в коменты если такой курс есть) как управлять ризонингом в агентах и как его вызывать самому (наш тул reasoning+plan)
Must Read от создателей LLM
Перед тем как что-то изобретать и задавать вопросы прочитайте что говорят те кто делает сами модели
OpenAI A Practical Guide to Building Agents
OpenAI Building Agents Track
Anthropic Building Effective Agents
Anthropic Context Engineering
Anthropic Building Agents with Claude Agent SDK
Все они говорят +- одно начинайте с простого не тащите сразу LangGraph на 20 нод сделайте одного агента с одним инструментом заставьте работать потом масштабируйте
Я строю агентов на локальных моделях и как оказалось что бы строить generic agent нужно мощное железо
Это не потому что я против OpenAI это потому что я хочу полный контроль над инференсом над латенси над стоимостью
Когда ты делаешь продакшен на локальных моделях ты понимаешь каждый байт контекста каждый вызов инструмента каждую миллисекунду задержки
Это сделать тебя лучшим инженером над API вызовами
По этому далее будет усиление на контент именно про них, про агентов, и про sgr-agent-core будем выводить фреймворк на 10к звезд!
Если ты со мной ставь
Stay tuned!
Please open Telegram to view this post
VIEW IN TELEGRAM
Прикольный специализированный агент - помогает редактировать научные статьи
Forwarded from Анализ данных (Data analysis)
🚀 Релиз GLM-4.6V!
• GLM-4.6V (106B) - старшая модель.
• GLM-4.6V-Flash (9B) — лёгкая, быстрая, отлично подходит для локального использования.
🔥 Что внутри:
✅ Нативный multimodal tool calling -заточена на работу с изображениями и документами.
✅ Контекст 128K - переваривает 150-страничные документы или часовые видео за один прогон
✅ Visual → Action pipeline - мультимодальные агенты: “найди эту одежду онлайн” → возвращает структурированный список покупок
✅ На 50% дешевле GLM-4.5V-— ~1$ за миллион входных токенов. (На ModelScope API можно использовать бесплатно.)
→ modelscope.cn/collections/GLM-46V-37fabc27818446
• GLM-4.6V (106B) - старшая модель.
• GLM-4.6V-Flash (9B) — лёгкая, быстрая, отлично подходит для локального использования.
🔥 Что внутри:
✅ Нативный multimodal tool calling -заточена на работу с изображениями и документами.
✅ Контекст 128K - переваривает 150-страничные документы или часовые видео за один прогон
✅ Visual → Action pipeline - мультимодальные агенты: “найди эту одежду онлайн” → возвращает структурированный список покупок
✅ На 50% дешевле GLM-4.5V-— ~1$ за миллион входных токенов. (На ModelScope API можно использовать бесплатно.)
→ modelscope.cn/collections/GLM-46V-37fabc27818446
Forwarded from Анализ данных (Data analysis)
🚀 Вышел Qwen-Image-i2L от DiffSynth-Studio - первый open-source инструмент, который умеет делать LoRA-модель из одной картинки. 🖼️➡️🧠
Что можно извлекать из изображения:
🎨 Style — только стиль и эстетика
🧩 Coarse — стиль + содержание сцены
✨ Fine — улучшение детализации 1024×1024 (используется вместе с Coarse)
⚖️ Bias — подстройка под фирменный визуальный почерк Qwen-Image
Модель построена на SigLIP2 + DINOv3 + Qwen-VL.
Итог — можно взять одну картинку и быстро натренировать под неё собственную LoRA, без больших датасетов.
🔗 ModelScope: modelscope.cn/models/DiffSynth-Studio/Qwen-Image-i2L/summary
💻 Код: github.com/modelscope/DiffSynth-Studio/blob/main/examples/qwen_image/model_inference_low_vram/Qwen-Image-i2L.py
Что можно извлекать из изображения:
🎨 Style — только стиль и эстетика
🧩 Coarse — стиль + содержание сцены
✨ Fine — улучшение детализации 1024×1024 (используется вместе с Coarse)
⚖️ Bias — подстройка под фирменный визуальный почерк Qwen-Image
Модель построена на SigLIP2 + DINOv3 + Qwen-VL.
Итог — можно взять одну картинку и быстро натренировать под неё собственную LoRA, без больших датасетов.
🔗 ModelScope: modelscope.cn/models/DiffSynth-Studio/Qwen-Image-i2L/summary
💻 Код: github.com/modelscope/DiffSynth-Studio/blob/main/examples/qwen_image/model_inference_low_vram/Qwen-Image-i2L.py