Forwarded from Валера Ковальский
Я ставлю крест на RAG: почему поиск по базе — это теперь задача для джуна, а будущее — за Generic Agent
Байт засчитан =)
Капля истории
Мы с вами начали с фундамента AI-инфраструктуры тестировали Llama на кластерах 4090, показывал вам тюн Whisper и считали экономику on-premise решений
Затем углубились в сложный RAG и Vibe Coding: заняли топ с малыми моделями в Enterprise RAG Challenge изучили Circuit Tracing для поиска галлюцинаций и научились собирать MVP за 7 дней
В середине 2025 перешли к автономным системам: запустили open-source SGR Deep Research доказали эффективность на бенчмарках и выпустили фреймворк SGR Agent Core
Честно говоря к концу 2025 года стало очевидно что RAG превратился в стандартную инженерную задачу которую может собрать джун по туториалам
Настоящий вызов сместился к агентам
И вот тут начинается самое интересное потому что большинство того что называют агентами на рынке это просто красивые цепочки в no-code конструкторах Workflow где вы заранее продумали каждый if-else
Это не агенты это детерминированные пайплайны с LLM внутри
Я потратил последние месяцы на то чтобы понять как строить настоящие автономные системы (Запускал демо ERC3, строил решения для демо в agentic comerce)
Результат всей моей работы оказался тут sgr-agent-core фреймворк уже набрал 815 звезд на GitHub и работает в продакшене у реальных клиентов
Но главное не звезды а то понимание физики процесса которое я получил, и это так же ответ зачем было его делать
Generic Agent = Based Prompt + ReAct+PlanAct + Context Engineering + Memory + Tool Search
Это не просто формула это среда для автономности Based Prompt задает законы физики для модели как она должна думать планировать реагировать на ошибки
ReAct это безальтернативный цикл без которого автономности не существует модель должна рассуждать действовать анализировать результат и корректировать план
Context Engineering потому что контекст не резиновый и агент должен уметь управлять своим вниманием сжимать историю отбрасывать неактуальное держать фокус
Memory это не просто кэш это архитектурное решение о том что помнить что забывать когда делать compaction
Tool Search критически важный компонент для энтерпрайза когда у вас 500 плюс API-ручек вы не можете скормить их все в контекст настоящий агент сначала понимает задачу находит нужный инструмент в репозитории и только потом использует
В ближайшие дни у меня будет несколько площадок где я буду давать очень скромный прогноз без хайпа обещаю
Очень хочу показать что курсы по AI-агентам дают вам базу с langchain или n8n и обещают что теперь вы зарабатываете 300к в наносекунду но они не расскажут про управление форматом и структурами внутри tools про constraint и args про то как на самом деле работает structured output (пришлите в коменты если такой курс есть) как управлять ризонингом в агентах и как его вызывать самому (наш тул reasoning+plan)
Must Read от создателей LLM
Перед тем как что-то изобретать и задавать вопросы прочитайте что говорят те кто делает сами модели
OpenAI A Practical Guide to Building Agents
OpenAI Building Agents Track
Anthropic Building Effective Agents
Anthropic Context Engineering
Anthropic Building Agents with Claude Agent SDK
Все они говорят +- одно начинайте с простого не тащите сразу LangGraph на 20 нод сделайте одного агента с одним инструментом заставьте работать потом масштабируйте
Я строю агентов на локальных моделях и как оказалось что бы строить generic agent нужно мощное железо🗿
Это не потому что я против OpenAI это потому что я хочу полный контроль над инференсом над латенси над стоимостью
Когда ты делаешь продакшен на локальных моделях ты понимаешь каждый байт контекста каждый вызов инструмента каждую миллисекунду задержки
Это сделать тебя лучшим инженером над API вызовами
По этому далее будет усиление на контент именно про них, про агентов, и про sgr-agent-core будем выводить фреймворк на 10к звезд!
Если ты со мной ставь🖥 Linux =)
Stay tuned!
Капля истории
Мы с вами начали с фундамента AI-инфраструктуры тестировали Llama на кластерах 4090, показывал вам тюн Whisper и считали экономику on-premise решений
Затем углубились в сложный RAG и Vibe Coding: заняли топ с малыми моделями в Enterprise RAG Challenge изучили Circuit Tracing для поиска галлюцинаций и научились собирать MVP за 7 дней
В середине 2025 перешли к автономным системам: запустили open-source SGR Deep Research доказали эффективность на бенчмарках и выпустили фреймворк SGR Agent Core
Честно говоря к концу 2025 года стало очевидно что RAG превратился в стандартную инженерную задачу которую может собрать джун по туториалам
Настоящий вызов сместился к агентам
И вот тут начинается самое интересное потому что большинство того что называют агентами на рынке это просто красивые цепочки в no-code конструкторах Workflow где вы заранее продумали каждый if-else
Это не агенты это детерминированные пайплайны с LLM внутри
Я потратил последние месяцы на то чтобы понять как строить настоящие автономные системы (Запускал демо ERC3, строил решения для демо в agentic comerce)
Результат всей моей работы оказался тут sgr-agent-core фреймворк уже набрал 815 звезд на GitHub и работает в продакшене у реальных клиентов
Но главное не звезды а то понимание физики процесса которое я получил, и это так же ответ зачем было его делать
Generic Agent = Based Prompt + ReAct+PlanAct + Context Engineering + Memory + Tool Search
Это не просто формула это среда для автономности Based Prompt задает законы физики для модели как она должна думать планировать реагировать на ошибки
ReAct это безальтернативный цикл без которого автономности не существует модель должна рассуждать действовать анализировать результат и корректировать план
Context Engineering потому что контекст не резиновый и агент должен уметь управлять своим вниманием сжимать историю отбрасывать неактуальное держать фокус
Memory это не просто кэш это архитектурное решение о том что помнить что забывать когда делать compaction
Tool Search критически важный компонент для энтерпрайза когда у вас 500 плюс API-ручек вы не можете скормить их все в контекст настоящий агент сначала понимает задачу находит нужный инструмент в репозитории и только потом использует
В ближайшие дни у меня будет несколько площадок где я буду давать очень скромный прогноз без хайпа обещаю
Очень хочу показать что курсы по AI-агентам дают вам базу с langchain или n8n и обещают что теперь вы зарабатываете 300к в наносекунду но они не расскажут про управление форматом и структурами внутри tools про constraint и args про то как на самом деле работает structured output (пришлите в коменты если такой курс есть) как управлять ризонингом в агентах и как его вызывать самому (наш тул reasoning+plan)
Must Read от создателей LLM
Перед тем как что-то изобретать и задавать вопросы прочитайте что говорят те кто делает сами модели
OpenAI A Practical Guide to Building Agents
OpenAI Building Agents Track
Anthropic Building Effective Agents
Anthropic Context Engineering
Anthropic Building Agents with Claude Agent SDK
Все они говорят +- одно начинайте с простого не тащите сразу LangGraph на 20 нод сделайте одного агента с одним инструментом заставьте работать потом масштабируйте
Я строю агентов на локальных моделях и как оказалось что бы строить generic agent нужно мощное железо
Это не потому что я против OpenAI это потому что я хочу полный контроль над инференсом над латенси над стоимостью
Когда ты делаешь продакшен на локальных моделях ты понимаешь каждый байт контекста каждый вызов инструмента каждую миллисекунду задержки
Это сделать тебя лучшим инженером над API вызовами
По этому далее будет усиление на контент именно про них, про агентов, и про sgr-agent-core будем выводить фреймворк на 10к звезд!
Если ты со мной ставь
Stay tuned!
Please open Telegram to view this post
VIEW IN TELEGRAM
Прикольный специализированный агент - помогает редактировать научные статьи
Forwarded from Анализ данных (Data analysis)
🚀 Релиз GLM-4.6V!
• GLM-4.6V (106B) - старшая модель.
• GLM-4.6V-Flash (9B) — лёгкая, быстрая, отлично подходит для локального использования.
🔥 Что внутри:
✅ Нативный multimodal tool calling -заточена на работу с изображениями и документами.
✅ Контекст 128K - переваривает 150-страничные документы или часовые видео за один прогон
✅ Visual → Action pipeline - мультимодальные агенты: “найди эту одежду онлайн” → возвращает структурированный список покупок
✅ На 50% дешевле GLM-4.5V-— ~1$ за миллион входных токенов. (На ModelScope API можно использовать бесплатно.)
→ modelscope.cn/collections/GLM-46V-37fabc27818446
• GLM-4.6V (106B) - старшая модель.
• GLM-4.6V-Flash (9B) — лёгкая, быстрая, отлично подходит для локального использования.
🔥 Что внутри:
✅ Нативный multimodal tool calling -заточена на работу с изображениями и документами.
✅ Контекст 128K - переваривает 150-страничные документы или часовые видео за один прогон
✅ Visual → Action pipeline - мультимодальные агенты: “найди эту одежду онлайн” → возвращает структурированный список покупок
✅ На 50% дешевле GLM-4.5V-— ~1$ за миллион входных токенов. (На ModelScope API можно использовать бесплатно.)
→ modelscope.cn/collections/GLM-46V-37fabc27818446
Forwarded from Анализ данных (Data analysis)
🚀 Вышел Qwen-Image-i2L от DiffSynth-Studio - первый open-source инструмент, который умеет делать LoRA-модель из одной картинки. 🖼️➡️🧠
Что можно извлекать из изображения:
🎨 Style — только стиль и эстетика
🧩 Coarse — стиль + содержание сцены
✨ Fine — улучшение детализации 1024×1024 (используется вместе с Coarse)
⚖️ Bias — подстройка под фирменный визуальный почерк Qwen-Image
Модель построена на SigLIP2 + DINOv3 + Qwen-VL.
Итог — можно взять одну картинку и быстро натренировать под неё собственную LoRA, без больших датасетов.
🔗 ModelScope: modelscope.cn/models/DiffSynth-Studio/Qwen-Image-i2L/summary
💻 Код: github.com/modelscope/DiffSynth-Studio/blob/main/examples/qwen_image/model_inference_low_vram/Qwen-Image-i2L.py
Что можно извлекать из изображения:
🎨 Style — только стиль и эстетика
🧩 Coarse — стиль + содержание сцены
✨ Fine — улучшение детализации 1024×1024 (используется вместе с Coarse)
⚖️ Bias — подстройка под фирменный визуальный почерк Qwen-Image
Модель построена на SigLIP2 + DINOv3 + Qwen-VL.
Итог — можно взять одну картинку и быстро натренировать под неё собственную LoRA, без больших датасетов.
🔗 ModelScope: modelscope.cn/models/DiffSynth-Studio/Qwen-Image-i2L/summary
💻 Код: github.com/modelscope/DiffSynth-Studio/blob/main/examples/qwen_image/model_inference_low_vram/Qwen-Image-i2L.py
Оффтопик, но как человек, который был в Помпеях месяц назад, пропустить новость не могу
https://t.me/denissexy/11037
https://t.me/denissexy/11037
Telegram
Denis Sexy IT 🤖
Помните учительница истории любила говорить «рецепт потерян» когда говорила вам про цемент древнего Рима? И вы такой да как так то, мы же технологичнее! У каждого же такое было?
В общем, в Помпеях нашли “застывшую” стройплощадку - дом, ремонт которого прервал…
В общем, в Помпеях нашли “застывшую” стройплощадку - дом, ремонт которого прервал…
🔥2
Forwarded from Machinelearning
🚀 Вышло крупное обновление Qwen3-Omni-Flash (версия 2025-12-01)
Что изменилось:
🎙️ Модель намного лучше ведёт разговоры с голосом и видео - общение звучит естественно и непрерывно
✨ Теперь можно задавать характер ИИ через system prompts, например, стиль общения или роль
🗣️ Улучшена поддержка языков: 119 письменных и 19 голосовых
😊 Голоса звучат почти как настоящие люди
Где попробовать:
🎙️ В Qwen Chat - нажмите VoiceChat или VideoChat (правый нижний угол): http://chat.qwen.ai
📝 Подробности в блоге: https://qwen.ai/blog?id=qwen3-omni-20251201
🎧 Онлайн-демо: http://hf.co/spaces/Qwen/Qwen3-Omni-Demo
🎧 Второе демо: http://modelscope.cn/studios/Qwen/Qwen3-Omni-Demo
⚡ Realtime API: https://modelstudio.console.alibabacloud.com/?tab=doc#/doc/?type=model&url=2840914_2&modelId=qwen3-omni-flash-realtime-2025-12-01
📥 Offline API: https://modelstudio.console.alibabacloud.com/?tab=doc#/doc/?type=model&url=2840914_2&modelId=qwen3-omni-flash-2025-12-01
@ai_machinelearning_big_data
#Qwen #llm #ml
Что изменилось:
🎙️ Модель намного лучше ведёт разговоры с голосом и видео - общение звучит естественно и непрерывно
✨ Теперь можно задавать характер ИИ через system prompts, например, стиль общения или роль
🗣️ Улучшена поддержка языков: 119 письменных и 19 голосовых
😊 Голоса звучат почти как настоящие люди
Где попробовать:
🎙️ В Qwen Chat - нажмите VoiceChat или VideoChat (правый нижний угол): http://chat.qwen.ai
📝 Подробности в блоге: https://qwen.ai/blog?id=qwen3-omni-20251201
🎧 Онлайн-демо: http://hf.co/spaces/Qwen/Qwen3-Omni-Demo
🎧 Второе демо: http://modelscope.cn/studios/Qwen/Qwen3-Omni-Demo
⚡ Realtime API: https://modelstudio.console.alibabacloud.com/?tab=doc#/doc/?type=model&url=2840914_2&modelId=qwen3-omni-flash-realtime-2025-12-01
📥 Offline API: https://modelstudio.console.alibabacloud.com/?tab=doc#/doc/?type=model&url=2840914_2&modelId=qwen3-omni-flash-2025-12-01
@ai_machinelearning_big_data
#Qwen #llm #ml
Сегодня с утра - пара новых моделей tts - text to speech. Если у VOX-cpm 1.5 только два языка - английский и китайский, то у Google все норм, русский есть. Но не опен сорс..
А вообще прикольно, когда с нейронкой можно говорить, обязательно что-то такое замучу
А вообще прикольно, когда с нейронкой можно говорить, обязательно что-то такое замучу
X (formerly Twitter)
Google AI Studio (@GoogleAIStudio) on X
Improving Gemini Text-to-Speech models for better control and capabilities
Для любителей экзотики - маленькая модель text-to-3D. Можно ставить на свой комп
huggingface.co
IvanTang/3DGen-R1 · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Почему я возлагаю большие надежды на релиз ChatGPT 5.2:
во-первых, и 5.1 был прекрасен в написании кода, причем на недорогих подписках в Claude code модель Opus недоступна, только Sonnet, а chatGPT дает доступ к последним моделям (почти);
во-вторых, теперь она знает то, что происходило до августа 2025 - это удобно, модели, которые обучались давно, местами тупят;
Контекст вырос до 400К - тоже удобно, и этого, в общем, достаточно.
Рекомендую Codex как первую опцию для программирования. Будет меньше заморочек, чем с Claude и Gemini.
во-первых, и 5.1 был прекрасен в написании кода, причем на недорогих подписках в Claude code модель Opus недоступна, только Sonnet, а chatGPT дает доступ к последним моделям (почти);
во-вторых, теперь она знает то, что происходило до августа 2025 - это удобно, модели, которые обучались давно, местами тупят;
Контекст вырос до 400К - тоже удобно, и этого, в общем, достаточно.
Рекомендую Codex как первую опцию для программирования. Будет меньше заморочек, чем с Claude и Gemini.
Вот и я о том - все скоро станут вайб-кодерами в том или ином количестве. И чем дальше, тем больше
https://t.me/seeallochnaya/3194
https://t.me/seeallochnaya/3194
Telegram
Сиолошная
OpenAI недавно выпустили Android-приложение Sora; по классике, сначала вышла iOS-версия, и затем через какое-то время команда допилила для нас, работяг. Вот только OpenAI сделали приложение командой из 4 человек и всего за 4 недели благодаря Codex Max — и…
С учетом того, что теперь вайб-кодинг - наше все, надо озаботиться правильными промптами для агентов.
Прежде чем, собственно, программировать, попросите модель сначала сделать readme.md (для людей), а потом agents.md (для агентов), для Клода - Claude.md. Чтобы этот файл получился качественным, попросите модель посмотреть этот репозиторий:
https://github.com/agentsmd/agents.md
Ну или его аналог.
Положите эти файлы в директорию проекта и запускайте Codex (рекомендую) или другого вашего агента для программирования.
Так работает вайб-кодинг..
Прежде чем, собственно, программировать, попросите модель сначала сделать readme.md (для людей), а потом agents.md (для агентов), для Клода - Claude.md. Чтобы этот файл получился качественным, попросите модель посмотреть этот репозиторий:
https://github.com/agentsmd/agents.md
Ну или его аналог.
Положите эти файлы в директорию проекта и запускайте Codex (рекомендую) или другого вашего агента для программирования.
Так работает вайб-кодинг..
GitHub
GitHub - agentsmd/agents.md: AGENTS.md — a simple, open format for guiding coding agents
AGENTS.md — a simple, open format for guiding coding agents - agentsmd/agents.md
Интересная мини-моделька на 3В специально натренированная для распознавания pdf - в последнее время, интересная для меня тема
huggingface.co
ByteDance/Dolphin-v2 · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Лайфхак. Если вы регулярно используете схемы в презентациях, то их гораздо проще и удобнее рисовать в draw.io
Это шикарная, очень простая и удобная программа. 100% рекомендую. А теперь к ней еще прикрутили и ИИ. Надо пробовать
Это шикарная, очень простая и удобная программа. 100% рекомендую. А теперь к ней еще прикрутили и ИИ. Надо пробовать
GitHub
GitHub - DayuanJiang/next-ai-draw-io: A next.js web application that integrates AI capabilities with draw.io diagrams. This app…
A next.js web application that integrates AI capabilities with draw.io diagrams. This app allows you to create, modify, and enhance diagrams through natural language commands and AI-assisted visual...
Forwarded from дядя_д
Это спустя два месяца после запуска запуска этой фичи у Anthropic. Skills – это папки с markdown-файлами и скриптами, которые позволяют LLM получать специализированные знания для конкретных задач. ChatGPT теперь имеет встроенную директорию
/home/oai/skills с готовыми skills для работы с PDF, DOCX и spreadsheets. Когда внедряли MCP (тоже антропиковская разработка) воротили носом только так. А тут что-то быстро прошло. И в стелс-режиме
сурс – https://simonwillison.net/2025/Dec/12/openai-skills/
дядь_д
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Анализ данных (Data analysis)
💡 Google Переводчик запускает перевод речи в реальном времени прямо в беспроводные наушники - и да, подходят любые модели.
Функция работает на базе нейросети Gemini и уже проходит тестирование на Android в США, Индии и Мексике. Поддерживается более 70 языков, включая русский.
Как это выглядит на практике:
собеседник говорит - ты сразу слышишь перевод в наушниках. Без пауз, без необходимости смотреть на экран, без лишних действий.
Ключевое отличие от конкурентов - универсальность. Google не привязывает функцию к конкретному «железу» и не требует фирменных наушников. Это резко контрастирует с подходом Apple, где подобные возможности ограничены экосистемой AirPods.
По сути, Google делает перевод частью повседневного общения, а не отдельным режимом в приложении.
Глобальный релиз и версия для iOS ожидаются в 2026 году.
Функция работает на базе нейросети Gemini и уже проходит тестирование на Android в США, Индии и Мексике. Поддерживается более 70 языков, включая русский.
Как это выглядит на практике:
собеседник говорит - ты сразу слышишь перевод в наушниках. Без пауз, без необходимости смотреть на экран, без лишних действий.
Ключевое отличие от конкурентов - универсальность. Google не привязывает функцию к конкретному «железу» и не требует фирменных наушников. Это резко контрастирует с подходом Apple, где подобные возможности ограничены экосистемой AirPods.
По сути, Google делает перевод частью повседневного общения, а не отдельным режимом в приложении.
Глобальный релиз и версия для iOS ожидаются в 2026 году.
Большая книжка из Стенфорда - такую я бы начал читать с NotebookLM..
https://web.stanford.edu/~jurafsky/slp3/ed3book_aug25.pdf
https://web.stanford.edu/~jurafsky/slp3/ed3book_aug25.pdf