🤖 AI-агент с нуля: руководство по MCP
В прошлый раз мы собрали ReAct-агента и разобрали, как работает tool calling под капотом. Теперь идём дальше — подключаем агента к реальному миру через открытый стандарт Anthropic.
Это вторая часть видеокурса об AI-агентах от ML-инженера Artezio Антона Максимова!
Разберём, почему самодельный протокол для инструментов — это тупик при масштабировании и как Model Context Protocol решает эту проблему раз и навсегда. MCP — единый стандарт, который уже поддерживают Claude Desktop, Cursor, Zed и десятки других инструментов.
В этом выпуске:
— Что такое MCP и зачем он нужен, если tool calling уже работает
— Роли в архитектуре MCP и чем они отличаются
— Пишем собственный MCP-сервер на FastMCP
— Подключаем ReAct-агента к серверу
🎬 Смотрите на YouTube или RuTube!
Следующая часть курса будет посвящена Memory, не переключайтесь :)
В прошлый раз мы собрали ReAct-агента и разобрали, как работает tool calling под капотом. Теперь идём дальше — подключаем агента к реальному миру через открытый стандарт Anthropic.
Это вторая часть видеокурса об AI-агентах от ML-инженера Artezio Антона Максимова!
Разберём, почему самодельный протокол для инструментов — это тупик при масштабировании и как Model Context Protocol решает эту проблему раз и навсегда. MCP — единый стандарт, который уже поддерживают Claude Desktop, Cursor, Zed и десятки других инструментов.
В этом выпуске:
— Что такое MCP и зачем он нужен, если tool calling уже работает
— Роли в архитектуре MCP и чем они отличаются
— Пишем собственный MCP-сервер на FastMCP
— Подключаем ReAct-агента к серверу
🎬 Смотрите на YouTube или RuTube!
Следующая часть курса будет посвящена Memory, не переключайтесь :)
🔥8👍7❤1💩1
Вышло новое поколение моделей OpenAI GPT-5.6: Sol, Terra и Luna. Artificial Analysis (независимая площадка бенчмаркинга LLM ) уже прогнали его по тестам. Главная новость: GPT-5.6 Sol (max) возглавил их новый Coding Agent Index с 80 баллами.
Индекс меряет работу агента целиком (а не только генерацию отдельных функций): исследование репозитория (SWE-Atlas-QnA, вопросы-ответы по большим кодовым базам), доведение задачи до проверяемого результата (DeepSWE, реальные задачи в духе SWE-bench), командную строку (Terminal-Bench v2) и координацию инструментов. Sol в связке с Codex лидирует во всех трёх тестах, при этом стоимость задачи примерно на 40% ниже, чем у Claude Fable 5 (max), и на 10% ниже Opus 4.8 (max) в Claude Code.
Sol — флагман: в Intelligence Index отстаёт от Fable 5 всего на 1 балл (59), но втрое дешевле, $1.04 за задачу. Terra и Luna дешевле на ~50% и ~80%, для массовых задач. По токенам Sol экономнее предшественника: 15k на задачу против 16k у GPT-5.5, при большем интеллекте, чем у Opus 4.8 и Gemini 3.5 Flash.
Похоже, для агентного кодинга Codex + Sol сейчас лучший baseline по цене/качеству. Для аналитически тяжёлых задач Fable 5 всё ещё впереди (Elo 1764 vs 1592 в AA-Briefcase).
Индекс меряет работу агента целиком (а не только генерацию отдельных функций): исследование репозитория (SWE-Atlas-QnA, вопросы-ответы по большим кодовым базам), доведение задачи до проверяемого результата (DeepSWE, реальные задачи в духе SWE-bench), командную строку (Terminal-Bench v2) и координацию инструментов. Sol в связке с Codex лидирует во всех трёх тестах, при этом стоимость задачи примерно на 40% ниже, чем у Claude Fable 5 (max), и на 10% ниже Opus 4.8 (max) в Claude Code.
Sol — флагман: в Intelligence Index отстаёт от Fable 5 всего на 1 балл (59), но втрое дешевле, $1.04 за задачу. Terra и Luna дешевле на ~50% и ~80%, для массовых задач. По токенам Sol экономнее предшественника: 15k на задачу против 16k у GPT-5.5, при большем интеллекте, чем у Opus 4.8 и Gemini 3.5 Flash.
Похоже, для агентного кодинга Codex + Sol сейчас лучший baseline по цене/качеству. Для аналитически тяжёлых задач Fable 5 всё ещё впереди (Elo 1764 vs 1592 в AA-Briefcase).
artificialanalysis.ai
AI Model & API Providers Analysis | Artificial Analysis
Comparison and analysis of AI models and API hosting providers. Independent benchmarks across key performance metrics including quality, price, output speed & latency.
👍6❤1
В десктопном Claude Code появился встроенный браузер (Cmd/Ctrl+Shift+B). Агент открывает документацию, макеты и произвольные сайты, читает страницы, кликает по элементам и работает с локально запущенным приложением, расширение для Chrome больше не нужно. Браузер живёт в отдельном профиле и не видит логины и историю вашего основного, если агенту нужны именно ваши залогиненные сессии, для этого по-прежнему расширение Claude in Chrome.
Это замыкает цикл фронтенд-разработки: агент пишет компонент, сам поднимает dev-сервер, визуально проверяет интерфейс, воспроизводит пользовательский сценарий и чинит найденное. При первом действии на новом сайте спрашивает разрешение, а в настройках можно выбрать, сохранять ли данные сессий между запусками или каждый раз начинать с чистого листа.
Это замыкает цикл фронтенд-разработки: агент пишет компонент, сам поднимает dev-сервер, визуально проверяет интерфейс, воспроизводит пользовательский сценарий и чинит найденное. При первом действии на новом сайте спрашивает разрешение, а в настройках можно выбрать, сохранять ли данные сессий между запусками или каждый раз начинать с чистого листа.
Claude Code Docs
Week 28 · July 6–10, 2026 - Claude Code Docs
Browse external sites from the Desktop app's built-in browser, run a full setup checkup with /doctor, and pick up auto mode transcript protections and agent view upgrades.
⚡3🔥1
💥 Агентская фабрика на CI: автоматизируем весь цикл разработки
Лёша Берёзка, техлид iOS в "Додо Пицце" и автор канала о разработке, покажет онлайн, как построить «фабрику» агентов в CI‑пайплайне — систему, которая самостоятельно закрывает полный цикл от создания issue до влития Pull Request.
➡️ Разберём, как организовать оркестрацию нескольких агентов и обеспечить их согласованную работу.
➡️ Посмотрим, как фабрика автоматически заводит issue, сама их планирует, уточняет детали, реализует и доводит Pull Request до успешного слияния.
➡️ Разберём типовые проблемы и способы их решения.
Когда?
Завтра, 15 июля, в 13:00.
Смотрите на YouTube, в ВК или прямо в этом канале — и задавайте вопросы Лёше!
Лёша Берёзка, техлид iOS в "Додо Пицце" и автор канала о разработке, покажет онлайн, как построить «фабрику» агентов в CI‑пайплайне — систему, которая самостоятельно закрывает полный цикл от создания issue до влития Pull Request.
Когда?
Завтра, 15 июля, в 13:00.
Смотрите на YouTube, в ВК или прямо в этом канале — и задавайте вопросы Лёше!
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥6👍2❤1🤡1
OpenWiki (LangChain, 1 июля) - открытый агент и CLI, который генерирует и поддерживает «вики» кодовой базы для агентов. Он индексирует репозиторий, фиксирует, где что лежит и как связано, а в CLAUDE.md/AGENTS.md кладёт не сотни страниц, а ссылку: агент сам подтянет нужное. Обновляется по коммитам через CI (GitHub Actions / GitLab / Bitbucket), читает diff с прошлого прогона и правит только затронутое. Провайдеры LLM: OpenRouter (дефолт), OpenAI, Anthropic, Fireworks, Baseten. Поверх DeepAgents, для трейса активностей агентов можно подключить LangSmith. Есть режим personal, локальная база знаний из ваших репо, Gmail, Notion, веб-поиска, и зачем-то даже есть коннекторы к Hacker News и X.
Вдохновлено DeepWiki, AutoWiki и концепцией LLM Wiki Карпаты.
Польза в том, что агент не должен заново разбираться во всём репозитории каждую сессию. Предполагается, что особенно эффективно, если репозиторий большой и legacy.
Открытый вопрос: что происходит с этой памятью со временем. Диффы копятся, глазами такие доки никто не читает. Нужен ли ревью владельцами модулей или дрейф не накапливается и обновления по коммитам достаточно? Если у кого-то уже крутится в CI, или был аналог - расскажите, что видите.
Вдохновлено DeepWiki, AutoWiki и концепцией LLM Wiki Карпаты.
Польза в том, что агент не должен заново разбираться во всём репозитории каждую сессию. Предполагается, что особенно эффективно, если репозиторий большой и legacy.
Открытый вопрос: что происходит с этой памятью со временем. Диффы копятся, глазами такие доки никто не читает. Нужен ли ревью владельцами модулей или дрейф не накапливается и обновления по коммитам достаточно? Если у кого-то уже крутится в CI, или был аналог - расскажите, что видите.
Langchain
OpenWiki: Open Source Repo Documentation for Coding Agents
OpenWiki generates and maintains codebase documentation so coding agents can find the repo context they need without loading everything into one instruction file.
❤3🤔2👍1
🤔 Какова вероятность выживания человечества в эпоху суперинтеллекта?
Исследователь Элиезер Юдковский и президент MIRI Нейт Соарес изложили свой прогноз в книге, которая только что вышла на русском языке под названием «Если кто-то его создаст — все погибнут. Почему сверхчеловеческий ИИ уничтожит нас всех».
Доктор технических наук Владимир Крылов рассмотрит этот прогноз и обоснует возможность значительно более оптимистичного варианта развития событий. Он основан на разработках методов коммуникации с неживым, которые развивает биолог Майкл Левин. Ведь в будущем построение конвенциональных отношений со сверхинтеллектом существенно сократит вероятность рокового исхода...
⏰ Запускаем трансляцию завтра, 16 июля, в 13:00.
Смотрите на YouTube, в ВК или прямо в этом канале — и задавайте вопросы лектору!
Исследователь Элиезер Юдковский и президент MIRI Нейт Соарес изложили свой прогноз в книге, которая только что вышла на русском языке под названием «Если кто-то его создаст — все погибнут. Почему сверхчеловеческий ИИ уничтожит нас всех».
Доктор технических наук Владимир Крылов рассмотрит этот прогноз и обоснует возможность значительно более оптимистичного варианта развития событий. Он основан на разработках методов коммуникации с неживым, которые развивает биолог Майкл Левин. Ведь в будущем построение конвенциональных отношений со сверхинтеллектом существенно сократит вероятность рокового исхода...
⏰ Запускаем трансляцию завтра, 16 июля, в 13:00.
Смотрите на YouTube, в ВК или прямо в этом канале — и задавайте вопросы лектору!
👍6🔥6🤡2
Moonshot выпустили Kimi K3, 57 баллов в Artificial Analysis Intelligence Index. Выше только Claude Fable 5 (60) и GPT-5.6 Sol (59). Opus 4.8 с его 56 остался позади.
Что интересно в цифрах:
— На GDPval (реальные рабочие задачи) 1668 Elo, третье место после Fable 5 и Sol
— На AA-Briefcase (длинные многошаговые задачи) вообще второе место, обошёл Sol. По качеству аналитики практически паритет с Fable 5: 1760 против 1764
— Цена $3/$15 за миллион токенов, ~$0.94 за задачу индекса. Это примерно вдвое дешевле Opus 4.8 при сопоставимом уровне
Чтобы глубже понимать контекст: в начале июня моделей с 50+ баллами в Artificial Analysis Intelligence Index было две, у Anthropic и OpenAI. Сейчас таких шесть. Только за последние восемь дней фронтир пополнили Grok 4.5, GPT-5.6, Muse Spark 1.1 и вот теперь Kimi K3. Отрыв лидера сжался с четырёх баллов до одного.
Веса обещают опубликовать 27-го. Но чтобы поднять такое у себя, конечно, нужен кластер. Практический смысл открытых весов есть для независимых провайдеров инференса и возможность файнтюна для тех, у кого есть железо.
А ещё ждём показателей Qwen3.8 от Alibaba, которая появилась в превью вчера, и которую они также заявляют как «second only to Fable 5».
Есть повод пересчитать экономику пайплайнов, которые держатся на дорогих моделях для агентских задач.
Что интересно в цифрах:
— На GDPval (реальные рабочие задачи) 1668 Elo, третье место после Fable 5 и Sol
— На AA-Briefcase (длинные многошаговые задачи) вообще второе место, обошёл Sol. По качеству аналитики практически паритет с Fable 5: 1760 против 1764
— Цена $3/$15 за миллион токенов, ~$0.94 за задачу индекса. Это примерно вдвое дешевле Opus 4.8 при сопоставимом уровне
Чтобы глубже понимать контекст: в начале июня моделей с 50+ баллами в Artificial Analysis Intelligence Index было две, у Anthropic и OpenAI. Сейчас таких шесть. Только за последние восемь дней фронтир пополнили Grok 4.5, GPT-5.6, Muse Spark 1.1 и вот теперь Kimi K3. Отрыв лидера сжался с четырёх баллов до одного.
Веса обещают опубликовать 27-го. Но чтобы поднять такое у себя, конечно, нужен кластер. Практический смысл открытых весов есть для независимых провайдеров инференса и возможность файнтюна для тех, у кого есть железо.
А ещё ждём показателей Qwen3.8 от Alibaba, которая появилась в превью вчера, и которую они также заявляют как «second only to Fable 5».
Есть повод пересчитать экономику пайплайнов, которые держатся на дорогих моделях для агентских задач.
👍4🔥3❤1
Британский AI Security Institute (государственный институт безопасности ИИ) опубликовал замеры разрыва между открытыми и закрытыми моделями в хакерских навыках. GLM-5.2 показывает уровень Opus 4.6 на отдельных задачах (эксплуатация уязвимостей, реверс, крипто) и Opus 4.5 на автономных многошаговых атаках в симулированных сетях. Итого текущий лаг — 4–7 месяцев. В 2025-м было 6–10. Закрытую модель провайдер может мониторить, банить и отзывать. Открытые веса после релиза доступны всем: safeguards снимаются, копии расходятся.
AI Security Institute
How Far Behind the Frontier are Leading Open Weight Models on Cyber? | AISI Work
We evaluated the cyber capabilities of leading open and closed weight AI models, and found that recent open models GLM-5.2 and DeepSeek V4-Pro perform similarly to frontier closed models released 4 to 7 months before them – a narrower gap than the 6 to 10…
🤔2
T-Search — открытый агент для сложного многошагового поиска на базе Qwen3.6-35B-A3B, обученный полностью на синтетике. Один из немногих релизов, заточенных под поиск именно в русскоязычных источниках. Модель не пишет ответ, а отдаёт ранжированный список evidence-чанков, дальнейшую генерацию доверяете любой модели под свой продукт. Выложили всё: веса, харнесс отдельным репозиторием и два бенчмарка, включая TRuST — ручной бенчмарк агентского поиска на русском. Фактически это жёсткая связка модель+харнесс: промпты и пороговые значения — ровно та конфигурация, под которую модель обучалась. При этом сам поиск по документам — эмбеддер и векторную базу — поднимаете сами, в комплекте его нет. Просто заменить свой ретривер на T-Search не получится: придётся встраивать всю конструкцию целиком и проверять, как она ищет по вашей базе документов. Подробности про обучение и ссылки на репозитории — в статье на Хабре.
Хабр
T-Search: как мы обучали агента многошаговому поиску
Всем привет! На связи Толя Потапов, MLE в Т-Банке. Продолжаем развивать линейку открытых моделей Gen-T. Мы делились русскоязычными семействами моделей T-Lite и T-Pro. Сегодня выпускаем модель другого...
🔥3💩1