Media is too big
VIEW IN TELEGRAM
🚀 Codex CLI: создаём автономный код‑ревьюер
Предлагаем обзор простого, но рабочего сетапа, который позволит:
→ посмотреть возможности Codex CLI;
→ собрать базовую инфраструктуру;
→ реализовать автономный код-ревьюер почти без вмешательства живого специалиста.
"Для работы с агентами нужны 3 главных навыка: адаптивность, слабоумие и отвага. Потому что иногда агент делает очень умные вещи, а иногда — очень странные", — говорит Артем Летюшев, tech project manager twinby.ru и автор канала @junior_pm.
Артем показал в онлайне:
⚡️ как настроить Codex CLI и MCP;
⚡️ как подключить Skills и защитные хуки;
⚡️ как спланировать roadmap и быстро запустить проект.
Запись доступна здесь и на других площадках:
YouTube
RuTube
ВКонтакте
ЯндексМузыка
Mave
Предлагаем обзор простого, но рабочего сетапа, который позволит:
→ посмотреть возможности Codex CLI;
→ собрать базовую инфраструктуру;
→ реализовать автономный код-ревьюер почти без вмешательства живого специалиста.
"Для работы с агентами нужны 3 главных навыка: адаптивность, слабоумие и отвага. Потому что иногда агент делает очень умные вещи, а иногда — очень странные", — говорит Артем Летюшев, tech project manager twinby.ru и автор канала @junior_pm.
Артем показал в онлайне:
⚡️ как настроить Codex CLI и MCP;
⚡️ как подключить Skills и защитные хуки;
⚡️ как спланировать roadmap и быстро запустить проект.
Запись доступна здесь и на других площадках:
YouTube
RuTube
ВКонтакте
ЯндексМузыка
Mave
❤3
У Claude будет жёстче проверка аккаунтов
С 8 июля новая privacy policy Anthropic разрешает запрашивать age/identity verification. Для возраста - селфи через Yoti или документ. Для проверки личности - government ID вроде паспорта и live selfie через Persona.
Это не значит, что 8 июля у всех разом попросят паспорт. Но если аккаунт попадёт под проверку, доступ может упереться в верификацию.
Для разработчиков неприятная часть не в самом KYC, а в зависимости от одного consumer-аккаунта. Если Claude уже сидит в вашем рабочем процессе, нужен план Б: резервная модель, сохранённые промпты, экспорт настроек и понимание, чем заменить сервис в день, когда он внезапно попросит документы.Anthropic пишет, что verification data не используется для обучения моделей.
Но вопрос в приватности и доступе к моделям в странах, которые Anthropic официально не поддерживает.
Privacy Policy: https://www.anthropic.com/legal/privacy
Age assurance: https://support.claude.com/en/articles/15171100-age-assurance-on-claude
Identity verification: https://support.claude.com/en/articles/14328960-identity-verification-on-claude
С 8 июля новая privacy policy Anthropic разрешает запрашивать age/identity verification. Для возраста - селфи через Yoti или документ. Для проверки личности - government ID вроде паспорта и live selfie через Persona.
Это не значит, что 8 июля у всех разом попросят паспорт. Но если аккаунт попадёт под проверку, доступ может упереться в верификацию.
Для разработчиков неприятная часть не в самом KYC, а в зависимости от одного consumer-аккаунта. Если Claude уже сидит в вашем рабочем процессе, нужен план Б: резервная модель, сохранённые промпты, экспорт настроек и понимание, чем заменить сервис в день, когда он внезапно попросит документы.Anthropic пишет, что verification data не используется для обучения моделей.
Но вопрос в приватности и доступе к моделям в странах, которые Anthropic официально не поддерживает.
Privacy Policy: https://www.anthropic.com/legal/privacy
Age assurance: https://support.claude.com/en/articles/15171100-age-assurance-on-claude
Identity verification: https://support.claude.com/en/articles/14328960-identity-verification-on-claude
🔥2🤬1🤡1
В AI-тусовке на выходных разогнали «новость»: Mistral якобы выпустила модель Le Chaton Fat, которая обходит Claude в benchmark’ах.
Проблема в том, что такой модели нет.
Новость выросла из старого названия ассистента Mistral - Le Chat. Его уже переименовали в Mistral Vibe, а в X кто-то превратил «кота» в «толстого котёнка» и начал постить фейковые анонсы: MoE на десятки триллионов параметров, миллион токенов контекста, рекордные таблицы и прочий AGI к завтраку.
Дальше скриншоты разошлись, часть людей поверила, CEO Mistral Артур Менш подыграл фразой про le gros chaton, и мем на пару дней стал почти инсайдом. Но самой модели нет.
Разбор Numerama:
https://www.numerama.com/tech/2276253-cest-quoi-le-chaton-fat-le-modele-de-mistral-ai-qui-affole-les-reseaux-sociaux.html
Официальные новости Mistral:
https://mistral.ai/news/
Проблема в том, что такой модели нет.
Новость выросла из старого названия ассистента Mistral - Le Chat. Его уже переименовали в Mistral Vibe, а в X кто-то превратил «кота» в «толстого котёнка» и начал постить фейковые анонсы: MoE на десятки триллионов параметров, миллион токенов контекста, рекордные таблицы и прочий AGI к завтраку.
Дальше скриншоты разошлись, часть людей поверила, CEO Mistral Артур Менш подыграл фразой про le gros chaton, и мем на пару дней стал почти инсайдом. Но самой модели нет.
Разбор Numerama:
https://www.numerama.com/tech/2276253-cest-quoi-le-chaton-fat-le-modele-de-mistral-ai-qui-affole-les-reseaux-sociaux.html
Официальные новости Mistral:
https://mistral.ai/news/
😁6👍1😭1
Media is too big
VIEW IN TELEGRAM
Голосовой агент — это не просто чат-бот + TTS. Это эволюция от текстового бота через полудуплекс к full-duplex, где на каждом уровне появляются свои проблемы. Пройдем этот путь на реальном production-стеке (Rust, ~1600 строк).
Как построить голосового AI-агента, экономящего время пользователя, рассказывает Виктор Загускин — руководитель центра компетенций голосового ИИ в MWS.AI.
В программе:
→ Голос, файловое распознавание: offline ASR, 3-7с roundtrip, SSML для склонений, LLM-нормализация услуг
→ Стриминг, полудуплекс: streaming ASR, VAD, гибридное EPD, порог тишины
→ Полный дуплекс: AEC (WebRTC AEC3), barge-in, tool calls в асинхронном потоке, pipeline parallelism
→ Метрики: покомпонентная latency, эволюция метрик, бенчмарки (Full-Duplex-Bench v1.5, EVA-Bench)
→ Native Audio LLM: speech-native модели, DuplexSLA, Moshi, MiniMind-O
🎥 Запись доступна здесь и на других площадках:
YouTube
RuTube
ВКонтакте
ЯндексМузыка
Mave
Как построить голосового AI-агента, экономящего время пользователя, рассказывает Виктор Загускин — руководитель центра компетенций голосового ИИ в MWS.AI.
В программе:
→ Голос, файловое распознавание: offline ASR, 3-7с roundtrip, SSML для склонений, LLM-нормализация услуг
→ Стриминг, полудуплекс: streaming ASR, VAD, гибридное EPD, порог тишины
→ Полный дуплекс: AEC (WebRTC AEC3), barge-in, tool calls в асинхронном потоке, pipeline parallelism
→ Метрики: покомпонентная latency, эволюция метрик, бенчмарки (Full-Duplex-Bench v1.5, EVA-Bench)
→ Native Audio LLM: speech-native модели, DuplexSLA, Moshi, MiniMind-O
YouTube
RuTube
ВКонтакте
ЯндексМузыка
Mave
Please open Telegram to view this post
VIEW IN TELEGRAM
❤6🔥3
🤖 AI-агент с нуля: руководство по MCP
В прошлый раз мы собрали ReAct-агента и разобрали, как работает tool calling под капотом. Теперь идём дальше — подключаем агента к реальному миру через открытый стандарт Anthropic.
Это вторая часть видеокурса об AI-агентах от ML-инженера Artezio Антона Максимова!
Разберём, почему самодельный протокол для инструментов — это тупик при масштабировании и как Model Context Protocol решает эту проблему раз и навсегда. MCP — единый стандарт, который уже поддерживают Claude Desktop, Cursor, Zed и десятки других инструментов.
В этом выпуске:
— Что такое MCP и зачем он нужен, если tool calling уже работает
— Роли в архитектуре MCP и чем они отличаются
— Пишем собственный MCP-сервер на FastMCP
— Подключаем ReAct-агента к серверу
🎬 Смотрите на YouTube или RuTube!
Следующая часть курса будет посвящена Memory, не переключайтесь :)
В прошлый раз мы собрали ReAct-агента и разобрали, как работает tool calling под капотом. Теперь идём дальше — подключаем агента к реальному миру через открытый стандарт Anthropic.
Это вторая часть видеокурса об AI-агентах от ML-инженера Artezio Антона Максимова!
Разберём, почему самодельный протокол для инструментов — это тупик при масштабировании и как Model Context Protocol решает эту проблему раз и навсегда. MCP — единый стандарт, который уже поддерживают Claude Desktop, Cursor, Zed и десятки других инструментов.
В этом выпуске:
— Что такое MCP и зачем он нужен, если tool calling уже работает
— Роли в архитектуре MCP и чем они отличаются
— Пишем собственный MCP-сервер на FastMCP
— Подключаем ReAct-агента к серверу
🎬 Смотрите на YouTube или RuTube!
Следующая часть курса будет посвящена Memory, не переключайтесь :)
🔥8👍7❤1💩1
Вышло новое поколение моделей OpenAI GPT-5.6: Sol, Terra и Luna. Artificial Analysis (независимая площадка бенчмаркинга LLM ) уже прогнали его по тестам. Главная новость: GPT-5.6 Sol (max) возглавил их новый Coding Agent Index с 80 баллами.
Индекс меряет работу агента целиком (а не только генерацию отдельных функций): исследование репозитория (SWE-Atlas-QnA, вопросы-ответы по большим кодовым базам), доведение задачи до проверяемого результата (DeepSWE, реальные задачи в духе SWE-bench), командную строку (Terminal-Bench v2) и координацию инструментов. Sol в связке с Codex лидирует во всех трёх тестах, при этом стоимость задачи примерно на 40% ниже, чем у Claude Fable 5 (max), и на 10% ниже Opus 4.8 (max) в Claude Code.
Sol — флагман: в Intelligence Index отстаёт от Fable 5 всего на 1 балл (59), но втрое дешевле, $1.04 за задачу. Terra и Luna дешевле на ~50% и ~80%, для массовых задач. По токенам Sol экономнее предшественника: 15k на задачу против 16k у GPT-5.5, при большем интеллекте, чем у Opus 4.8 и Gemini 3.5 Flash.
Похоже, для агентного кодинга Codex + Sol сейчас лучший baseline по цене/качеству. Для аналитически тяжёлых задач Fable 5 всё ещё впереди (Elo 1764 vs 1592 в AA-Briefcase).
Индекс меряет работу агента целиком (а не только генерацию отдельных функций): исследование репозитория (SWE-Atlas-QnA, вопросы-ответы по большим кодовым базам), доведение задачи до проверяемого результата (DeepSWE, реальные задачи в духе SWE-bench), командную строку (Terminal-Bench v2) и координацию инструментов. Sol в связке с Codex лидирует во всех трёх тестах, при этом стоимость задачи примерно на 40% ниже, чем у Claude Fable 5 (max), и на 10% ниже Opus 4.8 (max) в Claude Code.
Sol — флагман: в Intelligence Index отстаёт от Fable 5 всего на 1 балл (59), но втрое дешевле, $1.04 за задачу. Terra и Luna дешевле на ~50% и ~80%, для массовых задач. По токенам Sol экономнее предшественника: 15k на задачу против 16k у GPT-5.5, при большем интеллекте, чем у Opus 4.8 и Gemini 3.5 Flash.
Похоже, для агентного кодинга Codex + Sol сейчас лучший baseline по цене/качеству. Для аналитически тяжёлых задач Fable 5 всё ещё впереди (Elo 1764 vs 1592 в AA-Briefcase).
artificialanalysis.ai
AI Model & API Providers Analysis | Artificial Analysis
Comparison and analysis of AI models and API hosting providers. Independent benchmarks across key performance metrics including quality, price, output speed & latency.
👍6❤1
В десктопном Claude Code появился встроенный браузер (Cmd/Ctrl+Shift+B). Агент открывает документацию, макеты и произвольные сайты, читает страницы, кликает по элементам и работает с локально запущенным приложением, расширение для Chrome больше не нужно. Браузер живёт в отдельном профиле и не видит логины и историю вашего основного, если агенту нужны именно ваши залогиненные сессии, для этого по-прежнему расширение Claude in Chrome.
Это замыкает цикл фронтенд-разработки: агент пишет компонент, сам поднимает dev-сервер, визуально проверяет интерфейс, воспроизводит пользовательский сценарий и чинит найденное. При первом действии на новом сайте спрашивает разрешение, а в настройках можно выбрать, сохранять ли данные сессий между запусками или каждый раз начинать с чистого листа.
Это замыкает цикл фронтенд-разработки: агент пишет компонент, сам поднимает dev-сервер, визуально проверяет интерфейс, воспроизводит пользовательский сценарий и чинит найденное. При первом действии на новом сайте спрашивает разрешение, а в настройках можно выбрать, сохранять ли данные сессий между запусками или каждый раз начинать с чистого листа.
Claude Code Docs
Week 28 · July 6–10, 2026 - Claude Code Docs
Browse external sites from the Desktop app's built-in browser, run a full setup checkup with /doctor, and pick up auto mode transcript protections and agent view upgrades.
⚡3🔥1
💥 Агентская фабрика на CI: автоматизируем весь цикл разработки
Лёша Берёзка, техлид iOS в "Додо Пицце" и автор канала о разработке, покажет онлайн, как построить «фабрику» агентов в CI‑пайплайне — систему, которая самостоятельно закрывает полный цикл от создания issue до влития Pull Request.
➡️ Разберём, как организовать оркестрацию нескольких агентов и обеспечить их согласованную работу.
➡️ Посмотрим, как фабрика автоматически заводит issue, сама их планирует, уточняет детали, реализует и доводит Pull Request до успешного слияния.
➡️ Разберём типовые проблемы и способы их решения.
Когда?
Завтра, 15 июля, в 13:00.
Смотрите на YouTube, в ВК или прямо в этом канале — и задавайте вопросы Лёше!
Лёша Берёзка, техлид iOS в "Додо Пицце" и автор канала о разработке, покажет онлайн, как построить «фабрику» агентов в CI‑пайплайне — систему, которая самостоятельно закрывает полный цикл от создания issue до влития Pull Request.
Когда?
Завтра, 15 июля, в 13:00.
Смотрите на YouTube, в ВК или прямо в этом канале — и задавайте вопросы Лёше!
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥5👍2❤1🤡1
OpenWiki (LangChain, 1 июля) - открытый агент и CLI, который генерирует и поддерживает «вики» кодовой базы для агентов. Он индексирует репозиторий, фиксирует, где что лежит и как связано, а в CLAUDE.md/AGENTS.md кладёт не сотни страниц, а ссылку: агент сам подтянет нужное. Обновляется по коммитам через CI (GitHub Actions / GitLab / Bitbucket), читает diff с прошлого прогона и правит только затронутое. Провайдеры LLM: OpenRouter (дефолт), OpenAI, Anthropic, Fireworks, Baseten. Поверх DeepAgents, для трейса активностей агентов можно подключить LangSmith. Есть режим personal, локальная база знаний из ваших репо, Gmail, Notion, веб-поиска, и зачем-то даже есть коннекторы к Hacker News и X.
Вдохновлено DeepWiki, AutoWiki и концепцией LLM Wiki Карпаты.
Польза в том, что агент не должен заново разбираться во всём репозитории каждую сессию. Предполагается, что особенно эффективно, если репозиторий большой и legacy.
Открытый вопрос: что происходит с этой памятью со временем. Диффы копятся, глазами такие доки никто не читает. Нужен ли ревью владельцами модулей или дрейф не накапливается и обновления по коммитам достаточно? Если у кого-то уже крутится в CI, или был аналог - расскажите, что видите.
Вдохновлено DeepWiki, AutoWiki и концепцией LLM Wiki Карпаты.
Польза в том, что агент не должен заново разбираться во всём репозитории каждую сессию. Предполагается, что особенно эффективно, если репозиторий большой и legacy.
Открытый вопрос: что происходит с этой памятью со временем. Диффы копятся, глазами такие доки никто не читает. Нужен ли ревью владельцами модулей или дрейф не накапливается и обновления по коммитам достаточно? Если у кого-то уже крутится в CI, или был аналог - расскажите, что видите.
Langchain
OpenWiki: Open Source Repo Documentation for Coding Agents
OpenWiki generates and maintains codebase documentation so coding agents can find the repo context they need without loading everything into one instruction file.
❤3🤔2👍1
🤔 Какова вероятность выживания человечества в эпоху суперинтеллекта?
Исследователь Элиезер Юдковский и президент MIRI Нейт Соарес изложили свой прогноз в книге, которая только что вышла на русском языке под названием «Если кто-то его создаст — все погибнут. Почему сверхчеловеческий ИИ уничтожит нас всех».
Доктор технических наук Владимир Крылов рассмотрит этот прогноз и обоснует возможность значительно более оптимистичного варианта развития событий. Он основан на разработках методов коммуникации с неживым, которые развивает биолог Майкл Левин. Ведь в будущем построение конвенциональных отношений со сверхинтеллектом существенно сократит вероятность рокового исхода...
⏰ Запускаем трансляцию завтра, 16 июля, в 13:00.
Смотрите на YouTube, в ВК или прямо в этом канале — и задавайте вопросы лектору!
Исследователь Элиезер Юдковский и президент MIRI Нейт Соарес изложили свой прогноз в книге, которая только что вышла на русском языке под названием «Если кто-то его создаст — все погибнут. Почему сверхчеловеческий ИИ уничтожит нас всех».
Доктор технических наук Владимир Крылов рассмотрит этот прогноз и обоснует возможность значительно более оптимистичного варианта развития событий. Он основан на разработках методов коммуникации с неживым, которые развивает биолог Майкл Левин. Ведь в будущем построение конвенциональных отношений со сверхинтеллектом существенно сократит вероятность рокового исхода...
⏰ Запускаем трансляцию завтра, 16 июля, в 13:00.
Смотрите на YouTube, в ВК или прямо в этом канале — и задавайте вопросы лектору!
👍6🔥6🤡2
Moonshot выпустили Kimi K3, 57 баллов в Artificial Analysis Intelligence Index. Выше только Claude Fable 5 (60) и GPT-5.6 Sol (59). Opus 4.8 с его 56 остался позади.
Что интересно в цифрах:
— На GDPval (реальные рабочие задачи) 1668 Elo, третье место после Fable 5 и Sol
— На AA-Briefcase (длинные многошаговые задачи) вообще второе место, обошёл Sol. По качеству аналитики практически паритет с Fable 5: 1760 против 1764
— Цена $3/$15 за миллион токенов, ~$0.94 за задачу индекса. Это примерно вдвое дешевле Opus 4.8 при сопоставимом уровне
Чтобы глубже понимать контекст: в начале июня моделей с 50+ баллами в Artificial Analysis Intelligence Index было две, у Anthropic и OpenAI. Сейчас таких шесть. Только за последние восемь дней фронтир пополнили Grok 4.5, GPT-5.6, Muse Spark 1.1 и вот теперь Kimi K3. Отрыв лидера сжался с четырёх баллов до одного.
Веса обещают опубликовать 27-го. Но чтобы поднять такое у себя, конечно, нужен кластер. Практический смысл открытых весов есть для независимых провайдеров инференса и возможность файнтюна для тех, у кого есть железо.
А ещё ждём показателей Qwen3.8 от Alibaba, которая появилась в превью вчера, и которую они также заявляют как «second only to Fable 5».
Есть повод пересчитать экономику пайплайнов, которые держатся на дорогих моделях для агентских задач.
Что интересно в цифрах:
— На GDPval (реальные рабочие задачи) 1668 Elo, третье место после Fable 5 и Sol
— На AA-Briefcase (длинные многошаговые задачи) вообще второе место, обошёл Sol. По качеству аналитики практически паритет с Fable 5: 1760 против 1764
— Цена $3/$15 за миллион токенов, ~$0.94 за задачу индекса. Это примерно вдвое дешевле Opus 4.8 при сопоставимом уровне
Чтобы глубже понимать контекст: в начале июня моделей с 50+ баллами в Artificial Analysis Intelligence Index было две, у Anthropic и OpenAI. Сейчас таких шесть. Только за последние восемь дней фронтир пополнили Grok 4.5, GPT-5.6, Muse Spark 1.1 и вот теперь Kimi K3. Отрыв лидера сжался с четырёх баллов до одного.
Веса обещают опубликовать 27-го. Но чтобы поднять такое у себя, конечно, нужен кластер. Практический смысл открытых весов есть для независимых провайдеров инференса и возможность файнтюна для тех, у кого есть железо.
А ещё ждём показателей Qwen3.8 от Alibaba, которая появилась в превью вчера, и которую они также заявляют как «second only to Fable 5».
Есть повод пересчитать экономику пайплайнов, которые держатся на дорогих моделях для агентских задач.
👍4🔥3❤1
Британский AI Security Institute (государственный институт безопасности ИИ) опубликовал замеры разрыва между открытыми и закрытыми моделями в хакерских навыках. GLM-5.2 показывает уровень Opus 4.6 на отдельных задачах (эксплуатация уязвимостей, реверс, крипто) и Opus 4.5 на автономных многошаговых атаках в симулированных сетях. Итого текущий лаг — 4–7 месяцев. В 2025-м было 6–10. Закрытую модель провайдер может мониторить, банить и отзывать. Открытые веса после релиза доступны всем: safeguards снимаются, копии расходятся.
AI Security Institute
How Far Behind the Frontier are Leading Open Weight Models on Cyber? | AISI Work
We evaluated the cyber capabilities of leading open and closed weight AI models, and found that recent open models GLM-5.2 and DeepSeek V4-Pro perform similarly to frontier closed models released 4 to 7 months before them – a narrower gap than the 6 to 10…
🤔2