AI4Dev — AI for Development
5.28K subscribers
169 photos
49 videos
5 files
318 links
Что надо знать, чтобы остаться востребованным ИТ специалистом в мире с LLM?

• Обзоры продуктов, фреймворков и способы взаимодействия с LLM для разработки софта

• Реальные кейсы, pet и бизнес проекты с LLM

• Публичные лекции

В будущее берут не всех!
Download Telegram
Live stream started
Live stream finished (55 minutes)
Кроме новой модели Opus 4.8 Anthropic показала следующий шаг в агентской разработке -- dynamic workflows. Claude сам пишет скрипт-оркестратор и разводит задачу по десяткам-сотням субагентов, которые проверяют и опровергают находки друг друга, пока ответы не сойдутся.

Принципиально новым тут является масштаб: рой агентов уходит работать над большой задачей надолго и задорого, Anthropic даже предупреждает про кратно больший расход токенов. По ссылке статья Anthropic и пример того, как AI-агенты с помощью dynamic workflows за 11 дней портировали Bun (JavaScript-рантайм и тулкит) с языка Zig на Rust: 750 000 строк кода, 99,8% проходящих тестов.

Заодно стоит обратить внимание на продукт, Managed Agents, который Anthropic запустила в бете еще в апреле. Это управляемая инфраструктура для долгоживущих агентов: разработчик описывает агента (естественный язык или YAML, промпты, инструменты, разрешения, MCP-подключения), а песочницы, состояние сессий, восстановление после сбоев и масштабирование Anthropic берет на себя.

Оплата по факту -стандартные тарифы на токены плюс 0,08 доллара за активный час сессии, простой не тарифицируется. Ниша многих стартапов строилась на том, чтобы разрабатывать агентов, поднимать и поддерживать агентскую инфраструктуру, а теперь этот слой Anthropic тоже забирает себе.
6🍓2💯1
Media is too big
VIEW IN TELEGRAM
🤝 6 рукопожатий — почему информация находит короткий путь?

Известный эксперимент социолога Стэнли Милгрэма 1967 года открыл феномен "тесного мира" — любых двух людей разделяет малое число рукопожатий. Другими словами, сети имеют малый диаметр. Само по себе это свойство сложно считать чем-то удивительным — это скорее естественное свойство случайных графов. Впечатляющим было другое открытие: структура сети позволяет информации (письму) следовать коротким путём.

Этот феномен математически пытался объяснить Джон Клейнберг. В 2001 году он показал, как добиться нужного эффекта с помощью специальной конструкции: длинные связи строятся с вероятностью, обратно пропорциональной расстоянию. Однако сложно представить, что люди в реальной жизни формируют связи согласно такому принципу.

⚡️Как же естественные сети приобретают это свойство? Вследствие какого процесса? Александр Пономаренко представил модель геометрического предпочтительного присоединения, которая во многом проливает свет на эту загадку.

Александр Пономаренко — лауреат стипендии им. Ильи Сегаловича, IBM PhD Fellowship Award, научный сотрудник ИПФ РАН, научный сотрудник лаборатории алгоритмов и технологий анализа сетевых структур ЛАТАС, доцент кафедры прикладной математики и информатики НИУ ВШЭ.


🎥 Запись доступна здесь и на других площадках:

YouTube
RuTube
ВКонтакте
ЯндексМузыка
Mave
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥6👍31🤝1
🚀 Codex CLI: создаём автономный код‑ревьюер за полчаса

Предлагаем обзор простого, но рабочего сетапа, который позволит:
→ посмотреть возможности Codex CLI;
→ собрать базовую инфраструктуру;
→ реализовать автономный код-ревьюер почти без вмешательства живого специалиста.

"Для работы с агентами нужны 3 главных навыка: адаптивность, слабоумие и отвага. Потому что иногда агент делает очень умные вещи, а иногда — очень странные", — говорит Артем Летюшев, tech project manager twinby.ru и автор канала @junior_pm.

Артем покажет в онлайне:
⚡️ как быстро настроить Codex CLI и MCP;
⚡️ как подключить Skills и защитные хуки;
⚡️ как спланировать roadmap и влет запустить проект.

Когда?
Завтра, 2 июня, в 12:00.

Смотрите на YouTube, в ВК или прямо в этом канале — и задавайте вопросы Артему!
🔥154🌚2
Live stream started
Live stream finished (1 hour)
🤖 AI-агент с нуля: руководство по Tool Calling

Как работают современные AI-агенты «под капотом» и как создать своего, не полагаясь на тяжелые фреймворки? Представляем гайд по созданию AI-агентов от ML-инженера Artezio Антона Максимова! В этом видео вы узнаете всё о работе с Tools: как они устроены, как их создать и как внедрить в агента.

Будем экспериментировать с локальной LLM Gemma 4 на 31B параметров. Посмотрим, как построить нативного агента с нуля без Lang Chain, в чем заключается архитектура агентов и как это связано с тулами. Поговорим о принципах проектирования тулов, системных промптах и работе со специальными токенами. Разберем не только теорию, но и подводные камни, которых не избежать на практике, если не знать о них.

Начнем проектировать собственного ReAct-агента. Обсудим, как сделать его работу стабильной на длинной дистанции и как оптимизировать взаимодействие LLM с внешними сервисами.

🎬 Смотрите на YouTube или RuTube!

Этот выпуск — первая часть видеокурса о том, как работать с агентами, как их разрабатывать и внедрять в разработку. В следующей части будем настраивать MCP, не переключайтесь :)
🔥15👍63💩1
Google Research показала Gemini-SQL2 — модель на базе Gemini 3.1 Pro, которая переводит обычный запрос в SQL.

На BIRD single-model leaderboard у неё 80,04% execution accuracy. Важная деталь: там проверяют не красоту SQL, а результат выполнения запроса.

Это уже похоже на рабочий интерфейс к данным для админок, BI и саппорт-инструментов. Но не на автопилот для продовой базы.

Человеческий результат в BIRD — 92,96%, поэтому безопасная схема всё ещё скучная: read-only доступ, лимиты, allowlist таблиц, EXPLAIN перед запуском и логирование SQL.

NL2SQL можно пробовать уже сейчас. Но лучше держать такого агента  не у руля, а в песочнице.

BIRD leaderboard:
https://bird-bench.github.io/

Разбор Google Cloud:
https://cloud.google.com/blog/products/databases/how-to-get-gemini-to-deeply-understand-your-database
🔥10👍1
Разработчик успел до введеных Anthropics ограничений использовать Fable 5  для  реинжиниринга DOS-игры Midwinter (1989). За ночь параллельные агенты разметили 602 функции экзешника, сэкономив полгода ручного реверс-инжиниринга.

Сценарий отлично переносится на анализ закрытых legacy-систем. Секрет в архитектуре: агенты парсили ассемблер через общий evidence ledger, записывая и валидируя гипотезы друг друга. Результат — написанная ими Python-реплика алгоритма, побитово совпадающая с оригиналом.

Чтобы LLM не галлюцинировала в смещениях памяти и регистрах, критически важен именно такой журнал доказательств и локальный sandbox для тестов. Без жесткого фреймворка сверки фактов на выходе получается правдоподобный, но нерабочий код.

Технический разбор процесса:

https://midwinter-remaster.titanium-helix.com/decode

GitHub с ledger-журналом и тулзами:

https://github.com/DrEvil-TitaniumHelix/midwinter-decode

Видео пайплайна:
https://youtu.be/PonvG2whtkc
🔥172
Media is too big
VIEW IN TELEGRAM
🚀 Codex CLI: создаём автономный код‑ревьюер

Предлагаем обзор простого, но рабочего сетапа, который позволит:
→ посмотреть возможности Codex CLI;
→ собрать базовую инфраструктуру;
→ реализовать автономный код-ревьюер почти без вмешательства живого специалиста.

"Для работы с агентами нужны 3 главных навыка: адаптивность, слабоумие и отвага. Потому что иногда агент делает очень умные вещи, а иногда — очень странные", — говорит Артем Летюшев, tech project manager twinby.ru и автор канала @junior_pm.

Артем показал в онлайне:
⚡️ как настроить Codex CLI и MCP;
⚡️ как подключить Skills и защитные хуки;
⚡️ как спланировать roadmap и быстро запустить проект.

Запись доступна здесь и на других площадках:

YouTube
RuTube
ВКонтакте
ЯндексМузыка
Mave
3
У Claude будет жёстче проверка аккаунтов

С 8 июля новая privacy policy Anthropic разрешает запрашивать age/identity verification. Для возраста - селфи через Yoti или документ. Для проверки личности - government ID вроде паспорта и live selfie через Persona.

Это не значит, что 8 июля у всех разом попросят паспорт. Но если аккаунт попадёт под проверку, доступ может упереться в верификацию.

Для разработчиков неприятная часть не в самом KYC, а в зависимости от одного consumer-аккаунта. Если Claude уже сидит в вашем рабочем процессе, нужен план Б: резервная модель, сохранённые промпты, экспорт настроек и понимание, чем заменить сервис в день, когда он внезапно попросит документы.Anthropic пишет, что verification data не используется для обучения моделей.

Но вопрос в приватности и доступе к моделям в странах, которые Anthropic официально не поддерживает.

Privacy Policy: https://www.anthropic.com/legal/privacy

Age assurance: https://support.claude.com/en/articles/15171100-age-assurance-on-claude

Identity verification: https://support.claude.com/en/articles/14328960-identity-verification-on-claude
🔥2🤬1🤡1
В AI-тусовке на выходных разогнали «новость»: Mistral якобы выпустила модель Le Chaton Fat, которая обходит Claude в benchmark’ах.

Проблема в том, что такой модели нет.

Новость выросла из старого названия ассистента Mistral -  Le Chat. Его уже переименовали в Mistral Vibe, а в X кто-то превратил «кота» в «толстого котёнка» и начал постить фейковые анонсы: MoE на десятки триллионов параметров, миллион токенов контекста, рекордные таблицы и прочий AGI к завтраку.

Дальше скриншоты разошлись, часть людей поверила, CEO Mistral Артур Менш подыграл фразой про le gros chaton, и мем на пару дней стал почти инсайдом. Но самой модели нет.

Разбор Numerama:
https://www.numerama.com/tech/2276253-cest-quoi-le-chaton-fat-le-modele-de-mistral-ai-qui-affole-les-reseaux-sociaux.html

Официальные новости Mistral:
https://mistral.ai/news/
😁6👍1😭1
Media is too big
VIEW IN TELEGRAM
Голосовой агент — это не просто чат-бот + TTS. Это эволюция от текстового бота через полудуплекс к full-duplex, где на каждом уровне появляются свои проблемы. Пройдем этот путь на реальном production-стеке (Rust, ~1600 строк).

Как построить голосового AI-агента, экономящего время пользователя, рассказывает Виктор Загускин — руководитель центра компетенций голосового ИИ в MWS.AI.

В программе:
Голос, файловое распознавание: offline ASR, 3-7с roundtrip, SSML для склонений, LLM-нормализация услуг
Стриминг, полудуплекс: streaming ASR, VAD, гибридное EPD, порог тишины
Полный дуплекс: AEC (WebRTC AEC3), barge-in, tool calls в асинхронном потоке, pipeline parallelism
Метрики: покомпонентная latency, эволюция метрик, бенчмарки (Full-Duplex-Bench v1.5, EVA-Bench)
Native Audio LLM: speech-native модели, DuplexSLA, Moshi, MiniMind-O


🎥 Запись доступна здесь и на других площадках:

YouTube
RuTube
ВКонтакте
ЯндексМузыка
Mave
Please open Telegram to view this post
VIEW IN TELEGRAM
6🔥3
🤖 AI-агент с нуля: руководство по MCP

В прошлый раз мы собрали ReAct-агента и разобрали, как работает tool calling под капотом. Теперь идём дальше — подключаем агента к реальному миру через открытый стандарт Anthropic.

Это вторая часть видеокурса об AI-агентах от ML-инженера Artezio Антона Максимова!

Разберём, почему самодельный протокол для инструментов — это тупик при масштабировании и как Model Context Protocol решает эту проблему раз и навсегда. MCP — единый стандарт, который уже поддерживают Claude Desktop, Cursor, Zed и десятки других инструментов.

В этом выпуске:
— Что такое MCP и зачем он нужен, если tool calling уже работает
— Роли в архитектуре MCP и чем они отличаются
— Пишем собственный MCP-сервер на FastMCP
— Подключаем ReAct-агента к серверу

🎬 Смотрите на YouTube или RuTube!

Следующая часть курса будет посвящена Memory, не переключайтесь :)
🔥8👍71💩1
Вышло новое поколение моделей OpenAI GPT-5.6: Sol, Terra и Luna. Artificial Analysis (независимая площадка бенчмаркинга LLM ) уже прогнали его по тестам. Главная новость: GPT-5.6 Sol (max) возглавил их новый Coding Agent Index с 80 баллами.

Индекс меряет работу агента целиком (а не только генерацию отдельных функций): исследование репозитория (SWE-Atlas-QnA, вопросы-ответы по большим кодовым базам), доведение задачи до проверяемого результата (DeepSWE, реальные задачи в духе SWE-bench), командную строку (Terminal-Bench v2) и координацию инструментов. Sol в связке с Codex лидирует во всех трёх тестах, при этом стоимость задачи примерно на 40% ниже, чем у Claude Fable 5 (max), и на 10% ниже Opus 4.8 (max) в Claude Code.

Sol — флагман: в Intelligence Index отстаёт от Fable 5 всего на 1 балл (59), но втрое дешевле, $1.04 за задачу. Terra и Luna дешевле на ~50% и ~80%, для массовых задач. По токенам Sol экономнее предшественника: 15k на задачу против 16k у GPT-5.5, при большем интеллекте, чем у Opus 4.8 и Gemini 3.5 Flash.

Похоже, для агентного кодинга Codex + Sol сейчас лучший baseline по цене/качеству. Для аналитически тяжёлых задач Fable 5 всё ещё впереди (Elo 1764 vs 1592 в AA-Briefcase).
👍61
В десктопном Claude Code появился встроенный браузер (Cmd/Ctrl+Shift+B). Агент открывает документацию, макеты и произвольные сайты, читает страницы, кликает по элементам и работает с локально запущенным приложением, расширение для Chrome больше не нужно. Браузер живёт в отдельном профиле и не видит логины и историю вашего основного, если агенту нужны именно ваши залогиненные сессии, для этого по-прежнему расширение Claude in Chrome.

Это замыкает цикл фронтенд-разработки: агент пишет компонент, сам поднимает dev-сервер, визуально проверяет интерфейс, воспроизводит пользовательский сценарий и чинит найденное. При первом действии на новом сайте спрашивает разрешение, а в настройках можно выбрать, сохранять ли данные сессий между запусками или каждый раз начинать с чистого листа.
3🔥1
💥 Агентская фабрика на CI: автоматизируем весь цикл разработки

Лёша Берёзка, техлид iOS в "Додо Пицце" и автор канала о разработке, покажет онлайн, как построить «фабрику» агентов в CI‑пайплайне — систему, которая самостоятельно закрывает полный цикл от создания issue до влития Pull Request.

➡️ Разберём, как организовать оркестрацию нескольких агентов и обеспечить их согласованную работу.
➡️ Посмотрим, как фабрика автоматически заводит issue, сама их планирует, уточняет детали, реализует и доводит Pull Request до успешного слияния.
➡️ Разберём типовые проблемы и способы их решения.

Когда?
Завтра, 15 июля, в 13:00.

Смотрите на YouTube, в ВК или прямо в этом канале — и задавайте вопросы Лёше!
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥5👍21🤡1
OpenWiki (LangChain, 1 июля) - открытый агент и CLI, который генерирует и поддерживает «вики» кодовой базы для агентов. Он индексирует репозиторий, фиксирует, где что лежит и как связано, а в CLAUDE.md/AGENTS.md кладёт не сотни страниц, а ссылку: агент сам подтянет нужное. Обновляется по коммитам через CI (GitHub Actions / GitLab / Bitbucket), читает diff с прошлого прогона и правит только затронутое. Провайдеры LLM: OpenRouter (дефолт), OpenAI, Anthropic, Fireworks, Baseten. Поверх DeepAgents, для трейса активностей агентов можно подключить LangSmith. Есть режим personal, локальная база знаний из ваших репо, Gmail, Notion, веб-поиска, и зачем-то даже есть коннекторы к Hacker News и X.
Вдохновлено DeepWiki, AutoWiki и концепцией LLM Wiki Карпаты.

Польза в том, что агент не должен заново разбираться во всём репозитории каждую сессию. Предполагается, что особенно эффективно, если репозиторий большой и legacy.

Открытый вопрос: что происходит с этой памятью со временем. Диффы копятся, глазами такие доки никто не читает. Нужен ли ревью владельцами модулей или дрейф не накапливается и обновления по коммитам достаточно? Если у кого-то уже крутится в CI, или был аналог - расскажите, что видите.
3🤔2👍1
🤔 Какова вероятность выживания человечества в эпоху суперинтеллекта?

Исследователь Элиезер Юдковский и президент MIRI Нейт Соарес изложили свой прогноз в книге, которая только что вышла на русском языке под названием «Если кто-то его создаст — все погибнут. Почему сверхчеловеческий ИИ уничтожит нас всех».

Доктор технических наук Владимир Крылов рассмотрит этот прогноз и обоснует возможность значительно более оптимистичного варианта развития событий. Он основан на разработках методов коммуникации с неживым, которые развивает биолог Майкл Левин. Ведь в будущем построение конвенциональных отношений со сверхинтеллектом существенно сократит вероятность рокового исхода...

Запускаем трансляцию завтра, 16 июля, в 13:00.

Смотрите на YouTube, в ВК или прямо в этом канале — и задавайте вопросы лектору!
👍6🔥6🤡2