AI4Dev — AI for Development
5.27K subscribers
169 photos
49 videos
5 files
318 links
Что надо знать, чтобы остаться востребованным ИТ специалистом в мире с LLM?

• Обзоры продуктов, фреймворков и способы взаимодействия с LLM для разработки софта

• Реальные кейсы, pet и бизнес проекты с LLM

• Публичные лекции

В будущее берут не всех!
Download Telegram
Media is too big
VIEW IN TELEGRAM
🚀 Codex CLI: создаём автономный код‑ревьюер

Предлагаем обзор простого, но рабочего сетапа, который позволит:
→ посмотреть возможности Codex CLI;
→ собрать базовую инфраструктуру;
→ реализовать автономный код-ревьюер почти без вмешательства живого специалиста.

"Для работы с агентами нужны 3 главных навыка: адаптивность, слабоумие и отвага. Потому что иногда агент делает очень умные вещи, а иногда — очень странные", — говорит Артем Летюшев, tech project manager twinby.ru и автор канала @junior_pm.

Артем показал в онлайне:
⚡️ как настроить Codex CLI и MCP;
⚡️ как подключить Skills и защитные хуки;
⚡️ как спланировать roadmap и быстро запустить проект.

Запись доступна здесь и на других площадках:

YouTube
RuTube
ВКонтакте
ЯндексМузыка
Mave
3
У Claude будет жёстче проверка аккаунтов

С 8 июля новая privacy policy Anthropic разрешает запрашивать age/identity verification. Для возраста - селфи через Yoti или документ. Для проверки личности - government ID вроде паспорта и live selfie через Persona.

Это не значит, что 8 июля у всех разом попросят паспорт. Но если аккаунт попадёт под проверку, доступ может упереться в верификацию.

Для разработчиков неприятная часть не в самом KYC, а в зависимости от одного consumer-аккаунта. Если Claude уже сидит в вашем рабочем процессе, нужен план Б: резервная модель, сохранённые промпты, экспорт настроек и понимание, чем заменить сервис в день, когда он внезапно попросит документы.Anthropic пишет, что verification data не используется для обучения моделей.

Но вопрос в приватности и доступе к моделям в странах, которые Anthropic официально не поддерживает.

Privacy Policy: https://www.anthropic.com/legal/privacy

Age assurance: https://support.claude.com/en/articles/15171100-age-assurance-on-claude

Identity verification: https://support.claude.com/en/articles/14328960-identity-verification-on-claude
🔥2🤬1🤡1
В AI-тусовке на выходных разогнали «новость»: Mistral якобы выпустила модель Le Chaton Fat, которая обходит Claude в benchmark’ах.

Проблема в том, что такой модели нет.

Новость выросла из старого названия ассистента Mistral -  Le Chat. Его уже переименовали в Mistral Vibe, а в X кто-то превратил «кота» в «толстого котёнка» и начал постить фейковые анонсы: MoE на десятки триллионов параметров, миллион токенов контекста, рекордные таблицы и прочий AGI к завтраку.

Дальше скриншоты разошлись, часть людей поверила, CEO Mistral Артур Менш подыграл фразой про le gros chaton, и мем на пару дней стал почти инсайдом. Но самой модели нет.

Разбор Numerama:
https://www.numerama.com/tech/2276253-cest-quoi-le-chaton-fat-le-modele-de-mistral-ai-qui-affole-les-reseaux-sociaux.html

Официальные новости Mistral:
https://mistral.ai/news/
😁6👍1😭1
Media is too big
VIEW IN TELEGRAM
Голосовой агент — это не просто чат-бот + TTS. Это эволюция от текстового бота через полудуплекс к full-duplex, где на каждом уровне появляются свои проблемы. Пройдем этот путь на реальном production-стеке (Rust, ~1600 строк).

Как построить голосового AI-агента, экономящего время пользователя, рассказывает Виктор Загускин — руководитель центра компетенций голосового ИИ в MWS.AI.

В программе:
Голос, файловое распознавание: offline ASR, 3-7с roundtrip, SSML для склонений, LLM-нормализация услуг
Стриминг, полудуплекс: streaming ASR, VAD, гибридное EPD, порог тишины
Полный дуплекс: AEC (WebRTC AEC3), barge-in, tool calls в асинхронном потоке, pipeline parallelism
Метрики: покомпонентная latency, эволюция метрик, бенчмарки (Full-Duplex-Bench v1.5, EVA-Bench)
Native Audio LLM: speech-native модели, DuplexSLA, Moshi, MiniMind-O


🎥 Запись доступна здесь и на других площадках:

YouTube
RuTube
ВКонтакте
ЯндексМузыка
Mave
Please open Telegram to view this post
VIEW IN TELEGRAM
6🔥3
🤖 AI-агент с нуля: руководство по MCP

В прошлый раз мы собрали ReAct-агента и разобрали, как работает tool calling под капотом. Теперь идём дальше — подключаем агента к реальному миру через открытый стандарт Anthropic.

Это вторая часть видеокурса об AI-агентах от ML-инженера Artezio Антона Максимова!

Разберём, почему самодельный протокол для инструментов — это тупик при масштабировании и как Model Context Protocol решает эту проблему раз и навсегда. MCP — единый стандарт, который уже поддерживают Claude Desktop, Cursor, Zed и десятки других инструментов.

В этом выпуске:
— Что такое MCP и зачем он нужен, если tool calling уже работает
— Роли в архитектуре MCP и чем они отличаются
— Пишем собственный MCP-сервер на FastMCP
— Подключаем ReAct-агента к серверу

🎬 Смотрите на YouTube или RuTube!

Следующая часть курса будет посвящена Memory, не переключайтесь :)
🔥8👍71💩1
Вышло новое поколение моделей OpenAI GPT-5.6: Sol, Terra и Luna. Artificial Analysis (независимая площадка бенчмаркинга LLM ) уже прогнали его по тестам. Главная новость: GPT-5.6 Sol (max) возглавил их новый Coding Agent Index с 80 баллами.

Индекс меряет работу агента целиком (а не только генерацию отдельных функций): исследование репозитория (SWE-Atlas-QnA, вопросы-ответы по большим кодовым базам), доведение задачи до проверяемого результата (DeepSWE, реальные задачи в духе SWE-bench), командную строку (Terminal-Bench v2) и координацию инструментов. Sol в связке с Codex лидирует во всех трёх тестах, при этом стоимость задачи примерно на 40% ниже, чем у Claude Fable 5 (max), и на 10% ниже Opus 4.8 (max) в Claude Code.

Sol — флагман: в Intelligence Index отстаёт от Fable 5 всего на 1 балл (59), но втрое дешевле, $1.04 за задачу. Terra и Luna дешевле на ~50% и ~80%, для массовых задач. По токенам Sol экономнее предшественника: 15k на задачу против 16k у GPT-5.5, при большем интеллекте, чем у Opus 4.8 и Gemini 3.5 Flash.

Похоже, для агентного кодинга Codex + Sol сейчас лучший baseline по цене/качеству. Для аналитически тяжёлых задач Fable 5 всё ещё впереди (Elo 1764 vs 1592 в AA-Briefcase).
👍61
В десктопном Claude Code появился встроенный браузер (Cmd/Ctrl+Shift+B). Агент открывает документацию, макеты и произвольные сайты, читает страницы, кликает по элементам и работает с локально запущенным приложением, расширение для Chrome больше не нужно. Браузер живёт в отдельном профиле и не видит логины и историю вашего основного, если агенту нужны именно ваши залогиненные сессии, для этого по-прежнему расширение Claude in Chrome.

Это замыкает цикл фронтенд-разработки: агент пишет компонент, сам поднимает dev-сервер, визуально проверяет интерфейс, воспроизводит пользовательский сценарий и чинит найденное. При первом действии на новом сайте спрашивает разрешение, а в настройках можно выбрать, сохранять ли данные сессий между запусками или каждый раз начинать с чистого листа.
3🔥1
💥 Агентская фабрика на CI: автоматизируем весь цикл разработки

Лёша Берёзка, техлид iOS в "Додо Пицце" и автор канала о разработке, покажет онлайн, как построить «фабрику» агентов в CI‑пайплайне — систему, которая самостоятельно закрывает полный цикл от создания issue до влития Pull Request.

➡️ Разберём, как организовать оркестрацию нескольких агентов и обеспечить их согласованную работу.
➡️ Посмотрим, как фабрика автоматически заводит issue, сама их планирует, уточняет детали, реализует и доводит Pull Request до успешного слияния.
➡️ Разберём типовые проблемы и способы их решения.

Когда?
Завтра, 15 июля, в 13:00.

Смотрите на YouTube, в ВК или прямо в этом канале — и задавайте вопросы Лёше!
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥5👍21🤡1
OpenWiki (LangChain, 1 июля) - открытый агент и CLI, который генерирует и поддерживает «вики» кодовой базы для агентов. Он индексирует репозиторий, фиксирует, где что лежит и как связано, а в CLAUDE.md/AGENTS.md кладёт не сотни страниц, а ссылку: агент сам подтянет нужное. Обновляется по коммитам через CI (GitHub Actions / GitLab / Bitbucket), читает diff с прошлого прогона и правит только затронутое. Провайдеры LLM: OpenRouter (дефолт), OpenAI, Anthropic, Fireworks, Baseten. Поверх DeepAgents, для трейса активностей агентов можно подключить LangSmith. Есть режим personal, локальная база знаний из ваших репо, Gmail, Notion, веб-поиска, и зачем-то даже есть коннекторы к Hacker News и X.
Вдохновлено DeepWiki, AutoWiki и концепцией LLM Wiki Карпаты.

Польза в том, что агент не должен заново разбираться во всём репозитории каждую сессию. Предполагается, что особенно эффективно, если репозиторий большой и legacy.

Открытый вопрос: что происходит с этой памятью со временем. Диффы копятся, глазами такие доки никто не читает. Нужен ли ревью владельцами модулей или дрейф не накапливается и обновления по коммитам достаточно? Если у кого-то уже крутится в CI, или был аналог - расскажите, что видите.
3🤔2👍1
🤔 Какова вероятность выживания человечества в эпоху суперинтеллекта?

Исследователь Элиезер Юдковский и президент MIRI Нейт Соарес изложили свой прогноз в книге, которая только что вышла на русском языке под названием «Если кто-то его создаст — все погибнут. Почему сверхчеловеческий ИИ уничтожит нас всех».

Доктор технических наук Владимир Крылов рассмотрит этот прогноз и обоснует возможность значительно более оптимистичного варианта развития событий. Он основан на разработках методов коммуникации с неживым, которые развивает биолог Майкл Левин. Ведь в будущем построение конвенциональных отношений со сверхинтеллектом существенно сократит вероятность рокового исхода...

Запускаем трансляцию завтра, 16 июля, в 13:00.

Смотрите на YouTube, в ВК или прямо в этом канале — и задавайте вопросы лектору!
👍6🔥6🤡2
Live stream started
Live stream finished (1 hour)
Moonshot выпустили Kimi K3, 57 баллов в Artificial Analysis Intelligence Index. Выше только Claude Fable 5 (60) и GPT-5.6 Sol (59). Opus 4.8 с его 56 остался позади.

Что интересно в цифрах:

— На GDPval (реальные рабочие задачи) 1668 Elo, третье место после Fable 5 и Sol
— На AA-Briefcase (длинные многошаговые задачи) вообще второе место, обошёл Sol. По качеству аналитики практически паритет с Fable 5: 1760 против 1764
— Цена $3/$15 за миллион токенов, ~$0.94 за задачу индекса. Это примерно вдвое дешевле Opus 4.8 при сопоставимом уровне

Чтобы глубже понимать контекст: в начале июня моделей с 50+ баллами в Artificial Analysis Intelligence Index было две, у Anthropic и OpenAI. Сейчас таких шесть. Только за последние восемь дней фронтир пополнили Grok 4.5, GPT-5.6, Muse Spark 1.1 и вот теперь Kimi K3. Отрыв лидера сжался с четырёх баллов до одного.

Веса обещают опубликовать 27-го. Но чтобы поднять такое у себя, конечно, нужен кластер. Практический смысл открытых весов есть для независимых провайдеров инференса и возможность файнтюна для тех, у кого есть железо.

А ещё ждём показателей Qwen3.8 от Alibaba, которая появилась в превью вчера, и которую они также заявляют как «second only to Fable 5».

Есть повод пересчитать экономику пайплайнов, которые держатся на дорогих моделях для агентских задач.
👍4🔥31
Британский AI Security Institute (государственный институт безопасности ИИ) опубликовал замеры разрыва между открытыми и закрытыми моделями в хакерских навыках. GLM-5.2 показывает уровень Opus 4.6 на отдельных задачах (эксплуатация уязвимостей, реверс, крипто) и Opus 4.5 на автономных многошаговых атаках в симулированных сетях. Итого текущий лаг — 4–7 месяцев. В 2025-м было 6–10. Закрытую модель провайдер может мониторить, банить и отзывать. Открытые веса после релиза доступны всем: safeguards снимаются, копии расходятся.
🤔2