AI и разработка | Кейсы, грабли и ИИ...
177 subscribers
43 photos
3 videos
43 links
Комьюнити о практическом применении ИИ в разработке.

LLM, агенты, Cursor, LangChain, кейсы, вебинары и вот это вот всё.

Про нас — https://spectr.dev/
Учиться — https://ai-academy.spectr.dev/

По сотрудничеству — в ЛС канала
Download Telegram
Как разработчику использовать AI? Курс стартует уже через неделю!

AI уже умеет писать код, помогать с ревью, генерировать тесты и даже собирать прототипы. Но в продакшене без системного подхода это превращается в лотерею: сегодня повезло, завтра всё развалилось.

Мы запустили практический курс «AI-driven разработчик» — как встроить ИИ в свою работу так же естественно, как Git или код-ревью.

В курсе:
- много важной теории, основы LLM, работа с локальными моделями;
- много практики по работе с код-агентами (Cursor, Claude Code);
- разработка своего MCP и RAG;
- разработки агентов: LangChain / LangGraph, LlamaIndex.

9 недель, нагрузка 5–10 часов в неделю. Один сквозной проект от идеи до рабочего прототипа. Видеоуроки с практикой; домашки; групповые встречи и разборы с преподавателями; общий чат для консультаций .

Старт обучения — 15 декабря
🔥 По промокоду AI_IN_DEV — скидка 10% на любой тариф

Посмотреть программу и записаться
Please open Telegram to view this post
VIEW IN TELEGRAM
AI и разработка | Кейсы, грабли и ИИ... pinned «Как разработчику использовать AI? Курс стартует уже через неделю! AI уже умеет писать код, помогать с ревью, генерировать тесты и даже собирать прототипы. Но в продакшене без системного подхода это превращается в лотерею: сегодня повезло, завтра всё развалилось.…»
Antigravity от Google — сильно отстает от Cursor по функционалу, но супер-сильный аргумент в его пользу — его ценовая политика.

На базовом платном тарифе (около 15$) лимиты на использование моделей (в том числе, топовых) обновляются каждые 5 часов.
При активной работе получается примерно так: 1-2 часа гоняешь на топовой Opus-4.5, потом еще ±час на Gemini-3 (High), пару часов отдыхаешь и так по кругу.

При этом, Cursor в режиме On-Demand биллинга выжирает около 10$ в час активной работы на Opus-4.5 🤬
Anthropic выпустила Claude Opus 4.6 — самую сильную модель в линейке

Что изменилось для разработчика:
— Агентный кодинг на новом уровне: модель планирует глубже, держит контекст дольше и сама ловит ошибки в коде. Лучший результат на Terminal-Bench 2.0.
— Контекст 1M токенов (бета). Первый Opus с таким окном. На тесте MRCR v2 набирает 76% против 18,5% у Sonnet 4.5 — качественный скачок в работе с большими кодовыми базами.
— Adaptive thinking: модель сама решает, когда включать глубокое рассуждение, а когда не тратить время. Плюс четыре уровня effort (low / medium / high / max) для контроля баланса скорости и качества.
— Context compaction: автоматическое сжатие контекста в длинных сессиях — агенты больше не упираются в лимит окна.
— Agent teams в Claude Code (превью): несколько агентов работают параллельно и координируются сами. Подходит для ревью и задач с большим объёмом чтения кода.

Цена та же: $5 / $25 за миллион токенов. Премиум-тариф для промптов свыше 200k.

Модель доступна в API (claude-opus-4-6), на claude.ai и облачных платформах.

Подробности → https://www.anthropic.com/news/claude-opus-4-6
OpenAI выкатила GPT-5.3-Codex

Что важно разработчику:

— Terminal-Bench 2.0: 77,3% (было 64% у GPT-5.2-Codex). При этом модель тратит меньше токенов, чем предшественники.
— OSWorld: 64,7% против 38,2% — почти двукратный рост в задачах на управление компьютером. Человеческий уровень — ~72%.
— Модель на 25% быстрее GPT-5.2-Codex.
— Интерактивная работа: можно подруливать агента прямо во время выполнения задачи — задавать вопросы, менять направление, не теряя контекст.
— Выход за пределы кода: презентации, таблицы, PRD, анализ данных, деплой — всё в одной модели. На GDPval (реальные рабочие задачи из 44 профессий) показывает результат на уровне GPT-5.2.

Отдельная история — кибербезопасность. Это первая модель OpenAI с рейтингом High по Preparedness Framework и первая, которую целенаправленно обучали находить уязвимости.

Забавный факт: GPT-5.3-Codex — первая модель, которая участвовала в собственном создании. Ранние версии дебажили свой же тренинг и помогали с деплоем.

Доступна в Codex app, CLI, IDE и вебе на платных планах ChatGPT. API — скоро.

Подробности → https://openai.com/index/introducing-gpt-5-3-codex/
Cursor выпустил Composer 1.5 — собственную кодинговую модель, вторую в линейке

Что под капотом:
— RL (reinforcement learning, обучение с подкреплением) масштабировали в 20 раз по сравнению с Composer 1. Объём пост-тренинга превысил объём самого претрейна — нетипичная пропорция.
— Thinking-модель с адаптивным рассуждением: на простых задачах думает минимально, на сложных — копает глубоко.
— Self-summarization: когда контекст заканчивается, модель сама сжимает историю и продолжает работу. Может срабатывать рекурсивно несколько раз подряд. Качество при этом не падает.

Из важного — цена. Composer 1.5 стоит $3,5 / $17,5 за миллион токенов (вход/выход). Для сравнения — GPT-5.3 Codex в Cursor обходится в $1,75 / $14. То есть Composer вдвое дороже на входе и на 25% дороже на выходе. Claude Opus 4.6 ещё дороже — $5 / $25, но это и другой класс модели.

При этом Cursor не публикует бенчмарки — только «внутренние тесты показывают рост, особенно на сложных задачах». Сравнить с GPT-5.3 Codex или Claude Opus 4.6 по цифрам пока невозможно. Придётся проверять руками.

Модель уже доступна в Cursor

Подробности → https://cursor.com/blog/composer-1-5
Ликбез про бенчмарки ИИ кодинг-агентов

Вендоры любят хвастаться «плюс X% на бенчмарке». Но запутаться в куче названий бенчмарков очень легко. Вот очень короткий гайд по актуальным бенчмаркам.

🤖 SWE-bench (https://www.swebench.com/) — модель получает реальный GitHub issue и должна сделать рабочий патч. Золотой стандарт для кодинг-агентов. SWE-bench Verified — 500 задач, которые инженеры проверили вручную.
Метрика — процент задач, где патч проходит тесты

🤖 Terminal-Bench (https://www.tbench.ai/) — задачи в реальном терминале: software engineering, сисадминирование, кибербезопасность, научные вычисления. Агент получает задание и работает в настоящем CLI-окружении. Топовые агенты набирают ~75% — значит, задачи действительно сложные.
Метрика — доля задач, где результат проходит автоматические тесты

🤖 LiveCodeBench (https://livecodebench.github.io/) — свежие задачи с LeetCode, AtCoder и Codeforces. Его регулярно обновляют, поэтому модель с меньшим шансом «видела» задачи при обучении. Хороший тест на свежесть.
Метрика — доля задач, которые прошли тесты

🤖 HumanEval (https://github.com/openai/human-eval) — 164 задачи: написать Python-функцию по docstring. Классика от OpenAI, но для топовых моделей уже простоват.
Метрика — доля задач, где первый ответ проходит юнит‑тесты

🤖 BigCodeBench (https://bigcode-bench.github.io/) — много задач с реальными библиотеками (pandas, torch, sklearn). Гораздо ближе к продовому коду, чем олимпиадные задачки.
Метрика — доля задач, которые прошли тесты

🤖 OSWorld (https://os-world.github.io/) — задачи с реальными десктопными и веб-приложениями. Агент должен кликать, печатать, переключаться между окнами и доводить задачу до результата. По сути, тест на «computer use» — может ли модель работать за компьютером как человек.
Метрика — доля задач, выполненных до конца корректно

🤖 MRCR v2 (https://huggingface.co/datasets/openai/mrcr) — бенчмарк от OpenAI на длинный контекст (до ~1M токенов). Модель получает синтетическую переписку, где один и тот же запрос повторяется 2, 4 или 8 раз. Задача — найти и вернуть конкретный экземпляр. Не про кодинг напрямую, но критически важен для агентов, которые работают с большими кодовыми базами и длинными контекстами.
Метрика — точность извлечения нужного фрагмента из длинного контекста

🤖 MMLU-Pro (https://github.com/TIGER-AI-Lab/MMLU-Pro) — 12 000+ вопросов по 14 областям: от математики и физики до права и экономики. Вариантов ответа не 4, а 10 — угадать сложнее, нужно реально рассуждать. На MMLU топовые модели уже упёрлись в потолок, а вот MMLU-Pro снова разделяет сильных и слабых.
Метрика — доля правильных ответов

Конечно, ни один бенчмарк не покажет эффективность модели именно на вашем проекте. Но как ориентир — помогает. На какой бенчмарк вы смотрите в первую очередь?

Канал — AI и разработка
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
Разработать решение на базе ИИ — это половина дела. Вторая половина — запустить его так, чтобы экономика сходилась. Эксплуатация LLM в продакшене — это GPU-серверы за миллионы рублей в месяц. И на каждом шаге — решение, которое меняет итоговый счёт: какую модель взять, как сконфигурировать железо, как масштабировать под нагрузку. Выбор модели, архитектуры и конфигурации GPU может изменить стоимость инфраструктуры на порядок — как в плюс, так и в минус.
На вебинаре разберём, из чего складывается стоимость инференса и какие решения при проектировании снижают бюджет на порядок.

🗓 13 марта, 12:00 мск, Пятница
💻 ОНЛАЙН

Что разберём:
— как устроен инференс LLM и какие способы оптимизации производительности существуют;
— из чего складывается стоимость эксплуатации LLM в продакшене;
— как выбор LLM-модели и конфигурации GPU меняет стоимость инфраструктуры на порядок;
— бенчмарки на реальном оборудовании: сравнение GPU в разных конфигурациях под нагрузкой;
— свой сервер и API: расчёт с ценами российских провайдеров, что выгодней.

Вебинар будет полезен для CTO, архитекторов, руководителей продуктов и разработчиков, которые строят LLM-решения и хотят понимать экономику их эксплуатации.

🔥 Зарегистрироваться на вебинар
Please open Telegram to view this post
VIEW IN TELEGRAM
Страшный сон вайб-кодера
OpenAI выпустила GPT-5.4

Что важно:
— native computer use: модель управляет UI через скриншоты и клики. 75% на OSWorld — выше человека (72.4%);
— tool search: вместо загрузки всех определений инструментов в контекст модель сама находит нужный. Минус 47% токенов — критично для MCP;
— контекст до 1M токенов в API;
— /fast в Codex: 1.5x скорость генерации без потери качества;
— на 33% меньше фактических ошибок vs GPT-5.2.

Цена в API: $2.50/M input, $15/M output (GPT-5.2 — $1.75/$14). Дороже за токен, но модель расходует их экономнее.

GPT-5.2 Thinking уедет в Legacy 5 июня 2026.


https://openai.com/index/introducing-gpt-5-4/
Вчера Open AI выкатили новые «дешевые» и умные модельки gpt-5.4-mini и gpt-5.4-nano и все вокруг пишут, как же круто, какие же они дешевые, а я решил сделать быстрый замер на реальной нашей задаче. Вот результаты

Контекст
Есть задача в одной из внутренних систем - метчить кандидатов на запросы при помощи LLM. Сейчас там используется моделька gpt-5-mini с low effort

Методика эксперимента
При тех же самых входных данных и промптах - меняем модельки и effort для них и смотрим на результаты

Замеры
На скриншоте

Итоги
1) Конкретно в нашей ситуации чуть лучший результат по качеству результата выдает gpt-5.4-mini с medium effort. Но по цене получается в ±3.5 раз дороже
2) gpt-5.4-mini с low effort выдает результат стабильно хуже, чем gpt-5-mini (незначительно, но хуже). Стоимость при этом примерно в 2 раза дороже
3) gpt-5.4-nano стабильно выдает в нашей задаче худшие результаты
4) Все модельки gpt-5.4 работают в 3+ раза быстрей
Решил поделиться одним из главных организационных изменений, которое будет во втором потоке курса по ИИ в разработке

У нас есть Групповой тариф, который подразумевает, что студенты добавляются в чат ПОТОКА, могут там консультироваться с преподавателями и могут ходить на еженедельные встречи

Дак вот мы решили превратить этот закрытый чат в комьюнити. Это будет один чат на все потоки (состоявшиеся и грядущие) и даже те, кто уже закончил обучение — будут иметь возможность ходить на ВСЕ еженедельные встречи. Без ограничений по сроку.

Первый поток показал, что еженедельные встречи — это не просто история про разбор домашек и ответы на вопросы, а место где реально заинтересованные люди делятся своими наблюдениями, опытом, болями и рабочими кейсами. Это очень круто, потому что опыт и специфика работы у ребят очень разные: были люди из быстрых стартапов, где всем по-умолчанию оплачивают подписку на Cursor; а были люди из банков, где за одно упоминание ИИ вызывают на ковер к СБ — это очень расширяет кругозор и позволяет обстучать свое представление о мире об чужой опыт :)

В общем, теперь наш Групповой тариф — это не про возможность получать обратную связь в рамках потока, а еще и про пожизненный доступ к закрытому комьюнити

🔥 Следующий поток стартует 20 апреля — не пропустите!

Курс по AI для разработчиков
Спонтанный вебинар про ИИ для автотестировщиков 🔥

5 мая в 13:00 мск проведём онлайн-вебинар «Искусственный интеллект в автотестировании: опыт QA Automation Tech Lead»

Поговорим с практиком QA Automation Tech Lead о том, как AI уже помогает в работе автотестировщика: искать информацию, писать и чинить тесты, работать с локаторами, разбирать JSON, писать SQL-запросы и рефакторить код.

👨 Гость: Олег Пендрак, Tech Lead QA Automation в СберЗдоровье, лидер сообщества Thread QA
🗓 5 мая, 13:00 мск, вторник
💻 ОНЛАЙН

Обсудим
— как QA Automation Tech Lead использует AI в ежедневной работе;
— где искусственный интеллект помогает с ресерчем, кодом, локаторами и рефакторингом;
— как AI-IDE и MCP-интеграции меняют работу с автотестами;
— как использовать AI для браузера, документации библиотек и запросов к базе;
— какие задачи лучше не отдавать AI без ручной проверки;
— какие навыки автотестировщика становятся важнее, когда существенную часть рутины берёт на себя инструмент.

РЕГИСТРАЦИЯ НА ВЕБИНАР
👍4
Cursor SDK выводит агента в код

29 апреля 2026 Cursor открыл в public beta TypeScript SDK. Того же агента из приложения, CLI и web теперь можно вызывать из своего кода через @cursor/sdk.

Модель простая: local работает в вашем cwd, cloud запускает задачу в выделенной VM Cursor, а run.stream() отдает события по ходу run. Для cloud-run Cursor отдельно обновил streaming, cancellation и lifecycle control.

Практический смысл в том, что агент становится частью workflow, а не только окна IDE. В официальном анонсе Cursor пишет про запуск из CI/CD и сценарий, когда run стартует из скрипта, а потом открывается в Cursor для ручного takeover.

Ограничения стандартные, но важные: это public beta с token-based биллингом, а качество и цена зависят от репозитория.

Если Cursor уже есть в команде, логичный тест один: вынести в SDK одну повторяемую задачу и сравнить, где хватает local, а где уже нужен cloud.

AI в разработке
👍2
ТРАНСЛЯЦИЯ ВЕБИНАРА «Искусственный интеллект в автотестировании: опыт QA Automation Tech Lead»

Подключайтесь по ссылке: https://vkvideo.ru/video-137384692_456239241
👍2
Cursor переводит плагины в командную настройку

Cursor обновил Team Marketplace: теперь админ может создать его без привязки к репозиторию и прямо в настройках задать режим установки для first-party plugins. В changelog от 1 мая перечислены три режима: Default Off, Default On и Required.

Это важно не только как удобство. Плагин в Cursor может упаковывать MCP-серверы, skills, subagents, rules и hooks, то есть команда начинает управлять не только редактором, но и тем, какие возможности вообще получает агент в проекте.

Практический эффект понятный: меньше ручной установки и расхождений между рабочими местами, проще онбординг. Базовый набор для GitHub, Linear, Figma или внутренних workflow можно раздавать централизованно, а не собирать на каждом ноутбуке заново.

Но вместе с удобством растут требования к политике доступа. Если агенту выдают больше инструментов, стоит заранее решить, что должно оставаться optional, что можно включать по умолчанию, а что нельзя делать required без проверки прав и сценариев записи.

Если команда уже работает в Cursor, полезно пройтись по текущим плагинам и разложить их в три корзины: оставить вручную, включить по умолчанию или ограничить.

AI в разработке
👍3
Запись вебинара «Искусственный интеллект в автотестировании: опыт QA Automation Tech Lead»

VKVideo: https://vkvideo.ru/video-137384692_456239241
YouTube: https://www.youtube.com/watch?v=mN_N4q5Y6eE

Спикером вебинара выступил Олег Пендрак — Tech Lead QA Automation в СберЗдоровье и лидер сообщества ThreadQA. Олег поделился своим опытом применения ИИ и прямо на вебинаре продемонстрировал конкретные примеры сценариев применения: работа с MCP, написание UI-тестов и API-тестов и пр

Также, мы с Олегом по мотивам вебинара подготовили статью, где показываем сценарии использования ИИ в автотестировании и разбираем, где сразу поставить границы: по доступам, данным, ревью и ответственности за результат
👍4
Cursor делает security review постоянным слоем

30 апреля 2026 года Cursor запустил в бете Security Review для Teams и Enterprise. Внутри два always-on агента: Security Reviewer проверяет каждый PR, а Vulnerability Scanner гоняет плановые сканы по кодовой базе.

Security Reviewer ищет не только уязвимости, но и auth-регрессии, privacy и data-handling риски, auto-approval агентных тулов и prompt injection. Vulnerability Scanner отдельно проверяет известные уязвимости, устаревшие зависимости и конфигурационные проблемы, а результаты может отправлять в Slack.

Практический сдвиг тут в другом: AI теперь ставят не только в редактор, а в постоянный контур вокруг PR и репозитория. Если у команды уже есть свои SAST, SCA или secrets scanners, Cursor позволяет подключить их через MCP как часть review.

По доступности это beta для Teams и Enterprise: на pricing page у Teams указано $40 / user / mo., у Enterprise цена кастомная, а сами security agents списывают usage из общего пула. Но заменой SAST/SCA и ручного security review это пока не выглядит: скорее ранний фильтр, который быстрее подсвечивает, куда человеку стоит смотреть в первую очередь.

Если команда уже пишет через Cursor, логичный тест простой: включить reviewer на активном репозитории и посмотреть, какие типы замечаний повторяются чаще всего и что из этого стоит перевести в свои правила и пайплайны.

AI в разработке
Почему Codex идет в AWS

28 апреля OpenAI и AWS открыли limited preview для OpenAI models on AWS, Codex on Amazon Bedrock и Managed Agents. Для Codex публично заявлены Codex CLI, desktop app и VS Code extension: доступ через AWS credentials, inference через Bedrock. OpenAI · AWS

Смысл не в самом анонсе. Для enterprise agentic coding упирается не только в модель, но и в контур запуска: где живут доступ, биллинг и согласования. Если команда уже работает вокруг AWS, пилот проще запускать там, а не через новый SaaS-путь.

Но это не «Codex для всех»: пока только limited preview, без обещаний широкой доступности и без повода додумывать compliance-свойства сверх анонса.

Практический вопрос для CTO и platform-команд: не просто «нужен ли нам coding agent», а «в каком контуре мы готовы его запускать». Для enterprise это уже часть выбора.

AI в разработке