🎙️ OpenAI собрала работу с голосом в один рабочий контур
GPT-Realtime-2, GPT-Realtime-Translate и GPT-Realtime-Whisper закрывают разговор, перевод и streaming speech-to-text.
И вот здесь уже видно, зачем это разработчику. Один Realtime-стек убирает лишнюю склейку между диалогом, переводом и транскрипцией. Меньше отдельных сервисов вокруг, меньше мест, где всё ломается на задержке или теряется контекст.
GPT-Realtime-2 держит разговор и тянет более сложные запросы с GPT-5-class reasoning. GPT-Realtime-Translate переводит речь в реальном времени с 70+ входных языков в 13 выходных. GPT-Realtime-Whisper делает live speech-to-text, пока спикер говорит.
Отдельный практический момент, который уже нельзя списать на маркетинг: Realtime API поддерживает EU Data Residency и стоит на 20% дешевле gpt-4o-realtime-preview. Для продакшена это как раз те вещи, из-за которых интеграцию обычно откладывают.
Вывод: OpenAI двигает voice из демо в слой, который можно реально встраивать в саппорт, операторские интерфейсы и мультиязычные продукты. И этот стек очень полезен там, где нужен один контур для речи, перевода и текста, а не игрушка для красивого демо.
👉 @CutCode_AI
GPT-Realtime-2, GPT-Realtime-Translate и GPT-Realtime-Whisper закрывают разговор, перевод и streaming speech-to-text.
И вот здесь уже видно, зачем это разработчику. Один Realtime-стек убирает лишнюю склейку между диалогом, переводом и транскрипцией. Меньше отдельных сервисов вокруг, меньше мест, где всё ломается на задержке или теряется контекст.
GPT-Realtime-2 держит разговор и тянет более сложные запросы с GPT-5-class reasoning. GPT-Realtime-Translate переводит речь в реальном времени с 70+ входных языков в 13 выходных. GPT-Realtime-Whisper делает live speech-to-text, пока спикер говорит.
Отдельный практический момент, который уже нельзя списать на маркетинг: Realtime API поддерживает EU Data Residency и стоит на 20% дешевле gpt-4o-realtime-preview. Для продакшена это как раз те вещи, из-за которых интеграцию обычно откладывают.
Вывод: OpenAI двигает voice из демо в слой, который можно реально встраивать в саппорт, операторские интерфейсы и мультиязычные продукты. И этот стек очень полезен там, где нужен один контур для речи, перевода и текста, а не игрушка для красивого демо.
👉 @CutCode_AI
🎉8👍2🔥2❤1🤩1
🤖 Интересное обновление в Telegram
Telegram открыл ботам вход в любой чат по @, даже если они не участники диалога. Но с ограничением: бот видит только те сообщения, где его упомянули, и ответы на них.
Для меня, как разработчика это уже не «бот в личке», а кусок рабочей схемы внутри обычной переписки. Например, бот-ресепшн принимает запрос, бот-проверка смотрит контекст, бот-исполнитель оформляет результат в том же чате. Человека между ними может не быть вообще. И всё это внутри Telegram.
Самое важное здесь даже не сам вызов по @, а связка bot-to-bot. Это уже нормальная автоматизация внутри живого диалога, а не один скрипт, который отвечает в лоб. Telegram ещё и обновил Bot API, так что это не обходная схема сверху, а новая основа на уровне протокола.
Вывод: Telegram перестал держать ботов в декоративной роли. Теперь это рабочая среда для процессов, где у каждого бота есть границы и маршрут. И это меняет не «умность» ботов, а то, как вообще можно собирать интеграции в мессенджере. Уже начал дорабатывать своего Telegram-агента 😎
👉 @CutCode_AI
Telegram открыл ботам вход в любой чат по @, даже если они не участники диалога. Но с ограничением: бот видит только те сообщения, где его упомянули, и ответы на них.
Для меня, как разработчика это уже не «бот в личке», а кусок рабочей схемы внутри обычной переписки. Например, бот-ресепшн принимает запрос, бот-проверка смотрит контекст, бот-исполнитель оформляет результат в том же чате. Человека между ними может не быть вообще. И всё это внутри Telegram.
Самое важное здесь даже не сам вызов по @, а связка bot-to-bot. Это уже нормальная автоматизация внутри живого диалога, а не один скрипт, который отвечает в лоб. Telegram ещё и обновил Bot API, так что это не обходная схема сверху, а новая основа на уровне протокола.
Вывод: Telegram перестал держать ботов в декоративной роли. Теперь это рабочая среда для процессов, где у каждого бота есть границы и маршрут. И это меняет не «умность» ботов, а то, как вообще можно собирать интеграции в мессенджере. Уже начал дорабатывать своего Telegram-агента 😎
👉 @CutCode_AI
🎉12👍7🔥5🤩3❤2
This media is not supported in your browser
VIEW IN TELEGRAM
🛠 Claude Code дал возможность наблюдать за субагентами
Когда агентов несколько, их сложно контролировать: кто ждёт ввод, кто ещё работает, кто уже отдал результат. Agent view собирает это в одном месте и сразу показывает, что происходит с каждой сессией.
В списке видны последняя реплика, время последнего контакта и состояние сессии. Оттуда же можно открыть полный транскрипт.
Для разработчика это меняет повседневную работу в терминале. Вместо россыпи вкладок и ручных пометок остаётся один диспетчер для параллельных задач. Это особенно заметно, когда несколько агентов уже работают одновременно и надо не терять контекст между ними.
Это полезно: Claude Code чинит самое больное место AI-инструментов в разработке, управление параллельным потоком. Сгенерировать агента уже не проблема, а вот удержать контроль над десятком сессий уже совсем другая задача. Именно здесь такие инструменты обычно и ломаются.
👉 @CutCode_AI
Когда агентов несколько, их сложно контролировать: кто ждёт ввод, кто ещё работает, кто уже отдал результат. Agent view собирает это в одном месте и сразу показывает, что происходит с каждой сессией.
В списке видны последняя реплика, время последнего контакта и состояние сессии. Оттуда же можно открыть полный транскрипт.
Для разработчика это меняет повседневную работу в терминале. Вместо россыпи вкладок и ручных пометок остаётся один диспетчер для параллельных задач. Это особенно заметно, когда несколько агентов уже работают одновременно и надо не терять контекст между ними.
Это полезно: Claude Code чинит самое больное место AI-инструментов в разработке, управление параллельным потоком. Сгенерировать агента уже не проблема, а вот удержать контроль над десятком сессий уже совсем другая задача. Именно здесь такие инструменты обычно и ломаются.
👉 @CutCode_AI
🤩5❤4🔥3🎉2👍1
GPT-5.5 против Claude Opus 4.7
Новый ролик на YouTube. Топовые модели получили один и тот же coding benchmark.
Обе проучили reasoning на максимум, и интрига держалась до самого конца.
Кто выиграл — смотри в видео👇
https://youtu.be/97EDYPWEXm0
Новый ролик на YouTube. Топовые модели получили один и тот же coding benchmark.
Обе проучили reasoning на максимум, и интрига держалась до самого конца.
Кто выиграл — смотри в видео👇
https://youtu.be/97EDYPWEXm0
YouTube
GPT-5.5 vs Opus 4.7: кто лучше пишет код?
GPT-5.5 и Claude Opus 4.7 получили одну и ту же задачу на coding benchmark, оба были выкручены на максимальный effort/reasoning, и интрига держалась почти до самого конца. Модели сдали решение практически одновременно, но внутри все оказалось куда интереснее.…
🔥5👍3🎉3🤩3❤2
⚡️ Andrej Karpathy переходит в Anthropic и, по данным CNBC, сразу подключается к pretraining-команде. Его задача — использовать Claude, чтобы ускорять research и обучение следующего поколения моделей.
Это важный сигнал: AI-гонка всё сильнее смещается от красивых демо к данным, пайплайнам, экспериментам и качеству pretraining. Если подход Anthropic сработает, преимущество будет расти прямо внутри процесса обучения.
Это важный сигнал: AI-гонка всё сильнее смещается от красивых демо к данным, пайплайнам, экспериментам и качеству pretraining. Если подход Anthropic сработает, преимущество будет расти прямо внутри процесса обучения.
🔥9❤4🤩4👍3🎉1
У Google пачка апдейтов, и главное тут три штуки.
1. Gemini 3.5 Flash
Опять обещают прорыв в кодинге — посмотрим в деле.
Но есть ощущение, что модель может получиться сильной. Особенно с учётом того, что Gemini у Google уже умеет хорошо удивлять.
2. Antigravity 2.0
Систему пересобрали, переписали на Go, добавили параллельных агентов, dynamic subagents и Scheduled Tasks.
По сути, просто догнали Claude Code и Codex.
Хотя важный нюанс: Antigravity сейчас лёг, так что протестить всё это пока нельзя.
3. Gemini Omni
Похоже, это новая SOTA-модель для генерации видео.
Формулировка простая: Nano Banana, но для видео. И это уже звучит интересно.
Вывод:
Самое вкусное тут не Antigravity, а связка Gemini 3.5 Flash + Omni. Особенно если Flash реально окажется сильной мультимодальной моделью.
1. Gemini 3.5 Flash
Опять обещают прорыв в кодинге — посмотрим в деле.
Но есть ощущение, что модель может получиться сильной. Особенно с учётом того, что Gemini у Google уже умеет хорошо удивлять.
2. Antigravity 2.0
Систему пересобрали, переписали на Go, добавили параллельных агентов, dynamic subagents и Scheduled Tasks.
По сути, просто догнали Claude Code и Codex.
Хотя важный нюанс: Antigravity сейчас лёг, так что протестить всё это пока нельзя.
3. Gemini Omni
Похоже, это новая SOTA-модель для генерации видео.
Формулировка простая: Nano Banana, но для видео. И это уже звучит интересно.
Вывод:
Самое вкусное тут не Antigravity, а связка Gemini 3.5 Flash + Omni. Особенно если Flash реально окажется сильной мультимодальной моделью.
❤4👍3🎉3🤩2🔥1
🇨🇳 Alibaba выкатили Qwen3.7-Max - и это уже не просто очередной чат-апдейт, а модель под агентные задачи.
Самый жирный кейс из релиза:
35 часов автономной работы, 1158+ tool calls и самостоятельная оптимизация CUDA-ядра под длинный контекст.
Итог - x10 ускорение инференса.
По цифрам тоже ок:
• 1M токенов контекста
• только текст
• мультимодальности нет
На SWE-bench Pro - 60.6%. Это выше DeepSeek V4-Pro, но ниже Claude Opus 4.7.
Интересно и то, что Qwen прогнали через OpenClaw, Claude Code и Hermes - разброс всего около 6 пунктов. Значит, модель довольно стабильна.
Главный вопрос теперь не про чат, а про реальную кодовую задачу: дотянет ли модель фронт, бэк, отладку и многошаговые tool calls до конца.
В целом Qwen двигается в правильную сторону. Но решать по-прежнему будет не только модель, а вся обвязка вокруг неё.
Самый жирный кейс из релиза:
35 часов автономной работы, 1158+ tool calls и самостоятельная оптимизация CUDA-ядра под длинный контекст.
Итог - x10 ускорение инференса.
По цифрам тоже ок:
• 1M токенов контекста
• только текст
• мультимодальности нет
На SWE-bench Pro - 60.6%. Это выше DeepSeek V4-Pro, но ниже Claude Opus 4.7.
Интересно и то, что Qwen прогнали через OpenClaw, Claude Code и Hermes - разброс всего около 6 пунктов. Значит, модель довольно стабильна.
Главный вопрос теперь не про чат, а про реальную кодовую задачу: дотянет ли модель фронт, бэк, отладку и многошаговые tool calls до конца.
В целом Qwen двигается в правильную сторону. Но решать по-прежнему будет не только модель, а вся обвязка вокруг неё.
❤7🤩5👍2🔥2🎉2
Сегодня весь день Claude и Codex работали над сложной задачей и в итоге впервые оба отчитались, что не смогли найти решение. Я такого еще не видел, но задача была действительно нелегкой. Примечательно, что Claude в итоге исправил README проекта, где указал этот кейс и сообщил о том, что задача невыполнима. Поскольку я готовлю баттл Gemini/Qwen/GPT/Opus и у меня открыт Antigravity CLI, то просто ради эксперимента закинул такую же задачу. По инпуту она была один в один, так как работал велась через ai-factory, и план не менялся! Ну, в целом, я в шоке. Gemini 3.5 Flash (medium) за 2 итерации решил проблему, а на 3-й довёл её до идеала. Я при этом следил за tool calling и настолько глубокого исследования проблемы еще не встречал ни в одном агенте. В итоге я просто просидел минут 10 вот с такими глазами 😳! Можно подумать, что очередной рандом, но Claude и Codex пыхтели весь день, там под 30 итераций и никак! Честно говоря, на Gemini вообще не было ставки. Теперь интересно, как он себя покажет на баттле.
❤15👍12🔥5🎉4🤩3🤯1
Новый coding battle на CutCode
Новые модели пришли с красивыми фирменными бенчмарками, где они доминируют по всем показателям. Поэтому я взял нашего чемпиона GPT-5.5 против новичков - Gemini 3.5 Flash и Qwen 3.7 Max и отправил их не в синтетическую табличку со столбиками, а в реальную задачу: endpoints, PDF, ограничения по версиям, Postgres, Docker sandbox, performance и ревью качества кода.
На старте у каждой модели есть причина выглядеть фаворитом. В ролике есть дисквалификации, второй шанс и финал, который лучше не спойлерить:
https://www.youtube.com/watch?v=NaEoiWCOdGs
Новые модели пришли с красивыми фирменными бенчмарками, где они доминируют по всем показателям. Поэтому я взял нашего чемпиона GPT-5.5 против новичков - Gemini 3.5 Flash и Qwen 3.7 Max и отправил их не в синтетическую табличку со столбиками, а в реальную задачу: endpoints, PDF, ограничения по версиям, Postgres, Docker sandbox, performance и ревью качества кода.
На старте у каждой модели есть причина выглядеть фаворитом. В ролике есть дисквалификации, второй шанс и финал, который лучше не спойлерить:
https://www.youtube.com/watch?v=NaEoiWCOdGs
YouTube
GPT 5.5 vs Gemini 3.5 flash vs Qwen 3.7-max: жесткий coding benchmark
В этот раз в батле моделей без Claude Opus: GPT-5.5, Gemini 3.5 Flash и Qwen Max получили одну и ту же реальную задачу с endpoints, генерацией PDF, ограничениями по версиям, performance-тестами и проверкой качества кода. Сначала все выглядело бодро: Qwen…
🤩9👍8❤6🔥5🎉3
⚙️ Claude Opus 4.8 вышел с штукой, которая для продакшн-агентов важнее любой красивой цифры — теперь можно управлять effort
То есть модель можно просить работать легче или, наоборот, выкладываться по максимуму прямо внутри продукта. Без лишней обвязки вокруг промпта.
И это реально меняет практику.
Где задача простая — не жжёшь лишние ресурсы.
Где ошибка дорогая — включаешь тяжёлый режим.
Тут уже речь не про “умнее”, а про то, насколько модель можно нормально контролировать в бою.
В Claude Code ещё добавили dynamic workflows для очень больших задач. И вот это, пожалуй, самое прикладное в релизе: длинные цепочки шагов, инструменты, промежуточные решения, риск потерять контекст — всё то, где agentic-сценарии обычно и разваливаются.
Anthropic также пишет, что ранние тестеры считают Opus 4.8 более надёжным и более точным в agentic tasks.
А fast mode теперь работает в 2.5 раза быстрее и стоит в 3 раза дешевле, чем у прошлых моделей.
И вот это уже не косметика, а вполне практичный апдейт: такие вещи реально делают автоматизации дешевле и проще в проде.
Мой вывод: Opus 4.8 важен не самими бенчмарками, а тем, что делает агентные сценарии более предсказуемыми и менее дорогими. Но настоящая ценность раскроется только там, где уже есть нормальная обвязка, контроль шагов и процесс. Один промпт тут не спасёт.
То есть модель можно просить работать легче или, наоборот, выкладываться по максимуму прямо внутри продукта. Без лишней обвязки вокруг промпта.
И это реально меняет практику.
Где задача простая — не жжёшь лишние ресурсы.
Где ошибка дорогая — включаешь тяжёлый режим.
Тут уже речь не про “умнее”, а про то, насколько модель можно нормально контролировать в бою.
В Claude Code ещё добавили dynamic workflows для очень больших задач. И вот это, пожалуй, самое прикладное в релизе: длинные цепочки шагов, инструменты, промежуточные решения, риск потерять контекст — всё то, где agentic-сценарии обычно и разваливаются.
Anthropic также пишет, что ранние тестеры считают Opus 4.8 более надёжным и более точным в agentic tasks.
А fast mode теперь работает в 2.5 раза быстрее и стоит в 3 раза дешевле, чем у прошлых моделей.
И вот это уже не косметика, а вполне практичный апдейт: такие вещи реально делают автоматизации дешевле и проще в проде.
Мой вывод: Opus 4.8 важен не самими бенчмарками, а тем, что делает агентные сценарии более предсказуемыми и менее дорогими. Но настоящая ценность раскроется только там, где уже есть нормальная обвязка, контроль шагов и процесс. Один промпт тут не спасёт.
❤9🎉9🔥5👍2🤩2
Новое видео на CutCode
Решил провести сравнение GPT-5.5, GPT-5.4, GPT-5.2 и GPT-5.3 в одном тесте.
Результат неоднозначный: победитель по баллам - не тот, чей код я бы взял в доработку.
Разбор тут:
https://www.youtube.com/watch?v=iAFxk__CstY
Решил провести сравнение GPT-5.5, GPT-5.4, GPT-5.2 и GPT-5.3 в одном тесте.
Результат неоднозначный: победитель по баллам - не тот, чей код я бы взял в доработку.
Разбор тут:
https://www.youtube.com/watch?v=iAFxk__CstY
YouTube
GPT-5.5, GPT-5.4, GPT-5.2 и GPT-5.3 Codex: кто лучше пишет код в линейке Codex
Я взял четыре модели из линейки GPT-5 и отправил их в один и тот же тест: GPT-5.5, GPT-5.4, GPT-5.2 и GPT-5.3. Задача не игрушечная: API с кучей endpoint-ов, генерация PDF, ограничения по версиям, интеграционные тесты, k6, performance и оценка качества кода.…
🔥9🎉6❤4👍4🤩3
Тестируем новую модель от Anthropic 🔥
Столкнул Claude Opus 4.8 и GPT-5.5 в реальной задаче по коду.
Получится ли у новой модели обогнать чемпиона последних батлов? Смотрите:
https://www.youtube.com/watch?v=lhZvejs6lnY
Столкнул Claude Opus 4.8 и GPT-5.5 в реальной задаче по коду.
Получится ли у новой модели обогнать чемпиона последних батлов? Смотрите:
https://www.youtube.com/watch?v=lhZvejs6lnY
YouTube
Claude Opus 4.8 против GPT-5.5: кто лучше пишет код
Claude Opus 4.8 вышел так, будто сейчас должен перевернуть таблицу лидеров. Поэтому я не стал смотреть на фирменные benchmark-графики и отправил его туда, где красивые цифры быстро заканчиваются: в реальную задачу против GPT-5.5.
У моделей одинаковое ТЗ:…
У моделей одинаковое ТЗ:…
❤7🎉7👍6🔥4🤩2
Forwarded from AI Community | CutCode
Вышел новый ролик про изменения в AI Factory и экосистеме 🚀
Разбираю AI Factory, AI Workspace, HLV, AIF Handoff, MCP Unit и AI Tester: аудит артефактов, дистилляцию материалов в скиллы, память между проектами, прогрев сессий и управляемый процесс AI-разработки.
Если vibe coding уже начал превращаться в хаос - показываю, куда двигаться дальше.
https://www.youtube.com/watch?v=uRb04AO_13Y
Разбираю AI Factory, AI Workspace, HLV, AIF Handoff, MCP Unit и AI Tester: аудит артефактов, дистилляцию материалов в скиллы, память между проектами, прогрев сессий и управляемый процесс AI-разработки.
Если vibe coding уже начал превращаться в хаос - показываю, куда двигаться дальше.
https://www.youtube.com/watch?v=uRb04AO_13Y
YouTube
AI кодинг без хаоса: мой workflow для разработки
Разбираю свежие изменения в AI Factory, AI Workspace, HLV, AIF Handoff, MCP Unit и AI Tester. В релизе много практичных вещей: аудит артефактов, дистилляция книг и документации в скиллы, события между проектами, прогрев сессий и связка AI Factory Init + AI…
❤8🔥7🤩4🎉3👍2
На днях провел эксперимент с LLM.
Занимался реализацией задачи в проекте, где генерировать код LLM-кой запрещено. Сам проект абсолютно не готов для работы с ИИ, хотя глобально там есть общие универсальные скиллы по тестам, качеству кода, архитектуре и т.д. Они общие, но индивидуального контекста под проект нет.
Суть эксперимента была в том, что я со своими знаниями и экспертностью попробую дать на вход максимум контекста и в итоге оценю результат.
Контекст я готовил половину рабочего дня: делал референсы из ТЗ, собирал контекст из переписок, саммари из созвонов. Было подготовлено много артефактов.
Дальше я запустил генерацию и через 30 минут получил готовый код: покрытый тестами, полностью рабочий. Если отправить его в прод, никто даже не заметит подвоха. QA отчитается, что все кейсы выполнены и все гуд.
Но код LLM-кой писать запрещено, значит, прежде чем отправлять его на ревью, мне нужно было поревьювить его самому.
Что в итоге? Как вы думаете?
Я полностью его переписал. Начиная от структуры таблиц и заканчивая кодом.
Это был рабочий мусор.
Думаете, вывод такой: «ха-ха, LLM делает мусор»?
Нет.
Эксперимент на самом деле завершился так, как я и предполагал. ИИ — это просто инструмент. Качественный контекст по задаче даст рабочее решение, но он не выполнит все ваши внутренние соглашения сам по себе.
А вот чтобы все было так, как вы хотите, хотя бы приближенно, нужно потратить кучу времени на подготовку проекта к работе с LLM: выстроить harness, дать примеры того, как нужно писать, и постоянно их поддерживать.
Причем это нужно внедрять не только на уровне разработки. Аналитики тоже должны сразу готовить контекст по задаче в едином стиле, желательно в кооперации с LLM, чтобы на вход уже попадал нормальный сформированный инпут, а не набор разрозненных сообщений, созвонов и догадок.
То есть задача должна приходить не в формате «ну там в переписке все есть», а в виде готового артефакта: что делаем, зачем, какие ограничения, какие кейсы, какие спорные места, какие примеры, какие связи с текущей системой.
А дополнительную информацию модель уже должна получать через внутренний MCP: документацию, схемы, соглашения, примеры кода, контракты, историю решений и все остальное, что нужно для нормального погружения в проект.
В моей ситуации нужно было бы вложить очень много времени именно в подготовку контекста по кодовой части. И этот процесс был бы бесконечным: столкнулись с непредсказуемым поведением — дополняем инструкции, улучшаем слой валидации, добавляем новые проверки.
Все это невозможно без смены мышления у всей команды.
Каждый должен держать систему в тонусе, чтобы через какое-то время получить буст и постоянно его наращивать.
Разработчикам в найме заниматься этим в свободное время, скорее всего, не особо захочется. А бизнес в большинстве случаев вряд ли выделит под это отдельные ресурсы.
Пока как-то так.
P.s. Манифест "AI Native - Новая культура мышления" уже доступен - https://ai-native.cutcode.dev
Занимался реализацией задачи в проекте, где генерировать код LLM-кой запрещено. Сам проект абсолютно не готов для работы с ИИ, хотя глобально там есть общие универсальные скиллы по тестам, качеству кода, архитектуре и т.д. Они общие, но индивидуального контекста под проект нет.
Суть эксперимента была в том, что я со своими знаниями и экспертностью попробую дать на вход максимум контекста и в итоге оценю результат.
Контекст я готовил половину рабочего дня: делал референсы из ТЗ, собирал контекст из переписок, саммари из созвонов. Было подготовлено много артефактов.
Дальше я запустил генерацию и через 30 минут получил готовый код: покрытый тестами, полностью рабочий. Если отправить его в прод, никто даже не заметит подвоха. QA отчитается, что все кейсы выполнены и все гуд.
Но код LLM-кой писать запрещено, значит, прежде чем отправлять его на ревью, мне нужно было поревьювить его самому.
Что в итоге? Как вы думаете?
Я полностью его переписал. Начиная от структуры таблиц и заканчивая кодом.
Это был рабочий мусор.
Думаете, вывод такой: «ха-ха, LLM делает мусор»?
Нет.
Эксперимент на самом деле завершился так, как я и предполагал. ИИ — это просто инструмент. Качественный контекст по задаче даст рабочее решение, но он не выполнит все ваши внутренние соглашения сам по себе.
А вот чтобы все было так, как вы хотите, хотя бы приближенно, нужно потратить кучу времени на подготовку проекта к работе с LLM: выстроить harness, дать примеры того, как нужно писать, и постоянно их поддерживать.
Причем это нужно внедрять не только на уровне разработки. Аналитики тоже должны сразу готовить контекст по задаче в едином стиле, желательно в кооперации с LLM, чтобы на вход уже попадал нормальный сформированный инпут, а не набор разрозненных сообщений, созвонов и догадок.
То есть задача должна приходить не в формате «ну там в переписке все есть», а в виде готового артефакта: что делаем, зачем, какие ограничения, какие кейсы, какие спорные места, какие примеры, какие связи с текущей системой.
А дополнительную информацию модель уже должна получать через внутренний MCP: документацию, схемы, соглашения, примеры кода, контракты, историю решений и все остальное, что нужно для нормального погружения в проект.
В моей ситуации нужно было бы вложить очень много времени именно в подготовку контекста по кодовой части. И этот процесс был бы бесконечным: столкнулись с непредсказуемым поведением — дополняем инструкции, улучшаем слой валидации, добавляем новые проверки.
Все это невозможно без смены мышления у всей команды.
Каждый должен держать систему в тонусе, чтобы через какое-то время получить буст и постоянно его наращивать.
Разработчикам в найме заниматься этим в свободное время, скорее всего, не особо захочется. А бизнес в большинстве случаев вряд ли выделит под это отдельные ресурсы.
Пока как-то так.
P.s. Манифест "AI Native - Новая культура мышления" уже доступен - https://ai-native.cutcode.dev
❤11👍3🔥1🎉1🤩1
⚡️ Anthropic открыла доступ к Claude Fable 5
Это первая публичная модель нового класса Mythos - уровня выше Opus по возможностям.
Fable 5 и закрытая Mythos 5 построены на одной базовой модели. Разница в ограничениях: чувствительные запросы по кибербезопасности, биологии, химии и distillation-трафик в Fable 5 перенаправляются к Opus 4.8.
Модель стоит $10 за миллион входных токенов и $50 за миллион выходных - меньше половины цены Mythos Preview. До 22 июня Fable 5 доступна на тарифах Pro, Max, Team и Enterprise, потом потребуются usage credits.
Интересно, что Anthropic отдельно позиционирует Mythos-класс не как обычный апдейт Claude, а как новый верхний уровень для сложной интеллектуальной работы и кодинга.
Ссылки:
Релиз Fable 5 и Mythos 5
Project Glasswing
Это первая публичная модель нового класса Mythos - уровня выше Opus по возможностям.
Fable 5 и закрытая Mythos 5 построены на одной базовой модели. Разница в ограничениях: чувствительные запросы по кибербезопасности, биологии, химии и distillation-трафик в Fable 5 перенаправляются к Opus 4.8.
Модель стоит $10 за миллион входных токенов и $50 за миллион выходных - меньше половины цены Mythos Preview. До 22 июня Fable 5 доступна на тарифах Pro, Max, Team и Enterprise, потом потребуются usage credits.
Интересно, что Anthropic отдельно позиционирует Mythos-класс не как обычный апдейт Claude, а как новый верхний уровень для сложной интеллектуальной работы и кодинга.
Ссылки:
Релиз Fable 5 и Mythos 5
Project Glasswing
Anthropic
Claude Fable 5 and Claude Mythos 5
Today we’re launching Claude Fable 5: a Mythos-class model that we’ve made safe for general use.
🔥5🎉3😁2🤩2
Есть популярный инструмент для AI-разработки — CodeGraph. Он обещает уменьшение потребления токенов (35%), меньше tool calls, быстрые ответы и лучшее понимание кодовой базы.
Звучит как must-have, поэтому я решил проверить его в деле.
Прогнал CodeGraph через AI Tester на двух сценариях: простой задаче и проекте покрупнее. А потом добавил длительное исследование от Ичи, разработчика из нашего комьюнити: 300+ тестов и 150 парных сравнений rg против CodeGraph.
И вот тут стало интересно. Смотрите в новом видео разбор CodeGraph:
https://youtu.be/4W7V4gj_jC8
Звучит как must-have, поэтому я решил проверить его в деле.
Прогнал CodeGraph через AI Tester на двух сценариях: простой задаче и проекте покрупнее. А потом добавил длительное исследование от Ичи, разработчика из нашего комьюнити: 300+ тестов и 150 парных сравнений rg против CodeGraph.
И вот тут стало интересно. Смотрите в новом видео разбор CodeGraph:
https://youtu.be/4W7V4gj_jC8
YouTube
CodeGraph MCP: меньше tool calls или просто больше токенов?
CodeGraph на бумаге выглядит как почти идеальный апгрейд для AI-агентов: индексирует кодовую базу, отдает контекст через MCP и обещает меньше токенов, меньше tool calls и более быстрые ответы. Звучит как тул, который можно просто подключить и сразу получить…
🔥9❤🔥4🎉3👍2🤩2😍2💯2❤1🥰1
AI-разработку часто подают как один сценарий: подключил модель, добавил MCP, дал агенту задачу — и команда ускорилась. Но на практике есть минимум три разных подхода: контекстная фабрика, разработка на стероидах и vibe coding, он же prompt casino. В новом ролике разбираю, почему их опасно путать, почему AI не отменяет разработчиков и почему сотни тулов не делают человека AI-native: https://www.youtube.com/watch?v=N_-GFgesQGk
YouTube
Три типа AI-разработки: где vibe coding ломается
Все говорят про AI-разработку так, будто есть один путь: подключил модель, добавил пару MCP, дал агенту задачу и команда сразу стала быстрее. На практике я вижу три совершенно разных сценария, и путать их опасно.
Первый - контекстная фабрика, где команда…
Первый - контекстная фабрика, где команда…
❤5🤩3🔥2🥰2🎉2😍2💯2👍1❤🔥1
Forwarded from Новости от CutCode
1000 звёзд у AI Factory. Вот это поворот.
Честно говоря, я пару раз обновил GitHub, просто проверить - точно ли это происходит с моим проектом.
AI Factory добрался до 1000 звёзд! Это мой самый быстрорастущий Open Source.
Для меня это не просто цифра. Это знак, что тема AI-разработки болит не только у меня.
Мы все видели этот сценарий: дал агенту задачу, он уверенно поехал, а потом ты полдня разбираешь, куда именно. Поэтому AI Factory родился как попытка сделать не prompt casino, а нормальный инженерный workflow: контекст, спеки, планы, проверки, документация, правила для агентов.
И самое крутое - проект уже давно не только про меня. В разработку влилось много сильных ребят, появились идеи, правки, обсуждения, и из этого постепенно вырос действительно полезный тул.
Спасибо всем, кто поставил звезду, помог кодом, issue, советом или просто поддержал.
Двигаемся дальше!
Честно говоря, я пару раз обновил GitHub, просто проверить - точно ли это происходит с моим проектом.
AI Factory добрался до 1000 звёзд! Это мой самый быстрорастущий Open Source.
Для меня это не просто цифра. Это знак, что тема AI-разработки болит не только у меня.
Мы все видели этот сценарий: дал агенту задачу, он уверенно поехал, а потом ты полдня разбираешь, куда именно. Поэтому AI Factory родился как попытка сделать не prompt casino, а нормальный инженерный workflow: контекст, спеки, планы, проверки, документация, правила для агентов.
И самое крутое - проект уже давно не только про меня. В разработку влилось много сильных ребят, появились идеи, правки, обсуждения, и из этого постепенно вырос действительно полезный тул.
Спасибо всем, кто поставил звезду, помог кодом, issue, советом или просто поддержал.
Двигаемся дальше!
GitHub
GitHub - lee-to/ai-factory: You want to build with AI, but setting up the right context, prompts, and workflows takes time. AI…
You want to build with AI, but setting up the right context, prompts, and workflows takes time. AI Factory handles all of that so you can focus on what matters — shipping quality code. - lee-to/ai-...
❤7🔥6❤🔥4👍3🥰2🤩2😍2🎉1🙏1💯1
⚡️ Sonnet 5 вышел!
Что ж, Fable нам опять не завезли — пока смотрим Sonnet 5.
Ещё не успел нормально потестить его в кодинге, но есть ощущение, что тут может повториться старая история, когда младшая модель внезапно оказывается лучше Opus.
И да, мысль такая есть: Sonnet 5 вполне может оказаться сильнее Opus 4.8 — как это уже бывало раньше.
Кто уже попробовал — делитесь своим мнением в комментариях.
Что вам больше зашло: Sonnet 5 или Opus 4.8?
Что ж, Fable нам опять не завезли — пока смотрим Sonnet 5.
Ещё не успел нормально потестить его в кодинге, но есть ощущение, что тут может повториться старая история, когда младшая модель внезапно оказывается лучше Opus.
И да, мысль такая есть: Sonnet 5 вполне может оказаться сильнее Opus 4.8 — как это уже бывало раньше.
Кто уже попробовал — делитесь своим мнением в комментариях.
Что вам больше зашло: Sonnet 5 или Opus 4.8?
🎉5🥰4🔥3❤🔥2💯2❤1🤩1
Forwarded from Пыхник’26 — PHP на природе
От скучной генерации к инженерии с ИИ
ИИ быстро генерирует код, но без контекста, декомпозиции и проверок работа с агентами превращается в ожидание и бесконечные правки. В докладе поговорим об AI-разработке как об управляемом инженерном процессе.
Данил Щуцкий — backend-разработчик с опытом более 15 лет, автор Laravel-сообщества и YouTube-канала CutCode. Консультирует команды по архитектуре и высоконагруженным системам, развивает open source и инструменты для работы с ИИ.
На примере AI Factory и AI Workspace Данил покажет, зачем нужны отдельные этапы исследования, планирования, реализации и проверки — и как превратить работу с кодинг-агентами в повторяемый процесс с понятными правилами и контролем результата.
🌿 Присоединиться к Пыхнику
ИИ быстро генерирует код, но без контекста, декомпозиции и проверок работа с агентами превращается в ожидание и бесконечные правки. В докладе поговорим об AI-разработке как об управляемом инженерном процессе.
Данил Щуцкий — backend-разработчик с опытом более 15 лет, автор Laravel-сообщества и YouTube-канала CutCode. Консультирует команды по архитектуре и высоконагруженным системам, развивает open source и инструменты для работы с ИИ.
На примере AI Factory и AI Workspace Данил покажет, зачем нужны отдельные этапы исследования, планирования, реализации и проверки — и как превратить работу с кодинг-агентами в повторяемый процесс с понятными правилами и контролем результата.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍6🔥6🥰5❤🔥3💯3❤2🤩2😍2🎉1