Данил Щуцкий | CutCode AI
148 subscribers
10 photos
6 videos
99 links
Внедряю AI в бизнес-процессы без хаоса и бесполезных демо.
Инженерный подход:
процесс → данные → MVP → внедрение.
Малый и средний бизнес.
✉️ - @leeto_telegram
Download Telegram
Новый coding battle на CutCode

Новые модели пришли с красивыми фирменными бенчмарками, где они доминируют по всем показателям. Поэтому я взял нашего чемпиона GPT-5.5 против новичков - Gemini 3.5 Flash и Qwen 3.7 Max и отправил их не в синтетическую табличку со столбиками, а в реальную задачу: endpoints, PDF, ограничения по версиям, Postgres, Docker sandbox, performance и ревью качества кода.

На старте у каждой модели есть причина выглядеть фаворитом. В ролике есть дисквалификации, второй шанс и финал, который лучше не спойлерить:
https://www.youtube.com/watch?v=NaEoiWCOdGs
🤩9👍86🔥5🎉3
⚙️ Claude Opus 4.8 вышел с штукой, которая для продакшн-агентов важнее любой красивой цифры — теперь можно управлять effort

То есть модель можно просить работать легче или, наоборот, выкладываться по максимуму прямо внутри продукта. Без лишней обвязки вокруг промпта.

И это реально меняет практику.
Где задача простая — не жжёшь лишние ресурсы.
Где ошибка дорогая — включаешь тяжёлый режим.
Тут уже речь не про “умнее”, а про то, насколько модель можно нормально контролировать в бою.

В Claude Code ещё добавили dynamic workflows для очень больших задач. И вот это, пожалуй, самое прикладное в релизе: длинные цепочки шагов, инструменты, промежуточные решения, риск потерять контекст — всё то, где agentic-сценарии обычно и разваливаются.

Anthropic также пишет, что ранние тестеры считают Opus 4.8 более надёжным и более точным в agentic tasks.
А fast mode теперь работает в 2.5 раза быстрее и стоит в 3 раза дешевле, чем у прошлых моделей.

И вот это уже не косметика, а вполне практичный апдейт: такие вещи реально делают автоматизации дешевле и проще в проде.

Мой вывод: Opus 4.8 важен не самими бенчмарками, а тем, что делает агентные сценарии более предсказуемыми и менее дорогими. Но настоящая ценность раскроется только там, где уже есть нормальная обвязка, контроль шагов и процесс. Один промпт тут не спасёт.
9🎉9🔥5👍2🤩2
Forwarded from AI Community | CutCode
Вышел новый ролик про изменения в AI Factory и экосистеме 🚀
Разбираю AI Factory, AI Workspace, HLV, AIF Handoff, MCP Unit и AI Tester: аудит артефактов, дистилляцию материалов в скиллы, память между проектами, прогрев сессий и управляемый процесс AI-разработки.
Если vibe coding уже начал превращаться в хаос - показываю, куда двигаться дальше.

https://www.youtube.com/watch?v=uRb04AO_13Y
8🔥7🤩4🎉3👍2
На днях провел эксперимент с LLM.

Занимался реализацией задачи в проекте, где генерировать код LLM-кой запрещено. Сам проект абсолютно не готов для работы с ИИ, хотя глобально там есть общие универсальные скиллы по тестам, качеству кода, архитектуре и т.д. Они общие, но индивидуального контекста под проект нет.

Суть эксперимента была в том, что я со своими знаниями и экспертностью попробую дать на вход максимум контекста и в итоге оценю результат.

Контекст я готовил половину рабочего дня: делал референсы из ТЗ, собирал контекст из переписок, саммари из созвонов. Было подготовлено много артефактов.

Дальше я запустил генерацию и через 30 минут получил готовый код: покрытый тестами, полностью рабочий. Если отправить его в прод, никто даже не заметит подвоха. QA отчитается, что все кейсы выполнены и все гуд.

Но код LLM-кой писать запрещено, значит, прежде чем отправлять его на ревью, мне нужно было поревьювить его самому.

Что в итоге? Как вы думаете?

Я полностью его переписал. Начиная от структуры таблиц и заканчивая кодом.

Это был рабочий мусор.

Думаете, вывод такой: «ха-ха, LLM делает мусор»?

Нет.

Эксперимент на самом деле завершился так, как я и предполагал. ИИ — это просто инструмент. Качественный контекст по задаче даст рабочее решение, но он не выполнит все ваши внутренние соглашения сам по себе.

А вот чтобы все было так, как вы хотите, хотя бы приближенно, нужно потратить кучу времени на подготовку проекта к работе с LLM: выстроить harness, дать примеры того, как нужно писать, и постоянно их поддерживать.

Причем это нужно внедрять не только на уровне разработки. Аналитики тоже должны сразу готовить контекст по задаче в едином стиле, желательно в кооперации с LLM, чтобы на вход уже попадал нормальный сформированный инпут, а не набор разрозненных сообщений, созвонов и догадок.

То есть задача должна приходить не в формате «ну там в переписке все есть», а в виде готового артефакта: что делаем, зачем, какие ограничения, какие кейсы, какие спорные места, какие примеры, какие связи с текущей системой.

А дополнительную информацию модель уже должна получать через внутренний MCP: документацию, схемы, соглашения, примеры кода, контракты, историю решений и все остальное, что нужно для нормального погружения в проект.

В моей ситуации нужно было бы вложить очень много времени именно в подготовку контекста по кодовой части. И этот процесс был бы бесконечным: столкнулись с непредсказуемым поведением — дополняем инструкции, улучшаем слой валидации, добавляем новые проверки.

Все это невозможно без смены мышления у всей команды.

Каждый должен держать систему в тонусе, чтобы через какое-то время получить буст и постоянно его наращивать.

Разработчикам в найме заниматься этим в свободное время, скорее всего, не особо захочется. А бизнес в большинстве случаев вряд ли выделит под это отдельные ресурсы.

Пока как-то так.

P.s. Манифест "AI Native - Новая культура мышления" уже доступен - https://ai-native.cutcode.dev
11👍3🔥1🎉1🤩1
⚡️ Anthropic открыла доступ к Claude Fable 5
Это первая публичная модель нового класса Mythos - уровня выше Opus по возможностям.
Fable 5 и закрытая Mythos 5 построены на одной базовой модели. Разница в ограничениях: чувствительные запросы по кибербезопасности, биологии, химии и distillation-трафик в Fable 5 перенаправляются к Opus 4.8.
Модель стоит $10 за миллион входных токенов и $50 за миллион выходных - меньше половины цены Mythos Preview. До 22 июня Fable 5 доступна на тарифах Pro, Max, Team и Enterprise, потом потребуются usage credits.
Интересно, что Anthropic отдельно позиционирует Mythos-класс не как обычный апдейт Claude, а как новый верхний уровень для сложной интеллектуальной работы и кодинга.
Ссылки:
Релиз Fable 5 и Mythos 5
Project Glasswing
🔥5🎉3😁2🤩2
Есть популярный инструмент для AI-разработки — CodeGraph. Он обещает уменьшение потребления токенов (35%), меньше tool calls, быстрые ответы и лучшее понимание кодовой базы.

Звучит как must-have, поэтому я решил проверить его в деле.

Прогнал CodeGraph через AI Tester на двух сценариях: простой задаче и проекте покрупнее. А потом добавил длительное исследование от Ичи, разработчика из нашего комьюнити: 300+ тестов и 150 парных сравнений rg против CodeGraph.

И вот тут стало интересно. Смотрите в новом видео разбор CodeGraph:
https://youtu.be/4W7V4gj_jC8
🔥9❤‍🔥4🎉3👍2🤩2😍2💯21🥰1
AI-разработку часто подают как один сценарий: подключил модель, добавил MCP, дал агенту задачу — и команда ускорилась. Но на практике есть минимум три разных подхода: контекстная фабрика, разработка на стероидах и vibe coding, он же prompt casino. В новом ролике разбираю, почему их опасно путать, почему AI не отменяет разработчиков и почему сотни тулов не делают человека AI-native: https://www.youtube.com/watch?v=N_-GFgesQGk
5🤩3🔥2🥰2🎉2😍2💯2👍1❤‍🔥1
1000 звёзд у AI Factory. Вот это поворот.

Честно говоря, я пару раз обновил GitHub, просто проверить - точно ли это происходит с моим проектом.
AI Factory добрался до 1000 звёзд! Это мой самый быстрорастущий Open Source.

Для меня это не просто цифра. Это знак, что тема AI-разработки болит не только у меня.
Мы все видели этот сценарий: дал агенту задачу, он уверенно поехал, а потом ты полдня разбираешь, куда именно. Поэтому AI Factory родился как попытка сделать не prompt casino, а нормальный инженерный workflow: контекст, спеки, планы, проверки, документация, правила для агентов.
И самое крутое - проект уже давно не только про меня. В разработку влилось много сильных ребят, появились идеи, правки, обсуждения, и из этого постепенно вырос действительно полезный тул.
Спасибо всем, кто поставил звезду, помог кодом, issue, советом или просто поддержал.
Двигаемся дальше!
7🔥6❤‍🔥4👍3🥰2🤩2😍2🎉1🙏1💯1
⚡️ Sonnet 5 вышел!

Что ж, Fable нам опять не завезли — пока смотрим Sonnet 5.

Ещё не успел нормально потестить его в кодинге, но есть ощущение, что тут может повториться старая история, когда младшая модель внезапно оказывается лучше Opus.
И да, мысль такая есть: Sonnet 5 вполне может оказаться сильнее Opus 4.8 — как это уже бывало раньше.

Кто уже попробовал — делитесь своим мнением в комментариях.
Что вам больше зашло: Sonnet 5 или Opus 4.8?
🎉5🥰4🔥3❤‍🔥2💯21🤩1
От скучной генерации к инженерии с ИИ

ИИ быстро генерирует код, но без контекста, декомпозиции и проверок работа с агентами превращается в ожидание и бесконечные правки. В докладе поговорим об AI-разработке как об управляемом инженерном процессе.

Данил Щуцкий — backend-разработчик с опытом более 15 лет, автор Laravel-сообщества и YouTube-канала CutCode. Консультирует команды по архитектуре и высоконагруженным системам, развивает open source и инструменты для работы с ИИ.

На примере AI Factory и AI Workspace Данил покажет, зачем нужны отдельные этапы исследования, планирования, реализации и проверки — и как превратить работу с кодинг-агентами в повторяемый процесс с понятными правилами и контролем результата.

🌿 Присоединиться к Пыхнику
Please open Telegram to view this post
VIEW IN TELEGRAM
👍6🔥6🥰5❤‍🔥3💯32🤩2😍2🎉1
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥85🎉5💯3👍2🤩2❤‍🔥1🥰1😍1
⚡️ Google выкатили Gemini 3.7 Flash

И это уже не просто быстрый чат, а вполне рабочая модель для агентов и production-сценариев.

Самое интересное: Google называет её своей самой умной workhorse-моделью для coding и agents.
И это не пустой анонс — у модели уже есть file search, function calling, search grounding, structured outputs и thinking.

По бенчмаркам Flash тоже выглядит сильно:

• в кодинге она примерно на уровне GPT-5.6 Terra
• и чуть лучше Sonnet 5
• на FrontierCode даже обходит обе модели

Плюс цена приятная:
$0.75 / $3.75 за миллион токенов на input/output.
Это заметно дешевле Sonnet 5 и Terra.

И ещё: у неё 1M контекста (ну этим уже не удивишь).

Итог: Google снова делает Flash не эффектнее, а практичнее. А это для реального применения важнее всего.
4🔥3💯3🤩2😍2🥰1❤‍🔥1
Тестирую локальную Qwen 3.8 и нашёл интересный артефакт

При анализе изображения Qwen ответила: «К сожалению, текущая модель (grok-4.5) не поддерживает анализ картинок».

Видимо какие-то вещи уже поручает другим моделькам.
😁6🔥4😍32🎉2👍1🤩1❤‍🔥1💯1
This media is not supported in your browser
VIEW IN TELEGRAM
🧩 Cursor запустил Origin — свой сервис для хранения кода и работы с PR.

Смысл Origin не в том, чтобы просто сделать ещё один GitHub.

Сейчас схема обычно такая: Cursor помогает писать код, а репозиторий, PR, проверки и ревью живут в GitHub.

Origin пытается собрать это в одном месте: код хранится в Cursor, агент может внести изменения, создать ветку, открыть PR, а разработчик — посмотреть изменения и провести ревью там же.

GitHub при этом пока никуда не исчезает. Его можно подключить к Origin, а данные будут синхронизироваться. Для старых репозиториев GitHub остаётся главным источником данных.

То есть главная польза Origin — меньше переключений между Cursor и GitHub и более удобная работа с AI-агентами.

Пока большинству команд он вряд ли нужен вместо GitHub. Но направление понятное: Cursor хочет контролировать не только написание кода, а весь путь от задачи до готового PR.

Как думаете, сможет Cursor со временем забрать у GitHub сам рабочий процесс разработки?

👉 @CutCode_AI
⚡️ В OpenCode и OpenRouter появилась загадочная Ox Alpha — и она неожиданно сильна в кодинге

Контекст — 1 млн токенов, есть мультимодальность, reasoning и работа с инструментами.
На небольшой выборке из 10 задач DeepSWE она набрала 80%, обогнав Fable 5, GLM-5.3, Grok 4.6 и GPT-5.6 Sol.
Прогон: https://x.com/davis7/status/2090655207831298095

Выборка маленькая, поэтому выводы делать рано. Но интереснее другое: по токенизатору, reasoning API и обработке видео Ox Alpha очень похожа на модели Z.ai / GLM.
Так что вполне возможно, перед нами новая ещё не анонсированная новая модель GLM.
До 27 августа OpenCode обещает почти безлимитный бесплатный доступ:
https://x.com/opencode/status/2090544355824038300

Самое время погонять на реальных репозиториях.
Кто уже пробовал?
4❤‍🔥4💯4👍3🔥3🎉2😍2
Media is too big
VIEW IN TELEGRAM
Решил всё-таки закинуть неизданный ролик про бизнес, построенный на AI😄

Почему неизданный?
Я скидывал его нескольким людям — никто не засмеялся.

В общем, теперь ваша очередь. Возможно, проблема была в людях. Или всё-таки в ролике 😁
😁13❤‍🔥6🔥4😍3🎉21👍1🤩1💩1💯1🤣1
Media is too big
VIEW IN TELEGRAM
Пыхник’26 — 2 октября расскажу про осознанное использование AI.

Скидка 15% по промокоду CUTCODE-26!

👉 Программа и билеты
🤩7👍6🥰4😍3❤‍🔥3🔥21🎉1💯1
Media is too big
VIEW IN TELEGRAM
Но все еще скидка 15% по промокоду CUTCODE-26!
🔥42👍2😍2❤‍🔥2🎉1🤩1💯1