Valentov Types Letters
168 subscribers
120 photos
14 videos
1 file
61 links
Про ИИ агентов и управление роевыми проектами.

https://arcanada.one — экосистема ИИ агентов
https://datarim.club — фреймворк управления проектами с ИИ агентами
Download Telegram
Codex VS Claude — мнение эксперта.

Я давно хотел сформулировать свои мысли про сравнение Claude Code и Codex.

Как вы знаете, я веду разработку своих продуктов через собственный фреймворк Datarim. Я почти не пишу код руками. Моя роль сейчас — оркестрировать, проектировать решения, ставить задачи, выстраивать архитектуру, DevOps, мониторинг, CI/CD, правила разработки, память агентов и весь контур инженерного производства.

У меня больше 25 лет опыта в IT и создании программных продуктов, поэтому мне оказалось посильно собрать собственный фреймворк SDLC — полного цикла разработки программных продуктов с участием автономных агентов. Но самое интересное, что теперь этот фреймворк во многом развивают уже сами агенты: находят инсайты, ошибки, улучшают skills, ужесточают правила, дописывают ограничения, прокачивают память и процессы.

Сейчас у меня есть максимальные подписки на Claude, Codex и Cursor на работе и личные. Поэтому у меня появилась возможность сравнивать не только модели, но и агентов, их поведение, интерфейсы, внутренний harness и качество работы на реальных задачах.
И вот что я думаю... полный текст ниже 👇
Все эти восторженные возгласы в соцсетях в стиле «эта модель победила ту», «этот агент уничтожил другого», «теперь всё изменилось» — я не разделяю.

На мой взгляд, это полный бред.

Потому что в реальной разработке важна не только модель. Важна связка:

модель + агент + harness + правила + память + ограничения + процесс.

После решения более полутора тысяч задач из backlog — от постановки до полной реализации, проверки, auto deploy и production — я всё-таки склоняюсь к тому, что Claude Code на текущий момент для меня лучше.

Claude Code — это очень классный агент. Удобный агент для разработчика. И, что важно, удобный агент для других агентов. Anthropic действительно хорошо поработали над дизайном, UX и общим ощущением работы.

Codex визуально тоже хорош. Возможно, кому-то его UI покажется даже интуитивнее. Я понимаю, что здесь есть вкусовщина: каждому подходит своё.

Но когда ты решаешь сотни задач одновременно и постоянно работаешь и там, и там, со временем становится намного понятнее, где агент устойчивее, где он чаще теряется, где лучше держит контекст, где быстрее ориентируется в задаче, а где начинает делать лишние круги.

И тут для меня разница уже не в интерфейсе.

Главное отличие — во внутреннем agent harness.

Мой внешний harness в обоих случаях одинаковый: DataRim, полный обвес правил, памяти, контроля, ограничений и сценариев. Но внутри самого агента тоже есть свой harness — его способность понимать задачу, держать цель, не терять контекст, не уходить в сторону, правильно восстанавливаться после ошибок и проходить задачу до конца.

И вот у Codex этот внутренний harness, на мой взгляд, пока работает хуже, чем у Claude Code.

Он чаще теряет память. Ему сложнее сориентироваться. За один проход он тратит больше итераций. Чаще делает лишние шаги. Чаще требует внешнего удержания в рамках задачи.

Claude Code в этом смысле пока стабильнее.

Но здесь есть важный момент.

Модели сами по себе не так важны, как кажется.

Да, мощные модели дают результат быстрее. Да, Opus, GPT-5.x, Fable и другие топовые модели могут быть очень сильными. Fable, например, по моим ощущениям, была на порядок сильнее всего, что я пробовал раньше. Но сейчас мы её временно потеряли, поэтому не будем об этом.

Главное другое.

Если у вас хорошо организован harness — правила, ограничения, память, процесс, контроль качества, повторные проходы, проверки, auto deploy, rollback, мониторинг, — то конкретная модель перестаёт быть критически важной.

У меня есть агенты, которые работают даже на DeepSeek Flash. И они тоже отлично справляются со своими задачами.

Да, они делают больше итераций. Да, чаще ошибаются. Да, им нужно больше подходов. Но хороший harness не даёт им уйти в сторону и всё равно доводит задачу до конца.

Поэтому мой вывод такой:

модель важна, но не первична.

Первичен инженерный контур вокруг агента.

Если у вас нет нормального harness, памяти, правил, ограничений и процесса, то даже самая сильная модель будет выглядеть как хаотичный junior-разработчик с амнезией.

Если же контур выстроен правильно, то даже более слабая модель может приносить стабильный результат.

Но если выбирать между Claude Code и Codex прямо сейчас, по моему опыту, после полутора тысяч реальных задач, Claude Code пока выигрывает.

Не потому что «Claude победил Codex».

А потому что в реальной агентной разработке Claude Code сейчас устойчивее, понятнее, лучше держит задачу и лучше работает внутри сложного инженерного процесса.

Но я не считаю эту ситуацию вечной.

Всё меняется очень быстро. Через месяц расклад может быть другим. Через полгода мы, возможно, будем сравнивать уже совсем другие уровни автономности.

А пока мой личный рейтинг такой:
- Claude Code — лучший агент для ежедневной разработки в сложном агентном контуре.
- Codex — сильный, перспективный, удобный, но пока менее устойчивый.
- Cursor — отличный инструмент, особенно если правильно встроить его в процесс, но это немного другая категория работы.

А главный победитель всё равно не модель.
Главный победитель — хороший harness.

Поделитесь своим опытом. Что у вас сейчас лучше работает: Claude Code, Codex, Cursor или что-то другое?
1
Пишут, что продлили опять эту Басню.
Как у вас, что пишет?
Нет уж, давайте отрубайте, как пообещали! Короче, еще пять дней дали
А да! Теперь и меня официально пригласили в клуб избранных =)

Только, что это за "Usage credits" ? 0_o
Media is too big
VIEW IN TELEGRAM
Cubrim. Или мечты сбываются с ИИ

🎲 Cubrim вышел на первые места в мировых бенчмарках по сжатию данных. Идея, которую я вынашивал со студенческих лет, наконец ожила.

Наряду с поиском и сортировкой сжатие — один из базовых столпов прикладных алгоритмов. Мне всегда казалось, что за существующими алгоритмами есть подходы сильнее и универсальнее.

Это «потом» наступило, когда пришли ИИ-агенты: не инструмент, а помощники, которые проверяют гипотезы, спорят, ищут ошибки. Так появился Cubrim.

Озвучка — в этом видео, полный текст ниже 👇
Valentov Types Letters
Cubrim. Или мечты сбываются с ИИ 🎲 Cubrim вышел на первые места в мировых бенчмарках по сжатию данных. Идея, которую я вынашивал со студенческих лет, наконец ожила. Наряду с поиском и сортировкой сжатие — один из базовых столпов прикладных алгоритмов. Мне…
Cubrim. Или мечты сбываются с ИИ

Вчера я засыпал не в лучшем состоянии — с тяжёлыми мыслями и сильной болью. А утром случилось сразу два чуда. Боль отступила (спасибо жене Виктории и моему дантисту Алине). И пришла новость совсем другого масштаба: Cubrim наконец вышел на первые места в мировых бенчмарках по сжатию данных.

Ещё студентом я был одержим идеей решить одну из фундаментальных задач прикладных алгоритмов — сжатие данных. Наряду с поиском и сортировкой это один из базовых столпов. Мне всегда казалось, что за существующими алгоритмами есть другие подходы — сильнее, красивее, универсальнее. Я думал об этом днями и ночами, но моей подготовки, вычислительных мощностей и помощников тогда не хватало. И я отложил эти идеи «на потом».

Это «потом» наступило, когда пришли ИИ-агенты. Не просто инструмент, а помощники, которые реализуют гипотезы, ищут ошибки, спорят, проводят эксперименты — делают то, на что одному человеку не хватило бы жизни. Так появился Cubrim — локальный архиватор данных в экосистеме Arcanada. Я нашёл три ведущих бенчмарка, воспроизвёл их на своём сервере и начал гонять Cubrim. Десятки агентов исследовали гипотезы — сейчас их уже больше восьмидесяти. Шаг за шагом: десятое место, девятое, восьмое, седьмое... И сегодня свежий рейтинг показал: Cubrim занял первое место в общем зачёте и первые-вторые места по большинству типов данных.

Главная идея шире локального архиватора — это глобальное сжатие и адресация данных, в том числе на космических расстояниях. Эту часть я развиваю вместе с дочерью Екатериной, инженером аэрокосмической техники. О ней — во второй статье цикла. Мечты действительно иногда сбываются: не всегда быстро, но если идея живая — она возвращается.

Читать статью полностью на arcanada.ai
🔥5
Как я поступаю, когда Codex/Claude обнулили недельные лимиты?

Как закрыть 100+ задач с помощью Datarim за 1-2 дня и получить только 1-3 вопроса от агентов.

Приоткрою завесу один раз...
В последние дни пошёл колоссальный расход средств на аккаунте Deepseek.

Где-то я перестарался с агентами мониторинга.
Media is too big
VIEW IN TELEGRAM
Собрать программу — только начало

Собрать бинарный файл недостаточно. Для desktop-приложения нужны пакеты под разные системы и архитектуры, подпись, установка и тесты, контрольные суммы, публикация и проверка всего пути глазами пользователя.

Cubrim сделал это видимым: программа весит всего 1,7–3,6 MiB, а её первый публичный релиз уже потребовал Linux, Windows, macOS Intel и Apple Silicon. Маленький бинарник — большой дистрибуционный контур. Полный текст и детали — следующим сообщением.
Valentov Types Letters
Собрать программу — только начало Собрать бинарный файл недостаточно. Для desktop-приложения нужны пакеты под разные системы и архитектуры, подпись, установка и тесты, контрольные суммы, публикация и проверка всего пути глазами пользователя. Cubrim сделал…
Собрать программу — только начало

Я думал, что в собственных программных продуктах самым сложным будут продажи, платежи и юридическая часть. Всё это действительно непросто. Но у desktop-приложения есть ещё одна большая задача, которую почти не видно до первого релиза: доставить программу пользователю.

Собрать бинарный файл недостаточно. Нужны подходящие пакеты для поддерживаемых систем и архитектур, подпись там, где она требуется, установка и тест на целевой среде, контрольные суммы, публикация и проверка всего пути глазами пользователя. Если что-то не работает, цикл начинается заново: исправление, сборка, тест, публикация.

Я прохожу этот путь с Cubrim. 10 июля вышла его первая публичная версия: Linux x86_64 и ARM64, Windows x86_64, macOS Intel и Apple Silicon, а также universal-архив для macOS. Размер пакетов — примерно от 1,7 до 3,6 MiB. Маленькая программа, но релизный контур у неё уже совсем не маленький.

С результатами тоже важно быть точным. В обновлённом world benchmark Cubrim занял первое место на файле x-ray и выиграл несколько специализированных сравнений. В общем зачёте опубликованной revalidation он пока пятый из восьми и опережает gzip на 19 из 24 файлов. Это сильный исследовательский результат, но не заявление «лучший для всего».

Теперь я хочу превратить накопленный процесс дистрибуции в повторяемый фреймворк: сборка, подпись, тест, публикация и обязательная проверка результата. Агенты должны не просто загрузить файл, а доказать, что пользователь получил именно нужный пакет и рабочую ссылку.

Статья на русском: https://arcanada.ai/ru/blog/software-publishing-complexity

Первая версия Cubrim: https://github.com/Arcanada-one/cubrim/releases/tag/v0.1.0-cubr0043
Новая для меня фраза "Нотаризация Apple"

Два дня был в отпуске и не был за компом.
В это воемя Кдод на сервере завис, и сделал только 68 задач из почти 200, которые я ему поручил. Хулиган!

Зато Apple одобрили мне сегодня публикацию моих приложений.
Почти 2 дня ждал. Но, видимо, так долго, потому что моя заявка выпала на выходные.

Теперь мои установочные пакеты Cubrim можно скачивать с сайта, и не переживать, что там какой-нибудь вирус.
С утра переходы по ссылкам телеграмм перестали работать.
Оказалось - все просто 😯
🔴 Домен t.me завис в serverHold - короткие ссылки Telegram по всему миру перестали открываться в браузере.

Это не блокировка на уровне провайдера или отдельной страны. .me - национальная доменная зона Черногории, которую технически администрирует регистратура Identity Digital. Именно на уровне регистратуры t.me получил статус serverHold - домен полностью исчезает из DNS, и браузер физически не может связать адрес с сервером, независимо от того, насколько корректно настроена инфраструктура самого Telegram.

Приложение - и мобильное, и десктопное - продолжает работать как обычно, оно не зависит от резолва t.me. А вот ссылки на каналы, юзернеймы и посты, которые расшариваются в браузере (t.me/username, t.me/channelname), сейчас никуда не ведут.

Ни Telegram, ни Identity Digital, ни власти Черногории пока не дали официальных комментариев о причине.

https://domainnamewire.com/2026/07/13/telegrams-t-me-domain-suspended-leading-to-outages/

#telegram@rvnikita_blog #dns@rvnikita_blog #internet@rvnikita_blog

—————————
Мысли Рвачева
—————————
Григорий Перельман. Свобода быть не как все.

Мы не любим, когда нам навязывают лидеров мнений и говорят, на кого нужно быть похожими.

Сегодня принято повторять: человек должен быть самим собой. И это правда.

Каждый из нас — отдельная личность, способная создать нечто невероятное. Нечто, чего раньше никто не делал. То, что сможет продвинуть человечество вперёд, уменьшить боль и страдания, победить голод, жажду, войны и раздор.

Но каким бы великим ни был дар человека, главным всё равно остаётся его выбор.

Свобода выбирать, как жить.
Кого любить.
Где быть.
В чём участвовать.
На что потратить свою жизнь.

Григорий Перельман не является для меня авторитетом во всём. Но в науке он — абсолютный авторитет.

Ему был дан редчайший математический дар, и он воспользовался им. Этот дар стал для него не только благословением, но и тяжёлым испытанием.

Для меня его история не столько о миллионе долларов, от которого он отказался. И не о мировой славе, которую он отверг.

Она о человеке, который выбрал свой путь и прошёл по нему до конца.

До полного погружения в проблему.
До отказа от привычного понимания успеха.
До почти полного исчезновения из мира, который требовал от него объяснений, интервью и публичности.

Он решил одну из величайших математических задач современности — и не позволил обществу решать за него, как теперь должна выглядеть его жизнь.

Можно спорить с его выбором. Можно не понимать его. Можно считать его странным.

Но невозможно не признать: это был его собственный выбор.

И, возможно, настоящая свобода начинается именно там, где человек перестаёт соответствовать чужим ожиданиям.
2
Media is too big
VIEW IN TELEGRAM
Cubrim-2: Глобальный Адресатор и общий язык для данных

Cubrim-1 уже стал работающим архиватором и занял первое место среди десяти участников открытого бенчмарка. Ближайший результат у PPMd: 0,2286 против 0,2227 у Cubrim, разница около 2,6%.

Cubrim-2 — совсем другая работа. Я исследую, можно ли заранее дать устройствам общую проверенную память, а затем передавать только адреса знакомых блоков и действительно новые данные. Не обещание «любого файла в нескольких байтах», а задача со стоимостью каталога, хранения, синхронизации и доставки.

Особенно интересно проверять эту идею для космической связи. Эту часть я развиваю вместе с дочерью Екатериной, аэрокосмическим инженером и соавтором идеи.

Полная озвучка статьи — в видео. Текст и ссылка — следующим постом.
Cubrim-2: Глобальный Адресатор и общий язык для данных

Cubrim-1 и Cubrim-2 — не две версии одного результата. Первый уже работает как архиватор: восстанавливает файлы побайтно и занимает первое место среди десяти участников открытого бенчмарка. Второй пока остаётся исследованием. Его вопрос звучит так: можно ли заранее дать устройствам общую проверенную память, а потом передавать не целые объекты, а ссылки на знакомые блоки и только действительно новые данные?

Сначала я проверил буквальную идею «хранить все возможные матрицы». Комбинаторика быстро её закрывает. Для блока длиной B бит существует 2^B вариантов. Даже склад из 20 000 дисков по 1 ТБ перестаёт справляться уже после 51 бита, а около 266 бит число вариантов достигает порядка 10^80 — оценки числа атомов в наблюдаемой Вселенной. Значит, хранить можно только то, что реально встретилось.

Следующий шаг был практическим. Я просканировал 13,48 ГБ данных с трёх серверов и сравнил четыре раскладки блоков по 4096 бит. В этом тесте меньше всего уникальных блоков дала 4D: 5,58 миллиона, или 2,66 ГиБ. Но важнее неприятный результат: насыщения не произошло, число новых блоков почти линейно росло до конца скана. Если механически перенести измеренную долю на мировой объём около 10 ЗБ, матрицам понадобится примерно 5,3–6,2 ЗБ. Это миллиарды терабайтных дисков, а не волшебный носитель для всех данных мира.

Поэтому реальный выигрыш Адресатора находится в повторениях. На измеренном корпусе повторялись 38–47% данных. Там, где общая основа действительно используется несколькими устройствами, каталог и ссылки могут окупиться уже на втором устройстве. Для строго уникальных личных данных экономии нет.

Космос делает эту задачу особенно конкретной. Память и энергия аппарата конечны, окна связи ограничены, повторная передача может стоить часов или дней. Эту часть я развиваю вместе с дочерью Екатериной, аэрокосмическим инженером и соавтором идеи. Она возвращает разговор от красивой структуры к вопросам миссии: какая версия уже на борту, что останется после обрыва, можно ли откатиться и восстановит ли аппарат целый объект без человека рядом.

Исследование уже прошло двадцать четыре гипотезы, но Cubrim-2 ещё не универсальный продукт. Для меня это правильное состояние проекта: мечта остаётся большой, а каждый следующий шаг должен выдержать измерение и попытку опровержения.

Читать статью полностью на arcanada.ai
Интерфейс админки Арканады пока оставляет желать лучшего.

Просто хотел показать сколько агентов одновременно работает над задачами в автономном режиме в TMUX сессиях с Клодом и Кодексом.

Эх. Пора отчитаться за 3й месяц Арканады.
Ушёл писать пост.
Сегодня запустил ещё один исследовательский проект "Регенератор Универсальных Матриц".

Но это вообще долгая история на десять лет вперед.
Пока только заложил основные гипотезы, и пробую их доказать.

Частых обновлений по проекту не ждите )

https://cubrim.com/ru/addressor/regeneration
Codex, выручай!

Еще 3 дня ждать разморозки клода.
Чем хорош кодекс, что они пока дают сбрасывать недельные лимиты.

Поэтому все агенты переключились на свободную подписку.

Продолжаю есть кактусы.
Всем хорошего дня!