Если пропустили: недавно в Claude Code изменили работу команды 🇨🇳
Теперь она копирует текущую сессию в новый фоновый сеанс, а вы можете продолжать работу в текущем.
Прежнее поведение — запуск субагента внутри той же сессии с последующим возвратом результата — теперь доступно через команду
v2.1.212+
/fork. Теперь она копирует текущую сессию в новый фоновый сеанс, а вы можете продолжать работу в текущем.
Прежнее поведение — запуск субагента внутри той же сессии с последующим возвратом результата — теперь доступно через команду
/subtask.v2.1.212+
Please open Telegram to view this post
VIEW IN TELEGRAM
Для следующего поколения моделей одного ноутбука уже будет недостаточно.
Tibo из OpenAI написал, что по результатам последних тестов Codex уже сейчас можно считать отличной обвязкой для работы с ИИ-моделями.
Но, по его мнению, уже через 2–3 месяца он будет казаться довольно примитивным. Нас ждёт очередной крупный скачок в том, как мы взаимодействуем с фронтир моделями.
Тем временем, OpenAI купила Ona, чтобы перенести Codex с локальных машин в защищённые постоянные облачные окружения. В анонсе это прямо называют «следующим этапом Codex» и пишут, что агенты смогут продолжать работу даже после того, как вы закроете ноутбук. Сам Тибо тоже цитируется в этом анонсе.
Ещё одна любопытная деталь - это вакансия, которую OpenAI открыла совсем недавно: Software Engineer, Cloud Agents.
Команда строит инфраструктуру для долгоживущих агентов: оркестрацию, песочницы, хранилище, идентификацию, наблюдаемость и контроль расходов. В описании вакансии сказано, что инженеры будут создавать системы для «оркестрации агентов в масштабе» внутри Codex, ChatGPT и API.
Если сложить всё это вместе, напрашивается такая гипотеза: следующий этап это не просто более мощная модель, а модель, способная самостоятельно развернуть инфраструктуру, необходимую для выполнения задачи.
Отдельные компьютеры. Отдельные агенты. Общая память. Инструменты. Разрешения. Дни непрерывной работы.
В таком сценарии ноутбук становится скорее пультом управления, чем местом, где выполняется вся работа.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
2
This media is not supported in your browser
VIEW IN TELEGRAM
Совет по вайбкодингу: подключите GitHub к своему ИИ-агенту и не просите сразу писать код. Это заметно сократит расход токенов.
Новички начинают с запроса вроде: «Напиши мне приложение, которое принесёт $100000, не допускай ошибок». Но гораздо эффективнее сначала дать агенту изучить существующие опенсорс-проекты.
Промпт:
Так агент сначала:
> Найдёт решения, проверенные реальными проектами.
> Разберёт ошибки и компромиссы, с которыми уже столкнулись другие разработчики.
> Подберёт стек и архитектуру под ваши требования.
И только после этого начнёт писать код. Обычно такой подход позволяет избежать множества лишних итераций и заметно сократить расход токенов.👌
Новички начинают с запроса вроде: «Напиши мне приложение, которое принесёт $100000, не допускай ошибок». Но гораздо эффективнее сначала дать агенту изучить существующие опенсорс-проекты.
Промпт:
«Я разрабатываю XXX. Пока не создавай файлы и не пиши код. Сначала найди похожие open source-проекты на GitHub и выбери самые полезные в качестве референсов. Проанализируй, какие задачи они решают, какую архитектуру используют, на каких технологиях построены, поддерживаются ли сейчас и какие решения стоит повторить или, наоборот, избежать. Затем, исходя из моих требований, предложи стек технологий, архитектуру системы, границы MVP и последовательность разработки. Только после моего подтверждения переходи к реализации.»
Так агент сначала:
> Найдёт решения, проверенные реальными проектами.
> Разберёт ошибки и компромиссы, с которыми уже столкнулись другие разработчики.
> Подберёт стек и архитектуру под ваши требования.
И только после этого начнёт писать код. Обычно такой подход позволяет избежать множества лишних итераций и заметно сократить расход токенов.
Please open Telegram to view this post
VIEW IN TELEGRAM
1
This media is not supported in your browser
VIEW IN TELEGRAM
Qwen 3.8 Max действительно впечатляет.
Модели Qwen 3.8 Max, Claude Opus 5, Kimi K3 и GPT-5.6 Sol получили одну и ту же фотографию неба с просьбой нарисовать силуэт животного по форме облаков.
По этому тесту Qwen 3.8 Max выглядел ничуть не хуже остальных моделей.
А вот GPT, похоже, разглядел в облаках что-то своё.😄
Модели Qwen 3.8 Max, Claude Opus 5, Kimi K3 и GPT-5.6 Sol получили одну и ту же фотографию неба с просьбой нарисовать силуэт животного по форме облаков.
По этому тесту Qwen 3.8 Max выглядел ничуть не хуже остальных моделей.
А вот GPT, похоже, разглядел в облаках что-то своё.
Please open Telegram to view this post
VIEW IN TELEGRAM
2
Forwarded from Айти мемы
This media is not supported in your browser
VIEW IN TELEGRAM
Ежедневная рутина с Claude
Модель или обвязка?
Если вы разрабатываете ИИ-агентов для продакшена, эту статью стоит сохранить.
Авторы собрали 41 типичный сценарий отказа и классифицировали их по тому, на стыке каких компонентов возникает проблема. Каждая ошибка привязывается к взаимодействию между моделью, обвязкой, пользователем, инструментами, памятью или окружением, а также указывает, на какой стороне находится причина и где её нужно исправлять.
Это хорошо отражает реальную картину: большинство проблем ИИ-агентов возникает не в самой модели, а на стыке модели и окружающей её инфраструктуры.
Подход также подходит для автоматического анализа. В тестах на четырёх передовых моделях лучший ИИ-судья достиг коэффициента согласия Коэна 0,76 по сравнению с ручной разметкой. Это позволяет автоматически классифицировать ошибки прямо в продакшене, а не разбирать их вручную после каждого инцидента.
В этом году инженерия обвязки стала одним из главных факторов качества ИИ-агентов, но общего языка для разделения ошибок модели и ошибок обвязки до сих пор не было. Эта работа как раз предлагает такую систему.
Статья: https://arxiv.org/abs/2607.28802
Если вы разрабатываете ИИ-агентов для продакшена, эту статью стоит сохранить.
Авторы собрали 41 типичный сценарий отказа и классифицировали их по тому, на стыке каких компонентов возникает проблема. Каждая ошибка привязывается к взаимодействию между моделью, обвязкой, пользователем, инструментами, памятью или окружением, а также указывает, на какой стороне находится причина и где её нужно исправлять.
Это хорошо отражает реальную картину: большинство проблем ИИ-агентов возникает не в самой модели, а на стыке модели и окружающей её инфраструктуры.
Подход также подходит для автоматического анализа. В тестах на четырёх передовых моделях лучший ИИ-судья достиг коэффициента согласия Коэна 0,76 по сравнению с ручной разметкой. Это позволяет автоматически классифицировать ошибки прямо в продакшене, а не разбирать их вручную после каждого инцидента.
В этом году инженерия обвязки стала одним из главных факторов качества ИИ-агентов, но общего языка для разделения ошибок модели и ошибок обвязки до сих пор не было. Эта работа как раз предлагает такую систему.
Статья: https://arxiv.org/abs/2607.28802
5
Совет по вайбкодингу: попросите Codex создать интерактивную карту вашего репозитория, а затем отмечать, какие модули изменились с момента её генерации.
Нажав на любой модуль, можно увидеть его вызывающие компоненты, зависимости, основные потоки выполнения, связанные тесты и подтверждающие данные из исходного кода.
Он создаёт:
→
→
→
Полный промпт ↓
Ещё один момент. Добавьте правило в
Нажав на любой модуль, можно увидеть его вызывающие компоненты, зависимости, основные потоки выполнения, связанные тесты и подтверждающие данные из исходного кода.
Он создаёт:
→
docs/codemap/codemap.html→
docs/codemap/codemap.json→
docs/codemap/codemap.lockПолный промпт ↓
Analyze the current codebase. Do not modify product code. Only create or update files under docs/codemap/.
Ignore vendor, build, dist, cache, and other generated directories.
If docs/codemap/ already exists, first compare the existing codemap.lock with the current repo and list the modules that changed. Then regenerate these three files together:
1. docs/codemap/codemap.html
Build a fully self-contained interactive code map that opens directly in a browser. Include:
- major modules, services, databases, queues, and external dependencies
- no more than 20 primary nodes; group low-level files under their parent module
- calls and data flows between modules
- the 3-5 most important end-to-end flows
- a clear dark theme by default
- system boundaries and the most important data flows visible on the first screen
- color-coded module types with a simple legend
- automatic layout that minimizes crossing edges
- clicking any module highlights its upstream callers, downstream dependencies, related tests, and the flows it belongs to
- selecting a flow highlights its complete path
- search, filtering, zoom, and drag controls
At the top, show the repo name, generation time, and the commit it was generated from.
2. docs/codemap/codemap.json
Use this structure:
{
"generated_at": "",
"generated_from_commit": "",
"scope": [],
"nodes": [],
"edges": [],
"flows": []
}
Each node must include:
- id
- path
- role
- entrypoints
- tests
- constraints
- evidence
Each edge must include:
- from
- to
- type
- evidence
type may only be:
- imports
- calls
- reads
- writes
- publishes
- subscribes
Each flow must include:
- trigger
- steps
- outcome
Every step must reference an existing node id.
Attach the matching source path and symbol to every node and edge. Mark any relationship without source evidence as unknown. Do not guess.
3. docs/codemap/codemap.lock
Use parseable JSON to record:
- the current commit
- whether the working tree has uncommitted changes
- generation time
- scanned scope
- excluded directories
- the fingerprint algorithm
- a deterministic fingerprint for each top-level module, calculated from its tracked file paths and current file contents
If no existing codemap.lock is found, treat every module as new and generate the full map.
When finished, verify that:
- codemap.json parses successfully
- every node path exists and every evidence symbol can be found in the source
- every edge and flow step references an existing node
- codemap.html and codemap.json use the same nodes, edges, and flows
- codemap.lock matches the current commit, working tree state, and module fingerprints
- every relationship without source evidence is marked unknown
These three files must always be generated together from the current repo. Never edit only one of them manually.
Finally, show:
- files created or modified
- stale modules
- remaining unknowns
- validation results
- the complete diff
Ещё один момент. Добавьте правило в
AGENTS.md, чтобы карта кода всегда оставалась синхронизированной с репозиторием:At the start of every code-changing task, compare the current repo with docs/codemap/codemap.lock.
Before modifying a module, use docs/codemap/codemap.json to answer three questions:
1. What calls it?
2. What does it affect?
3. Which tests cover it?
If the map is stale or cannot answer those questions, regenerate codemap.html, codemap.json, and codemap.lock before changing the code.
Whenever module boundaries, dependencies, routes, databases, queues, or major data flows change, update the code map in the same commit as the code.
3
Вычисления для ИИ скоро отправятся на орбиту.
NVIDIA и SpaceX официально объединяются для создания космического дата-центра.
В рамках проекта спутник Starmind AI1 получит вычислительный модуль на базе NVIDIA Vera Rubin NVL72.
Он будет использовать солнечную энергию для работы ИИ-инфраструктуры на орбите, обеспечивая высокопроизводительные вычисления с передачей результатов на Землю.🚀
NVIDIA и SpaceX официально объединяются для создания космического дата-центра.
В рамках проекта спутник Starmind AI1 получит вычислительный модуль на базе NVIDIA Vera Rubin NVL72.
Он будет использовать солнечную энергию для работы ИИ-инфраструктуры на орбите, обеспечивая высокопроизводительные вычисления с передачей результатов на Землю.
Please open Telegram to view this post
VIEW IN TELEGRAM
3
This media is not supported in your browser
VIEW IN TELEGRAM
Firecrawl запустил anydoc — их новый движок для парсинга документов на Rust
Он конвертирует PDF, Word-документы, презентации и ещё 10 форматов в Markdown менее чем за 5 мс, сохраняя одно из лучших качеств обработки в индустрии.
100% опенсорс
Он конвертирует PDF, Word-документы, презентации и ещё 10 форматов в Markdown менее чем за 5 мс, сохраняя одно из лучших качеств обработки в индустрии.
100% опенсорс
7
Please open Telegram to view this post
VIEW IN TELEGRAM
COMEBACK: Meta выпустили Muse Spark 1.2 и собственную IDE Muse Code в бета-версии. 🍗
Это быстрое обновление после Muse Spark 1.1, вышедшей всего несколько недель назад. Новая версия получила больше фокуса на задачах программирования и новый harness.
В тестах модель показала заметный рост в Terminal Bench, DeepSWE и внутренних бенчмарках. В агентных сценариях улучшились результаты в GDPVal и MCP Atlas.
В DeepSWE 1.1 Muse Spark 1.2 набрала 59%, обойдя Grok Build 4.5 и Gemini 3.6 Flash.
При этом цена остаётся крайне низкой. Если готовы немного поделиться данными с Цукербергом ради «улучшения продуктов Meta» — Spark 1.2 можно получить почти даром: $0,10 за 1 млн входных токенов и $0,20 за 1 млн выходных.
Это быстрое обновление после Muse Spark 1.1, вышедшей всего несколько недель назад. Новая версия получила больше фокуса на задачах программирования и новый harness.
В тестах модель показала заметный рост в Terminal Bench, DeepSWE и внутренних бенчмарках. В агентных сценариях улучшились результаты в GDPVal и MCP Atlas.
В DeepSWE 1.1 Muse Spark 1.2 набрала 59%, обойдя Grok Build 4.5 и Gemini 3.6 Flash.
При этом цена остаётся крайне низкой. Если готовы немного поделиться данными с Цукербергом ради «улучшения продуктов Meta» — Spark 1.2 можно получить почти даром: $0,10 за 1 млн входных токенов и $0,20 за 1 млн выходных.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Очень интересный релиз: Prime Intellect запустили Prime Agent — обвязку, которая превращает долгие автономные сессии ИИ в отдельную задачу программирования.
Его единственный инструмент — постоянное IPython-ядро. Модель может программно искать по своей истории, вызывать инструменты, запускать постоянных субагентов и хранить полезное состояние вне активного контекста.
Prime Intellect описывают это так:
В основе лежат три идеи:
— программный вызов инструментов через RLM;
— постоянная работа нескольких субагентов;
— самоизменяемый harness, который позволяет агенту обновлять собственную память, навыки и настройки.
Они сообщают о заметном приросте результатов на задачах с длинным контекстом и долгим горизонтом. На ARC-AGI-3 Opus 5 в стандартной конфигурации набрал 30,2%, а с Prime Agent результат вырос до 95,5%, превысив заявленный хуман эксперт базлайн — 95,4%.
Также на предварительном бенчмарке он с нуля создал рабочие эмуляторы SEGA Genesis и Game Boy Color на Rust :D
опенсорс🥰
Его единственный инструмент — постоянное IPython-ядро. Модель может программно искать по своей истории, вызывать инструменты, запускать постоянных субагентов и хранить полезное состояние вне активного контекста.
Prime Intellect описывают это так:
«RLM рассматривает контекст как переменную, а делегирование субагентам — как вызовы функций внутри REPL».
В основе лежат три идеи:
— программный вызов инструментов через RLM;
— постоянная работа нескольких субагентов;
— самоизменяемый harness, который позволяет агенту обновлять собственную память, навыки и настройки.
Они сообщают о заметном приросте результатов на задачах с длинным контекстом и долгим горизонтом. На ARC-AGI-3 Opus 5 в стандартной конфигурации набрал 30,2%, а с Prime Agent результат вырос до 95,5%, превысив заявленный хуман эксперт базлайн — 95,4%.
Также на предварительном бенчмарке он с нуля создал рабочие эмуляторы SEGA Genesis и Game Boy Color на Rust :D
опенсорс
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Совет: используйте Codex, Claude Code или другого ИИ-агента, чтобы быстро найти, что занимает место на диске.
Если хранилище переполнено и непонятно, куда исчезло свободное место, просто попросите Codex просканировать систему.
Промпт:
Codex найдёт самые объёмные файлы, объяснит, что это такое, и покажет, что можно удалить без риска, а что лучше сначала проверить. Это гораздо быстрее, чем вручную искать всё по папкам и переживать, что случайно удалишь что-то важное.😓
Если хранилище переполнено и непонятно, куда исчезло свободное место, просто попросите Codex просканировать систему.
Промпт:
«Просканируй систему и найди, что занимает место на диске. Найди крупные файлы, старые установщики, неиспользуемые приложения, папки с кэшем, заброшенные проекты и всё, что можно безопасно очистить. Сгруппируй результаты по категориям с указанием размера и отметь, что можно удалить автоматически, а что требует моей проверки. Пока ничего не удаляй — только покажи список».
Codex найдёт самые объёмные файлы, объяснит, что это такое, и покажет, что можно удалить без риска, а что лучше сначала проверить. Это гораздо быстрее, чем вручную искать всё по папкам и переживать, что случайно удалишь что-то важное.
Please open Telegram to view this post
VIEW IN TELEGRAM
Плохие новости: на странице API DeepSeek написано, что в ближайшее время стоимость использования API DeepSeek значительно вырастет.
Самое время выжать максимум из Flash, пока он не подорожал.👀
Самое время выжать максимум из Flash, пока он не подорожал.
Please open Telegram to view this post
VIEW IN TELEGRAM
Похоже, OpenAI работают над функцией, которая позволит покупать сброс лимитов запросов для Codex.
На это указывают находки в публичной конфигурации страницы оплаты и ресурсах веб-приложения ChatGPT.
Теперь ясно, почему Tibo не сбрасывает нам лимиты.🙂
На это указывают находки в публичной конфигурации страницы оплаты и ресурсах веб-приложения ChatGPT.
Теперь ясно, почему Tibo не сбрасывает нам лимиты.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM