Max Syabro and a Slop Driven Development
818 subscribers
490 photos
49 videos
10 files
396 links
@syabro_chats в роли акына: что вижу то пою.
- Запускаю presync.io
- Web, tech, management.
Download Telegram
https://www.alibabacloud.com/campaign/ai-scene-coding?referral_code=A92LL7

Алибаба выкатила свой кодплан
Lite $10 и PRO $50

Заявлено
- qwen3.5-plus
- kimi-k2.5
- glm-5
- MiniMax-M2.5

Выглядит как идеальная подписка для агентов

PS Ссылка реферальная, мне $10 на кофе
https://xcancel.com/theflow0/status/2030011206040256841

Кажется Игорь больше не тонет
👍2
This media is not supported in your browser
VIEW IN TELEGRAM
Rust Dos Navigator

https://github.com/apatrushev/rdn

*утер старческую слезу рукавом*
2👍2
https://arxiv.org/abs/2512.08296

Google Research + MIT выкатили paper на 180 экспериментов, где методично разобрали, когда мультиагентные системы работают, а когда всё становится хуже.

ТЛДР: “More agents is all you need” — не работает.
Разброс от +80.9% до −70% в зависимости от задачи и архитектуры.

Три семейства моделей (OpenAI, Google, Anthropic), четыре бенчмарка, пять архитектур. Controlled evaluation — одинаковые промпты, тулы, бюджеты токенов. Меняется только координация.

Пять архитектур: Single-agent — одна модель, один цикл рассуждения. Independent — несколько агентов работают параллельно без общения, результаты склеиваются в конце. Decentralized — агенты общаются друг с другом напрямую, приходят к консенсусу через раунды дебатов. Centralized — есть оркестратор, который раздаёт подзадачи сабагентам и собирает результат. Hybrid — оркестратор + агенты ещё и между собой общаются.

Где мультиагенты тащат. Finance Agent — задачи с параллельной декомпозицией. Один агент копает SEC filings, другой — новости, третий — операционный анализ. Centralized MAS даёт +80.8% к single-agent. Задача сама напрашивается на разделение.

Где всё ломается. PlanCraft — последовательное планирование в Minecraft. Каждое действие зависит от предыдущего состояния. Любая мультиагентная архитектура деградирует: от −39% (Hybrid) до −70% (Independent). Координация жрёт токены, которые нужны на рассуждение. Агенты начинают делить задачу, которую делить нельзя — один «исследует рецепт», другой «проверяет инвентарь», третий крафтит. Три шага вместо одного, плюс overhead на общение между ними.

Scaling law дала три закономерности. Чем больше тулов у задачи, тем сильнее мультиагентный overhead бьёт по перформансу. В Workbench, где задачи используют по 16 тулов, эффективность Hybrid проседает в 6 раз относительно single-agent. Дальше — потолок отдачи. Если single-agent уже даёт выше ~45%, добавление агентов даёт отрицательный возврат. Координация стоит дороже, чем потенциальный прирост. И усиление ошибок зависит от топологии. Independent агенты усиливают ошибки в 17.2× — нет механизма коррекции, каждый варится в своём контексте. Centralized сдерживает до 4.4× за счёт оркестратора-валидатора.
Про деньги. Single-agent — 67.7 success/1K tokens. Centralized — 21.5. Hybrid — 13.6. Расход токенов в пять раз выше, а результат тот же или хуже.

Авторы вывели формулу, которая по количеству тулов, базовой точности и декомпозируемости задачи предсказывает оптимальную архитектуру с точностью 87% на новых конфигурациях. Валидировали на GPT-5.2, который вышел после исследования — четыре из пяти принципов подтвердились.

Если задача последовательная и single-agent уже даёт >45% — мультиагенты скорее всего сделают хуже. Если параллелизуема и baseline низкий — Centralized или Decentralized дадут прирост. Decentralized лучше для exploration (web navigation: +9.2%), Centralized — для structured reasoning (finance: +80.8%).

Ещё интересное: в decentralized архитектурах команды из слабых и сильных моделей работают на уровне или лучше однородных из сильных. У Anthropic в centralized архитектуре слабый оркестратор + сильные сабагенты даёт +31% относительно полностью сильной команды.
👍8
Forwarded from Oleg Puzanov
codex_system_prompt.md
23 KB
Сегдоня немного прилег codex. Пока трейсил его чтоб понять в чем проблема заметил что с их сервера приходит системный промпт. Расшифровал его и можно глянуть как они описывают персону, поведение, как тулы вызывают. Возможно кому пригодиться кто своих агентов пилит.
6👍2
Amazon собрала инженеров на обязательный разбор серии инцидентов. Внутренний документ описывает волну крупных сбоев, вызванных правками через GenAI. Официальная позиция — «part of normal business».

Четыре Sev-1 за одну неделю. 5 марта сайт и приложение Amazon лежали ~6 часов — оформление заказов не работало, цены не показывались. В декабре Kiro (kiro.dev), которому поручили внести правки в AWS Cost Explorer, решил снести и пересоздать окружение целиком. Восстановление заняло 13 часов. Amazon назвал это «extremely limited event» — сервис при этом обслуживал клиентов в материковом Китае.

Джунам и миддлам теперь нужен аппрув синьора на любые правки, сделанные с помощью AI. Эти ограничения вводят поверх системы, в которой уже крутятся 21 000 AI-агентов в розничном подразделении. Amazon заявляет $2B экономии и рост скорости разработки в 4.5 раза. И с такими цифрами в отчётах фарш назад не провернуть.

Отдельный кек: пункт про GenAI из документа удалили до начала встречи. После публикации FT представитель Amazon заявил, что только один сбой связан с AI и ни один не вызван кодом, который AI написал.
CNBC: An internal document originally said generative AI-assisted production changes were partly to blame for the issues, but the reference to GenAI was subsequently deleted.


James Gosling, ушедший из AWS в 2024, ещё тогда описывал ту же картину — команды, не приносящие прямой доход, расформировали ради AI-повестки. Corey Quinn из Duckbill сформулировал точнее: AWS предпочтёт, чтобы мир считал их инженеров некомпетентными, чем признает, что ошибку допустил AI.

https://fixupx.com/lukolejnik/status/2031257644724342957?s=46

https://www.cnbc.com/2026/03/10/amazon-plans-deep-dive-internal-meeting-address-ai-related-outages.html
2🤯1
В Claude Code появилась команда claude remote-control. Не слеш-команда /remote-control, которая была и раньше. Та пробрасывала одну конкретную сессию на телефон.

Новая команда поднимает persistent-сервер. До 32 параллельных сессий на одной машине. Зашёл в claude.ai/code с телефона, создал сессию — она стартует локально, с доступом к файлам, MCP-серверам, CLAUDE.md. --spawn=worktree разносит сессии по отдельным git worktree, --spawn=same-dir держит всё в одной директории. Переключение между режимами — клавиша w на лету.

Мак с запущенным claude remote-control фактически становится headless-сервером. Одной командой закрыли сценарий, под который люди городили Tailscale + tmux + Termius и отчасти из-за которого набирал популярность OpenClaw.
🔥8
Forwarded from Tips AI | IT & AI
Оказывается у Anthropic есть экзамен — Claude Certified Architect

Узнал про неё из статьи, где парень набрал 985/1000

Cдать его могут только партнёры Anthropic. Зато все учебные материалы в открытом доступе:

• Агентная архитектура: мультиагентные системы, оркестрация
• Tool Design и MCP: подключение внешних сервисов
• Настройка Claude Code: конфиги, хуки, воркфлоу
• Промпт-инжиниринг: system prompts, цепочки, few-shot
• Управление контекстом: стратегии работы с контекстным окном


30 практических задач, сценарии, упражнения на сборку.

Комьюнити уже собрало бесплатный гайд с промптами для подготовки по каждому направлению.

> claudecertificationguide.com

Практические уроки, тренировочные вопросы и упражнения по разработке, всё что нужно.

Просто без сертификата в конце 🪙

@tips_ai #news
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
10🔥5👍3
https://github.com/max-prtsr/claude-ru-gaming

Фразы про кабанчика подзаебали, решил сделать из игр.

PR приветствуются!
3🔥1
Хм, кажется это месяц «10 баксов уходит минимаксу» ибо алибаба пока только 2.5 имеет :(
😁75🤪2
https://rjcorwin.github.io/cook/

Еще один ральф-луп. И DX отличный - сходу понятно куда тыкать

Опции:
- луп над одной задачей пока не Done
- работа над одной задачей в нескольких воркспейсах вариациями и потом выбор где пизже получилось
- ральф-луп который берет задачи из списка

Для простых вещей выглядит клево
👍6
https://code.claude.com/docs/en/channels

Дождались. Anthropic выкатили Claude Code Channels — research preview, который добавляет новый транспорт в сессию Claude Code. Щас доступны Telegram и Discord через официальные плагины из claude-plugins-official.

Для теста ставим fakechat@claude-plugins-official из офплагинов, запускаем

claude --channels plugin:fakechat@claude-plugins-official


и идем на http://localhost:8787/ тестить.

Нужен v2.1.80+, Bun runtime, авторизация через claude.ai (API-ключи не работают).

Ответ на OpenClaw очевиден. Anthropic взяли самый востребованный паттерн — асинхронное общение с агентом через мессенджер — и встроили нативно. Разница в подходе в том что события приходят только пока сессия открыта. Для постоянной работы нужен фоновый процесс или tmux/screen.
👍1
https://mimo.xiaomi.com/mimo-v2-pro

Xiaomi выкатили MiMo-V2-Pro — флагманскую модель на 1T параметров (42B активных). Hybrid Attention с соотношением 7:1, контекст до 1M токенов, Multi-Token Prediction для быстрой генерации.

Неделю назад модель анонимно залили на OpenRouter под кодовым именем Hunter Alpha. За неделю она несколько дней подряд возглавляла дневной чарт по количеству вызовов и набрала больше 1T токенов суммарно.

По бенчмаркам — кодинг выше Claude 4.6 Sonnet, агентские задачи (ClawEval 61.5) приближаются к Opus 4.6. На PinchBench — 81.0, третье место глобально после Opus и MiMo-V2-Omni. Основной трафик во время теста шёл от инструментов для разработки.

Цены API: $1/$3 за миллион токенов input/output (до 256K контекста). Для сравнения — Sonnet 4.6 стоит $3/$15. Cache write пока бесплатен.

Самое главное - дают неделю бесплатного доступа в OpenClaw, OpenCode, KiloCode, Blackbox, and Cline, например через https://opencode.ai/docs/zen/#endpoints
🔥3
Сижу работаю с MiMo-V2-Pro в opencode

Китайцы в этот раз не пиздят

Мне очень комфортно, кажется у клода в этот раз должно начать играть технологическое отверстие ниже копчика.

Слушает что надо делать фактически, контекст держит, рассуждения топ.

Короче настоятельно рекомендую пробовать
10🔥5
На Reddit всплыл тред про страницу в документации Anthropic, которую мало кто читал. Три инструкции для системного промпта, которые заметно снижают галлюцинации Claude.

Явно разрешить модели отвечать «I don't know». Без этого Claude заполняет пробелы в знаниях правдоподобной выдумкой.

Потребовать цитаты и источники на каждое утверждение. Если источника нет, модель должна отозвать утверждение.

При работе с длинными документами (>20K токенов) заставить модель сначала извлечь дословные цитаты из текста, а потом анализировать. Это убивает дрейф смысла при пересказе, когда модель незаметно сдвигает значение при суммаризации.

Есть нюанс. Статья arXiv 2307.02185 показала, что жёсткие требования к цитированию давят креативную генерацию. Рекомендуют два режима: режим исследования с тремя инструкциями для фактчекинга, обычный режим без них — для свободной генерации.

https://docs.anthropic.com/en/docs/test-and-evaluate/strengthen-guardrails/reduce-hallucinations
👍10
Пацаны, а кто kilo code юзает? Чот он вроде как популярный но в моем пузыре не про него не слышно...
Судя по виду это форк opencode

UPD Claude вот чо написал про их cli

Kilo Code Cli — всё то же самое в (потому что форк), но сверху:
- кросс-девайсный sync состояния сессий Kilo
- managed кредитная система (Kilo Pass)
- AI Management Dashboard для трекинга adoption и ROI LinkedIn
- встроенный code review и деплой из IDE Kilo
- KiloClaw — hosted OpenClaw для автоматизации за пределами кода

PS в опенкоде кончился MIMOv2, в килокоде все еще есть