SimpleAGI
293 subscribers
83 photos
2 files
70 links
Здесь ты найдешь понятные лайфхаки и примеры использования LLM в повседневной жизни и бизнесе.

Подпишись, чтобы вместе шаг за шагом разбираться в технологиях, которые уже меняют наше будущее.
Download Telegram
6 мая в Сан-Франциско Anthropic собирает свою главную конференцию.

Год назад эта же конфа была launch-площадкой. Дарио вышел и со словами "I'm not one to hype things up" объявил, что "as of exactly this moment" релизятся Opus 4 и Sonnet 4.
Плюс шесть платформенных штук в один заход:
- серверный code execution tool,
- MCP через API, Files API,
- web search через API,
- расширенный prompt caching до часа,
- extended thinking с использованием tools.
Claude Code в тот же день вышел с расширениями для VS Code и JetBrains. Параллельно GitHub Copilot подключил Claude.

И за этот год не останавливались:
- Opus 4.5
- Opus 4.6 с Agent Teams
- Opus 4.7 с 1M tokens
- Sonnet 4.6 1M

В Claude Code за этот же период - skills, subagents, /loop, Ultraplan, /ultrareview и еще куча всего.

Я тут закопался, чтоб разобраться, как работают тулзы в CC с web search , вы могли себе представить, что контекст HTML сырым заливается в Haiku с промптом пользователя и в output лезет результат Haiku, что она смогла выжать из сырого html? Балдеж же, наглость которую позволить могут лишь не все, кек.

Между делом - вспомним про Mythos в закрытом превью, о чем, кажется, точно что-то расскажут.

Большая часть из этого закрепилась у меня в работе.
Да в жизни
____
Спикеры тоже сильные.
Boris Cherny - тот, кто собственно сделал Claude Code, до этого был в Cursor и Meta. Кажется очень веселым дядькой.

Cat Wu - Head of Product, Claude Code.
Ami Vora - Head of Product
Angela Jiang - Head of Product, Claude Platform.
Этих не знаю, но звучат то круто. 🙂
____
Зарегался на лайв-стрим во всех трёх городах.

P.S. Скорее всего посмотрю 0 трансляций. НО главное же желание
Please open Telegram to view this post
VIEW IN TELEGRAM
2🔥1🤩1
Выпал из телеги, но в оповещениях видел разбор полетов про Harness, а это причина моего "вылета"☹️

Harness - слой, который задаёт модели среду. Какие тулы есть, что знает всегда, какая память переживает /clear, когда обязана остановиться или спросить.

Без harness каждая сессия начинается с нуля:
«Привет, у нас Next.js 15, не трогай .env, тесты гоняем так».
С harness это один раз описывается и работает.

Четыре вопроса, на которые модель сама не ответит:
- Что я могу делать? - тулы и пермишены
- Что знаю всегда? - стек, соглашения, ограничения
- Что делала в прошлый раз? - память между сессиями
- Когда остановиться или спросить? - границы автономии


Окно контекста конечно. И деградирует задолго до формального потолка - на 1M-моделях качество падает уже к 200K (Chroma Research). Anthropic называет это context rot(гниение контекста).

Поэтому знания раскладываем по слоям. Слой - это про цену в токенах и вероятность, что знание окажется в контексте в нужный момент.

Пять слоёв, от дорогого к дешёвому:

1. Каждый turn каждой сессии - `AGENT.md`, `CLAUDE.md`
2. На событие - hooks: `session_start`, `tool_use`, `stop`
3. На контекст - `skills/`, `rules/` с `paths:`
4. Когда позвали - `agents/`, `commands/`, MCP
5. Когда прочитали руками - `docs/`, ADR


Правило «в проекте нет Anthropic API» - слой 1, иначе модель попробует и сломается.
Детали оформления devlog - слой 3, нужны только когда реально пишет.



Отдельная история - безопасность. Удобно делить на три типа границ.

Trust gate - можно ли это вообще делать. Whitelist действий, заданный до начала работы.
allow: ["Read"] в settings.

Information gate - что модель видит прямо сейчас. Это и есть слои выше. CLAUDE.md - всегда. Skill - после триггера. Devlog - только если явно прочитала.

Containment - что сломается, если actor всё-таки ошибся. Не предотвращает ошибку, а сужает blast radius.
- Subagent со свежим контекстом и tools: [Read, Grep] физически не может писать.
- Git worktree изолирует эксперимент.
- Bubblewrap/Seatbelt отделяет процесс от системы.



В новом гайде Anthropic есть прямая фраза:

«По мере совершенствования моделей разработчикам следует избавляться от лишних вспомогательных элементов, а не усложнять структуру».

Если модель умеет X нативно - не надо расширять harness под X. С каждой новой моделью объём .claude/ должен сокращаться, а не расти.

Удаляй старое, не добавляй лишнее.

P.S.
Пост Валеры по теме
Гайд Anthropic: https://www.anthropic.com/engineering/harness-design-long-running-apps
Please open Telegram to view this post
VIEW IN TELEGRAM
51🔥3
Как я (с Claude) починил аналоговый звук на MSI в Ubuntu

Подключаю наушники к своему usb микрофону, так как джек-разъем молчал, а на Windows работает.

Некоторое время назад я пытался решить проблему с Claude- без результатов, так и подключал через микрофон.

А СЕГОДНЯ!
- начали с тех же шагов "что там в логах, может ошибки подскажут?"
«no codecs found» указывало на PCI-устройство, подписанное в BIOS как «Realtek ALC1220»

И вишенка на торте, я прям цитатой из диалога поделюсь, это забавно!
Перелом наступил, когда диагноз перевернулся. Выяснилось, что onboard-звук на X870 Tomahawk — это вообще не PCI-кодек ALC1220, а Realtek ALC4080, подключённый по внутреннему USB. Та надпись «ALC1220» у PCI-контроллера — просто легаси-строка из BIOS, а сам контроллер пустой, поэтому «no codecs found» там — нормально и безвредно. Настоящий кодек всё это время преспокойно определялся как USB-аудиоустройство

___
Я к тому, что Opus4.8 мне уже нравится 😎
Please open Telegram to view this post
VIEW IN TELEGRAM
101😁42
А еще у меня начался отпуск в неделю и я надеюсь вернуться к Вам.

К слову о популярных репозиториях и идее Harness под модели аля Клод и ГПТ,
Долго вынашиваю и тестирую прототипы Базового пресета под разработку.
И как правило, получить весомого улучшения по качеству - проблематично, только сам себе в ноги стреляешь, пытаясь описать процессы в красивые пайплайны.

Кто бы мог подумать, но в интернете опять кто-то неправ😐
Please open Telegram to view this post
VIEW IN TELEGRAM
3
Планировал отпуск как нормальный инженер.
Закрыть свои проекты, дописать наконец стартер-пак для разработки с Claude Code. Неделя же - целая вечность.

К IDE так и не подошёл. Компьютер включал ради YouTube и игры.
Вместо работы отсыпался. Отметил день рождения девушки. Съездил к родителям. Про агентов, пайплайны и проекты не думал вообще.

К концу недели заметил любопытное. Мысли перестали ходить по кругу. Вокруг будто прибавилось приятного. Самочувствие - лучше, чем после любого "продуктивного" выходного в IDE.

"Залипание" от перманентного фокуса на одном домене (не важно, "работа" или что-то другое) - сужает жизненный опыт и бьёт по качеству жизни.
Автоматизация агентами всего подряд - это круто, но фоновый процесс - отдых - тоже запускать нужно)
___🥺___
Завтра возвращаться в строй. Судорожно вспоминаю
source .venv/bin/activate
Please open Telegram to view this post
VIEW IN TELEGRAM
50🔥74😁1
Fable 5 - из новостей может показаться, что это "новый ярус" нас Opus4.8 с особой проработкой безопасности.

По факту, важно понимать- это новая модель, но с фишкой
Внешний классификатор перед/вокруг Fable решает: если запрос попадает в высокорисковую зону (наступательная кибербезопасность, биология, химия), ответ генерирует не Fable, а Opus 4.8.

Предлагаю относиться к этому, как к fallback по условию 😇

Из интересного, у модели нет параметров:
thinking
temperature
top_p
top_k
Please open Telegram to view this post
VIEW IN TELEGRAM
2
При одном проекте в 2 терминалах запустил по одному промпту на Opus и Fable
___
Задача лютая, чертовски плохо формулируется, и по кодингу и по
"Ну сформулируйте точнее задачу, тогда будет понятнее, как это считать по трудозатратам"

Сразу видно, что Fable решительнее и не "останавливается", а накидывает через AskUserQuestion варианты и шпарит дальше, причем его вопросы не "делать А или Б?", а "Эта штука так работает?"
По итогу Opus за 3 минуты остановился и зафиналил вопросом
"будем новую репу делать или попробуем упихнуть в skill?"

А Fable за 8 минут полностью подготовил миграцию и просит сказать "поехали", чтоб начать работу)
🔥4
Предупреждения о "запретных" темах вылазят непредсказуемо. Это определенно должны как-то фиксить. На запросах вполне унылых и коддерских ловить смену модели - вообще не круто. Ставлю дислайк, вот прям так и передайте Anthropic
😁2🤬1
за 12 часов прохерить 40 % недельного лимита на макс тарифе - новая модель,конечно, жопу рвет знатно.
Так быть не должно, как мне кажется.

Ребятам на других тарифах - сочувствую и ставлю свечку.
😱21
https://www.anthropic.com/news/fable-mythos-access

Чертовски неприятный пример, политика добралась окончательно
182 дня до нового года, уже меньше половины до долгих выходных.

Fable 5 вернули*
*На неделю по подпискам, а далее ток по api.

Постараюсь закончить сборку под harness или хотя бы справочных файлов.
Чтоб и вы тоже смогли "успеть" донастроить Claude code под ваши кодинг задачи и сократить количество
"Ну ты чо творишь? Мне нужно иначе и вообще верни всё в зад"

Астрологи объявили неделю fable 5.
Успеть закрыть все мета - задачи
3
Знакомая спрашивает, нужна ли кому работа с "Адекватным работодателем и оплатой по рынку"

Ищут человека оценивать генерации мультимодальных моделей — видео, аудио, речь, музыка. По факту ты смотришь, что нагенерила модель, ставишь оценки по чек-листам (насколько попало в промпт, реалистичное ли движение, не разъезжается ли картинка между кадрами, естественная ли речь, липсинк и т.д.) и объясняешь, где она врёт. Из твоих оценок собирают preference-данные, на которых модель потом дообучают через RLHF.

Условия: удалёнка/гибрид, контракт на 6 месяцев с возможным продлением, 3–6 лет опыта, подчинение напрямую CAO. Стек — Label Studio, Scale, Surge, Appen, Excel.
https://www.linkedin.com/jobs/view/4434694805/
😁2
К сожалению не получится зафиналить полноценный "пак" для вас, пока думаю, как с пользой собрать обвязку, чтоб каждому было потенциально полезно и за одну сессию с клодом доработать под себя.
А пока пытаюсь работу работать, тяжко)

P.S. Fable 5 крутая, но как же мало лимитов и долго "думает". Кто и так использует API , Я вам сочувствую, потому что с этой иглы вы не слезете и будете стучаться к Fable вне зависимости от стоимости,
пу-пу-пу
🔥4
Словить 5 часовой лимит на MAX подписке в процессе workflow - ВЫПОЛНЕНО

😈 как горит, уф ☹️
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥4
Давно обещаю выложить наработки по harness для Claude Code. 🥺

Два плагина. Одна репа.

claude-code-harness - проектирует и аудирует .claude/ в проекте.
Удаляет так же охотно, как добавляет: показываешь ему свой .claude/ -
получаешь список мёртвого груза.

devlog - память проекта между сессиями. Новая сессия открывается
не холодной, а с последними записями и незакрытой работой.

Даже презентацию сделал - ссылка .
Please open Telegram to view this post
VIEW IN TELEGRAM
8🔥3🤩2
Please open Telegram to view this post
VIEW IN TELEGRAM
41
Forwarded from Pavel Zloi
Как и обещал, выкладываю самый полный курс про Cursor AI

Собирал несколько недель. 14 модулей, почти 70 уроков. Начинается с установки и оплаты из России, заканчивается автономными агентами, которые сами доводят задачу до конца.

Что разбираем:
- как устроен агент, токены, контекст, цикл с инструментами;
- работа в IDE, Tab, Ctrl+K, чат, композер, режимы и модели;
- контекст, правила проекта, MCP-серверы;
- скиллы, хуки, команды, субагенты;
- Cursor CLI и запуск агента в CI/CD;
- ACP, BDD и сквозной проект от плана до деплоя.

Курс текстовый, со скриншотами из живого проекта, а не из документации. Каждый урок самодостаточный, порядок изучения любой. После модуля вопросы на проверку и практика в своём проекте.

Забирайте, делитесь, не стесняйтесь задавать вопросы если вдруг что-то непонятно.

>>> Пройти курс бесплатно, на Stepik

PS. Кому удобнее читать офлайн, весь курс собрал в PDF-книгу на Boosty.
🔥42🤡1
На Opus 5 любая сессия выше high(effort) теряет WebSearch — включая ultracode и /effort max.

Держу в курсе
2😁1
Please open Telegram to view this post
VIEW IN TELEGRAM
3
Продолжение истории с effort и WebSearch.

В claude-code есть issue #79798: alwaysThinkingEnabled не превращается в thinking: {type: "adaptive"}. Сессия молча идёт без thinking, а на xhigh WebSearch падает с 400. Весь тред до этого был про Opus 4.8, Windows Desktop и macOS.

Написал туда большой комментарий. Что он добавляет:

Opus 5 в scope. Теперь у мейнтейнеров есть репро на текущей дефолтной модели и на 2.1.220 - в треде максимум был 2.1.218. Плюс третья платформа: Linux CLI.

Снят неверный воркэраунд. effort: high во frontmatter агента не работает. Это уточнение к совету из #76689, проверял на скилле. Без него люди чинили бы себе не тот слой.

Объяснение чистых репро. Почему часть попыток воспроизвести возвращается зелёной: env-блок в settings перебивает --effort, и вся матрица по факту меряет high. Сам сидел на этом двое суток - так что в тред ушло как предупреждение, а не как теория.
И способ найти прошлые молчаливые потери - греп с глобом на уровень глубже. Ошибка не помечается is_error, обычным поиском её не видно.
___
Просьба.
Если тема близка - зайдите и поставьте реакцию на комментарий. Мейнтейнеры сортируют по реакциям, а не по длине текста.

https://github.com/anthropics/claude-code/issues/79798#issuecomment-5081189474
1
Появилась возможность потрогать Codex с нормальными лимитами. У меня он совсем ванильный и без всяких harness примочек.

Дай, думаю, попробую переписать архитектурные блоки проекта из состояния "Нужно, чтоб работало хоть как-то"
в приличную модульную структуру, чистенько.

Сессии 2 ушло на формирование плана и всяких особенностей. Потом несколько сессий на подготовительные работы и сбор анамнеза пациента😫

И вот он самостоятельно шпилит уже 8 час. Судя по коду - это может быть даже не в пустую потраченное время.

Мне понравилось поведение и дефолтные подходы к работе с большой кодовой базой, то как решаются проблемы возникающие в процессе разработки.

Культурный шок от того, что "Запустил и работает хорошо"
С Клодом немного другие эмоции)
Please open Telegram to view this post
VIEW IN TELEGRAM
❤‍🔥1