⚪️ TinBase: локальный Supabase
Наткнулся на интересный проект
Это локальный Supabase в одном бинарнике, даже без докера (хотя он бы и не помешал) - полностью совместим с supabase-js SDK, но меньше и менее прожорливый.
Похож на PocketBase, но вместо простенького SQLite полноценный PostgreSQL
Выглядит полезным!
🔗 Оффсайт: https://www.tinbase.dev
🔗 Гитхаб : https://github.com/sanketsahu/tinbase
@deksden_notes
Наткнулся на интересный проект
Это локальный Supabase в одном бинарнике, даже без докера (хотя он бы и не помешал) - полностью совместим с supabase-js SDK, но меньше и менее прожорливый.
Похож на PocketBase, но вместо простенького SQLite полноценный PostgreSQL
Выглядит полезным!
🔗 Оффсайт: https://www.tinbase.dev
🔗 Гитхаб : https://github.com/sanketsahu/tinbase
@deksden_notes
1👍19🔥11
⚪️ Релиз от OpenAI !..
... но не тот, который мы все ждем.
🔗 Бложик: https://openai.com/index/introducing-gpt-live/
gpt-live-1
Более лучшая голосовая модель реального времени, уже в ChatGPT Voice. Неужели в Codex на диктовку поставят командовать Солнышком? Посмотрим
@deksden_notes
... но не тот, который мы все ждем.
🔗 Бложик: https://openai.com/index/introducing-gpt-live/
gpt-live-1
Более лучшая голосовая модель реального времени, уже в ChatGPT Voice. Неужели в Codex на диктовку поставят командовать Солнышком? Посмотрим
@deksden_notes
😁2👍1
⚪️ Grok 4.5
Маск подумал что лучшего момента смазать презентацию 5.6 у клозедов ждать не стоит, и оперативно зарелизил свой Grok 4.5
🔗 Почитать : https://x.ai/news/grok-4-5
🔗 Дока : https://docs.x.ai/developers/grok-4-5
Вкратце:
• бенчи - заявлено хуже Фубли, лучше Опуса 4.8 (посмотрим)
• сильно быстрее многих - 80 tps (неплохо, но это скромнее многих Fast режимов);
• дешевле - $2/$6 (оч гуманно)
• контекст 500k
• особенно отмечено что знает Excel, PPT, Word
• уже в Grok Build и Cursor
• в EU после середины Июля
Ну - раз подписка есть, попробую
@deksden_notes
Маск подумал что лучшего момента смазать презентацию 5.6 у клозедов ждать не стоит, и оперативно зарелизил свой Grok 4.5
🔗 Почитать : https://x.ai/news/grok-4-5
🔗 Дока : https://docs.x.ai/developers/grok-4-5
Вкратце:
• бенчи - заявлено хуже Фубли, лучше Опуса 4.8 (посмотрим)
• сильно быстрее многих - 80 tps (неплохо, но это скромнее многих Fast режимов);
• дешевле - $2/$6 (оч гуманно)
• контекст 500k
• особенно отмечено что знает Excel, PPT, Word
• уже в Grok Build и Cursor
• в EU после середины Июля
Ну - раз подписка есть, попробую
@deksden_notes
👍10😁5🔥3
👉 Подписки для работы с ИИ, удобный market:
apel0sin_market_bot
Из того, что сейчас особенно интересно:
• ChatGPT Plus Edu и Chatgpt plus, подходит для Codex
• Super grok + X premium+ по самой низкой цене
• Gemini Pro + 5TB на 18 месяцев
• разные ИИ-сервисы и подписки под работу, учебу и код
Оплата есть через СБП, крипту и CryptoBot. Большая часть выдачи автоматическая, поэтому не нужно долго ждать ручной обработки. Гарантии указываются в конкретных товарах.
• Отзывы
• Их канал, там промокоды на деньги
apel0sin_market_bot
Из того, что сейчас особенно интересно:
• ChatGPT Plus Edu и Chatgpt plus, подходит для Codex
• Super grok + X premium+ по самой низкой цене
• Gemini Pro + 5TB на 18 месяцев
• разные ИИ-сервисы и подписки под работу, учебу и код
Оплата есть через СБП, крипту и CryptoBot. Большая часть выдачи автоматическая, поэтому не нужно долго ждать ручной обработки. Гарантии указываются в конкретных товарах.
• Отзывы
• Их канал, там промокоды на деньги
Telegram
apel0sin | market 2.0
Реклама: @apel0sin_ads
Отзывы: @rep_apel0sin
Связь: @apel0sin
Наш тгк (Раздаем промокоды): @apel0sin_work
Отзывы: @rep_apel0sin
Связь: @apel0sin
Наш тгк (Раздаем промокоды): @apel0sin_work
👍8💩8❤4
DEKSDEN notes pinned «👉 Подписки для работы с ИИ, удобный market: apel0sin_market_bot Из того, что сейчас особенно интересно: • ChatGPT Plus Edu и Chatgpt plus, подходит для Codex • Super grok + X premium+ по самой низкой цене • Gemini Pro + 5TB на 18 месяцев • разные ИИ-сервисы…»
⚪️ Релиз 5.6
Будем в этом топике ожидать релиз 5.6 и следить за событиями.
Клозедовцы уже просыпаются потихоньку! Мониторим ситуацию
... (пост будет меняться и дополняться, надеюсь, превратится в пост о релизе линейки 5.6)
—-
Upd 1️⃣ : Ждем 20-00 мск!
——
upd 2️⃣ : ‼️ РЕСЕТУ БЫТЬ! Американским вечером.
@deksden_notes
Будем в этом топике ожидать релиз 5.6 и следить за событиями.
Клозедовцы уже просыпаются потихоньку! Мониторим ситуацию
... (пост будет меняться и дополняться, надеюсь, превратится в пост о релизе линейки 5.6)
—-
Upd 1️⃣ : Ждем 20-00 мск!
——
upd 2️⃣ : ‼️ РЕСЕТУ БЫТЬ! Американским вечером.
@deksden_notes
👍9❤🔥8🔥5😁3🕊3🙏1
⚪️ Еще один ресет на Кодексе (второй)
... анонсирован - в течение следующих 24 часов!
Неплохо!
Сгоревшие в Солнышке лимиты можно будет восстановить и уже не жечь так сильно
——
Upd 1️⃣ : второй ресет раскатывают в моменте! мне вот долетел уже
@deksden_notes
... анонсирован - в течение следующих 24 часов!
Неплохо!
Сгоревшие в Солнышке лимиты можно будет восстановить и уже не жечь так сильно
——
Upd 1️⃣ : второй ресет раскатывают в моменте! мне вот долетел уже
@deksden_notes
👍12😇4👻1
⚪️ Atlas всё
Помните ИИ браузеры? Вот - вариант от openAI закрывают в сентябре
▶️ Я скучать не буду ни разу - не запускал его в принципе.
Все что можно сделать в интернете - лучше всего сделать в агенте с browser use / computer use или deep-research
Никаких кейсов именно для браузера у меня не нашлось
❓ А кто то им пользвоался? Кто то грустит?
@deksden_notes
Помните ИИ браузеры? Вот - вариант от openAI закрывают в сентябре
▶️ Я скучать не буду ни разу - не запускал его в принципе.
Все что можно сделать в интернете - лучше всего сделать в агенте с browser use / computer use или deep-research
Никаких кейсов именно для браузера у меня не нашлось
❓ А кто то им пользвоался? Кто то грустит?
@deksden_notes
💯12👍4😁4🫡2❤1👏1
⚪️ Третий (!!!) ресет Кодекса анонсирован
"в течении дня!.." чтобы это ни значило!
В общем, есть возможность экспериментироваь, тестить и настраивать флоу!
(ц) шоу маст гоу он!
——
Upd 1️⃣ : ресет в процессе, мне (и не только) - вот прилетел
@deksden_notes
"в течении дня!.." чтобы это ни значило!
В общем, есть возможность экспериментироваь, тестить и настраивать флоу!
(ц) шоу маст гоу он!
——
Upd 1️⃣ : ресет в процессе, мне (и не только) - вот прилетел
@deksden_notes
🔥12👍3
⚪️ Grok Build даром!
Тут Маск решил добавить жару и обещает давать пробовать грок забесплатно.
Так то и сам грок 4.5 и упряжка вполне норм, так что если найдете время на фоне тестов Солнышка - не премините и грока защупать! Стоящая тема
@deksden_notes
Тут Маск решил добавить жару и обещает давать пробовать грок забесплатно.
Так то и сам грок 4.5 и упряжка вполне норм, так что если найдете время на фоне тестов Солнышка - не премините и грока защупать! Стоящая тема
@deksden_notes
🔥5👍4😁2
⚪️ Промптинг поколения 5.6
Все уже пощупали 5.6-трио. Что можно сказать, помимо расхода токенов Sol? Промптинг определенно стоит тюнинговать под это поколение
Мои наблюдения:
• модель довольно глубоко может порассуждать, довольно глубокие моменты выкапывает
• модель следует в русле того, что ты ей сказал
• не всегда следует говорить что модели делать, чаще лучше спросить чего она предлагает исходя из набора моих пожеланий;
• ограничения и ясная конечная цель и раньше были важны
• агентность модели вполне высокая, учить переставлять ноги не обязательно
Ну и можно почитать что сам вендор рекомендует как гайд для промптинга:
• советуют устанавливать рамки, sandbox в котором рабоатет модель
• ясно обозначить конечную цель
• любые неопределенности или двусмысленности сильно повышают расход токенов на блуждание модели
❓ Успели отметить что то полезное и примечательное про промптинг новых моделей?
——
Upd 1️⃣ : моментик - все отследили что контекст в кодексе теперь на 5.6 поколении в 353к показывается, а на 5.5 было 253к? То есть компакт на 100к токенов позже и каждый запрос/тулюз - это +100к токенов кеша дополнительно жгёт. Это тоже фактор повышенного расхода в агенте.
——
Upd 2️⃣ : дока от вендора, кому надо - но мне не показалась сильно полезной, про новые модели специфика неявная: https://learn.chatgpt.com/docs/prompting
про 5.6 немного тут: https://developers.openai.com/api/docs/guides/latest-model#prompting-best-practices
@deksden_notes
Все уже пощупали 5.6-трио. Что можно сказать, помимо расхода токенов Sol? Промптинг определенно стоит тюнинговать под это поколение
Мои наблюдения:
• модель довольно глубоко может порассуждать, довольно глубокие моменты выкапывает
• модель следует в русле того, что ты ей сказал
• не всегда следует говорить что модели делать, чаще лучше спросить чего она предлагает исходя из набора моих пожеланий;
• ограничения и ясная конечная цель и раньше были важны
• агентность модели вполне высокая, учить переставлять ноги не обязательно
Ну и можно почитать что сам вендор рекомендует как гайд для промптинга:
• советуют устанавливать рамки, sandbox в котором рабоатет модель
• ясно обозначить конечную цель
• любые неопределенности или двусмысленности сильно повышают расход токенов на блуждание модели
❓ Успели отметить что то полезное и примечательное про промптинг новых моделей?
——
Upd 1️⃣ : моментик - все отследили что контекст в кодексе теперь на 5.6 поколении в 353к показывается, а на 5.5 было 253к? То есть компакт на 100к токенов позже и каждый запрос/тулюз - это +100к токенов кеша дополнительно жгёт. Это тоже фактор повышенного расхода в агенте.
——
Upd 2️⃣ : дока от вендора, кому надо - но мне не показалась сильно полезной, про новые модели специфика неявная: https://learn.chatgpt.com/docs/prompting
про 5.6 немного тут: https://developers.openai.com/api/docs/guides/latest-model#prompting-best-practices
@deksden_notes
👍18❤4🔥3
⚪️ Чем работать
Смотрите, какую интересную и содержательную картинку встретил!
На вертикали видим качество, а горизонталь - про стоимость.
Тут есть о чем подумать. Видимо, потрата токенов в подписке в коэффициентах должна с апи стоимостью коррелировать - будем исходить из этой весьма вероятной гипотезы.
👉 Из графика получается, что Luna XHigh лучше Terra High за те же деньги.
Добавка Sol Ultra в сравнении с High не кажется впечатляющей, зато рост расходов - огромный.
И так далее.
▶️ В общем, паттерны использования нового трио надо нарабатывать - это теперь все новое и непонятное!
——
Upd 1️⃣ : Важно: график сам по себе не факт что полностью достоверный! ризонинг 5.5 и луны немного с галюнами (лишние уровни). Так что как истину не воспринимаем, а используем как повод для размышлений.
Важная идея тут - ризонинг может заменять апгрейд тира модели. То есть слабая модель с большим бюджетом размышлений может уделать более сильную с меньшим бюджетом, и это будет экономичнее!
Этот тейк и будем тестировать
@deksden_notes
Смотрите, какую интересную и содержательную картинку встретил!
На вертикали видим качество, а горизонталь - про стоимость.
Тут есть о чем подумать. Видимо, потрата токенов в подписке в коэффициентах должна с апи стоимостью коррелировать - будем исходить из этой весьма вероятной гипотезы.
👉 Из графика получается, что Luna XHigh лучше Terra High за те же деньги.
Добавка Sol Ultra в сравнении с High не кажется впечатляющей, зато рост расходов - огромный.
И так далее.
▶️ В общем, паттерны использования нового трио надо нарабатывать - это теперь все новое и непонятное!
——
Upd 1️⃣ : Важно: график сам по себе не факт что полностью достоверный! ризонинг 5.5 и луны немного с галюнами (лишние уровни). Так что как истину не воспринимаем, а используем как повод для размышлений.
Важная идея тут - ризонинг может заменять апгрейд тира модели. То есть слабая модель с большим бюджетом размышлений может уделать более сильную с меньшим бюджетом, и это будет экономичнее!
Этот тейк и будем тестировать
@deksden_notes
👍19🔥13❤1
Forwarded from ABI
🤖 Multi-Agent OpenCode Workflows
Превращает OpenCode в дисциплинированную мульти-агентную инженерную систему.
Архитектура:
Один пользовательский оркестратор вместо хаоса агентов
11 скрытых специализированных субагентов (coder, reviewer, debugger, planner, verifier и др.)
Иерархическая структура supervisor-worker
Ключевые фичи:
✅ Структурированное планирование с треками и эпиками
✅ Независимая верификация после ревью
✅ Мульти-модельное консенсусное ревью
✅ Переиспользуемые внутренние навыки вместо раздутых промптов
✅ Шаблонная долговременная память
Это не демо-набор промптов, а серьёзная основа для агентной разработки.
🔗 https://github.com/ABIvan-Tech/opencode-agentic-workflows
#opensource #opencode
Превращает OpenCode в дисциплинированную мульти-агентную инженерную систему.
Архитектура:
Один пользовательский оркестратор вместо хаоса агентов
11 скрытых специализированных субагентов (coder, reviewer, debugger, planner, verifier и др.)
Иерархическая структура supervisor-worker
Ключевые фичи:
✅ Структурированное планирование с треками и эпиками
✅ Независимая верификация после ревью
✅ Мульти-модельное консенсусное ревью
✅ Переиспользуемые внутренние навыки вместо раздутых промптов
✅ Шаблонная долговременная память
Это не демо-набор промптов, а серьёзная основа для агентной разработки.
🔗 https://github.com/ABIvan-Tech/opencode-agentic-workflows
#opensource #opencode
GitHub
GitHub - ABIvan-Tech/opencode-agentic-workflows
Contribute to ABIvan-Tech/opencode-agentic-workflows development by creating an account on GitHub.
1👍15❤6❤🔥1
⚪️ Очередной ресет кодекса - и не только
1️⃣ Тибо анонсировал очередной ресет кодекса в течение этого часа! Ко мне пока не прилетел
2️⃣ Sol немного подкрутят чтобы он так не выжигал лимиты!
3️⃣ 5h лимиты ВРЕМЕННО отключаются - но недельные остаются
——
👉 На этом фоне: Антропики
1️⃣ сохраняют фублю в подписке (пока?),
2️⃣ еще на неделю до 19 июля пробляют акцию с х2 лимитами использования
Если бы эти дятлы сразу сказали что до середины месяца можно фублю покрутить - я бы подписку купил! Обидно, да
——
Удачный три-релиз случился, да? Ждем когда грок лимиты сбросит )))
@deksden_notes
1️⃣ Тибо анонсировал очередной ресет кодекса в течение этого часа! Ко мне пока не прилетел
2️⃣ Sol немного подкрутят чтобы он так не выжигал лимиты!
3️⃣ 5h лимиты ВРЕМЕННО отключаются - но недельные остаются
——
👉 На этом фоне: Антропики
1️⃣ сохраняют фублю в подписке (пока?),
2️⃣ еще на неделю до 19 июля пробляют акцию с х2 лимитами использования
Если бы эти дятлы сразу сказали что до середины месяца можно фублю покрутить - я бы подписку купил! Обидно, да
——
Удачный три-релиз случился, да? Ждем когда грок лимиты сбросит )))
@deksden_notes
🔥17😁6👍3🤝1
⚪️ Фестиваль ресетов продолжается!
Да, еще один ресет анонсирован. И теперь это - ручной ресет, который применяется вами по желанию.
▶️ Часть людей, кто применял недавно ресет (зачем? он же был серверный для все?) - у них ресет не применился, и всем, кто это делал около проблемного времени дали доп ресет
▶️ Завтра ручной ресет обещан всем пользователями Chatgpt Work и Codex.
▶️ Добавлена возможность применения ресетов в веб и с мобилок. Пока не нашел где именно это - ресетов в запасе не осталось! напишите кто найдет в комменты/чат.
@deksden_notes
Да, еще один ресет анонсирован. И теперь это - ручной ресет, который применяется вами по желанию.
▶️ Часть людей, кто применял недавно ресет (зачем? он же был серверный для все?) - у них ресет не применился, и всем, кто это делал около проблемного времени дали доп ресет
▶️ Завтра ручной ресет обещан всем пользователями Chatgpt Work и Codex.
▶️ Добавлена возможность применения ресетов в веб и с мобилок. Пока не нашел где именно это - ресетов в запасе не осталось! напишите кто найдет в комменты/чат.
@deksden_notes
🔥5
⚪️ Thinking budget для Sol
Нашел обсуждения изменений. Клозеды по слухам значительно порезали бюджет рассуждений у Sol модели. На скринах в табличке указано! Juice - это как раз и есть бюджет размышлений в неких "попугаях".
Оцените изменения - в разы! Хм..
Не знаю насколько это правда. Если да - то нужно снова рисовать графики зависимостей между уровнями размышления и перфомансом модели.
Посмотрим
——
Upd 1️⃣ : Terra / Luna бюджеты вроде бы не трогали - и Terra получается сейчас может сильно дольше старшего собрата думать!..
Upd 2️⃣ : Ответ тибо в комментах частично подтверждает, но говорит что все к лучшему, типа - все норм. Почитайте сами! Но сол лимиты палил довольно быстро, это точно надо было чинить
@deksden_notes
Нашел обсуждения изменений. Клозеды по слухам значительно порезали бюджет рассуждений у Sol модели. На скринах в табличке указано! Juice - это как раз и есть бюджет размышлений в неких "попугаях".
Оцените изменения - в разы! Хм..
Не знаю насколько это правда. Если да - то нужно снова рисовать графики зависимостей между уровнями размышления и перфомансом модели.
Посмотрим
——
Upd 1️⃣ : Terra / Luna бюджеты вроде бы не трогали - и Terra получается сейчас может сильно дольше старшего собрата думать!..
Upd 2️⃣ : Ответ тибо в комментах частично подтверждает, но говорит что все к лучшему, типа - все норм. Почитайте сами! Но сол лимиты палил довольно быстро, это точно надо было чинить
@deksden_notes
🤔7
⚪️ Запуск субагентов с определенной моделью
Уже несколько раз в чате проскакивали упоминания, что кодекс не может запустить субагентов с нужной моделью!
Это не совсем так. Пруф на скрине и в комментах (сессия, где видно запускаемую модель, в ui убрали зачем то).
▶️ У spawn_agents параметр model есть, но он опциональный. И самое важное - работает если НЕ ФОРКАТЬ в субагента контекст, что делается по-умолчанию. Иначе он просто наследует за сессией все свойства - модель, ризонинг.
▶️ Для multi agents есть две версии, 5.6 работает по умолчанию с v2, но с этим связано ряд багов. они обсуждаются в тредах:
🔗 https://github.com/openai/codex/issues/32031
🔗 https://github.com/openai/codex/issues/31814
🔗 https://github.com/openai/codex/issues/31864
Думаю, починят со временем, но я себе в конфиг внес блок:
не знаю насколько это помогло, но ошибок и конфликтов между тулами кодекса и встроенными в сол - больше не видел, а они встречались!
Скрин кусочка jsonl с параметрами вызова модели в комментах ⬇️
——
Upd 1️⃣ : в dev community есть решение, которое немного сложнее, но может быть тред или решение кому то будут полезны:
🔗 https://community.openai.com/t/restoring-subagent-roles-model-and-reasoning-in-multi-agent-v2/1386513
——
Upd 2️⃣ : сразу скажу что с субагентами в кодексе сейчас все НЕ очень ладно. Известные мне сложности/баги, примерный список:
• v2 субагенты иногда конфликтуют по схеме с встроенными субагентами в модель Sol;
• v2 субагенты иногда не получают при старте задачи от оркестратора, пустое сообщение;
• метаданные тулов могут быть спрятаны в конфиге чтобы не конфликтовать; в итоге агент не умеет запустить субагента с параметрами;
• не документированы неймспейсы для тулов и когда с ними работать (кто знает - подскажите!);
• v1 и v2 субагентов нельзя менять для начатой сессии - метаданные сесси сохраняют версию этого режима, только сессию новую пускать
• в v2 не видно модель и ризонинг при запуске;
• в v2 нельзя сходить в сессию субагента и посмотреть как он работает
@deksden_notes
Уже несколько раз в чате проскакивали упоминания, что кодекс не может запустить субагентов с нужной моделью!
Это не совсем так. Пруф на скрине и в комментах (сессия, где видно запускаемую модель, в ui убрали зачем то).
▶️ У spawn_agents параметр model есть, но он опциональный. И самое важное - работает если НЕ ФОРКАТЬ в субагента контекст, что делается по-умолчанию. Иначе он просто наследует за сессией все свойства - модель, ризонинг.
▶️ Для multi agents есть две версии, 5.6 работает по умолчанию с v2, но с этим связано ряд багов. они обсуждаются в тредах:
🔗 https://github.com/openai/codex/issues/32031
🔗 https://github.com/openai/codex/issues/31814
🔗 https://github.com/openai/codex/issues/31864
Думаю, починят со временем, но я себе в конфиг внес блок:
[features.multi_agent_v2]
hide_spawn_agent_metadata = false
tool_namespace = "agents"
не знаю насколько это помогло, но ошибок и конфликтов между тулами кодекса и встроенными в сол - больше не видел, а они встречались!
Скрин кусочка jsonl с параметрами вызова модели в комментах ⬇️
——
Upd 1️⃣ : в dev community есть решение, которое немного сложнее, но может быть тред или решение кому то будут полезны:
🔗 https://community.openai.com/t/restoring-subagent-roles-model-and-reasoning-in-multi-agent-v2/1386513
——
Upd 2️⃣ : сразу скажу что с субагентами в кодексе сейчас все НЕ очень ладно. Известные мне сложности/баги, примерный список:
• v2 субагенты иногда конфликтуют по схеме с встроенными субагентами в модель Sol;
• v2 субагенты иногда не получают при старте задачи от оркестратора, пустое сообщение;
• метаданные тулов могут быть спрятаны в конфиге чтобы не конфликтовать; в итоге агент не умеет запустить субагента с параметрами;
• не документированы неймспейсы для тулов и когда с ними работать (кто знает - подскажите!);
• v1 и v2 субагентов нельзя менять для начатой сессии - метаданные сесси сохраняют версию этого режима, только сессию новую пускать
• в v2 не видно модель и ризонинг при запуске;
• в v2 нельзя сходить в сессию субагента и посмотреть как он работает
@deksden_notes
1👍11🔥4❤1
⚪️ Путевые заметки: наблюдения за белками
Есть у меня экспериментальный проект. Это бот, который управляет базой знаний. Работает он на агентном поиске, база знаний ведется как граф.
У этого бота есть пайплайн, который знания извлекает. Это самая сложная часть всей гравицапы, потому что он должен переварить документы, и достать картинки/текст/сущности/даты/связи и много чего еще. И все это в граф организовать. Агентный поиск по готовому - сильно проще.
▶️ Так вот: какие белки? Которые как заведенные, бегают в колесе. Я, конечно, про Loop Engineering.
👉 Пайплайн импорта у меня крутится в задачах улучшения - как белка в колесе. Что за цикл? Мы запускаем пайплайн под наблюдением агента по инструкции. Далее смотрим чего получилось и проводим агентное ревью, там аспекты выделены и все такое. Результаты рассматриваем, находим косяки, где метрики не дотягиваются до целевых, и готовим исправления/доработки пайплайна. Ситемно и все такое. Потом эти доработки проходят полный SDLC цикл - plan -> code -> merge.
Совокупно в полностью автономном режиме у меня наверное неделю пробегал. Последний забег длится уже 1.5 суток и пока даже не особо хочет кончаться. Циклов штук 70 прошло!
Это все для контекста
▶️ Суть: хотел поделиться наблюдением.
При анализе как оно там, выясняется следующее. Да, пайплайн улучшается. Когда останавливается цикл и я разбираю чего там понакручено, то есть определенный прогресс.
Но я не особо доволен тем как все идет. Не хватает системности решения проблемы. Задачи решаются вроде бы путем системного перепланирования, сверху вниз, но видно же, что это разовые доработки, которым недостает концептуальности!
Вроде, все как завещали вендоры: задача обозначена, критерии измеримые, работай - поле свободно!
При этом есть во флоу куча всяких улучшений, которые должны дорабатывать или чего то прорабатывать. Но все не выглядит идеальным.
Это я еще ревью отключил, чтобы циклы крутились чуть побыстрее. Логика: пока меняем код, смысла каждое изменение вылизывать не вижу. В конце будем шерстить кодовую базу и причесывать - сейчас вопрос в основной логике.
▶️ Потом я вспомнил эксперименты с написанием компилятора. Подумал что очень похоже - там рой набрасывался на задачи и все было так же невнятно. Вроде цели вполне конкретные, но путаница, суета и невыстроенность в четкую систему!
Опа! А ведь это похоже
▶️ Да, у меня процесс не хаотичный, он по рельсам флоу ездиет по кругу. Но для самой сути проектирования - по сути это тот же хаос! Агент действует так, как ему в его латентном пространстве всбредет в голову.
‼️ В чем вижу проблему: на мой взгляд, логика моей задачи превышает возможности модели. Она не в состянии понять полностью и осознать весь пайплайн одновременно. Поэтому она "мечется" по разным частям, добавляя заплатки тут и там.
Очень похоже на попытку осветить фонариком большой цех: ресурса не хватает, свет теряется в большом пространстве!
👉 Что делать? Как обычно. Резать задачу, искать габарит который понятен модели. Резать пайплайн на кусочки, на этапы, и отлаживать отдельный блок. Такой, чтобы модель его полностью понимала! Хотя бы на верхнем уровне, но с достаточными деталями, чтобы отладить его работу.
То есть мы возьмем маленький участок и уже там "сделаем светло". И так - этап за этапом. Можно параллельно!
▶️ Вывод: AGI пока не настал. Все инженерные вопросы решаем как раньше, недостаток мозгов модели решаем правильным флоу - в данном случае декомпозиция задачи рулит.
@deksden_notes
Есть у меня экспериментальный проект. Это бот, который управляет базой знаний. Работает он на агентном поиске, база знаний ведется как граф.
У этого бота есть пайплайн, который знания извлекает. Это самая сложная часть всей гравицапы, потому что он должен переварить документы, и достать картинки/текст/сущности/даты/связи и много чего еще. И все это в граф организовать. Агентный поиск по готовому - сильно проще.
▶️ Так вот: какие белки? Которые как заведенные, бегают в колесе. Я, конечно, про Loop Engineering.
👉 Пайплайн импорта у меня крутится в задачах улучшения - как белка в колесе. Что за цикл? Мы запускаем пайплайн под наблюдением агента по инструкции. Далее смотрим чего получилось и проводим агентное ревью, там аспекты выделены и все такое. Результаты рассматриваем, находим косяки, где метрики не дотягиваются до целевых, и готовим исправления/доработки пайплайна. Ситемно и все такое. Потом эти доработки проходят полный SDLC цикл - plan -> code -> merge.
Совокупно в полностью автономном режиме у меня наверное неделю пробегал. Последний забег длится уже 1.5 суток и пока даже не особо хочет кончаться. Циклов штук 70 прошло!
Это все для контекста
▶️ Суть: хотел поделиться наблюдением.
При анализе как оно там, выясняется следующее. Да, пайплайн улучшается. Когда останавливается цикл и я разбираю чего там понакручено, то есть определенный прогресс.
Но я не особо доволен тем как все идет. Не хватает системности решения проблемы. Задачи решаются вроде бы путем системного перепланирования, сверху вниз, но видно же, что это разовые доработки, которым недостает концептуальности!
Вроде, все как завещали вендоры: задача обозначена, критерии измеримые, работай - поле свободно!
При этом есть во флоу куча всяких улучшений, которые должны дорабатывать или чего то прорабатывать. Но все не выглядит идеальным.
Это я еще ревью отключил, чтобы циклы крутились чуть побыстрее. Логика: пока меняем код, смысла каждое изменение вылизывать не вижу. В конце будем шерстить кодовую базу и причесывать - сейчас вопрос в основной логике.
▶️ Потом я вспомнил эксперименты с написанием компилятора. Подумал что очень похоже - там рой набрасывался на задачи и все было так же невнятно. Вроде цели вполне конкретные, но путаница, суета и невыстроенность в четкую систему!
Опа! А ведь это похоже
▶️ Да, у меня процесс не хаотичный, он по рельсам флоу ездиет по кругу. Но для самой сути проектирования - по сути это тот же хаос! Агент действует так, как ему в его латентном пространстве всбредет в голову.
‼️ В чем вижу проблему: на мой взгляд, логика моей задачи превышает возможности модели. Она не в состянии понять полностью и осознать весь пайплайн одновременно. Поэтому она "мечется" по разным частям, добавляя заплатки тут и там.
Очень похоже на попытку осветить фонариком большой цех: ресурса не хватает, свет теряется в большом пространстве!
👉 Что делать? Как обычно. Резать задачу, искать габарит который понятен модели. Резать пайплайн на кусочки, на этапы, и отлаживать отдельный блок. Такой, чтобы модель его полностью понимала! Хотя бы на верхнем уровне, но с достаточными деталями, чтобы отладить его работу.
То есть мы возьмем маленький участок и уже там "сделаем светло". И так - этап за этапом. Можно параллельно!
▶️ Вывод: AGI пока не настал. Все инженерные вопросы решаем как раньше, недостаток мозгов модели решаем правильным флоу - в данном случае декомпозиция задачи рулит.
@deksden_notes
👍15🔥5❤3❤🔥1👎1