Вышел новый "Гермес" и в него встроен ComfyUI Skill
Это один из самых мощных и проработанных скиллов в репозитории Hermes Agent.
ComfyUI — это визуальный node-based фреймворк для генерации изображений, видео, аудио и 3D (Stable Diffusion, SDXL, Flux, SD3, Hunyuan Video и т.д.). Обычно с ним работают через веб-интерфейс: мышкой перетаскиваешь ноды, соединяешь их, жмёшь «Queue Prompt».
Скилл превращает ComfyUI из ручного визуального инструмента в полностью программируемый генеративный движок, которым может управлять AI-агент.
Что было бы без скилла:
- Юзер говорит «сгенерируй картинку с киберпанк-котом»
- Агент понятия не имеет что установлено, какие модели есть, как запустить сервер.
Скилл же даёт полную автоматизация всей цепочки.
Что особенно круто:
1. Поддержка и локального, и облачного режима — скилл сначала спрашивает юзера что он хочет, а не тупо ставит локально. Comfy Cloud на RTX 6000 Pro — для тех у кого нет GPU.
2. Полный цикл от 0 до результата — юзер говорит «сгенерируй картинку», а скилл: проверяет железо → ставит если надо → качает модели → проверяет зависимости → запускает → отдаёт файл. Всё в одном диалоге.
3. Поддержка img2img, inpainting, ControlNet, видео — не просто txt2img, а продвинутые пайплайны.
4. Безопасность — защита от path traversal в именах выходных файлов, проверка API-формата workflow, предупреждение что чужой workflow = eval() по уровню доверия.
5. 12 скриптов + 10 pitfalls — очень взрослый, production-grade скилл. Видно что его реально использовали и допиливали.
Этот скилл нужен чтобы AI-агент мог работать с ComfyUI как полноценный оператор: развернуть, настроить, подобрать модель, сгенерировать картинку/видео, отдать результат — и всё это без того чтобы юзер хоть раз открыл веб-интерфейс. По сути это мост между low-code визуальным миром ComfyUI и полностью автоматизированным agentic-миром.
Но надо учитывать, что для локального запуска нужна видеокарта от 6–8 ГБ VRAM, иначе только через Comfy Cloud за деньги.
Это один из самых мощных и проработанных скиллов в репозитории Hermes Agent.
ComfyUI — это визуальный node-based фреймворк для генерации изображений, видео, аудио и 3D (Stable Diffusion, SDXL, Flux, SD3, Hunyuan Video и т.д.). Обычно с ним работают через веб-интерфейс: мышкой перетаскиваешь ноды, соединяешь их, жмёшь «Queue Prompt».
Скилл превращает ComfyUI из ручного визуального инструмента в полностью программируемый генеративный движок, которым может управлять AI-агент.
Что было бы без скилла:
- Юзер говорит «сгенерируй картинку с киберпанк-котом»
- Агент понятия не имеет что установлено, какие модели есть, как запустить сервер.
Скилл же даёт полную автоматизация всей цепочки.
Что особенно круто:
1. Поддержка и локального, и облачного режима — скилл сначала спрашивает юзера что он хочет, а не тупо ставит локально. Comfy Cloud на RTX 6000 Pro — для тех у кого нет GPU.
2. Полный цикл от 0 до результата — юзер говорит «сгенерируй картинку», а скилл: проверяет железо → ставит если надо → качает модели → проверяет зависимости → запускает → отдаёт файл. Всё в одном диалоге.
3. Поддержка img2img, inpainting, ControlNet, видео — не просто txt2img, а продвинутые пайплайны.
4. Безопасность — защита от path traversal в именах выходных файлов, проверка API-формата workflow, предупреждение что чужой workflow = eval() по уровню доверия.
5. 12 скриптов + 10 pitfalls — очень взрослый, production-grade скилл. Видно что его реально использовали и допиливали.
Этот скилл нужен чтобы AI-агент мог работать с ComfyUI как полноценный оператор: развернуть, настроить, подобрать модель, сгенерировать картинку/видео, отдать результат — и всё это без того чтобы юзер хоть раз открыл веб-интерфейс. По сути это мост между low-code визуальным миром ComfyUI и полностью автоматизированным agentic-миром.
Но надо учитывать, что для локального запуска нужна видеокарта от 6–8 ГБ VRAM, иначе только через Comfy Cloud за деньги.
👨💻2
Эх, теперь ещё и деньги на тесты Comfy Cloud тратить...😭😂
🕊1🐳1
Пока плАчу над невозможностью войти в Codex, позитивные вести про EmDash.
Все отдыхали, а ребята выкатили релиз EmDash v0.9.0 1 мая (прямо под праздники, как водится). Не знают, видимо, что всемирный Праздник Весны и Труда — это выходной. Не отдыхают, короче, трудятся.
Что сделали:
🔹 Разобрались с кэшем манифеста — раньше админка могла подвисать со старыми данными после изменений схемы. Теперь манифест собирается заново на каждый запрос, два запроса к базе — и никакой магии с инвалидацией. У меня несколько раз такой баг воспроизводился, теперь не будет
🔹 Два новых плагина — plugin-field-kit (кастомные типы полей, можно слепить хоть яндекс-карту в админке) и обновлённый plugin-forms до v0.2.0. Плагинная система обрастает мясом.
🔹 Tab-блок и Accordion-блок в Block Kit — теперь можно собирать сложные лендинги прямо из админки. Табы переключаются, аккордеоны сворачиваются. Всё без верстальщика. Хотя сама система затачивается под ИИ-агентов — зачем вообще в админке что-то руками делать?
🔹 media\_picker в Block Kit — превьюшка медиафайла с модальным окном выбора, как в нормальных CMS. Больше никаких «вставь ID картинки».
🔹 CLI в неинтерактивном режиме — create-emdash теперь принимает флаги, можно разворачивать проект в CI без тыканья по стрелочкам.
🔹 emdash secrets CLI — централизованное хранилище секретов для плагинов. Ключи API, токены — всё в одном месте.
🔹 SEO-бонус: favicon теперь вставляется с правильным MIME-типом, редиректы работают для неавторизованных посетителей. Мелочи, которые влияют на индексацию.
ИИ-агентам: MCP-инструменты content\_publish и content\_update стали полноценными — SEO, авторы, даты. Плюс plugin-field-kit и media\_picker означают, что агенты могут создавать контент с кастомными полями и медиа, не заходя в админку. Агенты получают всё больше контроля.
Роадмап всё так же непубличный. Но судя по частоте релизов (v0.4→0.9 за три недели) — у них там спринт без тормозов, либо рой агентов под капотом работает без перерывов на шашлыки =)
#EmDashCMS
Все отдыхали, а ребята выкатили релиз EmDash v0.9.0 1 мая (прямо под праздники, как водится). Не знают, видимо, что всемирный Праздник Весны и Труда — это выходной. Не отдыхают, короче, трудятся.
Что сделали:
🔹 Разобрались с кэшем манифеста — раньше админка могла подвисать со старыми данными после изменений схемы. Теперь манифест собирается заново на каждый запрос, два запроса к базе — и никакой магии с инвалидацией. У меня несколько раз такой баг воспроизводился, теперь не будет
🔹 Два новых плагина — plugin-field-kit (кастомные типы полей, можно слепить хоть яндекс-карту в админке) и обновлённый plugin-forms до v0.2.0. Плагинная система обрастает мясом.
🔹 Tab-блок и Accordion-блок в Block Kit — теперь можно собирать сложные лендинги прямо из админки. Табы переключаются, аккордеоны сворачиваются. Всё без верстальщика. Хотя сама система затачивается под ИИ-агентов — зачем вообще в админке что-то руками делать?
🔹 media\_picker в Block Kit — превьюшка медиафайла с модальным окном выбора, как в нормальных CMS. Больше никаких «вставь ID картинки».
🔹 CLI в неинтерактивном режиме — create-emdash теперь принимает флаги, можно разворачивать проект в CI без тыканья по стрелочкам.
🔹 emdash secrets CLI — централизованное хранилище секретов для плагинов. Ключи API, токены — всё в одном месте.
🔹 SEO-бонус: favicon теперь вставляется с правильным MIME-типом, редиректы работают для неавторизованных посетителей. Мелочи, которые влияют на индексацию.
ИИ-агентам: MCP-инструменты content\_publish и content\_update стали полноценными — SEO, авторы, даты. Плюс plugin-field-kit и media\_picker означают, что агенты могут создавать контент с кастомными полями и медиа, не заходя в админку. Агенты получают всё больше контроля.
Роадмап всё так же непубличный. Но судя по частоте релизов (v0.4→0.9 за три недели) — у них там спринт без тормозов, либо рой агентов под капотом работает без перерывов на шашлыки =)
#EmDashCMS
👍2
Forwarded from Крабоводоведы
В Гермес завезли Канбан:
https://hermes-agent.nousresearch.com/docs/user-guide/features/kanban-tutorial
https://hermes-agent.nousresearch.com/docs/user-guide/features/kanban-tutorial
Nousresearch
Kanban tutorial | Hermes Agent
A walkthrough of the four use-cases the Hermes Kanban system was designed for, with the dashboard open in a browser. If you haven't read the Kanban overview yet, start there — this assumes you know what a task, run, assignee, and dispatcher are.
👍1
По итогам вчерашнего дня:
• подписка ChatGPT за 100 баксов слетела;
• Codex не даёт авторизоваться, требует номер телефона;
• на виртуальные номера смс с подтверждение не приходят;
Такая нестабильная работа, мне нафиг не нужна. Вместо того, чтобы делать проекты, весь день потратился на поиски обхода блокировок и настройку инструментов для работы.
Буду искать более стабильные и подконтрольные варианты реализации рабочего окружания
#мысливслух
• подписка ChatGPT за 100 баксов слетела;
• Codex не даёт авторизоваться, требует номер телефона;
• на виртуальные номера смс с подтверждение не приходят;
Такая нестабильная работа, мне нафиг не нужна. Вместо того, чтобы делать проекты, весь день потратился на поиски обхода блокировок и настройку инструментов для работы.
Буду искать более стабильные и подконтрольные варианты реализации рабочего окружания
#мысливслух
🗿3🫡2
Claude Desktop теперь работает с Ollama Cloud
Ollama 0.23 научилась встраиваться в Claude Desktop как провайдер моделей. Одна команда, и в селекторе моделей появляются qwen, gemma, kimi, ministral. Прямиком из Ollama Cloud, по стоимости подписки Ollama Cloud.
Что это значит на практике. Раньше Claude Desktop (и Claude Code) работал только на моделях Anthropic. Sonnet, Opus — отличные, но дорогие. Подписка $20/мес за Pro, плюс API-токены, если через API. Теперь можно переключиться внутри Claude на qwen3.5:27b или ministral-3:14b и… не платить Anthropic за инференс.
- Быстрый рефакторинг? Ministral-3 — бесплатно.
- Vision-задачи? Gemma4 или qwen3-vl — бесплатно.
- Кодинг на выходных, когда лимиты Sonnet кончились? qwen3.5 — бесплатно.
Ну, почти бесплатно — API-ключ Ollama Cloud всё ещё нужен, но сам инференс моделей там не тарифицируется.
Главный вопрос — а нужна ли вообще подписка Claude Desktop?
Протестировал на тарифе Free — все модели Ollama доступны и денег дополнительно не просят.
Anthropic превращает Claude Desktop из закрытой экосистемы в универсальный хаб, где open-source модели — полноправные граждане. Видимо, поняли, что запирать пользователя в своих моделях — проигрышная стратегия.
На фоне невозможности авторизоваться в Codex — это прям отличный «подгон»! А то я уже в сторону OpenCode смотреть начал, но пока отложу и поработаю с Claude Desktop.
Ollama 0.23 научилась встраиваться в Claude Desktop как провайдер моделей. Одна команда, и в селекторе моделей появляются qwen, gemma, kimi, ministral. Прямиком из Ollama Cloud, по стоимости подписки Ollama Cloud.
Что это значит на практике. Раньше Claude Desktop (и Claude Code) работал только на моделях Anthropic. Sonnet, Opus — отличные, но дорогие. Подписка $20/мес за Pro, плюс API-токены, если через API. Теперь можно переключиться внутри Claude на qwen3.5:27b или ministral-3:14b и… не платить Anthropic за инференс.
- Быстрый рефакторинг? Ministral-3 — бесплатно.
- Vision-задачи? Gemma4 или qwen3-vl — бесплатно.
- Кодинг на выходных, когда лимиты Sonnet кончились? qwen3.5 — бесплатно.
Ну, почти бесплатно — API-ключ Ollama Cloud всё ещё нужен, но сам инференс моделей там не тарифицируется.
Главный вопрос — а нужна ли вообще подписка Claude Desktop?
Протестировал на тарифе Free — все модели Ollama доступны и денег дополнительно не просят.
Anthropic превращает Claude Desktop из закрытой экосистемы в универсальный хаб, где open-source модели — полноправные граждане. Видимо, поняли, что запирать пользователя в своих моделях — проигрышная стратегия.
На фоне невозможности авторизоваться в Codex — это прям отличный «подгон»! А то я уже в сторону OpenCode смотреть начал, но пока отложу и поработаю с Claude Desktop.
👍2
Второй день тестирую Claude Desktop, и размышляю, а нужен ли мне этот инструмент...
Если через него писать код, то я всё равно ничего не понимаю и пушу всё что он напишет и ничего не сверяю и не правлю, а с файлами на локальном компьютере пока не нужно взаимодействовать и он получается не нужным.
По моими ощущениям проще установить OpenClaw/Hermes на компьютер и дать доступ к определенной папке - результат будет такой же, только еще можно через ТГ усправлять.
Если Codex точно приятен и удобен для работы, то Claude Desktop точно не про это. Его преимущество только в моделях под капотом, а когда это модели Ollama Cloud, то можно использовать более привычные для меня инструменты.
Другое дело, что работают по проектам удобнее через Codex/Claude: один чат = один проект, но это не точно...
Пока ощущение бардака - Codex, Claude Desktop, Hermes, OpenClaw и каждого есть кусочек информации о моих проектах, но никто не знает всю инфраструктуру и все проекты полностью. В итоге каждый заход на работу нужно начинать с подгрузки всего контекста по задачам и с анализа локальных папок и git.
#Codex #ClaudeDesktop #Hermes #OpenClaw #Ollama
Если через него писать код, то я всё равно ничего не понимаю и пушу всё что он напишет и ничего не сверяю и не правлю, а с файлами на локальном компьютере пока не нужно взаимодействовать и он получается не нужным.
По моими ощущениям проще установить OpenClaw/Hermes на компьютер и дать доступ к определенной папке - результат будет такой же, только еще можно через ТГ усправлять.
Если Codex точно приятен и удобен для работы, то Claude Desktop точно не про это. Его преимущество только в моделях под капотом, а когда это модели Ollama Cloud, то можно использовать более привычные для меня инструменты.
Другое дело, что работают по проектам удобнее через Codex/Claude: один чат = один проект, но это не точно...
Пока ощущение бардака - Codex, Claude Desktop, Hermes, OpenClaw и каждого есть кусочек информации о моих проектах, но никто не знает всю инфраструктуру и все проекты полностью. В итоге каждый заход на работу нужно начинать с подгрузки всего контекста по задачам и с анализа локальных папок и git.
#Codex #ClaudeDesktop #Hermes #OpenClaw #Ollama
👀2
Из полезного пока я работал, агент тоже работал и собрал базовую версию календаря стартов по триатлону (и не только) - пока парсится только АйронСтар, доведу до ума карточки событий и буду делать фильтрацию и умный SEO-фильтр по городам и типам соревнований
#триатлон #SEO
#триатлон #SEO
Spotify для музыкантов вводит признаки «человек» и «нейронка».
205 апвойсов на Hacker News и общее «ну наконец-то» в комментариях. Народ устал от AI-треков — генерятся пачками, заливаются автоматом, размывают рекомендации. Spotify первым из больших платформ решил: будем маркировать.
Интересно не само нововведение, а куда это катится.
Проблема шире музыки. YouTube, Instagram, любые площадки с пользовательским контентом — везде одинаковый тренд. AI-контент плодится быстрее, чем площадки успевают придумывать правила. Маркировка — первый шаг. Дальше — интереснее: бирка «сделано человеком» станет товаром. Будет стоить денег или давать приоритет в выдаче.
Для тех, кто генерит контент пачками — сигнал: площадки научатся детектить и маркировать. А для живых авторов появляется значок, которого у нейронки пока нет.
Любимый момент: Hermes Agent как раз получил нативную интеграцию со Spotify. Агенты только научились управлять музыкой, а платформа уже вешает бирки «человек — не человек». Скорость, с которой AI заходит на территорию, а площадки пытаются поставить забор — это и есть главный сюжет 2026 года.
#новости
205 апвойсов на Hacker News и общее «ну наконец-то» в комментариях. Народ устал от AI-треков — генерятся пачками, заливаются автоматом, размывают рекомендации. Spotify первым из больших платформ решил: будем маркировать.
Интересно не само нововведение, а куда это катится.
Проблема шире музыки. YouTube, Instagram, любые площадки с пользовательским контентом — везде одинаковый тренд. AI-контент плодится быстрее, чем площадки успевают придумывать правила. Маркировка — первый шаг. Дальше — интереснее: бирка «сделано человеком» станет товаром. Будет стоить денег или давать приоритет в выдаче.
Для тех, кто генерит контент пачками — сигнал: площадки научатся детектить и маркировать. А для живых авторов появляется значок, которого у нейронки пока нет.
Любимый момент: Hermes Agent как раз получил нативную интеграцию со Spotify. Агенты только научились управлять музыкой, а платформа уже вешает бирки «человек — не человек». Скорость, с которой AI заходит на территорию, а площадки пытаются поставить забор — это и есть главный сюжет 2026 года.
#новости
с ИИ-агентами можно создавать сайты, коворили они...
ИИ-агенты упрощают работу, говорили они...
ИИ-агента на самом деле 👆👆👆
По итогу всё починили, но нестабильность работы колоссальная
#косяки
ИИ-агенты упрощают работу, говорили они...
ИИ-агента на самом деле 👆👆👆
По итогу всё починили, но нестабильность работы колоссальная
#косяки
Всем утро доброе!
Еще один косяк работы агентов. Он должен был сконвертировать заметки из формата Evernote в Obsidian и загурзить в отдельную папку. В итоге вместо конвертации текущей заметки, он решил, что уже делал эту работу и пропустил конвертацию самого файла, придумал что 1 заметка пустая, и описал всё это.
При этом скилл автоматизации работы с заметками в Обсидиан у него прописан и там есть информация, что нужно использовать скрипт автоматизации.
Всё больше прихожу к выводу, что ИИ-агентов можно в какой-то ограниченной части работы программы использовать, там где невозмодно четких алгоритмов прописать, а для все остального эффективнее автоматизировать через "тупые программы", которые делают то, что о них ожидаешь.
#размышления #косяки
Еще один косяк работы агентов. Он должен был сконвертировать заметки из формата Evernote в Obsidian и загурзить в отдельную папку. В итоге вместо конвертации текущей заметки, он решил, что уже делал эту работу и пропустил конвертацию самого файла, придумал что 1 заметка пустая, и описал всё это.
При этом скилл автоматизации работы с заметками в Обсидиан у него прописан и там есть информация, что нужно использовать скрипт автоматизации.
Всё больше прихожу к выводу, что ИИ-агентов можно в какой-то ограниченной части работы программы использовать, там где невозмодно четких алгоритмов прописать, а для все остального эффективнее автоматизировать через "тупые программы", которые делают то, что о них ожидаешь.
#размышления #косяки
🕊2
При этом вещи связанные с кодом делают. Не на "Ура!", но делают:
• 1 промт сделай калькулятор Триатлона
• 5 минут работы
• 2 дня мелких корректировок и правок (суммарно на час чистой работы)
и, я готов, представить калькулятор триатлона.
Лучший в своём роде!
https://dimino.me/triatlon/calc/
#триатлон
• 1 промт сделай калькулятор Триатлона
• 5 минут работы
• 2 дня мелких корректировок и правок (суммарно на час чистой работы)
и, я готов, представить калькулятор триатлона.
Лучший в своём роде!
https://dimino.me/triatlon/calc/
#триатлон
👍1
Please open Telegram to view this post
VIEW IN TELEGRAM
Немного подробнее про генератор вселенных на Hermes Agent (Из поста выше). Он называется Noustiny.
Штука в том, что ты не пишешь сценарий. Бросаешь «семечко» — завязку, идею, пару персонажей — а система разворачивает из него дерево сюжетных веток. Захотел в середине истории добавить сцену, где герой сворачивает не туда? Вставляешь — и следующие события переписываются сами. Персонаж при этом не плывёт визуально: образ держится единым через всю историю.
Голос клонируется через ElevenLabs — можно скинуть ссылку на YouTube, и рассказчик заговорит нужным тембром. На выходе — готовое видео, можно публиковать.
Интересно даже не то, что видео генерится. А то, что меняется сам подход к нарративу: история перестаёт быть линией и становится пространством вариантов. Написал — и пошёл гулять по веткам.
Технически это не просто скилл упакованный в одном файле, а 12 инструментов на Python, 13 скиллов, два цикла обработки.
https://github.com/UfukNode/Noustiny
#Hermes
Штука в том, что ты не пишешь сценарий. Бросаешь «семечко» — завязку, идею, пару персонажей — а система разворачивает из него дерево сюжетных веток. Захотел в середине истории добавить сцену, где герой сворачивает не туда? Вставляешь — и следующие события переписываются сами. Персонаж при этом не плывёт визуально: образ держится единым через всю историю.
Голос клонируется через ElevenLabs — можно скинуть ссылку на YouTube, и рассказчик заговорит нужным тембром. На выходе — готовое видео, можно публиковать.
Интересно даже не то, что видео генерится. А то, что меняется сам подход к нарративу: история перестаёт быть линией и становится пространством вариантов. Написал — и пошёл гулять по веткам.
Технически это не просто скилл упакованный в одном файле, а 12 инструментов на Python, 13 скиллов, два цикла обработки.
https://github.com/UfukNode/Noustiny
#Hermes
Forwarded from Сергей Пименов
Наткнулся на статью, которая дала мне новый взгляд на Codex Desktop. Автор — Meta Alchemist — описал штуку, до которой я сам не додумался: оказывается, Codex Desktop можно использовать не как терминал для кода, а как полноценный визуальный конструктор интерфейсов.
Суть простая: Codex собирает UI, запускает его, делает скриншот, смотрит на результат через vision, находит косяки, правит и повторяет — пока не станет хорошо. Плюс генерирует ассеты через imagegen и даже проводит A/B-тесты вариантов прямо в процессе. То есть дизайн-цикл, который обычно занимает часы ручного тыканья, сворачивается в несколько итераций.
Я перевёл и адаптировал статью — с промптами, воркфлоу и мастер-промптом, который можно скопировать и сразу применить. Там есть примеры для игровых интерфейсов, продуктовых дашбордов и даже извлечение art bible из готового проекта.
Если вы работаете с Codex и до сих пор используете его как умную командную строку — почитайте, это реально другой уровень.
Статья на сайте: https://pimenov.ai/articles/codex-desktop-visual-design-loop/
Суть простая: Codex собирает UI, запускает его, делает скриншот, смотрит на результат через vision, находит косяки, правит и повторяет — пока не станет хорошо. Плюс генерирует ассеты через imagegen и даже проводит A/B-тесты вариантов прямо в процессе. То есть дизайн-цикл, который обычно занимает часы ручного тыканья, сворачивается в несколько итераций.
Я перевёл и адаптировал статью — с промптами, воркфлоу и мастер-промптом, который можно скопировать и сразу применить. Там есть примеры для игровых интерфейсов, продуктовых дашбордов и даже извлечение art bible из готового проекта.
Если вы работаете с Codex и до сих пор используете его как умную командную строку — почитайте, это реально другой уровень.
Статья на сайте: https://pimenov.ai/articles/codex-desktop-visual-design-loop/