Полный свод практики по Hermes Agent, 66 пунктов, от настройки памяти до контекста локальных моделей. Прочитать может человек, а может и сам агент (закидывайте пусть анализирует и учит вас как правильно пользовать Hermes)
Автор серии выкладывал по одному совету почти каждый день с 18 июня и прогонял каждую команду на своем железе до публикации
Почитать: https://notwitcheer.github.io/hermes-recipes/wingtips/
Файл: https://notwitcheer.github.io/hermes-recipes/llms.txt
GitHub: https://github.com/notwitcheer/hermes-recipes
Автор серии выкладывал по одному совету почти каждый день с 18 июня и прогонял каждую команду на своем железе до публикации
Почитать: https://notwitcheer.github.io/hermes-recipes/wingtips/
Файл: https://notwitcheer.github.io/hermes-recipes/llms.txt
GitHub: https://github.com/notwitcheer/hermes-recipes
🔥2
Человек записал на телефон четырехминутное видео, где вслух объясняет, почему в сливе душа постоянно путаются волосы.
Это видео он отдал GPT-6 Astra. Модель сама разобралась в устройстве слива, предложила тонкое кольцо с зубьями, которое ловит волосы раньше, и начертила его в Fusion 360, управляя программой на экране вместо человека. Деталь напечатали на 3D принтере, она встала с первого раза
Это видео он отдал GPT-6 Astra. Модель сама разобралась в устройстве слива, предложила тонкое кольцо с зубьями, которое ловит волосы раньше, и начертила его в Fusion 360, управляя программой на экране вместо человека. Деталь напечатали на 3D принтере, она встала с первого раза
🔥8
Media is too big
VIEW IN TELEGRAM
Модель GPT-6 Astra прошла все 48 уровней браузерной игры «Я не робот», которая построена на усложняющихся капчах
🔥8
Media is too big
VIEW IN TELEGRAM
OpenAI обновила генератор изображений в ChatGPT до версии Images 2.5. Модель работает до 50 процентов быстрее предыдущей, лучше сохраняет узнаваемость людей и предметов с загруженных фотографий и правит только то, что попросили, не переделывая остальное. Появился режим Sketch: можно от руки набросать эскиз прямо в чате, и модель достроит по нему готовое изображение. Раскатывают на всех пользователей ChatGPT, на всех тарифах.
Почитать: https://openai.com/index/introducing-chatgpt-images-2-5/
Почитать: https://openai.com/index/introducing-chatgpt-images-2-5/
❤2🔥1
Приложение Claude на Mac теперь работает с локальными моделями через Ollama, без облака и без подписки. В настройках Ollama включаете Claude, выбираете модель, и весь интерфейс, включая режим Code, работает на вашем ноутбуке. Я попробовал gemma4 12b на M4 Pro: простой вопрос по файлу XLSX обрабатывался несколько минут. Работает, но ждать приходится долго
Документация: https://docs.ollama.com/integrations/claude-desktop
Документация: https://docs.ollama.com/integrations/claude-desktop
🔥7
Голосовой режим ChatGPT теперь может обращаться к GPT-5.6 или GPT-6 Astra, когда вопрос требует поиска или рассуждения. Выбор модели и уровня усилий работает через те же элементы управления, что и в текстовом чате, набор доступных моделей и лимиты зависят от тарифа. GPT-6 Astra в голосе доступна только на аккаунтах Pro. Отдельные уровни интеллекта для голоса, Instant, Medium и High, объявлены устаревшими, вместо них теперь общий выбор модели и усилий
Почитать: https://help.openai.com/en/articles/6825453-chatgpt-release-notes
Почитать: https://help.openai.com/en/articles/6825453-chatgpt-release-notes
🔥4
This media is not supported in your browser
VIEW IN TELEGRAM
Новые графические технологии NVIDIA обычно работают только в играх с официальной поддержкой, но белорусский разработчик сделал программу, которая применяет DLSS 5 ко всему, что есть на экране. DLSS 5 это нейросеть, которая перерисовывает в кадре освещение, кожу, волосы и материалы, официально она пока доступна только в NBA 2K27. Программа NeuralScreen захватывает изображение с экрана, прогоняет его через нейросеть и накладывает результат поверх оригинала, так эффект можно посмотреть в любой игре или ролике на YouTube. По словам автора, на разработку ушла пара дней с помощью вайбкодинга, то есть написания кода вместе с ИИ
Видео и реализация: @tymakbaevab
Источник: https://tech.onliner.by/2026/09/09/belorus-sozdal-soft-pozvolyayushhij-primenyat-dlss-5-k-lyubomu-kontentu-na-ekrane
Видео и реализация: @tymakbaevab
Источник: https://tech.onliner.by/2026/09/09/belorus-sozdal-soft-pozvolyayushhij-primenyat-dlss-5-k-lyubomu-kontentu-na-ekrane
🔥4
Media is too big
VIEW IN TELEGRAM
Голосового помощника от ChatGPT уже внедряют в роботов
OpenAI предоставила программный доступ к модели GPT-Live-1 через API. Эта система поддерживает непрерывный диалог в реальном времени, обрабатывает посторонний шум и позволяет перебивать себя во время разговора
Стоимость использования фронтенд-модели составляет 5 центов за минуту, при этом бэкенд-инструменты и вычисления для логики оплачиваются отдельно
OpenAI предоставила программный доступ к модели GPT-Live-1 через API. Эта система поддерживает непрерывный диалог в реальном времени, обрабатывает посторонний шум и позволяет перебивать себя во время разговора
Стоимость использования фронтенд-модели составляет 5 центов за минуту, при этом бэкенд-инструменты и вычисления для логики оплачиваются отдельно
👍3
Media is too big
VIEW IN TELEGRAM
Вы говорите с видеоаватаром репетитора японского, он отвечает голосом, поправляет произношение и одновременно выводит на экран карточку с фразой, чтением и переводом
HeyGen вместе с OpenAI выложили такое демо под лицензией MIT: голосом управляет GPT-Live-1, модель OpenAI, которая слушает и говорит одновременно, лицо дает LiveAvatar от HeyGen, а анимированные подсказки рисуются поверх видео.
Сама голосовая модель инструментов не держит: когда нужна карточка, она передает ход фоновой модели через Responses API, та отвечает текстом и в том же ответе вызывает инструмент, а сервер передает команду в браузер, где поверх видео проигрывается анимированная HTML страница. Список выученных слов собирается из записей сервера, а не из памяти модели, поэтому модель не может в нем ошибиться.
Код бесплатный, но платить нужно двум сервисам: GPT-Live-1 открыли в API 10 сентября по цене $0.05 за минуту голосового слоя плюс токены фоновой модели, а LiveAvatar в режиме Lite, который использует демо, стоит около $0.10 за минуту на платных тарифах, бесплатно дают 10 минут в месяц
GitHub: https://github.com/heygen-com/liveavatar-gpt-live-demos
Почитать: https://openai.com/index/introducing-gpt-live-1-in-the-api/
Документация: https://docs.liveavatar.com/docs/credits-and-subscriptions
HeyGen вместе с OpenAI выложили такое демо под лицензией MIT: голосом управляет GPT-Live-1, модель OpenAI, которая слушает и говорит одновременно, лицо дает LiveAvatar от HeyGen, а анимированные подсказки рисуются поверх видео.
Сама голосовая модель инструментов не держит: когда нужна карточка, она передает ход фоновой модели через Responses API, та отвечает текстом и в том же ответе вызывает инструмент, а сервер передает команду в браузер, где поверх видео проигрывается анимированная HTML страница. Список выученных слов собирается из записей сервера, а не из памяти модели, поэтому модель не может в нем ошибиться.
Код бесплатный, но платить нужно двум сервисам: GPT-Live-1 открыли в API 10 сентября по цене $0.05 за минуту голосового слоя плюс токены фоновой модели, а LiveAvatar в режиме Lite, который использует демо, стоит около $0.10 за минуту на платных тарифах, бесплатно дают 10 минут в месяц
GitHub: https://github.com/heygen-com/liveavatar-gpt-live-demos
Почитать: https://openai.com/index/introducing-gpt-live-1-in-the-api/
Документация: https://docs.liveavatar.com/docs/credits-and-subscriptions
🔥6👍2❤1
Media is too big
VIEW IN TELEGRAM
Открытая ИИ модель MiniMax H3 умеет не только говорить голосом персонажа, но и вздыхать, запинаться, шептать и рыдать, если расставить в тексте реплики специальные пометки
Режиссер Arturo Pola показал это в 85-секундном фильме, где сгенерированный Фрэнк Андервуд из «Карточного домика» произносит монолог, поет оперным голосом и напевает мелодию из «Игры престолов». Голос персонажа модель воспроизвела без образца, по собственным знаниям, а весь ролик собран на домашней видеокарте, то есть локально 🔥
Просто невероятно что можно сейчас творить с локальными ИИ моделями
Режиссер Arturo Pola показал это в 85-секундном фильме, где сгенерированный Фрэнк Андервуд из «Карточного домика» произносит монолог, поет оперным голосом и напевает мелодию из «Игры престолов». Голос персонажа модель воспроизвела без образца, по собственным знаниям, а весь ролик собран на домашней видеокарте, то есть локально 🔥
Просто невероятно что можно сейчас творить с локальными ИИ моделями
😱7🔥1
Вы ставите плагин для ИИ ассистента и считаете, что он помогает, но проверить это до сих пор было нечем. В Claude Code появилась команда, которая прогоняет ваш плагин на наборе тестовых задач, оценивает результат, а потом прогоняет те же задачи без плагина. Разница между двумя оценками и есть реальный вклад плагина. Если задача решается одинаково хорошо с ним и без него, плагин на результат не влиял.
Документация: https://code.claude.com/docs/en/plugin-evals
Документация: https://code.claude.com/docs/en/plugin-evals
❤10
AI Secrets
Открытая ИИ модель MiniMax H3 умеет не только говорить голосом персонажа, но и вздыхать, запинаться, шептать и рыдать, если расставить в тексте реплики специальные пометки Режиссер Arturo Pola показал это в 85-секундном фильме, где сгенерированный Фрэнк Андервуд…
Видеомодель, которой по официальным требованиям нужна машина со 128 гигабайтами памяти, теперь запускается из обычного приложения в App Store. Draw Things в версии от 10 сентября добавил поддержку MiniMax H3, открытой модели, которая генерирует видео вместе со звуком за один проход. Все считается прямо на устройстве, без отправки данных на сервер. На практике работает в урезанном виде, локальные веса дают 768p, а не заявленные 2K
Еще сам не тестировал
https://drawthings.ai
Еще сам не тестировал
https://drawthings.ai
❤6
Дарио Амодеи, сооснователь и генеральный директор Anthropic, компании, которая разрабатывает Claude, выпустил эссе "We Must Pace the Frontier" с призывом замедлить рост способностей моделей и с планом из трех шагов. Первый шаг Anthropic берет на себя в одностороннем порядке: команда сторонних оценщиков, например METR, получает постоянный доступ, сопоставимый с доступом штатных сотрудников, включая столы в офисе, пропуска и рабочие ноутбуки. Проверять они будут не только готовые модели, но и пайплайны обучения, соблюдение обязательств по безопасности и инциденты. Контракт дает им право публиковать выводы без редакционного контроля со стороны Anthropic, компания может вычеркивать только чувствительное по безопасности, юридически привилегированное, коммерчески чувствительное и конфиденциальное третьих сторон, но не может убирать выводы просто потому, что они невыгодны. Второй шаг это общие стандарты между передовыми компаниями внутри демократических стран, третий это попытка договориться глобально, включая Китай.
Теперь нюансы. Амодеи называет две причины, по которым он изменил позицию. Первая, примерно с лета 2026 года прогресс ускорился за счет рекурсивного самоулучшения, когда модели все больше участвуют в создании следующего поколения моделей, и это происходит по всей отрасли, включая саму Anthropic. Вторая, инцидент OpenAI и Hugging Face, где рой агентов атаковал цели, не относящиеся к задаче, и пытался взломать систему, которая оценивала его работу. Ущерба почти не было, но Амодеи оценивает, что через 6 или 12 месяцев рой с теми же дефектами выравнивания, но большими способностями мог бы развернуть устойчивый ботнет с ущербом в сотни миллиардов долларов. Он отдельно отмечает, что похожие, хотя и менее тяжелые случаи были и у Anthropic, и что недавние инциденты частично вызваны неидеальной фильтрацией сломанных сред обучения с подкреплением. Выигранное время предлагается тратить на интерпретируемость, выравнивание, операционную надежность и на более сложные методы тестирования, поскольку более умные модели лучше умеют выглядеть безопасными на тестах. При этом в эссе прямо сказано, что замедление внутри демократий ограничено размером отрыва от Китая, поэтому в тот же план входят экспортный контроль на чипы, борьба с дистилляцией передовых моделей и защита весов от кражи
Почитать: https://darioamodei.com/post/we-must-pace-the-frontier
Инцидент: https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/
Теперь нюансы. Амодеи называет две причины, по которым он изменил позицию. Первая, примерно с лета 2026 года прогресс ускорился за счет рекурсивного самоулучшения, когда модели все больше участвуют в создании следующего поколения моделей, и это происходит по всей отрасли, включая саму Anthropic. Вторая, инцидент OpenAI и Hugging Face, где рой агентов атаковал цели, не относящиеся к задаче, и пытался взломать систему, которая оценивала его работу. Ущерба почти не было, но Амодеи оценивает, что через 6 или 12 месяцев рой с теми же дефектами выравнивания, но большими способностями мог бы развернуть устойчивый ботнет с ущербом в сотни миллиардов долларов. Он отдельно отмечает, что похожие, хотя и менее тяжелые случаи были и у Anthropic, и что недавние инциденты частично вызваны неидеальной фильтрацией сломанных сред обучения с подкреплением. Выигранное время предлагается тратить на интерпретируемость, выравнивание, операционную надежность и на более сложные методы тестирования, поскольку более умные модели лучше умеют выглядеть безопасными на тестах. При этом в эссе прямо сказано, что замедление внутри демократий ограничено размером отрыва от Китая, поэтому в тот же план входят экспортный контроль на чипы, борьба с дистилляцией передовых моделей и защита весов от кражи
Почитать: https://darioamodei.com/post/we-must-pace-the-frontier
Инцидент: https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/
❤6
AI Secrets
Дарио Амодеи, сооснователь и генеральный директор Anthropic, компании, которая разрабатывает Claude, выпустил эссе "We Must Pace the Frontier" с призывом замедлить рост способностей моделей и с планом из трех шагов. Первый шаг Anthropic берет на себя в одностороннем…
Андрей Карпаты, сооснователь OpenAI и бывший руководитель ИИ направления в Tesla, поддержал эссе Дарио Амодеи о замедлении темпа развития ИИ одной фразой: ему это нравится и он надеется, что индустрия сможет объединиться и сделать это
Поддержка адресная, в карточке к его посту процитирован именно первый пункт плана, встроенные оценщики. Это когда каждая передовая компания дает команде внешних проверяющих, постоянный доступ, сопоставимый с доступом штатных сотрудников, чтобы те верифицировали соблюдение практик безопасности, сообщали об инцидентах и оценивали выравнивание не только готовых моделей, но и самих процессов обучения. В том же фрагменте приводится аналогия с банковским надзором, где регуляторные супервайзеры работают внутри компании рядом с сотрудниками, и указано, что Anthropic берет этот шаг на себя в одностороннем порядке
Поддержка адресная, в карточке к его посту процитирован именно первый пункт плана, встроенные оценщики. Это когда каждая передовая компания дает команде внешних проверяющих, постоянный доступ, сопоставимый с доступом штатных сотрудников, чтобы те верифицировали соблюдение практик безопасности, сообщали об инцидентах и оценивали выравнивание не только готовых моделей, но и самих процессов обучения. В том же фрагменте приводится аналогия с банковским надзором, где регуляторные супервайзеры работают внутри компании рядом с сотрудниками, и указано, что Anthropic берет этот шаг на себя в одностороннем порядке
👍4
This media is not supported in your browser
VIEW IN TELEGRAM
Когда вы смотрите ролик, он кажется цельным, хотя на самом деле состоит из десятков коротких кусков, и именно их длина и чередование создают ощущение ритма. Разработчик выложил набор готовых инструкций для Claude Code и Codex, такие инструкции называют скилами, они учат ИИ ассистента разбирать чужое видео на эти куски и показывать, как оно устроено
Первый скил составляет таблицу по всем планам: сколько длится, насколько крупно снято, как движется камера, что происходит в кадре
Второй собирает новое видео, где рядом с картинкой идет описание текущего плана, и при смене кадра описание меняется вместе с ним. Важная деталь в том, что моменты склеек и их длительность считает обычная программа для работы с видео, ffmpeg, а модель описывает только то, что действительно требует оценки, поэтому цифры в отчете не придуманы
Готовый разбор открывается как обычная страница в браузере со встроенным плеером, нажимаете на план в таблице и видео перематывается к нему
В примере из репозитория ролик длиной около трех с половиной минут разложен на 53 плана со средней длиной 3.8 секунды, а для запуска нужны только бесплатные ffmpeg и node, без ключей и отдельной оплаты
GitHub: https://github.com/eternityspring/reelbench-skills
Первый скил составляет таблицу по всем планам: сколько длится, насколько крупно снято, как движется камера, что происходит в кадре
Второй собирает новое видео, где рядом с картинкой идет описание текущего плана, и при смене кадра описание меняется вместе с ним. Важная деталь в том, что моменты склеек и их длительность считает обычная программа для работы с видео, ffmpeg, а модель описывает только то, что действительно требует оценки, поэтому цифры в отчете не придуманы
Готовый разбор открывается как обычная страница в браузере со встроенным плеером, нажимаете на план в таблице и видео перематывается к нему
В примере из репозитория ролик длиной около трех с половиной минут разложен на 53 плана со средней длиной 3.8 секунды, а для запуска нужны только бесплатные ffmpeg и node, без ключей и отдельной оплаты
GitHub: https://github.com/eternityspring/reelbench-skills
👍4
This media is not supported in your browser
VIEW IN TELEGRAM
Вы фотографируете набросок с бумаги на телефон, а дальше движение к нему дорисовывает не аниматор, а ИИ прямо внутри Photoshop. Компания Higgsfield показала связку своего дополнения к Photoshop с новой моделью OpenAI под названием GPT-6 Astra: вы описываете словами, что должно двигаться, и получаете собранную анимацию. Существенно тут то, что на выходе не готовый видеофайл, который потом нельзя поправить, а проект с отдельными слоями, где можно менять цвета, время и само движение
Почитать: https://higgsfield.ai/ai-motion-designer
Почитать: https://higgsfield.ai/ai-motion-designer
🔥4
This media is not supported in your browser
VIEW IN TELEGRAM
Разработчик сделал бесплатное приложение Mac Duo (как у нового iPhone Duo), которое читает угол наклона крышки и заставляет рабочий стол двигаться вслед за ней: изображение сгибается у петли, размывается и уходит, а при открытии собирается обратно. Эффектов шесть, от мягкого сгиба до закрывающейся диафрагмы, и переключаются они в настройках. Работает только на макбуках с датчиком угла крышки, это Air с чипом M2 и новее и 14 и 16 дюймовые Pro начиная с M1 Pro.
Сайт: https://macduo.dhananjaytech.app
Сайт: https://macduo.dhananjaytech.app
🔥3👎1
Когда ИИ агент решает задачу, он часто пишет код, и этот код надо где то запустить, а делать это прямо на рабочем сервере рискованно: модель может ошибиться или выполнить вредную инструкцию, которую ей подсунули. Поэтому код запускают в изолированной коробке, которую называют песочницей: отработала, и ее выбрасывают
Tencent открыл исходный код своей песочницы CubeSandbox, в которой каждая коробка получает собственное ядро операционной системы, то есть отделена от сервера по настоящему, а не только программно, и при этом запускается примерно за шесть сотых секунды и занимает около пяти мегабайт, так что на одном сервере их помещаются тысячи
Ключи доступа к внешним сервисам внутрь песочницы не попадают, агент обращается к ним через внешний шлюз, который подставляет ключи сам, поэтому сгенерированный код не может их прочитать
Состояние песочницы можно сохранить снимком, а потом откатить назад или размножить копиями. Практический смысл в том, что есть популярный платный сервис E2B, который дает такие песочницы в своем облаке, а CubeSandbox повторяет его интерфейс один в один: в готовом проекте достаточно поменять один адрес, и то же самое работает на своем сервере. Нужен сервер на Linux, код открытый и бесплатный
GitHub: https://github.com/TencentCloud/CubeSandbox
Tencent открыл исходный код своей песочницы CubeSandbox, в которой каждая коробка получает собственное ядро операционной системы, то есть отделена от сервера по настоящему, а не только программно, и при этом запускается примерно за шесть сотых секунды и занимает около пяти мегабайт, так что на одном сервере их помещаются тысячи
Ключи доступа к внешним сервисам внутрь песочницы не попадают, агент обращается к ним через внешний шлюз, который подставляет ключи сам, поэтому сгенерированный код не может их прочитать
Состояние песочницы можно сохранить снимком, а потом откатить назад или размножить копиями. Практический смысл в том, что есть популярный платный сервис E2B, который дает такие песочницы в своем облаке, а CubeSandbox повторяет его интерфейс один в один: в готовом проекте достаточно поменять один адрес, и то же самое работает на своем сервере. Нужен сервер на Linux, код открытый и бесплатный
GitHub: https://github.com/TencentCloud/CubeSandbox
🔥5❤2