Автоматизация действий на компьютере с Computer Use от Codex и Claude Code
Десктопные Codex ChatGPT и Claude Code изначально развивались как инструменты для разработчиков, но в последние месяцы становятся популярны уже и у не-технарей. OpenAI ещё в апреле сменил позиционирование, анонсировав новый Codex for Everything.
Если раньше эти агентские системы умели использовать встроенные коннекторы и интеграции с различными сервисами, а также давали возможность устанавливать кастомные MCP серверы и навыки (что уже позволяет закрыть львиную долю задач по автоматизации процессов), то недавно была добавлена возможность агентам буквально «видеть» экран и управлять курсором мыши.
Это буквально развязывает «руки» агентам и позволяет им работать с абсолютно любыми программами и веб-сайтами, как это делает человек. И антибот системам защиты практически нереально отследить, что их интерфейсом сейчас пользуется не человек.
Это открывает возможность для автоматизации уже практически любых процессов, особенно таких, где нет публичных или доступных API или MCP для интеграции или они стоят очень дорого - как, например, в случае с API X (Twitter), WhatsApp, Instagram и т.д.
Как понять, что задачу стоит автоматизировать? Проверьте - если она:
• Повторяется регулярно или ежедневно
• Занимает более 3-5 минут
• Имеет понятные измеримые критерии результата на выходе
• Может быть повторена почти любым человеком удалённо за компьютером
То скорее всего её можно поручить агенту и повесить на выполнение по расписанию или триггеру - в Codex это Automations, в Claude Code - это Scheduled tasks / Hooks (когда запускается локально с компьютера) и Routines (когда запускается и выполняется в облаке)
Если же есть понимание, что таких процессов много и нужно, чтобы они выполнялись 24/7 независимо от включенности компьютера - то здесь уже стоит задуматься об использовании автономных агентов типа OpenClaw / Hermes на собственном облачном сервере, но это требует некоторой технической подготовки и более глубокого погружения - об этом чуть позже также выпущу цикл статей.
Десктопные Codex ChatGPT и Claude Code изначально развивались как инструменты для разработчиков, но в последние месяцы становятся популярны уже и у не-технарей. OpenAI ещё в апреле сменил позиционирование, анонсировав новый Codex for Everything.
Если раньше эти агентские системы умели использовать встроенные коннекторы и интеграции с различными сервисами, а также давали возможность устанавливать кастомные MCP серверы и навыки (что уже позволяет закрыть львиную долю задач по автоматизации процессов), то недавно была добавлена возможность агентам буквально «видеть» экран и управлять курсором мыши.
Это буквально развязывает «руки» агентам и позволяет им работать с абсолютно любыми программами и веб-сайтами, как это делает человек. И антибот системам защиты практически нереально отследить, что их интерфейсом сейчас пользуется не человек.
Это открывает возможность для автоматизации уже практически любых процессов, особенно таких, где нет публичных или доступных API или MCP для интеграции или они стоят очень дорого - как, например, в случае с API X (Twitter), WhatsApp, Instagram и т.д.
Как понять, что задачу стоит автоматизировать? Проверьте - если она:
• Повторяется регулярно или ежедневно
• Занимает более 3-5 минут
• Имеет понятные измеримые критерии результата на выходе
• Может быть повторена почти любым человеком удалённо за компьютером
То скорее всего её можно поручить агенту и повесить на выполнение по расписанию или триггеру - в Codex это Automations, в Claude Code - это Scheduled tasks / Hooks (когда запускается локально с компьютера) и Routines (когда запускается и выполняется в облаке)
Если же есть понимание, что таких процессов много и нужно, чтобы они выполнялись 24/7 независимо от включенности компьютера - то здесь уже стоит задуматься об использовании автономных агентов типа OpenClaw / Hermes на собственном облачном сервере, но это требует некоторой технической подготовки и более глубокого погружения - об этом чуть позже также выпущу цикл статей.
👍3🔥2
This media is not supported in your browser
VIEW IN TELEGRAM
Ускоряем печать, переходя на голос
Судя по трендам в X, Threads и GitHub, текущий месяц стал месяцем разработки собственных инструментов автоматизации голосового ввода. Каждый уважающий себя разработчик (и не только) написал собственную «диктовалку» и гордо выложил её в открытый доступ 🙂
Однако завайбкодить своё и иметь на выходе качественный продукт - это далеко не одно и то же.
И если вас интересует в первую очередь второе - то эта статья для вас.
Сегодня хочу рассказать про WhisprFlow - инструмент, по праву считающийся №1 среди бесчисленного множества инструментов подобного типа.
Основная функция, как и у всех альтернатив - это возможность печатать текст в любое поле ввода в любом месте, просто наговаривая его вслух на естественном языке. Система в реальном времени распознает сказанное и переводит это в текст, кратно повышая скорость коммуникации, что особенно важно при взаимодействии с ИИ-агентами, где самым медленным звеном являешься ты сам 🙂
Многие сейчас строят собственные аналоги или используют бесплатные opensource решения, которые работают через локальную библиотеку Whisper, которую OpenAI выложил в открытый доступ ещё в 22 году. И это имеет смысл, если вы хотите сэкономить, или, что особенно важно в бизнесе - не хотите, чтобы данные покидали ваш корпоративный контур.
Но для большинства людей это может быть технически сложно и избыточно, и хотелось бы просто использовать готовое универсальное решение из коробки. И именно им является WhisprFlow - кросс-платформенная утилита, которая работает на любом устройстве, включая мобильные на iOS и Android (кстати, на андроид интеграция максимально нативная и бесшовная).
И ключевой особенностью, которой нет пока что у бесплатных опенсорс аналогов (по крайней мере, на таком уровне) является адаптивность системы под контекст приложения. Текст автоматически стилизуется под стиль приложения, в котором происходит диктовка, и это можно дополнительно настраивать. В whatsapp или телеграм это будет неформальный и живой формат, в почте - более взвешенный и с деловым этикетом, в Word и Google Docs - предельно чёткий и структурированный.
Кроме того, из текста будут автоматически вырезаны все слова-паразиты и речевые обороты, хоть и приемлемые в живом диалоге, но некорректные для письменного стиля. И именно эта постобработка, при этом происходящая мгновенно в реальном времени, в сочетании с возможностью стилизации текста и общей скоростью работы транскрипции - делает WhisprFlow (на мой субъективный взгляд) наиболее сильным продуктом в данный момент, не имеющим (пока) качественных аналогов (если у вас другое мнение на этот счёт - расскажите в комментах). А ещё он отлично распознает имена и специфичные термины, с чем есть проблемы у всех остальных сервисов, использующих голый Whisper под капотом, без доп. обработки и словарей.
Что касается стоимости - для многих может хватить бесплатного тарифа, включающего 2000 слов в неделю на компьютере и 1000 слов на iPhone. А на Android сейчас вообще пока временно бесплатный тариф без ограничений. А полноценный платный тариф начинается от €12 в месяц.
В общем, подводя итог - пользуюсь сам и рекомендую. Хотя у меня есть и локально установленный Whisper, и бесплатная сверхбыстрая real-time транскрипция через Groq, которые использую для агентов Hermes / OpenClaw и саммаризации звонков и онлайн-встреч. Но пока для обычных повседневных задач выбираю WisprFlow за его умность и адаптивность.
Судя по трендам в X, Threads и GitHub, текущий месяц стал месяцем разработки собственных инструментов автоматизации голосового ввода. Каждый уважающий себя разработчик (и не только) написал собственную «диктовалку» и гордо выложил её в открытый доступ 🙂
Однако завайбкодить своё и иметь на выходе качественный продукт - это далеко не одно и то же.
И если вас интересует в первую очередь второе - то эта статья для вас.
Сегодня хочу рассказать про WhisprFlow - инструмент, по праву считающийся №1 среди бесчисленного множества инструментов подобного типа.
Основная функция, как и у всех альтернатив - это возможность печатать текст в любое поле ввода в любом месте, просто наговаривая его вслух на естественном языке. Система в реальном времени распознает сказанное и переводит это в текст, кратно повышая скорость коммуникации, что особенно важно при взаимодействии с ИИ-агентами, где самым медленным звеном являешься ты сам 🙂
Многие сейчас строят собственные аналоги или используют бесплатные opensource решения, которые работают через локальную библиотеку Whisper, которую OpenAI выложил в открытый доступ ещё в 22 году. И это имеет смысл, если вы хотите сэкономить, или, что особенно важно в бизнесе - не хотите, чтобы данные покидали ваш корпоративный контур.
Но для большинства людей это может быть технически сложно и избыточно, и хотелось бы просто использовать готовое универсальное решение из коробки. И именно им является WhisprFlow - кросс-платформенная утилита, которая работает на любом устройстве, включая мобильные на iOS и Android (кстати, на андроид интеграция максимально нативная и бесшовная).
И ключевой особенностью, которой нет пока что у бесплатных опенсорс аналогов (по крайней мере, на таком уровне) является адаптивность системы под контекст приложения. Текст автоматически стилизуется под стиль приложения, в котором происходит диктовка, и это можно дополнительно настраивать. В whatsapp или телеграм это будет неформальный и живой формат, в почте - более взвешенный и с деловым этикетом, в Word и Google Docs - предельно чёткий и структурированный.
Кроме того, из текста будут автоматически вырезаны все слова-паразиты и речевые обороты, хоть и приемлемые в живом диалоге, но некорректные для письменного стиля. И именно эта постобработка, при этом происходящая мгновенно в реальном времени, в сочетании с возможностью стилизации текста и общей скоростью работы транскрипции - делает WhisprFlow (на мой субъективный взгляд) наиболее сильным продуктом в данный момент, не имеющим (пока) качественных аналогов (если у вас другое мнение на этот счёт - расскажите в комментах). А ещё он отлично распознает имена и специфичные термины, с чем есть проблемы у всех остальных сервисов, использующих голый Whisper под капотом, без доп. обработки и словарей.
Что касается стоимости - для многих может хватить бесплатного тарифа, включающего 2000 слов в неделю на компьютере и 1000 слов на iPhone. А на Android сейчас вообще пока временно бесплатный тариф без ограничений. А полноценный платный тариф начинается от €12 в месяц.
В общем, подводя итог - пользуюсь сам и рекомендую. Хотя у меня есть и локально установленный Whisper, и бесплатная сверхбыстрая real-time транскрипция через Groq, которые использую для агентов Hermes / OpenClaw и саммаризации звонков и онлайн-встреч. Но пока для обычных повседневных задач выбираю WisprFlow за его умность и адаптивность.
🔥4❤1
AIматизация | ИИ в жизни и бизнесе
Ускоряем печать, переходя на голос Судя по трендам в X, Threads и GitHub, текущий месяц стал месяцем разработки собственных инструментов автоматизации голосового ввода. Каждый уважающий себя разработчик (и не только) написал собственную «диктовалку» и гордо…
Для тех же, кому важна приватность данных и чтобы вся обработка происходила локально и без интернета (например, в корпоративном контуре), и при этом у вас есть мощный видеочип на ноутбуке / видеокарта в компьютере, чтобы не ждать по 30-40 секунд результатов транскрибации - рекомендую Handy либо OpenWhispr.
Они максимально приближены по функционалу к облачному WhisprFlow - есть сборки под все основные системы (Mac, Windows, Linux), умеют «писать» в любое выбранное поле, а также есть постобработка с возможностью вырезания лишних слов и стилизации текста.
Первый - Handy - более простой в использовании, второй - более гибкий в настройках и возможностях кастомизации, а ещё умеет подключаться к Zoom и Google Meet и работать вашим личным секретарём. А также в OpenWhispr можно подключить бесплатный ключ от Groq с очень высокими лимитами и иметь полностью бесплатный аналог WhisprFlow с молниеносным speech-to-text (но этот уже будет облачный сценарий, не локальный).
Они максимально приближены по функционалу к облачному WhisprFlow - есть сборки под все основные системы (Mac, Windows, Linux), умеют «писать» в любое выбранное поле, а также есть постобработка с возможностью вырезания лишних слов и стилизации текста.
Первый - Handy - более простой в использовании, второй - более гибкий в настройках и возможностях кастомизации, а ещё умеет подключаться к Zoom и Google Meet и работать вашим личным секретарём. А также в OpenWhispr можно подключить бесплатный ключ от Groq с очень высокими лимитами и иметь полностью бесплатный аналог WhisprFlow с молниеносным speech-to-text (но этот уже будет облачный сценарий, не локальный).
GitHub
GitHub - cjpais/Handy: A free, open source, and extensible speech-to-text application that works completely offline.
A free, open source, and extensible speech-to-text application that works completely offline. - cjpais/Handy
🔥5
claude_cowork_for_sales.pdf
40.8 KB
Автоматизация рутины в отделе продаж
Anthropic (создатель Claude) выпустили статью, где рассказали, как их отдел продаж оптимизирует свои процессы с помощью AI агентов в режиме Claude Cowork (это когда можно создавать множество узкопрофильных агентов-специалистов, где каждый специализируется на своей области).
Подготовил для вас тезисное саммари на русском языке в PDF и краткое изложение в аудио.
Anthropic (создатель Claude) выпустили статью, где рассказали, как их отдел продаж оптимизирует свои процессы с помощью AI агентов в режиме Claude Cowork (это когда можно создавать множество узкопрофильных агентов-специалистов, где каждый специализируется на своей области).
Подготовил для вас тезисное саммари на русском языке в PDF и краткое изложение в аудио.
👍3
AI как оружие - больше не спекуляция
Claude выпустили ту самую нашумевшую модель Mythos, котораявзломала Пентагон нашла уязвимости в сотнях крупнейших opensource проектов и которую не давали никому, кроме «good guys» 😒
Правда, выпустили с существенными ограничениями и мониторингом каждого запроса, особо подозрительные из которых будут просматриваться людьми. И назвали по-другому - Claude Fable 5.
В текущих Claude-подписках доступна пока временно (до 22 июня). И по стоимости за токены - в 2 раза выше последнего Opus.
А ещё запросы, связанные с кибербезопасностью, биологией и вообще чувствительными темами, будут автоматически переключаться на предыдущее поколение (Opus 4.8).
По бенчмаркам, ожидаемо, самая сильная модель на сегодняшний день. На 5–8% опережает Claude Opus 4.8 по показателям кодинга, а сам Opus 4.8 по бенчмаркам в 2 раза превосходит GPT-5.5.
Если сделать шаг в сторону и посмотреть, как антропики разыгрывают свою карту - сложно не признать результативность их подхода к маркетингу на протяжении всего года (капитализация выросла почти в 15 (!) раз за последние 14 месяцев)
Текущий выпуск Fable - ещё один гениальный ход. Сначала выпустить в закрытом режиме, заставив всех обсуждать и хотеть - и когда рынок сам за тебя уже её распиарил на всевозможных слухах и «утечках» - выпустить в общий релиз (и то не полностью).
Стив Джобс нервно перевернулся, глядя на их способность продавать и приучать людей хотеть то, о чем они ещё полгода назад даже не знали (а также на практически полное поражение Apple в гонке ИИ)
Claude выпустили ту самую нашумевшую модель Mythos, которая
Правда, выпустили с существенными ограничениями и мониторингом каждого запроса, особо подозрительные из которых будут просматриваться людьми. И назвали по-другому - Claude Fable 5.
В текущих Claude-подписках доступна пока временно (до 22 июня). И по стоимости за токены - в 2 раза выше последнего Opus.
А ещё запросы, связанные с кибербезопасностью, биологией и вообще чувствительными темами, будут автоматически переключаться на предыдущее поколение (Opus 4.8).
По бенчмаркам, ожидаемо, самая сильная модель на сегодняшний день. На 5–8% опережает Claude Opus 4.8 по показателям кодинга, а сам Opus 4.8 по бенчмаркам в 2 раза превосходит GPT-5.5.
Если сделать шаг в сторону и посмотреть, как антропики разыгрывают свою карту - сложно не признать результативность их подхода к маркетингу на протяжении всего года (капитализация выросла почти в 15 (!) раз за последние 14 месяцев)
Текущий выпуск Fable - ещё один гениальный ход. Сначала выпустить в закрытом режиме, заставив всех обсуждать и хотеть - и когда рынок сам за тебя уже её распиарил на всевозможных слухах и «утечках» - выпустить в общий релиз (и то не полностью).
Стив Джобс нервно перевернулся, глядя на их способность продавать и приучать людей хотеть то, о чем они ещё полгода назад даже не знали (а также на практически полное поражение Apple в гонке ИИ)
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥2😱1
Media is too big
VIEW IN TELEGRAM
Codex: Record & Replay
Я уже писал ранее, что Codex от OpenAI уже давно стал инструментом не только для разработчиков, и компания продолжает расширять позиционирование и развивать инструментарий. На днях добавили простую, но крайне важную фичу - Record & Replay.
Теперь можно буквально делать любые действия на своём компьютере «под запись», а агент научится самостоятельно их воспроизводить - и выполнять как по просьбе, так и по расписанию.
И это не буквальная запись и повтор движений мыши, как в софте из 2010х - агент сам проанализирует происходящее на экране, разложит на шаги и распишет подробный skill, сохранив его для будущих сессий.
Многие скажут, что инновации здесь никакой нет, что и раньше можно было пройти с агентом по шагам, а затем попросить оформить успешно пройденный воркфлоу в скилл, и будут частично правы. Но это зачастую отнимает приличный объём времени и нервов - со всеми ошибками и повторами агента. А теперь можно просто один раз показать - а дальше уже пусть сам разбирается. Главное, чтобы в конце был понятный и измеримый результат, по которому агент сможет идентифицировать свои действия как успешные.
P.S. В приложенном официальном видео показан пример, как агент учится выкладывать видео на ютуб - но этот кейс, как и множество других, которые захочется автоматизировать таким образом - на практике эффективнее и надёжнее реализовывать через API, MCP и CLI (то есть по сути через исполняемый код и вызовы официальных программных методов).
Тогда агент будет работать намного предсказуемее и быстрее, а потреблять на порядки меньше токенов. Т.к. визуальный анализ - это один из самых затратных по себестоимости, работает медленно и требует постоянно включённого компьютера.
Но в целом, для того, чтобы просто решить задачу здесь и сейчас - вполне отличный инструмент.
Я уже писал ранее, что Codex от OpenAI уже давно стал инструментом не только для разработчиков, и компания продолжает расширять позиционирование и развивать инструментарий. На днях добавили простую, но крайне важную фичу - Record & Replay.
Теперь можно буквально делать любые действия на своём компьютере «под запись», а агент научится самостоятельно их воспроизводить - и выполнять как по просьбе, так и по расписанию.
И это не буквальная запись и повтор движений мыши, как в софте из 2010х - агент сам проанализирует происходящее на экране, разложит на шаги и распишет подробный skill, сохранив его для будущих сессий.
Многие скажут, что инновации здесь никакой нет, что и раньше можно было пройти с агентом по шагам, а затем попросить оформить успешно пройденный воркфлоу в скилл, и будут частично правы. Но это зачастую отнимает приличный объём времени и нервов - со всеми ошибками и повторами агента. А теперь можно просто один раз показать - а дальше уже пусть сам разбирается. Главное, чтобы в конце был понятный и измеримый результат, по которому агент сможет идентифицировать свои действия как успешные.
P.S. В приложенном официальном видео показан пример, как агент учится выкладывать видео на ютуб - но этот кейс, как и множество других, которые захочется автоматизировать таким образом - на практике эффективнее и надёжнее реализовывать через API, MCP и CLI (то есть по сути через исполняемый код и вызовы официальных программных методов).
Тогда агент будет работать намного предсказуемее и быстрее, а потреблять на порядки меньше токенов. Т.к. визуальный анализ - это один из самых затратных по себестоимости, работает медленно и требует постоянно включённого компьютера.
Но в целом, для того, чтобы просто решить задачу здесь и сейчас - вполне отличный инструмент.
🔥2❤1👍1
Make Gemini Great Again
Небольшой полезный плагин для тех, кто работает с Google Gemini в браузере.
Добавляет функционал, который там должен быть и давно есть в ChatGPT и Claude:
• Папки и подпапки для чатов
• Быстрые действия по правому клику мыши (Дублирование, удаление и переименование)
• Поиск внутри конкретной папки
• Визуальное таймлайн-дерево чата для мгновенного прыжка к любому шагу.
• Сохранение промптов и ответов в и с синхронизацией на Google Диск.
• Экспорт в Markdown, JSON или длинный скриншот.
• Возможность смотреть скрытый Thinking process из Deep Research.
• Визуализация блок-схем и ментальных карт прямо в окне чата (Mermaid-схемы)
• Экспорт сложных формул в один клик без поломки верстки
• Показ оставшихся лимитов в реальном времени
• Настройка визуала, шрифтов и т.д.
И на десерт: Удаление водяных знаков с изображений от Nano Banana
Про безопасность - полностью открытый исходный код и проверен сообществом.
В общем, рекомендасьон.
Есть для всех основных браузеров - Chrome, Safari, Mozilla, Edge и все, сделанные на Chromium (Opera, Brave, Яндекс и т.д.)
Небольшой полезный плагин для тех, кто работает с Google Gemini в браузере.
Добавляет функционал, который там должен быть и давно есть в ChatGPT и Claude:
• Папки и подпапки для чатов
• Быстрые действия по правому клику мыши (Дублирование, удаление и переименование)
• Поиск внутри конкретной папки
• Визуальное таймлайн-дерево чата для мгновенного прыжка к любому шагу.
• Сохранение промптов и ответов в и с синхронизацией на Google Диск.
• Экспорт в Markdown, JSON или длинный скриншот.
• Возможность смотреть скрытый Thinking process из Deep Research.
• Визуализация блок-схем и ментальных карт прямо в окне чата (Mermaid-схемы)
• Экспорт сложных формул в один клик без поломки верстки
• Показ оставшихся лимитов в реальном времени
• Настройка визуала, шрифтов и т.д.
И на десерт: Удаление водяных знаков с изображений от Nano Banana
Про безопасность - полностью открытый исходный код и проверен сообществом.
В общем, рекомендасьон.
Есть для всех основных браузеров - Chrome, Safari, Mozilla, Edge и все, сделанные на Chromium (Opera, Brave, Яндекс и т.д.)
👍2🔥2
Бесплатный DeepSeek
Сейчас в OpenModel временная акция - бесплатно раздают DeepSeek 4 Flash, которая весьма неплохая в текстах, креативе и агентских задачах. После регистрации сразу можно получить API-ключ и скормить его своему агенту, попросив сделать интеграцию (у них есть классический OpenAI-совместимый ендпоинт).
В OpenClaw / Hermes встанет легко как custom provider, в Claude придётся немного заморочиться с кастомным гейтвеем (про это напишу в отдельном посте).
Постараюсь в ближайшее время сделать подробную инструкцию по настройке собственного гейтвея, чтобы использовать такие халявы, а также выложу подборку ещё 10+ провайдеров, где можно брать токены бесплатно
Сейчас в OpenModel временная акция - бесплатно раздают DeepSeek 4 Flash, которая весьма неплохая в текстах, креативе и агентских задачах. После регистрации сразу можно получить API-ключ и скормить его своему агенту, попросив сделать интеграцию (у них есть классический OpenAI-совместимый ендпоинт).
В OpenClaw / Hermes встанет легко как custom provider, в Claude придётся немного заморочиться с кастомным гейтвеем (про это напишу в отдельном посте).
Постараюсь в ближайшее время сделать подробную инструкцию по настройке собственного гейтвея, чтобы использовать такие халявы, а также выложу подборку ещё 10+ провайдеров, где можно брать токены бесплатно
www.openmodel.ai
Codex & Claude Code Client Discounts | OpenModel
Call OpenModel through Codex or Claude Code and eligible models bill at a client discount, applied automatically per request. See eligible models and pricing.
👍9
AIматизация | ИИ в жизни и бизнесе
Бесплатный DeepSeek Сейчас в OpenModel временная акция - бесплатно раздают DeepSeek 4 Flash, которая весьма неплохая в текстах, креативе и агентских задачах. После регистрации сразу можно получить API-ключ и скормить его своему агенту, попросив сделать интеграцию…
кстати, работает очень шустро, практически молниеносно
❤1
OpenRouter - крупнейший агрегатор ИИ, щедро раздающий токены.
Про эту платформу, собирающую у себя все топовые нейронки, скорее всего, многие уже слышали. Но не все знают, что если положить и держать на балансе от $10, то они дают до 1000 запросов ежедневно на модели, которые в данный момент помечены как free.
А так как платформа большая и популярная, многие провайдеры используют это как маркетинговый инструмент и общественный тест-драйв для своих новых моделей. А мы можем строить на этом систему оптимизации бюджета.
Например, из сильных и бесплатных моделей сейчас доступны Nemotron 3 Ultra от NVidia и Laguna M.1 от Poolside, нового быстрорастущего стартапа из США.
Можно также добавить свой ключ через раздел BYOK, чтобы, например, использовать как прокси-сервер с отдельным ip для бесплатных ключей от Google (про них в следующем посте)
Рекомендую сразу в настройках оповещений включить Low Balance Alerts и выставить $10 - если какой-то агент решит использовать платную модель (или бесплатная перестанет быть таковой) и спишется несколько центов - лимит free tier упадёт всего до 50 запросов в сутки, а своевременное оповещение позволит этот момент отследить.
P.S. Хотел написать, что без проблем работает из рф, но буквально в конце июня они объявили, что перестают работать с ip из рф (но, полагаю, для большинства людей такие ограничения уже давно не являются непреодолимыми)
Про эту платформу, собирающую у себя все топовые нейронки, скорее всего, многие уже слышали. Но не все знают, что если положить и держать на балансе от $10, то они дают до 1000 запросов ежедневно на модели, которые в данный момент помечены как free.
А так как платформа большая и популярная, многие провайдеры используют это как маркетинговый инструмент и общественный тест-драйв для своих новых моделей. А мы можем строить на этом систему оптимизации бюджета.
Например, из сильных и бесплатных моделей сейчас доступны Nemotron 3 Ultra от NVidia и Laguna M.1 от Poolside, нового быстрорастущего стартапа из США.
Можно также добавить свой ключ через раздел BYOK, чтобы, например, использовать как прокси-сервер с отдельным ip для бесплатных ключей от Google (про них в следующем посте)
Рекомендую сразу в настройках оповещений включить Low Balance Alerts и выставить $10 - если какой-то агент решит использовать платную модель (или бесплатная перестанет быть таковой) и спишется несколько центов - лимит free tier упадёт всего до 50 запросов в сутки, а своевременное оповещение позволит этот момент отследить.
P.S. Хотел написать, что без проблем работает из рф, но буквально в конце июня они объявили, что перестают работать с ip из рф (но, полагаю, для большинства людей такие ограничения уже давно не являются непреодолимыми)
OpenRouter
The unified interface for every model. Find the best models & prices for your prompts
👍6❤3🔥2
upd: уже разобрали все. Кто успел, тот молодец :)
😁2❤1🔥1
«Тот, кто к полудню не исчерпал свой лимит в Claude, — зря потратил утро».
— Клодиус Максимус
😁8🔥3❤2
big-pickle-stealth-is-deepseek-report.pdf
398.3 KB
Dragon v.s. Eagle
Китайские модели уже не просто наступают на пятки американцам, а активно догоняют их и практически сравнялись по возможностям. При этом распространяются по лицензии opensource, не ставят палки в колеса в виде guardrails и ограниченных доступов и стоят существенно дешевле.
За последние две недели вышли GLM 5.2 и Kimi K3, которые уже успели нашуметь и даже превзойти Claude Opus в некоторых тестах, а сегодня Qwen анонсировал выход Qwen 3.8.
Давно не было релизов от DeepSeek, четвёртая версия которого, в своё время, стала прорывом и бесспорным лидером в тот момент по соотношению цена-качество. Должны запустить вот-вот, уже есть анонс, но сегодня я проводил ресерчи и обнаружил, где её можно потестировать уже сейчас, причём абсолютно бесплатно.
Выше я уже рассказывал, что многие провайдеры часто делают «обкатку» своих моделей через популярные интеграторы. Ещё одним таким интегратором, по совместимости харнессом (оболочкой для агентов) и средой разработки является Opencode - opensource инструмент для разработки, который предоставляет внутри своего приложения free tier для некоторых моделей.
Сегодня я заметил, что среди них доступна новая stealth-модель под названием Big Pickle. Мне стало интересно, что там под капотом, и недолгий ресерч показал, что модель иногда в ответах выдаёт себя и шаблонные ответы об ошибках, присущие DeepSeek.
Мне этого было мало и я решил сравнить все доступные сейчас бесплатные модели в OpenCode, включая эту - по итогу новый DeepSeek оказался на голову сильнее всех доступных во free tier.
Ознакомиться с отчётом эксперимента можно во вложенном PDF или на обновлённом сайте.
В общем, рекомендую к использованию, пока доступна - неплохая экономия за счёт бесплатных токенов сильной модели.
Китайские модели уже не просто наступают на пятки американцам, а активно догоняют их и практически сравнялись по возможностям. При этом распространяются по лицензии opensource, не ставят палки в колеса в виде guardrails и ограниченных доступов и стоят существенно дешевле.
За последние две недели вышли GLM 5.2 и Kimi K3, которые уже успели нашуметь и даже превзойти Claude Opus в некоторых тестах, а сегодня Qwen анонсировал выход Qwen 3.8.
Давно не было релизов от DeepSeek, четвёртая версия которого, в своё время, стала прорывом и бесспорным лидером в тот момент по соотношению цена-качество. Должны запустить вот-вот, уже есть анонс, но сегодня я проводил ресерчи и обнаружил, где её можно потестировать уже сейчас, причём абсолютно бесплатно.
Выше я уже рассказывал, что многие провайдеры часто делают «обкатку» своих моделей через популярные интеграторы. Ещё одним таким интегратором, по совместимости харнессом (оболочкой для агентов) и средой разработки является Opencode - opensource инструмент для разработки, который предоставляет внутри своего приложения free tier для некоторых моделей.
Сегодня я заметил, что среди них доступна новая stealth-модель под названием Big Pickle. Мне стало интересно, что там под капотом, и недолгий ресерч показал, что модель иногда в ответах выдаёт себя и шаблонные ответы об ошибках, присущие DeepSeek.
Мне этого было мало и я решил сравнить все доступные сейчас бесплатные модели в OpenCode, включая эту - по итогу новый DeepSeek оказался на голову сильнее всех доступных во free tier.
Ознакомиться с отчётом эксперимента можно во вложенном PDF или на обновлённом сайте.
В общем, рекомендую к использованию, пока доступна - неплохая экономия за счёт бесплатных токенов сильной модели.
🔥5👍3❤1🤔1
AIматизация | ИИ в жизни и бизнесе
Ускоряем печать, переходя на голос Судя по трендам в X, Threads и GitHub, текущий месяц стал месяцем разработки собственных инструментов автоматизации голосового ввода. Каждый уважающий себя разработчик (и не только) написал собственную «диктовалку» и гордо…
This media is not supported in your browser
VIEW IN TELEGRAM
Писал ранее, что использовал WisprFlow - но бесплатный тариф ограничивает быстрое распознавание лимитом 2000 слов в неделю. Решил поискать бесплатный opensource аналог, чтобы имел все те же функции и работало как локально, так и облачно на супербыстром и бесплатном groq, который у меня и так используется в собственной системе транскрипции звонков и в Hermes-агентах в телеграм для голосовых.
Попробовал разные и остановился на небольшом и пока малоизвестном FreeFlow. Имеет все те же функции, как в платных аналогах, но, как говорится, все бесплатно, без регистрации и смс 🙂
Особенно важными для меня были учёт контекста приложений и постобработка текста после распознавания - благодаря чему он правильно и на лету понимает все, что говорю, и корректно пишет все термины, названия и команды. Использует сразу тот же ключ Groq для работы.
Сборка в данный момент только на MacOS (причём старые на intel тоже поддерживаются), но проект активно развивается и в PR на гитхабе уже есть сборка под windows. Ждём в релиз)
В общем, пока полёт нормальный, распознавание за милисекунды, всем доволен и рекомендую
Попробовал разные и остановился на небольшом и пока малоизвестном FreeFlow. Имеет все те же функции, как в платных аналогах, но, как говорится, все бесплатно, без регистрации и смс 🙂
Особенно важными для меня были учёт контекста приложений и постобработка текста после распознавания - благодаря чему он правильно и на лету понимает все, что говорю, и корректно пишет все термины, названия и команды. Использует сразу тот же ключ Groq для работы.
Сборка в данный момент только на MacOS (причём старые на intel тоже поддерживаются), но проект активно развивается и в PR на гитхабе уже есть сборка под windows. Ждём в релиз)
В общем, пока полёт нормальный, распознавание за милисекунды, всем доволен и рекомендую
🔥5❤2
