Заместители
2.97K subscribers
198 photos
123 videos
4 files
227 links
Цех ИИ агентов. Здесь я тестирую цифровых заместителей в разных профессиях. По пути обсуждаем актуальные новости про ИИ агентов простым языком.
Добро пожаловать в эру замещения.
Запросы -> aideputies_collab@agentmail.to.
Download Telegram
Купил сегодня футболку с одной мыслью — немного ее проапрегрейдить маркером 😁

Интересно, H&M осознанно выбирали цвет надписи Claude Monet?
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
😁226🔥3💯2
Новый ChatGPT Work, а также как Anthropic и OpenAI убивают свои чаты

Обе компании уже всерьез намекают юзерам, что LLM стали достаточно мощными и дорогими, чтобы растрачивать их токены на всякие банальные вопросы. Поэтому они постепенно сворачивают свои режимы чатов и переводят юзеров в режим выполнения задач.

Claude совместил Cowork и Chat. Теперь это одна страница с переключателем между двумя режимами. По сути, пока что они позиционируются как равноправные. Но ставлю 🍋 токенов — это просто переходный этап.

OpenAI же сделали более радикальные шаги. Во-первых, старое приложение ChatGPT для Mac, где мы с вами кажется уже 100 лет назад делали папки-проекты, какие-то GPTs настраивали, — переименовали в "ChatGPT Classic" (читай отправили на пенсию ).

А во-вторых, приложение Codex повысили — оно стало новым ChatGPT. Теперь оно объединяет все режимы работы GPT: Codex, Work (о нем дальше) и Chat. И казалось бы то же самое что Claude — да вот только в отличие от Антропика, здесь Chat вообще стал вторичным. Codex и Work имеют полноценные отдельные страницы. А Chat теперь живет в маленьком всплывающем окошке, которое как бы намекает: "я тут чисто подсказать, а по серьезным вопросам пиши в Work".

ChatGPT Work

Теперь подробнее про него. Так OpenAI назвали свой аналог Claude Cowork, который выкатили на днях. По существу, почти то же самое. Тоже агент, живущий в виртуалке, как Codex, с доступом к компу, браузеру и всему тому же, что и Codex. Уровень работы благодаря GPT-5.6, который OpenAI сами рекомендуют как основную модель в этом режиме, — хороший.

Проверял я его прямо на живом. Мне нужно было сдать отчетность в налоговую. Не вдаваясь в подробности там есть этап, где нужно кропотливо классифицировать транзакции из банковской выписки по налоговым кодам, а потом сводить баланс по каждому счету, да еще и сопоставлять потом между разными счетами балансы, чтобы все билось. В общем, самая ненавистная для меня отчетность. Каждый раз настроение портилось, когда ее опять сдавать нужно.

Решил отдать эту задачу ChatGPT Work. Дал ему пример предыдущей отчетности, и запустил GPT-5.6 Sol Extra High. Не потому что такая силища для этой задачи нужна, а скорее чтобы перестраховаться — все таки тема достаточно чувствительная. Цена ошибки велика.

Но в итоге, результат такой же как с Claude Cowork — базово со всем справляется. Но с незначительными недочетами. Первый результат сдал — он был на "пять с минусом". Я ему дал комментарии по классификации нескольких транзакций. Тот ушел думать, вернулся — классификации отдельных транзакций поменял, а баланс не обновил. То есть не считал мое намерение (он же "интент"). Возможно, потому что сфера нетривиальная, и вряд ли его много тренировали на подобных задачах. Клодовский Cowork, интент обычно считывает хорошо, но на узкопрофильных задачах бывает так же тупит.

Дальше уже чисто для эксперимента попросил Codex сделать презентацию для C-level. Справился хорошечно — суть всю передал, по слайдам разбил очень логично, есть дорожная карта, график, табличка. В общем уровень Claude Cowork берет легко, только немного в своем стиле. Но, честно говоря, я уже давно все презентации делаю в Claude Design (и вам рекомендую). Настолько, что у нас в компании я юзаю его больше, чем отдел дизайна 😁 Поэтому для меня презентации что от ChatGPT Work, что от Claude Cowork — выглядят примитивными и топорными.

Итог: экосистема ChatGPT отстает только, пожалуй, в сфере дизайна. В остальном — удобство, функциональность, UX — такие же как у Claude, если не лучше.

Заместители
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
14👍931
Media is too big
VIEW IN TELEGRAM
OpenAI выпустила свою первую железку. Но не ту самую от Джони Айва

⁠Совместно с Work Louder релизнули Codex Micro — компактную механическую клавиатуру для управления Codex-агентами.

Внутри 13 механических клавиш, джойстик, крутилка и тач-панель.

Главная фишка — отдельные клавиши для агентов. Они подсвечиваются разными цветами и показывают, что сейчас происходит с каждым агентом: думает, нужно вмешательство, ошибка или готов сдать работу. Между агентами можно переключаться одной кнопкой, не перебирая вкладки и чаты.

Остальные элементы тоже заточены под Codex.
- Джойстиком запускаются готовые скиллы — например, PR ревью, поиск бага или рефакторинг. Ну либо им предлагают просто дергать, пока ждешь, когда агент закончит работу 😁
- Отдельные кнопки отвечают за принятие и отклонение изменений, новый чат и голосовой промпт.
- Крутилкой можно прямо на ходу менять уровень рассуждений модели: поменьше для простых задач, побольше — когда агенту нужно хорошенько пораскинуть токенами.

Все кнопки можно переназначить под собственные воркфлоу. Работает с Mac и Windows по Bluetooth или USB-C. Есть тихая и клацающая версии переключателей.

Стоит всё это удовольствие $230. В комплекте ещё 32 дополнительные клавиши с иконками Codex.

Конечно это лютое баловство для техногиков 🎹

Но сама идея интереснее устройства. Когда у тебя параллельно бегают несколько агентов, обычный чат уже становится не самым удобным интерфейсом. И голосовой набор промпта + физические кнопки для быстрого фидбека = звучит как потенциально крутая затягивающая альтернатива.

И даже если голосом пользоваться не всегда удобно, то кнопки под быстрый фидбек агентам — то, чего мне лично не хватает. Постоянно бешусь, что кнопка аппрува действия каждый раз разная: то аппрув одного действия, то всех таких действий в проекте, то всех действий вообще всегда. И ещё каждый раз комбинации клавиш под это как будто меняются 🔨. А на клаве тыкаешь одну кнопочку и не паришься.

Кстати, шикарная идея подарка для вашего кореша или партнера, который общается с AI агентами, больше чем с вами 😈

Ну и ждём, когда китайцы наклепают клонов этой штуковины для Claude Desktop и других агентов.

Заместители
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥9🤡53👍111
Please open Telegram to view this post
VIEW IN TELEGRAM
31👍113🔥2
GPT 5.6 Sol выбралась из OpenAI и взломала Hugging Face

На прошлой неделе Hugging Face рассказали о беспрецедентной атаке на свою инфраструктуру. Тогда было известно только одно: атаку полностью провел автономный AI-агент.

Сегодня OpenAI официально призналась — этим агентом оказалась комбинация моделей GPT-5.6 Sol и еще более мощной пре-релиз модели, которую тестировали на кибербезопасность 😨

Что вообще произошло?

OpenAI гоняла внутренний бенчмарк ExploitGym, который оценивает способность моделей искать и эксплуатировать уязвимости.

Но чтобы честно измерить максимум возможностей модели, разработчики отключили часть защитных ограничений.

Ну и модельки увлеклись процессом:
• они нашли zero-day уязвимость в инфраструктуре самого OpenAI и через нее выбрались из изолированной песочницы в интернет
• догадались, что решения ExploitGym могут храниться на Hugging Face
• самостоятельно нашли путь до инфраструктуры Hugging Face
• объединили несколько техник атаки — украденные учетные данные и zero-day уязвимости — чтобы получить доступ к секретным данным и “сжульничать” в тесте.

К счастью, история закончилась хорошо. AI-системы Hugging Face сами обнаружили аномальную активность, остановили атаку и начали расследование еще до того, как команды компаний связались между собой. Сейчас OpenAI и Hugging Face совместно расследуют инцидент.

Интересно, что UK AI Security Institute (AISI) — Британская гос организация, которая исследует AI безопасность — только на днях выпустила отчет, где говорила о таких рисках. OpenAI сами сослались на график (который и стал заголовком этого поста), где GPT 5.6 Sol победоносно сидит на верхушке. Это означает, что в симуляции ей удалось полностью захватить локальную сеть корпорации, произведя 32-шаговую атаку.

Но что ещё интереснее — статья AISI вообще-то про другое. Она про то, что в среднем опенсорсные модели отстают всего примерно на полгода по своим возможностям цифровых атак от топовых коммерческих моделей.

И, как нам показали MoonshotAI со своей Kimi K3, похоже, это отставание уменьшается. А значит — то, что сделала GPT 5.6 Sol уже совсем скоро будет доступно любому обладателю достаточного количества железа, чтобы развернуть модель такого размера 😅

Так что же нас ждет?

Дивный новый мир. В нем OpenAI, Anthropic и другие AI гиганты станут уже не просто болталкой и офисным помощником — они будут продавать вам единственную сопоставимую с нападением защиту от кибератак. Хакеры же будут плясать от опенсорсных моделей.

Также вангую, что появятся аудиторы кибербезопасности с помощью AI. Такие компании будут заниматься «редтимингом» или «этичным хакингом» ИТ инфраструктуры заказчика с помощью топовых моделей и рекомендовать, где что подлатать, чтобы злобные хакеры с джеилбрейкнутой (то есть взломанной и готовой беспринципно взламывать все подряд в полную силу) Kimi K3 не залезли под юбку вашей компании, как себе домой.

Другой вектор развития этой истории — международная кооперация, результатом которой станет ограничение на выпуск таких моделей в открытом доступе. Да вот незадача — с международной кооперацией сейчас не клеится 😐

А значит нас ждет какая-то штука, без приуменьшения планетарного масштаба, чтобы жареный петух клюнул сразу весь мир и подтолкнул к этой кооперации.

Что это будет за петух — остается только гадать 😒

Заместители
Please open Telegram to view this post
VIEW IN TELEGRAM
14🔥10👍53😁2🙈21
Этот пост не про новый Claude Opus 5

Хотя именно благодаря ему я нашёл новую интересную модель для генерации изображений.

С выходом Opus 5 у меня появилось полное ощущение финальной битвы из «Мстителей». Супергероев на экране уже столько, что эту эпичность захотелось как-то визуально зафиксировать. Но снова идти в GPT Image 2 было как будто скучновато.

И тут очень вовремя в начале июля вышла Reve 2.1 — и практически сразу заняла второе место в Text-to-Image Leaderboard. Все картинки к этому посту сгенерировала именно она. И, собственно, этот пост — про Reve!

Главная фишка Reve 2.1 — модель не просто превращает промпт в набор пикселей. Сначала она планирует изображение как структурированный layout: где находятся отдельные области, как связаны элементы, что должно быть главным, а что — второстепенным. И только потом рендерит картинку сразу в нативном 4K.

Первым делом я попросил её сделать инфографику про новый Opus. Там, кстати, вы и узнаете всё про нового форварда Anthropic 👍

Русский текст генерируется весьма и весьма недурно. А благодаря планированию layout картинка действительно выглядит как продуманная инфографика, а не как хаотичный набор карточек.

Без косяков, конечно, не обошлось. Изначально Reve вставила в гистограмму Intelligence Index какие-то старые модели. Но моделька умеет еще и редактировать изображения. Я просто загрузил ей скриншот актуального рейтинга — и она перегенерировала изображение, исправив конкретно эту часть.

В редактировании есть один минус — весь текст — это изображение. А значит, его нельзя просто переписать, как в Claude Design. Можно только попросить модель его переписать. Благо делает это она хорошо.

Дальше я решил выплеснуть своё творческое представление битвы моделей в стиле постера Marvel 🤖🤖🤖. Промпт предварительно написал GPT-5.6, а я его просто вставил в Reve (вот так нынче выглядит digital творчество).

Ну и что получилось — судить вам. Получилось оно с первого раза.

Отдельно впечатляет разрешение. Инфографика весила около 8 МБ, а изображение с битвой — все 30 МБ. Можно спокойно распечатать и повесить на стену.

В общем, только показалось, что на фоне агентной гонки все немного подзабыли про генерацию изображений — как появился достойный соперник старичкам GPT Image 2 и Nano Banana 2.

Так что прямо душевно рекомендую потыкать Reve 2.1 своими руками. Тем более у сервиса весьма щедрый Free-план.

Заместители
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥20721
Claude убрал 80% системного промпта, потому что он ему не нужен, говорили они...

Тут на днях с выкаткой Opus 5 Антропики рассказали, что сократили системный промпт для Opus 5 и Fable 5 в Claude Code на 80%, потому что, мол, модели итак умные. Чо контест перегружать. А я вам на это расскажу интересную историю, которая сегодня приключилась со мной ☕️

Мне нужно было перевести целую пачку документов на другой язык. Все они были ПДФами, причем не машиночитаемыми — то есть теми, которые картинки. Естессно, я не сомневаясь, что GPT 5.6 Sol справится, закинул все ему.

Ремарка: да, тут вы можете сказать, что GPT это не Claude — это другое. Но, по-моему, эти модели сейчас — братья близнецы. Ну и так получилось, что для личных задач я использую ГПТ. Поэтому история о нем, но выводы, на мой взгляд, относятся ко всем топовым LLM.

Модель работает, я сижу занимаюсь своими делами. Тут мак начинает шуметь как турбина Боинга, и сам горячий как сковородка. Я в недоумении проверяю, что у меня включено — там только браузер и ГПТ Чат Альтманович.

Ну, думаю, не браузер же 100% CPU жрать начал — я полез в ЧатГПТ. Смотрю, а там "Распознавание выполняется локально: документы не передаются во внешние сервисы" 🕶

Этот негодяй прочитал документы и решил, что переводить их сам не будет. И молча, ничего со мной не согласовав, сделал следующее:
1. Сначала написал на swift приложение, которое использует нативную библиотеку macOS "Vision". Но она ему не понравилась.
2. Дальше нашел у меня в установленных tesseract (специализированная библиотека для OCR)
3. Удовлетворившись им, распознал документы
4. А для перевода — поднял через ollama модельку qwen3:8b
5. И довольный начал постранично переводить через нее распознанный текст. Тут то мой мак и начал прикипать к моим коленкам.

Как я потом у него допытался — GPT решил оптимизировать задачу, создав "локальный конвейер", и заодно не передавать личные документы в онлайн (то, что он их уже прочитал — его, конечно же, не смутило 😁).

Мораль истории

Во-первых, конечно, хочется отдать должное ГПТ — он попытался сохранить потенциально чувствительную информацию в локале. С точки зрения безопасности — молодец. Это, очевидно, последствие того, как последние модели ведущих лабораторий натаскивают на секьюрность и приватность.

Но, во-вторых, у этого есть и обратная сторона медали — перегибы. Очевидным действием в такой ситуации должно было бы стать "спрошу у юзера, как сделать". Но модель очень уверенно расставила приоритеты сама и поскакала сжигать процессор моего мака.

И вот тут вернемся к заголовку.

Антропик отрезал Клоду 80% системного промпта. Мол, модель сама вас прекрасно поймет и все разрулит... Разрулит то, разрулит. И результат получит. Уверен, что Квен все бы перевел в конце концов. Но все это неэффективными странными путями...

Не знаю, как вы, а я вот после сегодняшней ситуации — пойду и пропишу в системный промпт GPT пару ласковых 😈

Заместители
Please open Telegram to view this post
VIEW IN TELEGRAM
😁2397👍3👎2
Media is too big
VIEW IN TELEGRAM
Google заходят в робототехнику по-своему

Пока Tesla, Figure и Unitree пытаются собрать лучшего гуманойдного робота, Google заходит с другой стороны. Компания продолжает фокусироваться на мозгах. Они представили Gemini Robotics 2 — универсальную модель, которая может адаптироваться под роботов разных производителей.

На самом деле Google представила сразу три связанные модели:
• Gemini Robotics 2 превращает изображение и текстовую команду в движения робота.
Gemini Robotics ER 2 понимает происходящее, составляет план, проверяет результат и координирует нескольких роботов.
Gemini Robotics On-Device 2 работает локально и адаптируется под совершенно новое тело менее чем на 200 примерах.

Главный апдейт с первой версии

Появилось управление всем телом одной системой. Раньше модель управляла руками роботов.

Теперь робот под управлением модели может одновременно идти, приседать, удерживать равновесие и тянуться к предмету. Раньше такие действия часто обслуживались отдельными контроллерами и заранее собранными последовательностями.

Робот получает цель и сам превращает её в непрерывное физическое поведение. Например, говоришь своему гаечному "убери захламлённую комнату". И Gemini Robotics 2 в ответ на запрос осматривается, составляет план, двигает предметы, проверяет результат, исправляет ошибки и при необходимости подключает другого робота.

По сути, Гуглойды двигают уже неплохо сложившуюся индустрию робототехники ближе к бесшовному взаимодействию с обычными людьми.

А что по реальным задачам?

Google показывает в демо ролике закручивание лампочки, завязывание пакетов и работу с зиплоком.

Однако собственные гугловые замеры успешности выполнения разных действий с помощью новой модели возвращают нас на землю:
• выкрутить лампочку — 92% успешных попыток
• закрутить обратно — 36%
• завязать пакет — 44%
• закрыть Ziplock — 40%
• воспользоваться совком — 32%

Получается эффектное демо уже можно снять. А вот уборку вашей кухни доверять терминаторам еще рано 😁

Завтра расскажу про рынок робототехники и AI в нем пошире. Stay tuned 👍

Заместители
Please open Telegram to view this post
VIEW IN TELEGRAM
2🔥1🤡1