Человек 2.0
1.29K subscribers
298 photos
31 videos
335 links
Среда внедрения ИИ в работу и бизнес. Длинные разборы, интервью, эфиры и гайды по агентным системам, лайфхаки по ИИ и рабочим процессам.

Помогаем применять личных ии агентов в работе

Сайт: https://human20.app
По всем вопросам: https://t.me/chipmanager
Download Telegram
Маск запустил убийцу Hermes

На экране Grok Bot уже целое расписание ролей: руководитель, личный ассистент, менеджер входящих, рекрутер, поддержка, специалист по расходам и сбору счетов. Небольшой цифровой офис.

11 августа SpaceXAI выпустила Grok Bot в ранней бете. Этой команде агентов можно поручать реальную работу.

У каждого есть облачный компьютер. Агент входит в сервисы пользователя, проходит многошаговый процесс и зовёт человека, когда нужен его выбор.

Руководитель раздаёт работу. Остальные выполняют её параллельно, переписываются и передают друг другу контекст. Повторяемый процесс достаточно показать один раз: Grok Bot сохранит шаги и сможет запускать задачу по расписанию.

SpaceXAI упаковывает знакомый любой компании принцип: у каждой работы должен быть ответственный. Один агент следит за почтой, другой ищет кандидатов, третий разбирает счета. Вместе они удерживают общий процесс.

Мы вокруг Hermes строим ту же механику: роли, память, инструменты, расписания и передачу задач между агентами. Теперь SpaceXAI вынесла этот подход в отдельный продукт.

Чат остаётся командным пунктом. Работу забирает команда.

Grok Bot доступен пользователям SuperGrok Heavy, Cursor Ultra и Cursor Teams Premium на компьютерах и мобильных устройствах Apple. Пока в ранней бете.

Интересно будет в нём разобраться. Пока у Маска только точечные успехи в ИИ, модели пока не блещут на фоне конкурентов, но может тут что-то интересное получилось.

🧩📣🔥💡🪄

Источник: официальный анонс SpaceXAI

Среда внедрения ИИ:

Внедрить | YouTube
Please open Telegram to view this post
VIEW IN TELEGRAM
Буду писать не только о плюсах своего агента

За эту поездку Hermes много раз нас выручал: находил места, строил маршруты, помогал с билетами и перестраивал планы на ходу.

Но провалы у него тоже были. Иногда мы теряли полчаса. Иногда кучу нервов. Один косяк обошёлся в 214 евро.

Конкретика:

1. В Китае он отправил нас в Wagas в MixC World. Торговый центр был на месте. Wagas — нет. Мы потеряли около получаса, уже голодные и с детьми.

2. В Дананге Hermes выбрал MỘC Quán Seafood. Отличная кухня, Michelin, сильные отзывы. Всё идеально, кроме возможности поесть: на входе нам объявили очередь на два часа.

Причём ресторан заранее советовал бронировать стол, а люди писали про ожидание в отзывах. Hermes проверил, вкусно ли там. Проверить, попадём ли мы внутрь сегодня вечером, забыл.

3. Следующим был Limoncello. Агент увидел «открыто до 22:00» и уверенно повёл нас на поздний обед (или ранний ужин?). У ресторана оказался собственный взгляд на расписание: с 15:00 до 17:30 кухня отдыхала. Мы приехали ровно в этот перерыв.

4. В Ba Na Hills Hermes нашёл льготные билеты U25 для детей. Хорошая экономия.

Уже по дороге выяснилась маленькая деталь: иностранцам нужны оригиналы паспортов. Фотографии не подходят. Паспорта, разумеется, лежали не в машине.

5. Самый дорогой провал случился вообще без нашего участия. Пока Hermes искал рестораны и достопримечательности, он пользовался Google Places как безлимитным шведским столом в шестизвёздочном отеле, где повар Шаркан, а официант — Бурак Осчевит. За июль набралось 7 137 запросов и почти 214 евро расходов.

На первом этапе отработки наших задач вместо подробного запроса ему хватило бы названия и адреса. Вместо этого он каждый раз тащил рейтинг, часы, телефон, сайт и отзывы. Всё включено. За мой счёт.

Hermes от этого не стал плохим агентом. Зато хорошо видно, чем личный агент отличается от очередного сервиса в телефоне.

Но с агентом надо уметь работать. Фраза «учти на будущее» здесь бесполезна. Из каждого провала мы сделали скриптовый каркас в нашем скиле.

После Wagas агент проверяет точный филиал, адрес, координаты и карточку на карте. В Китае отдельно сверяется с Amap.

После MỘC он не может сказать «езжайте», пока не проверил свежие отзывы, риск очереди, условия бронирования и два запасных ресторана.

После Limoncello часы кухни проверяет отдельный скрипт. Общая надпись «открыто» больше не скрывает дневной перерыв.

После Ba Na Hills льготный билет блокируется, пока оригиналы документов не подтверждены физически. Не дома. Не на фотографии. С собой. Если так написано в тексте мелким шрифтом, который вы всё равно не прочитаете, если будете покупать билеты вручную.

После счёта Google появились отдельные лимиты на каждый тип запроса. Дорогие поля запрашиваются только для выбранного места. Платный перерасход равен нулю, старые прямые ключи удалены.

Чужой сервис после ошибки прислал бы извинение и жил дальше. Мой Hermes получает новый тест, новый запрет и меняет то, как он работает.

Реальная поездка, голодные дети и счёт почти на 214 евро укрепили этот туристический скилл сильнее сотни красивых промптов.

🧠🚀🐾💬

Среда внедрения ИИ:

Внедрить | YouTube
Please open Telegram to view this post
VIEW IN TELEGRAM
10
This media is not supported in your browser
VIEW IN TELEGRAM
Codex начал импортировать вашу рабочую жизнь из других ИИ-приложений

В десктопном Codex появился импорт из других ИИ-приложений. Он переносит проекты, недавние чаты, инструкции, навыки и плагины. В настройках можно посмотреть историю импорта и включить автоматическую синхронизацию.

С файлами всё было проще. Проекты и AGENTS.md давно можно использовать параллельно в разных агентах.

А вот чаты, навыки и плагины оставались внутри конкретной среды. Меняешь агента: снова объясняешь привычки, собираешь инструменты и восстанавливаешь рабочий контекст.

Codex начинает вынимать эту работу из закрытого ящика. Подключил источник, перенёс накопленное, оставил синхронизацию; новый агент уже знает часть вашей рабочей жизни.

Пока источники импорта обезличены, а плагины Gmail и Outlook нужно доустановить вручную. Функция только набирает форму.

Но конкуренция агентов уже упирается в переносимость. Выиграет тот, к кому проще прийти со всей своей работой.

Так что теперь можно все ваши наработки из OpenClaw и Hermes одной кнопкой воткнуть в ChatGPT.

🧩📣🔥💡🪄

Внедряйте ИИ агентов:

Внедрить | YouTube
Please open Telegram to view this post
VIEW IN TELEGRAM
3
Сбер сделал своего Hermes

«Сбер» представил «ГигаАгента» и назвал его российским ответом OpenClaw, Hermes Agent и NemoClaw. Агент уже доступен в Agents Space от Cloud.ru.

Календарь, документы, переписка, поиск, отчёты и презентации. В Agents Space задачи можно запускать в фоне и по расписанию. Перед необратимыми действиями агент запрашивает подтверждение.

Сбер сравнивает новый продукт именно с Hermes и OpenClaw. Персональные агенты в России стали отдельным рынком.

Теперь нужен операторский тест: сколько реальных задач «ГигаАгент» доводит до результата без человека и сколько потом приходится переделывать. Публичных метрик завершённых задач без ручной переделки пока нет.

Интересно, кто может себе позволить сжигать токены ГигаЧата на тысячи долларов в месяц, чтобы делать хотя бы простейшие вещи с этим агентом?

Источник: Forbes

Запускаем ИИ-агентов:
Внедрить | YouTube
🔥1
This media is not supported in your browser
VIEW IN TELEGRAM
🔥21💯1
Мы дали одну задачу двум ИИ-агентам

Один и тот же код: новый скил, который мы написали с нуля по принципам из пресс-релиза об очередном чудо-харнессе. Одинаковая модель GPT-5.6 Sol Medium. Задача тоже одинаковая: проверить что за код мы написали и найти ошибки.

Первое ревью сделал Grok Build, большая агентская система от xAI, которую только что релизнул в опенсорс Илон, который Маск.

Второе ревью провёл наш основной навык программирования для Hermes, /shaw. Я развиваю его с февраля 2026 года, ещё со времён OpenClaw, специально для кодинга через персонального агента в телеграм.

Grok Build нашёл 4 проблемы. Shaw нашёл 17 дефектов и пробелов.

Некоторые из них могли легко доехать до релиза. Одна команда не понимала успешный ответ собственного инструмента. Установщик навыков мог записать файлы не туда или затереть чужой навык. Проверка релиза видела хеши, но не убеждалась, что они относятся к нужному коду.

Получился хороший эксперимент. Модель в обоих случаях была одинаковой, результат получился разным. Одной сильной модели мало: на результат влияют правила, по которым она работает, что именно проверять, как доказывать ошибку, когда запускать тест и что считать готовой работой.

В этом Shaw оказался сильнее: копнул глубже и нашёл больше реальных проблем. Grok Build лучше оформил результат. Он аккуратнее расставил приоритеты и описал каждую проблему по одной схеме:
┈ где находится ошибка
┈ к чему она приводит
┈ как её повторить
┈ как исправить
┈ как проверить исправление

Прямо сейчас шуршит процесс: мы переносим в /shaw практики ранжирования и оформления из Grok Build. Shaw сохранит свою глубину, а отчёты станут точнее: сначала критические ошибки, потом проблемы для релиза, пробелы в тестах и оставшиеся риски. У каждой находки будет доказательство и конкретный план исправления.

На этом тесте наш навык опередил одну из самых серьёзных агентских систем на рынке: 17 находок против 4. А теперь мы забираем у неё то, что она умеет лучше. Шашечки.

Так и развивается хороший инструмент: сравниваешь на одном материале, сохраняешь своё преимущество и переносишь к себе сильные решения конкурента.

Кстати, своим скилом /shaw я делюсь на нашем обучении работе с агентами — воркшопе «Человек 2.0». Он доступен по ссылке: открыть воркшоп.

🧠🚀🐾💬
Please open Telegram to view this post
VIEW IN TELEGRAM
3
DeepSeek выкатила V4 Pro и открыла мастерскую

Обычно релиз ИИ-модели похож на презентацию нового двигателя: показывают мощность, результаты испытаний и обещают, что теперь всё поедет быстрее. А машину вокруг него разработчик собирает сам.

DeepSeek в этот раз привезла и двигатель, и мастерскую.

V4 Pro заметно выросла в задачах с кодом и инструментами. В тестах самой DeepSeek модель получила 87,9 балла в Terminal Bench 2.1, 83,3 в Cybergym и 74,1 в Toolathlon-Verified.

Но этот стенд принадлежит производителю. В независимом рейтинге Artificial Analysis результат скромнее: V4 Pro с максимальной глубиной рассуждений набрала 53 балла, как и GLM-5.2. У GPT-5.6 Sol со средней глубиной 56, у Kimi K3 — 60, у Fable 5 — 62.

Мотор хороший. Рекорды трассы пока, конечно, у других.

Зато подключать его стало проще. V4 Pro нативно поддерживает OpenAI Responses API, Codex настраивается одним скриптом. Для V4 Pro и Flash можно выбрать низкую, высокую или максимальную глубину рассуждений. Названия моделей в API не изменились.

А рядом DeepSeek открыла свой Harness: конструктор агентных систем с открытым кодом под лицензией MIT.

Он устроен как верстак со сменными деталями. Отдельно можно подключать модели, инструменты, навыки, сессии, песочницы, файловые системы, агентные циклы, оркестрацию и интерфейс. Если нужен другой провайдер или собственный инструмент, не приходится менять всю конструкцию.

Внутри уже есть веб-интерфейс, рабочие пространства, журнал сессии, траектория действий, уровни доступа и четыре режима агента: стандартный, для кода, минимальный и режим собственной конфигурации.

Мастерская пока открыта в тестовом режиме. Harness выпущен как предварительная версия для разработчиков. DeepSeek предупреждает, что проект будет быстро меняться и периодически ломать совместимость.

Экспериментировать уже можно. Спокойно ставить в производство — пока рано.

И да, топливо дорожает. С 16 августа 2026 года, 16:00 UTC, появятся пиковые часы: 01:00–04:00 и 06:00–10:00 UTC. В остальное время токены будут стоить вдвое дешевле пикового тарифа.

Для V4 Pro миллион входных токенов без попадания в кэш обойдётся в 0,66 доллара вне пика и 1,32 в пик. Миллион выходных токенов будет стоить 1,98 и 3,96 доллара соответственно. Даже вне пика это дороже прежних 0,435 доллара за вход и 0,87 за выход.

DeepSeek по-прежнему даёт много мощности за небольшие деньги. Только теперь вместе с мотором разработчикам выдали инструменты и чертежи: собирайте своего агента сами.

Источник: DeepSeek / GitHub / Artificial Analysis
5
This media is not supported in your browser
VIEW IN TELEGRAM
OpenAI договорилась с Cerebras. Результат — 750 токенов/с

OpenAI заказала 750 МВт вычислительной мощности с подключением до 2028 года. CNBC оценивает контракт более чем в $10 млрд; цена не раскрыта.

Cerebras — независимая американская компания, OpenAI ею не владеет. Её WSE-3 занимает целую кремниевую пластину: 4 трлн транзисторов, 900 тыс. ИИ-ядер и 44 ГБ SRAM. Запасные ядра и маршруты обходят дефекты.

Память находится рядом с вычислениями, поэтому веса модели не ездят между ускорителями и внешней памятью. Склад встроили в фабрику, и станки больше не ждут грузовики.

На этом железе GPT-5.6 Sol Ultrafast выдаёт до 750 токенов/с и работает до 14 раз быстрее обычной Sol. Claude Fable 5 показал 62.5 токена/с по Artificial Analysis. Разрыв в 12 раз. Замеры разные, но быстрый режим Anthropic даёт максимум 2.5 раза.

Ultrafast пока доступен выбранным клиентам OpenAI API. Эксклюзивность Cerebras за OpenAI публично не подтверждена.

Было бы круто увидеть такое в подписке. Можно будет получать ответы в Hermes на порядок быстрее и кодить как из пулемёта 😂

🧩📣🔥💡🪄

OpenAI · Cerebras · Anthropic · CNBC · Artificial Analysis
Please open Telegram to view this post
VIEW IN TELEGRAM
5🔥1
OpenClaw задержал релиз. И это хорошая новость

Поставить агента — полдела. Потом начинаются долгие сессии, накопленная история, подключённые инструменты и обновления. В этот момент агент либо входит в ежедневную работу, либо сам становится отдельной работой.

Новый релиз OpenClaw задержался, потому что команда переделывает именно эту часть. Подключение хотят приблизить к одному клику: упростить установку и обновления, а сам OpenClaw научить быстрее находить инструменты пользователя.

Одновременно переписали хранение и управление информацией. Долгие сессии и крупные конфигурации должны сохранять скорость и стабильность по мере роста.

Изменения прошли почти по всему продукту. Поэтому команда отдельно проверяет уже работающие установки: удобство для новичков не должно обернуться поломкой для тех, кто давно внутри.

Релиз ожидают во вторник, 18 августа. Дата пока предварительная.

Если всё получится, OpenClaw придётся реже чинить и можно будет чаще оставлять делать долгую работу. Это и отличает агентскую систему от удачного первого запуска: на следующий день она всё ещё работает.

Косяки, с которыми они борются, стали причиной моего ухода с OpenClaw на Hermes.

Бежать обратно не планирую. Думаю, первые месяцы релиз будут обкатывать и допиливать, эти друзья славятся сыростью продового кода. Но без глубокой смены архитектуры OpenClaw развивать нет смысла.

🔵🤍🎯🛠📌📎

Источник
Please open Telegram to view this post
VIEW IN TELEGRAM
4
Please open Telegram to view this post
VIEW IN TELEGRAM
4🔥22
Книгу можно превратить в навык для ИИ-агента

Open-source-проект book-to-skill превращает PDF, EPUB или папку с документами в структурированный навык.

Вместо загрузки всей книги агент обращается только к нужной главе. Так он получает предметные знания и экономит контекст.

Команда выглядит просто:

/book-to-skill <путь к книге> [название навыка]

Подойдёт для технических книг, исследований, инструкций и внутренней документации.

GitHub · X-пост

💬 Внедрить ИИ
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥41
Вот почему я ушёл с Клода и вам советую.
5💯5🔥2🏆1
Мы публикуем в этом канале множество замечательных скилов, которые сами используем, чтобы автоматизировать всё на свете. Интересно узнать, используете вы это всё или пока нет?
Anonymous Poll
45%
Да, у меня есть агенты и я пробую то, что вы публикуете, спасибо за эти скилы! 🦾
30%
Я пока просто читаю, агента своего нет, попробовать не могу😳
15%
Я вообще не понимаю что тут происходит, меня удерживают на канале против моей воли 🙈
15%
Результаты ⬇️
Hermes не создан для кодинга. Почему после Codex я вернулся к нему?

22 августа, 15:00 МСК, наконец-то вернусь из 40-дневного путешествия и выйду в прямой эфир в Среде внедрения ИИ

Я покажу свой сетап на реальной задаче. Codex в этой связке пишет код, а Hermes хранит память и контекст проекта, подключает нужные навыки, проводит задачу через тесты, деплой и проверку результата.

Присоединяйтесь к Человек 2.0, чтобы проверить, способен ли он доводить реальные задачи до результата эффективнее специализированного кодинг-агента.

Контекст проекта не помещается в один промпт. В эфире покажу, как я его не теряю.

Приходите посмотреть на эту связку в реальной работе. И обсудим ваши наработки, можем попросить Сигурда оценить ваш пайплайн.

💬 Получить доступ к Среде.

До встречи 22 августа.
Please open Telegram to view this post
VIEW IN TELEGRAM
4🔥3
Впервые в «Человеке 2.0»? Начните отсюда.

Какую задачу в своей работе вы бы с удовольствием перестали делать сами?

С неё обычно и начинается работа с персональным ИИ-агентом.

С ходу понять, какую задачу поручить первой, бывает непросто. Поэтому мы собрали в боте тест из пяти рабочих ситуаций. Они помогут увидеть, где агент пригодится вам в первую очередь.

После каждого ответа бот сразу объяснит выбор. В финале покажет, как двигаться дальше.

Пройти тест и выбрать первый сценарий
Сегодня я надиктовал Hermes команду голосом: «Покупай билеты на панд на завтра»

Наконец-то мы едем к главной цели всего путешествия, с которого всё началось — смотреть панд в Чэнду. За этой простой фразой обычно прячется маленькая смена в отделе логистики: найти официальный билет, выбрать правильную дату и утренний слот, разобраться с тарифами, перенести сведения из четырёх паспортов, проверить латиницу, телефоны, оплату и подтверждение.

Обычно это задачка на вечер для папы, который вместо чила на отдыхе садится искать билеты.

Ссылка на оплату находится быстро. Время съедают следующие двадцать полей.

Hermes прошёл их сам. Выбрал два взрослых и два ученических билета, поставил слот 7:30–12:00, заполнил сведения из четырёх паспортов, учёл разные варианты написания фамилий латиницей и провёл оплату своей виртуальной картой на $24.34.

Внутри оказалось всё как мы любим. Кругом подводные камни. У детей свои условия. Trip.com несколько раз пересобирал платёжную форму. После оплаты пришлось отдельно открыть заказ, проверить статус Confirmed, затем зайти в обе группы билетов и прочитать правила прохода.

Через несколько минут у нас четыре подтверждённых билета. QR-коды не нужны. Завтра берём оригиналы паспортов (как везде в Китае) и едем.

Ценность агента живёт в двадцати скучных действиях, которые больше не на тебе.
4🔥4
60 ИИ-сервисов, которые можно запустить под своим брендом

Не знаю, кто это сделал. Но дай Бог ему здоровья.

В Awesome Generative AI Apps собрали 60 ГОТОВЫХ приложений в 10 категориях: генерация изображений и видео, виртуальные примерки, товарная фотография, недвижимость, аватары, тексты, агенты и голос.

Это готовые SaaS-шаблоны: вход через Google, платежи и кредиты, история задач, хранилище и подключение ИИ-моделей уже предусмотрены. Лицензия MIT разрешает переделать продукт, сменить бренд и использовать код в коммерческом проекте.

Развёртывание на Vercel одной кнопкой. После него всё равно потребуются хранилище, OAuth, Stripe, вебхуки, ключ MuAPI, тарифы и поддержка пользователей. Кнопка поднимает приложение, бизнес вокруг него придётся собирать самостоятельно.

Репозиторий сокращает путь от выбранной аудитории до MVP: берёте подходящий шаблон, адаптируете сценарий под конкретную профессию или рынок и проверяете спрос через реальные каналы привлечения.

Код типового ИИ-сервиса здесь уже собран. Узкое место — найти нишу с повторяющейся задачей и выстроить дистрибуцию, которая регулярно приводит пользователей. Профит!

А научиться это всё развертывать можно на нашем воркшопе Human20 за пару недель 😉

Даже если вы вообще не айтишник.

🐱 GitHub — тут лежит это добро добрейшее.
6🔥6
Open-source пентест-агент Strix набирает обороты.

Open-source пентест-агент Strix набирает обороты: 50 тысяч звёзд на GitHub, плюс 7 тысяч за неделю.

Агент работает как реальный хакер: запускает код, находит уязвимость, эксплуатирует её чтобы доказать что она реальная, и сразу пишет патч. Поддерживает GPT-5 и Claude Sonnet 4.5, открытая лицензия Apache-2.0.

Почему это важнее, чем кажется: модель угроз для автономных агентов та же, что и для кода. Агент с доступом к файлам и инструментам может сделать разрушительное действие случайно или по неверной интерпретации задачи.

Не важно, пишет он код или сводку, последствия такие же.

Полезный сдвиг, который Strix показывает на практике: пентест уже стал частью пайплайна, а не разовой акцией. Безопасность как нормальная инженерная дисциплина.

Репозиторий: github.com/usestrix/strix.

💬 Среда внедрения ИИ
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥32
This media is not supported in your browser
VIEW IN TELEGRAM
Опенсорсный Grok Bot уже здесь 🫣

OpenBot — локальная система для рабочих ИИ-агентов. Им можно поручать задачи, давать доступ к файлам, браузеру и только разрешённым инструментам.

В ролике агент сам входит в бэкофис через браузер, вытягивает 52 аккаунта, собирает статистику по контактам и готовит 36 персональных черновиков.

К OpenBot можно подключать Claude Code, Codex, Cursor и собственных агентов. Для локального запуска нужны свои API-ключи, зато всё остаётся на вашей машине.

Но у «опенсорса» есть жирная звёздочка: публичный MIT-репозиторий открыт только до версии 0.5.3. Более свежую разработку команда туда уже не выкладывает.

Проект ранний, гитхаб выглядит аккуратно, интересно что будет со следующими версиями.

🧱🔧🧬📈💎🟣🟢

OpenBot на GitHub
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
👨‍💻 Что остановится в компании, если ключевой сотрудник уйдёт в отпуск?

Пока он на связи, зависимость почти незаметна. Но стоит ему уйти, и выясняется: порядок работы нигде не записан, исключения спрятаны в переписке, а часть решений держится только в его голове.

С такой задачей пришёл участник Среды внедрения ИИ. Он передал личному ИИ-агенту Hermes полтора года рабочей переписки с сотрудником.

Агент разобрал задачи, повторяющиеся ситуации и решения, которые требуют участия владельца. В результате стало понятно, где Hermes может помочь, что сможет взять на себя и где по-прежнему нужен человек.

💬 Почитать отзыв

Проверить свой процесс можно по пяти вопросам:

• Какие задачи сотрудник выполняет регулярно?
• Откуда берёт данные и материалы?
• Где действует по инструкции?
• Какие решения принимает самостоятельно?
• Что согласует с руководителем?

Ответы покажут, что стоит закрепить в инструкции, что можно поручить агенту и какие решения оставить человеку.

В Среду приходят именно с такими рабочими задачами. Внутри участники находят готовые скилы и примеры, обсуждают свои ситуации, получают обратную связь и доводят идеи до процессов, которые можно использовать в работе.

Если часть вашей компании тоже держится на знаниях одного сотрудника, начните с разбора этого процесса.

Получить доступ в Среду внедрения ИИ
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1💯1
Появился китаец, который рвёт Fable и GPT-5.6 Sol. Пока бесплатно.

Вчера на OpenRouter из ниоткуда всплыла Ox Alpha: анонимная модель без сайта, без команды, без статьи. Открыли бесплатно на неделю, дали контекст в 1M токенов и пообещали 100T токенов мощности в день.

Бен Дэвис прогнал её по 10 задачам DeepSWE. Это формат, где модель сама разбирается в чужом коде и чинит его.

Результат:
┈ Ox Alpha: 80%
┈ Fable 5: 65%
┈ GPT-5.6 Sol: 52%

Дэвис сам оговаривает: выборка из 10 задач, разброс может быть огромный. Но Ox Alpha каждую задачу решала одним прогоном, а остальные модели получили по четыре попытки. И две недостающие она почти взяла, так что реально выше 80%.

Что известно о самой модели: мультимодальная, не хранит ваши запросы и не тренируется на них. Всё остальное засекречено до конца бесплатного окна. Дальше либо откроют имя, либо начнут брать деньги.

Я уже воткнул её в Hermes и тестирую. Окно короткое: кто хотел потрогать сильную модель за ноль долларов, сейчас самый момент.

🧱🔧🧬📈💎🟣🟢

Источник: твит Бена Дэвиса
Please open Telegram to view this post
VIEW IN TELEGRAM