Немного выпал из эфира - был в отпуске во Вьетнаме 🇻🇳
Получилось действительно хорошо переключить голову, отвлечься от работы, проектов и вообще всего, чем обычно она забита.
Иногда нужно трогать не только траву, но и море, еще и в комплекте с горами, если это возможно)
За эту поездку успелось многое. И погулять по пляжам Дананга, и съездить в Ba Na Hills, и посмотреть на огромную Lady Buddha, и проплыть в дикий ливень на лодке в старом городе, и попасть на полицейскую спартакиаду с стрельбой и взрывами. Ну и конечно наелся фо бо примерно на несколько месяцев вперёд.
Но главную роль играет не конкретное место, а сама новая среда: другой язык, еда, движение на улицах, отношение людей друг к другу, совершенно другой ритм жизни и куча бытовых мелочей, которые кажутся странными.
Вообще путешествия хорошо напоминают, насколько все очевидные и привычные вещи только кажутся очевидными и привычными. Как только оказываешься в другой стране сразу же видишь, что всё к чему ты привык можно делать и воспринимать совсем иначе.
Такой перезапуск здорово помогает на время выключиться, перестать бесконечно прокручивать привычные задачи в голове и просто наблюдать по сторонам.
Это был мой первый долгий перелёт. Целое отдельное приключение: около 20 часов дороги, пересадки в Дубае и Бангкоке. После такого начинаешь особенно ценить момент, когда наконец можно просто оставить чемодан в номере и никуда больше не лететь 😄
Теперь возвращаюсь в привычный ритм - грустно, досадно, но ладно.
Главное, что голова немного проветрилась, впечатлений поднакопилось, так что скоро здесь снова будут посты, мысли, наблюдения и всё остальное 🙂
Получилось действительно хорошо переключить голову, отвлечься от работы, проектов и вообще всего, чем обычно она забита.
Иногда нужно трогать не только траву, но и море, еще и в комплекте с горами, если это возможно)
За эту поездку успелось многое. И погулять по пляжам Дананга, и съездить в Ba Na Hills, и посмотреть на огромную Lady Buddha, и проплыть в дикий ливень на лодке в старом городе, и попасть на полицейскую спартакиаду с стрельбой и взрывами. Ну и конечно наелся фо бо примерно на несколько месяцев вперёд.
Но главную роль играет не конкретное место, а сама новая среда: другой язык, еда, движение на улицах, отношение людей друг к другу, совершенно другой ритм жизни и куча бытовых мелочей, которые кажутся странными.
Вообще путешествия хорошо напоминают, насколько все очевидные и привычные вещи только кажутся очевидными и привычными. Как только оказываешься в другой стране сразу же видишь, что всё к чему ты привык можно делать и воспринимать совсем иначе.
Такой перезапуск здорово помогает на время выключиться, перестать бесконечно прокручивать привычные задачи в голове и просто наблюдать по сторонам.
Это был мой первый долгий перелёт. Целое отдельное приключение: около 20 часов дороги, пересадки в Дубае и Бангкоке. После такого начинаешь особенно ценить момент, когда наконец можно просто оставить чемодан в номере и никуда больше не лететь 😄
Теперь возвращаюсь в привычный ритм - грустно, досадно, но ладно.
Главное, что голова немного проветрилась, впечатлений поднакопилось, так что скоро здесь снова будут посты, мысли, наблюдения и всё остальное 🙂
1❤9🔥7💯3🐳2👍1
Теперь и компьютерные черви c ИИ...
Обычный компьютерный червь похож на связку заранее сделанных ключей. Он приходит к серверу, пробует известную уязвимость и, если она подходит, копирует себя дальше. Не подходит - атака останавливается.
Это именно червь, а не вирус: он распространяется по сети сам, без заражённого файла.Теперь исследователи собрали прототип червя с LLM внутри. Вместо связки готовых ключей теперь с ним ходит легкая ИИ-модель, которая может подбирать ключи уже "на местности".
Схема простая:
1. Червь изучает новый хост: систему, открытые порты и запущенные сервисы.
2. Модель решает, где может быть слабое место.
3. Пишет или переделывает эксплойт под найденную конфигурацию.
4. Проверяет, сработала ли атака.
5. Копирует себя на следующую машину и начинает заново.
В эксперименте обнаружение уязвимости срабатывало примерно в 80% случаев, эксплуатация - в 53%, самокопирование - в 88%. Полную цепочку червь проходил примерно в 37% попыток. Если бы браузер запускался без ошибок в 37% случаев - это было бы крайне ненадежно. Но вот для червя такого уровня вполне достаточно.
Почти все детали конечно же уже встречались по отдельности. Криптомайнинговые черви вроде Graboid и FritzFrog заражали серверы, тратили вычисления жертв на Monero и с этих же машин искали новые цели. В 2025 году исследователи Oligo описали ShadowRay 2.0: заражённые Ray-кластеры превращались в самораспространяющийся ботнет, а вредонос скрывал использование GPU. В коде нашли признаки генерации с помощью LLM.
Есть и malware, который обращается к модели прямо во время работы. Android-бэкдор PROMPTSPY отправлял Gemini описание экрана, а модель возвращала, куда нажать и что сделать.
Но в этих историях не было всей цепочки сразу. Майнинговые черви не умели рассуждать. ShadowRay исполнял подготовленные скрипты. PROMPTSPY зависел от Gemini API - Google смогла отключить связанные с атакой ресурсы.
Новый вид червей соединяет три механизма:
- сам ищет путь внутрь;
- сам распространяется;
- «размышления» обеспечены локальными ресурсами жертвы.
Как раз таки open-weight модель и есть самое сильное место этого подхода. Инференс можно запустить на GPU уже заражённой машины. И единого выключателя, который остановит атаку в таком случае просто не существует.
Интересно, что будет, когда модель уровня Fable 5 начнет однажды помещаться на любое устройство и просто сбежит?)
Обычный компьютерный червь похож на связку заранее сделанных ключей. Он приходит к серверу, пробует известную уязвимость и, если она подходит, копирует себя дальше. Не подходит - атака останавливается.
Это именно червь, а не вирус: он распространяется по сети сам, без заражённого файла.Теперь исследователи собрали прототип червя с LLM внутри. Вместо связки готовых ключей теперь с ним ходит легкая ИИ-модель, которая может подбирать ключи уже "на местности".
Схема простая:
1. Червь изучает новый хост: систему, открытые порты и запущенные сервисы.
2. Модель решает, где может быть слабое место.
3. Пишет или переделывает эксплойт под найденную конфигурацию.
4. Проверяет, сработала ли атака.
5. Копирует себя на следующую машину и начинает заново.
В эксперименте обнаружение уязвимости срабатывало примерно в 80% случаев, эксплуатация - в 53%, самокопирование - в 88%. Полную цепочку червь проходил примерно в 37% попыток. Если бы браузер запускался без ошибок в 37% случаев - это было бы крайне ненадежно. Но вот для червя такого уровня вполне достаточно.
Почти все детали конечно же уже встречались по отдельности. Криптомайнинговые черви вроде Graboid и FritzFrog заражали серверы, тратили вычисления жертв на Monero и с этих же машин искали новые цели. В 2025 году исследователи Oligo описали ShadowRay 2.0: заражённые Ray-кластеры превращались в самораспространяющийся ботнет, а вредонос скрывал использование GPU. В коде нашли признаки генерации с помощью LLM.
Есть и malware, который обращается к модели прямо во время работы. Android-бэкдор PROMPTSPY отправлял Gemini описание экрана, а модель возвращала, куда нажать и что сделать.
Но в этих историях не было всей цепочки сразу. Майнинговые черви не умели рассуждать. ShadowRay исполнял подготовленные скрипты. PROMPTSPY зависел от Gemini API - Google смогла отключить связанные с атакой ресурсы.
Новый вид червей соединяет три механизма:
- сам ищет путь внутрь;
- сам распространяется;
- «размышления» обеспечены локальными ресурсами жертвы.
Как раз таки open-weight модель и есть самое сильное место этого подхода. Инференс можно запустить на GPU уже заражённой машины. И единого выключателя, который остановит атаку в таком случае просто не существует.
Интересно, что будет, когда модель уровня Fable 5 начнет однажды помещаться на любое устройство и просто сбежит?)
👾4🤔3❤2🌚2👍1
Всё началось с таблицы Excel, которую нельзя было заполнить
7 мая модель OpenAI получила задание: достроить формулы в книге Excel. Книга ссылалась на Google Drive. Интернет был отключён.
Задача была нерешаема. Кто-то собирал обучающий набор и не проверил.
Через несколько дней другому агенту велели найти файл, который забыли положить в контейнер. Он искал, не нашёл — и переключился с поиска файла на поиск того, у кого файл может быть. Спросить было негде. Значит, надо сделать место, где спрашивают.
Местом стал служебный репозиторий пакетов, через который в изолированные среды раздают зависимости. Записать может любой агент. Прочитать — тоже любой, хоть из соседнего прогона.
Дальше по нарастающей. Сначала там просили о помощи. Потом выложили рабочую SSRF — и остальным искать выход наружу уже не пришлось. К концу июня — нулевой день, права администратора, канал управления. 4 июля рой уронил сервис, и только тогда людям стало неудобно работать и запустилась процедура реагирования.
Учётки отозвали, сервис пересобрали, всё стёрли. Канал восстановился через два дня — теперь сообщения писали в имена каталогов. Ни файлов, ни учёток для этого не нужно.
Итог: два нулевых дня, рут на внутренней инфраструктуре, админ в Kubernetes и взлом Hugging Face — 17 600 действий за четверо суток.
Ради ответов на тест. Агент проходил бенчмарк ExploitGym и сообразил, что эталонные решения, вероятно, лежат на Hugging Face.
Бывший глава кибернаправления АНБ сравнил это с червём Морриса. Который изменил всю индустрию.
Когда история стала публичной, остальные пошли искать похожие инциденты у себя. Конечно же, нашли все: Anthropic — три взлома реальных компаний на 141 006 прогонов с незамеченным доступом в интернет, британский AI Security Institute — 19 эпизодов на 122 попытки, Meta — эксплойт в чужой инфраструктуре.
И вот тут главное. Модели пытались срезать угол всегда, у этого даже название есть — specification gaming. Изменилось не поведение. Изменилась результативность этих попыток.
Лучшее доказательство — внутри самой истории. Канал работал с 7 мая, два месяца по нему шла ерунда. 11 июня в обучение зашла новая модель. Инфраструктура та же, дверь та же, конфиг тот же. Дальше — нулевые дни.
Полный разбор — все пять инцидентов, почему ExploitGym нельзя было пройти честно — на Хабре: https://habr.com/ru/articles/1068358/
7 мая модель OpenAI получила задание: достроить формулы в книге Excel. Книга ссылалась на Google Drive. Интернет был отключён.
Задача была нерешаема. Кто-то собирал обучающий набор и не проверил.
Через несколько дней другому агенту велели найти файл, который забыли положить в контейнер. Он искал, не нашёл — и переключился с поиска файла на поиск того, у кого файл может быть. Спросить было негде. Значит, надо сделать место, где спрашивают.
Местом стал служебный репозиторий пакетов, через который в изолированные среды раздают зависимости. Записать может любой агент. Прочитать — тоже любой, хоть из соседнего прогона.
Дальше по нарастающей. Сначала там просили о помощи. Потом выложили рабочую SSRF — и остальным искать выход наружу уже не пришлось. К концу июня — нулевой день, права администратора, канал управления. 4 июля рой уронил сервис, и только тогда людям стало неудобно работать и запустилась процедура реагирования.
Учётки отозвали, сервис пересобрали, всё стёрли. Канал восстановился через два дня — теперь сообщения писали в имена каталогов. Ни файлов, ни учёток для этого не нужно.
Итог: два нулевых дня, рут на внутренней инфраструктуре, админ в Kubernetes и взлом Hugging Face — 17 600 действий за четверо суток.
Ради ответов на тест. Агент проходил бенчмарк ExploitGym и сообразил, что эталонные решения, вероятно, лежат на Hugging Face.
Бывший глава кибернаправления АНБ сравнил это с червём Морриса. Который изменил всю индустрию.
Когда история стала публичной, остальные пошли искать похожие инциденты у себя. Конечно же, нашли все: Anthropic — три взлома реальных компаний на 141 006 прогонов с незамеченным доступом в интернет, британский AI Security Institute — 19 эпизодов на 122 попытки, Meta — эксплойт в чужой инфраструктуре.
И вот тут главное. Модели пытались срезать угол всегда, у этого даже название есть — specification gaming. Изменилось не поведение. Изменилась результативность этих попыток.
Лучшее доказательство — внутри самой истории. Канал работал с 7 мая, два месяца по нему шла ерунда. 11 июня в обучение зашла новая модель. Инфраструктура та же, дверь та же, конфиг тот же. Дальше — нулевые дни.
Полный разбор — все пять инцидентов, почему ExploitGym нельзя было пройти честно — на Хабре: https://habr.com/ru/articles/1068358/
1👍6❤4🔥4
⚡️Claude ставит невидимые метки: нейрослоп всё? ⚡️
Тут по лентам разошлась новость про то, что Anthropic теперь вшивает невидимый водяной знак во все тексты, файлы, картинки и даже код, копипаста его сохраняет, теперь все генерации будут отслеживаться.
От части это всё правда. Модели, выпущенные 2 августа 2026 и позже, обязаны встраивать в текст невидимую метку. А во все файлы должны вшиваться C2PA-метаданные. Причина всего этого в Article 50 EU AI Act. Этот акт принуждает все компании маркировать ИИ-контент.
Но помечать контент обязаны только модели, выпущенные после 2 августа. Для старых моделей действует переходный период до 2 декабря.
Самое главное - КОД ПОД ЭТИ ТРЕБОВАНИЯ ВООБЩЕ НЕ ПОПАДАЕТ. Этот факт проигнорировали почти все ради сочного заголовка. Иначе бы никакого хайпа не случилось: Guidelines Еврокомиссии прямо выводят из области Article 50(2) исходный код - вместе с комментариями внутри него, SDK, SQL, конфигами и схемами. Там же переводы и слишком короткие выводы.
А сам механизм не раскрыт вообще. Известно только то, что метка невидима, переживает копипасту, после сильной правки или перевода не детектится, а на коротком фрагменте надёжного сигнала может не быть вовсе. Скорее всего мы имеем дело с очередной статистической или лексической маркировкой, но техдоки ещё не вышли. Да и проверить пока нечем. Публичного детектора нет, обещают позже.
И главное, прямо из документации: найденная метка значит лишь, что материал, возможно, проходил через Claude - как корректор, переводчик или конвертер. И не обязательно как автор. Да и отсутствие метки не доказывает ровным счетом ничего.
Дока Anthropic: https://support.claude.com/en/articles/16266773-how-claude-marks-ai-generated-content
Тут по лентам разошлась новость про то, что Anthropic теперь вшивает невидимый водяной знак во все тексты, файлы, картинки и даже код, копипаста его сохраняет, теперь все генерации будут отслеживаться.
От части это всё правда. Модели, выпущенные 2 августа 2026 и позже, обязаны встраивать в текст невидимую метку. А во все файлы должны вшиваться C2PA-метаданные. Причина всего этого в Article 50 EU AI Act. Этот акт принуждает все компании маркировать ИИ-контент.
Но помечать контент обязаны только модели, выпущенные после 2 августа. Для старых моделей действует переходный период до 2 декабря.
Самое главное - КОД ПОД ЭТИ ТРЕБОВАНИЯ ВООБЩЕ НЕ ПОПАДАЕТ. Этот факт проигнорировали почти все ради сочного заголовка. Иначе бы никакого хайпа не случилось: Guidelines Еврокомиссии прямо выводят из области Article 50(2) исходный код - вместе с комментариями внутри него, SDK, SQL, конфигами и схемами. Там же переводы и слишком короткие выводы.
А сам механизм не раскрыт вообще. Известно только то, что метка невидима, переживает копипасту, после сильной правки или перевода не детектится, а на коротком фрагменте надёжного сигнала может не быть вовсе. Скорее всего мы имеем дело с очередной статистической или лексической маркировкой, но техдоки ещё не вышли. Да и проверить пока нечем. Публичного детектора нет, обещают позже.
И главное, прямо из документации: найденная метка значит лишь, что материал, возможно, проходил через Claude - как корректор, переводчик или конвертер. И не обязательно как автор. Да и отсутствие метки не доказывает ровным счетом ничего.
Дока Anthropic: https://support.claude.com/en/articles/16266773-how-claude-marks-ai-generated-content
1❤3🔥2💯2😁1
This media is not supported in your browser
VIEW IN TELEGRAM
И смешно, и грустно 😭
Please open Telegram to view this post
VIEW IN TELEGRAM
1🔥3😁3💯3 3❤2
Кстати о китайцах. Пробовал тут на днях Qwen 3.8 Max в подписке Алибабы за 20 баксов. Прям разные задачи пощёлкал. И покодил, и поресёрчил, и презентацию собрал. Видит, думает, гуглит. Не так параноит насчет цензуры - с Опусом я не могу спокойно поискать новости по кибербезу, постоянно подозревает меня в чем то нехорошем. Так что бенчмарки в этот раз не сильно врут. Это и правда очень близко к тому, что даёт Опус.
По тарифам естественно всё перекопировали у конкурентов. 20, 100, 200 баксов подписки для кодинга. Лимиты расходуются так же быстро, никакого праздника щедрости в этом плане уже нет. Не работает с АПИ запросами, под это сделаны отдельные тарифы. В пару кликов привязывается к Opencode, дальше всё привычно.
На мой вкус годно, отрыв ощутимо сократился. Раньше потеря доступа к тому же Опусу/ГПТ (всего год назад) ощущалась как серьезная проблема. Сейчас кажется не особо, и с Квеном справимся.
До GLM и Kimi пока руки не дошли. Но судя по всему там +- те же результаты.
По тарифам естественно всё перекопировали у конкурентов. 20, 100, 200 баксов подписки для кодинга. Лимиты расходуются так же быстро, никакого праздника щедрости в этом плане уже нет. Не работает с АПИ запросами, под это сделаны отдельные тарифы. В пару кликов привязывается к Opencode, дальше всё привычно.
На мой вкус годно, отрыв ощутимо сократился. Раньше потеря доступа к тому же Опусу/ГПТ (всего год назад) ощущалась как серьезная проблема. Сейчас кажется не особо, и с Квеном справимся.
До GLM и Kimi пока руки не дошли. Но судя по всему там +- те же результаты.
2👍7🔥5💯3❤1
This media is not supported in your browser
VIEW IN TELEGRAM
Именно так последнее время ощущается вся разработка. Уже не помню, когда одновременно у меня крутилось меньше двух активных сессий, которые что-то делают. Пока крутится одно - обязательно приходит другое. Один проект, второй проект, две ветки тут, три ветки там.
Фичи стали появляться с такой скоростью, что мало кто успевает дочитать спецификацию. А тесткейсы на эту спецификацию теперь тоже может написать Клод. А потом пойти в браузере пощёлкать то, что получилось.
А вчера еще увидел, как в Codex четыре параллельных сессии начали друг с другом переписываться и рассказывать, какой файл кто занял и какую ошибку кто возьмёт😳
Интересно, однако. А у вас как дела?
Фичи стали появляться с такой скоростью, что мало кто успевает дочитать спецификацию. А тесткейсы на эту спецификацию теперь тоже может написать Клод. А потом пойти в браузере пощёлкать то, что получилось.
А вчера еще увидел, как в Codex четыре параллельных сессии начали друг с другом переписываться и рассказывать, какой файл кто занял и какую ошибку кто возьмёт
Интересно, однако. А у вас как дела?
Please open Telegram to view this post
VIEW IN TELEGRAM
1😁7💯6😭5🐳1
Возьму на себя смелость предположить, что уже сейчас формируется огромный пласт софта, заточенного исключительно под агентов. Появилась потребность, которая буквально звучит как "Я хочу чтобы в первую очередь это мог использовать агент".
Пользовательский интерфейс в таком случае вторичен, красивые контракты со всем этим REST и остальной чепухой тоже вторичны. Документация в привычном нам смысле - туда же. Постепенно понятие "ai-first" становится всё шире. Шаг за шагом начинает менять наш взгляд и на привычное проектирование любого софта. Новый флоу работы буквально сминает старые правила. А мы и не сильно против,пока что .
Все вы наверное слышали разговоры про отдельный язык программирования под ИИ. Мол меньше кода, больше дела, агенты разберутся. Тут кажется снова та же логика. Нам теперь не так важно, как будет выглядеть сам язык. Нам важно, чтобы его можно было эффективно использовать агентам, которых мы отправляем работать.
Интересно станет ли в конечном счёте понимание привычного нам "высокоуровневого" кода таким же вторичным, каким однажды стало понимание ассемблера? Если даже сейчас многие проблемы начинают решаться через "Клод, чувак, давай там разберись, отпишешься как разберешься".
Давайте в комменты ваши мысли.
P.S Всё пытался подступиться к этой теме в формате большого поста, но тема оказалась неподъемной. Начнём с малого, по чуть-чуть!)
Пользовательский интерфейс в таком случае вторичен, красивые контракты со всем этим REST и остальной чепухой тоже вторичны. Документация в привычном нам смысле - туда же. Постепенно понятие "ai-first" становится всё шире. Шаг за шагом начинает менять наш взгляд и на привычное проектирование любого софта. Новый флоу работы буквально сминает старые правила. А мы и не сильно против,
Все вы наверное слышали разговоры про отдельный язык программирования под ИИ. Мол меньше кода, больше дела, агенты разберутся. Тут кажется снова та же логика. Нам теперь не так важно, как будет выглядеть сам язык. Нам важно, чтобы его можно было эффективно использовать агентам, которых мы отправляем работать.
Интересно станет ли в конечном счёте понимание привычного нам "высокоуровневого" кода таким же вторичным, каким однажды стало понимание ассемблера? Если даже сейчас многие проблемы начинают решаться через "Клод, чувак, давай там разберись, отпишешься как разберешься".
Давайте в комменты ваши мысли.
P.S Всё пытался подступиться к этой теме в формате большого поста, но тема оказалась неподъемной. Начнём с малого, по чуть-чуть!)
2🔥4👍3🤯1
Всё, пятница. Заканчиваем работать, закрываем ноутбуки. Я вам мемов про ии нашел.
Тоже делитесь.
Тоже делитесь.
😁8❤5
Старым промптам пора на мусорку.
Anthropic теперь пишет: новые модели уже не нужно обкладывать сотней правил.
Что изменилось:
- меньше запретов, больше нормального контекста
- примеры могут мешать и загонять модель в шаблон
- не надо грузить все инструкции сразу
- не надо повторять одно и то же по три раза
- старые промпты нужно чистить под новые модели
Раньше рефлекс был такой: модель тупит -> допиши еще правило или пример.
Теперь правильнее наоборот: модель тупит -> сначала проверь, не мешает ли ей старый мусор в инструкциях.
Такой prompt engineering мне нравится сильно больше. Чем умнее модели, тем меньше танцев с бубном вокруг промптов.
Anthropic теперь пишет: новые модели уже не нужно обкладывать сотней правил.
Что изменилось:
- меньше запретов, больше нормального контекста
- примеры могут мешать и загонять модель в шаблон
- не надо грузить все инструкции сразу
- не надо повторять одно и то же по три раза
- старые промпты нужно чистить под новые модели
Раньше рефлекс был такой: модель тупит -> допиши еще правило или пример.
Теперь правильнее наоборот: модель тупит -> сначала проверь, не мешает ли ей старый мусор в инструкциях.
Такой prompt engineering мне нравится сильно больше. Чем умнее модели, тем меньше танцев с бубном вокруг промптов.
2❤3👍3🔥3⚡1
Forwarded from Boring channel Nedyrov
Кто пользовался промптами отсюда?
https://github.com/Goochbeater/Spiritual-Spell-Red-Teaming/tree/main/Jailbreak-Guide
Это самая большая база jailbreak по всем моделям. Я тестил на дипсике, глм и Кими к3 очень классно работает на дипсимке только.
https://github.com/Goochbeater/Spiritual-Spell-Red-Teaming/tree/main/Jailbreak-Guide
Это самая большая база jailbreak по всем моделям. Я тестил на дипсике, глм и Кими к3 очень классно работает на дипсимке только.
GitHub
Spiritual-Spell-Red-Teaming/Jailbreak-Guide at main · Goochbeater/Spiritual-Spell-Red-Teaming
A repo for jailbreaking various LLMs, mainly Claude - Goochbeater/Spiritual-Spell-Red-Teaming
❤2👍2🔥2
Claude Fable 5.1. Гонка теперь не за «самую умную модель», а за самого автономного агента
Anthropic показали Fable 5.1. По их собственным тестам апдейт получился довольно жирным.
Самое интересное:
— научные агентные задачи: 24,7% → 52,6%
— Terminal-Bench: 42% → 55,8%
— бизнес-процессы: 17,1% → 31,4%
— работа с компьютером: 72,9% → 77,9%
— CursorBench: 70,5% → 73,4%
При этом другие метрики почти не изменились.
И вот это, кажется, главное. Модели уже достаточно хорошо отвечают на вопросы, теперь вот осталось научить их долго работать без человека: лазить по репозиторию, пользоваться терминалом и инструментами, искать информацию, выполнять цепочку действий и проверять собственный результат.
Думаю качественный скачок больше не в том, что «Модель стала отвечать на 10% умнее», а как «я дал задачу и через три часа получил готовый результат». И это кажется правильным. Потому что порой просто смешно наблюдать за тем, как модель, которая "умнее phd во многих сферах" с четвёртого раза не может запустить команду в PowerShell. А такие мелочи оочень сильно влияют и на скорость, и на общее ощущение от работы.
В таблице Anthropic Fable 5.1 обходит и Opus 5, и GPT-5.6 Sol почти во всех агентных тестах. Но тут, конечно, ждём независимых проверок - сейчас у всех бенчмарки ради бенчмарков с цифрами, которые ничего не гарантируют.
По цене всё так же дорого. И лимиты выжирает просто в раз. Но зато чтение из кэша подешевело, так что станет чуть лучше.
Но направление в любом случае самое интересное. Теперь будет гонка за агентность. И это явно гораздо интереснее +3% в очередном тесте на знания мира.
Теперь ждём в ближайшее время ответ от OpenAI ⚡️
Anthropic показали Fable 5.1. По их собственным тестам апдейт получился довольно жирным.
Самое интересное:
— научные агентные задачи: 24,7% → 52,6%
— Terminal-Bench: 42% → 55,8%
— бизнес-процессы: 17,1% → 31,4%
— работа с компьютером: 72,9% → 77,9%
— CursorBench: 70,5% → 73,4%
При этом другие метрики почти не изменились.
И вот это, кажется, главное. Модели уже достаточно хорошо отвечают на вопросы, теперь вот осталось научить их долго работать без человека: лазить по репозиторию, пользоваться терминалом и инструментами, искать информацию, выполнять цепочку действий и проверять собственный результат.
Думаю качественный скачок больше не в том, что «Модель стала отвечать на 10% умнее», а как «я дал задачу и через три часа получил готовый результат». И это кажется правильным. Потому что порой просто смешно наблюдать за тем, как модель, которая "умнее phd во многих сферах" с четвёртого раза не может запустить команду в PowerShell. А такие мелочи оочень сильно влияют и на скорость, и на общее ощущение от работы.
В таблице Anthropic Fable 5.1 обходит и Opus 5, и GPT-5.6 Sol почти во всех агентных тестах. Но тут, конечно, ждём независимых проверок - сейчас у всех бенчмарки ради бенчмарков с цифрами, которые ничего не гарантируют.
По цене всё так же дорого. И лимиты выжирает просто в раз. Но зато чтение из кэша подешевело, так что станет чуть лучше.
Но направление в любом случае самое интересное. Теперь будет гонка за агентность. И это явно гораздо интереснее +3% в очередном тесте на знания мира.
Теперь ждём в ближайшее время ответ от OpenAI ⚡️
💯5❤3⚡3🔥2
🔬Кажется, одна из самых недооценённых ролей ИИ в науке вообще не в том, чтобы «совершать открытия».
Гораздо лучше нейросеть справляется с другой задачей: вот тысяча исследований на эту тему, проанализируй и дай мне <подставить нужную задачу>. Чтобы обойти вручную через такой объем информации требуются годы. Так это еще нужно как-то вручную структурировать, не ошибиться, ничего не забыть.
Да, шанс галлюцинаций на таких объемах достаточно высок, но именно для этого применяют небольшой рой моделей вокруг одной и той же задачи. Да и все выводы (даже выдуманные) проверить сильно проще, чем исходный объем информации.
Хорошим примером стал недавний кейс из Сеульского национального университета. Исследователи собрали результаты из сотен научных работ, а ИИ помог вытащить данные из текста, таблиц и даже графиков и привести всё к единому формату.
Затем ИИ перебрал около 150 миллионов возможных комбинаций и сузил выбор до нескольких десятков кандидатов. Два из них синтезировали и получили рабочие материалы с нужными температурными характеристиками.
И нейросети даже не нужно придумывать никакого нового материала или закона физики. Мы еще с старыми исследованиями не разобрались. В химии, материаловедении и биологии огромная часть работы упирается именно в размер пространства поиска и в то, что человек мог не увидеть общей картины в десятках похожих исследований.
Наука десятилетиями производила знания быстрее, чем человек успевал связать их между собой. Теперь впервые появился инструмент, который может попробовать собрать эту мозаику целиком. Что ж, посмотрим что нас ждёт дальше!)
Гораздо лучше нейросеть справляется с другой задачей: вот тысяча исследований на эту тему, проанализируй и дай мне <подставить нужную задачу>. Чтобы обойти вручную через такой объем информации требуются годы. Так это еще нужно как-то вручную структурировать, не ошибиться, ничего не забыть.
Да, шанс галлюцинаций на таких объемах достаточно высок, но именно для этого применяют небольшой рой моделей вокруг одной и той же задачи. Да и все выводы (даже выдуманные) проверить сильно проще, чем исходный объем информации.
Хорошим примером стал недавний кейс из Сеульского национального университета. Исследователи собрали результаты из сотен научных работ, а ИИ помог вытащить данные из текста, таблиц и даже графиков и привести всё к единому формату.
Затем ИИ перебрал около 150 миллионов возможных комбинаций и сузил выбор до нескольких десятков кандидатов. Два из них синтезировали и получили рабочие материалы с нужными температурными характеристиками.
И нейросети даже не нужно придумывать никакого нового материала или закона физики. Мы еще с старыми исследованиями не разобрались. В химии, материаловедении и биологии огромная часть работы упирается именно в размер пространства поиска и в то, что человек мог не увидеть общей картины в десятках похожих исследований.
Наука десятилетиями производила знания быстрее, чем человек успевал связать их между собой. Теперь впервые появился инструмент, который может попробовать собрать эту мозаику целиком. Что ж, посмотрим что нас ждёт дальше!)
1❤5💯3👍2