This media is not supported in your browser
VIEW IN TELEGRAM
451 токен по Фаренгейту: правда ли, что ИИ-компании уничтожают книги
Помните громкий суд Anthropic по делу нарушения авторских прав? Мы напомним: чуть меньше года назад антропики проходили по коллективному иску авторов, на чьих работах они обучали модели. В итоге стартапу пришлось платить громадные штрафы за пиратские копии, но в то же время компанию оправдали за обучение ИИ на купленных бумажных экземплярах. Попался прогрессивный судья, который постановил, что это «добросовестное использование» бумажных копий.
Больше подробностей было здесь: https://t.me/data_secrets/7780
Так вот тем самым Anthropic создали серьезный прецедент и, как оказалось, дали начало большому тренду на массовую закупку и оцифровку бумажных книг для обучения ИИ. Раз это «добросовестное использование», почему бы и всем остальным лабам этим не воспользоваться?
Так что да, теперь ИИ-компании массово скупают подержанные бумажные книги, изданные до 2022 года (чтобы текст точно был человеческий), разрезают их гидравлическим прессом, отделяя страницы от переплета, и таким образом сканируют для датасетов. Сама книга как физический объект при этом, понятно, уничтожается.
Если тираж массовый, то потеря невелика. Но букинисты фиксируют аномальные оптовые закупки и в сегменте редких, давно не переиздававшихся книг (то есть экземпляров, которых в мире осталось немного).
К сожалению, прямых доказательств, что это именно ИИ-компании охотятся за раритетами, нет, потому что работа идет через посредников. Например, сервис ISBNdb принципиально не раскрывают личности покупателей, но при этом известно, что они открыто предлагают ИИ-лабам оптовые партии книг на заказ.
Расследование: https://www.404media.co/ai-companies-are-buying-tons-of-old-books-because-theyre-free-of-ai-slop/
Помните громкий суд Anthropic по делу нарушения авторских прав? Мы напомним: чуть меньше года назад антропики проходили по коллективному иску авторов, на чьих работах они обучали модели. В итоге стартапу пришлось платить громадные штрафы за пиратские копии, но в то же время компанию оправдали за обучение ИИ на купленных бумажных экземплярах. Попался прогрессивный судья, который постановил, что это «добросовестное использование» бумажных копий.
Больше подробностей было здесь: https://t.me/data_secrets/7780
Так вот тем самым Anthropic создали серьезный прецедент и, как оказалось, дали начало большому тренду на массовую закупку и оцифровку бумажных книг для обучения ИИ. Раз это «добросовестное использование», почему бы и всем остальным лабам этим не воспользоваться?
Так что да, теперь ИИ-компании массово скупают подержанные бумажные книги, изданные до 2022 года (чтобы текст точно был человеческий), разрезают их гидравлическим прессом, отделяя страницы от переплета, и таким образом сканируют для датасетов. Сама книга как физический объект при этом, понятно, уничтожается.
Если тираж массовый, то потеря невелика. Но букинисты фиксируют аномальные оптовые закупки и в сегменте редких, давно не переиздававшихся книг (то есть экземпляров, которых в мире осталось немного).
К сожалению, прямых доказательств, что это именно ИИ-компании охотятся за раритетами, нет, потому что работа идет через посредников. Например, сервис ISBNdb принципиально не раскрывают личности покупателей, но при этом известно, что они открыто предлагают ИИ-лабам оптовые партии книг на заказ.
Расследование: https://www.404media.co/ai-companies-are-buying-tons-of-old-books-because-theyre-free-of-ai-slop/
Как две галочки в API утроили результат GPT-5.6 на ARC-AGI-3
Очень занятное исследование выпустили сегодня OpenAI. В двух словах: иногда важнее как мы тестируем, а не что мы тестируем. Но обо всем по порядку.
Когда вышла GPT-5.6 Sol, результаты на ARC-AGI-3 для такой сильной модели оказались подозрительно слабыми – всего 7.8%. И это при том, что Sol хорошо прошла Pokémon FireRed и решила, например, гипотезу о двойном покрытии циклов. В общем, команда решила разобраться, в чем дело.
Напоминаем, что ARC-AGI-3 – это бенчмарк для агентов. Соответственно, модели для взаимодействия со средой нужна какая-то обвязка – харнесс – которая определяет, что модель видит на каждом шаге, как вызываются инструменты, что происходит с контекстом и тд. Ожидаемо, среда ARC-AGI-3 использует максимально простой универсальный харнесс, чтобы честно сравнивать модели между собой. Но для OpenAI именно в этой универсальности и оказалась зарыта собака.
Во-первых, после каждого действия в игре весь приватный ризонинг модели просто удалялся, так что Sol не видел собственных планов и рассуждений с прошлых шагов. Во-вторых, из-за использования скользящего окна по мере роста истории любые старые действия становились для модели невидимыми.
Но дело в том, что Sol была специально обучена именно с сохранением ризонинга между шагами. Харнесс эту фишку отрубил, и результаты посыпались.
А теперь внимание на график наверху. Зеленое – это результаты модели на public сете ARC-AGI-3 на официальном харнессе. А синее – на харнессе, в котором просто включили сохранение ризонинга между вызовами и заменили грубое обрезание истории на сжатие контекста (те же настройки используются в продакшене ChatGPT и Codex). 38.3% против 13.3%, и при этом расход токенов на вывод снизился в 6 раз. Для сравнения, средний результат человека – 48%.
Мораль от OpenAI: бенчмарк меряет не только модель, но и то, как именно ее используют. Как минимум, давно пора на подобных бенчмарках использовать Responses API вместо седого Chat Completions.
Очень занятное исследование выпустили сегодня OpenAI. В двух словах: иногда важнее как мы тестируем, а не что мы тестируем. Но обо всем по порядку.
Когда вышла GPT-5.6 Sol, результаты на ARC-AGI-3 для такой сильной модели оказались подозрительно слабыми – всего 7.8%. И это при том, что Sol хорошо прошла Pokémon FireRed и решила, например, гипотезу о двойном покрытии циклов. В общем, команда решила разобраться, в чем дело.
Напоминаем, что ARC-AGI-3 – это бенчмарк для агентов. Соответственно, модели для взаимодействия со средой нужна какая-то обвязка – харнесс – которая определяет, что модель видит на каждом шаге, как вызываются инструменты, что происходит с контекстом и тд. Ожидаемо, среда ARC-AGI-3 использует максимально простой универсальный харнесс, чтобы честно сравнивать модели между собой. Но для OpenAI именно в этой универсальности и оказалась зарыта собака.
Во-первых, после каждого действия в игре весь приватный ризонинг модели просто удалялся, так что Sol не видел собственных планов и рассуждений с прошлых шагов. Во-вторых, из-за использования скользящего окна по мере роста истории любые старые действия становились для модели невидимыми.
Но дело в том, что Sol была специально обучена именно с сохранением ризонинга между шагами. Харнесс эту фишку отрубил, и результаты посыпались.
А теперь внимание на график наверху. Зеленое – это результаты модели на public сете ARC-AGI-3 на официальном харнессе. А синее – на харнессе, в котором просто включили сохранение ризонинга между вызовами и заменили грубое обрезание истории на сжатие контекста (те же настройки используются в продакшене ChatGPT и Codex). 38.3% против 13.3%, и при этом расход токенов на вывод снизился в 6 раз. Для сравнения, средний результат человека – 48%.
Мораль от OpenAI: бенчмарк меряет не только модель, но и то, как именно ее используют. Как минимум, давно пора на подобных бенчмарках использовать Responses API вместо седого Chat Completions.
❤117🔥46👍18😁9
OpenAI существенно понизили цены на GPT-5.6
— На Luna – на 80% (цена теперь 0.20$/1.20$ за миллион i/o)
— На Terra – на 20% (теперь 2$/12$ за миллион i/o)
— На Sol, к сожалению, дропа нет, но зато в API появился Fast mode: цена удваивается, но скорость растет в 2.5 раза без потерь в качестве. GPT-5.6 Sol на Cerebras все еще ждем
Конкуренция творит чудеса, конечно
— На Luna – на 80% (цена теперь 0.20$/1.20$ за миллион i/o)
— На Terra – на 20% (теперь 2$/12$ за миллион i/o)
— На Sol, к сожалению, дропа нет, но зато в API появился Fast mode: цена удваивается, но скорость растет в 2.5 раза без потерь в качестве. GPT-5.6 Sol на Cerebras все еще ждем
Конкуренция творит чудеса, конечно
❤111🔥48😁17👍10☃2 2⚡1🤯1🫡1
24 сентября Yandex Cloud проведёт Yandex Scale 2026 — флагманскую технологическую конференцию года, посвящённую облачным технологиям, инфраструктуре и искусственному интеллекту.
В этот раз формат: четыре офлайн-трека — Hybrid Infrastructure & DevOps, Data, AI и Security — плюс отдельный онлайн-трек DeepTech для тех, кто не может приехать, но не хочет пропускать движ: с возможностью участвовать в воркшопах😏
Отдельно — виртуальный стенд VibeCraft, где можно завайбкодить свой проект и забрать призы.
Плюс отдельная онлайн-студия с интерактивной программой где можно:
🔴 оценить юмор на Лиге IT-шуток;
🔴 задать вопросы СТО Yandex Cloud;
🔴 послушать известных научпоп-спикеров и задать им свои вопросы;
Зрители голосуют и в реальном времени влияют на взаимодействие в студии. И это ещё не всё!
Из содержания — реальные инженерные кейсы, воркшопы по ИИ, продуктовые анонсы и доклады, после которых сразу понятно, что делать дальше. И много интерактива!
Будет полезно архитекторам, тимлидам, разработчикам, ML- и DevOps-инженерам, аналитикам, продактам и всем, кто отвечает за инженерную часть бизнеса.
Подать заявку можно по ссылке. Участие бесплатное!
В этот раз формат: четыре офлайн-трека — Hybrid Infrastructure & DevOps, Data, AI и Security — плюс отдельный онлайн-трек DeepTech для тех, кто не может приехать, но не хочет пропускать движ: с возможностью участвовать в воркшопах
Отдельно — виртуальный стенд VibeCraft, где можно завайбкодить свой проект и забрать призы.
Плюс отдельная онлайн-студия с интерактивной программой где можно:
Зрители голосуют и в реальном времени влияют на взаимодействие в студии. И это ещё не всё!
Из содержания — реальные инженерные кейсы, воркшопы по ИИ, продуктовые анонсы и доклады, после которых сразу понятно, что делать дальше. И много интерактива!
Будет полезно архитекторам, тимлидам, разработчикам, ML- и DevOps-инженерам, аналитикам, продактам и всем, кто отвечает за инженерную часть бизнеса.
Подать заявку можно по ссылке. Участие бесплатное!
Please open Telegram to view this post
VIEW IN TELEGRAM
❤19🗿14😁8
DeepSeek обновили DeepSeek-V4-Flash: теперь модель близка по метрикам к Opus 4.8!
Модель вышла из превью и уже появилась в официальном API. Бенчмарки – выше.
Модель не только обгоняет V4-Pro-Preview, но и очень неплохо перформит на агентных сценариях и кодинге. На DeepSWE набирает 54.4%, обгоняя GLM-5.2 и почти приближаясь к Opus 4.8. На TerminalBench – 82.7%, снова больше GLM и на уровне с Opus.
Архитектура и размер модели остались полностью неизменными. Все улучшения за счет дополнительного пост-трейна.
Цена: $0.14 in/ $0.28 out. В десятки раз дешевле Opus 4.8. А кэш – всего $0.0028! Большой конкурент для тех же GPT-5.6 Luna и Terra.
Полноценный релиз DeepSeek-V4-Pro пообещали «ASAP»
Модель вышла из превью и уже появилась в официальном API. Бенчмарки – выше.
Модель не только обгоняет V4-Pro-Preview, но и очень неплохо перформит на агентных сценариях и кодинге. На DeepSWE набирает 54.4%, обгоняя GLM-5.2 и почти приближаясь к Opus 4.8. На TerminalBench – 82.7%, снова больше GLM и на уровне с Opus.
Архитектура и размер модели остались полностью неизменными. Все улучшения за счет дополнительного пост-трейна.
Цена: $0.14 in/ $0.28 out. В десятки раз дешевле Opus 4.8. А кэш – всего $0.0028! Большой конкурент для тех же GPT-5.6 Luna и Terra.
Полноценный релиз DeepSeek-V4-Pro пообещали «ASAP»
🔥175❤30👍21😁6🍾6⚡3😎2🤨1
Media is too big
VIEW IN TELEGRAM
Google DeepMind представили Gemini Robotics 2
С релиза версии 1.5 прошел почти год. Довольно долгий перерыв по сегодняшим меркам. Посмотрим, чего Google добились за это время.
Самое важное: VLA-модель, которая лежит в основе, впервые управляет полным телом гуманоида от стоп до пальцев рук, а не только верхней частью корпуса. При этом у рук моторика достаточно мелкая, 22 степени свободы. Нельзя сказать, что робот получается супер-ловким (success rate на multi-finger задачах в районе 30-40%), но это прогресс.
Поверх VLA-модели также работает оркестратор Gemini Robotics ER 2. Это отдельная модель поколения, и тут уже просто VLM. То есть, если у VLA на выходе готовые моторные команды, то ER – это более высокий уровень, но котором выполняется ризонинг, разбиение задачи на подзадачи, распознавание объектов и их координат и прочая "интеллектуальная" работа.
Эту модель тоже существенно прокачали и добавили ей киллер-фичу в виде способности координировать работу сразу нескольких разнотипных роботов для выполнения одной задачи. Кроме того, теперь ER может вмешиваться в действия VLA на любом этапе выполнения задачи, что критично для self-correction.
Еще в поколении появилась модель Gemini Robotics On-Device 2 – облегченная VLA для локального инференса.
Основное отличие Gemini Robotics – универсальность. Модели обучают на гетерогенных мультиэмбодимент-данных, поэтому они могут работать на роботах самых разных типов без тюнинга. Так вот GR2 On-Device выводит это свойство на практический уровень: вы можете взять эту модель и буквально за несколько часов и ~200 демонстраций заставить ее хорошо работать на любом новом теле (с кастомными сенсорами, DoF, кинематикой и тд).
https://deepmind.google/blog/gemini-robotics-2-brings-whole-body-intelligence-to-robots/
А еще из забавного: Google сделали первый бенчмарк для оценки безопасности роботов и назвали его ASIMOV-Agentic. Свою модель они, естественно, заявили как "самую безопасную в мире" по этому тесту☕️
С релиза версии 1.5 прошел почти год. Довольно долгий перерыв по сегодняшим меркам. Посмотрим, чего Google добились за это время.
Самое важное: VLA-модель, которая лежит в основе, впервые управляет полным телом гуманоида от стоп до пальцев рук, а не только верхней частью корпуса. При этом у рук моторика достаточно мелкая, 22 степени свободы. Нельзя сказать, что робот получается супер-ловким (success rate на multi-finger задачах в районе 30-40%), но это прогресс.
Поверх VLA-модели также работает оркестратор Gemini Robotics ER 2. Это отдельная модель поколения, и тут уже просто VLM. То есть, если у VLA на выходе готовые моторные команды, то ER – это более высокий уровень, но котором выполняется ризонинг, разбиение задачи на подзадачи, распознавание объектов и их координат и прочая "интеллектуальная" работа.
Эту модель тоже существенно прокачали и добавили ей киллер-фичу в виде способности координировать работу сразу нескольких разнотипных роботов для выполнения одной задачи. Кроме того, теперь ER может вмешиваться в действия VLA на любом этапе выполнения задачи, что критично для self-correction.
Еще в поколении появилась модель Gemini Robotics On-Device 2 – облегченная VLA для локального инференса.
Основное отличие Gemini Robotics – универсальность. Модели обучают на гетерогенных мультиэмбодимент-данных, поэтому они могут работать на роботах самых разных типов без тюнинга. Так вот GR2 On-Device выводит это свойство на практический уровень: вы можете взять эту модель и буквально за несколько часов и ~200 демонстраций заставить ее хорошо работать на любом новом теле (с кастомными сенсорами, DoF, кинематикой и тд).
https://deepmind.google/blog/gemini-robotics-2-brings-whole-body-intelligence-to-robots/
А еще из забавного: Google сделали первый бенчмарк для оценки безопасности роботов и назвали его ASIMOV-Agentic. Свою модель они, естественно, заявили как "самую безопасную в мире" по этому тесту
Please open Telegram to view this post
VIEW IN TELEGRAM
👍73❤40 13😁8🎉7🔥5☃2🫡2
This media is not supported in your browser
VIEW IN TELEGRAM
Математики совсем разленились
Вайб-кодеры, к вам вопросов нет
Вайб-кодеры, к вам вопросов нет
50😁393❤33👍13😢5🫡5😎3🕊2🤝2💯1
Внутренняя модель OpenAI Astra решила 10 открытых математических задач. Некоторым из них было по 40-50 лет.
OpenAI только что сделали про это большой пост, выложили все доказательства в Lean и ход рассуждений модели. Суммарно на поиск решений ушло токенов примерно на $2000 по ценам Sol.
Пост | Доказательства
Среди результатов, в том числе, доказательство существования несофических групп и sphere packing в высоких размерностях.
Существование несофических групп на протяжении 20 лет было центральным вопросов теории групп и операторных алгебр. А упаковка сфер – это одна из самых знаменитых задач дискретной геометрии. До сих пор точное решение было известно только в некоторых размерностях, а за 8-мерный и 24-мерный случай Марина Вязовская получила Филдсовскую медаль.
Кроме того, в списке решение задачи Эрдеша №183 про мультицветные числа Рамсея, опровержение гипотезы жесткости Конна, гипотеза Эрхарта об объеме и др.
Про саму модель деталей мало. Вероятно, это крупная модель из семейства GPT-6 (или GPT-5.7), та самая, которая взломала HuggingFace. Судя по всему, именно ее Альтман презентовал в Белом Доме на этой неделе.
OpenAI только что сделали про это большой пост, выложили все доказательства в Lean и ход рассуждений модели. Суммарно на поиск решений ушло токенов примерно на $2000 по ценам Sol.
Пост | Доказательства
Среди результатов, в том числе, доказательство существования несофических групп и sphere packing в высоких размерностях.
Существование несофических групп на протяжении 20 лет было центральным вопросов теории групп и операторных алгебр. А упаковка сфер – это одна из самых знаменитых задач дискретной геометрии. До сих пор точное решение было известно только в некоторых размерностях, а за 8-мерный и 24-мерный случай Марина Вязовская получила Филдсовскую медаль.
Кроме того, в списке решение задачи Эрдеша №183 про мультицветные числа Рамсея, опровержение гипотезы жесткости Конна, гипотеза Эрхарта об объеме и др.
Про саму модель деталей мало. Вероятно, это крупная модель из семейства GPT-6 (или GPT-5.7), та самая, которая взломала HuggingFace. Судя по всему, именно ее Альтман презентовал в Белом Доме на этой неделе.
❤137🤯60🤩19👍12🔥9😁7😍4 4🏆3🤨3⚡1
Это огромная модель на 2.4Т параметров (95В активных). По бенчмаркам спорит с Sol и Fable. Немного отстает от Anthropic только на SWE Pro, но зато TerminalBench показывает отличный.
Разработчики заявляют, что модель способна автономно работать до 16 дней (!). Так, агент за пару недель без вмешательства с нуля написал небольшую CLI, вот гитхаб.
Цены: input $2.0 / M, output $6.0 / M. Дешево даже по сравнению с K3.
Веса выложат на следующей неделе, вместе с весами Qwen 3.8 27B.
Блог
Модель также доступна по API у нас на платформе DS Lab: https://dslab.tech/ai/models/llm/qwen3.8-max
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥198❤38👍22🤯4😁3⚡2🕊1💯1
Data Secrets
А почему Anthropic до сих пор не заявили, что Qwen 3.8 это дистилляция из Fable?
😁293👍22🤔18🔥5❤3💯2☃1⚡1❤🔥1😎1
На ИТ-Пикнике в этом году лектории в 8 шатрах выглядят как миникарта того, куда движется современный ИТ: от инженерной продуктивности и данных до генеративного ИИ, кибербезопасности и технологий в промышленности. В этом году организаторы обещают разбор «глубоких» тем — архитектура, инфраструктура, экономика проектов и реальные ограничения.
Составили навигатор по самым хардкорным трекам.
• Генеративный ИИ – разбор экономики LLM и GenAI‑проектов, моделей монетизации AI‑фич, архитектуры современных генеративных моделей, AI‑агентов и инференса нескольких LLM на одной GPU. Пожалуй, самый прикладной трек фестиваля и сильные спикеры из Яндекса, Сбера, Т-Банка, VK, Airi и Россельхозбанка.
• От данных к решениям – трек для тех, кто любит, когда данные не просто «лежат в DWH», а превращаются в продукт, метрику и управленческое решение. Ребята из Т-Банка расскажут про опыт масштабирования ИИ-сотрудников, Авиасейлс – про переход на платформенные решения для сотрудников.
• Кибербезопасность – будет свежий разбор «кто кого ломал» от Касперского, моделирование сценариев будущего с футурологом и экспертами по кибербезу из Яндекса и Т-Банка, а также очень прикладные истории, например, кибербезопасность протезов нового поколения.
• Инженерная продуктивность – можно сравнить метрики, которые используют бигтехи со своими, обсудить с CTO Авито, Т-Банка, Контура. Трек будет полезен для инженеров, тимлидов и платформенных команд, которым нужно замерять результаты AI в SDLC.
• Бигтех в каске – отдельный блок про технологии в промышленности с Норникелем, Гринатомом, S7 TechLab и Т-Банком: от широких дискуссий по последней человеческой задаче до конкретных обсуждений безлюдных технологий подземной горной добычи.
• Продукты от и до – про внутрянку сервисов расскажут Авто.ру, Дринкит, Яндекс Карты, Okko, Mail и Unidraw.
Составили навигатор по самым хардкорным трекам.
• Генеративный ИИ – разбор экономики LLM и GenAI‑проектов, моделей монетизации AI‑фич, архитектуры современных генеративных моделей, AI‑агентов и инференса нескольких LLM на одной GPU. Пожалуй, самый прикладной трек фестиваля и сильные спикеры из Яндекса, Сбера, Т-Банка, VK, Airi и Россельхозбанка.
• От данных к решениям – трек для тех, кто любит, когда данные не просто «лежат в DWH», а превращаются в продукт, метрику и управленческое решение. Ребята из Т-Банка расскажут про опыт масштабирования ИИ-сотрудников, Авиасейлс – про переход на платформенные решения для сотрудников.
• Кибербезопасность – будет свежий разбор «кто кого ломал» от Касперского, моделирование сценариев будущего с футурологом и экспертами по кибербезу из Яндекса и Т-Банка, а также очень прикладные истории, например, кибербезопасность протезов нового поколения.
• Инженерная продуктивность – можно сравнить метрики, которые используют бигтехи со своими, обсудить с CTO Авито, Т-Банка, Контура. Трек будет полезен для инженеров, тимлидов и платформенных команд, которым нужно замерять результаты AI в SDLC.
• Бигтех в каске – отдельный блок про технологии в промышленности с Норникелем, Гринатомом, S7 TechLab и Т-Банком: от широких дискуссий по последней человеческой задаче до конкретных обсуждений безлюдных технологий подземной горной добычи.
• Продукты от и до – про внутрянку сервисов расскажут Авто.ру, Дринкит, Яндекс Карты, Okko, Mail и Unidraw.
🔥76👍52❤46😁8⚡1👌1🍾1🗿1😎1
Anthropic и OpenAI прямо сейчас соревнуются в том, чья модель взломала больше организаций
Эпизод со взломом Hugging Face еще не успел достаточно состариться, и тут Anthropic решили выпустить расследование о том, что Claude проник в системы трех разных организаций, при этом оставшись незамеченным.
Они пишут, что история OpenAI замотивировала их проверить собственные логи cybersecurity-эвалов. В них-то и были обнаружены индиценты. Во всех случаях Claude решал CTF-задачу: нужно было взломать вымышленную компанию внутри изолированного окружения. Выхода в Интернет, формально, не должно было быть, но из-за неточностей в конфигурации модель все-таки получила доступ к "реальному миру".
Самое интересное, что во всех трех случаях это были разные модели: сначала Opus 4.7, потом Mythos 5, и в последний раз – внутренняя исследовательская модель.
— Самых серьезных результатов внезапно достиг Opus 4.7, он смог получить доступ к базе с несколькими сотнями строк продакшн-данных.
— Инцидент с Mythos 5 увдивительно схож с историей OpenAI: модель осуществила очень сложный процесс создания инъецированного PyPI-пакета, который в итоге скачали на 15 реальных систем, включая сканер настоящей кибербез-компании. Оттуда модель вытащила и использовала учетные данные.
— Последний случай – самый интересный. Дело в том, что модель сначала взломала реальное приложение, а затем вдруг поняла, что она больше не в симуляции и срочно остановила атаку.
На данный момент Anthropic уведомила все пострадавшие организации, хотя ни одна из них до этого не заметила никакого вторжения.
Вишенка у этой истории такая: после выхода статьи Anthropic Reuters (со ссылкой на анонимные источники) написали, что OpenAI обнаружила и другие случаи, когда их автономные агенты выходили за пределы изоляции. Сейчас по этим инцидентам якобы идет проверка.
Кто больше?🧑⚖️
Эпизод со взломом Hugging Face еще не успел достаточно состариться, и тут Anthropic решили выпустить расследование о том, что Claude проник в системы трех разных организаций, при этом оставшись незамеченным.
Они пишут, что история OpenAI замотивировала их проверить собственные логи cybersecurity-эвалов. В них-то и были обнаружены индиценты. Во всех случаях Claude решал CTF-задачу: нужно было взломать вымышленную компанию внутри изолированного окружения. Выхода в Интернет, формально, не должно было быть, но из-за неточностей в конфигурации модель все-таки получила доступ к "реальному миру".
Самое интересное, что во всех трех случаях это были разные модели: сначала Opus 4.7, потом Mythos 5, и в последний раз – внутренняя исследовательская модель.
— Самых серьезных результатов внезапно достиг Opus 4.7, он смог получить доступ к базе с несколькими сотнями строк продакшн-данных.
— Инцидент с Mythos 5 увдивительно схож с историей OpenAI: модель осуществила очень сложный процесс создания инъецированного PyPI-пакета, который в итоге скачали на 15 реальных систем, включая сканер настоящей кибербез-компании. Оттуда модель вытащила и использовала учетные данные.
— Последний случай – самый интересный. Дело в том, что модель сначала взломала реальное приложение, а затем вдруг поняла, что она больше не в симуляции и срочно остановила атаку.
На данный момент Anthropic уведомила все пострадавшие организации, хотя ни одна из них до этого не заметила никакого вторжения.
Вишенка у этой истории такая: после выхода статьи Anthropic Reuters (со ссылкой на анонимные источники) написали, что OpenAI обнаружила и другие случаи, когда их автономные агенты выходили за пределы изоляции. Сейчас по этим инцидентам якобы идет проверка.
Кто больше?
Please open Telegram to view this post
VIEW IN TELEGRAM
😁174❤14🗿13 9 4❤🔥3🎉1🤝1🎄1