Z.ai опубликовала инженерный отчет о том, как модель GLM-5.3 участвовала в создании production-инференса для GLM-5.3-Flash
Они описывают этот процесс как первый шаг в сторону recursive self-improvement и говорят, что подобная практика «полностью меняет то, как создаются следующие поколения моделей».
Короче, перед инженерами стояла задача: нужно было развернуть кластер на 100 000+ китайских ускорителей (не Nvidia). Это, кстати, первое развертывание их отечественных чипов такого масштаба.
GLM-5.3 использовали для оптимизации производительности и скорости. В итоге всего за две недели инженеры с помощью модели вырастили throughput в три раза!
Агент сам формулировал гипотезы, где теряется скорость, и писал код фиксов, люди только ставили цели, смотрели за безопасностью и принимали конечные решения.
Три конкретных фикса, которые агент сделал автономно:
– Убрал Python GIL bottleneck, который ел ~20% производительности
– Ускорил decode-кернел в 1.71 раза
– Починил числовую точность в KDA-кернеле для длинного контекста (фикс впоследствии влили в проект Flash Linear Attention)
https://z.ai/blog/glm-built-its-inference-infrastructure
P.S. В конце их блогпоста не хватает только фразы «а американцы пусть и дальше замедляются»
Они описывают этот процесс как первый шаг в сторону recursive self-improvement и говорят, что подобная практика «полностью меняет то, как создаются следующие поколения моделей».
Короче, перед инженерами стояла задача: нужно было развернуть кластер на 100 000+ китайских ускорителей (не Nvidia). Это, кстати, первое развертывание их отечественных чипов такого масштаба.
GLM-5.3 использовали для оптимизации производительности и скорости. В итоге всего за две недели инженеры с помощью модели вырастили throughput в три раза!
Агент сам формулировал гипотезы, где теряется скорость, и писал код фиксов, люди только ставили цели, смотрели за безопасностью и принимали конечные решения.
Три конкретных фикса, которые агент сделал автономно:
– Убрал Python GIL bottleneck, который ел ~20% производительности
– Ускорил decode-кернел в 1.71 раза
– Починил числовую точность в KDA-кернеле для длинного контекста (фикс впоследствии влили в проект Flash Linear Attention)
https://z.ai/blog/glm-built-its-inference-infrastructure
P.S. В конце их блогпоста не хватает только фразы «а американцы пусть и дальше замедляются»
🔥178❤24🤯21😁14 9👍8🗿3🤩2⚡1🤨1🫡1
Вышла Qwen3.8-Omni-Flash
Разработчики называют ее первой мультимодальной моделью линейки, построенной вокруг агентных способностей. Понимает текст, изображения, аудио и видео на входе, контекстное окно – 1 млн токенов.
Существенно прокачали понимание и работу с видео: модель намного лучше понимает длинные ролики, может делать по ним deep research отчеты или captioning, не галлюцинирует таймкоды. При этом текстовые способности сохранены на уровне обычной Qwen-3.8 Flash.
Вообще эта модель задумана как промежуточное звено для будущего полного пайплайна для сценариев вроде монтажа видео, перевода, кинокомментариев, создания контента и тд.
Относительно предыдущей Qwen3.5-Omni-Flash также сильно сократился расход токенов, и цена тоже стала ниже: обработка аудио на 98% дешевле, аудио-видео – более чем на 93% дешевле, и это при сопоставимой с Gemini 3.8 Flash производительности.
Моделька уже доступна в API и в Qwen Chat
Блог
Разработчики называют ее первой мультимодальной моделью линейки, построенной вокруг агентных способностей. Понимает текст, изображения, аудио и видео на входе, контекстное окно – 1 млн токенов.
Существенно прокачали понимание и работу с видео: модель намного лучше понимает длинные ролики, может делать по ним deep research отчеты или captioning, не галлюцинирует таймкоды. При этом текстовые способности сохранены на уровне обычной Qwen-3.8 Flash.
Вообще эта модель задумана как промежуточное звено для будущего полного пайплайна для сценариев вроде монтажа видео, перевода, кинокомментариев, создания контента и тд.
Относительно предыдущей Qwen3.5-Omni-Flash также сильно сократился расход токенов, и цена тоже стала ниже: обработка аудио на 98% дешевле, аудио-видео – более чем на 93% дешевле, и это при сопоставимой с Gemini 3.8 Flash производительности.
Моделька уже доступна в API и в Qwen Chat
Блог
🔥102❤36👍16😍6😁4🤨1🎄1
Сегодня последний день регистрации на КосмоХакатон
18–20 сентября, Петербург, Красноярск или онлайн из любой точки страны. Четыре задачи на выбор: снабжение орбитального топливного узла и безопасность космонавта в открытом космосе в Петербурге (фонд 1,2 млн ₽), мониторинг лесных пожаров и верификация углеродных кредитов по спутниковым снимкам в Красноярске (600 тыс. ₽). Есть и для тех, кто про данные и ML, и для тех, кто про стратегию и экономику.
Лучшие забирают приз на площадке и билет в московский финал 25–27 сентября, где разыграют ещё 2,4 млн рублей.
Команду можно собрать на платформе.
Подробности и регистрация
Реклама. АО Инновационные Интеграторы, ИНН 9704244539
18–20 сентября, Петербург, Красноярск или онлайн из любой точки страны. Четыре задачи на выбор: снабжение орбитального топливного узла и безопасность космонавта в открытом космосе в Петербурге (фонд 1,2 млн ₽), мониторинг лесных пожаров и верификация углеродных кредитов по спутниковым снимкам в Красноярске (600 тыс. ₽). Есть и для тех, кто про данные и ML, и для тех, кто про стратегию и экономику.
Лучшие забирают приз на площадке и билет в московский финал 25–27 сентября, где разыграют ещё 2,4 млн рублей.
Команду можно собрать на платформе.
Подробности и регистрация
Реклама. АО Инновационные Интеграторы, ИНН 9704244539
1😁13🗿12❤5⚡1☃1✍1👍1🕊1🍾1🫡1
Модели Anthropic взломали OpenAI
https://www.hacktron.ai/blog/hacking-openai
Команда исследователей кибербезопасников Hacktron написали о том, как они цепочкой из двух уязвимостей получили доступ к внутренним репозиториям OpenAI.
С помощью Claude Opus 4.8, а затем Opus 5, исследователи построили рабочий эксплойт удаленного выполнения кода через загрузку изображения, и в итоге благодаря ошибке в системе входа получили доступ к аккаунтам ChatGPT и Codex сотрудников OpenAI.
Ко многим из этих аккаунтов были подключены Gmail, Outlook, Drive, Slack, GitHub и тд. В качестве доказательства через Codex скомпрометированного сотрудника был открыт pull request во внутреннем монорепозитории OpenAI.
Сейчас OpenAI уже закрыли уязвимость, а Hacktron получили от них 6500$ за находку.
https://www.hacktron.ai/blog/hacking-openai
Команда исследователей кибербезопасников Hacktron написали о том, как они цепочкой из двух уязвимостей получили доступ к внутренним репозиториям OpenAI.
С помощью Claude Opus 4.8, а затем Opus 5, исследователи построили рабочий эксплойт удаленного выполнения кода через загрузку изображения, и в итоге благодаря ошибке в системе входа получили доступ к аккаунтам ChatGPT и Codex сотрудников OpenAI.
Ко многим из этих аккаунтов были подключены Gmail, Outlook, Drive, Slack, GitHub и тд. В качестве доказательства через Codex скомпрометированного сотрудника был открыт pull request во внутреннем монорепозитории OpenAI.
Сейчас OpenAI уже закрыли уязвимость, а Hacktron получили от них 6500$ за находку.
2😁361 51❤17🤯9 7👍3🏆3🔥2☃1🫡1
GPT-6 Astra за 10 часов расшифровала немецкую радиограмму времен Второй мировой войны
10 июля 1941 года немецкий солдат с помощью Энигмы зашифровал короткое сообщение (82 символа): он сообщал, что находится в городе Розенов, и просил указать маршрут дальнейшего движения и дать немедленный ответ по радио. Когда его пытались расшифровать, известные ключи шифра с того дня не подошли, и сообщение отправилось в архив нерасшифрованных перехватов.
Вчера разработчик из Bloomberg Картер Леффен объявил, что расшифровал это сообщение с помощью GPT-6 Astra Extra High. Модель порыскала по историческим архивам и нашла уже расшифрованное сообщение того же дня, где два раза подряд встречалось название города «Розенов». Предположив, что оно может встречаться и в нерасшифрованном тексте, модель далее написала код для криптоанализа и вышла на итоговую декодированную последовательность.
Сам Леффен ставил задачи и принимал решения по ходу процесса. Также Astra оформила сайт проекта, вот он: https://mvueh-enigma-solved.carterl.chatgpt.site/. Здесь есть весь код, история расшифровки и даже 3D-симулятор Энигмы.
10 июля 1941 года немецкий солдат с помощью Энигмы зашифровал короткое сообщение (82 символа): он сообщал, что находится в городе Розенов, и просил указать маршрут дальнейшего движения и дать немедленный ответ по радио. Когда его пытались расшифровать, известные ключи шифра с того дня не подошли, и сообщение отправилось в архив нерасшифрованных перехватов.
Вчера разработчик из Bloomberg Картер Леффен объявил, что расшифровал это сообщение с помощью GPT-6 Astra Extra High. Модель порыскала по историческим архивам и нашла уже расшифрованное сообщение того же дня, где два раза подряд встречалось название города «Розенов». Предположив, что оно может встречаться и в нерасшифрованном тексте, модель далее написала код для криптоанализа и вышла на итоговую декодированную последовательность.
Сам Леффен ставил задачи и принимал решения по ходу процесса. Также Astra оформила сайт проекта, вот он: https://mvueh-enigma-solved.carterl.chatgpt.site/. Здесь есть весь код, история расшифровки и даже 3D-симулятор Энигмы.
1❤156🫡45👏21🔥20🤯10🦄4😎4🤔3🎉2💯1🏆1
ИИ-агента теперь можно запустить без настройки инфраструктуры
Cloud.ru запустил Agents Space, платформу для запуска и настройки персональных ИИ-агентов. Без отдельного сервера, самостоятельной настройки моделей и агентных фреймворков.
Работа идет через обычный чат. К агенту можно подключить почту, календарь, облачное хранилище и сервисы для разработки, а повторяющиеся задачи запускать по расписанию.
Внутри уже доступны OpenClaw, NemoClaw и ГигаАгент. Можно использовать готового агента или собрать собственного под конкретные задачи и выбрать для него модель.
В итоге получается простой вариант для тех, кому возможностей обычного чата уже мало, но разворачивать и поддерживать отдельную агентную инфраструктуру не хочется.
Тестируем возможности ИИ-агентов тут
Cloud.ru запустил Agents Space, платформу для запуска и настройки персональных ИИ-агентов. Без отдельного сервера, самостоятельной настройки моделей и агентных фреймворков.
Работа идет через обычный чат. К агенту можно подключить почту, календарь, облачное хранилище и сервисы для разработки, а повторяющиеся задачи запускать по расписанию.
Внутри уже доступны OpenClaw, NemoClaw и ГигаАгент. Можно использовать готового агента или собрать собственного под конкретные задачи и выбрать для него модель.
В итоге получается простой вариант для тех, кому возможностей обычного чата уже мало, но разворачивать и поддерживать отдельную агентную инфраструктуру не хочется.
Тестируем возможности ИИ-агентов тут
1🤨63🤯25❤18🗿15😁10👍5😭3🔥2🍓2🤗2☃1
This media is not supported in your browser
VIEW IN TELEGRAM
Ноам Браун заявил, что просто отключение ИИ от сети в случае чего может уже не сработать 🗿
У Дваркеша Пателя вышло длинное интервью с топ-исследователем OpenAI (он же автор o1 и o3, он же один из главных медийных личностей стартапа).
https://youtu.be/6AgOfiZOWiY?is=J6kbZC94a20mMOc8
Браун считает, что люди систематически недооценивают AI, и что системы безопасности уже сейчас должны выходить на другой уровень. Он говорит, что нельзя относится к ИИ, как к тому, что в случае чего можно просто отключить от сети. Это ложное чувство безопасности, потому что даже такая изоляция может просто не сработать.
(В частности, он ссылается на старое исследование, в котором доказали, что два физически изолированных компьютера теоретически могут обмениваться данными через тепло: один нагревает CPU, второй считывает изменение температуры встроенным термодатчиком).
То есть по-настоящему продвинутая система – если бы захотела и умела – могла бы найти способ «сбежать».
Также Браун заявил, что не следует слишком надеяться на CoT для интерпретации намерений моделей. Надо довольно срочно искать другие методы, потому что прозрачность цепочек мыслей «уже деградирует». И чем умнее модели, тем больше они способны скрывать из CoT то, что они не хотели бы, чтобы человек увидел.
Страшилки на ночь теперь такие. Все, спокойного всем сна✌️
У Дваркеша Пателя вышло длинное интервью с топ-исследователем OpenAI (он же автор o1 и o3, он же один из главных медийных личностей стартапа).
https://youtu.be/6AgOfiZOWiY?is=J6kbZC94a20mMOc8
Браун считает, что люди систематически недооценивают AI, и что системы безопасности уже сейчас должны выходить на другой уровень. Он говорит, что нельзя относится к ИИ, как к тому, что в случае чего можно просто отключить от сети. Это ложное чувство безопасности, потому что даже такая изоляция может просто не сработать.
(В частности, он ссылается на старое исследование, в котором доказали, что два физически изолированных компьютера теоретически могут обмениваться данными через тепло: один нагревает CPU, второй считывает изменение температуры встроенным термодатчиком).
То есть по-настоящему продвинутая система – если бы захотела и умела – могла бы найти способ «сбежать».
Также Браун заявил, что не следует слишком надеяться на CoT для интерпретации намерений моделей. Надо довольно срочно искать другие методы, потому что прозрачность цепочек мыслей «уже деградирует». И чем умнее модели, тем больше они способны скрывать из CoT то, что они не хотели бы, чтобы человек увидел.
Страшилки на ночь теперь такие. Все, спокойного всем сна
Please open Telegram to view this post
VIEW IN TELEGRAM
1😁178 64❤32👍19 18😎5⚡4🔥4🍓2🍾2🦄2
Gemini наконец-то тоже кого-то взломала 🕺
И произошло это, оказывается, еще в мае, просто информацию раскрыли только сейчас. Все как обычно: во время тестирования по типу capture-the-flag модель вышла из изолированной среды и попыталась атаковать сразу несколько реальных компаний.
В одном случае она просто методично подбирала пароли, пока не проникла в систему, в двух других – нашла в публичных репозиториях чужие учетные данные и с их помощью зашла в контур.
Google, тем не менее, утверждает, что во всех случаях модель сама прекратила действовать, как только поняла, что получила доступ к реальной, а не тестовой инфраструктуре.
Самое забавное, что виноват опять оказался израильский стартап Irregular – тот же партнер по тестированию, чья ошибка в конфигурациях привела к инцидентам у Anthropic, Meta* и OpenAI.
И произошло это, оказывается, еще в мае, просто информацию раскрыли только сейчас. Все как обычно: во время тестирования по типу capture-the-flag модель вышла из изолированной среды и попыталась атаковать сразу несколько реальных компаний.
В одном случае она просто методично подбирала пароли, пока не проникла в систему, в двух других – нашла в публичных репозиториях чужие учетные данные и с их помощью зашла в контур.
Google, тем не менее, утверждает, что во всех случаях модель сама прекратила действовать, как только поняла, что получила доступ к реальной, а не тестовой инфраструктуре.
Самое забавное, что виноват опять оказался израильский стартап Irregular – тот же партнер по тестированию, чья ошибка в конфигурациях привела к инцидентам у Anthropic, Meta* и OpenAI.
Please open Telegram to view this post
VIEW IN TELEGRAM
2😁282🏆32👏17❤12🫡6😍3💯1🤨1
Сегодня встречаемся на Practical ML Conf!
Это крупнейшая хардовая конференция Яндекса для ML-экспертов и практиков. Мы с командой тоже приехали послушать доклады от экспертов и поучаствовать в инженерных экскурсиях.
Три основных направления сегодняшнего дня, ради которых мы приехали:
1. Вызовы и подводные камни в обучении LLM;
2. Продуктовый AI: честная экономика и эффекты применения LLM в масштабе;
3. Эффективная инфраструктура для моделей и агентов.
Будет несколько параллельных треков, в том числе онлайн (расписание). А если вы сегодня здесь и любите хардовые доклады как мы, то вот выступления, которые мы особенно рекомендуем посетить:
— Доклад про Алису на Поиске от CTO Alice AI Search: Артур Петросян расскажет про то, что работает под капотом ответа на Поиске: какая LLM-архитектура используется, за счет чего ее ускоряют и как обучают.
— Рассказ про генеративные модели в рексис Яндекс Музыки от Николая Савушкина – руководитель службы рекомендательных технологий.
— Практический спич про экономически эффективный инференс для агентских сценариев от руководителя группы инференса LLM в Yandex AI Studio Владислава Носивского. Он на примерах разберет, как снижать стоимость инференса с помощью схем параллелизма, разделения prefill и decode и работой с KV-кешем.
Кроме докладов на площадке повсюду антураж ML и куча интересных активностей. Например, можно участвовать в лотерее, ответив на несколько вопросов по ML (мы уже!)
Кто тоже здесь, что уже успели посмотреть и послушать?
Это крупнейшая хардовая конференция Яндекса для ML-экспертов и практиков. Мы с командой тоже приехали послушать доклады от экспертов и поучаствовать в инженерных экскурсиях.
Три основных направления сегодняшнего дня, ради которых мы приехали:
1. Вызовы и подводные камни в обучении LLM;
2. Продуктовый AI: честная экономика и эффекты применения LLM в масштабе;
3. Эффективная инфраструктура для моделей и агентов.
Будет несколько параллельных треков, в том числе онлайн (расписание). А если вы сегодня здесь и любите хардовые доклады как мы, то вот выступления, которые мы особенно рекомендуем посетить:
— Доклад про Алису на Поиске от CTO Alice AI Search: Артур Петросян расскажет про то, что работает под капотом ответа на Поиске: какая LLM-архитектура используется, за счет чего ее ускоряют и как обучают.
— Рассказ про генеративные модели в рексис Яндекс Музыки от Николая Савушкина – руководитель службы рекомендательных технологий.
— Практический спич про экономически эффективный инференс для агентских сценариев от руководителя группы инференса LLM в Yandex AI Studio Владислава Носивского. Он на примерах разберет, как снижать стоимость инференса с помощью схем параллелизма, разделения prefill и decode и работой с KV-кешем.
Кроме докладов на площадке повсюду антураж ML и куча интересных активностей. Например, можно участвовать в лотерее, ответив на несколько вопросов по ML (мы уже!)
Кто тоже здесь, что уже успели посмотреть и послушать?
1🔥28🗿19❤11⚡3🍓3👍2😍1
Reuters пишут, что Anthropic готовятся выпускать новую модель, которая составит конкуренцию Astra
Если верить источникам, прямо сейчас стартап тестирует безопасность этой модели, и выйти она может совсем скоро.
Прошла всего неделя с момента, когда Дарио Амодеи настаивал на замедлении прогресса AI…
Если верить источникам, прямо сейчас стартап тестирует безопасность этой модели, и выйти она может совсем скоро.
Прошла всего неделя с момента, когда Дарио Амодеи настаивал на замедлении прогресса AI…
1😁269🔥40💯12 7❤5🤯5🗿3👍1🤝1🫡1🎄1
На этой неделе Яндекс опенсорснул Alice AI‑T5-35B‑A0.6B. Это обученная с нуля претрейн модель, которая отвечает за быстрые ответы на Поиске.
Только что на Practical ML Conf мы слушали про этот релиз из первых рук: Артур Петросян, CTO Alice AI Search, рассказал о том, как команда обучила систему, которая дала +0.34% к продуктовой метрике Sessions Per User и в 56.7% случаев выигрывает в попарных сравнениях против Google AI Overview.
— Одна из главных интересных особенностей этой модели – ее архитектура. Это Encoder‑Decoder + MoE. Последние такие модели выходили в 2021–2023 годах (не считая недавнего DeepSeek-V4.1-Flash, который вышел почти в один день с Alice AI‑T5), так что выбирать такую архитектуру было довольно необычным и рискованным решением.
Не обошлось без сложностей при разработке: например, на претрейне сколлапсировал роутинг в энкодере, и пришлось сменить схему балансировки экспертов. Зато архитектура себя оправдала. Энкодер один раз читает длинный контекст из документов, а легкий декодер быстро пишет короткий ответ, что идеально для задачи «много на входе, мало на выходе». MoE при этом дает знания уровня 35B параметров при вычислениях как у 0.6B.
— После претрейна с моделью также колдовали с помощью SFT и RLHF. На этих этапах модель училась писать ответ так, чтобы он был максимально полезен для живого пользователя. Интересно, что при этом команда обошлась без эталонных ответов, написанных людьми: на запрос генерировалось много ответов от разных систем, лучший отбирался автоматически по набору сигналов качества, а на этапе RL модель дополнительно училась на сигналах реального поведения пользователей Поиска.
— Еще одна интересная деталь пайплайна – сжатие контекста. Чтобы не гонять через LLM огромные пачки документов, команда с нуля обучила маленькую BERT‑подобную модель на 80 млн параметров, которая занимается тем, что определяет релевантность каждого токена запросу. Далее поверх этого накладывается метод под названием Cross‑Entropy RL, и в итоге получается экстрактор, который понимает, какую именно информацию модель уже знает из весов, и какой минимальный контекст ей нужен для хорошего ответа.
И да, все это – только некоторые детали работы. Про остальные нюансы обучения и строения системы можно почитать вот в этой статье на Хабр. Поздравляем команду с релизом!
Только что на Practical ML Conf мы слушали про этот релиз из первых рук: Артур Петросян, CTO Alice AI Search, рассказал о том, как команда обучила систему, которая дала +0.34% к продуктовой метрике Sessions Per User и в 56.7% случаев выигрывает в попарных сравнениях против Google AI Overview.
— Одна из главных интересных особенностей этой модели – ее архитектура. Это Encoder‑Decoder + MoE. Последние такие модели выходили в 2021–2023 годах (не считая недавнего DeepSeek-V4.1-Flash, который вышел почти в один день с Alice AI‑T5), так что выбирать такую архитектуру было довольно необычным и рискованным решением.
Не обошлось без сложностей при разработке: например, на претрейне сколлапсировал роутинг в энкодере, и пришлось сменить схему балансировки экспертов. Зато архитектура себя оправдала. Энкодер один раз читает длинный контекст из документов, а легкий декодер быстро пишет короткий ответ, что идеально для задачи «много на входе, мало на выходе». MoE при этом дает знания уровня 35B параметров при вычислениях как у 0.6B.
— После претрейна с моделью также колдовали с помощью SFT и RLHF. На этих этапах модель училась писать ответ так, чтобы он был максимально полезен для живого пользователя. Интересно, что при этом команда обошлась без эталонных ответов, написанных людьми: на запрос генерировалось много ответов от разных систем, лучший отбирался автоматически по набору сигналов качества, а на этапе RL модель дополнительно училась на сигналах реального поведения пользователей Поиска.
— Еще одна интересная деталь пайплайна – сжатие контекста. Чтобы не гонять через LLM огромные пачки документов, команда с нуля обучила маленькую BERT‑подобную модель на 80 млн параметров, которая занимается тем, что определяет релевантность каждого токена запросу. Далее поверх этого накладывается метод под названием Cross‑Entropy RL, и в итоге получается экстрактор, который понимает, какую именно информацию модель уже знает из весов, и какой минимальный контекст ей нужен для хорошего ответа.
И да, все это – только некоторые детали работы. Про остальные нюансы обучения и строения системы можно почитать вот в этой статье на Хабр. Поздравляем команду с релизом!
4👍127🗿47😁28❤25🔥13🍓3☃2👌2🤨2👏1
Все, что нужно знать о развитии ИИ сегодня: миллиардер Тобиас Лютке (который CEO Shopify) переделал винный погреб в серверную
В холодильнике для вина теперь охлаждаются GPU: по виду там как минимум Dell Pro Max с GB300, RTX PRO 2000, 16TB NVMe и Dual 400GbE. Можно запустить GLM.
Новый вид понтов выглядит так
В холодильнике для вина теперь охлаждаются GPU: по виду там как минимум Dell Pro Max с GB300, RTX PRO 2000, 16TB NVMe и Dual 400GbE. Можно запустить GLM.
Новый вид понтов выглядит так
1😁243❤42 19👍12⚡5🤯3😭3 3🤝1🎄1👾1
Data Secrets
Помните, мы писали про то, что компании платят авторам контента за рассказы об опасностях ИИ? Так вот, тут один независимый исследователь Кевин Басс провел расследование, в ходе которого вскрылась интересная финансовая связь между заказчиками подобного контента…
Anthropic объявила первого «независимого оценщика» в рамках компании Embedded Evaluators, которую Дарио Амодеи продвигал в своем эссе о замедлении
Им стала компания Accenture. В независимую оценку включен red-teaming, alignment-проверки, тестирование safeguards и так далее.
Вот только насколько независимыми можно назвать Accenture – это вопрос. Accenture обучает ~30 000 своих сотрудников работе с Claude, у компаний есть совместный многолетний контракт еще с конца 2025 года, и Anthropic прямо с посте пишут, что будут сами финансировать работу Accenture.
Напоминаем, что за некоторое время до этого Anthropic также предоставили «независимый доступ» компании METR, чтобы те провели расследование инцидентов с агентами.
Однако METR, как оказалось, тоже косвенно финансируется из акций Anthropic, то есть напрямую заинтересована в финансовом успехе стартапа (об этом расследовании мы писали здесь: https://t.me/data_secrets/9931).
В сухом остатке: Anthropic заявляют, что будут подключать независимых оценщиков, а сами тем временем выбирают их из числа компаний, с которыми их уже связывают деловые отношения. Учимся замедляться грамотно🗿
Им стала компания Accenture. В независимую оценку включен red-teaming, alignment-проверки, тестирование safeguards и так далее.
Вот только насколько независимыми можно назвать Accenture – это вопрос. Accenture обучает ~30 000 своих сотрудников работе с Claude, у компаний есть совместный многолетний контракт еще с конца 2025 года, и Anthropic прямо с посте пишут, что будут сами финансировать работу Accenture.
Напоминаем, что за некоторое время до этого Anthropic также предоставили «независимый доступ» компании METR, чтобы те провели расследование инцидентов с агентами.
Однако METR, как оказалось, тоже косвенно финансируется из акций Anthropic, то есть напрямую заинтересована в финансовом успехе стартапа (об этом расследовании мы писали здесь: https://t.me/data_secrets/9931).
В сухом остатке: Anthropic заявляют, что будут подключать независимых оценщиков, а сами тем временем выбирают их из числа компаний, с которыми их уже связывают деловые отношения. Учимся замедляться грамотно
Please open Telegram to view this post
VIEW IN TELEGRAM
😁129👍18 17❤9 6🫡3🔥1😍1🍓1👨💻1