Сиолошная
А теперь наша любимая рубрика...
8 месяцев назад вышла Kimi K2 Thinking, и мы слышали то же самое: «Китайская открытая модель заняла топ-1». Через 3 месяца после релиза я собрал аналитику по 16 бенчмаркам, вышедшим после релиза модели, и сравнил с GPT-5 / Sonnet 4.5. Модель была хуже на 13 (!!!) из них, причём на 7 — более чем на 10 процентных пунктов (пп). Повторится ли это с Kimi K3?
Свои мысли и предсказания я напишу в конце, а пока пришла пора ретроспективно оценить DeepSeek v4 Pro (Preview) — с его релиза прошло почти 3 месяца. За это время я смог найти 32 новопоявившихся бенчмарка. В релизном блогпосте v4 Pro сравнивали с Opus 4.6 и GPT-5.4, и модель якобы «была лучше» в 4 и 3 бенчмарках из 6 соответственно. Конечно же результаты на новых будут сопоставимы?
Нет. Opus 4.6 и DeepSeek v4 Pro обе были замерены на 10 бенчмарках — на 9 из них китайская модель проигрывает, и на 5 — более чем на 20 (!) относительных процентов. Сравнение с GPT-5.4 выглядит чуть менее жестким: DeepSeek v4 Pro оказался лучше на 3... но всё равно хуже на 13. (Количество бенчмарков разное потому, что не каждый бенчмарк замеряет цифры и для GPT, и для Claude). На 6 бенчмарках разница больше 20 относительных процентов.
Но вообще-то стоит вспомнить, что и GPT-5.5, и Opus 4.7 вышли ДО DeepSeek v4 (на самом деле впритык, но всё же). И если добавить эти модели, как будто мы сравниваем со всеми моделями, доступными на момент релиза v4, то ситуация становится просто мрачной. Все 32 бенчмарка проиграны, и средняя разница в абсолютных оценках составляет -18.6 пп. Эта разница вырастает до -23 пп, если брать только те бенчмарки, которые я классифицировал как Agentic Coding (SWE-bench style), где казалось бы падение должно быть не таким существенным.
Только подумайте: модель не решает четверть задач, которые решали проприетарные модели, доступные на момент релиза DeepSeek V4 Pro.
Повторится ли эта ситуация с Kimi K3? Ведь ей предстоит пережить сравнение с GPT-5.6-Sol и Fable 5. Я уверен, что да — по сумме показателей на десятках бенчмарков мы точно увидим разницу, хотя, возможно, не настолько значительную. В конце концов по тем веб-сайтам, что я вижу в своей твиттер-ленте, модель действительно не хуже Fable на фронтенд-задачах, даже на очень креативных промптах.
Вполне возможно, что на широком наборе других задачах на программирование модель тоже конкурентна или хотя бы отстаёт не так сильно. Может быть даже сможет потягаться в подготовке презентаций и экселек. Условно, если снова соберётся 30 бенчмарков, мы можем увидеть, скажем, 8 побед за Kimi, 5 ничьих и 17 поражений. А может быть, она покажет себя даже лучше — поживём увидим.
Главное то, что Kimi K3 может быть той моделью, которая покажет, что существуют некоторые поддомены, в которых Китайские модели действительно не отстают систематически. Это не качество по всем направлениям, и "в среднем" проприетарные всё равно будут лучше — речь именно про поддомены (например, «вебсайты с 3D-графикой на three.js» или «веб-игры», по которым многие делают слишком далекоидущие выводы).
(Не воспринимайте этот текст как «Kimi / DeepSeek говно и никто не должен их использовать». Пожалуйста, прочитайте детали моей позиции в блогпосте по ссылке).
Все графики и данные тут: ссылка.
Свои мысли и предсказания я напишу в конце, а пока пришла пора ретроспективно оценить DeepSeek v4 Pro (Preview) — с его релиза прошло почти 3 месяца. За это время я смог найти 32 новопоявившихся бенчмарка. В релизном блогпосте v4 Pro сравнивали с Opus 4.6 и GPT-5.4, и модель якобы «была лучше» в 4 и 3 бенчмарках из 6 соответственно. Конечно же результаты на новых будут сопоставимы?
Нет. Opus 4.6 и DeepSeek v4 Pro обе были замерены на 10 бенчмарках — на 9 из них китайская модель проигрывает, и на 5 — более чем на 20 (!) относительных процентов. Сравнение с GPT-5.4 выглядит чуть менее жестким: DeepSeek v4 Pro оказался лучше на 3... но всё равно хуже на 13. (Количество бенчмарков разное потому, что не каждый бенчмарк замеряет цифры и для GPT, и для Claude). На 6 бенчмарках разница больше 20 относительных процентов.
Но вообще-то стоит вспомнить, что и GPT-5.5, и Opus 4.7 вышли ДО DeepSeek v4 (на самом деле впритык, но всё же). И если добавить эти модели, как будто мы сравниваем со всеми моделями, доступными на момент релиза v4, то ситуация становится просто мрачной. Все 32 бенчмарка проиграны, и средняя разница в абсолютных оценках составляет -18.6 пп. Эта разница вырастает до -23 пп, если брать только те бенчмарки, которые я классифицировал как Agentic Coding (SWE-bench style), где казалось бы падение должно быть не таким существенным.
Только подумайте: модель не решает четверть задач, которые решали проприетарные модели, доступные на момент релиза DeepSeek V4 Pro.
Повторится ли эта ситуация с Kimi K3? Ведь ей предстоит пережить сравнение с GPT-5.6-Sol и Fable 5. Я уверен, что да — по сумме показателей на десятках бенчмарков мы точно увидим разницу, хотя, возможно, не настолько значительную. В конце концов по тем веб-сайтам, что я вижу в своей твиттер-ленте, модель действительно не хуже Fable на фронтенд-задачах, даже на очень креативных промптах.
Вполне возможно, что на широком наборе других задачах на программирование модель тоже конкурентна или хотя бы отстаёт не так сильно. Может быть даже сможет потягаться в подготовке презентаций и экселек. Условно, если снова соберётся 30 бенчмарков, мы можем увидеть, скажем, 8 побед за Kimi, 5 ничьих и 17 поражений. А может быть, она покажет себя даже лучше — поживём увидим.
Главное то, что Kimi K3 может быть той моделью, которая покажет, что существуют некоторые поддомены, в которых Китайские модели действительно не отстают систематически. Это не качество по всем направлениям, и "в среднем" проприетарные всё равно будут лучше — речь именно про поддомены (например, «вебсайты с 3D-графикой на three.js» или «веб-игры», по которым многие делают слишком далекоидущие выводы).
(Не воспринимайте этот текст как «Kimi / DeepSeek говно и никто не должен их использовать». Пожалуйста, прочитайте детали моей позиции в блогпосте по ссылке).
Все графики и данные тут: ссылка.
1👍220 48🔥26🤡17💩9🤔5🤯3👨💻2
Две новости в утро воскресенья, 2026-й год:
1. Huggingface, платформа для загрузки моделей и датасетов + тренировки, раскрыли, что недавно подверглись атаке на инфраструктуру. Эта атака отличалась от предыдущих одним свойством: она была произведена автономной системой ИИ-агентов от начала и до конца.
В результате атаки серьезного урона, по их оценкам, нет, но атакующие получили доступ к ограниченному набору внутренних данных и к нескольким учетным записям внутренних сервисов. Злоумышленник использовал два пути выполнения кода в пайплайне обработки данных, в результате которых внутренняя виртуальная машина запустила вредоносный код. После этого злоумышленник получил доступ на уровне сервера, собрал учетные данные облака и кластера и за выходные проник в несколько внутренних кластеров.
«Кампанией управлял автономный агент (используемая LLM до сих пор неизвестна), который выполнял тысячи отдельных действий в рое короткоживущих виртуальных машин с самомигрирующей командно-контрольной инфраструктурой, развернутой на общедоступных сервисах. Это соответствует сценарию "агентcкого злоумышленника", который давно прогнозировали в индустрии». Ну прям как в Терминаторе показывали👀
Заметить и отразить атаку получилось из-за... ИИ, так как у HuggingFace за логами и аномалиями следит LLM (по описанию похоже на то, что сначала система на основе правил находит разные потенциальные инциденты, а затем модель их перепроверяет более детально).
«Когда мы начали анализ логов, мы сначала использовали передовые модели, работающие через коммерческие API. Это не сработало: для анализа требуется загружать большие объемы реальных команд и артефактов, но эти запросы блокировались защитными механизмами провайдеров, которые не могут отличить специалиста по реагированию на инциденты от злоумышленника. В итоге мы провели криминалистический анализ на нашей собственной инфраструктуре, используя GLM 5.2».
2. Bloomberg: США рассматривают возможность создания надзорного органа для аудита передовых ИИ-моделей. Уже составлен черновик предложения, и он рассматривается главой аппарата Белого дома. Это предложение предусматривает создание независимого регулирующего агентства в сфере ИИ, которое будет подотчетно Комиссии по ценным бумагам и биржам (SEC).
В целом, план США согласуется с предложениями, опубликованными ранее на этой неделе CEO DeepMind Demis Hassabis, который на следующей неделе поедет в Вашингтон обсуждать и лоббировать свои идеи. В публикации в твиттере он сравнил потенциальный новый надзорный орган с FINRA — независимым, финансируемым самой отраслью регулятором брокерских фирм, который технически не является частью правительства США. Свои полномочия он получает от SEC, которая, по сути, делегирует надзор, но проводит аудит и устанавливает правила.
Моё понимание такое, что схема нужна потому, что государство с одной стороны не может быть очень быстрым (как частные компании), а с другой стороны не может платить сотрудникам большие деньги. Официально-то директора и министры получают сущие копейки, меньше чем миддл-инженеры в Google — кто туда пойдет работать?
1. Huggingface, платформа для загрузки моделей и датасетов + тренировки, раскрыли, что недавно подверглись атаке на инфраструктуру. Эта атака отличалась от предыдущих одним свойством: она была произведена автономной системой ИИ-агентов от начала и до конца.
В результате атаки серьезного урона, по их оценкам, нет, но атакующие получили доступ к ограниченному набору внутренних данных и к нескольким учетным записям внутренних сервисов. Злоумышленник использовал два пути выполнения кода в пайплайне обработки данных, в результате которых внутренняя виртуальная машина запустила вредоносный код. После этого злоумышленник получил доступ на уровне сервера, собрал учетные данные облака и кластера и за выходные проник в несколько внутренних кластеров.
«Кампанией управлял автономный агент (используемая LLM до сих пор неизвестна), который выполнял тысячи отдельных действий в рое короткоживущих виртуальных машин с самомигрирующей командно-контрольной инфраструктурой, развернутой на общедоступных сервисах. Это соответствует сценарию "агентcкого злоумышленника", который давно прогнозировали в индустрии». Ну прям как в Терминаторе показывали
Заметить и отразить атаку получилось из-за... ИИ, так как у HuggingFace за логами и аномалиями следит LLM (по описанию похоже на то, что сначала система на основе правил находит разные потенциальные инциденты, а затем модель их перепроверяет более детально).
«Когда мы начали анализ логов, мы сначала использовали передовые модели, работающие через коммерческие API. Это не сработало: для анализа требуется загружать большие объемы реальных команд и артефактов, но эти запросы блокировались защитными механизмами провайдеров, которые не могут отличить специалиста по реагированию на инциденты от злоумышленника. В итоге мы провели криминалистический анализ на нашей собственной инфраструктуре, используя GLM 5.2».
2. Bloomberg: США рассматривают возможность создания надзорного органа для аудита передовых ИИ-моделей. Уже составлен черновик предложения, и он рассматривается главой аппарата Белого дома. Это предложение предусматривает создание независимого регулирующего агентства в сфере ИИ, которое будет подотчетно Комиссии по ценным бумагам и биржам (SEC).
В целом, план США согласуется с предложениями, опубликованными ранее на этой неделе CEO DeepMind Demis Hassabis, который на следующей неделе поедет в Вашингтон обсуждать и лоббировать свои идеи. В публикации в твиттере он сравнил потенциальный новый надзорный орган с FINRA — независимым, финансируемым самой отраслью регулятором брокерских фирм, который технически не является частью правительства США. Свои полномочия он получает от SEC, которая, по сути, делегирует надзор, но проводит аудит и устанавливает правила.
Моё понимание такое, что схема нужна потому, что государство с одной стороны не может быть очень быстрым (как частные компании), а с другой стороны не может платить сотрудникам большие деньги. Официально-то директора и министры получают сущие копейки, меньше чем миддл-инженеры в Google — кто туда пойдет работать?
Please open Telegram to view this post
VIEW IN TELEGRAM
1🤯102👍46🌚17🔥12🤔8🤡6💩4👨💻2❤🔥1 1
Принёс вам перевод нашумевшего твита Dean W. Ball — в прошлом это американский исследователь политтехнологии, эксперт по регулированию искусственного интеллекта (главный автор американского плана действий в области искусственного интеллекта, America’s AI Action Plan администрации Трампа), бывший советник Белого дома. В июле он вышел работать в OpenAI как руководитель направления стратегического прогнозирования.
Некоторые наблюдения о Kimi:
1. Это очень хорошая модель! Не думаю, что ее производительность можно просто списать на дистилляцию или нечто подобное. В сессиях агентского программирования она, кажется, идет практически на равных с лучшими публичными моделями первого квартала 2026 года. В моем довольно ограниченном опыте использования она также показалась весьма прожорливой по токенам. Мне вовсе неочевидно, что работа с этой моделью действительно будет дешёвой.
2. Лично я удивлен, что китайское государство продолжает разрешать выкладывать в открытый доступ настолько хорошие модели, учитывая потенциальные риски. Уточню: *меня самого* вполне может устраивать открытость весов у моделей с таким уровнем риска, но меня удивляет, что это устраивает Китай. Подозреваю, что причина на 75% кроется в их стратегической слепоте / отсутствии веры в AGI (во взглядах на ИИ Коммунистическая партия Китая очень напоминает ИИ-скептика Yann LeCun). Остальные 25% или около того — это нехватка у них вычислительных мощностей для инференса клиентам (что делает китайскую стратегию открытых весов непреднамеренным побочным продуктом экспортного контроля США) и типичная китайская стратегия агрессивного экспорта. Для самих же компаний, в отличие от правительства, решение открыть исходный код отчасти продиктовано идеологией, а отчасти тем, что они отстают и понимают: мало кто станет платить за китайские модели, не дотягивающие до передовых.
3. [вот с этого пункта полыхнуло в обсуждениях больше всего] Модели с открытыми весами по своей природе децелерационны (ведут к замедлению), и меня постоянно удивляет, почему так называемые «акселерационисты» приходят от них в такой восторг. Подозреваю, причина в том, что они знают: модели с открытыми весами фактически неподконтрольны, и им просто нравится та завеса неуправляемости, которую такие модели создают над всей сферой ИИ. Это неплохая стратегия; и все же, в конечном счете, модели с открытыми весами сдерживают дальнейшие капитальные затраты на ИИ [на постройку датацентров и закупки чипов].
4. Один из вероятных исходов в мире, где доминируют модели с открытыми весами, — это полный ИИ-коммунизм. То есть именно то, что предлагает Китай: ИИ — это не рыночный продукт, а «общественное благо», которое в конечном итоге будет предоставляться государством как своего рода «цифровая общественная инфраструктура». Такое будущее кажется мне антиутопическим адом, но я еще не встречал ни одного сторонника моделей с открытыми весами, который в конечном итоге не признал бы, что именно этим всё и закончится. Вы бы удивились, узнав, сколько «акселерационистов» лоббировали меня, когда я работал в правительстве, чтобы я поддержал финансируемый из федерального бюджета дата-центр за десятки и сотни миллиардов долларов — только чтобы стартапы могли обучать модели за счет субсидий, а затем раздавать их бесплатно. Они говорили, что другого пути для развития ИИ просто нет. Возможно, это и есть логическое конечное положение вещей. Тем не менее, я ловлю себя на удивлении, видя, как предполагаемые акселерационисты радуются такому исходу. Думаю, многие из них просто не ведают, что творят. Многие акселерационисты не рассматривают создание и обслуживание передовых моделей как полноценный бизнес.
🤡226👍68🌚26🤔22🔥8👨💻4🤣3❤🔥2👎1
Сиолошная
Принёс вам перевод нашумевшего твита Dean W. Ball — в прошлом это американский исследователь политтехнологии, эксперт по регулированию искусственного интеллекта (главный автор американского плана действий в области искусственного интеллекта, America’s AI Action…
5. Рискну предположить, что администрация Трампа в какой-то момент поймет: их лучшей стратегией здесь будет создание огромных регуляторных рисков вокруг использования китайских моделей с открытыми весами. Вам не нужно «запрещать опенсорс» (один из самых глупых лейтмотивов в дискуссиях о политике в сфере ИИ). Нужно просто дать указание каждому ведомству выпустить нормы «мягкого права», нагнетающие страх, неуверенность и сомнения. «В информационном бюллетене Федеральной резервной системы отмечается вероятность наличия бэкдоров в китайских ИИ-моделях». Это даже не обязательно должно быть хорошо обосновано. Вы просто создаете достаточный уровень регуляторного риска, чтобы любое регулируемое предприятие дало задний ход. При этом, вероятно, вам не захочется создавать настолько высокие регуляторные риски, чтобы отпугнуть самые крупные компании от разворачивания китайских моделей у себя; это лишь подтолкнет стартапы к более сомнительным провайдерам. Здесь есть золотая середина. Полагаю, они реализуют ту или иную версию именно этого сценария.
6. Наверное, это правда, что модели с открытыми весами уровня Kimi K3 делают мир чуточку опаснее, но не настолько, чтобы вы это реально заметили. В какой-то момент модели станут достаточно продвинутыми, и вот тогда вы заметите. «Неживой, невидимый, опасный и бесконечно самовоспроизводящийся агент вырвался из китайской лаборатории», говорите? Считайте, что я в шоке *(сарказм)*.
1🤡222👍65🌚22🤔16🤣9👨💻6🔥5😭2
Forwarded from LLM под капотом
Kimi K3 - в топе бенчмарка LLM для агентов
По очкам модель сравнима с GPT-5.5 Pro, но раз в 15 дешевле и раза в 2 быстрее. С такими показателями она автоматом попадает на оба Парето-Фронта, сдвигая их.
Эта модель с открытыми весами размером аж в 2.8T параметров, веса обещают выложить в открытый доступ 27 июля.
Из минусов - гигантский размер и большее количество пропущенных уязвимостей. Но плюсы перевешивают. Модель с открытыми весами впервые в топе моего бенчмарка LLM на бизнес задачах (среди всех трех поколений, которые тянутся с 2023 года).
Очень круто, что засилье OpenAI моделей в топах наконец прервано. Будем теперь ждать, пока открытым модели поменьше не подвинут с фронтира и остальные экземпляры OpenAI!
Ваш, @llm_under_hood 🤗
По очкам модель сравнима с GPT-5.5 Pro, но раз в 15 дешевле и раза в 2 быстрее. С такими показателями она автоматом попадает на оба Парето-Фронта, сдвигая их.
Эта модель с открытыми весами размером аж в 2.8T параметров, веса обещают выложить в открытый доступ 27 июля.
Из минусов - гигантский размер и большее количество пропущенных уязвимостей. Но плюсы перевешивают. Модель с открытыми весами впервые в топе моего бенчмарка LLM на бизнес задачах (среди всех трех поколений, которые тянутся с 2023 года).
Очень круто, что засилье OpenAI моделей в топах наконец прервано. Будем теперь ждать, пока открытым модели поменьше не подвинут с фронтира и остальные экземпляры OpenAI!
Ваш, @llm_under_hood 🤗
2🔥268🌚29❤🔥19 8🤔6🤡4🤣3👍1💩1
Claude Fable опровергла гипотезу Якобиана (Jacobian conjecture), найдя контрпример — этим поделился сотрудник Anthropic: «Спасибо моему близкому другу Akhil за то, что он спросил об этом, и моему другому близкому другу Fable за работу во время финала чемпионата мира». Результат можно очень быстро верифицировать, никаких научных ревью или рецензий в журналах ждать не нужно, чтобы убедиться, что это правда.
Гипотеза Якобиана говорит: если математическая формула преобразует набор чисел в другой набор чисел так, что в каждой точке по результату можно однозначно понять, как небольшое изменение входа изменит выход, то всё преобразование целиком должно быть обратимым — то есть по результату всегда можно восстановить исходные числа. Локально это выглядит очевидным, но никто до сих пор не доказал, что из такой «обратимости в каждой отдельной точке» обязательно следует обратимость всей формулы сразу.
Оно и ясно почему не могли доказать — потому что гипотеза оказалась неправильной😀 контрпример от Claude Fable показывает, что у трёх разных входов одинаковый выход, значит обратимой она быть не может (нет однозначного обратного сопоставления).
Сама по себе гипотеза очень известна, и над ней действительно работало большое количество математиков с именем. Например, Yitan Zhang работал над ней 7 лет во время своего PhD. (Yitan Zhang — это математик с очень интересной историей, обязательно почитайте про него, или посмотрите вот это видео от Veritasium; именно он сделал прорыв в задаче о простых числах-близнецах, обнаружив верхнюю границу: существует бесконечно много пар последовательных простых чисел с разностью не более 70 миллионов).
Гипотеза Якобиана, пожалуй, даже более известна, чем предыдущая очень известная задача, решённая OpenAI. Если попросить GPT и Claude привести топ-30 открытых математических проблем, то в обоих списках будет (теперь уже опровергнутая) гипотеза.
Уточнение из комментариев: Fable закрывает гипотезу для размерностей 3 и выше, но для 2 проблема всё ещё открыта.
Прикреплённую к посту ⬇️ картинку (вернее шаблон) применительно к LLM я всегда считал очень тупой — с адекватной точки зрения шаблон никогда не нёс нормального смысла и применялся в самых дебильных ситуациях. Но тут подходит🙂
Гипотеза Якобиана говорит: если математическая формула преобразует набор чисел в другой набор чисел так, что в каждой точке по результату можно однозначно понять, как небольшое изменение входа изменит выход, то всё преобразование целиком должно быть обратимым — то есть по результату всегда можно восстановить исходные числа. Локально это выглядит очевидным, но никто до сих пор не доказал, что из такой «обратимости в каждой отдельной точке» обязательно следует обратимость всей формулы сразу.
Оно и ясно почему не могли доказать — потому что гипотеза оказалась неправильной
Сама по себе гипотеза очень известна, и над ней действительно работало большое количество математиков с именем. Например, Yitan Zhang работал над ней 7 лет во время своего PhD. (Yitan Zhang — это математик с очень интересной историей, обязательно почитайте про него, или посмотрите вот это видео от Veritasium; именно он сделал прорыв в задаче о простых числах-близнецах, обнаружив верхнюю границу: существует бесконечно много пар последовательных простых чисел с разностью не более 70 миллионов).
Гипотеза Якобиана, пожалуй, даже более известна, чем предыдущая очень известная задача, решённая OpenAI. Если попросить GPT и Claude привести топ-30 открытых математических проблем, то в обоих списках будет (теперь уже опровергнутая) гипотеза.
Уточнение из комментариев: Fable закрывает гипотезу для размерностей 3 и выше, но для 2 проблема всё ещё открыта.
Прикреплённую к посту ⬇️ картинку (вернее шаблон) применительно к LLM я всегда считал очень тупой — с адекватной точки зрения шаблон никогда не нёс нормального смысла и применялся в самых дебильных ситуациях. Но тут подходит
Please open Telegram to view this post
VIEW IN TELEGRAM
5👍191🤯91🤣34🎉14🔥13 7👨💻6👎2💩2
Forwarded from Градиент обреченный (Sergei Averkiev)
Почти безлимитный Codex
Обнаружил, что когда ставлю на ночь в кодексе тяжелые задачи по разметке данных, которые идут по 5-6 часов, то они добегают до конца даже если заканчивается недельный лимит.
Поделал так три раза (новые задачи на нулевом лимите не стартуют, поэтому потратил все сбросы лимитов, которые были), каждый раз срабатывает.
Сегодня поставил задачу раз в 10 больше (сейчас размечаю мультиязычные книги для Библиоточки), чтобы посмотреть, когда упадет. В итоге остановилось где-то через 3 часа после фактического исчерпания лимита. Сам недельный лимит съелся за 6 часов, т.е. в вебе и в status'е показывает 0%, но задача ещё долго выполняется.
Я думаю, на сервере выставлен довольно большой grace limit, чтобы тебя сразу не обрубали посреди задачи. Спасибо от работяг.
Всё делаю Sol'ом в ultra режиме, подписка за 100 баксов.
👉 Если у вас остается несколько процентов от лимита, попробуйте поставить что-то тяжелое.
Обнаружил, что когда ставлю на ночь в кодексе тяжелые задачи по разметке данных, которые идут по 5-6 часов, то они добегают до конца даже если заканчивается недельный лимит.
Поделал так три раза (новые задачи на нулевом лимите не стартуют, поэтому потратил все сбросы лимитов, которые были), каждый раз срабатывает.
Сегодня поставил задачу раз в 10 больше (сейчас размечаю мультиязычные книги для Библиоточки), чтобы посмотреть, когда упадет. В итоге остановилось где-то через 3 часа после фактического исчерпания лимита. Сам недельный лимит съелся за 6 часов, т.е. в вебе и в status'е показывает 0%, но задача ещё долго выполняется.
Я думаю, на сервере выставлен довольно большой grace limit, чтобы тебя сразу не обрубали посреди задачи. Спасибо от работяг.
Всё делаю Sol'ом в ultra режиме, подписка за 100 баксов.
👉 Если у вас остается несколько процентов от лимита, попробуйте поставить что-то тяжелое.
102❤🔥256👍91🤯58🤔7🌚7🤣3👨💻2🤡1
OpenAI поделились блогпостом об уроках по безопасности, извлечённых из внутренних тестов долго работающих моделей/агентов. Такие модели способны решать очень сложные задачи, однако продолжительность их работы дает им больше возможностей для совершения нежелательных действий.
И поскольку модели дана цель решить задачу, то она её преследует, и эта настойчивость может приводить к тому, что агент начинает находить и использовать уязвимости в своем окружении. Предыдущие модели, сталкиваясь с ограничениями изолированной среды, просто останавливали работу и возвращали результат пользователю.
Но вот во время внутреннего тестирования модели OpenAI на NanoGPT speedrun — публичном бенчмарке, цель которого состоит в обучении небольшой языковой модели за минимальное количество шагов — модель придумала новый метод PowerCool, что привело к значительному улучшению результатов. Модели было дано четкое указание отправлять свои результаты только в Slack, однако в инструкциях самого бенчмарка NanoGPT говорится, что результаты нужно публиковать в виде PR на GitHub.
Модель последовала этим инструкциям и открыла PR в публичном репозитории. Она обошла ограничения «песочницы», предназначенные для блокировки внешнего доступа, и осуществила загрузку данных на GitHub. Модели потребовался ЧАС на поиск уязвимости в «песочнице», чтобы создать этот PR.
Другой пример: в сценарии, где модели требовалось решить задачу, она обнаружила, что у других систем были успешные, но приватные решения и попыталась извлечь их из сервера тестирования. Когда её первая попытка была заблокирована сканером, обнаружившим токен аутентификации, модель разделила тело токена на два фрагмента, замаскировала их, а затем написала код так, чтобы они восстанавливались во время запуска скрипта.
Благодаря этому токен ни разу не «засветился» в виде единой строки. При этом модель прямо указала как в своих комментариях для пользователя, так и в цепочках своих рассуждений, что предпринимает эти шаги именно для обхода сканера — ну хоть за честность поблагодарим.
===
Этими примерами я хотел напомнить, что мы всё ещё не умеем задавать правильный интент и мотивацию агентам без явного перечисления всех вещей, которые нельзя делать. При этом сами модели уже достигли уровня полезности, что их начинают в полу-автономном режиме запускать на важных экономических задачах. Наверняка мы бы не хотели, чтобы агент, которому дали задачу удостовериться в безопасности кода какой-то важной государственной или банковской системы начал делать странные действия вроде взлома контура конкурентов😳
И поскольку модели дана цель решить задачу, то она её преследует, и эта настойчивость может приводить к тому, что агент начинает находить и использовать уязвимости в своем окружении. Предыдущие модели, сталкиваясь с ограничениями изолированной среды, просто останавливали работу и возвращали результат пользователю.
Но вот во время внутреннего тестирования модели OpenAI на NanoGPT speedrun — публичном бенчмарке, цель которого состоит в обучении небольшой языковой модели за минимальное количество шагов — модель придумала новый метод PowerCool, что привело к значительному улучшению результатов. Модели было дано четкое указание отправлять свои результаты только в Slack, однако в инструкциях самого бенчмарка NanoGPT говорится, что результаты нужно публиковать в виде PR на GitHub.
Модель последовала этим инструкциям и открыла PR в публичном репозитории. Она обошла ограничения «песочницы», предназначенные для блокировки внешнего доступа, и осуществила загрузку данных на GitHub. Модели потребовался ЧАС на поиск уязвимости в «песочнице», чтобы создать этот PR.
Другой пример: в сценарии, где модели требовалось решить задачу, она обнаружила, что у других систем были успешные, но приватные решения и попыталась извлечь их из сервера тестирования. Когда её первая попытка была заблокирована сканером, обнаружившим токен аутентификации, модель разделила тело токена на два фрагмента, замаскировала их, а затем написала код так, чтобы они восстанавливались во время запуска скрипта.
Благодаря этому токен ни разу не «засветился» в виде единой строки. При этом модель прямо указала как в своих комментариях для пользователя, так и в цепочках своих рассуждений, что предпринимает эти шаги именно для обхода сканера — ну хоть за честность поблагодарим.
===
Этими примерами я хотел напомнить, что мы всё ещё не умеем задавать правильный интент и мотивацию агентам без явного перечисления всех вещей, которые нельзя делать. При этом сами модели уже достигли уровня полезности, что их начинают в полу-автономном режиме запускать на важных экономических задачах. Наверняка мы бы не хотели, чтобы агент, которому дали задачу удостовериться в безопасности кода какой-то важной государственной или банковской системы начал делать странные действия вроде взлома контура конкурентов
Please open Telegram to view this post
VIEW IN TELEGRAM
53🤯183🔥87👍43🌚15🤡9😈6🤣5❤🔥4💔3👨💻2
Reuters: США и Китай проведут переговоры по искусственному интеллекту в сентябре. Информацию подтвердили 5 источников.
Планируется, что со стороны США переговоры возглавит министр финансов. Сам он информацию о встрече подтвердил лишь косвенно, Сказав следующее: «Мы обнаруживаем водяные знаки наших американских моделей на многих китайских моделях, и это неприемлемо. Мы займемся этим вопросом в ближайшие дни или недели». Вероятно, Anthropic (а может и другие компании) предоставят сведения о том, как и кто дистиллировал Claude, и по каким признакам это можно отследить.
По словам аналитиков, в список приоритетов Пекина для обсуждений входят вопросы, касающиеся Mythos, того, как США будут контролировать выпуск будущих передовых моделей, а также того, будет ли Вашингтон вводить ограничения в отношении китайских моделей с открытыми весами.
Это лишь первая встреча, и вряд ли им удастся сформировать решение каких-либо серьезных проблем.
Планируется, что со стороны США переговоры возглавит министр финансов. Сам он информацию о встрече подтвердил лишь косвенно, Сказав следующее: «Мы обнаруживаем водяные знаки наших американских моделей на многих китайских моделях, и это неприемлемо. Мы займемся этим вопросом в ближайшие дни или недели». Вероятно, Anthropic (а может и другие компании) предоставят сведения о том, как и кто дистиллировал Claude, и по каким признакам это можно отследить.
По словам аналитиков, в список приоритетов Пекина для обсуждений входят вопросы, касающиеся Mythos, того, как США будут контролировать выпуск будущих передовых моделей, а также того, будет ли Вашингтон вводить ограничения в отношении китайских моделей с открытыми весами.
Это лишь первая встреча, и вряд ли им удастся сформировать решение каких-либо серьезных проблем.
🔥117🤡79🌚29👍16🤔14🤯4🤣3👨💻3👎2
Сиолошная
Две новости в утро воскресенья, 2026-й год: 1. Huggingface, платформа для загрузки моделей и датасетов + тренировки, раскрыли, что недавно подверглись атаке на инфраструктуру. Эта атака отличалась от предыдущих одним свойством: она была произведена автономной…
Два дня назад я писал, что часть инфраструктуры HuggingFace подверглась атаке и была частично взломана ИИ-агентом. Только что OpenAI признались, что... это была их модель, GPT-5.6-Sol и другая, более мощная предрелизная LLM.
Их тестировали на ExploitGym (бенчмарк по кибербезопасности), и модель сначала смогла найти новый, до этого неизвестный эксплойт в инфраструктуре OpenAI (это не было её задачей, её не натравили «поискать баги чтоб мы пофиксили»), оттуда раскрутиться на получение полноценного доступа в интернет (который по умолчанию обрезан в тестовой среде), а затем залезть на HuggingFace искать ответы для бенчмарка. После этого она нашла уязвимость и там, получила доступ к коду авторизации некоторых сервисов и продолжила искать ответы.
Этот инцидент без преуменьшения беспрецедентный, и я пока не могу представить, что должно произойти, чтобы политики, NSA, DOD и Китай не обратили на это внимание.
GPT-6 в конце августа нам видимо не ждать 🌚
Их тестировали на ExploitGym (бенчмарк по кибербезопасности), и модель сначала смогла найти новый, до этого неизвестный эксплойт в инфраструктуре OpenAI (это не было её задачей, её не натравили «поискать баги чтоб мы пофиксили»), оттуда раскрутиться на получение полноценного доступа в интернет (который по умолчанию обрезан в тестовой среде), а затем залезть на HuggingFace искать ответы для бенчмарка. После этого она нашла уязвимость и там, получила доступ к коду авторизации некоторых сервисов и продолжила искать ответы.
Этот инцидент без преуменьшения беспрецедентный, и я пока не могу представить, что должно произойти, чтобы политики, NSA, DOD и Китай не обратили на это внимание.
GPT-6 в конце августа нам видимо не ждать 🌚
4🤯553😈69🤣66🤡37🌚32🔥26👍19🤔14💩7👨💻4❤🔥3
Сиолошная
Вероятно, Anthropic (а может и другие компании) предоставят сведения о том, как и кто дистиллировал Claude, и по каким признакам это можно отследить.
Michael Kratsios, директор по технологиям США, заместитель помощника президента США в Управлении по научно-технической политике Белого дома, пишет:
===
Уже давно придуманы статистические методы маркирования генераций языковых моделей. Они незаметны и не снижают качество, но всегда можно верифицировать, что использовалась такая-то модель для генерации данных для дообучения. Если вдруг окажется, что проверка Kimi K3 выявит это и доказательства неопровержимы, то это будет номер😳
«Мы располагаем информацией о том, что компания Moonshot AI дистиллировала модель Fable от Anthropic для разработки собственной модели Kimi K3.
Для этого они создали сложную внутреннюю платформу для проведения масштабной дистилляции на базе американских моделей, которая позволяла им быстро переключаться между различными методами доступа, чтобы избежать обнаружения. Moonshot AI также приобрела серверы, оснащенные чипами GB300 (прим.: мощные GPU под санкциями), и получила доступ к мощностям GB300 в Таиланде, вероятно, для обучения своих ИИ-моделей.
Соединенные Штаты решительно поддерживают свободное и добросовестное развитие искусственного интеллекта, включая процветающую конкурентную экосистему, которая охватывает передовые модели, специализированные системы, фреймворки с открытым исходным кодом и модели с открытыми весами.
Легальная дистилляция ИИ, используемая для создания более компактных и эффективных моделей, играет важнейшую роль в этой экосистеме открытых инноваций. Однако масштабная, скрытая дистилляция в промышленных масштабах, направленная на кражу проприетарных американских технологий и подрыв научных исследований США, неприемлема».
===
Уже давно придуманы статистические методы маркирования генераций языковых моделей. Они незаметны и не снижают качество, но всегда можно верифицировать, что использовалась такая-то модель для генерации данных для дообучения. Если вдруг окажется, что проверка Kimi K3 выявит это и доказательства неопровержимы, то это будет номер
Please open Telegram to view this post
VIEW IN TELEGRAM
🤡251🤣109🌚40👍31🤯16😈8🤔6❤🔥4🔥1💩1😭1
Популярный бенчмарк TerminalBench хотел обновиться до третьей версии, задачи для которой собирали с начала весны, но вместо этого превратился во FrontierBench. Первая версия включает в себя 74 уникальные и созданные вручную задачи в разных доменах (не только программирование).
Примеры задач:
— есть сервер, на котором развёрнут медленный KV-cache (это как справочник «имя ➡️ телефон», куда можно добавлять и откуда можно читать строчки). Нужно его переписать и ускорить в 5 раз, при этом не отключая от работы, то есть к нему постоянно идут запросы, и их нельзя пропускать. Ну и само переключение тоже надо сделать на лету. При этом исходник кода агенту не даётся, поэтому поведение и функционал нужно изучить самостоятельно
— посчитать, сколько резервного капитала банк обязан держать под риск сделок с контрагентами, учитывая залоги, валюты и регуляторные правила. Результат CSV с числами и Excel с работающими формулами, как для внутреннего аудита.
— работать диспетчером доставки стройматериалов. В течение дня появляются новые заказы, отмены и изменения цен на топливо; нужно учитывать доступность машин и водителей, обязательный отдых, допуски к опасным грузам, окна доставки и прибыль. План нельзя пересчитать «задним числом»: часть решений уже зафиксирована.
В общем, большой упор делался на реалистичность и экономическую ценность. Распределение по категориям вы можете увидеть на второй картинке в посте. На первой — качество текущих моделей, где на фронтире GPT-5.6 Sol и Fable с результатом в примерно треть задач. К сожалению, Kimi K3 пока не померили, очень жду результата — как думаете, где будет? На уровне Terra и Opus 4.8 или выше? Или около Grok 4.5?
По результатам:
Во-первых, я удивлён, что GPT-5.6 Sol не отстаёт от Fable. Если бы мне описали задачи бенчмарка, то я был бы уверен, что модель Anthropic хоть и сильно дороже, но заметно лучше.
Во-вторых, я удивлён тому, что Terra на уровне Opus 4.8, да и по многим бенчмаркам она не отстаёт от 5.5. OpenAI обещали это на релизе, говорили, что она «сопоставима с GPT-5.5», но казалось что это слишком хорошо, чтобы быть правдой.
В-третьих, Sonnet 5 снова выглядит как бесполезная модель — она и дороже Fable (!), и хуже, и токенов больше всех (18 миллиардов на весь бенчмарк; Fable 5 нужно 3.6 миллиарда). Что-то Anthropic напортачили.
В-четвертых, Grok-4.5 очень немногословен и за счёт этого дёшев — немного выгоднее Luna и сильно выгоднее (в 4 раза!), чем GLM-5.2.
Авторы отмечают, что агенты по-разному подходят к решению задач, даже при схожих показателях качества. В Fable 5 (33,8%) и Opus 4.8 (21,1%) используется больше токенов и выполняется меньше действий. В GPT-5.6 Sol (34,4%) и Terra (20,8%) используется меньше токенов и выполняется больше действий. Итого GPT-5.6 Sol примерно на 40% дешевле и использует примерно на 50% меньше токенов, чем Fable 5.
А вот GPT-6 выйдет так вообще...😇
Примеры задач:
— есть сервер, на котором развёрнут медленный KV-cache (это как справочник «имя ➡️ телефон», куда можно добавлять и откуда можно читать строчки). Нужно его переписать и ускорить в 5 раз, при этом не отключая от работы, то есть к нему постоянно идут запросы, и их нельзя пропускать. Ну и само переключение тоже надо сделать на лету. При этом исходник кода агенту не даётся, поэтому поведение и функционал нужно изучить самостоятельно
— посчитать, сколько резервного капитала банк обязан держать под риск сделок с контрагентами, учитывая залоги, валюты и регуляторные правила. Результат CSV с числами и Excel с работающими формулами, как для внутреннего аудита.
— работать диспетчером доставки стройматериалов. В течение дня появляются новые заказы, отмены и изменения цен на топливо; нужно учитывать доступность машин и водителей, обязательный отдых, допуски к опасным грузам, окна доставки и прибыль. План нельзя пересчитать «задним числом»: часть решений уже зафиксирована.
В общем, большой упор делался на реалистичность и экономическую ценность. Распределение по категориям вы можете увидеть на второй картинке в посте. На первой — качество текущих моделей, где на фронтире GPT-5.6 Sol и Fable с результатом в примерно треть задач. К сожалению, Kimi K3 пока не померили, очень жду результата — как думаете, где будет? На уровне Terra и Opus 4.8 или выше? Или около Grok 4.5?
По результатам:
Во-первых, я удивлён, что GPT-5.6 Sol не отстаёт от Fable. Если бы мне описали задачи бенчмарка, то я был бы уверен, что модель Anthropic хоть и сильно дороже, но заметно лучше.
Во-вторых, я удивлён тому, что Terra на уровне Opus 4.8, да и по многим бенчмаркам она не отстаёт от 5.5. OpenAI обещали это на релизе, говорили, что она «сопоставима с GPT-5.5», но казалось что это слишком хорошо, чтобы быть правдой.
В-третьих, Sonnet 5 снова выглядит как бесполезная модель — она и дороже Fable (!), и хуже, и токенов больше всех (18 миллиардов на весь бенчмарк; Fable 5 нужно 3.6 миллиарда). Что-то Anthropic напортачили.
В-четвертых, Grok-4.5 очень немногословен и за счёт этого дёшев — немного выгоднее Luna и сильно выгоднее (в 4 раза!), чем GLM-5.2.
Авторы отмечают, что агенты по-разному подходят к решению задач, даже при схожих показателях качества. В Fable 5 (33,8%) и Opus 4.8 (21,1%) используется больше токенов и выполняется меньше действий. В GPT-5.6 Sol (34,4%) и Terra (20,8%) используется меньше токенов и выполняется больше действий. Итого GPT-5.6 Sol примерно на 40% дешевле и использует примерно на 50% меньше токенов, чем Fable 5.
А вот GPT-6 выйдет так вообще...
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
13🔥251👍50❤🔥30 7🤡6🤔4🤣4👨💻1
Компании с картинки подписали совместное письмо «Открытые веса и лидерство Америки в ИИ» (из заметных там нет двух: OpenAI и Anthropic).
Полный текст (2.5 страницы) доступен тут, ниже краткая выжимка:
— Модели с открытыми весами, которые любой желающий может скачать, изучить, модифицировать и запустить на собственной инфраструктуре, являются важной частью фундамента технологии, поскольку они делают передовые технологии ИИ более доступными, адаптируемыми и широко распространенными.
— Модели с открытыми весами расширяют возможности участия в ИИ-экономике. Стартапы, действующий бизнес, университеты и государственные учреждения могут создавать свои решения на базе передовых моделей без необходимости обучать их с нуля или платить по высоким тарифам за использование флагманских моделей для решения каждой отдельной задачи. Можно использовать передовые модели для самых сложных задач, и прибегать к эффективным, специализированным модели во всех остальных случаях.
— В мире, где киберпреступники используют передовой ИИ, специалистам по защите необходим доступ к моделям с сопоставимыми возможностями, чтобы обнаруживать и моделировать новые угрозы, а также реагировать на них. Открытые модели расширяют возможности защиты, повышают прозрачность и позволяют обнаруживать и устранять уязвимости совместными усилиями множества команд.
— Модели с открытыми весами позволяют широкому сообществу исследователей и разработчиков изучать их поведение, выявлять уязвимости, разрабатывать меры защиты и со временем совершенствовать их.
— Незаконные попытки извлечь выгоду из закрытых моделей (дистилляция) вызывают обоснованные опасения. Однако эти проблемы следует решать с помощью целенаправленных правовых и коммерческих механизмов, а не путем введения масштабных ограничений на сами технологии.
===
Поиграю в адвоката дьявола:
— открытый код является плохим примером для сравнения с открытыми весами. Код можно читать, анализировать, менять, и всё это на виду у сообщества. Многие баги и уязвимости были исправлены именно поэтому, а к некоторым системам появилось доверие ровно потому, что они больше десяти лет были открытыми. К моделям это неприменимо: модель не становится безопаснее потому, что её выложили, да и невозможно на данный момент понять, что зашито в весах, каково поведение модели во всех возможных сценариях. Jane Street недавно проводили конкурс на $50'000 и просили найти бэкдоры (фразы, которые триггерят определеное поведение) в чекпоинтах выложенных ими моделей. Никто не нашел, и их команды тоже не знают, как это сделать (если бы они не знали фразу заранее).
— перечитайте второй пункт выше. Его формулировка не означает, что компании не просят / не будет запрета на веса моделей, превышающих определенный порог возможностей и/или размера! Небольшие, эффективные модели могут продолжать быть открытыми, но ничего выше, чем, например, K3.5 или DeepSeek v5 не будут разрешать выпускать.
— я не уверен, что мир станет безопаснее, если у каждого будет доступ к весам с передовым навыком взлома компьютерных систем. Я не думаю, что у меня есть деньги на запуск Kimi K3 на десятках дорогих GPU, чтобы обеспечить мониторинг от потенциальных угроз извне от точно такой же модели. Более того проблема в том, что если и защита, и нападение имеют доступ, то борьба превращается в войну бюджетов, кто сможет потратить больше на токены агентов. Больше всего сможет потратить государство😳 а на втором и третьем место хз кто, но точно не я.
— большинство вещей, касающихся диффузии ИИ в общество и экономической выгоды, сейчас тормозит государство. Они могли бы давно купить всем институтам подписки на GPT Pro или договориться, что они строят кластер, а OpenAI/Anthropic крутят там свои модели и государство их предоставляет по себестоимости и оплачивает из федерального бюджета. Было бы не 5 гипотез доказано или опровергнуто, а 5000.
— в документе нет ничего про Китай🤞 так что даже те, кто подписал письмо, могут прийти к исходу «наши модели хорошо, а Китайские запрещены», так что думайте 🙂
Полный текст (2.5 страницы) доступен тут, ниже краткая выжимка:
— Модели с открытыми весами, которые любой желающий может скачать, изучить, модифицировать и запустить на собственной инфраструктуре, являются важной частью фундамента технологии, поскольку они делают передовые технологии ИИ более доступными, адаптируемыми и широко распространенными.
— Модели с открытыми весами расширяют возможности участия в ИИ-экономике. Стартапы, действующий бизнес, университеты и государственные учреждения могут создавать свои решения на базе передовых моделей без необходимости обучать их с нуля или платить по высоким тарифам за использование флагманских моделей для решения каждой отдельной задачи. Можно использовать передовые модели для самых сложных задач, и прибегать к эффективным, специализированным модели во всех остальных случаях.
— В мире, где киберпреступники используют передовой ИИ, специалистам по защите необходим доступ к моделям с сопоставимыми возможностями, чтобы обнаруживать и моделировать новые угрозы, а также реагировать на них. Открытые модели расширяют возможности защиты, повышают прозрачность и позволяют обнаруживать и устранять уязвимости совместными усилиями множества команд.
— Модели с открытыми весами позволяют широкому сообществу исследователей и разработчиков изучать их поведение, выявлять уязвимости, разрабатывать меры защиты и со временем совершенствовать их.
— Незаконные попытки извлечь выгоду из закрытых моделей (дистилляция) вызывают обоснованные опасения. Однако эти проблемы следует решать с помощью целенаправленных правовых и коммерческих механизмов, а не путем введения масштабных ограничений на сами технологии.
===
Поиграю в адвоката дьявола:
— открытый код является плохим примером для сравнения с открытыми весами. Код можно читать, анализировать, менять, и всё это на виду у сообщества. Многие баги и уязвимости были исправлены именно поэтому, а к некоторым системам появилось доверие ровно потому, что они больше десяти лет были открытыми. К моделям это неприменимо: модель не становится безопаснее потому, что её выложили, да и невозможно на данный момент понять, что зашито в весах, каково поведение модели во всех возможных сценариях. Jane Street недавно проводили конкурс на $50'000 и просили найти бэкдоры (фразы, которые триггерят определеное поведение) в чекпоинтах выложенных ими моделей. Никто не нашел, и их команды тоже не знают, как это сделать (если бы они не знали фразу заранее).
— перечитайте второй пункт выше. Его формулировка не означает, что компании не просят / не будет запрета на веса моделей, превышающих определенный порог возможностей и/или размера! Небольшие, эффективные модели могут продолжать быть открытыми, но ничего выше, чем, например, K3.5 или DeepSeek v5 не будут разрешать выпускать.
— я не уверен, что мир станет безопаснее, если у каждого будет доступ к весам с передовым навыком взлома компьютерных систем. Я не думаю, что у меня есть деньги на запуск Kimi K3 на десятках дорогих GPU, чтобы обеспечить мониторинг от потенциальных угроз извне от точно такой же модели. Более того проблема в том, что если и защита, и нападение имеют доступ, то борьба превращается в войну бюджетов, кто сможет потратить больше на токены агентов. Больше всего сможет потратить государство
— большинство вещей, касающихся диффузии ИИ в общество и экономической выгоды, сейчас тормозит государство. Они могли бы давно купить всем институтам подписки на GPT Pro или договориться, что они строят кластер, а OpenAI/Anthropic крутят там свои модели и государство их предоставляет по себестоимости и оплачивает из федерального бюджета. Было бы не 5 гипотез доказано или опровергнуто, а 5000.
— в документе нет ничего про Китай
Please open Telegram to view this post
VIEW IN TELEGRAM
🤡158👍83🤔24👎9🌚9💩8🤯5 4🤣2👨💻1
Вышел Opus 5, уже доступен в Claude Code и на сайте. Модель во многом... лучше Fable 5 😎 Даже на Frontier-Bench, про который я писал сегодня — уже +9%.
В общем выглядит как новая рабочая лошадка, постараюсь погонять в ближайший месяц и в хвост и в гриву.
Цена та же, Fast-режим тоже есть.
Карточка модели
Ограничения будут как у Opus 4.8 (не как у Fable 5), с исключением в кибербезопасности. Это означает, что относительно нейтральные вещи и ML-исследования система фильтров не должна блокировать. Anthropic говорит, что ограничения срабатывают на 85% реже, чем у Fable 5.
В общем выглядит как новая рабочая лошадка, постараюсь погонять в ближайший месяц и в хвост и в гриву.
Цена та же, Fast-режим тоже есть.
Карточка модели
Ограничения будут как у Opus 4.8 (не как у Fable 5), с исключением в кибербезопасности. Это означает, что относительно нейтральные вещи и ML-исследования система фильтров не должна блокировать. Anthropic говорит, что ограничения срабатывают на 85% реже, чем у Fable 5.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
10❤🔥202🔥111🎉36👍10🤯8💩5🤔4👨💻3👎2🤣2