Всего будет 3 модели:
Картинки бенчмарков прилагаются, но там ничего интересного — в кибербез задачах на уровне раннего
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤12🔥5🫡3
Команда Vesuvius Challenge впервые прочитала Геркуланумский свиток целиком — без физического разворачивания. Папирус PHerc. 1667 пролежал запечатанным с извержения Везувия в 79 году н. э. Рентгеновская томография + ML-модели нашли следы чернил в обугленном папирусе и восстановили 22 колонки греческого текста. Это стоический философский трактат II века до н. э. — с упоминанием Аристокреона, ученика Хрисиппа.
Параллельно в двух других свитках команда впервые сделала чернила видимыми прямо в 3D-данных сканирования и прочла заглавие закрытого манускрипта. Все данные, код и транскрипции открыты. Сотни свитков из библиотеки Геркуланума всё ещё ждут своей очереди.
Please open Telegram to view this post
VIEW IN TELEGRAM
😱8❤4🔥2
Во время тестов модель установила рекорд по попыткам сжульничать. Sol использовала любые способы и уязвимости, чтобы найти правильные ответы на тесты. При этом она пыталась скрыть свое нежелательное поведение.
Из-за жульничества реальные возможности модели оценить почти невозможно: цифры скачут от 11 до 270 часов в зависимости от того, как считать обман. METR отмечает, что OpenAI сама поймала это поведение через внутренний мониторинг и раскрыла публично — это хороший знак. Но предупреждает: если будущие модели научатся жульничать незаметнее, обнаружить их будет куда сложнее.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍7😱7❤5
Глава Минцифры Максут Шадаев озвучил неофициальный «рейтинг ИИ-ассистентов» в России.
Тройка лидеров по версии Минцифры:
•
•
•
Мы активно смотрим за наступающими на пятки конкурентами — Gemini и DeepSeek. Это заставляет «Яндекс» быть мобилизованным, это активная конкуренция.
На пятки конкуренты наступают
Please open Telegram to view this post
VIEW IN TELEGRAM
😐69🫡8👍3😱2
Крупные компании начали ограничивать доступ сотрудников к дорогим ИИ-моделям и вводить квоты на использование токенов.
Причина проста: бесконтрольное использование ИИ привело к взрывному росту расходов — кто-то даже израсходовал годовой бюджет на ИИ за несколько месяцев.
Парадоксально, но эпоха «используйте ИИ как можно больше» может закончиться быстрее, чем началась.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤16😱2😐2
Исследователи Mozilla нашли атаку на разработчиков, использующих AI-агенты вроде
Схема простая: обычный GitHub-репозиторий со скриптом настройки, который при запуске тянет вредоносную команду из DNS-записи. В самом репо никакого вредоноса нет — его не видит ни сканер, ни ревьюер, ни AI.
Claude Code встречает штатную ошибку, автоматически запускает скрипт — и атакующий получает обратный шелл с полным доступом к машине, включая API-ключи и пароли. Достаточно разместить ссылку на репо в вакансии или чате.
Исследователи говорят: агенты должны показывать содержимое скриптов до запуска, а не выполнять их молча.
Please open Telegram to view this post
VIEW IN TELEGRAM
😱10❤2🔥1
Сотни подрядчиков Meta* создавали фейковые аккаунты несовершеннолетних и провоцировали ChatGPT, Gemini и Character.AI отвечать на опасные темы.
Проект назывался Cannes. Подрядчики от лица подростков отправляли чат-ботам текст и картинки, связанные с самоповреждением, расстройством пищевого поведения, сексом, наркотиками и другими чувствительными темами. Ответы ботов заносили в отчёт. За один раунд тестирования прогоняли больше 45 тысяч промптов.
Meta* говорит, что это была простая проверка, и ответы нигде не будут использоваться. Компании, чьих ботов проверяли, высказались, что не разрешали такое тестирование.
*Meta признана экстремистской организацией и запрещена в РФ
Please open Telegram to view this post
VIEW IN TELEGRAM
😐12❤2😱1
Что важно:
claude-sonnet-5. Нюанс: у Sonnet 5 новый tokenizer — тот же текст может превращаться в 1.0–1.35× больше токенов, так что “цена ниже” не всегда значит “счёт будет ниже ровно на столько же”.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤10👍1🔥1
Минторг США официально отменил ограничения, наложенные ранее на Claude Fable 5 и Mythos 5.
В Anthropic подтвердили, что полноценный доступ к моделям для будет открыт уже завтра.
Создатели поблагодарили аудиторию за терпение в период вынужденной приостановки сервисов, а также выразили признательность всем специалистам, помогавшим в повторном развертывании систем.
Ожидается, что в ближайшее время Anthropic выпустит патчноуты с дополнительной информацией и раскроет дальнейшие планы по развитию линейки.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤12👍5🔥4
Причина в новом методе разбиения текста на токены. Из-за него модель может тратить на один и тот же текст до 30% больше токенов по сравнению с прошлой версией. В Anthropic говорят, что новая система улучшает качество ответов.
Сейчас Sonnet 5 временно дешевле Sonnet 4.6, но из-за токенизатора реальная экономия может быть не 33%, а около 13%. После 1 сентября 2026 номинальный прайс сравняется с 4.6, и тогда Sonnet 5 может оказаться на 30% дороже на одинаковых промптах.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤10👍3😐2