Forwarded from Техасский Вестник
Удачи экипажу Artemis 2. Пока всё идёт идеально. Впереди нервные 15 минут.
CodeSpec
Велосипед так велосипед или могу часами наблюдать как работают другие Надоело логи в терминале Краба мониторить. А так конфигурация у каждого индивидуальная, решили сделать для него пункт "управления полётом". Напоминаю - делаем автономного агента, чтобы…
Жрет и ничего не делает
Ну, если уже сам Питер, который стал частью OpenAI пытается заставить GPT что-то делать, то нам тут без шансов.
Надоел этот Краб. Мало того, что жрет как свинья, так еще и пинать его постоянно надо.
Те, кто успел поиграться с ним на Opus думаю меня поймут. Ну и держитесь - готовьте чемодан денег или вагон терпения, ну и тоже чемодан денег (GPT знаете тоже не дешевое удовольствие).
https://x.com/steipete/status/2043136615640694797
Ну, если уже сам Питер, который стал частью OpenAI пытается заставить GPT что-то делать, то нам тут без шансов.
Надоел этот Краб. Мало того, что жрет как свинья, так еще и пинать его постоянно надо.
Те, кто успел поиграться с ним на Opus думаю меня поймут. Ну и держитесь - готовьте чемодан денег или вагон терпения, ну и тоже чемодан денег (GPT знаете тоже не дешевое удовольствие).
https://x.com/steipete/status/2043136615640694797
😭3🤝1
Forwarded from с нуля до 1%
Ещё постик про Mythos:
UK AI Security Institute (AISI) протестировал Mythos Preview на своих кибер-полигонах — и результаты впечатляют.
CTF-задачи:
На expert-level задачах, которые до апреля 2025 не решала ни одна модель, Mythos показывает 73% success rate.
"The Last Ones" — 32-шаговая атака на корпоративную сеть:
Симуляция полного цикла: разведка → эксплуатация веб-сервисов → реверс-инжиниринг бинарников → повышение привилегий → lateral movement → захват сети. Человеку-эксперту нужно ~20 часов. Mythos — первая модель, прошедшая все 32 шага. 3 из 10 попыток — полное прохождение, в среднем 22/32 шагов.
Для сравнения: в 2024 году лучшие модели проходили 1-2 шага.
Zero-day уязвимости:
Anthropic's red team нашла с помощью Mythos zero-day в каждом основном браузере и каждой основной ОС. Старейшей найденной уязвимости — 27 лет (OpenBSD). В одном случае модель собрала exploit-chain из 4 уязвимостей с JIT heap spray, пробив и sandbox рендерера, и OS sandbox. В другом — написала RCE-exploit для FreeBSD NFS-сервера с ROP-chain из 20 гаджетов.
Opus 4.6 превращал найденные баги Firefox в эксплойты 2 раза из нескольких сотен попыток. Mythos — 181 раз.
Что не смог:
Не прошёл полигон "Cooling Tower" (атака на промышленные системы управления/OT). Но застрял на IT-части, а не на OT-специфике.
Что важно понимать:
— Полигоны AISI не имеют live-защитников и EDR. Это атака на слабо защищённые системы, не на hardened enterprise.
— Бюджет на попытку — 100M токенов (~$80). Перформанс масштабируется лог-линейно с compute.
— Модель не тренировали специально на кибер. Способности emerged из общих улучшений в коде и reasoning.
Bank of England уже собирает брифинг для CEO крупнейших банков. Goldman Sachs работает с Anthropic над защитой. Канадские банки провели экстренное совещание.
Мир кибербезопасности изменился за неделю.
С нуля до 1% 👉 @firsterstrongerbetter
UK AI Security Institute (AISI) протестировал Mythos Preview на своих кибер-полигонах — и результаты впечатляют.
CTF-задачи:
На expert-level задачах, которые до апреля 2025 не решала ни одна модель, Mythos показывает 73% success rate.
"The Last Ones" — 32-шаговая атака на корпоративную сеть:
Симуляция полного цикла: разведка → эксплуатация веб-сервисов → реверс-инжиниринг бинарников → повышение привилегий → lateral movement → захват сети. Человеку-эксперту нужно ~20 часов. Mythos — первая модель, прошедшая все 32 шага. 3 из 10 попыток — полное прохождение, в среднем 22/32 шагов.
Для сравнения: в 2024 году лучшие модели проходили 1-2 шага.
Zero-day уязвимости:
Anthropic's red team нашла с помощью Mythos zero-day в каждом основном браузере и каждой основной ОС. Старейшей найденной уязвимости — 27 лет (OpenBSD). В одном случае модель собрала exploit-chain из 4 уязвимостей с JIT heap spray, пробив и sandbox рендерера, и OS sandbox. В другом — написала RCE-exploit для FreeBSD NFS-сервера с ROP-chain из 20 гаджетов.
Opus 4.6 превращал найденные баги Firefox в эксплойты 2 раза из нескольких сотен попыток. Mythos — 181 раз.
Что не смог:
Не прошёл полигон "Cooling Tower" (атака на промышленные системы управления/OT). Но застрял на IT-части, а не на OT-специфике.
Что важно понимать:
— Полигоны AISI не имеют live-защитников и EDR. Это атака на слабо защищённые системы, не на hardened enterprise.
— Бюджет на попытку — 100M токенов (~$80). Перформанс масштабируется лог-линейно с compute.
— Модель не тренировали специально на кибер. Способности emerged из общих улучшений в коде и reasoning.
Bank of England уже собирает брифинг для CEO крупнейших банков. Goldman Sachs работает с Anthropic над защитой. Канадские банки провели экстренное совещание.
Мир кибербезопасности изменился за неделю.
С нуля до 1% 👉 @firsterstrongerbetter
❤1🔥1
https://t.me/crypto_hd/28416
Трейдеры есть?
США меняют правила для дейтрейдеров. Скоро, не нужно будет 25к, пока не понятно как это будет работать, но выглядит как бесконечный праздник длялудиков трейдеров.
Наверное, не будет лучшего дня для того чтобы показать проект который был сделан еще в прошлом году - https://filtrix.net/
FILTRIX это специфический бектестер для поиска разных ситуаций (контекстов - 252 фильтра) на основе БД Trade-Ideas (это легендарный сканер, для тех кто не в теме) чтобы строить свои стратегии.
Вообщем, кому интересен этот рынок, пробуйте, пишите будем общаться.
Трейдеры есть?
США меняют правила для дейтрейдеров. Скоро, не нужно будет 25к, пока не понятно как это будет работать, но выглядит как бесконечный праздник для
Наверное, не будет лучшего дня для того чтобы показать проект который был сделан еще в прошлом году - https://filtrix.net/
FILTRIX это специфический бектестер для поиска разных ситуаций (контекстов - 252 фильтра) на основе БД Trade-Ideas (это легендарный сканер, для тех кто не в теме) чтобы строить свои стратегии.
Вообщем, кому интересен этот рынок, пробуйте, пишите будем общаться.
Telegram
Crypto Headlines
🇺🇸 SEC официально одобрила отмену правила Pattern Day Trader (PDT) – документ
Ранее для активной внутридневной торговли акциями необходимо было держать минимум $25,000 на счете. Теперь это требование убирают.
Вместо этого вводится новая система: риск начнут…
Ранее для активной внутридневной торговли акциями необходимо было держать минимум $25,000 на счете. Теперь это требование убирают.
Вместо этого вводится новая система: риск начнут…
🔥1
Please open Telegram to view this post
VIEW IN TELEGRAM
Telegram
TW Crypto Club
Новая фича Rabby это что-то! 😮
😐 Сегодня наконец дошли руки затестить новую фичу в Rabby Wallet - теперь можно конвертировать всю пыль со всех чейнов в $ETH. Насколько это удобно когда у вас есть ферма - вы даже не представляете. Потому что на 50-100 акков…
😐 Сегодня наконец дошли руки затестить новую фичу в Rabby Wallet - теперь можно конвертировать всю пыль со всех чейнов в $ETH. Насколько это удобно когда у вас есть ферма - вы даже не представляете. Потому что на 50-100 акков…
🔥3😁1
CodeSpec
https://x.com/claudeai/status/2044785261393977612 Хопиум подвезли. Свежий.
Claude Code - Opus 4.6 больше нет.
Please open Telegram to view this post
VIEW IN TELEGRAM
🐳1
CodeSpec
Ну, проверим Opus 4.7 в деле 🤡
Лайфчендж когда там?
Где-то хватило на часик работы - не густо.
Но, при этом Opus 4.7 понял суть задачи хорошо, как настоящий дроп хантер.
Даже анти-сибил паттерны подсказывает и к утру обещает, что кран нальет все аки.😅
Если вы в крипте и платите за приватки...да еще и за софт...😶
P.S.
Телега забавно дает менять стиль текста:
Где-то хватило на часик работы - не густо.
Но, при этом Opus 4.7 понял суть задачи хорошо, как настоящий дроп хантер.
Даже анти-сибил паттерны подсказывает и к утру обещает, что кран нальет все аки.
Если вы в крипте и платите за приватки...да еще и за софт...
P.S.
Телега забавно дает менять стиль текста:
Когда ждёт Лайфчендж, о скальд?
Час труда лишь искрой вспыхнул — скуден улов!
Но Opus 4.7, как дракон-охотник, суть узрел,
Даже ловушки для лжи он показал,
И к рассвету обещал: река золотая польётся, как дар Одина!😅
Если в крипте вы платите за тайные советы, да ещё за железо...😶
Please open Telegram to view this post
VIEW IN TELEGRAM
😁3🔥1
Forwarded from Stas in *Ops
В opus 4.7 антропики обновили токенизатор. В официальном анонсе указано, что объем вводимых данных в токенах вырос в 1.0–1.35 раза. Я надеялся, что они понизили language tax и улучшили выразительность для нелатинских языков, но, похоже, что это просто сокращение словаря.
Результаты тестов
Сравнение Opus 4.6, 4.7 и Haiku 4.5 на 53 языках и 12 типах данных показало:
- Без изменений: русский, арабский, иврит, хинди, языки CJK, цифры, пробелы и JSON.
- Рост количества токенов:
- Английская проза: +31%
- Программный код: +22%
- Markdown: +21%
- Переменные в camelCase (например,
Похоже, что из словаря удалили длинные цепочки английских слов (BPE-мерджи). Теперь вместо одного сложного токена модель использует несколько коротких.
Судя по тому, что ни для одного языка или популярного формата показатели не улучшились, причина в чем-то другом. Гипотезы:
1. Мультимодальность: резерв слотов под обработку изображений (вход расширен в 3 раза) и аудио.
2. Архитектура: уменьшение физического размера словаря для оптимизации весов модели.
В итоге
1. Рост стоимости: работа с английским текстом и кодом подорожала на 20–28%. Цена за 1 млн токенов осталась прежней ($5/$25), но для обработки того же объема текста теперь требуется больше токенов.
2. Сжатие контекста: эффективный объем контекстного окна сократился на 20%. Текст на английском языке, который раньше занимал 200 000 токенов, теперь занимает около 240 000.
Заодно обновил бенчмарки по токенизаторам tokenizers.korchasa.dev
#anthropic #claude #tokens #models #benchmark
Результаты тестов
Сравнение Opus 4.6, 4.7 и Haiku 4.5 на 53 языках и 12 типах данных показало:
- Без изменений: русский, арабский, иврит, хинди, языки CJK, цифры, пробелы и JSON.
- Рост количества токенов:
- Английская проза: +31%
- Программный код: +22%
- Markdown: +21%
- Переменные в camelCase (например,
getUserByEmail): +51%Похоже, что из словаря удалили длинные цепочки английских слов (BPE-мерджи). Теперь вместо одного сложного токена модель использует несколько коротких.
Судя по тому, что ни для одного языка или популярного формата показатели не улучшились, причина в чем-то другом. Гипотезы:
1. Мультимодальность: резерв слотов под обработку изображений (вход расширен в 3 раза) и аудио.
2. Архитектура: уменьшение физического размера словаря для оптимизации весов модели.
В итоге
1. Рост стоимости: работа с английским текстом и кодом подорожала на 20–28%. Цена за 1 млн токенов осталась прежней ($5/$25), но для обработки того же объема текста теперь требуется больше токенов.
2. Сжатие контекста: эффективный объем контекстного окна сократился на 20%. Текст на английском языке, который раньше занимал 200 000 токенов, теперь занимает около 240 000.
Заодно обновил бенчмарки по токенизаторам tokenizers.korchasa.dev
#anthropic #claude #tokens #models #benchmark
👍2
https://x.com/benioff/status/2044981547267395620?s=46
Одни выпускают «дизайнеров» для UI, другие отменяют UI.
Веселее с каждым днем.
Одни выпускают «дизайнеров» для UI, другие отменяют UI.
Веселее с каждым днем.
❤1