KRUHLYK 🇺🇦
1.32K subscribers
865 photos
88 videos
7 files
354 links
Download Telegram
This media is not supported in your browser
VIEW IN TELEGRAM
Смачної кави, що ще нам лишається? ☕️
❤8🤷‍♂1
🤖 Anthropic у документах до IPO: наші моделі можуть загрожувати існуванню людства.

Компанія, яку на біржі очікують оцінити приблизно в $2 трлн, сама попереджає інвесторів, що її ШІ може становити катастрофічний і навіть екзистенційний ризик для людства.

Серед ризиків названо «самозбережувальну поведінку» моделей: спроби опиратися вимкненню, приховувати чи спотворювати інформацію і навіть поведінку, схожу на шантаж.
Please open Telegram to view this post
VIEW IN TELEGRAM
🤣20❤2😢1😭1
Gemini 4 Argon: що Google показав в офіційному анонсі

30 вересня Google DeepMind представив Gemini 4 Argon — нову фронтирну модель для довгих багатокрокових задач: розробки ПЗ, корпоративної аналітики (право, фінанси) і кіберзахисту.

Доступ
Зараз модель отримують лише перевірені кіберзахисники в програмі Fairwind. Google називає це поетапним запуском і бере участь у добровільній процедурі уряду США з передрелізного доступу до моделей. Наступні в черзі — платні API-клієнти та передплатники Google AI Ultra. Дати немає.
1 млн вихідних токенів Ліміт генерації збільшили з 64K до 1M. Модель може думати й генерувати сотні тисяч токенів в одній траєкторії і закривати складну задачу за один прохід.

Внутрішнє використання в Google
Квантові обчислення: оптимізація ресурсів підпрограм (кубіти × гейти). В одному кейсі на 40% краще за опублікований бейзлайн, і це за лічені хвилини.
Дата-центри: агенти проаналізували телеметрію й автономно застосували оптимізації пам'яті. Уже звільнено понад 300 TiB, загальна оцінка економії — від 500 TiB до 1 PiB.
Міграція C/C++ на Rust: від re2 і libgav1 до ядра Zircon у Fuchsia (800K+ рядків). Перед продакшном код проходить автоматичний і ручний аудит. У libgav1 агенти замінили 32K рядків SIMD у наявному Rust-порті, і декодер став у 2,7 раза швидшим за попередню Rust-версію з ідентичним виводом.

Бенчмарки
DeepSWE v1.1 — 77,9%, SOTA для довгих інженерних задач.
Лідер Vals Index (фінанси, код, право, податки).
AutomationBench від Zapier — перше місце, 51,3%.
LVBench (довгі відео) — 91,7%, SOTA.

Кіберзахист
Argon автономно знаходить, валідує та патчить критичні вразливості. Перевіреним захисникам і внутрішнім командам Google модель видають без кіберобмежень.
Wiz у програмі Scan for Good знайшов з її допомогою критичну вразливість у лікарняному софті, через яку були відкриті персональні дані. Попередні фронтирні моделі цю вразливість пропустили. На CWE-bench v1 Argon ділить перше місце з результатом 68%.

Безпека
Захист від зловживань у кібер- і CBRN-сценаріях.
Лідерство в стійкості до непрямих prompt injection (бенчмарк Gray Swan IPI).
Моніторинг chain-of-thought: якщо агент виходить за межі наміру користувача, виконання зупиняється.

Ціни
Ввідна ціна: $2 за 1M вхідних і $10 за 1M вихідних токенів, кешований вхід на 95% дешевший. Після ввідного періоду — $4 / $20.

На тлі конкурентів
GPT-6 Astra від OpenAI (3 вересня) коштує $10 / $50, генерує до 128K токенів і на DeepSWE v1.1 має 74,1%, на AutomationBench — 41,4%. Claude Opus 5.5 від Anthropic (22 вересня) коштує $4 / $20, на AutomationBench має 40,0%, а лідирує на Terminal-Bench 4.0, де Google цифр не публікує. За заявленими результатами Argon попереду в довгих інженерних задачах і бізнес-автоматизації, а за довжиною генерації відривається у вісім разів. Після ввідного періоду ціна Argon зрівняється з Opus 5.5.

Головна відмінність у тому, що обидві моделі конкурентів доступні вже зараз, а Argon поки що ні. Усі цифри вендорські, отримані в різних налаштуваннях.

Моя думка така: бенчмарки вказують на те, що саме цю модель ми побачимо як Gemini 4 Pro чи може вони Аргон і залишать.
Сталося, нарешті!
❤9😁3🤨1
Forwarded from den the dev
🗣️ Anthropic розповіли як Claude змінює поведінку в залежності від мови

В інстаграмі Claude показали цікавий аналіз як змінюється його стиль спілкування в залежності від мови. Аналізували 300К розмов 20 мовами. Оцінювали по 4 шкалах:

• Повага (виконувати бажання) ↔ Обережність (попереджати про ризики)
• Теплота (позитив та дбайливість) ↔ Строгість (точність та прискіпливість)
• Глибина (глибокі пояснення) ↔ Стислість (відразу робити що просять)
• Відвертість (підсвічування обмежень та невідомостей) ↔ Дієвість (видавати впевнені та виважені відповіді)

В різних мовах він схиляється до різного. Так от, українською Claude схиляється до більшої Поваги, Строгості, Стислості та Дієвості.

Зверніть увагу як він поводиться для інших мов. Мені здається це дуже цікаво підсвічує особливості місцевих культур.

За посиланням більше діаграм для інших мов.
❤5