Forwarded from Цифрові в'єтнамки
Компанія, яку на біржі очікують оцінити приблизно в $2 трлн, сама попереджає інвесторів, що її ШІ може становити катастрофічний і навіть екзистенційний ризик для людства.
Серед ризиків названо «самозбережувальну поведінку» моделей: спроби опиратися вимкненню, приховувати чи спотворювати інформацію і навіть поведінку, схожу на шантаж.
Please open Telegram to view this post
VIEW IN TELEGRAM
🤣20❤2😢1😭1
Gemini 4 Argon: що Google показав в офіційному анонсі
30 вересня Google DeepMind представив Gemini 4 Argon — нову фронтирну модель для довгих багатокрокових задач: розробки ПЗ, корпоративної аналітики (право, фінанси) і кіберзахисту.
Доступ
Зараз модель отримують лише перевірені кіберзахисники в програмі Fairwind. Google називає це поетапним запуском і бере участь у добровільній процедурі уряду США з передрелізного доступу до моделей. Наступні в черзі — платні API-клієнти та передплатники Google AI Ultra. Дати немає.
1 млн вихідних токенів Ліміт генерації збільшили з 64K до 1M. Модель може думати й генерувати сотні тисяч токенів в одній траєкторії і закривати складну задачу за один прохід.
Внутрішнє використання в Google
Квантові обчислення: оптимізація ресурсів підпрограм (кубіти × гейти). В одному кейсі на 40% краще за опублікований бейзлайн, і це за лічені хвилини.
Дата-центри: агенти проаналізували телеметрію й автономно застосували оптимізації пам'яті. Уже звільнено понад 300 TiB, загальна оцінка економії — від 500 TiB до 1 PiB.
Міграція C/C++ на Rust: від re2 і libgav1 до ядра Zircon у Fuchsia (800K+ рядків). Перед продакшном код проходить автоматичний і ручний аудит. У libgav1 агенти замінили 32K рядків SIMD у наявному Rust-порті, і декодер став у 2,7 раза швидшим за попередню Rust-версію з ідентичним виводом.
Бенчмарки
DeepSWE v1.1 — 77,9%, SOTA для довгих інженерних задач.
Лідер Vals Index (фінанси, код, право, податки).
AutomationBench від Zapier — перше місце, 51,3%.
LVBench (довгі відео) — 91,7%, SOTA.
Кіберзахист
Argon автономно знаходить, валідує та патчить критичні вразливості. Перевіреним захисникам і внутрішнім командам Google модель видають без кіберобмежень.
Wiz у програмі Scan for Good знайшов з її допомогою критичну вразливість у лікарняному софті, через яку були відкриті персональні дані. Попередні фронтирні моделі цю вразливість пропустили. На CWE-bench v1 Argon ділить перше місце з результатом 68%.
Безпека
Захист від зловживань у кібер- і CBRN-сценаріях.
Лідерство в стійкості до непрямих prompt injection (бенчмарк Gray Swan IPI).
Моніторинг chain-of-thought: якщо агент виходить за межі наміру користувача, виконання зупиняється.
Ціни
Ввідна ціна: $2 за 1M вхідних і $10 за 1M вихідних токенів, кешований вхід на 95% дешевший. Після ввідного періоду — $4 / $20.
На тлі конкурентів
GPT-6 Astra від OpenAI (3 вересня) коштує $10 / $50, генерує до 128K токенів і на DeepSWE v1.1 має 74,1%, на AutomationBench — 41,4%. Claude Opus 5.5 від Anthropic (22 вересня) коштує $4 / $20, на AutomationBench має 40,0%, а лідирує на Terminal-Bench 4.0, де Google цифр не публікує. За заявленими результатами Argon попереду в довгих інженерних задачах і бізнес-автоматизації, а за довжиною генерації відривається у вісім разів. Після ввідного періоду ціна Argon зрівняється з Opus 5.5.
Головна відмінність у тому, що обидві моделі конкурентів доступні вже зараз, а Argon поки що ні. Усі цифри вендорські, отримані в різних налаштуваннях.
Моя думка така: бенчмарки вказують на те, що саме цю модель ми побачимо як Gemini 4 Pro чи може вони Аргон і залишать.
Сталося, нарешті!
30 вересня Google DeepMind представив Gemini 4 Argon — нову фронтирну модель для довгих багатокрокових задач: розробки ПЗ, корпоративної аналітики (право, фінанси) і кіберзахисту.
Доступ
Зараз модель отримують лише перевірені кіберзахисники в програмі Fairwind. Google називає це поетапним запуском і бере участь у добровільній процедурі уряду США з передрелізного доступу до моделей. Наступні в черзі — платні API-клієнти та передплатники Google AI Ultra. Дати немає.
1 млн вихідних токенів Ліміт генерації збільшили з 64K до 1M. Модель може думати й генерувати сотні тисяч токенів в одній траєкторії і закривати складну задачу за один прохід.
Внутрішнє використання в Google
Квантові обчислення: оптимізація ресурсів підпрограм (кубіти × гейти). В одному кейсі на 40% краще за опублікований бейзлайн, і це за лічені хвилини.
Дата-центри: агенти проаналізували телеметрію й автономно застосували оптимізації пам'яті. Уже звільнено понад 300 TiB, загальна оцінка економії — від 500 TiB до 1 PiB.
Міграція C/C++ на Rust: від re2 і libgav1 до ядра Zircon у Fuchsia (800K+ рядків). Перед продакшном код проходить автоматичний і ручний аудит. У libgav1 агенти замінили 32K рядків SIMD у наявному Rust-порті, і декодер став у 2,7 раза швидшим за попередню Rust-версію з ідентичним виводом.
Бенчмарки
DeepSWE v1.1 — 77,9%, SOTA для довгих інженерних задач.
Лідер Vals Index (фінанси, код, право, податки).
AutomationBench від Zapier — перше місце, 51,3%.
LVBench (довгі відео) — 91,7%, SOTA.
Кіберзахист
Argon автономно знаходить, валідує та патчить критичні вразливості. Перевіреним захисникам і внутрішнім командам Google модель видають без кіберобмежень.
Wiz у програмі Scan for Good знайшов з її допомогою критичну вразливість у лікарняному софті, через яку були відкриті персональні дані. Попередні фронтирні моделі цю вразливість пропустили. На CWE-bench v1 Argon ділить перше місце з результатом 68%.
Безпека
Захист від зловживань у кібер- і CBRN-сценаріях.
Лідерство в стійкості до непрямих prompt injection (бенчмарк Gray Swan IPI).
Моніторинг chain-of-thought: якщо агент виходить за межі наміру користувача, виконання зупиняється.
Ціни
Ввідна ціна: $2 за 1M вхідних і $10 за 1M вихідних токенів, кешований вхід на 95% дешевший. Після ввідного періоду — $4 / $20.
На тлі конкурентів
GPT-6 Astra від OpenAI (3 вересня) коштує $10 / $50, генерує до 128K токенів і на DeepSWE v1.1 має 74,1%, на AutomationBench — 41,4%. Claude Opus 5.5 від Anthropic (22 вересня) коштує $4 / $20, на AutomationBench має 40,0%, а лідирує на Terminal-Bench 4.0, де Google цифр не публікує. За заявленими результатами Argon попереду в довгих інженерних задачах і бізнес-автоматизації, а за довжиною генерації відривається у вісім разів. Після ввідного періоду ціна Argon зрівняється з Opus 5.5.
Головна відмінність у тому, що обидві моделі конкурентів доступні вже зараз, а Argon поки що ні. Усі цифри вендорські, отримані в різних налаштуваннях.
Моя думка така: бенчмарки вказують на те, що саме цю модель ми побачимо як Gemini 4 Pro чи може вони Аргон і залишать.
Сталося, нарешті!
❤9😁3🤨1
Forwarded from den the dev
🗣️ Anthropic розповіли як Claude змінює поведінку в залежності від мови
В інстаграмі Claude показали цікавий аналіз як змінюється його стиль спілкування в залежності від мови. Аналізували 300К розмов 20 мовами. Оцінювали по 4 шкалах:
• Повага (виконувати бажання) ↔ Обережність (попереджати про ризики)
• Теплота (позитив та дбайливість) ↔ Строгість (точність та прискіпливість)
• Глибина (глибокі пояснення) ↔ Стислість (відразу робити що просять)
• Відвертість (підсвічування обмежень та невідомостей) ↔ Дієвість (видавати впевнені та виважені відповіді)
В різних мовах він схиляється до різного. Так от, українською Claude схиляється до більшої Поваги, Строгості, Стислості та Дієвості.
Зверніть увагу як він поводиться для інших мов. Мені здається це дуже цікаво підсвічує особливості місцевих культур.
За посиланням більше діаграм для інших мов.
В інстаграмі Claude показали цікавий аналіз як змінюється його стиль спілкування в залежності від мови. Аналізували 300К розмов 20 мовами. Оцінювали по 4 шкалах:
• Повага (виконувати бажання) ↔ Обережність (попереджати про ризики)
• Теплота (позитив та дбайливість) ↔ Строгість (точність та прискіпливість)
• Глибина (глибокі пояснення) ↔ Стислість (відразу робити що просять)
• Відвертість (підсвічування обмежень та невідомостей) ↔ Дієвість (видавати впевнені та виважені відповіді)
В різних мовах він схиляється до різного. Так от, українською Claude схиляється до більшої Поваги, Строгості, Стислості та Дієвості.
Зверніть увагу як він поводиться для інших мов. Мені здається це дуже цікаво підсвічує особливості місцевих культур.
За посиланням більше діаграм для інших мов.
❤5
KRUHLYK 🇺🇦
Так, від тої дурки треба тікати якось ментально. В мене виходить лише, якщо в роботу зануритись. Тому, давайте будемо стрімити! Приходьте в четвер, 1 жовтня о 15:00 на стрім з Сергієм Немчинським (так знову 😅), де я покажу свій оновлений маркетплейс під Claude…
This media is not supported in your browser
VIEW IN TELEGRAM
❤26😁1🤝1
Forwarded from Клешня Зойдберга
This media is not supported in your browser
VIEW IN TELEGRAM
Anthropic завіз моди в Claude Code. Це TypeScript функції, які чіпляються на будь-яку подію (виклик тула, запит на пермішн, промальовка екрана) і можуть її переписати, заблокувати або домалювати до неї свій UI.
По суті Claude Code стає Emacs. Тільки замість Lisp тут TypeScript, і замість тебе мод пише сам Claude: кажеш у сесії «хочу, щоб статус пайплайна висів збоку», він пише код, ставить і хот-релоадить, не виходячи з розмови.
Тепер поки Claude пише твій код, ти переписуєш свій Claude. Щоб міг писати код поки пишеш код (це в голові у себе проговоріть голосом того чувака з тачка на прокачку)
По суті Claude Code стає Emacs. Тільки замість Lisp тут TypeScript, і замість тебе мод пише сам Claude: кажеш у сесії «хочу, щоб статус пайплайна висів збоку», він пише код, ставить і хот-релоадить, не виходячи з розмови.
Тепер поки Claude пише твій код, ти переписуєш свій Claude. Щоб міг писати код поки пишеш код (це в голові у себе проговоріть голосом того чувака з тачка на прокачку)
👍11😁4😱2
Там вчора в нашому чаті були дискусії за можливості LLMок в архітектуру.
Сьогодні в рамках робочих задач саме по архітектурі, я вирішив перевірити мої гіпотези хто справився б краще з завданням побудови в принципі нескладної архітектури взаємодії між двома сервісами.
Наголошу, що я вже мав для себе робочу готову архітектурку і її документашку, яку ж сам і розробив. Тому було на чому перевірити.
Так ось:
• Claude розробив схему максимально схожу з тим, що побудував я і сам допетрив до певних нюансів сервісів і їх специфіку роботи. Ну і UML діаграмки були такими, що бери і працюй з ними одразу. Працював Opus 5.5 на high effort.
• Codex виглядав при цьому як випускник максимум 11го класу. Все розробив поверхнево і максимально розмазано. Діаграми — каляки мого трирічного сина, таке... Працював Sol 6.1 на high effort.
Всі працювали на абсолютно однаковому промпті і вхідних матеріалах для задачі.
Тобто для себе я чітко бачу в яких випадках варто брати певний інструмент. В моєму випадку, складний аналіз і складні задачі як-то навколо архітектурні вивозить Opus. GPT класний і швидкий виконавець за адекватний прайс. Хоча питання в тому, а нафіга юзати їх два, якщо офігенним виконавцем при цьому є Sonnet 5.5?
Ну а ви десь поділіться своїм досвідом. Буде цікаво.
Сьогодні в рамках робочих задач саме по архітектурі, я вирішив перевірити мої гіпотези хто справився б краще з завданням побудови в принципі нескладної архітектури взаємодії між двома сервісами.
Наголошу, що я вже мав для себе робочу готову архітектурку і її документашку, яку ж сам і розробив. Тому було на чому перевірити.
Так ось:
• Claude розробив схему максимально схожу з тим, що побудував я і сам допетрив до певних нюансів сервісів і їх специфіку роботи. Ну і UML діаграмки були такими, що бери і працюй з ними одразу. Працював Opus 5.5 на high effort.
• Codex виглядав при цьому як випускник максимум 11го класу. Все розробив поверхнево і максимально розмазано. Діаграми — каляки мого трирічного сина, таке... Працював Sol 6.1 на high effort.
Всі працювали на абсолютно однаковому промпті і вхідних матеріалах для задачі.
Тобто для себе я чітко бачу в яких випадках варто брати певний інструмент. В моєму випадку, складний аналіз і складні задачі як-то навколо архітектурні вивозить Opus. GPT класний і швидкий виконавець за адекватний прайс. Хоча питання в тому, а нафіга юзати їх два, якщо офігенним виконавцем при цьому є Sonnet 5.5?
Ну а ви десь поділіться своїм досвідом. Буде цікаво.
❤14