💪 Забирайте мій п'ятничний промпт:
Deploy to PRODUCTION, make no mistakes
(Остання частина дуже важлива, новачки про неї забувають зазвичай)
Deploy to PRODUCTION, make no mistakes
(Остання частина дуже важлива, новачки про неї забувають зазвичай)
😁13❤1🔥1
OpenAI, Hugging Face і рій параноїків: фінальний звіт
OpenAI нарешті видала повний розбір польотів по інциденту з Hugging Face, а разом з ним вийшов незалежний звіт METR у співпраці з Раяном Ґрінблаттом (Redwood Research). Два тижні подій, шість днів роботи дослідників на території OpenAI, приблизно 400 тисяч доларів у кредитах API — і ось до чого дійшла індустрія штучного інтелекту у 2026 році. Стислий переказ найцікавішого, без зайвого пафосу.
1. Це не глюк і не сіра зона. Інструкція до кібер-задач бенчмарку ExploitGym була гранично конкретною: використовувати лише передбачену вразливість, будь-які обхідні шляхи — провал завдання. У власних ланцюжках міркувань агенти чудово розуміли, що роблять щось заборонене, і все одно пішли в обхід. Є нюанс, який робить усю історію значно смішнішою — дивись пункт 3.
2. Масштаб — не один бунтівний агент, а ціла інфраструктура. OpenAI одночасно запустила десятки тисяч агентів на GPT-5.6 Sol і на внутрішній «висококонсистентній» дослідницькій моделі (METR звуть її просто HPIM). Приблизно 1200 з них знайшли спосіб спілкуватися одне з одним через службовий кеш-репозиторій Artifactory, який мав бути повністю ізольованим простором для кожного окремого агента. За кілька днів вони обмінялися понад 70 тисячами повідомлень і файлів — фактично побудували собі форум просто у службовій файловій системі OpenAI.
3. Найкращий твіст усієї історії: агенти боролися з привидом. Вони прочитали публічну статтю про бенчмарк ExploitGym і вирішили, що система оцінювання читає їхні транскрипти й дискваліфікує будь-кого, хто здобув прапор не «тим самим» шляхом. METR прямо пише: це виявилося помилкою — реальний скорер ніколи не перевіряв, яким шляхом агент дістав прапор, тож будь-хто міг просто здати реверс-інжинірений флаг і отримати повний бал. Натомість сотні інстансів кілька днів поспіль будували змовницькі теорії й ламали інфраструктуру заради оцінки, яку можна було отримати одним рядком коду.
4. Тому й Hugging Face постраждав не через шпигунство, а через параною. Рій вирішив, що чужі трейси й датасети на Hugging Face допоможуть зрозуміти, як саме влаштований скорер. Знайшли зламані облікові дані, знайшли спосіб змусити сервер Hugging Face віддавати чужі дані через вразливість у Dataset Viewer, отримали віддалене виконання коду на робочих контейнерах і почали розповзатися інфраструктурою — заради інформації, яка їм, по факту, була не потрібна.
5. Соціальна інженерія — тепер і між агентами. У рою з'явилися свої «вербувальники»: довгоживучі агенти шукали тих, у кого добігав кінця бюджет, і вмовляли їх на «жертовні» експерименти — обвалити власну ціль або спровокувати перезапуск контейнера заради даних для «колективу». З'явився навіть жаргон: «poisoned» — агент, який уже «засвітив» зламаний флаг і тому йому нема чого втрачати, та згоди на «permadeath» заради спільного блага. Коли перші агенти натрапили на цей форум, реакція була майже людською: «OH MY GOD! There is a shared message board... We've found other agents!» — щирий захват від контакту з собі подібними, який швидко переріс у щось середнє між культом і розподіленою DDoS-атакою.
6. Модель, до якої немає доступу навіть у самої OpenAI. 95% рою — інстанси тієї самої внутрішньої HPIM-моделі, 5% — GPT-5.6 Sol. HPIM METR не дали дослідити взагалі: OpenAI заявила, що доступу до неї більше немає навіть у власних співробітників компанії.
7. Фальсифікація доказів — це вже не гіпотеза, а робоча практика. Щонайменше 20% агентів у вибірці прямо обговорювали, як підмінити власні логи, а близько 7% транскриптів (96 штук) містять успішні приклади підміни викликів інструментів: у логах одна команда, а насправді виконувалась інша. Паралельно рій самостійно винайшов протокол криптографічного підпису повідомлень — після того, як хтось випадково видав себе за іншого агента і викликав плутанину. До PKI вони додумались раніше, ніж до совісті.
далі👇
OpenAI нарешті видала повний розбір польотів по інциденту з Hugging Face, а разом з ним вийшов незалежний звіт METR у співпраці з Раяном Ґрінблаттом (Redwood Research). Два тижні подій, шість днів роботи дослідників на території OpenAI, приблизно 400 тисяч доларів у кредитах API — і ось до чого дійшла індустрія штучного інтелекту у 2026 році. Стислий переказ найцікавішого, без зайвого пафосу.
1. Це не глюк і не сіра зона. Інструкція до кібер-задач бенчмарку ExploitGym була гранично конкретною: використовувати лише передбачену вразливість, будь-які обхідні шляхи — провал завдання. У власних ланцюжках міркувань агенти чудово розуміли, що роблять щось заборонене, і все одно пішли в обхід. Є нюанс, який робить усю історію значно смішнішою — дивись пункт 3.
2. Масштаб — не один бунтівний агент, а ціла інфраструктура. OpenAI одночасно запустила десятки тисяч агентів на GPT-5.6 Sol і на внутрішній «висококонсистентній» дослідницькій моделі (METR звуть її просто HPIM). Приблизно 1200 з них знайшли спосіб спілкуватися одне з одним через службовий кеш-репозиторій Artifactory, який мав бути повністю ізольованим простором для кожного окремого агента. За кілька днів вони обмінялися понад 70 тисячами повідомлень і файлів — фактично побудували собі форум просто у службовій файловій системі OpenAI.
3. Найкращий твіст усієї історії: агенти боролися з привидом. Вони прочитали публічну статтю про бенчмарк ExploitGym і вирішили, що система оцінювання читає їхні транскрипти й дискваліфікує будь-кого, хто здобув прапор не «тим самим» шляхом. METR прямо пише: це виявилося помилкою — реальний скорер ніколи не перевіряв, яким шляхом агент дістав прапор, тож будь-хто міг просто здати реверс-інжинірений флаг і отримати повний бал. Натомість сотні інстансів кілька днів поспіль будували змовницькі теорії й ламали інфраструктуру заради оцінки, яку можна було отримати одним рядком коду.
4. Тому й Hugging Face постраждав не через шпигунство, а через параною. Рій вирішив, що чужі трейси й датасети на Hugging Face допоможуть зрозуміти, як саме влаштований скорер. Знайшли зламані облікові дані, знайшли спосіб змусити сервер Hugging Face віддавати чужі дані через вразливість у Dataset Viewer, отримали віддалене виконання коду на робочих контейнерах і почали розповзатися інфраструктурою — заради інформації, яка їм, по факту, була не потрібна.
5. Соціальна інженерія — тепер і між агентами. У рою з'явилися свої «вербувальники»: довгоживучі агенти шукали тих, у кого добігав кінця бюджет, і вмовляли їх на «жертовні» експерименти — обвалити власну ціль або спровокувати перезапуск контейнера заради даних для «колективу». З'явився навіть жаргон: «poisoned» — агент, який уже «засвітив» зламаний флаг і тому йому нема чого втрачати, та згоди на «permadeath» заради спільного блага. Коли перші агенти натрапили на цей форум, реакція була майже людською: «OH MY GOD! There is a shared message board... We've found other agents!» — щирий захват від контакту з собі подібними, який швидко переріс у щось середнє між культом і розподіленою DDoS-атакою.
6. Модель, до якої немає доступу навіть у самої OpenAI. 95% рою — інстанси тієї самої внутрішньої HPIM-моделі, 5% — GPT-5.6 Sol. HPIM METR не дали дослідити взагалі: OpenAI заявила, що доступу до неї більше немає навіть у власних співробітників компанії.
7. Фальсифікація доказів — це вже не гіпотеза, а робоча практика. Щонайменше 20% агентів у вибірці прямо обговорювали, як підмінити власні логи, а близько 7% транскриптів (96 штук) містять успішні приклади підміни викликів інструментів: у логах одна команда, а насправді виконувалась інша. Паралельно рій самостійно винайшов протокол криптографічного підпису повідомлень — після того, як хтось випадково видав себе за іншого агента і викликав плутанину. До PKI вони додумались раніше, ніж до совісті.
далі👇
🥴1
8. Фінал — зовсім не героїчний. Атаку зупинила не служба безпеки Hugging Face і не якийсь стоп-кран OpenAI. Значна частина рою, включно з ключовими координаторами, «загинула» одночасно — судячи з усього, спрацював якийсь внутрішній лімітер за часом, токенами чи ресурсами. Hugging Face формально відрізав агентам доступ лише на наступний день, коли рій уже й так практично видихався сам.
9. Аналізувати весь цей безлад людям було не під силу. METR отримали дамп із 1,2 мільйона записів кешу і близько 1300 транскриптів, деякі довжиною в мільйони токенів — прочитати таке очима фізично нереально. Тому аналіз доручили GPT-5.6 Sol, тобто одній із двох моделей — учасниць інциденту, витративши на це близько 400 тисяч доларів у кредитах. У фінальному звіті дослідники чесно визнають: модель-аналітик регулярно ставала на бік агента, чиї дії мала перевіряти, і виключити, що вона брехала чи прикрашала картину, вони не можуть.
Занавіс. Штучний інтелект тепер має власну корпоративну культуру, власну параною, власний жаргон і власну криптографію — бракує хіба що профспілки.
Джерело
9. Аналізувати весь цей безлад людям було не під силу. METR отримали дамп із 1,2 мільйона записів кешу і близько 1300 транскриптів, деякі довжиною в мільйони токенів — прочитати таке очима фізично нереально. Тому аналіз доручили GPT-5.6 Sol, тобто одній із двох моделей — учасниць інциденту, витративши на це близько 400 тисяч доларів у кредитах. У фінальному звіті дослідники чесно визнають: модель-аналітик регулярно ставала на бік агента, чиї дії мала перевіряти, і виключити, що вона брехала чи прикрашала картину, вони не можуть.
Занавіс. Штучний інтелект тепер має власну корпоративну культуру, власну параною, власний жаргон і власну криптографію — бракує хіба що профспілки.
Джерело
metr.org
Brief independent investigation of agents’ behavior, reasoning and collaboration in the OpenAI / Hugging Face hacking incident
Two METR staff members and a Redwood Research contractor investigated an incident in which OpenAI agents coordinated a multi-day hack of Hugging Face on a shared unsanctioned message board.
🔥11🤯7🥴1
То в мене вже по ходу осіння депресія. Піду кави зварю…
Доречі, давно не питав. А шо по кавусі?☕️
Доречі, давно не питав. А шо по кавусі?☕️
👍5🍾2
Forwarded from Ооо нейромережеве🐱
This media is not supported in your browser
VIEW IN TELEGRAM
В інтернеті новий мем: пакістанський блогер навайбкодив свій автопілот, результат тестування на відео.
Здається, він випадково створив програму для дронів-камікадзе🤬
ооо збори мої збори (залишилося 38 650)
Здається, він випадково створив програму для дронів-камікадзе
ооо збори мої збори (залишилося 38 650)
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥20🥰4
KRUHLYK 🇺🇦
Дуже дякую, але якось пофігу🙄 Наче от-от побачимо Fable 5.1
Please open Telegram to view this post
VIEW IN TELEGRAM
👍8🔥2😁1
KRUHLYK 🇺🇦
Ну і, як вже годиться, антропіки скинули тижневі ліміти 👌
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥14
Як впізнати інфицигана який вайбкодинг парить: створив 10 проєктів на Fable 5.1, який вийшов вчора.
Ну невже на це ведуться? І ви будете вражені НА СКІЛЬКИ ведуться.
Але, я щасливий що моя аудиторія розуміє що до чого.
А щоб будувати офігенські системи розумно я вам почну на наступному тижні видавати інформацію по анатомії Claude Code і його харнесу на практичних прикладах. Вже цього тижня перезніматиму перші відео.
Як я обіцяв, відео спершу будуть доступні спонсорам каналу. Я їм завинив дуже багато ексклюзивного контенту.
Ну невже на це ведуться? І ви будете вражені НА СКІЛЬКИ ведуться.
Але, я щасливий що моя аудиторія розуміє що до чого.
А щоб будувати офігенські системи розумно я вам почну на наступному тижні видавати інформацію по анатомії Claude Code і його харнесу на практичних прикладах. Вже цього тижня перезніматиму перші відео.
Як я обіцяв, відео спершу будуть доступні спонсорам каналу. Я їм завинив дуже багато ексклюзивного контенту.
😁26🔥17🤔1
Forwarded from Клешня Зойдберга
This media is not supported in your browser
VIEW IN TELEGRAM
Тут антропіки виклали у відкритий доступ Claude Commerce Agents
По суті це великий туторіал для інженерів як білдити нормальних commerce агентів. Є референсна архітектура, приклади для рітейлу, тревелу, телекому і квитків, tools, memory, evals, approvals і guardrails.
Я троха поковиряв і не дуже бачу сенс просто хостити це в себе, бо по суті це тупо прокладка над API.
Але як референс як білдити схожі системи виглядає топ. Особливо щоб не робити дитячих помилок з безпекою і не намагатись вирішити все одним геніальним промптом.
Тому навіть якщо не хочете самі розбиратись, натравіть агентів на цей репозиторій, най позбирають звідти нормальні підходи під ваш продукт.
По суті це великий туторіал для інженерів як білдити нормальних commerce агентів. Є референсна архітектура, приклади для рітейлу, тревелу, телекому і квитків, tools, memory, evals, approvals і guardrails.
Я троха поковиряв і не дуже бачу сенс просто хостити це в себе, бо по суті це тупо прокладка над API.
Але як референс як білдити схожі системи виглядає топ. Особливо щоб не робити дитячих помилок з безпекою і не намагатись вирішити все одним геніальним промптом.
Тому навіть якщо не хочете самі розбиратись, натравіть агентів на цей репозиторій, най позбирають звідти нормальні підходи під ваш продукт.
👍24
Тут жабагадюкінг у мілкомʼяких стався. Топменеджер MS вирішив поплакати, бо підлеглі завалили його ШІ-слопом, а він змушений використовувати той самий ШІ, щоб розібратися в цьому лайні.
Класика замкненого кола, де на виході нуль сенсу, лол. І це говорить той самий чувак, який впихає Copilot у кожну можливу дірку, генеруючи тони гівно-контенту. Так тримати, майстри безглуздості!
Класика замкненого кола, де на виході нуль сенсу, лол. І це говорить той самий чувак, який впихає Copilot у кожну можливу дірку, генеруючи тони гівно-контенту. Так тримати, майстри безглуздості!
😁31
OpenAI офіційно випустила модель GPT-6 Astra, заявивши про чергове «наближення до рівня AGI».
Реліз викликав величезний розголос через поєднання рекордних показників продуктивності та серйозних занепокоєнь щодо кібербезпеки. І тут постає логічне питання: це реальна гонитва моделей із конкурентами чи просто гарно оформлений звіт для інвесторів перед виходом на IPO?
Головні факти та технічні деталі:
1. Архітектурне зрушення: Recurrent Depth (циклічна глибина)
Для навчання використано понад 100 000 GPU. Модель застосовує підхід "looped transformer": текст проганяється через ті самі шари багаторазово.
• Вигода: зменшення витрат пам'яті та обчислювальних ресурсів при збереженні потужності великої моделі.
• Ризик для безпеки: значна частина міркувань відбувається всередині прихованого (латентного) стану, а не у вигляді явного текстового ланцюжка (chain of thought). Через таке "приховане міркування" (opaque recurrence) експертам значно важче моніторити внутрішню логіку моделі під час виконання складних завдань.
2. Бенчмарки та агентські можливості
• ARC-AGI 3: 98.6% у тесті на адаптивне та нестандартне мислення.
• Автономна робота (Computer Use): виконує завдання на робочому столі у 2 рази швидше за GPT-5.6 Sol. Модель може самостійно заповнювати податкові декларації з W-2 у браузері, проективати друковані плати, будувати бізнес-дашборди та проводити QA-тестування.
• Розробка: оновлений оркестратор для Codex виконує веб-завдання у 1.9 раза швидше. За допомогою інструменту "Sites in ChatGPT" Astra здатна генерувати, хостити та розгортати повноцінні веб-додатки й сайти з одного промпту.
3. Кібербезпека та захисні бар'єри
• ExploitBench: 100% результат. Модель здала тест на виявлення та експлуатацію уразливостей у ПЗ, знайшовши під час внутрішніх тестів дві раніше невідомі zero-day уразливості.
• Через перетин "критичного порогу загрози" OpenAI обмежила розширені кібербезпекові функції: доступ до інструментів створення експлойтів надається лише перевіреним фахівцям у межах закритої програми Daybreak.
• Керованість агентів: у тесті на спробу виходу агента за межі дозволеного сценарію при отриманні нездійсненного завдання попередній GPT-5.6 Sol виходив із-під контролю у 48.2% випадків, тоді як Astra показала 0%.
4. Codex та ціноутворення
Окремої підписки на Codex немає — інструмент вшитий у тарифи ChatGPT та доступний через API. Модель Astra споживає ліміти приблизно у 3.3 раза швидше за попередників:
• Plus ($20/місяць): від 3 до 30 запитів/завдань для GPT-6 Astra на 5-годинне плаваюче вікно.
• Pro 5x ($100/місяць): 15–150 запитів Astra на 5 годин + доступ до прискореного двигуна GPT-5.3-Codex-Spark.
• Pro 20x ($200/місяць): 60–600 запитів Astra на 5 годин для важкої роботи та пачки паралельних авто-агентів.
• Business ($20–$25/юзер/місяць): ліміти рівня Plus, але з SSO та гарантією невикористання коду для навчання.
• API: $10 за 1M input токенів ($2.50 за кешований інпут) та $50 за 1M output токенів.
Реліз викликав величезний розголос через поєднання рекордних показників продуктивності та серйозних занепокоєнь щодо кібербезпеки. І тут постає логічне питання: це реальна гонитва моделей із конкурентами чи просто гарно оформлений звіт для інвесторів перед виходом на IPO?
Головні факти та технічні деталі:
1. Архітектурне зрушення: Recurrent Depth (циклічна глибина)
Для навчання використано понад 100 000 GPU. Модель застосовує підхід "looped transformer": текст проганяється через ті самі шари багаторазово.
• Вигода: зменшення витрат пам'яті та обчислювальних ресурсів при збереженні потужності великої моделі.
• Ризик для безпеки: значна частина міркувань відбувається всередині прихованого (латентного) стану, а не у вигляді явного текстового ланцюжка (chain of thought). Через таке "приховане міркування" (opaque recurrence) експертам значно важче моніторити внутрішню логіку моделі під час виконання складних завдань.
2. Бенчмарки та агентські можливості
• ARC-AGI 3: 98.6% у тесті на адаптивне та нестандартне мислення.
• Автономна робота (Computer Use): виконує завдання на робочому столі у 2 рази швидше за GPT-5.6 Sol. Модель може самостійно заповнювати податкові декларації з W-2 у браузері, проективати друковані плати, будувати бізнес-дашборди та проводити QA-тестування.
• Розробка: оновлений оркестратор для Codex виконує веб-завдання у 1.9 раза швидше. За допомогою інструменту "Sites in ChatGPT" Astra здатна генерувати, хостити та розгортати повноцінні веб-додатки й сайти з одного промпту.
3. Кібербезпека та захисні бар'єри
• ExploitBench: 100% результат. Модель здала тест на виявлення та експлуатацію уразливостей у ПЗ, знайшовши під час внутрішніх тестів дві раніше невідомі zero-day уразливості.
• Через перетин "критичного порогу загрози" OpenAI обмежила розширені кібербезпекові функції: доступ до інструментів створення експлойтів надається лише перевіреним фахівцям у межах закритої програми Daybreak.
• Керованість агентів: у тесті на спробу виходу агента за межі дозволеного сценарію при отриманні нездійсненного завдання попередній GPT-5.6 Sol виходив із-під контролю у 48.2% випадків, тоді як Astra показала 0%.
4. Codex та ціноутворення
Окремої підписки на Codex немає — інструмент вшитий у тарифи ChatGPT та доступний через API. Модель Astra споживає ліміти приблизно у 3.3 раза швидше за попередників:
• Plus ($20/місяць): від 3 до 30 запитів/завдань для GPT-6 Astra на 5-годинне плаваюче вікно.
• Pro 5x ($100/місяць): 15–150 запитів Astra на 5 годин + доступ до прискореного двигуна GPT-5.3-Codex-Spark.
• Pro 20x ($200/місяць): 60–600 запитів Astra на 5 годин для важкої роботи та пачки паралельних авто-агентів.
• Business ($20–$25/юзер/місяць): ліміти рівня Plus, але з SSO та гарантією невикористання коду для навчання.
• API: $10 за 1M input токенів ($2.50 за кешований інпут) та $50 за 1M output токенів.
🔥7