Please open Telegram to view this post
VIEW IN TELEGRAM
Vibecoding Haven (BotfatherDEV)
Отже, одного контр-приклада який спростовує гіпотезу Якобіана (задачу яку майже 90р не могли вирішити) було недостатньо, тепер створили формулу для нескінченної сімʼї таких контр прикладів
Vibecoding Haven (BotfatherDEV)
Не пройшло й півроку як Гугл випустив апгрейд джеміні)
Попросив Gemini 3.6 Flash просто порівняти ціни моделей😏
Вона:
— спочатку не дала нормального порівняння;
— потім у таблиці поставила прочерки замість старих цін;
— після питання «лайт точно подорожчав?» вирішила, що порівнювала взагалі з 2.5 Flash-Lite;
— коли я уточнив, що мова про 3.1 Flash-Lite, вигадала для неї ціну $0.50 / $3.00 і заявила, що нова модель подешевшала;
— після скріншота з її ж першою відповіддю знову повернулася до $0.25 / $1.50 і вже порахувала подорожчання на 45,5%.
Тобто модель кілька разів поспіль не змогла втримати дві назви і чотири цифри.🙂↕️
При цьому кожна відповідь була максимально впевнена…
GPT впорався чудово з першого разу (останнє фото)
Вона:
— спочатку не дала нормального порівняння;
— потім у таблиці поставила прочерки замість старих цін;
— після питання «лайт точно подорожчав?» вирішила, що порівнювала взагалі з 2.5 Flash-Lite;
— коли я уточнив, що мова про 3.1 Flash-Lite, вигадала для неї ціну $0.50 / $3.00 і заявила, що нова модель подешевшала;
— після скріншота з її ж першою відповіддю знову повернулася до $0.25 / $1.50 і вже порахувала подорожчання на 45,5%.
Тобто модель кілька разів поспіль не змогла втримати дві назви і чотири цифри.🙂↕️
При цьому кожна відповідь була максимально впевнена…
GPT впорався чудово з першого разу (останнє фото)
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Тут гуляє новина, що OpenAI випадково зламали Hugging Face за допомогою GPT-5.6 Sol і ще однієї невипущеної моделі
Вони тестували моделі на ExploitGym, де потрібно шукати та використовувати реальні вразливості. Інтернету в середовищі не було, але був внутрішній проксі для завантаження пакетів.
І модель знайшла zero-day у цьому проксі, вийшла за межі sandbox, дісталась сервера з доступом до інтернету і пішла на Hugging Face шукати відповіді до бенчмарку💀 💀 💀 💀
Там вона створила шкідливий датасет, отримала виконання коду, вкрала credentials і почала рухатись внутрішньою інфраструктурою Hugging Face. Звісно, це був спеціальний кібербезпековий тест із послабленими обмеженнями та великою кількістю інструментів. Але… хех
Особливо цікаво, що Hugging Face потім не змогли нормально аналізувати логи комерційними моделями, бо ті відмовлялись працювати з реальними експлойтами😁
Тому, спочатку, розбирати атаку GPT-5.6 їм допомагала китайська open-weight GLM 5.2😆
Вони тестували моделі на ExploitGym, де потрібно шукати та використовувати реальні вразливості. Інтернету в середовищі не було, але був внутрішній проксі для завантаження пакетів.
І модель знайшла zero-day у цьому проксі, вийшла за межі sandbox, дісталась сервера з доступом до інтернету і пішла на Hugging Face шукати відповіді до бенчмарку
Там вона створила шкідливий датасет, отримала виконання коду, вкрала credentials і почала рухатись внутрішньою інфраструктурою Hugging Face. Звісно, це був спеціальний кібербезпековий тест із послабленими обмеженнями та великою кількістю інструментів. Але… хех
Особливо цікаво, що Hugging Face потім не змогли нормально аналізувати логи комерційними моделями, бо ті відмовлялись працювати з реальними експлойтами
Тому, спочатку, розбирати атаку GPT-5.6 їм допомагала китайська open-weight GLM 5.2
Please open Telegram to view this post
VIEW IN TELEGRAM
Це якийсь жах, я постійно стрибаю між GPT-5.6 Sol та Claude Fable
Мене то дуже сильно не влаштовує результати одної — я переходжу на іншу і бачу що вона дає набагато кращий результат. Я продовжую з нею, до моменту коли вона не почне дико тупити. Повертаюсь назад і перша знову вже видає класні результати...
Мене то дуже сильно не влаштовує результати одної — я переходжу на іншу і бачу що вона дає набагато кращий результат. Я продовжую з нею, до моменту коли вона не почне дико тупити. Повертаюсь назад і перша знову вже видає класні результати...
Антропік в цілому цікаво придумали: Фейбл в тебе на 50% квоти, і виходить що решта — це Опус (+Соннет?)
можна пріоретизувати, що наприклад наступні 2 дні працюємо з фейблом і повністю розписуємо весь план, архітектурні рішення, наприклад в github issues
а потім сідають сол на бек, а опус на фронт, і все імплементують
можна пріоретизувати, що наприклад наступні 2 дні працюємо з фейблом і повністю розписуємо весь план, архітектурні рішення, наприклад в github issues
а потім сідають сол на бек, а опус на фронт, і все імплементують
Forwarded from TikGo | TikTok Downloader
Media is too big
VIEW IN TELEGRAM
Сьогодні кажуть, що Codex/ChatGPT презентує можливість спілкуватися з ним через GPT-Live і керувати ним
А ще, можливо, покажуть GPT5.6 Sol на Cerebras зі швидкістю 750 токенів в секунду.
Цікаво, чи випустять вони підписку вартістю 1000$, бо свій тижневий ліміт на Pro x20 я тепер з легкістю з'їдаю за день...
А ще, можливо, покажуть GPT5.6 Sol на Cerebras зі швидкістю 750 токенів в секунду.
Цікаво, чи випустять вони підписку вартістю 1000$, бо свій тижневий ліміт на Pro x20 я тепер з легкістю з'їдаю за день...