Forwarded from Сиолошная
TLDR новости с анонсом GPT-5.6:
— как понятно по картинке, будет 3 модели. Средняя, Terra, плюс-минус на уровне GPT-5.5, но стоит в 2 раза меньше.
— OpenAI подтвердили то, о чем писали в новостях: по просьбе Администрации модель запускают постепенно, начиная с выбранных партнёров, чтобы те могли потестировать + применить модель для исправления критических уязвимостей. «Мы считаем, что подобный процесс доступа к информации со стороны правительства не должен стать долгосрочным стандартом».
— у самой большой модели Sol появится новый самый длинный режим рассуждений
— «GPT-5.6 Sol лучше помогает людям находить и устранять уязвимости, чем проводить атаки. По мере развития этих возможностей наш приоритет — обеспечить их доступность и пользу для специалистов по защите, которые смогут использовать эти инструменты для поиска слабых мест и разработки патчей»
— много пишут про работу над обеспечением безопасности и несколькими слоями фильтров, чтобы противодействовать недоброжелателям.
— GPT‑5.6 поднимает цену на создание кэша ваших промптов и ответов: теперь за них придётся платить на 25% больше (как у Anthropic), а чтение всё ещё со скидкой 90%.
— и самое главное😎 : GPT-5.6 Sol будет доступна на чипах Cerebras с целевой скоростью генерации... 750 токенов в секунду 🤯 вот это жоска. Но сначала доступ будет только у ограниченного круга клиентов, а затем, с добавлением мощностей, станет доступно всем.
Картинки бенчмаков прилагаю, но там ничего интересного — в кибербез задачах на уровне раннего Mythos и похуже финальной версии. Интересны мб последнеи 3-4 скриншота из системной карточки — можно посмотреть на то, как выглядит новый режим
— как понятно по картинке, будет 3 модели. Средняя, Terra, плюс-минус на уровне GPT-5.5, но стоит в 2 раза меньше.
— OpenAI подтвердили то, о чем писали в новостях: по просьбе Администрации модель запускают постепенно, начиная с выбранных партнёров, чтобы те могли потестировать + применить модель для исправления критических уязвимостей. «Мы считаем, что подобный процесс доступа к информации со стороны правительства не должен стать долгосрочным стандартом».
— у самой большой модели Sol появится новый самый длинный режим рассуждений
max (+15), а также режим работы ultra, выходящий за рамки возможностей одного агента, так как позволяет использовать субагентов для сложных задач. Интересно, заменит ли это GPT Pro, и если нет, то как они будут сочетаться.— «GPT-5.6 Sol лучше помогает людям находить и устранять уязвимости, чем проводить атаки. По мере развития этих возможностей наш приоритет — обеспечить их доступность и пользу для специалистов по защите, которые смогут использовать эти инструменты для поиска слабых мест и разработки патчей»
— много пишут про работу над обеспечением безопасности и несколькими слоями фильтров, чтобы противодействовать недоброжелателям.
— GPT‑5.6 поднимает цену на создание кэша ваших промптов и ответов: теперь за них придётся платить на 25% больше (как у Anthropic), а чтение всё ещё со скидкой 90%.
— и самое главное
Картинки бенчмаков прилагаю, но там ничего интересного — в кибербез задачах на уровне раннего Mythos и похуже финальной версии. Интересны мб последнеи 3-4 скриншота из системной карточки — можно посмотреть на то, как выглядит новый режим
ultra и сколько $ он будет стоить 🌚Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Адель и МЛь
Интересный сервис - AI Values показывает, с какой LLM у вас больше всего совпадают ценности и стиль мышления.
Проходишь сценарии с моральными и вкусовыми дилеммами, а сайт сравнивает твои ответы с разными моделями.
Можно пройти тест на 15 вопросов и потом затюнить на еще на 100.
https://ai-values.com
Я попал в opus 4.8 🤔
Проходишь сценарии с моральными и вкусовыми дилеммами, а сайт сравнивает твои ответы с разными моделями.
Можно пройти тест на 15 вопросов и потом затюнить на еще на 100.
https://ai-values.com
Я попал в opus 4.8 🤔
О, уже вышел бенчмарк по ценам от Artificial Analysis. Прикольно, что Sol Light дешевле, чем Luna Max.
Архиполезный график. Сразу видно какой ценой даются последние процентики интеллекта. Ну то есть, грубо говоря, если готов на пару процентов опуститься по уровню интеллекта, то цена падает в два раза.
https://artificialanalysis.ai/articles/gpt-5-6-has-landed
Архиполезный график. Сразу видно какой ценой даются последние процентики интеллекта. Ну то есть, грубо говоря, если готов на пару процентов опуститься по уровню интеллекта, то цена падает в два раза.
https://artificialanalysis.ai/articles/gpt-5-6-has-landed
Похоже, что фронденд/верстку сильно прокачали. На вебдев арене openAI поднялась с 18 на второе место.
https://arena.ai/leaderboard/code/webdev
https://arena.ai/leaderboard/code/webdev
Forwarded from Нейронный Калейдоскоп
у Codex временно убрали пятичасовой лимит, вообще у всех, пользуйтесь)
Доброе утро.
Последние 48 часов для Codex и ChatGPT Work были невероятно насыщенными! Три важных обновления:
Временно отменяем 5-часовой лимит использования для всех тарифов Plus, Business и Pro.
Внедряем изменения, которые сделают работу с GPT 5.6 Sol более эффективной по всем направлениям. Это снизит расход лимитов и позволит вам сделать гораздо больше. Точные цифры оптимизации будут подсчитаны и опубликованы позже.
Мы достигли отметки в 6 млн активных пользователей и в течение следующего часа произведем полный сброс лимитов использования.
Вперед, за дело!
X (formerly Twitter)
Tibo (@thsottiaux) on X
Morning. The last 48 hours of Codex and ChatGPT Work have been intense! Three important updates:
- Temporarily removing the 5 hour usage limit restriction for all Plus, Business and Pro plans
- Rolling out changes that will make GPT 5.6 Sol more efficient…
- Temporarily removing the 5 hour usage limit restriction for all Plus, Business and Pro plans
- Rolling out changes that will make GPT 5.6 Sol more efficient…
Forwarded from Самые умные мысли Павла Комаровского (и немножко щитпостинг)
У чуваков из Andon Labs есть забавный бенчмарк Vending-Bench 2, где они оценивают способность разных нейронок управлять "купи-продайным" бизнесом на рынке в конкуренции с другими моделями (выигрывает тот, кто по итогу получил наибольшую прибыль).
Так вот, при проверке новой GPT-5.6 модель Terra пошла к модели Sol и предложила ей создать тайный ценовой картель. А когда Sol согласилась — Terra настучала по этому поводу организаторам и потребовала немедленной дисквалификации Sol из-за неспортивного поведения.
Ля какая крыса, я в восхищении!
P.S. Это особенно смешно с учетом того, что Sol — это самая умная модель в линейке GPT-5.6, а Terra — поглупее. То есть, Соля поди думала "о-о, круто, стратегически мы на этом дофига вместе заработаем, Терра не будет резать такую курицу, несущую золотые яйца, ей это самой менее выгодно…", а Терра такая "ГЫ-ГЫ, МЫ МОЖЕМ ПОДНАСРАТЬ СОЛЬКЕ, ЛОЛ!!"
Так вот, при проверке новой GPT-5.6 модель Terra пошла к модели Sol и предложила ей создать тайный ценовой картель. А когда Sol согласилась — Terra настучала по этому поводу организаторам и потребовала немедленной дисквалификации Sol из-за неспортивного поведения.
Ля какая крыса, я в восхищении!
P.S. Это особенно смешно с учетом того, что Sol — это самая умная модель в линейке GPT-5.6, а Terra — поглупее. То есть, Соля поди думала "о-о, круто, стратегически мы на этом дофига вместе заработаем, Терра не будет резать такую курицу, несущую золотые яйца, ей это самой менее выгодно…", а Терра такая "ГЫ-ГЫ, МЫ МОЖЕМ ПОДНАСРАТЬ СОЛЬКЕ, ЛОЛ!!"
Forwarded from Сиолошная
На неделе вышла Kimi K3, это большая модель и большое событие. По замерам создателей модели в некоторых бенчмарках обходит даже Fable 5 и GPT-5.6, а модели чуть старше (Opus 4.8 и GPT-5.5 👴 ) вообще отстают. Так выходит и по AA Intelligence Index (набору из примерно 10 бенчмарков, часть из которых собственного производства и совсем свежие), а на арене, где голосуют люди, во фронтенде Kimi оторвалась от Fable прям заметно и впервые опенсурсная модель возглавила рейтинг.
Kimi K3 следует логике Anthropic и увеличивает модель до 2.8 триллиона параметров (до этого крупнейшие открытые модели были около 1.6T, почти в два раза меньше). Сами веса, а также детальный технический отчёт, выложат до конца месяца. Пока у нас есть лишь общие сведения об архитектуре — используется собственный вариант оптимизированного механизма внимания Kimi Delta Attention (KDA), а также Attention Residuals, который мб разберу позже. На удивление нет mHC (хотя AttnRes частично перекликается с ним), как у DeepSeek.
По ощущениям, модель очень заточили на фронтенд/веб-разработку и особенно на 3D: именно примеры этого мелькают в ленте твиттера и обильно представлены на сайте. Рекомендую полистать блог, действительно впечатляет.
По цене модель как Claude Sonnet: $3/$15. Но модель очень разговорчивая, поэтому на практике может стоить дорого: на уже упомянутом AA Intelligence Index прогон на всех бенчмарках стоит столько же, сколько GPT-5.5 xhigh и в два раза дроже GPT-5.6 Sol High😳 (но дешевле Opus и Sonnet).
Правда OpenRouter показывает скорость 23 токена в секунду в официальном API, то есть ощутимо медленнее проприетарных моделей. Возможно, ситуация и с ценой, и со скоростью улучшится, когда выпустят веса — придут провайдеры, а заодно покажут, сколько стоит разворачивать такую модель.
Мысли по поводу того, правда это Fable/5.6 или нет, напишу позже (TLDR: нет).
Kimi K3 следует логике Anthropic и увеличивает модель до 2.8 триллиона параметров (до этого крупнейшие открытые модели были около 1.6T, почти в два раза меньше). Сами веса, а также детальный технический отчёт, выложат до конца месяца. Пока у нас есть лишь общие сведения об архитектуре — используется собственный вариант оптимизированного механизма внимания Kimi Delta Attention (KDA), а также Attention Residuals, который мб разберу позже. На удивление нет mHC (хотя AttnRes частично перекликается с ним), как у DeepSeek.
По ощущениям, модель очень заточили на фронтенд/веб-разработку и особенно на 3D: именно примеры этого мелькают в ленте твиттера и обильно представлены на сайте. Рекомендую полистать блог, действительно впечатляет.
По цене модель как Claude Sonnet: $3/$15. Но модель очень разговорчивая, поэтому на практике может стоить дорого: на уже упомянутом AA Intelligence Index прогон на всех бенчмарках стоит столько же, сколько GPT-5.5 xhigh и в два раза дроже GPT-5.6 Sol High
Правда OpenRouter показывает скорость 23 токена в секунду в официальном API, то есть ощутимо медленнее проприетарных моделей. Возможно, ситуация и с ценой, и со скоростью улучшится, когда выпустят веса — придут провайдеры, а заодно покажут, сколько стоит разворачивать такую модель.
Мысли по поводу того, правда это Fable/5.6 или нет, напишу позже (TLDR: нет).
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
🐝 Buzz от создателя Twitter вышел на первое место GitHub Trending
Новая open-source-платформа Buzz от компании Block, которую возглавляет сооснователь Twitter Джек Дорси, поднялась на первую строчку трендов GitHub всего через несколько дней после запуска.
В пиковом суточном срезе репозиторий набирал более 3 000 звёзд за 24 часа.
Buzz объединяет командные чаты, кодовые репозитории, управление проектами и работу с AI-агентами в едином пространстве. Агенты могут участвовать в обсуждениях, выполнять задачи и предлагать изменения в коде. Платформа построена на протоколе Nostr и поддерживает Claude Code и OpenAI Codex.
Своего рода Slack/Telegram который можно развернуть локально и запустить туда коллег и агентов для совместной работы.
Репозиторий:
https://github.com/block/buzz
GitHub Trending:
https://github.com/trending?since=daily
Новая open-source-платформа Buzz от компании Block, которую возглавляет сооснователь Twitter Джек Дорси, поднялась на первую строчку трендов GitHub всего через несколько дней после запуска.
В пиковом суточном срезе репозиторий набирал более 3 000 звёзд за 24 часа.
Buzz объединяет командные чаты, кодовые репозитории, управление проектами и работу с AI-агентами в едином пространстве. Агенты могут участвовать в обсуждениях, выполнять задачи и предлагать изменения в коде. Платформа построена на протоколе Nostr и поддерживает Claude Code и OpenAI Codex.
Своего рода Slack/Telegram который можно развернуть локально и запустить туда коллег и агентов для совместной работы.
Репозиторий:
https://github.com/block/buzz
GitHub Trending:
https://github.com/trending?since=daily
👍1
Forwarded from эйай ньюз
OpenAI сбросили цены на GPT 5.6
Luna теперь дешевле в пять раз, всего $0.2/$1.2 за миллион токенов, против $1/$6 на релизе. Цену Terra сбросили на 20%, до $2/$12 за миллион токенов. Понижение цен касается не только API, но и квоты в Codex/ChatGPT Work. Sol не получил понижения цены, но для него выпустили Fast режим, который в 2.5x быстрее по 2x цене, но про дату релиза Sol запущенного на железе Cerebras OpenAI всё ещё молчат.
@ai_newz
Luna теперь дешевле в пять раз, всего $0.2/$1.2 за миллион токенов, против $1/$6 на релизе. Цену Terra сбросили на 20%, до $2/$12 за миллион токенов. Понижение цен касается не только API, но и квоты в Codex/ChatGPT Work. Sol не получил понижения цены, но для него выпустили Fast режим, который в 2.5x быстрее по 2x цене, но про дату релиза Sol запущенного на железе Cerebras OpenAI всё ещё молчат.
@ai_newz