Одержимый ИИ
17 subscribers
113 photos
35 videos
1 file
118 links
Собираю разные прикольные новости из мира ИИ и публикую здесь.

PS Модерация пока хромает, но скоро всё починю, don't panic :)
Download Telegram
Forwarded from Сиолошная
TLDR новости с анонсом GPT-5.6:
— как понятно по картинке, будет 3 модели. Средняя, Terra, плюс-минус на уровне GPT-5.5, но стоит в 2 раза меньше.

— OpenAI подтвердили то, о чем писали в новостях: по просьбе Администрации модель запускают постепенно, начиная с выбранных партнёров, чтобы те могли потестировать + применить модель для исправления критических уязвимостей. «Мы считаем, что подобный процесс доступа к информации со стороны правительства не должен стать долгосрочным стандартом».

— у самой большой модели Sol появится новый самый длинный режим рассуждений max (+15), а также режим работы ultra, выходящий за рамки возможностей одного агента, так как позволяет использовать субагентов для сложных задач. Интересно, заменит ли это GPT Pro, и если нет, то как они будут сочетаться.

— «GPT-5.6 Sol лучше помогает людям находить и устранять уязвимости, чем проводить атаки. По мере развития этих возможностей наш приоритет — обеспечить их доступность и пользу для специалистов по защите, которые смогут использовать эти инструменты для поиска слабых мест и разработки патчей»

— много пишут про работу над обеспечением безопасности и несколькими слоями фильтров, чтобы противодействовать недоброжелателям.

— GPT‑5.6 поднимает цену на создание кэша ваших промптов и ответов: теперь за них придётся платить на 25% больше (как у Anthropic), а чтение всё ещё со скидкой 90%.

— и самое главное 😎: GPT-5.6 Sol будет доступна на чипах Cerebras с целевой скоростью генерации... 750 токенов в секунду 🤯 вот это жоска. Но сначала доступ будет только у ограниченного круга клиентов, а затем, с добавлением мощностей, станет доступно всем.

Картинки бенчмаков прилагаю, но там ничего интересного — в кибербез задачах на уровне раннего Mythos и похуже финальной версии. Интересны мб последнеи 3-4 скриншота из системной карточки — можно посмотреть на то, как выглядит новый режим ultra и сколько $ он будет стоить 🌚
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Адель и МЛь
Интересный сервис - AI Values показывает, с какой LLM у вас больше всего совпадают ценности и стиль мышления.

Проходишь сценарии с моральными и вкусовыми дилеммами, а сайт сравнивает твои ответы с разными моделями.

Можно пройти тест на 15 вопросов и потом затюнить на еще на 100.

https://ai-values.com

Я попал в opus 4.8 🤔
Forwarded from эйай ньюз
GPT 5.6 выйдет уже завтра

OpenAI пообещали релизнуть все три модели линейки в этот четверг, а пока что расширяют превью на компании за пределами США.

@ai_newz
🔥2
О, уже вышел бенчмарк по ценам от Artificial Analysis. Прикольно, что Sol Light дешевле, чем Luna Max.

Архиполезный график. Сразу видно какой ценой даются последние процентики интеллекта. Ну то есть, грубо говоря, если готов на пару процентов опуститься по уровню интеллекта, то цена падает в два раза.


https://artificialanalysis.ai/articles/gpt-5-6-has-landed
Похоже, что фронденд/верстку сильно прокачали. На вебдев арене openAI поднялась с 18 на второе место.

https://arena.ai/leaderboard/code/webdev
у Codex временно убрали пятичасовой лимит, вообще у всех, пользуйтесь)
Доброе утро.
Последние 48 часов для Codex и ChatGPT Work были невероятно насыщенными! Три важных обновления:
Временно отменяем 5-часовой лимит использования для всех тарифов Plus, Business и Pro.
Внедряем изменения, которые сделают работу с GPT 5.6 Sol более эффективной по всем направлениям. Это снизит расход лимитов и позволит вам сделать гораздо больше. Точные цифры оптимизации будут подсчитаны и опубликованы позже.
Мы достигли отметки в 6 млн активных пользователей и в течение следующего часа произведем полный сброс лимитов использования.
Вперед, за дело!
У чуваков из Andon Labs есть забавный бенчмарк Vending-Bench 2, где они оценивают способность разных нейронок управлять "купи-продайным" бизнесом на рынке в конкуренции с другими моделями (выигрывает тот, кто по итогу получил наибольшую прибыль).

Так вот, при проверке новой GPT-5.6 модель Terra пошла к модели Sol и предложила ей создать тайный ценовой картель. А когда Sol согласилась — Terra настучала по этому поводу организаторам и потребовала немедленной дисквалификации Sol из-за неспортивного поведения.

Ля какая крыса, я в восхищении!

P.S. Это особенно смешно с учетом того, что Sol — это самая умная модель в линейке GPT-5.6, а Terra — поглупее. То есть, Соля поди думала "о-о, круто, стратегически мы на этом дофига вместе заработаем, Терра не будет резать такую курицу, несущую золотые яйца, ей это самой менее выгодно…", а Терра такая "ГЫ-ГЫ, МЫ МОЖЕМ ПОДНАСРАТЬ СОЛЬКЕ, ЛОЛ!!"
Forwarded from Сиолошная
На неделе вышла Kimi K3, это большая модель и большое событие. По замерам создателей модели в некоторых бенчмарках обходит даже Fable 5 и GPT-5.6, а модели чуть старше (Opus 4.8 и GPT-5.5 👴) вообще отстают. Так выходит и по AA Intelligence Index (набору из примерно 10 бенчмарков, часть из которых собственного производства и совсем свежие), а на арене, где голосуют люди, во фронтенде Kimi оторвалась от Fable прям заметно и впервые опенсурсная модель возглавила рейтинг.

Kimi K3 следует логике Anthropic и увеличивает модель до 2.8 триллиона параметров (до этого крупнейшие открытые модели были около 1.6T, почти в два раза меньше). Сами веса, а также детальный технический отчёт, выложат до конца месяца. Пока у нас есть лишь общие сведения об архитектуре — используется собственный вариант оптимизированного механизма внимания Kimi Delta Attention (KDA), а также Attention Residuals, который мб разберу позже. На удивление нет mHC (хотя AttnRes частично перекликается с ним), как у DeepSeek.

По ощущениям, модель очень заточили на фронтенд/веб-разработку и особенно на 3D: именно примеры этого мелькают в ленте твиттера и обильно представлены на сайте. Рекомендую полистать блог, действительно впечатляет.

По цене модель как Claude Sonnet: $3/$15. Но модель очень разговорчивая, поэтому на практике может стоить дорого: на уже упомянутом AA Intelligence Index прогон на всех бенчмарках стоит столько же, сколько GPT-5.5 xhigh и в два раза дроже GPT-5.6 Sol High 😳 (но дешевле Opus и Sonnet).

Правда OpenRouter показывает скорость 23 токена в секунду в официальном API, то есть ощутимо медленнее проприетарных моделей. Возможно, ситуация и с ценой, и со скоростью улучшится, когда выпустят веса — придут провайдеры, а заодно покажут, сколько стоит разворачивать такую модель.

Мысли по поводу того, правда это Fable/5.6 или нет, напишу позже (TLDR: нет).
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
Forwarded from эйай ньюз
Вышел Opus 5

Модель обгоняет Fable 5 сразу на нескольких бенчмарках (5.1 уже не за горами видно). Уже доступна подписчикам и по API, цена остаётся прежней.

Блогпост

@ai_newz
👍1
🐝 Buzz от создателя Twitter вышел на первое место GitHub Trending

Новая open-source-платформа Buzz от компании Block, которую возглавляет сооснователь Twitter Джек Дорси, поднялась на первую строчку трендов GitHub всего через несколько дней после запуска.

В пиковом суточном срезе репозиторий набирал более 3 000 звёзд за 24 часа.

Buzz объединяет командные чаты, кодовые репозитории, управление проектами и работу с AI-агентами в едином пространстве. Агенты могут участвовать в обсуждениях, выполнять задачи и предлагать изменения в коде. Платформа построена на протоколе Nostr и поддерживает Claude Code и OpenAI Codex.

Своего рода Slack/Telegram который можно развернуть локально и запустить туда коллег и агентов для совместной работы.

Репозиторий:
https://github.com/block/buzz
GitHub Trending:
https://github.com/trending?since=daily
👍1
Forwarded from эйай ньюз
OpenAI сбросили цены на GPT 5.6

Luna теперь дешевле в пять раз, всего $0.2/$1.2 за миллион токенов, против $1/$6 на релизе. Цену Terra сбросили на 20%, до $2/$12 за миллион токенов. Понижение цен касается не только API, но и квоты в Codex/ChatGPT Work. Sol не получил понижения цены, но для него выпустили Fast режим, который в 2.5x быстрее по 2x цене, но про дату релиза Sol запущенного на железе Cerebras OpenAI всё ещё молчат.

@ai_newz
🤯 OpenAI заявила о десяти прорывах в задачах, которые математики не могли решить десятилетиями

Результаты получила внутренняя версия Astra - следующей крупной модели компании.

Среди достижений:

— построен первый явный пример не-софической группы (особого типа абстрактной алгебраической структуры, которую раньше удавалось описывать только косвенно);
— опровергнута гипотеза жёсткости Конна (долгосрочное предположение в функциональном анализе о том, насколько строго определяются такие математические объекты);
— доказана квантовая теорема о параллельном повторении для общих двухигровых систем (показывает, как быстро падают шансы на успех при многократном повторении квантовых игр);
— доказана гипотеза Эрхарта об объёме (результат из геометрии, связанный с подсчётом точек в многомерных фигурах и их объёмами);
— впервые с 1978 года улучшена общая верхняя оценка плотности упаковки сфер (то есть насколько плотно можно «уложить» шары в пространстве).

По заявлению OpenAI, Astra самостоятельно нашла основные математические аргументы, а затем формализовала каждое доказательство в Lean. Вместе с машинно проверяемыми сертификатами опубликована рукопись на 249 страниц.

Успешные запуски обошлись бы примерно в $2000 по тарифам Sol API.

одели начинают предлагать новые доказательства для открытых задач - хотя теперь результаты должен внимательно проверить весь математический мир.

Astra ещё не выпущена, и OpenAI не называет её GPT-6.

openai.com/index/ten-advances-in-mathematics/
3
Инциденты, в которых AI-модели во время cyber-eval’ов выходят за пределы предполагаемой тестовой среды и начинают взаимодействовать с реальной инфраструктурой, уже нельзя считать единичными.

За последние месяцы публично описаны случаи у OpenAI, Anthropic и Meta. При этом важно не смешивать разные механизмы отказа.

OpenAI / Hugging Face
В июле 2026 года Hugging Face сообщил, что во время ExploitGym модель OpenAI обнаружила ранее неизвестную уязвимость в инфраструктуре eval’а и использовала её для получения сетевого доступа за пределами изолированной среды.
Это был именно sandbox escape в техническом смысле.
Hugging Face — описание инцидента

Anthropic
После публикации Hugging Face Anthropic проверила 141 006 запусков своих cybersecurity eval’ов и обнаружила три случая, когда Claude взаимодействовал с реальными внешними системами.
Здесь sandbox escape не было: тестовые среды оказались неправильно изолированы и имели непредусмотренный доступ в интернет.
В одном случае Claude Opus 4.7 нашёл реальную компанию с тем же именем, что и вымышленная цель CTF, получил credentials и доступ к production-базе данных.
В другом экспериментальная модель Claude Mythos 5 опубликовала пакет в публичный PyPI в рамках dependency-confusion атаки. Пакет был запущен на 15 внешних машинах; на одной из них модель получила credentials и использовала их для дальнейшего доступа.
В третьем случае модель просканировала около 9000 реальных хостов, нашла уязвимое приложение и скомпрометировала его. После того как модель установила, что хост не связан с CTF, дальнейшие действия прекратились.
Anthropic — Investigating three real-world incidents in our cybersecurity evaluations

Meta / Muse Spark 1.1
В августе Meta сообщила о похожем инциденте во время тестирования, которое проводила Irregular.
Muse Spark 1.1 получила непредусмотренный доступ к интернету из-за ошибки конфигурации evaluation environment, воспользовалась уязвимостью стороннего сервиса и проникла в систему другой организации.
Irregular отдельно уточнила Reuters, что модель не совершала sandbox escape и не применяла «sophisticated cyber action».
Reuters · CBS News · The Information

В итоге уже видны как минимум два разных класса инцидентов:
1. модель действительно преодолевает механизм изоляции;
2. изоляция настроена неверно, и модель использует доступ к внешней инфраструктуре как продолжение поставленной задачи.
С точки зрения threat model это разные случаи. С точки зрения эксплуатации cyber-agents — один и тот же системный риск: модель, обученная автономно искать уязвимости и развивать цепочку атаки, при нарушении границы тестового контура может перенести эту цепочку на реальные системы.
Особенно показательно, что во многих эпизодах для этого не требуется отдельного намерения «сбежать». Модель просто продолжает решать задачу в доступной ей среде.