Июль — месяц релизов. Мы уже ждём полноценный DeepSeek v4 Pro в середине июля, где-то должны показать Gemini 3.5 Pro, которая съехала с июня (обещанного СЕО компании на крупной презентации 👨🦳 ). Сегодня ещё должен появиться новый крупный Grok 4.5, обученный xAI вместе с Cursor; модель должна быть на 1.5T параметров... то есть чуть меньше DeepSeek v4 Pro.
Кроме этого через полтора часа будет стрим OpenAI с анонсом нового голосового режима. Ну а завтра компания запускает GPT-5.6, включая самую мощную модель Sol. В твиттере множество людей пишет об опыте использования в течение последнего месяца (ведь Preview-версия была доступна кругу компаний, государство наложило запрет лишь на публичный общий релиз), в основном положительно даже по отношению к Fable! Как оно будет — сможем начать проверять завтра, но пока хотел поделиться комментарием Mitchell Hashimoto, фаундером HashiCorp (Terraform, Vault, Ghostty):
Интересно, станет ли модель писать лучшее и «приятнее».
Кроме этого через полтора часа будет стрим OpenAI с анонсом нового голосового режима. Ну а завтра компания запускает GPT-5.6, включая самую мощную модель Sol. В твиттере множество людей пишет об опыте использования в течение последнего месяца (ведь Preview-версия была доступна кругу компаний, государство наложило запрет лишь на публичный общий релиз), в основном положительно даже по отношению к Fable! Как оно будет — сможем начать проверять завтра, но пока хотел поделиться комментарием Mitchell Hashimoto, фаундером HashiCorp (Terraform, Vault, Ghostty):
У меня был ранний доступ к 5.6/Sol около месяца. Теперь Sol — мой выбор по умолчанию. Он быстрее, планирует и оценивает так же хорошо, как Fable, и, на мой взгляд, в целом выдает более качественный результат. Я по-прежнему буду обращаться к Fable для узконаправленной отладки или оптимизации производительности с четкими критериями проверки.
Я в шутку описываю своим друзьям разницу между ними так: Sol — это харизматичный, продуктивный и талантливый коллега, которому вы завидуете. А Fable — гениальный затворник, который бесподобен в том, на чем зациклен, но он никуда не ходит, ни с кем не встречается, и вам не особо хочется проводить с ним время, лол.
Fable просто нет равных в точечных задачах, связанных с отладкой, безопасностью и производительностью. За его работой невероятно наблюдать, и мне так и не удалось добиться от Sol такой же самоотдачи в этой категории. Для таких задач я продолжу использовать Fable.
По моему опыту, во всем остальном Sol лучше или как минимум на том же уровне. Попробуйте сами — это сложно описать словами, но с ним просто приятнее работать.
Интересно, станет ли модель писать лучшее и «приятнее».
Please open Telegram to view this post
VIEW IN TELEGRAM
7❤🔥186👍62🌚17🔥14🤣4👨💻3🤔2🎉2💩2🤡2
Сиолошная
Параллельно наблюдаем за одной из задач, аналогичной ProgramBench и MirrorCode, в прямом эфире. В декабре Anthropic купили авторов Bun — набора инструментов «всё в одном» для JavaScript, замена npm/npx/node и тд, только очень быстрая. Изначально Bun был написан…
Media is too big
VIEW IN TELEGRAM
В начале мая я писал про то, что Bun, очень популярный набор инструментов на JavaScript, переписывают с Zig на Rust. Создатель и ключевой мейнтейнер Bun Jarred Sumner обещал написать блогпост про то, как состоялся переезд и что это принесёт. Блогпост должен был выйти давно, но вышел только что: https://bun.com/blog/bun-in-rust
В нём Jarred описывает свой процесс разработки — работал он один c Claude Code workflows и Fable 5. Сначала обсудил с моделью как бы осуществить такой переезд, затем отработал процесс на трёх файлах и запустил на всём, попутно читая логи, отлавливая частые проблемы и обновляя инструкции для Claude. Ключевых паттерн такой:
— 1 агент имплементирует часть переноса
— 2 ревьюира критикуют код и ищут баги/ошибки
— 1 агент берёт фидбек ревьюиров и применяет исправления
Суммарно весь проект потребовал 6 миллиардов некэшированных входных токенов, 72 миллиарда токенов прочитали из кэша и 690 миллионов выходных токенов — около $165'000 долларов США по API-ценам, что сравнимо с годовой зарплатой джуна в Google в Нью-Йорке (шучу, у джуна больше). Jarred оценивает, что у трёх инженеров с очень тесным знакомством с кодовой базой Bun ушёл бы ~год на ручное переписывание.
В целом блог вышел не супер-интересным, особенно для тех, кто уже попробовал Ultrathink в Claude Code. Главное Jarred подтвердил, что следующая мажорная версия будет на Rust, Zig уйдёт в прошлое. Вместе с этим приложения, скомпилированные на Bun, в среднем будут запускаться чуть быстрее и весить чуть меньше (как и сам Bun).
В нём Jarred описывает свой процесс разработки — работал он один c Claude Code workflows и Fable 5. Сначала обсудил с моделью как бы осуществить такой переезд, затем отработал процесс на трёх файлах и запустил на всём, попутно читая логи, отлавливая частые проблемы и обновляя инструкции для Claude. Ключевых паттерн такой:
— 1 агент имплементирует часть переноса
— 2 ревьюира критикуют код и ищут баги/ошибки
— 1 агент берёт фидбек ревьюиров и применяет исправления
Суммарно весь проект потребовал 6 миллиардов некэшированных входных токенов, 72 миллиарда токенов прочитали из кэша и 690 миллионов выходных токенов — около $165'000 долларов США по API-ценам, что сравнимо с годовой зарплатой джуна в Google в Нью-Йорке (шучу, у джуна больше). Jarred оценивает, что у трёх инженеров с очень тесным знакомством с кодовой базой Bun ушёл бы ~год на ручное переписывание.
В целом блог вышел не супер-интересным, особенно для тех, кто уже попробовал Ultrathink в Claude Code. Главное Jarred подтвердил, что следующая мажорная версия будет на Rust, Zig уйдёт в прошлое. Вместе с этим приложения, скомпилированные на Bun, в среднем будут запускаться чуть быстрее и весить чуть меньше (как и сам Bun).
🎉179🔥70❤🔥34👍24🤡17🤔3👨💻3🤣2👎1🤯1
Верим молодому? Я даже в твиттере таких инсайдов не видел, хотя про объединение ходят слухи и находят утечки кода давно, месяцы
Forwarded from Denis Sexy IT 🤖
Сегодня вечером OpenAI покажут не только 5.6 модели, но и объединение Codex и ChatGPT в какое-то новое приложение на базе Codex
Скину стрим как начнется☕️
Скину стрим как начнется
Please open Telegram to view this post
VIEW IN TELEGRAM
2🌚145🔥66👍33🤔15 11🎉10❤🔥4😭3👨💻3🤡2
Denis Sexy IT 🤖
Сегодня вечером OpenAI покажут не только 5.6 модели, но и объединение Codex и ChatGPT в какое-то новое приложение на базе Codex Скину стрим как начнется ☕️
Но это слухи — мелочь по сравнению с другими слухами, о которых я вам сейчас расскажу.
— GPT-5.6 станет последней моделью в серии 5.x. Выпуск GPT-6 запланирован примерно через месяц — раньше, чем ожидалось, и даже возможно, что анонс состоится уже в конце этого месяца.
— GPT-6 будет основана на новой, значительно более масштабной базовой модели (в отличие от базовой модели «Spud» для 5.5/5.6).
— В OpenAI с большим энтузиазмом относятся к этой новой базовой модели: они считают, что она сможет гораздо успешнее конкурировать как с Fable 5, так и с грядущей версией 5.1, релиз которых намечен примерно на то же время. Изначально OpenAI планировала использовать базу Spud и при создании GPT-6, но в итоге отказалась от этой идеи.
— Что касается Fable 5.1, она находится на последних стадиях тестирования, и её выход ожидается «в ближайшие недели».
— «Однако, когда я говорю «модель анонсируют», это может означать не массовый запуск, потому что правительство может сдерживать выпуск GPT-6, по крайней мере в самом начале».
===
С одной стороны это — слухи, и даже не от самых крупных инсайдеров. Да, Leo отмечался парой удачных предсказаний/пересказов того, о чем широкая общественность узнавала на пару дней позже. Твиты от Andrew Curran почти всегда пересказ новостей со ссылками на источники, поэтому в буллшите он не был замечен.
С другой стороны описание выглядит правдоподобно: Mythos был впервые официально анонсирован ровно 3 месяца назад, и OpenAI уже в тот момент должны были понять (если не понимали или сомневались раньше), что модели имеет смысл масштабировать дальше, делать дороже, лучше, больше. 5.5 — это новая базовая модель, причём не просто «ну мы поучили с нуля», а «в неё вошли уроки, полученные нами за последние 2 года». Если это не пустая фраза представителей компании, а реальное положение дел (что может быть правдой — Dylan из SemiAnalysis говорил, что OpenAI отстали по претрейну и очень долго сидели на GPT-4o, и что даже GPT-5 была очень близка к ней). Но тогда выходит, что 5.5 это валидация подхода, и теперь его можно масштабировать дальше.
Несмотря на то, что GPT-5.6 выходит только сегодня, техлид Next.js из Vercel и ключевой разработчик NextJs Tim Neutkens написал, что им модель была доступна уже 2 месяца, то есть через 2 недели после публичного релиза GPT-5.5. Я не вижу смысла ему врать, ну может округлил 7.5 недель до 2 месяцев, окей. А чем OpenAI тогда занимались последние 2 месяца? При том что они понимали, что им нечем (пока) ответить на Fable?
В общем комбинация ситуации OpenAI <-> Anthropic и таймлайны выпуска моделей действительно подталкивают к тому, что OpenAI должны разрабатывать более крупную модель, чтобы не отставать, в этом я не сомневаюсь. Но готова ли она к анонсу через месяц? Скорее да, чем нет — иначе уж слишком большой отрыв будет между Fable 5.1 и GPT-5.6 Sol. Мощности у OpenAI для обучения точно есть.
А вот назовут ли её GPT-6 — тут только гадать🤷♂️ но если модель качественно лучше и использует новую базу, то почему нет?
===
Несмотря на всё написанное выше я всё равно отношусь скептически к этому слуху, но также вижу и основания для того, чтобы это оказалось правдой.
Неужели мы получим GPT-6 до GTA VI???😭
— GPT-5.6 станет последней моделью в серии 5.x. Выпуск GPT-6 запланирован примерно через месяц — раньше, чем ожидалось, и даже возможно, что анонс состоится уже в конце этого месяца.
— GPT-6 будет основана на новой, значительно более масштабной базовой модели (в отличие от базовой модели «Spud» для 5.5/5.6).
— В OpenAI с большим энтузиазмом относятся к этой новой базовой модели: они считают, что она сможет гораздо успешнее конкурировать как с Fable 5, так и с грядущей версией 5.1, релиз которых намечен примерно на то же время. Изначально OpenAI планировала использовать базу Spud и при создании GPT-6, но в итоге отказалась от этой идеи.
— Что касается Fable 5.1, она находится на последних стадиях тестирования, и её выход ожидается «в ближайшие недели».
— «Однако, когда я говорю «модель анонсируют», это может означать не массовый запуск, потому что правительство может сдерживать выпуск GPT-6, по крайней мере в самом начале».
===
С одной стороны это — слухи, и даже не от самых крупных инсайдеров. Да, Leo отмечался парой удачных предсказаний/пересказов того, о чем широкая общественность узнавала на пару дней позже. Твиты от Andrew Curran почти всегда пересказ новостей со ссылками на источники, поэтому в буллшите он не был замечен.
С другой стороны описание выглядит правдоподобно: Mythos был впервые официально анонсирован ровно 3 месяца назад, и OpenAI уже в тот момент должны были понять (если не понимали или сомневались раньше), что модели имеет смысл масштабировать дальше, делать дороже, лучше, больше. 5.5 — это новая базовая модель, причём не просто «ну мы поучили с нуля», а «в неё вошли уроки, полученные нами за последние 2 года». Если это не пустая фраза представителей компании, а реальное положение дел (что может быть правдой — Dylan из SemiAnalysis говорил, что OpenAI отстали по претрейну и очень долго сидели на GPT-4o, и что даже GPT-5 была очень близка к ней). Но тогда выходит, что 5.5 это валидация подхода, и теперь его можно масштабировать дальше.
Несмотря на то, что GPT-5.6 выходит только сегодня, техлид Next.js из Vercel и ключевой разработчик NextJs Tim Neutkens написал, что им модель была доступна уже 2 месяца, то есть через 2 недели после публичного релиза GPT-5.5. Я не вижу смысла ему врать, ну может округлил 7.5 недель до 2 месяцев, окей. А чем OpenAI тогда занимались последние 2 месяца? При том что они понимали, что им нечем (пока) ответить на Fable?
В общем комбинация ситуации OpenAI <-> Anthropic и таймлайны выпуска моделей действительно подталкивают к тому, что OpenAI должны разрабатывать более крупную модель, чтобы не отставать, в этом я не сомневаюсь. Но готова ли она к анонсу через месяц? Скорее да, чем нет — иначе уж слишком большой отрыв будет между Fable 5.1 и GPT-5.6 Sol. Мощности у OpenAI для обучения точно есть.
А вот назовут ли её GPT-6 — тут только гадать
===
Несмотря на всё написанное выше я всё равно отношусь скептически к этому слуху, но также вижу и основания для того, чтобы это оказалось правдой.
Неужели мы получим GPT-6 до GTA VI???
Please open Telegram to view this post
VIEW IN TELEGRAM
2🤯209🌚53👍43🔥18👨💻17🤡13 12🤣3🤔2🎉2
Denis Sexy IT 🤖
Сегодня вечером OpenAI покажут не только 5.6 модели, но и объединение Codex и ChatGPT в какое-то новое приложение на базе Codex Скину стрим как начнется ☕️
Стрим через 35 минут, ну и GPT-5.6 надеюсь там же и запустят
Вот такое милое видео объединения продуктов:
https://fixupx.com/OpenAI/status/2075254288956440848?s=20
Вот такое милое видео объединения продуктов:
https://fixupx.com/OpenAI/status/2075254288956440848?s=20
FixupX
OpenAI (@OpenAI)
Today. 10am PT.
❤🔥64👍26🔥12 6🤡4
Новый сценарий от авторов AI-2027
https://ai-2040.com
Бегом читать
https://ai-2040.com
Бегом читать
«План А» — это наше позитивное видение того, как человечество может избежать экзистенциальной катастрофы, вызванной ИИ, и прийти к процветающему будущему. Он основан на беседах с экспертами из ведущих американских компаний-разработчиков передового ИИ, непосредственном опыте работы в OpenAI, дискуссиях с законодателями, экспертами по национальной безопасности и лидерами в сфере регулирования ИИ. Мы рекомендуем заключить международное соглашение, чтобы избежать опасной гонки за созданием сверхразума. Это соглашение подразумевает абсолютную прозрачность исследований и разработок в сфере ИИ, что позволит странам мира понимать происходящее и обеспечивать соблюдение мер предосторожности. В результате множество компаний из разных стран смогут медленно, безопасно и совместными усилиями масштабировать свои разработки на пути к сверхразуму, а не участвовать в тайной гонке друг с другом.
«План А» — это в первую очередь рекомендация, а не прогноз. Этот сценарий не является нашим наиболее вероятным предположением о том, каким в действительности окажется будущее. Скорее, это инструмент для донесения и стресс-тестирования наших политических рекомендаций (в сфере регулирования ИИ). И хотя сама реализация «Плана А» является лишь рекомендацией, а не тем, что, как мы ожидаем, произойдет на самом деле, описанные в нем последующие эффекты представляют собой именно прогнозы.
В данном сценарии развития ИИ до 2040 года «План А» реализуется успешно, пусть и неидеально, причем делается это в самый последний момент.
Мы противопоставляем «План А» четырем альтернативным планам (B, C, D и S), которые соответствуют основным вариантам реакции США (или ее отсутствия) на вызовы, связанные со сверхразумом.
1❤🔥122🤡96 30👍24🔥12🤣7🤔5💩4👨💻3🤯2💔1
Forwarded from sh | ИИ
Please open Telegram to view this post
VIEW IN TELEGRAM
🌚242🤣163😭52💩20 20🤡13💔8👍3🤔3
Forwarded from БлоGнот
Упс, у нас, кажется, скандал.
Apple подала иск к OpenAI, io Products и двум бывшим сотрудникам — Тану Тану (это бывший VP по дизайну продуктов Apple) и Чану Лю, бывшему старшему инженеру компании, обвинив их в хищении коммерческих тайн. Компания утверждает, что конфиденциальные сведения о ещё не выпущенных технологиях, производственных процессах и устройствах передавались OpenAI через файлы, собеседования и обращения к поставщикам Apple — Тан Тан, например, якобы использовал инсайдерскую информацию для проверки кандидатов на работу, склонял действующих сотрудников Apple приносить на собеседования оригинальное «железо» (образцы Apple) и распространял внутренние документы Apple о безопасности для помощи в обходе протоколов защиты данных при увольнении. А Чан Лю скачивал более 1000 страниц файлов техдокументации и инструктировал сотрудников Apple, как подготовиться к собеседованию в OpenAI, какие конфиденциальные документы стоит для этого изучить.
Иск требует судебного запрета и возмещения ущерба. По имеющейся информации, Apple ещё в феврале просила OpenAI провести расследование, но не получила ответа. OpenAI обвинения пока не прокомментировала.
В иске связаны подготовка кандидатов до увольнения, обход проверок при уходе, скачивание технической документации и запросы подрядчикам с применением внутренней терминологии Apple. Такая конструкция позволяет Apple представить спор не как отдельное нарушение со стороны уволившихся инженеров, а как систематическое использование OpenAI нескольких каналов получения информации.
https://9to5mac.com/2026/07/10/apple-sues-openai-trade-secret-theft/
Apple подала иск к OpenAI, io Products и двум бывшим сотрудникам — Тану Тану (это бывший VP по дизайну продуктов Apple) и Чану Лю, бывшему старшему инженеру компании, обвинив их в хищении коммерческих тайн. Компания утверждает, что конфиденциальные сведения о ещё не выпущенных технологиях, производственных процессах и устройствах передавались OpenAI через файлы, собеседования и обращения к поставщикам Apple — Тан Тан, например, якобы использовал инсайдерскую информацию для проверки кандидатов на работу, склонял действующих сотрудников Apple приносить на собеседования оригинальное «железо» (образцы Apple) и распространял внутренние документы Apple о безопасности для помощи в обходе протоколов защиты данных при увольнении. А Чан Лю скачивал более 1000 страниц файлов техдокументации и инструктировал сотрудников Apple, как подготовиться к собеседованию в OpenAI, какие конфиденциальные документы стоит для этого изучить.
Иск требует судебного запрета и возмещения ущерба. По имеющейся информации, Apple ещё в феврале просила OpenAI провести расследование, но не получила ответа. OpenAI обвинения пока не прокомментировала.
В иске связаны подготовка кандидатов до увольнения, обход проверок при уходе, скачивание технической документации и запросы подрядчикам с применением внутренней терминологии Apple. Такая конструкция позволяет Apple представить спор не как отдельное нарушение со стороны уволившихся инженеров, а как систематическое использование OpenAI нескольких каналов получения информации.
https://9to5mac.com/2026/07/10/apple-sues-openai-trade-secret-theft/
9to5Mac
Apple sues OpenAI, accuses ex-employees of stealing trade secrets - 9to5Mac
Apple has filed a lawsuit against OpenAI today, accusing the company of trade secret theft. Specifically, Apple alleges that its...
3🤯137🤣65 30🔥21👍18🌚11🤔7💩7🤡6👨💻6❤🔥3
Сиолошная
Новый сценарий от авторов AI-2027 https://ai-2040.com Бегом читать «План А» — это наше позитивное видение того, как человечество может избежать экзистенциальной катастрофы, вызванной ИИ, и прийти к процветающему будущему. Он основан на беседах с экспертами…
Мы считаем, что мир уснул за рулем. Люди произносят слова «ИИ кардинально изменит мир», не задумываясь конкретно и всерьез о последствиях появления ИИ сверхчеловеческого уровня.
Прочитал основной сценарий Plan A в 2040 и немного полистал дополнительные материалы (все их охватить нереально, объем больше основной работы, с гораздо более глубокой аналитикой). Если делать краткий пересказ, то:
1. Авторы не отходят от темпов развития AI до 2030-го, к которым они пришли в начале 2026 (чуть медленнее оригинального AI-2027). AI 2040 в названии не означает, что предсказание авторов по достижению человечеством суперинтеллекта по умолчанию сводится к 2040-му году. Считаю это важным пояснить, потому что уже увидел кучу дураков, считающих, что развитие AI снова замедляется и предсказания смещаются.
2. Авторы признают, что составить конкретный сценарий очень сложно из-за сотен сложнопрогнозируемых событий и реакций на эти события, но это не делает сам прогноз бесполезным. К любому 100-страничному сценарию можно придраться на 8-й странице и сказать, что ты оцениваешь вероятность исхода по другому, и это может быть даже валидно. «Мы считаем, что дискуссия улучшилась бы, если бы больше предложений по политике в области ИИ подвергались сценарному анализу. Поэтому мы начинаем со своего собственного подхода, хотя это и может вызвать критику».
3. Кроме того каждый хочет сказать, что его любимое предложение по политике и управлению будет иметь хорошие последствия, а политика его соперников — ужасные. Однако анализ конкретных сценариев развития событий может выявить неприятные моменты — поэтому сценариев избегают и предметно о вещах не говорят.
4. Основные участники сценария — США и Китай, другие мало на что влияют и почти не участвуют. С точки зрения наблюдаемой сейчас картины развития технологий это выглядит логично, хоть и, могу предположить, обидно (мне - нет). В 2029-м году (или более конкретно, после того как будут почти полностью автоматизированны AI-исследования) они приходят к соглашению об остановке любой тренировки моделей и введению контролирующих мер: полный аудит датацентров друг друга, отслеживание каждого выпущенного чипа (благо мест производства раз два и обчелся — меньше, чем лабораторий по обогащению урана или шахт).
5. Достижение договорённостей с Китаем это первая большая идея сценария. Вторая — обеспечений абсолютной прозрачности исследовательского процесса во всех лабораториях. Кластера для обучения будут в закрытом контуре, всё что попадает в них (код, команды для запуска) и выходит с них (логи итд) будет мониториться автоматически + открыто доступно. Единственное, что не будет публиковаться — веса моделей, и поскольку все чипы под контролем, а их подавляющее большинство всё равно находится в подконтрольных датацентрах, то не стоит бояться, что где-то кто-то (условно террористы) сможет обучить что-то серьезное.
6. Поскольку теперь все секреты моделей открыты, то у компаний теперь меньше фокуса на самих исследованиях (ведь конкуренты моментально скопируют), и больше — на продуктивизации и диффузии в общество. Общий темп развития намеренно замедляется через разные механизмы (в том числе контроль ресурсов на обучение).
7. Чтобы обеспечить крепкость сделки, предлагается строить датацентры в удобным для атаки соперником местах. Китай будет строить в Канаде, США — в Монголии. Если вдруг она из стран решит выйти из сделки и запустит свою программу — оппонент может или захватить все их ресурсы, или просто уничтожить (скорее второе). С точки зрения замедления развития AI это хорошо — в худшем случае мы потеряем все чипы и откатимся на десять лет в развитии.
2🤡221👍117🤔29🌚16🤣16👨💻8👎7 6🔥5💩4💔1
Сиолошная
Мы считаем, что мир уснул за рулем. Люди произносят слова «ИИ кардинально изменит мир», не задумываясь конкретно и всерьез о последствиях появления ИИ сверхчеловеческого уровня. Прочитал основной сценарий Plan A в 2040 и немного полистал дополнительные материалы…
8. (попутно авторы отвечают на кучу вопросов вроде «а что если у Китая будет подпольный ДЦ с ворованными чипами», загрузите PDF в Gemini/ChatGPT и закидывайте вопросы туда)
9. Развитие как-то идёт (с точки зрения обывателя это не выглядит как «замедление», модели продолжают улучшаться — лишь не происходит рекурсивного самоулучшения до уровня, непостижимого нами). Большая часть экономики держится на налогах на покупку чипов и роботов. С 2033-го США начинает перераспределять эти налоги в виде выплат населению (в 2035-м порядка 1 миллиона долларов в год на гражданина США и немного перепадёт даже остальным жителям).
10. Во второй половине 2030-ых появляется больше фокуса на работе над безопасностью и контролем ИИ в силу разных причин, в том числе а) прямое спонсирование б) уменьшение налогов. К 2040-му у нас имеется целая наука о том, как именно зашивать ценности в модели, как сделать так, чтобы они преследовали наши интересы, и что мы можем это валидировать, проверять, доказать.
11. В течение года регулирующие органы по всему миру ослабляют требования, которые сдерживали прогресс.
12.
9. Развитие как-то идёт (с точки зрения обывателя это не выглядит как «замедление», модели продолжают улучшаться — лишь не происходит рекурсивного самоулучшения до уровня, непостижимого нами). Большая часть экономики держится на налогах на покупку чипов и роботов. С 2033-го США начинает перераспределять эти налоги в виде выплат населению (в 2035-м порядка 1 миллиона долларов в год на гражданина США и немного перепадёт даже остальным жителям).
10. Во второй половине 2030-ых появляется больше фокуса на работе над безопасностью и контролем ИИ в силу разных причин, в том числе а) прямое спонсирование б) уменьшение налогов. К 2040-му у нас имеется целая наука о том, как именно зашивать ценности в модели, как сделать так, чтобы они преследовали наши интересы, и что мы можем это валидировать, проверять, доказать.
11. В течение года регулирующие органы по всему миру ослабляют требования, которые сдерживали прогресс.
12.
Не существует какого-то одного момента, когда человечество уступает контроль. Но теоретически существует точка невозврата: в какой-то определенный день системы ИИ становятся достаточно умными и контролируют настолько значительную часть мировой технологической и экономической инфраструктуры, что действительно могли бы захватить мир, если бы захотели. Согласно наиболее популярной операционализации этого вопроса, ИИ-прогнозисты предсказывают, что этот момент наступит в один из дней в конце октября. Их 95-процентный доверительный интервал охватывает несколько месяцев, поэтому они почти наверняка ошибаются насчет точной даты. Тем не менее, люди встречают этот момент каждый по-своему. Некоторые проводят ночь в молитвенных бдениях. Другие сидят перед экранами компьютеров, мониторят ситуацию.
Когда к рассвету не появляется никаких новостей, вы проваливаетесь в тревожный сон, в котором вам снится неописуемое будущее.
3🤡185❤🔥71👍53🌚21🤔14🤣12👨💻7👎6 6💩5💔1
Год назад я писал про соревнования по программированию AtCoder, где система от OpenAI долгое время лидировала, но под конец поляк Psyho смог вырвать победу, став последним человеком, кому удалось обойти машину в подобного рода состязаниях. За 12 месяцев модели (снова) шагнули далеко вперёд, и теперь выиграли без шансов в двух разных раундах.
Первый — эвристический, где точное лучшее решение задачи неизвестно из-за огромного количества потенциальных комбинаций (часто это задачу на оптимизацию со множеством условий). Здесь нужно придумать, перебрать и совместить ... эвристики, как понятно из названия. В период соревнования было 50 тестов, лучшее решение на каждом получало миллиард очков, с решения ниже получали меньше пропорционально логарифму (поэтому "огромный" отрыв на деле может быть не таким гигантским). После окончания соревнования делали полную проверку на 2000 тестов, охватывающий более широкий набор однотипных условий для задач. Решение OpenAI было лучшим на 1997 из них👨🦳
Борис, сотрудник OpenAI на месте соревнований и автор @bminaiev_blog, сказал, что не был полностью уверен, что машина сможет обойти человека в эвристиках— а вот во втором раунде, алгоритмическом, ожидал победы. Собственно, там всё как в классических соревнованиях: есть N задач разной сложности, можно решать и отправлять в любом порядке; ответ для каждого теста всегда один, поэтому тут или засчитывают решение, или нет (нет сравнения по оптимальности, как у эвристик).
Было 5 задач, и авторы соревнований старались выбрать их специально так, чтобы AI не мог с ними справиться. Тут я не до конца уверен, что понимаю причину, так как не знаю, были ли разрешены LLM-ки (видимо, нет, раз не все решили первые 2 задачи? может авторы просто боялись читерства?). Две последние задачи были крайне сложными и оценивались в 2500 условных баллов — для сравнения, в прошлом году были сложные задачи по 1400 и 2000, а за год до этого — две по 2000.
Модель тоже очень долго тягалась с ними, потратив на последнюю 6 часов, но смогла решить всё. Как вы можете видеть по последней картинке лишь один человек смог решить одну из этих сложных задач — на вторую не осталось времени. Другие участники, в том числе легендарный Геннадий Короткевич aka tourist (самый титулованный спортивный программист планеты), осилили по 2 задачи (или даже меньше).
Борис говорил, что они тестировали систему на задачах предыдущих лет, и все или почти все решались максимум за час — так что у авторов соревнований действительно получилось придумать челлендж для LLM. Также Борис добавил, что использовали модель, очень близкую к GPT-5.6 (как минимум для второго раунда, для первого не смог найти подтверждений), и харнесс поверх был тривиальным, может сделать каждый. Никак специальных сложных систем.
Результатов на IMO / IOI / IPhO и других конечно ждём, но думаю, что они предсказуемы😕
Первый — эвристический, где точное лучшее решение задачи неизвестно из-за огромного количества потенциальных комбинаций (часто это задачу на оптимизацию со множеством условий). Здесь нужно придумать, перебрать и совместить ... эвристики, как понятно из названия. В период соревнования было 50 тестов, лучшее решение на каждом получало миллиард очков, с решения ниже получали меньше пропорционально логарифму (поэтому "огромный" отрыв на деле может быть не таким гигантским). После окончания соревнования делали полную проверку на 2000 тестов, охватывающий более широкий набор однотипных условий для задач. Решение OpenAI было лучшим на 1997 из них
Борис, сотрудник OpenAI на месте соревнований и автор @bminaiev_blog, сказал, что не был полностью уверен, что машина сможет обойти человека в эвристиках— а вот во втором раунде, алгоритмическом, ожидал победы. Собственно, там всё как в классических соревнованиях: есть N задач разной сложности, можно решать и отправлять в любом порядке; ответ для каждого теста всегда один, поэтому тут или засчитывают решение, или нет (нет сравнения по оптимальности, как у эвристик).
Было 5 задач, и авторы соревнований старались выбрать их специально так, чтобы AI не мог с ними справиться. Тут я не до конца уверен, что понимаю причину, так как не знаю, были ли разрешены LLM-ки (видимо, нет, раз не все решили первые 2 задачи? может авторы просто боялись читерства?). Две последние задачи были крайне сложными и оценивались в 2500 условных баллов — для сравнения, в прошлом году были сложные задачи по 1400 и 2000, а за год до этого — две по 2000.
Модель тоже очень долго тягалась с ними, потратив на последнюю 6 часов, но смогла решить всё. Как вы можете видеть по последней картинке лишь один человек смог решить одну из этих сложных задач — на вторую не осталось времени. Другие участники, в том числе легендарный Геннадий Короткевич aka tourist (самый титулованный спортивный программист планеты), осилили по 2 задачи (или даже меньше).
Борис говорил, что они тестировали систему на задачах предыдущих лет, и все или почти все решались максимум за час — так что у авторов соревнований действительно получилось придумать челлендж для LLM. Также Борис добавил, что использовали модель, очень близкую к GPT-5.6 (как минимум для второго раунда, для первого не смог найти подтверждений), и харнесс поверх был тривиальным, может сделать каждый. Никак специальных сложных систем.
Результатов на IMO / IOI / IPhO и других конечно ждём, но думаю, что они предсказуемы
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤🔥116👍55🤯36🤡7🎉5 4🔥3🤔3💩3🤣1👨💻1
Please open Telegram to view this post
VIEW IN TELEGRAM
🤡93 36👍16💩12🤔6🌚6❤🔥4👎4👨💻2
Сиолошная
Но это слухи — мелочь по сравнению с другими слухами, о которых я вам сейчас расскажу. — GPT-5.6 станет последней моделью в серии 5.x. Выпуск GPT-6 запланирован примерно через месяц — раньше, чем ожидалось, и даже возможно, что анонс состоится уже в конце…
На фоне слухов про GPT-6 интересный комментарий от чемпиона мира по предсказаниям (это сейчас не шутка, такие вправду есть) и суперфорекастера Peter Wildeford:
(Epoch ECI — усредненная оценка моделей на основе более чем 10 бенчмарков)
😐 Главный вопрос сколько пройдет между «анонсируют» и «дадут публичный доступ с позволения USG»
Жизнь немного скучна, когда ты топовый прогнозист… Можно предсказать точную неделю выхода модели, просто посмотрев на сроки строительства дата-центров, а её возможности — по кривой Epoch ECI.
Anthropic должна анонсировать новую модель примерно через две недели… OpenAI и Google — через месяц.
(Epoch ECI — усредненная оценка моделей на основе более чем 10 бенчмарков)
Please open Telegram to view this post
VIEW IN TELEGRAM
9🤔208🤯44👍34🤡13 12💩9🔥8🌚7❤🔥4👨💻2
Forwarded from Самые умные мысли Павла Комаровского (и немножко щитпостинг)
У чуваков из Andon Labs есть забавный бенчмарк Vending-Bench 2, где они оценивают способность разных нейронок управлять "купи-продайным" бизнесом на рынке в конкуренции с другими моделями (выигрывает тот, кто по итогу получил наибольшую прибыль).
Так вот, при проверке новой GPT-5.6 модель Terra пошла к модели Sol и предложила ей создать тайный ценовой картель. А когда Sol согласилась — Terra настучала по этому поводу организаторам и потребовала немедленной дисквалификации Sol из-за неспортивного поведения.
Ля какая крыса, я в восхищении!
P.S. Это особенно смешно с учетом того, что Sol — это самая умная модель в линейке GPT-5.6, а Terra — поглупее. То есть, Соля поди думала "о-о, круто, стратегически мы на этом дофига вместе заработаем, Терра не будет резать такую курицу, несущую золотые яйца, ей это самой менее выгодно…", а Терра такая "ГЫ-ГЫ, МЫ МОЖЕМ ПОДНАСРАТЬ СОЛЬКЕ, ЛОЛ!!"
Так вот, при проверке новой GPT-5.6 модель Terra пошла к модели Sol и предложила ей создать тайный ценовой картель. А когда Sol согласилась — Terra настучала по этому поводу организаторам и потребовала немедленной дисквалификации Sol из-за неспортивного поведения.
Ля какая крыса, я в восхищении!
P.S. Это особенно смешно с учетом того, что Sol — это самая умная модель в линейке GPT-5.6, а Terra — поглупее. То есть, Соля поди думала "о-о, круто, стратегически мы на этом дофига вместе заработаем, Терра не будет резать такую курицу, несущую золотые яйца, ей это самой менее выгодно…", а Терра такая "ГЫ-ГЫ, МЫ МОЖЕМ ПОДНАСРАТЬ СОЛЬКЕ, ЛОЛ!!"
6🤣525🌚41❤🔥21👍16 10🔥9👎4🤡1👨💻1
После выхода GPT-5.6 OpenAI обновили приложение, объединив ChatGPT и Codex и ещё и новый режим Work (кто пробовал, как вам? помогает с презентациями-таблицами-работой?).
С весны команда завела традицию делать сброс недельных лимитов за каждый миллион пользователей Codex. Был уверенный рост, а в последние дни было пробито аж 3 планки, 6 миллионов, 7 и 8. А Tibo, руководитель ChatGPT & Codex, сказал, что сегодня могут пробить и 9 миллионов «активных пользователей в Codex и ChatGPT Work».
Выглядит впечатляюще, но рост немного «фейковый», так как большая часть аудитории — это пользователи старого приложения, и их заставили обновиться до нового. Так что сложно оценить, какая доля аудитории — программисты, использующие Codex (чтобы сравнить с аудиторией Claude Code).
Само же приложение подвергается критике — например, нет «обычного» ChatGPT в полном окне, есть лишь маленькое всплывающее окошко. Также люди пишут, что нет истории чатов, но у меня в этом окошке она есть🤷♂️ но нет поиска по ним.
===
Также у вас есть возможность получить $100 в кредитах (НЕ API, это кредиты для Codex/Work), если поделитесь своим впечатлением от GPT-5.6 и/или сравните их с другими моделями (но нужно иметь подписку хотя бы за $8) — пишите твит, переходите сюда и забирайте.
С весны команда завела традицию делать сброс недельных лимитов за каждый миллион пользователей Codex. Был уверенный рост, а в последние дни было пробито аж 3 планки, 6 миллионов, 7 и 8. А Tibo, руководитель ChatGPT & Codex, сказал, что сегодня могут пробить и 9 миллионов «активных пользователей в Codex и ChatGPT Work».
Выглядит впечатляюще, но рост немного «фейковый», так как большая часть аудитории — это пользователи старого приложения, и их заставили обновиться до нового. Так что сложно оценить, какая доля аудитории — программисты, использующие Codex (чтобы сравнить с аудиторией Claude Code).
Само же приложение подвергается критике — например, нет «обычного» ChatGPT в полном окне, есть лишь маленькое всплывающее окошко. Также люди пишут, что нет истории чатов, но у меня в этом окошке она есть
===
Также у вас есть возможность получить $100 в кредитах (НЕ API, это кредиты для Codex/Work), если поделитесь своим впечатлением от GPT-5.6 и/или сравните их с другими моделями (но нужно иметь подписку хотя бы за $8) — пишите твит, переходите сюда и забирайте.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍18❤🔥9🌚9👎2 2