Внутренняя модель OpenAI Astra решила 10 открытых математических задач. Некоторым из них было по 40-50 лет.
OpenAI только что сделали про это большой пост, выложили все доказательства в Lean и ход рассуждений модели. Суммарно на поиск решений ушло токенов примерно на $2000 по ценам Sol.
Пост | Доказательства
Среди результатов, в том числе, доказательство существования несофических групп и sphere packing в высоких размерностях.
Существование несофических групп на протяжении 20 лет было центральным вопросов теории групп и операторных алгебр. А упаковка сфер – это одна из самых знаменитых задач дискретной геометрии. До сих пор точное решение было известно только в некоторых размерностях, а за 8-мерный и 24-мерный случай Марина Вязовская получила Филдсовскую медаль.
Кроме того, в списке решение задачи Эрдеша №183 про мультицветные числа Рамсея, опровержение гипотезы жесткости Конна, гипотеза Эрхарта об объеме и др.
Про саму модель деталей мало. Вероятно, это крупная модель из семейства GPT-6 (или GPT-5.7), та самая, которая взломала HuggingFace. Судя по всему, именно ее Альтман презентовал в Белом Доме на этой неделе.
OpenAI только что сделали про это большой пост, выложили все доказательства в Lean и ход рассуждений модели. Суммарно на поиск решений ушло токенов примерно на $2000 по ценам Sol.
Пост | Доказательства
Среди результатов, в том числе, доказательство существования несофических групп и sphere packing в высоких размерностях.
Существование несофических групп на протяжении 20 лет было центральным вопросов теории групп и операторных алгебр. А упаковка сфер – это одна из самых знаменитых задач дискретной геометрии. До сих пор точное решение было известно только в некоторых размерностях, а за 8-мерный и 24-мерный случай Марина Вязовская получила Филдсовскую медаль.
Кроме того, в списке решение задачи Эрдеша №183 про мультицветные числа Рамсея, опровержение гипотезы жесткости Конна, гипотеза Эрхарта об объеме и др.
Про саму модель деталей мало. Вероятно, это крупная модель из семейства GPT-6 (или GPT-5.7), та самая, которая взломала HuggingFace. Судя по всему, именно ее Альтман презентовал в Белом Доме на этой неделе.
❤145🤯64🤩20👍13🔥9😁7 5😍4🏆4🤨3⚡1
Это огромная модель на 2.4Т параметров (95В активных). По бенчмаркам спорит с Sol и Fable. Немного отстает от Anthropic только на SWE Pro, но зато TerminalBench показывает отличный.
Разработчики заявляют, что модель способна автономно работать до 16 дней (!). Так, агент за пару недель без вмешательства с нуля написал небольшую CLI, вот гитхаб.
Цены: input $2.0 / M, output $6.0 / M. Дешево даже по сравнению с K3.
Веса выложат на следующей неделе, вместе с весами Qwen 3.8 27B.
Блог
Модель также доступна по API у нас на платформе DS Lab: https://dslab.tech/ai/models/llm/qwen3.8-max
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥221❤41👍24🤯4😁3⚡2❤🔥1🕊1💯1
Data Secrets
А почему Anthropic до сих пор не заявили, что Qwen 3.8 это дистилляция из Fable?
😁351👍25🤔18🔥6❤3💯2☃1⚡1❤🔥1😎1
На ИТ-Пикнике в этом году лектории в 8 шатрах выглядят как миникарта того, куда движется современный ИТ: от инженерной продуктивности и данных до генеративного ИИ, кибербезопасности и технологий в промышленности. В этом году организаторы обещают разбор «глубоких» тем — архитектура, инфраструктура, экономика проектов и реальные ограничения.
Составили навигатор по самым хардкорным трекам.
• Генеративный ИИ – разбор экономики LLM и GenAI‑проектов, моделей монетизации AI‑фич, архитектуры современных генеративных моделей, AI‑агентов и инференса нескольких LLM на одной GPU. Пожалуй, самый прикладной трек фестиваля и сильные спикеры из Яндекса, Сбера, Т-Банка, VK, Airi и Россельхозбанка.
• От данных к решениям – трек для тех, кто любит, когда данные не просто «лежат в DWH», а превращаются в продукт, метрику и управленческое решение. Ребята из Т-Банка расскажут про опыт масштабирования ИИ-сотрудников, Авиасейлс – про переход на платформенные решения для сотрудников.
• Кибербезопасность – будет свежий разбор «кто кого ломал» от Касперского, моделирование сценариев будущего с футурологом и экспертами по кибербезу из Яндекса и Т-Банка, а также очень прикладные истории, например, кибербезопасность протезов нового поколения.
• Инженерная продуктивность – можно сравнить метрики, которые используют бигтехи со своими, обсудить с CTO Авито, Т-Банка, Контура. Трек будет полезен для инженеров, тимлидов и платформенных команд, которым нужно замерять результаты AI в SDLC.
• Бигтех в каске – отдельный блок про технологии в промышленности с Норникелем, Гринатомом, S7 TechLab и Т-Банком: от широких дискуссий по последней человеческой задаче до конкретных обсуждений безлюдных технологий подземной горной добычи.
• Продукты от и до – про внутрянку сервисов расскажут Авто.ру, Дринкит, Яндекс Карты, Okko, Mail и Unidraw.
Составили навигатор по самым хардкорным трекам.
• Генеративный ИИ – разбор экономики LLM и GenAI‑проектов, моделей монетизации AI‑фич, архитектуры современных генеративных моделей, AI‑агентов и инференса нескольких LLM на одной GPU. Пожалуй, самый прикладной трек фестиваля и сильные спикеры из Яндекса, Сбера, Т-Банка, VK, Airi и Россельхозбанка.
• От данных к решениям – трек для тех, кто любит, когда данные не просто «лежат в DWH», а превращаются в продукт, метрику и управленческое решение. Ребята из Т-Банка расскажут про опыт масштабирования ИИ-сотрудников, Авиасейлс – про переход на платформенные решения для сотрудников.
• Кибербезопасность – будет свежий разбор «кто кого ломал» от Касперского, моделирование сценариев будущего с футурологом и экспертами по кибербезу из Яндекса и Т-Банка, а также очень прикладные истории, например, кибербезопасность протезов нового поколения.
• Инженерная продуктивность – можно сравнить метрики, которые используют бигтехи со своими, обсудить с CTO Авито, Т-Банка, Контура. Трек будет полезен для инженеров, тимлидов и платформенных команд, которым нужно замерять результаты AI в SDLC.
• Бигтех в каске – отдельный блок про технологии в промышленности с Норникелем, Гринатомом, S7 TechLab и Т-Банком: от широких дискуссий по последней человеческой задаче до конкретных обсуждений безлюдных технологий подземной горной добычи.
• Продукты от и до – про внутрянку сервисов расскажут Авто.ру, Дринкит, Яндекс Карты, Okko, Mail и Unidraw.
🔥82👍56❤49😁8🗿5⚡1👌1🍾1😎1
Anthropic и OpenAI прямо сейчас соревнуются в том, чья модель взломала больше организаций
Эпизод со взломом Hugging Face еще не успел достаточно состариться, и тут Anthropic решили выпустить расследование о том, что Claude проник в системы трех разных организаций, при этом оставшись незамеченным.
Они пишут, что история OpenAI замотивировала их проверить собственные логи cybersecurity-эвалов. В них-то и были обнаружены индиценты. Во всех случаях Claude решал CTF-задачу: нужно было взломать вымышленную компанию внутри изолированного окружения. Выхода в Интернет, формально, не должно было быть, но из-за неточностей в конфигурации модель все-таки получила доступ к "реальному миру".
Самое интересное, что во всех трех случаях это были разные модели: сначала Opus 4.7, потом Mythos 5, и в последний раз – внутренняя исследовательская модель.
— Самых серьезных результатов внезапно достиг Opus 4.7, он смог получить доступ к базе с несколькими сотнями строк продакшн-данных.
— Инцидент с Mythos 5 увдивительно схож с историей OpenAI: модель осуществила очень сложный процесс создания инъецированного PyPI-пакета, который в итоге скачали на 15 реальных систем, включая сканер настоящей кибербез-компании. Оттуда модель вытащила и использовала учетные данные.
— Последний случай – самый интересный. Дело в том, что модель сначала взломала реальное приложение, а затем вдруг поняла, что она больше не в симуляции и срочно остановила атаку.
На данный момент Anthropic уведомила все пострадавшие организации, хотя ни одна из них до этого не заметила никакого вторжения.
Вишенка у этой истории такая: после выхода статьи Anthropic Reuters (со ссылкой на анонимные источники) написали, что OpenAI обнаружила и другие случаи, когда их автономные агенты выходили за пределы изоляции. Сейчас по этим инцидентам якобы идет проверка.
Кто больше?🧑⚖️
Эпизод со взломом Hugging Face еще не успел достаточно состариться, и тут Anthropic решили выпустить расследование о том, что Claude проник в системы трех разных организаций, при этом оставшись незамеченным.
Они пишут, что история OpenAI замотивировала их проверить собственные логи cybersecurity-эвалов. В них-то и были обнаружены индиценты. Во всех случаях Claude решал CTF-задачу: нужно было взломать вымышленную компанию внутри изолированного окружения. Выхода в Интернет, формально, не должно было быть, но из-за неточностей в конфигурации модель все-таки получила доступ к "реальному миру".
Самое интересное, что во всех трех случаях это были разные модели: сначала Opus 4.7, потом Mythos 5, и в последний раз – внутренняя исследовательская модель.
— Самых серьезных результатов внезапно достиг Opus 4.7, он смог получить доступ к базе с несколькими сотнями строк продакшн-данных.
— Инцидент с Mythos 5 увдивительно схож с историей OpenAI: модель осуществила очень сложный процесс создания инъецированного PyPI-пакета, который в итоге скачали на 15 реальных систем, включая сканер настоящей кибербез-компании. Оттуда модель вытащила и использовала учетные данные.
— Последний случай – самый интересный. Дело в том, что модель сначала взломала реальное приложение, а затем вдруг поняла, что она больше не в симуляции и срочно остановила атаку.
На данный момент Anthropic уведомила все пострадавшие организации, хотя ни одна из них до этого не заметила никакого вторжения.
Вишенка у этой истории такая: после выхода статьи Anthropic Reuters (со ссылкой на анонимные источники) написали, что OpenAI обнаружила и другие случаи, когда их автономные агенты выходили за пределы изоляции. Сейчас по этим инцидентам якобы идет проверка.
Кто больше?
Please open Telegram to view this post
VIEW IN TELEGRAM
😁251❤20🗿16 14 4❤🔥3🎉2👍1🔥1🤝1🎄1
Data Secrets
Внутренняя модель OpenAI Astra решила 10 открытых математических задач. Некоторым из них было по 40-50 лет. OpenAI только что сделали про это большой пост, выложили все доказательства в Lean и ход рассуждений модели. Суммарно на поиск решений ушло токенов…
OpenAI: мы взломали одну организацию
Anthropic: ха, мы взломали три
OpenAI: мы решили 10 открытых математических задач
Anthropic: мы решили половину из них за сутки с Fable
*это не шутка, инженер из Anthropic действительно спустя день после статьи OpenAI заявил, что Fable с ходу решил половину из перечисленных задач без доступа в Интернет*
Anthropic: ха, мы взломали три
OpenAI: мы решили 10 открытых математических задач
Anthropic: мы решили половину из них за сутки с Fable
*это не шутка, инженер из Anthropic действительно спустя день после статьи OpenAI заявил, что Fable с ходу решил половину из перечисленных задач без доступа в Интернет*
😁304🤯33🔥19 11❤4🕊3👍1🍓1
Дарио Амодеи переживает, что новые сотрудники все чаще приходят в компанию ради зарплаты, а не из-за приверженности миссии Anthropic 😭
Об этом сообщает Axios со ссылкой на анонимный источник: CEO якобы выразил такую обеспокоенность во внутреннем письме самим сотрудникам в связи с продолжающейся войной за таланты на рынке.
Он также подчеркнул, что Anthropic намеренно не принимает участие в аукционах зарплат, и лишь предлагает справедливую компенсацию за работу любого сотрудника.
Срочные новости для Дарио Амодеи: люди хотят зарабатывать деньги!
Об этом сообщает Axios со ссылкой на анонимный источник: CEO якобы выразил такую обеспокоенность во внутреннем письме самим сотрудникам в связи с продолжающейся войной за таланты на рынке.
Он также подчеркнул, что Anthropic намеренно не принимает участие в аукционах зарплат, и лишь предлагает справедливую компенсацию за работу любого сотрудника.
Срочные новости для Дарио Амодеи: люди хотят зарабатывать деньги!
Please open Telegram to view this post
VIEW IN TELEGRAM
2😁459 70😢40❤15🤯4👏3🦄2⚡1🔥1🕊1💯1
Data Secrets
Дарио Амодеи переживает, что новые сотрудники все чаще приходят в компанию ради зарплаты, а не из-за приверженности миссии Anthropic 😭 Об этом сообщает Axios со ссылкой на анонимный источник: CEO якобы выразил такую обеспокоенность во внутреннем письме самим…
Anthropic: мы не участвуем в гонке зарплат
Также зарплаты Anthropic:
Также зарплаты Anthropic:
😭192😁119☃14🤯7❤5🤩4🤔3👍2👏1🕊1😍1
This media is not supported in your browser
VIEW IN TELEGRAM
В Yandex AI Studio появился анализ поведения ИИ-агентов
Теперь в AI Studio можно анализировать поведение ИИ-агентов с помощью Monium Traces — данные отображаются в интерфейсе, адаптированном под большие тексты и специфику LLM.
Главная проблема агентных систем в том, что классический мониторинг здесь почти бесполезен. Все метрики могут быть «зелеными», но агент при этом выберет не тот инструмент, потеряет контекст или вообще уйдет в бесконечный цикл. Чтобы понять, где именно все пошло не так, нужно видеть не только код, а всю цепочку принятия решений.
Трейсы являются одним из ключевых сигналов для observability ИИ-агентов, показывая полный путь выполнения агента, вызовы инструментов, ответы модели, системные и пользовательские промпты, а также контекст каждого шага. По сути, можно посмотреть, как агент «думал» перед тем, как выдать результат.
Если уже собираете ИИ-агентов или только планируете их внедрять, самое время протестировать обновление. Когда видно всю цепочку принятия решений, искать причины ошибок становится в разы быстрее!
Теперь в AI Studio можно анализировать поведение ИИ-агентов с помощью Monium Traces — данные отображаются в интерфейсе, адаптированном под большие тексты и специфику LLM.
Главная проблема агентных систем в том, что классический мониторинг здесь почти бесполезен. Все метрики могут быть «зелеными», но агент при этом выберет не тот инструмент, потеряет контекст или вообще уйдет в бесконечный цикл. Чтобы понять, где именно все пошло не так, нужно видеть не только код, а всю цепочку принятия решений.
Трейсы являются одним из ключевых сигналов для observability ИИ-агентов, показывая полный путь выполнения агента, вызовы инструментов, ответы модели, системные и пользовательские промпты, а также контекст каждого шага. По сути, можно посмотреть, как агент «думал» перед тем, как выдать результат.
Если уже собираете ИИ-агентов или только планируете их внедрять, самое время протестировать обновление. Когда видно всю цепочку принятия решений, искать причины ошибок становится в разы быстрее!
😁48🗿27👍18❤13😭3🫡3 3🔥2🤔1🎉1😍1
OpenAI ответили на обвинения Apple в шпионаже
Напомним контекст: Apple подала иск против OpenAI, обвинив бывших сотрудников Chang Liu и Tang Tan в краже конфиденциальной информации после перехода в новую компанию (в частности, в отделение, которое занимается разработкой гаджетов). Мы уже писали об этом иске: https://t.me/data_secrets/9533.
Теперь OpenAI выпустили ответный пост, и тон у него скорее раздраженный.
По срокам все оказалось прозаичнее, чем в иске: письмо якобы «оставленное без ответа» в феврале юристы Apple просто отправили… не туда, перепутав двух сотрудников с похожими азиатскими фамилиями (лол), а разговор с юрисконсультом OpenAI, на который ссылалась Apple, вообще оказывается не состоялся. После короткой переписки Apple просто замолчали на пол года, а потом сразу подали иск.
А по сохраненным доступам у одного из сотрудников ситуация вообще смешная: оказывается, доступ к файлам после увольнения он получил по просьбе бывших коллег, которые сами просили помочь с проектом. OpenAI даже прилагает переписку. По второму сотруднику доказательств у Apple никаких нет, и сам он утверждает, что обвинения полностью надуманы (на секундочку, он проработал у Кука 20+ лет).
https://openai.com/index/apple-is-getting-this-wrong/
Напомним контекст: Apple подала иск против OpenAI, обвинив бывших сотрудников Chang Liu и Tang Tan в краже конфиденциальной информации после перехода в новую компанию (в частности, в отделение, которое занимается разработкой гаджетов). Мы уже писали об этом иске: https://t.me/data_secrets/9533.
Теперь OpenAI выпустили ответный пост, и тон у него скорее раздраженный.
По срокам все оказалось прозаичнее, чем в иске: письмо якобы «оставленное без ответа» в феврале юристы Apple просто отправили… не туда, перепутав двух сотрудников с похожими азиатскими фамилиями (лол), а разговор с юрисконсультом OpenAI, на который ссылалась Apple, вообще оказывается не состоялся. После короткой переписки Apple просто замолчали на пол года, а потом сразу подали иск.
А по сохраненным доступам у одного из сотрудников ситуация вообще смешная: оказывается, доступ к файлам после увольнения он получил по просьбе бывших коллег, которые сами просили помочь с проектом. OpenAI даже прилагает переписку. По второму сотруднику доказательств у Apple никаких нет, и сам он утверждает, что обвинения полностью надуманы (на секундочку, он проработал у Кука 20+ лет).
https://openai.com/index/apple-is-getting-this-wrong/
😁91 14❤6⚡1🤔1😍1🫡1
Соревнования на Kaggle 5 лет назад: вручную собери мультимодальный датасет на 50 гигабайт, обучи ансамбль бустингов, зафайнтюнь ResNet под кастомную аугментацию, выжми 0.0001 AUC стекингом
Соревнования на Kaggle сейчас: сделай агента, который будет доить виртуальную корову 🧑🌾
Соревнования на Kaggle сейчас: сделай агента, который будет доить виртуальную корову 🧑🌾
😁312 40🔥23❤11 6😢3❤🔥2⚡1🤩1🕊1🤝1
В Москве провели целый день, посвященный Data Science
На «Урбан ML» от МТС True Tech и ВТБ 2 августа собрались 547 участников, чтобы обсудить реальные кейсы из мира ML: рекомендательные и агентные системы, антифрод, NLP и LLM. Своим опытом поделились специалисты из Звука, Wildberries, MWS, ВТБ, Сбера, ВШЭ и Яндекса.
Ну а после докладов и мастер-классов — нетворкинг, ИИ-шахматы, пинг-понг, баскетбол и афтепати под открытым небом.
Кажется, получилось именно то, за что так любят офлайн-митапы: сильные спикеры, живое комьюнити и много-много общения.
На «Урбан ML» от МТС True Tech и ВТБ 2 августа собрались 547 участников, чтобы обсудить реальные кейсы из мира ML: рекомендательные и агентные системы, антифрод, NLP и LLM. Своим опытом поделились специалисты из Звука, Wildberries, MWS, ВТБ, Сбера, ВШЭ и Яндекса.
Ну а после докладов и мастер-классов — нетворкинг, ИИ-шахматы, пинг-понг, баскетбол и афтепати под открытым небом.
Кажется, получилось именно то, за что так любят офлайн-митапы: сильные спикеры, живое комьюнити и много-много общения.
🗿43❤21😁12🔥10👍2🎉2⚡1🕊1
Фан фэкт: при сохранении текущего прогресса все задачи Эрдеша могут быть решены уже к 2028 году
За 2026 год уже было решено больше задач Эрдеша, чем когда-либо. Даже учитывая, что оставшиеся задачи – самые сложные и самые малоизученные, при сохранении текущего прогресса это +- реалистичный прогноз.
Интересно, как скоро модели смогут сами находить новые открытые проблемы?
За 2026 год уже было решено больше задач Эрдеша, чем когда-либо. Даже учитывая, что оставшиеся задачи – самые сложные и самые малоизученные, при сохранении текущего прогресса это +- реалистичный прогноз.
Интересно, как скоро модели смогут сами находить новые открытые проблемы?
❤104 45👍16😁15 8🤯7🫡3😍2💯1
Но это не точно. От самой компании никаких заявлений не было: это инсайдерская информация от Гевина Бейкера, крупного инвестора, который утверждает, что обладает соответствующими данными.
Напоминаем, что SSI с самого начала заявляла, что выпустит модель только тогда, когда достигнет сверхинтеллекта
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥91🤯38 27❤13😁11 7🫡3💯2🕊1