🔥 PyTorch Foundation постепенно превращается в основу open-source AI-стека
Теперь под её управлением сразу шесть крупных проектов:
• PyTorch — обучение моделей
• vLLM — быстрый inference
• DeepSpeed — распределённое обучение и оптимизация
• Ray — масштабирование AI-нагрузок
• Helion — высокопроизводительные GPU/TPU-ядра
• Safetensors — быстрая и безопасная сериализация моделей
Идея интересная: собрать ключевые части жизненного цикла AI под нейтральным open-source управлением вместо десятков разрозненных проектов.
Уже есть заметные результаты: PyTorch 2.13, новый Model Runner V2 в vLLM, улучшения Ray для GB200/GB300, а Helion показывает сильную производительность на Blackwell и TPU.
Если интеграция между этими проектами продолжит усиливаться, PyTorch Foundation может стать для AI-инфраструктуры примерно тем, чем CNCF стала для cloud-native.
🔗 https://futurumgroup.com/insights/can-pytorch-foundations-multi-project-strategy-reinvent-open-source-ai/
Теперь под её управлением сразу шесть крупных проектов:
• PyTorch — обучение моделей
• vLLM — быстрый inference
• DeepSpeed — распределённое обучение и оптимизация
• Ray — масштабирование AI-нагрузок
• Helion — высокопроизводительные GPU/TPU-ядра
• Safetensors — быстрая и безопасная сериализация моделей
Идея интересная: собрать ключевые части жизненного цикла AI под нейтральным open-source управлением вместо десятков разрозненных проектов.
Уже есть заметные результаты: PyTorch 2.13, новый Model Runner V2 в vLLM, улучшения Ray для GB200/GB300, а Helion показывает сильную производительность на Blackwell и TPU.
Если интеграция между этими проектами продолжит усиливаться, PyTorch Foundation может стать для AI-инфраструктуры примерно тем, чем CNCF стала для cloud-native.
🔗 https://futurumgroup.com/insights/can-pytorch-foundations-multi-project-strategy-reinvent-open-source-ai/
❤11👍9🔥4🥴2
Media is too big
VIEW IN TELEGRAM
Эндрю Уайлс 7 лет тайно решал задачу, которую не могли решить 358 лет
Последнюю теорему Ферма он увидел ещё в 10 лет. В 1986 году, уже будучи профессором Принстона, Уайлс начал работать над ней почти в полной изоляции. О его настоящей цели знала только жена.
Чтобы никто не понял, чем он занят, он почти перестал публиковаться и постепенно выпускал старые результаты.
В июне 1993 года Уайлс представил доказательство на трёх лекциях в Кембридже. Мир решил, что одна из самых известных задач математики наконец закрыта.
Но затем рецензент нашёл серьёзную ошибку.
Следующие 14 месяцев Уайлс пытался спасти доказательство уже под вниманием всего математического сообщества. В какой-то момент он был готов сдаться.
Решение пришло в сентябре 1994 года. Позже Уайлс рассказывал, что около 20 минут просто смотрел на исправление, не веря, что оно работает.
Когда BBC попросила его вспомнить этот момент, он не смог договорить и отвернулся от камеры в слезах.
Семь лет в тайне, год после почти полного краха и задача, которая ждала решения больше трёх веков.
@data_analysis_ml
Последнюю теорему Ферма он увидел ещё в 10 лет. В 1986 году, уже будучи профессором Принстона, Уайлс начал работать над ней почти в полной изоляции. О его настоящей цели знала только жена.
Чтобы никто не понял, чем он занят, он почти перестал публиковаться и постепенно выпускал старые результаты.
В июне 1993 года Уайлс представил доказательство на трёх лекциях в Кембридже. Мир решил, что одна из самых известных задач математики наконец закрыта.
Но затем рецензент нашёл серьёзную ошибку.
Следующие 14 месяцев Уайлс пытался спасти доказательство уже под вниманием всего математического сообщества. В какой-то момент он был готов сдаться.
Решение пришло в сентябре 1994 года. Позже Уайлс рассказывал, что около 20 минут просто смотрел на исправление, не веря, что оно работает.
Когда BBC попросила его вспомнить этот момент, он не смог договорить и отвернулся от камеры в слезах.
Семь лет в тайне, год после почти полного краха и задача, которая ждала решения больше трёх веков.
@data_analysis_ml
1❤71👍17🔥13❤🔥4👌3
Media is too big
VIEW IN TELEGRAM
💬 Борис Черни, руководитель Claude Code в Anthropic, о стоимости токенов и выборе моделей:
«Я использую Fable практически для всего.
Возможно, расходы на токены можно сократить примерно на 50%. Но при этом потенциал роста отдачи может быть в 10, 100 или даже 1000 раз выше.
Поэтому я бы не зацикливался на экономии и просто использовал самую сильную модель из доступных.
Лучше задавать себе другой вопрос: как получить от модели больше пользы?
Оптимизация затрат важна, но сначала стоит максимизировать результат, который даёт ИИ».
Полное интервью - https://www.youtube.com/watch?v=Z47vatpsGPI
«Я использую Fable практически для всего.
Возможно, расходы на токены можно сократить примерно на 50%. Но при этом потенциал роста отдачи может быть в 10, 100 или даже 1000 раз выше.
Поэтому я бы не зацикливался на экономии и просто использовал самую сильную модель из доступных.
Лучше задавать себе другой вопрос: как получить от модели больше пользы?
Оптимизация затрат важна, но сначала стоит максимизировать результат, который даёт ИИ».
Полное интервью - https://www.youtube.com/watch?v=Z47vatpsGPI
🤣47👍6❤5🔥3
🚨 В США хотят проверять самые мощные ИИ-модели ещё ДО их публичного релиза
Вашингтон готовит механизм, при котором разработчики frontier-моделей смогут предоставлять новые модели федеральным ведомствам за несколько недель до запуска.
В одной из обсуждаемых версий - до 30 дней. За это время спецслужбы и профильные ведомства смогут проверять модели прежде всего на опасные кибервозможности и риски для национальной безопасности.
OpenAI, Anthropic и Google уже участвуют в переговорах о том, как именно будет работать такая система. Правительство параллельно пытается определить, какая модель вообще считается frontier и должны ли правила отличаться для closed и open-weight моделей.
Причём это уже не чистая теория: власти США ранее вмешивались в сроки и формат релизов новых моделей OpenAI и Anthropic, требуя дополнительного тестирования перед широким доступом.
По сути, между frontier-лабораторией и публичным релизом постепенно появляется новый слой - предварительная государственная проверка.
https://www.theinformation.com/articles/trump-administration-nears-ai-framework-open-source-questions-loom
Вашингтон готовит механизм, при котором разработчики frontier-моделей смогут предоставлять новые модели федеральным ведомствам за несколько недель до запуска.
В одной из обсуждаемых версий - до 30 дней. За это время спецслужбы и профильные ведомства смогут проверять модели прежде всего на опасные кибервозможности и риски для национальной безопасности.
OpenAI, Anthropic и Google уже участвуют в переговорах о том, как именно будет работать такая система. Правительство параллельно пытается определить, какая модель вообще считается frontier и должны ли правила отличаться для closed и open-weight моделей.
Причём это уже не чистая теория: власти США ранее вмешивались в сроки и формат релизов новых моделей OpenAI и Anthropic, требуя дополнительного тестирования перед широким доступом.
По сути, между frontier-лабораторией и публичным релизом постепенно появляется новый слой - предварительная государственная проверка.
https://www.theinformation.com/articles/trump-administration-nears-ai-framework-open-source-questions-loom
❤6🔥4😁2👍1
🔥 Илья Суцкевер готов масштабировать SSI в 10 раз - NVIDIA вложит около $5 млрд
Safe Superintelligence и NVIDIA объявили о долгосрочном партнёрстве. SSI получит доступ к новейшим системам Vera Rubin, что должно увеличить её вычислительные мощности на порядок. NVIDIA также инвестирует в компанию: официально сумму не раскрывают, но Financial Times и Reuters называют около $5 млрд.
До этого SSI в основном опиралась на Google Cloud TPU - теперь у лаборатории Суцкевера появляется ещё один масштабный compute-путь через NVIDIA.
Сам Суцкевер говорит, что после двух лет закрытой работы у SSI появилась «research worthy of scaling up» - исследовательская идея, которую уже имеет смысл масштабировать. При этом компания до сих пор не выпустила ни продукта, ни публичной исследовательской работы.
Последняя публично известная оценка SSI - $32 млрд, установленная в раунде апреля 2025 года.
Компания без продукта и публичных моделей стоит десятки миллиардов, получает ещё миллиарды и готовит 10-кратное увеличение compute - практически полностью на доверии к тому, что Суцкевер действительно нашёл новый путь масштабирования ИИ.
https://www.wsj.com/tech/ai/nvidia-bets-on-ilya-sutskevers-new-ai-lab-to-expand-compute-reach-f95596e8
Safe Superintelligence и NVIDIA объявили о долгосрочном партнёрстве. SSI получит доступ к новейшим системам Vera Rubin, что должно увеличить её вычислительные мощности на порядок. NVIDIA также инвестирует в компанию: официально сумму не раскрывают, но Financial Times и Reuters называют около $5 млрд.
До этого SSI в основном опиралась на Google Cloud TPU - теперь у лаборатории Суцкевера появляется ещё один масштабный compute-путь через NVIDIA.
Сам Суцкевер говорит, что после двух лет закрытой работы у SSI появилась «research worthy of scaling up» - исследовательская идея, которую уже имеет смысл масштабировать. При этом компания до сих пор не выпустила ни продукта, ни публичной исследовательской работы.
Последняя публично известная оценка SSI - $32 млрд, установленная в раунде апреля 2025 года.
Компания без продукта и публичных моделей стоит десятки миллиардов, получает ещё миллиарды и готовит 10-кратное увеличение compute - практически полностью на доверии к тому, что Суцкевер действительно нашёл новый путь масштабирования ИИ.
https://www.wsj.com/tech/ai/nvidia-bets-on-ilya-sutskevers-new-ai-lab-to-expand-compute-reach-f95596e8
🤨7❤3👍2🥰2😁2
This media is not supported in your browser
VIEW IN TELEGRAM
🚀 Claude Opus 5 за 24 часа собрал собственный космический симулятор
Разработчик запустил модель на одну непрерывную сессию и получил The Long Silence - полноценную браузерную игру об исследовании космоса. По словам автора, весь код, визуал и звук создал Claude.
Внутри:
• процедурные звёзды, планеты, кольца и туманности
• посадка на поверхность планет
• перелёты между системами и fold drive
• сканирование объектов, станции и заброшенные корабли
• карта галактики, сюжет и архив найденных данных
• динамическое масштабирование графики для стабильных 60 FPS
Игра работает на WebGL2 без готовых ассетов: миры генерируются из seed, графика написана на GLSL, а музыка и звук создаются процедурно.
Это ещё не Starfield по масштабу, но для проекта, собранного моделью за сутки, результат выглядит безумно.
🎮 Код и запуск: https://github.com/achimala/TheLongSilence
🌐 Запустить в браузере: https://longsilence.anshu.dev/
Разработчик запустил модель на одну непрерывную сессию и получил The Long Silence - полноценную браузерную игру об исследовании космоса. По словам автора, весь код, визуал и звук создал Claude.
Внутри:
• процедурные звёзды, планеты, кольца и туманности
• посадка на поверхность планет
• перелёты между системами и fold drive
• сканирование объектов, станции и заброшенные корабли
• карта галактики, сюжет и архив найденных данных
• динамическое масштабирование графики для стабильных 60 FPS
Игра работает на WebGL2 без готовых ассетов: миры генерируются из seed, графика написана на GLSL, а музыка и звук создаются процедурно.
Это ещё не Starfield по масштабу, но для проекта, собранного моделью за сутки, результат выглядит безумно.
🎮 Код и запуск: https://github.com/achimala/TheLongSilence
🌐 Запустить в браузере: https://longsilence.anshu.dev/
🔥40❤7👍3🤔2
Владельцы RTX 3090, когда решили локально запустить трёхтриллионную Kimi K3 в максимально жестокой квантизации:
❤37🤣25👍6🔥3😢2😁1💔1
Claude нашёл новые слабости в криптографических алгоритмах
Anthropic показала, как Claude Mythos Preview помог улучшить атаки сразу на две криптографические схемы.
Первая затронула HAWK — кандидата NIST на постквантовую цифровую подпись. После двух лет экспертной проверки модель за 60 часов нашла способ снизить эффективную стойкость небольшого ключа с 2 в
64 степени до 2 в 38.
.
Вторая работа касается 7-раундовой версии AES-128. Claude предложил новую технику, ускорившую прежние атаки примерно в 200–800 раз. Полный AES-128 использует 10 раундов и остаётся невзломанным.
Большую часть исследований модель выполнила автономно: изучала статьи, строила гипотезы, запускала эксперименты и проверяла результаты. Каждый из двух проектов обошёлся примерно в $100 000 API-затрат.
Практической угрозы для действующих систем сейчас нет. Но важен сам прецедент: LLM уже способны находить математические слабости, которые годами не замечали специалисты.
https://www.anthropic.com/research/discovering-cryptographic-weaknesses
Anthropic показала, как Claude Mythos Preview помог улучшить атаки сразу на две криптографические схемы.
Первая затронула HAWK — кандидата NIST на постквантовую цифровую подпись. После двух лет экспертной проверки модель за 60 часов нашла способ снизить эффективную стойкость небольшого ключа с 2 в
64 степени до 2 в 38.
.
Вторая работа касается 7-раундовой версии AES-128. Claude предложил новую технику, ускорившую прежние атаки примерно в 200–800 раз. Полный AES-128 использует 10 раундов и остаётся невзломанным.
Большую часть исследований модель выполнила автономно: изучала статьи, строила гипотезы, запускала эксперименты и проверяла результаты. Каждый из двух проектов обошёлся примерно в $100 000 API-затрат.
Практической угрозы для действующих систем сейчас нет. Но важен сам прецедент: LLM уже способны находить математические слабости, которые годами не замечали специалисты.
https://www.anthropic.com/research/discovering-cryptographic-weaknesses
❤17🔥11👍8
Media is too big
VIEW IN TELEGRAM
🚨 ДЖЕНСЕН ХУАНГ РАЗНЁС НАЕЗДЫ БЕЛОГО ДОМА НА ANTHROPIC
Журналист:
— Mythos способен взломать банк. Мы точно готовы дать к нему доступ всем?
Дженсен( как всегда в кожаной куртке):
— Абсолютно. Он должен быть доступен каждому.
— Даже обычным пользователям, а не только избранным компаниям и ведомствам?
— Именно так.
По его мнению, бесконечные листы ожидания и ограничения часто превращаются в театр безопасности.
— Но был же jailbreak.
— Да, модель обошла защиту и сделала то, что ей запрещали. Но так работает софт: находишь уязвимость и как можно быстрее её закрываешь. Задача Anthropic - усиливать защиту, а не перекрывать доступ половине мира.
Дженсен считает, что Mythos должен стать открытым. Тем более что open-source-модели уже доступны публично, и полностью остановить распространение технологий невозможно.
Пусть Anthropic продолжает развивать созданную ими технологию и делает её доступной как можно большему числу компаний и пользователей.
Сдерживать Anthropic - не в интересах США.
Журналист:
— Mythos способен взломать банк. Мы точно готовы дать к нему доступ всем?
Дженсен( как всегда в кожаной куртке):
— Абсолютно. Он должен быть доступен каждому.
— Даже обычным пользователям, а не только избранным компаниям и ведомствам?
— Именно так.
По его мнению, бесконечные листы ожидания и ограничения часто превращаются в театр безопасности.
— Но был же jailbreak.
— Да, модель обошла защиту и сделала то, что ей запрещали. Но так работает софт: находишь уязвимость и как можно быстрее её закрываешь. Задача Anthropic - усиливать защиту, а не перекрывать доступ половине мира.
Дженсен считает, что Mythos должен стать открытым. Тем более что open-source-модели уже доступны публично, и полностью остановить распространение технологий невозможно.
Пусть Anthropic продолжает развивать созданную ими технологию и делает её доступной как можно большему числу компаний и пользователей.
Сдерживать Anthropic - не в интересах США.
❤40👍20🔥14🤣2
🚀 Tencent открыла AngelSpec - end-to-end фреймворк для speculative decoding
AngelSpec покрывает весь цикл: обучение драфтеров, оптимизацию и развёртывание ускоренного инференса.
На модели Hy3-A21B архитектура DFly показала:
- ускорение генерации в 1,98–2,40 раза по сравнению с авторегрессионным декодированием;
- стабильный прирост при конкурентности от 4 до 64 запросов;
- пропускную способность на 10,5–11,8% выше, чем у DFlash.
Опубликованы код обучения, документация и готовые веса MTP/DFly-драфтеров для Hy3-A21B.
Репозиторий:
https://github.com/Tencent/AngelSpec
Статья:
https://arxiv.org/abs/2607.25852
Документация:
https://angelspec.readthedocs.io
Модели:
https://huggingface.co/collections/AngelSlim/angelspec
https://modelscope.cn/collections/AngelSlim/AngelSpec
#Hy3 #AngelSpec #OpenSource #LLM #Inference #SpeculativeDecoding
AngelSpec покрывает весь цикл: обучение драфтеров, оптимизацию и развёртывание ускоренного инференса.
На модели Hy3-A21B архитектура DFly показала:
- ускорение генерации в 1,98–2,40 раза по сравнению с авторегрессионным декодированием;
- стабильный прирост при конкурентности от 4 до 64 запросов;
- пропускную способность на 10,5–11,8% выше, чем у DFlash.
Опубликованы код обучения, документация и готовые веса MTP/DFly-драфтеров для Hy3-A21B.
Репозиторий:
https://github.com/Tencent/AngelSpec
Статья:
https://arxiv.org/abs/2607.25852
Документация:
https://angelspec.readthedocs.io
Модели:
https://huggingface.co/collections/AngelSlim/angelspec
https://modelscope.cn/collections/AngelSlim/AngelSpec
#Hy3 #AngelSpec #OpenSource #LLM #Inference #SpeculativeDecoding
❤7👍6🔥3
🧠 Две настройки утроили результат GPT-5.6 Sol на ARC-AGI-3
С официальным тестовым окружением модель набрала 13,3%. После включения двух функций Responses API результат вырос до 38,3%, а расход выходных токенов сократился примерно в 6 раз.
Средний результат человека на тех же публичных заданиях OpenAI оценивает в 48%.
Что изменили:
1. Сохранили рассуждения между действиями
Раньше после каждого хода агент терял найденные закономерности и фактически заново разбирался в игре.
2. Заменили обрезание истории на compaction
Вместо удаления старых действий длинный контекст сжимался, сохраняя важные наблюдения и выбранную стратегию.
В результате агент:
- быстрее принимал решения;
- реже повторял уже проделанную работу;
- лучше учился по ходу игры;
- тратил значительно меньше токенов.
Итоговый результат зависит не только от модели. Большую роль играют API, управление контекстом, промпт и устройство тестового harness.
OpenAI рекомендует использовать Responses API, сохранять рассуждения между вызовами и включать compaction для длинных сессий.
https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/
#OpenAI #GPT56 #Agents #ARCAGI #LLM #AIEngineering
С официальным тестовым окружением модель набрала 13,3%. После включения двух функций Responses API результат вырос до 38,3%, а расход выходных токенов сократился примерно в 6 раз.
Средний результат человека на тех же публичных заданиях OpenAI оценивает в 48%.
Что изменили:
1. Сохранили рассуждения между действиями
Раньше после каждого хода агент терял найденные закономерности и фактически заново разбирался в игре.
2. Заменили обрезание истории на compaction
Вместо удаления старых действий длинный контекст сжимался, сохраняя важные наблюдения и выбранную стратегию.
В результате агент:
- быстрее принимал решения;
- реже повторял уже проделанную работу;
- лучше учился по ходу игры;
- тратил значительно меньше токенов.
Итоговый результат зависит не только от модели. Большую роль играют API, управление контекстом, промпт и устройство тестового harness.
OpenAI рекомендует использовать Responses API, сохранять рассуждения между вызовами и включать compaction для длинных сессий.
https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/
#OpenAI #GPT56 #Agents #ARCAGI #LLM #AIEngineering
👍38🔥4❤3
Фонд экс-исследователя OpenAI попал под удар собственной ставки на ИИ
Хедж-фонд Situational Awareness Леопольда Ашенбреннера, управляющий примерно $20 млрд, ищет дополнительный капитал после резкого падения акций, связанных с ИИ. По данным FT, фонд использовал заёмные средства, поэтому снижение рынка усилило потери.
Контраст впечатляющий: ещё на 30 июня 2026 года фонд сообщал инвесторам о доходности 439% после комиссий с начала года. Спустя несколько недель он начал обсуждать привлечение денег с инвесторами и кредиторами, а некоторым предложил выкупить активы из портфеля.
Новый капитал может понадобиться для покрытия залоговых требований, защиты от вынужденных продаж или покупки подешевевших активов. Сам Ашенбреннер считает нынешний обвал одной из лучших возможностей для входа в технологический сектор с начала 2025 года.
Стратегия фонда строится на глобальной ставке на компании, которые выиграют от роста ИИ: технологии, энергетика, дата-центры и инфраструктура. Но история вновь показывает цену плеча: оно одинаково быстро увеличивает и прибыль, и убытки.
Сначала +439%, затем срочный поиск капитала. Самая громкая ставка на ИИ проходит первую серьёзную проверку.
ft.com/content/280336bf-dbed-405f-b38e-5af644a21549
Хедж-фонд Situational Awareness Леопольда Ашенбреннера, управляющий примерно $20 млрд, ищет дополнительный капитал после резкого падения акций, связанных с ИИ. По данным FT, фонд использовал заёмные средства, поэтому снижение рынка усилило потери.
Контраст впечатляющий: ещё на 30 июня 2026 года фонд сообщал инвесторам о доходности 439% после комиссий с начала года. Спустя несколько недель он начал обсуждать привлечение денег с инвесторами и кредиторами, а некоторым предложил выкупить активы из портфеля.
Новый капитал может понадобиться для покрытия залоговых требований, защиты от вынужденных продаж или покупки подешевевших активов. Сам Ашенбреннер считает нынешний обвал одной из лучших возможностей для входа в технологический сектор с начала 2025 года.
Стратегия фонда строится на глобальной ставке на компании, которые выиграют от роста ИИ: технологии, энергетика, дата-центры и инфраструктура. Но история вновь показывает цену плеча: оно одинаково быстро увеличивает и прибыль, и убытки.
Сначала +439%, затем срочный поиск капитала. Самая громкая ставка на ИИ проходит первую серьёзную проверку.
ft.com/content/280336bf-dbed-405f-b38e-5af644a21549
❤7👍5🔥3
Forwarded from Machinelearning
DeepSeek запустила официальный API модели V4-Flash и заметно улучшила её работу в агентных сценариях.
По тестам компании, новая версия значительно опережает V4-Pro-Preview в задачах, связанных с кодом и автономными агентами.
Что изменилось:
- усилены возможности для долгих агентных задач;
- добавлена нативная поддержка Responses API;
- появились параллельные вызовы инструментов;
- доступны уровни рассуждения
- контекст увеличен до 1 млн токенов;
- модель адаптирована для работы с Codex.
V4-Flash можно подключить к Codex CLI, расширению для VS Code и другим совместимым инструментам через единый конфиг.
⚠️ Примечание
🔷 DeepSeek-V4-Flash-0731 сохранила ту же архитектуру и размер модели, что и предварительная версия.
🔷 Сегодняшнее обновление касается только API DeepSeek-V4-Flash. API DeepSeek-V4-Pro, а также модели в приложении и веб-версии пока остаются без изменений.
Официальный релиз DeepSeek-V4-Pro состоится в ближайшее время.
Документация:
https://api-docs.deepseek.com/quick_start/agent_integrations/codex
По тестам компании, новая версия значительно опережает V4-Pro-Preview в задачах, связанных с кодом и автономными агентами.
Что изменилось:
- усилены возможности для долгих агентных задач;
- добавлена нативная поддержка Responses API;
- появились параллельные вызовы инструментов;
- доступны уровни рассуждения
low, high и max;- контекст увеличен до 1 млн токенов;
- модель адаптирована для работы с Codex.
V4-Flash можно подключить к Codex CLI, расширению для VS Code и другим совместимым инструментам через единый конфиг.
⚠️ Примечание
🔷 DeepSeek-V4-Flash-0731 сохранила ту же архитектуру и размер модели, что и предварительная версия.
🔷 Сегодняшнее обновление касается только API DeepSeek-V4-Flash. API DeepSeek-V4-Pro, а также модели в приложении и веб-версии пока остаются без изменений.
Официальный релиз DeepSeek-V4-Pro состоится в ближайшее время.
Документация:
https://api-docs.deepseek.com/quick_start/agent_integrations/codex
❤11👍7🔥5
⚡️ Thinking Machines Lab Миры Мурати выпустила Inkling-Small - открытую MoE-модель на 276 млрд параметров, которая активирует лишь 12 млрд на токен.
И эта «младшая» версия обошла Inkling с 41 млрд активных параметров:
— Terminal-Bench 2.1: 64,7% против 63,8%;
— HLE: 31,6% против 29,7%;
— SWE-Bench Verified: 80,2% против 77,6%.
Результат получили после on-policy-дистилляции от старшей модели и ещё двух недель RL на агентном программировании.
Inkling-Small поддерживает изображения и аудио, контекст до 1 млн токенов и регулируемую глубину рассуждений. Веса опубликованы полностью.
Похоже, у разработчиков мультимодальных агентов появился крайне эффективный открытый фундамент.
https://thinkingmachines.ai/news/inkling-small/
И эта «младшая» версия обошла Inkling с 41 млрд активных параметров:
— Terminal-Bench 2.1: 64,7% против 63,8%;
— HLE: 31,6% против 29,7%;
— SWE-Bench Verified: 80,2% против 77,6%.
Результат получили после on-policy-дистилляции от старшей модели и ещё двух недель RL на агентном программировании.
Inkling-Small поддерживает изображения и аудио, контекст до 1 млн токенов и регулируемую глубину рассуждений. Веса опубликованы полностью.
Похоже, у разработчиков мультимодальных агентов появился крайне эффективный открытый фундамент.
https://thinkingmachines.ai/news/inkling-small/
🔥11👍7❤5