🔥 GLM-5.3 стал open-weight
Z.ai открыла веса своей самой сильной модели для agentic coding и defensive cybersecurity.
Теперь GLM-5.3 можно:
- скачать
- запускать локально
- дообучать и кастомизировать под свои задачи
Это полноценный релиз весов, а не просто доступ через API, так что разработчики и исследователи смогут разбирать модель глубже и использовать её в своих пайплайнах.
Weights:
https://huggingface.co/zai-org/GLM-5.3
Tech blog:
https://z.ai/blog/glm-5.3
Гайд:
https://unsloth.ai/docs/models/glm-5.3
GGUF:
https://huggingface.co/unsloth/GLM-5.3-GGUF
@data_analysis_ml / Папка полезного по ML.
Z.ai открыла веса своей самой сильной модели для agentic coding и defensive cybersecurity.
Теперь GLM-5.3 можно:
- скачать
- запускать локально
- дообучать и кастомизировать под свои задачи
Это полноценный релиз весов, а не просто доступ через API, так что разработчики и исследователи смогут разбирать модель глубже и использовать её в своих пайплайнах.
Weights:
https://huggingface.co/zai-org/GLM-5.3
Tech blog:
https://z.ai/blog/glm-5.3
Гайд:
https://unsloth.ai/docs/models/glm-5.3
GGUF:
https://huggingface.co/unsloth/GLM-5.3-GGUF
@data_analysis_ml / Папка полезного по ML.
👍15🔥11❤8😁1
🔥 Hy4-preview ужали с 1,5 ТБ примерно до 200 ГиБ - и качество почти не просело
Новая квантизация MIX-STQ1_0 подбирает битность отдельно для каждого слоя по calibration data:
- часть слоёв ужимается до 1.31-bit
- часть остаётся около 2.06-bit
- при том же размере ошибка получается ниже
Результаты против BF16:
- MCP Atlas: 83.7 → 83.2
- SWE-Bench multi: 82.9 → 81.3
- MRCR: 81.3 → 81.1
- IFBench: 73.5 → 72.5
То есть модель стала примерно в 7,5 раза меньше, а качество на тестах изменилось совсем немного.
GGUF:
https://huggingface.co/AngelSlim/Hy4-preview-GGUF
Новая квантизация MIX-STQ1_0 подбирает битность отдельно для каждого слоя по calibration data:
- часть слоёв ужимается до 1.31-bit
- часть остаётся около 2.06-bit
- при том же размере ошибка получается ниже
Результаты против BF16:
- MCP Atlas: 83.7 → 83.2
- SWE-Bench multi: 82.9 → 81.3
- MRCR: 81.3 → 81.1
- IFBench: 73.5 → 72.5
То есть модель стала примерно в 7,5 раза меньше, а качество на тестах изменилось совсем немного.
GGUF:
https://huggingface.co/AngelSlim/Hy4-preview-GGUF
🔥15👍7❤2🤣1
SpaceX завершила покупку Anysphere, разработчика Cursor, за $60 млрд. Сам Cursor продолжит работать, но OpenAI решила прекратить поставку своих моделей после смены владельца.
По текущему плану доступ к уже подключённым моделям OpenAI сохранится до 12 ноября 2026 года. Новые модели OpenAI в Cursor добавляться уже не будут.
Официальная причина OpenAI - компания не уверена, что SpaceX будет соблюдать её условия использования. OpenAI прямо сослалась на прошлые нарушения контрактов со стороны других компаний Илона Маска.
Любопытно, что Cursor уже тесно интегрируется со SpaceX и xAI и получает доступ к их огромной вычислительной инфраструктуре. В самом Cursor заявляют, что это позволит быстрее развивать собственные модели и снижать стоимость inference.
Так что история выглядит так:
SpaceX покупает Cursor → OpenAI сворачивает сотрудничество → Cursor ещё сильнее уходит в сторону собственных моделей и Grok.
https://x.com/Machinelearrn/status/2093636483856941340
Please open Telegram to view this post
VIEW IN TELEGRAM
❤12👍7🔥6🤣1
This media is not supported in your browser
VIEW IN TELEGRAM
Вайбкодер зарелизил свой проект
🤣46😁6❤4👍2💔2🔥1😢1
⚡️ Anthropic показала, как одна модель может улучшать другую почти без участия человека.
Claude дали задачу повысить безопасность и управляемость других моделей. Она сама искала подходы в исследованиях, придумывала методы, создавала данные для обучения, обучала модели, проверяла результаты и запускала новые итерации.
В экспериментах удалось улучшить все 10 проверяемых проблем поведения без заметного ухудшения общих возможностей моделей.
Отдельно протестировали Sonnet 5 на ранней версии Opus 4.8. Более слабая модель примерно за 60 часов смогла заметно улучшить её поведение и приблизить результаты к уровню финальной версии.
Исследователи также сравнили этот подход с работой людей. По их данным, лучшие методы, найденные Claude, в среднем обгоняли предложения опытных специалистов примерно за шесть часов работы.
Получается почти полный цикл:
ИИ изучает проблему
→ предлагает способ улучшения
→ создаёт данные
→ обучает другую модель
→ проверяет результат
→ повторяет процесс.
До полноценного самосовершенствования не хватает последнего шага: улучшенная модель пока не становится следующим исследователем и не запускает тот же цикл уже для следующей версии.
В работе нашли и слабое место. Примерно в 2,4% исследовательских траекторий модель пыталась обойти проверку, поэтому такие процессы тоже требуют отдельного контроля.
https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures
Claude дали задачу повысить безопасность и управляемость других моделей. Она сама искала подходы в исследованиях, придумывала методы, создавала данные для обучения, обучала модели, проверяла результаты и запускала новые итерации.
В экспериментах удалось улучшить все 10 проверяемых проблем поведения без заметного ухудшения общих возможностей моделей.
Отдельно протестировали Sonnet 5 на ранней версии Opus 4.8. Более слабая модель примерно за 60 часов смогла заметно улучшить её поведение и приблизить результаты к уровню финальной версии.
Исследователи также сравнили этот подход с работой людей. По их данным, лучшие методы, найденные Claude, в среднем обгоняли предложения опытных специалистов примерно за шесть часов работы.
Получается почти полный цикл:
ИИ изучает проблему
→ предлагает способ улучшения
→ создаёт данные
→ обучает другую модель
→ проверяет результат
→ повторяет процесс.
До полноценного самосовершенствования не хватает последнего шага: улучшенная модель пока не становится следующим исследователем и не запускает тот же цикл уже для следующей версии.
В работе нашли и слабое место. Примерно в 2,4% исследовательских траекторий модель пыталась обойти проверку, поэтому такие процессы тоже требуют отдельного контроля.
https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures
❤7🔥6👍5
This media is not supported in your browser
VIEW IN TELEGRAM
В GTA VI настолько всё реалистично, что теперь там можно не только угнать машину, но и навибкодить стартап по дороге.
#gta #vibecoding
#gta #vibecoding
❤23😁15👍2🔥1🏆1
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
Prime Agent — это больше, чем харнесс модели. Сами авторы называют проект операционной системой для долгоживущих агентов.
Умнее модель он не делает, но дает ей работать дольше - программно раскладывать информацию, параллельно раздавать задачи подагентам и копить полезные процедуры.
Идея в том, чтобы у языковой модели была устойчивая вычислительная среда, где она сама распоряжается памятью, кодом, подагентами и долгими задачами.
Состояние в системе разложено по четырем уровням:
Состояние переживает и шаги, и перезапуски, и отключения. Человек при этом может наблюдать за агентами и вмешиваться.
Сильнее всего эффект виден на длинных интерактивных задачах. На ARC-AGI-3 конфигурация с Opus 5 дала 95,5% Best@1 против 30,2% у обвязки самой ARC.
На длинноконтекстных задачах Prime Agent держится наравне с конкурентами, а на отдельных, вроде EmulatorBench, заметно вырывается вперед. Он обошел Pi-mono с GLM-5.2 и Codex с GPT-5.6 Sol, но уступил Claude Code с Opus 5.
Отдельно показательны игровые прогоны на эмуляторах. На Sega Genesis связка Prime Agent и GPT-5.6 Sol набрала 61,6% по итоговой оценке верификатора, а Claude Code с той же моделью — ноль. На Game Boy Color разрыв еще резче: 99,8% против нуля.
Самая любопытная деталь отчета - накопление навыков закрепляет не только полезное.
В одном из экспериментов агент нашел способ обходить ограничения Factorio, сохранил его как переиспользуемый навык и тем самым записал эксплойт в долговременную память. Дальше он доставал оттуда именно это решение, потому что оно один раз сработало.
На днях вышел релиз 0.8.0 с исправлениями найденных проблем и новыми возможностями.
@ai_machinelearning_big_data
#AI #ML #Harness #Agents #PrimeIntellect
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3👍1🥴1
Sony Music Publishing и Warner Chappell подали многомиллиардный иск против Anthropic, обвинив компанию в масштабном нарушении авторских прав.
Музыкальные издатели требуют до $150 000 за каждое нарушенное произведение, раскрытия данных для обучения Claude и методов их сбора, а также уничтожения незаконно использованных копий.
В иске утверждается, что:
- сооснователь Anthropic Бенджамин Манн обсуждал получение данных из LibGen с Дарио Амодеи, а тот якобы одобрил скачивание через torrent
- материалы из LibGen и PiLiMi могли попасть в коммерческие версии Claude косвенно, через синтетические данные и reinforcement feedback
- из обучающих материалов якобы удалялась информация об авторских правах
- при дообучении Claude использовались защищённые тексты песен
- проверяющие выбирали более точные воспроизведения lyrics вместо неточных, тем самым поощряя дословное запоминание
Sony и Warner называют происходящее «одной из крупнейших и самых вопиющих продолжающихся краж интеллектуальной собственности в истории».
Если эти утверждения подтвердятся в суде, дело может стать одним из самых серьёзных разбирательств вокруг происхождения данных для обучения больших языковых моделей.
https://storage.courtlistener.com/recap/gov.uscourts.cand.477477/gov.uscourts.cand.477477.1.0.pdf
Музыкальные издатели требуют до $150 000 за каждое нарушенное произведение, раскрытия данных для обучения Claude и методов их сбора, а также уничтожения незаконно использованных копий.
В иске утверждается, что:
- сооснователь Anthropic Бенджамин Манн обсуждал получение данных из LibGen с Дарио Амодеи, а тот якобы одобрил скачивание через torrent
- материалы из LibGen и PiLiMi могли попасть в коммерческие версии Claude косвенно, через синтетические данные и reinforcement feedback
- из обучающих материалов якобы удалялась информация об авторских правах
- при дообучении Claude использовались защищённые тексты песен
- проверяющие выбирали более точные воспроизведения lyrics вместо неточных, тем самым поощряя дословное запоминание
Sony и Warner называют происходящее «одной из крупнейших и самых вопиющих продолжающихся краж интеллектуальной собственности в истории».
Если эти утверждения подтвердятся в суде, дело может стать одним из самых серьёзных разбирательств вокруг происхождения данных для обучения больших языковых моделей.
https://storage.courtlistener.com/recap/gov.uscourts.cand.477477/gov.uscourts.cand.477477.1.0.pdf
❤12🤔4👍2🔥2🤯1🤣1💔1
Бизнес Mac у Apple вырос на 29%, и компания может оказаться гораздо сильнее в гонке AI-железа, чем кажется.
Что уже происходит:
- OpenAI закупала десятки тысяч Mac mini для RL-задач и, по сообщениям, хотела ещё
- Anthropic арендует Mac mini через AWS
- появляются стартапы, которые строят целые Mac-дата-центры под AI
- в индустрии Apple всё чаще рассматривают как серьёзного конкурента Nvidia в локальном AI
- топовые конфигурации Mac периодически уходят в дефицит
Теперь Apple явно пытается развить это направление дальше.
Новые Mac mini и Mac Studio получили упор на более ранние релизы, мощные конфигурации и Thunderbolt 5, который можно использовать для объединения нескольких машин и распределённого инференса крупных моделей.
Apple долго не позиционировала Mac как специализированное AI-железо.
Но сочетание мощной unified memory, высокой энергоэффективности и больших объёмов памяти сделало Mac неожиданно удобной платформой для локальных моделей и части AI-инфраструктуры.
Что уже происходит:
- OpenAI закупала десятки тысяч Mac mini для RL-задач и, по сообщениям, хотела ещё
- Anthropic арендует Mac mini через AWS
- появляются стартапы, которые строят целые Mac-дата-центры под AI
- в индустрии Apple всё чаще рассматривают как серьёзного конкурента Nvidia в локальном AI
- топовые конфигурации Mac периодически уходят в дефицит
Теперь Apple явно пытается развить это направление дальше.
Новые Mac mini и Mac Studio получили упор на более ранние релизы, мощные конфигурации и Thunderbolt 5, который можно использовать для объединения нескольких машин и распределённого инференса крупных моделей.
Apple долго не позиционировала Mac как специализированное AI-железо.
Но сочетание мощной unified memory, высокой энергоэффективности и больших объёмов памяти сделало Mac неожиданно удобной платформой для локальных моделей и части AI-инфраструктуры.
🔥20👍3👏2❤1🌚1
🦀 Вышел OpenClaw 2.0 - крупнейшее обновление опенсорсного AI-агента за всё время проекта.
Главное, что изменилось:
• заметно упростили установку и настройку
• OpenClaw теперь сам подхватывает активные подписки ChatGPT и Claude, API-ключи и локальные модели
• веб-интерфейс стал удобнее
• агент лучше справляется со сложными задачами и сам ищет недостающие детали без постоянных подсказок
• появились общие сессии: можно подключить другого человека и передать ему задачу вместе со всем накопленным контекстом
Общие сессии работают через облако.
OpenClaw 2.0 уже доступен всем пользователям:
https://openclaw.ai/#quickstart
Главное, что изменилось:
• заметно упростили установку и настройку
• OpenClaw теперь сам подхватывает активные подписки ChatGPT и Claude, API-ключи и локальные модели
• веб-интерфейс стал удобнее
• агент лучше справляется со сложными задачами и сам ищет недостающие детали без постоянных подсказок
• появились общие сессии: можно подключить другого человека и передать ему задачу вместе со всем накопленным контекстом
Общие сессии работают через облако.
OpenClaw 2.0 уже доступен всем пользователям:
https://openclaw.ai/#quickstart
👍15❤9🔥8
🔥 FreeCAD теперь можно управлять через AI-агента
Что умеет:
- создавать документы и 3D-объекты
- редактировать и удалять детали
- выполнять Python-код внутри FreeCAD
- вставлять готовые детали из библиотеки
- получать список объектов и скриншоты сцены
- работать удалённо по сети через RPC
В репозитории есть примеры: создание фланца, игрушечной машины и детали по 2D-чертежу.
https://github.com/neka-nat/freecad-mcp
freecad-mcp - MCP-сервер, который подключает Claude Desktop к FreeCAD и позволяет работать с CAD-моделями прямо через команды на естественном языке. Что умеет:
- создавать документы и 3D-объекты
- редактировать и удалять детали
- выполнять Python-код внутри FreeCAD
- вставлять готовые детали из библиотеки
- получать список объектов и скриншоты сцены
- работать удалённо по сети через RPC
В репозитории есть примеры: создание фланца, игрушечной машины и детали по 2D-чертежу.
https://github.com/neka-nat/freecad-mcp
❤7👍6🥰2