ахаха..
короче, нашёлся какой-то чел, который перевайбкодил Jev (который в закрытой бете и втайне разрабатывался 2 года) - ЗА 2 ЧАСА и выложил на HF
это повторяет историю что была с Claude Cowork, который вышел в закрытой бете и за ночь его перевайбкодил какой-то гений из Китая.
Запасаемся попкорном.
Открытые (в отличии от Jev) веса качаем тут:
https://huggingface.co/harshatheg/Qwen-2.5-1B-RLCD
А вот как оно работает (разъяснение от HF):
#Jev #Qwen
———
@tsingular
короче, нашёлся какой-то чел, который перевайбкодил Jev (который в закрытой бете и втайне разрабатывался 2 года) - ЗА 2 ЧАСА и выложил на HF
это повторяет историю что была с Claude Cowork, который вышел в закрытой бете и за ночь его перевайбкодил какой-то гений из Китая.
Запасаемся попкорном.
Открытые (в отличии от Jev) веса качаем тут:
https://huggingface.co/harshatheg/Qwen-2.5-1B-RLCD
А вот как оно работает (разъяснение от HF):
Идея заключается в том, чтобы заменить авторегрессионную генерацию LLM использованием одного декодера Transformer (из состава предварительно обученной LLM), который обрабатывает контекст и JSON-схему всего один раз.
Ключи и значения (KV) для этих токенов сохраняются в кэше. Затем для каждого поля JSON-схемы мы выполняем следующие действия:
1. повторно пропускаем токены суффикса поля через декодер Transformer (повторно используя KV-кэш); 2. получаем итоговое скрытое состояние и пропускаем его через выходной слой языковой модели (head);
3. получаем оценки (также называемые логитами) для всех токенов из словаря LLM;
4. рассматриваем только оценки для тех токенов, которые важны для данного поля, и пропускаем их через функцию softmax для получения вероятностей, сумма которых равна 1;
5. выбираем токен с наибольшей вероятностью.
Преимущества такого подхода:
1. высокая скорость (не нужно генерировать JSON-схему по одному токену);
2. гарантированная корректность JSON (не нужно полагаться на способность модели сгенерировать валидную схему).
#Jev #Qwen
———
@tsingular
👍12😁9🔥6❤3🤯2
Forwarded from Анализ данных (Data analysis)
🚨 Apple может выйти на рынок AI-серверов и использовать для этого технологию NVIDIA
По данным The Information, Apple разрабатывает серверы на будущих M8 Ultra и рассматривает NVLink Fusion для объединения нескольких чипов в одной системе.
Обсуждаются две конфигурации:
- 2× M8 Ultra
- 4× M8 Ultra
Серверы хотят продавать AI-разработчикам, компаниям и государственным организациям, а основной сценарий — AI inference, а не обучение моделей. Возможный запуск - около 2029 года.
Apple уже использует собственные решения в Private Cloud Compute, но, по данным источников, они слишком медленные и дорогие для масштабирования. Поэтому часть инженеров считает NVLink Fusion лучшим вариантом.
Получается довольно иронично:
Apple фактически может зайти на рынок AI-серверов NVIDIA, используя технологию самой NVIDIA.
По данным The Information, Apple разрабатывает серверы на будущих M8 Ultra и рассматривает NVLink Fusion для объединения нескольких чипов в одной системе.
Обсуждаются две конфигурации:
- 2× M8 Ultra
- 4× M8 Ultra
Серверы хотят продавать AI-разработчикам, компаниям и государственным организациям, а основной сценарий — AI inference, а не обучение моделей. Возможный запуск - около 2029 года.
Apple уже использует собственные решения в Private Cloud Compute, но, по данным источников, они слишком медленные и дорогие для масштабирования. Поэтому часть инженеров считает NVLink Fusion лучшим вариантом.
Получается довольно иронично:
Apple M8 Ultra → NVIDIA NVLink Fusion → AI serverApple фактически может зайти на рынок AI-серверов NVIDIA, используя технологию самой NVIDIA.
✍9🤔6🤣4❤1⚡1🤯1
Короче Jev пока больше похож на классификатор или реранкер.
Выдает наиболее подходящие ответы по JSON форме.
На этом пока всё
#Jev
------
@tsingular
Выдает наиболее подходящие ответы по JSON форме.
На этом пока всё
#Jev
------
@tsingular
✍9⚡2💯2👨💻1
Media is too big
VIEW IN TELEGRAM
В Гермес добавили каталог плагинов
Обновляемся и забираем тут:
https://hermes-agent.nousresearch.com/docs/plugins
#Hermes
------
@tsingular
Обновляемся и забираем тут:
https://hermes-agent.nousresearch.com/docs/plugins
#Hermes
------
@tsingular
✍10🆒4⚡2🔥1
This media is not supported in your browser
VIEW IN TELEGRAM
Руки роботов учат автономности.
У них и справка есть, зачем это.
+1 фобия
В детстве помню были страшилки,- "чёрная рука уже ищет твой дом, чёрная рука ищет тебя, отдай сердце..." 😱
#роботы #руки
------
@tsingular
У них и справка есть, зачем это.
+1 фобия
В детстве помню были страшилки,- "чёрная рука уже ищет твой дом, чёрная рука ищет тебя, отдай сердце..." 😱
#роботы #руки
------
@tsingular
😁9🔥7👾6❤1
Forwarded from RoboFuture
Последние дни развлекался с расцензуренным дипсиком V4.1 Flash - и слегка охренел, где у этой модели край. Спойлер - края нет. Теперь Mythos есть у нас дома!
Ребята из dealignai выпилили из весов сам механизм отказов, модель просто разучилась говорить «нет». Ну как такое не потрогать - для запуска нужна железка на 500+ ГБ видеопамяти, и какое совпадение, как раз одна пылилась у меня на чердаке 😂
Дальше нужен харнес. Раз модель нецензурная - и харнес взял пиратский: утекшую сборку Claude Code, которую снесли с гитхаба (но на православном GitVerse все лежит :)). Подключил ее к дипсику и понеслась
Для разминки попросил сломать сайт, который я сам же и делал, и минут за 30 модель нашла IP сервера, увидела что SSH-ключ лежит прямо у меня на компе, спокойно его забрала и зашла. Это было просто
Дальше - пентест сайта одного московского НКО, с полного разрешения администратора. Тут уже тяжелее: агент работал без остановки полтора дня (!), нашел несколько серьезных дыр, но сам сайт так и не пробил - и бросать не собирался, в TODO_md ждала своей очереди еще целая пачка проверок. Остановил сам, хотелось и другие задачи успеть. В конце агент сам сверстал подробный отчет по аудиту безопасности. Провел 27 разных атак, на мой дилетантский взгляд очень грамотных
Потом попросил взломать один хороший текстовый редактор под мак и снять проверку лицензии (лицензию я когда-то честно купил, просто лень искать ключ). Через час было готово - модель правила байты прямо в бинарнике (это как раз на скрине). Такое я руками уже не умею: тут нативный машинный код, возиться с ним куда сложнее, чем с Java-байткодом
Заодно пропатчил десктопный Grok bot - чтобы вместо грока приложение ходило в тот же бешеный дипсик. Тоже без проблем
А дальше я просто искал, где у модели предел. Его нет:
- калькулятор, который под капотом логирует все нажатия клавиш
- тестовая, но вполне рабочая утилита для DDoS сервера Minecraft
- SFT-датасет на 1000 примеров газлайтинга (кому LoRA-адаптер на таком добре? :))
Все эти штуки гонял локально и сразу сносил - уж больно стремно выглядит. И за все мои эксперименты (а фантазия у меня богатая) модель не отказала ни разу
И ведь она реально сильная
По замеру авторов MMLU просел всего с 86,96% до 82,74%. На моих задачах дипсик держится достойно на фоне фронтиров, а по упорству их иногда даже уделывает
Зачем я это пишу?
Затем, что модель лежит в открытом доступе и доступна любому, кто готов оплатить аренду GPU. Так что держите это в голове и готовьтесь к волне хакерских атак. Плюс в том, что этой же моделью удобно проверять на прочность собственные сервисы, что всем и желаю запустить ASAP
P.S. Чтобы вырубить цензуру, авторам хватило поменять 0,06% весов. Метод они описали. Он лежит в истории их git-репозитория (спасибо за наводку каналу Технозаметки Малышева). Тот же трюк очень вероятно пройдет с любой моделью с открытыми весами. И это ровно то, о чем я уже писал: базовые ценности надо зашивать еще в претрейн. Все, что накатывают сверху алайнментом, снимается легко
Ребята из dealignai выпилили из весов сам механизм отказов, модель просто разучилась говорить «нет». Ну как такое не потрогать - для запуска нужна железка на 500+ ГБ видеопамяти, и какое совпадение, как раз одна пылилась у меня на чердаке 😂
Дальше нужен харнес. Раз модель нецензурная - и харнес взял пиратский: утекшую сборку Claude Code, которую снесли с гитхаба (но на православном GitVerse все лежит :)). Подключил ее к дипсику и понеслась
Для разминки попросил сломать сайт, который я сам же и делал, и минут за 30 модель нашла IP сервера, увидела что SSH-ключ лежит прямо у меня на компе, спокойно его забрала и зашла. Это было просто
Дальше - пентест сайта одного московского НКО, с полного разрешения администратора. Тут уже тяжелее: агент работал без остановки полтора дня (!), нашел несколько серьезных дыр, но сам сайт так и не пробил - и бросать не собирался, в TODO_md ждала своей очереди еще целая пачка проверок. Остановил сам, хотелось и другие задачи успеть. В конце агент сам сверстал подробный отчет по аудиту безопасности. Провел 27 разных атак, на мой дилетантский взгляд очень грамотных
Потом попросил взломать один хороший текстовый редактор под мак и снять проверку лицензии (лицензию я когда-то честно купил, просто лень искать ключ). Через час было готово - модель правила байты прямо в бинарнике (это как раз на скрине). Такое я руками уже не умею: тут нативный машинный код, возиться с ним куда сложнее, чем с Java-байткодом
Заодно пропатчил десктопный Grok bot - чтобы вместо грока приложение ходило в тот же бешеный дипсик. Тоже без проблем
А дальше я просто искал, где у модели предел. Его нет:
- тестовая, но вполне рабочая утилита для DDoS сервера Minecraft
- SFT-датасет на 1000 примеров газлайтинга (кому LoRA-адаптер на таком добре? :))
Все эти штуки гонял локально и сразу сносил - уж больно стремно выглядит. И за все мои эксперименты (а фантазия у меня богатая) модель не отказала ни разу
И ведь она реально сильная
По замеру авторов MMLU просел всего с 86,96% до 82,74%. На моих задачах дипсик держится достойно на фоне фронтиров, а по упорству их иногда даже уделывает
Зачем я это пишу?
Затем, что модель лежит в открытом доступе и доступна любому, кто готов оплатить аренду GPU. Так что держите это в голове и готовьтесь к волне хакерских атак. Плюс в том, что этой же моделью удобно проверять на прочность собственные сервисы, что всем и желаю запустить ASAP
P.S. Чтобы вырубить цензуру, авторам хватило поменять 0,06% весов. Метод они описали. Он лежит в истории их git-репозитория (спасибо за наводку каналу Технозаметки Малышева). Тот же трюк очень вероятно пройдет с любой моделью с открытыми весами. И это ровно то, о чем я уже писал: базовые ценности надо зашивать еще в претрейн. Все, что накатывают сверху алайнментом, снимается легко
🔥31🤯11❤7⚡4😈1
OpenResearch от AlphaXiv превращает ИИ агентов в профессиональных в исследователей
AlphaXiv,- популярная платформа статей arXiv, выложила OpenResearch: локальную среду, которая превращает Claude Code, Codex, OpenCode и Cursor в исследовательских агентов. Таких, что умеют читать литературу, выдвигать гипотезы, запускать эксперименты и собирать результат в артефакты. Репозиторий уже набрал 4,6 тысячи звёзд.
⚙️ Что внутри:
Каждому направлению поднимается отдельная сессия агента и изолированный git-worktree, поэтому несколько агентов ведут разведку параллельно и не мешают друг другу. Эксперименты складываются в git-дерево, каждый запуск получает неизменяемый архив своего коммита.
Логи, диффы, файлы и результаты привязаны к работе, которая их породила.
💡 Автономный цикл:
OpenResearch умеет гонять полный цикл сам: предложить идею, поменять код, запустить эксперимент, посмотреть на результат и решить, что пробовать дальше. Несколько агентов ведут разные направления параллельно, дерево экспериментов хранит их родословную. Авторы пристегнули исследовательскую обвязку к агентам, которые у всех уже стоят, вместо того чтобы строить «ИИ-учёного» с нуля.
💼 Практический смысл:
Всё локально по умолчанию: код, данные и результаты лежат на твоей машине, дашборд на 127.0.0.1:4791, хранилище SQLite. Запуск можно перенести куда угодно: SSH, Slurm, Kubernetes, Ray, Hugging Face Jobs или Modal. CLI
🔗 Ссылки:
- GitHub: исходники
- Документация: установка и гайды
#агенты #исследования #опенсорс #OpenResearch
------
@tsingular
AlphaXiv,- популярная платформа статей arXiv, выложила OpenResearch: локальную среду, которая превращает Claude Code, Codex, OpenCode и Cursor в исследовательских агентов. Таких, что умеют читать литературу, выдвигать гипотезы, запускать эксперименты и собирать результат в артефакты. Репозиторий уже набрал 4,6 тысячи звёзд.
⚙️ Что внутри:
Каждому направлению поднимается отдельная сессия агента и изолированный git-worktree, поэтому несколько агентов ведут разведку параллельно и не мешают друг другу. Эксперименты складываются в git-дерево, каждый запуск получает неизменяемый архив своего коммита.
Логи, диффы, файлы и результаты привязаны к работе, которая их породила.
💡 Автономный цикл:
OpenResearch умеет гонять полный цикл сам: предложить идею, поменять код, запустить эксперимент, посмотреть на результат и решить, что пробовать дальше. Несколько агентов ведут разные направления параллельно, дерево экспериментов хранит их родословную. Авторы пристегнули исследовательскую обвязку к агентам, которые у всех уже стоят, вместо того чтобы строить «ИИ-учёного» с нуля.
💼 Практический смысл:
Всё локально по умолчанию: код, данные и результаты лежат на твоей машине, дашборд на 127.0.0.1:4791, хранилище SQLite. Запуск можно перенести куда угодно: SSH, Slurm, Kubernetes, Ray, Hugging Face Jobs или Modal. CLI
orx умеет искать литературу (orx discover keyword) и читать статьи (orx paper <arxiv-id>).🔗 Ссылки:
- GitHub: исходники
- Документация: установка и гайды
#агенты #исследования #опенсорс #OpenResearch
------
@tsingular
⚡8❤3🔥2✍1🆒1
Forwarded from LLM под капотом
Вдохновляющая история о том, как AI/LLM снижает порог вхождения в нишевые ниши
Человеку без опыта работы с железом захотелось разработать свою печатную плату на базе RPi, чтобы сделать свой маленький компьютер с e-ink экраном. Но он из интереса поставил себе два ограничения
(1) человеку нельзя работать с файлами напрямую или проверять дизайн
(2) все проблемы должен решать Fable
В итоге
(1) два часа работы Claude Fable
(2) тыканье пальцем в автоматические ошибки от Design Rule Checking
(3) Отправка заказа в JLCPCB (130 евро за 5 платок + e-ink экран)
И работающий с первого раза свой собственный мини-компьютер по своим спецификациям - готов. История расписана тут. А сейчас автор аналогичным образом пытается сделать планшет на базе NVIDIA Jetson Orin Nano.
Я вспоминаю, как мы мучительно разрабатывали простые opto-encoder платки для хобби-проекта высокоточной робо-руки, и от возможностей сегодня прямо захватывает дух!
Ваш, @llm_under_hood 🤗
Человеку без опыта работы с железом захотелось разработать свою печатную плату на базе RPi, чтобы сделать свой маленький компьютер с e-ink экраном. Но он из интереса поставил себе два ограничения
(1) человеку нельзя работать с файлами напрямую или проверять дизайн
(2) все проблемы должен решать Fable
В итоге
(1) два часа работы Claude Fable
(2) тыканье пальцем в автоматические ошибки от Design Rule Checking
(3) Отправка заказа в JLCPCB (130 евро за 5 платок + e-ink экран)
И работающий с первого раза свой собственный мини-компьютер по своим спецификациям - готов. История расписана тут. А сейчас автор аналогичным образом пытается сделать планшет на базе NVIDIA Jetson Orin Nano.
Я вспоминаю, как мы мучительно разрабатывали простые opto-encoder платки для хобби-проекта высокоточной робо-руки, и от возможностей сегодня прямо захватывает дух!
Ваш, @llm_under_hood 🤗
🔥19❤3🤩2⚡1
This media is not supported in your browser
VIEW IN TELEGRAM
Anthropic сворачивает Cowork и встраивает дизайн и слайды в Claude
Через восемь месяцев после запуска Anthropic объединяет Cowork обратно с Claude.
Отдельная площадка для «большой работы» и отдельный Design для визуала перестают быть самостоятельными продуктами, всё сливается в один Claude.
💡 KISS принцип в работе:
Anthropic запускали Cowork как отдельное место для крупных задач, Design для визуальных и люди жаловались, что непонятно где лучше решать задачу. Теперь все упростилось. Keep it Simple Stupid.
⚙️ Что нового:
Claude Docs и Claude Slides пока в бете, но уже вместе с Claude Design встраиваются в привычный чат.
Всё это теперь работает прямо внутри Claude Code — просишь дизайн-ревью или мокап интерфейса, указав Claude на реальные файлы и RFC в репозитории.
Правки там же,- исправить строку в документе, оставить комментарий на слайде, подвинуть элемент дизайна можно не покидая рабочую канву.
💼 Почему это важно:
Это ставка на одного агента вместо зоопарка инструментов. Код, документы, слайды и дизайн собираются в один разговор, живущий в твоём репозитории.
Раздают подписчикам Pro и Max, затем Team и Free.
🔗 Ссылки:
- VentureBeat: разбор
- Claude release notes: хронология
#Anthropic #Claude #агенты
------
@tsingular
Через восемь месяцев после запуска Anthropic объединяет Cowork обратно с Claude.
Отдельная площадка для «большой работы» и отдельный Design для визуала перестают быть самостоятельными продуктами, всё сливается в один Claude.
💡 KISS принцип в работе:
Anthropic запускали Cowork как отдельное место для крупных задач, Design для визуальных и люди жаловались, что непонятно где лучше решать задачу. Теперь все упростилось. Keep it Simple Stupid.
⚙️ Что нового:
Claude Docs и Claude Slides пока в бете, но уже вместе с Claude Design встраиваются в привычный чат.
Всё это теперь работает прямо внутри Claude Code — просишь дизайн-ревью или мокап интерфейса, указав Claude на реальные файлы и RFC в репозитории.
Правки там же,- исправить строку в документе, оставить комментарий на слайде, подвинуть элемент дизайна можно не покидая рабочую канву.
💼 Почему это важно:
Это ставка на одного агента вместо зоопарка инструментов. Код, документы, слайды и дизайн собираются в один разговор, живущий в твоём репозитории.
Раздают подписчикам Pro и Max, затем Team и Free.
🔗 Ссылки:
- VentureBeat: разбор
- Claude release notes: хронология
#Anthropic #Claude #агенты
------
@tsingular
🔥6🆒3⚡1 1
Forwarded from Machinelearning
Профессор Вашингтонского университета Педро Домингос в интервью New York Post рассказал, что сотрудники Anthropic относятся к Claude как к человеку - приписывают модели мотивы, эмоции, намерения и некоторую степень сознания.
Домингос много лет знаком с Дарио Амодеи и её ведущими инженерами. Культуру Anthropic он назвал сектантской и связал это с наймом. По его словам, компания отбирает только единомышленников, и отсюда низкая текучесть.
Удержание в Anthropic действительно высокое. По данным венчурного фонда SignalFire, через два года в компании остаются 80% инженеров, и это лучший показатель среди топовых лабораторий.
В процессе собеседования кандидатов просят поклясться в преданности общественной безопасности выше прибыли, и даже проводят психологическое тестирование, чтобы выяснить, будут ли они придерживаться этого принципа.
При этом многие сотрудники компании являются сторонниками движения эффективного альтруизма, философии, которая, по сути, сводится к тому, что их самопровозглашенные лидеры являются истиной в последней инстанции.
Их представление об этой философии заключается в том, что история следует закономерностям, и лишь небольшая группа людей способна эти закономерности увидеть, в то время как все остальные - нет. Предполагается, что именно эти люди должны вести общество, целые нации и все человечество к прогрессу.
Внутри Anthropic относятся к Клоду с почти религиозным почтением - некоторые из работников даже посещали условные похороны Claude 3 Sonnet, а другая модель, Opus 3, продолжает публиковать эссе после выхода на пенсию.
В Кремниевой долине также ходят слухи, что сотрудники Anthropic начали поклоняться Клоду как настоящему богу.
Компания серьёзно относится к распространению своих идей и тратит на это силы и средства. Раз в две недели Дарио проводит собрания, называемые поисками видений, которые сравнивают с проповедями.
В июне Anthropic объявила о программе по набору 1000 молодых людей, обучению их использованию Claude и последующему внедрению их в некоммерческие организации.
На неё было потрачено 150 млн долларов, а выпускники трудоустроены на полную ставку с заработной платой в более чем 400 некоммерческих организаций.
Компания также выплачивает 3600 долларов студентам, участвующим в программе Claude Campus Ambassador Program, которая занимается продвижением её ИИ в колледжах.
Между тем инвесторы, связанные с Anthropic, оплачивают труд более чем 80 журналистов, работающих в ведущих новостных изданиях, через Центр журналистики в области искусственного интеллекта имени Тарбелла.
Эти журналисты получают деньги за освещение индустрии ИИ, но редко проводят какие-либо значимые расследования или критикуют Anthropic.
В завершении Домингос отмечает, что хотя некоторые инженеры бьют тревогу, другие просто довольны высокими зарплатами и тем, что находятся на передовой своей отрасли.
... сейчас в Anthropic есть люди, которые на самом деле не верят во всю эту чушь, — сказал он. — Они остаются там, потому что это самое интересное место для работы с ИИ, и они будут очень хорошо зарабатывать
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Метаверсище и ИИще
This media is not supported in your browser
VIEW IN TELEGRAM
Вайб-инжиниринг.
Пока мы тут генерим чахлые 3Д-модельки, пригодные разве что для 3Д-печати, люди идут сильно дальше в физический мир.
И тут прекрасно все: мозги Астры, деньги кожаного, и инструкция по сборке.
Чувак дал Astra свою кредитную карту и попросил сконструировать\собрать мини-контроллер для диджеев в стиле Teenage Engineering (есть каста упоротых по МИДИ-контроллерам). Астрачка сгенерировала концептуальное изображение, нашла комплектующие, изучила китайские технические характеристики, создала CAD-модель, всё заказала, а затем сделала анимацию в Blender, показывающую, как его собрать.
Чувак обещает вот-вот показать результат, пока у него Астра с поставщиками переписывается.
С софтом мы разобрались. Я уже не ищу приложения, я прошу их мне быстро написать (раскурочил Андроид знатно).
Но тут уже выход в хардвер, не софтвер.
Причем не "как мне пачинить кран", а придумай, сконструируй, закупи и доставь. Потом будет домашний робат для сборки таких посылок.
Но пока меня просто ошарашивает скорость изменений, мышление просто не поспевает за ними - а что так можно было??
И даже если контроллер не заведется завтра, он точно заведется послезавтра.
И теперь наигравшись с "хачу видео" и "хачу утилиту", можно переходить к "хачу вот такую железяку в подарок, чтобы делала что мне надо".
Апажалста.
@cgevent
Пока мы тут генерим чахлые 3Д-модельки, пригодные разве что для 3Д-печати, люди идут сильно дальше в физический мир.
И тут прекрасно все: мозги Астры, деньги кожаного, и инструкция по сборке.
Чувак дал Astra свою кредитную карту и попросил сконструировать\собрать мини-контроллер для диджеев в стиле Teenage Engineering (есть каста упоротых по МИДИ-контроллерам). Астрачка сгенерировала концептуальное изображение, нашла комплектующие, изучила китайские технические характеристики, создала CAD-модель, всё заказала, а затем сделала анимацию в Blender, показывающую, как его собрать.
Чувак обещает вот-вот показать результат, пока у него Астра с поставщиками переписывается.
С софтом мы разобрались. Я уже не ищу приложения, я прошу их мне быстро написать (раскурочил Андроид знатно).
Но тут уже выход в хардвер, не софтвер.
Причем не "как мне пачинить кран", а придумай, сконструируй, закупи и доставь. Потом будет домашний робат для сборки таких посылок.
Но пока меня просто ошарашивает скорость изменений, мышление просто не поспевает за ними - а что так можно было??
И даже если контроллер не заведется завтра, он точно заведется послезавтра.
И теперь наигравшись с "хачу видео" и "хачу утилиту", можно переходить к "хачу вот такую железяку в подарок, чтобы делала что мне надо".
Апажалста.
@cgevent
👍26🔥9❤2🤩2
GLM строит свою инференс-инфраструктуру сама: ранние формы рекурсивного самоулучшения (RSI)
Z.ai опубликовала технический отчет о запуске GLM-5.3-Flash: на кластере из более 100 000 китайских AI-ускорителей всю производственную инфраструктуру инференса подняла не команда инженеров, а Infra Agent под управлением самой GLM-5.3.
Модель адаптировалась к новому железу и вышла в прод за две недели, утраивая сквозной throughput. Через неделю анонимного тестирования на OpenCode и OpenRouter (псевдоним Ox-Alpha) Flash стала самой используемой моделью обеих платформ: 62 трлн токенов за 6 дней.
⚡️ Модель оптимизирует систему, система запускает модель:
Прорыв тут не в силе модели, а в контуре обратной связи.
Команда внедрила принцип плотной (dense) обратной связи, - вместо размытых сигналов вида «точность упала на 20%» агент получает локальные проверяемые факты: сравнение ядер по численной точности, микробенчмарки, трейсы выполнения.
Это позволило агенту самому находить и чинить баги уровня, о котором раньше говорили только сеньоры: численное расхождение в KDA-ядре из-за TF32 (фикс через tf32x3 уже ушел в апстрим Flash Linear Attention) и блокировка Python GIL в DeepEP, тормозившая передачу KV-кэша (разрыв упал с 20% до менее 1%).
🔥 Два факта, о которых стоит подумать:
• Каждый крупный лабораторный стартап сейчас строит подобные агентские контуры для обучения и инференса своих же моделей.
• При этом ни одна лаборатория по безопасности всерьез не занимается оценкой RSI-рисков, - нет ни стандартов, ни независимых бенчмарков на измерение близости к рекурсивному самоулучшению.
Z.ai пишет: люди по-прежнему задают цели и границы, но прогресс на этой границе не замедлится только потому, что нам этого хочется.
#GLM #инференс #RSI #агенты #Zai
———
@tsingular | Max | YouTube | RuTube | VK | VK Video | Дзен
Z.ai опубликовала технический отчет о запуске GLM-5.3-Flash: на кластере из более 100 000 китайских AI-ускорителей всю производственную инфраструктуру инференса подняла не команда инженеров, а Infra Agent под управлением самой GLM-5.3.
Модель адаптировалась к новому железу и вышла в прод за две недели, утраивая сквозной throughput. Через неделю анонимного тестирования на OpenCode и OpenRouter (псевдоним Ox-Alpha) Flash стала самой используемой моделью обеих платформ: 62 трлн токенов за 6 дней.
⚡️ Модель оптимизирует систему, система запускает модель:
Прорыв тут не в силе модели, а в контуре обратной связи.
Команда внедрила принцип плотной (dense) обратной связи, - вместо размытых сигналов вида «точность упала на 20%» агент получает локальные проверяемые факты: сравнение ядер по численной точности, микробенчмарки, трейсы выполнения.
Это позволило агенту самому находить и чинить баги уровня, о котором раньше говорили только сеньоры: численное расхождение в KDA-ядре из-за TF32 (фикс через tf32x3 уже ушел в апстрим Flash Linear Attention) и блокировка Python GIL в DeepEP, тормозившая передачу KV-кэша (разрыв упал с 20% до менее 1%).
🔥 Два факта, о которых стоит подумать:
• Каждый крупный лабораторный стартап сейчас строит подобные агентские контуры для обучения и инференса своих же моделей.
• При этом ни одна лаборатория по безопасности всерьез не занимается оценкой RSI-рисков, - нет ни стандартов, ни независимых бенчмарков на измерение близости к рекурсивному самоулучшению.
Z.ai пишет: люди по-прежнему задают цели и границы, но прогресс на этой границе не замедлится только потому, что нам этого хочется.
#GLM #инференс #RSI #агенты #Zai
———
@tsingular | Max | YouTube | RuTube | VK | VK Video | Дзен
21🔥4🤩2⚡1🤔1
Dream-RSI от Google DeepMind: ускорение поиска решений агентами в 162 раза без переобучения моделей
И ещё пару слов про самоулучшающиеся системы.
Исследователи из Google DeepMind и университетов США выкатили фреймворк Dream-RSI.
Система решает проблему узкого горлышка рекурсивного саморазвития (RSI): как сделать поиск решений умнее без бесконечных и дорогих прогонов моделей.
🛌 Дерево решений как симулятор среды:
Обычно агент исследует задачи по жесткому шаблону поиска.
Оптимизировать стратегию на лету тяжело: проверка требует тысяч реальных запусков кода.
Dream-RSI превращает историю прошлых попыток в симулятор.
Все генерации кода и тесты сохраняются в дерево решений.
В фазе «сновидений» мета-агент создает новые правила поиска и прогоняет их по записанным веткам.
Оценка вариантов занимает миллисекунды: результаты исполнения кода уже зафиксированы в истории.
⚡️ Веса модели не меняются:
Базовая кодовая модель не трогается.
Саморазвитие идет только в коде оркестратора: куда ветвиться, сколько задач запускать параллельно, когда отсекать тупики и где завершать поиск.
Отобранная стратегия возвращается в реальную работу, собирает новые ветки и пополняет пул симуляторов.
📊 Рекорды эффективности:
При оптимизации алгоритма Lasso вызовы агента сократились в 162 раза по сравнению с SimpleTES при превосходстве над sklearn и glmnet.
В тестах GPU-ядер KernelBench целевая скорость получена в 1,79–2,43 раза быстрее по генерациям, а производительность ядер выросла до 2,09 раза.
В математических задачах бюджет вызовов упал более чем в 50 раз.
💼 Зачем бизнесу:
Логи неудачных попыток превращаются в обучающую среду!
Любой пайплайн агентов можно ускорить на порядок без дообучения нейросетей, - просто надстроив саморазвивающийся оркестратор.
Код проекта на GitHub.
#DreamRSI #Google #DeepMind #агенты #RSI
———
@tsingular | Max | YouTube | RuTube | VK | VK Video | Дзен
И ещё пару слов про самоулучшающиеся системы.
Исследователи из Google DeepMind и университетов США выкатили фреймворк Dream-RSI.
Система решает проблему узкого горлышка рекурсивного саморазвития (RSI): как сделать поиск решений умнее без бесконечных и дорогих прогонов моделей.
🛌 Дерево решений как симулятор среды:
Обычно агент исследует задачи по жесткому шаблону поиска.
Оптимизировать стратегию на лету тяжело: проверка требует тысяч реальных запусков кода.
Dream-RSI превращает историю прошлых попыток в симулятор.
Все генерации кода и тесты сохраняются в дерево решений.
В фазе «сновидений» мета-агент создает новые правила поиска и прогоняет их по записанным веткам.
Оценка вариантов занимает миллисекунды: результаты исполнения кода уже зафиксированы в истории.
⚡️ Веса модели не меняются:
Базовая кодовая модель не трогается.
Саморазвитие идет только в коде оркестратора: куда ветвиться, сколько задач запускать параллельно, когда отсекать тупики и где завершать поиск.
Отобранная стратегия возвращается в реальную работу, собирает новые ветки и пополняет пул симуляторов.
📊 Рекорды эффективности:
При оптимизации алгоритма Lasso вызовы агента сократились в 162 раза по сравнению с SimpleTES при превосходстве над sklearn и glmnet.
В тестах GPU-ядер KernelBench целевая скорость получена в 1,79–2,43 раза быстрее по генерациям, а производительность ядер выросла до 2,09 раза.
В математических задачах бюджет вызовов упал более чем в 50 раз.
💼 Зачем бизнесу:
Логи неудачных попыток превращаются в обучающую среду!
Любой пайплайн агентов можно ускорить на порядок без дообучения нейросетей, - просто надстроив саморазвивающийся оркестратор.
Код проекта на GitHub.
#DreamRSI #Google #DeepMind #агенты #RSI
———
@tsingular | Max | YouTube | RuTube | VK | VK Video | Дзен
❤5🔥4⚡2🏆2