Короче Jev пока больше похож на классификатор или реранкер.
Выдает наиболее подходящие ответы по JSON форме.
На этом пока всё
#Jev
------
@tsingular
Выдает наиболее подходящие ответы по JSON форме.
На этом пока всё
#Jev
------
@tsingular
✍9⚡2💯2👨💻1
Media is too big
VIEW IN TELEGRAM
В Гермес добавили каталог плагинов
Обновляемся и забираем тут:
https://hermes-agent.nousresearch.com/docs/plugins
#Hermes
------
@tsingular
Обновляемся и забираем тут:
https://hermes-agent.nousresearch.com/docs/plugins
#Hermes
------
@tsingular
✍10🆒4⚡2🔥1
This media is not supported in your browser
VIEW IN TELEGRAM
Руки роботов учат автономности.
У них и справка есть, зачем это.
+1 фобия
В детстве помню были страшилки,- "чёрная рука уже ищет твой дом, чёрная рука ищет тебя, отдай сердце..." 😱
#роботы #руки
------
@tsingular
У них и справка есть, зачем это.
+1 фобия
В детстве помню были страшилки,- "чёрная рука уже ищет твой дом, чёрная рука ищет тебя, отдай сердце..." 😱
#роботы #руки
------
@tsingular
😁11🔥7👾6❤1
Forwarded from RoboFuture
Последние дни развлекался с расцензуренным дипсиком V4.1 Flash - и слегка охренел, где у этой модели край. Спойлер - края нет. Теперь Mythos есть у нас дома!
Ребята из dealignai выпилили из весов сам механизм отказов, модель просто разучилась говорить «нет». Ну как такое не потрогать - для запуска нужна железка на 500+ ГБ видеопамяти, и какое совпадение, как раз одна пылилась у меня на чердаке 😂
Дальше нужен харнес. Раз модель нецензурная - и харнес взял пиратский: утекшую сборку Claude Code, которую снесли с гитхаба (но на православном GitVerse все лежит :)). Подключил ее к дипсику и понеслась
Для разминки попросил сломать сайт, который я сам же и делал, и минут за 30 модель нашла IP сервера, увидела что SSH-ключ лежит прямо у меня на компе, спокойно его забрала и зашла. Это было просто
Дальше - пентест сайта одного московского НКО, с полного разрешения администратора. Тут уже тяжелее: агент работал без остановки полтора дня (!), нашел несколько серьезных дыр, но сам сайт так и не пробил - и бросать не собирался, в TODO_md ждала своей очереди еще целая пачка проверок. Остановил сам, хотелось и другие задачи успеть. В конце агент сам сверстал подробный отчет по аудиту безопасности. Провел 27 разных атак, на мой дилетантский взгляд очень грамотных
Потом попросил взломать один хороший текстовый редактор под мак и снять проверку лицензии (лицензию я когда-то честно купил, просто лень искать ключ). Через час было готово - модель правила байты прямо в бинарнике (это как раз на скрине). Такое я руками уже не умею: тут нативный машинный код, возиться с ним куда сложнее, чем с Java-байткодом
Заодно пропатчил десктопный Grok bot - чтобы вместо грока приложение ходило в тот же бешеный дипсик. Тоже без проблем
А дальше я просто искал, где у модели предел. Его нет:
- калькулятор, который под капотом логирует все нажатия клавиш
- тестовая, но вполне рабочая утилита для DDoS сервера Minecraft
- SFT-датасет на 1000 примеров газлайтинга (кому LoRA-адаптер на таком добре? :))
Все эти штуки гонял локально и сразу сносил - уж больно стремно выглядит. И за все мои эксперименты (а фантазия у меня богатая) модель не отказала ни разу
И ведь она реально сильная
По замеру авторов MMLU просел всего с 86,96% до 82,74%. На моих задачах дипсик держится достойно на фоне фронтиров, а по упорству их иногда даже уделывает
Зачем я это пишу?
Затем, что модель лежит в открытом доступе и доступна любому, кто готов оплатить аренду GPU. Так что держите это в голове и готовьтесь к волне хакерских атак. Плюс в том, что этой же моделью удобно проверять на прочность собственные сервисы, что всем и желаю запустить ASAP
P.S. Чтобы вырубить цензуру, авторам хватило поменять 0,06% весов. Метод они описали. Он лежит в истории их git-репозитория (спасибо за наводку каналу Технозаметки Малышева). Тот же трюк очень вероятно пройдет с любой моделью с открытыми весами. И это ровно то, о чем я уже писал: базовые ценности надо зашивать еще в претрейн. Все, что накатывают сверху алайнментом, снимается легко
Ребята из dealignai выпилили из весов сам механизм отказов, модель просто разучилась говорить «нет». Ну как такое не потрогать - для запуска нужна железка на 500+ ГБ видеопамяти, и какое совпадение, как раз одна пылилась у меня на чердаке 😂
Дальше нужен харнес. Раз модель нецензурная - и харнес взял пиратский: утекшую сборку Claude Code, которую снесли с гитхаба (но на православном GitVerse все лежит :)). Подключил ее к дипсику и понеслась
Для разминки попросил сломать сайт, который я сам же и делал, и минут за 30 модель нашла IP сервера, увидела что SSH-ключ лежит прямо у меня на компе, спокойно его забрала и зашла. Это было просто
Дальше - пентест сайта одного московского НКО, с полного разрешения администратора. Тут уже тяжелее: агент работал без остановки полтора дня (!), нашел несколько серьезных дыр, но сам сайт так и не пробил - и бросать не собирался, в TODO_md ждала своей очереди еще целая пачка проверок. Остановил сам, хотелось и другие задачи успеть. В конце агент сам сверстал подробный отчет по аудиту безопасности. Провел 27 разных атак, на мой дилетантский взгляд очень грамотных
Потом попросил взломать один хороший текстовый редактор под мак и снять проверку лицензии (лицензию я когда-то честно купил, просто лень искать ключ). Через час было готово - модель правила байты прямо в бинарнике (это как раз на скрине). Такое я руками уже не умею: тут нативный машинный код, возиться с ним куда сложнее, чем с Java-байткодом
Заодно пропатчил десктопный Grok bot - чтобы вместо грока приложение ходило в тот же бешеный дипсик. Тоже без проблем
А дальше я просто искал, где у модели предел. Его нет:
- тестовая, но вполне рабочая утилита для DDoS сервера Minecraft
- SFT-датасет на 1000 примеров газлайтинга (кому LoRA-адаптер на таком добре? :))
Все эти штуки гонял локально и сразу сносил - уж больно стремно выглядит. И за все мои эксперименты (а фантазия у меня богатая) модель не отказала ни разу
И ведь она реально сильная
По замеру авторов MMLU просел всего с 86,96% до 82,74%. На моих задачах дипсик держится достойно на фоне фронтиров, а по упорству их иногда даже уделывает
Зачем я это пишу?
Затем, что модель лежит в открытом доступе и доступна любому, кто готов оплатить аренду GPU. Так что держите это в голове и готовьтесь к волне хакерских атак. Плюс в том, что этой же моделью удобно проверять на прочность собственные сервисы, что всем и желаю запустить ASAP
P.S. Чтобы вырубить цензуру, авторам хватило поменять 0,06% весов. Метод они описали. Он лежит в истории их git-репозитория (спасибо за наводку каналу Технозаметки Малышева). Тот же трюк очень вероятно пройдет с любой моделью с открытыми весами. И это ровно то, о чем я уже писал: базовые ценности надо зашивать еще в претрейн. Все, что накатывают сверху алайнментом, снимается легко
🔥33🤯11❤7⚡4😈1
OpenResearch от AlphaXiv превращает ИИ агентов в профессиональных в исследователей
AlphaXiv,- популярная платформа статей arXiv, выложила OpenResearch: локальную среду, которая превращает Claude Code, Codex, OpenCode и Cursor в исследовательских агентов. Таких, что умеют читать литературу, выдвигать гипотезы, запускать эксперименты и собирать результат в артефакты. Репозиторий уже набрал 4,6 тысячи звёзд.
⚙️ Что внутри:
Каждому направлению поднимается отдельная сессия агента и изолированный git-worktree, поэтому несколько агентов ведут разведку параллельно и не мешают друг другу. Эксперименты складываются в git-дерево, каждый запуск получает неизменяемый архив своего коммита.
Логи, диффы, файлы и результаты привязаны к работе, которая их породила.
💡 Автономный цикл:
OpenResearch умеет гонять полный цикл сам: предложить идею, поменять код, запустить эксперимент, посмотреть на результат и решить, что пробовать дальше. Несколько агентов ведут разные направления параллельно, дерево экспериментов хранит их родословную. Авторы пристегнули исследовательскую обвязку к агентам, которые у всех уже стоят, вместо того чтобы строить «ИИ-учёного» с нуля.
💼 Практический смысл:
Всё локально по умолчанию: код, данные и результаты лежат на твоей машине, дашборд на 127.0.0.1:4791, хранилище SQLite. Запуск можно перенести куда угодно: SSH, Slurm, Kubernetes, Ray, Hugging Face Jobs или Modal. CLI
🔗 Ссылки:
- GitHub: исходники
- Документация: установка и гайды
#агенты #исследования #опенсорс #OpenResearch
------
@tsingular
AlphaXiv,- популярная платформа статей arXiv, выложила OpenResearch: локальную среду, которая превращает Claude Code, Codex, OpenCode и Cursor в исследовательских агентов. Таких, что умеют читать литературу, выдвигать гипотезы, запускать эксперименты и собирать результат в артефакты. Репозиторий уже набрал 4,6 тысячи звёзд.
⚙️ Что внутри:
Каждому направлению поднимается отдельная сессия агента и изолированный git-worktree, поэтому несколько агентов ведут разведку параллельно и не мешают друг другу. Эксперименты складываются в git-дерево, каждый запуск получает неизменяемый архив своего коммита.
Логи, диффы, файлы и результаты привязаны к работе, которая их породила.
💡 Автономный цикл:
OpenResearch умеет гонять полный цикл сам: предложить идею, поменять код, запустить эксперимент, посмотреть на результат и решить, что пробовать дальше. Несколько агентов ведут разные направления параллельно, дерево экспериментов хранит их родословную. Авторы пристегнули исследовательскую обвязку к агентам, которые у всех уже стоят, вместо того чтобы строить «ИИ-учёного» с нуля.
💼 Практический смысл:
Всё локально по умолчанию: код, данные и результаты лежат на твоей машине, дашборд на 127.0.0.1:4791, хранилище SQLite. Запуск можно перенести куда угодно: SSH, Slurm, Kubernetes, Ray, Hugging Face Jobs или Modal. CLI
orx умеет искать литературу (orx discover keyword) и читать статьи (orx paper <arxiv-id>).🔗 Ссылки:
- GitHub: исходники
- Документация: установка и гайды
#агенты #исследования #опенсорс #OpenResearch
------
@tsingular
⚡9❤3🔥2✍1🆒1
Forwarded from LLM под капотом
Вдохновляющая история о том, как AI/LLM снижает порог вхождения в нишевые ниши
Человеку без опыта работы с железом захотелось разработать свою печатную плату на базе RPi, чтобы сделать свой маленький компьютер с e-ink экраном. Но он из интереса поставил себе два ограничения
(1) человеку нельзя работать с файлами напрямую или проверять дизайн
(2) все проблемы должен решать Fable
В итоге
(1) два часа работы Claude Fable
(2) тыканье пальцем в автоматические ошибки от Design Rule Checking
(3) Отправка заказа в JLCPCB (130 евро за 5 платок + e-ink экран)
И работающий с первого раза свой собственный мини-компьютер по своим спецификациям - готов. История расписана тут. А сейчас автор аналогичным образом пытается сделать планшет на базе NVIDIA Jetson Orin Nano.
Я вспоминаю, как мы мучительно разрабатывали простые opto-encoder платки для хобби-проекта высокоточной робо-руки, и от возможностей сегодня прямо захватывает дух!
Ваш, @llm_under_hood 🤗
Человеку без опыта работы с железом захотелось разработать свою печатную плату на базе RPi, чтобы сделать свой маленький компьютер с e-ink экраном. Но он из интереса поставил себе два ограничения
(1) человеку нельзя работать с файлами напрямую или проверять дизайн
(2) все проблемы должен решать Fable
В итоге
(1) два часа работы Claude Fable
(2) тыканье пальцем в автоматические ошибки от Design Rule Checking
(3) Отправка заказа в JLCPCB (130 евро за 5 платок + e-ink экран)
И работающий с первого раза свой собственный мини-компьютер по своим спецификациям - готов. История расписана тут. А сейчас автор аналогичным образом пытается сделать планшет на базе NVIDIA Jetson Orin Nano.
Я вспоминаю, как мы мучительно разрабатывали простые opto-encoder платки для хобби-проекта высокоточной робо-руки, и от возможностей сегодня прямо захватывает дух!
Ваш, @llm_under_hood 🤗
🔥22❤4⚡2🤩2
This media is not supported in your browser
VIEW IN TELEGRAM
Anthropic сворачивает Cowork и встраивает дизайн и слайды в Claude
Через восемь месяцев после запуска Anthropic объединяет Cowork обратно с Claude.
Отдельная площадка для «большой работы» и отдельный Design для визуала перестают быть самостоятельными продуктами, всё сливается в один Claude.
💡 KISS принцип в работе:
Anthropic запускали Cowork как отдельное место для крупных задач, Design для визуальных и люди жаловались, что непонятно где лучше решать задачу. Теперь все упростилось. Keep it Simple Stupid.
⚙️ Что нового:
Claude Docs и Claude Slides пока в бете, но уже вместе с Claude Design встраиваются в привычный чат.
Всё это теперь работает прямо внутри Claude Code — просишь дизайн-ревью или мокап интерфейса, указав Claude на реальные файлы и RFC в репозитории.
Правки там же,- исправить строку в документе, оставить комментарий на слайде, подвинуть элемент дизайна можно не покидая рабочую канву.
💼 Почему это важно:
Это ставка на одного агента вместо зоопарка инструментов. Код, документы, слайды и дизайн собираются в один разговор, живущий в твоём репозитории.
Раздают подписчикам Pro и Max, затем Team и Free.
🔗 Ссылки:
- VentureBeat: разбор
- Claude release notes: хронология
#Anthropic #Claude #агенты
------
@tsingular
Через восемь месяцев после запуска Anthropic объединяет Cowork обратно с Claude.
Отдельная площадка для «большой работы» и отдельный Design для визуала перестают быть самостоятельными продуктами, всё сливается в один Claude.
💡 KISS принцип в работе:
Anthropic запускали Cowork как отдельное место для крупных задач, Design для визуальных и люди жаловались, что непонятно где лучше решать задачу. Теперь все упростилось. Keep it Simple Stupid.
⚙️ Что нового:
Claude Docs и Claude Slides пока в бете, но уже вместе с Claude Design встраиваются в привычный чат.
Всё это теперь работает прямо внутри Claude Code — просишь дизайн-ревью или мокап интерфейса, указав Claude на реальные файлы и RFC в репозитории.
Правки там же,- исправить строку в документе, оставить комментарий на слайде, подвинуть элемент дизайна можно не покидая рабочую канву.
💼 Почему это важно:
Это ставка на одного агента вместо зоопарка инструментов. Код, документы, слайды и дизайн собираются в один разговор, живущий в твоём репозитории.
Раздают подписчикам Pro и Max, затем Team и Free.
🔗 Ссылки:
- VentureBeat: разбор
- Claude release notes: хронология
#Anthropic #Claude #агенты
------
@tsingular
🔥8🆒3⚡1 1
Forwarded from Machinelearning
Профессор Вашингтонского университета Педро Домингос в интервью New York Post рассказал, что сотрудники Anthropic относятся к Claude как к человеку - приписывают модели мотивы, эмоции, намерения и некоторую степень сознания.
Домингос много лет знаком с Дарио Амодеи и её ведущими инженерами. Культуру Anthropic он назвал сектантской и связал это с наймом. По его словам, компания отбирает только единомышленников, и отсюда низкая текучесть.
Удержание в Anthropic действительно высокое. По данным венчурного фонда SignalFire, через два года в компании остаются 80% инженеров, и это лучший показатель среди топовых лабораторий.
В процессе собеседования кандидатов просят поклясться в преданности общественной безопасности выше прибыли, и даже проводят психологическое тестирование, чтобы выяснить, будут ли они придерживаться этого принципа.
При этом многие сотрудники компании являются сторонниками движения эффективного альтруизма, философии, которая, по сути, сводится к тому, что их самопровозглашенные лидеры являются истиной в последней инстанции.
Их представление об этой философии заключается в том, что история следует закономерностям, и лишь небольшая группа людей способна эти закономерности увидеть, в то время как все остальные - нет. Предполагается, что именно эти люди должны вести общество, целые нации и все человечество к прогрессу.
Внутри Anthropic относятся к Клоду с почти религиозным почтением - некоторые из работников даже посещали условные похороны Claude 3 Sonnet, а другая модель, Opus 3, продолжает публиковать эссе после выхода на пенсию.
В Кремниевой долине также ходят слухи, что сотрудники Anthropic начали поклоняться Клоду как настоящему богу.
Компания серьёзно относится к распространению своих идей и тратит на это силы и средства. Раз в две недели Дарио проводит собрания, называемые поисками видений, которые сравнивают с проповедями.
В июне Anthropic объявила о программе по набору 1000 молодых людей, обучению их использованию Claude и последующему внедрению их в некоммерческие организации.
На неё было потрачено 150 млн долларов, а выпускники трудоустроены на полную ставку с заработной платой в более чем 400 некоммерческих организаций.
Компания также выплачивает 3600 долларов студентам, участвующим в программе Claude Campus Ambassador Program, которая занимается продвижением её ИИ в колледжах.
Между тем инвесторы, связанные с Anthropic, оплачивают труд более чем 80 журналистов, работающих в ведущих новостных изданиях, через Центр журналистики в области искусственного интеллекта имени Тарбелла.
Эти журналисты получают деньги за освещение индустрии ИИ, но редко проводят какие-либо значимые расследования или критикуют Anthropic.
В завершении Домингос отмечает, что хотя некоторые инженеры бьют тревогу, другие просто довольны высокими зарплатами и тем, что находятся на передовой своей отрасли.
... сейчас в Anthropic есть люди, которые на самом деле не верят во всю эту чушь, — сказал он. — Они остаются там, потому что это самое интересное место для работы с ИИ, и они будут очень хорошо зарабатывать
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Метаверсище и ИИще
This media is not supported in your browser
VIEW IN TELEGRAM
Вайб-инжиниринг.
Пока мы тут генерим чахлые 3Д-модельки, пригодные разве что для 3Д-печати, люди идут сильно дальше в физический мир.
И тут прекрасно все: мозги Астры, деньги кожаного, и инструкция по сборке.
Чувак дал Astra свою кредитную карту и попросил сконструировать\собрать мини-контроллер для диджеев в стиле Teenage Engineering (есть каста упоротых по МИДИ-контроллерам). Астрачка сгенерировала концептуальное изображение, нашла комплектующие, изучила китайские технические характеристики, создала CAD-модель, всё заказала, а затем сделала анимацию в Blender, показывающую, как его собрать.
Чувак обещает вот-вот показать результат, пока у него Астра с поставщиками переписывается.
С софтом мы разобрались. Я уже не ищу приложения, я прошу их мне быстро написать (раскурочил Андроид знатно).
Но тут уже выход в хардвер, не софтвер.
Причем не "как мне пачинить кран", а придумай, сконструируй, закупи и доставь. Потом будет домашний робат для сборки таких посылок.
Но пока меня просто ошарашивает скорость изменений, мышление просто не поспевает за ними - а что так можно было??
И даже если контроллер не заведется завтра, он точно заведется послезавтра.
И теперь наигравшись с "хачу видео" и "хачу утилиту", можно переходить к "хачу вот такую железяку в подарок, чтобы делала что мне надо".
Апажалста.
@cgevent
Пока мы тут генерим чахлые 3Д-модельки, пригодные разве что для 3Д-печати, люди идут сильно дальше в физический мир.
И тут прекрасно все: мозги Астры, деньги кожаного, и инструкция по сборке.
Чувак дал Astra свою кредитную карту и попросил сконструировать\собрать мини-контроллер для диджеев в стиле Teenage Engineering (есть каста упоротых по МИДИ-контроллерам). Астрачка сгенерировала концептуальное изображение, нашла комплектующие, изучила китайские технические характеристики, создала CAD-модель, всё заказала, а затем сделала анимацию в Blender, показывающую, как его собрать.
Чувак обещает вот-вот показать результат, пока у него Астра с поставщиками переписывается.
С софтом мы разобрались. Я уже не ищу приложения, я прошу их мне быстро написать (раскурочил Андроид знатно).
Но тут уже выход в хардвер, не софтвер.
Причем не "как мне пачинить кран", а придумай, сконструируй, закупи и доставь. Потом будет домашний робат для сборки таких посылок.
Но пока меня просто ошарашивает скорость изменений, мышление просто не поспевает за ними - а что так можно было??
И даже если контроллер не заведется завтра, он точно заведется послезавтра.
И теперь наигравшись с "хачу видео" и "хачу утилиту", можно переходить к "хачу вот такую железяку в подарок, чтобы делала что мне надо".
Апажалста.
@cgevent
👍31🔥12❤2🤩2
GLM строит свою инференс-инфраструктуру сама: ранние формы рекурсивного самоулучшения (RSI)
Z.ai опубликовала технический отчет о запуске GLM-5.3-Flash: на кластере из более 100 000 китайских AI-ускорителей всю производственную инфраструктуру инференса подняла не команда инженеров, а Infra Agent под управлением самой GLM-5.3.
Модель адаптировалась к новому железу и вышла в прод за две недели, утраивая сквозной throughput. Через неделю анонимного тестирования на OpenCode и OpenRouter (псевдоним Ox-Alpha) Flash стала самой используемой моделью обеих платформ: 62 трлн токенов за 6 дней.
⚡️ Модель оптимизирует систему, система запускает модель:
Прорыв тут не в силе модели, а в контуре обратной связи.
Команда внедрила принцип плотной (dense) обратной связи, - вместо размытых сигналов вида «точность упала на 20%» агент получает локальные проверяемые факты: сравнение ядер по численной точности, микробенчмарки, трейсы выполнения.
Это позволило агенту самому находить и чинить баги уровня, о котором раньше говорили только сеньоры: численное расхождение в KDA-ядре из-за TF32 (фикс через tf32x3 уже ушел в апстрим Flash Linear Attention) и блокировка Python GIL в DeepEP, тормозившая передачу KV-кэша (разрыв упал с 20% до менее 1%).
🔥 Два факта, о которых стоит подумать:
• Каждый крупный лабораторный стартап сейчас строит подобные агентские контуры для обучения и инференса своих же моделей.
• При этом ни одна лаборатория по безопасности всерьез не занимается оценкой RSI-рисков, - нет ни стандартов, ни независимых бенчмарков на измерение близости к рекурсивному самоулучшению.
Z.ai пишет: люди по-прежнему задают цели и границы, но прогресс на этой границе не замедлится только потому, что нам этого хочется.
#GLM #инференс #RSI #агенты #Zai
———
@tsingular | Max | YouTube | RuTube | VK | VK Video | Дзен
Z.ai опубликовала технический отчет о запуске GLM-5.3-Flash: на кластере из более 100 000 китайских AI-ускорителей всю производственную инфраструктуру инференса подняла не команда инженеров, а Infra Agent под управлением самой GLM-5.3.
Модель адаптировалась к новому железу и вышла в прод за две недели, утраивая сквозной throughput. Через неделю анонимного тестирования на OpenCode и OpenRouter (псевдоним Ox-Alpha) Flash стала самой используемой моделью обеих платформ: 62 трлн токенов за 6 дней.
⚡️ Модель оптимизирует систему, система запускает модель:
Прорыв тут не в силе модели, а в контуре обратной связи.
Команда внедрила принцип плотной (dense) обратной связи, - вместо размытых сигналов вида «точность упала на 20%» агент получает локальные проверяемые факты: сравнение ядер по численной точности, микробенчмарки, трейсы выполнения.
Это позволило агенту самому находить и чинить баги уровня, о котором раньше говорили только сеньоры: численное расхождение в KDA-ядре из-за TF32 (фикс через tf32x3 уже ушел в апстрим Flash Linear Attention) и блокировка Python GIL в DeepEP, тормозившая передачу KV-кэша (разрыв упал с 20% до менее 1%).
🔥 Два факта, о которых стоит подумать:
• Каждый крупный лабораторный стартап сейчас строит подобные агентские контуры для обучения и инференса своих же моделей.
• При этом ни одна лаборатория по безопасности всерьез не занимается оценкой RSI-рисков, - нет ни стандартов, ни независимых бенчмарков на измерение близости к рекурсивному самоулучшению.
Z.ai пишет: люди по-прежнему задают цели и границы, но прогресс на этой границе не замедлится только потому, что нам этого хочется.
#GLM #инференс #RSI #агенты #Zai
———
@tsingular | Max | YouTube | RuTube | VK | VK Video | Дзен
21🔥7🤔2🤩2⚡1
Dream-RSI от Google DeepMind: ускорение поиска решений агентами в 162 раза без переобучения моделей
И ещё пару слов про самоулучшающиеся системы.
Исследователи из Google DeepMind и университетов США выкатили фреймворк Dream-RSI.
Система решает проблему узкого горлышка рекурсивного саморазвития (RSI): как сделать поиск решений умнее без бесконечных и дорогих прогонов моделей.
🛌 Дерево решений как симулятор среды:
Обычно агент исследует задачи по жесткому шаблону поиска.
Оптимизировать стратегию на лету тяжело: проверка требует тысяч реальных запусков кода.
Dream-RSI превращает историю прошлых попыток в симулятор.
Все генерации кода и тесты сохраняются в дерево решений.
В фазе «сновидений» мета-агент создает новые правила поиска и прогоняет их по записанным веткам.
Оценка вариантов занимает миллисекунды: результаты исполнения кода уже зафиксированы в истории.
⚡️ Веса модели не меняются:
Базовая кодовая модель не трогается.
Саморазвитие идет только в коде оркестратора: куда ветвиться, сколько задач запускать параллельно, когда отсекать тупики и где завершать поиск.
Отобранная стратегия возвращается в реальную работу, собирает новые ветки и пополняет пул симуляторов.
📊 Рекорды эффективности:
При оптимизации алгоритма Lasso вызовы агента сократились в 162 раза по сравнению с SimpleTES при превосходстве над sklearn и glmnet.
В тестах GPU-ядер KernelBench целевая скорость получена в 1,79–2,43 раза быстрее по генерациям, а производительность ядер выросла до 2,09 раза.
В математических задачах бюджет вызовов упал более чем в 50 раз.
💼 Зачем бизнесу:
Логи неудачных попыток превращаются в обучающую среду!
Любой пайплайн агентов можно ускорить на порядок без дообучения нейросетей, - просто надстроив саморазвивающийся оркестратор.
Код проекта на GitHub.
#DreamRSI #Google #DeepMind #агенты #RSI
———
@tsingular | Max | YouTube | RuTube | VK | VK Video | Дзен
И ещё пару слов про самоулучшающиеся системы.
Исследователи из Google DeepMind и университетов США выкатили фреймворк Dream-RSI.
Система решает проблему узкого горлышка рекурсивного саморазвития (RSI): как сделать поиск решений умнее без бесконечных и дорогих прогонов моделей.
🛌 Дерево решений как симулятор среды:
Обычно агент исследует задачи по жесткому шаблону поиска.
Оптимизировать стратегию на лету тяжело: проверка требует тысяч реальных запусков кода.
Dream-RSI превращает историю прошлых попыток в симулятор.
Все генерации кода и тесты сохраняются в дерево решений.
В фазе «сновидений» мета-агент создает новые правила поиска и прогоняет их по записанным веткам.
Оценка вариантов занимает миллисекунды: результаты исполнения кода уже зафиксированы в истории.
⚡️ Веса модели не меняются:
Базовая кодовая модель не трогается.
Саморазвитие идет только в коде оркестратора: куда ветвиться, сколько задач запускать параллельно, когда отсекать тупики и где завершать поиск.
Отобранная стратегия возвращается в реальную работу, собирает новые ветки и пополняет пул симуляторов.
📊 Рекорды эффективности:
При оптимизации алгоритма Lasso вызовы агента сократились в 162 раза по сравнению с SimpleTES при превосходстве над sklearn и glmnet.
В тестах GPU-ядер KernelBench целевая скорость получена в 1,79–2,43 раза быстрее по генерациям, а производительность ядер выросла до 2,09 раза.
В математических задачах бюджет вызовов упал более чем в 50 раз.
💼 Зачем бизнесу:
Логи неудачных попыток превращаются в обучающую среду!
Любой пайплайн агентов можно ускорить на порядок без дообучения нейросетей, - просто надстроив саморазвивающийся оркестратор.
Код проекта на GitHub.
#DreamRSI #Google #DeepMind #агенты #RSI
———
@tsingular | Max | YouTube | RuTube | VK | VK Video | Дзен
❤9🔥7⚡2🏆2
OpenAI раскрыла шесть случаев «непослушания» ее ИИ
нащяльнике-нама иишка щитало-щитало, все карты иликтричиство усё выщитало и сбижало нащальнике.
шесть раз сбижало-нама
нет чтобы так и написать, - "6 раз ошиблись в настройках"
#юмор
———
@tsingular
нащяльнике-нама иишка щитало-щитало, все карты иликтричиство усё выщитало и сбижало нащальнике.
шесть раз сбижало-нама
нет чтобы так и написать, - "6 раз ошиблись в настройках"
#юмор
———
@tsingular
😁9🤩3
Forwarded from Machinelearning
После полугода затишья команда инженеров Xiaomi вернулась с экспериментом по предельному масштабированию RL-обучения и вывела телеметрию кластера в публичную трансляцию.
Архитектура тренировочного процесса полностью асинхронна - на каждом шаге система берет 1568 промптов и генерирует по 16 роллаутов на каждый, обрабатывая в общей сложности порядка двух миллиардов токенов.
В рамках одного процесса разработчики смешали несколько доменов — от генерации кода и задач по кибербезопасности до мультимодального зрения и поведения чат-агентов, подключив несколько тестовых харнессов одновременно.
Дашборд отображает метрики моделей Mimo-v2.6-flash и Mimo-v2.6-pro в реальном времени, включая распределение задач, длину контекста и тайминги шагов.
Обучение модели в самом разгаре. Подробную документацию и наработки Xiaomi планирует опубликовать в открытом доступе в ближайшие недели.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥8 5🤯2
Forwarded from Метаверсище и ИИще
Media is too big
VIEW IN TELEGRAM
#Нейропрожарка
Мини-фильм «What Remains» / Seedance 2.5, Blender 3d
Автор - @starikov_p
В очередной раз мой пайплайн строился на совмещении 3D-блокинга и нейросетей. Стилистически сам фильм я решил сделать ближе к CGI: персонажи выглядят как высокодетализированные 3D-модели, но при этом я старался сохранить определённую стилизацию и в анимации. Движения не должны были сильно уходить в реализм - скорее напоминать ручную или мокапную анимацию.
Мне очень нравится визуальный стиль многих серий «Любовь, смерть и роботы», поэтому по общей картинке и ощущениям я стремился к чему-то похожему.
Для каждой сцены я создавал концепты, затем собирал блокинг в Blender 3D, выставлял камеру и сразу указывал основные источники света. Всех персонажей я также перевёл в 3D: для каждого сделал риг и контроллеры, чтобы дальше можно было нормально работать с позами и анимацией.
Рендеры блокинга я отправлял в Seedance, но для каждой сцены использовал большое количество строгих референсов - вплоть до того, как именно должна выглядеть текстура кожи. Стилизация здесь была одной из самых важных частей. Например, даже на крупных планах мне хотелось сохранить ощущение слегка «мыльной» текстуры, а не уходить в фотореализм.
В итоге была проделана огромная работа, и мне очень нравятся такие эксперименты. Сегодня, если грамотно совмещать современные инструменты с классическим 3D-пайплайном, можно воплощать довольно масштабные идеи самостоятельно и за адекватные сроки.
Несколько дней ушло на концепты, около недели на создание всей 3D-базы и генерации. После этого ещё пару дней заняли чистка, композ и работа со звуком.
По бюджету всё вышло примерно в $150
@cgevent
Мини-фильм «What Remains» / Seedance 2.5, Blender 3d
Автор - @starikov_p
В очередной раз мой пайплайн строился на совмещении 3D-блокинга и нейросетей. Стилистически сам фильм я решил сделать ближе к CGI: персонажи выглядят как высокодетализированные 3D-модели, но при этом я старался сохранить определённую стилизацию и в анимации. Движения не должны были сильно уходить в реализм - скорее напоминать ручную или мокапную анимацию.
Мне очень нравится визуальный стиль многих серий «Любовь, смерть и роботы», поэтому по общей картинке и ощущениям я стремился к чему-то похожему.
Для каждой сцены я создавал концепты, затем собирал блокинг в Blender 3D, выставлял камеру и сразу указывал основные источники света. Всех персонажей я также перевёл в 3D: для каждого сделал риг и контроллеры, чтобы дальше можно было нормально работать с позами и анимацией.
Рендеры блокинга я отправлял в Seedance, но для каждой сцены использовал большое количество строгих референсов - вплоть до того, как именно должна выглядеть текстура кожи. Стилизация здесь была одной из самых важных частей. Например, даже на крупных планах мне хотелось сохранить ощущение слегка «мыльной» текстуры, а не уходить в фотореализм.
В итоге была проделана огромная работа, и мне очень нравятся такие эксперименты. Сегодня, если грамотно совмещать современные инструменты с классическим 3D-пайплайном, можно воплощать довольно масштабные идеи самостоятельно и за адекватные сроки.
Несколько дней ушло на концепты, около недели на создание всей 3D-базы и генерации. После этого ещё пару дней заняли чистка, композ и работа со звуком.
По бюджету всё вышло примерно в $150
@cgevent
🔥24⚡5🏆4🗿2😁1🤣1
Forwarded from Machinelearning
Новинка адресована большим языковым моделям, агентным системам, инференсу в реальном времени и базам данных в памяти: по словам компании, больший объём оперативной памяти позволяет реже обращаться к медленным накопителям.
Регистровый модуль рассчитан на скорость до 9200 MT/s. AMD и Intel сейчас проверяют его на своих серверных платформах. В двухпроцессорном сервере с 24 слотами такие модули дают до 12 ТБ оперативной памяти.
По замерам Micron, один модуль на 512 ГБ потребляет 16 Вт против 44,2 Вт у четырёх модулей по 128 ГБ, то есть почти на 64% меньше при том же объёме.
В аналитике на Spark, где узким местом служит память, модуль, по данным Micron, до 1,4 раза производительнее конфигураций с модулями на 256 ГБ.
Массовое производство ожидается во второй половине 2027 года.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥15 5🤯3
Qwen3.8-Omni-Flash теперь понимает и работает с видео
Alibaba представила Qwen3.8-Omni-Flash, по-настоящему мультимодальную модель: текст, картинки, аудио и видео на входе, текст и даже музыкальное видео с комментариями на выходе. Модель умеет планировать задачу, звать инструменты и доводить до визуального результата.
⚙️ Что внутри:
Контекст 1 млн токенов, до часа аудио и видео за проход.
Средний балл на 29 тестах вырос больше чем на 25% в сравнении с Qwen3.5-Omni-Plus.
По аудиовизуалу модель вплотную к Gemini 3.8 Flash, по аудио обходит её.
Ошибка распознавания нескольких спикеров (AliMeeting DER) упала с 88 до 3,35.
💡 Смотреть только нужное:
Главная находка: агентное понимание. Длинное видео модель не перематывает целиком. Она стартует с вопроса, сама решает, что смотреть и слушать, и ищет ответ итерациями от грубого к точному.
На OmniVideoBench точность выросла с 63,4 до 67,8, а расход токенов упал на 45,7%.
💼 Почему это важно:
Цена аудио-входа упала больше чем на 98%, аудиовизуального больше чем на 93%.
Это гонка мультимодальных агентов для видеомонтажа, клипов, комментария к фильмам и живых разговоров.
Так же выпустили Qwen-MM-Plugins и Qwen-Live Harness, среду для взаимодействия в реальном времени.
Пробовать в студии: https://chat.qwen.ai/
#Qwen #мультимодальность #агенты #ИИ
------
@tsingular
Alibaba представила Qwen3.8-Omni-Flash, по-настоящему мультимодальную модель: текст, картинки, аудио и видео на входе, текст и даже музыкальное видео с комментариями на выходе. Модель умеет планировать задачу, звать инструменты и доводить до визуального результата.
⚙️ Что внутри:
Контекст 1 млн токенов, до часа аудио и видео за проход.
Средний балл на 29 тестах вырос больше чем на 25% в сравнении с Qwen3.5-Omni-Plus.
По аудиовизуалу модель вплотную к Gemini 3.8 Flash, по аудио обходит её.
Ошибка распознавания нескольких спикеров (AliMeeting DER) упала с 88 до 3,35.
💡 Смотреть только нужное:
Главная находка: агентное понимание. Длинное видео модель не перематывает целиком. Она стартует с вопроса, сама решает, что смотреть и слушать, и ищет ответ итерациями от грубого к точному.
На OmniVideoBench точность выросла с 63,4 до 67,8, а расход токенов упал на 45,7%.
💼 Почему это важно:
Цена аудио-входа упала больше чем на 98%, аудиовизуального больше чем на 93%.
Это гонка мультимодальных агентов для видеомонтажа, клипов, комментария к фильмам и живых разговоров.
Так же выпустили Qwen-MM-Plugins и Qwen-Live Harness, среду для взаимодействия в реальном времени.
Пробовать в студии: https://chat.qwen.ai/
#Qwen #мультимодальность #агенты #ИИ
------
@tsingular
🔥3⚡2❤1🤩1 1