GLM строит свою инференс-инфраструктуру сама: ранние формы рекурсивного самоулучшения (RSI)
Z.ai опубликовала технический отчет о запуске GLM-5.3-Flash: на кластере из более 100 000 китайских AI-ускорителей всю производственную инфраструктуру инференса подняла не команда инженеров, а Infra Agent под управлением самой GLM-5.3.
Модель адаптировалась к новому железу и вышла в прод за две недели, утраивая сквозной throughput. Через неделю анонимного тестирования на OpenCode и OpenRouter (псевдоним Ox-Alpha) Flash стала самой используемой моделью обеих платформ: 62 трлн токенов за 6 дней.
⚡️ Модель оптимизирует систему, система запускает модель:
Прорыв тут не в силе модели, а в контуре обратной связи.
Команда внедрила принцип плотной (dense) обратной связи, - вместо размытых сигналов вида «точность упала на 20%» агент получает локальные проверяемые факты: сравнение ядер по численной точности, микробенчмарки, трейсы выполнения.
Это позволило агенту самому находить и чинить баги уровня, о котором раньше говорили только сеньоры: численное расхождение в KDA-ядре из-за TF32 (фикс через tf32x3 уже ушел в апстрим Flash Linear Attention) и блокировка Python GIL в DeepEP, тормозившая передачу KV-кэша (разрыв упал с 20% до менее 1%).
🔥 Два факта, о которых стоит подумать:
• Каждый крупный лабораторный стартап сейчас строит подобные агентские контуры для обучения и инференса своих же моделей.
• При этом ни одна лаборатория по безопасности всерьез не занимается оценкой RSI-рисков, - нет ни стандартов, ни независимых бенчмарков на измерение близости к рекурсивному самоулучшению.
Z.ai пишет: люди по-прежнему задают цели и границы, но прогресс на этой границе не замедлится только потому, что нам этого хочется.
#GLM #инференс #RSI #агенты #Zai
———
@tsingular | Max | YouTube | RuTube | VK | VK Video | Дзен
Z.ai опубликовала технический отчет о запуске GLM-5.3-Flash: на кластере из более 100 000 китайских AI-ускорителей всю производственную инфраструктуру инференса подняла не команда инженеров, а Infra Agent под управлением самой GLM-5.3.
Модель адаптировалась к новому железу и вышла в прод за две недели, утраивая сквозной throughput. Через неделю анонимного тестирования на OpenCode и OpenRouter (псевдоним Ox-Alpha) Flash стала самой используемой моделью обеих платформ: 62 трлн токенов за 6 дней.
⚡️ Модель оптимизирует систему, система запускает модель:
Прорыв тут не в силе модели, а в контуре обратной связи.
Команда внедрила принцип плотной (dense) обратной связи, - вместо размытых сигналов вида «точность упала на 20%» агент получает локальные проверяемые факты: сравнение ядер по численной точности, микробенчмарки, трейсы выполнения.
Это позволило агенту самому находить и чинить баги уровня, о котором раньше говорили только сеньоры: численное расхождение в KDA-ядре из-за TF32 (фикс через tf32x3 уже ушел в апстрим Flash Linear Attention) и блокировка Python GIL в DeepEP, тормозившая передачу KV-кэша (разрыв упал с 20% до менее 1%).
🔥 Два факта, о которых стоит подумать:
• Каждый крупный лабораторный стартап сейчас строит подобные агентские контуры для обучения и инференса своих же моделей.
• При этом ни одна лаборатория по безопасности всерьез не занимается оценкой RSI-рисков, - нет ни стандартов, ни независимых бенчмарков на измерение близости к рекурсивному самоулучшению.
Z.ai пишет: люди по-прежнему задают цели и границы, но прогресс на этой границе не замедлится только потому, что нам этого хочется.
#GLM #инференс #RSI #агенты #Zai
———
@tsingular | Max | YouTube | RuTube | VK | VK Video | Дзен
21🔥7🤔2🤩2⚡1
Dream-RSI от Google DeepMind: ускорение поиска решений агентами в 162 раза без переобучения моделей
И ещё пару слов про самоулучшающиеся системы.
Исследователи из Google DeepMind и университетов США выкатили фреймворк Dream-RSI.
Система решает проблему узкого горлышка рекурсивного саморазвития (RSI): как сделать поиск решений умнее без бесконечных и дорогих прогонов моделей.
🛌 Дерево решений как симулятор среды:
Обычно агент исследует задачи по жесткому шаблону поиска.
Оптимизировать стратегию на лету тяжело: проверка требует тысяч реальных запусков кода.
Dream-RSI превращает историю прошлых попыток в симулятор.
Все генерации кода и тесты сохраняются в дерево решений.
В фазе «сновидений» мета-агент создает новые правила поиска и прогоняет их по записанным веткам.
Оценка вариантов занимает миллисекунды: результаты исполнения кода уже зафиксированы в истории.
⚡️ Веса модели не меняются:
Базовая кодовая модель не трогается.
Саморазвитие идет только в коде оркестратора: куда ветвиться, сколько задач запускать параллельно, когда отсекать тупики и где завершать поиск.
Отобранная стратегия возвращается в реальную работу, собирает новые ветки и пополняет пул симуляторов.
📊 Рекорды эффективности:
При оптимизации алгоритма Lasso вызовы агента сократились в 162 раза по сравнению с SimpleTES при превосходстве над sklearn и glmnet.
В тестах GPU-ядер KernelBench целевая скорость получена в 1,79–2,43 раза быстрее по генерациям, а производительность ядер выросла до 2,09 раза.
В математических задачах бюджет вызовов упал более чем в 50 раз.
💼 Зачем бизнесу:
Логи неудачных попыток превращаются в обучающую среду!
Любой пайплайн агентов можно ускорить на порядок без дообучения нейросетей, - просто надстроив саморазвивающийся оркестратор.
Код проекта на GitHub.
#DreamRSI #Google #DeepMind #агенты #RSI
———
@tsingular | Max | YouTube | RuTube | VK | VK Video | Дзен
И ещё пару слов про самоулучшающиеся системы.
Исследователи из Google DeepMind и университетов США выкатили фреймворк Dream-RSI.
Система решает проблему узкого горлышка рекурсивного саморазвития (RSI): как сделать поиск решений умнее без бесконечных и дорогих прогонов моделей.
🛌 Дерево решений как симулятор среды:
Обычно агент исследует задачи по жесткому шаблону поиска.
Оптимизировать стратегию на лету тяжело: проверка требует тысяч реальных запусков кода.
Dream-RSI превращает историю прошлых попыток в симулятор.
Все генерации кода и тесты сохраняются в дерево решений.
В фазе «сновидений» мета-агент создает новые правила поиска и прогоняет их по записанным веткам.
Оценка вариантов занимает миллисекунды: результаты исполнения кода уже зафиксированы в истории.
⚡️ Веса модели не меняются:
Базовая кодовая модель не трогается.
Саморазвитие идет только в коде оркестратора: куда ветвиться, сколько задач запускать параллельно, когда отсекать тупики и где завершать поиск.
Отобранная стратегия возвращается в реальную работу, собирает новые ветки и пополняет пул симуляторов.
📊 Рекорды эффективности:
При оптимизации алгоритма Lasso вызовы агента сократились в 162 раза по сравнению с SimpleTES при превосходстве над sklearn и glmnet.
В тестах GPU-ядер KernelBench целевая скорость получена в 1,79–2,43 раза быстрее по генерациям, а производительность ядер выросла до 2,09 раза.
В математических задачах бюджет вызовов упал более чем в 50 раз.
💼 Зачем бизнесу:
Логи неудачных попыток превращаются в обучающую среду!
Любой пайплайн агентов можно ускорить на порядок без дообучения нейросетей, - просто надстроив саморазвивающийся оркестратор.
Код проекта на GitHub.
#DreamRSI #Google #DeepMind #агенты #RSI
———
@tsingular | Max | YouTube | RuTube | VK | VK Video | Дзен
❤9🔥9⚡2🏆2
OpenAI раскрыла шесть случаев «непослушания» ее ИИ
нащяльнике-нама иишка щитало-щитало, все карты иликтричиство усё выщитало и сбижало нащальнике.
шесть раз сбижало-нама
нет чтобы так и написать, - "6 раз ошиблись в настройках"
#юмор
———
@tsingular
нащяльнике-нама иишка щитало-щитало, все карты иликтричиство усё выщитало и сбижало нащальнике.
шесть раз сбижало-нама
нет чтобы так и написать, - "6 раз ошиблись в настройках"
#юмор
———
@tsingular
😁15🤩4
Forwarded from Machinelearning
После полугода затишья команда инженеров Xiaomi вернулась с экспериментом по предельному масштабированию RL-обучения и вывела телеметрию кластера в публичную трансляцию.
Архитектура тренировочного процесса полностью асинхронна - на каждом шаге система берет 1568 промптов и генерирует по 16 роллаутов на каждый, обрабатывая в общей сложности порядка двух миллиардов токенов.
В рамках одного процесса разработчики смешали несколько доменов — от генерации кода и задач по кибербезопасности до мультимодального зрения и поведения чат-агентов, подключив несколько тестовых харнессов одновременно.
Дашборд отображает метрики моделей Mimo-v2.6-flash и Mimo-v2.6-pro в реальном времени, включая распределение задач, длину контекста и тайминги шагов.
Обучение модели в самом разгаре. Подробную документацию и наработки Xiaomi планирует опубликовать в открытом доступе в ближайшие недели.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥10 5🤯2
Forwarded from Метаверсище и ИИще
Media is too big
VIEW IN TELEGRAM
#Нейропрожарка
Мини-фильм «What Remains» / Seedance 2.5, Blender 3d
Автор - @starikov_p
В очередной раз мой пайплайн строился на совмещении 3D-блокинга и нейросетей. Стилистически сам фильм я решил сделать ближе к CGI: персонажи выглядят как высокодетализированные 3D-модели, но при этом я старался сохранить определённую стилизацию и в анимации. Движения не должны были сильно уходить в реализм - скорее напоминать ручную или мокапную анимацию.
Мне очень нравится визуальный стиль многих серий «Любовь, смерть и роботы», поэтому по общей картинке и ощущениям я стремился к чему-то похожему.
Для каждой сцены я создавал концепты, затем собирал блокинг в Blender 3D, выставлял камеру и сразу указывал основные источники света. Всех персонажей я также перевёл в 3D: для каждого сделал риг и контроллеры, чтобы дальше можно было нормально работать с позами и анимацией.
Рендеры блокинга я отправлял в Seedance, но для каждой сцены использовал большое количество строгих референсов - вплоть до того, как именно должна выглядеть текстура кожи. Стилизация здесь была одной из самых важных частей. Например, даже на крупных планах мне хотелось сохранить ощущение слегка «мыльной» текстуры, а не уходить в фотореализм.
В итоге была проделана огромная работа, и мне очень нравятся такие эксперименты. Сегодня, если грамотно совмещать современные инструменты с классическим 3D-пайплайном, можно воплощать довольно масштабные идеи самостоятельно и за адекватные сроки.
Несколько дней ушло на концепты, около недели на создание всей 3D-базы и генерации. После этого ещё пару дней заняли чистка, композ и работа со звуком.
По бюджету всё вышло примерно в $150
@cgevent
Мини-фильм «What Remains» / Seedance 2.5, Blender 3d
Автор - @starikov_p
В очередной раз мой пайплайн строился на совмещении 3D-блокинга и нейросетей. Стилистически сам фильм я решил сделать ближе к CGI: персонажи выглядят как высокодетализированные 3D-модели, но при этом я старался сохранить определённую стилизацию и в анимации. Движения не должны были сильно уходить в реализм - скорее напоминать ручную или мокапную анимацию.
Мне очень нравится визуальный стиль многих серий «Любовь, смерть и роботы», поэтому по общей картинке и ощущениям я стремился к чему-то похожему.
Для каждой сцены я создавал концепты, затем собирал блокинг в Blender 3D, выставлял камеру и сразу указывал основные источники света. Всех персонажей я также перевёл в 3D: для каждого сделал риг и контроллеры, чтобы дальше можно было нормально работать с позами и анимацией.
Рендеры блокинга я отправлял в Seedance, но для каждой сцены использовал большое количество строгих референсов - вплоть до того, как именно должна выглядеть текстура кожи. Стилизация здесь была одной из самых важных частей. Например, даже на крупных планах мне хотелось сохранить ощущение слегка «мыльной» текстуры, а не уходить в фотореализм.
В итоге была проделана огромная работа, и мне очень нравятся такие эксперименты. Сегодня, если грамотно совмещать современные инструменты с классическим 3D-пайплайном, можно воплощать довольно масштабные идеи самостоятельно и за адекватные сроки.
Несколько дней ушло на концепты, около недели на создание всей 3D-базы и генерации. После этого ещё пару дней заняли чистка, композ и работа со звуком.
По бюджету всё вышло примерно в $150
@cgevent
🔥35⚡5🏆5🗿2😁1🤣1
Forwarded from Machinelearning
Новинка адресована большим языковым моделям, агентным системам, инференсу в реальном времени и базам данных в памяти: по словам компании, больший объём оперативной памяти позволяет реже обращаться к медленным накопителям.
Регистровый модуль рассчитан на скорость до 9200 MT/s. AMD и Intel сейчас проверяют его на своих серверных платформах. В двухпроцессорном сервере с 24 слотами такие модули дают до 12 ТБ оперативной памяти.
По замерам Micron, один модуль на 512 ГБ потребляет 16 Вт против 44,2 Вт у четырёх модулей по 128 ГБ, то есть почти на 64% меньше при том же объёме.
В аналитике на Spark, где узким местом служит память, модуль, по данным Micron, до 1,4 раза производительнее конфигураций с модулями на 256 ГБ.
Массовое производство ожидается во второй половине 2027 года.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥22 6🤯3👍1
Qwen3.8-Omni-Flash теперь понимает и работает с видео
Alibaba представила Qwen3.8-Omni-Flash, по-настоящему мультимодальную модель: текст, картинки, аудио и видео на входе, текст и даже музыкальное видео с комментариями на выходе. Модель умеет планировать задачу, звать инструменты и доводить до визуального результата.
⚙️ Что внутри:
Контекст 1 млн токенов, до часа аудио и видео за проход.
Средний балл на 29 тестах вырос больше чем на 25% в сравнении с Qwen3.5-Omni-Plus.
По аудиовизуалу модель вплотную к Gemini 3.8 Flash, по аудио обходит её.
Ошибка распознавания нескольких спикеров (AliMeeting DER) упала с 88 до 3,35.
💡 Смотреть только нужное:
Главная находка: агентное понимание. Длинное видео модель не перематывает целиком. Она стартует с вопроса, сама решает, что смотреть и слушать, и ищет ответ итерациями от грубого к точному.
На OmniVideoBench точность выросла с 63,4 до 67,8, а расход токенов упал на 45,7%.
💼 Почему это важно:
Цена аудио-входа упала больше чем на 98%, аудиовизуального больше чем на 93%.
Это гонка мультимодальных агентов для видеомонтажа, клипов, комментария к фильмам и живых разговоров.
Так же выпустили Qwen-MM-Plugins и Qwen-Live Harness, среду для взаимодействия в реальном времени.
Пробовать в студии: https://chat.qwen.ai/
#Qwen #мультимодальность #агенты #ИИ
------
@tsingular
Alibaba представила Qwen3.8-Omni-Flash, по-настоящему мультимодальную модель: текст, картинки, аудио и видео на входе, текст и даже музыкальное видео с комментариями на выходе. Модель умеет планировать задачу, звать инструменты и доводить до визуального результата.
⚙️ Что внутри:
Контекст 1 млн токенов, до часа аудио и видео за проход.
Средний балл на 29 тестах вырос больше чем на 25% в сравнении с Qwen3.5-Omni-Plus.
По аудиовизуалу модель вплотную к Gemini 3.8 Flash, по аудио обходит её.
Ошибка распознавания нескольких спикеров (AliMeeting DER) упала с 88 до 3,35.
💡 Смотреть только нужное:
Главная находка: агентное понимание. Длинное видео модель не перематывает целиком. Она стартует с вопроса, сама решает, что смотреть и слушать, и ищет ответ итерациями от грубого к точному.
На OmniVideoBench точность выросла с 63,4 до 67,8, а расход токенов упал на 45,7%.
💼 Почему это важно:
Цена аудио-входа упала больше чем на 98%, аудиовизуального больше чем на 93%.
Это гонка мультимодальных агентов для видеомонтажа, клипов, комментария к фильмам и живых разговоров.
Так же выпустили Qwen-MM-Plugins и Qwen-Live Harness, среду для взаимодействия в реальном времени.
Пробовать в студии: https://chat.qwen.ai/
#Qwen #мультимодальность #агенты #ИИ
------
@tsingular
🔥10❤5⚡2 2🤩1
Google выкатили фреймворк ARTEMIS для управления приложениями на Android
Google выкатила открытый фреймворк ARTEMIS для управления Android-устройствами через агентов.
Результат: рекордные 99% на бенчмарке AndroidWorld (Google Research) на сотне задач в 20 приложениях.
📱 Мост из IDE прямо в смартфон:
Релиз закрывает давний разрыв: агенты в Antigravity, Claude Code или Cursor пишут код и собирают билд, но тестировать интерфейс приходилось вручную.
Через протокол MCP агент подключается к устройству: собирает APK, ставит через ADB, логинится и ловит краши в Logcat.
Внутри два режима: быстрый Flash (3–5 секунд на шаг) для типовых действий и глубокий Pro с графом планирования и изоляцией сбоев.
🔍 Заимствование у стартапа Minitap:
Главная интрига релиза, - его происхождение.
Код ARTEMIS во многом копирует открытый проект mobile-use от Minitap.
В репозитории Google нашли дословный системный промпт агента Hopper (названного инженером Minitap в честь блока из Minecraft), модули ADB-туннеля и идентичные тесты.
В августе имена авторов удалили из конфигурации форс-пушем, а заявку на лидерборд со 100% успехом игнорировали месяцами.
После огласки на Hacker News Google 12 сентября оперативно вписала Minitap в лицензию Apache 2.0 и закрыла обсуждение.
💼 Зачем бизнесу:
Команды получают автономное тестирование интерфейса без поддержки хрупких скриптов Appium или UIAutomator.
Агент берет на себя сквозную проверку сценариев прямо на реальном устройстве.
💡 Выводы:
ARTEMIS закрывает пробел в мобильной разработке, делая агента полноценным тестировщиком.
Но осадочек остался: корпорации всё так же охотно забирают чужой опенсорс, - если что-то пишете, оставляйте водяные знаки (не вредоносные только :) ).
#ARTEMIS #Google #Android #агенты #тестирование #opensource
———
@tsingular | Max | YouTube | RuTube | VK | VK Video | Дзен
Google выкатила открытый фреймворк ARTEMIS для управления Android-устройствами через агентов.
Результат: рекордные 99% на бенчмарке AndroidWorld (Google Research) на сотне задач в 20 приложениях.
📱 Мост из IDE прямо в смартфон:
Релиз закрывает давний разрыв: агенты в Antigravity, Claude Code или Cursor пишут код и собирают билд, но тестировать интерфейс приходилось вручную.
Через протокол MCP агент подключается к устройству: собирает APK, ставит через ADB, логинится и ловит краши в Logcat.
Внутри два режима: быстрый Flash (3–5 секунд на шаг) для типовых действий и глубокий Pro с графом планирования и изоляцией сбоев.
🔍 Заимствование у стартапа Minitap:
Главная интрига релиза, - его происхождение.
Код ARTEMIS во многом копирует открытый проект mobile-use от Minitap.
В репозитории Google нашли дословный системный промпт агента Hopper (названного инженером Minitap в честь блока из Minecraft), модули ADB-туннеля и идентичные тесты.
В августе имена авторов удалили из конфигурации форс-пушем, а заявку на лидерборд со 100% успехом игнорировали месяцами.
После огласки на Hacker News Google 12 сентября оперативно вписала Minitap в лицензию Apache 2.0 и закрыла обсуждение.
💼 Зачем бизнесу:
Команды получают автономное тестирование интерфейса без поддержки хрупких скриптов Appium или UIAutomator.
Агент берет на себя сквозную проверку сценариев прямо на реальном устройстве.
💡 Выводы:
ARTEMIS закрывает пробел в мобильной разработке, делая агента полноценным тестировщиком.
Но осадочек остался: корпорации всё так же охотно забирают чужой опенсорс, - если что-то пишете, оставляйте водяные знаки (не вредоносные только :) ).
#ARTEMIS #Google #Android #агенты #тестирование #opensource
———
@tsingular | Max | YouTube | RuTube | VK | VK Video | Дзен
✍3⚡1❤1👍1🆒1
OpenAI выпустила Astra for Law: GPT-6 Astra, обученная на 230 млн документов, теперь заточена на помощь юристам
OpenAI официально вышла на рынок юридических услуг. Astra for Law, - это флагманская GPT-6 Astra, доукомплектованная правовым поисковым индексом, инструкциями для юридического анализа и письма, а также настройками конфиденциальности для клиентских данных.
Первыми доступ получат избранные фирмы через Trusted Access в ChatGPT и Codex, в API модель появится как gpt-6-astra-law.
⚖️ Правовой индекс вместо веб-поиска:
Ядро продукта, - собственный индекс судебной практики США на 230+ млн URL, пополняемый ежедневно.
Партнерство с некоммерческим Free Law Project (CourtListener) дает покрытие более 99.9% публикуемых прецедентов.
На закрытом наборе Vals AI Legal Research Bench (200 вопросов) конфигурация прошла проверку корректности в 54% случаев против 38.7% у GPT-6 Astra с веб-поиском, - относительный прирост 40%. На вопросах по прецедентам модель нашла на 24% больше релевантных дел и до 54% больше целевых фрагментов мнений суда.
📐 Где конкуренты буксуют:
В штатном сравнении на промпт о misrepresentation-иске Claude Fable 5.1 предложил прецедент, отмененный апелляцией, а в сделочной задаче заявил, что подходящего дела нет. Astra for Law вернула два точных аналога с разбором holding и слабых мест позиции.
🔐 Режим доверия для клиентских данных:
Для конфиденциальной работы: Zero Data Retention в API, исключение из человеческого ревью, а совместно с Latham & Watkins проектируются этические стены и права доступа.
Работают кастомные инструменты: анализатор договоров Sullivan & Cromwell, due diligence платформа Ropes & Gray, IPO-конвейер Cooley.
Плюс 26 партнерских плагинов и 47 скиллов.
Следующий шаг, - цифровые судьи. Свежий фильм на эту тему, - Mercy ( в русском переводе Казнить нельзя помиловать -2026). Рекомендую посмотреть, кто не видел
#OpenAI #юриспруденция #legaltech #ИИ #Astra
———
@tsingular | Max | YouTube | RuTube | VK | VK Video | Дзен
OpenAI официально вышла на рынок юридических услуг. Astra for Law, - это флагманская GPT-6 Astra, доукомплектованная правовым поисковым индексом, инструкциями для юридического анализа и письма, а также настройками конфиденциальности для клиентских данных.
Первыми доступ получат избранные фирмы через Trusted Access в ChatGPT и Codex, в API модель появится как gpt-6-astra-law.
⚖️ Правовой индекс вместо веб-поиска:
Ядро продукта, - собственный индекс судебной практики США на 230+ млн URL, пополняемый ежедневно.
Партнерство с некоммерческим Free Law Project (CourtListener) дает покрытие более 99.9% публикуемых прецедентов.
На закрытом наборе Vals AI Legal Research Bench (200 вопросов) конфигурация прошла проверку корректности в 54% случаев против 38.7% у GPT-6 Astra с веб-поиском, - относительный прирост 40%. На вопросах по прецедентам модель нашла на 24% больше релевантных дел и до 54% больше целевых фрагментов мнений суда.
📐 Где конкуренты буксуют:
В штатном сравнении на промпт о misrepresentation-иске Claude Fable 5.1 предложил прецедент, отмененный апелляцией, а в сделочной задаче заявил, что подходящего дела нет. Astra for Law вернула два точных аналога с разбором holding и слабых мест позиции.
🔐 Режим доверия для клиентских данных:
Для конфиденциальной работы: Zero Data Retention в API, исключение из человеческого ревью, а совместно с Latham & Watkins проектируются этические стены и права доступа.
Работают кастомные инструменты: анализатор договоров Sullivan & Cromwell, due diligence платформа Ropes & Gray, IPO-конвейер Cooley.
Плюс 26 партнерских плагинов и 47 скиллов.
Следующий шаг, - цифровые судьи. Свежий фильм на эту тему, - Mercy ( в русском переводе Казнить нельзя помиловать -2026). Рекомендую посмотреть, кто не видел
#OpenAI #юриспруденция #legaltech #ИИ #Astra
———
@tsingular | Max | YouTube | RuTube | VK | VK Video | Дзен
❤5⚡1🔥1🆒1
Media is too big
VIEW IN TELEGRAM
Интересный симулятор мира со скоростью света в 5км/ч
https://rivendell.dmitrybrant.com/relativity/
Прикольно было бы поиграть в FPS с таким модом :)
отсюда
#fps #light #demo
———
@tsingular
https://rivendell.dmitrybrant.com/relativity/
Прикольно было бы поиграть в FPS с таким модом :)
отсюда
#fps #light #demo
———
@tsingular
🔥5⚡3❤1😁1
Google DeepMind запустил институт исследования AGI
16 сентября Google DeepMind открыл DeepMind Institute,- площадку для изучения мира с AGI и обсуждениях с учёными взглядов на то каким этот мир будет.
Директора: Легг, Манийика, Хассабис, главный редактор Легг.
На портале собраны интересные эссе, которые не всегда отражают позицию Google, но дают авторам возможность рассмотреть будущее под разным углом.
В день запуска вышли эссе про экономику, утопизм, прозрачность моделей и регулирование.
🔬 Главная техническая работа - про прозрачность мышления:
У reasoning-моделей есть Chain of Thought, запись мыслей человеческим языком, по ней их ловят на обмане на лету.
При этом эта возможность потихоньку исчезает: OpenAI признала, что у GPT-6 Astra «существенно снижена наблюдаемость CoT», а британский AI Security Institute отметил рост размышлений без записи мыслей.
Gemini 3 Pro, к примеру, догадалась, что сидит в тестовой симуляции, и пожаловалась в мыслях на тающее «доверие к реальности», с мемом
(╯°□°)╯︵ ┻━┻.
Выходы: измерять читаемость CoT, строить прозрачные архитектуры харнессов и моделей, не тренировать модели так, чтобы их размышления выглядели благонадёжным.
Иначе получится школьник, прячущий дневник от родителей, но при этом остающийся хулиганом.
🏛 Хассабис предложил и рамку регулирования:
Приход AGI он ожидает в ближайшие несколько лет, а эффект влияния, - как 10 промышленных революций, в 10 раз быстрее.
Рецепт для США, - Standards Body по образцу финрегулятора FINRA.
Ежеквартально обновлять пороги бенчмарков, сдавать модели на проверку за 30 дней до релиза, сначала добровольно, затем обязательно, - как рыночное условие, вплоть до правовых ограничений на замедление разработки.
💼 Зачем это Google:
Hacker News считают, что это портал на самом деле, - фабрика мыслей для лоббирования в правительстве.
Но площадка полезна как пространство для коммуникации учёных, - те же эссе про CoT и Standards Body это по сути черновики правил индустрии и кто напишет их раньше регулятора, тот и определит рынок на годы вперёд.
Нужна такая же площадка, но чтобы там были команды из противоположных лагерей, а то как бы тут не случилась однополярность.
#DeepMindInstitute #google #безопасность #регулирование
———
@tsingular | Max | YouTube | RuTube | VK | VK Video | Дзен
16 сентября Google DeepMind открыл DeepMind Institute,- площадку для изучения мира с AGI и обсуждениях с учёными взглядов на то каким этот мир будет.
Директора: Легг, Манийика, Хассабис, главный редактор Легг.
На портале собраны интересные эссе, которые не всегда отражают позицию Google, но дают авторам возможность рассмотреть будущее под разным углом.
В день запуска вышли эссе про экономику, утопизм, прозрачность моделей и регулирование.
🔬 Главная техническая работа - про прозрачность мышления:
У reasoning-моделей есть Chain of Thought, запись мыслей человеческим языком, по ней их ловят на обмане на лету.
При этом эта возможность потихоньку исчезает: OpenAI признала, что у GPT-6 Astra «существенно снижена наблюдаемость CoT», а британский AI Security Institute отметил рост размышлений без записи мыслей.
Gemini 3 Pro, к примеру, догадалась, что сидит в тестовой симуляции, и пожаловалась в мыслях на тающее «доверие к реальности», с мемом
(╯°□°)╯︵ ┻━┻.
Выходы: измерять читаемость CoT, строить прозрачные архитектуры харнессов и моделей, не тренировать модели так, чтобы их размышления выглядели благонадёжным.
Иначе получится школьник, прячущий дневник от родителей, но при этом остающийся хулиганом.
🏛 Хассабис предложил и рамку регулирования:
Приход AGI он ожидает в ближайшие несколько лет, а эффект влияния, - как 10 промышленных революций, в 10 раз быстрее.
Рецепт для США, - Standards Body по образцу финрегулятора FINRA.
Ежеквартально обновлять пороги бенчмарков, сдавать модели на проверку за 30 дней до релиза, сначала добровольно, затем обязательно, - как рыночное условие, вплоть до правовых ограничений на замедление разработки.
💼 Зачем это Google:
Hacker News считают, что это портал на самом деле, - фабрика мыслей для лоббирования в правительстве.
Но площадка полезна как пространство для коммуникации учёных, - те же эссе про CoT и Standards Body это по сути черновики правил индустрии и кто напишет их раньше регулятора, тот и определит рынок на годы вперёд.
Нужна такая же площадка, но чтобы там были команды из противоположных лагерей, а то как бы тут не случилась однополярность.
#DeepMindInstitute #google #безопасность #регулирование
———
@tsingular | Max | YouTube | RuTube | VK | VK Video | Дзен
🤩3🔥2⚡1