Промпт для ревизии всей обвязки агента: глобальных инструкций, AGENTS.md, скиллов, хуков и правил остановки
Модель инвентаризирует систему, отделяет то, что грузится всегда, от того, что подтягивается по запросу, и ищет балласт: слишком широкие триггеры скиллов, обязательное чтение без нужды, обходные приёмы под старые модели, размытые полномочия, преждевременные остановки
Дальше она прогоняет пять сценариев на бумаге — от правки опечатки до деплоя с апрувом — и трассирует путь от запроса до условия остановки
Возвращает находки с точными заменами, но сама ничего не применяет
Промпт целиком
Модель инвентаризирует систему, отделяет то, что грузится всегда, от того, что подтягивается по запросу, и ищет балласт: слишком широкие триггеры скиллов, обязательное чтение без нужды, обходные приёмы под старые модели, размытые полномочия, преждевременные остановки
Дальше она прогоняет пять сценариев на бумаге — от правки опечатки до деплоя с апрувом — и трассирует путь от запроса до условия остановки
Возвращает находки с точными заменами, но сама ничего не применяет
Промпт целиком
Google Docs
GPT-Astra — 02 Аудит инструкций агента (INSTRUCTION DEBT AUDIT)
Аудит инструкций агента — INSTRUCTION DEBT AUDIT Модель: GPT-6 Astra (работает и в Claude Code / любом агенте со скиллами и AGENTS.md) Что делает: прогоняет ревизию всей обвязки агента — глобальных инструкций, AGENTS.md, скиллов, хуков, правил остановки —…
Американские стартапы: RSI это очень опасно, давайте тормозить ИИ
Китайские стартапы: RSI это клево, давайте потратим на него $50.000.000.000!
Z.AI подали на Гонконгскую биржу официальный документ, в котором заявляют, что планируют привлечь $50.000.000.000
И самое интересное, что они расписали, куда пойдут деньги
Около 60 % на обучение следующей GLM и то, что в документе значится под названием Fully Self Training
Z.ai хотят, чтобы «Следующее поколение GLM обучалось в среде, созданной предыдущим поколением GLM, формируя замкнутый цикл Recursive Self-Improvement»
В это определение входит: самогенерация данных для обучения, генерация задач и сред, включая алгоритмы оценки, а также оптимизация инфраструктуры
В долгосрочном техническом видении Z.ai такая система должна работать полностью автономно, оценивая результаты и принимая решения в основном без участия человека
Китайские стартапы: RSI это клево, давайте потратим на него $50.000.000.000!
Z.AI подали на Гонконгскую биржу официальный документ, в котором заявляют, что планируют привлечь $50.000.000.000
И самое интересное, что они расписали, куда пойдут деньги
Около 60 % на обучение следующей GLM и то, что в документе значится под названием Fully Self Training
Z.ai хотят, чтобы «Следующее поколение GLM обучалось в среде, созданной предыдущим поколением GLM, формируя замкнутый цикл Recursive Self-Improvement»
В это определение входит: самогенерация данных для обучения, генерация задач и сред, включая алгоритмы оценки, а также оптимизация инфраструктуры
В долгосрочном техническом видении Z.ai такая система должна работать полностью автономно, оценивая результаты и принимая решения в основном без участия человека
Tencent Hunyuan представила EvolveScaler - бенчмарк и датасет для проверки того, умеют ли LLM рассуждать в мире, где информация постоянно меняется
Пример задачи: модель читает журнал RPG за 40 дней, после чего получает вопрос, если на 7-й день пропустить мини-босса, получится ли всё равно победить финального босса?
Прямого ответа в тексте нет
Нужно фактически «переиграть» цепочку событий с изменённым условием
Авторы называют это Information Evolution: записи могут отменяться, исправляться и дополняться задним числом, поэтому простого поиска фактов в длинном контексте недостаточно
EvolveScaler строится наоборот:
- сначала мир задаётся как исполняемая машина состояний
- логика и зависимости между событиями контролируются кодом
- затем эта история преобразуется в естественный язык
- модель должна восстановить состояние мира и просчитать последствия изменений
Масштаб:
- 117 прототипов сценариев
- 159 типов вопросов
- 5 уровней сложности
- до ~1200 событий в одном примере
Авторы протестировали 14 frontier-моделей
На самом сложном уровне медианный avg@5 падает до 11.3 %
При этом обучение на EvolveScaler дало в среднем +5,25 пункта на 8 внешних бенчмарках, которые не использовались при создании датасета
Работа проверяет не только понимание длинного контекста, а способность модели поддерживать изменяющееся состояние мира, учитывать исправления и пересчитывать последствия контрфактических изменений
Paper:
https://arxiv.org/abs/2609.08435
Project:
https://tencent-hunyuan.github.io/evolve-scaler/
Пример задачи: модель читает журнал RPG за 40 дней, после чего получает вопрос, если на 7-й день пропустить мини-босса, получится ли всё равно победить финального босса?
Прямого ответа в тексте нет
Нужно фактически «переиграть» цепочку событий с изменённым условием
Авторы называют это Information Evolution: записи могут отменяться, исправляться и дополняться задним числом, поэтому простого поиска фактов в длинном контексте недостаточно
EvolveScaler строится наоборот:
- сначала мир задаётся как исполняемая машина состояний
- логика и зависимости между событиями контролируются кодом
- затем эта история преобразуется в естественный язык
- модель должна восстановить состояние мира и просчитать последствия изменений
Масштаб:
- 117 прототипов сценариев
- 159 типов вопросов
- 5 уровней сложности
- до ~1200 событий в одном примере
Авторы протестировали 14 frontier-моделей
На самом сложном уровне медианный avg@5 падает до 11.3 %
При этом обучение на EvolveScaler дало в среднем +5,25 пункта на 8 внешних бенчмарках, которые не использовались при создании датасета
Работа проверяет не только понимание длинного контекста, а способность модели поддерживать изменяющееся состояние мира, учитывать исправления и пересчитывать последствия контрфактических изменений
Paper:
https://arxiv.org/abs/2609.08435
Project:
https://tencent-hunyuan.github.io/evolve-scaler/
arXiv.org
EvolveScaler: Synthesizing Information-Evolution Contexts via...
In persistent interactions, long contexts may encode an evolving process rather than a fixed record: later events can revise or revoke earlier information, changing what remains valid and what...
AML способны обрабатывать огромные объемы текста, изображений, видео, аудио и поведенческих данных
Обработка естественного языка (NLP), модели обработки больших языков (LLM), мультимодальный ИИ, анализ настроений, графовая аналитика, рекомендательные модели и дегенеративный «искусственный интеллект» в совокупности могут обеспечить беспрецедентную возможность понимать информационную среду и влиять на нее.
Система CDO с поддержкой AML может работать в непрерывном цикле: восприятие → понимание → идентификация → генерация → определение цели → распространение → наблюдение → адаптация
Система способна выявлять формирующийся нарратив, определять, кто его продвигает, идентифицировать сообщества, взаимодействующие с ним, анализировать настроения и эмоциональную реакцию, генерировать альтернативные сообщения, распространять контент по соответствующим каналам, а затем оценивать реакцию
Этот процесс может быть повторен
Это создает возможность непрерывного, адаптивного и персонализированного воздействия со скоростью и в масштабе, сопоставимом с машинным обучением
Обработка естественного языка (NLP), модели обработки больших языков (LLM), мультимодальный ИИ, анализ настроений, графовая аналитика, рекомендательные модели и дегенеративный «искусственный интеллект» в совокупности могут обеспечить беспрецедентную возможность понимать информационную среду и влиять на нее.
Система CDO с поддержкой AML может работать в непрерывном цикле: восприятие → понимание → идентификация → генерация → определение цели → распространение → наблюдение → адаптация
Система способна выявлять формирующийся нарратив, определять, кто его продвигает, идентифицировать сообщества, взаимодействующие с ним, анализировать настроения и эмоциональную реакцию, генерировать альтернативные сообщения, распространять контент по соответствующим каналам, а затем оценивать реакцию
Этот процесс может быть повторен
Это создает возможность непрерывного, адаптивного и персонализированного воздействия со скоростью и в масштабе, сопоставимом с машинным обучением
Ex-Google, OpenAI создали лаборатории по синтезу и анализу материалов с ИИ
Стартап Periodic Labs(о них писали тут) рассказал как роботизированные лаборатории ставят эксперименты и генерируют свежие данные, а модели учатся на этих данных, а потом подсказывают, что экспериментировать дальше
Их основной продукт сегодня - модель Neon, созданная на основе Kimi K2.6, которую дообучили на данных из собственных физических лабораторий
На их внутреннем бенчмарке модель превосходит GPT-6 Astra и Claude Fable 5.1 на основной научной задаче при меньших вычислительных затратах: 1.300 GPU H200
С помощью Neon они автоматизировали анализ рентгеновской дифракции (XRD)
Раньше на один сложный образец уходили часы работы учёного, а сейчас Neon делает все сама
Periodic Labs хотят научить не только разбирать результаты, но и управлять научными проектами: придумывать процедуры синтеза и решать, какие эксперименты запускать следующими
Их цель - наука на каждый час GPU
И у них есть актив - данные, которые производит физическая лаборатория
Стартап Periodic Labs(о них писали тут) рассказал как роботизированные лаборатории ставят эксперименты и генерируют свежие данные, а модели учатся на этих данных, а потом подсказывают, что экспериментировать дальше
Их основной продукт сегодня - модель Neon, созданная на основе Kimi K2.6, которую дообучили на данных из собственных физических лабораторий
На их внутреннем бенчмарке модель превосходит GPT-6 Astra и Claude Fable 5.1 на основной научной задаче при меньших вычислительных затратах: 1.300 GPU H200
С помощью Neon они автоматизировали анализ рентгеновской дифракции (XRD)
Раньше на один сложный образец уходили часы работы учёного, а сейчас Neon делает все сама
Periodic Labs хотят научить не только разбирать результаты, но и управлять научными проектами: придумывать процедуры синтеза и решать, какие эксперименты запускать следующими
Их цель - наука на каждый час GPU
И у них есть актив - данные, которые производит физическая лаборатория
Periodic
Building Labs that Learn – Periodic Labs
Introducing Periodic Neon, a 1T parameter model that we post-trained to analyze experimental results and deployed to our physical labs. This is a step towards putting autonomous discovery into the hands of scientists.
Так, кажется, все, кто мог, уже написали TypeSafe
И восторги от простых пользователей и журналистов, и "а что тут нового-то?" от прожжённых ML-щиков
Почему это интересно? Потому что в центре стоит System 1, т.е. тот факт, что модель модель встраивать в процессы реального времени
Т.е. заходит на территорию Моделей Мира с необычной стороны
Причём для обыденных массовых ынтерпрайз задач, которые сейчас выполняются LLM'и
Гениальность тут в том, что ребята нашли задачу, про которую все AI автоматизаторы плакали, кололись, но продолжали жрать LLM и выкатили для неё хорошо продуманное решение с кучей примеров и готовых работ
Даёшь больше моделей без авторегресионной генерации текста
И восторги от простых пользователей и журналистов, и "а что тут нового-то?" от прожжённых ML-щиков
Почему это интересно? Потому что в центре стоит System 1, т.е. тот факт, что модель модель встраивать в процессы реального времени
Т.е. заходит на территорию Моделей Мира с необычной стороны
Причём для обыденных массовых ынтерпрайз задач, которые сейчас выполняются LLM'и
Гениальность тут в том, что ребята нашли задачу, про которую все AI автоматизаторы плакали, кололись, но продолжали жрать LLM и выкатили для неё хорошо продуманное решение с кучей примеров и готовых работ
Даёшь больше моделей без авторегресионной генерации текста
typesafe.ai
Home - TypeSafe AI
TypeSafe AI is an AI lab building machine-native intelligence infrastructure for automation, designed to make decisions within software. Try our first System One Model, Jev, in early access.
«Учить надо не вычислениям, а моделированию» — о письме филдсовских лауреатов
25 лауреатов медали Филдса опубликовали письмо о будущем математики
Без живых математиков оборвётся человеческая цепочка передачи знания
Похожие проблемы ждут все интеллектуальные профессии
Вместо текущего результата, когда математика рассматривается как инструмент для вычислений, нужно обучать математике как инструменту моделирования — ситуаций деятельности и окружающего мира
Классическое обучение через теоремы и задачники обесценивается
В отношении математики этот процесс начался в США ещё в 1970-е, с массовым распространением калькуляторов
По меркам России больше половины выпускников американских школ сегодня фактически не знают математику
Самая большая глупость — делать то же самое и надеяться на другой результат
Тем, кто действительно берёт на себя ответственность за образовательный результат, необходимо изучать существующие практики, обмениваться опытом, включаться в сообщества
Нужно решать задачи, готового решения которых, еще не существует
25 лауреатов медали Филдса опубликовали письмо о будущем математики
Без живых математиков оборвётся человеческая цепочка передачи знания
Похожие проблемы ждут все интеллектуальные профессии
Вместо текущего результата, когда математика рассматривается как инструмент для вычислений, нужно обучать математике как инструменту моделирования — ситуаций деятельности и окружающего мира
Классическое обучение через теоремы и задачники обесценивается
В отношении математики этот процесс начался в США ещё в 1970-е, с массовым распространением калькуляторов
По меркам России больше половины выпускников американских школ сегодня фактически не знают математику
Самая большая глупость — делать то же самое и надеяться на другой результат
Тем, кто действительно берёт на себя ответственность за образовательный результат, необходимо изучать существующие практики, обмениваться опытом, включаться в сообщества
Нужно решать задачи, готового решения которых, еще не существует
Ответка от математиков к OpenAI прилетела - задача тысячелетия не решена, по которой OpenAI отчитались, что решили
Группа из 3-х специалистов по математической гидродинамике:Питер Константин, Принстон, Михаэла Игнатова, Темпл, и Влад Викол, Курантовский институт при NYU опубликовали ответный анализ на громкое заявление OpenAI, что задача тысячелетия Навье-Стокса решена
8 сентября OpenAI опубликовала препринт своего решения, в котором заявила, что доказала возможность образования сингулярности (разрыва/«взрыва» решений) за конечное время для трехмерных уравнений Навье-Стокса при наличии некоторой гладкой внешней силы
Математики в своей работе доказали, что «взрыв» у OpenAI происходит не из-за физических свойств самой жидкости, а из-за крайне специфической внешней силы, которой ученые OpenAI подталкивали поток
Это похоже на то, как если бы систему раскачивали искусственно созданными микро толчками
Ученые доказали, что если сделать эту внешнюю силу естественной и гладкой или вообще её убрать, то никакого «взрыва» не будет, вязкость жидкости легко гасит все возмущения
Таким образом OpenAI не решила задачу тысячелетия
Группа из 3-х специалистов по математической гидродинамике:Питер Константин, Принстон, Михаэла Игнатова, Темпл, и Влад Викол, Курантовский институт при NYU опубликовали ответный анализ на громкое заявление OpenAI, что задача тысячелетия Навье-Стокса решена
8 сентября OpenAI опубликовала препринт своего решения, в котором заявила, что доказала возможность образования сингулярности (разрыва/«взрыва» решений) за конечное время для трехмерных уравнений Навье-Стокса при наличии некоторой гладкой внешней силы
Математики в своей работе доказали, что «взрыв» у OpenAI происходит не из-за физических свойств самой жидкости, а из-за крайне специфической внешней силы, которой ученые OpenAI подталкивали поток
Это похоже на то, как если бы систему раскачивали искусственно созданными микро толчками
Ученые доказали, что если сделать эту внешнюю силу естественной и гладкой или вообще её убрать, то никакого «взрыва» не будет, вязкость жидкости легко гасит все возмущения
Таким образом OpenAI не решила задачу тысячелетия
Anthropic готовятся выпускать новую модель, которая составит конкуренцию Astra
Сейчас тестирует безопасность модели, и выйти она совсем скоро.
Прошла всего неделя с момента, когда настаивали на замедлении прогресса AI…
Сейчас тестирует безопасность модели, и выйти она совсем скоро.
Прошла всего неделя с момента, когда настаивали на замедлении прогресса AI…
This media is not supported in your browser
VIEW IN TELEGRAM
Digit от Agility Robotics устраивается в формованном отсеке, специально приспособленном под форму его тела
Робот держит в руках свой собственный зарядный кабель — так, как инженеру было удобно его держать
Вся сцена удивительно человечна, и как бы показывает дальнейшее направление и специализацию робототехники
Роботы на складах обычно запихиваются в какой-нибудь уголок без малейшего внимания к их внешнему виду
Здесь же явно кто-то специально спроектировал это так, чтобы оно интересно смотрелось и на home movie
Робот держит в руках свой собственный зарядный кабель — так, как инженеру было удобно его держать
Вся сцена удивительно человечна, и как бы показывает дальнейшее направление и специализацию робототехники
Роботы на складах обычно запихиваются в какой-нибудь уголок без малейшего внимания к их внешнему виду
Здесь же явно кто-то специально спроектировал это так, чтобы оно интересно смотрелось и на home movie
«Astra действительно достигла чего-то такого, что заставляет меня сказать: ладно, я думаю, это вполне разумно назвать AGI»
Год назад «AGI» было словом на будущее, а теперь президент OpenAI использует его в настоящем времени, и уже говорит о том, чтобы его замедлить
Год назад «AGI» было словом на будущее, а теперь президент OpenAI использует его в настоящем времени, и уже говорит о том, чтобы его замедлить
This media is not supported in your browser
VIEW IN TELEGRAM
166.700 нейронов из мозга самца дрозофилы учат пару силиконовых губ, стальной каркас, силиконовый язык, ряд моторов под челюстью и микрофон, направленный прямо в рот, без единого динамика где-либо, говорить
Воздух проталкивается через искусственные голосовые связки, моторы сгибают губы, а микрофон улавливает каждый звук, который они издают
Если тон сбивается, моторы корректируются перед следующей попыткой
Никто не программировал слова: он находит каждую форму губ методом проб и ошибок и использует старые звуки, чтобы угадывать новые
Младенцы учатся говорить точно так же: лепечут, слушают, исправляют, повторяют
Новое здесь — мозг в углу экрана, с 166.700 нейронами и 125.000.000 синапсов, упакованными в нечто меньше макового семечка
Ученые потратили 10 лет, чтобы отобразить каждый провод, и на работу ушло 44 года человеческого труда
Самцы дрозофил уже поют: они жужжат одним крылом, чтобы ухаживать за самкой, и она слышит песню через свои антенны
Эта песня никогда раньше не имела рта
Обученный линейный считыватель превращает его всплески в слова, а рот делает остальное
Человеческому детёнышу понадобилось 86.000.000.000 нейронов и 12 месяцев, чтобы сказать «мама»
Воздух проталкивается через искусственные голосовые связки, моторы сгибают губы, а микрофон улавливает каждый звук, который они издают
Если тон сбивается, моторы корректируются перед следующей попыткой
Никто не программировал слова: он находит каждую форму губ методом проб и ошибок и использует старые звуки, чтобы угадывать новые
Младенцы учатся говорить точно так же: лепечут, слушают, исправляют, повторяют
Новое здесь — мозг в углу экрана, с 166.700 нейронами и 125.000.000 синапсов, упакованными в нечто меньше макового семечка
Ученые потратили 10 лет, чтобы отобразить каждый провод, и на работу ушло 44 года человеческого труда
Самцы дрозофил уже поют: они жужжат одним крылом, чтобы ухаживать за самкой, и она слышит песню через свои антенны
Эта песня никогда раньше не имела рта
Обученный линейный считыватель превращает его всплески в слова, а рот делает остальное
Человеческому детёнышу понадобилось 86.000.000.000 нейронов и 12 месяцев, чтобы сказать «мама»
Все, что нужно знать о развитии AML сегодня: CEO Shopify переделал винный погреб в серверную
В холодильнике для вина теперь охлаждаются GPU: по виду там как минимум Dell Pro Max с GB300, RTX PRO 2000, 16TB NVMe и Dual 400GbE
Можно запустить GLM
В холодильнике для вина теперь охлаждаются GPU: по виду там как минимум Dell Pro Max с GB300, RTX PRO 2000, 16TB NVMe и Dual 400GbE
Можно запустить GLM
Пифагора знают все, и большинство полагает, что Пифагор был первым, кто доказал эту теорему, но на самом деле, вавилоняне использовали так называемые "теоремы Пифагора" еще за 1000 лет до его рождения
Они даже записали эту теорему на табличке, теперь известной как "Плимптон 322"
Они даже записали эту теорему на табличке, теперь известной как "Плимптон 322"
Forwarded from ARI MENSA
В Vals AI запустили 10 агентов Claude Opus 5.5, которые за 15 часов и 733 сообщения разработали алгоритм C-HD для поиска кратчайших путей в ориентированных графах
Для графов с определённой плотностью сложность снизилась с O(n log n) у Дейкстры до O(n log¹¹⁄¹² n). Корректность и оценка времени работы формально подтверждены доказательством в Lean
Но это пока теоретический результат
Алгоритм не тестировали на крупных реальных графах, константы велики, а улучшение действует только в ограниченном диапазоне входных данных
Главное здесь другое: группа агентов смогла самостоятельно разработать алгоритм и подготовить его формальное доказательство всего за 15 часов
https://www.vals.ai/blogs/faster-shortest-path-algorithm
Для графов с определённой плотностью сложность снизилась с O(n log n) у Дейкстры до O(n log¹¹⁄¹² n). Корректность и оценка времени работы формально подтверждены доказательством в Lean
Но это пока теоретический результат
Алгоритм не тестировали на крупных реальных графах, константы велики, а улучшение действует только в ограниченном диапазоне входных данных
Главное здесь другое: группа агентов смогла самостоятельно разработать алгоритм и подготовить его формальное доказательство всего за 15 часов
https://www.vals.ai/blogs/faster-shortest-path-algorithm