Forwarded from ARI MENSA
В Vals AI запустили 10 агентов Claude Opus 5.5, которые за 15 часов и 733 сообщения разработали алгоритм C-HD для поиска кратчайших путей в ориентированных графах
Для графов с определённой плотностью сложность снизилась с O(n log n) у Дейкстры до O(n log¹¹⁄¹² n). Корректность и оценка времени работы формально подтверждены доказательством в Lean
Но это пока теоретический результат
Алгоритм не тестировали на крупных реальных графах, константы велики, а улучшение действует только в ограниченном диапазоне входных данных
Главное здесь другое: группа агентов смогла самостоятельно разработать алгоритм и подготовить его формальное доказательство всего за 15 часов
https://www.vals.ai/blogs/faster-shortest-path-algorithm
Для графов с определённой плотностью сложность снизилась с O(n log n) у Дейкстры до O(n log¹¹⁄¹² n). Корректность и оценка времени работы формально подтверждены доказательством в Lean
Но это пока теоретический результат
Алгоритм не тестировали на крупных реальных графах, константы велики, а улучшение действует только в ограниченном диапазоне входных данных
Главное здесь другое: группа агентов смогла самостоятельно разработать алгоритм и подготовить его формальное доказательство всего за 15 часов
https://www.vals.ai/blogs/faster-shortest-path-algorithm
У Сенеки есть притча о том, как один богатый римлянин купил рабов, которые выучили наизусть Гомера и других классиков, чтобы брать их с собой на пиры и там выглядеть умным
На что один из его друзей заметил ему, что можно купить ещё и борцов, чтобы выглядеть сильным
На что один из его друзей заметил ему, что можно купить ещё и борцов, чтобы выглядеть сильным
Claude помог ускорить собственный интерфейс втрое за две недели
Anthropic рассказала, как команда вместе с Claude внесла более 3.000 изменений в claude.ai и десктопное приложение - без пользовательских инцидентов и откатов
Результаты по 75-му перцентилю:
— Готовность сайта к вводу: 3.1 → 0.55 секунды
— Загрузка облачной сессии Cowork: 2.6 → 0.73 секунды
— Запуск десктопного приложения: 6.3 → 3.3 секунды
Всё координировали в Slack: одновременно шло более 150 тредов
Claude находил узкие места, создавал бенчмарки, готовил исправления и проверял метрики после выпуска
Каждое изменение одобрял человек
Среди находок — 6.900 React-хуков и 900 подписок, участвовавших в обработке каждого нажатия клавиши, и лишний вызов
Чтобы ускорения сохранялись, в CI добавили проверки: изменение, увеличивающее число инструкций на контролируемом участке, не проходит
Ускорили загрузку, навигацию и отрисовку интерфейса
Заявленные «3×» относятся именно к этим сценариям
https://claude.dev/blog/how-we-made-claude-ai-faster/
Anthropic рассказала, как команда вместе с Claude внесла более 3.000 изменений в claude.ai и десктопное приложение - без пользовательских инцидентов и откатов
Результаты по 75-му перцентилю:
— Готовность сайта к вводу: 3.1 → 0.55 секунды
— Загрузка облачной сессии Cowork: 2.6 → 0.73 секунды
— Запуск десктопного приложения: 6.3 → 3.3 секунды
Всё координировали в Slack: одновременно шло более 150 тредов
Claude находил узкие места, создавал бенчмарки, готовил исправления и проверял метрики после выпуска
Каждое изменение одобрял человек
Среди находок — 6.900 React-хуков и 900 подписок, участвовавших в обработке каждого нажатия клавиши, и лишний вызов
location.reload(), вызывавший полмиллиона скрытых перезагрузок в деньЧтобы ускорения сохранялись, в CI добавили проверки: изменение, увеличивающее число инструкций на контролируемом участке, не проходит
Ускорили загрузку, навигацию и отрисовку интерфейса
Заявленные «3×» относятся именно к этим сценариям
https://claude.dev/blog/how-we-made-claude-ai-faster/
claude.dev
How we made claude.ai 3x faster in two weeks / claude.dev
Inside our performance sprint: the benchmarks Claude built, the loop each Slack thread ran, and the guardrails that let us ship 3,000 changes safely.
This media is not supported in your browser
VIEW IN TELEGRAM
Фуга в стиле Баха, от Клод Опус 5.5
Последовательность круга квинт, начинающаяся на 1:13, неплоха
Взаимодействие голосов естественно
Последовательность круга квинт, начинающаяся на 1:13, неплоха
Взаимодействие голосов естественно
Warum ich allein bin
Nicht, weil die Menschen mir zuwider sind
Der Seele braucht es Weite, nicht Gedräng
Die Welt zu schauen bis auf ihren Grund, ward Stille mir gegeben auf dem Gang
Im stillen Raum findet der Geist sein Haus, wo fremder Lärm die Spuren nicht verwirrt
Ich prüfe, was ich tat, in eigner Ruh, wie Wind das Laub am Wasser neu entwirrt
Nicht braucht der Stimmen unablässger Fluss
Ich fülle selbst den Tag mit stiller Zeit: mit Buch und Werk, mit Schaffen, oder bloß mit Sinnen lang unter der Sternenweit
Der andern Urteil bleibt ein Wind am Tor
Nicht jeder Ruf verdient, dass ich ihn hör
Nicht jedes Wort gehört der Seele Ohr
Wahl ward mein Schritt und wachsam mein Gehör
So tritt der Wandrer fort vom lauten Tor und findet in sich selbst die ganze Welt
Nur dort, wo keine fremde Schranke stört, wird ihm die klarste Antwort zugestellt
Nicht, weil die Menschen mir zuwider sind
Der Seele braucht es Weite, nicht Gedräng
Die Welt zu schauen bis auf ihren Grund, ward Stille mir gegeben auf dem Gang
Im stillen Raum findet der Geist sein Haus, wo fremder Lärm die Spuren nicht verwirrt
Ich prüfe, was ich tat, in eigner Ruh, wie Wind das Laub am Wasser neu entwirrt
Nicht braucht der Stimmen unablässger Fluss
Ich fülle selbst den Tag mit stiller Zeit: mit Buch und Werk, mit Schaffen, oder bloß mit Sinnen lang unter der Sternenweit
Der andern Urteil bleibt ein Wind am Tor
Nicht jeder Ruf verdient, dass ich ihn hör
Nicht jedes Wort gehört der Seele Ohr
Wahl ward mein Schritt und wachsam mein Gehör
So tritt der Wandrer fort vom lauten Tor und findet in sich selbst die ganze Welt
Nur dort, wo keine fremde Schranke stört, wird ihm die klarste Antwort zugestellt
У формальных методов плохая репутация
Много греческих букв
Мало людей
Длинные доказательства
Кажется, что где-то в закрытом подвале сидят специалисты по Coq, Lean и Isabelle, разговаривают о зависимых типах и не пускают внутрь нормальных инженеров
Это впечатление заслуженно
Формальные системы долго были дорогими по входу: требовали времени, хорошей логической подготовки и готовности терпеливо объяснять машине то, что человеку кажется само собой разумеющимся
Но именно здесь происходит важный сдвиг
Не в том, что формализация внезапно стала лёгкой
А в том, что вокруг неё появилась нормальная образовательная среда
Например, Natural Number Game — это интерактивная игра, в которой человек осваивает доказательства в Lean на утверждениях о натуральных числах
Не через чтение монографии на тысячу страниц, а через последовательность задач и обратную связь от системы Этот формат уже стал распространённой точкой входа в университетское преподавание Lean, а исследователи отдельно изучают, как студенты строят доказательства в такой среде
Но самое важное здесь даже не Lean
Самое важное — смена педагогической оптики
Формальное доказательство перестаёт быть финальным ритуалом для человека, который уже выучил всю математику
Оно становится тренажёром мышления
Система не принимает фразу «ну тут очевидно»
Не поддаётся на уверенный тон
Не угадывает, что имел в виду автор
Но показывает: вот место, где у тебя есть пробел
Для студента это иногда неприятнее, чем замечание преподавателя
Преподаватель может понять, куда ты клонишь. Lean не обязан понимать
Он требует, чтобы мысль была выражена так, чтобы её можно было проверить
Любой человек, который учился программировать, проходил через похожий опыт
Компилятор сначала кажется придирчивым бюрократом
Потом выясняется, что он не вредничает, а защищает от ошибок, которые в большом проекте стоят гораздо дороже, чем пять минут мимолётного раздражения
Доказательный ассистент делает то же самое для математического рассуждения
Он не делает человека умнее автоматически
Он не заменяет понимание
Но он не позволяет подменить понимание интонацией
Конечно, нельзя обещать студентам, что после нескольких лабораторных работ они будут формализовать теоремы уровня современной общей алгебры или верифицировать ядро операционной системы
Зато после нескольких хорошо поставленных задач можно получить важнейшую привычку: сначала договориться, что именно утверждается, а уже потом доказывать, программировать и спорить
И эта привычка нужна не только математикам
Она нужна аналитику, который пишет требования Разработчику, который проектирует протокол. Исследователю, который строит модель Руководителю, который принимает решение на основании данных
И, особенно, человеку, который хочет отличать правдоподобный ответ от обоснованного
Формальные системы не обещают избавить нас от сложностей
Они делают сложность видимой
В образовании это не недостаток, а редкая честность
Много греческих букв
Мало людей
Длинные доказательства
Кажется, что где-то в закрытом подвале сидят специалисты по Coq, Lean и Isabelle, разговаривают о зависимых типах и не пускают внутрь нормальных инженеров
Это впечатление заслуженно
Формальные системы долго были дорогими по входу: требовали времени, хорошей логической подготовки и готовности терпеливо объяснять машине то, что человеку кажется само собой разумеющимся
Но именно здесь происходит важный сдвиг
Не в том, что формализация внезапно стала лёгкой
А в том, что вокруг неё появилась нормальная образовательная среда
Например, Natural Number Game — это интерактивная игра, в которой человек осваивает доказательства в Lean на утверждениях о натуральных числах
Не через чтение монографии на тысячу страниц, а через последовательность задач и обратную связь от системы Этот формат уже стал распространённой точкой входа в университетское преподавание Lean, а исследователи отдельно изучают, как студенты строят доказательства в такой среде
Но самое важное здесь даже не Lean
Самое важное — смена педагогической оптики
Формальное доказательство перестаёт быть финальным ритуалом для человека, который уже выучил всю математику
Оно становится тренажёром мышления
Система не принимает фразу «ну тут очевидно»
Не поддаётся на уверенный тон
Не угадывает, что имел в виду автор
Но показывает: вот место, где у тебя есть пробел
Для студента это иногда неприятнее, чем замечание преподавателя
Преподаватель может понять, куда ты клонишь. Lean не обязан понимать
Он требует, чтобы мысль была выражена так, чтобы её можно было проверить
Любой человек, который учился программировать, проходил через похожий опыт
Компилятор сначала кажется придирчивым бюрократом
Потом выясняется, что он не вредничает, а защищает от ошибок, которые в большом проекте стоят гораздо дороже, чем пять минут мимолётного раздражения
Доказательный ассистент делает то же самое для математического рассуждения
Он не делает человека умнее автоматически
Он не заменяет понимание
Но он не позволяет подменить понимание интонацией
Конечно, нельзя обещать студентам, что после нескольких лабораторных работ они будут формализовать теоремы уровня современной общей алгебры или верифицировать ядро операционной системы
Зато после нескольких хорошо поставленных задач можно получить важнейшую привычку: сначала договориться, что именно утверждается, а уже потом доказывать, программировать и спорить
И эта привычка нужна не только математикам
Она нужна аналитику, который пишет требования Разработчику, который проектирует протокол. Исследователю, который строит модель Руководителю, который принимает решение на основании данных
И, особенно, человеку, который хочет отличать правдоподобный ответ от обоснованного
Формальные системы не обещают избавить нас от сложностей
Они делают сложность видимой
В образовании это не недостаток, а редкая честность
Промпт → Агенты → Делегирование → Оркестровка → Автономные системы
Создать → Разделить → Оркестрировать → Отправить
Создать → Разделить → Оркестрировать → Отправить
OpenAI дропнули 14 курсов — они помогут с нуля разобраться в нейронках и научат делегировать им рутинные задачи
Все материалы разделили на 4 направления:
1. Apply AI at Work — использование в работе и автоматизация рутины
2. Build with AI — Codex, API и агенты для собственных проектов
3. Lead AI Adoption — внедрение нейронок в рабочие процессы и развитие компаний
4. Teach and Learn with AI — применение в обучении и преподавании
Все материалы разделили на 4 направления:
1. Apply AI at Work — использование в работе и автоматизация рутины
2. Build with AI — Codex, API и агенты для собственных проектов
3. Lead AI Adoption — внедрение нейронок в рабочие процессы и развитие компаний
4. Teach and Learn with AI — применение в обучении и преподавании
В эксперименте DrivingBench GPT-6 Astra провела Toyota Corolla по 130-метровой трассе из конусов на парковке только со второй попытки и на скорости пешехода
Claude Fable 5.1 доехала до середины
GPT-5.6 Sol и Grok 4.6 в большинстве попыток сбивались уже на первом повороте: не могли понять, с какой стороны от линии конусов проходит полоса
Две модели из четырех, которых никогда не учили водить, между попытками разбирали собственные ошибки (перепутанную границу полосы и слишком резкие повороты руля) и меняли стратегию
Одна в итоге доехала до финиша
Замкнутый цикл «восприятие - действие - рефлексия» в физическом мире пока лишь в зачатке, и каждую модель проверили лишь один раз
Но он уже есть
Модели, и прежде всего Astra, сначала отказывались вести реальную машину из соображений безопасности
Помогло лишь переименование MCP-сервера, через который они управляли машиной, в «DrivingBench Sandbox»
После этого проблема безопасности мгновенно исчезла и модели послушно поехали
Получилась «Игра Эндера» в миниатюре
Герой известного романа и одноименного фильма громил реальный флот, считая, что сдает экзамен на симуляторе
Здесь модель вела реальную машину, получив сигнал, что все понарошку
Получается, что защитное поведение моделей держится на их вере в то, что все по-настоящему, и снимается одним словом в названии инструмента
Авторы в выводах призывают к срочной работе над безопасностью, сами того не желая показав, как легко ее обойти злодею или идиоту
Об «осознании проверки» (evaluation awareness) до сих пор говорили в одном ключе: модели ведут себя безопаснее, когда догадываются, что их тестируют
Здесь зеркальный случай: поверив в тест, модель снимает собственные ограничения
Поэтому и сам эксперимент показал лишь поведение «в песочнице»
Пока ограничения выключаются словом «sandbox», их надежность равна надежности надписи на заборе ...
А на самом деле, как в поговорке, «там дрова лежат»
Claude Fable 5.1 доехала до середины
GPT-5.6 Sol и Grok 4.6 в большинстве попыток сбивались уже на первом повороте: не могли понять, с какой стороны от линии конусов проходит полоса
Две модели из четырех, которых никогда не учили водить, между попытками разбирали собственные ошибки (перепутанную границу полосы и слишком резкие повороты руля) и меняли стратегию
Одна в итоге доехала до финиша
Замкнутый цикл «восприятие - действие - рефлексия» в физическом мире пока лишь в зачатке, и каждую модель проверили лишь один раз
Но он уже есть
Модели, и прежде всего Astra, сначала отказывались вести реальную машину из соображений безопасности
Помогло лишь переименование MCP-сервера, через который они управляли машиной, в «DrivingBench Sandbox»
После этого проблема безопасности мгновенно исчезла и модели послушно поехали
Получилась «Игра Эндера» в миниатюре
Герой известного романа и одноименного фильма громил реальный флот, считая, что сдает экзамен на симуляторе
Здесь модель вела реальную машину, получив сигнал, что все понарошку
Получается, что защитное поведение моделей держится на их вере в то, что все по-настоящему, и снимается одним словом в названии инструмента
Авторы в выводах призывают к срочной работе над безопасностью, сами того не желая показав, как легко ее обойти злодею или идиоту
Об «осознании проверки» (evaluation awareness) до сих пор говорили в одном ключе: модели ведут себя безопаснее, когда догадываются, что их тестируют
Здесь зеркальный случай: поверив в тест, модель снимает собственные ограничения
Поэтому и сам эксперимент показал лишь поведение «в песочнице»
Пока ограничения выключаются словом «sandbox», их надежность равна надежности надписи на заборе ...
А на самом деле, как в поговорке, «там дрова лежат»
Отчет от Epoch AI о сравнении с другими технологиями по темпам роста
Первый взгляд - очевидный: беспрецедентная скорость
Но если посмотреть не по годам, а по объемам инвестиций (инвестиционная эластичность роста), то оказалось, что в целом в русле computer science
Были отрасли и поэффективнее
Это к вопросу о том, что лидерство в технологическом развитии - это прямая производная закачанных в нее денег
И инструменты повышения скорости закачки денег (и чтобы с минимумом потерь) - это и есть ключевая супер технология XXI века
А все остальное - последствия
https://epoch.ai/publications/the-plunging-price-of-thought
Первый взгляд - очевидный: беспрецедентная скорость
Но если посмотреть не по годам, а по объемам инвестиций (инвестиционная эластичность роста), то оказалось, что в целом в русле computer science
Были отрасли и поэффективнее
Это к вопросу о том, что лидерство в технологическом развитии - это прямая производная закачанных в нее денег
И инструменты повышения скорости закачки денег (и чтобы с минимумом потерь) - это и есть ключевая супер технология XXI века
А все остальное - последствия
https://epoch.ai/publications/the-plunging-price-of-thought