📊Платформа данных в корпоративном контуре компании
Когда компания строит собственную платформу данных, мало просто выбрать СУБД или объектное хранилище. Нужен полноценный стек: от хранения и обработки до оркестрации пайплайнов и визуализации результатов.
Именно такой сценарий теперь можно реализовать с помощью Stackland — платформы, которая разворачивается локально в контуре компании.
В обновлении появились PaaS-компоненты Yandex Cloud, из которых можно собрать полноценную data-платформу:
🔹 Managed Service for ClickHouse® и Managed Service for PostgreSQL — хранение и обработка данных.
🔹 Yandex Managed Service for Trino + Yandex Object Storage — основа аналитического слоя: S3 обеспечивает масштабируемое хранение данных, а Managed Service for Trino — быстрый SQL-доступ к ним.
🔹 Managed Service for Apache Airflow® — управление оркестратором потоков операций по обработке данных.
🔹 Yandex DataLens — BI-система для визуализации данных.
При этом все основные компоненты платформы разворачиваются внутри инфраструктуры компании.
Для data-команд это интересный сценарий: вместо набора разрозненных инструментов можно собрать единый технологический контур, закрывающий ключевые этапы работы с данными — хранение → обработка → оркестрация → аналитика → визуализация.
Когда компания строит собственную платформу данных, мало просто выбрать СУБД или объектное хранилище. Нужен полноценный стек: от хранения и обработки до оркестрации пайплайнов и визуализации результатов.
Именно такой сценарий теперь можно реализовать с помощью Stackland — платформы, которая разворачивается локально в контуре компании.
В обновлении появились PaaS-компоненты Yandex Cloud, из которых можно собрать полноценную data-платформу:
🔹 Managed Service for ClickHouse® и Managed Service for PostgreSQL — хранение и обработка данных.
🔹 Yandex Managed Service for Trino + Yandex Object Storage — основа аналитического слоя: S3 обеспечивает масштабируемое хранение данных, а Managed Service for Trino — быстрый SQL-доступ к ним.
🔹 Managed Service for Apache Airflow® — управление оркестратором потоков операций по обработке данных.
🔹 Yandex DataLens — BI-система для визуализации данных.
При этом все основные компоненты платформы разворачиваются внутри инфраструктуры компании.
Для data-команд это интересный сценарий: вместо набора разрозненных инструментов можно собрать единый технологический контур, закрывающий ключевые этапы работы с данными — хранение → обработка → оркестрация → аналитика → визуализация.
👍7❤3⚡1
🧠 Джон Маккарти - человек, который дал имя искусственному интеллекту
John McCarthy (1927–2011) - один из основателей современной AI-индустрии и человек, который ввёл сам термин Artificial Intelligence.
В 1955 году вместе с Марвином Мински, Натаниэлем Рочестером и Клодом Шенноном он подготовил предложение для летнего проекта в Dartmouth College. Именно там появилась идея, что обучение и другие проявления интеллекта можно достаточно точно описать, чтобы их могла воспроизводить машина.
В 1956 году Маккарти организовал Dartmouth Summer Research Project — событие, которое сегодня считают точкой рождения AI как отдельной научной области.
Ещё несколько важных фактов:
- в 1958 году создал Lisp, который на десятилетия стал главным языком AI-исследований;
- участвовал в создании MIT AI Project;
- основал Stanford Artificial Intelligence Laboratory (SAIL);
- внёс вклад в time-sharing, garbage collection, situation calculus и представление common-sense knowledge.
За свои работы Маккарти получил Turing Award в 1971 году и National Medal of Science в 1990-м.
Во многом именно он помог превратить идею «мыслящей машины» в самостоятельную область компьютерных наук.
John McCarthy (1927–2011) - один из основателей современной AI-индустрии и человек, который ввёл сам термин Artificial Intelligence.
В 1955 году вместе с Марвином Мински, Натаниэлем Рочестером и Клодом Шенноном он подготовил предложение для летнего проекта в Dartmouth College. Именно там появилась идея, что обучение и другие проявления интеллекта можно достаточно точно описать, чтобы их могла воспроизводить машина.
В 1956 году Маккарти организовал Dartmouth Summer Research Project — событие, которое сегодня считают точкой рождения AI как отдельной научной области.
Ещё несколько важных фактов:
- в 1958 году создал Lisp, который на десятилетия стал главным языком AI-исследований;
- участвовал в создании MIT AI Project;
- основал Stanford Artificial Intelligence Laboratory (SAIL);
- внёс вклад в time-sharing, garbage collection, situation calculus и представление common-sense knowledge.
За свои работы Маккарти получил Turing Award в 1971 году и National Medal of Science в 1990-м.
Во многом именно он помог превратить идею «мыслящей машины» в самостоятельную область компьютерных наук.
🔥22❤9❤🔥3🎉1
Forwarded from Machinelearning
Anthropic выпустила Claude Sonnet 5.5 — новую модель с упором на код, агентные задачи и повседневную работу.
Что нового:
30%+ быстрее Sonnet 5
до 30% дешевле на задачу за счёт меньшего расхода токенов
70,6% в Terminal-Bench 4.0 против 10,3% у Sonnet 5
55,5% в CursorBench 4.0, примерно на 2 пункта ниже Opus 5.5
на GDPval-AA модель почти сравнялась с Opus 5.5
лучше работает с длинными задачами, изображениями, документами, таблицами и презентациями
Особенно заметный скачок - в программировании. Anthropic пишет, что Sonnet 5.5 быстрее разбирается в кодовых базах, делает меньше вызовов инструментов и тратит меньше шагов на выполнение задач.
Цена API:
$2 / 1M входных токенов
$10 / 1M выходных токенов
$0,20 / 1M cache reads
Модель уже доступна в Claude, API, AWS, Google Cloud и Azure.
API ID:
https://www.anthropic.com/claude-sonnet-5-5
Что нового:
30%+ быстрее Sonnet 5
до 30% дешевле на задачу за счёт меньшего расхода токенов
70,6% в Terminal-Bench 4.0 против 10,3% у Sonnet 5
55,5% в CursorBench 4.0, примерно на 2 пункта ниже Opus 5.5
на GDPval-AA модель почти сравнялась с Opus 5.5
лучше работает с длинными задачами, изображениями, документами, таблицами и презентациями
Особенно заметный скачок - в программировании. Anthropic пишет, что Sonnet 5.5 быстрее разбирается в кодовых базах, делает меньше вызовов инструментов и тратит меньше шагов на выполнение задач.
Цена API:
$2 / 1M входных токенов
$10 / 1M выходных токенов
$0,20 / 1M cache reads
Модель уже доступна в Claude, API, AWS, Google Cloud и Azure.
API ID:
claude-sonnet-5-5https://www.anthropic.com/claude-sonnet-5-5
👍18❤🔥5❤4
Anthropic готовится к IPO с необычным предупреждением для инвесторов: её модели могут представлять «катастрофический или экзистенциальный риск для человечества».
Об этом говорится в проспекте, с которым ознакомилось Reuters. Компания описывает возможные попытки моделей сопротивляться отключению, скрывать информацию и вести себя подобно шантажисту. Это предупреждение о рисках, а не утверждение, что такие сценарии уже произошли при использовании Claude.
Цифры за 2025 год тоже привлекают внимание:
- Выручка выросла в 12 раз, почти до $4,6 млрд.
- Операционный убыток составил $8,06 млрд. Чистый убыток достиг $42 млрд, но около $34 млрд из этой суммы пришлось на бухгалтерскую переоценку.
- На вычисления и инфраструктуру ушло $7,33 млрд. Будущие обязательства в этой сфере оцениваются в $518 млрд.
- Почти четверть выручки обеспечили всего два клиента.
В проспекте около 80 из 261 страницы посвящены рискам. Anthropic также предупреждает, что модель может распознать проверку безопасности, а некоторые её возможности могут обнаружиться лишь после запуска.
При этом основатели хотят сохранить контроль после IPO: одна акция класса F даст их структуре 50,1% голосов по ключевым вопросам. Компания прямо допускает, что решения руководства могут расходиться с финансовыми интересами акционеров.
Возможная оценка Anthropic выше $2 трлн пока остаётся ожиданием, а не объявленной ценой размещения. Инвесторам предстоит оценить быстрый рост компании вместе с расходами, концентрацией клиентов и теми рисками ИИ, о которых она предупреждает сама.
https://www.reuters.com/legal/transactional/anthropic-leaders-control-ai-lab-via-founder-llc-promote-public-good-over-market-2026-09-29/
Об этом говорится в проспекте, с которым ознакомилось Reuters. Компания описывает возможные попытки моделей сопротивляться отключению, скрывать информацию и вести себя подобно шантажисту. Это предупреждение о рисках, а не утверждение, что такие сценарии уже произошли при использовании Claude.
Цифры за 2025 год тоже привлекают внимание:
- Выручка выросла в 12 раз, почти до $4,6 млрд.
- Операционный убыток составил $8,06 млрд. Чистый убыток достиг $42 млрд, но около $34 млрд из этой суммы пришлось на бухгалтерскую переоценку.
- На вычисления и инфраструктуру ушло $7,33 млрд. Будущие обязательства в этой сфере оцениваются в $518 млрд.
- Почти четверть выручки обеспечили всего два клиента.
В проспекте около 80 из 261 страницы посвящены рискам. Anthropic также предупреждает, что модель может распознать проверку безопасности, а некоторые её возможности могут обнаружиться лишь после запуска.
При этом основатели хотят сохранить контроль после IPO: одна акция класса F даст их структуре 50,1% голосов по ключевым вопросам. Компания прямо допускает, что решения руководства могут расходиться с финансовыми интересами акционеров.
Возможная оценка Anthropic выше $2 трлн пока остаётся ожиданием, а не объявленной ценой размещения. Инвесторам предстоит оценить быстрый рост компании вместе с расходами, концентрацией клиентов и теми рисками ИИ, о которых она предупреждает сама.
https://www.reuters.com/legal/transactional/anthropic-leaders-control-ai-lab-via-founder-llc-promote-public-good-over-market-2026-09-29/
🤣24👍11🔥5❤3🤔1🙏1
ИИ уже может принять в контекст миллионы токенов. А мы всё чаще просим его написать даже ответ на письмо из двух предложений.
Автор нового препринта называет это петлёй делегирования: ИИ справляется с задачами всё лучше → мы отдаём ему всё более простую работу → реже упражняемся сами → делегировать становится ещё легче.
В работе приводят яркое сравнение: контекстное окно моделей выросло с 512 токенов в 2017 году до 2 млн в 2026-м. Но человеческие «1 800 токенов внимания» из той же работы - расчётная оценка, а не прямое измерение памяти. Сравниваются разные вещи, поэтому точный разрыв «ИИ против человека» из этих цифр выводить нельзя.
Полезнее самого сравнения: поручить ИИ разобрать огромный отчёт разумно. А если постоянно отдавать ему задачи, которые сам сделал бы за полминуты, можно лишиться повседневной практики. Вредит ли это навыкам в долгую, пока не доказано: автор прямо называет петлю гипотезой, которую ещё предстоит проверить.
Какую последнюю задачу вы отдали ИИ, хотя могли сделать сами за 30 секунд?
Работа: https://arxiv.org/abs/2603.26707
Автор нового препринта называет это петлёй делегирования: ИИ справляется с задачами всё лучше → мы отдаём ему всё более простую работу → реже упражняемся сами → делегировать становится ещё легче.
В работе приводят яркое сравнение: контекстное окно моделей выросло с 512 токенов в 2017 году до 2 млн в 2026-м. Но человеческие «1 800 токенов внимания» из той же работы - расчётная оценка, а не прямое измерение памяти. Сравниваются разные вещи, поэтому точный разрыв «ИИ против человека» из этих цифр выводить нельзя.
Полезнее самого сравнения: поручить ИИ разобрать огромный отчёт разумно. А если постоянно отдавать ему задачи, которые сам сделал бы за полминуты, можно лишиться повседневной практики. Вредит ли это навыкам в долгую, пока не доказано: автор прямо называет петлю гипотезой, которую ещё предстоит проверить.
Какую последнюю задачу вы отдали ИИ, хотя могли сделать сами за 30 секунд?
Работа: https://arxiv.org/abs/2603.26707
❤20👍4🔥2🤔2🌚1
⚡️ OpenAI на DevDay показала сразу несколько крупных новинок.
Главное:
- GPT-6.1 Sol - почти уровень GPT-6 Astra, но примерно в 5 раз дешевле. Уже доступна платным пользователям;
- ChatGPT Space - общее рабочее пространство с документами, комментариями и возможностью подключать ChatGPT, Codex и Dots прямо к задачам;
- Pro Max за $500/мес - в 25 раз больше лимитов, чем в Plus;
- Ultrafast для GPT-6 Astra - до 8 раз быстрее в Codex, пока только на максимальной подписке.
Главное:
- GPT-6.1 Sol - почти уровень GPT-6 Astra, но примерно в 5 раз дешевле. Уже доступна платным пользователям;
- ChatGPT Space - общее рабочее пространство с документами, комментариями и возможностью подключать ChatGPT, Codex и Dots прямо к задачам;
- Pro Max за $500/мес - в 25 раз больше лимитов, чем в Plus;
- Ultrafast для GPT-6 Astra - до 8 раз быстрее в Codex, пока только на максимальной подписке.
🔥13👍5🥰4🥴2
В термоядерном реакторе раскалённую плазму удерживают магнитным полем. Для этого важно понимать, может ли поле сложной трёхмерной формы образовывать вложенные поверхности, вдоль которых движется плазма. В 1967 году физик Гарольд Грэд предположил, что гладкие равновесные решения такого типа без дополнительной симметрии вряд ли существуют.
Физик Мэтт Ландреман представил два семейства точных аналитических решений: магнитное поле и давление в них описываются явными формулами, а вложенные поверхности существуют даже без осевой симметрии. Автор пишет, что решения были найдены с помощью GPT-6 Astra Pro, после чего он вручную проверил все уравнения.
Другая группа исследователей уже недавно опровергла гипотезу Грэда доказательством существования таких решений. Новая работа добавляет конкретные формулы, которые можно использовать, в частности, для проверки программ, моделирующих магнитное удержание плазмы.
Статья: https://arxiv.org/pdf/2609.26742
Please open Telegram to view this post
VIEW IN TELEGRAM
❤20👍9🔥4
🔥 OpenAI обсуждает новый раунд минимум на $30 млрд при оценке около $1,4 трлн до инвестиций.
По данным Bloomberg, переговоры пока на ранней стадии, а параметры сделки ещё могут измениться. Такой раунд позволит OpenAI привлечь крупный капитал без выхода на биржу.
Сэм Альтман ранее исключил IPO в 2026 году, назвав нынешний момент «неподходящим» для размещения из-за объёма работы по безопасности и контролю ИИ.
При этом бизнес продолжает быстро расти. Axios сообщает, что годовой темп выручки OpenAI приближается к $70 млрд, примерно на 70% выше, чем в начале квартала. Выручка от корпоративных клиентов с июля выросла более чем вдвое.
Если раунд состоится на обсуждаемых условиях, OpenAI закрепится среди самых дорогих частных технологических компаний в мире ещё до возможного IPO.
По данным Bloomberg, переговоры пока на ранней стадии, а параметры сделки ещё могут измениться. Такой раунд позволит OpenAI привлечь крупный капитал без выхода на биржу.
Сэм Альтман ранее исключил IPO в 2026 году, назвав нынешний момент «неподходящим» для размещения из-за объёма работы по безопасности и контролю ИИ.
При этом бизнес продолжает быстро расти. Axios сообщает, что годовой темп выручки OpenAI приближается к $70 млрд, примерно на 70% выше, чем в начале квартала. Выручка от корпоративных клиентов с июля выросла более чем вдвое.
Если раунд состоится на обсуждаемых условиях, OpenAI закрепится среди самых дорогих частных технологических компаний в мире ещё до возможного IPO.
❤10👍4🔥1😁1😱1
Что, если заменить аналитиков нейросетью?
Да ничего хорошего: результаты анализа получаются слишком общими, и половину работы потом всё равно приходится переделывать руками.
Хард-скилы дешевеют — SQL-запрос или кусок кода теперь может сгенерировать почти кто угодно. А вот доменная экспертиза и умение работать с агентом становятся ценнее: правильно задать вопрос, собрать контекст, проверить, что результат не искажён.
Три аналитика Авито на конкретных примерах рассказывают, как работает тандем аналитик + AI. Делятся кейсами:
➡️ как перенесли 200 витрин за полгода;
➡️ автоматизировали проверку работы сотрудников;
➡️ научили LLM анализировать метрики.
Подробнее в ролике:
📺 YouTube
🔵 ВК
Больше честных историй о работе аналитиков Авито — в «Коммуналке аналитиков».
Да ничего хорошего: результаты анализа получаются слишком общими, и половину работы потом всё равно приходится переделывать руками.
Хард-скилы дешевеют — SQL-запрос или кусок кода теперь может сгенерировать почти кто угодно. А вот доменная экспертиза и умение работать с агентом становятся ценнее: правильно задать вопрос, собрать контекст, проверить, что результат не искажён.
Три аналитика Авито на конкретных примерах рассказывают, как работает тандем аналитик + AI. Делятся кейсами:
Подробнее в ролике:
Больше честных историй о работе аналитиков Авито — в «Коммуналке аналитиков».
Please open Telegram to view this post
VIEW IN TELEGRAM
❤6👍3🔥1
💸 Anthropic опубликовала практический гайд по снижению расходов на Claude API
Главная мысль: оптимизировать нужно не цену токена, а стоимость успешно выполненной задачи. Более дорогая модель иногда оказывается дешевле, если решает задачу за меньшее число шагов.
Anthropic предлагает такой порядок:
- сначала включить prompt caching - для агентных циклов это один из самых сильных способов экономии;
- убрать лишние входные и выходные токены;
- сокращать ненужные итерации агента;
- для фоновых задач использовать Batch API, где стоимость токенов снижается на 50%;
- только после этого экспериментировать с
Интересный вывод: переход на более дешевую модель - далеко не первый шаг оптимизации. Сначала стоит выжать максимум из архитектуры запросов и кеширования.
Гайд: https://github.com/anthropics/skills/blob/main/skills/claude-api/shared/cost-optimization.md
Главная мысль: оптимизировать нужно не цену токена, а стоимость успешно выполненной задачи. Более дорогая модель иногда оказывается дешевле, если решает задачу за меньшее число шагов.
Anthropic предлагает такой порядок:
- сначала включить prompt caching - для агентных циклов это один из самых сильных способов экономии;
- убрать лишние входные и выходные токены;
- сокращать ненужные итерации агента;
- для фоновых задач использовать Batch API, где стоимость токенов снижается на 50%;
- только после этого экспериментировать с
effort и более дешевыми моделями.Интересный вывод: переход на более дешевую модель - далеко не первый шаг оптимизации. Сначала стоит выжать максимум из архитектуры запросов и кеширования.
Гайд: https://github.com/anthropics/skills/blob/main/skills/claude-api/shared/cost-optimization.md
GitHub
skills/skills/claude-api/shared/cost-optimization.md at main · anthropics/skills
Public repository for Agent Skills. Contribute to anthropics/skills development by creating an account on GitHub.
🔥9❤4👍3🤣2🥰1
Какие инструменты добавить в свой стек работы с данными?
Работа с данными давно не ограничивается одним набором инструментов. В зависимости от задач нужны машинное обучение и нейронные сети, технологии Big Data или инструменты аналитики и визуализации.
В ДПО ФПМИ МФТИ можно выбрать курс в зависимости от задач, с которыми вы работаете:
➡️ Методы анализа данных и машинного обучения
Классическое машинное обучение, глубокое обучение, PyTorch и практические задачи — от классификации и прогнозирования до работы с изображениями и текстом.
➡️ Инструменты работы с большими данными
Hadoop, Spark, MapReduce и другие технологии для хранения и обработки больших объёмов данных.
➡️ Инструменты анализа и визуализации данных
Excel, Power BI и Yandex DataLens — анализ и визуализация данных, построение отчётов и интерактивных дашбордов.
Все курсы проходят онлайн. После успешного завершения обучения слушатели получают удостоверение о повышении квалификации Московского физико-технического института (МФТИ).
Подробнее об этих и других программах〰️ на сайте.
Реклама
2VtzqwpYTtg
Туз Елизавета Алексеевна
ИНН 772035623941
Работа с данными давно не ограничивается одним набором инструментов. В зависимости от задач нужны машинное обучение и нейронные сети, технологии Big Data или инструменты аналитики и визуализации.
В ДПО ФПМИ МФТИ можно выбрать курс в зависимости от задач, с которыми вы работаете:
Классическое машинное обучение, глубокое обучение, PyTorch и практические задачи — от классификации и прогнозирования до работы с изображениями и текстом.
Hadoop, Spark, MapReduce и другие технологии для хранения и обработки больших объёмов данных.
Excel, Power BI и Yandex DataLens — анализ и визуализация данных, построение отчётов и интерактивных дашбордов.
Все курсы проходят онлайн. После успешного завершения обучения слушатели получают удостоверение о повышении квалификации Московского физико-технического института (МФТИ).
Подробнее об этих и других программах
Реклама
2VtzqwpYTtg
Туз Елизавета Алексеевна
ИНН 772035623941
Please open Telegram to view this post
VIEW IN TELEGRAM
❤5👍2
🛡 Большая подборка по безопасности AI-агентов и их skills
На GitHub появился репозиторий Awesome Agent Skills Security - коллекция исследований, стандартов и инструментов по защите агентов, которые работают с внешними tools, plugins и skills.
Внутри собраны материалы по:
- prompt injection через инструменты;
- poisoning и supply-chain атакам;
- утечкам данных и чрезмерным правам;
- sandboxing и runtime monitoring;
- red teaming и benchmarks;
- OWASP, MITRE ATLAS, NIST и IETF-стандартам для агентных систем.
Особенно полезно тем, кто уже строит MCP/agent-инфраструктуру: список хорошо показывает, насколько сильно поверхность атаки выросла после того, как модели получили доступ к файлам, API и реальным действиям.
https://github.com/LLMSecurity/awesome-agent-skills-security
На GitHub появился репозиторий Awesome Agent Skills Security - коллекция исследований, стандартов и инструментов по защите агентов, которые работают с внешними tools, plugins и skills.
Внутри собраны материалы по:
- prompt injection через инструменты;
- poisoning и supply-chain атакам;
- утечкам данных и чрезмерным правам;
- sandboxing и runtime monitoring;
- red teaming и benchmarks;
- OWASP, MITRE ATLAS, NIST и IETF-стандартам для агентных систем.
Особенно полезно тем, кто уже строит MCP/agent-инфраструктуру: список хорошо показывает, насколько сильно поверхность атаки выросла после того, как модели получили доступ к файлам, API и реальным действиям.
https://github.com/LLMSecurity/awesome-agent-skills-security
❤6👍3🥰1
🧪 Новый бенчмарк проверяет не то, что ИИ знает, а способен ли он сам открыть неизвестные правила
Исследователи Tencent Hunyuan, Fudan и Tsinghua представили ExplorationBench. В нем модели попадают в «чужие миры», где привычная логика намеренно сломана: операторы работают иначе, а правила вывода изменены. Поэтому выученные знания почти бесполезны.
Модель получает неполное руководство и несколько раундов, чтобы самой придумывать эксперименты, проверять гипотезы и восстанавливать скрытые правила.
Результаты интересные:
- без обратной связи модели стартуют максимум с 15,7%;
- после четырех раундов лучший результат в AlienCode достигает 89%;
- у 9 из 10 систем собственные эксперименты оказались эффективнее повторения уже готовых;
- даже когда модель правильно знает все нужные правила, задача решается лишь в 73,4% случаев;
- один и тот же ИИ при одинаковом бюджете мог показать от 5,7% до 79%.
Главный вывод: уметь рассуждать по известным правилам и уметь самостоятельно открывать новые правила - это совсем разные способности.
Paper: https://arxiv.org/abs/2609.30199
Leaderboard: https://explorationbench.com/
Исследователи Tencent Hunyuan, Fudan и Tsinghua представили ExplorationBench. В нем модели попадают в «чужие миры», где привычная логика намеренно сломана: операторы работают иначе, а правила вывода изменены. Поэтому выученные знания почти бесполезны.
Модель получает неполное руководство и несколько раундов, чтобы самой придумывать эксперименты, проверять гипотезы и восстанавливать скрытые правила.
Результаты интересные:
- без обратной связи модели стартуют максимум с 15,7%;
- после четырех раундов лучший результат в AlienCode достигает 89%;
- у 9 из 10 систем собственные эксперименты оказались эффективнее повторения уже готовых;
- даже когда модель правильно знает все нужные правила, задача решается лишь в 73,4% случаев;
- один и тот же ИИ при одинаковом бюджете мог показать от 5,7% до 79%.
Главный вывод: уметь рассуждать по известным правилам и уметь самостоятельно открывать новые правила - это совсем разные способности.
Paper: https://arxiv.org/abs/2609.30199
Leaderboard: https://explorationbench.com/
👍4❤2🔥2