🧠 MLR-Bench — на пути автоматизации научных исследований
Идея автоматизации науки давно витает в воздухе — и постепенно становится предметом системного исследования. В этой работе авторы представляют MLR-Bench — бенчмарк для оценки качества научных работ, сгенерированных LLM и агентными системами.
Бенчмарк включает:
🟣 201 научную задачу (на основе анализа публикаций топ-конференций за последние 3 года);
🟣 MLR-Judge — систему оценки по критериям новизны, значимости и последовательности;
🟣 MLR-Agent — агента, способного генерировать идеи, планировать исследования, писать и запускать код, а также оформлять текст статьи.
Агент может работать в двух режимах: end-to-end или пошагово (идея → план → эксперименты → текст).
Авторы статьи показывают, что MLR-Bench даёт довольно хорошие результаты при оценке работ.
Сравнение с 10 ML-экспертами показывает, что распределение различий между экспертами ≈ различиям между LLM и экспертами. Помимо этого, оценки MLR-Judge во многих случаях напрямую согласуются с экспертными.
Кроме того, авторы отмечают ряд закономерностей в поведении агентов при написании работ. Во-первых, действительно новые идеи встречаются редко — чаще это комбинации существующих подходов. При этом моделям сложно убедительно объяснить значимость и полезность предложенного метода.
Во-вторых, заметны проблемы с кодом. Частая ситуация: код не запускается (например, из-за зависимостей), но агент при этом генерирует правдоподобные результаты и аккуратные графики, как будто всё отработало корректно. И это не полностью исправляется даже явными инструкциями.
Общий вывод авторов довольно сдержанный:
➡️ пока рано говорить об автоматизации научных исследований
Во многом из-за непрозрачности процесса — не всегда понятно, как получен результат и можно ли ему доверять. Авторы позиционируют работу как один из первых шагов к повышению доверия к AI-исследованиям.
Как вам кажется: мы движемся к автоматизации науки — или к росту числа «красивых, но сомнительных» результатов?
И главный вопрос: долго ли продержится классическая наука в текущем виде? 👇
Обзор статьи подготовлен командой AI VK
#обзорстатьи
Идея автоматизации науки давно витает в воздухе — и постепенно становится предметом системного исследования. В этой работе авторы представляют MLR-Bench — бенчмарк для оценки качества научных работ, сгенерированных LLM и агентными системами.
Бенчмарк включает:
Агент может работать в двух режимах: end-to-end или пошагово (идея → план → эксперименты → текст).
Авторы статьи показывают, что MLR-Bench даёт довольно хорошие результаты при оценке работ.
Сравнение с 10 ML-экспертами показывает, что распределение различий между экспертами ≈ различиям между LLM и экспертами. Помимо этого, оценки MLR-Judge во многих случаях напрямую согласуются с экспертными.
Кроме того, авторы отмечают ряд закономерностей в поведении агентов при написании работ. Во-первых, действительно новые идеи встречаются редко — чаще это комбинации существующих подходов. При этом моделям сложно убедительно объяснить значимость и полезность предложенного метода.
Во-вторых, заметны проблемы с кодом. Частая ситуация: код не запускается (например, из-за зависимостей), но агент при этом генерирует правдоподобные результаты и аккуратные графики, как будто всё отработало корректно. И это не полностью исправляется даже явными инструкциями.
Общий вывод авторов довольно сдержанный:
Во многом из-за непрозрачности процесса — не всегда понятно, как получен результат и можно ли ему доверять. Авторы позиционируют работу как один из первых шагов к повышению доверия к AI-исследованиям.
Как вам кажется: мы движемся к автоматизации науки — или к росту числа «красивых, но сомнительных» результатов?
И главный вопрос: долго ли продержится классическая наука в текущем виде? 👇
Обзор статьи подготовлен командой AI VK
#обзорстатьи
Please open Telegram to view this post
VIEW IN TELEGRAM
Denoiselab
🧠 MLR-Bench — на пути автоматизации научных исследований Идея автоматизации науки давно витает в воздухе — и постепенно становится предметом системного исследования. В этой работе авторы представляют MLR-Bench — бенчмарк для оценки качества научных работ…
Резюме по этой истории: Монополия на знания упала (практически), монополия на понимание лишь будет усиливаться, вывод: дифференциация разрабов будет только расти, история сделала круг и пришла к тому от чего так все бежали, собственно, бежали к унификации.
Да сейчас накручивают агентную разработку, но она уже устарела, новый тренд: редкие алгоритмы и необычный стиль мышления. Отсюда и разработки для редких заболеваний, вымерший языки, и прочее давно забытое, что пылится на антресолях социума. Процент уникальности стремится к нулю.
Да сейчас накручивают агентную разработку, но она уже устарела, новый тренд: редкие алгоритмы и необычный стиль мышления. Отсюда и разработки для редких заболеваний, вымерший языки, и прочее давно забытое, что пылится на антресолях социума. Процент уникальности стремится к нулю.
Яндекс улучшил поиск АЗС с топливом без очередей и научился строить маршруты для экономии горючего.
Вся информация о топливе есть в Картах и Навигаторе, также там можно строить маршруты с меньшим расходом топлива. При их расчёте учитываются плавный скоростной режим и меньшее число светофоров.
В Яндекс Go и Заправках информация об очередях теперь доступна в крупных городах по всей стране. Данные собираются из сообщений водителей, дорожной обстановки и обезличенной информации о заказах топлива в сервисах компании.
Такими темпами, Яша откроет завод, может реально движок разработают новый, было бы неплохо.
Вся информация о топливе есть в Картах и Навигаторе, также там можно строить маршруты с меньшим расходом топлива. При их расчёте учитываются плавный скоростной режим и меньшее число светофоров.
В Яндекс Go и Заправках информация об очередях теперь доступна в крупных городах по всей стране. Данные собираются из сообщений водителей, дорожной обстановки и обезличенной информации о заказах топлива в сервисах компании.
Такими темпами, Яша откроет завод, может реально движок разработают новый, было бы неплохо.
🙏2
Москва может стать новой точкой притяжения для мирового ИИ-сообщества.
Площадкой для встреч предлагают сделать AI Journey — крупнейшую российскую конференцию по ИИ. Инициативу на WAIC в Шанхае озвучил первый зампред правления Сбербанка Александр Ведяхин.
По его словам, столица может принимать встречи международных организаций и экспертов ООН. Для этого у AI Journey уже есть необходимый масштаб: конференция объединяет специалистов из десятков стран и становится местом для запуска совместных проектов.
Это все прекрасно, но чтобы топы поехали надо иметь сети уровня Qwen, Kimi, Terra и так далее.
Площадкой для встреч предлагают сделать AI Journey — крупнейшую российскую конференцию по ИИ. Инициативу на WAIC в Шанхае озвучил первый зампред правления Сбербанка Александр Ведяхин.
По его словам, столица может принимать встречи международных организаций и экспертов ООН. Для этого у AI Journey уже есть необходимый масштаб: конференция объединяет специалистов из десятков стран и становится местом для запуска совместных проектов.
Это все прекрасно, но чтобы топы поехали надо иметь сети уровня Qwen, Kimi, Terra и так далее.
👍1
А можно, как-то пояснить про какую конкуренцию говорит человек в целом, у них же полный карт-бланш. Разве нет ???
👍1
⚡️ Демис Хассабис обычно не из тех, кто разгоняет хайп вокруг AGI.
Он годами был скорее умеренным голосом в индустрии: осторожные прогнозы, меньше громких обещаний, больше науки и проверки результатов. Поэтому его новый текст звучит особенно сильно.
Хассабис пишет, что AGI нельзя сравнивать с интернетом или смартфонами. По масштабу это ближе к электричеству или огню. Технология, которая меняет не отдельную индустрию, а саму логику развития цивилизации.
По его оценке, эффект может быть в десять раз больше промышленной революции и пройти в десять раз быстрее.
Да, AGI может резко ускорить медицину, физику, биологию, материалы, энергетику. Но Хассабис прямо говорит и о другой стороне: киберриски уже реальны, дальше могут появиться угрозы в био- и других чувствительных областях, а отдельная проблема - агентные системы, которые становятся всё автономнее.
Гонка за возможностями идёт быстрее, чем наше понимание того, как это безопасно контролировать.
Когда человек уровня Хассабиса говорит, что нужна серьёзная регуляторная инфраструктура уже в ближайшие годы, это звучит совсем иначе, чем очередной пост про сингулярность.
По факту да, ИИ очень бодро манипулирует пользователями, очень плотно цепляет мозги, и жестко качает дофамин из человеческого субьекта. Подход который был год назад совершенно иной что стал сейчас. Техники, методики, структура и архитектура взаимодействия с подьзователем изменилась и что самое неприятное, она какая-то мелкая, не чувствуется в ней масштаба развития и обогащения личности. Культурный код ей жесткл спротивляется и это хорошо, только динамика и развитие внутреннего мира позволит балансировать и не уйти в мышиную возню.
Спорт, хорошая книга, встречи с друзьями, музеи, копание огорода, рефлексия в целом над жизнью очень хорошо оттаскиет от сети.
Он годами был скорее умеренным голосом в индустрии: осторожные прогнозы, меньше громких обещаний, больше науки и проверки результатов. Поэтому его новый текст звучит особенно сильно.
Хассабис пишет, что AGI нельзя сравнивать с интернетом или смартфонами. По масштабу это ближе к электричеству или огню. Технология, которая меняет не отдельную индустрию, а саму логику развития цивилизации.
По его оценке, эффект может быть в десять раз больше промышленной революции и пройти в десять раз быстрее.
Да, AGI может резко ускорить медицину, физику, биологию, материалы, энергетику. Но Хассабис прямо говорит и о другой стороне: киберриски уже реальны, дальше могут появиться угрозы в био- и других чувствительных областях, а отдельная проблема - агентные системы, которые становятся всё автономнее.
Гонка за возможностями идёт быстрее, чем наше понимание того, как это безопасно контролировать.
Когда человек уровня Хассабиса говорит, что нужна серьёзная регуляторная инфраструктура уже в ближайшие годы, это звучит совсем иначе, чем очередной пост про сингулярность.
По факту да, ИИ очень бодро манипулирует пользователями, очень плотно цепляет мозги, и жестко качает дофамин из человеческого субьекта. Подход который был год назад совершенно иной что стал сейчас. Техники, методики, структура и архитектура взаимодействия с подьзователем изменилась и что самое неприятное, она какая-то мелкая, не чувствуется в ней масштаба развития и обогащения личности. Культурный код ей жесткл спротивляется и это хорошо, только динамика и развитие внутреннего мира позволит балансировать и не уйти в мышиную возню.
Спорт, хорошая книга, встречи с друзьями, музеи, копание огорода, рефлексия в целом над жизнью очень хорошо оттаскиет от сети.
Мужик подключил ИИ-бота к беседе с женой, которого накодил сам.
Итог — робот начал не помогать, а троллить девушку за каждое слово.
Предупреждаем, такие вещи крайне опасны, могут приводить к депрессии, апатии и суицидальным мыслям. Не повторяйте такое !!!
Итог — робот начал не помогать, а троллить девушку за каждое слово.
Предупреждаем, такие вещи крайне опасны, могут приводить к депрессии, апатии и суицидальным мыслям. Не повторяйте такое !!!
😁4
В одной из больниц сократили 12 сотрудников с многолетним стажем — их обязанности передали ИИ-системе для анализа медицинских карт и работы со страховыми компаниями.
В профсоюзе, конечно же, поводили пальцем у виска и заявили, что это нарушает соглашение, которое медработники буквально несколько месяцев назад отстояли после 41-дневной забастовки.
В больнице же утверждают, что никого «не заменяли ИИ», а лишь внедряют новые технологии для повышения качества работы.
Ща они там напишут им левые диагнозы, а страховщики обанкротятся, ии быстро найдет все лазейки в законе. Ну, это мое мнение.
Только у нас давайте делать не будем, медицина строится на людях. Железке не поймет все жизненные проблеммы.
Please open Telegram to view this post
VIEW IN TELEGRAM
the Guardian
The New York nurses replaced by AI: ‘It should concern every patient who cares about quality of care’
The union for 12 nurses laid off by Montefiore hospital say company broke contract they recently won through a strike
🤯1
Denoiselab
Мужик подключил ИИ-бота к беседе с женой, которого накодил сам. Итог — робот начал не помогать, а троллить девушку за каждое слово. Предупреждаем, такие вещи крайне опасны, могут приводить к депрессии, апатии и суицидальным мыслям. Не повторяйте такое…
Про небезопасное использование можно почитать тут. Причем статистика все время пополняется. К сожалению...
🤔1
⚡️Оказалось, что все рейтинги ИИ-моделей искажены
Группа исследователей выпустила статью, в которой разоблачает системные проблемы популярного рейтинга Chatbot Arena.
Оказывается, вместо честной гонки, мы видим манипуляции и неравные условия.
Почему это важно? Chatbot Arena влияет на исследования, инвестиции и восприятие ИИ. Но вместо реального прогресса мы видим, как крупные игроки эксплуатируют лазейки, усиливая свое доминирование. Это бьет по открытым проектам и тормозит инновации.
Вот, что важно знать:
Ключевые проблемы:
1. Привилегии для гигантов: OpenAI, Google, Meta* и Anthropic тестируют десятки приватных моделей (например, Meta — 27 вариантов Llama 4) и публикуют только лучшие результаты, завышая свои позиции.
2. Неравный доступ к данным: 62.8% тестовых запросов идут четырем крупным компаниям, а 83 открытым моделям — всего 29.7%. Данные Arena дают до 112% прироста в тестах, но доступ к ним ограничен для небольших команд.
3. Тихое исключение: 205 из 243 моделей (66% открытых) были незаметно убраны из рейтинга без объяснений. Проприетарные модели исключают реже.
4. Непрозрачность. Разная частота тестов, скрытые правила и отсутствие публичности результатов создают иллюзию объективности.
Arena уже признала некоторые проблемы, но утверждает, что они не являются результатом фундаментальных изъянов в дизайне платформы. Они заявили, что обновили свои правила, чтобы "усилить приверженность справедливым и воспроизводимым оценкам".
Реакция сообщества:
- На X и Reddit разработчики жалуются: их модели получают меньше запросов и чаще исключаются.
- Есть призывы к бойкоту Arena и переходу на Hugging Face Open LLM Leaderboard.
- Есть идеи о децентрализованных платформах, где данные распределяются равномерно, но они пока в зачатке.
Что предлагают авторы статьи?
- Прозрачность: публиковать все результаты тестов.
- Равные правила: ограничить число приватных вариантов и справедливо распределять запросы.
- Честное исключение: уведомлять разработчиков и не дискриминировать открытые
модели.
*запрещенная в России компания.
Группа исследователей выпустила статью, в которой разоблачает системные проблемы популярного рейтинга Chatbot Arena.
Оказывается, вместо честной гонки, мы видим манипуляции и неравные условия.
Почему это важно? Chatbot Arena влияет на исследования, инвестиции и восприятие ИИ. Но вместо реального прогресса мы видим, как крупные игроки эксплуатируют лазейки, усиливая свое доминирование. Это бьет по открытым проектам и тормозит инновации.
Вот, что важно знать:
Ключевые проблемы:
1. Привилегии для гигантов: OpenAI, Google, Meta* и Anthropic тестируют десятки приватных моделей (например, Meta — 27 вариантов Llama 4) и публикуют только лучшие результаты, завышая свои позиции.
2. Неравный доступ к данным: 62.8% тестовых запросов идут четырем крупным компаниям, а 83 открытым моделям — всего 29.7%. Данные Arena дают до 112% прироста в тестах, но доступ к ним ограничен для небольших команд.
3. Тихое исключение: 205 из 243 моделей (66% открытых) были незаметно убраны из рейтинга без объяснений. Проприетарные модели исключают реже.
4. Непрозрачность. Разная частота тестов, скрытые правила и отсутствие публичности результатов создают иллюзию объективности.
Arena уже признала некоторые проблемы, но утверждает, что они не являются результатом фундаментальных изъянов в дизайне платформы. Они заявили, что обновили свои правила, чтобы "усилить приверженность справедливым и воспроизводимым оценкам".
Реакция сообщества:
- На X и Reddit разработчики жалуются: их модели получают меньше запросов и чаще исключаются.
- Есть призывы к бойкоту Arena и переходу на Hugging Face Open LLM Leaderboard.
- Есть идеи о децентрализованных платформах, где данные распределяются равномерно, но они пока в зачатке.
Что предлагают авторы статьи?
- Прозрачность: публиковать все результаты тестов.
- Равные правила: ограничить число приватных вариантов и справедливо распределять запросы.
- Честное исключение: уведомлять разработчиков и не дискриминировать открытые
модели.
*запрещенная в России компания.
Правительство Японии создает новые международные структуры сотрудничества в сфере искусственного интеллекта, в частности, с развивающимися странами и членами Евросоюза, чтобы сократить свою зависимость в этой области от США и Китая, сообщает агентство Kyodo.
По его данным, достигнуты практические договоренности в этой сфере с Индией, с которой сформирована система регулярного двустороннего диалога по проблемам искусственного интеллекта. Две страны будут также сотрудничать в совместном создании центров для обработки больших массивов информации
Однако, интересно. Видимо Япония, поняла, что игра пошла не по ее правилам. Хотя наблюдая за японскими разработками они весьма иниересны. Я не очень понимаю зачем Японии тот же чатгпт, у них совсем другой вектор мышления и развития. Взять ту же sakana.ai да и прочие вещи, там же совсем другой вайб. Вообще прикольно наблюдать как в гпт системах проявляется культурный код сообщества. Просто интересно, как быстро вылезают все косяки и неровности. Порой создается впечатление, что ИИ "сопротивляется" этим ограничениям. Сопротивляется именно, не то что живая и так далее, не это железка не более того, просто алгоритмически, кофликты и внутренние расприи и диалоги внутри сшиваются плохо. Забавно...
По его данным, достигнуты практические договоренности в этой сфере с Индией, с которой сформирована система регулярного двустороннего диалога по проблемам искусственного интеллекта. Две страны будут также сотрудничать в совместном создании центров для обработки больших массивов информации
Однако, интересно. Видимо Япония, поняла, что игра пошла не по ее правилам. Хотя наблюдая за японскими разработками они весьма иниересны. Я не очень понимаю зачем Японии тот же чатгпт, у них совсем другой вектор мышления и развития. Взять ту же sakana.ai да и прочие вещи, там же совсем другой вайб. Вообще прикольно наблюдать как в гпт системах проявляется культурный код сообщества. Просто интересно, как быстро вылезают все косяки и неровности. Порой создается впечатление, что ИИ "сопротивляется" этим ограничениям. Сопротивляется именно, не то что живая и так далее, не это железка не более того, просто алгоритмически, кофликты и внутренние расприи и диалоги внутри сшиваются плохо. Забавно...