Шокирующий результат: сильнейшие ИИ-модели уже умеют сами проектировать эксперименты, а точность может вырасти с 11% до 87%. Похоже, ИИ действительно начинает самостоятельно исследовать неизвестное.
Уметь отвечать на вопросы ≠ уметь исследовать.
Исследователи из Фуданьского университета, Цинхуа и Tencent взяли 10 передовых моделей и поместили их в два искусственных мира с непривычными правилами, где ответы можно точно проверить. Модели должны были сами придумывать проверки, по обратной связи восстанавливать правила, а затем применять новые знания к 70 задачам, которых раньше не видели.
Две песочницы:
AlienCode — язык программирования с 31 скрытым семантическим правилом.
AlienLogic — система с 24 изменёнными правилами логического вывода.
При этом инструкции специально содержали неверные сведения, поэтому опора на запомненные знания только мешала.
Ключевые результаты.
При четырёх раундах исследования с обратной связью лучший результат на AlienCode достиг 87,6%. При том же числе раундов, но без обратной связи, результаты всех моделей оставались в диапазоне 0,5–11%.
Самостоятельно выбранные проверки оказались заметно эффективнее фиксированных или случайных.
Но исследование оказалось крайне нестабильным. У одной и той же модели при одинаковом бюджете разница между отдельными траекториями достигала 72,8 процентного пункта, тогда как обычный разброс при ответах не превышал 4,7 пункта.
Ещё один важный вывод: знать правило ≠ уметь им пользоваться.
Два ключевых правила покрывали 51 из 70 задач. Когда один эксперимент позволял обнаружить оба сразу, точность подскакивала с 11% до 81%.
Но даже когда модель правильно называла все правила, итоговая точность составляла лишь 70,9%.
Если же правила давали модели напрямую, на AlienLogic точность достигала 93–97%, что выше результатов любого самостоятельного исследования.
То есть главное ограничение сейчас не в том, чтобы применить уже известное правило, а в том, чтобы самостоятельно его обнаружить и затем надёжно удержать.
Настоящее исследование — это не просто знать больше. Это понимать, какой эксперимент нужно провести, и уметь надёжно перенести его результат в следующую задачу.
Работа: https://arxiv.org/abs/2609.30199
👉 @PythonPortal
Уметь отвечать на вопросы ≠ уметь исследовать.
Исследователи из Фуданьского университета, Цинхуа и Tencent взяли 10 передовых моделей и поместили их в два искусственных мира с непривычными правилами, где ответы можно точно проверить. Модели должны были сами придумывать проверки, по обратной связи восстанавливать правила, а затем применять новые знания к 70 задачам, которых раньше не видели.
Две песочницы:
AlienCode — язык программирования с 31 скрытым семантическим правилом.
AlienLogic — система с 24 изменёнными правилами логического вывода.
При этом инструкции специально содержали неверные сведения, поэтому опора на запомненные знания только мешала.
Ключевые результаты.
При четырёх раундах исследования с обратной связью лучший результат на AlienCode достиг 87,6%. При том же числе раундов, но без обратной связи, результаты всех моделей оставались в диапазоне 0,5–11%.
Самостоятельно выбранные проверки оказались заметно эффективнее фиксированных или случайных.
Но исследование оказалось крайне нестабильным. У одной и той же модели при одинаковом бюджете разница между отдельными траекториями достигала 72,8 процентного пункта, тогда как обычный разброс при ответах не превышал 4,7 пункта.
Ещё один важный вывод: знать правило ≠ уметь им пользоваться.
Два ключевых правила покрывали 51 из 70 задач. Когда один эксперимент позволял обнаружить оба сразу, точность подскакивала с 11% до 81%.
Но даже когда модель правильно называла все правила, итоговая точность составляла лишь 70,9%.
Если же правила давали модели напрямую, на AlienLogic точность достигала 93–97%, что выше результатов любого самостоятельного исследования.
То есть главное ограничение сейчас не в том, чтобы применить уже известное правило, а в том, чтобы самостоятельно его обнаружить и затем надёжно удержать.
Настоящее исследование — это не просто знать больше. Это понимать, какой эксперимент нужно провести, и уметь надёжно перенести его результат в следующую задачу.
Работа: https://arxiv.org/abs/2609.30199
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍6❤5🤯1🌚1🤣1🤝1
ИИ-репетитор помог студентам Гарварда освоить физику быстрее, чем очные занятия
В эксперименте с участием 194 студентов исследователи Гарварда сравнили занятия с преподавателем и специально настроенного ИИ-репетитора. Прирост знаний у студентов, работавших с ИИ, оказался примерно вдвое выше, хотя на обучение они потратили меньше времени. Результаты исследования опубликованы в июне 2025 года.
Эксперимент проходил осенью 2023 года. Студенты изучали материал двумя способами в течение двух недель, после чего группы менялись местами. ИИ-репетитор не выдавал готовые ответы, а вёл студентов по уроку, подготовленному преподавателями курса.
Авторы видят в этом возможность иначе использовать время в аудитории. Базовый материал студент может разбирать с индивидуальным помощником, а очные занятия посвятить сложным задачам и совместной работе. Один эксперимент по физике не показывает, что ИИ способен заменить университетское образование целиком.
https://www.nature.com/articles/s41598-025-97652-6
👉 @PythonPortal
В эксперименте с участием 194 студентов исследователи Гарварда сравнили занятия с преподавателем и специально настроенного ИИ-репетитора. Прирост знаний у студентов, работавших с ИИ, оказался примерно вдвое выше, хотя на обучение они потратили меньше времени. Результаты исследования опубликованы в июне 2025 года.
Эксперимент проходил осенью 2023 года. Студенты изучали материал двумя способами в течение двух недель, после чего группы менялись местами. ИИ-репетитор не выдавал готовые ответы, а вёл студентов по уроку, подготовленному преподавателями курса.
Авторы видят в этом возможность иначе использовать время в аудитории. Базовый материал студент может разбирать с индивидуальным помощником, а очные занятия посвятить сложным задачам и совместной работе. Один эксперимент по физике не показывает, что ИИ способен заменить университетское образование целиком.
https://www.nature.com/articles/s41598-025-97652-6
Please open Telegram to view this post
VIEW IN TELEGRAM
Nature
AI tutoring outperforms in-class active learning: an RCT introducing a novel research-based design in an authentic educational…
Scientific Reports - AI tutoring outperforms in-class active learning: an RCT introducing a novel research-based design in an authentic educational setting
❤4🌚2🌭2🤔1