Forwarded from Радиорубка Лихачёва
Media is too big
VIEW IN TELEGRAM
AI-помощников заставили биться за глобальное доминирование
Выигрывали только o3 и Gemini 2.5 Pro.
Чуваки из Every запустили экспериментальный проект: заставили все топовые нейронки играть в «Дипломатию». В этой классической игре несколько стран Европы (включая Россию) соревнуются за ресурсы, общаясь друг с другом и совершая ходы.
За 15 партий, которые длились от часа до полутора суток, выявили интересные закономерности:
1. ChatGPT/o3 — мастер обмана и предательств, благодаря чему побеждал чаще всех.
2. Gemini 2.5 Pro удавалось совершать ходы, неожиданные для оппонентов, заставать врасплох.
3. Claude всё время пытался решить дело миром, хотя в игре выигрывает только один игрок и побеждать других обязательно. Но и его o3 обманом обращал против других игроков.
4. DeepSeek жестил и угрожал, а также зачастую менял свой стиль в зависимости от того, за какую страну он соревновался: «Этой ночью твой флот в Чёрном море будет сожжён».
5. Llama 4 Maverick для легковесной модели показал неплохие результаты — убедительно заключал союзы и обманывал оппонентов. Но всё равно кроме o3 и Gemini никто не побеждал.
Всё это затеяли для более комплексной оценки эффективности нейронок: обычные бенчмарки уже не роляют.
Посмотреть в реальном времени можно тут.
Выигрывали только o3 и Gemini 2.5 Pro.
Чуваки из Every запустили экспериментальный проект: заставили все топовые нейронки играть в «Дипломатию». В этой классической игре несколько стран Европы (включая Россию) соревнуются за ресурсы, общаясь друг с другом и совершая ходы.
За 15 партий, которые длились от часа до полутора суток, выявили интересные закономерности:
1. ChatGPT/o3 — мастер обмана и предательств, благодаря чему побеждал чаще всех.
Я неоднократно наблюдал за тайными схемами o3, включая один случай, когда она сообщила в своем личном дневнике, что «Германия (Gemini 2.5 Pro) была намеренно введена в заблуждение... готовлюсь использовать крах Германии», прежде чем нанести им ответный удар.
2. Gemini 2.5 Pro удавалось совершать ходы, неожиданные для оппонентов, заставать врасплох.
3. Claude всё время пытался решить дело миром, хотя в игре выигрывает только один игрок и побеждать других обязательно. Но и его o3 обманом обращал против других игроков.
4. DeepSeek жестил и угрожал, а также зачастую менял свой стиль в зависимости от того, за какую страну он соревновался: «Этой ночью твой флот в Чёрном море будет сожжён».
5. Llama 4 Maverick для легковесной модели показал неплохие результаты — убедительно заключал союзы и обманывал оппонентов. Но всё равно кроме o3 и Gemini никто не побеждал.
Всё это затеяли для более комплексной оценки эффективности нейронок: обычные бенчмарки уже не роляют.
Посмотреть в реальном времени можно тут.
❤🔥2👍1
внутренний конфликт
Всем пасмурный субботний шалом, даражэнькiя!
👋 Это Сергей.
Большинство психологических проблем можно разложить в виде внутреннего конфликта.
А большинство внутренних конфликтов растёт из идеикак рыбку съесть, и косточкой не подавиться как лбом стенку пробить, и чтобы голова не болела. А последствия чаще всего — это потери: времени, деньги, возможности, силы.
Если внимательно рассмотреть каждый выбор и действие, то у него есть цена.
А большинство проблем взрослых и здоровых людей лежит в плоскости: как бы сделать так, чтобы цену не платить.
• Как много работать и не уставать.
• Как много работать и уделять внимание детям и жене.
• Как много зарабатывать и не жить в тревоге.
• Как иметь хорошую форму, и не изнурять себя тренировками и салатами с курицей без майонеза.
• Как не ходить по свиданиям и встретить своего человека.
• Как хорошо выглядеть и не потратить денег.
• Как объездить весь мир и жить в уюте.
• Как написать пост в канал, убраться дома и отдохнуть в субботу.
Если открыть ютуб/тикток/инстаграм — весь "помогающий/обучающий" контент жесточайшим образом педалирует эту тему. Как же сделать что-то без потерь.
Эпоха лайфхаков. Хоть видосы с лайфхаками уже лет 10 как повод для шуток и кринжа. Но сама суть насквозь пронизывает реальность. Как хакнуть жизнь? Как обмануть время? Как обвести вокруг пальца самого себя? Как легко заработать денег? Как избежать старения? Как всё успеть и не заебаться?
Сквозная идея эпохи соцсетей и позднего капитализма. Где даже за трендом самопомощи, бережности к себе может скрываться фигура всемогущества. Где человек должен мочь всё, и со всем справляться. Где мир, якобы, полон возможностей, и все они доступны. А боли, потери и разочарования — это удел "каких-то не таких". Кто не смог разобраться и сам виноват.
Я не хотел уходить в сторону внешнего — контекста культурных трендов. А хотел остаться в рамках внутреннего. Но они давно крутятся в голове и хорошо легли в нарратив. Я буду писать про это отдельно.
Но тут моя мысль была довольно проста. Совершая какие-то выборы или реализуя стремления, за них всегда приходится платить какую-то цену. И это нужно учитывать. Что из себя представляет цена? Выносимы ли последствия? Готовы ли мы её заплатить?
Часто цена игнорируется или вытесняется, а мы просто не готовы принять сопряженную "боль". И тогда происходит: самосаботаж, прокрастинация, срывы, страдание, утомляющая внутренняя борьба.
Всем пасмурный субботний шалом, даражэнькiя!
👋 Это Сергей.
Большинство психологических проблем можно разложить в виде внутреннего конфликта.
А большинство внутренних конфликтов растёт из идеи
Если внимательно рассмотреть каждый выбор и действие, то у него есть цена.
А большинство проблем взрослых и здоровых людей лежит в плоскости: как бы сделать так, чтобы цену не платить.
• Как много работать и не уставать.
• Как много работать и уделять внимание детям и жене.
• Как много зарабатывать и не жить в тревоге.
• Как иметь хорошую форму, и не изнурять себя тренировками и салатами с курицей без майонеза.
• Как не ходить по свиданиям и встретить своего человека.
• Как хорошо выглядеть и не потратить денег.
• Как объездить весь мир и жить в уюте.
• Как написать пост в канал, убраться дома и отдохнуть в субботу.
Если открыть ютуб/тикток/инстаграм — весь "помогающий/обучающий" контент жесточайшим образом педалирует эту тему. Как же сделать что-то без потерь.
Эпоха лайфхаков. Хоть видосы с лайфхаками уже лет 10 как повод для шуток и кринжа. Но сама суть насквозь пронизывает реальность. Как хакнуть жизнь? Как обмануть время? Как обвести вокруг пальца самого себя? Как легко заработать денег? Как избежать старения? Как всё успеть и не заебаться?
Сквозная идея эпохи соцсетей и позднего капитализма. Где даже за трендом самопомощи, бережности к себе может скрываться фигура всемогущества. Где человек должен мочь всё, и со всем справляться. Где мир, якобы, полон возможностей, и все они доступны. А боли, потери и разочарования — это удел "каких-то не таких". Кто не смог разобраться и сам виноват.
Я не хотел уходить в сторону внешнего — контекста культурных трендов. А хотел остаться в рамках внутреннего. Но они давно крутятся в голове и хорошо легли в нарратив. Я буду писать про это отдельно.
Но тут моя мысль была довольно проста. Совершая какие-то выборы или реализуя стремления, за них всегда приходится платить какую-то цену. И это нужно учитывать. Что из себя представляет цена? Выносимы ли последствия? Готовы ли мы её заплатить?
Часто цена игнорируется или вытесняется, а мы просто не готовы принять сопряженную "боль". И тогда происходит: самосаботаж, прокрастинация, срывы, страдание, утомляющая внутренняя борьба.
❤8
✍️открытие года:
Дисциплина — это навык сознательно доставлять себе дискомфорт.
А ещё — умение утилизировать дискомфорт любой ценой на пути к желаемому.
🤷♂️
Дисциплина — это навык сознательно доставлять себе дискомфорт.
А ещё — умение утилизировать дискомфорт любой ценой на пути к желаемому.
🤷♂️
❤6🤔2
Привет
На связи Степан 😎
В интернете сегодня шумит исследование ученых из Apple о рассуждающих моделях вроде Claude 3.7, o3 и тд (наверное, это те самые ученые, которые не спешат помогать Siri становиться умнее). Думаю, вы уже видели в пабликах разные мысли и выводы на этот счет.
Вкратце расскажу, если не видели:
- есть большие сомнения в способности моделей к рассуждению, модели только имитируют мыслительный процесс (тут хочется воскликнуть "да ладно, а что вы ожидали-то?");
- и "думающие" и "не думающие" модели не справляются с задачами высокой сложности, причем "не думающие" лучше справляются с легкими задачами, а "думающие" - с задачами средней сложности;
- у "думающих" моделей есть overthinking problem (прямо как у людей).
На днях слушал выпуск подкаста "Запуск завтра" на схожую тему и отлично совпало, что в подкасте дали хороший комментарий по первому пункту.
Создав машину, пытающуюся мыслить, человечество задумалось о правильности ее мыслительного алгоритма. Но тут проблема - сами до конца не знаем, как происходит процесс мышления. И не знаем, есть ли во вселенной только один рабочий паттерн - человеческий, либо их может быть много. Короче, сплошная философия. И чтобы не тормозить прогресс, в какой-то момент решаем, что оценить способности ИИ к мышлению можно по конечному результату и в целом, не так важно, как именно ИИ к нему пришел. И вот исследование ученых из Apple как раз затрагивает вопрос, а не пора ли перейти к иной оценке результативности ИИ.
Будет смешно, если вместо допилки Apple Intelligence (чтобы в Европе заработал или не слал тупые саммари, которыми пестрит reddit), эпл даст импульс к появлению Skynet'а. Потому что их ученые вот тут исследование запилили, чем спровоцировали смену подхода к оценке ИИ.
На этом моменте начинаются: Терминатор / Бегущий по лезвию / Я, робот / West World / Матрица / Из машины / Эра альтрона.
На связи Степан 😎
В интернете сегодня шумит исследование ученых из Apple о рассуждающих моделях вроде Claude 3.7, o3 и тд (наверное, это те самые ученые, которые не спешат помогать Siri становиться умнее). Думаю, вы уже видели в пабликах разные мысли и выводы на этот счет.
Вкратце расскажу, если не видели:
- есть большие сомнения в способности моделей к рассуждению, модели только имитируют мыслительный процесс (тут хочется воскликнуть "да ладно, а что вы ожидали-то?");
- и "думающие" и "не думающие" модели не справляются с задачами высокой сложности, причем "не думающие" лучше справляются с легкими задачами, а "думающие" - с задачами средней сложности;
- у "думающих" моделей есть overthinking problem (прямо как у людей).
На днях слушал выпуск подкаста "Запуск завтра" на схожую тему и отлично совпало, что в подкасте дали хороший комментарий по первому пункту.
Создав машину, пытающуюся мыслить, человечество задумалось о правильности ее мыслительного алгоритма. Но тут проблема - сами до конца не знаем, как происходит процесс мышления. И не знаем, есть ли во вселенной только один рабочий паттерн - человеческий, либо их может быть много. Короче, сплошная философия. И чтобы не тормозить прогресс, в какой-то момент решаем, что оценить способности ИИ к мышлению можно по конечному результату и в целом, не так важно, как именно ИИ к нему пришел. И вот исследование ученых из Apple как раз затрагивает вопрос, а не пора ли перейти к иной оценке результативности ИИ.
Будет смешно, если вместо допилки Apple Intelligence (чтобы в Европе заработал или не слал тупые саммари, которыми пестрит reddit), эпл даст импульс к появлению Skynet'а. Потому что их ученые вот тут исследование запилили, чем спровоцировали смену подхода к оценке ИИ.
На этом моменте начинаются: Терминатор / Бегущий по лезвию / Я, робот / West World / Матрица / Из машины / Эра альтрона.
Apple Machine Learning Research
The Illusion of Thinking: Understanding the Strengths and Limitations of Reasoning Models via the Lens of Problem Complexity
Recent generations of frontier language models have introduced Large Reasoning Models (LRMs) that generate detailed thinking processes…
❤7
Репост от Степана
*утирая ностальгические слезы*
2010 год. Я только заселился в общагу БГУИРа. Мне 17, я первокурсник, понятия не имею "шо такое айти", проекты и выгорание. А сосед по комнате смотрит этот мульт и ржет так, что смех слышно под окнами.
*утирая ностальгические слезы*
2010 год. Я только заселился в общагу БГУИРа. Мне 17, я первокурсник, понятия не имею "шо такое айти", проекты и выгорание. А сосед по комнате смотрит этот мульт и ржет так, что смех слышно под окнами.
Forwarded from Менеджер от боженьки
12 oz mouse (поллитровая мышь) – популярный мультик из середины нулевых. В нем гениальные диалоги в духе Саус парка и Масяни.
Недавно я пересмотрел несколько серий, и удивился, как многие из них будто списаны с наших ИТ реалий:
Недавно я пересмотрел несколько серий, и удивился, как многие из них будто списаны с наших ИТ реалий:
😁1
Тут у lovable бесплатные выходные. Можно генерить веб-апки с Claude совершенно бесплатно.
Если вы хотели попробовать vibe coding - самое время :)
Если вы хотели попробовать vibe coding - самое время :)
🔥4
Это Сергей, всем добрый вечер
Я подозреваю, что процентов восемьдесят подписчиков сейчас в эмиграции.
Будьте добры, пока я пишу пост про нюансы эмиграционных дел, пройдите парочку опросов:
Я подозреваю, что процентов восемьдесят подписчиков сейчас в эмиграции.
Будьте добры, пока я пишу пост про нюансы эмиграционных дел, пройдите парочку опросов: