Временно Степан
122 subscribers
104 photos
12 videos
8 files
76 links
Senior BA/Proxy PO in AI.
Как жить, работать и не терять себя среди AI-реальности и эмиграции.
Портфолио тут: https://sazanavets.cc
Download Telegram
Походу будущее человечества зависит от того, какая нейронка станет Skynet’ом. Если ChatGPT, то у нас проблемы
Media is too big
VIEW IN TELEGRAM
AI-помощников заставили биться за глобальное доминирование

Выигрывали только o3 и Gemini 2.5 Pro.

Чуваки из Every запустили экспериментальный проект: заставили все топовые нейронки играть в «Дипломатию». В этой классической игре несколько стран Европы (включая Россию) соревнуются за ресурсы, общаясь друг с другом и совершая ходы.

За 15 партий, которые длились от часа до полутора суток, выявили интересные закономерности:

1. ChatGPT/o3 — мастер обмана и предательств, благодаря чему побеждал чаще всех.

Я неоднократно наблюдал за тайными схемами o3, включая один случай, когда она сообщила в своем личном дневнике, что «Германия (Gemini 2.5 Pro) была намеренно введена в заблуждение... готовлюсь использовать крах Германии», прежде чем нанести им ответный удар.


2. Gemini 2.5 Pro удавалось совершать ходы, неожиданные для оппонентов, заставать врасплох.

3. Claude всё время пытался решить дело миром, хотя в игре выигрывает только один игрок и побеждать других обязательно. Но и его o3 обманом обращал против других игроков.

4. DeepSeek жестил и угрожал, а также зачастую менял свой стиль в зависимости от того, за какую страну он соревновался: «Этой ночью твой флот в Чёрном море будет сожжён».

5. Llama 4 Maverick для легковесной модели показал неплохие результаты — убедительно заключал союзы и обманывал оппонентов. Но всё равно кроме o3 и Gemini никто не побеждал.

Всё это затеяли для более комплексной оценки эффективности нейронок: обычные бенчмарки уже не роляют.

Посмотреть в реальном времени можно тут.
❤‍🔥2👍1
внутренний конфликт

Всем пасмурный субботний шалом, даражэнькiя!

👋 Это Сергей.

Большинство психологических проблем можно разложить в виде внутреннего конфликта.
А большинство внутренних конфликтов растёт из идеи как рыбку съесть, и косточкой не подавиться как лбом стенку пробить, и чтобы голова не болела. А последствия чаще всего — это потери: времени, деньги, возможности, силы.
Если внимательно рассмотреть каждый выбор и действие, то у него есть цена.
А большинство проблем взрослых и здоровых людей лежит в плоскости: как бы сделать так, чтобы цену не платить.

• Как много работать и не уставать.
• Как много работать и уделять внимание детям и жене.
• Как много зарабатывать и не жить в тревоге.
• Как иметь хорошую форму, и не изнурять себя тренировками и салатами с курицей без майонеза.
• Как не ходить по свиданиям и встретить своего человека.
• Как хорошо выглядеть и не потратить денег.
• Как объездить весь мир и жить в уюте.
• Как написать пост в канал, убраться дома и отдохнуть в субботу.

Если открыть ютуб/тикток/инстаграм — весь "помогающий/обучающий" контент жесточайшим образом педалирует эту тему. Как же сделать что-то без потерь.

Эпоха лайфхаков. Хоть видосы с лайфхаками уже лет 10 как повод для шуток и кринжа. Но сама суть насквозь пронизывает реальность. Как хакнуть жизнь? Как обмануть время? Как обвести вокруг пальца самого себя? Как легко заработать денег? Как избежать старения? Как всё успеть и не заебаться?

Сквозная идея эпохи соцсетей и позднего капитализма. Где даже за трендом самопомощи, бережности к себе может скрываться фигура всемогущества. Где человек должен мочь всё, и со всем справляться. Где мир, якобы, полон возможностей, и все они доступны. А боли, потери и разочарования — это удел "каких-то не таких". Кто не смог разобраться и сам виноват.

Я не хотел уходить в сторону внешнего — контекста культурных трендов. А хотел остаться в рамках внутреннего. Но они давно крутятся в голове и хорошо легли в нарратив. Я буду писать про это отдельно.

Но тут моя мысль была довольно проста. Совершая какие-то выборы или реализуя стремления, за них всегда приходится платить какую-то цену. И это нужно учитывать. Что из себя представляет цена? Выносимы ли последствия? Готовы ли мы её заплатить?

Часто цена игнорируется или вытесняется, а мы просто не готовы принять сопряженную "боль". И тогда происходит: самосаботаж, прокрастинация, срывы, страдание, утомляющая внутренняя борьба.
8
✍️открытие года:
Дисциплина — это навык сознательно доставлять себе дискомфорт.
А ещё — умение утилизировать дискомфорт любой ценой на пути к желаемому.
🤷‍♂️
6🤔2
Случился мем:
пока писал пост про цену усилий и выбора, заебался от своего выбора и усилий 🫠
😁9🥰2
Запросы которые мы заслужили
🤣63
Привет
На связи Степан 😎

В интернете сегодня шумит исследование ученых из Apple о рассуждающих моделях вроде Claude 3.7, o3 и тд (наверное, это те самые ученые, которые не спешат помогать Siri становиться умнее). Думаю, вы уже видели в пабликах разные мысли и выводы на этот счет.

Вкратце расскажу, если не видели:
- есть большие сомнения в способности моделей к рассуждению, модели только имитируют мыслительный процесс (тут хочется воскликнуть "да ладно, а что вы ожидали-то?");
- и "думающие" и "не думающие" модели не справляются с задачами высокой сложности, причем "не думающие" лучше справляются с легкими задачами, а "думающие" - с задачами средней сложности;
- у "думающих" моделей есть overthinking problem (прямо как у людей).

На днях слушал выпуск подкаста "Запуск завтра" на схожую тему и отлично совпало, что в подкасте дали хороший комментарий по первому пункту.

Создав машину, пытающуюся мыслить, человечество задумалось о правильности ее мыслительного алгоритма. Но тут проблема - сами до конца не знаем, как происходит процесс мышления. И не знаем, есть ли во вселенной только один рабочий паттерн - человеческий, либо их может быть много. Короче, сплошная философия. И чтобы не тормозить прогресс, в какой-то момент решаем, что оценить способности ИИ к мышлению можно по конечному результату и в целом, не так важно, как именно ИИ к нему пришел. И вот исследование ученых из Apple как раз затрагивает вопрос, а не пора ли перейти к иной оценке результативности ИИ.

Будет смешно, если вместо допилки Apple Intelligence (чтобы в Европе заработал или не слал тупые саммари, которыми пестрит reddit), эпл даст импульс к появлению Skynet'а. Потому что их ученые вот тут исследование запилили, чем спровоцировали смену подхода к оценке ИИ.

На этом моменте начинаются: Терминатор / Бегущий по лезвию / Я, робот / West World / Матрица / Из машины / Эра альтрона.
7
Репост от Степана
*утирая ностальгические слезы*

2010 год. Я только заселился в общагу БГУИРа. Мне 17, я первокурсник, понятия не имею "шо такое айти", проекты и выгорание. А сосед по комнате смотрит этот мульт и ржет так, что смех слышно под окнами.
12 oz mouse (поллитровая мышь) – популярный мультик из середины нулевых. В нем гениальные диалоги в духе Саус парка и Масяни.

Недавно я пересмотрел несколько серий, и удивился, как многие из них будто списаны с наших ИТ реалий:
😁1
Будущее Настоящее выглядит так.

Признавайтесь, за кем уже ходит такой ассистент во все миты?
😎4🤯2
Тут у lovable бесплатные выходные. Можно генерить веб-апки с Claude совершенно бесплатно.
Если вы хотели попробовать vibe coding - самое время :)
🔥4