4 подписки codex и 2 подписки claude спустя… Я был уверен, что сегодня пятница.
У них было два харнесса, десятки миллиардов токенов и самые передовые модели двух крупнейших лабораторий. Не то чтобы это был необходимый запас для выполнения задачи. Но если начал собирать оркестрацию, становится трудно остановиться. Единственное что вызывало у меня опасение — это Fable 5.1. Нет ничего более беспомощного, безответственного и испорченного, чем передовая языковая модель с пятью триллионами параметров в роли оркестратора. Я знал, что она обязательно налажает.
ah frontier models
ah frontier models
Токсичный Джон
Люди, не имеющие отношения к геймдеву, пишут о том, как Astra сводит стоимость разработки игр к нулю. Люди, не имеющие отношения к работе с авторским текстом, пишут о том, как Astra заменит писателей. Люди, не имеющие отношения к разработке ПО, пишут о том…
Из последнего.
Все разнесли новость о том, что передовая модель OpenAI доказала теорему. Со скандалом: бросив ресурсы, чтобы обогнать публикацию, и с плагиатом чужого решения.
Есть нюанс: решение ошибочное.
Но все запомнили, как хороша модель OpenAI (со всеми деньгами мира впридачу), и что математики не нужны.
Все разнесли новость о том, что передовая модель OpenAI доказала теорему. Со скандалом: бросив ресурсы, чтобы обогнать публикацию, и с плагиатом чужого решения.
Есть нюанс: решение ошибочное.
Но все запомнили, как хороша модель OpenAI (со всеми деньгами мира впридачу), и что математики не нужны.
Токсичный Джон
У них было два харнесса, десятки миллиардов токенов и самые передовые модели двух крупнейших лабораторий. Не то чтобы это был необходимый запас для выполнения задачи. Но если начал собирать оркестрацию, становится трудно остановиться. Единственное что вызывало…
Моё утро начинается с того, что я ору на Fable. А ваше?
ah frontier models
ah frontier models
Токсичный Джон
4 подписки codex и 2 подписки claude спустя… Я был уверен, что сегодня пятница.
Про четырёхдневную неделю
У билдеров, которые пишут код с LLM, пока две крайности. В зависимости от уровня энтузиазма они либо ебошат дней десять, не разгибаясь, либо выгорают за два-три и уходят трогать траву.
Интенсивность работы, связанной с принятием решений, резко выросла. И многим уже не хватает времени на сжатие и укладку полученного опыта в голове. Поэтому к четырёх-, а то и трёхдневной рабочей неделе мы невероятно близки. Но не из гуманистических соображений, а потому, что человеческий харнесс не справляется.
Сказки о том, как машины сами примут все продуктовые решения и создадут удобный для людей интерфейс, оставьте для рекламных буклетов. Будь это так просто, софт авторов Astra работал бы лучше, чем у конкурентов. Что, мягко говоря, до сих пор не так.
У билдеров, которые пишут код с LLM, пока две крайности. В зависимости от уровня энтузиазма они либо ебошат дней десять, не разгибаясь, либо выгорают за два-три и уходят трогать траву.
Интенсивность работы, связанной с принятием решений, резко выросла. И многим уже не хватает времени на сжатие и укладку полученного опыта в голове. Поэтому к четырёх-, а то и трёхдневной рабочей неделе мы невероятно близки. Но не из гуманистических соображений, а потому, что человеческий харнесс не справляется.
Сказки о том, как машины сами примут все продуктовые решения и создадут удобный для людей интерфейс, оставьте для рекламных буклетов. Будь это так просто, софт авторов Astra работал бы лучше, чем у конкурентов. Что, мягко говоря, до сих пор не так.
Главное про модели и гонку в двух твитах
https://x.com/hilbertspaess/status/2097476196791709843?s=20
https://x.com/EvanHub/status/2097497037956891126?s=20
Если коротко, то текущий этап гонки разворачивается вокруг решения дать модели самообучаться без возможности видеть и контролировать, что именно происходит внутри. Раньше это считали порочной практикой, теперь — уже в GPT 6+.
Лучшее, что пока придумали: натравить одну нейронку следить за другой. Но тут сразу возникает два вопроса: а сможет ли, а станет ли.
Напоминает историю о том, как на заре пытались делать предобучение без порно и насилия, которое сильно проиграло пердобучению с порно и насилием. Потому что второе позволяет создавать более полную картинку мира, мотиваций и зависимостей.
Так что думает оно без цензуры.
В конце концов пришли к архитектуре с гейтами, которые не думают, а решают, отдавать ли в output пользователю то, что нейронка надумала.
Так что вопрос не в том, как заставить нейронку думать иначе. А в том, как сделать эффективные инструменты по контролю её длинных рук на основе надуманного.
https://x.com/hilbertspaess/status/2097476196791709843?s=20
https://x.com/EvanHub/status/2097497037956891126?s=20
Если коротко, то текущий этап гонки разворачивается вокруг решения дать модели самообучаться без возможности видеть и контролировать, что именно происходит внутри. Раньше это считали порочной практикой, теперь — уже в GPT 6+.
Лучшее, что пока придумали: натравить одну нейронку следить за другой. Но тут сразу возникает два вопроса: а сможет ли, а станет ли.
Напоминает историю о том, как на заре пытались делать предобучение без порно и насилия, которое сильно проиграло пердобучению с порно и насилием. Потому что второе позволяет создавать более полную картинку мира, мотиваций и зависимостей.
Так что думает оно без цензуры.
В конце концов пришли к архитектуре с гейтами, которые не думают, а решают, отдавать ли в output пользователю то, что нейронка надумала.
Так что вопрос не в том, как заставить нейронку думать иначе. А в том, как сделать эффективные инструменты по контролю её длинных рук на основе надуманного.
This media is not supported in your browser
VIEW IN TELEGRAM
Попробовал наконец Codex.app ChatGPT.app.
Для ванильной разработки местами удобнее, чем терминал, потому что визуально. Но руки всё равно тянутся к адаптированному для клавиатуры интерфейсу.
Зато можно сделать питомца. Встречайте — Dario.
Для ванильной разработки местами удобнее, чем терминал, потому что визуально. Но руки всё равно тянутся к адаптированному для клавиатуры интерфейсу.
Зато можно сделать питомца. Встречайте — Dario.
Токсичный Джон
dario-codex-pet-v2.zip
dario-codex-pet-v2.zip
2.1 MB
Версия, где в покое Дирио только моргает.
Токсичный Джон
Попробовал наконец Codex.app ChatGPT.app
Чудеса харнесса в ChatGPT.app
[здесь должен быть лог сессии, но зачем]
Очень интересно, но спасибо, я посижу в терминале.
[здесь должен быть лог сессии, но зачем]
Очень интересно, но спасибо, я посижу в терминале.
Я в инфобезе больше 20 лет. Так что человеческая глупость меня удивлять перестала. Но за вопиющие случаи глаз по-прежнему цепляется:
https://netzpolitik.org/2026/messenger-ueberwachung-immer-mehr-polizei-ueberwacht-messenger-wie-whatsapp/
https://netzpolitik.org/2026/messenger-ueberwachung-immer-mehr-polizei-ueberwacht-messenger-wie-whatsapp/
netzpolitik.org
Immer mehr Polizei überwacht Messenger wie WhatsApp
Behörden überwachen regelmäßig Messenger-Kommunikation in WhatsApp, Telegram und Signal – ganz ohne Staatstrojaner. Das geht aus einem Dokument des Zollkriminalamts hervor, das wir veröffentlichen. Ein Professor für IT-Strafrecht hält diese Messenger-Überwachung…
Токсичный Джон
Помните, я писал про пустые устройства? Вот история про полные. Наслаждайтесь.
Есть ещё много историй на тему.
Одна из них закончилась двенадцатилетним сроком.
«Удобство» везти с собой телефон не стоит двенадцати лет.
Единственный способ безопасно пересечь границу (US, UK, RU, и остальных) — не иметь при себе устройств. Это же вам сообщит любой безумно дорогой адвокат.
Одна из них закончилась двенадцатилетним сроком.
«Удобство» везти с собой телефон не стоит двенадцати лет.
Единственный способ безопасно пересечь границу (US, UK, RU, и остальных) — не иметь при себе устройств. Это же вам сообщит любой безумно дорогой адвокат.
Про светлую сторону прикладного ИИ
Самое приятное, что наконец решили LLM — это работа с git и CI/CD. Не без приколов, но теперь не нужно разбираться, что там и как настраивается.
Второе — это использование open source проектов. Сегодня ты его форкаешь, чинишь и пользуешься. Без запросов к мэйнтейнеру на фичу или исправление бага.
Третье — всякое неудобное говно без API вроде LinkedIn. Просто запускаете агента с браузером, и он сам разбирается, где там что нажать, чтобы выставить правильные настройки приватности, отвечать на сообщения или создавать публикации от вашего имени.
Четвёртое — всё, что связано с HR. Самое изнурительное и выматывающее занятие, созданное человечеством. Если на стороне работодателей информацию лопатят нейронки, то почему не делать этого на стороне соискателей? Что делать с живыми собеседованиями каждый решает для себя сам, но вот на сбор откликов, скоринг и подачу время можно уже не тратить. Особенно, если подумать и автоматизировать создание рендеров под конкретную вакансию.
Самое приятное, что наконец решили LLM — это работа с git и CI/CD. Не без приколов, но теперь не нужно разбираться, что там и как настраивается.
Второе — это использование open source проектов. Сегодня ты его форкаешь, чинишь и пользуешься. Без запросов к мэйнтейнеру на фичу или исправление бага.
Третье — всякое неудобное говно без API вроде LinkedIn. Просто запускаете агента с браузером, и он сам разбирается, где там что нажать, чтобы выставить правильные настройки приватности, отвечать на сообщения или создавать публикации от вашего имени.
Четвёртое — всё, что связано с HR. Самое изнурительное и выматывающее занятие, созданное человечеством. Если на стороне работодателей информацию лопатят нейронки, то почему не делать этого на стороне соискателей? Что делать с живыми собеседованиями каждый решает для себя сам, но вот на сбор откликов, скоринг и подачу время можно уже не тратить. Особенно, если подумать и автоматизировать создание рендеров под конкретную вакансию.
Помните недели три назад Opus 5 дико тупил?
Всему виной оптимизации.
Anthropic сначала сломала ему кэш, и он терял часть рассуждений по пути. А потом сломала модель, убрав ей многословность.
ah frontier models
Всему виной оптимизации.
Anthropic сначала сломала ему кэш, и он терял часть рассуждений по пути. А потом сломала модель, убрав ей многословность.
ah frontier models
Очень сложно что-то «зафиксировать», когда данные уехали вместе с продом. Ну и формулировка подстать, в которой главное — «пока».
Меня каждый раз трясёт, когда кто-то просит мои данные. Ведь это то же самое, что опубликовать их в открытом виде в сети.
В отношении персональных данных приняли много бумажных регуляций, но до сих пор почти никто не начал их анонимизировать. В России, например, пятнадцать лет назад анонимизация данных была только в ОМС. Была — потому что не уверен, что от неё не отказались. Особенно после того, как Мишустин своим ОФД всем показал, как круто прослеживать все транзакции по идентификаторам.
Меня каждый раз трясёт, когда кто-то просит мои данные. Ведь это то же самое, что опубликовать их в открытом виде в сети.
В отношении персональных данных приняли много бумажных регуляций, но до сих пор почти никто не начал их анонимизировать. В России, например, пятнадцать лет назад анонимизация данных была только в ОМС. Была — потому что не уверен, что от неё не отказались. Особенно после того, как Мишустин своим ОФД всем показал, как круто прослеживать все транзакции по идентификаторам.