С добавлением воркфлоу в Claude Code я заметил, что там зачастую работают модели Sonnet и Haiku для рутинных задач. Они дешевле, но по производительности особо не отличаются от Opus.
В целом время работы в облачных моделях стало ужасным. Во многих задачах складывается впечатление, что модель просто ждёт, а не делает задачу.
Начал тестировать локальные модели не только по качеству реализации, но и по времени работы. На моей пекарне чуть больше ресурсов, чем нужно, и значит, можно их задействовать в полезной нагрузке. А значит, реально заменить модели Sonnet и Haiku на локальную.
Провёл тесты, результаты оказались отличными на MoE-моделях. Мой фаворит, Gemma-4-26B-A4B, оказалась сверхбыстрой и при этом достаточно качественной. Прирост производительности — в 5 раз.
А чтобы она работала вместо этих двух моделек, буду использовать CCR.
MoE-модели в целом очень приятны в домашнем использовании: там немного активных параметров, но при этом качество ответов практически такое же. Это видно, например, по Qwen Coder Next: модель имеет размер 51 GB, но 3B активных параметров. Она не влезает полностью на две мои видюхи, но ей это не мешает. А у Gemma 4 31B все 31B активные, и она полностью помещается на две видюхи, но производительность у неё низкая из-за того, что на каждый токен ей нужно гонять все активные веса. На скрине — таблица с отчётом.
В целом время работы в облачных моделях стало ужасным. Во многих задачах складывается впечатление, что модель просто ждёт, а не делает задачу.
Начал тестировать локальные модели не только по качеству реализации, но и по времени работы. На моей пекарне чуть больше ресурсов, чем нужно, и значит, можно их задействовать в полезной нагрузке. А значит, реально заменить модели Sonnet и Haiku на локальную.
Провёл тесты, результаты оказались отличными на MoE-моделях. Мой фаворит, Gemma-4-26B-A4B, оказалась сверхбыстрой и при этом достаточно качественной. Прирост производительности — в 5 раз.
А чтобы она работала вместо этих двух моделек, буду использовать CCR.
MoE-модели в целом очень приятны в домашнем использовании: там немного активных параметров, но при этом качество ответов практически такое же. Это видно, например, по Qwen Coder Next: модель имеет размер 51 GB, но 3B активных параметров. Она не влезает полностью на две мои видюхи, но ей это не мешает. А у Gemma 4 31B все 31B активные, и она полностью помещается на две видюхи, но производительность у неё низкая из-за того, что на каждый токен ей нужно гонять все активные веса. На скрине — таблица с отчётом.
❤3
https://mdwit.dev/
Сделал себе сайт. Часто делюсь ссылками на временные проекты и тесты с этого домаена, так хотябы люди могут не пустую страницу посмотреть)
Сделал себе сайт. Часто делюсь ссылками на временные проекты и тесты с этого домаена, так хотябы люди могут не пустую страницу посмотреть)
🔥8🏆1
Forwarded from S0ER
ИИ должен был помочь людям выполнять их работу лучше, а вместо этого приводит к усталости и выгоранию.
Очень хорошо прочувствовал эту проблему на себе. Работаю с ИИ каждый день: формирую пул заданий, загоняю в оркестратор (это моя агентная система), через несколько часов проверяю сделанное, собираю список правок, снова запускаю агентную систему - и так по кругу.
Проблема в том, что циклов исправления очень много. Причем это не моя личная проблема, появился даже новый термин - "ботситтинг" - это когда человек "нянчится" с LLM, чтобы получить результат. По статистике, на такие проверки и исправления у сотрудников уходит в среднем 6.4 часа в неделю, то есть почти целый рабочий день.
Ситуация усугубляется тем, что сначала кажется, будто человек делает меньшую часть работы - просто правит результат ИИ, а потом ждет. Но на самом деле цикл довольно плотный, а сам момент "принятия решения" сильно выматывает психологически (делать рутинный код на порядок проще, чем быстро анализировать, находить проблемы, указывать, что нужно переделать).
Если посмотреть на историю коммитов, кажется, что проект растет, но если смотреть на качество - значительная часть кода - это сплошные исправления. Причем я не могу назвать это "рефакторингом".
Рефакторинг - это улучшение структуры без изменения функциональности. В моем случае каждое исправление - это изменение поведения, которое ИИ изначально реализовал неправильно.
В итоге стал замечать, что устаю от принятия решений. Даже правильнее сказать от "скорости" принятия решений. Выматывает, что нельзя ни в чем быть уверенным, нужно все проверять и перепроверять, либо рискушь скатиться в "ботшитинг".
Такое состояние называется "AI brain fry" - это когда нужно принимать бесконечные микро-решения, которые истощают когнитивные ресурсы. В результате падает КПД и возникает разрыв между тем, что я обсуждаю, и тем, что в итоге получаю.
Пишут, что ИИ не только не сокращает объем задач, но и делает работу еще более интенсивной и сложной для человека.
Можно возразить, что с людьми примерно так же - они ошибаются, переделывают и дорабатывают код. Но есть важнейший нюанс: люди делают это совсем в другом ритме. Машина же никогда не устает ошибаться.
В итоге статистика удручающая: 48% разработчиков сообщают о ментальной усталости от работы с ИИ, 44% периодически чувствуют себя измотанными, а 19% уже вышли на уровень постоянного выгорания.
При этом компании, уволившие сотрудников в надежде заменить их ИИ, вынуждены нанимать их обратно, так как модели не закрывают весь цикл разработки.
Получается, я работаю не с кодом. Я работаю с системой, которая генерирует мне работу. И этой работы становится только больше.
А вы говорите "ИИ скоро всех заменит". Сильно сомневаюсь.
Glean
AI has arrived at work. The organizational impact hasn't
Stephanie Baladi | The Work AI Index reveals why widespread AI adoption still isn’t translating into business impact — and the hidden human labor behind the gap.
🔥5💯1
gpt 5.6 sol не произвела ни какого впечатления на меня, так же как и fable 5
gpt так и осталась тойже gpt, даже в режиме ultra think у нее одна мотивация сделать как можно быстрее, любой ценой. Ни какой революции нет. У нейросетей все так же нет ктитического мышления, нет чувства прекрассного. Безусловно задача будет сделана, но сделана так как нейросеть посчитала правильным, после реализации она не сделает ни каких выводов. инфополе кишит хвалебными отзывами но, реальность для меня такова, что opus является золотой серединой где и качество хорошее и уровень размления и цена. Если нейросети при максимальном уровне размышления не способны выдать нормальный результат, то такие нейросети не нужны. Ну разве что греть на бабки тупых корпоратов которые в погоне за хайпом готовы вышвыривать специалистов на улицу. А потом узнавать что расходы на нейронки превышают расходы на предыдущий штат сотрудников. При этом продуктивность не выросла а даже уменьшилась
Я уже более полу года активно пользуюсь opus и мне прям грустно видеть, как лучшие модели gpt пытаются выдать любой результат вместо ожидаемого. Я прям чувствую как выгораю пока пытаюсь обьяснить элементарные вещи, которые тот же opus понимает сразу.
gpt так и осталась тойже gpt, даже в режиме ultra think у нее одна мотивация сделать как можно быстрее, любой ценой. Ни какой революции нет. У нейросетей все так же нет ктитического мышления, нет чувства прекрассного. Безусловно задача будет сделана, но сделана так как нейросеть посчитала правильным, после реализации она не сделает ни каких выводов. инфополе кишит хвалебными отзывами но, реальность для меня такова, что opus является золотой серединой где и качество хорошее и уровень размления и цена. Если нейросети при максимальном уровне размышления не способны выдать нормальный результат, то такие нейросети не нужны. Ну разве что греть на бабки тупых корпоратов которые в погоне за хайпом готовы вышвыривать специалистов на улицу. А потом узнавать что расходы на нейронки превышают расходы на предыдущий штат сотрудников. При этом продуктивность не выросла а даже уменьшилась
Я уже более полу года активно пользуюсь opus и мне прям грустно видеть, как лучшие модели gpt пытаются выдать любой результат вместо ожидаемого. Я прям чувствую как выгораю пока пытаюсь обьяснить элементарные вещи, которые тот же opus понимает сразу.
❤5🫡3🤔1💯1
Возможно кто-то не понял чем это черевато, но вот тут из поиска по тегу password я нашел код: https://claude.ai/public/artifacts/76b32a4a-e0cd-4a1c-9c33-f716643bbdde
Тут тест кейсы описаны с паролями, они конечно же фейковые, но такие файлы с прод данными могут быть слиты и вы даже не поймете что они стали общественным достоянием
Тут тест кейсы описаны с паролями, они конечно же фейковые, но такие файлы с прод данными могут быть слиты и вы даже не поймете что они стали общественным достоянием
Claude
Complete Claude Code Workflow Setup Script
👍2😁1👻1
я так понимаю, вайбкодерам теперь сложно проценты даже посчитать правильно
6 запросов на статус в кодексе вернули 6 разных значений
Сколько в итоге недельного лимита то осталось?
6 запросов на статус в кодексе вернули 6 разных значений
Сколько в итоге недельного лимита то осталось?
😁3
Антропики снова уничтожили Opus. Ну прям не знаю, контора пидорасов. Выпустили модель, похайпили, а потом снова сделали её тупой.
У меня прям чёткое ощущение, что стало даже хуже, чем было на 4.8. Вдобавок они снова порезали недельные лимиты. Прошлые две недели у меня к концу оставалось ещё по 30% неиспользованного лимита. На этой неделе у меня 50% ушло за первый день работы, при том что я ничего не менял — нагрузка такая же.
Модель в xhigh effort стала заметно тупее, зато быстрее отвечает. Видимо, они решили, что сделать её тупой, но быстрой лучше, чем повысить RPC на один токен.
У меня прям чёткое ощущение, что стало даже хуже, чем было на 4.8. Вдобавок они снова порезали недельные лимиты. Прошлые две недели у меня к концу оставалось ещё по 30% неиспользованного лимита. На этой неделе у меня 50% ушло за первый день работы, при том что я ничего не менял — нагрузка такая же.
Модель в xhigh effort стала заметно тупее, зато быстрее отвечает. Видимо, они решили, что сделать её тупой, но быстрой лучше, чем повысить RPC на один токен.
💯3
