⚡️ OpenAI показали GPT-5.6: семейство Sol, Terra и Luna
Под конец недели OpenAI выпустили GPT-5.6 — но только узкому кругу партнёров, согласованных с правительством США.
GPT-5.6 разбили на три тира:
1. Sol (флагман)
2. Terra (на уровне GPT-5.5, но вдвое дешевле)
3. и Luna (быстрая и самая дешёвая)
Цены за 1M токенов (вход/выход): Sol $5/$30, Terra $2.50/$15, Luna $1/$6.
В июле Sol запустят на Cerebras — до 750 токенов/с. Публичный доступ в ChatGPT, Codex и API обещают через пару недель.
@ai_for_devs
Под конец недели OpenAI выпустили GPT-5.6 — но только узкому кругу партнёров, согласованных с правительством США.
GPT-5.6 разбили на три тира:
1. Sol (флагман)
2. Terra (на уровне GPT-5.5, но вдвое дешевле)
3. и Luna (быстрая и самая дешёвая)
Цены за 1M токенов (вход/выход): Sol $5/$30, Terra $2.50/$15, Luna $1/$6.
Ключевое сравнение с Mythos (Fable 5) от Anthropic идёт по кибербезопасности. На ExploitBench Sol тянется к Mythos Preview, расходуя при этом примерно треть выходных токенов.
В июле Sol запустят на Cerebras — до 750 токенов/с. Публичный доступ в ChatGPT, Codex и API обещают через пару недель.
@ai_for_devs
3❤49🔥30👍19⚡2👌2🤩1
Please open Telegram to view this post
VIEW IN TELEGRAM
1😁216👍22🔥13💯9❤4🤡2
Как не слить конфиденциальные данные в общедоступные нейросети?
Самый надежный способ — развернуть их локально на собственном сервере. Или не тратить на это время и воспользоваться готовым решением от Selectel. В каталоге готовых ИИ-моделей нейросети уже развернуты на оптимальном железе для инференса.
Что вы получаете в Selectel:
1. Большой выбор моделей для ваших задач: для генерации текста и кода, распознавания речи, создания контента и других
2. Производительность и гибкое масштабирование. Инференс-сервис развернут на современном железе с актуальными видеокартами и автоматически адаптируется при росте или снижении нагрузки
3. Прогнозируемую стоимость: платите за фактическое время потребления вычислительных ресурсов
Начните работать с ИИ-моделями на выделенной инфраструктуре: https://slc.tl/vj562
Самый надежный способ — развернуть их локально на собственном сервере. Или не тратить на это время и воспользоваться готовым решением от Selectel. В каталоге готовых ИИ-моделей нейросети уже развернуты на оптимальном железе для инференса.
Что вы получаете в Selectel:
1. Большой выбор моделей для ваших задач: для генерации текста и кода, распознавания речи, создания контента и других
2. Производительность и гибкое масштабирование. Инференс-сервис развернут на современном железе с актуальными видеокартами и автоматически адаптируется при росте или снижении нагрузки
3. Прогнозируемую стоимость: платите за фактическое время потребления вычислительных ресурсов
Начните работать с ИИ-моделями на выделенной инфраструктуре: https://slc.tl/vj562
1👌20👍15❤9🔥2
⚡️ Grok 4.5 вышел в приватную бету в SpaceX и Tesla
В основе Grok 4.5 лежит V9: новая модель, которую xAI обучали с нуля вместе с инженерами из Cursor на их данных.
Модель втрое больше предыдущей: 1.5 триллиона параметров против 0.5T у v8-small (Grok 4.3), которая сейчас обслуживает весь продакшен трафик.
Илон обещает по одной новой модели в месяц от SpaceX. То есть в паблик Grok 4.5 должен выйти уже в июле!
Параллельно xAI развивает Grok Build (собственный инструмент для кодинга), конкурент того же Cursor. Маск говорит, что он становится лучше с каждым днём. Делаем ставки, кого из них в итоге принесут в жертву?
@ai_for_devs
В основе Grok 4.5 лежит V9: новая модель, которую xAI обучали с нуля вместе с инженерами из Cursor на их данных.
Модель втрое больше предыдущей: 1.5 триллиона параметров против 0.5T у v8-small (Grok 4.3), которая сейчас обслуживает весь продакшен трафик.
Макс отметил, что данные Cursor добавили уже после основного этапа (это менее эффективно, чем с нуля). В следующей версии на 2T параметров они войдут с самого начала.
Илон обещает по одной новой модели в месяц от SpaceX. То есть в паблик Grok 4.5 должен выйти уже в июле!
Параллельно xAI развивает Grok Build (собственный инструмент для кодинга), конкурент того же Cursor. Маск говорит, что он становится лучше с каждым днём. Делаем ставки, кого из них в итоге принесут в жертву?
@ai_for_devs
1👍44⚡12❤7🔥6👏1🤩1
This media is not supported in your browser
VIEW IN TELEGRAM
Холли-молли...
🤯 А чё, так можно было что ли!?
🤡 Ну ты и дед...
🤯 А чё, так можно было что ли!?
🤡 Ну ты и дед...
3🤯158🤡28👍3
⚡️ Claude Sonnet 5: Anthropic обновили главную рабочую лошадку
Позиционируется как самый агентный Sonnet. По качеству близка к Opus 4.8, но дешевле.
По рассуждению, использованию инструментов, написанию кода и задачам на знание строгое доминирование над Sonnet 4.6. На многих бенчмарках Opus 4.8 по-прежнему впереди.
Наконец-то что-то для просто народа!)
@ai_for_devs
Позиционируется как самый агентный Sonnet. По качеству близка к Opus 4.8, но дешевле.
Цены: $2 за млн входных и $10 за млн выходных токенов до 31 августа, с 1 сентября $3/$15.
Обновили токенайзер, входные тексты занимают на 0–35% больше токенов, чем в предыдущих версиях.
По рассуждению, использованию инструментов, написанию кода и задачам на знание строгое доминирование над Sonnet 4.6. На многих бенчмарках Opus 4.8 по-прежнему впереди.
Наконец-то что-то для просто народа!)
@ai_for_devs
1🤩37❤27👍18🔥3⚡2
⚡️ Anthropic "возвращают" доступ к Fable 5
Экспортные ограничения на Fable 5 и Mythos 5 сняли вчера, 30 июня, модель обещают сделать доступной всем уже сегодня. Но "всеобщий" доступ с оговорками.
1. На Pro/Max/Team Fable 5 входит в подписку только в пределах 50% недельного лимита и только до 7 июля. Дальше исключительно через usage credits, то есть отдельная оплата сверху подписки, по себестоимости как за API. Для тех, у кого тариф enterprise, usage credits нужны вообще сразу, никакого бесплатного окна нет.
2. Заодно выкатили "улучшенный" классификатор безопасности. Anthropic сами пишут, что он чаще блокирует безобидные запросы на обычном кодинге и дебаге. В те пару дней, что модель уже была доступна в июне, часть пользователей и так жаловалась на запросы, которые без видимой причины перекидывало на Opus 4.8. С новым классификатором таких случаев станет только больше.
3. Anthropic согласились, что релизы топовых моделей теперь идут через расширенный ранний доступ для правительства США: Минторг, CAISI и профильные ведомства получают модели и защитные механизмы до публичного релиза. Тут без комментариев))
В общем да, сегодня Fable 5 снова станет доступна "всем"🙂
@ai_for_devs
Экспортные ограничения на Fable 5 и Mythos 5 сняли вчера, 30 июня, модель обещают сделать доступной всем уже сегодня. Но "всеобщий" доступ с оговорками.
1. На Pro/Max/Team Fable 5 входит в подписку только в пределах 50% недельного лимита и только до 7 июля. Дальше исключительно через usage credits, то есть отдельная оплата сверху подписки, по себестоимости как за API. Для тех, у кого тариф enterprise, usage credits нужны вообще сразу, никакого бесплатного окна нет.
2. Заодно выкатили "улучшенный" классификатор безопасности. Anthropic сами пишут, что он чаще блокирует безобидные запросы на обычном кодинге и дебаге. В те пару дней, что модель уже была доступна в июне, часть пользователей и так жаловалась на запросы, которые без видимой причины перекидывало на Opus 4.8. С новым классификатором таких случаев станет только больше.
3. Anthropic согласились, что релизы топовых моделей теперь идут через расширенный ранний доступ для правительства США: Минторг, CAISI и профильные ведомства получают модели и защитные механизмы до публичного релиза. Тут без комментариев))
В общем да, сегодня Fable 5 снова станет доступна "всем"
@ai_for_devs
Please open Telegram to view this post
VIEW IN TELEGRAM
1⚡32👍29❤14🤯7😢5🔥1💯1
⚡️ Z.ai выпустили крупное обновление ZCode
Альтернатива Claude Code и Codex от создателей GLM-5.2 уже доступна для всех OS.
Их собственный ZCode Agent заточен под GLM-5.2, но через BYOK можно подключить свои подписки OpenAI, Anthropic и других провайдеров.
Подписчикам GLM Coding Plan квота в ZCode в 1.5 раза выше обычной.
P.S. GLM в ZCode доступна из России без VPN.
@ai_for_devs
Альтернатива Claude Code и Codex от создателей GLM-5.2 уже доступна для всех OS.
Их собственный ZCode Agent заточен под GLM-5.2, но через BYOK можно подключить свои подписки OpenAI, Anthropic и других провайдеров.
Новым пользователям дают 5 дней бесплатного доступа с повышенным дневным лимитом: хороший повод протестировать китайский флагман.
Подписчикам GLM Coding Plan квота в ZCode в 1.5 раза выше обычной.
P.S. GLM в ZCode доступна из России без VPN.
@ai_for_devs
1🔥66👍26⚡15❤5🤩2
Forwarded from Veai - про код и тесты с AI
⚡️ Fable 5 снова в строю: модель уже доступна в Veai
По бенчмаркам отрыв безоговорочный: Fable 5 обходит и Opus 4.8, и GPT-5.5 почти во всём, от кода и работы с компьютером до юридических задач и медицины. На SWE-Bench Pro, например, у неё 80.3% против 69.2% у Opus 4.8, а в кибербезопасности разрыв с Opus почти вдвое.
Всем новым пользователям Veai даём 30 дней бесплатного триала. Поделитесь этой инфой с друзьями, они будут благодарны)
https://veai.ru/products
Если Fable 5 покажется слишком прожорливой и долгодумающей, в Veai есть ещё больше десятка моделей: Sonnet 5, Opus 4.8, GPT-5.5, Gemini, GLM, DeepSeek, Kimi. Переключиться можно в любой момент.
@veai_devs
По бенчмаркам отрыв безоговорочный: Fable 5 обходит и Opus 4.8, и GPT-5.5 почти во всём, от кода и работы с компьютером до юридических задач и медицины. На SWE-Bench Pro, например, у неё 80.3% против 69.2% у Opus 4.8, а в кибербезопасности разрыв с Opus почти вдвое.
⚠️ Модель дорогая и "думает" много, поэтому токены на ней сгорают сильно быстрее обычного. Будьте бдительны!
Всем новым пользователям Veai даём 30 дней бесплатного триала. Поделитесь этой инфой с друзьями, они будут благодарны)
https://veai.ru/products
Если Fable 5 покажется слишком прожорливой и долгодумающей, в Veai есть ещё больше десятка моделей: Sonnet 5, Opus 4.8, GPT-5.5, Gemini, GLM, DeepSeek, Kimi. Переключиться можно в любой момент.
@veai_devs
1👌25👍16❤8🔥1
⚡️ Слепые зоны в промптинге: полный гайд по Fable 5
Инженеры из Anthropic порадовали новой статьёй о работе с Fable 5. Главных выводов из этого материала два.
Первый, про важность промпта.
Даже с такими моделями, как Fable 5, результат упирается не в возможности модели, а в то, насколько чётко вы умеете сформулировать, чего хотите. Если пережмёте с конкретикой, то модель послушно идёт по инструкции даже там, где стоило бы свернуть в сторону. Чуть недожмёте, и модель добирает недостающее из усреднённых практик индустрии, которые не всегда подходят именно вам.
Второй, про собственное эго.
Призвайтесь честно, чего вы не знаете. Если задача выходит за рамки вашей экспертизы, быть самым глупым в комнате (даже с бездушными LLM) – нормально.
И в первом и во втором случаях, помогает деление задачи на четыре типа неизвестных:
Примеры поиска всех типов неизветных в формате Claude Artifacts тут.
📚 Читайте и комментируйте на Хабр: https://habr.com/ru/articles/1055458
@ai_for_devs
Инженеры из Anthropic порадовали новой статьёй о работе с Fable 5. Главных выводов из этого материала два.
Первый, про важность промпта.
Даже с такими моделями, как Fable 5, результат упирается не в возможности модели, а в то, насколько чётко вы умеете сформулировать, чего хотите. Если пережмёте с конкретикой, то модель послушно идёт по инструкции даже там, где стоило бы свернуть в сторону. Чуть недожмёте, и модель добирает недостающее из усреднённых практик индустрии, которые не всегда подходят именно вам.
Второй, про собственное эго.
Призвайтесь честно, чего вы не знаете. Если задача выходит за рамки вашей экспертизы, быть самым глупым в комнате (даже с бездушными LLM) – нормально.
И в первом и во втором случаях, помогает деление задачи на четыре типа неизвестных:
1. Известное известное: то, что реально прописано в промпте
2. Известное неизвестное: то, что вы осознаёте, что ещё не выяснили
3. Неизвестное известное: то, что очевидно, но вы никогда бы это не записали
4. Неизвестное неизвестное: то, о чём вы вообще не задумывались
Примеры поиска всех типов неизветных в формате Claude Artifacts тут.
@ai_for_devs
Please open Telegram to view this post
VIEW IN TELEGRAM
1🔥35👏19❤15👍12💯1
🪨 JetBrains протестировали скилл Caveman: обещанные 65% экономии токенов превратились в 8.5%
Caveman — скилл для агентов вроде Claude Code, который переводит текстовые ответы в рубленый «пещерный» стиль без служебных слов. Код и вызовы инструментов не трогает. Целых 85к звёзд на GitHub!
Тест прогнали на бенчмарке SkillsBench, 86 из 87 задач, Claude Sonnet 5 с низким reasoning effort. Сравнивали одни и те же задачи без скилла и с принудительно включённым.
Результат по 82 парным задачам:
1. Экономия output-токенов: 8.5% (592k против 542k), далеко от обещанных 65%. Авторы считали экономию на чатовой прозе, а в агентной работе основную массу токенов занимают код, диффы и тексты ошибок, которые скилл не сжимает.
2. Качество не пострадало: средний скор 0.326 против 0.311, статистически неразличимо (p = 0.82).
3. Экономия $ отсутствует. По логике 8.5% экономии токенов должны были дать скидку около 10% по деньгам. Но один вырожденный случай всё нивелировал: одна задача перешла порог в 200k токенов контекста и попала под дорогой тариф API, её цена выросла с $0.33 до $8.29. Из-за этого прогон со скиллом вышел на 11.6% дороже ($40.60 против $36.39).
Со скиллом или без, результат по сути один и тот же, что по деньгам, что по качеству. Разве что читать ответы веселее)
@ai_for_devs
Caveman — скилл для агентов вроде Claude Code, который переводит текстовые ответы в рубленый «пещерный» стиль без служебных слов. Код и вызовы инструментов не трогает. Целых 85к звёзд на GitHub!
Тест прогнали на бенчмарке SkillsBench, 86 из 87 задач, Claude Sonnet 5 с низким reasoning effort. Сравнивали одни и те же задачи без скилла и с принудительно включённым.
Результат по 82 парным задачам:
1. Экономия output-токенов: 8.5% (592k против 542k), далеко от обещанных 65%. Авторы считали экономию на чатовой прозе, а в агентной работе основную массу токенов занимают код, диффы и тексты ошибок, которые скилл не сжимает.
2. Качество не пострадало: средний скор 0.326 против 0.311, статистически неразличимо (p = 0.82).
3. Экономия $ отсутствует. По логике 8.5% экономии токенов должны были дать скидку около 10% по деньгам. Но один вырожденный случай всё нивелировал: одна задача перешла порог в 200k токенов контекста и попала под дорогой тариф API, её цена выросла с $0.33 до $8.29. Из-за этого прогон со скиллом вышел на 11.6% дороже ($40.60 против $36.39).
Со скиллом или без, результат по сути один и тот же, что по деньгам, что по качеству. Разве что читать ответы веселее)
@ai_for_devs
GitHub
GitHub - JuliusBrussee/caveman: 🪨 why use many token when few token do trick — Claude Code skill that cuts 65% of tokens by talking…
🪨 why use many token when few token do trick — Claude Code skill that cuts 65% of tokens by talking like caveman - JuliusBrussee/caveman
1🗿64👍40❤12🤩5💯3🔥1
⚡️ Лайфхак: контролируем лимиты Claude
Скользящее 5-часовое окно может застать врасплох: оно стартует только с вашего первого сообщения.
Чтобы всегда точно знать, когда начнётся 5-часовая сессия и когда обнулится, создайте простейшую routine (ping-pong) на запуск по расписанию. Например, каждый день в 0, 5, 10, 15 и 20 часов (cron
В итоге садитесь за комп, сжигаете первую сессию за час и сразу катите следующую — предыдущая стартанула задолго до того, как вы подошли к компу. Profit!
@ai_for_devs
Скользящее 5-часовое окно может застать врасплох: оно стартует только с вашего первого сообщения.
Чтобы всегда точно знать, когда начнётся 5-часовая сессия и когда обнулится, создайте простейшую routine (ping-pong) на запуск по расписанию. Например, каждый день в 0, 5, 10, 15 и 20 часов (cron
0 0,5,10,15,20 * * *). Тогда окно стартует в фиксированное время, а не когда придётся.Время можно подогнать под сброс почти вплотную к своим пиковым часам (их, кстати, можно спросить у самого Claude).
В итоге садитесь за комп, сжигаете первую сессию за час и сразу катите следующую — предыдущая стартанула задолго до того, как вы подошли к компу. Profit!
@ai_for_devs
2🔥88👍42👏9🤯7❤6💯2
Anthropic продлили доступ к Fable на всех платных тарифах до 12 июля!
Казнить нельзя помиловать
@ai_for_devs
Казнить нельзя помиловать
@ai_for_devs
1🔥80😁20⚡15👍10
⚡️ Российская LLM Koda Pro почти сравнялась с Claude Sonnet и Opus
KodaCode выпустили версию 1.0 своего плагина для VS Code. Вместе с релизом агента обновили и флагманскую LLM.
На SWE-bench Verified новая Koda Pro на основе GLM 5.2 набрала 77.4% (у Claude Sonnet 5 на этом же бенче 78.8%, у Claude Opus 4.8 результат 83%).
Также выкатили подключение российских провайдеров моделей без VPN.
@ai_for_devs
KodaCode выпустили версию 1.0 своего плагина для VS Code. Вместе с релизом агента обновили и флагманскую LLM.
На SWE-bench Verified новая Koda Pro на основе GLM 5.2 набрала 77.4% (у Claude Sonnet 5 на этом же бенче 78.8%, у Claude Opus 4.8 результат 83%).
В агента для VS Code, JetBrains и CLI добавили маркетплейс MCP и скиллов, просмотр diff прямо в чате и починили зависания на длинных сессиях.
Telegram-интеграция раньше работала только в VS Code, теперь доступна в JetBrains и CLI.
Также выкатили подключение российских провайдеров моделей без VPN.
@ai_for_devs
1👍103🤯58🔥23❤17⚡5
⚡️ Cursor выпустили Grok 4.5: флагман уровня Opus, обучали вместе со SpaceXAI
«Opus-класс, но быстрее, экономнее по токенам и дешевле» — так Маск описал модель в X.
Уже доступна в Grok Build, в Cursor на всех тарифах.
Цена: $2/$6 за млн токенов (input/output). Для сравнения, у Opus 4.8 — $5/$25.
@ai_for_devs
«Opus-класс, но быстрее, экономнее по токенам и дешевле» — так Маск описал модель в X.
Уже доступна в Grok Build, в Cursor на всех тарифах.
На первую неделю дают двойные лимиты и уточняют: у Grok 4.5 и Composer разные весовые категории.
Composer 2.5 остаётся в строю, новые модели этого размера продолжат выходить отдельно.
Цена: $2/$6 за млн токенов (input/output). Для сравнения, у Opus 4.8 — $5/$25.
@ai_for_devs
1🔥66🤯12👍10⚡7❤5
⚡️ Через 5 минут смотрим релиз GPT-5.6 Sol
Sol — флагманская модель нового поколения от OpenAI, по слухам последняя в серии 5.x. Дальше компания переходит на нейминг 6+.
Модель почти месяц была в закрытом превью для избранных партнёров по запросу властей США, сегодня открывают публичный доступ.
Стрим здесь: https://youtu.be/Wq45rvPGNHs
@ai_for_devs
Sol — флагманская модель нового поколения от OpenAI, по слухам последняя в серии 5.x. Дальше компания переходит на нейминг 6+.
Модель почти месяц была в закрытом превью для избранных партнёров по запросу властей США, сегодня открывают публичный доступ.
Стрим здесь: https://youtu.be/Wq45rvPGNHs
@ai_for_devs
YouTube
Introducing the next chapter for ChatGPT
Andrew Ambrosino, Jessica Liang, Ed Bayes, Lauren Gordon, Tejal Patwardhan, and Katy Shi join host Thibault Sottiaux to introduce and demo the new ChatGPT and GPT-5.6.
1👍33🤩14🔥12❤6⚡3
⚡️ Линейку моделей GPT-5.6 раскатили на всех
Модель уже доступна всем пользователям Codex, её добавили в Cursor, JetBrains Air и в десяток других самых популярных агентов.
На части бенчмарков Sol обходит Fable 5, в том числе в кодинге. Главный акцент OpenAI делают на цене и скорости: тех же результатов Sol добивается вдвое быстрее и примерно на треть дешевле.
Цена за 1М токенов: Sol $5/$30, Terra $2.50/$15, Luna $1/$6.
А для тех, кто сидит на Claude, а не на Codex — Anthropic прямо сейчас сбросили недельные лимиты, чтобы никто никуда не переметнулся 😄 В общем, сегодня в плюсе все!
@ai_for_devs
Модель уже доступна всем пользователям Codex, её добавили в Cursor, JetBrains Air и в десяток других самых популярных агентов.
На части бенчмарков Sol обходит Fable 5, в том числе в кодинге. Главный акцент OpenAI делают на цене и скорости: тех же результатов Sol добивается вдвое быстрее и примерно на треть дешевле.
Цена за 1М токенов: Sol $5/$30, Terra $2.50/$15, Luna $1/$6.
Также OpenAI выпустили аналог Artifacts у Claude Code — назвали ChatGPT Sites, собирать сайты и мини-приложения прямо в Codex.
И раскатали ChatGPT Work — по сути слияние ChatGPT и Codex в одном приложении, уже можно скачать на macOS, версии для Windows как обычно обещают позже.
А для тех, кто сидит на Claude, а не на Codex — Anthropic прямо сейчас сбросили недельные лимиты, чтобы никто никуда не переметнулся 😄 В общем, сегодня в плюсе все!
@ai_for_devs
OpenAI
GPT-5.6: Frontier intelligence that scales with your ambition
More intelligence from every token, stronger performance per dollar, and more capability on demand for your hardest work.
1🔥95👍22❤14⚡12🤯4
⚡️ Поменять модель или повысить effort?
Когда агент не справляется с задачей, первое естественное желание — поменять модель. Причём работает это в обе стороны: то суперумная модель странно тупит на казалось бы лёгкой задаче, то маленькая вообще не отдупляет, что происходит в сложной.
Но модель это не единственная ручка, которую можно покрутить. Может, лучше повысить/понизить effort?
Выбор модели определяет то, что агент знает по умолчанию. Веса любой модели были зафиксированы в процессе обучения, благодаря чему она знает о паттернах, фреймворках, подводных камнях и так далее. Размер модели определяет, насколько много и насколько хорошо она разбирается в различных областях. Если проводить весёлые аналогии, то Fable — Principal Engineer, Opus — Senior, Sonnet — Middle, а Haiku лучше не подпускать к коду.
Effort же определяет, насколько каждый из них будет стараться над решением конкретной задачи. Сколько файлов прочитать, сколько раз перепроверить себя, насколько уверенным быть перед ответом. На одном и том же промпте одна и та же модель с высоким effort может сгенерировать в 7 раз больше токенов, чем с низким.
Отсюда принцип работы с крутилками:
1. Если ошибка от нехватки знаний (тонкий баг, незнакомая область, архитектурное решение, модель уверенно врёт при любом количестве контекста) — берите модель крупнее.
2. Если ошибка от нехватки старания (агент пропустил файл, не прогнал тесты, не перепроверил себя) — поднимайте effort.
Подробнее про механику выбора, влияние на расход токенов и качество результата, читайте в новой статье на Хабре.
@ai_for_devs
Когда агент не справляется с задачей, первое естественное желание — поменять модель. Причём работает это в обе стороны: то суперумная модель странно тупит на казалось бы лёгкой задаче, то маленькая вообще не отдупляет, что происходит в сложной.
Но модель это не единственная ручка, которую можно покрутить. Может, лучше повысить/понизить effort?
Выбор модели определяет то, что агент знает по умолчанию. Веса любой модели были зафиксированы в процессе обучения, благодаря чему она знает о паттернах, фреймворках, подводных камнях и так далее. Размер модели определяет, насколько много и насколько хорошо она разбирается в различных областях. Если проводить весёлые аналогии, то Fable — Principal Engineer, Opus — Senior, Sonnet — Middle, а Haiku лучше не подпускать к коду.
Effort же определяет, насколько каждый из них будет стараться над решением конкретной задачи. Сколько файлов прочитать, сколько раз перепроверить себя, насколько уверенным быть перед ответом. На одном и том же промпте одна и та же модель с высоким effort может сгенерировать в 7 раз больше токенов, чем с низким.
Отсюда принцип работы с крутилками:
1. Если ошибка от нехватки знаний (тонкий баг, незнакомая область, архитектурное решение, модель уверенно врёт при любом количестве контекста) — берите модель крупнее.
2. Если ошибка от нехватки старания (агент пропустил файл, не прогнал тесты, не перепроверил себя) — поднимайте effort.
Подробнее про механику выбора, влияние на расход токенов и качество результата, читайте в новой статье на Хабре.
@ai_for_devs
1❤61👍34🔥14👏2
⚡️ GitHub перестал работать в России
Не работает Git, сам сайт не открывается, а также невозможно получить доступ к репозиториям.
На глобальный сбой GitHub не похоже, во всех остальных странах сервис функционирует нормально.
UPD: Github, Google и другие сайты снова доступны в России.
@ai_for_devs
Не работает Git, сам сайт не открывается, а также невозможно получить доступ к репозиториям.
На глобальный сбой GitHub не похоже, во всех остальных странах сервис функционирует нормально.
UPD: Github, Google и другие сайты снова доступны в России.
@ai_for_devs
1🤯80😱29❤15⚡10🔥8👍7👏4🤩4