Please open Telegram to view this post
VIEW IN TELEGRAM
Заметка от сотрудника Anthropic как и для чего лучше писать скилы.
Вкратце, пишем скилы для:
* Описание как пользоваться своими либами и не самыми распространенными cli
* Как протестировать свой продукт (напр. смотрим такие то поды, такие-то логи, ходим курлом на ингрессы, открываем гуи playwrite-ом и тыкаем кнопки)
* Анализ данных (например вот графана, вот такие датасорсы вот такие дашборды. если вот такая проблема - смотрим вот там)
Есть с чем и поспорить 😎
Team Automation, Code review - это больше подходит под commands, а не skills
CICD, Operations, Infrastructure - для всего этого есть девопсы и пайплайны 😁
Ну и полный набор tips&tricks как эти скилы писать. Полезно👍
Читаем здесь
Вкратце, пишем скилы для:
* Описание как пользоваться своими либами и не самыми распространенными cli
* Как протестировать свой продукт (напр. смотрим такие то поды, такие-то логи, ходим курлом на ингрессы, открываем гуи playwrite-ом и тыкаем кнопки)
* Анализ данных (например вот графана, вот такие датасорсы вот такие дашборды. если вот такая проблема - смотрим вот там)
Есть с чем и поспорить 😎
Team Automation, Code review - это больше подходит под commands, а не skills
CICD, Operations, Infrastructure - для всего этого есть девопсы и пайплайны 😁
Ну и полный набор tips&tricks как эти скилы писать. Полезно
Читаем здесь
Please open Telegram to view this post
VIEW IN TELEGRAM
X (formerly Twitter)
Thariq (@trq212) on X
Lessons from Building Claude Code: How We Use Skills
🦄1
Forwarded from эйай ньюз
Похоже Composer 2 — это украденная Kimi 2.5
Сразу после выхода Composer 2 пользователи заметили что модель на эндпоинте называется kimi-k2p5-rl-0317-s515-fast, а чуть позже пошли (ныне удалённые) шокированные твиты от команды Kimi. Ходили слухи что оригинальный Composer тоже был основан на китайской модели — GLM 4.6, так что прецедент такого "ребрендинга" есть, но там ситуация отличается.
Дело в лицензии — если GLM лицензирована по MIT, то у Kimi 2.5 лицензия более сложная — подобные к лицензии MIT права она даёт только до 100 миллионов пользователей продукта или 20 миллионов выручки в месяц. То есть тюн GLM не нарушал лицензию оригинальных весов, а тюн Kimi — нарушает.
Ситуацию обостряет конфликт Anthropic с авторами Kimi — компания обвиняет Moonshot в использовании более чем 3.4 миллионов запросов для дистилляции. Возможно руководство Cursor решило, что из-за собственных проблем с данными, Moonshot не отважится подать на них в суд и им за это ничего не будет.
Достаём попкорн и наблюдаем за ситуацией
@ai_newz
Сразу после выхода Composer 2 пользователи заметили что модель на эндпоинте называется kimi-k2p5-rl-0317-s515-fast, а чуть позже пошли (ныне удалённые) шокированные твиты от команды Kimi. Ходили слухи что оригинальный Composer тоже был основан на китайской модели — GLM 4.6, так что прецедент такого "ребрендинга" есть, но там ситуация отличается.
Дело в лицензии — если GLM лицензирована по MIT, то у Kimi 2.5 лицензия более сложная — подобные к лицензии MIT права она даёт только до 100 миллионов пользователей продукта или 20 миллионов выручки в месяц. То есть тюн GLM не нарушал лицензию оригинальных весов, а тюн Kimi — нарушает.
Ситуацию обостряет конфликт Anthropic с авторами Kimi — компания обвиняет Moonshot в использовании более чем 3.4 миллионов запросов для дистилляции. Возможно руководство Cursor решило, что из-за собственных проблем с данными, Moonshot не отважится подать на них в суд и им за это ничего не будет.
Достаём попкорн и наблюдаем за ситуацией
@ai_newz
🌚2🤔1
Forwarded from kyrillic
Как Anthropic хитрит с цифрами выручки
TLDR: в медиа запускают новости о $14 млрд run rate выручки в год. А в суде сообщают о $5 млрд ЗА ВСЕ ВРЕМЯ.
На днях Anthropic подал иск в суд на Министерство Войны США (pdf), и в нем CFO компании сообщил, что за все время существования компании на рынке, она сделала $5 млрд выручки. Не прибыли! При этом на инференс и тренинг потратила $10 млрд.
Это все ок, если бы не публичные заявления компании про $14 млрд выручки (run rate). Через три недели мы узнали уже о $19 млрд annualized run rate (bloomberg). Вау! Неопытные читатели (которых большинство) воспринимают это как уже полученную выручку за год. Что со стороны компании является введением в заблуждение.
Но даже тут дополнительный уровень жопокрутства:
Run rate - это предполагаемая выручка, когда берут даже не последний период, а иногда лучший месяц, и умножают на 12. Согласно источникам Reuters, Anthropic считает run rate так: (месячные подписки)x12 + (оплата токенов за 28 дней)x13.
Очевидно, что с $5 млрд за все время, Anthropic черрипикнули выручку так, что мама не горюй.
И это сработало: все пишут о $14 млрд (а то и $19 млрд) выручки, и если гуглить - такая же первая цифра. Получилось похлеще, чем вайбчартинг.
А честные $5 млрд выручки Anthropic (за все время на рынке!) - это меньше, чем продажи airpods за пару месяцев.
@kyrillic
TLDR: в медиа запускают новости о $14 млрд run rate выручки в год. А в суде сообщают о $5 млрд ЗА ВСЕ ВРЕМЯ.
На днях Anthropic подал иск в суд на Министерство Войны США (pdf), и в нем CFO компании сообщил, что за все время существования компании на рынке, она сделала $5 млрд выручки. Не прибыли! При этом на инференс и тренинг потратила $10 млрд.
Это все ок, если бы не публичные заявления компании про $14 млрд выручки (run rate). Через три недели мы узнали уже о $19 млрд annualized run rate (bloomberg). Вау! Неопытные читатели (которых большинство) воспринимают это как уже полученную выручку за год. Что со стороны компании является введением в заблуждение.
Но даже тут дополнительный уровень жопокрутства:
Run rate - это предполагаемая выручка, когда берут даже не последний период, а иногда лучший месяц, и умножают на 12. Согласно источникам Reuters, Anthropic считает run rate так: (месячные подписки)x12 + (оплата токенов за 28 дней)x13.
Очевидно, что с $5 млрд за все время, Anthropic черрипикнули выручку так, что мама не горюй.
И это сработало: все пишут о $14 млрд (а то и $19 млрд) выручки, и если гуглить - такая же первая цифра. Получилось похлеще, чем вайбчартинг.
А честные $5 млрд выручки Anthropic (за все время на рынке!) - это меньше, чем продажи airpods за пару месяцев.
@kyrillic
Похоже с этим хайпом, что Composer 2 - это Kimi, саму Kimi K2.5 сейчас люди стали гонять в хвост и гриву 😂 Дико тормозит сегодня и на opencode go и даже на openrouter. Похоже пока стоит временно поюзать другие модели, рекомендую GLM-5 👍
Please open Telegram to view this post
VIEW IN TELEGRAM
Впервые столкнулся, когда модель слишком ведется на хайп слова и не вникает в суть, при эвалюейшене результатов тех собеса. 😵
Собесил человечка. Он не плох по софтам, что-то есть по cicd и security, но точно не синьор и точно не на эту позицию. Как обычно скидываю сиви, джоб дескрипшен, топики для собеса которые мы прошли и полный транскрипт беседы. Отправляю это в GLM-5 - и она мне пишет - "ОФИГЕТЬ ПОЛНЫЙ МЭТЧ, БЕРЕМ!" Я чуть офигел 🙈, удалил чат, загрузил все по новой в Gemini 3.1 Pro (все таки лучшая модель для бизнесовых задач) и она мне тоже выдает: "кандидат подходит". Вот например с такими заметками:
Я уже думаю что может я что-то прослушал 😟, скинул в Гемини уже свои заметки. Спрашиваю "а вот это вот, вот это вот что тогда??"😂 Вобщем вот такой re-evaluation у него произошел сразу:
Ну вот уже ближе похоже на правду)) Мораль - не доверяйте на 100% LLM моделям⚠️ , особенно в том, что не касается кода) Всегда надо перепроверять и сравнивать со своим личным опытом и мнением 🌡
Собесил человечка. Он не плох по софтам, что-то есть по cicd и security, но точно не синьор и точно не на эту позицию. Как обычно скидываю сиви, джоб дескрипшен, топики для собеса которые мы прошли и полный транскрипт беседы. Отправляю это в GLM-5 - и она мне пишет - "ОФИГЕТЬ ПОЛНЫЙ МЭТЧ, БЕРЕМ!" Я чуть офигел 🙈, удалил чат, загрузил все по новой в Gemini 3.1 Pro (все таки лучшая модель для бизнесовых задач) и она мне тоже выдает: "кандидат подходит". Вот например с такими заметками:
1. Core Competencies (JD Requirements) - Strong
* CI/CD & Jenkins: He has 5 years of direct Jenkins experience before moving to Bitbucket Pipelines. He deeply understands CI/CD optimization (reducing build times from 20m to 3m by changing image bases, optimizing tests, and removing unnecessary steps). He understands pipeline templates and branch-environment routing.
* Terraform & AWS: He demonstrated mature Infrastructure-as-Code practices. He segregates environments using Terraform workspaces and S3 buckets, injects AWS Secrets Manager variables at runtime (avoids hardcoding), and strictly advocates for running terraform plan/apply via CI/CD pipelines rather than local machines.
* DevSecOps & Release Governance: This is his strongest area. He acts as a "guardian of the process" and has great experience integrating SAST/SCA (SonarQube, Snyk). His anecdote about debugging a developer's false positive (passing a bloated object instead of a required string) shows excellent practical troubleshooting and collaboration skills.
Я уже думаю что может я что-то прослушал 😟, скинул в Гемини уже свои заметки. Спрашиваю "а вот это вот, вот это вот что тогда??"😂 Вобщем вот такой re-evaluation у него произошел сразу:
You are absolutely right, and I appreciate the pushback. I completely overlooked the lack of depth in his answers by focusing too much on his confidence and the buzzwords he used (like "reduced from 20m to 3m").
When looking closer at the transcript based on your feedback:
1. CI/CD Optimization: His "optimization" was literally just using a lighter base Docker image, cleaning up some commands, and fixing unit tests. There was no mention of layer caching, parallelization, or advanced pipeline architecture. It's very basic.
2. Quality Gates: He only talked about building custom vulnerability gates (using bash and jq for Snyk). He completely missed standard quality gates (functional tests, code coverage, performance thresholds).
3. Terraform: You are spot on. Just using workspaces and an S3 bucket is a beginner/intermediate setup. He didn't mention DRY principles, Terraform modules, or tools like Terragrunt/Atmos for managing complex environment metadata.
4. AWS & Containers: He mentioned building a "data lake" but didn't name a single AWS data service (Glue, Athena, EMR, Redshift). His container experience is strictly kubectl logs and checking if a binary was copied correctly. He is a user, not an orchestrator or builder.
5. Future-Proofing (CI/CD Tools): Relying heavily on Bitbucket Pipelines for the last 6 years makes him very niche. While his older Jenkins experience might let him survive this specific project, putting him on the bench later for modern GitHub Actions or GitLab CI projects will be a huge risk.
I have completely rewritten the key-takeaways.md file in the current folder to reflect this much more critical and accurate assessment. He is downgraded to a Borderline / Weak Fit.
His DevSecOps and cultural fit are still strong, but technically, he lacks the depth expected of a Senior Release Engineer, especially regarding infrastructure, orchestration, and advanced CI/CD architecture.
Ну вот уже ближе похоже на правду)) Мораль - не доверяйте на 100% LLM моделям
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2
LiteLLM питон библиотеку сломали. Инфецированную версию уже убрали, но на всякий случай пока лучше не загружать версии 1.82.7-1.82.8, если используете в каких-то своих проектах ⚠️⚠️⚠️
https://x.com/karpathy/status/2036487306585268612
https://x.com/karpathy/status/2036487306585268612
X (formerly Twitter)
Andrej Karpathy (@karpathy) on X
Software horror: litellm PyPI supply chain attack.
Simple `pip install litellm` was enough to exfiltrate SSH keys, AWS/GCP/Azure creds, Kubernetes configs, git credentials, env vars (all your AP…
Simple `pip install litellm` was enough to exfiltrate SSH keys, AWS/GCP/Azure creds, Kubernetes configs, git credentials, env vars (all your AP…
🌚3
Cursor запускает self-hosted агентов. Все их фичи с мультиагентами и грамотной индексацией кода, но на вашей инфраструктуре. Видно, что Anysphere все больше двигается в сторону enterprise контрактов, все меньше новых фич для индивидуальных контрибьютеров. Бизнес по перепродаже токенов похоже идет слабо 🤷♂️
❤1
Рекомендашка от меня: крутой voice-to-text conversion tool 💬 . На Линухе пока не работает, но уже есть винда, макоси и андройд. Работет реально удобно и четко, добавляет на телефоне плавающую иконку каждый раз когда открываешь текст филд, или сразу отправляет надиктованное в буфер. Хорошо составляет списки и другой форматированный текст, есть голосовые шорткаты, нормально распознает русский язык. Удобно отправлять текст в рабочий Slack или писать емейлы, когда ты на ходу. На андройде пока что полностью бесплатно 👍
https://wisprflow.ai/
https://wisprflow.ai/
Please open Telegram to view this post
VIEW IN TELEGRAM
wisprflow.ai
Wispr Flow | Voice to Text Dictation & AI Notetaker
Flow makes writing quick and clear with seamless voice dictation. It is the fastest, smartest way to type with your voice.
Дизайним cli, хорошо совместимые с ai-агентами. Вкратце:
* опции без интерактивного ввода (—no-input, —force, —yes итд)
* структурированный вывод (—json)
* error аутпут понятный для агента (какого аргумента не хватало, что делать) и подробный —help
* безопасные ретраи, идемпотентность, —dry-run, опасные изменения с отдельным confirm флагом
и т.д.
Читаем здесь
* опции без интерактивного ввода (—no-input, —force, —yes итд)
* структурированный вывод (—json)
* error аутпут понятный для агента (какого аргумента не хватало, что делать) и подробный —help
* безопасные ретраи, идемпотентность, —dry-run, опасные изменения с отдельным confirm флагом
и т.д.
Читаем здесь
На днях вышла GLM-5.1 oт Z-ai. По их внутреннему бенчу (решение кодинг задач внутри компании) почти догоняет последний Opus.
Но с GLM как всегда стоит упомянуть нюансы. GLM-5 реально хорошая модель. Но только у внешних провайдеров 😆 Я использую ее иногда на OpenRouter и OpenCode Go, для ревью кода или когда нужно свежее мнение для решения сложных задач (с которыми она реально справляется, правда для обычного использования для кодинга я все еще с Kimi K2.5, мне нравится ее скорость и стиль работы). Но именно на Z.ai coding plan GLM-5 вообще unsusable.🤷♂️ Во-первых тормоза (ждешь по минуте когда начнется вывод, как будто все запросы висят в queue прежде чем попасть на инфиренс), во-вторых на их кодинг плане она реально работает по другому. Один и тот же запрос в GLM-5 на openrouter и в zai coding plan выдавал упрощенные и иногда просто лоботомические ответы во втором случае. И проблему потверждали многие в дискорде, см скриншоты. Кто-то писал что треш наинчается после 100к контекста, кто-то что проблема с кешем, но факт остается фактом.
Но сейчас с выходом последней модели админы говорят что починили все проблемы со старыми (последний скрин). Детально я еще не проверял, но сегодня потестил GLM-5.1 для генерации вопросов для тех собесов. Пока впечатления хорошие, в тестовом ассесменте сгенеренным моим обычным Kimi и GLM-5.1, вторая уверенно сделала лучше. Будем тестить дальше 😎
В то что Zai решит все свои проблемы с инфрой я не верю 😅 но модель реально вырисовывается хорошая. И когда она появится у других провайдеров (к десятым числам апреля) - максимально рекомендую ее потестить👍
Но с GLM как всегда стоит упомянуть нюансы. GLM-5 реально хорошая модель. Но только у внешних провайдеров 😆 Я использую ее иногда на OpenRouter и OpenCode Go, для ревью кода или когда нужно свежее мнение для решения сложных задач (с которыми она реально справляется, правда для обычного использования для кодинга я все еще с Kimi K2.5, мне нравится ее скорость и стиль работы). Но именно на Z.ai coding plan GLM-5 вообще unsusable.
Но сейчас с выходом последней модели админы говорят что починили все проблемы со старыми (последний скрин). Детально я еще не проверял, но сегодня потестил GLM-5.1 для генерации вопросов для тех собесов. Пока впечатления хорошие, в тестовом ассесменте сгенеренным моим обычным Kimi и GLM-5.1, вторая уверенно сделала лучше. Будем тестить дальше 😎
В то что Zai решит все свои проблемы с инфрой я не верю 😅 но модель реально вырисовывается хорошая. И когда она появится у других провайдеров (к десятым числам апреля) - максимально рекомендую ее потестить
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1
Update по GLM-5.1 - Глючное неюзабельное 💩 , когда контекст превышает 100к токенов. Не знаю, может это именно опенкод? в других ide не тестил. В opencode неюзабельно для реальной работы с крупными фичами. Продолжаю работать с Kimi и GLM5 от других провайдеров. Такие дела 😕
Кстати в этом месяце обещают файнтюн Kimi K2.6, а так же Moonshot сейчас активно работает над 3й моделью, которая по размеру должна догнать GPT и Opus. Очень жду, LLM от Муншотов реально зе бест оф опенсорс.
Кстати в этом месяце обещают файнтюн Kimi K2.6, а так же Moonshot сейчас активно работает над 3й моделью, которая по размеру должна догнать GPT и Opus. Очень жду, LLM от Муншотов реально зе бест оф опенсорс.
Please open Telegram to view this post
VIEW IN TELEGRAM