This media is not supported in your browser
VIEW IN TELEGRAM
Ship обещает снизить стоимость инференса Claude на 50% заменой одной строки:
Вместо прямого вызова
Разработчик проверил это в терминале на одной и той же модели Anthropic с одинаковым промптом и получил заявленную экономию. (см. демо)
Идея Ship в том, что не каждый запрос требует одинаково дорогого способа выполнения. Обычно модель всегда запускает один и тот же forward pass, независимо от сложности задачи.
Ship выбирает стратегию уже после получения запроса. Система может использовать одну модель, каскад моделей, ансамбль или связку с инструментами, а затем подобрать самый дешёвый вариант, который сохранит качество и поведение исходной модели.
Это не просто роутинг на более дешёвую модель. Ship также проверяет, чтобы не менялись ключевые характеристики ответа: формат, паттерны вызова инструментов, отказы и общий уровень возможностей.
Ответы при этом не обязаны совпадать токен в токен. Важно, чтобы они были сопоставимы с референсной моделью по качеству и поведению.
Для пользователя цена в любом случае остаётся на 50% ниже. Даже если отдельный запрос обходится Ship дороже, разницу компания берёт на себя.
https://www.thesean.ai/blog/introducing-ship
За проектом стоит Thesean Labs — команда с бывшими специалистами Anthropic, DeepMind и квантами☕️
Вместо прямого вызова
claude-opus-4-8 достаточно указать: ship-like/claude-opus-4-8Разработчик проверил это в терминале на одной и той же модели Anthropic с одинаковым промптом и получил заявленную экономию. (см. демо)
Идея Ship в том, что не каждый запрос требует одинаково дорогого способа выполнения. Обычно модель всегда запускает один и тот же forward pass, независимо от сложности задачи.
Ship выбирает стратегию уже после получения запроса. Система может использовать одну модель, каскад моделей, ансамбль или связку с инструментами, а затем подобрать самый дешёвый вариант, который сохранит качество и поведение исходной модели.
Это не просто роутинг на более дешёвую модель. Ship также проверяет, чтобы не менялись ключевые характеристики ответа: формат, паттерны вызова инструментов, отказы и общий уровень возможностей.
Ответы при этом не обязаны совпадать токен в токен. Важно, чтобы они были сопоставимы с референсной моделью по качеству и поведению.
Для пользователя цена в любом случае остаётся на 50% ниже. Даже если отдельный запрос обходится Ship дороже, разницу компания берёт на себя.
https://www.thesean.ai/blog/introducing-ship
За проектом стоит Thesean Labs — команда с бывшими специалистами Anthropic, DeepMind и квантами
Please open Telegram to view this post
VIEW IN TELEGRAM
В десктопной версии Claude Code появилась интеграция с iOS Simulator.
Теперь можно запустить iOS-приложение, а симулятор откроется прямо рядом с чатом. Claude будет видеть, как работает приложение, сможет взаимодействовать с интерфейсом и вносить изменения, пока не доведёт задачу до результата.
При этом управление остаётся и у пользователя: в любой момент можно самостоятельно кликать по приложению в симуляторе.
Функция уже доступна в публичной бете на macOS и требует установленный Xcode.🇨🇳
Теперь можно запустить iOS-приложение, а симулятор откроется прямо рядом с чатом. Claude будет видеть, как работает приложение, сможет взаимодействовать с интерфейсом и вносить изменения, пока не доведёт задачу до результата.
При этом управление остаётся и у пользователя: в любой момент можно самостоятельно кликать по приложению в симуляторе.
Функция уже доступна в публичной бете на macOS и требует установленный Xcode.
Please open Telegram to view this post
VIEW IN TELEGRAM
2
This media is not supported in your browser
VIEW IN TELEGRAM
На этой неделе я нашёл, пожалуй, лучший оркестратор для ИИ-агентов. Он называется Herdr и по сути представляет собой 👍
Вы запускаете Claude Code, Codex или OpenCode в отдельных панелях, а боковая панель в реальном времени показывает, какой агент сейчас работает, какой уже закончил и какой заблокирован в ожидании вашего ввода.
Кроме того, терминал можно закрыть, а агенты продолжат работать. То есть поддерживается detach-режим.
Затем можно подключиться обратно по SSH откуда угодно, даже с телефона.
Всё это упаковано в один бинарник на Rust: быстрый, лёгкий, кроссплатформенный и с открытым исходным кодом. Работает в любом терминале, поддерживает настройку и плагины для расширения возможностей
https://herdr.dev/
tmux, который понимает, что делают агенты. Вы запускаете Claude Code, Codex или OpenCode в отдельных панелях, а боковая панель в реальном времени показывает, какой агент сейчас работает, какой уже закончил и какой заблокирован в ожидании вашего ввода.
Кроме того, терминал можно закрыть, а агенты продолжат работать. То есть поддерживается detach-режим.
Затем можно подключиться обратно по SSH откуда угодно, даже с телефона.
Всё это упаковано в один бинарник на Rust: быстрый, лёгкий, кроссплатформенный и с открытым исходным кодом. Работает в любом терминале, поддерживает настройку и плагины для расширения возможностей
https://herdr.dev/
Please open Telegram to view this post
VIEW IN TELEGRAM
Проект для бесплатного доступа к ИИ. 😧
OmniRoute объединяет все сервисы с бесплатным тарифом в один API-эндпоинт.
✓ Работает с Claude Code, Codex и Cursor
✓ Поддерживает сжатие токенов
✓ Доступно 50 провайдеров
100% опенсорс
OmniRoute объединяет все сервисы с бесплатным тарифом в один API-эндпоинт.
✓ Работает с Claude Code, Codex и Cursor
✓ Поддерживает сжатие токенов
✓ Доступно 50 провайдеров
100% опенсорс
Please open Telegram to view this post
VIEW IN TELEGRAM
Media is too big
VIEW IN TELEGRAM
"ИИ-компании слишком зациклены на самих моделях." — глава Kimi Ян Чжилинь
По его мнению, решающее преимущество даёт не только архитектура или количество параметров, а то, как устроена команда, которая всё это создаёт. Именно организация людей, процессов и решений в итоге определяет результат.
Moonshot показала этот подход и на практике. Когда спрос на K3 превысил доступные мощности, компания остановила продажу новых подписок, но не стала урезать лимиты действующим пользователям. То есть предпочла потерять часть выручки, а не ухудшать сервис для уже существующей аудитории.
Ещё одна важная идея Яна: длинный контекст становится для ИИ тем же, чем оперативная память стала для компьютеров. Объём доступной модели памяти растёт огромными темпами, только теперь этот переход занимает не десятилетия, а считаные годы.
Модель важна, но настоящий перевес может давать команда и то, как она организована.
источник
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
3
This media is not supported in your browser
VIEW IN TELEGRAM
Плагин Claude Security для Claude Code теперь доступен в бета-версии.
Теперь можно прямо из терминала проверять код на уязвимости: запускать анализ изменений перед коммитом или выполнять полноценное сканирование всей кодовой базы, используя тот же Claude inference, который уже работает в Claude Code.🎉
Теперь можно прямо из терминала проверять код на уязвимости: запускать анализ изменений перед коммитом или выполнять полноценное сканирование всей кодовой базы, используя тот же Claude inference, который уже работает в Claude Code.
Please open Telegram to view this post
VIEW IN TELEGRAM
Конфликт вокруг открытых-моделей ИИ набирает обороты. 🤷♂️
США заявили, что располагают информацией о том, что Moonshot AI использовала дистилляцию модели Fable от Anthropic при разработке своей K3.
По утверждению американской стороны, для этого Moonshot AI создала внутреннюю платформу для масштабной дистилляции американских моделей, которая позволяла переключаться между разными способами доступа, чтобы избежать обнаружения. Также компания приобрела серверы с GB300 и получила доступ к таким системам в Таиланде, предположительно для обучения своих AI-моделей.
При этом США подчёркивают, что поддерживают опенсорс развитие ИИ. Легитимная дистилляция, которая помогает создавать более компактные и эффективные модели, остаётся важной частью экосистемы.
Однако, по мнению американских властей, скрытая промышленная дистилляция, направленная на получение доступа к проприетарным технологиям и подрыв исследований, является неприемлемой.
На фоне этих заявлений почти 200 компаний из Кремниевой долины, включая Proton и Y Combinator, призвали администрацию Трампа не ограничивать доступ к китайским AI-моделям с открытыми весами. По их мнению, такие ограничения могут нанести серьёзный ущерб следующему поколению американских стартапов, которые используют открытые модели для разработки новых продуктов.
США заявили, что располагают информацией о том, что Moonshot AI использовала дистилляцию модели Fable от Anthropic при разработке своей K3.
По утверждению американской стороны, для этого Moonshot AI создала внутреннюю платформу для масштабной дистилляции американских моделей, которая позволяла переключаться между разными способами доступа, чтобы избежать обнаружения. Также компания приобрела серверы с GB300 и получила доступ к таким системам в Таиланде, предположительно для обучения своих AI-моделей.
При этом США подчёркивают, что поддерживают опенсорс развитие ИИ. Легитимная дистилляция, которая помогает создавать более компактные и эффективные модели, остаётся важной частью экосистемы.
Однако, по мнению американских властей, скрытая промышленная дистилляция, направленная на получение доступа к проприетарным технологиям и подрыв исследований, является неприемлемой.
«Мы поддерживаем опенсорс в области ИИ и инновации, которые он позволяет создавать. Но опенсорс — это не свободная охота на американскую интеллектуальную собственность. Если компании из КНР проводят скрытые масштабные операции по дистилляции, переходящие черту и превращающиеся в кражу IP, санкции и внесение в Entity List будут рассматриваться как возможные меры».
На фоне этих заявлений почти 200 компаний из Кремниевой долины, включая Proton и Y Combinator, призвали администрацию Трампа не ограничивать доступ к китайским AI-моделям с открытыми весами. По их мнению, такие ограничения могут нанести серьёзный ущерб следующему поколению американских стартапов, которые используют открытые модели для разработки новых продуктов.
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
Антропики добавили несколько новых возможностей в Claude Managed Agents. 🏋️♂️
Теперь можно:
- настраивать effort level отдельно для каждого агента;
- запускать сессии с заранее заданными событиями;
- добавлять до 500 скиллов на одну сессию;
- использовать вебхуки для окружений и хранилищ памяти;
- получать поток событий от субагентов в режиме реального времени.
Протестировать новые возможности можно через их cookbook.
Теперь можно:
- настраивать effort level отдельно для каждого агента;
- запускать сессии с заранее заданными событиями;
- добавлять до 500 скиллов на одну сессию;
- использовать вебхуки для окружений и хранилищ памяти;
- получать поток событий от субагентов в режиме реального времени.
Протестировать новые возможности можно через их cookbook.
Please open Telegram to view this post
VIEW IN TELEGRAM
Методы квантования LLM, которые я бы изучил, если бы мне нужно было запустить модель 70B на одной GPU:
Модель 70B в FP16 требует около 140 ГБ только под веса. В 4-битном формате этот объём уменьшается до 35 ГБ, что уже помещается на одну видеокарту.
Но простое округление значений не работает для больших моделей. Примерно 0,1% скрытых размерностей содержат значения, которые могут быть до 20 раз больше, чем остальные значения в тензоре, и они ломают квантовочную сетку для всех остальных параметров.
Каждый из этих 5 методов решает проблему выбросов на разном этапе:
1. RTN (Round-To-Nearest)
Игнорирует проблему.
Каждый вес просто округляется до ближайшего уровня квантования без использования калибровочных данных.
Самый дешёвый вариант, но самый слабый при низкой разрядности.
2. GPTQ
Исправляет последствия округления.
Квантует слой за слоем, столбец за столбцом, и после каждого шага корректирует оставшиеся веса, чтобы компенсировать возникшую ошибку, прежде чем перейти дальше.
3. AWQ (Activation-aware Weight Quantization)
Защищает важные веса до округления.
Находит примерно 1% каналов весов, которые оказывают наибольшее влияние, и масштабирует их так, чтобы они лучше переживали квантование.
При этом итоговая модель всё равно полностью работает в обычном INT4.
4. LLM.int8()
Изолирует выбросы во время инференса.
Размерности с выбросами выполняются в FP16, а остальные 99,9% параметров работают в INT8. Затем результаты объединяются.
5. QAT (Quantization-Aware Training)
Решает проблему ещё во время обучения.
Модель дообучается с учётом квантования: округление встроено в каждый forward pass, поэтому модель заранее адаптируется к возникающим потерям до фактического применения квантования.
Все пять методов создают один и тот же результат — модель, работающую с меньшей точностью представления по сравнению с исходной обученной версией.
Разница только в том, на каком этапе решается проблема выбросов.
Визуализация ниже хорошо суммирует эти подходы.
Есть отличная статья с подробным исследованием методов квантования LLM:
https://arxiv.org/abs/2411.02530
Модель 70B в FP16 требует около 140 ГБ только под веса. В 4-битном формате этот объём уменьшается до 35 ГБ, что уже помещается на одну видеокарту.
Но простое округление значений не работает для больших моделей. Примерно 0,1% скрытых размерностей содержат значения, которые могут быть до 20 раз больше, чем остальные значения в тензоре, и они ломают квантовочную сетку для всех остальных параметров.
Каждый из этих 5 методов решает проблему выбросов на разном этапе:
1. RTN (Round-To-Nearest)
Игнорирует проблему.
Каждый вес просто округляется до ближайшего уровня квантования без использования калибровочных данных.
Самый дешёвый вариант, но самый слабый при низкой разрядности.
2. GPTQ
Исправляет последствия округления.
Квантует слой за слоем, столбец за столбцом, и после каждого шага корректирует оставшиеся веса, чтобы компенсировать возникшую ошибку, прежде чем перейти дальше.
3. AWQ (Activation-aware Weight Quantization)
Защищает важные веса до округления.
Находит примерно 1% каналов весов, которые оказывают наибольшее влияние, и масштабирует их так, чтобы они лучше переживали квантование.
При этом итоговая модель всё равно полностью работает в обычном INT4.
4. LLM.int8()
Изолирует выбросы во время инференса.
Размерности с выбросами выполняются в FP16, а остальные 99,9% параметров работают в INT8. Затем результаты объединяются.
5. QAT (Quantization-Aware Training)
Решает проблему ещё во время обучения.
Модель дообучается с учётом квантования: округление встроено в каждый forward pass, поэтому модель заранее адаптируется к возникающим потерям до фактического применения квантования.
Все пять методов создают один и тот же результат — модель, работающую с меньшей точностью представления по сравнению с исходной обученной версией.
Разница только в том, на каком этапе решается проблема выбросов.
Визуализация ниже хорошо суммирует эти подходы.
Есть отличная статья с подробным исследованием методов квантования LLM:
https://arxiv.org/abs/2411.02530
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
Эндрю Ын: «Возможно, я единственный человек в мире, у которого и Сэм, и Дарио работали под моим руководством».
источник
«Есть одна вещь, которую я точно не смог бы предсказать несколько лет назад: в итоге Китай стал гораздо более открытым, чем США, если говорить о способах развития и внедрения инноваций в ИИ.
Я очень хорошо знаю американскую AI-экосистему, потому что основал Google Brain и участвовал в её развитии. Возможно, я единственный человек в мире, у которого и Сэм, и Дарио работали в подчинении. Поэтому я хорошо знаком с людьми, которые стоят за этими командами.
Когда ChatGPT вышел в конце 2022 года, США сильно опережали Китай. Но с тех пор Китай грамотно использовал свои возможности, сделав ставку на open source и экосистему открытых весов моделей. Китайские команды проводят исследования и бесплатно публикуют научные работы в интернете, где их может прочитать любой желающий.
Кстати, многие ведущие американские команды внимательно изучают большое количество китайских исследований, перенимая идеи и получая от этого значительную пользу. Честно говоря, многие технологии, которые сегодня используют ведущие AI-команды в США, появились благодаря исследовательским инновациям, которые они узнали из китайских работ.
Поэтому я считаю, что обмен знаниями идёт в обе стороны».
источник
Этот скилл автоматически улучшает GitHub README.
Он сначала анализирует проект, а уже потом перерабатывает README, чтобы не придумывать несуществующие функции и возможности.
Репозиторий: https://github.com/oil-oil/beautify-github-readme
Он сначала анализирует проект, а уже потом перерабатывает README, чтобы не придумывать несуществующие функции и возможности.
Репозиторий: https://github.com/oil-oil/beautify-github-readme