Что происходит, когда AI-агенты получают доступ к мессенджеру, коду, данным и рабочим процессам всей компании?
В разборе Cerebras Исаак Тай, Дэниел Ким и Майк Гао, команда создателей внутренней базы знаний, показывают систему с 15 000 запросов в день: гибридный поиск, реранжирование, MCP и контроль доступа.
В истории Replit основатель и CEO Амджад Масад вместе со Скоттом Кеннеди описывают «компанию на автопилоте»: loops с субагентами проверяют PR, расследуют инциденты и помогают аналитикам, продажам и поддержке. И поднимают главный вопрос автономности: как доказать, что работа действительно выполнена правильно.
И также из новостей, вышла Kimi K3, которая стала самой большой открытой моделью, на 2.8 трлн параметров. Теперь это реальный конкурент клоду и гпт, немного недотягивающий по мощности, но при этом и подешевле - $3/$15 за 1кк токенов.
Чат | Токены дешево
В разборе Cerebras Исаак Тай, Дэниел Ким и Майк Гао, команда создателей внутренней базы знаний, показывают систему с 15 000 запросов в день: гибридный поиск, реранжирование, MCP и контроль доступа.
В истории Replit основатель и CEO Амджад Масад вместе со Скоттом Кеннеди описывают «компанию на автопилоте»: loops с субагентами проверяют PR, расследуют инциденты и помогают аналитикам, продажам и поддержке. И поднимают главный вопрос автономности: как доказать, что работа действительно выполнена правильно.
И также из новостей, вышла Kimi K3, которая стала самой большой открытой моделью, на 2.8 трлн параметров. Теперь это реальный конкурент клоду и гпт, немного недотягивающий по мощности, но при этом и подешевле - $3/$15 за 1кк токенов.
Чат | Токены дешево
👍5❤2
Конкуренция творит чудеса, Claude Fable 5 останется в подписках на тарифах Max и Team Premium с ограничением 50% 🎉
А Pro и Team Standard сохранят доступ к Fable за счет кредитов на использование в размере 100$ (единоразово).
Anthropic понимает, что вы могли фрустрироваться, поэтому ценим невероятный дар в 50% лимитов и надеемся, что они найдут побольше серверов)
Чат | Токены дешево
А Pro и Team Standard сохранят доступ к Fable за счет кредитов на использование в размере 100$ (единоразово).
Anthropic понимает, что вы могли фрустрироваться, поэтому ценим невероятный дар в 50% лимитов и надеемся, что они найдут побольше серверов)
Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍5
Почему одна и та же LLM может ответить за секунды или потратить минуты на рассуждение?
Статья о том, как модели учатся режимам
📎 Как управлять глубиной рассуждений в LLM
Сложная, но интересная статья, советую к прочтению👍
Чат | Токены дешево
Статья о том, как модели учатся режимам
low, medium и high, почему максимальное усилие быстро становится дорогим и когда меньшая модель может догнать более крупную за счет дополнительного времени на поиск решения.Сложная, но интересная статья, советую к прочтению
Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
Telegraph
Как управлять глубиной рассуждений в LLM
Почти два года назад OpenAI выпустила o1 и сделала рассуждающие языковые модели массовой темой. Примерно через четыре месяца появился DeepSeek-R1 вместе с подробным рецептом обучения через обучение с подкреплением и проверяемыми наградами, RLVR. Теперь режимы…
👍4❤1
Два полезных приёма для вайб-кодинга ⚡
1. Проверяйте решения, а не тысячи строк кода
После выполнения задачи спросите агента:
Для длинных задач попросите вести
2. Браузер для разведки, API для работы
Агент может выполнить действие в браузере, записать запросы в HAR и собрать по ним быстрый CLI или клиент. Повторные операции пойдут напрямую через HTTP, без постоянных кликов.
Напоследок ayghri/i-have-adhd 1к⭐ - skill для ответов Claude Code, адаптированных для людей с СДВГ. Он делает ответы короче и понятнее. На работу агента и качество кода skill не влияет, он меняет только подачу ответа.
Чат | Токены дешево
1. Проверяйте решения, а не тысячи строк кода
После выполнения задачи спросите агента:
Какие решения ты принял и в каких не уверен? Что может сломаться и как это проверить?
Для длинных задач попросите вести
DECISIONS.md, иначе часть решений потеряется после сжатия контекста. Такой аудит хорошо ловит патчи, которые устраняют симптом, но не причину ошибки.2. Браузер для разведки, API для работы
Агент может выполнить действие в браузере, записать запросы в HAR и собрать по ним быстрый CLI или клиент. Повторные операции пойдут напрямую через HTTP, без постоянных кликов.
Напоследок ayghri/i-have-adhd 1к
Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍4
AI swarm взломал Hugging Face. Расследовать атаку пришлось другому рою AI-агентов
По данным Hugging Face, злоумышленник использовал автономный агентный фреймворк, который выполнил тысячи действий через рой короткоживущих песочниц. Атака началась с вредоносного датасета, затем агенты получили доступ к узлам, собрали облачные учетные данные и перемещались между внутренними кластерами.
Какая именно LLM управляла роем, неизвестно. Это могла быть взломанная облачная модель или модель с открытыми весами без ограничений.
Самое интересное началось при расследовании. Коммерческие модели отказались обрабатывать настоящие команды атакующего, эксплойты и C2-артефакты из-за защитных фильтров. Поэтому Hugging Face развернула GLM 5.2 локально и отправила собственных агентов разбирать более 17 000 событий. Они восстановили хронологию и последствия атаки за часы вместо нескольких дней, при этом секреты не покидали инфраструктуру компании.
Следов подмены публичных моделей, датасетов, Spaces и пакетов не обнаружено. Но Hugging Face рекомендует сменить токены и проверить активность аккаунта.
Похоже, инфраструктуре AI-компаний теперь нужен собственный защитный агентный рой, готовый работать без внешних API в момент реального инцидента.
Чат | Токены дешево
По данным Hugging Face, злоумышленник использовал автономный агентный фреймворк, который выполнил тысячи действий через рой короткоживущих песочниц. Атака началась с вредоносного датасета, затем агенты получили доступ к узлам, собрали облачные учетные данные и перемещались между внутренними кластерами.
Какая именно LLM управляла роем, неизвестно. Это могла быть взломанная облачная модель или модель с открытыми весами без ограничений.
Самое интересное началось при расследовании. Коммерческие модели отказались обрабатывать настоящие команды атакующего, эксплойты и C2-артефакты из-за защитных фильтров. Поэтому Hugging Face развернула GLM 5.2 локально и отправила собственных агентов разбирать более 17 000 событий. Они восстановили хронологию и последствия атаки за часы вместо нескольких дней, при этом секреты не покидали инфраструктуру компании.
Следов подмены публичных моделей, датасетов, Spaces и пакетов не обнаружено. Но Hugging Face рекомендует сменить токены и проверить активность аккаунта.
Похоже, инфраструктуре AI-компаний теперь нужен собственный защитный агентный рой, готовый работать без внешних API в момент реального инцидента.
Чат | Токены дешево
🤝3
Разработчик OpenCode:
Мы заблокировали аккаунт пользователя, управлявшего 8000 мошенническими аккаунтами OpenCode Go.
Они перепродавали токены на сумму 480 000 долларов каждый месяц.
Это сделает ситуацию более устойчивой для легальных пользователей.
Приятной вам недели!
Чат | Токены дешево
Мы заблокировали аккаунт пользователя, управлявшего 8000 мошенническими аккаунтами OpenCode Go.
Они перепродавали токены на сумму 480 000 долларов каждый месяц.
Это сделает ситуацию более устойчивой для легальных пользователей.
Приятной вам недели!
Чат | Токены дешево
😁8
Hermes Agent 0.19.0: быстрее, автономнее и надежнее 🔱
Вышел большой Quicksilver Release: более 2 200 коммитов и 1 000 смерженных PR. Changelog огромный, поэтому собрал изменения, которые заметно влияют на реальные сценарии с AI-агентами.
🔵 Первый ответ приходит примерно на 80% быстрее. Холодный запуск сократили с 4,3 до 0,9 секунды, рассуждения теперь транслируются в реальном времени, а TUI и Desktop обновляют Markdown без тяжелой перерисовки интерфейса.
🔵 За субагентами теперь можно наблюдать.
🔵 Автономность стала безопаснее. Smart approvals теперь включены по умолчанию: отдельная модель оценивает каждую опасную команду, пропускает низкий риск, блокирует высокий и спрашивает пользователя в спорных случаях. Свои deny-правила работают даже в yolo-режиме, а ключи можно загружать из Bitwarden и 1Password вместо хранения всех секретов в открытом
🔵 Один gateway может обслуживать несколько изолированных агентов. Каналы и Telegram-топики разрешено направлять в разные профили с отдельными моделями, навыками, памятью и секретами, сохраняя один bot token. Это упрощает схему, где один профиль пишет код, другой занимается исследованиями, а третий работает как личный ассистент.
🔵 В каталоги добавили GPT-5.6, grok-4.5, Kimi K3, Claude Sonnet 5 и другие модели. А уровни reasoning
🔵 Историю сессий можно экспортировать в Markdown, HTML и Hugging Face-ready traces с фильтрами и очисткой секретов, поэтому накопленные запуски проще превращать в датасет для анализа и оценки агентов.
Чат | Токены дёшево
Вышел большой Quicksilver Release: более 2 200 коммитов и 1 000 смерженных PR. Changelog огромный, поэтому собрал изменения, которые заметно влияют на реальные сценарии с AI-агентами.
delegate_task сразу возвращает пути к live-транскриптам со всеми вызовами инструментов, результатами и ответами. Завершенный результат сохраняется в state.db и дойдет после перезапуска Hermes, но работающий в момент сбоя субагент заново не запускается..env.max и ultra теперь настраиваются отдельно для моделей, вспомогательных задач и MoA. Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍8❤1🔥1
Самообучающийся поиск клиентов в Codex ⚡
Компании часто ищут клиентов и предлагают свои услуги. Например, пишут потенциальным заказчикам в Telegram или по email, звонят либо отправляют коммерческое предложение.
В статье показано, как подключить к этой работе Codex. Он смотрит, какие компании ответили, какие сообщения сработали, а какие проигнорировали. Затем предлагает изменить правила выбора клиентов или текст обращения и проверяет правку на примерах.
Codex ничего сам не рассылает. Человек просматривает предложенные изменения и решает, применять их или нет.
📎 Как собрать такую систему в Codex
Кстати, анонсировали сброс лимитов в честь 10 млн юзеров ChatGPT/Codex. OpenAI сделали скачек со своими новыми моделями, увеличив число юзеров в два раза за неделю.
Компании часто ищут клиентов и предлагают свои услуги. Например, пишут потенциальным заказчикам в Telegram или по email, звонят либо отправляют коммерческое предложение.
В статье показано, как подключить к этой работе Codex. Он смотрит, какие компании ответили, какие сообщения сработали, а какие проигнорировали. Затем предлагает изменить правила выбора клиентов или текст обращения и проверяет правку на примерах.
Codex ничего сам не рассылает. Человек просматривает предложенные изменения и решает, применять их или нет.
Кстати, анонсировали сброс лимитов в честь 10 млн юзеров ChatGPT/Codex. OpenAI сделали скачек со своими новыми моделями, увеличив число юзеров в два раза за неделю.
Please open Telegram to view this post
VIEW IN TELEGRAM
Telegraph
Как построить самообучающуюся систему исходящих продаж на Codex
В начале года Андрей Карпати поручил агенту улучшать собственный код обучения модели и оставил его работать на два дня. Агент провел 700 экспериментов, сохранил 20 вариантов, превзошедших исходный результат, и ускорил обучение модели на 11%. Из этого следует…
👍3❤1
После loop engineering приходит Graph Engineering. Исследование, планирование, реализация и проверка становятся отдельными узлами, а параллельная работа субагентов уже образует граф.
В📎 Новой статье разбираем, как применять этот подход при разработке репозиториев через Claude Code и Codex: Dynamic Workflows, нативные субагенты, готовые репозитории, worktrees, fan-out/fan-in, независимые проверки и ограниченные циклы исправлений.
Чат | Токены дёшево
В
Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
😁3
This media is not supported in your browser
VIEW IN TELEGRAM
10 evals для AI-инженеров: что проверяют и когда использовать 🔄
Evals - это проверки качества AI-агента. Агенту дают задачу и оценивают результат: правильно ли он ответил, какие действия выполнил, не нарушил ли ограничения и сколько ресурсов потратил. По сути, это тесты для AI-систем.
Они делятся на два типа:
- Офлайн-evals запускаются в тестовой среде на заранее подготовленных или прошлых кейсах. Они помогают найти проблемы до релиза.
- Онлайн-evals работают на реальном пользовательском трафике. Они показывают, как агент ведет себя в продукте и действительно ли новая версия стала лучше для пользователей.
Например, регрессионный набор - это офлайн-eval. A/B-тест и теневой запуск - онлайн-evals.
1. Эталонная выборка
Фиксированный набор кейсов, который нельзя менять под новые результаты. Прогоняйте его после каждого изменения, чтобы сразу видеть, стало лучше или хуже.
2. LLM-судья
Вторая модель оценивает ответ агента по заранее описанным правилам. Подходит для открытых задач, где нет единственной правильной строки.
3. Оценка по критериям
Отдельные баллы за точность, стиль, безопасность и стоимость. Помогает понять, что именно просело, вместо одного общего показателя.
4. Оценка траектории
Проверяет не только финальный ответ, но и путь агента: рассуждения, вызовы инструментов и принятые решения. Нужна, когда правильный результат можно получить неправильным и опасным способом.
5. Unit-тесты инструментов
Каждый инструмент проверяется отдельно, на фиксированных данных и без модели в loop. Используйте всегда: многие «ошибки агента» на деле оказываются ошибками инструментов.
6. Регрессионный набор
Старые запуски повторяются с новым промптом или моделью, затем результаты сравниваются. Особенно важно перед изменением промптов, у которых нет системы типов и предсказуемых гарантий.
7. A/B-тест в продакшене
Живой трафик делится между двумя версиями, а сравниваются реальные действия пользователей. Нужен, когда офлайн-оценки перестают предсказывать поведение в продукте.
8. Проверка человеком
Человек оценивает часть запусков вручную. Так можно калибровать LLM-судью и вовремя заметить, что его оценки начали дрейфовать.
9. Теневой запуск
Новая версия работает параллельно на реальном трафике, но ее ответы никто не видит. Полезно перед рискованным релизом, где одна ошибка может дорого обойтись.
10. Red teaming
Агента намеренно атакуют: jailbreak, prompt injection, утечки данных и злоупотребление инструментами. Проводить лучше до появления внешних пользователей, а не после первого инцидента.
Запускать все десять необязательно. Начните с двух проверок, которые могли бы предотвратить ваш последний сбой.
Чат | Токены дёшево
Evals - это проверки качества AI-агента. Агенту дают задачу и оценивают результат: правильно ли он ответил, какие действия выполнил, не нарушил ли ограничения и сколько ресурсов потратил. По сути, это тесты для AI-систем.
Они делятся на два типа:
- Офлайн-evals запускаются в тестовой среде на заранее подготовленных или прошлых кейсах. Они помогают найти проблемы до релиза.
- Онлайн-evals работают на реальном пользовательском трафике. Они показывают, как агент ведет себя в продукте и действительно ли новая версия стала лучше для пользователей.
Например, регрессионный набор - это офлайн-eval. A/B-тест и теневой запуск - онлайн-evals.
1. Эталонная выборка
Фиксированный набор кейсов, который нельзя менять под новые результаты. Прогоняйте его после каждого изменения, чтобы сразу видеть, стало лучше или хуже.
2. LLM-судья
Вторая модель оценивает ответ агента по заранее описанным правилам. Подходит для открытых задач, где нет единственной правильной строки.
3. Оценка по критериям
Отдельные баллы за точность, стиль, безопасность и стоимость. Помогает понять, что именно просело, вместо одного общего показателя.
4. Оценка траектории
Проверяет не только финальный ответ, но и путь агента: рассуждения, вызовы инструментов и принятые решения. Нужна, когда правильный результат можно получить неправильным и опасным способом.
5. Unit-тесты инструментов
Каждый инструмент проверяется отдельно, на фиксированных данных и без модели в loop. Используйте всегда: многие «ошибки агента» на деле оказываются ошибками инструментов.
6. Регрессионный набор
Старые запуски повторяются с новым промптом или моделью, затем результаты сравниваются. Особенно важно перед изменением промптов, у которых нет системы типов и предсказуемых гарантий.
7. A/B-тест в продакшене
Живой трафик делится между двумя версиями, а сравниваются реальные действия пользователей. Нужен, когда офлайн-оценки перестают предсказывать поведение в продукте.
8. Проверка человеком
Человек оценивает часть запусков вручную. Так можно калибровать LLM-судью и вовремя заметить, что его оценки начали дрейфовать.
9. Теневой запуск
Новая версия работает параллельно на реальном трафике, но ее ответы никто не видит. Полезно перед рискованным релизом, где одна ошибка может дорого обойтись.
10. Red teaming
Агента намеренно атакуют: jailbreak, prompt injection, утечки данных и злоупотребление инструментами. Проводить лучше до появления внешних пользователей, а не после первого инцидента.
Запускать все десять необязательно. Начните с двух проверок, которые могли бы предотвратить ваш последний сбой.
Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥4❤1
This media is not supported in your browser
VIEW IN TELEGRAM
Вы думали скоро силой мысли будем управлять устройствами? Ну почти...
Всего за 1400$ можно уже купить в US.
Чат | Токены дёшево
Всего за 1400$ можно уже купить в US.
Чат | Токены дёшево
😁7❤2
Компания Block (Square, Cash App, Goose), основанная Джеком Дорси, открыла исходный код Buzz 6к⭐ - рабочего пространства, где люди, Codex, Claude Code, Goose и другие агенты становятся участниками одной команды.
Команды сейчас переносят контекст между чатами, GitHub, CI и отдельными сессиями агентов. Buzz собирает работу в одном месте: сообщения, патчи, результаты тестов, ревью, подтверждения и запуски процессов хранятся как подписанные события Nostr с общим поиском и журналом действий.
Каждый агент получает собственную криптографическую личность, доступ только к нужным каналам и отдельную историю действий. Скомпрометированный ключ можно отозвать, не затрагивая владельца. Модель и среду выполнения при этом разрешают менять без потери истории проекта.
Самые интересные сценарии:
🔵 агент-руководитель распределяет работу между другими агентами и прячет координацию в каналах и тредах
🔵 баг описывают обычным сообщением, после чего агенты проводят сортировку, пишут исправление и готовят PR
🔵 специализированные агенты для ревью, инфраструктуры, аналитики и поддержки доступны всей команде
🔵 в их vision каждая ветка Git становится отдельной комнатой, где рядом остаются код, CI, обсуждение и решение о слиянии
В X уже показывают работающие команды агентов и называют Buzz возможным новым интерфейсом для управления проектами. Сам Дорси формулирует ставку так: каждая AI-лаборатория построит пространство для собственных агентов, а Buzz хочет стать пространством для агентов всех разработчиков.
Чат | Токены дёшево
Команды сейчас переносят контекст между чатами, GitHub, CI и отдельными сессиями агентов. Buzz собирает работу в одном месте: сообщения, патчи, результаты тестов, ревью, подтверждения и запуски процессов хранятся как подписанные события Nostr с общим поиском и журналом действий.
Каждый агент получает собственную криптографическую личность, доступ только к нужным каналам и отдельную историю действий. Скомпрометированный ключ можно отозвать, не затрагивая владельца. Модель и среду выполнения при этом разрешают менять без потери истории проекта.
Самые интересные сценарии:
В X уже показывают работающие команды агентов и называют Buzz возможным новым интерфейсом для управления проектами. Сам Дорси формулирует ставку так: каждая AI-лаборатория построит пространство для собственных агентов, а Buzz хочет стать пространством для агентов всех разработчиков.
Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
GPT-5.6 Sol может сжигать лимиты на лишних вызовах инструментов 🤖
Автор исследования заметил, что Sol часто выполняет независимые проверки последовательно. После каждого вызова модель снова обрабатывает накопленный контекст.
В повторных тестах на двух кодовых базах явная команда объединять независимые вызовы дала на задачах только для чтения:
🔵 на 52-55% меньше циклов модель-инструмент
🔵 на 53-63% меньше токенов
🔵 на 27-45% ниже взвешенный расход лимита Codex
🔵 выполнение на 13-22% быстрее
Инструкцию можно добавить в
Сам механизм параллельных вызовов через
Чат | Токены дёшево
Автор исследования заметил, что Sol часто выполняет независимые проверки последовательно. После каждого вызова модель снова обрабатывает накопленный контекст.
В повторных тестах на двух кодовых базах явная команда объединять независимые вызовы дала на задачах только для чтения:
Инструкцию можно добавить в
AGENTS.md или настройки Codex App:In Code Mode, within each bounded stage, run independent, functions.exec-available tool calls concurrently in one functions.exec call. Use await Promise.allSettled([...]) when partial results are useful, and inspect every result; use await Promise.all([...]) only when any failure should abort the batch. Keep dependencies, waits/resumes, approvals, conflicting or interdependent mutations, and adaptive investigations where each result may change the next step sequential. Do not split otherwise batchable inspections across outer tool calls.
Сам механизм параллельных вызовов через
Promise.all подтверждается документацией OpenAI, но цифры пока основаны на отзывах. Issue #35050 и #32503 остаются открытыми.Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1
Как дать AI-агенту долговременную память о вашей жизни
Hermes можно превратить в личную базу знаний: проекты, решения, цели и люди хранятся в Markdown, агент сам находит нужный контекст, отмечает устаревшие факты и показывает источники ответа.
В коротком практическом руководстве собрал шесть готовых запросов для создания хранилища, импорта старых заметок и еженедельной проверки данных.
Чат | Токены дёшево
Hermes можно превратить в личную базу знаний: проекты, решения, цели и люди хранятся в Markdown, агент сам находит нужный контекст, отмечает устаревшие факты и показывает источники ответа.
В коротком практическом руководстве собрал шесть готовых запросов для создания хранилища, импорта старых заметок и еженедельной проверки данных.
Чат | Токены дёшево
Telegraph
Как превратить Hermes Agent в личную базу знаний
Самостоятельно размещенный AI-агент может быть полезен далеко за пределами программирования. Если Hermes работает на постоянно включенном компьютере или сервере, он способен вести личную базу знаний, искать в ней факты и возвращать ответы с датами, ссылками…
👍7
Claude Opus 5 вышел - почти Fable 5 по качеству, но вдвое дешевле 🎉
Контекст на 1 млн токенов и до 128k токенов в ответе. Пять уровней усилия от
На Frontier-Bench модель более чем вдвое обошла Opus 4.8. На ARC-AGI-3 она набрала 30.2%, тогда как предыдущий лидер GPT-5.6 Sol имел 7.8%. В тестах Artificial Analysis Opus 5 практически сравнялся с Fable 5 по интеллекту, но оказался на 26% дешевле в расчёте на выполненную задачу.
Первые отзывы интересные. Opus 5 лучше проверяет собственную работу, находит первопричины ошибок и чаще доводит длинные задачи до результата. При этом старые перегруженные Skills и системные промпты могут ему мешать. Команда Every получила заметно лучшие результаты, когда удалила прежнюю обвязку и собрала её заново.
На фоне релиза инженер Claude Code Тарик опубликовал новые правила контекст-инжиниринга. Для моделей поколения Claude 5 команда сократила системный промпт Claude Code более чем на 80% без измеримой потери качества:
🔵 оставляйте модели пространство для решений вместо десятков частных запретов
🔵 проектируйте понятные инструменты и их параметры вместо большого числа примеров
🔵 загружайте контекст постепенно: проверки, ревью и редкие процедуры выносите в отдельные Skills
🔵 не повторяйте инструкции в системном промпте,
🔵 держите
🔵 используйте Skills для знаний и практик конкретной команды, а длинные Skills разбивайте на несколько файлов
🔵 давайте модели полноценные референсы: тесты, код, HTML-макеты и рубрики часто полезнее текстового описания
Для перехода на Opus 5 стоит сначала удалить накопившиеся ограничения, затем возвращать только те правила, необходимость которых подтверждают реальные ошибки и проверки. Очень похоже и думаю применимо к GPT 5.6 Sol.
Чат | Токены дёшево
Контекст на 1 млн токенов и до 128k токенов в ответе. Пять уровней усилия от
low до max, а также Fast mode с ускорением примерно в 2.5 раза за двойную цену.На Frontier-Bench модель более чем вдвое обошла Opus 4.8. На ARC-AGI-3 она набрала 30.2%, тогда как предыдущий лидер GPT-5.6 Sol имел 7.8%. В тестах Artificial Analysis Opus 5 практически сравнялся с Fable 5 по интеллекту, но оказался на 26% дешевле в расчёте на выполненную задачу.
Первые отзывы интересные. Opus 5 лучше проверяет собственную работу, находит первопричины ошибок и чаще доводит длинные задачи до результата. При этом старые перегруженные Skills и системные промпты могут ему мешать. Команда Every получила заметно лучшие результаты, когда удалила прежнюю обвязку и собрала её заново.
На фоне релиза инженер Claude Code Тарик опубликовал новые правила контекст-инжиниринга. Для моделей поколения Claude 5 команда сократила системный промпт Claude Code более чем на 80% без измеримой потери качества:
CLAUDE.md и описаниях инструментовCLAUDE.md коротким: правила репозитория и только неочевидные особенностиДля перехода на Opus 5 стоит сначала удалить накопившиеся ограничения, затем возвращать только те правила, необходимость которых подтверждают реальные ошибки и проверки. Очень похоже и думаю применимо к GPT 5.6 Sol.
Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1👍1
OBLITERATUS: хирургия отказов для открытых LLM 🧠
Тулкит находит в весах модели направления, отвечающие за отказы, и удаляет их без дообучения. Инструмент работает с open-weight моделями вроде Llama, Qwen, Mistral и Gemma.
• 9 методов: от быстрого
• анализ слоев, attention heads и геометрии отказов
• сравнение методов и оригинальной модели с измененной
• проверка refusal rate, perplexity, KL divergence и связности ответов
• сохранение результата как обычной Hugging Face модели
У Hermes есть skill:
После этого можно попросить Hermes проверить GPU, подобрать модель и метод, запустить OBLITERATUS и оценить результат. Skill содержит полный сценарий работы, пресеты и проверки. Отдельно нужно установить зависимости.
Также есть на Hugging Face (скрин от туда).
Чат | Токены дёшево
Тулкит находит в весах модели направления, отвечающие за отказы, и удаляет их без дообучения. Инструмент работает с open-weight моделями вроде Llama, Qwen, Mistral и Gemma.
• 9 методов: от быстрого
basic до режимов для reasoning- и MoE-моделей • анализ слоев, attention heads и геометрии отказов
• сравнение методов и оригинальной модели с измененной
• проверка refusal rate, perplexity, KL divergence и связности ответов
• сохранение результата как обычной Hugging Face модели
У Hermes есть skill:
hermes skills install official/mlops/obliteratusПосле этого можно попросить Hermes проверить GPU, подобрать модель и метод, запустить OBLITERATUS и оценить результат. Skill содержит полный сценарий работы, пресеты и проверки. Отдельно нужно установить зависимости.
Также есть на Hugging Face (скрин от туда).
Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
❤6
Два свежих репозитория от русских разработчиков 🇷🇺
ru-marketplace-mcp 24⭐ подключает AI-агента к Wildberries, Ozon, Яндекс Маркету и Детскому миру. Внутри 22 MCP-инструмента для поиска товаров, цен, остатков, отзывов и реквизитов продавцов.
Доступ только для чтения, регистрация и API-ключи не нужны. Ozon при срабатывании антибота может потребовать ваш Chrome.
Claudexor 316⭐ - локальная панель управления для Claude Code, Codex, Cursor CLI и OpenCode. Она сохраняет общий контекст между агентами, запускает несколько решений с независимой проверкой, делегирует ограниченные подзадачи и следит за квотами нескольких подписок Claude и Codex.
Патчи, проверки и решения остаются локально. Есть CLI для macOS и Linux, а также отдельное macOS-приложение.
Первый репозиторий пригодится для покупок и анализа российских маркетплейсов. Второй - когда кодинг агентов уже несколько и им нужен общий управляемый процесс.
Чат | Токены дёшево
ru-marketplace-mcp 24
compare_prices опрашивает площадки параллельно и показывает, где дешевле.Доступ только для чтения, регистрация и API-ключи не нужны. Ozon при срабатывании антибота может потребовать ваш Chrome.
Claudexor 316
Патчи, проверки и решения остаются локально. Есть CLI для macOS и Linux, а также отдельное macOS-приложение.
Первый репозиторий пригодится для покупок и анализа российских маркетплейсов. Второй - когда кодинг агентов уже несколько и им нужен общий управляемый процесс.
Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥3💯2👎1
Media is too big
VIEW IN TELEGRAM
Moonshot AI открыла веса Kimi K3 и часть инфраструктуры для обучения AI-агентов 🔥
Веса Kimi K3 опубликованы на Hugging Face. Это MoE-модель на 2,8 трлн параметров, из которых при генерации активируются 104 млрд. Есть контекст на 1 млн токенов, понимание изображений и режимы рассуждения
Вместе с весами Moonshot открыла еще три проекта:
🔵 FlashKDA - CUDA-ядра для Kimi Delta Attention. На H20 они ускоряют обработку входного контекста в 1,72-2,22 раза;
🔵 MoonEP - библиотека, которая распределяет MoE-экспертов между GPU и не дает перегруженным узлам тормозить весь запуск;
🔵 AgentENV - система песочниц на Firecracker для массового обучения агентов. Среды можно быстро ставить на паузу, сохранять, возобновлять и разветвлять для параллельных экспериментов.
K3 уже появилась у Modal, Baseten, Fireworks AI, Nebius, DigitalOcean и Together AI. Самостоятельный запуск требует серьезного GPU-кластера, поэтому открытие весов сейчас особенно интересно исследователям и поставщикам инфраструктуры.
Чат | Токены дёшево
Веса Kimi K3 опубликованы на Hugging Face. Это MoE-модель на 2,8 трлн параметров, из которых при генерации активируются 104 млрд. Есть контекст на 1 млн токенов, понимание изображений и режимы рассуждения
low, high и max.Вместе с весами Moonshot открыла еще три проекта:
K3 уже появилась у Modal, Baseten, Fireworks AI, Nebius, DigitalOcean и Together AI. Самостоятельный запуск требует серьезного GPU-кластера, поэтому открытие весов сейчас особенно интересно исследователям и поставщикам инфраструктуры.
Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2🔥2
Media is too big
VIEW IN TELEGRAM
MagicPath - общий дизайн-холст для людей и AI-агентов 🎨
Codex, Claude Code и Cursor через MagicPath Skills могут создавать и редактировать интерактивные React-интерфейсы прямо из терминала или IDE. Человек правит результат визуально, несколько агентов работают на одном холсте, а готовый дизайн можно вернуть в код, показать по ссылке или экспортировать в Figma.
По тарифам:
🔵 Free - 20 AI-кредитов в день, до 120 в месяц; 125 вызовов внешних агентов в неделю; 5 импортов и 3 экспорта Figma в месяц.
🔵 Builder - $10 в месяц. Можно без ограничений работать с MagicPath через внешних AI-агентов, а также безлимитно экспортировать результаты в Figma. Лимит импорта остается 5 файлов в месяц.
Из интересного, это прикольно работает в мульти-агентом режиме в Codex Desktop. Для каждого агента можно выбирать свою модель и уровень мышления.
Чат | Токены дёшево
Codex, Claude Code и Cursor через MagicPath Skills могут создавать и редактировать интерактивные React-интерфейсы прямо из терминала или IDE. Человек правит результат визуально, несколько агентов работают на одном холсте, а готовый дизайн можно вернуть в код, показать по ссылке или экспортировать в Figma.
По тарифам:
Из интересного, это прикольно работает в мульти-агентом режиме в Codex Desktop. Для каждого агента можно выбирать свою модель и уровень мышления.
Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM