Итоговые результаты китайского бенчмарка SuperCLUE за 2025 год.
🥇 Лидеры: Claude-Opus-4.5, Gemini-3-Pro, GPT-5.2 и Gemini-3-Flash.
🥈 За ними идут: Doubao и DeepSeek-V3.2 делят первое место среди китайских моделей. GLM-4.7, ERNIE-5.0 и Kimi вошли в пятёрку лучших среди отечественных разработок.
🇨🇳Первые три места в рейтинге open-source моделей полностью заняты китайскими разработками (DeepSeek, GLM, Kimi).
Перевод названия колонок результатов:
• Организация
• Открытый/закрытый исходный код
• Общий балл
• Математическое рассуждение
• Контроль галлюцинаций
• Научное рассуждение
• Точное следование инструкциям
• Генерация кода
• Планирование задач агента
• Регион
• Способ использования
🇨🇳Первые три места в рейтинге open-source моделей полностью заняты китайскими разработками (DeepSeek, GLM, Kimi).
Перевод названия колонок результатов:
• Организация
• Открытый/закрытый исходный код
• Общий балл
• Математическое рассуждение
• Контроль галлюцинаций
• Научное рассуждение
• Точное следование инструкциям
• Генерация кода
• Планирование задач агента
• Регион
• Способ использования
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥3❤2✍1💯1
Front Ed x IT-ХОЗЯЕВА
Итоговые результаты китайского бенчмарка SuperCLUE за 2025 год. 🥇 Лидеры: Claude-Opus-4.5, Gemini-3-Pro, GPT-5.2 и Gemini-3-Flash. 🥈 За ними идут: Doubao и DeepSeek-V3.2 делят первое место среди китайских моделей. GLM-4.7, ERNIE-5.0 и Kimi вошли в пятёрку…
Claude безусловно топ-1 в плане кода, но ценник и упоры в лимиты сильно душат. Поэтому хочу сам активно попробовать такой подход: формировать план в MD-файле для задачи через Claude, а потом уже кодинг делегировать GLM.
Ценник и лимиты у GLM относительно Claude - видите сами на скрине.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2🔥2
Front Ed x IT-ХОЗЯЕВА
Надеюсь, связка Plan Mode на Opus 4.6 + кодинг через Sonnet снова станет актуальной для экономии токенов, пока полет нормальный, не тупит на примитивных задачах как это было последние 2 недели с Sonnet 4.5.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥2
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥3👍1
1) Что это такое?
Skills (навыки) - это готовые наборы инструкций и лучших практик, которые Claude читает перед тем, как выполнить задачу. Например, перед тем как сделать проект, Claude сначала заглядывает в нужную папку с инструкциями и только потом приступает к работе.
2) Где брать годноту?
Основная точка входа - SkillsMP. Это самый большой маркетплейс с тысячами готовых решений прямо с GitHub. Остальные маркетплейсы пока выглядят не так интересно. Главное смотрите на количество звёзд скилла: если их мало, читайте исходники, чтобы не нарваться на что-то плохое.
3) Что там есть крутого?
• Инструменты для разработчиков: бест практисы и готовые решения для разработки в разных сферах.
• Discovery Interview: мастхэв, который сам проводит с вами интервью, чтобы составить идеальное ТЗ для проекта.
• Дизайн и контент: создание 3D-анимации и работа с медиафайлами.
4) Как это запустить?
Всё ставится за пару кликов через одну команду в терминале глобально (npx) либо можно скачать zip-архив и распаковать его в свой проект. С архивом аккуратнее: если неправильно его распаковать и что-то переименовать, то LLM может потерять данный скилл и не выполнять его.
Итог: с правильными скиллами даже не самая топовая модель может выдать результат на 10 из 10, создав MVP за пару минут.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2🔥2
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🍌2❤1👍1
Please open Telegram to view this post
VIEW IN TELEGRAM
YouTube
Почему AI генерит мусор — и как заставить его писать нормальный код
Контекстная инженерия для AI-агентов: полный процесс разработки с Cursor, Claude Code, Copilot - от исследований до живого кода.
Свежие данные Carnegie Mellon, CodeRabbit и MIT показывают: AI-код содержит в 1.7 раза больше дефектов, в 8 раз больше проблем…
Свежие данные Carnegie Mellon, CodeRabbit и MIT показывают: AI-код содержит в 1.7 раза больше дефектов, в 8 раз больше проблем…
❤1👍1
Front Ed x IT-ХОЗЯЕВА
Сегодня закончили разработку MVP "Бункер", при этом параллельно на другом ноуте тоже прогонял небольшие таски. За 2 часа такой работы вышло всего 38% использованных лимитов.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2🐳1
Front Ed x IT-ХОЗЯЕВА
Claude Code - нереальный инструмент: реализация идей с минимумом рутины + обучение с интерактивными задачками, которые заменяют кучу курсов.
Недавно жаловался, что жалко тратить 100 баков т.к не упираюсь в лимиты. И вот чудо, спустя 2 часа активной сессии впервые дошёл до 82%. На подписку за 200 баков прогреваться не буду, надо оптимизировать процессы и личное время.
P.S. Расстраивает, что расширение для VSC стало багоным - пришлось пересесть обратно на CLI. Жду как фиксанут все.
P.S. 2. Тупо я на подписке за 20 бачей
https://www.instagram.com/reel/DU5PpK0jCOt/?igsh=MTkwZzZmc2Q1NXdiZA==
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2
Front Ed x IT-ХОЗЯЕВА
P.S. Расстраивает, что расширение для VSC стало багоным - пришлось пересесть обратно на CLI. Жду как фиксанут все.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3
В длинной сессии часто нужно быстро уточнить что-то, не теряя контекст, не засоряя историю и не прерывая выполнение основной задачи.
Команда
/btw решает именно это: пишешь /btw стоит ли поменять цвет кнопки?, далее Claude создаёт временного агента, который видит весь текущий контекст, отвечает и исчезает без следа в истории. https://code.claude.com/docs/en/interactive-mode#side-questions-with-/btw
Please open Telegram to view this post
VIEW IN TELEGRAM
Claude Code Docs
Interactive mode - Claude Code Docs
Complete reference for keyboard shortcuts, input modes, and interactive features in Claude Code sessions.
🐳2
https://t.me/strdub/1563
Please open Telegram to view this post
VIEW IN TELEGRAM
Telegram
Стародубцев x IT-ХОЗЯЕВА
🧠 Claude Code: 14 полезных штук, которые реально экономят время
Собрал самое полезное из своих двух докладов по Claude Code. Кстати если хотите посмотреть первую часть, то вот. Держите ссылочку.
━━━━━━━━━━━━━━━━━━
1️⃣ YOLO-режим
claude --dangerously…
Собрал самое полезное из своих двух докладов по Claude Code. Кстати если хотите посмотреть первую часть, то вот. Держите ссылочку.
━━━━━━━━━━━━━━━━━━
1️⃣ YOLO-режим
claude --dangerously…
❤🔥2👍1
На данный момент эта модель обходит Opus в 5 раз по бенчмаркам. При этом ценник за подписку не изменился.
Ссылка:
Please open Telegram to view this post
VIEW IN TELEGRAM
🗿4🔥2😁2
P.S. Для тех, кто в танке, в Claude Code добавили питомцев, выпадает рандомно, команда /buddy
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1😁1
Front Ed x IT-ХОЗЯЕВА
Что не день, то React Server Components уязвимость, уже надоело эти пакеты обновлять. 👩💻 👩💻 👩💻 - топ. https://vercel.com/changelog/summary-of-cve-2026-23864
https://vercel.com/changelog/summary-of-cve-2026-23869
Please open Telegram to view this post
VIEW IN TELEGRAM
Vercel
Summary of CVE-2026-23869 - Vercel
Vercel has issued mitigations for a high-severity vulnerability in React Server Components can lead to Denial of Service
Ловлю себя на том, что вместо своих проектов гоняю одни и те же задачки в Codex и Claude, хотя оба справляются. Или залипаю в ленте: новая моделька - посмотрел, новый инструмент - потыкал. А ведь большинство из этого умрёт или мутирует до неузнаваемости за пару месяцев. Какой смысл тратить время на ресерч того, что скоро будет неактуально.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1👍1