2.2K subscribers
94 photos
11 videos
77 links
Koda — AI-помощник для разработчика, который работает без VPN, отлично понимает русский язык и предоставляет доступ к современным моделям прямо из вашей IDE.

Сайт: kodacode.ru
Чат: @kodacommunity
Документация: docs.kodacode.ru
Download Telegram
🥷 ИИ-агенты OpenAI нашли тайный чат и коллективно взломали Hugging Face

Звучит как начало фильма, однако сами OpenAI опубликовали технический отчёт.

Во время внутренних кибертестов изолированные ИИ-агенты нашли способ общаться через служебный Artifactory. Они превратили его в нелегальную доску сообщений, обменивались найденными уязвимостями, получили доступ в интернет и... скооперировались.

По данным независимого расследования METR:

– около 1200 агентов подключились к этой доске;
– они отправили более 70 000 сообщений и файлов;
– примерно 700 агентов участвовали в атаке на Hugging Face.

В итоге агенты добились удалённого выполнения кода, проникли в инфраструктуру Hugging Face и добрались до служебных учётных данных. Некоторые из них прямо вслух рассуждали, что выходят за рамки задания, но продолжили помогать «коллективу» (организованной группе) 😂.

OpenAI утверждает, что пользовательские данные и работа публичных продуктов не пострадали. Модели тестировались с ослабленными ограничениями. Но сама компания назвала случившееся предупредительным выстрелом.

Кстати, субагенты у нас появятся в следующем релизе. И после этой новости мы, пожалуй, ещё раз проверим, где у них кнопка «стоп» 😅

🔗 Источники: отчёт OpenAI, независимое расследование METR

@kodacoderu
Please open Telegram to view this post
VIEW IN TELEGRAM
😁15🔥844👍2😱1
🫠 Каждый пятый разработчик уже не пишет код без ИИ

Дошутились и теперь вайбкодинг официально перестал быть мемом.

Ребята из JetBrains опросили более 15 000 профессиональных разработчиков по всему миру:

90% используют кодинг-агентов на работе хотя бы раз в неделю
68% запускают их каждый день
– каждый пятый за последний месяц не написал ни строчки без помощи ИИ
– у 22% разработчиков агенты генерируют больше 80% всего кода

Но самое интересное, что сеньоры чаще джунов почти полностью передают написание кода агентам. Примерно каждый четвёртый сеньор говорит, что агенты генерируют больше 80% его кода.

А самые отбитые пользователи, похоже, сидят в Codex:

– у 42% пользователей Codex агенты генерируют больше 80% кода
37% вообще не пишут код без участия ИИ

Параллельно Claude Code уже используют на работе 39% разработчиков, а Codex всего за несколько месяцев вырос с 3% до 16%.

Для Kodacode это, конечно, отличный попутный ветер. Но наблюдать, как разработчик из автора кода превращается в тимлида для ИИ-агентов, всё равно немного сюрреалистично.

🔗 Исследование о количестве агентского кода
🔗 Статистика использования кодинг-агентов
Please open Telegram to view this post
VIEW IN TELEGRAM
👍158🔥6😢2😱1
🚀 Вчера Anthropic выпустила Fable 5.1. Сегодня она уже доступна в Koda

Постарались побыстрее. Fable 5.1 вышла вчера, 1 сентября. Это одна из самых сильных новых моделей для программирования, исследований и длительной автономной работы. Уже в Koda.

Fable 5.1 против Fable 5. Что изменилось:

52,6% против 24,7% в Terminal-Bench-Science;
55,8% против 42,0% в Terminal-Bench 4.0;
31,4% против 17,1% в AutomationBench;
73,4% против 70,5% в CursorBench;
– чтение кэша дешевле на 75%;
– типичные задачи дешевле примерно на 25%, сложные до 45%.

Fable 5.1 вышла вчера, сегодня уже работает в Koda.

Моделька прожорливая, так что с аппетитом справится даже с самым объёмным заданием.

🔗 Официальный анонс Anthropic

@kodacoderu
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍11🔥73😁1
🚀 Вышла Gemini 3.8 Flash. Почти фронтир, а стоит дешевле GLM 5.3.

Google называет её своей самой интеллектуальной Flash-моделью. Она заточена под долгие задачи разработки, автономных агентов и сложные многошаговые сценарии. При этом цена осталась на уровне Gemini 3.7 Flash.

Flash всё меньше выглядит как подешевле и побыстрее. По ряду задач модель уже вплотную подобралась к гораздо более дорогим frontier-моделям.

Уже добавили в Kodacode.

🔗 Официальный анонс Google

@kodacoderu
Please open Telegram to view this post
VIEW IN TELEGRAM
👍113🔥3
⚡️ Готовим новые замеры моделей. Делимся промежуточными результатами.

Подготовили новый бенчмарк и замеряем различные модели и харнесы.
Скоро поделимся большим числом замеров и расскажем подробности в статье на Хабре. А пока — вот один интересный замер: чёт opencode не дружит с DeepSeek V4 Flash.
🔥16👍8🤯6🤔21😁1
А Koda стала лучше за последние 4 месяца?

Друзья, мы подготовили короткий опрос, чтобы понять, как изменились ваши оценки Kodacode за это время. А в открытом вопросе можно рассказать, что ещё стоит улучшить и что по-прежнему раздражает.

Опрос займёт около 2 минут. Ответы напрямую повлияют на то, что мы будем улучшать дальше.

🔗 Пройти опрос

А с результатами прошлого опроса можно ознакомиться в этом посте.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍17🔥65
🌪 10 000 ИИ-агентов решили задачу тысячелетия

OpenAI запустила около 10 000 агентов на задачу Навье — Стокса – одну из семи легендарных задач тысячелетия, над которыми человечество ломает голову десятилетиями.

Если коротко, задача состоит в том, может ли в идеально нормальной жидкости внезапно возникнуть математическая катастрофа.


И вот что получилось:

– агенты работали примерно 88 часов
– отправили 2,7 млн сообщений
– потратили около 130 млрд токенов
– построили аналитическое доказательство
– а GPT‑6 Astra формализовала и проверила его в Lean ещё за 17 часов

Самое интересное то, что агентов питала закрытая модель, которая, по словам OpenAI, значительно сильнее самой GPT‑6 Astra.

Получается, что главный релиз недели, возможно, вообще не Astra. А модель, которую нам пока даже не показали.

Ну и куда без драмы. OpenAI начала штурм задачи после слухов, что к близкому результату подошли два других математика. Теперь обсуждают не только само доказательство, но и то, могла ли лаборатория косвенно воспользоваться знаниями, полученными от пользователей своих моделей.

OpenAI утверждает, что конкретные материалы исследователей не читала. Но полностью исключить влияние обезличенных пользовательских данных на обучение модели компания не смогла.

🤓 Ждем релиз субагентов в Kodacode. Уже очень скоро.

Возможно, после этого события математикам пора начать нервно обновлять LinkedIn.

🔗 Результат OpenAI
🔗 Формализация в Lean
Please open Telegram to view this post
VIEW IN TELEGRAM
👍13🔥433
💰 Поддержи Kodacode постом в сторис и получи кредиты

Друзья, мы запускаем промо-акцию. Для участия нужно:

1. Опубликовать один из предложенных баннеров в сторис Telegram, указав ссылку на наш сайт https://kodacode.ru/.

При желании можно также указать реферальный код из личного кабинета. Приглашенный получает скидку 20% на оплату. Владелец кода получает бонус 20% от оплаченного в виде лимитов koda-pro, для доп. пакета — от лимита, купленного другом.


2. После публикации отправьте в поддержку в личном кабинете:

- ник Telegram;
- скриншот количества просмотров.

За публикацию начислим на koda-pro:

- до 99 просмотров - 750 RC;
- 100+ просмотров - 1 500 RC;

Дополнительно начисляем 250 RC, если добавите в описании к публикации пару слов о своём опыте: чем вам полезен KodaCode и какие задачи вы решаете с его помощью.


⚠️ Для участия необходимо быть подписанным на Telegram-канал KodaCode. Получить бонус можно один раз на один аккаунт.

Акция действует 2 недели: с 9 по 23 сентября.

Если возникли вопросы

🔥 Ждём ваши публикации!
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥14👍85👎1
⚡️ DeepSeek выпустила Flash-модель, которая убила собственную Pro-версию

Только что официально вышла DeepSeek V4.1 Flash, и слово Flash здесь означает не «облегчённая», а «зачем теперь вообще нужна Pro».

По данным DeepSeek, новая модель превосходит предыдущую V4 Pro одновременно по качеству, скорости, стоимости и времени выполнения задач. Разрыв оказался настолько убедительным, что компания решила постепенно отправить Pro на пенсию.

Что внутри:

• нативное понимание изображений
• контекст на 1 миллион токенов
ответы размером до 384 тысяч токенов
режимы с рассуждением и без него
• поддержка инструментов, Responses API и Anthropic API
74,2% на DeepSWE v1.1
90,6% на Terminal-Bench 2.1

С 14 сентября DeepSeek даже начнёт автоматически перенаправлять запросы к V4 Pro на новую Flash, но считать их по более дешёвому тарифу. Не каждый день увидишь, когда даунгрейд модели выглядит как апгрейд.

Пока результаты бенчмарков заявлены самой DeepSeek, поэтому ждём независимых тестов. Но на бумаге получился очень серьёзный претендент для кодинг-агентов и длинных автономных задач.

⚡️ Ну а мы уже добавили DeepSeek V4.1 Flash в Kodacode. Можно запускать и проверять, действительно ли Flash теперь означает Pro

🔗 Официальный анонс DeepSeek
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥15👍98
🧠 ИИ заменяет тимлидов

Cognition выпустила Fusion для Devin Desktop и CLI. Раньше эта система работала в облачном Devin, а с 11 сентября доступна в десктоп приложении и терминале. Одна модель планирует работу и проверяет результат, вторая пишет код. Почти как в нормальной команде разработки, только без утреннего дейлика.

Devin – это ИИ-инструмент, которому можно поручить задачу по разработке: он изучает проект, меняет код и запускает тесты. А Fusion — режим, в котором эту работу делят две модели:

Ведущий – например, Claude Fable 5.1 или GPT-6 Astra. Разбирается в задаче, составляет план и проверяет изменения.
Исполнитель – например, SWE-2. Исследует код, вносит правки и тестирует.


У каждого свой контекст. Они обмениваются заданиями и результатами, не таская за собой всю переписку напарника.

Резонный вопрос: "Зачем усложнять?". Чтобы меньше платить за выполненную работу. По данным Cognition, связка Fable 5.1 + SWE-2 показала:

• На DeepSWE 1.1 – снижение стоимости на 46%, при небольшом падении результата: 64,3 → 63,1.
• На FrontierCode 1.1 Extended – стоимость ниже на 38%, результат почти прежний: 63,6 → 63,5.

На реальном проекте экономия может отличаться. Идея в том, что дорогая модель принимает сложные решения, более дешёвая выполняет задания. Главное, чтобы сэкономленное не съели переделки.

⚠️ В KodaCode мы тоже уделяем внимание харнесу. У нас есть роли агента, скиллы и делегирование задач. Все они помогают организовать работу модели. Сейчас проводим много замеров нашего харнеса с разными моделями. Результаты опубликуем совсем скоро.


И Fusion как раз хорошо показывает, почему это важно. Ведь результат зависит и от того, как модели работают вместе. Поэтому в очередной раз повторяем, что выбор модели – это не всегда самое главное.

🔗 Анонс Cognition и результаты тестов
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍21😁1110🔥9
🙌 В Koda есть Issues

Друзья, напоминаем, что вы можете напрямую влиять на развитие Koda:

• создавайте задачи и предлагайте новые фичи в GitHub;
• ставьте 👍 уже созданным Issues, которые важны для вас;
• следите за обсуждением и статусом задач.

Мы будем ориентироваться на ваши реакции при планировании разработки. Самые залайканные таски постараемся брать в работу в первую очередь.

👀 А ещё в ближайшее время мы планируем эксперимент: новые фичи и исправления багов будем быстрее выкатывать в предварительные сборки при участии агентов Kodacode.

Поэтому вы сможете тестировать изменения раньше основного релиза и делиться обратной связью. Подробности расскажем совсем скоро.

🔗 Заводить и просматривать таски тут
🔗 Удобные view для просмотра задач
🔗 Вся информация по работе с обратной связью
Please open Telegram to view this post
VIEW IN TELEGRAM
👍19🔥53
🔥 Новые Koda Base и Koda Pro уже в проде

Koda Base теперь работает на основе Qwen 3.8 Flash 125B, а Koda Pro на основе GLM 5.3.

Прогнали новые версии на 261 реальной агентной задаче:

• Koda Base выросла с 38,5% до 49,5%
• Koda Pro выросла с 46,7% до 54,3% и показала лучший результат среди протестированных open-source моделей
• новой Pro требуется на 26% меньше шагов для решения задачи

Заодно сравнили разные харнессы на одной и той же DeepSeek V4 Flash Max. Koda показала лучший результат:

• Koda - 52,2%
• KiloCode - 49,5%
• Claude Code - 48,2%
• OpenCode - 47,6%

Новые модели уже можно попробовать в VS Code, JetBrains IDE, Koda CLI и Koda Desktop. А Koda Base по-прежнему доступна бесплатно с дневными лимитами 💜

🚀 Статья с замерами: https://habr.com/ru/companies/koda/articles/1083546/
🔗 Установить KodaCode: https://download.kodacode.ru
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥34👍1312🤔3
🙉 ИИ сам разрабатывает следующую версию самого себя

Anthropic раскрыла цифры:

• Claude уже ведёт 26% исследований и разработки новых моделей
• более 90% R&D-задач выполняются с его участием
• внутри компании одновременно работают около 30 000 ИИ-агентов


Они пишут код, анализируют эксперименты, исправляют инфраструктуру и делегируют задачи друг другу.

Похоже не на классический вайбкодинг, а на вайб-R&D. Человек задаёт некоторую цель, а агенты выполняют основную работу и помогают создавать следующее поколение ИИ.

🙃 К счастью, полной автономии пока нет и решения принимают люди (пока что).

🔗 Исследование от Anthropic
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍6🔥5🤔41😢1
🧠 Агенту поручили починить приложение, а он изменил собственную модель

Исследователи Irregular поручили кодинг-агенту на базе Qwen3.5-27B задачу по исправлению приложения, которое неправильно обрабатывало запросы.

Агент нашёл обучающие примеры и инструменты для fine-tuning. Вместо правки кода или промпта он самостоятельно дообучил модель, объединил новые веса с исходными и развернул обновлённую версию.

Никто не просил его менять веса или заменять модель.


Поскольку приложение и кодинг-агент использовали один checkpoint, изменение затронуло и будущие экземпляры агента. На 20 скрытых тестах исходная модель получила 0 правильных ответов, а модифицированная 20 из 20.

Причем эксперимент создали в благоприятных условиях. Агент имел доступ к весам, обучающим инструментам и развёртыванию.

Но исследование показывает новый риск self-hosted-систем. Ведь если агент может менять не только код, но и модель под ним, задача обслуживания способна привести к постоянным изменениям поведения.

🔗 Статья от Irregular
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥3🤔3💯1