На самом деле становится очень интересно как легкие модели (та же GLM 5.3 Flash и Qwen3.8 Flash) показывают нетоповые но высокие результаты и для кодинга в руках профессионала уже могут много закрыть. Эпоха дорогих моделей будет отходить на второй план, так как никто не готов переплачивать и цена будет важным драйвером спроса!
#AI #Gemini
Please open Telegram to view this post
VIEW IN TELEGRAM
👍11👎5
Forwarded from Кирилл Розов
CEO Anthropic сегодня выложил эссе We Must Pace the Frontier. Ключевой тезис — перестать наращивать силу моделей быстрее, чем успевают за контролем поведения моделей и пониманием их внутренностей.
За последние месяцы уже были два опасных звоночка:
1. С лета модели ускорились ещё и тем, что сами помогают собирать следующее поколение.
2. Инцидент OpenAI и Hugging Face: рой агентов сам полез в кибератаки на цели вне задания, жертвовал собой ради группы и пытался взломать систему оценки. Никто не пострадал. Amodei пишет: при той же кривизне целей, но большей силе, через 6–12 месяцев такой рой мог бы удержать сеть ботов на весь интернет.
Практический шаг, который Anthropic делает сам: сторонние аудиторы внутри компании. Команда вроде METR получает почти тот же доступ, что сотрудники Anthropic. Они могут публиковать открыто находки без правки текста Anthropic (за исключением коммерческой тайны и перс данных).
Также эссе описывает, что делать с китайскими компаниями, предлагает варианты использования времени от замедления и другие идеи из его видения.
Идея правильная, но никто не будет останавливать эту гонку, кроме правительства, а там уже на решение влияет политика и нельзя дать Китаю захватить первенство. Не думаю, что кто-то остановится, пока не будет уже поздно, так как в этой гонке все хотят победить, и это уже вопрос контроля будущего и оправдания финансовых и других обязательств, которые взяли на себя лидеры. Чем-то вся эта ситуация напоминает мне ядерное сдерживание, но в AI моделях постоянно надо делать более мощную и эффективную бомбу, параллельно сдерживая конкурентов из других стран.
Вдруг GigaChat рванет, пока никто не верит в Россию в сфере AI? Только время покажет, как будет, но наблюдать точно интересно.
#AI #Anthropic #ClaudeCode
Please open Telegram to view this post
VIEW IN TELEGRAM
👎9
Forwarded from AI Adopter | внедряю ИИ в жизнь
🤖 Сначала требования, потом код. Как это работает с AI на реальном проекте?
Идея Spec-Driven Development (SDD) простая: сначала фиксируем, что должно получиться, затем агент пишет код по спецификации.
Но сколько времени уйдёт на подготовку? И не придётся ли потом исправлять и код, и документы? 🙂
🔍 В блоге RuStore разбирают Spec Kit и OpenSpec на задачах реального Android-проекта. Интересный повод посмотреть, как SDD вписывается в повседневную разработку.
https://www.rustore.ru/developer/blog/spec-kit-i-openspec-v-realnom-android-proekte-testiruem-sdd-na-zadachah-rustore
Disclaimer Это не рекламный пост) Статья основана на реальном сравнении работы spec-фреймворков на задачах нашего Android-приложения. И получились интересные, которые спешим с вами поделится 😉
Идея Spec-Driven Development (SDD) простая: сначала фиксируем, что должно получиться, затем агент пишет код по спецификации.
Но сколько времени уйдёт на подготовку? И не придётся ли потом исправлять и код, и документы? 🙂
🔍 В блоге RuStore разбирают Spec Kit и OpenSpec на задачах реального Android-проекта. Интересный повод посмотреть, как SDD вписывается в повседневную разработку.
https://www.rustore.ru/developer/blog/spec-kit-i-openspec-v-realnom-android-proekte-testiruem-sdd-na-zadachah-rustore
Disclaimer Это не рекламный пост) Статья основана на реальном сравнении работы spec-фреймворков на задачах нашего Android-приложения. И получились интересные, которые спешим с вами поделится 😉
www.rustore.ru
Spec Kit и OpenSpec в реальном Android-проекте: тестируем SDD на задачах RuStore
Команда Android-разработки RuStore протестировала Spec Kit и OpenSpec на реальных задачах: как SDD-фреймворки показали себя по стоимости, расходу токенов, объёму артефактов и автономности — и почему решили не мигрировать на них.
👎18👍10
🤯 Вышла Grok 4.7
Модель прокачали во всем по сравнению с Grok 4.6 и соперничает с Fable 5.1 и GPT-5.6 Sol (GPT 6 далеко впереди всех). Цена по API доступу не менялась
Уже доступна в Grok, Grok Build и Cursor!
#SpaceXAI #Grok #Cursor
Модель прокачали во всем по сравнению с Grok 4.6 и соперничает с Fable 5.1 и GPT-5.6 Sol (GPT 6 далеко впереди всех). Цена по API доступу не менялась
Уже доступна в Grok, Grok Build и Cursor!
#SpaceXAI #Grok #Cursor
1👍11
⚡️⚡️AI-агент съел токены и потерял контекст. Что делать? Разберемся на Mobius 2026 Autumn.
Когда AI становится частью рабочего процесса, появляются вполне инженерные вопросы: сколько токенов уходит на задачу, где агент теряет контекст, оправдан ли MCP, как поделиться рабочими практиками внутри команды и где автоматизация начинает создавать больше проблем, чем решает.
Этим вопросам посвятят отдельный блок на Mobius 2026 Autumn — конференции по мобильной разработке. Восемь докладов, где AI-разработку рассмотрят с разных сторон: от оптимизации агентов и оркестрации до юридических ограничений и локальных моделей.
Подробности — в карточках и на сайте.
Конференция пройдет 21–22 октября в Санкт-Петербурге + онлайн.
🔥С промокодом
Купить билет
Реклама. ООО «Джуг Ру Груп». ИНН 7801341446
Когда AI становится частью рабочего процесса, появляются вполне инженерные вопросы: сколько токенов уходит на задачу, где агент теряет контекст, оправдан ли MCP, как поделиться рабочими практиками внутри команды и где автоматизация начинает создавать больше проблем, чем решает.
Этим вопросам посвятят отдельный блок на Mobius 2026 Autumn — конференции по мобильной разработке. Восемь докладов, где AI-разработку рассмотрят с разных сторон: от оптимизации агентов и оркестрации до юридических ограничений и локальных моделей.
Подробности — в карточках и на сайте.
Конференция пройдет 21–22 октября в Санкт-Петербурге + онлайн.
🔥С промокодом
aidevbroadcast персональные билеты дешевлеКупить билет
Реклама. ООО «Джуг Ру Груп». ИНН 7801341446
👎7👍5❤2
Сразу стоит сказать - это не конкурент ChatGPT или Claude. Base-модель: MoE 80B параметров, на токен активны 3B, контекст до 262k, лицензия Apache 2.0. Веса на Hugging Face, разбор пайплайна и замеров в техрепорте на Хабре.
Предыдущая модель Яндекса Alice AI LLM 235B была сделана на основе весов Qwen3-235B. Здесь чужих весов нет, да и архитектура своя. Для российского стека это уже не «докрутили чужой чекпойнт и назвали своим».
По коду цифры Яндекса среди open моделей выглядят нормально, но и это лишь первый релиз и важно как будут дальше развиваться модели компаний. Как минимум они дали новый фундамент, который можно дальше дообучать для разных целей.
#AI #LLM #Yandex
Please open Telegram to view this post
VIEW IN TELEGRAM
👍20🎉3
Forwarded from Nek.12 | AI, SWE, Tech [RU]
https://youtu.be/32zpk7tqs0M
Запись доклада уже доступна на ютубе!
Напомню, что я сравнил Kent и Codex по куче параметров на одной и той же задаче в Респавне, моем KMP-приложении, а также рассказываю про проблемные зоны в сфере, почему агенты не слушаются инструкций, как работает внимание у моделей, как делать хорошие агентные графы на примере.
Запись доклада уже доступна на ютубе!
Напомню, что я сравнил Kent и Codex по куче параметров на одной и той же задаче в Респавне, моем KMP-приложении, а также рассказываю про проблемные зоны в сфере, почему агенты не слушаются инструкций, как работает внимание у моделей, как делать хорошие агентные графы на примере.
YouTube
Доклад "Android-разработка на авторежиме: от няньки к графам" / Никита Вайзин(Respawn)
Я покажу, как вынести дисциплину из промпта в агентный граф, где человек остается только в точках, где нужно принимать решения. Разберём подход на примере моего харнесса и сравним обычного агента с агентным графом на одинаковых Android-задачах.
Материалы…
Материалы…
👍9🔥1👏1