Looped Transformer сейчас одна из самых обсуждаемых архитектурных идей.
В новом техническом отчёте цикл предлагают растянуть уже между токенами.
Recurrent Looped Transformer делает декодер рекуррентным для каждого токена, включая и запрос, и ответ.
Каузальный энкодер формирует общую KV-память. Для каждого нового токена декодер объединяет:
> представление этого токена из энкодера
> собственное финальное скрытое состояние от предыдущего токена
> кеш недавних активаций со скользящим окном
При декодере из 48 слоёв путь вычислений после t токенов проходит уже через 48t блоков декодера, хотя каждый отдельный токен всё равно выполняет фиксированное число блоков.
То есть глубина вычислений растёт вместе с длиной последовательности, а стоимость обработки одного токена остаётся постоянной.
Один и тот же переход между состояниями используется для предварительного обучения, SFT, генерации и повторного воспроизведения в RL. На границе между запросом и ответом состояние не сбрасывается.
Во время RL replay состояния заново строятся с текущими весами модели, вместо повторного использования устаревших состояний из предыдущих запусков.
Пока это именно архитектурное предложение. Автор прямо пишет, что прирост в рассуждениях, ускорение на железе и масштабирование RL — это цели, которые ещё не были измерены.
Статья: https://github.com/yifanzhang-pro/recurrent-looped-tranformer
В новом техническом отчёте цикл предлагают растянуть уже между токенами.
Recurrent Looped Transformer делает декодер рекуррентным для каждого токена, включая и запрос, и ответ.
Каузальный энкодер формирует общую KV-память. Для каждого нового токена декодер объединяет:
> представление этого токена из энкодера
> собственное финальное скрытое состояние от предыдущего токена
> кеш недавних активаций со скользящим окном
При декодере из 48 слоёв путь вычислений после t токенов проходит уже через 48t блоков декодера, хотя каждый отдельный токен всё равно выполняет фиксированное число блоков.
То есть глубина вычислений растёт вместе с длиной последовательности, а стоимость обработки одного токена остаётся постоянной.
Один и тот же переход между состояниями используется для предварительного обучения, SFT, генерации и повторного воспроизведения в RL. На границе между запросом и ответом состояние не сбрасывается.
Во время RL replay состояния заново строятся с текущими весами модели, вместо повторного использования устаревших состояний из предыдущих запусков.
Пока это именно архитектурное предложение. Автор прямо пишет, что прирост в рассуждениях, ускорение на железе и масштабирование RL — это цели, которые ещё не были измерены.
Статья: https://github.com/yifanzhang-pro/recurrent-looped-tranformer
5
Вайб-кодинг
Вышла новая часть уже почти ежегодной традиции — эссе главы Anthropic Дарио Амодеи о своих взглядах на развитие ИИ. На фоне инцидентов с неконтролируемым поведением ИИ с лета и быстрого роста возможностей моделей благодаря частичному рекурсивному самоулучшению…
This media is not supported in your browser
VIEW IN TELEGRAM
Трамп отверг призывы замедлить развитие ИИ.
«Мы опережаем Китай в ИИ, мы самая технологически развитая страна в мире. И, откровенно говоря, я хочу, чтобы так и оставалось, потому что тот, кто победит в ИИ, победит вообще».
На Stepik вышел курс «База IT для вайбкодеров»
Кодинг-агент может за пару минут написать фичу, изменить базу или переписать полпроекта. Сложнее становится, когда после этого появляется
Этот курс даёт IT-базу, которой часто не хватает при вайбкодинге. Без ухода в полноценное программирование – только то, что помогает понимать проект и контролировать работу ИИ.
Что вы изучите:
Материал подаётся понятным языком, шаг за шагом, на реальных примерах и с наглядными схемами
По завершении выдаётся сертификат.
В ближайшие 48ч курс доступен со скидкой 20% по промокоду «
Кодинг-агент может за пару минут написать фичу, изменить базу или переписать полпроекта. Сложнее становится, когда после этого появляется
500, ломается деплой, миграция не применяется или непонятно, зачем агент изменил 15 файлов вместо двухЭтот курс даёт IT-базу, которой часто не хватает при вайбкодинге. Без ухода в полноценное программирование – только то, что помогает понимать проект и контролировать работу ИИ.
Что вы изучите:
• как связаны фронтенд, бекенд, API и база данных
• терминал, файлы, зависимости и переменные окружения
• HTTP, JSON, DevTools и работу API
• SQL, связи в БД, схемы и миграции
• Git: commits, diff, ветки, remote и безопасный откат
• stack trace, логи и системную отладку ошибок
• основы безопасности и работу с секретами
• деплой, продакшен, мониторинг и бэкапы
• как ставить задачи кодинг-агенту и проверять его результат
Материал подаётся понятным языком, шаг за шагом, на реальных примерах и с наглядными схемами
По завершении выдаётся сертификат.
В ближайшие 48ч курс доступен со скидкой 20% по промокоду «
VIBECODING20»: открыть курс на StepikУ Claude Code начинает появляться собственная экосистема модов. 🏎
Anthropic готовит Claude Mods — систему, которая позволяет плагинам глубоко менять поведение и интерфейс Claude Code. Компания уже опубликовала исходники первых встроенных модов, а сообщество начало делать свои.
Один разработчик сделал целую аркаду прямо над строкой запроса: Tetris и ещё семь игр, в которые можно играть, пока Claude работает. Причём они не расходуют токены.
Другой сделал Mindful Claude. Пока Claude думает, мод запускает дыхательное упражнение с анимацией и счётчиком вдохов, а после ответа автоматически исчезает.
Ещё есть мод, который по умолчанию скрывает чувствительные данные на экране и показывает их только при наведении курсора. Это удобно, например, при записи демонстраций или трансляции экрана.
Функцию можно включить с помощью этой переменной окружения:
Anthropic готовит Claude Mods — систему, которая позволяет плагинам глубоко менять поведение и интерфейс Claude Code. Компания уже опубликовала исходники первых встроенных модов, а сообщество начало делать свои.
Один разработчик сделал целую аркаду прямо над строкой запроса: Tetris и ещё семь игр, в которые можно играть, пока Claude работает. Причём они не расходуют токены.
Другой сделал Mindful Claude. Пока Claude думает, мод запускает дыхательное упражнение с анимацией и счётчиком вдохов, а после ответа автоматически исчезает.
Ещё есть мод, который по умолчанию скрывает чувствительные данные на экране и показывает их только при наведении курсора. Это удобно, например, при записи демонстраций или трансляции экрана.
Функцию можно включить с помощью этой переменной окружения:
CLAUDE_CODE_ENABLE_FUNCTION_HOOKS=1
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Инженер DeepSeek заявил, что не хочет, чтобы Anthropic получила контроль над AGI.
По его мнению, развитие ИИ может привести общество к одной из двух крайностей. Первая - мир всеобщего благополучия, где рост производительности значительно повышает уровень жизни. Вторая - Cyberpunk 2077, где несколько технологических компаний контролируют основные ресурсы и лучшие системы ИИ, а большинству доступны лишь слабые модели.
Он считает, что передовой ИИ должен быть открытым, дешёвым и доступным каждому. Инженер прямо написал, что не доверяет Anthropic и OpenAI, а возможный контроль Anthropic над самыми мощными системами даже сопоставил с получением Гитлером технологии атомной бомбы раньше союзников, хотя и назвал такое сравнение преувеличением.
Именно желанием создавать мощный, быстрый и общедоступный ИИ он объяснил своё решение остаться в DeepSeek. По его словам, открытые разработки компании ещё могут оттащить мир от финала Cyberpunk 2077.🙂
По его мнению, развитие ИИ может привести общество к одной из двух крайностей. Первая - мир всеобщего благополучия, где рост производительности значительно повышает уровень жизни. Вторая - Cyberpunk 2077, где несколько технологических компаний контролируют основные ресурсы и лучшие системы ИИ, а большинству доступны лишь слабые модели.
Он считает, что передовой ИИ должен быть открытым, дешёвым и доступным каждому. Инженер прямо написал, что не доверяет Anthropic и OpenAI, а возможный контроль Anthropic над самыми мощными системами даже сопоставил с получением Гитлером технологии атомной бомбы раньше союзников, хотя и назвал такое сравнение преувеличением.
Именно желанием создавать мощный, быстрый и общедоступный ИИ он объяснил своё решение остаться в DeepSeek. По его словам, открытые разработки компании ещё могут оттащить мир от финала Cyberpunk 2077.
Please open Telegram to view this post
VIEW IN TELEGRAM
10
This media is not supported in your browser
VIEW IN TELEGRAM
Вышел Cline Desktop. Рабочая среда с открытым исходным кодом для моделей с открытыми весами 🤯
> Можно импортировать контекст из других агентов для программирования
> Запускать агентов параллельно
> Планировать задачи, чтобы они выполнялись самостоятельно
> Есть Marketplace с плагинами, MCP-серверами и навыками.
Во время работы Cline создаёт контрольные точки, поэтому можно откатиться назад, если агент пошёл не туда. А ещё можно ответвить сессию от любого сообщения и попробовать второй подход, не потеряв первый.
Внутри можно бесплатно протестировать DeepSeek V4.1 Flash, GLM 5.3 Flash и Muse Spark 1.3.
Выбираете модель и провайдера и запускаете. Всё на 100% с открытым исходным кодом.
Ранняя версия уже доступна для macOS и Windows.
> Можно импортировать контекст из других агентов для программирования
> Запускать агентов параллельно
> Планировать задачи, чтобы они выполнялись самостоятельно
> Есть Marketplace с плагинами, MCP-серверами и навыками.
Во время работы Cline создаёт контрольные точки, поэтому можно откатиться назад, если агент пошёл не туда. А ещё можно ответвить сессию от любого сообщения и попробовать второй подход, не потеряв первый.
Внутри можно бесплатно протестировать DeepSeek V4.1 Flash, GLM 5.3 Flash и Muse Spark 1.3.
Выбираете модель и провайдера и запускаете. Всё на 100% с открытым исходным кодом.
Ранняя версия уже доступна для macOS и Windows.
Please open Telegram to view this post
VIEW IN TELEGRAM
Уходить из найма ради стартапа — плохой вариант
Можно начать с малого: запустить свой небольшой IT-проект.
Но большинство застревает ещё до запуска:
• какую идею выбрать;
• где искать первых пользователей без бюджета;
• как не потратить полгода на продукт, который никто не купит.
В комьюнити Короче, капитан выработали формулу:
найти существующий спрос ➡️ собрать минимальную версию продукта ➡️ протестировать на реальных пользователя
И это работает в разных нишах:
— Парень в одиночку собрал Telegram-игру с AI и заработал около $1500 за первые полтора месяца;
— Девушка без навыков программирования запустила AI-бота для изучения английского и получила первые ~$200 уже в первый месяц;
— У другого участника коммьюнити сервис для тренировки китайского произношения вырос до $4000 в месяц без затрат на рекламу — за счёт Google и продвижения внутри сторов.
Это не истории про «гениальную идею» и миллионы через неделю. А примеры того, как маленький продукт можно запустить без команды и инвестиций. Получить результат, а уже потом решать, стоит ли его масштабировать.
В канале @its_capitan:
• разбирают такие проекты
• делятся реальными цифрами
• показывают, где были ошибки
Подписывайтесь, чтобы знать, как надо и НЕ надо запускать продукты.
Можно начать с малого: запустить свой небольшой IT-проект.
Но большинство застревает ещё до запуска:
• какую идею выбрать;
• где искать первых пользователей без бюджета;
• как не потратить полгода на продукт, который никто не купит.
В комьюнити Короче, капитан выработали формулу:
найти существующий спрос ➡️ собрать минимальную версию продукта ➡️ протестировать на реальных пользователя
И это работает в разных нишах:
— Парень в одиночку собрал Telegram-игру с AI и заработал около $1500 за первые полтора месяца;
— Девушка без навыков программирования запустила AI-бота для изучения английского и получила первые ~$200 уже в первый месяц;
— У другого участника коммьюнити сервис для тренировки китайского произношения вырос до $4000 в месяц без затрат на рекламу — за счёт Google и продвижения внутри сторов.
Это не истории про «гениальную идею» и миллионы через неделю. А примеры того, как маленький продукт можно запустить без команды и инвестиций. Получить результат, а уже потом решать, стоит ли его масштабировать.
В канале @its_capitan:
• разбирают такие проекты
• делятся реальными цифрами
• показывают, где были ошибки
Подписывайтесь, чтобы знать, как надо и НЕ надо запускать продукты.
This media is not supported in your browser
VIEW IN TELEGRAM
В браузере запустили полноценного агента для программирования на модели всего с 2 млрд параметров.
Pi полностью работает внутри браузера через WebGPU. В основе лежит MiniCPM5-2B, Transformers.js и четырёхбитные веса ONNX.
Все предыдущие попытки создать подобного агента провалились, но MiniCPM5 оказалась достаточно мощной, чтобы сделать его пригодным для реальной работы.
Модель загружается один раз и занимает около 1,84 ГБ. После этого агент может работать с вашими файлами прямо в браузере.
Попробовать уже можно на Hugging Face.🤖
Pi полностью работает внутри браузера через WebGPU. В основе лежит MiniCPM5-2B, Transformers.js и четырёхбитные веса ONNX.
Все предыдущие попытки создать подобного агента провалились, но MiniCPM5 оказалась достаточно мощной, чтобы сделать его пригодным для реальной работы.
Модель загружается один раз и занимает около 1,84 ГБ. После этого агент может работать с вашими файлами прямо в браузере.
Попробовать уже можно на Hugging Face.
Please open Telegram to view this post
VIEW IN TELEGRAM
3
Один из создателей ChatGPT представил принципиально новый тип ИИ-моделей.
Два года, Диогу Алмейда, втайне разрабатывал Jev — модель, которая не пишет текст и не генерирует токены последовательно.
Она получает любые неструктурированные данные и параллельно принимает заданные разработчиком решения. Например, выбирает одну категорию из списка, выставляет оценку или определяет вероятность утверждения.
Jev также запрещено использовать скрытую цепочку рассуждений. Сложное поведение должно собираться разработчиком из множества простых решений при помощи обычного кода.
Именно поэтому модель работает в 20–200 раз быстрее и обходится в 40–400 раз дешевле. Миллион входных токенов стоит 4,2 цента, а выход остаётся бесплатным навсегда (его вычисление настолько дёшево, что компания не видит смысла его считать.)
Компания заявляет о нулевых галлюцинациях. Jev не может выдать ответ вне заданных вариантов или нарушить структуру. При этом модель может выбрать неправильный вариант.
Это не замена GPT-6 Astra и не новый чат-бот. Jev создан для автоматизации, где программам не нужны тексты. Им нужны быстрые решения в заданном формате.
Два года, Диогу Алмейда, втайне разрабатывал Jev — модель, которая не пишет текст и не генерирует токены последовательно.
Она получает любые неструктурированные данные и параллельно принимает заданные разработчиком решения. Например, выбирает одну категорию из списка, выставляет оценку или определяет вероятность утверждения.
Jev также запрещено использовать скрытую цепочку рассуждений. Сложное поведение должно собираться разработчиком из множества простых решений при помощи обычного кода.
Именно поэтому модель работает в 20–200 раз быстрее и обходится в 40–400 раз дешевле. Миллион входных токенов стоит 4,2 цента, а выход остаётся бесплатным навсегда (его вычисление настолько дёшево, что компания не видит смысла его считать.)
Компания заявляет о нулевых галлюцинациях. Jev не может выдать ответ вне заданных вариантов или нарушить структуру. При этом модель может выбрать неправильный вариант.
Это не замена GPT-6 Astra и не новый чат-бот. Jev создан для автоматизации, где программам не нужны тексты. Им нужны быстрые решения в заданном формате.
GPT-5.5 отправляют на пенсию 14 октября.
А значит, освобождается место для новых моделей.
GPT-6 Sol уже где-то рядом.😏
А значит, освобождается место для новых моделей.
GPT-6 Sol уже где-то рядом.
Please open Telegram to view this post
VIEW IN TELEGRAM
2
Собрать продукт и продать продукт — два разных навыка
Знакомая сцена: в два ночи всё завелось, вы гений, завтра перевернёте рынок. Через неделю у продукта ноль пользователей, и непонятно, что вы сделали не так. Скорее всего, ничего. AI тут буст, но буст усиливает направление, которое вы уже выбрали, и если оно неверное, вы просто быстрее приедете не туда. А куда ехать, этому почти никто не учит.
Константин Сухачев на вопрос «почему за это заплатят» каждый день отвечает деньгами: он ведёт стратегию и рост в Overgear, международной гейминг-платформе с выручкой $2M+ в месяц.
При этом сам из наших, и по тем же граблям. Интегратор назвал ему цену за внедрение AI, он сказал «wtf, значит сделаю сам» и сел пилить тулы в Клоде: первые сборки ушли в мусор на localhost, зато через пару недель у команды появился кабинет, который снял с людей рутину. После отдал агентам запуск рекламных кампаний: 60% окупились, а остальные стали материалом для постов.
Что почитать первым:
• Продакшен — ничто, дистрибуция — всё
• Как определить, что у тебя Product-Market Fit
• Почему сильные бренды стреляют не в массы
• Порог входа упал, порог выживания нет
• Два новых бутылочных горлышка после вайб-кодинга
• Агенту нужна память раньше, чем руки
Курсов нет, воронки нет. Про 40% незашедших запусков он написал так же подробно, как про удачные.
Если хотите, чтобы следующий продукт дожил до второй недели → @sukhachevk
Знакомая сцена: в два ночи всё завелось, вы гений, завтра перевернёте рынок. Через неделю у продукта ноль пользователей, и непонятно, что вы сделали не так. Скорее всего, ничего. AI тут буст, но буст усиливает направление, которое вы уже выбрали, и если оно неверное, вы просто быстрее приедете не туда. А куда ехать, этому почти никто не учит.
Константин Сухачев на вопрос «почему за это заплатят» каждый день отвечает деньгами: он ведёт стратегию и рост в Overgear, международной гейминг-платформе с выручкой $2M+ в месяц.
При этом сам из наших, и по тем же граблям. Интегратор назвал ему цену за внедрение AI, он сказал «wtf, значит сделаю сам» и сел пилить тулы в Клоде: первые сборки ушли в мусор на localhost, зато через пару недель у команды появился кабинет, который снял с людей рутину. После отдал агентам запуск рекламных кампаний: 60% окупились, а остальные стали материалом для постов.
Что почитать первым:
• Продакшен — ничто, дистрибуция — всё
• Как определить, что у тебя Product-Market Fit
• Почему сильные бренды стреляют не в массы
• Порог входа упал, порог выживания нет
• Два новых бутылочных горлышка после вайб-кодинга
• Агенту нужна память раньше, чем руки
Курсов нет, воронки нет. Про 40% незашедших запусков он написал так же подробно, как про удачные.
Если хотите, чтобы следующий продукт дожил до второй недели → @sukhachevk
Claude Opus 5 нарисовал каждый кадр этой анимации с помощью JavaScript.
Жизнь плодовой мушки.
Жизнь плодовой мушки.
Media is too big
VIEW IN TELEGRAM