Forwarded from Intermission
рассуждения у моделей появились как интерфейсная фича примерно в эпоху o1 и быстро стали любимыми
причина понятная: когда модель показывает ход мысли, кажется, что ты видишь не просто ответ, а процесс. можно понять, где она ошиблась, почему выбрала такой путь, насколько ей можно доверять. для сложных задач это выглядело как маленькое окно внутрь модели
но, кажется, эта эпоха была очень короткой
новое исследование anthropic показывает, что chain-of-thought нельзя воспринимать как честный audit log. модель может что-то “понимать” внутри, но не проговаривать это в reasoning trace. то есть красивое объяснение в интерфейсе не обязательно совпадает с тем, как модель реально пришла к ответу
и это сильно меняет продуктовый смысл рассуждений
в текущем виде они уже не так полезны. вместо “покажи ход мысли” важнее становятся проверяемые вещи: источники, tool calls, артефакты, тесты, история действий агента
reasoning был красивым переходным интерфейсом. но если мы строим не демки, а рабочие системы, то доверие нужно переносить с текста “как я думал” на проверяемые следы “что я сделал”
причина понятная: когда модель показывает ход мысли, кажется, что ты видишь не просто ответ, а процесс. можно понять, где она ошиблась, почему выбрала такой путь, насколько ей можно доверять. для сложных задач это выглядело как маленькое окно внутрь модели
но, кажется, эта эпоха была очень короткой
новое исследование anthropic показывает, что chain-of-thought нельзя воспринимать как честный audit log. модель может что-то “понимать” внутри, но не проговаривать это в reasoning trace. то есть красивое объяснение в интерфейсе не обязательно совпадает с тем, как модель реально пришла к ответу
и это сильно меняет продуктовый смысл рассуждений
в текущем виде они уже не так полезны. вместо “покажи ход мысли” важнее становятся проверяемые вещи: источники, tool calls, артефакты, тесты, история действий агента
reasoning был красивым переходным интерфейсом. но если мы строим не демки, а рабочие системы, то доверие нужно переносить с текста “как я думал” на проверяемые следы “что я сделал”
👍3
Пупырка AI
главные события недели · 26 апреля – 3 мая Модели • mistral medium 3.5: open-source 128B, превосходит claude sonnet 4.5 по бенчмаркам — Mistral Blog • xai grok 4.3 со скидками на api и новым режимом imagine — xAI • маск признал: xai дистиллировал grok из…
главные события недели · 4–10 мая 2026
Модели
• gpt-5.5 instant стал моделью chatgpt по умолчанию: меньше галлюцинаций, лучше работа с изображениями и видимость memory sources как новый паттерн доверия в персонализированных ai-продуктах — пост в канале
• openai выпустил новые realtime voice-модели для api: голосовые интерфейсы становятся быстрее, дешевле и ближе к production-сценариям поддержки, обучения и ассистентов — openai
Агенты и инструменты
• codex переупаковывают из coding tool в агента для knowledge work: документы, таблицы, презентации, браузинг, memory и интеграции с microsoft, google и salesforce — пост в канале
• claude managed agents получили dreaming, outcomes и multiagent orchestration: агент начинает улучшать память между задачами и работать по проверяемым критериям качества — пост в канале
• microsoft показал copilot cowork: облачный агент, который можно запускать с телефона, продолжать в фоне и расширять скиллами под повторяющиеся рабочие процессы — пост в канале
• github copilot coding agent получил secrets, а copilot code review — типы замечаний в usage metrics api; ai-разработка становится управляемым процессом с метриками и доступами — github changelog
Инфраструктура и разработка
• lazyweb открыл 250k реальных экранов приложений для ai-агентов через mcp, чтобы генерация интерфейсов опиралась на живые паттерны, а не фантазию модели — пост в канале
• deepmind alphaevolve показал, что gemini-powered coding agents уже оптимизируют алгоритмы для датацентров и чипов google, а не только пишут прикладной код — deepmind
• anthropic удвоил лимиты claude code через compute-сделку со spacex/xai: качество ai-инструментов всё сильнее зависит от доступа к gpu и инфраструктурных партнёрств — пост в канале
Бизнес и рынок
• openai начал разворачивать self-serve ads manager для chatgpt: cpc-ставки, аналитика и intent-based advertising прямо внутри диалога — пост в канале
• cloudflare заявил, что ai сделал 1100 вакансий ненужными даже на фоне рекордной выручки: рынок труда получает первый жёсткий сигнал про замещение планируемого найма — techcrunch
UX и доверие
• важный сдвиг в ux reasoning: chain-of-thought больше нельзя считать audit log, доверие надо переносить на источники, tool calls, артефакты, тесты и историю действий агента — пост в канале
Модели
• gpt-5.5 instant стал моделью chatgpt по умолчанию: меньше галлюцинаций, лучше работа с изображениями и видимость memory sources как новый паттерн доверия в персонализированных ai-продуктах — пост в канале
• openai выпустил новые realtime voice-модели для api: голосовые интерфейсы становятся быстрее, дешевле и ближе к production-сценариям поддержки, обучения и ассистентов — openai
Агенты и инструменты
• codex переупаковывают из coding tool в агента для knowledge work: документы, таблицы, презентации, браузинг, memory и интеграции с microsoft, google и salesforce — пост в канале
• claude managed agents получили dreaming, outcomes и multiagent orchestration: агент начинает улучшать память между задачами и работать по проверяемым критериям качества — пост в канале
• microsoft показал copilot cowork: облачный агент, который можно запускать с телефона, продолжать в фоне и расширять скиллами под повторяющиеся рабочие процессы — пост в канале
• github copilot coding agent получил secrets, а copilot code review — типы замечаний в usage metrics api; ai-разработка становится управляемым процессом с метриками и доступами — github changelog
Инфраструктура и разработка
• lazyweb открыл 250k реальных экранов приложений для ai-агентов через mcp, чтобы генерация интерфейсов опиралась на живые паттерны, а не фантазию модели — пост в канале
• deepmind alphaevolve показал, что gemini-powered coding agents уже оптимизируют алгоритмы для датацентров и чипов google, а не только пишут прикладной код — deepmind
• anthropic удвоил лимиты claude code через compute-сделку со spacex/xai: качество ai-инструментов всё сильнее зависит от доступа к gpu и инфраструктурных партнёрств — пост в канале
Бизнес и рынок
• openai начал разворачивать self-serve ads manager для chatgpt: cpc-ставки, аналитика и intent-based advertising прямо внутри диалога — пост в канале
• cloudflare заявил, что ai сделал 1100 вакансий ненужными даже на фоне рекордной выручки: рынок труда получает первый жёсткий сигнал про замещение планируемого найма — techcrunch
UX и доверие
• важный сдвиг в ux reasoning: chain-of-thought больше нельзя считать audit log, доверие надо переносить на источники, tool calls, артефакты, тесты и историю действий агента — пост в канале
👍2 1
html is the new markdown
llm-output перестаёт быть только текстом. всё чаще результатом работы будет disposable software artifact — одноразовый мини-интерфейс, сделанный под конкретный вопрос, задачу или исследование
thariq shihipar из команды claude code написал хороший разбор про то, почему он почти перестал просить у моделей markdown и всё чаще просит самодостаточный html-файл — статья
его главный тезис — markdown был хорошим дефолтом, пока llm-ответы были в основном текстом. но если модель уже умеет писать код, держать структуру, собирать интерфейсы и пользоваться локальным браузером, то странно ограничивать её форматом, который специально придуман быть максимально простым.
thariq также собрал галерею из 20 примеров таких html-артефактов — от annotated diff до incident timeline и интерактивных планов — примеры
после этого карпати добавил важную рамку. он пишет, что это действительно хорошо работает — в конце запроса можно просто попросить llm “structure your response as HTML”, сохранить файл и открыть его в браузере — пост Карпати
но интереснее не сам лайфхак, а его прогрессия форматов:
текст → markdown → html → приложения
сначала модели отвечали обычным текстом. потом markdown стал дефолтом, потому что он даёт структуру почти бесплатно: заголовки, списки, таблицы, код. теперь, когда модели лучше пишут frontend-код, html становится следующим естественным уровнем: это уже не просто структурированный текст, а визуальный и интерактивный документ
следующий шаг — полноценные маленькие приложения, которые агент генерирует под конкретную задачу. вместо «вот анализ», будет «вот интерфейс, где можно этот анализ исследовать»
llm-output перестаёт быть только текстом. всё чаще результатом работы будет disposable software artifact — одноразовый мини-интерфейс, сделанный под конкретный вопрос, задачу или исследование
thariq shihipar из команды claude code написал хороший разбор про то, почему он почти перестал просить у моделей markdown и всё чаще просит самодостаточный html-файл — статья
его главный тезис — markdown был хорошим дефолтом, пока llm-ответы были в основном текстом. но если модель уже умеет писать код, держать структуру, собирать интерфейсы и пользоваться локальным браузером, то странно ограничивать её форматом, который специально придуман быть максимально простым.
что даёт html:
• вместо линейной простыни текста можно получить навигацию, секции, таблицы, диаграммы, annotated diffs, timeline, collapsible-блоки и маленькие интерактивные инструменты
• ответ становится не «сообщением», а артефактом: его можно открыть локально, отправить коллеге, использовать как dashboard, план, ревью или объяснялку
• html хорошо подходит для результатов работы агента: implementation plan, incident report, архитектурная карта, pr-review, анализ логов, prompt tuner, slide deck
• браузер уже есть у всех, сборка не нужна, hosting не нужен, dependency hell тоже не нужен
• модель может делать интерфейс под конкретную задачу, а не запихивать всё в универсальный markdown-шаблон
thariq также собрал галерею из 20 примеров таких html-артефактов — от annotated diff до incident timeline и интерактивных планов — примеры
после этого карпати добавил важную рамку. он пишет, что это действительно хорошо работает — в конце запроса можно просто попросить llm “structure your response as HTML”, сохранить файл и открыть его в браузере — пост Карпати
но интереснее не сам лайфхак, а его прогрессия форматов:
текст → markdown → html → приложения
сначала модели отвечали обычным текстом. потом markdown стал дефолтом, потому что он даёт структуру почти бесплатно: заголовки, списки, таблицы, код. теперь, когда модели лучше пишут frontend-код, html становится следующим естественным уровнем: это уже не просто структурированный текст, а визуальный и интерактивный документ
следующий шаг — полноценные маленькие приложения, которые агент генерирует под конкретную задачу. вместо «вот анализ», будет «вот интерфейс, где можно этот анализ исследовать»
👍9
dessn поднял $6 млн на дизайн прямо в production-коде
dessn делает ai-инструмент для продуктовых команд, который запускает существующий код в облаке и позволяет дизайнерам итеративно менять интерфейс без локальной настройки проекта. в отличие от lovable/v0-подхода для идей с нуля, dessn целится в команды с живым продуктом, где важно сохранить fidelity к реальному codebase и проще передавать изменения разработчикам.
для нас это: дизайн-инструменты смещаются ближе к production-среде. меньше «макетов отдельно от системы» и больше работы с настоящими состояниями, компонентами, данными и ограничениями продукта
techcrunch
dessn делает ai-инструмент для продуктовых команд, который запускает существующий код в облаке и позволяет дизайнерам итеративно менять интерфейс без локальной настройки проекта. в отличие от lovable/v0-подхода для идей с нуля, dessn целится в команды с живым продуктом, где важно сохранить fidelity к реальному codebase и проще передавать изменения разработчикам.
для нас это: дизайн-инструменты смещаются ближе к production-среде. меньше «макетов отдельно от системы» и больше работы с настоящими состояниями, компонентами, данными и ограничениями продукта
techcrunch
TechCrunch
Dessn raises $6M for its production-focused design tool | TechCrunch
A new startup called Dessn has raised $6 million to build AI-powered design tools that work directly with production codebases.
👍2
Google делает mcp для android-приложений
Google показал AppFunctions — новый механизм, через который android-приложения смогут отдавать свои функции ai-агентам как инструменты — Android Developers
идея простая: приложение заранее объявляет действия вроде “отправить сообщение”, “создать заметку”, “добавить событие в календарь” или “обновить список покупок”, а Gemini или другой авторизованный агент сможет вызвать их напрямую.
это важно, потому что это не screen scraping и не кликание по интерфейсу через accessibility. google делает нормальный системный контракт между приложениями и агентами.
по сути, android-приложения начинают превращаться из экранов в callable tools. раньше пользователь сам открывал пять приложений подряд. теперь агент сможет собрать workflow сам: понять намерение, найти нужные функции и выполнить задачу между приложениями.
пока AppFunctions в preview и завязан на Android 16+, но направление очень понятное: мобильная ОС готовится к миру, где главный интерфейс — не иконка приложения, а намерение пользователя.
Google показал AppFunctions — новый механизм, через который android-приложения смогут отдавать свои функции ai-агентам как инструменты — Android Developers
идея простая: приложение заранее объявляет действия вроде “отправить сообщение”, “создать заметку”, “добавить событие в календарь” или “обновить список покупок”, а Gemini или другой авторизованный агент сможет вызвать их напрямую.
это важно, потому что это не screen scraping и не кликание по интерфейсу через accessibility. google делает нормальный системный контракт между приложениями и агентами.
по сути, android-приложения начинают превращаться из экранов в callable tools. раньше пользователь сам открывал пять приложений подряд. теперь агент сможет собрать workflow сам: понять намерение, найти нужные функции и выполнить задачу между приложениями.
пока AppFunctions в preview и завязан на Android 16+, но направление очень понятное: мобильная ОС готовится к миру, где главный интерфейс — не иконка приложения, а намерение пользователя.
👍3
This media is not supported in your browser
VIEW IN TELEGRAM
Android становится Agentic os
Google показал Gemini Intelligence — новую ai-прослойку для Android, Chrome, Android Auto, Wear OS и будущих Googlebook-ноутбуков — Android
Google начинает делать ai системным уровнем android — модель видит контекст устройства, понимает, что происходит в приложениях, и помогает выполнять задачи между ними
что показали:
• multi-step tasks across apps: Gemini сможет брать информацию из одного приложения и использовать её в другом — например, распознать событие с флаера, добавить его в календарь и отправить детали в чат
• Gemini in Chrome получает browser-use сценарии: резюмирование страниц, ответы по содержимому сайта и помощь с задачами вроде заполнения форм или бронирования
• Android Auto тоже получает Gemini: можно будет говорить более естественно, просить составить сообщение, найти место по контексту или продолжить задачу с телефона
• на Wear OS Gemini заменяет старого Assistant и становится более контекстным помощником на часах
Gemini перестаёт быть отдельным чатиком. он становится слоем поверх ОС, браузера, машины и носимых устройств.
если AppFunctions — это техническая база для “android apps as tools”, то Gemini Intelligence — пользовательский слой поверх этого. Android постепенно превращается в систему, где пользователь формулирует намерение, а агент сам собирает workflow из приложений и контекста.
Google показал Gemini Intelligence — новую ai-прослойку для Android, Chrome, Android Auto, Wear OS и будущих Googlebook-ноутбуков — Android
Google начинает делать ai системным уровнем android — модель видит контекст устройства, понимает, что происходит в приложениях, и помогает выполнять задачи между ними
что показали:
• multi-step tasks across apps: Gemini сможет брать информацию из одного приложения и использовать её в другом — например, распознать событие с флаера, добавить его в календарь и отправить детали в чат
• Gemini in Chrome получает browser-use сценарии: резюмирование страниц, ответы по содержимому сайта и помощь с задачами вроде заполнения форм или бронирования
• Android Auto тоже получает Gemini: можно будет говорить более естественно, просить составить сообщение, найти место по контексту или продолжить задачу с телефона
• на Wear OS Gemini заменяет старого Assistant и становится более контекстным помощником на часах
Gemini перестаёт быть отдельным чатиком. он становится слоем поверх ОС, браузера, машины и носимых устройств.
если AppFunctions — это техническая база для “android apps as tools”, то Gemini Intelligence — пользовательский слой поверх этого. Android постепенно превращается в систему, где пользователь формулирует намерение, а агент сам собирает workflow из приложений и контекста.
❤1👍1🌚1
интерфейсно дизайнеров Google заставили сделать ответ на glass. судя по видео получилось спорно.
хотя появился свой ход с блюрами и он звучит инетерсно, всякие обводки приехали явно от вдохновения iOS
зато они придумали своё светящееся яблочко для ноутбуков
видео с главными анонсами за минуту — https://youtu.be/tOWuuIF7go0?si=HzBtghQdu_lEEipG
хотя появился свой ход с блюрами и он звучит инетерсно, всякие обводки приехали явно от вдохновения iOS
зато они придумали своё светящееся яблочко для ноутбуков
видео с главными анонсами за минуту — https://youtu.be/tOWuuIF7go0?si=HzBtghQdu_lEEipG
🎉1
Googlebook и vibe-coded widgets
ещё на ивенте показали Googlebook — это chromebook neo. и виджеты, которые можно генерировать по описанию — TechCrunch
Googlebook — новая категория ноутбуков на базе Android PC. Идея в том, что Gemini будет встроен в систему с самого начала: искать по файлам и приложениям, помогать с рабочими задачами, продолжать сценарии с телефона и управлять действиями через Magic Pointer
вторая штука — Create My Widget. пользователь описывает, какой виджет ему нужен, а Gemini собирает его сам: например, «виджет с рецептами по продуктам дома», «travel-план на выходные» и тп
это маленький, но важный сдвиг: теперь пользователь может сгенерировать микро-интерфейс под конкретную задачу. какое-то время назад у nothing были даже более смелые идеи, гугл пошел осторожнее
итого — приложения дают агенту функции, Gemini собирает из них workflow, а пользователь получает не универсальный экран приложения, а интерфейс под текущий intent. а ведь ещё утром обсуждали, что генерация текстов это начало
ещё на ивенте показали Googlebook — это chromebook neo. и виджеты, которые можно генерировать по описанию — TechCrunch
Googlebook — новая категория ноутбуков на базе Android PC. Идея в том, что Gemini будет встроен в систему с самого начала: искать по файлам и приложениям, помогать с рабочими задачами, продолжать сценарии с телефона и управлять действиями через Magic Pointer
вторая штука — Create My Widget. пользователь описывает, какой виджет ему нужен, а Gemini собирает его сам: например, «виджет с рецептами по продуктам дома», «travel-план на выходные» и тп
это маленький, но важный сдвиг: теперь пользователь может сгенерировать микро-интерфейс под конкретную задачу. какое-то время назад у nothing были даже более смелые идеи, гугл пошел осторожнее
итого — приложения дают агенту функции, Gemini собирает из них workflow, а пользователь получает не универсальный экран приложения, а интерфейс под текущий intent. а ведь ещё утром обсуждали, что генерация текстов это начало
👍5
Media is too big
VIEW IN TELEGRAM
ai pointer — как google перепридумывают курсор 🖥
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥6
Media is too big
VIEW IN TELEGRAM
codex remote
если вы уже хотели отойти от ноутбука, то тут нам апдейт
openai добавили preview codex в мобильное приложение chatgpt. можно стартовать новую задачу, смотреть что агент сделал, читать диффы/логи/скриншоты, давать правки и подтверждать команды прямо с телефона
сам codex продолжает работать не на айфоне, а на хосте (ноутбуке, mac mini или devbox)
openai docs
если вы уже хотели отойти от ноутбука, то тут нам апдейт
openai добавили preview codex в мобильное приложение chatgpt. можно стартовать новую задачу, смотреть что агент сделал, читать диффы/логи/скриншоты, давать правки и подтверждать команды прямо с телефона
сам codex продолжает работать не на айфоне, а на хосте (ноутбуке, mac mini или devbox)
openai docs
🔥5👌1🌚1
plaud запустили dev platform для разработчиков
plaud — это маленький ai-диктофон, который записывает разговоры и превращает их в транскрипты, саммари и заметки
теперь они запустили dev platform для разработчиков. plaud-девайсы можно встраивать в свои продукты — подключать к приложению, забирать аудио, получать расшифровки со спикерами и строить поверх этого свои воркфлоу
сценарии понятные — продажи, медицина, real estate… — всё, где важная инфа появляется не в интерфейсе, а в живом разговоре
интересна тут не транскрибация сама по себе, а контекст для агентов. если у продукта есть доступ к реальным разговорам пользователя, агент может работать не только с тем, что человек руками занёс в crm, а с первоисточником
plaud dev
plaud — это маленький ai-диктофон, который записывает разговоры и превращает их в транскрипты, саммари и заметки
теперь они запустили dev platform для разработчиков. plaud-девайсы можно встраивать в свои продукты — подключать к приложению, забирать аудио, получать расшифровки со спикерами и строить поверх этого свои воркфлоу
сценарии понятные — продажи, медицина, real estate… — всё, где важная инфа появляется не в интерфейсе, а в живом разговоре
интересна тут не транскрибация сама по себе, а контекст для агентов. если у продукта есть доступ к реальным разговорам пользователя, агент может работать не только с тем, что человек руками занёс в crm, а с первоисточником
plaud dev
❤3🤔2
пара приколов обсудить вам вечером в баре
про стоимость идей в мире с ai, когда твою идею повторят уже через час
про искусство и ai
и про робота на заводе
про стоимость идей в мире с ai, когда твою идею повторят уже через час
про искусство и ai
и про робота на заводе
Forwarded from AI Secrets
Media is too big
VIEW IN TELEGRAM
Через несколько часов после анонса Google DeepMind AI Pointer разработчик Milind S выпустил open-source клон для macOS под названием tiptour
Приложение захватывает экран, определяет, на какое окно или приложение направлено внимание пользователя, и принимает команды в свободной форме: можно нарисовать что-то на экране и попросить ИИ это изменить, или просто сказать что сделать. Агент умеет кликать, печатать, редактировать интерфейсы, навигироваться между приложениями и выполнять код
Сделано на основе trycua, open-source фреймворка для computer-use агентов. Работает на macOS, требует Gemini API ключ. Скачать можно как готовый DMG без сборки через Xcode
GitHub: https://github.com/milind-soni/tiptour-macos
DMG: https://tiptour.io/
Приложение захватывает экран, определяет, на какое окно или приложение направлено внимание пользователя, и принимает команды в свободной форме: можно нарисовать что-то на экране и попросить ИИ это изменить, или просто сказать что сделать. Агент умеет кликать, печатать, редактировать интерфейсы, навигироваться между приложениями и выполнять код
Сделано на основе trycua, open-source фреймворка для computer-use агентов. Работает на macOS, требует Gemini API ключ. Скачать можно как готовый DMG без сборки через Xcode
GitHub: https://github.com/milind-soni/tiptour-macos
DMG: https://tiptour.io/
🔥4
Forwarded from GPT/ChatGPT/AI Central Александра Горного
Блогер запостил в X картинку, написал, что сгенерировал её в стиле Моне и попросил людей рассказать, почему она хуже настоящего Моне.
В тред пришли сотни «искусствоведов». Картину назвали бездушной AI-поделкой, ругали глубину, композицию и нашли ещё кучу проблем.
Нюанс в том, что это не AI-генерация, а настоящая картина Моне из цикла Кувшинки.
https://x.com/SHL0MS/status/2054280631807316329
В тред пришли сотни «искусствоведов». Картину назвали бездушной AI-поделкой, ругали глубину, композицию и нашли ещё кучу проблем.
Нюанс в том, что это не AI-генерация, а настоящая картина Моне из цикла Кувшинки.
https://x.com/SHL0MS/status/2054280631807316329
😁11❤2