Пупырка AI
главные события недели · 26 апреля – 3 мая Модели • mistral medium 3.5: open-source 128B, превосходит claude sonnet 4.5 по бенчмаркам — Mistral Blog • xai grok 4.3 со скидками на api и новым режимом imagine — xAI • маск признал: xai дистиллировал grok из…
главные события недели · 4–10 мая 2026
Модели
• gpt-5.5 instant стал моделью chatgpt по умолчанию: меньше галлюцинаций, лучше работа с изображениями и видимость memory sources как новый паттерн доверия в персонализированных ai-продуктах — пост в канале
• openai выпустил новые realtime voice-модели для api: голосовые интерфейсы становятся быстрее, дешевле и ближе к production-сценариям поддержки, обучения и ассистентов — openai
Агенты и инструменты
• codex переупаковывают из coding tool в агента для knowledge work: документы, таблицы, презентации, браузинг, memory и интеграции с microsoft, google и salesforce — пост в канале
• claude managed agents получили dreaming, outcomes и multiagent orchestration: агент начинает улучшать память между задачами и работать по проверяемым критериям качества — пост в канале
• microsoft показал copilot cowork: облачный агент, который можно запускать с телефона, продолжать в фоне и расширять скиллами под повторяющиеся рабочие процессы — пост в канале
• github copilot coding agent получил secrets, а copilot code review — типы замечаний в usage metrics api; ai-разработка становится управляемым процессом с метриками и доступами — github changelog
Инфраструктура и разработка
• lazyweb открыл 250k реальных экранов приложений для ai-агентов через mcp, чтобы генерация интерфейсов опиралась на живые паттерны, а не фантазию модели — пост в канале
• deepmind alphaevolve показал, что gemini-powered coding agents уже оптимизируют алгоритмы для датацентров и чипов google, а не только пишут прикладной код — deepmind
• anthropic удвоил лимиты claude code через compute-сделку со spacex/xai: качество ai-инструментов всё сильнее зависит от доступа к gpu и инфраструктурных партнёрств — пост в канале
Бизнес и рынок
• openai начал разворачивать self-serve ads manager для chatgpt: cpc-ставки, аналитика и intent-based advertising прямо внутри диалога — пост в канале
• cloudflare заявил, что ai сделал 1100 вакансий ненужными даже на фоне рекордной выручки: рынок труда получает первый жёсткий сигнал про замещение планируемого найма — techcrunch
UX и доверие
• важный сдвиг в ux reasoning: chain-of-thought больше нельзя считать audit log, доверие надо переносить на источники, tool calls, артефакты, тесты и историю действий агента — пост в канале
Модели
• gpt-5.5 instant стал моделью chatgpt по умолчанию: меньше галлюцинаций, лучше работа с изображениями и видимость memory sources как новый паттерн доверия в персонализированных ai-продуктах — пост в канале
• openai выпустил новые realtime voice-модели для api: голосовые интерфейсы становятся быстрее, дешевле и ближе к production-сценариям поддержки, обучения и ассистентов — openai
Агенты и инструменты
• codex переупаковывают из coding tool в агента для knowledge work: документы, таблицы, презентации, браузинг, memory и интеграции с microsoft, google и salesforce — пост в канале
• claude managed agents получили dreaming, outcomes и multiagent orchestration: агент начинает улучшать память между задачами и работать по проверяемым критериям качества — пост в канале
• microsoft показал copilot cowork: облачный агент, который можно запускать с телефона, продолжать в фоне и расширять скиллами под повторяющиеся рабочие процессы — пост в канале
• github copilot coding agent получил secrets, а copilot code review — типы замечаний в usage metrics api; ai-разработка становится управляемым процессом с метриками и доступами — github changelog
Инфраструктура и разработка
• lazyweb открыл 250k реальных экранов приложений для ai-агентов через mcp, чтобы генерация интерфейсов опиралась на живые паттерны, а не фантазию модели — пост в канале
• deepmind alphaevolve показал, что gemini-powered coding agents уже оптимизируют алгоритмы для датацентров и чипов google, а не только пишут прикладной код — deepmind
• anthropic удвоил лимиты claude code через compute-сделку со spacex/xai: качество ai-инструментов всё сильнее зависит от доступа к gpu и инфраструктурных партнёрств — пост в канале
Бизнес и рынок
• openai начал разворачивать self-serve ads manager для chatgpt: cpc-ставки, аналитика и intent-based advertising прямо внутри диалога — пост в канале
• cloudflare заявил, что ai сделал 1100 вакансий ненужными даже на фоне рекордной выручки: рынок труда получает первый жёсткий сигнал про замещение планируемого найма — techcrunch
UX и доверие
• важный сдвиг в ux reasoning: chain-of-thought больше нельзя считать audit log, доверие надо переносить на источники, tool calls, артефакты, тесты и историю действий агента — пост в канале
👍2 1
html is the new markdown
llm-output перестаёт быть только текстом. всё чаще результатом работы будет disposable software artifact — одноразовый мини-интерфейс, сделанный под конкретный вопрос, задачу или исследование
thariq shihipar из команды claude code написал хороший разбор про то, почему он почти перестал просить у моделей markdown и всё чаще просит самодостаточный html-файл — статья
его главный тезис — markdown был хорошим дефолтом, пока llm-ответы были в основном текстом. но если модель уже умеет писать код, держать структуру, собирать интерфейсы и пользоваться локальным браузером, то странно ограничивать её форматом, который специально придуман быть максимально простым.
thariq также собрал галерею из 20 примеров таких html-артефактов — от annotated diff до incident timeline и интерактивных планов — примеры
после этого карпати добавил важную рамку. он пишет, что это действительно хорошо работает — в конце запроса можно просто попросить llm “structure your response as HTML”, сохранить файл и открыть его в браузере — пост Карпати
но интереснее не сам лайфхак, а его прогрессия форматов:
текст → markdown → html → приложения
сначала модели отвечали обычным текстом. потом markdown стал дефолтом, потому что он даёт структуру почти бесплатно: заголовки, списки, таблицы, код. теперь, когда модели лучше пишут frontend-код, html становится следующим естественным уровнем: это уже не просто структурированный текст, а визуальный и интерактивный документ
следующий шаг — полноценные маленькие приложения, которые агент генерирует под конкретную задачу. вместо «вот анализ», будет «вот интерфейс, где можно этот анализ исследовать»
llm-output перестаёт быть только текстом. всё чаще результатом работы будет disposable software artifact — одноразовый мини-интерфейс, сделанный под конкретный вопрос, задачу или исследование
thariq shihipar из команды claude code написал хороший разбор про то, почему он почти перестал просить у моделей markdown и всё чаще просит самодостаточный html-файл — статья
его главный тезис — markdown был хорошим дефолтом, пока llm-ответы были в основном текстом. но если модель уже умеет писать код, держать структуру, собирать интерфейсы и пользоваться локальным браузером, то странно ограничивать её форматом, который специально придуман быть максимально простым.
что даёт html:
• вместо линейной простыни текста можно получить навигацию, секции, таблицы, диаграммы, annotated diffs, timeline, collapsible-блоки и маленькие интерактивные инструменты
• ответ становится не «сообщением», а артефактом: его можно открыть локально, отправить коллеге, использовать как dashboard, план, ревью или объяснялку
• html хорошо подходит для результатов работы агента: implementation plan, incident report, архитектурная карта, pr-review, анализ логов, prompt tuner, slide deck
• браузер уже есть у всех, сборка не нужна, hosting не нужен, dependency hell тоже не нужен
• модель может делать интерфейс под конкретную задачу, а не запихивать всё в универсальный markdown-шаблон
thariq также собрал галерею из 20 примеров таких html-артефактов — от annotated diff до incident timeline и интерактивных планов — примеры
после этого карпати добавил важную рамку. он пишет, что это действительно хорошо работает — в конце запроса можно просто попросить llm “structure your response as HTML”, сохранить файл и открыть его в браузере — пост Карпати
но интереснее не сам лайфхак, а его прогрессия форматов:
текст → markdown → html → приложения
сначала модели отвечали обычным текстом. потом markdown стал дефолтом, потому что он даёт структуру почти бесплатно: заголовки, списки, таблицы, код. теперь, когда модели лучше пишут frontend-код, html становится следующим естественным уровнем: это уже не просто структурированный текст, а визуальный и интерактивный документ
следующий шаг — полноценные маленькие приложения, которые агент генерирует под конкретную задачу. вместо «вот анализ», будет «вот интерфейс, где можно этот анализ исследовать»
👍9
dessn поднял $6 млн на дизайн прямо в production-коде
dessn делает ai-инструмент для продуктовых команд, который запускает существующий код в облаке и позволяет дизайнерам итеративно менять интерфейс без локальной настройки проекта. в отличие от lovable/v0-подхода для идей с нуля, dessn целится в команды с живым продуктом, где важно сохранить fidelity к реальному codebase и проще передавать изменения разработчикам.
для нас это: дизайн-инструменты смещаются ближе к production-среде. меньше «макетов отдельно от системы» и больше работы с настоящими состояниями, компонентами, данными и ограничениями продукта
techcrunch
dessn делает ai-инструмент для продуктовых команд, который запускает существующий код в облаке и позволяет дизайнерам итеративно менять интерфейс без локальной настройки проекта. в отличие от lovable/v0-подхода для идей с нуля, dessn целится в команды с живым продуктом, где важно сохранить fidelity к реальному codebase и проще передавать изменения разработчикам.
для нас это: дизайн-инструменты смещаются ближе к production-среде. меньше «макетов отдельно от системы» и больше работы с настоящими состояниями, компонентами, данными и ограничениями продукта
techcrunch
TechCrunch
Dessn raises $6M for its production-focused design tool | TechCrunch
A new startup called Dessn has raised $6 million to build AI-powered design tools that work directly with production codebases.
👍2
Google делает mcp для android-приложений
Google показал AppFunctions — новый механизм, через который android-приложения смогут отдавать свои функции ai-агентам как инструменты — Android Developers
идея простая: приложение заранее объявляет действия вроде “отправить сообщение”, “создать заметку”, “добавить событие в календарь” или “обновить список покупок”, а Gemini или другой авторизованный агент сможет вызвать их напрямую.
это важно, потому что это не screen scraping и не кликание по интерфейсу через accessibility. google делает нормальный системный контракт между приложениями и агентами.
по сути, android-приложения начинают превращаться из экранов в callable tools. раньше пользователь сам открывал пять приложений подряд. теперь агент сможет собрать workflow сам: понять намерение, найти нужные функции и выполнить задачу между приложениями.
пока AppFunctions в preview и завязан на Android 16+, но направление очень понятное: мобильная ОС готовится к миру, где главный интерфейс — не иконка приложения, а намерение пользователя.
Google показал AppFunctions — новый механизм, через который android-приложения смогут отдавать свои функции ai-агентам как инструменты — Android Developers
идея простая: приложение заранее объявляет действия вроде “отправить сообщение”, “создать заметку”, “добавить событие в календарь” или “обновить список покупок”, а Gemini или другой авторизованный агент сможет вызвать их напрямую.
это важно, потому что это не screen scraping и не кликание по интерфейсу через accessibility. google делает нормальный системный контракт между приложениями и агентами.
по сути, android-приложения начинают превращаться из экранов в callable tools. раньше пользователь сам открывал пять приложений подряд. теперь агент сможет собрать workflow сам: понять намерение, найти нужные функции и выполнить задачу между приложениями.
пока AppFunctions в preview и завязан на Android 16+, но направление очень понятное: мобильная ОС готовится к миру, где главный интерфейс — не иконка приложения, а намерение пользователя.
👍3
This media is not supported in your browser
VIEW IN TELEGRAM
Android становится Agentic os
Google показал Gemini Intelligence — новую ai-прослойку для Android, Chrome, Android Auto, Wear OS и будущих Googlebook-ноутбуков — Android
Google начинает делать ai системным уровнем android — модель видит контекст устройства, понимает, что происходит в приложениях, и помогает выполнять задачи между ними
что показали:
• multi-step tasks across apps: Gemini сможет брать информацию из одного приложения и использовать её в другом — например, распознать событие с флаера, добавить его в календарь и отправить детали в чат
• Gemini in Chrome получает browser-use сценарии: резюмирование страниц, ответы по содержимому сайта и помощь с задачами вроде заполнения форм или бронирования
• Android Auto тоже получает Gemini: можно будет говорить более естественно, просить составить сообщение, найти место по контексту или продолжить задачу с телефона
• на Wear OS Gemini заменяет старого Assistant и становится более контекстным помощником на часах
Gemini перестаёт быть отдельным чатиком. он становится слоем поверх ОС, браузера, машины и носимых устройств.
если AppFunctions — это техническая база для “android apps as tools”, то Gemini Intelligence — пользовательский слой поверх этого. Android постепенно превращается в систему, где пользователь формулирует намерение, а агент сам собирает workflow из приложений и контекста.
Google показал Gemini Intelligence — новую ai-прослойку для Android, Chrome, Android Auto, Wear OS и будущих Googlebook-ноутбуков — Android
Google начинает делать ai системным уровнем android — модель видит контекст устройства, понимает, что происходит в приложениях, и помогает выполнять задачи между ними
что показали:
• multi-step tasks across apps: Gemini сможет брать информацию из одного приложения и использовать её в другом — например, распознать событие с флаера, добавить его в календарь и отправить детали в чат
• Gemini in Chrome получает browser-use сценарии: резюмирование страниц, ответы по содержимому сайта и помощь с задачами вроде заполнения форм или бронирования
• Android Auto тоже получает Gemini: можно будет говорить более естественно, просить составить сообщение, найти место по контексту или продолжить задачу с телефона
• на Wear OS Gemini заменяет старого Assistant и становится более контекстным помощником на часах
Gemini перестаёт быть отдельным чатиком. он становится слоем поверх ОС, браузера, машины и носимых устройств.
если AppFunctions — это техническая база для “android apps as tools”, то Gemini Intelligence — пользовательский слой поверх этого. Android постепенно превращается в систему, где пользователь формулирует намерение, а агент сам собирает workflow из приложений и контекста.
❤1👍1🌚1
интерфейсно дизайнеров Google заставили сделать ответ на glass. судя по видео получилось спорно.
хотя появился свой ход с блюрами и он звучит инетерсно, всякие обводки приехали явно от вдохновения iOS
зато они придумали своё светящееся яблочко для ноутбуков
видео с главными анонсами за минуту — https://youtu.be/tOWuuIF7go0?si=HzBtghQdu_lEEipG
хотя появился свой ход с блюрами и он звучит инетерсно, всякие обводки приехали явно от вдохновения iOS
зато они придумали своё светящееся яблочко для ноутбуков
видео с главными анонсами за минуту — https://youtu.be/tOWuuIF7go0?si=HzBtghQdu_lEEipG
🎉1
Googlebook и vibe-coded widgets
ещё на ивенте показали Googlebook — это chromebook neo. и виджеты, которые можно генерировать по описанию — TechCrunch
Googlebook — новая категория ноутбуков на базе Android PC. Идея в том, что Gemini будет встроен в систему с самого начала: искать по файлам и приложениям, помогать с рабочими задачами, продолжать сценарии с телефона и управлять действиями через Magic Pointer
вторая штука — Create My Widget. пользователь описывает, какой виджет ему нужен, а Gemini собирает его сам: например, «виджет с рецептами по продуктам дома», «travel-план на выходные» и тп
это маленький, но важный сдвиг: теперь пользователь может сгенерировать микро-интерфейс под конкретную задачу. какое-то время назад у nothing были даже более смелые идеи, гугл пошел осторожнее
итого — приложения дают агенту функции, Gemini собирает из них workflow, а пользователь получает не универсальный экран приложения, а интерфейс под текущий intent. а ведь ещё утром обсуждали, что генерация текстов это начало
ещё на ивенте показали Googlebook — это chromebook neo. и виджеты, которые можно генерировать по описанию — TechCrunch
Googlebook — новая категория ноутбуков на базе Android PC. Идея в том, что Gemini будет встроен в систему с самого начала: искать по файлам и приложениям, помогать с рабочими задачами, продолжать сценарии с телефона и управлять действиями через Magic Pointer
вторая штука — Create My Widget. пользователь описывает, какой виджет ему нужен, а Gemini собирает его сам: например, «виджет с рецептами по продуктам дома», «travel-план на выходные» и тп
это маленький, но важный сдвиг: теперь пользователь может сгенерировать микро-интерфейс под конкретную задачу. какое-то время назад у nothing были даже более смелые идеи, гугл пошел осторожнее
итого — приложения дают агенту функции, Gemini собирает из них workflow, а пользователь получает не универсальный экран приложения, а интерфейс под текущий intent. а ведь ещё утром обсуждали, что генерация текстов это начало
👍5
Media is too big
VIEW IN TELEGRAM
ai pointer — как google перепридумывают курсор 🖥
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥6
Media is too big
VIEW IN TELEGRAM
codex remote
если вы уже хотели отойти от ноутбука, то тут нам апдейт
openai добавили preview codex в мобильное приложение chatgpt. можно стартовать новую задачу, смотреть что агент сделал, читать диффы/логи/скриншоты, давать правки и подтверждать команды прямо с телефона
сам codex продолжает работать не на айфоне, а на хосте (ноутбуке, mac mini или devbox)
openai docs
если вы уже хотели отойти от ноутбука, то тут нам апдейт
openai добавили preview codex в мобильное приложение chatgpt. можно стартовать новую задачу, смотреть что агент сделал, читать диффы/логи/скриншоты, давать правки и подтверждать команды прямо с телефона
сам codex продолжает работать не на айфоне, а на хосте (ноутбуке, mac mini или devbox)
openai docs
🔥5👌1🌚1
plaud запустили dev platform для разработчиков
plaud — это маленький ai-диктофон, который записывает разговоры и превращает их в транскрипты, саммари и заметки
теперь они запустили dev platform для разработчиков. plaud-девайсы можно встраивать в свои продукты — подключать к приложению, забирать аудио, получать расшифровки со спикерами и строить поверх этого свои воркфлоу
сценарии понятные — продажи, медицина, real estate… — всё, где важная инфа появляется не в интерфейсе, а в живом разговоре
интересна тут не транскрибация сама по себе, а контекст для агентов. если у продукта есть доступ к реальным разговорам пользователя, агент может работать не только с тем, что человек руками занёс в crm, а с первоисточником
plaud dev
plaud — это маленький ai-диктофон, который записывает разговоры и превращает их в транскрипты, саммари и заметки
теперь они запустили dev platform для разработчиков. plaud-девайсы можно встраивать в свои продукты — подключать к приложению, забирать аудио, получать расшифровки со спикерами и строить поверх этого свои воркфлоу
сценарии понятные — продажи, медицина, real estate… — всё, где важная инфа появляется не в интерфейсе, а в живом разговоре
интересна тут не транскрибация сама по себе, а контекст для агентов. если у продукта есть доступ к реальным разговорам пользователя, агент может работать не только с тем, что человек руками занёс в crm, а с первоисточником
plaud dev
❤3🤔2
пара приколов обсудить вам вечером в баре
про стоимость идей в мире с ai, когда твою идею повторят уже через час
про искусство и ai
и про робота на заводе
про стоимость идей в мире с ai, когда твою идею повторят уже через час
про искусство и ai
и про робота на заводе
Forwarded from AI Secrets
Media is too big
VIEW IN TELEGRAM
Через несколько часов после анонса Google DeepMind AI Pointer разработчик Milind S выпустил open-source клон для macOS под названием tiptour
Приложение захватывает экран, определяет, на какое окно или приложение направлено внимание пользователя, и принимает команды в свободной форме: можно нарисовать что-то на экране и попросить ИИ это изменить, или просто сказать что сделать. Агент умеет кликать, печатать, редактировать интерфейсы, навигироваться между приложениями и выполнять код
Сделано на основе trycua, open-source фреймворка для computer-use агентов. Работает на macOS, требует Gemini API ключ. Скачать можно как готовый DMG без сборки через Xcode
GitHub: https://github.com/milind-soni/tiptour-macos
DMG: https://tiptour.io/
Приложение захватывает экран, определяет, на какое окно или приложение направлено внимание пользователя, и принимает команды в свободной форме: можно нарисовать что-то на экране и попросить ИИ это изменить, или просто сказать что сделать. Агент умеет кликать, печатать, редактировать интерфейсы, навигироваться между приложениями и выполнять код
Сделано на основе trycua, open-source фреймворка для computer-use агентов. Работает на macOS, требует Gemini API ключ. Скачать можно как готовый DMG без сборки через Xcode
GitHub: https://github.com/milind-soni/tiptour-macos
DMG: https://tiptour.io/
🔥4
Forwarded from GPT/ChatGPT/AI Central Александра Горного
Блогер запостил в X картинку, написал, что сгенерировал её в стиле Моне и попросил людей рассказать, почему она хуже настоящего Моне.
В тред пришли сотни «искусствоведов». Картину назвали бездушной AI-поделкой, ругали глубину, композицию и нашли ещё кучу проблем.
Нюанс в том, что это не AI-генерация, а настоящая картина Моне из цикла Кувшинки.
https://x.com/SHL0MS/status/2054280631807316329
В тред пришли сотни «искусствоведов». Картину назвали бездушной AI-поделкой, ругали глубину, композицию и нашли ещё кучу проблем.
Нюанс в том, что это не AI-генерация, а настоящая картина Моне из цикла Кувшинки.
https://x.com/SHL0MS/status/2054280631807316329
😁11❤2