пара приколов обсудить вам вечером в баре
про стоимость идей в мире с ai, когда твою идею повторят уже через час
про искусство и ai
и про робота на заводе
про стоимость идей в мире с ai, когда твою идею повторят уже через час
про искусство и ai
и про робота на заводе
Forwarded from AI Secrets
Media is too big
VIEW IN TELEGRAM
Через несколько часов после анонса Google DeepMind AI Pointer разработчик Milind S выпустил open-source клон для macOS под названием tiptour
Приложение захватывает экран, определяет, на какое окно или приложение направлено внимание пользователя, и принимает команды в свободной форме: можно нарисовать что-то на экране и попросить ИИ это изменить, или просто сказать что сделать. Агент умеет кликать, печатать, редактировать интерфейсы, навигироваться между приложениями и выполнять код
Сделано на основе trycua, open-source фреймворка для computer-use агентов. Работает на macOS, требует Gemini API ключ. Скачать можно как готовый DMG без сборки через Xcode
GitHub: https://github.com/milind-soni/tiptour-macos
DMG: https://tiptour.io/
Приложение захватывает экран, определяет, на какое окно или приложение направлено внимание пользователя, и принимает команды в свободной форме: можно нарисовать что-то на экране и попросить ИИ это изменить, или просто сказать что сделать. Агент умеет кликать, печатать, редактировать интерфейсы, навигироваться между приложениями и выполнять код
Сделано на основе trycua, open-source фреймворка для computer-use агентов. Работает на macOS, требует Gemini API ключ. Скачать можно как готовый DMG без сборки через Xcode
GitHub: https://github.com/milind-soni/tiptour-macos
DMG: https://tiptour.io/
🔥4
Forwarded from GPT/ChatGPT/AI Central Александра Горного
Блогер запостил в X картинку, написал, что сгенерировал её в стиле Моне и попросил людей рассказать, почему она хуже настоящего Моне.
В тред пришли сотни «искусствоведов». Картину назвали бездушной AI-поделкой, ругали глубину, композицию и нашли ещё кучу проблем.
Нюанс в том, что это не AI-генерация, а настоящая картина Моне из цикла Кувшинки.
https://x.com/SHL0MS/status/2054280631807316329
В тред пришли сотни «искусствоведов». Картину назвали бездушной AI-поделкой, ругали глубину, композицию и нашли ещё кучу проблем.
Нюанс в том, что это не AI-генерация, а настоящая картина Моне из цикла Кувшинки.
https://x.com/SHL0MS/status/2054280631807316329
😁11❤2
просто live на youtube как робот работает третьи сутки подряд
figure ai устроили, кажется, самый понятный демо-момент для гуманоидов. не сальто, не красивый ролик на 40 секунд — а складская рутина в лайве — их F.03 стоит у конвейера, берет посылки из кучи, находит лейбл, переворачивает и кладет дальше. компания говорит, что всё автономно, на Helix-02, без человека на пульте
изначально хотели показать 8-часовую (ха-ха) смену на скорости примерно как у человека, но потом просто продолжили. уже пошли десятки тысяч посылок и больше суток непрерывной работы
youtube
figure ai устроили, кажется, самый понятный демо-момент для гуманоидов. не сальто, не красивый ролик на 40 секунд — а складская рутина в лайве — их F.03 стоит у конвейера, берет посылки из кучи, находит лейбл, переворачивает и кладет дальше. компания говорит, что всё автономно, на Helix-02, без человека на пульте
изначально хотели показать 8-часовую (ха-ха) смену на скорости примерно как у человека, но потом просто продолжили. уже пошли десятки тысяч посылок и больше суток непрерывной работы
youtube
YouTube
F.03 Livestream - Day 9 | 191 consecutive hours and 238,000 packages
Watch a team of humanoid robots running a full 191+ Hour shift at human performance levels. This is fully autonomous running Helix-02. Get the 24/7 Merch here: https://figure-ai.myshopify.com
💔5
говорят Google готовит Gemini Spark — отдельный агентский режим внутри Gemini
судя по интерфейсу, это уже не просто чат, а штука для задач: schedules, skills, inbox cleanup, meeting briefs, news digest и тп
Gemini как always-on агент. он сможет брать контекст из подключенных прилржений, чатов, задач, сайтов с залогином, локации, а потом выполнять действия от твоего имени
в тексте онбординга прямо предупреждают, что Spark экспериментальный и может делиться данными с третьими сторонами или делать покупки без отдельного подтверждения
ждём на I/O
source
судя по интерфейсу, это уже не просто чат, а штука для задач: schedules, skills, inbox cleanup, meeting briefs, news digest и тп
Gemini как always-on агент. он сможет брать контекст из подключенных прилржений, чатов, задач, сайтов с залогином, локации, а потом выполнять действия от твоего имени
в тексте онбординга прямо предупреждают, что Spark экспериментальный и может делиться данными с третьими сторонами или делать покупки без отдельного подтверждения
ждём на I/O
source
❤3
Пупырка AI
codex remote если вы уже хотели отойти от ноутбука, то тут нам апдейт openai добавили preview codex в мобильное приложение chatgpt. можно стартовать новую задачу, смотреть что агент сделал, читать диффы/логи/скриншоты, давать правки и подтверждать команды…
кодекс сбросил всем платным планам лимиты в честь выходных и уточнили, что можно удаленно управлять codex на мак с другого мак, а не только с айфона
https://developers.openai.com/codex/remote-connections
https://developers.openai.com/codex/remote-connections
❤3🤔2
Пупырка AI
главные события недели · 4–10 мая 2026 Модели • gpt-5.5 instant стал моделью chatgpt по умолчанию: меньше галлюцинаций, лучше работа с изображениями и видимость memory sources как новый паттерн доверия в персонализированных ai-продуктах — пост в канале •…
главные события недели · 10–17 мая 2026
google и agentic os
• google показал android как agentic os: gemini intelligence становится слоем поверх android, chrome, auto, wear os и будущих googlebook, а не отдельным чатиком — пост в канале
• google appfunctions — фактически mcp для android-приложений: приложения смогут отдавать агентам callable-функции вместо screen scraping и кликов по ui — пост в канале
• googlebook и vibe-coded widgets: google пробует ноутбук вокруг gemini и микро-интерфейсы, которые пользователь генерирует под конкретный intent — пост в канале
• google готовит gemini spark — отдельный режим для фоновых задач, skills, schedules, inbox cleanup, meeting briefs и других always-on workflows — пост в канале
агенты и инструменты
• codex remote появился в мобильном chatgpt preview: можно стартовать задачу, смотреть диффы и логи, давать правки и approve next steps с телефона, пока codex работает на ноутбуке/mac mini/devbox — пост в канале
• dessn поднял $6 млн на дизайн прямо в production-коде: не “сгенерируй лендинг с нуля”, а итерации по реальному продукту, компонентам и codebase — пост в канале
• plaud запустили dev platform: ai-диктофоны можно подключать к продуктам, забирать аудио, транскрипты и speaker diarization как контекст для workflows и агентов — пост в канале
openai и персональные данные
• openai запустили personal finance в chatgpt: подключение счетов, карт, кредитов и инвестиций через plaid, дашборд расходов/net worth/портфеля и вопросы по своим финансовым данным — openai
интерфейсы и продуктовые паттерны
• html is the new markdown: llm-ответы всё чаще становятся не текстом, а одноразовыми html-артефактами — интерактивными планами, ревью, таймлайнами, дашбордами и маленькими приложениями — пост в канале
• ai pointer быстро получил open-source клон для macos: tiptour захватывает экран, понимает контекст и выполняет действия в приложениях через computer-use агент — пост в канале
инфраструктура и исследования
• deepmind alphaevolve показал, что gemini-powered coding agents уже оптимизируют алгоритмы для датацентров и чипов google, а не только пишут прикладной код — deepmind
роботы
• figure ai устроили сильное live-демо F.03: не постановочный ролик, а складская рутина на конвейере, которая шла уже больше суток и дошла до десятков тысяч посылок — пост в канале
google и agentic os
• google показал android как agentic os: gemini intelligence становится слоем поверх android, chrome, auto, wear os и будущих googlebook, а не отдельным чатиком — пост в канале
• google appfunctions — фактически mcp для android-приложений: приложения смогут отдавать агентам callable-функции вместо screen scraping и кликов по ui — пост в канале
• googlebook и vibe-coded widgets: google пробует ноутбук вокруг gemini и микро-интерфейсы, которые пользователь генерирует под конкретный intent — пост в канале
• google готовит gemini spark — отдельный режим для фоновых задач, skills, schedules, inbox cleanup, meeting briefs и других always-on workflows — пост в канале
агенты и инструменты
• codex remote появился в мобильном chatgpt preview: можно стартовать задачу, смотреть диффы и логи, давать правки и approve next steps с телефона, пока codex работает на ноутбуке/mac mini/devbox — пост в канале
• dessn поднял $6 млн на дизайн прямо в production-коде: не “сгенерируй лендинг с нуля”, а итерации по реальному продукту, компонентам и codebase — пост в канале
• plaud запустили dev platform: ai-диктофоны можно подключать к продуктам, забирать аудио, транскрипты и speaker diarization как контекст для workflows и агентов — пост в канале
openai и персональные данные
• openai запустили personal finance в chatgpt: подключение счетов, карт, кредитов и инвестиций через plaid, дашборд расходов/net worth/портфеля и вопросы по своим финансовым данным — openai
интерфейсы и продуктовые паттерны
• html is the new markdown: llm-ответы всё чаще становятся не текстом, а одноразовыми html-артефактами — интерактивными планами, ревью, таймлайнами, дашбордами и маленькими приложениями — пост в канале
• ai pointer быстро получил open-source клон для macos: tiptour захватывает экран, понимает контекст и выполняет действия в приложениях через computer-use агент — пост в канале
инфраструктура и исследования
• deepmind alphaevolve показал, что gemini-powered coding agents уже оптимизируют алгоритмы для датацентров и чипов google, а не только пишут прикладной код — deepmind
роботы
• figure ai устроили сильное live-демо F.03: не постановочный ролик, а складская рутина на конвейере, которая шла уже больше суток и дошла до десятков тысяч посылок — пост в канале
openai стягивает chatgpt и codex в единую агентную платформу
openai снова перестраивает продуктовую организацию: greg brockman официально берёт продуктовую стратегию, а команда codex будет вести центральную платформу для consumer и enterprise. По сути, chatgpt, codex и будущий atlas/browser-сценарий сходятся в один agentic experience, а не остаются набором отдельных инструментов
для нас это: интерфейс ai-продукта будет всё меньше похож на «чат плюс плагины» и всё больше на рабочую среду с общим контекстом, правами, задачами и поверхностями
decoder
openai снова перестраивает продуктовую организацию: greg brockman официально берёт продуктовую стратегию, а команда codex будет вести центральную платформу для consumer и enterprise. По сути, chatgpt, codex и будущий atlas/browser-сценарий сходятся в один agentic experience, а не остаются набором отдельных инструментов
для нас это: интерфейс ai-продукта будет всё меньше похож на «чат плюс плагины» и всё больше на рабочую среду с общим контекстом, правами, задачами и поверхностями
decoder
🔥1
Пупырка AI
говорят Google готовит Gemini Spark — отдельный агентский режим внутри Gemini судя по интерфейсу, это уже не просто чат, а штука для задач: schedules, skills, inbox cleanup, meeting briefs, news digest и тп Gemini как always-on агент. он сможет брать контекст…
This media is not supported in your browser
VIEW IN TELEGRAM
всплыли сразу несколько новых штук: gemini live для десктопа, gemini spark, gemini omni и “stream to cursor”
ждём на google i/o уже завтра
source
ждём на google i/o уже завтра
source
🤔1
у cursor новый composer 2.5 — дишит в спину opus и gpt, а с учетом цены вроде как и вообще топ решение. забавно, что они сразу показали сколько там kimi
https://cursor.com/blog/composer-2-5
https://cursor.com/blog/composer-2-5
😁4🤔1
я верю, через время и дизайнеры, и продакты, и разработчики… — все будут работать с единым источником правды и коммитить прямо в прод. даже знаю, что в некоторых командах такое практикуют.
а сегодня про это написал интересный пост Люк Вроблевски — известный продуктовый дизайнер и исследователь интерфейсов, автор книг и статей про mobile-first, формы, ux и продуктовый дизайн. раньше он работал в yahoo и ebay, потом в google, а сейчас много пишет про ai-интерфейсы, агентные продукты и тп
——
сейчас ai-инструменты в основном работают как соло-спорт
разработчики пишут больше кода, дизайнеры генерят больше картинок, продакты быстрее делают документы. это полезно, но у такой модели есть проблема: каждый человек запускает своего агента, со своим контекстом, своими промптами, своими скиллами, своей памятью и своим представлением о результате
в итоге команда может двигаться не к одному общему продукту, а к набору разных версий
Luke Wroblewski называет это проблемой disconnected agents. в агентном мире расхождение перспектив только усиливается: если каждый может быстро собрать то, что хочет, продукт начинает ощущаться как пятнадцать разных идей вместо одной общей точки зрения
причина не только в людях, но и в том, как мы сейчас управляем агентами. AGENTS.md, skills.md, system prompts, memory, MCP-серверы, локальные файлы, настройки в кодовой базе — всё это влияет на результат. у одного человека это уже сложно контролировать, а на уровне команды превращается в кашу из разрозненного контекста
поэтому Luke предлагает идею collaborative steering
это общий механизм управления агентами, который команда создаёт, редактирует и поддерживает вместе. не “каждый настраивает своего помощника как хочет”, а shared context layer для проекта: какие у нас принципы, какие ограничения, какой бренд, какие engineering-подходы, что важно для ux, производительности, поддержки и качества
смысл в том, что ai не отменяет экспертизу людей. наоборот, он делает ещё важнее то, как эта экспертиза собирается в общий контекст. дизайнеры приносят принципы взаимодействия, визуальную целостность и голос бренда. инженеры — архитектуру, производительность, maintainability и инфраструктурные решения. задача не в том, чтобы агент заменил эти роли, а в том, чтобы он помог им не разъехаться
Luke пишет, что в нескольких проектах они уже использовали Intent как пространство для project-level context, который направляет агентные workflows к общим целям, а не уводит каждого в свою сторону
главная мысль: эпоха, где каждый член команды пилотирует своего отдельного агента, не может быть финальной стадией
следующий важный слой ai-инструментов — не просто “сделать одного человека продуктивнее”, а помочь командам вместе направлять агентов. выиграют продукты, которые сделают collaborative steering естественным и лёгким
source
а сегодня про это написал интересный пост Люк Вроблевски — известный продуктовый дизайнер и исследователь интерфейсов, автор книг и статей про mobile-first, формы, ux и продуктовый дизайн. раньше он работал в yahoo и ebay, потом в google, а сейчас много пишет про ai-интерфейсы, агентные продукты и тп
——
сейчас ai-инструменты в основном работают как соло-спорт
разработчики пишут больше кода, дизайнеры генерят больше картинок, продакты быстрее делают документы. это полезно, но у такой модели есть проблема: каждый человек запускает своего агента, со своим контекстом, своими промптами, своими скиллами, своей памятью и своим представлением о результате
в итоге команда может двигаться не к одному общему продукту, а к набору разных версий
Luke Wroblewski называет это проблемой disconnected agents. в агентном мире расхождение перспектив только усиливается: если каждый может быстро собрать то, что хочет, продукт начинает ощущаться как пятнадцать разных идей вместо одной общей точки зрения
причина не только в людях, но и в том, как мы сейчас управляем агентами. AGENTS.md, skills.md, system prompts, memory, MCP-серверы, локальные файлы, настройки в кодовой базе — всё это влияет на результат. у одного человека это уже сложно контролировать, а на уровне команды превращается в кашу из разрозненного контекста
поэтому Luke предлагает идею collaborative steering
это общий механизм управления агентами, который команда создаёт, редактирует и поддерживает вместе. не “каждый настраивает своего помощника как хочет”, а shared context layer для проекта: какие у нас принципы, какие ограничения, какой бренд, какие engineering-подходы, что важно для ux, производительности, поддержки и качества
смысл в том, что ai не отменяет экспертизу людей. наоборот, он делает ещё важнее то, как эта экспертиза собирается в общий контекст. дизайнеры приносят принципы взаимодействия, визуальную целостность и голос бренда. инженеры — архитектуру, производительность, maintainability и инфраструктурные решения. задача не в том, чтобы агент заменил эти роли, а в том, чтобы он помог им не разъехаться
Luke пишет, что в нескольких проектах они уже использовали Intent как пространство для project-level context, который направляет агентные workflows к общим целям, а не уводит каждого в свою сторону
главная мысль: эпоха, где каждый член команды пилотирует своего отдельного агента, не может быть финальной стадией
следующий важный слой ai-инструментов — не просто “сделать одного человека продуктивнее”, а помочь командам вместе направлять агентов. выиграют продукты, которые сделают collaborative steering естественным и лёгким
source
Lukew
LukeW | Collaborative Steering
Today, AI tools are mostly solo sports. Developers write more code. Designers create more images. PMs crank out more docs. That's cool... but it's more cool to ...
👍9💯8❤🔥7❤4🔥2
Forwarded from ИИ Cерафимодальность
у этого канала две обсессии: Антропик и Андрей Карпатый
теперь одна
теперь одна
🔥10😱6