Vibe and AI
5 subscribers
39 photos
52 links
Download Telegram
Запускаем модель как агента: компьютерная среда для Responses API

Показывается, как превратить вызовы Responses API в агентный рантайм: добавить shell-инструмент, управляемые хостингом контейнеры и рабочее окружение. Получается безопасное выполнение команд с доступом к файлам, инструментам и состоянию — для масштабируемых агентов в реальных сценариях.

https://openai.com/index/equip-responses-api-computer-environment
Сокращаем токены в LLM-приложениях: 10 практик

Токены — это цена и производительность: каждый лишний символ в промпте и каждое лишнее слово на выходе увеличивают задержки и расходы. Разбираем 10 способов оптимизировать вход/выход (в т.ч. системные инструкции, stop-секвенции, кэширование и форматы ответов), чтобы сохранить качество и сделать агентов заметно эффективнее.

https://blog.logrocket.com/stop-wasting-ai-tokens-10-ways-to-reduce-usage/
Представляем GPT-5 для разработчиков

GPT-5 в API-платформе — ставка на высокую “логическую” производительность, новые инструменты и больше контроля для разработчиков, чтобы уверенно решать реальные задачи по коду. Меньше лишних итераций, лучше результаты там, где важны качество и предсказуемость.

https://openai.com/index/introducing-gpt-5-for-developers
Почему AI-приложение ломается в проде и как это исправить (5 причин)

AI, который отлично работает локально, в продакшене часто падает из‑за недетерминированных ответов LLM, «убегающих» агентных циклов, невалидных/неподходящих пользовательских вводов и деградации контекста. Ключ к стабильности — относиться к выходам модели как к недоверенным данным, жёстко валидировать результат и проектировать graceful failure с автоворековери.

https://blog.logrocket.com/5-reasons-ai-app-fails-production/
A2UI и агентные UI: вместо чата — мини‑приложения, собранные прямо по схеме

A2UI (Agent-to-UI) позволяет агенту возвращать не HTML/JS, а структурированный JSON‑описатель интерфейса: формы, кнопки, поля и действия. Собираете собственный “безопасный” рендерер на клиенте — а агент управляет UI как в Telegram‑миниаппах, без долгих Q&A циклов.

https://blog.logrocket.com/a2ui-better-way-ship-agents/
Вы не читаете слова — модель читает токены и упирается в контекстное окно:

Текст превращается в токены (фрагменты подслов), и дальше модель видит только последовательность этих единиц — а не исходные слова. Контекстное окно ограничивает объём, поэтому старые детали могут исчезнуть из внимания, что ломает логику диалога, оценки стоимости и стратегию промптов.

https://dev.to/contextfirstai/youre-not-reading-words-youre-reading-chunks-tokens-and-context-windows-explained-310h
Retrieval после RAG: гибридный поиск, агенты и дизайн базы для unstructured-данных

Идея Turbopuffer: модели не умеют сжать мир в веса — значит нужен поиск по первоисточнику с честной точностью. Берите гибридное retrieval (семантика + текст/regex/паттерны), а в базе делайте ставку на tiered-хранилище: object storage для редких запросов и NVMe/память для горячих, чтобы оптимизировать latency и экономику.

https://www.latent.space/p/turbopuffer
Cursor в третью эпоху: cloud-агенты, которые реально управляют компьютером

Cursor запускает Cloud Agents: ИИ больше не просто дописывает код, а получает доступ к облачному компьютеру и выполняет задачи end-to-end — с запуском, тестированием и разбором проблем. Ключевые фишки: параллельные агенты, субагенты для контекста, slash-команды и фокус на throughput и ускорении разработки.

https://www.latent.space/p/cursor-third-era
Я собрал приложение для клипов из подкастов за выходные на vibe coding — получилось быстрее, чем спорить с хайпом

PodClip: веб-апка, которая позволяет сохранять фрагменты из Spotify с таймкодами, автоматически генерировать транскрипты и складывать всё в удобный дашборд с поиском. В основе — быстрый прототип в Replit и AI-агенты, которые берут на себя большую часть вёрстки, бэкенда, авторизации и даже тестов.

https://towardsdatascience.com/i-built-a-podcast-clipping-app-in-one-weekend-using-vibe-coding/
Агентный RAG может молчаливо упасть в проде: от зацикленного поиска до раздувания контекста

https://towardsdatascience.com/agentic-rag-failure-modes-retrieval-thrash-tool-storms-and-context-bloat-and-how-to-spot-them-early/
Кэшируем RAG шире, чем просто prompt caching

Помимо prompt caching, в RAG-пайплайне можно экономить время и деньги за счёт кэшей на других этапах: повторного использования эмбеддингов (query/doc), семантического кэша для похожих запросов и даже кеширования целых query → response пар.

https://towardsdatascience.com/beyond-prompt-caching-5-more-things-you-should-cache-in-rag-pipelines/
От предиктивного кодирования к «цифровому мозгу»: когнитивная архитектура для AI-агентов с устойчивой памятью

Идея: строим агента по мотивам мозга — он постоянно «предсказывает» и корректирует свои ожидания, а знания сохраняются не как разовые подсказки, а как устойчивый когнитивный слой. Получается более последовательное поведение: агент лучше удерживает контекст, обучается на ошибках и быстрее восстанавливается между задачами.

https://blog.gazzurelli.com/from-predictive-coding-to-digital-brain-a-cognitive-architecture-for-ai-agents-with-persistent-f1726baf97f6
Почему Codex Security не выпускает отчёты SAST

Традиционный SAST ищет проблемы «по правилам», а часто ловит много ложных срабатываний. Здесь упор на AI-проверки: вместо статического отчёта модель применяет constraint reasoning и валидацию, чтобы находить реальные уязвимости с меньшим шумом.

https://openai.com/index/why-codex-security-doesnt-include-sast
OpenAI приобретает Promptfoo

Платформа Promptfoo помогает находить и устранять уязвимости в AI-системах прямо в процессе разработки. Это шаг к более безопасному применению AI в проде: меньше рисков, быстрее исправления, проще контроль качества промптов и пайплайнов.

https://openai.com/index/openai-to-acquire-promptfoo
Codex Security: теперь в режиме research preview

AI-агент для прикладной безопасности: погружается в контекст проекта, находит и подтверждает сложные уязвимости, а затем предлагает патчи с меньшим числом ложных срабатываний. Фокус — быстрее закрывать риски и снижать «шум» при анализе кода.

https://openai.com/index/codex-security-now-in-research-preview
Модели рассуждений сложно держать под контролем их цепочки мыслей — и это даже хорошо

Представлена CoT-Control: попытка управлять цепочкой рассуждений показывает, что такие модели плохо поддаются точному контролю. Зато это усиливает идею мониторируемости как механизма безопасности для разработчиков ИИ.

https://openai.com/index/reasoning-models-chain-of-thought-controllability
ChatGPT для Excel и новые финансовые интеграции

Добавили ChatGPT для Excel: можно быстрее делать моделирование, исследования и анализ данных прямо в таблицах, а новые интеграции с финансовыми приложениями помогают работать с данными из коробки даже в среде с повышенными требованиями к комплаенсу.

https://openai.com/index/chatgpt-for-excel
Пишем stateful runtime для агентов в Amazon Bedrock

Stateful Runtime добавляет агентам память и постоянную оркестрацию между шагами: контекст не теряется, а выполнение разбивается на управляемые состояния. Это упрощает разработку сложных multi-step сценариев и повышает надёжность (включая безопасное выполнение) для продакшн-агентов.

https://openai.com/index/introducing-the-stateful-runtime-environment-for-agents-in-amazon-bedrock
Системная карта GPT-5

Разбираемся, как единая система маршрутизации позволяет GPT-5 быстро и точно выбирать нужный режим ответа: от «умного рассуждения» до лёгких версий для простых задач. Это полезно разработчикам, которым важны скорость, стоимость и предсказуемость поведения модели в проде.

https://openai.com/index/gpt-5-system-card
Агентная система ChatGPT: как объединяются исследования, браузер и инструменты кода

Модель-агент соединяет исследовательские шаги, автоматизацию действий в браузере и работу с code-инструментами в одном потоке. Для безопасной эксплуатации применяются ограничения и проверочные меры в рамках Preparedness Framework.

https://openai.com/index/chatgpt-agent-system-card