Qwen выпустил апдейты DeepResearch и Qwen Code. Кстати, еще и Google раскатал Gemini deep research в мобильном приложении
GitHub
GitHub - QwenLM/qwen-code: An open-source AI coding agent that lives in your terminal.
An open-source AI coding agent that lives in your terminal. - QwenLM/qwen-code
Forwarded from Анализ данных (Data analysis)
🚀 Grok 4.1 - новая фронтир-модель, которая поднимает планку разговорного интеллекта, эмоционального понимания и практической полезности в реальных сценариях.
Grok 4.1 доступен бесплатно на:
• grok.com
• grok.x.com
• мобильных приложениях.
Первое место в LMArena Text Leaderboard (привет старому другу “quasar”) и в EQ-Bench (и даже превосходит Kimi k2).
Модель стала лучше понимать контекст, тон, эмоции и намерения собеседника, а также выдавать более точные и прикладные ответы. Это делает Grok 4.1 одним из наиболее продвинутых решений в своей категории.
https://x.ai/news/grok-4-1
Grok 4.1 доступен бесплатно на:
• grok.com
• grok.x.com
• мобильных приложениях.
Первое место в LMArena Text Leaderboard (привет старому другу “quasar”) и в EQ-Bench (и даже превосходит Kimi k2).
Модель стала лучше понимать контекст, тон, эмоции и намерения собеседника, а также выдавать более точные и прикладные ответы. Это делает Grok 4.1 одним из наиболее продвинутых решений в своей категории.
https://x.ai/news/grok-4-1
🔥1
Forwarded from Refat Talks: Tech & AI
Великий
Делаем агента для европейской маркетинговой компании. Они год мучались с RAG - индексировали, чанкали, перебирали эмбединги, то лагает, то галлюцинирует, то не находит нужное.
Предложил радикально другой подход: выкинуть RAG, вместо этого - Claude Agent SDK + обычная файловая система и MCP как интерфейс. Сделал им прототип - результат настолько лучше, что сначала не поверили. Сравнить можно +/- с тем, насколько Claude Code лучше чем обычный AI чат в кодинге. Поиск по гигабайтам PDF, DOCX, PPTX - доли секунды. Залетает новый файл - агент сразу готов его учитывать. Никакого чанкинга, никакой индексации. По сути - это то же самое что Claude Code или Codex CLI делают с кодовой базой, только тут вместо code base у нас knowledge base.
Но есть нюанс, и даже несколько. Вообще, планирую серию постов на эту тему, начну с проблемы синхронизации файлов и ее решения.
Итак, проблема. Основной источник знаний в их случае - Google Drive. Там все: презентации клиентам, стратегии, исследования. Но делать квери туда - слишком долго и мы ограничены только встроенным поиском драйва - не пойдет. Нам нужно чтобы Claude Code (Agent SDK) шустро шуршал по файлам.
Решение - rclone
Rclone - это как rsync для облачных хранилищ. Поддерживает Google Drive, OneDrive, Dropbox и десятки других. Крутая штука: умеет автоматически экспортировать форматы. Google Docs превращается в .docx, Sheets в .xlsx, презентации в .pptx и тд.
Файлы летят на сервер, конвертируются, агент работает с ними как с обычными файлами.
Почему file-first лучше
Storage дешевый и быстрый. Иногда (особенно для использования внутри компании) куда проще загрузить все на диск и работать с файлами напрямую, чем городить удаленный инджестинг с векторными базами и пайплайн индексации.
Современные CLI агенты прекрасно справляются с файловым поиском. "Найди все упоминания проекта X за последние 3 месяца" - делает за секунды через обычные файловые операции. Когда нужно читает файлы по частям или целиком. А еще на лету пишет скрипты для работы с ними если надо (!), собственно эту концепцию сейчас и продвигают Антропик со своими Skills.
В общем, если строите агента для работы с документами:
- Посмотрите на file-first подход. Может быть быстрее и надежнее RAG.
- Используйте rclone для синхронизации облачных хранилищ.
- Дайте агенту доступ к файловой системе и нормальным тулам поиска - часто лучше наивного RAG.
---
Этот проект оказался интереснее чем я ожидал. Куча нюансов, неочевидных решений и инсайтов, которыми буду делиться дальше. Продолжение следует.
rclone (или иногда агенту нужны просто файлы)Делаем агента для европейской маркетинговой компании. Они год мучались с RAG - индексировали, чанкали, перебирали эмбединги, то лагает, то галлюцинирует, то не находит нужное.
Предложил радикально другой подход: выкинуть RAG, вместо этого - Claude Agent SDK + обычная файловая система и MCP как интерфейс. Сделал им прототип - результат настолько лучше, что сначала не поверили. Сравнить можно +/- с тем, насколько Claude Code лучше чем обычный AI чат в кодинге. Поиск по гигабайтам PDF, DOCX, PPTX - доли секунды. Залетает новый файл - агент сразу готов его учитывать. Никакого чанкинга, никакой индексации. По сути - это то же самое что Claude Code или Codex CLI делают с кодовой базой, только тут вместо code base у нас knowledge base.
Но есть нюанс, и даже несколько. Вообще, планирую серию постов на эту тему, начну с проблемы синхронизации файлов и ее решения.
Итак, проблема. Основной источник знаний в их случае - Google Drive. Там все: презентации клиентам, стратегии, исследования. Но делать квери туда - слишком долго и мы ограничены только встроенным поиском драйва - не пойдет. Нам нужно чтобы Claude Code (Agent SDK) шустро шуршал по файлам.
Решение - rclone
Rclone - это как rsync для облачных хранилищ. Поддерживает Google Drive, OneDrive, Dropbox и десятки других. Крутая штука: умеет автоматически экспортировать форматы. Google Docs превращается в .docx, Sheets в .xlsx, презентации в .pptx и тд.
rclone sync "gdrive:/" "/local/path" --drive-export-formats docx,xlsx,pptx
Файлы летят на сервер, конвертируются, агент работает с ними как с обычными файлами.
Почему file-first лучше
Storage дешевый и быстрый. Иногда (особенно для использования внутри компании) куда проще загрузить все на диск и работать с файлами напрямую, чем городить удаленный инджестинг с векторными базами и пайплайн индексации.
Современные CLI агенты прекрасно справляются с файловым поиском. "Найди все упоминания проекта X за последние 3 месяца" - делает за секунды через обычные файловые операции. Когда нужно читает файлы по частям или целиком. А еще на лету пишет скрипты для работы с ними если надо (!), собственно эту концепцию сейчас и продвигают Антропик со своими Skills.
В общем, если строите агента для работы с документами:
- Посмотрите на file-first подход. Может быть быстрее и надежнее RAG.
- Используйте rclone для синхронизации облачных хранилищ.
- Дайте агенту доступ к файловой системе и нормальным тулам поиска - часто лучше наивного RAG.
---
Этот проект оказался интереснее чем я ожидал. Куча нюансов, неочевидных решений и инсайтов, которыми буду делиться дальше. Продолжение следует.
Forwarded from Refat Talks: Tech & AI
Продолжаю про file-first подход к агентам для работы с базами знаний. В прошлом посте рассказал про общий концепт и rclone. В этом посте как и обещал расскажу про поиск по бинарным (не-текстовым) файлам.
Напомню что общая идея - использовать всю мощь передовых кодинг-агентов (в данном случае Claude Code) для задачи работы с базами знаний.
Итак, синхронизация настроена, имеем на быстром диске файлы, но большинство из них в формате Word, PDF, Excel, PowerPoint. По дефолту Claude Code (а точнее в его обертке под названием Agent SDK) доступны все инструменты для поиска по текстовым файлам (grep, ripgrep и тд), но эти файлы не текстовые.
Первая мысль была: ок, давай конвертнем все в plain text (есть же docling, markitdown и тд). Но хотелось чего-то проще, не хотелось строить пайплайн индексации: это и время, и дублирование источника истины, и проблема инвалидации - файлы-то постоянно обновляются. Хотелось найти решение которое работает напрямую с Office файлами.
Эксперименты
Создал тестовое окружение: 150 документов в разных форматах и сравнивал такой шортлист, который мне подкинул deep research:
- ripgrep c расширенными настройками (на самом деле их было больше) - почти сразу отпал
- pdfgrep - прекрасно ищет по PDF файлам
- ugrep - хоть и ищет по всем файлам, но по-началу давал средние результаты, например был хуже pdfgrep для pdf и плохо искал по презентациям, но потом я открыл его суперсилу - фильтры!
Фильтры ugrep - вот где магия
ugrep умеет на лету конвертить файлы через внешние тулы перед поиском. Для этого используется флаг
Пример:
Или еще проще:
Самое крутое - ugrep уже идет с набором преднастроенных фильтров для популярных форматов. В итоге pdfgrep и другие специализированные тулы оказались не нужны -
ugrep еще умеет искать в архивах (zip, tar, gz) без распаковки, поддерживает fuzzy-поиск и regex с Unicode, может выдавать контекст вокруг найденного текста с подсветкой и все это можно конфигурировать через .ugrep конфиг-файл. Короче, швейцарский нож для поиска.
По скорости. На деле с быстрым диском поиск по тысячам документам занимает доли секунды и не является узким местом в агентных сценариях. Но если база огромная и нужна реальная скорость - у ugrep есть встроенная система индексирования через
Далее, чтобы это эффективно работало было несколько раундов работы с промптом агента. Одна из лучших идей оказалась - инструктировать агента сначала запускать команду
Почему file-first - это кайф
Мне нравится работать в file-first экосистеме. Linux - это filesystem-first операционка и в этом мире много сильных инженеров и очень развитый опенсорс. Поражаешься как много эффективных и производительных тулов доступны, они просто работают. Плюс это же все текстовые интерфейсы - CLI + stdin/stdout - кодинговые агенты (считай LLM) с ними на ты. Никаких API оберток, никаких дополнительных слоев абстракции. Просто композиция мощных Unix-тулов.
В будущих постах по этой теме планирую покрыть:
- Другие челленджи: чтение и понимание содержимого нетекстовых файлов
- Когда все-таки нужны индексы или "шпаргалки" (или навигаторы) для таких агентов
- Опыт с Remote MCP и вопросы авторизации
- Подходы к разграничению прав доступа
- Вопросы изоляции (безопасность)
🔥 ➕ 🔁поддержите если хотите больше на эту тему
Напомню что общая идея - использовать всю мощь передовых кодинг-агентов (в данном случае Claude Code) для задачи работы с базами знаний.
Итак, синхронизация настроена, имеем на быстром диске файлы, но большинство из них в формате Word, PDF, Excel, PowerPoint. По дефолту Claude Code (а точнее в его обертке под названием Agent SDK) доступны все инструменты для поиска по текстовым файлам (grep, ripgrep и тд), но эти файлы не текстовые.
Первая мысль была: ок, давай конвертнем все в plain text (есть же docling, markitdown и тд). Но хотелось чего-то проще, не хотелось строить пайплайн индексации: это и время, и дублирование источника истины, и проблема инвалидации - файлы-то постоянно обновляются. Хотелось найти решение которое работает напрямую с Office файлами.
Эксперименты
Создал тестовое окружение: 150 документов в разных форматах и сравнивал такой шортлист, который мне подкинул deep research:
- ripgrep c расширенными настройками (на самом деле их было больше) - почти сразу отпал
- pdfgrep - прекрасно ищет по PDF файлам
- ugrep - хоть и ищет по всем файлам, но по-началу давал средние результаты, например был хуже pdfgrep для pdf и плохо искал по презентациям, но потом я открыл его суперсилу - фильтры!
Фильтры ugrep - вот где магия
ugrep умеет на лету конвертить файлы через внешние тулы перед поиском. Для этого используется флаг
--filter или его алиас `ug+`. Работает просто: ты говоришь "для файлов .docx юзай pandoc, для .pdf юзай pdftotext" и все.Пример:
ugrep --filter="docx:pandoc %f -t plain" --filter="pdf:pdftotext % -" "искомая фраза"
Или еще проще:
ug+ "искомая фраза"
Самое крутое - ugrep уже идет с набором преднастроенных фильтров для популярных форматов. В итоге pdfgrep и другие специализированные тулы оказались не нужны -
ugrep is all you need.ugrep еще умеет искать в архивах (zip, tar, gz) без распаковки, поддерживает fuzzy-поиск и regex с Unicode, может выдавать контекст вокруг найденного текста с подсветкой и все это можно конфигурировать через .ugrep конфиг-файл. Короче, швейцарский нож для поиска.
По скорости. На деле с быстрым диском поиск по тысячам документам занимает доли секунды и не является узким местом в агентных сценариях. Но если база огромная и нужна реальная скорость - у ugrep есть встроенная система индексирования через
ugrep-indexer, которая может дать ускорение в разы.Далее, чтобы это эффективно работало было несколько раундов работы с промптом агента. Одна из лучших идей оказалась - инструктировать агента сначала запускать команду
tree чтобы понять структуру директорий, а потом уже делать таргетированные запросы. Это хорошо фокусирует поиск и помогает агенту лучше ориентироваться в контексте.Почему file-first - это кайф
Мне нравится работать в file-first экосистеме. Linux - это filesystem-first операционка и в этом мире много сильных инженеров и очень развитый опенсорс. Поражаешься как много эффективных и производительных тулов доступны, они просто работают. Плюс это же все текстовые интерфейсы - CLI + stdin/stdout - кодинговые агенты (считай LLM) с ними на ты. Никаких API оберток, никаких дополнительных слоев абстракции. Просто композиция мощных Unix-тулов.
В будущих постах по этой теме планирую покрыть:
- Другие челленджи: чтение и понимание содержимого нетекстовых файлов
- Когда все-таки нужны индексы или "шпаргалки" (или навигаторы) для таких агентов
- Опыт с Remote MCP и вопросы авторизации
- Подходы к разграничению прав доступа
- Вопросы изоляции (безопасность)
🔥 ➕ 🔁
Forwarded from Институт AIRI
Учёные Института AIRI создали открытую платформу VLA Arena, чтобы исследователи, инженеры и даже любители могли сравнивать и оценивать современные модели управления роботами ⤵️
VLA Arena поддерживает компактные манипуляторы, доступные для самостоятельной сборки или в готовом виде, которые используются в образовательных и исследовательских целях.
На платформе можно:
⚫️ Тестировать модели в симуляции и на реальных роботах
⚫️ Следить за объективной таблицей лидеров с оценками пользователей
⚫️ Поддерживать модели с открытым исходным кодом, включая адаптированные для русского языка версии
⚫️ Найти датасеты и инструменты для обучения собственных моделей
Первый запуск платформы продлится три месяца.
📎 VLA Arena доступна по ссылке.
VLA Arena поддерживает компактные манипуляторы, доступные для самостоятельной сборки или в готовом виде, которые используются в образовательных и исследовательских целях.
На платформе можно:
Первый запуск платформы продлится три месяца.
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from эйай ньюз
Heretic — автоматическое снятие цензуры с LLM
В прошлом году несколько исследователей решило разобраться как именно работает механизм отказов в языковых моделях, когда они блокируют "вредные" запросы. Оказалось что за отказ LLM выполнять запрос отвечает одно единственное направление в пространстве активаций. А вот сейчас на основе этого ресёрча сделали софт для автоматического снятия цензуры.
Heretic вычисляет "направления отказа" как разницу средних активаций между вредными и безвредными промптами, затем ортогонализирует веса аттеншна и MLP проекций для удаления этого направления. Оптимизатор автоматически подбирает параметры подавления, минимизируя одновременно количество отказов и KL-divergence от оригинальной модели.
Работает полностью автоматически — просто запускаешь на любой поддерживаемой модели и через 45 минут получаешь версию без цензуры. Поддерживает большинство популярных архитектур включая Llama, Qwen, Gemma и даже некоторые мультимодальные модели. Той же gpt-oss снятие цензуры точно не помешает.
https://github.com/p-e-w/heretic
@ai_newz
В прошлом году несколько исследователей решило разобраться как именно работает механизм отказов в языковых моделях, когда они блокируют "вредные" запросы. Оказалось что за отказ LLM выполнять запрос отвечает одно единственное направление в пространстве активаций. А вот сейчас на основе этого ресёрча сделали софт для автоматического снятия цензуры.
Heretic вычисляет "направления отказа" как разницу средних активаций между вредными и безвредными промптами, затем ортогонализирует веса аттеншна и MLP проекций для удаления этого направления. Оптимизатор автоматически подбирает параметры подавления, минимизируя одновременно количество отказов и KL-divergence от оригинальной модели.
Работает полностью автоматически — просто запускаешь на любой поддерживаемой модели и через 45 минут получаешь версию без цензуры. Поддерживает большинство популярных архитектур включая Llama, Qwen, Gemma и даже некоторые мультимодальные модели. Той же gpt-oss снятие цензуры точно не помешает.
https://github.com/p-e-w/heretic
@ai_newz
Все ждут выхода Gemini 3 буквально сегодня. На крайняк - до конца недели..
Тестирую Gemini 3 )) пока тяжело сказать, чем отличается от 2.5, буду судить по ошибкам..
Пытаюсь поставить также Gemini Antigravity - IDE от Google, пока с этим что-то сбоит
Пытаюсь поставить также Gemini Antigravity - IDE от Google, пока с этим что-то сбоит
Не Gemini 3 единым. Сейчас работаю с несколькими модельками, которые помещаются на компе - для OCR. Если все получится, расскажу подробнее.
Поэтому появление новых маленьких умных моделек, как минимум, интересно. Хотя таким бенчам все-таки тяжело.
Подробнее, что крутого в этой модельке, здесь
Поэтому появление новых маленьких умных моделек, как минимум, интересно. Хотя таким бенчам все-таки тяжело.
Подробнее, что крутого в этой модельке, здесь
huggingface.co
rl-research/DR-Tulu-8B · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
По ссылке в сообщении ниже - полезная информация от разработчиков Gemini. Вообще, у Google какая безумная куча всевозможных фишек, настроек, плавунов и пр. - разобраться в этом чрезвычайно тяжело. Тяжело и получить базовые простые апи, токены и пр. (хотя стало легче, чем раньше). Но зато у компании самый широкий спектр моделей, в целом омнимодальность - не удивлен, что Баффет вложился именно в Гугл.
Из того, на что стоит обратить внимание - можно пользоваться последними моделями бесплатно, с очень щедрыми лимитами, но Гугл будет использовать ваши данные. Имейте это ввиду. Антропия и чат ОпенЭйАй тоже пытаются сделать что-то такое, но только у них бесплатного кот наплакал. А Гугл может себе это позволить, понимая, что самое ценное сейчас - данные. Если хочется прайваси, видимо тоже надо заплатить за платную подписку
https://t.me/machinelearning_interview/2335
Из того, на что стоит обратить внимание - можно пользоваться последними моделями бесплатно, с очень щедрыми лимитами, но Гугл будет использовать ваши данные. Имейте это ввиду. Антропия и чат ОпенЭйАй тоже пытаются сделать что-то такое, но только у них бесплатного кот наплакал. А Гугл может себе это позволить, понимая, что самое ценное сейчас - данные. Если хочется прайваси, видимо тоже надо заплатить за платную подписку
https://t.me/machinelearning_interview/2335
Telegram
Machine learning Interview
⚡️ Вышел подробный гайд по Gemini 3 - новой флагманской модели Google DeepMind, которая в ряде задач уже опережает другие топовые решения.
Внутри разбор возможностей модели, примеры создания реальных приложений, рекомендации по настройке промтов и системных…
Внутри разбор возможностей модели, примеры создания реальных приложений, рекомендации по настройке промтов и системных…
Очень интересная модель SAM-3 от Meta, которая выделяет что-то на картинке и следит за этим на видео. Пригодится нам для анализа видео с птицами на полигонах ))
И да, опен-сорс!
И да, опен-сорс!
Meta AI
SAM 3.1: Faster and More Accessible Real-Time Video Detection and Tracking With Multiplexing and Global Reasoning
А в то же время лидером по скачиванию на Hugging Face становится VibeThinker-1.5B, крошечная модель, которая размышляет на уровне got-oss-20B. Можно ставить буквально на любом компе
huggingface.co
Qwen/Qwen2.5-1.5B · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Forwarded from Data Secrets
Видимо, они хотят хотя бы немного перебить хайп вокруг Gemini. Вот что в релизе действительно интересного:
Также для Windows появился Agent mode, с помощью которого агент может работать в терминале автономно (доступы можно настраивать).
«Претрейн и test-time не уперлись в стену» – написал Ноам Браун про релиз. Это он намекает, что масштабирование продолжается.
При этом благодаря новой фишке – «компакции» – Codex теперь может работать с огромными контекстами. Это как бы аналог краткосрочной и долгосрочной памяти. Когда лимит токенов контекстного окна близок, модель сжимает самую старую информацию, а затем вместе с этой выжимкой + последней актуальной информацией переходит в новое контекстное окно. Процесс может повторяться много раз.
Уже доступно в IDE и Codex CLI, в API завезут «soon»
openai.com/index/gpt-5-1-codex-max/
Please open Telegram to view this post
VIEW IN TELEGRAM
Говорят, Сбер раскатал GigaChat3 на базе DeepSeek, плюс выкатил еще кучу моделей
https://t.me/lovedeathtransformers/10018
https://t.me/lovedeathtransformers/10018
Telegram
Love. Death. Transformers.
Сбер выпустил новую линейку генеративных моделей Kandinsky 5.0 в open source — с кодом, весами и под лицензией MIT
Линейку представили на международной конференции Сбера - AI Journey. В нее вошли нейросети:
– Video Pro - превосходит Wan2.2-A14B и работает…
Линейку представили на международной конференции Сбера - AI Journey. В нее вошли нейросети:
– Video Pro - превосходит Wan2.2-A14B и работает…
Forwarded from Анализ данных (Data analysis)
Media is too big
VIEW IN TELEGRAM
Построенная на архитектуре DiT, модель поднимает планку по качеству и доступности.
Что важно:
⚡️ Всего 8.3B параметров - модель можно запускать даже на потребительских GPU с 14GB VRAM
🖥️ Качество: генерирует 5–10 секунд видео в 480p/720p, а через суперразрешение —ё- до 1080p с киношной детализацией
SOTA-качество с очень низкими требованиями к железу.
@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Вообще, на этой неделе Сбер и AIRI прекрасно выступили, запустив кучу русскоязычных опенсорсных моделей. Обязательно буду их пробовать
Replit дает бесплатный доступ к своим агентам на ограниченное время
replit
AI App and Website Builder
Describe what you want. Replit builds it. Get a working app or website in minutes. No coding required.
Forwarded from Data Secrets
This media is not supported in your browser
VIEW IN TELEGRAM
О, вышел Cursor 2.1
– Добавили функцию «Find Issues»: поиск и исправление багов по одной кнопке. Агент делает ревью кода и тут же показывает найденные проблемы в боковой панели. В течение этой недели фичу можно тестить бесплатно.
– Напоминаем, что в Cursor недавно обновили поиск, и теперь он работает на базе векторов (как именно, мы писали тут). Так что для любителей пользоваться старым добрым grep его вынесли отдельно. Работает почти мгновенно и ищет по всей кодовой базе, включая точные совпадения и регулярки.
– Улучшили режим планирования. Теперь агент будет задавать уточняющие вопросы, когда вы утверждаете план действий, и отвечать на них можно прямо в новом интерактивном режиме (выглядит прикольно, пример на видео).
Раскрывают постепенно на всех пользователей (ченчлог)
– Добавили функцию «Find Issues»: поиск и исправление багов по одной кнопке. Агент делает ревью кода и тут же показывает найденные проблемы в боковой панели. В течение этой недели фичу можно тестить бесплатно.
– Напоминаем, что в Cursor недавно обновили поиск, и теперь он работает на базе векторов (как именно, мы писали тут). Так что для любителей пользоваться старым добрым grep его вынесли отдельно. Работает почти мгновенно и ищет по всей кодовой базе, включая точные совпадения и регулярки.
– Улучшили режим планирования. Теперь агент будет задавать уточняющие вопросы, когда вы утверждаете план действий, и отвечать на них можно прямо в новом интерактивном режиме (выглядит прикольно, пример на видео).
Раскрывают постепенно на всех пользователей (ченчлог)
Forwarded from Denis Sexy IT 🤖
Я тут понял, что второй после ChatGPT AI-продукт который я использую, это Google AI Studio: https://aistudio.google.com/
Я уже нахваливал его пару раз в канале, но в этот раз хотел отдельно рассказать про их кодинг агента который живет под неприметным "Build": https://aistudio.google.com/app/apps
Это что-то вроде бесплатного Lovable, эта фигня не просто соберет вам красивую веб страницу, но она умеет в GenAI пайплайны, в том числе к генерации картинок – вот строительные блоки к которым имеет доступ агент:
Самое клевое, что вы не просто можете один раз вызвать LLM (как в обычном режиме Playground), вы можете заставить ее отвечать в Structured Output (на картинке детали параметров), поменять температуру, и другие настройки семплинга - и даже сделать пайплайн, где ответ от одной модели попадает на вход в другую модель
Если у вас в голове есть идея "А что если отряд LLM-агентов работал бы над какой-то задачей" и все кодинг фреймворки кажутся душными чтобы быстро проверить, вам сюда
Единственное ограничено, которое вы встретите в какой-то момент – это лимит бесплатных запросов в N времени; для того чтобы это снять, можно подключить свой API ключ через кнопку🔑 и сможете вайбкодить сложные пайплайны которые делают 1000 запросов в минуту к какой-то Gemini Flash 2.5, что за глаза хватает для почти всех идей и стоит копейки (точно также я подключил Nano Banana Pro, потому что она без API ключа в AI Studio не работает)
Короче, Gemini апп мне не нравится, а вот AI Studio реально для АИ инженеров делают, шикарный продукт
P.S. Есть забавный баг, в какой-то момент их агент начинает забывает редактировать код – а пишет будто редактирует, нужно на него накричать капсом и все заведется💡
Я уже нахваливал его пару раз в канале, но в этот раз хотел отдельно рассказать про их кодинг агента который живет под неприметным "Build": https://aistudio.google.com/app/apps
Это что-то вроде бесплатного Lovable, эта фигня не просто соберет вам красивую веб страницу, но она умеет в GenAI пайплайны, в том числе к генерации картинок – вот строительные блоки к которым имеет доступ агент:
🔍 Google Search🌐 Google Maps🟦 Function Declarations (Вы можете сделать свой тул для модели который будет вызываться аппом когда он считает нужным)✍️ Текст и общие задачи:
gemini-2.5-flash
gemini-3-pro-preview
gemini-flash-lite-latest🍎 Изображения:
gemini-2.5-flash-image
gemini-3-pro-image-preview (новая нана банана)
imagen-4.0-generate-001🎬 Видео:
veo-3.1-fast-generate-preview
veo-3.1-generate-preview🔊 Аудио и речь:
gemini-2.5-flash-native-audio-preview-09-2025
gemini-2.5-flash-preview-tts
Самое клевое, что вы не просто можете один раз вызвать LLM (как в обычном режиме Playground), вы можете заставить ее отвечать в Structured Output (на картинке детали параметров), поменять температуру, и другие настройки семплинга - и даже сделать пайплайн, где ответ от одной модели попадает на вход в другую модель
Если у вас в голове есть идея "А что если отряд LLM-агентов работал бы над какой-то задачей" и все кодинг фреймворки кажутся душными чтобы быстро проверить, вам сюда
Единственное ограничено, которое вы встретите в какой-то момент – это лимит бесплатных запросов в N времени; для того чтобы это снять, можно подключить свой API ключ через кнопку
Короче, Gemini апп мне не нравится, а вот AI Studio реально для АИ инженеров делают, шикарный продукт
P.S. Есть забавный баг, в какой-то момент их агент начинает забывает редактировать код – а пишет будто редактирует, нужно на него накричать капсом и все заведется
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1