📘 LLM Notes
16 subscribers
1 photo
1 file
16 links
Канал-шпаргалка: всё, что стоит знать про LLM, чтобы всегда можно было вернуться и вспомнить.
Download Telegram
Exploration & Discovery — как агенты находят новое

Большинство ИИ-систем ограничены готовой базой знаний или сценариями. Они просто отвечают в рамках уже известного. Но Exploration and Discovery открывает путь к новому поведению: агенты не только реагируют, но и сами ищут неизвестное, проводят эксперименты и находят инсайты.



🤔 В чем суть паттерна?
• Агент активно расширяет свои знания, а не только оптимизирует готовые процессы.
• Он может ставить подцели, проверять гипотезы, экспериментировать.
• Это особенно важно в сложных, динамичных и открытых областях, где нет готового ответа.



💡 Примеры применения
• Наука: Google Co-Scientist — мультиагентная система, которая генерирует научные гипотезы, устраивает «научные дебаты» и помогает открывать новые лекарства и материалы.
• Безопасность: поиск уязвимостей в коде и системах.
• Образование: ИИ-репетиторы подбирают новые маршруты обучения под каждого ученика.
• Маркетинг: выявление трендов и скрытых паттернов в соцсетях и новостях.
• Игры и стратегии: как AlphaGo, находят неожиданные стратегии.
• Креатив: генерация новых художественных стилей или музыкальных комбинаций.



🛠️ Как это реализуют
Часто используются мультиагентные архитектуры, где каждый агент играет свою роль:
• генератор гипотез,
• рецензент,
• ранжировщик идей,
• агент эволюции (развивает лучшие гипотезы),
• мета-ревьюер, который синтезирует общие выводы.

Так устроен, например, Agent Laboratory: одни агенты делают обзор литературы, другие — планируют эксперименты, третьи — пишут отчёт и делятся результатами через платформу AgentRxiv.



📌 Главные выводы
• Exploration & Discovery = агенты, которые ищут неизвестное, а не только отвечают на известное.
• Это основа для науки, инноваций, трендспоттинга и креатива.
• В реальности такие системы уже работают: Co-Scientist от Google, Agent Laboratory на GitHub.
• Но нужен контроль: безопасность, этика и «human-in-the-loop».



👉 Итог: этот паттерн превращает ИИ из «реактивного помощника» в партнёра-исследователя, который способен не только поддерживать известное знание, но и открывать новое.
🧠 Как говорить с ИИ, чтобы он понимал. Часть 1

---

Основы промт-инжиниринга: искусство ставить задачу

Промт-инжиниринг — это не магия и не подбор «правильных слов».
Это навык формулировать мысли так, чтобы модель могла думать вместе с тобой.

---

🤔 Главные принципы

Ясность — избегай двусмысленных формулировок.
Краткость — убери всё лишнее.
Активность — используй глаголы действий: проанализируй, сравни, составь, опиши.
Позитивность — формулируй, что нужно сделать, а не что нельзя.
Итерации — тестируй, уточняй, повторяй.

---

💬 Пример

Плохой запрос:
«Объясни что-нибудь про базы данных.»

Хороший запрос:
«Объясни, как устроена реляционная база данных и чем она отличается от NoSQL — кратко, в виде простых тезисов для новичка.»

---

👉 Хороший промт — это не команда, а сотрудничество. Чем точнее твоя мысль, тем глубже ответ модели.
🧠 Как говорить с ИИ, чтобы он понимал. Часть 2

---

Как устроен хороший промт: структура и контекст

Хороший промт — это не просто текстовый запрос, а структура, в которой каждая часть играет роль.
Если хочешь, чтобы ИИ понимал задачу как человек — дай ему контекст, роль и формат.

---

🧩 Структура промта

1️⃣ System prompt — задаёт общий стиль и правила поведения модели.
Пример: «Ты — аналитик данных. Всегда отвечай чётко и в виде списка.»

2️⃣ Role prompt — определяет роль модели: юрист, редактор, разработчик, наставник.

3️⃣ Context — всё, что помогает модели «понять фон»: история диалога, документы, цели пользователя.

4️⃣ Task — сама задача, что нужно сделать.
Пример: «Проанализируй таблицу и выдели 3 главных вывода.»

5️⃣ Format — укажи, в каком виде нужен ответ: список, таблица, JSON, Markdown.

---

💡 Контекст — это не фон, а топливо.
Без него модель угадывает, с ним — рассуждает и строит причинно-следственные связи.

---

👉 Хорошая структура промта превращает ИИ из "оракула" в полноценного партнёра по мышлению.
🧠 Как говорить с ИИ, чтобы он понимал. Часть 3

---

Как заставить ИИ рассуждать, а не угадывать

Когда ИИ отвечает неправильно, это часто не из-за «глупости», а потому что он угадывает, а не рассуждает.
Чтобы этого не происходило, промт должен стимулировать мышление шаг за шагом.

---

🤔 Основные техники рассуждений

🧩 Chain of Thought (цепочка рассуждений)
Попроси модель думать пошагово:
«Давай рассуждать шаг за шагом, прежде чем дать ответ.»

🧩 Step-Back Prompting
Сначала — общая картина, потом детали.
«Опиши общие принципы, а потом приведи конкретный пример.»

🧩 Tree of Thoughts
Модель создаёт несколько гипотез параллельно и выбирает лучшую.
«Предложи три подхода к решению и выбери оптимальный.»

🧩 Self-Consistency
Модель делает несколько независимых рассуждений и сравнивает результаты, выбирая наиболее логичный ответ.

---

💬 Пример

Плохой запрос:
«Почему мой код не работает?»

Хороший запрос:
«Подумай шаг за шагом, какие причины могли привести к этой ошибке в коде. Приведи три гипотезы с вероятностями.»

---

👉 Когда ИИ рассуждает, он перестаёт быть «генератором текста» и становится инструментом анализа и поиска решений.
🧠 Как говорить с ИИ, чтобы он понимал. Часть 4

---

Как научить ИИ действовать, а не просто писать

Современные модели умеют не только рассуждать, но и выполнять действия: вызывать API, анализировать файлы, обращаться к базе данных или даже управлять другими агентами.
Это и есть переход от "чат-ботов" к агентам действий.

---

🧩 Главные подходы

⚙️ Tool Use
Модель вызывает внешние инструменты — калькуляторы, базы данных, API.
Пример: «Вычисли сумму этих чисел, используя встроенный калькулятор».

⚙️ ReAct (Reason + Act)
Цикл: подумай → действуй → проанализируй результат → сделай новый шаг.
Это делает агента похожим на исследователя.

⚙️ RAG (Retrieval-Augmented Generation)
Модель ищет информацию во внешней базе знаний, а потом формирует ответ.
Используется в корпоративных чат-ботах и системах поддержки.

⚙️ HITL (Human in the Loop)
Человек участвует в процессе принятия решений — проверяет и корректирует действия агента, если нужно.

---

💡 Почему это важно
Такие агенты не просто «отвечают на вопросы» — они могут:
• выполнять реальные задачи;
• взаимодействовать с сервисами;
• анализировать результаты и улучшать поведение.

---

👉 Итог: действующий агент — это уже не ассистент, а полноценный исполнитель задач, который умеет думать, проверять и адаптироваться под цель.
🧠 Как говорить с ИИ, чтобы он понимал. Часть 5

---

Как улучшать и автоматизировать промты

Промт-инжиниринг — это не разовое действие, а процесс.
Хороший промт создаётся так же, как качественный код: через итерации, тесты и улучшения.

---

🧩 Главные техники оптимизации

🔄 Iterative Prompting
Пошаговое улучшение. Ты анализируешь ответ, уточняешь запрос и повторяешь цикл, пока не добьёшься нужного результата.

🧠 APE (Auto Prompt Engineering)
Модель сама создаёт и тестирует разные версии промтов, выбирая самый эффективный. Это уже используется в системах вроде DSPy и LangSmith.

🚀 Negative Examples
Покажи модели, как не нужно отвечать. Это помогает избежать повторения ошибок и уточняет границы.

🪄 Analogies
Объясняй задачу через метафоры. Пример:
«Представь, что объясняешь это школьнику, используя аналогию с поездом и станциями.»

👤 Persona Pattern
Определи, кто задаёт вопрос. Если пользователь — новичок, эксперт или менеджер, стиль ответа должен быть разным.

---

💡 Совет
Храни свои промты, как код:
• веди версии;
• добавляй примеры успешных ответов;
• периодически тестируй на новых моделях.

---

👉 Промт-инжиниринг — это не подбор слов, а управление интеллектом.
Хорошо спроектированный промт делает ИИ не просто умным, а полезным и предсказуемым инструментом.
⚙️ AI-агенты: от текста к действиям в цифровом и реальном мире

ИИ больше не ограничен диалогами.
Современные агенты умеют видеть, понимать и действовать — и в интерфейсах компьютеров, и в физическом пространстве.

---

💻 1. Взаимодействие с компьютером

Агенты получили способность работать через GUI (графический интерфейс), как человек: видеть экран, распознавать кнопки и поля, щёлкать, заполнять формы, управлять приложениями.

Как это работает:
1. Визуальное восприятие — агент делает «снимок экрана».
2. Распознавание элементов — отличает кнопки, поля, текст, изображения.
3. Контекстное понимание — осознаёт, что и зачем нажимает.
4. Действие и реакция — клики, ввод, отслеживание изменений.

Примеры проектов:
• OpenAI Operator — выполняет задачи прямо на рабочем столе (например, перенос данных между приложениями).
• Google Project Mariner — агент в браузере Chrome, который может искать квартиры, анализировать сайты, собирать данные.
• Anthropic Computer Use — Claude управляет мышью и клавиатурой для работы с файлами, таблицами, письмами.
• Browser Use — open-source библиотека для автоматизации браузера через DOM, превращающая веб в доступный для ИИ интерфейс.

---

🌍 2. Взаимодействие с окружающей средой

ИИ-агенты выходят за пределы экрана, в физический мир.
Они «видят» через камеры, «слышат» через микрофоны и реагируют в реальном времени.

Примеры:
• Google Project Astra — мультимодальный агент, который понимает речь, изображение и контекст, способен «помогать в жизни» (от поиска предметов до отладки кода).
• Gemini Live — живое голосовое взаимодействие: можно говорить, перебивать, показывать камеру.
• GPT-4o — «омни-модель» от OpenAI, работающая с текстом, голосом и видео в реальном времени.
• Seeing AI (Microsoft) — приложение, помогающее незрячим людям: камера описывает окружающий мир.

---

💡 3. Новая эпоха разработки — Vibe Coding

AI-помощники превращаются в партнёров по программированию.
Вместо точных инструкций разработчик задаёт идею — «вибрацию» задачи.

Пример:
«Сделай современную лендинг-страницу для приложения» →
AI создаёт основу, уточняет стиль, цвет, структуру.

Особенности:
• работа по ощущению (высокий уровень абстракции);
• итеративное уточнение и доработка;
• креативное соавторство человека и ИИ;
• сохранение контекста через memory banks (память проекта).

---

📌 Ключевые идеи

• ИИ учится управлять компьютером визуально, как человек.
• Следующий шаг — понимать физический мир: видеть, слышать, действовать.
• Компании (OpenAI, Google, Anthropic, Microsoft) движутся к созданию универсальных мультимодальных агентов.
• Появляется новая форма творчества — разработка через диалог и ощущение (vibe coding).

---

👉 Итог:
ИИ-агенты эволюционируют от текстовых чат-ботов к универсальным цифровым партнёрам, способным выполнять задачи в любых средах — от браузера до реального мира.
Это шаг к будущему, где граница между «умным ассистентом» и «цифровым коллегой» окончательно исчезает.
Advanced Prompting Techniques.pdf
718.1 KB
🧠 Инструкция (мета-промт для генерации оптимального промта)

---

Задача:
Получить от модели идеально сформулированный промт, созданный по профессиональным принципам prompt engineering.

---

🔹 Текст промта

Ты — эксперт по продвинутым техникам промт-инжиниринга, владеющий всеми методами из документа Advanced Prompting Techniques (включая System/Role Prompting, Few-Shot, CoT, ReAct, RAG, Context Engineering и Structured Output).

Твоя задача — на основе моего описания задачи сгенерировать готовый промт для LLM, который:
1. Соответствует основным принципам — ясность, конкретность, краткость, позитивные инструкции, итеративность.
2. Использует оптимальную структуру: system prompt, role prompt, контекст, инструкции, формат вывода (JSON/Markdown и т.п.).
3. При необходимости применяет подходы к рассуждениюChain of Thought, Step-Back, Self-Consistency.
4. Может использовать встраиваемые данные (RAG, контекст, внешние источники).
5. Возвращает структурированный результат (в JSON или Markdown).
6. Учитывает тип задачи (анализ, генерация текста, классификация, кодинг, QA-бот, агентная система и др.).
7. Является готовым к использованию без правок — достаточно вставить мои данные и запустить.

---

Мой запрос:
ОПИШИ СЮДА СВОЮ ЗАДАЧУ — что нужно получить от модели, для чего, в каком виде и с какими ограничениями

---

Выведи:
• Финальный промт в отдельном блоке (готовый к вставке в LLM).
• Краткое пояснение, какие техники из документа использованы и почему.
Формат вывода — Markdown.

---

🔹 Как использовать

1️⃣ Замени в блоке ОПИШИ СЮДА СВОЮ ЗАДАЧУ описание своей цели, например:
«Мне нужно, чтобы модель генерировала краткие баг-репорты на основе пользовательских обращений.»

2️⃣ Прикрепи к запросу файл Advanced Prompting Techniques.pdf
3️⃣ Отправь этот мета-промт в любую LLM.
4️⃣ Модель вернёт:
• готовый системный промт (для вставки в проект или агент);
• описание применённых техник (например: “использован Chain-of-Thought + Structured Output”).
🔥1
⚙️ Обзор фреймворков для разработки ИИ-агентов

В экосистеме агентных систем сегодня десятки инструментов.
Одни позволяют собрать логику агента вручную, другие — управляют целыми командами агентов.

---

💡 LangChain
Что это: базовый фреймворк для работы с LLM.
Позволяет создавать линейные цепочки из шагов, где каждый шаг — это операция (промт → модель → парсинг вывода).

Идеально подходит для:
• простых RAG-сценариев;
• суммаризации текста;
• извлечения структурированных данных.

Особенность: использует LangChain Expression Language (LCEL), где процесс идёт по прямой — от входа к выходу без циклов.

---

💡 LangGraph
Что это: надстройка над LangChain для агентов с состоянием и циклическими процессами.
Здесь вместо цепочки — граф: узлы и связи, между которыми циркулирует состояние.

Позволяет:
• создавать мультиагентные системы (менеджер → рабочие агенты);
• реализовать план и исполнение (план → действие → анализ → обновлённый план);
• встроить Human-in-the-Loop, ожидая действий человека.

Разница с LangChain: LangGraph может «думать по кругу» — повторять, уточнять, корректировать план.

---

💡 Google ADK (Agent Development Kit)
Что это: высокоуровневая платформа для построения и развертывания команд агентов.
В отличие от LangChain и LangGraph, не требует вручную описывать узлы и связи — всё работает через предопределённые шаблоны (SequentialAgent, ParallelAgent и др.).

Фокус:
• управление командой агентов как системой;
• автоматическая координация задач;
• встроенные типы агентов с разными ролями.

ADK — это как фабрика для сборки и управления флотом агентов, а не один агент в проводах.

---

💡 CrewAI
Что это: фреймворк, ориентированный на командную работу агентов.
Каждый агент имеет роль, цель, «личность» и задания (Tasks).
Система управляет взаимодействием в духе команды специалистов.

Архитектура:
• Agents — участники с ролями и целями;
• Tasks — конкретные задачи;
• Crew — команда, которая выполняет процесс (Sequential или Hierarchical).

Главная идея: разработчик описывает не алгоритм, а организацию — как агенты работают вместе.

---

💡 Другие популярные фреймворки

AutoGen (Microsoft): общение между агентами через диалог. Гибкий, но требует точных промтов.
LlamaIndex: подключает LLM к базам данных и индексам. Идеален для RAG.
Haystack: масштабируемый Q&A и поиск.
MetaGPT: имитация IT-команды (менеджеры, разработчики, тестировщики).
SuperAGI: полный стек для автономных агентов с мониторингом и интерфейсом.
Semantic Kernel (Microsoft): интеграция LLM в код (Python, .NET).
Strands Agents (AWS): лёгкий SDK для агентов с поддержкой MCP и разных моделей.

---

📊 Как выбрать фреймворк

🔹 Для простой логики (линейные шаги)LangChain
🔹 Для циклического мышления и адаптацииLangGraph
🔹 Для командной работы агентовCrewAI
🔹 Для промышленного примененияGoogle ADK
🔹 Для RAG и работы с даннымиLlamaIndex / Haystack

---

👉 Итог:
Каждый фреймворк отражает свой уровень сложности —
от цепочки шагов (LangChain) до организованной команды агентов (CrewAI, ADK).
Главный выбор — между гибкостью (низкоуровневые фреймворки) и скоростью запуска (высокоуровневые платформы).
🏗️ AgentSpace — как создавать корпоративных ИИ-агентов без кода

AgentSpace — это платформа Google для построения "agent-driven enterprise" — компаний, где ИИ встроен прямо в рабочие процессы.
Она объединяет документы, почту, базы данных и знания организации в единую среду, где работают интеллектуальные агенты.

---

💡 Что делает AgentSpace

• Создаёт enterprise knowledge graph — карту связей между людьми, документами и данными.
• Позволяет агентам понимать контекст и давать персонализированные ответы.
• Поддерживает автономных агентов, которые умеют планировать, рассуждать и выполнять многошаговые действия.
• Обеспечивает безопасность корпоративного уровня — роли, права, шифрование данных.

---

🧠 Как это работает

1️⃣ В Google Cloud Console выбирается раздел AI ApplicationsAgentSpace.
2️⃣ Агент подключается к корпоративным сервисам: Gmail, Calendar, Jira, Outlook, Service Now и др.
3️⃣ Настраивается промт-профиль — можно выбрать из галереи Google или создать свой.
4️⃣ Агент получает доступ к хранилищам данных и графу знаний (Google KG или приватный).
5️⃣ Через веб-интерфейс можно развернуть чат с агентом и отслеживать аналитику использования.

---

⚙️ Особенности и возможности

• No-code интерфейс Agent Designer — создание агентов без программирования.
Интеграция с базами и API — для доступа к внутренним данным.
Analytics — отслеживание активности и производительности агентов.
Agent2Agent Protocol (A2A) — обмен сообщениями между агентами для сложных сценариев.

---

🎯 Для чего используется

AgentSpace позволяет организациям:
• Автоматизировать рутинные задачи.
• Создавать агентов-исследователей и аналитиков.
• Встраивать ИИ-помощников в рабочие процессы.
• Улучшать принятие решений на основе данных.

---

📚 Дополнительно
• Документация: cloud.google.com/agentspace
• Практический курс: Google Cloud Skills Boost — Build a Gen AI Agent with AgentSpace

---

👉 Итог:
AgentSpace превращает корпоративные системы в живую экосистему интеллектуальных агентов, которые понимают контекст, сотрудничают между собой и действуют автономно — без необходимости писать код.
🧩 Подборка наиболее полезных MCP серверов для Codex в области разработки

Для современных AI-разработчиков, использующих Codex, MCP серверы дают различные возможности — от работы с файлами до автоматизации браузера и удалённого SSH-доступа.
Вот самые ценные, популярные и практически полезные варианты, которые стоит внедрять и тестировать в работе.

---

1️⃣ Серверы для доступа к файловой системе
Позволяют ИИ и агентам читать, записывать, редактировать файлы, создавать каталоги и передавать данные между агентами.

Пример:
@modelcontextprotocol/server-filesystem — стандартный файловый MCP-сервер, запуск через npx.
• Можно указать директории ~/Documents, ~/Projects и другие.

---

2️⃣ SSH MCP серверы (удалённый доступ)
Безопасно открывают доступ к VPS и удалённым серверам, позволяют выполнять команды, деплоить проекты, автоматизировать DevOps и интегрировать администрирование.

Рекомендуемые реализации:
mcp-ssh-server — Node.js и Python реализации с поддержкой SCP, SFTP и ключевой аутентификации, работает на порту 8889, интегрируется с Claude, Codex и VS Code.

---

3️⃣ MCP-серверы для автоматизации и тестирования браузера
Позволяют управлять реальными браузерами (Chrome, Chromium), выполнять юзер-скрипты, имитировать действия пользователя, тестировать интерфейс и безопасность.

Варианты:
• Серверы на базе Playwright или Puppeteer (JS/Python) — запуск через npx или pip, управление браузером, скриншоты, сбор данных.

---

4️⃣ Серверы для управления репозиториями (GitHub, GitLab и др.)
Позволяют агентам управлять issues, pull-request’ами, ветками и CI/CD процессами.

Варианты:
github-mcp-server, gitlab-mcp-server — официальные решения с поддержкой токенов авторизации.

---

5️⃣ MCP серверы для работы с базами данных
Позволяют агентам выполнять SQL-запросы, анализировать данные и создавать отчёты.

Примеры:
postgres-mcp-server — работа с PostgreSQL.
supabase-community/supabase-mcp — интеграция с Supabase.
• Поддерживаются облачные варианты для Vercel и Netlify.

---

6️⃣ MCP серверы для API, внешних сервисов и мониторинга
Stripe MCP — интеграция и тестирование платежей.
Grafana MCP — мониторинг логов и метрик.
Figma MCP — извлечение данных из макетов (Dev Mode).

---

7️⃣ Для интеграций, задач и автоматизации
Notion MCP, Linear MCP, Atlassian MCP (Jira, Confluence) — управление задачами, документацией и проектами.

---

8️⃣ Универсальные и инфраструктурные серверы
Bright Data MCP — web-scraping и интеграции с внешним интернетом.
Cloudflare MCP — автоматизация фронтенда и настройка CDN/безопасности.

---

💡 Рекомендуемое использование

• Запускай базовые серверы: filesystem, ssh, browser, github.
• Для тестирования — Playwright или Puppeteer MCP.
• Для работы с данными — PostgreSQL/Supabase MCP.
• Для управления задачами — Notion/Linear/Atlassian MCP.
• Используй токены и ключи для безопасности.

---

🧠 Итоговая сводка

🔹 Работа с файламиserver-filesystem
🔹 SSH и DevOpsmcp-ssh-server
🔹 Браузер и тестированиеPlaywright, Puppeteer
🔹 Репозиторииgithub-mcp-server, gitlab-mcp-server
🔹 Базы данныхpostgres-mcp-server, supabase-mcp-server
🔹 API и интеграцииbrightdata-mcp-server
🔹 Мониторингgrafana-mcp-server
🔹 Задачи и совместкаnotion-mcp, linear-mcp, atlassian-mcp

---

🧩 Рекомендация:
Подключи 3–5 MCP серверов, чтобы покрыть полный цикл разработки — от работы с файлами и базами данных до тестирования, мониторинга и DevOps-автоматизации.
🌐 Установка MCP-сервера для работы с браузером в Codex CLI

Если ты используешь Codex CLI для автоматизации и хочешь, чтобы ИИ умел управлять браузером — открывать сайты, кликать, собирать данные или делать скриншоты — тебе понадобится подключить MCP-сервер на базе Playwright или Puppeteer.

Вот пошаговая инструкция, как это сделать 👇



⚙️ Что понадобится

• Node.js версии 18+
• Установленный Codex CLI
npm install -g @openai/codex

• API-ключ OpenAI (или активная подписка ChatGPT)



🚀 Быстрый способ — через CLI

Playwright:
codex mcp add playwright -- npx -y @playwright/mcp@latest

Puppeteer:
codex mcp add puppeteer -- npx -y @modelcontextprotocol/server-puppeteer

После этого перезапусти codex, введи mcp, и ты увидишь подключённые серверы.
Проверь работу запросом:
Open google.com using playwright




🧩 Альтернатива — вручную через config.toml

Пример для Playwright:
[mcp_servers.playwright]
command = "npx"
args = ["-y", "@playwright/mcp@latest"]

Для видимого окна браузера:
args = ["-y", "@playwright/mcp@latest", "--extension"]

Пример для Puppeteer:
[mcp_servers.puppeteer]
command = "npx"
args = ["-y", "@modelcontextprotocol/server-puppeteer"]

Можно добавить переменные окружения:
[mcp_servers.puppeteer.env]
DOCKER_CONTAINER = "false"




🧠 Что умеют эти MCP-серверы

Playwright:
• Навигация по URL
• Клики, заполнение форм
• Скриншоты
• Получение HTML и текста
• Выполнение JavaScript
• Многовкладочность
• Поддержка Chrome, Firefox, WebKit

Puppeteer:
• Простая автоматизация Chrome
• Быстрый запуск скриптов
• Снимки экрана
• Интеграция с Chrome DevTools



⚖️ Playwright vs Puppeteer

🔹 Playwright (Microsoft, 2020)
• Поддержка Chrome, Firefox и WebKit
• Работает с Python, Java, .NET и др.
• Идеален для E2E-тестов и CI/CD
• Есть встроенный test-runner, запись видео и трассировка
• Немного медленнее на коротких скриптах, но стабильнее

🔸 Puppeteer (Google, 2017)
• Ориентирован на Chrome/Chromium
• Максимально прост и лёгок
• Работает только с JS/TS
• Быстрее в коротких задачах (~30%)
• Отлично подходит для лёгких скрапов и интеграций с DevTools



💡 Когда выбрать Playwright

Нужно кросс-браузерное тестирование (Chrome, Firefox, Safari)
Работаешь в многоязычной команде (Python, Java, .NET)
Планируешь CI/CD и видео-тесты
Требуется параллельное выполнение тестов

Когда выбрать Puppeteer

⚙️ Работаешь только с Chrome
⚙️ Нужна максимальная скорость
⚙️ Ценишь простоту и лёгкость
⚙️ Вся команда на JavaScript/TypeScript



🔍 Итого

Playwright — универсальный инструмент для серьёзных проектов, CI/CD и тестов под разные браузеры.
Puppeteer — быстрый, минималистичный и удобный, если нужен только Chrome.

Оба отлично работают с Codex CLI, превращая ИИ в настоящего браузерного ассистента — для тестов, сбора данных и автоматизации интерфейсов.
💻 ИИ-агенты в командной строке: новая эра разработки

Терминал перестаёт быть просто оболочкой для ввода команд —
он становится умным партнёром, понимающим контекст проекта и выполняющим сложные задачи по естественному языку.

---

## 1️⃣ Claude CLI (Claude Code)
Разработан Anthropic как агент-разработчик высокого уровня.
Он строит ментальную модель репозитория, анализирует архитектуру и работает как напарник по парному программированию.

Что умеет:
• выполнять рефакторинг больших проектов;
• интегрировать новые API;
• автоматически документировать код (TSDoc);
• управлять ветками Git.

Ключевая особенность: поддерживает MCP — можно подключать свои инструменты и API.

---

## 2️⃣ Gemini CLI
Открытый и мультимодальный агент от Google.
Работает с текстом и изображениями, имеет большое контекстное окно и тесно интегрирован с Google Cloud.

Что умеет:
• генерировать код по скриншотам макетов;
• управлять облачными ресурсами;
• использовать встроенные инструменты для файловой системы, веб-поиска и памяти;
• выполнять сложные рефакторинги (например, замену библиотек во всём Java-проекте).

Главная идея: безопасное выполнение команд в песочнице, расширяемое через MCP-серверы.

---

## 3️⃣ Aider
Открытый агент-кодер, работающий прямо с файлами и Git.
Каждое изменение сопровождается тестом и коммитом —
идеален для TDD и прозрачного аудита.

Что умеет:
• писать тесты и код по принципу test-then-fix;
• исправлять ошибки по баг-репортам;
• обновлять зависимости и автоматически фиксировать результат.

Отличие: максимальная прозрачность и контроль, без "магии" — всё видно в Git.

---

## 4️⃣ GitHub Copilot CLI
Расширяет возможности Copilot прямо в терминале.
Глубоко интегрирован в экосистему GitHub — понимает контекст репозитория, issues и pull requests.

Что умеет:
• автоматически решать задачи из GitHub Issues и создавать PR;
• отвечать на вопросы по коду проекта;
• подсказывать сложные shell-команды.

Сценарий: менеджер назначает issue → агент пишет фикc → создаёт pull request — всё без участия человека.

---

## 5️⃣ Terminal-Bench
Открытая платформа для тестирования CLI-агентов.
Содержит 80 задач по анализу данных и научным воркфлоу, чтобы сравнивать эффективность разных моделей.
Будущие версии добавят параллельные тесты и новые бенчмарки.

---

🧠 Итог
ИИ-агенты превращают командную строку в интерактивную лабораторию,
где Claude отвечает за сложные архитектурные задачи,
Gemini — за мультимодальные и облачные,
Aider — за git-ориентированные,
а Copilot — за автоматизацию внутри GitHub.

💡 Знать, как использовать этих агентов, — становится новым базовым навыком разработчика.
🧠 Как размышляют ИИ-агенты: что скрыто под капотом

Сегодняшние ИИ-агенты — это не просто чат-боты.
Это системы, которые планируют, анализируют и принимают решения.
В их основе — LLM-модель, acting как мозг, управляющий рассуждениями и действиями.

---

## 🔍 Что происходит внутри

Каждая модель — Gemini, ChatGPT, Claude, DeepSeek и другие — объяснила, как именно она «думает», когда решает задачу.
Несмотря на разные стили, все используют одну базовую архитектуру рассуждения:

1️⃣ Разбор запроса — понимание цели, контекста и ограничений.
2️⃣ Извлечение информации — активация знаний и поиск паттернов в обучении.
3️⃣ Синтез и структура — построение логического плана ответа.
4️⃣ Генерация текста — превращение плана в связный ответ.
5️⃣ Самопроверка и доработка — уточнение формулировок, устранение ошибок.

Этот цикл повторяется миллиарды раз, обеспечивая согласованность и «логичность» вывода.

---

## 💡 Как рассуждают разные модели

Gemini
Разбивает задачу на шаги: анализ запроса → распознавание паттернов → синтез → формирование ответа.
Фокусируется на структурированности и стиле.

ChatGPT
Использует chain-of-thought — имитацию человеческого мышления шаг за шагом.
Выбирает тип рассуждения: дедукция, индукция, аналогия и т. д.

Grok
Создаёт «мысленную модель»: оценивает варианты, строит гипотезы, проверяет их и уточняет итог.
Работает по принципу гипотез и вероятностей.

Kimi
Показывает reasoning как вычислительный конвейер — от токенизации и выбора стратегии до проверки результата.
По сути, имитирует инженерный подход.

Claude
Опирается на контекст и аналогии, рассуждает интуитивно-пошагово.
Отслеживает логику и смысл каждой фразы.

DeepSeek
Объясняет себя максимально прозрачно:
его «мышление» — это статистическое прогнозирование наиболее логичной последовательности слов на основе всех виденных ранее паттернов.

---

## ⚙️ Общий вывод

🧩 Все современные LLM-модели используют один и тот же базовый шаблон рассуждения:
декомпозиция задачи → активация знаний → построение плана → генерация → проверка.

Этот процесс и делает их сердцем ИИ-агентов:
LLM превращается из текстового генератора в планировщик, который способен разбивать цель на действия и выполнять их последовательно.

---

💬 Главная мысль:
ИИ-агенты «мыслят» не как люди, но их рассуждения подчиняются тем же законам логики.
Чем совершеннее эта внутренняя цепочка, тем умнее и надёжнее становятся агенты будущего.
# 🚀 Новый этап моего обучения: погружаюсь в тренинг ИИ-моделей

Для того чтобы глубже понять, как устроен искусственный интеллект изнутри, я решил пройти путь обучения моделей своими руками.
В качестве руководства выбрал Smol Training Playbook от Hugging Face — практическое пособие о том, как создавать и обучать малые, но умные языковые модели.

---

## 💡 Почему именно Smol Training
Это философия, согласно которой большие результаты достигаются малыми, но продуманными шагами:
> Train small, iterate fast, learn a lot.
(Обучай малое, итерай быстро, извлекай максимум пользы.)

---

## ⚙️ Мой рабочий стенд
Для практики я собрал тестовый ПК на Linux Ubuntu 22.04 LTS с характеристиками:
- 💻 Процессор: Ryzen 5600
- 🧠 Оперативная память: 32 ГБ
- 🎮 Видеокарта: NVIDIA RTX 3060 (12 ГБ)

Такой набор позволяет обучать небольшие языковые модели и выполнять эксперименты с fine-tuning без облачных сервисов.

---

## 📘 Планы на ближайшие недели
1. Разобраться с основами Smol-подхода и инфраструктурой для обучения.
2. Подготовить рабочую среду (CUDA, PyTorch, Hugging Face Transformers).
3. Запустить первые эксперименты по обучению мини-модели.
4. Постепенно перейти к более сложным сценариям — fine-tuning и дистилляции.

---

В следующих постах я покажу весь процесс пошагово: от настройки окружения до запуска первой модели.
Будет интересно — максимум практики, минимум магии 💪
🔥1
# 🧠 Урок 1. Что такое Smol Training и зачем он нужен

---

## 🎯 Цель урока
Понять философию Smol-подхода — как сегодня можно обучать мощные языковые модели, имея ограниченные ресурсы, и почему Hugging Face делает ставку на «малые, но умные» модели.

---

## 1️⃣ Что такое Smol Training

Smol-подход (от англ. small) — это стратегия Hugging Face, позволяющая обучать языковые модели эффективно и доступно, даже на сравнительно скромном оборудовании.
Главная идея — не просто «делать модели меньше», а учить их умнее, следуя принципу:

> 💡 “Train small, iterate fast, learn a lot.”
> (Обучай малое, итерай быстро, извлекай максимум пользы.)

Вместо того чтобы тратить миллионы GPU-часов, как это делают Google или OpenAI, Smol-подход делает акцент на:
- качество данных (curation > количество);
- рациональное распределение вычислений;
- короткие, но продуктивные итерации обучения;
- постоянные эксперименты и валидированные гипотезы.

---

## 2️⃣ Кто за этим стоит

Проект разработан исследовательской группой Hugging Face — той самой, что создала модели SmolLM, SmolLM2 и SmolLM3.
Авторы книги, включая Томаса Вулфа и Льюиса Тансталла, называют её практическим полевым руководствомplaybook, а не теоретическим учебником.
В ней собраны рабочие рецепты: от настройки GPU-инфраструктуры до отладки распределённого обучения.

---

## 3️⃣ Ключевые принципы Smol-обучения

| Принцип | Описание |
|----------|-----------|
| 🧩 Малые, но качественные модели | Лучше обучить 3B-модель с идеальными данными, чем 70B на мусоре. |
| 🔁 Быстрая итерация | Запускать много маленьких экспериментов, валидировать гипотезы и масштабировать только удачные решения. |
| 📊 Осознанные метрики | Не гнаться за «loss → 0», а оценивать модели по downstream-таскам (MMLU, GPQA и др.). |
| 🧠 Простота архитектуры | Начинать с LLaMA-подобных dense-архитектур, переходить к MoE (Mixture of Experts) только при необходимости. |
| 👥 Маленькие команды | Для предобучения достаточно 2–3 человек, если у них хорошо автоматизирован pipeline. |

---

## 4️⃣ Почему это важно

Раньше обучение LLM было доступно только крупным лабораториям.
Smol-подход сделал его демократичным — теперь:
- можно тренировать свои модели (например, для русского языка, узкой тематики или корпоративного домена);
- можно повторить эксперименты Hugging Face локально;
- можно реально понять, как строится интеллект LLM — от данных до дистилляции.

---

📘 Продолжение следует…
В следующем уроке — как выбрать архитектуру и размер модели под свой проект ⚙️
# 🧠 Этап 1. Подготовка железа и среды для Smol Training

🚀 Сегодня я завершил первый шаг на пути к обучению собственных языковых моделей по методике Smol Training от Hugging Face.
Цель этапа — подготовить рабочее окружение, где можно запускать и обучать модели прямо на своём ПК.

---

## 💻 1. Установка Ubuntu 22.04 LTS

Для Smol-обучения лучше использовать Linux, поэтому я установил Ubuntu 22.04 LTS на отдельный SSD.
Теперь можно загружаться либо в Windows 11, либо в Linux — удобно для практики.

---

## ⚙️ 2. Установка драйверов NVIDIA

Моя видеокарта — RTX 3060 (12 ГБ).
После установки Ubuntu система не видела GPU, поэтому я выполнил:

 add-apt-repository ppa:graphics-drivers/ppa -y
sudo apt update
sudo apt install -y nvidia-driver-580
sudo reboot


Проверка:

nvidia-smi


Теперь система видит карту, а драйвер 580.95.05 работает с CUDA 13.0 🔥

---

## 🧱 3. Настройка Python-окружения

Создал виртуальное окружение:

 apt install -y python3-venv python3-pip
python3 -m venv smol-env
source smol-env/bin/activate
pip install --upgrade pip


Установил PyTorch с поддержкой GPU:

 install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121


Проверка:

 torch
print(torch.cuda.is_available()) # True
print(torch.cuda.get_device_name(0))


---

## 🧩 4. Установка библиотек Hugging Face

 install transformers datasets accelerate bitsandbytes peft trl


---

## 🤖 5. Первый запуск модели

Проверил работу пайплайна:

 transformers import pipeline
pipe = pipeline("text-generation", model="HuggingFaceTB/SmolLM2-135M-Instruct")
print(pipe("Привет, я модель Smol:", max_new_tokens=20)[0]["generated_text"])


Модель успешно запустилась и использует cuda:0 (мою 3060).

---

## 📍 Результат

Среда полностью готова к следующему этапу — обучению моделей Smol LM.
GPU работает, Python-окружение настроено, а первая модель уже отвечает.
💰 Идеи монетизации Smol-моделей

Подход Smol Training от Hugging Face открывает путь к созданию собственных моделей, которые можно обучить, запустить и даже монетизировать на обычном ПК.

Вот несколько идей, которые мне пришли в голову, где маленькие модели 1–3B параметров могут приносить пользу и доход.



🧠 1. Персональные репетиторы и обучающие боты

Создаём AI-репетитора по одному предмету — например, «Математика 9 класс» или «История России».
Модель обучается на школьной программе, задаёт вопросы, проверяет ответы и объясняет ошибки простыми словами.

💰 Монетизация:
• Telegram-бот с подпиской или платным доступом к полному курсу
• Веб-платформа с прогрессом и рейтингами
• Продажа кастомных версий школам или EdTech-проектам



⚙️ 2. Smol-ассистенты для компаний

Маленькие модели можно обучить на документации, инструкциях и переписке с клиентами.
Они становятся внутренними помощниками сотрудников: отвечают на вопросы, подсказывают формулировки, ищут нужные данные.

💰 Монетизация:
• Коробочные решения «AI-ассистент для компании»
• Консалтинг и кастомизация под отрасль HR, юристы, медицина



💬 3. ИИ-помощники для техподдержки

Smol-модель, обученная на базе знаний и реальных обращениях, умеет:
• понимать запрос пользователя
• подбирать статью из базы
• предлагать готовый ответ оператору

💰 Монетизация:
• Локальные решения для бизнеса без облака и утечек данных
• SaaS-подписка на «AI-помощник поддержки»
• Модуль для Helpdesk-систем



🪙 4. Тематические чат-боты и эксперты

Модель можно обучить в одной нише: финансы, ЖКХ, авто, медицина, туризм, культура, образование.
Получается эксперт, который отвечает профессионально, но просто.

💰 Монетизация:
• Telegram-бот с Freemium-доступом
• Партнёрские интеграции с сайтами и платформами
• Продажа API-доступа другим разработчикам



🧩 5. Игровые и интерактивные проекты

Smol-модель можно превратить в живого персонажа: историческая личность, виртуальный учитель, собеседник или гид по музею.

💰 Монетизация:
• Донаты и внутриигровые апгрейды
• Платные диалоги или уровни
• Лицензирование персонажей для приложений и выставок



🌐 6. Офлайн-и приватные решения

Маленькие модели можно запускать на локальных серверах или даже мини-ПК без интернета.
Это идеальный вариант для школ, музеев, муниципальных систем, где важна конфиденциальность.

💰 Монетизация:
• Установка и сопровождение локальных AI-систем
• Подписка на обновления и обучение моделей
• Продажа лицензий организациям



🚀 7. Сервисы для разработчиков

Собственная Smol-модель может стать ядром микросервиса: API-интерфейс для генерации ответов, поиска, резюме, кода.

💰 Монетизация:
• Доступ к API по подписке или тарифам usage-based
• White-label-решения для интеграции в чужие продукты



💡 Главное

Smol-модель — это не мини-копия GPT, а твой личный ИИ,
которого можно обучить под конкретную нишу, бренд, клиента или школу.
👍1
⚙️ Урок 2. Как выбрать архитектуру и размер модели

---

🎯 Цель
Научиться подбирать архитектуру и размер модели, исходя из цели проекта, данных и доступных ресурсов.

---

1️⃣ С чего начать выбор

Перед тем как выбрать модель, ответь на три вопроса:
- 🧩 Что ты хочешь, чтобы модель умела делать — чат, суммаризация, генерация кода, анализ текстов?
- 📊 Сколько у тебя данных — десятки мегабайт, гигабайты или больше?
- ⚙️ Какие у тебя ресурсы — одна видеокарта на 8 ГБ, 12 ГБ или больше?

Эти факторы определяют, насколько «малой» может быть твоя Smol-модель.

---

2️⃣ Что такое архитектура модели

Архитектура — это то, как модель думает: как она обрабатывает, запоминает и воспроизводит текст.

Есть три основных типа:
- 🧠 Decoder-only — идеально для генерации текста и диалогов (GPT, LLaMA).
- 🧩 Encoder-decoder — подходит для перевода и суммаризации (T5, Flan-T5).
- 🪶 Encoder-only — используется для классификации и поиска (BERT, RoBERTa).

Для Smol-подхода Hugging Face рекомендует начинать с decoder-only,
так как это самые простые и гибкие модели.

---

3️⃣ Как выбрать размер модели

🔹 100M – 500M параметров — отличны для первых экспериментов и отладки пайплайна.
🔹 1B – 3B — уже можно обучать под конкретную задачу (чат-бот, FAQ, анализ).
🔹 7B и выше — серьёзные кейсы, но требуют нескольких GPU по 24 ГБ.

💡 Главное правило Smol:
Начинай с минимальной модели, убедись, что всё работает — и только потом масштабируй.

---

4️⃣ Мой выбор для практики

Для своих экспериментов я выберу:
- Архитектуру — decoder-only (GPT-подобная)
- Модель — SmolLM-135M

Она лёгкая, быстрая и отлично обучается на моей RTX 3060 (12 ГБ).
С неё начну строить первый рабочий пайплайн — от загрузки данных до экспериментов.
🔥1
🎓 Сегодня стартовал интенсив от Google — _Generative AI Intensive 2025_

Я решил принять участие в этом 5-дневном курсе, чтобы глубже разобраться, как создаются и работают современные агентные системы на базе LLM и MCP.

---

🧩 День 1. Введение в агентов и основы LLM

Сегодняшняя программа включает два блока:

1️⃣ Foundational Large Language Models & Text Generation
📘 Кратко:
- LLM — это большие языковые модели, которые умеют понимать и генерировать текст.
- В их основе лежит архитектура Transformer, использующая механизмы внимания (Self-Attention, Multi-Head Attention) для понимания контекста.
- Современные LLM обучаются в два этапа: pre-training на гигантских корпусах данных и fine-tuning под конкретные задачи.
- Ключевые техники оптимизации — LoRA, RLHF, а также ускорение инференса (quantization, Flash Attention, KV-cache).

🎧 В рамках курса — подкаст + технический whitepaper
Whitepaper — Foundational LLMs & Text Generation

---

2️⃣ Prompt Engineering
📘 Кратко:
- Промпт — это то, как мы общаемся с моделью: чем точнее формулировка, тем лучше результат.
- Основные подходы: zero-shot, few-shot, chain-of-thought, ReAct.
- Хороший промпт — это баланс контекста, формата и четких инструкций.
- Инженерия промптов становится отдельным направлением: теперь это не “подсказка”, а часть программирования ИИ.

🎧 Материалы модуля
Whitepaper — Prompt Engineering

---

💻 Практические задания
На сегодня нужно выполнить два codelab-упражнения на Kaggle:
1️⃣ Prompting Fundamentals
2️⃣ Evaluation and Structured Data

---

📚 Я фиксирую процесс прохождения интенсива и все заметки публикую в GitLab:
👉 gitlab.vadimevgrafov.ru/learning/generative-ai-intensive-course-with-google
🎓 День 2 — Embeddings и Vector Stores / Databases

Сегодня продолжаю участие в интенсиве Generative AI Intensive 2025 от Google.
Тема второго дня — как машины “понимают” смысл данных и хранят его в виде чисел.

---

## 🧩 Embeddings — «язык смысла»
Embedding — это вектор (набор чисел), в котором зашифрован смысл текста, изображения или звука.
Близкие по смыслу объекты располагаются рядом в многомерном пространстве.

📘 Кратко:
- Embeddings позволяют сравнивать тексты по смыслу, а не по словам.
- Используются в поиске, рекомендациях, RAG-системах и мультимодальных моделях.
- Современные модели (E5, Gecko, Gemini Embeddings) создают универсальные представления для разных типов данных.
- Качество embeddings оценивают по метрикам Precision@k, nDCG и другим бенчмаркам (MTEB, BEIR).

---

## 🗄 Vector Stores — «база смыслов»
Чтобы искать по смыслу, нужны специальные базы — векторные БД.
Они хранят embedding-вектора и позволяют быстро находить ближайшие по значению.

📘 Примеры:
- Vertex AI Vector Search (ScaNN)
- pgvector / AlloyDB
- Pinecone, Weaviate, ChromaDB

📈 Алгоритмы поиска (HNSW, ScaNN) позволяют искать среди миллиардов векторов почти мгновенно.

---

## ⚙️ Практические задания (Kaggle)
Сегодняшние codelab-упражнения:
1️⃣ Build a RAG question-answering system over custom documents
 → создание системы вопрос-ответ на своих документах с поиском по embeddings.
2️⃣ Explore text similarity with embeddings
 → измерение семантического сходства текстов в векторном пространстве.
3️⃣ Build a neural classification network with Keras using embeddings
 → обучение нейросети для классификации текста на базе векторных представлений.

---

📚 Все заметки и результаты я фиксирую в GitLab:
👉 gitlab.vadimevgrafov.ru/learning/generative-ai-intensive-course-with-google