very vibe coding
122 subscribers
463 photos
126 videos
13 files
998 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Forwarded from Градиент обреченный (Sergei Averkiev)
🔺 Стандартизируем промпт-инженерию c POML

🔸 Если вы используете LLM и составляете более-менее сложные промпты, в которых есть

• пункты правил для оформления и стиля
• контент в виде картинок и таблиц
• переиспользуемые части типа системных промптов

🔸 Или если вы многократно тестируете промпты, заменяя составные части, то ваши эксперименты могут постепенно захламиться.

🔸 Возможно, вам просто удобней визуально видеть ваш промпт с ролями и отрисованным контентом, редактировать его в таком виде и обращаться в API.

🔸 В MS решили навести порядок и сколотили POML (Prompt Orchestration Markup Language). Собственно, это мини-фреймворк и язык для структурирования промптов и встраивания в него контента. Синтаксис уже довольно богатый, можно прописывать json схему ответа, встраивать кусочки кода, выражения, прописывать тулы и т.д.

🔸 .poml файлики — это конфиги для ваших промптов, с которыми можно работать в VS Code, в настройках расширения можно указать API, через которое можно гонять ваши запросы по ходу разработки. Есть python клиент, чтобы парсить эти файлики в коде и затем работать с готовым промптом.

Пробуем в работе

👉 Документация | GitHub | Demo | Paper
👍1
DeepSeek сможет работать по апи с Claude code. По МСР он и так это может, как я понимаю, но никакие интеграции лишними не будут. И если с текущим DeepSeek R1 это не так интересно - тут уж лучше GPT-5 подключать, то с R2, которого ждем, все может быть куда интереснее
Вот верю в то, что прогресс в маленьких моделях будет больше, чем в больших и разница в модели на 10b параметров и топовыми моделями будет сильно меньше чем сейчас. Большие модели будут делать умнее за счет использования большого количества разных дополнительных инструментов

https://t.me/data_secrets/7663
Вот про отношение к контексту на 100% согласен. Слабал себе сейчас системный промпт для Claude Code - там отдельным разделом экономию контекста сделал. Вопрос даже не в том, что токенов жалко - просто у Клода контекста банально не хватает, и растекание мыслью по древу отвлекает от задачи. Посмотрим, как будет работать

https://t.me/nobilix/146
Сегодняшние новости - ничего супер-важного, но немного полезной информации:
- Cohere выпустила открытую модель (специализация - агенты), которая по тестам SOTA в опенсорсе;
- новая маленькая модель на 8b Intern-S1, одна из лучших в своем весе;
- VibeTree позволяет запускать несколько Claude Code в разных ветках git;
- OpenAI выпустила 2 новые функции в апи - коннектор к Google mail и прочим ресурсам и хранилище для прошлых разговоров и поиска по ним;
- у подписчиков Google AI Ultra появились агентные возможности в поиске;
- у Qwen3 появился Deep research;
- используйте в Claude code команду /context для получения информации об использовании контекста
Автоматизация личных аккаунтов в телеграм

Мало кто знает, но ваш личный аккаунт можно сделать "ботом" и автоматизировать многие действия.

Называется это userbot. Работает поверх MTProto API от телеги.

Самые популярные библиотеки поверх этой апишки: gramjs для js и telethon для питона.

Что можно делать со своим личным аккаунтом с помощью этого API?

Да что угодно: парсинг каналов/групп, автоответчик на сообщения, массовая обработка медифайлов, редактирование вашего профиля по расписанию, любая другая ваша фантазия.

И да, все эти нейроботы в комментариях пишутся именно на MTProto API.

Для чего мне нужно было автоматизировать свой аккаунт? Неужели нейробота захотел, чтобы спамить другим блогерам?

Нет, все куда более практично.

Мой иностранный банк присылает все уведомления и коды через тг бота мне в личку. А я дал карту друзьям в путешествие и нужно было как-то шарить им все уведомления.

Пересылать самому быстро надоедает. К тому же я могу быть афк и тогда они не смогут что-то оплатить.

Решение простое – создать общую тг группу и автоматизировать пересылку сообщений от бота с моего аккаунта в группу.

Небольшой скрипт за вечер и теперь все сообщения от банка пересылаются в группу. Работает как часы.


Упрощенный код приложил в скрине выше.

А что если по всем своим рабочим тикетам вести минимальную доку и подключить нейронку, которая будет отвечать менеджерам на банальные вопросы по задачам, имея доступ к этой доке? :)

Короче, инструмент максимально полезный и простой. А придумать с ним можно кучу полезностей. Определенно в будущем найдется еще кейс, когда мне нужно будет автоматизировать свой аккаунт.

Как вам?

🔥 – круто, не знал
👀 – давно знал
🤖 – я нейробот

@dlents
🔥2❤‍🔥1💅1
Утренние новости:
- на выходных генерация 3 видео с Veo3 (это - топ модель) бесплатна;
- Mistral выпустил Mistral medium 3.1, обновил LeChat и Codestal;
- Новые модельки по созданию видео Ray 2 и Runway Gen 4;
- и генерация изображений Lucid Origin от LeonardoAI;
- хотите локальный DeepSeek V3.1? 2 Mac Ultra - и он у вас с 14 токенами в секунду;
- любопытный универсальный коннектор любой LLM с любым МСР сервером
На неделе проапгрейдил свой NAS для хранения бэкапов - теперь там 4 винчестера на 4ТБ каждый, с учетом защиты от отказа одного из них, доступно 11ТБ. Буду использовать для бэкапов, так как с этими агентами риск потерять код, данные и пр. практически гарантирован. Не то, чтобы я рекомендую использовать такие хранилища (я реально смог с этим работать только когда ИИ появился - до этого лень было разбираться), но то, что надо бэкапы делать - абсолютно точно.

Долго сомневался, но заказал себе еще пару мак мини в минимальной комплектации - буду делать кластер с 48Мб памяти для работы с локальными моделями (доступно будет едва ли 40, но сейчас и этого достаточно для множества интересных моделек). Пару недель жду доставки из Китая, потом расскажу об эксперименте ))
💅2
Бесплатный китайский аналог Cursor, как я понимаю, с основном работает на Qwen, но, как пишут, использует еще чуть ли не Sonnet 3.7. Не проверял, но тоже пишут, что зарегистрироваться и запустить проблема - видимо, много бесплатно не бывает. Как по мне, дождусь своих машинок, поставлю Qwen Coder 30b, и можно не переживать обо всех этих внешних ресурсах. Знаю, что и этот путь будет тернист, но душа лежит к кастомным решениям…
✍1
Вот я все жду, когда нейронки научатся переводить язык животных - вроде бы не должно быть нерешаемых проблем, но что-то новостей не вижу. Разве что про дельфинов писали…
Forwarded from эйай ньюз
xAI наконец-то релизнули веса Grok 2

Хоть Grok 2 и безнадёжно устарел, веса все равно представляют интерес и показывают что компания не забыла про опенсорс. Ну и это хороший пример другим компаниям — круто было бы иметь в публичном доступе веса депрекейтнутых моделей, той же GPT 4.5 или Claude 3 Opus (его депрекейтят в октябре).

https://huggingface.co/xai-org/grok-2

@ai_newz
Утренние новости:
- вышла новая моделька Ovis для распознавания сканов и пр. - на 2 и 9 миллиардов параметров, опенсорс;
- Google удвоил лимиты на бесплатную генерацию видео до 6 штук. Работает только сегодня - кто хочет попробовать, спешите! Кстати, видео - со звуком. У меня, правда, так толком и не получилось погенерировать - с моими фотографиями отказывается, промпту что-то сгенерила - но это черный экран, скачать нельзя, забил возиться;
- веса в grok 2.5 выложили в опенсорс, Маск обещает выложить grok 3 через полгода;
- Hunyuan3D-2.1 переводит изображения в 3D. Опенсорс;
- gpt-5 обрезает промпты длиннее 49k - имейте ввиду, если пишите такое..
❤‍🔥1💅1
Новый протокол для взаимодействия агентов - АСР (agent communication protocol). Разработан, как я понял, ребятами из IBM, за него вписался Эндрю Нг.

Все мы помним, что есть протокол А2А от Google, но не скажу, что он стал таким же успешным, как МСР у Anthropic, так что почему бы не посоревноваться
Утро понедельника - никаких сколь-нибудь интересных новостей нет..

Зато вчера посмотрел краем глаза обучающий курс из прошлого поста, и очень заинтересовало не столько то, как в нем пишут клиента и сервер для агента, сколько то, как за 3 мин написали RAG, используя CrewAI. Пересмотрю еще раз попозже..
Сегодня у меня противоречивый опыт с Claude code был. Опять возился с пробрасыванием портов, доменам и пр. - по итогу все получилось (правда, на каком-то этапе пришлось спрашивать Gemini и Opus, которые дали хороший совет, и, как ни странно, одинаковый).

Но был и эпик фейл. И в настройках Claude code в системном промпте прописал создание файла окружения с конфигурацией и паролями отдельно, чтобы первый можно было передавать модели для работы, а второй - она бы не смотрела ни при каких обстоятельствах. Смотрит, зараза, и не парится. Извиняется потом, правда, когда ее за этим застукаешь. Придется как-то более жестко ограничения выставлять. И так во всем. Чему за это время научился - так это тому, что с нейронками никакая паранойя не будет лишней..
Долго ставился домен для работы с n8n - на мак мини работает локально, но из интернета не виден. В конце концов, вернул мак мини на место - подключил по эзернету к роутеру, переписал локальные порты, вроде все норм - не работает. После 20 мин обсуждений нашли программулину (очередной впн), которая создала какой-то прокси, который все портит, даже когда не работает. Убил ее, сразу все заработало везде. Все-таки настройка сетей - штука сложная. Но решаемая. Не то чтобы я чему-то сильно научился, просто смирился и сижу с Клодом все это фиксю
Microsoft VibeVoice 1.5B - Новая Text-To-Speech модель 🎙️

⚠️ ВНИМАНИЕ: Русский язык НЕ поддерживается! Дальше можно не читать )

Microsoft Research только что выпустил VibeVoice 1.5B — open-source модель преобразования текста в речь.

🔥 Основные возможности:
• 90 минут аудио — может генерировать до 90 минут непрерывной речи
• 4 спикера одновременно — поддержка мультиспикерных диалогов
• Только английский и китайский — модель обучена исключительно на этих языках
• MIT лицензия — полностью открытый исходный код
• 1.5B параметров — компактная, но мощная архитектура

🚫 Ограничения:
❌ Русский язык официально не поддерживается
❌ Попытки использования других языков могут давать неразборчивые результаты
❌ Только для исследовательских целей
❌ Не рекомендуется для коммерческого использования

🛠️ Технические особенности:
• Основа: Qwen2.5-1.5B LLM • Инновационные акустические и семантические токенизаторы • Диффузионная архитектура для высококачественного аудио • Поддержка кросс-языкового синтеза (английский → китайский)

📋 Где найти:
• GitHub: microsoft/VibeVoice
• Hugging Face: microsoft/VibeVoice-1.5B

Вот так всегда - поскребешь новенький Майкрософт, а под красивой оберткой - китаец
🚀 ElevenLabs запустила Eleven v3 (alpha) API - это модель Text-to-Speech для асинхронных задач

🔥 Ключевые возможности:
• Режим диалога с неограниченным количеством спикеров Создавайте сложные беседы с множеством персонажей одним запросом
• Поддержка 70+ языков, включая русский Максимальное покрытие для глобальных проектов
• Улучшенный контроль голоса и эмоций с [audio tags] Используйте теги [excited], [whispers], [sighs] для точной передачи эмоций
• Оптимизация для асинхронных задач Идеально подходит для больших объемов контента и фоновой обработки

💡 Практические применения:
• Подкасты и аудиокниги Автоматическое создание диалогов между персонажами
• Озвучка видео и презентаций Множественные спикеры без смены голосовых моделей
• Образовательный контент Интерактивные уроки с диалогами на разных языках
• Игровая индустрия Генерация реплик NPC с эмоциональными оттенками

🌍 Русский язык:
• Полная поддержка русского языка Включая эмоциональные теги и диалоговый режим
• Естественная интонация ИИ понимает контекст и передает нужные эмоции
• Совместимость с кириллицей Корректная обработка русских текстов и имен

🔗 Полезные ссылки:
Официальная документация API:
https://elevenlabs.io/docs
Главная страница: https://elevenlabs.io
Блог с обновлениями: https://elevenlabs.io/blog
Попробовать бесплатно: https://elevenlabs.io/app

🛠 Для разработчиков:
• Alpha версия доступна в API Интеграция через REST API с полной документацией
• Бесплатное тестирование 10,000 символов в месяц для знакомства с возможностями
• SDK для популярных языков Python, JavaScript, и другие платформы

#ElevenLabs #ElevenV3 #API #TextToSpeech
Как вам новые форматы постов? Или вся эта мишура - лишняя?
Вот чем наши исследователи отличаются, скажем, от китайских? Те что-то сделали, на гитхабе или хаггинфейсе выложили, собирают пиар. Наши отчитались в ТАСС - никаких ссылок, разве что пиарщикам Сбера просмотров добавили. Да, еще и по телеграмму просмотров наберут - цель достигнута