very vibe coding
122 subscribers
463 photos
126 videos
13 files
998 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Вот про отношение к контексту на 100% согласен. Слабал себе сейчас системный промпт для Claude Code - там отдельным разделом экономию контекста сделал. Вопрос даже не в том, что токенов жалко - просто у Клода контекста банально не хватает, и растекание мыслью по древу отвлекает от задачи. Посмотрим, как будет работать

https://t.me/nobilix/146
Сегодняшние новости - ничего супер-важного, но немного полезной информации:
- Cohere выпустила открытую модель (специализация - агенты), которая по тестам SOTA в опенсорсе;
- новая маленькая модель на 8b Intern-S1, одна из лучших в своем весе;
- VibeTree позволяет запускать несколько Claude Code в разных ветках git;
- OpenAI выпустила 2 новые функции в апи - коннектор к Google mail и прочим ресурсам и хранилище для прошлых разговоров и поиска по ним;
- у подписчиков Google AI Ultra появились агентные возможности в поиске;
- у Qwen3 появился Deep research;
- используйте в Claude code команду /context для получения информации об использовании контекста
Автоматизация личных аккаунтов в телеграм

Мало кто знает, но ваш личный аккаунт можно сделать "ботом" и автоматизировать многие действия.

Называется это userbot. Работает поверх MTProto API от телеги.

Самые популярные библиотеки поверх этой апишки: gramjs для js и telethon для питона.

Что можно делать со своим личным аккаунтом с помощью этого API?

Да что угодно: парсинг каналов/групп, автоответчик на сообщения, массовая обработка медифайлов, редактирование вашего профиля по расписанию, любая другая ваша фантазия.

И да, все эти нейроботы в комментариях пишутся именно на MTProto API.

Для чего мне нужно было автоматизировать свой аккаунт? Неужели нейробота захотел, чтобы спамить другим блогерам?

Нет, все куда более практично.

Мой иностранный банк присылает все уведомления и коды через тг бота мне в личку. А я дал карту друзьям в путешествие и нужно было как-то шарить им все уведомления.

Пересылать самому быстро надоедает. К тому же я могу быть афк и тогда они не смогут что-то оплатить.

Решение простое – создать общую тг группу и автоматизировать пересылку сообщений от бота с моего аккаунта в группу.

Небольшой скрипт за вечер и теперь все сообщения от банка пересылаются в группу. Работает как часы.


Упрощенный код приложил в скрине выше.

А что если по всем своим рабочим тикетам вести минимальную доку и подключить нейронку, которая будет отвечать менеджерам на банальные вопросы по задачам, имея доступ к этой доке? :)

Короче, инструмент максимально полезный и простой. А придумать с ним можно кучу полезностей. Определенно в будущем найдется еще кейс, когда мне нужно будет автоматизировать свой аккаунт.

Как вам?

🔥 – круто, не знал
👀 – давно знал
🤖 – я нейробот

@dlents
🔥2❤‍🔥1💅1
Утренние новости:
- на выходных генерация 3 видео с Veo3 (это - топ модель) бесплатна;
- Mistral выпустил Mistral medium 3.1, обновил LeChat и Codestal;
- Новые модельки по созданию видео Ray 2 и Runway Gen 4;
- и генерация изображений Lucid Origin от LeonardoAI;
- хотите локальный DeepSeek V3.1? 2 Mac Ultra - и он у вас с 14 токенами в секунду;
- любопытный универсальный коннектор любой LLM с любым МСР сервером
На неделе проапгрейдил свой NAS для хранения бэкапов - теперь там 4 винчестера на 4ТБ каждый, с учетом защиты от отказа одного из них, доступно 11ТБ. Буду использовать для бэкапов, так как с этими агентами риск потерять код, данные и пр. практически гарантирован. Не то, чтобы я рекомендую использовать такие хранилища (я реально смог с этим работать только когда ИИ появился - до этого лень было разбираться), но то, что надо бэкапы делать - абсолютно точно.

Долго сомневался, но заказал себе еще пару мак мини в минимальной комплектации - буду делать кластер с 48Мб памяти для работы с локальными моделями (доступно будет едва ли 40, но сейчас и этого достаточно для множества интересных моделек). Пару недель жду доставки из Китая, потом расскажу об эксперименте ))
💅2
Бесплатный китайский аналог Cursor, как я понимаю, с основном работает на Qwen, но, как пишут, использует еще чуть ли не Sonnet 3.7. Не проверял, но тоже пишут, что зарегистрироваться и запустить проблема - видимо, много бесплатно не бывает. Как по мне, дождусь своих машинок, поставлю Qwen Coder 30b, и можно не переживать обо всех этих внешних ресурсах. Знаю, что и этот путь будет тернист, но душа лежит к кастомным решениям…
✍1
Вот я все жду, когда нейронки научатся переводить язык животных - вроде бы не должно быть нерешаемых проблем, но что-то новостей не вижу. Разве что про дельфинов писали…
Forwarded from эйай ньюз
xAI наконец-то релизнули веса Grok 2

Хоть Grok 2 и безнадёжно устарел, веса все равно представляют интерес и показывают что компания не забыла про опенсорс. Ну и это хороший пример другим компаниям — круто было бы иметь в публичном доступе веса депрекейтнутых моделей, той же GPT 4.5 или Claude 3 Opus (его депрекейтят в октябре).

https://huggingface.co/xai-org/grok-2

@ai_newz
Утренние новости:
- вышла новая моделька Ovis для распознавания сканов и пр. - на 2 и 9 миллиардов параметров, опенсорс;
- Google удвоил лимиты на бесплатную генерацию видео до 6 штук. Работает только сегодня - кто хочет попробовать, спешите! Кстати, видео - со звуком. У меня, правда, так толком и не получилось погенерировать - с моими фотографиями отказывается, промпту что-то сгенерила - но это черный экран, скачать нельзя, забил возиться;
- веса в grok 2.5 выложили в опенсорс, Маск обещает выложить grok 3 через полгода;
- Hunyuan3D-2.1 переводит изображения в 3D. Опенсорс;
- gpt-5 обрезает промпты длиннее 49k - имейте ввиду, если пишите такое..
❤‍🔥1💅1
Новый протокол для взаимодействия агентов - АСР (agent communication protocol). Разработан, как я понял, ребятами из IBM, за него вписался Эндрю Нг.

Все мы помним, что есть протокол А2А от Google, но не скажу, что он стал таким же успешным, как МСР у Anthropic, так что почему бы не посоревноваться
Утро понедельника - никаких сколь-нибудь интересных новостей нет..

Зато вчера посмотрел краем глаза обучающий курс из прошлого поста, и очень заинтересовало не столько то, как в нем пишут клиента и сервер для агента, сколько то, как за 3 мин написали RAG, используя CrewAI. Пересмотрю еще раз попозже..
Сегодня у меня противоречивый опыт с Claude code был. Опять возился с пробрасыванием портов, доменам и пр. - по итогу все получилось (правда, на каком-то этапе пришлось спрашивать Gemini и Opus, которые дали хороший совет, и, как ни странно, одинаковый).

Но был и эпик фейл. И в настройках Claude code в системном промпте прописал создание файла окружения с конфигурацией и паролями отдельно, чтобы первый можно было передавать модели для работы, а второй - она бы не смотрела ни при каких обстоятельствах. Смотрит, зараза, и не парится. Извиняется потом, правда, когда ее за этим застукаешь. Придется как-то более жестко ограничения выставлять. И так во всем. Чему за это время научился - так это тому, что с нейронками никакая паранойя не будет лишней..
Долго ставился домен для работы с n8n - на мак мини работает локально, но из интернета не виден. В конце концов, вернул мак мини на место - подключил по эзернету к роутеру, переписал локальные порты, вроде все норм - не работает. После 20 мин обсуждений нашли программулину (очередной впн), которая создала какой-то прокси, который все портит, даже когда не работает. Убил ее, сразу все заработало везде. Все-таки настройка сетей - штука сложная. Но решаемая. Не то чтобы я чему-то сильно научился, просто смирился и сижу с Клодом все это фиксю
Microsoft VibeVoice 1.5B - Новая Text-To-Speech модель 🎙️

⚠️ ВНИМАНИЕ: Русский язык НЕ поддерживается! Дальше можно не читать )

Microsoft Research только что выпустил VibeVoice 1.5B — open-source модель преобразования текста в речь.

🔥 Основные возможности:
• 90 минут аудио — может генерировать до 90 минут непрерывной речи
• 4 спикера одновременно — поддержка мультиспикерных диалогов
• Только английский и китайский — модель обучена исключительно на этих языках
• MIT лицензия — полностью открытый исходный код
• 1.5B параметров — компактная, но мощная архитектура

🚫 Ограничения:
❌ Русский язык официально не поддерживается
❌ Попытки использования других языков могут давать неразборчивые результаты
❌ Только для исследовательских целей
❌ Не рекомендуется для коммерческого использования

🛠️ Технические особенности:
• Основа: Qwen2.5-1.5B LLM • Инновационные акустические и семантические токенизаторы • Диффузионная архитектура для высококачественного аудио • Поддержка кросс-языкового синтеза (английский → китайский)

📋 Где найти:
• GitHub: microsoft/VibeVoice
• Hugging Face: microsoft/VibeVoice-1.5B

Вот так всегда - поскребешь новенький Майкрософт, а под красивой оберткой - китаец
🚀 ElevenLabs запустила Eleven v3 (alpha) API - это модель Text-to-Speech для асинхронных задач

🔥 Ключевые возможности:
• Режим диалога с неограниченным количеством спикеров Создавайте сложные беседы с множеством персонажей одним запросом
• Поддержка 70+ языков, включая русский Максимальное покрытие для глобальных проектов
• Улучшенный контроль голоса и эмоций с [audio tags] Используйте теги [excited], [whispers], [sighs] для точной передачи эмоций
• Оптимизация для асинхронных задач Идеально подходит для больших объемов контента и фоновой обработки

💡 Практические применения:
• Подкасты и аудиокниги Автоматическое создание диалогов между персонажами
• Озвучка видео и презентаций Множественные спикеры без смены голосовых моделей
• Образовательный контент Интерактивные уроки с диалогами на разных языках
• Игровая индустрия Генерация реплик NPC с эмоциональными оттенками

🌍 Русский язык:
• Полная поддержка русского языка Включая эмоциональные теги и диалоговый режим
• Естественная интонация ИИ понимает контекст и передает нужные эмоции
• Совместимость с кириллицей Корректная обработка русских текстов и имен

🔗 Полезные ссылки:
Официальная документация API:
https://elevenlabs.io/docs
Главная страница: https://elevenlabs.io
Блог с обновлениями: https://elevenlabs.io/blog
Попробовать бесплатно: https://elevenlabs.io/app

🛠 Для разработчиков:
• Alpha версия доступна в API Интеграция через REST API с полной документацией
• Бесплатное тестирование 10,000 символов в месяц для знакомства с возможностями
• SDK для популярных языков Python, JavaScript, и другие платформы

#ElevenLabs #ElevenV3 #API #TextToSpeech
Как вам новые форматы постов? Или вся эта мишура - лишняя?
Вот чем наши исследователи отличаются, скажем, от китайских? Те что-то сделали, на гитхабе или хаггинфейсе выложили, собирают пиар. Наши отчитались в ТАСС - никаких ссылок, разве что пиарщикам Сбера просмотров добавили. Да, еще и по телеграмму просмотров наберут - цель достигнута
Оно и правда, все пошли на поляну работы с браузерами. И проблема взлома ИИ моделек очень серьезная. Скажу по своему опыту - модели только и делают, что читают в твоем компе то, что им нужно и не нужно. Легко читают секреты. Теперь еще все помнят. И взять у них эту информацию можно просто хорошо попросив. Эта просьба зашивается в коды страницы, на которую идет агент, и все раскрывается. perplexity так уже поломали.

Поэтому первый совет - озаботьтесь хранением секретов. Я перестал использовать свои пароли кроме нескольких особых случаев, когда не доверяю даже машине. Остальное генерит и хранит bitwarden - не очень хочу доверять секреты ни Apple, ни Google. Раньше пользовался опенсорсным и проверенным браузером brave, поиском duckduckgo, но это выше моих сил.

Пожалуй, займусь секретами более плотно - чуть позже расскажу, как это работает на моем сервере
Forwarded from Data Secrets
Вышла Gemini 2.5 Flash Image

Причем, уверены, многим из вас модель уже знакома под другим именем: nano-banana. Она всю неделю хайповала в X. В целом, не было секретом, что это моделька от Google (их топы прямо скажем недвусмысленно намекали). Сегодня наконец-то мы дождались официального релиза.

Итак, это модель для генерации и редактирования изображений. И если генерацией уже никого не удивить, то способности Gemini к эдиту действительно заслуживают внимания.

Отлично держит айдентику персонажа и консистентность картинки в целом. На вход можно давать и текст, и картинки: перенос стиля работает, судя по примерам, очень прилично.

Еще из интересного: пишут, что модель может рассуждать. То есть не просто генерирует в тупую, а руководствуется общей логикой мира, которую черпает из знаний Gemini 2.5 Flash. Например, может самостоятельно понять, что должно происходить на следующем кадре сценария (см пример 3).

Ну короче, новый SOTA ИИ-фотошоп, расходимся

Блогпост
– Попробовать можно в AI Studio (стоит 39$ за тысячу изображений, в целом человечно)