Новый протокол для взаимодействия агентов - АСР (agent communication protocol). Разработан, как я понял, ребятами из IBM, за него вписался Эндрю Нг.
Все мы помним, что есть протокол А2А от Google, но не скажу, что он стал таким же успешным, как МСР у Anthropic, так что почему бы не посоревноваться
Все мы помним, что есть протокол А2А от Google, но не скажу, что он стал таким же успешным, как МСР у Anthropic, так что почему бы не посоревноваться
GitHub
GitHub - i-am-bee/acp: Open protocol for communication between AI agents, applications, and humans.
Open protocol for communication between AI agents, applications, and humans. - i-am-bee/acp
Утро понедельника - никаких сколь-нибудь интересных новостей нет..
Зато вчера посмотрел краем глаза обучающий курс из прошлого поста, и очень заинтересовало не столько то, как в нем пишут клиента и сервер для агента, сколько то, как за 3 мин написали RAG, используя CrewAI. Пересмотрю еще раз попозже..
Зато вчера посмотрел краем глаза обучающий курс из прошлого поста, и очень заинтересовало не столько то, как в нем пишут клиента и сервер для агента, сколько то, как за 3 мин написали RAG, используя CrewAI. Пересмотрю еще раз попозже..
Сегодня у меня противоречивый опыт с Claude code был. Опять возился с пробрасыванием портов, доменам и пр. - по итогу все получилось (правда, на каком-то этапе пришлось спрашивать Gemini и Opus, которые дали хороший совет, и, как ни странно, одинаковый).
Но был и эпик фейл. И в настройках Claude code в системном промпте прописал создание файла окружения с конфигурацией и паролями отдельно, чтобы первый можно было передавать модели для работы, а второй - она бы не смотрела ни при каких обстоятельствах. Смотрит, зараза, и не парится. Извиняется потом, правда, когда ее за этим застукаешь. Придется как-то более жестко ограничения выставлять. И так во всем. Чему за это время научился - так это тому, что с нейронками никакая паранойя не будет лишней..
Но был и эпик фейл. И в настройках Claude code в системном промпте прописал создание файла окружения с конфигурацией и паролями отдельно, чтобы первый можно было передавать модели для работы, а второй - она бы не смотрела ни при каких обстоятельствах. Смотрит, зараза, и не парится. Извиняется потом, правда, когда ее за этим застукаешь. Придется как-то более жестко ограничения выставлять. И так во всем. Чему за это время научился - так это тому, что с нейронками никакая паранойя не будет лишней..
Долго ставился домен для работы с n8n - на мак мини работает локально, но из интернета не виден. В конце концов, вернул мак мини на место - подключил по эзернету к роутеру, переписал локальные порты, вроде все норм - не работает. После 20 мин обсуждений нашли программулину (очередной впн), которая создала какой-то прокси, который все портит, даже когда не работает. Убил ее, сразу все заработало везде. Все-таки настройка сетей - штука сложная. Но решаемая. Не то чтобы я чему-то сильно научился, просто смирился и сижу с Клодом все это фиксю
Microsoft VibeVoice 1.5B - Новая Text-To-Speech модель 🎙️
⚠️ ВНИМАНИЕ: Русский язык НЕ поддерживается! Дальше можно не читать )
Microsoft Research только что выпустил VibeVoice 1.5B — open-source модель преобразования текста в речь.
🔥 Основные возможности:
• 90 минут аудио — может генерировать до 90 минут непрерывной речи
• 4 спикера одновременно — поддержка мультиспикерных диалогов
• Только английский и китайский — модель обучена исключительно на этих языках
• MIT лицензия — полностью открытый исходный код
• 1.5B параметров — компактная, но мощная архитектура
🚫 Ограничения:
❌ Русский язык официально не поддерживается
❌ Попытки использования других языков могут давать неразборчивые результаты
❌ Только для исследовательских целей
❌ Не рекомендуется для коммерческого использования
🛠️ Технические особенности:
• Основа: Qwen2.5-1.5B LLM • Инновационные акустические и семантические токенизаторы • Диффузионная архитектура для высококачественного аудио • Поддержка кросс-языкового синтеза (английский → китайский)
📋 Где найти:
• GitHub: microsoft/VibeVoice
• Hugging Face: microsoft/VibeVoice-1.5B
Вот так всегда - поскребешь новенький Майкрософт, а под красивой оберткой - китаец
⚠️ ВНИМАНИЕ: Русский язык НЕ поддерживается! Дальше можно не читать )
Microsoft Research только что выпустил VibeVoice 1.5B — open-source модель преобразования текста в речь.
🔥 Основные возможности:
• 90 минут аудио — может генерировать до 90 минут непрерывной речи
• 4 спикера одновременно — поддержка мультиспикерных диалогов
• Только английский и китайский — модель обучена исключительно на этих языках
• MIT лицензия — полностью открытый исходный код
• 1.5B параметров — компактная, но мощная архитектура
🚫 Ограничения:
❌ Русский язык официально не поддерживается
❌ Попытки использования других языков могут давать неразборчивые результаты
❌ Только для исследовательских целей
❌ Не рекомендуется для коммерческого использования
🛠️ Технические особенности:
• Основа: Qwen2.5-1.5B LLM • Инновационные акустические и семантические токенизаторы • Диффузионная архитектура для высококачественного аудио • Поддержка кросс-языкового синтеза (английский → китайский)
📋 Где найти:
• GitHub: microsoft/VibeVoice
• Hugging Face: microsoft/VibeVoice-1.5B
Вот так всегда - поскребешь новенький Майкрософт, а под красивой оберткой - китаец
🚀 ElevenLabs запустила Eleven v3 (alpha) API - это модель Text-to-Speech для асинхронных задач
🔥 Ключевые возможности:
• Режим диалога с неограниченным количеством спикеров Создавайте сложные беседы с множеством персонажей одним запросом
• Поддержка 70+ языков, включая русский Максимальное покрытие для глобальных проектов
• Улучшенный контроль голоса и эмоций с [audio tags] Используйте теги [excited], [whispers], [sighs] для точной передачи эмоций
• Оптимизация для асинхронных задач Идеально подходит для больших объемов контента и фоновой обработки
💡 Практические применения:
• Подкасты и аудиокниги Автоматическое создание диалогов между персонажами
• Озвучка видео и презентаций Множественные спикеры без смены голосовых моделей
• Образовательный контент Интерактивные уроки с диалогами на разных языках
• Игровая индустрия Генерация реплик NPC с эмоциональными оттенками
🌍 Русский язык:
• Полная поддержка русского языка Включая эмоциональные теги и диалоговый режим
• Естественная интонация ИИ понимает контекст и передает нужные эмоции
• Совместимость с кириллицей Корректная обработка русских текстов и имен
🔗 Полезные ссылки:
Официальная документация API: https://elevenlabs.io/docs
Главная страница: https://elevenlabs.io
Блог с обновлениями: https://elevenlabs.io/blog
Попробовать бесплатно: https://elevenlabs.io/app
🛠 Для разработчиков:
• Alpha версия доступна в API Интеграция через REST API с полной документацией
• Бесплатное тестирование 10,000 символов в месяц для знакомства с возможностями
• SDK для популярных языков Python, JavaScript, и другие платформы
#ElevenLabs #ElevenV3 #API #TextToSpeech
🔥 Ключевые возможности:
• Режим диалога с неограниченным количеством спикеров Создавайте сложные беседы с множеством персонажей одним запросом
• Поддержка 70+ языков, включая русский Максимальное покрытие для глобальных проектов
• Улучшенный контроль голоса и эмоций с [audio tags] Используйте теги [excited], [whispers], [sighs] для точной передачи эмоций
• Оптимизация для асинхронных задач Идеально подходит для больших объемов контента и фоновой обработки
💡 Практические применения:
• Подкасты и аудиокниги Автоматическое создание диалогов между персонажами
• Озвучка видео и презентаций Множественные спикеры без смены голосовых моделей
• Образовательный контент Интерактивные уроки с диалогами на разных языках
• Игровая индустрия Генерация реплик NPC с эмоциональными оттенками
🌍 Русский язык:
• Полная поддержка русского языка Включая эмоциональные теги и диалоговый режим
• Естественная интонация ИИ понимает контекст и передает нужные эмоции
• Совместимость с кириллицей Корректная обработка русских текстов и имен
🔗 Полезные ссылки:
Официальная документация API: https://elevenlabs.io/docs
Главная страница: https://elevenlabs.io
Блог с обновлениями: https://elevenlabs.io/blog
Попробовать бесплатно: https://elevenlabs.io/app
🛠 Для разработчиков:
• Alpha версия доступна в API Интеграция через REST API с полной документацией
• Бесплатное тестирование 10,000 символов в месяц для знакомства с возможностями
• SDK для популярных языков Python, JavaScript, и другие платформы
#ElevenLabs #ElevenV3 #API #TextToSpeech
elevenlabs.io
Documentation | ElevenLabs Documentation
Explore our docs and guides to integrate ElevenLabs
Вот чем наши исследователи отличаются, скажем, от китайских? Те что-то сделали, на гитхабе или хаггинфейсе выложили, собирают пиар. Наши отчитались в ТАСС - никаких ссылок, разве что пиарщикам Сбера просмотров добавили. Да, еще и по телеграмму просмотров наберут - цель достигнута
Telegram
Machinelearning
✔️ Российские учёные предложили новый способ борьбы с галлюцинациями ИИ
Одна из главных проблем больших языковых моделей — они могут генерировать правдоподобные, но ложные ответы.
Исследователи из Сбера разработали метамодели, которые повышают точность…
Одна из главных проблем больших языковых моделей — они могут генерировать правдоподобные, но ложные ответы.
Исследователи из Сбера разработали метамодели, которые повышают точность…
Qwen крайне агрессивно ведет свою экспансию, в последнее время акцент - на видео
https://t.me/ai_machinelearning_big_data/8369
https://t.me/ai_machinelearning_big_data/8369
Telegram
Machinelearning
🚀 Wan2.2-S2V — модель с 14 миллиардами параметров для генерации видео кинематографического качества на основе аудио.
🎬 Новая версия Wan способна превращать статичные изображения и аудио в динамичные видео с реалистичными выражениями лиц, естественными…
🎬 Новая версия Wan способна превращать статичные изображения и аудио в динамичные видео с реалистичными выражениями лиц, естественными…
Оно и правда, все пошли на поляну работы с браузерами. И проблема взлома ИИ моделек очень серьезная. Скажу по своему опыту - модели только и делают, что читают в твоем компе то, что им нужно и не нужно. Легко читают секреты. Теперь еще все помнят. И взять у них эту информацию можно просто хорошо попросив. Эта просьба зашивается в коды страницы, на которую идет агент, и все раскрывается. perplexity так уже поломали.
Поэтому первый совет - озаботьтесь хранением секретов. Я перестал использовать свои пароли кроме нескольких особых случаев, когда не доверяю даже машине. Остальное генерит и хранит bitwarden - не очень хочу доверять секреты ни Apple, ни Google. Раньше пользовался опенсорсным и проверенным браузером brave, поиском duckduckgo, но это выше моих сил.
Пожалуй, займусь секретами более плотно - чуть позже расскажу, как это работает на моем сервере
Поэтому первый совет - озаботьтесь хранением секретов. Я перестал использовать свои пароли кроме нескольких особых случаев, когда не доверяю даже машине. Остальное генерит и хранит bitwarden - не очень хочу доверять секреты ни Apple, ни Google. Раньше пользовался опенсорсным и проверенным браузером brave, поиском duckduckgo, но это выше моих сил.
Пожалуй, займусь секретами более плотно - чуть позже расскажу, как это работает на моем сервере
Telegram
Все о блокчейн/мозге/space/WEB 3.0 в России и мире
Вот это бомба! Anthropic запускает Claude для Chrome - ИИ-агент в браузере Google
Компания запускает тестирование с 1,000 пользователями Max-плана.
Это шаг к созданию ИИ-агента, который может работать непосредственно в браузере пользователя, которое напрямую…
Компания запускает тестирование с 1,000 пользователями Max-плана.
Это шаг к созданию ИИ-агента, который может работать непосредственно в браузере пользователя, которое напрямую…
Forwarded from Data Secrets
Вышла Gemini 2.5 Flash Image
Причем, уверены, многим из вас модель уже знакома под другим именем: nano-banana. Она всю неделю хайповала в X. В целом, не было секретом, что это моделька от Google (их топы прямо скажем недвусмысленно намекали). Сегодня наконец-то мы дождались официального релиза.
Итак, это модель для генерации и редактирования изображений. И если генерацией уже никого не удивить, то способности Gemini к эдиту действительно заслуживают внимания.
Отлично держит айдентику персонажа и консистентность картинки в целом. На вход можно давать и текст, и картинки: перенос стиля работает, судя по примерам, очень прилично.
Еще из интересного: пишут, что модель может рассуждать. То есть не просто генерирует в тупую, а руководствуется общей логикой мира, которую черпает из знаний Gemini 2.5 Flash. Например, может самостоятельно понять, что должно происходить на следующем кадре сценария (см пример 3).
Ну короче, новый SOTA ИИ-фотошоп, расходимся
Блогпост
– Попробовать можно в AI Studio (стоит 39$ за тысячу изображений, в целом человечно)
Причем, уверены, многим из вас модель уже знакома под другим именем: nano-banana. Она всю неделю хайповала в X. В целом, не было секретом, что это моделька от Google (их топы прямо скажем недвусмысленно намекали). Сегодня наконец-то мы дождались официального релиза.
Итак, это модель для генерации и редактирования изображений. И если генерацией уже никого не удивить, то способности Gemini к эдиту действительно заслуживают внимания.
Отлично держит айдентику персонажа и консистентность картинки в целом. На вход можно давать и текст, и картинки: перенос стиля работает, судя по примерам, очень прилично.
Еще из интересного: пишут, что модель может рассуждать. То есть не просто генерирует в тупую, а руководствуется общей логикой мира, которую черпает из знаний Gemini 2.5 Flash. Например, может самостоятельно понять, что должно происходить на следующем кадре сценария (см пример 3).
Ну короче, новый SOTA ИИ-фотошоп, расходимся
Блогпост
– Попробовать можно в AI Studio (стоит 39$ за тысячу изображений, в целом человечно)
Forwarded from Анализ данных (Data analysis)
MiniCPM-V 4.5 🚀
Свежий релиз от OpenBMB — мультимодальная модель, которая умеет понимать картинки, несколько изображений подряд и даже видео. Главное: запуск возможен прямо на телефоне 📱
Что внутри:
✨ Достигает SOTA результатов в задачах vision+language
✨ 96× сжатие видеотокенов → можно анализировать длинные ролики с высоким FPS
✨ Два режима работы: быстрые ответы (Fast) или глубокие рассуждения (Deep)
✨ Мощный OCR для документов
✨ Поддержка более чем 30 языков
🔗 Подробнее: https://huggingface.co/openbmb/MiniCPM-V-4_5
@data_analysis_ml
Свежий релиз от OpenBMB — мультимодальная модель, которая умеет понимать картинки, несколько изображений подряд и даже видео. Главное: запуск возможен прямо на телефоне 📱
Что внутри:
✨ Достигает SOTA результатов в задачах vision+language
✨ 96× сжатие видеотокенов → можно анализировать длинные ролики с высоким FPS
✨ Два режима работы: быстрые ответы (Fast) или глубокие рассуждения (Deep)
✨ Мощный OCR для документов
✨ Поддержка более чем 30 языков
🔗 Подробнее: https://huggingface.co/openbmb/MiniCPM-V-4_5
@data_analysis_ml
эйай ньюз
xAI наконец-то релизнули веса Grok 2 Хоть Grok 2 и безнадёжно устарел, веса все равно представляют интерес и показывают что компания не забыла про опенсорс. Ну и это хороший пример другим компаниям — круто было бы иметь в публичном доступе веса депрекейтнутых…
Утренние новости
- Qwen научился читать веб-страницы (теперь ждем, когда научится там писать :);
- NVIDEA релизнула Nemotron Nano 9b - SOTA среди моделей такого размера, но по тестам обгоняет и большие модели - например, все модели Meta. Для локальных устройств очень интересно;
- новая модель InternVL 3.5 в 32 разных размерах и вариантах. Зачем она и чем так хороша, пока не понял;
- ссылка на Wan 2.2 от Qwen для генерации видео по аудио. Опенсорс, размер небольшой, можно качать ));
- Google признался в авторстве нано-бананы, теперь заходим через aistudio, но доступ есть и для платных пользователей hagging face, причем там должны быть неплохие лимиты;
- Claude дает первым пользователям доступ к плагину для браузера. Оно интересно, но ресурсы будет выжирать моментально. Вчера задал вопрос Opus, после того, как Sonnet в Claude code начал ходить по кругу - один поиск в интернете, и моя сессия закончилась. Без плана Мах с браузером даже не пытайтесь;
- Google запускает синхронный перевод на мобильных устройствах. Ай, молодцы!
- Qwen научился читать веб-страницы (теперь ждем, когда научится там писать :);
- NVIDEA релизнула Nemotron Nano 9b - SOTA среди моделей такого размера, но по тестам обгоняет и большие модели - например, все модели Meta. Для локальных устройств очень интересно;
- новая модель InternVL 3.5 в 32 разных размерах и вариантах. Зачем она и чем так хороша, пока не понял;
- ссылка на Wan 2.2 от Qwen для генерации видео по аудио. Опенсорс, размер небольшой, можно качать ));
- Google признался в авторстве нано-бананы, теперь заходим через aistudio, но доступ есть и для платных пользователей hagging face, причем там должны быть неплохие лимиты;
- Claude дает первым пользователям доступ к плагину для браузера. Оно интересно, но ресурсы будет выжирать моментально. Вчера задал вопрос Opus, после того, как Sonnet в Claude code начал ходить по кругу - один поиск в интернете, и моя сессия закончилась. Без плана Мах с браузером даже не пытайтесь;
- Google запускает синхронный перевод на мобильных устройствах. Ай, молодцы!
huggingface.co
Nemotron-Pre-Training-Dataset - a nvidia Collection
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
С утра возимся с Клодом: "сначала откатлю изменения...". Все-таки русский язык сложный не только для детей ))
😁1💯1
Очень интересная модель генерации голоса, оптимизирована для процессоров Apple, размер - 1Гб, можно уменьшить до 500 квантизацией. Одна проблема - русского нет
Telegram
Анализ данных (Data analysis)
Marvis-TTS 🔥🚀
Новая локальная TTS-модель, которая работает в реальном времени прямо на потребительских устройствах: Apple Silicon, iPhone, iPad и других.
В отличие от классических моделей, требующих полный ввод текста или жертвующих скоростью, Marvis…
Новая локальная TTS-модель, которая работает в реальном времени прямо на потребительских устройствах: Apple Silicon, iPhone, iPad и других.
В отличие от классических моделей, требующих полный ввод текста или жертвующих скоростью, Marvis…
🔥1😢1
Forwarded from Blog Hanzo
привет! пока я отдыхаю,
незаметно для многих прошел
Agentic AI summit
там реально топовые знания по LLM агентам
конечно!
я уже собрал для вас самые вкусные выступления в одном видео
Agentic AI summit, august 2025. The best lectures of all
русская сокращенная версия будет завтра
незаметно для многих прошел
Agentic AI summit
там реально топовые знания по LLM агентам
конечно!
я уже собрал для вас самые вкусные выступления в одном видео
Agentic AI summit, august 2025. The best lectures of all
👏1
Курсы по RAG на стероидах на графах от топ-менеджера Neo4j (лидирующий пакет, на котором строятся модели). Конечно, от Эндрю Нг
www.deeplearning.ai
Agentic Knowledge Graph Construction
Build a multi-agent system that plans, designs, and constructs a knowledge graph.