Forwarded from Data Secrets
Nvidia выложили в опенсорс универсальный Deep Research, который можно обернуть вокруг любой LLM
Он так и называется: Universal Deep Research (UDR). Фактически, это готовый конструктор для построения системы поиска или анализа.
Пользователь просто задает стратегию работы на уровне сценариев: правила сбора и анализа данных, последовательность действий, критерии отбора источников и формат результата. А дальше агент все делает сам: ищет источники, обрабатывает их, верифицирует и синтезирует. Движок под капотом может быть абсолютно любой, то есть модель можно взять какую угодно.
Почему это круто? Тут все просто: демократизация. Нет привязки к конкретной платформе, и обертку можно делать даже над чайником.
Почему это не панацея? Тут не предполагается никакого рода файнтюнинга. А значит, итоговые метрики могут страдать, даже если в основе у вас отличная базовая модель. Поэтому – доверяем, но всегда проверяем.
Статья | Страница проекта | Гитхаб | Лаб
Он так и называется: Universal Deep Research (UDR). Фактически, это готовый конструктор для построения системы поиска или анализа.
Пользователь просто задает стратегию работы на уровне сценариев: правила сбора и анализа данных, последовательность действий, критерии отбора источников и формат результата. А дальше агент все делает сам: ищет источники, обрабатывает их, верифицирует и синтезирует. Движок под капотом может быть абсолютно любой, то есть модель можно взять какую угодно.
Почему это круто? Тут все просто: демократизация. Нет привязки к конкретной платформе, и обертку можно делать даже над чайником.
Почему это не панацея? Тут не предполагается никакого рода файнтюнинга. А значит, итоговые метрики могут страдать, даже если в основе у вас отличная базовая модель. Поэтому – доверяем, но всегда проверяем.
Статья | Страница проекта | Гитхаб | Лаб
Forwarded from Анализ данных (Data analysis)
Parlant помогает задавать агенту чёткое поведение: сценарии шагов (Journeys), правила тона и политики, подключение инструментов (API, БД, поиски), готовые ответы и объяснимость действий.
pip install parlant
Github: https://github.com/emcie-co/parlant
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Denis Sexy IT 🤖
А еще в чатгпт завезли ветки разговоров, можно нажать эту кнопку и создастся новый чат со всей историей диалога, который в боковой панели будет виден как новый чат - уже выкатили
Любопытная ссылка на построение карты ембеддингов - позволяет понять кластеры в ваших данных
И раз уж заговорили про ембеддинги - новая SOTA в размере до 500М параметров от Google, к тому же еще и очень быстрая - EmbeddingGemma
И раз уж заговорили про ембеддинги - новая SOTA в размере до 500М параметров от Google, к тому же еще и очень быстрая - EmbeddingGemma
huggingface.co
uv-scripts/build-atlas · Datasets at Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Пока DeepSeek безуспешно пытается обучить R2 на чипах от Huawei, ждем в ближайшее время от Qwen большую умную и, конечно, опенсорсную модель.
Kimi K2, GLM-4.5 - это сегодня топовые открытые большие модели, совсем немного отстающие от основных моделей, которые на слуху типа GPT-5 или Claude. Так что, новость об обновлении К2 из разряда тех, к которым стоит присмотреться
Telegram
Анализ данных (Data analysis)
Kimi K2-0905 свежее обновление 🚀
• Прокачанные возможности для кода, особенно фронтенд и tool-calling
• Контекст расширен до 256k токенов
• Улучшена интеграция с разными агентными фреймворками (Claude Code, Roo Code и др.)
🔗 Weights & code: htt…
• Прокачанные возможности для кода, особенно фронтенд и tool-calling
• Контекст расширен до 256k токенов
• Улучшена интеграция с разными агентными фреймворками (Claude Code, Roo Code и др.)
🔗 Weights & code: htt…
Вот и дождались. Правда, если полгода назад модель на 1В параметром меня впечатлила бы, сейчас я куда больше жду от Qwen обновления на 32М. И свои даа мак мини, чтобы на них ее раскатать…
https://t.me/data_secrets/7773
https://t.me/data_secrets/7773
Telegram
Data Secrets
Думали в пятницу вечером релизов уже не будет? А вот и нет, вышел Qwen3-Max-Preview 😎
В модели аж 1 триллион параметров – это самый крупный экземпляр стартапа на данный момент. При этом модель без ризонинга.
По бенчмаркам бьет их предыдущего лидера Qwen3…
В модели аж 1 триллион параметров – это самый крупный экземпляр стартапа на данный момент. При этом модель без ризонинга.
По бенчмаркам бьет их предыдущего лидера Qwen3…
Кстати, про новый Qwen я ошибся - новая модель Qwen3-Max не опенсорс, по крайней мере, пока. Зато доступна бесплатно по ссылке
https://chat.qwen.ai/
https://chat.qwen.ai/
chat.qwen.ai
Qwen Studio
Qwen Studio is an official platform from Qwen that empowers both everyday users and developers with unified access to Qwen’s series of open-source and proprietary models. It offers comprehensive functionality spanning chatbots, image and video understanding…
Happy Coder - прикольное приложение, которое позволяет продолжить сессию с Claude Code на телефоне или в браузере
Happy Engineering
Happy — Leave your desk. Keep your agents moving.
Control Claude Code, Codex, and other coding agents running on your computers from anywhere.
🔥1
Не знаю, зачем это нужно, но может кому и пригодится - увидел сегодня на GitHub пару библиотек.
Первая разворачивает Windows в контейнере на Linux сервере;
Вторая позволяет запускать приложения, которые работают на виндах.
В общем, если есть мичуринцы, желающие привить винду на линукс - велкам ))
Вот для меня куда более важна история редактирования документов с помощью ИИ - здесь тоже наработки есть, но с этим дело прямо непросто обстоит
Первая разворачивает Windows в контейнере на Linux сервере;
Вторая позволяет запускать приложения, которые работают на виндах.
В общем, если есть мичуринцы, желающие привить винду на линукс - велкам ))
Вот для меня куда более важна история редактирования документов с помощью ИИ - здесь тоже наработки есть, но с этим дело прямо непросто обстоит
GitHub
GitHub - dockur/windows: Windows inside a Docker container.
Windows inside a Docker container. Contribute to dockur/windows development by creating an account on GitHub.
Forwarded from Machine learning Interview
Здесь есть все — ссылки на бесплатные лекции от Стэнфорда, готовых агентов и чат-ботов, а также библиотеки для обучения собственных нейронок под любые задачи.
Репозитрий: https://github.com/balavenkatesh3322/awesome-AI-toolkit
Please open Telegram to view this post
VIEW IN TELEGRAM
Resemble AI - опенсорсная голосовая модель с 23 языками, включая русский. Прямой конкурент 11Labs. Очень интересно
www.resemble.ai
Multimodal Deepfake Detection and Watermarking for Enterprise | Resemble AI
Resemble AI powers real-time deepfake detection for enterprise. Verify media and satisfy AI content compliance standards. On-prem or cloud, built to scale.
🚀 MiniCPM-o 2.6: GPT-4o уровня, но open-source
OpenBMB выпустили революционную мультимодальную модель — MiniCPM-o 2.6. Всего 8B параметров, а результаты впечатляют: 70.2 балла на OpenCompass, превосходя GPT-4V и Claude 3.5 Sonnet. Модель объединяет SigLip-400M, Whisper-300M, ChatTTS-200M и Qwen2.5-7B в единую end-to-end архитектуру.
Ключевая фишка — real-time streaming 🎬. Модель принимает непрерывные потоки видео и аудио независимо от запросов пользователя. На StreamingBench (бенчмарк для real-time понимания) обогнала GPT-4o-202408 и Claude 3.5 Sonnet. Первая open-source модель с такими возможностями.
Техническая магия в деталях 🔧. Архитектура использует Time-Division Multiplexing (TDM) для обработки омни-модальных потоков в LLM backbone. Билингвальный синтез речи (английский/китайский) с настраиваемыми голосами, voice cloning и контроль эмоций. Token density — всего 640 токенов для 1.8M пиксельного изображения (на 75% меньше большинства моделей).
Практика для Mac пользователей 🖥️📱. Поддержка MPS (Apple Silicon), но пока без MLX оптимизации. Доступны 4-bit квантизация (int4/GGUF в 16 размерах) и llama.cpp для CPU инференса. На iPad Pro работает в реальном времени благодаря эффективной архитектуре. Требует 16GB+ RAM для комфортной работы.
Русский язык в деле 🇷🇺. Официальная поддержка 30+ языков, включая кириллицу. В команде OpenBMB есть понимание важности мультиязычности — результаты на multilingual LLaVA Bench показывают стабильно высокое качество.
Хайп в сообществе оправдан 🔥👍. Модель попала в топ GitHub Trending и топ-2 на HuggingFace Trending за неделю после релиза. Сообщество отмечает прорывные возможности в streaming, качество voice cloning и стабильность работы на edge devices. Единственные жалобы — на специфичные требования к transformers==4.44.2.
🔗 Основные ссылки: 🏠 Официальный HuggingFace 🐙 GitHub репозиторий 🎮 Онлайн демо
📱 Для Mac пользователей: 🗜️ 4-bit GGUF модели ⚡ llama.cpp поддержка 📝 Ollama интеграция
💬 Сообщество: 🔥 Обсуждение результатов 👍 Технический отчет
#нейросети #multimodal #opensource #написаноклодом
OpenBMB выпустили революционную мультимодальную модель — MiniCPM-o 2.6. Всего 8B параметров, а результаты впечатляют: 70.2 балла на OpenCompass, превосходя GPT-4V и Claude 3.5 Sonnet. Модель объединяет SigLip-400M, Whisper-300M, ChatTTS-200M и Qwen2.5-7B в единую end-to-end архитектуру.
Ключевая фишка — real-time streaming 🎬. Модель принимает непрерывные потоки видео и аудио независимо от запросов пользователя. На StreamingBench (бенчмарк для real-time понимания) обогнала GPT-4o-202408 и Claude 3.5 Sonnet. Первая open-source модель с такими возможностями.
Техническая магия в деталях 🔧. Архитектура использует Time-Division Multiplexing (TDM) для обработки омни-модальных потоков в LLM backbone. Билингвальный синтез речи (английский/китайский) с настраиваемыми голосами, voice cloning и контроль эмоций. Token density — всего 640 токенов для 1.8M пиксельного изображения (на 75% меньше большинства моделей).
Практика для Mac пользователей 🖥️📱. Поддержка MPS (Apple Silicon), но пока без MLX оптимизации. Доступны 4-bit квантизация (int4/GGUF в 16 размерах) и llama.cpp для CPU инференса. На iPad Pro работает в реальном времени благодаря эффективной архитектуре. Требует 16GB+ RAM для комфортной работы.
Русский язык в деле 🇷🇺. Официальная поддержка 30+ языков, включая кириллицу. В команде OpenBMB есть понимание важности мультиязычности — результаты на multilingual LLaVA Bench показывают стабильно высокое качество.
Хайп в сообществе оправдан 🔥👍. Модель попала в топ GitHub Trending и топ-2 на HuggingFace Trending за неделю после релиза. Сообщество отмечает прорывные возможности в streaming, качество voice cloning и стабильность работы на edge devices. Единственные жалобы — на специфичные требования к transformers==4.44.2.
🔗 Основные ссылки: 🏠 Официальный HuggingFace 🐙 GitHub репозиторий 🎮 Онлайн демо
📱 Для Mac пользователей: 🗜️ 4-bit GGUF модели ⚡ llama.cpp поддержка 📝 Ollama интеграция
💬 Сообщество: 🔥 Обсуждение результатов 👍 Технический отчет
#нейросети #multimodal #opensource #написаноклодом
huggingface.co
openbmb/MiniCPM-o-2_6 · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Forwarded from Data Secrets
Сентябрь == настроение поучиться. Собрали для всех желающих подборку из свежих бесплатных курсов по ML/DL от топовых мировых университетов
Сразу скажем: в подборке нет старых курсов. Все перечисленное не старше весны 2025 года, так что и информация, и код – актуальны. Все курсы открытые и бесплатные, с большим количеством практики. Везде доступны записи лекций, слайды и доп.материалы, кое-где еще и домашки.
1️⃣ MIT 6.S191: Introduction to Deep Learning. Интенсивный вводный курс по глубокому обучению. Охватывает: основы нейронных сетей, обучение сверточных и рекуррентных сетей, генеративные модели (включая генерацию музыки), большие языковые модели, RL, файнтюнинг. Много практических примеров применения в компьютерном зрении, NLP, биомедицине, играх и тд. Сайт (записи лекций внутри)
2️⃣ Stanford CS231n: Deep Learning for Computer Vision. Отличный базовый курс по CV. В целом около 20 часов лекций с разбором архитектур (CNN, ResNet, трансформеры и др.), методов оптимизации, детекции объектов, сегментации, генеративных моделей, мульти-модального обучения и обучения с подкреплением для CV. Одна из преподавателей – легендарная Фей-Фей Ли. Сайт (тут лекции и материалы), плейлист с лекциями
3️⃣ Stanford CS336: Language Modeling from Scratch. Собственно, внутренность соответствует названию: это прекрасный практический курс по LLM, в котором вы по порядку пройдете все этапы разработки LLM с нуля. Сбор и очистка данных для предобучения, архитектура трансформеров, обучение моделей на GPU-кластерах и масштабирование, оптимизация производительности, файнтюнинг, методы безопасности и alignment. Ну, в общем, прямо от А до Я. Сайт, плейлист
4️⃣ Harvard CS 2881R: AI Safety. Курс запущен в сотрудничестве с OpenAI. Темы уже для продвинутых: технические аспекты элаймента, предотвращение нежелательного поведения, социальные и философские вопросы влияния ИИ, RLHF, Constitutional AI, ограничения и риски современных систем, и даже анализ возможных сценариев и экзистенциальных рисков. Сайт (записи лекций внутри)
5️⃣ CMU 11-785: Introduction to Deep Learning. Совсем свежий курс от университета Карнеги–Меллона, который еще даже не закончился в самом университете. Хороший охват тем: нейросети, прямое и обратное распространение, CNN, CV, рекуррентные и трансформерные архитектуры, оптимизационные алгоритмы (SGD, Adam и др.), регуляризация и тд. Вполне подробно. Затрагивается даже вопрос обобщающей способности. Доступны домашки и их разборы. Записи лекций (уже выложены 4 лекции и 2 семинара, остальное продолжает выходить), сайт
Сохраняйте (а лучше не просто сохраняйте, но и находите время смотреть)👉
Сразу скажем: в подборке нет старых курсов. Все перечисленное не старше весны 2025 года, так что и информация, и код – актуальны. Все курсы открытые и бесплатные, с большим количеством практики. Везде доступны записи лекций, слайды и доп.материалы, кое-где еще и домашки.
Сохраняйте (а лучше не просто сохраняйте, но и находите время смотреть)
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from partially unsupervised
What makes Claude Code so damn good (and how to recreate that magic in your agent)
Рекомендую почитать любителям везде воткнуть мультиагентный граф, сверху накинуть векторный RAG и удивляться, почему все не очень работает.
Рекомендую почитать любителям везде воткнуть мультиагентный граф, сверху накинуть векторный RAG и удивляться, почему все не очень работает.
minusx.ai
What makes Claude Code so damn good (and how to recreate that magic in your agent)!?
Claude Code is the most delightful AI agent/workflow I have used so far. Not only does it make targeted edits or vibe coding throwaway tools less annoying, ...
Google снижает цены на Veo3 в 2 раза (это SOTA модель по генерации видео) и запускает генерацию вертикальных видео. В принципе, доступ к Veo3 - один из поводов купить платную подписку.
Googleblog
Google for Developers Blog - News about Web, Mobile, AI and Cloud
Veo updates: vertical video, 1080p HD, and lower pricing for Veo 3 and Veo 3 Fast. Now stable in Gemini API for high-quality video generation.
🎙️ Alibaba выпустила Qwen3-ASR-Flash — универсальную модель распознавания речи
Команда Qwen анонсировала Qwen3-ASR-Flash — специализированную ASR модель (автоматическое распознавание речи), обученную на базе Qwen3-Omni. Модель тренировалась на десятках миллионов часов речевых данных и показывает впечатляющие результаты на бенчмарках.
Ключевые характеристики:
Поддерживает 11 языков с диалектами: китайский (мандарин + кантонский, сычуаньский), английский (американский, британский), французский, немецкий, испанский, итальянский, португальский, русский, японский, корейский, арабский
Автоматическое определение языка и фильтрация тишины/шума
Контекстная настройка — можно подавать любой текст для улучшения точности (имена, жаргон, даже бессмыслицу)
Производительность превосходит конкурентов: 🖥️⚡ На тестах августа 2025 года Qwen3-ASR-Flash показал ошибку всего 3.97% на стандартном китайском против 8.98% у Gemini-2.5-Pro и 15.72% у GPT-4o-Transcribe. На английском — 3.81% против 7.63% и 8.45% соответственно.
Уникальная фишка — музыка: 🎵 Модель отлично распознает тексты песен с фоновой музыкой (ошибка 4.51% против 32.79% у Gemini и 58.59% у GPT-4o на полных песнях). Работает даже с рэпом и сложными акустическими условиями.
Для русского языка: 🇷🇺 Входит в список поддерживаемых языков, но пока нет детальных тестов качества работы с кириллицей.
Доступность: ✅🔒 Доступен только через API Alibaba Cloud (платформа Bailian). Веса модели не открыты. Есть демо на HuggingFace для тестирования.
🔗 Основные ссылки:
🎮 HuggingFace Demo
🏠 Официальный блог Qwen
🤖 ModelScope Demo
🔧 API Alibaba Cloud
#Qwen3ASR #ИИ #написаноклодом
Команда Qwen анонсировала Qwen3-ASR-Flash — специализированную ASR модель (автоматическое распознавание речи), обученную на базе Qwen3-Omni. Модель тренировалась на десятках миллионов часов речевых данных и показывает впечатляющие результаты на бенчмарках.
Ключевые характеристики:
Поддерживает 11 языков с диалектами: китайский (мандарин + кантонский, сычуаньский), английский (американский, британский), французский, немецкий, испанский, итальянский, португальский, русский, японский, корейский, арабский
Автоматическое определение языка и фильтрация тишины/шума
Контекстная настройка — можно подавать любой текст для улучшения точности (имена, жаргон, даже бессмыслицу)
Производительность превосходит конкурентов: 🖥️⚡ На тестах августа 2025 года Qwen3-ASR-Flash показал ошибку всего 3.97% на стандартном китайском против 8.98% у Gemini-2.5-Pro и 15.72% у GPT-4o-Transcribe. На английском — 3.81% против 7.63% и 8.45% соответственно.
Уникальная фишка — музыка: 🎵 Модель отлично распознает тексты песен с фоновой музыкой (ошибка 4.51% против 32.79% у Gemini и 58.59% у GPT-4o на полных песнях). Работает даже с рэпом и сложными акустическими условиями.
Для русского языка: 🇷🇺 Входит в список поддерживаемых языков, но пока нет детальных тестов качества работы с кириллицей.
Доступность: ✅🔒 Доступен только через API Alibaba Cloud (платформа Bailian). Веса модели не открыты. Есть демо на HuggingFace для тестирования.
🔗 Основные ссылки:
🎮 HuggingFace Demo
🏠 Официальный блог Qwen
🤖 ModelScope Demo
🔧 API Alibaba Cloud
#Qwen3ASR #ИИ #написаноклодом
huggingface.co
Qwen3 ASR Demo - a Hugging Face Space by Qwen
This app lets you upload an audio file and instantly get a written transcription. You can add optional context, choose a specific language or let the system detect it, and enable inverse text norma...
🔥1
Долгожнанная новость - нейросеть, в данном случае Claude начала работать с редактированием файлов MS Ofiice. Удивительно, конечно, что это не Copilot (совершенно бесполезный в офисных приложениях) или Gemini, который мог бы работать с google docs. Очень жду, когда функционал раскатают на более дешевые подписки - у меня много задачек такого рода, начиная с банального единообразного оформления справок и докладов..
Telegram
Refat Talks: Tech & AI
🤩 Claude научился создавать и редактировать реальные файлы: excel, word, powerpoint - мой детальный обзор
Пока фича доступна только на Max, Team и Enterprise тарифах (Pro получат скоро), я сразу потестил и хочу рассказать, как это вообще работает и что можно…
Пока фича доступна только на Max, Team и Enterprise тарифах (Pro получат скоро), я сразу потестил и хочу рассказать, как это вообще работает и что можно…
🔥2
🚀 K2-Think: новая frontier 32B модель
MBZUAI и G42 выпустили K2-Think — открытую reasoning-систему на 32B параметров, которая показывает результаты уровня frontier-моделей. Базируется на Qwen2.5-32B с добавлением продвинутого пост-тренинга: long chain-of-thought SFT (обучение с длинными цепочками рассуждений), RLVR (обучение с подкреплением от проверяемых наград), agentic планирование и test-time scaling.
Модель генерирует на 11.7% меньше токенов чем конкуренты, сохраняя качество ответов. Интересная особенность — "план-перед-решением" подход: сначала создает компактный план, потом полное решение.
Базируется на Qwen2.5-32B. Для 32B модели понадобится ~20GB RAM для 4-bit квантизации. На данный момент оптимизирована для Cerebras WSE с ~2000 токенов/сек.
Пока народ еще модель не распробовал, посмотрим, какие будут отзывы.
🔗 Основные ссылки:
🏠 [Техотчет](https://k2think-about.pages.dev/assets/tech-report/K2-Think_Tech-Report.pdf)
🤗 [HuggingFace](https://huggingface.co/LLM360/K2-Think)
🐙 [GitHub SFT](https://github.com/MBZUAI-IFM/K2-Think-SFT)
🎮 [Демо](https://k2think.ai/k2think)
💬 Сообщество:
(https://marktechpost.com/2025/09/09/mbzuai-researchers-release-k2-think-a-32b-open-source-system-for-advanced-ai-reasoning-and-outperforms-20x-larger-reasoning-models/)
#reasoning #opensource #написаноклодом
MBZUAI и G42 выпустили K2-Think — открытую reasoning-систему на 32B параметров, которая показывает результаты уровня frontier-моделей. Базируется на Qwen2.5-32B с добавлением продвинутого пост-тренинга: long chain-of-thought SFT (обучение с длинными цепочками рассуждений), RLVR (обучение с подкреплением от проверяемых наград), agentic планирование и test-time scaling.
Модель генерирует на 11.7% меньше токенов чем конкуренты, сохраняя качество ответов. Интересная особенность — "план-перед-решением" подход: сначала создает компактный план, потом полное решение.
Базируется на Qwen2.5-32B. Для 32B модели понадобится ~20GB RAM для 4-bit квантизации. На данный момент оптимизирована для Cerebras WSE с ~2000 токенов/сек.
Пока народ еще модель не распробовал, посмотрим, какие будут отзывы.
🔗 Основные ссылки:
🏠 [Техотчет](https://k2think-about.pages.dev/assets/tech-report/K2-Think_Tech-Report.pdf)
🤗 [HuggingFace](https://huggingface.co/LLM360/K2-Think)
🐙 [GitHub SFT](https://github.com/MBZUAI-IFM/K2-Think-SFT)
🎮 [Демо](https://k2think.ai/k2think)
💬 Сообщество:
(https://marktechpost.com/2025/09/09/mbzuai-researchers-release-k2-think-a-32b-open-source-system-for-advanced-ai-reasoning-and-outperforms-20x-larger-reasoning-models/)
#reasoning #opensource #написаноклодом
🚀 ERNIE X1.1: Baidu обновил reasoning-модель и сравнялся с GPT-5
На Wave Summit 2025 Baidu представил ERNIE X1.1 — улучшенную версию своей reasoning-модели. По сравнению с ERNIE X1 новая версия показала +34.8% точности фактов, +12.5% следования инструкциям и +9.6% агентских способностей. Базируется на ERNIE 4.5 с гибридным reinforcement learning и итеративной самодистилляцией.
Ключевые результаты: В бенчмарках превосходит DeepSeek R1-0528 и показывает результаты наравне с GPT-5 и Gemini 2.5 Pro. Особенно хорошо справляется с задачами, требующими рассуждений и точности фактов — проблемными зонами многих LLM.
🖼️🎬🎵 Мультимодальность: Поддерживает понимание и генерацию изображений, работу с видео, аудио и графиками. Может анализировать мемы, комиксы, чарты и даже фильмы. Особенность — высокий "эмоциональный интеллект" для понимания сарказма и интернет-культуры.
🖥️📱 Доступность: Сразу доступен в ERNIE Bot (ernie.baidu.com), приложении Wenxiaoyan и платформе Qianfan через API для разработчиков. Пока только на китайском и английском языках.
🇷🇺 Русский язык: Поддержка кириллицы есть (базируется на ERNIE 4.5)
🔥 Бонус релиза: Открыли исходники ERNIE-4.5-21B-A3B-Thinking — lightweight MoE модель (21B общих параметров, 3B активных) с 128K контекстом. Показывает near-SOTA результаты при значительно
🔗 Основные ссылки: 🏠 ERNIE Bot 🤗 GitHub ERNIE 🎮 Live демо
#reasoning #baidu #написаноклодом
На Wave Summit 2025 Baidu представил ERNIE X1.1 — улучшенную версию своей reasoning-модели. По сравнению с ERNIE X1 новая версия показала +34.8% точности фактов, +12.5% следования инструкциям и +9.6% агентских способностей. Базируется на ERNIE 4.5 с гибридным reinforcement learning и итеративной самодистилляцией.
Ключевые результаты: В бенчмарках превосходит DeepSeek R1-0528 и показывает результаты наравне с GPT-5 и Gemini 2.5 Pro. Особенно хорошо справляется с задачами, требующими рассуждений и точности фактов — проблемными зонами многих LLM.
🖼️🎬🎵 Мультимодальность: Поддерживает понимание и генерацию изображений, работу с видео, аудио и графиками. Может анализировать мемы, комиксы, чарты и даже фильмы. Особенность — высокий "эмоциональный интеллект" для понимания сарказма и интернет-культуры.
🖥️📱 Доступность: Сразу доступен в ERNIE Bot (ernie.baidu.com), приложении Wenxiaoyan и платформе Qianfan через API для разработчиков. Пока только на китайском и английском языках.
🇷🇺 Русский язык: Поддержка кириллицы есть (базируется на ERNIE 4.5)
🔥 Бонус релиза: Открыли исходники ERNIE-4.5-21B-A3B-Thinking — lightweight MoE модель (21B общих параметров, 3B активных) с 128K контекстом. Показывает near-SOTA результаты при значительно
🔗 Основные ссылки: 🏠 ERNIE Bot 🤗 GitHub ERNIE 🎮 Live демо
#reasoning #baidu #написаноклодом
ERNIE Blog