🚀 Qwen3-VL: визуальный ИИ с режимом "мышления" и агентскими способностями
Команда Qwen выпустила Qwen3-VL — самую мощную мультимодальную модель в линейке. Модель доступна в двух версиях: Qwen3-VL-235B-A22B-Instruct и Qwen3-VL-235B-A22B-Thinking Qwen3-VL: Sharper Vision, Deeper Thought, Broader Action, плюс компактная версия Qwen3-VL-30B-A3B (30B общих параметров, 3B активных). Релиз состоялся 23 сентября, сейчас начинают приходить результаты тестирования модели, и они весьма впечатляющие.
Ключевые фишки:
Модель работает с текстом, изображениями и видео через единый интерфейс. Умеет управлять GUI компьютера и мобильных устройств — распознает элементы интерфейса, понимает их функции и выполняет задачи. Генерирует код (HTML/CSS/JS/Draw.io) из скриншотов и видео. Поддерживает продвинутое 2D/3D позиционирование объектов для spatial reasoning
Qwen/Qwen3-VL-30B-A3B-Instruct OCR работает на 32 языках (включая русский) с высокой точностью даже на низкокачественных сканах. Пользователи хвалят. Контекст: 256K токенов нативно, расширяется до 1 миллиона. Можно загрузить целые учебники или часы видео.
Два режима работы: Instruct для быстрых ответов, Thinking для сложных задач с рассуждениями. Версия Instruct сопоставима с Gemini 2.5 Pro по визуальному пониманию, а Thinking показывает SOTA на математических бенчмарках.
Interleaved-MRoPE для лучшего понимания длинных видео, DeepStack для детального анализа изображений, выравнивание текста с временными метками для точной локализации событий в видео.
Размер и доступность:
Flagship-модель Qwen3-VL-235B-A22B весит 471 GB — не запустишь на обычном Mac Qwen3-VL: Sharper Vision, Deeper Thought, Broader Action. Но есть версия 30B-A3B (3B активных параметров), которая должна работать на мощных Mac, плюс выпущены FP8-квантизации. Все под лицензией Apache 2.0.
Qwen движется быстро — учитывая их темп релизов, меньшие версии Qwen3-VL могут появиться в ближайшие дни Qwen3-VL: Sharper Vision, Deeper Thought, Broader Action. Это серьезная альтернатива закрытым моделям с упором на визуальные задачи и агентские возможности.
#мультимодальныеLLM #VLM #написаноклодом
Команда Qwen выпустила Qwen3-VL — самую мощную мультимодальную модель в линейке. Модель доступна в двух версиях: Qwen3-VL-235B-A22B-Instruct и Qwen3-VL-235B-A22B-Thinking Qwen3-VL: Sharper Vision, Deeper Thought, Broader Action, плюс компактная версия Qwen3-VL-30B-A3B (30B общих параметров, 3B активных). Релиз состоялся 23 сентября, сейчас начинают приходить результаты тестирования модели, и они весьма впечатляющие.
Ключевые фишки:
Модель работает с текстом, изображениями и видео через единый интерфейс. Умеет управлять GUI компьютера и мобильных устройств — распознает элементы интерфейса, понимает их функции и выполняет задачи. Генерирует код (HTML/CSS/JS/Draw.io) из скриншотов и видео. Поддерживает продвинутое 2D/3D позиционирование объектов для spatial reasoning
Qwen/Qwen3-VL-30B-A3B-Instruct OCR работает на 32 языках (включая русский) с высокой точностью даже на низкокачественных сканах. Пользователи хвалят. Контекст: 256K токенов нативно, расширяется до 1 миллиона. Можно загрузить целые учебники или часы видео.
Два режима работы: Instruct для быстрых ответов, Thinking для сложных задач с рассуждениями. Версия Instruct сопоставима с Gemini 2.5 Pro по визуальному пониманию, а Thinking показывает SOTA на математических бенчмарках.
Interleaved-MRoPE для лучшего понимания длинных видео, DeepStack для детального анализа изображений, выравнивание текста с временными метками для точной локализации событий в видео.
Размер и доступность:
Flagship-модель Qwen3-VL-235B-A22B весит 471 GB — не запустишь на обычном Mac Qwen3-VL: Sharper Vision, Deeper Thought, Broader Action. Но есть версия 30B-A3B (3B активных параметров), которая должна работать на мощных Mac, плюс выпущены FP8-квантизации. Все под лицензией Apache 2.0.
Qwen движется быстро — учитывая их темп релизов, меньшие версии Qwen3-VL могут появиться в ближайшие дни Qwen3-VL: Sharper Vision, Deeper Thought, Broader Action. Это серьезная альтернатива закрытым моделям с упором на визуальные задачи и агентские возможности.
#мультимодальныеLLM #VLM #написаноклодом
Forwarded from Machinelearning
This media is not supported in your browser
VIEW IN TELEGRAM
Google выпустили LiteRT-LM - фреймворк для запуска LLM прямо на устройстве (offline), с минимальной задержкой и без API-вызовов.
Если вы пилите приложения, это полезная штука, потому что:
- Работает на устройстве: нет задержек от удалённых серверов
- Нет расходов на API
- Дает доступ к Локальному GenAI
🔍 Основное
- LiteRT-LM уже используется внутри Gemini Nano / Gemma в Chrome, Chromebook Plus и Pixel Watch.
- Открытый C++ интерфейс (preview) для интеграции в кастомные решения.
- Архитектура: Engine + Session
• Engine хранит базовую модель, ресурсы - общий для всех функций
• Session - контекст для отдельных задач, с возможностью клонирования, копирования “по записи” (Copy-on-Write) и лёгких переключений
- Поддержка аппаратного ускорения (CPU / GPU / NPU) и кроссплатформенность (Android, Linux, macOS, Windows и др.)
- Для Pixel Watch используется минимальный “pipeline” - только необходимые компоненты - чтобы уложиться в ограничения памяти и размера бинарей
Google опенсорснули целый стек для запуска GenAI на устройствах:
- LiteRT быстрый «движок», который запускает отдельные AI-модели на устройстве.
- LiteRT-LM - интерфейс C++ для работы с LLM. Он объединяет сразу несколько инстурментов : кэширование промптов, хранение контекста, клонирование сессий и т.д.
- LLM Inference API - готовые интерфейсы для разработчиков (Kotlin, Swift, JS). Работают поверх LiteRT-LM, чтобы можно было легко встраивать GenAI в приложения.
@ai_machinelearning_big_data
#AI #Google #LiteRT #LiteRTLM #GenAI #EdgeAI #OnDeviceAI #LLM
Please open Telegram to view this post
VIEW IN TELEGRAM
На выходных мало писал, потому что мало читал. Занимался своими задачками. Где-то прямо почти получилось, где-то еще надо поработать.
Во-первых, теперь я обхожусь без vpn - и это было открытие дня. Начал настраивать потому что claude code не работал (проблему решил, но сейчас опять не работает - зато теперь понимаю, как можно порешать, попробую уже позже).
Идея в том, что настроил себе прокси - купил американские, итальянские и пр. IP (в пакете 20 штук) и настроил так, чтобы зарубежные сайты шли через прокси, а российские - напрямую.
Работает! Сделал себе на компе, на сервере, на телефоне. Теперь мне не надо переключаться - включать, отключать vpn, все работает все время ))
Естественно, все сделал на open-source. Сама программулина - китайская, думаю, они знают толк в таких вещах.
В общем, интересно провел выходной. Вечером работаю над другой, уже более прикладной, но для меня очень важной задачкой - как мотивировать ребенка учить python. Расскажу об этом немного попозже, надеюсь и покажу - для тех, кто пользуется Claude
Во-первых, теперь я обхожусь без vpn - и это было открытие дня. Начал настраивать потому что claude code не работал (проблему решил, но сейчас опять не работает - зато теперь понимаю, как можно порешать, попробую уже позже).
Идея в том, что настроил себе прокси - купил американские, итальянские и пр. IP (в пакете 20 штук) и настроил так, чтобы зарубежные сайты шли через прокси, а российские - напрямую.
Работает! Сделал себе на компе, на сервере, на телефоне. Теперь мне не надо переключаться - включать, отключать vpn, все работает все время ))
Естественно, все сделал на open-source. Сама программулина - китайская, думаю, они знают толк в таких вещах.
В общем, интересно провел выходной. Вечером работаю над другой, уже более прикладной, но для меня очень важной задачкой - как мотивировать ребенка учить python. Расскажу об этом немного попозже, надеюсь и покажу - для тех, кто пользуется Claude
👍1
OpenAI запускает функционал по созданию агентов, как в n8n. Эти щупальца до всех дотянутся - нет такой сферы и такого ПО, куда в перспективе не полезет Сам Альтман
В курсоре новая модель Cheetah неизвестного происхождения, умная и очень быстрая. Скорее всего, это тестируется будущая Gemini 3 от Google
Forwarded from СВЕЖЕСТИ
❗️Amazon закрывает в Великобритании свои продуктовые магазины без касс, работающие под контролем искусственного интеллекта, после того, как британцы перестали туда ходить, когда выяснилось, что удаленные индийские работники следят за покупателями и рассчитывают их счета на кассе вместо того, чтобы это делал искусственный интеллект.
Forwarded from Анализ данных (Data analysis)
🚀 NeuTTS Air - on-device TTS с мгновенным клонированием голоса
Это первая реалистичная модель синтеза речи, запускаемая на устройстве, без api.
Формат - GGML, что позволяет работать на телефонах, ноутбуках и даже на Raspberry Pi.
Клонирование голоса за 3 секунды: достаточно короткого аудиофрагмента, чтобы сконструировать голос для последующих синтезов.
Базируется на лёгком языковом ядре (0,5 B) + нейрокодек NeuCodec, что обеспечивает баланс между качеством и скоростью.
Генерируемые аудио отмечаются водяным знаком с помощью Perceptual Threshold Watermarker — для борьбы с злоупотреблениями.
GitHub: https://github.com/neuphonic/neutts-air
Это первая реалистичная модель синтеза речи, запускаемая на устройстве, без api.
Формат - GGML, что позволяет работать на телефонах, ноутбуках и даже на Raspberry Pi.
Клонирование голоса за 3 секунды: достаточно короткого аудиофрагмента, чтобы сконструировать голос для последующих синтезов.
Базируется на лёгком языковом ядре (0,5 B) + нейрокодек NeuCodec, что обеспечивает баланс между качеством и скоростью.
Генерируемые аудио отмечаются водяным знаком с помощью Perceptual Threshold Watermarker — для борьбы с злоупотреблениями.
GitHub: https://github.com/neuphonic/neutts-air
Forwarded from Machine learning Interview
This media is not supported in your browser
VIEW IN TELEGRAM
🎥 Генерация видео из кода с Code2Video
Code2Video предлагает инновационный подход к созданию образовательных видео на основе кода. Проект позволяет визуализировать программные концепции, превращая код в наглядные видеоматериалы, что упрощает обучение и понимание.
🚀Основные моменты:
- Генерация видео на основе программного кода.
- Поддержка различных учебных тем.
- Визуализация сложных концепций в доступной форме.
- Открытый доступ к проекту и данным.
📌 GitHub: https://github.com/showlab/Code2Video
#python
Code2Video предлагает инновационный подход к созданию образовательных видео на основе кода. Проект позволяет визуализировать программные концепции, превращая код в наглядные видеоматериалы, что упрощает обучение и понимание.
🚀Основные моменты:
- Генерация видео на основе программного кода.
- Поддержка различных учебных тем.
- Визуализация сложных концепций в доступной форме.
- Открытый доступ к проекту и данным.
📌 GitHub: https://github.com/showlab/Code2Video
#python
Forwarded from Machinelearning
Позволяет создать нативные приложенийяпрямо внутри ChatGPT.
Идея простая: теперь не нужно выходить из ChatGPT, чтобы делать привычные вещи.
Можно прямо в чате работать с дизайном в Figma, создавать презентации в Canva, искать жильё на Booking или смотреть курсы на Coursera — всё в одном окне.
Платформа поддерживает авторизацию, оплату и подключение внешних сервисов,
а значит, ChatGPT становится центром, где совмещаются ИИ, приложения и автоматизация задач.
Скоро разработчики (вайбкодеры) смогут добавлять свои приложения и зарабатывать на них через ChatGPT SDK.
По сути это убийца n8n и Zapier.
Это интуитивно понятный**визуальный конструктор**, где можно создавать своих ИИ-агентов без единой строчки кода.
Просто перетаскиваешь блоки, подключаешь MCP и ChatKit — и агент сам ищет файлы, анализирует данные и выполняет задачи.
Инструмент уже доступен всем.
OpenAi умеют в дизайн, должно быть удобно.
Можно уже попробовать: https://platform.openai.com/agent-builder
Вышел из беты, получил интеграцию со Slack и собственный SDK.
На демо агент управлял светом и экраном голосом - без кода.
На презентации заявили, что теперь почти весь их код пишется с помощью Codex
Благодаря Codex разработчики OpenAI стали отправлять на 70% больше pull-request’ов в неделю, чем раньше.
Теперь у кодекса появляется интеграция со Slack и SDK, чтобы разработчики могли встраивать его в свои рабочие процессы.
Прямо в эфире Codex написал код для управления камерой, сам собрал интерфейс и **запустил готовое при
$15 за ввод и $120 за вывод за 1M токенов
Gpt-realtime-mini - на 70% дешевле, подходит для мгновенных ответов и потоковых задач
Можно будет генерировать видео прямо из кода
PS: Agent Builder выглядит действительно интересно - интуитивный, гибкий, инструмент с большим потенциало
м.
А вот насколько полезными окажутся приложения внутри ChatGPT, не особо понятно.
OpenAI не боится экспериментировать.
Они развивают ChatGPT как платформу, ищут
новые варианты захвата рынка и пробуют смелые идеи. Это дорогого стоит.
Их интерфейс просто топ: минимализм, аккуратность, почти в духе Apple. UX - на уровне искусства.
У OpenAI уже более 800 млн активных пользователей в неделю и они обрабатывают 6 миллиардов токенов в минуту!
К концу года число пользователей, похоже, вплотную подойдёт к 1 миллиарду.
Но гонка только начинается.
Google явно готовит ответ - Gemini 3 обещает быть топом. Другие игроки тоже не дремлют.
@ai_machinelearning_big_data
#openai #chatgpt #llm #ml #ai
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Data Secrets
Google выпустили новую SOTA Computer Use модель на базе Gemini 2.5
На многих основных бенчмарках она солидно обгоняет Agent режим от ChatGPT, Claude Sonnet 4 и 4.5. Плюс, заявляется гораздо более низкая задержка.
Модель хорошо работает с вебом и неплохо – с мобильными устройствами. Для компьютерной ОС она не оптимизирована, так что, предположительно, вести себя будет не очень.
Под капотом, по сути, прокачанный tool use для Gemini 2.5. На каждом шаге ей на вход поступает скриншот экрана, и она вызывает определенные функции типа clicking или typing с нужными аргументами.
Еще хвастаются безопасностью модели. Во-первых, вы прямо в системном промпте можете контролировать, какие действия надо подтверждать, какие нет. Во-вторых, есть внешний авто-оценщик, который на каждом шаге независимо перепроверяет, что делает модель, и выбрасывает алерты, если происходит что-то не то. Подробнее можно почитать в системной карте.
Сейчас модель уже доступна в public preview. Попробовать можно через API.
Кстати, ползет слух, что на этой неделе должна выйти Gemini 3.0
На многих основных бенчмарках она солидно обгоняет Agent режим от ChatGPT, Claude Sonnet 4 и 4.5. Плюс, заявляется гораздо более низкая задержка.
Модель хорошо работает с вебом и неплохо – с мобильными устройствами. Для компьютерной ОС она не оптимизирована, так что, предположительно, вести себя будет не очень.
Под капотом, по сути, прокачанный tool use для Gemini 2.5. На каждом шаге ей на вход поступает скриншот экрана, и она вызывает определенные функции типа clicking или typing с нужными аргументами.
Еще хвастаются безопасностью модели. Во-первых, вы прямо в системном промпте можете контролировать, какие действия надо подтверждать, какие нет. Во-вторых, есть внешний авто-оценщик, который на каждом шаге независимо перепроверяет, что делает модель, и выбрасывает алерты, если происходит что-то не то. Подробнее можно почитать в системной карте.
Сейчас модель уже доступна в public preview. Попробовать можно через API.
Кстати, ползет слух, что на этой неделе должна выйти Gemini 3.0
Forwarded from Data Secrets
Крошечная модель на 7 миллионов параметров превзошла DeepSeek-R1, Gemini 2.5 Pro и o3-mini на ARG-AGI 1 и ARC-AGI 2
Сегодня разбираем самую громкую статью последних дней: "Less is More: Recursive Reasoning with Tiny Networks" от Samsung. В работе, кстати, всего один автор (большая редкость, особенно для корпоративных исследований).
Итак, главный вопрос: как это вообще возможно, чтобы модель в 10 000 раз меньше была настолько умнее?
Ответ: рекурсия. Модель (Tiny Recursive Model, TRM) многократко думает над своим ответом, пересматривает его и исправляет, прежде чем выдать окончательное решение. Выглядит процесс примерно так:
1. Модель получает условия задачки и сразу генерирует какой-то грубый набросок решения. Он не обязательно должен быть правильным, это просто быстрая догадка.
2. Дальше система создает "мысленный блокнот" – scratchpad. Туда она записывает всё, что думает о задаче и своём черновике: где ошибки, что можно улучшить, как проверить гипотезу. При этом важно понимать, что scratchpad – это не поток токенов, как в обычном ризонинге. Это внутреннее скрытое состояние, то есть матрица или вектор, который постепенно обновляется. Другими словами, TRM умеет думает молча.
3. Модель в несколько проходов обновляет это внутреннее состояние, каждый раз сверяясь с (а) задачей и (б) исходным наброском. Она как бы думает: согласуется ли текущий черновик с условием, где противоречия, что улучшить. После N-ого количества итераций модель переписывает исходный черновик, опираясь на свой сформированный scratchpad. Но это не все. Этот процесс (сначала подумай → потом исправь) повторяется несколько раз. И вот только после этого мы получаем финальный ответ.
Результаты, конечно, поражают. Метрики на ARC-AGI-1 / ARC-AGI-2 – 44.6% / 7.8%. Для сравнения, у o3-mini-high – 34.5% / 3.0%. Также модель отлично решает судоку и лабиринты.
Единственная честная оговорка: это не языковая модель, она предназначена только для алгоритмов и текстом отвечать не умеет. Тем не менее, идея блестящая. Много раз пройтись одной и той же крохотной сеткой по scratchpad – это буквально как эмулировать глубину большой модели без большой модели. Отличный пример алгоритмического преимущества.
Крайне советуем почитать статью полностью тут. К слову, они там много ссылаются на августовскую работу про Hierarchical Reasoning Model (HRM). Если захотите освежить память по этому исследованию, то вот тут – наш разбор.
Сегодня разбираем самую громкую статью последних дней: "Less is More: Recursive Reasoning with Tiny Networks" от Samsung. В работе, кстати, всего один автор (большая редкость, особенно для корпоративных исследований).
Итак, главный вопрос: как это вообще возможно, чтобы модель в 10 000 раз меньше была настолько умнее?
Ответ: рекурсия. Модель (Tiny Recursive Model, TRM) многократко думает над своим ответом, пересматривает его и исправляет, прежде чем выдать окончательное решение. Выглядит процесс примерно так:
1. Модель получает условия задачки и сразу генерирует какой-то грубый набросок решения. Он не обязательно должен быть правильным, это просто быстрая догадка.
2. Дальше система создает "мысленный блокнот" – scratchpad. Туда она записывает всё, что думает о задаче и своём черновике: где ошибки, что можно улучшить, как проверить гипотезу. При этом важно понимать, что scratchpad – это не поток токенов, как в обычном ризонинге. Это внутреннее скрытое состояние, то есть матрица или вектор, который постепенно обновляется. Другими словами, TRM умеет думает молча.
3. Модель в несколько проходов обновляет это внутреннее состояние, каждый раз сверяясь с (а) задачей и (б) исходным наброском. Она как бы думает: согласуется ли текущий черновик с условием, где противоречия, что улучшить. После N-ого количества итераций модель переписывает исходный черновик, опираясь на свой сформированный scratchpad. Но это не все. Этот процесс (сначала подумай → потом исправь) повторяется несколько раз. И вот только после этого мы получаем финальный ответ.
Результаты, конечно, поражают. Метрики на ARC-AGI-1 / ARC-AGI-2 – 44.6% / 7.8%. Для сравнения, у o3-mini-high – 34.5% / 3.0%. Также модель отлично решает судоку и лабиринты.
Единственная честная оговорка: это не языковая модель, она предназначена только для алгоритмов и текстом отвечать не умеет. Тем не менее, идея блестящая. Много раз пройтись одной и той же крохотной сеткой по scratchpad – это буквально как эмулировать глубину большой модели без большой модели. Отличный пример алгоритмического преимущества.
Крайне советуем почитать статью полностью тут. К слову, они там много ссылаются на августовскую работу про Hierarchical Reasoning Model (HRM). Если захотите освежить память по этому исследованию, то вот тут – наш разбор.