very vibe coding
120 subscribers
463 photos
126 videos
13 files
991 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Forwarded from Machinelearning
✔️ IBM представила Granite 4.0 — новое семейство open-weights языковых моделей от 3B до 32B параметров.

Четыре новые модели:
- Granite 4.0 H Small - 32B/9B активных параметров
- Granite 4.0 H Tiny - 7B/1B
- Granite 4.0 H Micro - 3B/3B
- Granite 4.0 Micro - 3B/3B

Benchmarking (Artificial Analysis Index):
- Granite 4.0 H Small: 23 балла (на 8 выше Granite 3.3 8B), обходит Gemma 3 27B (22), но уступает Mistral Small 3.2 (29) и Qwen3 30B A3B (37).
- Granite 4.0 Micro: 16 баллов, выше Gemma 3 4B (15) и LFM 2 2.6B (12).

⚡ Token efficiency:
- Granite 4.0 Small — 5.2M токенов
- Granite 4.0 Micro — 6.7M токенов

Обе модели заметно эффективнее Granite 3.3 8B и большинства non-reasoning моделей <40B.

Детали:
- Контекст: до 128K токенов
- Лицензия: Apache 2.0
- Granite 4.0 H Small доступна на Replicate по $0.06 / $0.25 за 1M input/output токенов
- Все модели доступны на Hugging Face
- Модель Micro (3.4B) можно запускать полностью локально.

🔗 Hugging Face: https://huggingface.co/collections/unsloth/granite-40-68ddf64b4a8717dc22a9322d
🔗 Unsloth: https://docs.unsloth.ai/new/ibm-granite-4.0

@ai_machinelearning_big_data


#AI #IBM #Granite4 #LLM #OpenWeights
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🚀 Qwen3-VL: визуальный ИИ с режимом "мышления" и агентскими способностями

Команда Qwen выпустила Qwen3-VL — самую мощную мультимодальную модель в линейке. Модель доступна в двух версиях: Qwen3-VL-235B-A22B-Instruct и Qwen3-VL-235B-A22B-Thinking Qwen3-VL: Sharper Vision, Deeper Thought, Broader Action, плюс компактная версия Qwen3-VL-30B-A3B (30B общих параметров, 3B активных). Релиз состоялся 23 сентября, сейчас начинают приходить результаты тестирования модели, и они весьма впечатляющие.

Ключевые фишки:
Модель работает с текстом, изображениями и видео через единый интерфейс. Умеет управлять GUI компьютера и мобильных устройств — распознает элементы интерфейса, понимает их функции и выполняет задачи. Генерирует код (HTML/CSS/JS/Draw.io) из скриншотов и видео. Поддерживает продвинутое 2D/3D позиционирование объектов для spatial reasoning

Qwen/Qwen3-VL-30B-A3B-Instruct OCR работает на 32 языках (включая русский) с высокой точностью даже на низкокачественных сканах. Пользователи хвалят. Контекст: 256K токенов нативно, расширяется до 1 миллиона. Можно загрузить целые учебники или часы видео.

Два режима работы: Instruct для быстрых ответов, Thinking для сложных задач с рассуждениями. Версия Instruct сопоставима с Gemini 2.5 Pro по визуальному пониманию, а Thinking показывает SOTA на математических бенчмарках.

Interleaved-MRoPE для лучшего понимания длинных видео, DeepStack для детального анализа изображений, выравнивание текста с временными метками для точной локализации событий в видео.

Размер и доступность:
Flagship-модель Qwen3-VL-235B-A22B весит 471 GB — не запустишь на обычном Mac Qwen3-VL: Sharper Vision, Deeper Thought, Broader Action. Но есть версия 30B-A3B (3B активных параметров), которая должна работать на мощных Mac, плюс выпущены FP8-квантизации. Все под лицензией Apache 2.0.

Qwen движется быстро — учитывая их темп релизов, меньшие версии Qwen3-VL могут появиться в ближайшие дни Qwen3-VL: Sharper Vision, Deeper Thought, Broader Action. Это серьезная альтернатива закрытым моделям с упором на визуальные задачи и агентские возможности.

#мультимодальныеLLM #VLM #написаноклодом
🤣🤣🥲

Такая подстава )) пытаюсь тут оживить Claude code - он банится с VPN даже со своим сервером (жесть), зашел тут в какое-то окошко на десктопном приложении с артефактами - там тоже сидит свой Claude code, только он не настоящий, а имитация ))) Засранцы, а я-то надеялся
Forwarded from Machinelearning
This media is not supported in your browser
VIEW IN TELEGRAM
✔️ GenAI прямо на устройстве: Chrome, Chromebook Plus и Pixel Watch с LiteRT-LM

Google выпустили LiteRT-LM - фреймворк для запуска LLM прямо на устройстве (offline), с минимальной задержкой и без API-вызовов.


Если вы пилите приложения, это полезная штука, потому что:
- Работает на устройстве: нет задержек от удалённых серверов
- Нет расходов на API
- Дает доступ к Локальному GenAI

🔍 Основное
- LiteRT-LM уже используется внутри Gemini Nano / Gemma в Chrome, Chromebook Plus и Pixel Watch.
- Открытый C++ интерфейс (preview) для интеграции в кастомные решения.
- Архитектура: Engine + Session
  • Engine хранит базовую модель, ресурсы - общий для всех функций
  • Session - контекст для отдельных задач, с возможностью клонирования, копирования “по записи” (Copy-on-Write) и лёгких переключений
- Поддержка аппаратного ускорения (CPU / GPU / NPU) и кроссплатформенность (Android, Linux, macOS, Windows и др.)
- Для Pixel Watch используется минимальный “pipeline” - только необходимые компоненты - чтобы уложиться в ограничения памяти и размера бинарей

Google опенсорснули целый стек для запуска GenAI на устройствах:

- LiteRT быстрый «движок», который запускает отдельные AI-модели на устройстве.

- LiteRT-LM - интерфейс C++ для работы с LLM. Он объединяет сразу несколько инстурментов : кэширование промптов, хранение контекста, клонирование сессий и т.д.

- LLM Inference API - готовые интерфейсы для разработчиков (Kotlin, Swift, JS). Работают поверх LiteRT-LM, чтобы можно было легко встраивать GenAI в приложения.

🟠Подробнее: https://developers.googleblog.com/en/on-device-genai-in-chrome-chromebook-plus-and-pixel-watch-with-litert-lm/

@ai_machinelearning_big_data

#AI #Google #LiteRT #LiteRTLM #GenAI #EdgeAI #OnDeviceAI #LLM
Please open Telegram to view this post
VIEW IN TELEGRAM
На выходных мало писал, потому что мало читал. Занимался своими задачками. Где-то прямо почти получилось, где-то еще надо поработать.

Во-первых, теперь я обхожусь без vpn - и это было открытие дня. Начал настраивать потому что claude code не работал (проблему решил, но сейчас опять не работает - зато теперь понимаю, как можно порешать, попробую уже позже).

Идея в том, что настроил себе прокси - купил американские, итальянские и пр. IP (в пакете 20 штук) и настроил так, чтобы зарубежные сайты шли через прокси, а российские - напрямую.

Работает! Сделал себе на компе, на сервере, на телефоне. Теперь мне не надо переключаться - включать, отключать vpn, все работает все время ))

Естественно, все сделал на open-source. Сама программулина - китайская, думаю, они знают толк в таких вещах.

В общем, интересно провел выходной. Вечером работаю над другой, уже более прикладной, но для меня очень важной задачкой - как мотивировать ребенка учить python. Расскажу об этом немного попозже, надеюсь и покажу - для тех, кто пользуется Claude
👍1
OpenAI запускает функционал по созданию агентов, как в n8n. Эти щупальца до всех дотянутся - нет такой сферы и такого ПО, куда в перспективе не полезет Сам Альтман
В курсоре новая модель Cheetah неизвестного происхождения, умная и очень быстрая. Скорее всего, это тестируется будущая Gemini 3 от Google
Forwarded from СВЕЖЕСТИ
❗️Amazon закрывает в Великобритании свои продуктовые магазины без касс, работающие под контролем искусственного интеллекта, после того, как британцы перестали туда ходить, когда выяснилось, что удаленные индийские работники следят за покупателями и рассчитывают их счета на кассе вместо того, чтобы это делал искусственный интеллект.
🚀 NeuTTS Air - on-device TTS с мгновенным клонированием голоса

Это первая реалистичная модель синтеза речи, запускаемая на устройстве, без api.

Формат - GGML, что позволяет работать на телефонах, ноутбуках и даже на Raspberry Pi.
Клонирование голоса за 3 секунды: достаточно короткого аудиофрагмента, чтобы сконструировать голос для последующих синтезов.

Базируется на лёгком языковом ядре (0,5 B) + нейрокодек NeuCodec, что обеспечивает баланс между качеством и скоростью.
Генерируемые аудио отмечаются водяным знаком с помощью Perceptual Threshold Watermarker — для борьбы с злоупотреблениями.

GitHub: https://github.com/neuphonic/neutts-air
This media is not supported in your browser
VIEW IN TELEGRAM
🎥 Генерация видео из кода с Code2Video

Code2Video предлагает инновационный подход к созданию образовательных видео на основе кода. Проект позволяет визуализировать программные концепции, превращая код в наглядные видеоматериалы, что упрощает обучение и понимание.

🚀Основные моменты:
- Генерация видео на основе программного кода.
- Поддержка различных учебных тем.
- Визуализация сложных концепций в доступной форме.
- Открытый доступ к проекту и данным.

📌 GitHub: https://github.com/showlab/Code2Video

#python
Forwarded from Machinelearning
🔥 Главное с OpenAI DevDay 2025

✔️ App SDK
Позволяет создать нативные приложенийяпрямо внутри ChatGPT.

Идея простая: теперь не нужно выходить из ChatGPT, чтобы делать привычные вещи.
Можно прямо в чате работать с дизайном в Figma, создавать презентации в Canva, искать жильё на Booking или смотреть курсы на Coursera — всё в одном окне.

Платформа поддерживает авторизацию, оплату и подключение внешних сервисов,
а значит, ChatGPT становится центром, где совмещаются ИИ, приложения и автоматизация задач.

Скоро разработчики (вайбкодеры) смогут добавлять свои приложения и зарабатывать на них через ChatGPT SDK.

✔️Agent Builder

По сути это убийца n8n и Zapier.
Это интуитивно понятный**визуальный конструктор**, где можно создавать своих ИИ-агентов без единой строчки кода.
Просто перетаскиваешь блоки, подключаешь MCP и ChatKit — и агент сам ищет файлы, анализирует данные и выполняет задачи.
Инструмент уже доступен всем.
OpenAi умеют в дизайн, должно быть удобно.
Можно уже попробовать: https://platform.openai.com/agent-builder

✔️ Обновили Codex

Вышел из беты, получил интеграцию со Slack и собственный SDK.
На демо агент управлял светом и экраном голосом - без кода.

На презентации заявили, что теперь почти весь их код пишется с помощью Codex

Благодаря Codex разработчики OpenAI стали отправлять на 70% больше pull-request’ов в неделю, чем раньше.

Теперь у кодекса появляется интеграция со Slack и SDK, чтобы разработчики могли встраивать его в свои рабочие процессы.

Прямо в эфире Codex написал код для управления камерой, сам собрал интерфейс и **запустил готовое при

✔️ GPT-5 Pro - доступна по API

$15 за ввод и $120 за вывод за 1M токенов

Gpt-realtime-mini - на 70% дешевле, подходит для мгновенных ответов и потоковых задач

✔️ Sora 2 - будет доступна по API.

Можно будет генерировать видео прямо из кода

PS: Agent Builder выглядит действительно интересно - интуитивный, гибкий, инструмент с большим потенциало
м.
А вот насколько полезными окажутся приложения внутри ChatGPT, не особо понятно.

OpenAI не боится экспериментировать.
Они развивают ChatGPT как платформу, ищут
новые варианты захвата рынка и пробуют смелые идеи. Это дорогого стоит.

Их интерфейс просто топ: минимализм, аккуратность, почти в духе Apple. UX - на уровне искусства.

У OpenAI уже более 800 млн активных пользователей в неделю и они обрабатывают 6 миллиардов токенов в минуту!

К концу года число пользователей, похоже, вплотную подойдёт к 1 миллиарду.

Но гонка только начинается.
Google явно готовит ответ - Gemini 3 обещает быть топом. Другие игроки тоже не дремлют.

@ai_machinelearning_big_data


#openai #chatgpt #llm #ml #ai
Please open Telegram to view this post
VIEW IN TELEGRAM