very vibe coding
120 subscribers
463 photos
126 videos
13 files
991 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Forwarded from Machinelearning
✔️ IBM представила Granite 4.0 — новое семейство open-weights языковых моделей от 3B до 32B параметров.

Четыре новые модели:
- Granite 4.0 H Small - 32B/9B активных параметров
- Granite 4.0 H Tiny - 7B/1B
- Granite 4.0 H Micro - 3B/3B
- Granite 4.0 Micro - 3B/3B

Benchmarking (Artificial Analysis Index):
- Granite 4.0 H Small: 23 балла (на 8 выше Granite 3.3 8B), обходит Gemma 3 27B (22), но уступает Mistral Small 3.2 (29) и Qwen3 30B A3B (37).
- Granite 4.0 Micro: 16 баллов, выше Gemma 3 4B (15) и LFM 2 2.6B (12).

⚡ Token efficiency:
- Granite 4.0 Small — 5.2M токенов
- Granite 4.0 Micro — 6.7M токенов

Обе модели заметно эффективнее Granite 3.3 8B и большинства non-reasoning моделей <40B.

Детали:
- Контекст: до 128K токенов
- Лицензия: Apache 2.0
- Granite 4.0 H Small доступна на Replicate по $0.06 / $0.25 за 1M input/output токенов
- Все модели доступны на Hugging Face
- Модель Micro (3.4B) можно запускать полностью локально.

🔗 Hugging Face: https://huggingface.co/collections/unsloth/granite-40-68ddf64b4a8717dc22a9322d
🔗 Unsloth: https://docs.unsloth.ai/new/ibm-granite-4.0

@ai_machinelearning_big_data


#AI #IBM #Granite4 #LLM #OpenWeights
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🚀 Qwen3-VL: визуальный ИИ с режимом "мышления" и агентскими способностями

Команда Qwen выпустила Qwen3-VL — самую мощную мультимодальную модель в линейке. Модель доступна в двух версиях: Qwen3-VL-235B-A22B-Instruct и Qwen3-VL-235B-A22B-Thinking Qwen3-VL: Sharper Vision, Deeper Thought, Broader Action, плюс компактная версия Qwen3-VL-30B-A3B (30B общих параметров, 3B активных). Релиз состоялся 23 сентября, сейчас начинают приходить результаты тестирования модели, и они весьма впечатляющие.

Ключевые фишки:
Модель работает с текстом, изображениями и видео через единый интерфейс. Умеет управлять GUI компьютера и мобильных устройств — распознает элементы интерфейса, понимает их функции и выполняет задачи. Генерирует код (HTML/CSS/JS/Draw.io) из скриншотов и видео. Поддерживает продвинутое 2D/3D позиционирование объектов для spatial reasoning

Qwen/Qwen3-VL-30B-A3B-Instruct OCR работает на 32 языках (включая русский) с высокой точностью даже на низкокачественных сканах. Пользователи хвалят. Контекст: 256K токенов нативно, расширяется до 1 миллиона. Можно загрузить целые учебники или часы видео.

Два режима работы: Instruct для быстрых ответов, Thinking для сложных задач с рассуждениями. Версия Instruct сопоставима с Gemini 2.5 Pro по визуальному пониманию, а Thinking показывает SOTA на математических бенчмарках.

Interleaved-MRoPE для лучшего понимания длинных видео, DeepStack для детального анализа изображений, выравнивание текста с временными метками для точной локализации событий в видео.

Размер и доступность:
Flagship-модель Qwen3-VL-235B-A22B весит 471 GB — не запустишь на обычном Mac Qwen3-VL: Sharper Vision, Deeper Thought, Broader Action. Но есть версия 30B-A3B (3B активных параметров), которая должна работать на мощных Mac, плюс выпущены FP8-квантизации. Все под лицензией Apache 2.0.

Qwen движется быстро — учитывая их темп релизов, меньшие версии Qwen3-VL могут появиться в ближайшие дни Qwen3-VL: Sharper Vision, Deeper Thought, Broader Action. Это серьезная альтернатива закрытым моделям с упором на визуальные задачи и агентские возможности.

#мультимодальныеLLM #VLM #написаноклодом
🤣🤣🥲

Такая подстава )) пытаюсь тут оживить Claude code - он банится с VPN даже со своим сервером (жесть), зашел тут в какое-то окошко на десктопном приложении с артефактами - там тоже сидит свой Claude code, только он не настоящий, а имитация ))) Засранцы, а я-то надеялся
Forwarded from Machinelearning
This media is not supported in your browser
VIEW IN TELEGRAM
✔️ GenAI прямо на устройстве: Chrome, Chromebook Plus и Pixel Watch с LiteRT-LM

Google выпустили LiteRT-LM - фреймворк для запуска LLM прямо на устройстве (offline), с минимальной задержкой и без API-вызовов.


Если вы пилите приложения, это полезная штука, потому что:
- Работает на устройстве: нет задержек от удалённых серверов
- Нет расходов на API
- Дает доступ к Локальному GenAI

🔍 Основное
- LiteRT-LM уже используется внутри Gemini Nano / Gemma в Chrome, Chromebook Plus и Pixel Watch.
- Открытый C++ интерфейс (preview) для интеграции в кастомные решения.
- Архитектура: Engine + Session
  • Engine хранит базовую модель, ресурсы - общий для всех функций
  • Session - контекст для отдельных задач, с возможностью клонирования, копирования “по записи” (Copy-on-Write) и лёгких переключений
- Поддержка аппаратного ускорения (CPU / GPU / NPU) и кроссплатформенность (Android, Linux, macOS, Windows и др.)
- Для Pixel Watch используется минимальный “pipeline” - только необходимые компоненты - чтобы уложиться в ограничения памяти и размера бинарей

Google опенсорснули целый стек для запуска GenAI на устройствах:

- LiteRT быстрый «движок», который запускает отдельные AI-модели на устройстве.

- LiteRT-LM - интерфейс C++ для работы с LLM. Он объединяет сразу несколько инстурментов : кэширование промптов, хранение контекста, клонирование сессий и т.д.

- LLM Inference API - готовые интерфейсы для разработчиков (Kotlin, Swift, JS). Работают поверх LiteRT-LM, чтобы можно было легко встраивать GenAI в приложения.

🟠Подробнее: https://developers.googleblog.com/en/on-device-genai-in-chrome-chromebook-plus-and-pixel-watch-with-litert-lm/

@ai_machinelearning_big_data

#AI #Google #LiteRT #LiteRTLM #GenAI #EdgeAI #OnDeviceAI #LLM
Please open Telegram to view this post
VIEW IN TELEGRAM
На выходных мало писал, потому что мало читал. Занимался своими задачками. Где-то прямо почти получилось, где-то еще надо поработать.

Во-первых, теперь я обхожусь без vpn - и это было открытие дня. Начал настраивать потому что claude code не работал (проблему решил, но сейчас опять не работает - зато теперь понимаю, как можно порешать, попробую уже позже).

Идея в том, что настроил себе прокси - купил американские, итальянские и пр. IP (в пакете 20 штук) и настроил так, чтобы зарубежные сайты шли через прокси, а российские - напрямую.

Работает! Сделал себе на компе, на сервере, на телефоне. Теперь мне не надо переключаться - включать, отключать vpn, все работает все время ))

Естественно, все сделал на open-source. Сама программулина - китайская, думаю, они знают толк в таких вещах.

В общем, интересно провел выходной. Вечером работаю над другой, уже более прикладной, но для меня очень важной задачкой - как мотивировать ребенка учить python. Расскажу об этом немного попозже, надеюсь и покажу - для тех, кто пользуется Claude
👍1
OpenAI запускает функционал по созданию агентов, как в n8n. Эти щупальца до всех дотянутся - нет такой сферы и такого ПО, куда в перспективе не полезет Сам Альтман
В курсоре новая модель Cheetah неизвестного происхождения, умная и очень быстрая. Скорее всего, это тестируется будущая Gemini 3 от Google
Forwarded from СВЕЖЕСТИ
❗️Amazon закрывает в Великобритании свои продуктовые магазины без касс, работающие под контролем искусственного интеллекта, после того, как британцы перестали туда ходить, когда выяснилось, что удаленные индийские работники следят за покупателями и рассчитывают их счета на кассе вместо того, чтобы это делал искусственный интеллект.
🚀 NeuTTS Air - on-device TTS с мгновенным клонированием голоса

Это первая реалистичная модель синтеза речи, запускаемая на устройстве, без api.

Формат - GGML, что позволяет работать на телефонах, ноутбуках и даже на Raspberry Pi.
Клонирование голоса за 3 секунды: достаточно короткого аудиофрагмента, чтобы сконструировать голос для последующих синтезов.

Базируется на лёгком языковом ядре (0,5 B) + нейрокодек NeuCodec, что обеспечивает баланс между качеством и скоростью.
Генерируемые аудио отмечаются водяным знаком с помощью Perceptual Threshold Watermarker — для борьбы с злоупотреблениями.

GitHub: https://github.com/neuphonic/neutts-air
This media is not supported in your browser
VIEW IN TELEGRAM
🎥 Генерация видео из кода с Code2Video

Code2Video предлагает инновационный подход к созданию образовательных видео на основе кода. Проект позволяет визуализировать программные концепции, превращая код в наглядные видеоматериалы, что упрощает обучение и понимание.

🚀Основные моменты:
- Генерация видео на основе программного кода.
- Поддержка различных учебных тем.
- Визуализация сложных концепций в доступной форме.
- Открытый доступ к проекту и данным.

📌 GitHub: https://github.com/showlab/Code2Video

#python
Forwarded from Machinelearning
🔥 Главное с OpenAI DevDay 2025

✔️ App SDK
Позволяет создать нативные приложенийяпрямо внутри ChatGPT.

Идея простая: теперь не нужно выходить из ChatGPT, чтобы делать привычные вещи.
Можно прямо в чате работать с дизайном в Figma, создавать презентации в Canva, искать жильё на Booking или смотреть курсы на Coursera — всё в одном окне.

Платформа поддерживает авторизацию, оплату и подключение внешних сервисов,
а значит, ChatGPT становится центром, где совмещаются ИИ, приложения и автоматизация задач.

Скоро разработчики (вайбкодеры) смогут добавлять свои приложения и зарабатывать на них через ChatGPT SDK.

✔️Agent Builder

По сути это убийца n8n и Zapier.
Это интуитивно понятный**визуальный конструктор**, где можно создавать своих ИИ-агентов без единой строчки кода.
Просто перетаскиваешь блоки, подключаешь MCP и ChatKit — и агент сам ищет файлы, анализирует данные и выполняет задачи.
Инструмент уже доступен всем.
OpenAi умеют в дизайн, должно быть удобно.
Можно уже попробовать: https://platform.openai.com/agent-builder

✔️ Обновили Codex

Вышел из беты, получил интеграцию со Slack и собственный SDK.
На демо агент управлял светом и экраном голосом - без кода.

На презентации заявили, что теперь почти весь их код пишется с помощью Codex

Благодаря Codex разработчики OpenAI стали отправлять на 70% больше pull-request’ов в неделю, чем раньше.

Теперь у кодекса появляется интеграция со Slack и SDK, чтобы разработчики могли встраивать его в свои рабочие процессы.

Прямо в эфире Codex написал код для управления камерой, сам собрал интерфейс и **запустил готовое при

✔️ GPT-5 Pro - доступна по API

$15 за ввод и $120 за вывод за 1M токенов

Gpt-realtime-mini - на 70% дешевле, подходит для мгновенных ответов и потоковых задач

✔️ Sora 2 - будет доступна по API.

Можно будет генерировать видео прямо из кода

PS: Agent Builder выглядит действительно интересно - интуитивный, гибкий, инструмент с большим потенциало
м.
А вот насколько полезными окажутся приложения внутри ChatGPT, не особо понятно.

OpenAI не боится экспериментировать.
Они развивают ChatGPT как платформу, ищут
новые варианты захвата рынка и пробуют смелые идеи. Это дорогого стоит.

Их интерфейс просто топ: минимализм, аккуратность, почти в духе Apple. UX - на уровне искусства.

У OpenAI уже более 800 млн активных пользователей в неделю и они обрабатывают 6 миллиардов токенов в минуту!

К концу года число пользователей, похоже, вплотную подойдёт к 1 миллиарду.

Но гонка только начинается.
Google явно готовит ответ - Gemini 3 обещает быть топом. Другие игроки тоже не дремлют.

@ai_machinelearning_big_data


#openai #chatgpt #llm #ml #ai
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Data Secrets
Google выпустили новую SOTA Computer Use модель на базе Gemini 2.5

На многих основных бенчмарках она солидно обгоняет Agent режим от ChatGPT, Claude Sonnet 4 и 4.5. Плюс, заявляется гораздо более низкая задержка.

Модель хорошо работает с вебом и неплохо – с мобильными устройствами. Для компьютерной ОС она не оптимизирована, так что, предположительно, вести себя будет не очень.

Под капотом, по сути, прокачанный tool use для Gemini 2.5. На каждом шаге ей на вход поступает скриншот экрана, и она вызывает определенные функции типа clicking или typing с нужными аргументами.

Еще хвастаются безопасностью модели. Во-первых, вы прямо в системном промпте можете контролировать, какие действия надо подтверждать, какие нет. Во-вторых, есть внешний авто-оценщик, который на каждом шаге независимо перепроверяет, что делает модель, и выбрасывает алерты, если происходит что-то не то. Подробнее можно почитать в системной карте.

Сейчас модель уже доступна в public preview. Попробовать можно через API.

Кстати, ползет слух, что на этой неделе должна выйти Gemini 3.0