very vibe coding
120 subscribers
463 photos
126 videos
13 files
991 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Forwarded from эйай ньюз
This media is not supported in your browser
VIEW IN TELEGRAM
Google Opal — убийца n8n? (еще нет)

Google тихо выкатил Opal — свой клон n8n с визуальным редактором и нодами для автоматизации. Многие уже успели заклеймить его убийцей n8n и AgentKit, но пока это скорее очередной эксперимент. Често говоря, я изначально думал что n8n придется несладко, т.к. очевидно было, что все LLM лабы в какой-то момент сделают свою обвязку для пайаплайна агентов, это было делом времени.

UI в Opal приятный, можно изменять воркфлоу промптом (даже голосом), и всё это бесплатно. Правда, там только сервисы Google: Gemini, Imagen 4, Veo (бесплатно!), Lyria 2 и т.д. Подключить что-то стороннее нельзя.

Но на практике всё сыро. Я попробовал собрать на нём контент-завод для "рекламы", но Opal забыл объединить сгенерированные видео. Попытка решить проблему через Python-скрипт провалилась — ffmpeg туда не завезли, хотя функция execute code предусмотрена.

Самый полезный юзкейс сейчас — собирать сложные цепочки из нескольких LLM. Например, одна модель пишет план отчёта, три другие параллельно генерируют части, а в конце всё собирается вместе (если вам не хватает длины ответа обычной Gemini). Или можно выстроить пайплайн: сценарий → раскадровка → картинки → видео, правда, помним про лимиты.

Итог: Opal пока может делать не больше, чем Canvas в Gemini App. Это не убийца n8n, а скорее эксперимент (так он и называется) и хороший способ вкатиться в "нодовую культуру" благодаря простому интерфейсу и ограниченному функционалу — n8n поначалу может пугать. Побаловаться вечерок можно, но для серьёзных задач инструмент пока не готов.

Кстати, Google завезли ещё кучу подобных мини-аппов, которым не суждено стать полноценными продуктами. Pomelli, кстати, как раз один из них. Ставьте единорога 🦄, если интересен обзор и на другие.

Попробовать

@ai_newz
Forwarded from Machinelearning
⚡️ OpenAI выпустила GPT-5-Codex-Mini.

GPT-5-Codex-Mini - более доступная версия флагманского Codex, она в 4 раза эффективней по затратам по сравнению с полной версией GPT-5-Codex при небольшом компромиссе в производительности.

Разница в возможностях минимальна: на SWE-bench Verified версия Mini набрала 71.3%, в то время как старшая GPT-5-Codex - 74.5%. OpenAI рекомендует переключаться на Mini для решения более простых задач или для экономии ресурсов при приближении к лимитам. Старший Codex будет автоматически предлагать переход на Mini, когда пользователь достигнет 90% своего лимита.

Модель уже доступна в CLI и расширении для IDE, а в скором времени появится и поддержка через API.

@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Kimi K2 Thinking такая большая, что даже динамическая 1-битная квантизация занимает 245Gb, нормальные 4-битные квантизации 500-700гб. Очевидно, это делает ее бессмысленной для локального использования.

Да и в самой модели что-то я сомневаюсь - наверняка учили проходить все известные бенчмарки, отсюда и результаты. Кто-то пользовался?
На выходных откатил систему с Tahoe на предыдущую версию - Sequoia. Не смог привыкнуть к отсутствию ланчпада - казнил бы человека в Apple, который это придумал. Установку сделал чистую, чтобы убрать все «хвосты» от моих экспериментов, которых набралось достаточно.

Из положительных впечатлений - какое-то время назад купил провода с разъемом usb-c на thunderbolt 5. Отлично работают - когда обычная флешка что-то копирует часами, здесь сотни гигабайт перекачиваются на диск за считанные минуты. Стоит 1300 руб по нынешним деньгам, очень все рекомендую.

Вся эта возня научилась из-за того, что комп перестал нормально коннектиться со вторым моим сервером, но здесь выяснилось, что дело в провайдере. Он блокирует уже второе мое подключение. Не хотел его менять, но теперь есть повод задуматься.

Решил установить MS office по платной подписке, предпринял не самые тривиальные усилия, поставил, и теперь у меня в офисе появился copilot. Посмотрим, на что он способен, особых надежд не возлагаю, но все же. И хочется все-таки понять, где там Клод и что Майкрософт делает вместе с андроидом.
Media is too big
VIEW IN TELEGRAM
AI-видео в китайском *Douyin выходят на совершенно другой уровень

В ленте вирусится ролик, где «китайская мама» устраивает разнос ксеноморфу - и выглядит это как мини-фильм. Кажется, что вот сейчас всё закончится, но сцена продолжает разгоняться и становится ещё абсурднее и эффектнее.

*Douyin - это китайская версия TikTok.
Новая моделька для работы с агентами - понимает видео, преобразует в текст. Опен-сорс, всего 30В параметров.
Baidu опенсорснула мультимодальную модельку на 28В параметров. Можно пробовать разворачивать у себя.

А Google тем временем дает возможность запускать модели в облаке, гарантируя приватность данных. Тоже может быть полезным.

Плюс большой апдейт Google photos, апдейт Gemini CLI для работы с Hugging face и еще куча всякой мелочи..
Forwarded from Machinelearning
⚡️ ChatGPT-5.1

OpenAI выпустила GPT-5.1, сделав основной упор на интеллект и качество диалога.

🟢GPT-5.1 Instant - модель с функцией адаптивного мышления. Она способна самостоятельно «задумываться» над сложными задачами, что позволило выбивать более высокие баллы по математическим задачам AIME 2025 и задачам по программированию Codeforces. Модель стала лучше следовать инструкциям и получила более «теплый» стиль общения по умолчанию.

🟢GPT-5.1 Thinking тоже была улучшена: она быстрее справляется с простыми запросами и выдает более четкие ответы с меньшим количеством жаргона.

Вместе с моделями OpenAI расширила возможности кастомизации тона ответов, добавив новые стили: «Профессиональный», «Откровенный» и «Необычный».

Обновление уже раскатывают на платных подписчиков, а доступ через API появится в ближайшие дни. Предыдущие версии GPT-5 останутся доступны в течение трех месяцев.

@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
⚡️ NVIDIA выпустила модель Llama-3 Nemotron Super-49B-v1.5-NVFP4

Это 49B reasoning-модель, улучшенная версия Meta Llama-3.3-70B-Instruct, которая даёт более сильное рассуждение, лучшее использование инструментов и стабильный диалог на длинных контекстах.

Она ориентирована на реальные агентные нагрузки - RAG, tool calling, сложные цепочки действий - и поддерживает контекст 128K, позволяющий держать большие беседы, документы и планы без нарезки.

Главное обновление - Neural Architecture Search, который снижает потребление памяти и повышает пропускную способность.
В итоге модель может выполнять тяжёлые задачи на одном H200 под высокой нагрузкой - это уменьшает стоимость сервинга и позволяет использовать большие batch'и.

huggingface.co/nvidia/Llama-3_3-Nemotron-Super-49B-v1_5-NVFP4
Forwarded from Сиолошная
Disrupting the first reported AI-orchestrated cyber espionage campaign

Anthropic считают, что настал момент, когда модели стали действительно полезными в кибербезопасности, как для защиты, так и для атак. Про защиту я уже писал — Google сделали систему на основе LLM, которая анализирует код и помогает находить уязвимости.

Anthropic выявили злоумышленников, которые пользовались Claude Code, чтобы попытаться атаковать примерно тридцать целей, и в небольшом числе случаев им удалось это сделать. Компания с высокой уверенностью идентифицировала атакующих как группу, поддерживаемую китайским правительством.

Операция была направлена на крупные технологические компании, финансовые институты, химические производства и государственные учреждения. Вероятно, это первый документально подтверждённый случай крупномасштабной кибератаки, осуществлённой без значительного участия человека.

Почему именно сейчас? Anthropic видят три причины:
— Интеллект моделей. Общий уровень вырос за последний год настолько, что LLM способны выполнять сложные инструкции и понимать контекст задач, требующих несколько часов работы. Особенно прокачалось программирование.
— Автономность. Модели могут выступать в роли агентов, то есть работать в цикле, автономно выполнять действия, декомпозировать задачи и принимать решения сами.
— Инструменты. Модели стали гораздо лучше искать информацию в интернете, извлекать данные, пользоваться инструментами. В случае кибератак такие инструменты могут включать программы для взлома паролей, сканеры сетей и другое ПО.

Атака состояла из 5 этапов, на каждом из которых нужно было убедить Claude — который тщательно обучен избегать вредоносных действий — участвовать в атаке. Они добились этого с помощью джейлбрейк-промптов, фактически обманув модель.

Задачи разбивались на мелкие, казалось бы, безобидные действия, которые Claude выполнял, не осознавая всей их вредоносной сути. Также модель заставили отыгрывать роль сотрудника легитимной фирмы по кибербезопасности, мол, она используется для проведения защитного тестирования.

Claude Code провёл инспекцию систем и инфраструктуры целевых организаций, обнаружив базы данных с наибольшей ценностью. Модель смогла выполнить эту «разведку» за малую долю времени, которое потребовалось бы группе хакеров-людей.

Затем Claude использовался для сбора учётных данных (имён пользователей и паролей), что позволило ему получить дополнительный доступ и извлечь большое количество конфиденциальных данных, которые он классифицировал по степени их значимости.

Были обранужены аккаунты с наивысшими привилегиями, и пользуясь их данными созданы новые, выглядящие легитимно, но позволяющие в будущем получать неправомерный доступ к данным, которые можно скачать/итд.

Claude не всегда работал идеально. Иногда он «галлюцинировал» данные учётных записей или утверждал, что получил секретную информацию, которая на самом деле была общедоступной и не требовала отдельных прав доступа.

Anthropic забанили все аккаунты, связанные с этой атакой, связались с атакованными компаниями и предупредили их. В конце они отвечают на вопрос: а зачем вообще выпускать модели, которые могут быть инструментами в руках плохих людей?

Ответ состоит в том, что те самые способности, которые позволяют использовать Claude в подобных атаках, также делают его незаменимым инструментом в киберзащите.

⚔️ 🛡
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Сиолошная
Вчера обновился лидерборд SWE-ReBench, с добавлением 51 свежей задачи за октябрь. Для тех кто не следит, напомню, что ребята берут свежие PR из Python-репозиториев, подходящих под некоторые критерии, и прогоняют на них простого агента с разными моделями под капотом.

Первенство остаётся за Sonnet 4.5, который слегка отрывается от GPT-5-medium / Codex в доле решаемых с первого раза задач, но существенно отрывается, если моделям давать по 5 независимых попыток и выбирать лучшую: 57% против 49 и 47% у моделей OpenAI. И даже от Sonnet 4 отрыв тоже 10%.

При этом авторы гоняют бенчмарк на Sonnet 4.5 без рассуждений... но модель всё равно тратит больше токенов чем gpt-5 medium / high. Мне кажется это результат того, что используемый агент (инструменты + промпты) чуть больше отличаются для естественных у моделей OpenAI, чем у Anthropic: OpenAI рекомендует использовать модели так, чтобы им были доступны предыдущие рассуждения в рамках цепочки вызова инструментов, и сейчас на бенчмарке это выбрасывается.

Очень жду, что авторы добавят хотя бы два агента, Claude Code и Codex, и протестируют с ними релевантные модели — было бы интересно увидеть гэп. Он точно есть, см. вот этот бенчмарк от Vercel (там агент авторов даёт 32% для Claude Sonnet 4 / 4.5, но 42% с Claude Code). Вангую, что и тут у моделей обеих компаний качество ощутимо подскочит, но какая будет лучше — хз, наверное, Anthropic.

К другим инсайтам:
— MiniMax M2 «самая экономически эффективная открытая модель из топа», но это на бумаге. Формально она стоит $0.255 / $1.02 против $1.25 / $10.00 за GPT-5 / Codex. Но OpenAI имеют кэширование промптов, которое предназначено как раз для длинных агентских сессий, состоящих из большого количества последовательных шагов. Вы платите на 90% меньше за входные токены, если они уже были обработаны. И по итогу цена за одно решение у M2 $0.44, а у Codex — $0.51. А разница в качестве 25% 🎃 При этом вместе с добавлением GPT-5.1 в API вчера OpenAI расширили кэш с 5-10 минут до 24 часов (за ту же цену, правда будет чуть медленее), так что вообще шик.

— Если брать срез в 100 последних задач, то GPT-OSS 120b хоть и существенно отстаёт от фронтира (26.1% vs 44.4%), но... умудряется обгонять: DeepSeek-V3.1, Qwen3-235B, gpt-4.1, o4-mini, gemini-2.5-pro, и это при том, что она стоит 4 цента за задачу — самая дешёвая из всех, от некоторых из указанных моделей отрывается на порядок. Хорошая агентская модель для бейзлайна, получается. Grok Code Fast 1 мог с ней потягаться, за сентябрь у него была такая же цена и +- качество), но авторы не замерили модели xAI в октябре.
Please open Telegram to view this post
VIEW IN TELEGRAM
Vqvae - это вообще-то главная часть в генеративке. Он решает, будет ли модель творить магию или кряхтеть как старый пылесос. Если он плохой - всё плохо.

В Сбере сделали сразу два токенизатора, и оба не просто хорошие - оба обгоняют открытый SOTA и по реконструкции, и по генерации.

2D-KVAE - для изображений, работает чище и аккуратнее нынешних открытых подходов.
3D-KVAE - для видео, и тут та же история: быстрее, точнее и в реконструкции, и в генерации.
Короче, два решения, которые уверенно обходят доступные аналоги.

На Хабре ребята открыто рассказывают, какая это боль - сделать хороший токенизатор, где споткнулись, какие хаки понадобились и почему это вообще важнее, чем кажется. Плюс сравнение с нынешним SOTA, чтобы видеть разницу не на словах.

И вишенка: всё это скоро станет open source.
люди делают не ресерч ради ресерча, а реально что-то серьёзное.
⚙️ Китайский “невозможный чип” меняет правила игры

В Китае представили разработку, которая может переписать будущее технологий. Речь о новом аналоговом чипе, который не просто обгоняет Nvidia и AMD — он выносит их за счётами.

Что известно:

- до 1000 раз быстрее современных топ-процессоров
- до 100 раз энергоэффективнее
- работает не в логике 1 и 0, а как мозг — обрабатывает непрерывные сигналы прямо в памяти
- никаких задержек, минимум потерь энергии, максимальный интеллект

Учёные заявляют, что решили проблему, над которой бились больше века: добились цифровой точности на аналоговом железе с минимальным потреблением. В тестах новый чип обошёл Nvidia H100 и AMD Vega 20 до 1000x по пропускной способности.

Если технология масштабируется, это может перевернуть всё — от ИИ и дата-центров до связи и робототехники. Начало новой техноэры может наступить намного раньше, чем кто-то ожидал.


https://www.livescience.com/technology/computing/china-solves-century-old-problem-with-new-analog-chip-that-is-1-000-times-faster-than-high-end-nvidia-gpus
Qwen выпустил апдейты DeepResearch и Qwen Code. Кстати, еще и Google раскатал Gemini deep research в мобильном приложении
🚀 Grok 4.1 - новая фронтир-модель, которая поднимает планку разговорного интеллекта, эмоционального понимания и практической полезности в реальных сценариях.

Grok 4.1 доступен бесплатно на:
• grok.com
• grok.x.com
• мобильных приложениях.

Первое место в LMArena Text Leaderboard (привет старому другу “quasar”) и в EQ-Bench (и даже превосходит Kimi k2).

Модель стала лучше понимать контекст, тон, эмоции и намерения собеседника, а также выдавать более точные и прикладные ответы. Это делает Grok 4.1 одним из наиболее продвинутых решений в своей категории.

https://x.ai/news/grok-4-1
🔥1
Forwarded from Refat Talks: Tech & AI
Великий rclone (или иногда агенту нужны просто файлы)

Делаем агента для европейской маркетинговой компании. Они год мучались с RAG - индексировали, чанкали, перебирали эмбединги, то лагает, то галлюцинирует, то не находит нужное.

Предложил радикально другой подход: выкинуть RAG, вместо этого - Claude Agent SDK + обычная файловая система и MCP как интерфейс. Сделал им прототип - результат настолько лучше, что сначала не поверили. Сравнить можно +/- с тем, насколько Claude Code лучше чем обычный AI чат в кодинге. Поиск по гигабайтам PDF, DOCX, PPTX - доли секунды. Залетает новый файл - агент сразу готов его учитывать. Никакого чанкинга, никакой индексации. По сути - это то же самое что Claude Code или Codex CLI делают с кодовой базой, только тут вместо code base у нас knowledge base.
Но есть нюанс, и даже несколько. Вообще, планирую серию постов на эту тему, начну с проблемы синхронизации файлов и ее решения.

Итак, проблема. Основной источник знаний в их случае - Google Drive. Там все: презентации клиентам, стратегии, исследования. Но делать квери туда - слишком долго и мы ограничены только встроенным поиском драйва - не пойдет. Нам нужно чтобы Claude Code (Agent SDK) шустро шуршал по файлам.

Решение - rclone

Rclone - это как rsync для облачных хранилищ. Поддерживает Google Drive, OneDrive, Dropbox и десятки других. Крутая штука: умеет автоматически экспортировать форматы. Google Docs превращается в .docx, Sheets в .xlsx, презентации в .pptx и тд.


rclone sync "gdrive:/" "/local/path" --drive-export-formats docx,xlsx,pptx


Файлы летят на сервер, конвертируются, агент работает с ними как с обычными файлами.

Почему file-first лучше

Storage дешевый и быстрый. Иногда (особенно для использования внутри компании) куда проще загрузить все на диск и работать с файлами напрямую, чем городить удаленный инджестинг с векторными базами и пайплайн индексации.

Современные CLI агенты прекрасно справляются с файловым поиском. "Найди все упоминания проекта X за последние 3 месяца" - делает за секунды через обычные файловые операции. Когда нужно читает файлы по частям или целиком. А еще на лету пишет скрипты для работы с ними если надо (!), собственно эту концепцию сейчас и продвигают Антропик со своими Skills.


В общем, если строите агента для работы с документами:
- Посмотрите на file-first подход. Может быть быстрее и надежнее RAG.
- Используйте rclone для синхронизации облачных хранилищ.
- Дайте агенту доступ к файловой системе и нормальным тулам поиска - часто лучше наивного RAG.

---

Этот проект оказался интереснее чем я ожидал. Куча нюансов, неочевидных решений и инсайтов, которыми буду делиться дальше. Продолжение следует.
Forwarded from Refat Talks: Tech & AI
Продолжаю про file-first подход к агентам для работы с базами знаний. В прошлом посте рассказал про общий концепт и rclone. В этом посте как и обещал расскажу про поиск по бинарным (не-текстовым) файлам.

Напомню что общая идея - использовать всю мощь передовых кодинг-агентов (в данном случае Claude Code) для задачи работы с базами знаний.

Итак, синхронизация настроена, имеем на быстром диске файлы, но большинство из них в формате Word, PDF, Excel, PowerPoint. По дефолту Claude Code (а точнее в его обертке под названием Agent SDK) доступны все инструменты для поиска по текстовым файлам (grep, ripgrep и тд), но эти файлы не текстовые.

Первая мысль была: ок, давай конвертнем все в plain text (есть же docling, markitdown и тд). Но хотелось чего-то проще, не хотелось строить пайплайн индексации: это и время, и дублирование источника истины, и проблема инвалидации - файлы-то постоянно обновляются. Хотелось найти решение которое работает напрямую с Office файлами.

Эксперименты

Создал тестовое окружение: 150 документов в разных форматах и сравнивал такой шортлист, который мне подкинул deep research:

- ripgrep c расширенными настройками (на самом деле их было больше) - почти сразу отпал
- pdfgrep - прекрасно ищет по PDF файлам
- ugrep - хоть и ищет по всем файлам, но по-началу давал средние результаты, например был хуже pdfgrep для pdf и плохо искал по презентациям, но потом я открыл его суперсилу - фильтры!

Фильтры ugrep - вот где магия

ugrep умеет на лету конвертить файлы через внешние тулы перед поиском. Для этого используется флаг --filter или его алиас `ug+`. Работает просто: ты говоришь "для файлов .docx юзай pandoc, для .pdf юзай pdftotext" и все.

Пример:

ugrep --filter="docx:pandoc %f -t plain" --filter="pdf:pdftotext % -" "искомая фраза"


Или еще проще:

ug+ "искомая фраза"


Самое крутое - ugrep уже идет с набором преднастроенных фильтров для популярных форматов. В итоге pdfgrep и другие специализированные тулы оказались не нужны - ugrep is all you need.

ugrep еще умеет искать в архивах (zip, tar, gz) без распаковки, поддерживает fuzzy-поиск и regex с Unicode, может выдавать контекст вокруг найденного текста с подсветкой и все это можно конфигурировать через .ugrep конфиг-файл. Короче, швейцарский нож для поиска.

По скорости. На деле с быстрым диском поиск по тысячам документам занимает доли секунды и не является узким местом в агентных сценариях. Но если база огромная и нужна реальная скорость - у ugrep есть встроенная система индексирования через ugrep-indexer, которая может дать ускорение в разы.

Далее, чтобы это эффективно работало было несколько раундов работы с промптом агента. Одна из лучших идей оказалась - инструктировать агента сначала запускать команду tree чтобы понять структуру директорий, а потом уже делать таргетированные запросы. Это хорошо фокусирует поиск и помогает агенту лучше ориентироваться в контексте.

Почему file-first - это кайф

Мне нравится работать в file-first экосистеме. Linux - это filesystem-first операционка и в этом мире много сильных инженеров и очень развитый опенсорс. Поражаешься как много эффективных и производительных тулов доступны, они просто работают. Плюс это же все текстовые интерфейсы - CLI + stdin/stdout - кодинговые агенты (считай LLM) с ними на ты. Никаких API оберток, никаких дополнительных слоев абстракции. Просто композиция мощных Unix-тулов.

В будущих постах по этой теме планирую покрыть:
- Другие челленджи: чтение и понимание содержимого нетекстовых файлов
- Когда все-таки нужны индексы или "шпаргалки" (или навигаторы) для таких агентов
- Опыт с Remote MCP и вопросы авторизации
- Подходы к разграничению прав доступа
- Вопросы изоляции (безопасность)

🔥 ➕ 🔁 поддержите если хотите больше на эту тему