very vibe coding
120 subscribers
463 photos
126 videos
13 files
991 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
🚀 Grok 4.1 - новая фронтир-модель, которая поднимает планку разговорного интеллекта, эмоционального понимания и практической полезности в реальных сценариях.

Grok 4.1 доступен бесплатно на:
• grok.com
• grok.x.com
• мобильных приложениях.

Первое место в LMArena Text Leaderboard (привет старому другу “quasar”) и в EQ-Bench (и даже превосходит Kimi k2).

Модель стала лучше понимать контекст, тон, эмоции и намерения собеседника, а также выдавать более точные и прикладные ответы. Это делает Grok 4.1 одним из наиболее продвинутых решений в своей категории.

https://x.ai/news/grok-4-1
🔥1
Forwarded from Refat Talks: Tech & AI
Великий rclone (или иногда агенту нужны просто файлы)

Делаем агента для европейской маркетинговой компании. Они год мучались с RAG - индексировали, чанкали, перебирали эмбединги, то лагает, то галлюцинирует, то не находит нужное.

Предложил радикально другой подход: выкинуть RAG, вместо этого - Claude Agent SDK + обычная файловая система и MCP как интерфейс. Сделал им прототип - результат настолько лучше, что сначала не поверили. Сравнить можно +/- с тем, насколько Claude Code лучше чем обычный AI чат в кодинге. Поиск по гигабайтам PDF, DOCX, PPTX - доли секунды. Залетает новый файл - агент сразу готов его учитывать. Никакого чанкинга, никакой индексации. По сути - это то же самое что Claude Code или Codex CLI делают с кодовой базой, только тут вместо code base у нас knowledge base.
Но есть нюанс, и даже несколько. Вообще, планирую серию постов на эту тему, начну с проблемы синхронизации файлов и ее решения.

Итак, проблема. Основной источник знаний в их случае - Google Drive. Там все: презентации клиентам, стратегии, исследования. Но делать квери туда - слишком долго и мы ограничены только встроенным поиском драйва - не пойдет. Нам нужно чтобы Claude Code (Agent SDK) шустро шуршал по файлам.

Решение - rclone

Rclone - это как rsync для облачных хранилищ. Поддерживает Google Drive, OneDrive, Dropbox и десятки других. Крутая штука: умеет автоматически экспортировать форматы. Google Docs превращается в .docx, Sheets в .xlsx, презентации в .pptx и тд.


rclone sync "gdrive:/" "/local/path" --drive-export-formats docx,xlsx,pptx


Файлы летят на сервер, конвертируются, агент работает с ними как с обычными файлами.

Почему file-first лучше

Storage дешевый и быстрый. Иногда (особенно для использования внутри компании) куда проще загрузить все на диск и работать с файлами напрямую, чем городить удаленный инджестинг с векторными базами и пайплайн индексации.

Современные CLI агенты прекрасно справляются с файловым поиском. "Найди все упоминания проекта X за последние 3 месяца" - делает за секунды через обычные файловые операции. Когда нужно читает файлы по частям или целиком. А еще на лету пишет скрипты для работы с ними если надо (!), собственно эту концепцию сейчас и продвигают Антропик со своими Skills.


В общем, если строите агента для работы с документами:
- Посмотрите на file-first подход. Может быть быстрее и надежнее RAG.
- Используйте rclone для синхронизации облачных хранилищ.
- Дайте агенту доступ к файловой системе и нормальным тулам поиска - часто лучше наивного RAG.

---

Этот проект оказался интереснее чем я ожидал. Куча нюансов, неочевидных решений и инсайтов, которыми буду делиться дальше. Продолжение следует.
Forwarded from Refat Talks: Tech & AI
Продолжаю про file-first подход к агентам для работы с базами знаний. В прошлом посте рассказал про общий концепт и rclone. В этом посте как и обещал расскажу про поиск по бинарным (не-текстовым) файлам.

Напомню что общая идея - использовать всю мощь передовых кодинг-агентов (в данном случае Claude Code) для задачи работы с базами знаний.

Итак, синхронизация настроена, имеем на быстром диске файлы, но большинство из них в формате Word, PDF, Excel, PowerPoint. По дефолту Claude Code (а точнее в его обертке под названием Agent SDK) доступны все инструменты для поиска по текстовым файлам (grep, ripgrep и тд), но эти файлы не текстовые.

Первая мысль была: ок, давай конвертнем все в plain text (есть же docling, markitdown и тд). Но хотелось чего-то проще, не хотелось строить пайплайн индексации: это и время, и дублирование источника истины, и проблема инвалидации - файлы-то постоянно обновляются. Хотелось найти решение которое работает напрямую с Office файлами.

Эксперименты

Создал тестовое окружение: 150 документов в разных форматах и сравнивал такой шортлист, который мне подкинул deep research:

- ripgrep c расширенными настройками (на самом деле их было больше) - почти сразу отпал
- pdfgrep - прекрасно ищет по PDF файлам
- ugrep - хоть и ищет по всем файлам, но по-началу давал средние результаты, например был хуже pdfgrep для pdf и плохо искал по презентациям, но потом я открыл его суперсилу - фильтры!

Фильтры ugrep - вот где магия

ugrep умеет на лету конвертить файлы через внешние тулы перед поиском. Для этого используется флаг --filter или его алиас `ug+`. Работает просто: ты говоришь "для файлов .docx юзай pandoc, для .pdf юзай pdftotext" и все.

Пример:

ugrep --filter="docx:pandoc %f -t plain" --filter="pdf:pdftotext % -" "искомая фраза"


Или еще проще:

ug+ "искомая фраза"


Самое крутое - ugrep уже идет с набором преднастроенных фильтров для популярных форматов. В итоге pdfgrep и другие специализированные тулы оказались не нужны - ugrep is all you need.

ugrep еще умеет искать в архивах (zip, tar, gz) без распаковки, поддерживает fuzzy-поиск и regex с Unicode, может выдавать контекст вокруг найденного текста с подсветкой и все это можно конфигурировать через .ugrep конфиг-файл. Короче, швейцарский нож для поиска.

По скорости. На деле с быстрым диском поиск по тысячам документам занимает доли секунды и не является узким местом в агентных сценариях. Но если база огромная и нужна реальная скорость - у ugrep есть встроенная система индексирования через ugrep-indexer, которая может дать ускорение в разы.

Далее, чтобы это эффективно работало было несколько раундов работы с промптом агента. Одна из лучших идей оказалась - инструктировать агента сначала запускать команду tree чтобы понять структуру директорий, а потом уже делать таргетированные запросы. Это хорошо фокусирует поиск и помогает агенту лучше ориентироваться в контексте.

Почему file-first - это кайф

Мне нравится работать в file-first экосистеме. Linux - это filesystem-first операционка и в этом мире много сильных инженеров и очень развитый опенсорс. Поражаешься как много эффективных и производительных тулов доступны, они просто работают. Плюс это же все текстовые интерфейсы - CLI + stdin/stdout - кодинговые агенты (считай LLM) с ними на ты. Никаких API оберток, никаких дополнительных слоев абстракции. Просто композиция мощных Unix-тулов.

В будущих постах по этой теме планирую покрыть:
- Другие челленджи: чтение и понимание содержимого нетекстовых файлов
- Когда все-таки нужны индексы или "шпаргалки" (или навигаторы) для таких агентов
- Опыт с Remote MCP и вопросы авторизации
- Подходы к разграничению прав доступа
- Вопросы изоляции (безопасность)

🔥 ➕ 🔁 поддержите если хотите больше на эту тему
Forwarded from Институт AIRI
Учёные Института AIRI создали открытую платформу VLA Arena, чтобы исследователи, инженеры и даже любители могли сравнивать и оценивать современные модели управления роботами ⤵️

VLA Arena поддерживает компактные манипуляторы, доступные для самостоятельной сборки или в готовом виде, которые используются в образовательных и исследовательских целях.

На платформе можно:
⚫️Тестировать модели в симуляции и на реальных роботах
⚫️Следить за объективной таблицей лидеров с оценками пользователей
⚫️Поддерживать модели с открытым исходным кодом, включая адаптированные для русского языка версии
⚫️Найти датасеты и инструменты для обучения собственных моделей

Первый запуск платформы продлится три месяца.

📎VLA Arena доступна по ссылке.
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from эйай ньюз
Heretic — автоматическое снятие цензуры с LLM

В прошлом году несколько исследователей решило разобраться как именно работает механизм отказов в языковых моделях, когда они блокируют "вредные" запросы. Оказалось что за отказ LLM выполнять запрос отвечает одно единственное направление в пространстве активаций. А вот сейчас на основе этого ресёрча сделали софт для автоматического снятия цензуры.

Heretic вычисляет "направления отказа" как разницу средних активаций между вредными и безвредными промптами, затем ортогонализирует веса аттеншна и MLP проекций для удаления этого направления. Оптимизатор автоматически подбирает параметры подавления, минимизируя одновременно количество отказов и KL-divergence от оригинальной модели.

Работает полностью автоматически — просто запускаешь на любой поддерживаемой модели и через 45 минут получаешь версию без цензуры. Поддерживает большинство популярных архитектур включая Llama, Qwen, Gemma и даже некоторые мультимодальные модели. Той же gpt-oss снятие цензуры точно не помешает.

https://github.com/p-e-w/heretic

@ai_newz
Все ждут выхода Gemini 3 буквально сегодня. На крайняк - до конца недели..
Тестирую Gemini 3 )) пока тяжело сказать, чем отличается от 2.5, буду судить по ошибкам..

Пытаюсь поставить также Gemini Antigravity - IDE от Google, пока с этим что-то сбоит
Не Gemini 3 единым. Сейчас работаю с несколькими модельками, которые помещаются на компе - для OCR. Если все получится, расскажу подробнее.

Поэтому появление новых маленьких умных моделек, как минимум, интересно. Хотя таким бенчам все-таки тяжело.

Подробнее, что крутого в этой модельке, здесь
По ссылке в сообщении ниже - полезная информация от разработчиков Gemini. Вообще, у Google какая безумная куча всевозможных фишек, настроек, плавунов и пр. - разобраться в этом чрезвычайно тяжело. Тяжело и получить базовые простые апи, токены и пр. (хотя стало легче, чем раньше). Но зато у компании самый широкий спектр моделей, в целом омнимодальность - не удивлен, что Баффет вложился именно в Гугл.

Из того, на что стоит обратить внимание - можно пользоваться последними моделями бесплатно, с очень щедрыми лимитами, но Гугл будет использовать ваши данные. Имейте это ввиду. Антропия и чат ОпенЭйАй тоже пытаются сделать что-то такое, но только у них бесплатного кот наплакал. А Гугл может себе это позволить, понимая, что самое ценное сейчас - данные. Если хочется прайваси, видимо тоже надо заплатить за платную подписку

https://t.me/machinelearning_interview/2335
Очень интересная модель SAM-3 от Meta, которая выделяет что-то на картинке и следит за этим на видео. Пригодится нам для анализа видео с птицами на полигонах ))

И да, опен-сорс!
А в то же время лидером по скачиванию на Hugging Face становится VibeThinker-1.5B, крошечная модель, которая размышляет на уровне got-oss-20B. Можно ставить буквально на любом компе
Forwarded from Data Secrets
⚡️ У OpenAI свежая модель для кодинга: GPT-5.1-Codex-Max

Видимо, они хотят хотя бы немного перебить хайп вокруг Gemini. Вот что в релизе действительно интересного:

1️⃣ Это первый Codex, обученный работать в Windows и, в частности, в Powershell. Теперь модель разбирается в особенностях Windows-окружения, структуре файловой системы и тд.

Также для Windows появился Agent mode, с помощью которого агент может работать в терминале автономно (доступы можно настраивать).

2️⃣ Заявляют, что модель может непрерывно самостоятельно работать над задачами более 24 часов! Невероятно, если правда (хотя Anthropic для своей Sonnet 4.5 вообще декларировали 30 часов).

«Претрейн и test-time не уперлись в стену» – написал Ноам Браун про релиз. Это он намекает, что масштабирование продолжается.


При этом благодаря новой фишке – «компакции» – Codex теперь может работать с огромными контекстами. Это как бы аналог краткосрочной и долгосрочной памяти. Когда лимит токенов контекстного окна близок, модель сжимает самую старую информацию, а затем вместе с этой выжимкой + последней актуальной информацией переходит в новое контекстное окно. Процесс может повторяться много раз.

3️⃣ Метрики. На SWE-bench Verified GPT-5.1-Codex-Max (xhigh) показывает 77.9% точности. Это лучше, чем у Gemini 3 и Claude Sonnet 4.5, то есть сота. При этом модель теперь еще больше экономит токены. На среднем уровне рассуждений она достигает результатов предыдущей версии, потребляя на 30% меньше токенов.

Уже доступно в IDE и Codex CLI, в API завезут «soon»

openai.com/index/gpt-5-1-codex-max/
Please open Telegram to view this post
VIEW IN TELEGRAM
Media is too big
VIEW IN TELEGRAM
✔️ HunyuanVideo 1.5 - новая открытая модель для генерации видео, которая сейчас считается самым сильным open-source решением в этой области.

Построенная на архитектуре DiT, модель поднимает планку по качеству и доступности.

Что важно:
⚡️ Всего 8.3B параметров - модель можно запускать даже на потребительских GPU с 14GB VRAM
🖥️ Качество: генерирует 5–10 секунд видео в 480p/720p, а через суперразрешение —ё- до 1080p с киношной детализацией

SOTA-качество с очень низкими требованиями к железу.

🟠Проект: hunyuan.tencent.com/video/zh
🟠GitHub: github.com/Tencent-Hunyuan/HunyuanVideo-1.5
🟠Hugging Face: huggingface.co/tencent/HunyuanVideo-1.5

@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Вообще, на этой неделе Сбер и AIRI прекрасно выступили, запустив кучу русскоязычных опенсорсных моделей. Обязательно буду их пробовать
Replit дает бесплатный доступ к своим агентам на ограниченное время
Forwarded from Data Secrets
This media is not supported in your browser
VIEW IN TELEGRAM
О, вышел Cursor 2.1

– Добавили функцию «Find Issues»: поиск и исправление багов по одной кнопке. Агент делает ревью кода и тут же показывает найденные проблемы в боковой панели. В течение этой недели фичу можно тестить бесплатно.

– Напоминаем, что в Cursor недавно обновили поиск, и теперь он работает на базе векторов (как именно, мы писали тут). Так что для любителей пользоваться старым добрым grep его вынесли отдельно. Работает почти мгновенно и ищет по всей кодовой базе, включая точные совпадения и регулярки.

– Улучшили режим планирования. Теперь агент будет задавать уточняющие вопросы, когда вы утверждаете план действий, и отвечать на них можно прямо в новом интерактивном режиме (выглядит прикольно, пример на видео).

Раскрывают постепенно на всех пользователей (ченчлог)
Forwarded from Denis Sexy IT 🤖
Я тут понял, что второй после ChatGPT AI-продукт который я использую, это Google AI Studio: https://aistudio.google.com/

Я уже нахваливал его пару раз в канале, но в этот раз хотел отдельно рассказать про их кодинг агента который живет под неприметным "Build": https://aistudio.google.com/app/apps

Это что-то вроде бесплатного Lovable, эта фигня не просто соберет вам красивую веб страницу, но она умеет в GenAI пайплайны, в том числе к генерации картинок – вот строительные блоки к которым имеет доступ агент:

🔍 Google Search 

🌐 Google Maps

🟦 Function Declarations (Вы можете сделать свой тул для модели который будет вызываться аппом когда он считает нужным)

✍️ Текст и общие задачи:
gemini-2.5-flash
gemini-3-pro-preview
gemini-flash-lite-latest

🍎 Изображения:
gemini-2.5-flash-image
gemini-3-pro-image-preview (новая нана банана)
imagen-4.0-generate-001

🎬 Видео:
veo-3.1-fast-generate-preview
veo-3.1-generate-preview

🔊 Аудио и речь:
gemini-2.5-flash-native-audio-preview-09-2025
gemini-2.5-flash-preview-tts


Самое клевое, что вы не просто можете один раз вызвать LLM (как в обычном режиме Playground), вы можете заставить ее отвечать в Structured Output (на картинке детали параметров), поменять температуру, и другие настройки семплинга - и даже сделать пайплайн, где ответ от одной модели попадает на вход в другую модель

Если у вас в голове есть идея "А что если отряд LLM-агентов работал бы над какой-то задачей" и все кодинг фреймворки кажутся душными чтобы быстро проверить, вам сюда

Единственное ограничено, которое вы встретите в какой-то момент – это лимит бесплатных запросов в N времени; для того чтобы это снять, можно подключить свой API ключ через кнопку 🔑 и сможете вайбкодить сложные пайплайны которые делают 1000 запросов в минуту к какой-то Gemini Flash 2.5, что за глаза хватает для почти всех идей и стоит копейки (точно также я подключил Nano Banana Pro, потому что она без API ключа в AI Studio не работает)

Короче, Gemini апп мне не нравится, а вот AI Studio реально для АИ инженеров делают, шикарный продукт

P.S. Есть забавный баг, в какой-то момент их агент начинает забывает редактировать код – а пишет будто редактирует, нужно на него накричать капсом и все заведется 💡
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
Forwarded from Machinelearning
🌟 LLM Council: на ваши запросы отвечает совет из языковых моделей.

Андрей Карпаты опять выходит на связь опубликовал очередной vibecode проект.

Его идея в том, что вместо того, чтобы задавать вопрос одной LLM, вы можете объединить их в «Совет моделей».

LLM Council - это простое локальное веб-приложение, с интерфейсом как у ChatGPT, но с той разницей, что запрос отправляется через Openrouter нескольким LLM. Полученные ответы перекрестно оцениваются и ранжируются, и, наконец, «модель-председатель совета» формирует окончательный ответ.

Более подробно процесс выглядит так:

🟢Этап 1: Сбор мнений. 
Запрос отправляется всем моделям по отдельности, и их ответы собираются. Ответы каждой модели отображаются в отдельной вкладке, чтобы можно было их посмотреть вручную.

🟢Этап 2: Рецензирование. 
Каждая модель получает ответы других моделей. При этом идентификаторы анонимизированы, чтобы исключить «игру в любимчиков» при оценке чужих результатов. На этом этапе ответы ранжируются их по точности и глубине анализа.

🟢Этап 3: Итоговый ответ. 
Модель-председатель принимает все ответы моделей и компилирует их в единый окончательный ответ.


⚠️ Для использования нужен API-ключ OpenRouter. На платформе есть бесплатные модели


🖥Github


@ai_machinelearning_big_data

#AI #ML #LLMCouncil #Github
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1