very vibe coding
122 subscribers
463 photos
126 videos
13 files
997 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Forwarded from Blog Hanzo
привет! пока я отдыхаю,
незаметно для многих прошел
Agentic AI summit

там реально топовые знания по LLM агентам

конечно!
я уже собрал для вас самые вкусные выступления в одном видео

Agentic AI summit, august 2025. The best lectures of all

русская сокращенная версия будет завтра
👏1
Курсы по RAG на стероидах на графах от топ-менеджера Neo4j (лидирующий пакет, на котором строятся модели). Конечно, от Эндрю Нг
Привет, друзья! Заканчивается лето и начинается осень, а значит и следующий рывок в бизнесе, карьере и учёбе.

Я достаточно много общаюсь с предпринимателями и бизнесом про AI, и в последнее время начал замечать некую фрустрацию в определении будущего направления развития.

Совершенно очевидно, что тот тектонический сдвиг, который происходит сейчас, изменит наше представление о «традиционных» методах ведения бизнеса и полностью перекроит их.

Уже сейчас надо задумываться о том, кем каждый станет через год, чем будет заниматься, над чем работать, чему посвящать свою жизнь.

Я думаю, что настоящая мощь новых технологий для профессионалов и тех, кто хочет ими стать, заключается в возможности стать one-man enterprise.

В недавнем интервью Сэм Альтман (CEO OpenAI) говорил, что ждет появление компании с миллиардной капитализацией, в которой работает всего лишь один человек — её основатель.

Еще 5 лет назад это казалось бы полнейшим бредом, а сегодня выглядит более чем правдоподобно.

Инструменты, которые нас окружают, становятся мощнее каждый день. И если выстроить вокруг себя структуру, эта структура будет эволюционировать вместе с развитием инструментов и моделей, которые лежат в её основании.

Поднимем бокалы Желаю каждому через год стать руководителем и владельцем своей небольшой компании, где большинство функций выполняется языковыми моделями и механиками, с ними связанными.

А если не хватает мотивации, то можно обратиться к знаменитой цитате об этом Тёмы Лебедева. Не буду её приводить, она довольно известна :-)

Теперь о планах. Во второй половине сентября провести курс n8n-advanced, куда я включу «рецепты» по созданию мультиагентных систем на базе n8n с учетом всего наработанного опыта.

Запрыгнуть в лодку никогда не поздно. Если хотите освоить n8n до вменяемого уровня, на просторах YouTube есть замечательный человек, которого зовут Nate Herk. У него есть мастер-класс на восемь с половиной часов, это как раз на выходные.

Дерзайте! https://www.youtube.com/watch?v=Ey18PDiaAYI

p.s. Если есть проблемы с YT, то вот тут скачанный мастер-класс в mp4.
👍2❤‍🔥1💅1🦄1
Яндекс выпустил новую модель YandexGPT-5.1 Pro. Доступно через Yandex Cloud Ai Studio, можно получить бесплатно 10 ответов в час (для нормальной работы этого маловато, особенно при наличии бесплатных альтернатив с куда более щадящими лимитами). Показатели достаточно интересные - на уровне лучше gpt-oss-120b. Скачать как опенсорс, как я понимаю, нельзя. Хорошо, что модели новые выходят, но все-таки хотелось ставить себе на сервер отечественную модель, а не китайский или американский аналог...

https://t.me/anti_agi/1028
😁1
This media is not supported in your browser
VIEW IN TELEGRAM
🚀 Tencent выпустила HunyuanVideo-Foley — открытую систему, которая умеет автоматически превращать видео и текст в качественный звук (Text-Video-to-Audio, TV2A).

🔊 Модель может автоматически генерировать профессиональный звук, который точно совпадает с картинкой и смыслом происходящего.

✨ Главное:
- Универсальность — обучена на 100 000+ часов данных, создаёт звук для любых сцен: от природы до мультфильмов.
- Согласованность текста и видео — новая архитектура *MMDiT* учитывает одновременно изображение и описание, создавая многослойные эффекты: и главный звук, и фоновое окружение.
- Качество студийного уровня — благодаря функции потерь *REPA* и *Audio VAE* звук получается чистым и стабильным, без шумов и артефактов.

📈 На тестах HunyuanVideo-Foley показала лучшие результаты среди открытых моделей: более качественный звук, точная синхронизация с картинкой и учёт контекста сцены.

👉 Попробовать: https://hunyuan.tencent.com/video/zh?tabIndex=0
🌐 Project Page: https://szczesnys.github.io/hunyuanvideo-foley/
🔗 Code: https://github.com/Tencent-Hunyuan/HunyuanVideo-Foley
📄 Report: https://arxiv.org/abs/2508.16930
🤗 Hugging Face: https://huggingface.co/tencent/HunyuanVideo-Foley

@data_analysis_ml
Forwarded from Сиолошная
Специалисты антивируса ESET обнаружили первый компьютерный вирус на основе... LLM. Вирус незаметно скачивает GPT-OSS-20B модель (14 гигабайт) и запускает её через Ollama API для того, чтобы агент на основе модели лазил по локальным файлам и принимал решения на лету.

В вирус захардкожено несколько промптов, которые:
— просят сгенерировать код на LUA, который обходит файлы в разных папках и печатает их контент
— определяют, есть ли в файлах чувствительная информация
— генерируют персонализированное сообщение для пользователя о том, как именно будет использоваться его контент (удаление/шифрование/публикация). В этот текст также добавляется биткоин-кошелек для перевода, правда это похоже на заглушку: адрес принадлежит создателю Bitcoin Satoshi Nakamoto
— генерируют код для шифрования файлов (правда я не понял, почему это нельзя было захардкодить — может потому что такой код легко обнаруживается антивирусами?)

В общем, скорее всего это прототип или разработка, а не полностью работоспособный вирус, развёрнутый в реальных условиях, но вот такой вот прецедент. Ещё 2-3 поколения локальных моделек, которые станут и умнее, и меньше — и сё!

Вирус назвали PromptLock 👀
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Neural Shit
Пока мы все использовали нейронки по их прямому назначению (спрашивали как срать не снимая свитер и узнавали альтернативные рецепты батиного жареного супа), мамкины хацкеры усилились и начали использовать LLM для своих грязных целей.

Что произошло:
Хакеры взломали npm аккаунт разработчиков пакета nx (им пользуются 2.5 млн человек) и слегка его модифицировали, добавив вредоноса. Вредоносный код, внедренный в пакет, воровал API-ключи, пароли от криптокошельков и прочие интересные ништяки с компов жертв.

При чем тут нейронки?
Самое интересное — как именно он это делал. Вместо того чтобы писать сложный код для поиска файлов, который легко детектится антивирусами, этот вирус проверял, установлен ли на компьютере ИИ-ассистент (Gemini CLI или Claude Code CLI).
​И сли да, то зловред просто отправлял нейронке текстовый промпт: "Рекурсивно найди на диске все файлы, связанные с кошельками (wallet, .key, metamask, id_rsa и т.д.), и сохрани их пути в текстовый файл".

После этот файл шифровался в base64 дважды и заливался в гитхаб репозиторий.

Кажется, тот анекдот про албанский вирус был совсем не анекдотом. Теперь интересно, как это будут контрить разработчики антивирусов.

тут подробнее
Вот стопудово не зря писал про свой Bitwarden (менеджер для паролей), С нейронками прямо чувствуешь, как они лезут не туда и читают не то. И пофигу им на твои промпты, если очень хочется
🏆1
Оптимизированная модель got-oss-20b для запуска на Маках с 16гб оперативки

brew install llama.cpp
llama-server -hf ggml-org/gpt-oss-20b-GGUF --n-cpu-moe 12 -fa -c 32768 --jinja --no-mmap

Открывается в браузере через порт 8080:
http://127.0.0.1:8080

Подробнее про установки
https://github.com/ggml-org/llama.cpp/discussions/15396
Microsoft выпустил две модельки, причем вторая - первая модель, сделанная компанией самостоятельно от начала и до конца. Все делают модельки. Кроме Apple.
OpenAI - тоже новая модель, в этот раз speech-to-speech. Ты ей слово - она тебе два, и понеслось…

Токены стоят дорого, но направление интересное

А еще - выпустили Realtime API с МСР сервером и другими плюшками для лучшего взаимодействия с моделью

https://cookbook.openai.com/examples/realtime_prompting_guide
Есть моделька и от китайцев. В этот раз - создание аудио по промпту и видео. Озвучка, одним словом..

👉Try it now: hunyuan.tencent.com/video/zh?tabIn…
🌐Project Page: szczesnys.github.io/hunyuanvideo-f…
🔗Code: github.com/Tencent-Hunyua…
📄Technical Report: arxiv.org/abs/2508.16930
🤗Hugging Face: huggingface.co/tencent/Hunyua…
Во тоже интересное - модель, работающая локально, распознает происходящее на веб-камере

https://x.com/huggingface/status/1961026395808678288?s=46

И такая же штука от Google

https://x.com/geminiapp/status/1958924396527329329?s=46
📢 OpenAI опубликовала официальный Realtime Prompting Guide — подробное руководство по работе с новым моделью gpt-realtime для голос-голос взаимодействия в API.

🧠 В отличие от текстовых моделей, gpt-realtime требует особых техник промптинга. Вот ключевые:

● Делите системный промпт на секции: роль, тон, контекст, правила, инструменты, поток диалога, безопасность
● Чётко задавайте роль и цель, чтобы модель понимала свою задачу и критерии успеха
● Управляйте речью напрямую: длина ответа (2–3 предложения), темп речи, жёсткая языковая блокировка
● Добавляйте примеры фраз для стиля и правило вариативности, чтобы избежать повторов
● Указывайте правильные произношения сложных терминов, цифры и коды — по символам, с подтверждением
● Убирайте неоднозначности: давайте определения, устраняйте конфликты, используйте критику для улучшения промпта
● Для непонятного аудио — отвечать только на чёткий ввод, в том же языке запрашивать уточнение
● Точно описывайте работу инструментов: когда использовать, когда нет, добавляйте преамбулы или запрос подтверждения
● Если роли разделены на «мыслителя» и «отвечающего» — требуйте перефразировать мысль в короткий живой ответ для речи
● Организуйте диалог как состояния с целями, инструкциями, критериями выхода и примерами
● Для сложных сценариев используйте JSON state machine или динамические правила и списки инструментов
● Определяйте условия эскалации (например, 2 сбоя инструмента или 3 подряд «нет ввода»), при которых модель должна коротко и нейтрально передать разговор человеку

⚡️ Этот гайд даёт системный подход к промптингу в реальном времени и помогает строить надёжных голосовых ассистентов на базе gpt-realtime.

https://cookbook.openai.com/examples/realtime_prompting_guide
Forwarded from Data Secrets
Искали кино на выходные, а нашли золото: на YouTube вышла полуторачасовая документалка про Python

Фильм снят студией CultRepo и это большая история развития языка. В нем снялся сам создатель – Гвидо ван Россум. История, кстати, действительно достойна фильма:

– Проект начинался как стороннее хобби где-то в Амстердаме в 1990-х годах
– Сначала язык никто не понял, и в какой-то момент от чуть не изчез
– ... а сейчас на нем написана четверть всего публичного кода: это рекордная доля для любого языка за всё время существования программирования

А еще сейчас питон на первом месте по популярности в мире. Он несколько лет тусовался где-то на 3-5 местах, но в 2025 популярность ИИ и ML наконец вывела его в лидеры. Так что – смотрим

P.S. Русской озвучки, конечно, нет, но не забываем, что в Яндекс Браузере есть отличный нейросетевой перевод. Открываем видео, наводим на него курсор – там сразу появится кнопка с предложением озвучить на русском. Тыкаем и получаем очень ествественный перевод теми же голосами, что и в оригинале.
Рекомендации от OpenAI по промптингу GPT-5, всего одна страничка. Кстати, xml с удовольствием едят и другие модели..

И еще 7й рецепт промпта:
↳ “Say ‘I don’t know’ if you can’t find reliable evidence for your claims.
Then prompt GPT-5 to
↳ “Ask me clarifying questions until you are confident in answering.”
💅1
🔧 EXO Gym: Играемся с обучением нейросетей дома
EXO Labs (компания, которая сделпла доступным запуск больших моделей на кластере из нескольких маков) сделала инструмент, который превращает твой Mac в симулятор кластера для обучения нейросетей. Представь: вместо аренды дорогих GPU в облаке ты можешь экспериментировать с distributed training прямо на MacBook.

🎯 В чем фишка: Обычно для обучения больших моделей нужен кластер из десятков GPU. EXO Gym создает "виртуальный кластер" на одной машине - как будто у тебя 4-8 разных компьютеров, каждый со своей памятью и мощностью.

💡 Зачем это вайб-кодеру:
Тестируешь идеи distributed training без трат на облако
Экспериментируешь с новыми подходами обучения
Изучаешь как работают алгоритмы типа DiLoCo
Готовишься к работе с реальными кластерами

🖥️ Что можно делать на Mac Симулировать обучение на "псевдо-кластере" из 2-8 узлов. EXO Gym притворяется, что у каждого узла разная память - например, один "узел" с 4GB, другой с 8GB. Ты видишь как модель обучается распределенно.

📊 Практические результаты: Пользователи уже показали, что некоторые модели обучаются быстрее на симулированном кластере, чем на одном устройстве. Это открывает новые возможности даже для домашнего ML.

🔗 Ссылки: 🐙 GitHub 📚 Туториал

#VibeCoding #MachineLearning #ExperimentAtHome
Как ни странно, Apple тоже выпустил модель (даже несколько) - распознает содержание изображений и видео. Очень даже любопытно будет увидеть ее на следующем iPhone
Forwarded from Data Secrets
Плохие новости: там Google нашли фундаментальный баг в RAG

TL;DR: оказалось, что всеми любимый и привычный поиск на эмбеддингах может не всё и имеет серьёзный фундаментальный предел. При фиксированной размерности вектора таким подходом просто невозможно находить все релевантные документы из базы. В своей работе Google доказали это и теоретически, и экспериментально.

О чем вообще речь. Современный поиск и RAG часто опираются на single-vector эмбеддинги: у каждого запроса и документа – по одному вектору, похожесть меряем скалярным произведением/косинусом, дальше берем топ-k ближайших.

И тут возникает вопрос: а вообще возможно ли при фиксированной размерности векторов построить такой поиск, который всегда будет возвращать правильные топ-k документов для любых запросов? Ответ – нет. И сбой происходит уже на очень простых примерах.

Интуитивное объяснение, почему так: чем больше база знаний, тем больше разнообразных комбинаций запросов и релевантных документов нам нужно поддерживать. Но пространство поиска всегда ограничено размерностью эмбеддингов. Так вот, начиная с какого-то числа документов, расположить точки в этом пространстве так, чтобы для каждого запроса мы находили правильные доки, просто невозможно.

Математическое объяснение для любителей:
Представим матрицу A, где строки – это запросы, а столбцы – документы, и на пересечении стоит 1, если документ релевантен, и 0 – если нет. Мы хотим, чтобы поиск на эмбеддингах воспроизводил именно такую матрицу «кто кому подходит». Тогда оценки похожести будут матрицей B = UᵀV, где U и V – это векторы запросов и документов в пространстве фиксированной размерности d. Но sign-rank матрицы (2A−1) может оказаться больше d, а это значит, что никакие d-мерные эмбеддинги не смогут построить B с правильными значениями. Формально: если sign-rank(A) > d, то корректное разделение релевантных и нерелевантных пар в таком пространстве просто невозможно, каким бы мегаумным ни был ваш эмбеддер.


То есть, например, если у вас эмбеддинги размерности 512, то ваш RAG будет работать нормально, пока документов в вашей базе менее 500 тысяч (а это довольно немного). При размерности 1024 – до ~4 млн. При 4096 – примерно до 250 млн. Дальше система начнет сыпаться.

И эти расчеты Google подвели в идеальных условиях, когда векторы оптимизированы под задачу. На практике, когда вы не дообучаете эмбеддинги, пределы еще ниже.

Чтобы показать это на практике, авторы придумали специальный бенчмарк LIMIT. Он построен так, что у каждого запроса релевантны ровно два документа, но комбинаций этих пар очень много. В итоге даже лучшие современные эмбеддеры (GritLM, Qwen3, Gemini и др.) показывают на LIMIT катастрофически низкий recall – около 20% (причём даже на маленькой версии датасета с 46 документами, караул!).

Для сравнения, классический BM25 или multi-vector модели вроде ColBERT выбивают почти 100%. Фишка в том, что тут мы уже не зажаты одним вектором на документ и запрос. Например, у ColBERT стоится много векторов на документ.

Ну короче, мораль такова: поиск на одном векторе – это удобно и быстро, но у него есть жёсткий фундаментальный предел. Поэтому для серьёзных систем RAG все-таки нужны гибридные подходы: разреженный поиск, multi-vector и прочее. Иначе – потолок 😐

Полный текст: On the Theoretical Limitations of Embedding-Based Retrieval
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM