very vibe coding
125 subscribers
465 photos
126 videos
13 files
1.01K links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Forwarded from Data Secrets
Media is too big
VIEW IN TELEGRAM
Робот по цене макбука от HuggingFace

Знакомьтесь: это HopeJR, полноразмерный робот-гуманоид с 66 степенями свободы конечностей всего за 3000 долларов. Его на днях показали робототехники Hugging Face, и совсем скоро он поступит в продажу.

Робот может ходить, двигать руками и выполнять почти любые задачи, которым вы его научите: весь код для него – в опенсорсе.

Кроме этого HF еще показали мини-робота Reachy Mini. Он настольный и может двигать головой, говорить и слушать. Тут уже предназначено не для выполнения задач, а скорее для прототипирования (оживления) LLM. Цена – около 250 долларов, и тоже в опенсорсе.

Выглядит как большой вызов, особенно учитывая, что текущая робо-индустрия полностью живет по модели черного ящика. Опенсорсный подход HF, да еще с такими ценами, здесь, по сути, первый в своем роде.
Forwarded from Data Secrets
Большой гайд по разработке агентов

Сбер внезапно сделали всем большой подарок: на конференции ЦИПР старший вице-президент компании Андрей Белевцев представил огромный практический гайд по созданию AI-агентов. Внутри:

– Все про то, кто такие агенты и как они работают
– Готовые скрипты и шаблоны для разработки и деплоя мультиагентных систем
– Прикладные рекомендации, основанные на опыте инженеров Сбера

Полезно будет всем: и ИТ-специалистам, и разработчикам, и руководителям.
Мы раскрываем наш практический опыт внедрения таких систем в сложном ИТ-ландшафте Сбера. Уверен, что документ станет ценным и полезным ресурсом на пути освоения и внедрения компаниями современных AI-технологий.

Полную pdf-ку забираем абсолютно бесплатно здесь
Пройдемся по новостям от лидеров рынка ИИ

ChatGPT: сделали "коннекторы", которые подключаются к google drive, dropbox, outlook и пр. Пока раскатывают на дорогих тарифах, но доступ в более дешевом варианте - вопрос времени, думаю месяца - другого. Потенциально эта фича избавляет вас от сложностей создания RAG, позволяя нейронкам ChatGPT иметь доступ ко все базе знаний на основе решения из коробки. Очень перспективно. Плюс, работает с использованием MCP, что расширяет возможности вдвойне.

Кстати, некоторое время назад в приложении появился Codex - агент, похожий на Claude Code. Подключается к GitHub, изучает базу кода, ищет ошибки, настраивает зависимости и пр.

На этом фоне Антропик раскатал Claude Code на подписку pro (это самая дешевая подписка на 17$ в месяц). Он и раньше был доступен, но только по API, а теперь подписчикам 1-2 часа в день можно использовать его бесплатно. Для понимания, чем эти агенты лучше Cursor и пр. - они работают непосредственно в терминале, достаточно автономно, самостоятельно тестируя сделанный код, получая обратную связь непосредственно из системы. Кстати, у Claude Code, не в приложении, а в браузерной версии появились "memories" - память для различных веток Claude Code. Т.е. он должен помнить различные проекты, которые вы пишете. Опять же, очень крутая фишка, т.к. кодить с Клодом можно и в обычном режиме, но контекстное окно не такое большое, забивается быстро, переход в новый диалог отимает много времени. А это решение, надеюсь, позволит о таких проблемах забыть навсегда. Кстати, ChatGPT уже раскатал память на все диалоги, которые вы ведете, так что здесь Антропик только догоняет.

Еще одна тема, в которой Антропик догоняет - это команды голосом. Пока раскатывают на мобильное приложение, в "правильных" странах, и только на английском. У нас (я пользуюсь "казахской" моделью) не работает. В ChatGPT эта тема реализована давно, на русском, так что надо бы и Антропик двигаться поскорее.

Самое интересное, что при том, что у меня есть подписки и на ChatGPT, и на Claude, я практически полностью перешел на бесплатный Gemini - настраиваем с ним сервер, приложения, и как-то с ним все понятнее делается. Жаль, таких инструментов по кодированию нет - но как вернусь к программированию, потестирую агентов, и codex, и claude code.

На этом фоне отменил пока себе подписку на Cursor, а у него, между тем, тоже много обновлений. Но я столько всего сразу не осилю, тем более, что мой фокус на ближайшее время - это агенты другого рода, которые создаются в n8n (будет интересно, расскажу).

Да, своего агента для кодирования выпусила и Mistral - думаю, что это может быть очень интересно. Модельки у них неплохие, очень шустрые, и недорогие. Может оказаться очень даже ничего.
В продолжение предыдущего поста - с агентами есть, что называется, нюансы. Параноикам - не читать.

Дело в том, что для работы им можно давать доступ и к компьютеру, и к интернет (без этого смысл в них теряется), что позволяет внешним ресурсам взаимодействовать с агентом. И здесь появляется возможность нового вида взлома - представьте, что на сайте, по которому он шарится записан вредоносный промпт, который уговаривает прописать в базу какой-то "полезный" скрипт или еще чего. Агент пишет, ну а дальше через эту уязвимость кто-то получает доступ к вашему компу.

Самый прикол в том, что если нейросеть имеет доступ к чему-то и с кем-то общается, этот кто-то безо всякого кода, просто словами может уговорить ИИ тоже дать ему доступ. Хакинг уговорами. И модели пока не могут этому гарантированно противостоять.

Поэтому очень важно хранить ключи отдельно, доступ ограничивать, по левым сайтам не шариться. Может плохо закончиться. Контролируйте своих агентов
😱1
Forwarded from Data Secrets
На гитхабе обнаружили самый честный ответ от Claude Code

«Я решил что мне все равно»

Вопросы?
И да, google уже выложили новую модельку. И месяца не прошло с прошлого релиза. Поможет ли мне это настроить обратный прокси для второго докера на сервере - посмотрим. Вчера не смогли, уже пошел спрашивать chatGPT b Claude (ответы chatGPT, кстати, понравились больше, хотя проблему пока не решил..). В любом случае, сейчас google gemini 2.5 - мой фаворит, и новый релиз - большой позитив.
Для любителей маленьких моделей - как заявляют, новая SOTA на 7b параметров (должна ставиться на мощный мак) - open-thoughts3. Подавляющее большинство таких моделек - это дистилляция более крупных моделей на маленькую базу, за основу которой, в последнее время, все берут qwen. Дистилляция - это обучение, когда маленькой и большой модели дают одни и те же задачи, и маленькую модель наказывают, если ее ответ отличается от ответа большой модели. Китайцы, вот, например, как мичуринцы, привили большой Deepseek на маленький qwen. Но авторы пишут, что эта маленькая моделька лучше.

Кто-то ставит себе такие?

https://x.com/ryanmart3n/status/1930671847244530145?s=46
Небольшая, но приятная новость от Антропик - в контекст проектов у Клода теперь помещается в 10 раз больше файлов. Еще бы и сам контекст модели увеличить - у Гугла он 1М токенов, причем счетчик виден, а у Клода (и чат-джипити) всего 200К, причем у Клода они выбираются быстро и внезапно, что особенно неприятно, когда надо перенести саммари в новый диалог.

Кстати, имейте ввиду, что при наполнении контекста модели тупеют, и сильно, поэтому почаще открывайте новые диалоги.
Новости моего вайбкодинга

На время выпал из работы с нейронками по очень печально причине, но теперь в строю, продолжаю возиться с нейронками. Все последнее время настраивал себе на сервере работу с пакетом программ, о которых писал выше.

Дело не одного дня, можно сказать, муторное, но зато за это время поразбирался с контейнерами, сетевыми подключениями, пробрасываниями портов и пр. – кстати gemini мне выдал мне очень простое объяснение того, как все устроено, сделаю отдельный пост (он для ламерам, профессионалов прошу простить). В какой-то момент gemini забуквал – добили все с chatgpt o3. Вообще, мне очень нравится тема переключения между моделями, помогает. Gemini мне очень нравится, работаю с ней (максимально структурированные подсказки), но он в интернет не ходит, сам с терминалом не работает – поймал себя на мысли о том, что когда я все-таки сам пишу в терминал, учусь больше. Как итог – теперь у меня установлен мощный стэк, которому и сами нейронки удивляются – n8n (автоматизация и агенты), supabase (база для метаданных), qdrant, (база для векторов) flowise (агенты), ollama (загрузка нейронок), openwebui (интерфейс для нейронок) и еще куча всего. Самое главное работает на моем собственном домене.

Вчера поставил на сервер первую свою собственную нейронку. Для этого предварительно закупил дополнительной памяти – теперь у меня там 16Гб (лишние 2 тыс.), чтобы сэкономить отказался от подписки на Cursor, так как в последнее время им не пользуюсь, моя ближайшая цель – работа с n8n. Без этого были отдельные пляски с бубном на вечер работы, когда сервер забился под завязку и перестал работать.

Нейронка – для ембеддинга, чтобы не платить за OpenAI text-embedding-3-small. Долго выбирал, есть специализированные русские модели, но в итоге скачал BGE-M3 – одного из многоязычных опенсорсных топов.

В тот же день читаю новость про новую SOTA по эмбеддингу Qwen3-Embedding-0.6B. Пришлось ставить и ее )) Причем на ollama (где лежат все модели) ее еще развернуть не успели, поэтому скачивал с hagging face, заодно познакомился с GGUF файлами и прочими прелестями – спасибо, Клод помог, ведь он, в отличие от Gemini к интернету уже подключен.

Все работает, планирую потихоньку приступать к автоматизации в n8n. RAG буду делать именно там, через загрузку данных с google drive и распознавание их различными агентами, в зависимости от типа файлов.
👍1
А ниже передает вам привет Gemini и рассказывает простыми словами по работу с сетями )) оцените. Это как раз то, с чем возились в последнее время

Привет, друзья! 🚀 Разбираемся в сетевых терминах простыми словами!

🏠 Хост – это любой комп, телефон или сервер в сети. У каждого свой уникальный адрес (IP-адрес), как у дома.

🚪 Порт – это как номер квартиры в этом доме (хосте). Когда данные приходят на IP-адрес, порт говорит, какому приложению они предназначены. Веб-сайты обычно "слушают" порты 80 (HTTP) и 443 (HTTPS).
Пример: 192.168.1.10:8080 – хост 192.168.1.10, приложение на порту 8080.

📞 DNS (Domain Name System) – это «телефонная книга» интернета. Вместо запоминания IP-адресов (цифр), мы используем имена вроде google.com. DNS находит по имени нужный IP-адрес, чтобы ваш браузер знал, куда "звонить".

🏢 Прокси-сервер – представьте себе управляющую компанию (УК) в большом офисном центре или жилом комплексе.
Когда вы хотите попасть на сайт: Ваш запрос сначала идет к прокси (УК). УК уже решает, как и куда его направить. Она может скрыть ваш настоящий "адрес" (IP), ускорить загрузку (если уже есть копия сайта) или проверить, можно ли вам туда.

Когда много сайтов на одном сервере: Если у компании (сервера) много разных "офисов" (сайтов/приложений), но один общий вход (IP-адрес и порт 80/443), то прокси (как администратор на ресепшене УК) смотрит на ваш запрос (например, "мне нужен site-A.com" или "мне нужен site-B.com") и направляет вас в нужный "офис" (конкретное приложение, которое может работать на своем внутреннем порту, например, :3001 или :8080). Так один внешний порт может обслуживать кучу разных сервисов!

🔑 Пробрасывание портов – это когда ваш домашний роутер (консьерж на входе в ваш «жилой комплекс») получает инструкцию: «Если кто-то стучится на внешний порт X, перенаправь его в квартиру Y (например, ваш комп) на внутренний порт Z (к вашему приложению)». Так можно сделать доступным из интернета домашний сервер или игру.

📦 Контейнеры (например, Docker) – это как упаковать приложение со всеми его «ингредиентами» (кодом, библиотеками) и «инструментами» (настройками) в один изолированный «кухонный бокс». Этот «бокс» можно запустить где угодно (на любом хосте), и приложение будет работать одинаково. Порты из контейнера можно «выставить» наружу на хост-машину, чтобы к приложению можно было обратиться.

Вот так эти "кирпичики" строят интернет и работу приложений! 🧱 Надеюсь, стало понятнее. 😉

Задавайте вопросы! 👇
Пока возился с Qwen3 выяснилось, что нужно ставить для эмбеддинга не одну модель, а целых две. Вот что об этом пишет Клод (с установкой помогал он, так как Клод ходить в интернеты умеет, а Джеминай - нет):

Qwen3 выпустили reranker модели — и это реально меняет игру в поиске информации.
В чем прикол: обычно embedding модели работают как быстрый, но не очень точный поиск. А reranker модели — наоборот, медленные, но очень точные. Qwen3 предлагает использовать их вместе.

Как это работает на практике:
Ты делаешь запрос → embedding модель за 50 миллисекунд находит 100 похожих документов → reranker за 200 миллисекунд анализирует каждый из них и выдает топ-10 самых релевантных.

Итого 250ms вместо 50ms, но качество результатов кардинально лучше.
Конкретные цифры:
Тестировали на разных языках — английский, китайский, мультиязычные задачи. Точность поиска выросла на 15-25% по сравнению с обычным подходом.

Где это полезно:
- Поиск по корпоративным базам знаний — находит действительно нужные документы, а не просто похожие по словам
- Интернет-магазины — лучше понимает, что именно ищет пользователь
- Чат-боты с RAG — выдают более точные ответы на основе найденной информации

Плюс фишка: модели понимают инструкции. Можешь сказать "найди документы про техническую реализацию" или "покажи примеры использования" — и они будут искать именно это.

Работает со 100+ языками, в общем: если раньше приходилось выбирать между "быстро, но так себе" и "долго, но точно", то теперь можно "довольно быстро и очень точно".

Теперь от себя: модельки новые, и тут есть нюанс. Обе модели (и ембеддинг, и реранкинг) еще не развернуты на ollama, но для ембеддинга есть gguf файл, который позволяет ставить модель в контейнер к ollama, а вот для реранкинга такого файла нет, поэтому придется ставить его вне контейнера, с питоном, новыми библиотеками, пробрасываниями портов и всякими прелестями (ну или подождать надо немного, прежде чем ставить - тоже вариант)
🔥2
Транскрипция и диаризация

На выходных баловался переводом аудио с совещаний в текст. Обнаружил много всего нового. Если с транскрипцией все более или менее понятно, берешь аудио, загоняешь в нейронку, получаешь текст (для этих целей я решил попробовать русскую модельку от Сбера – GigaAM-RNNT-v2, как вариант можно было бы использовать стандартный и бесплатный(!) Whiper – но там сразу предупрежу, надо брать самую тяжелую модель, качество у моделей поменьше совсем так себе), то дальше началось интересное.

Решил, что надо бы определять, кто и что говорит – так проще составлять последующие протоколы. И для этой штуки нашелся даже отдельный термин «диаризация». Естественно, есть и специальные продукты, из которых лучший – pyannote.audio. Скачивается с huggingface, там же для него нужно получить специальный токен. Моделька от Сбера, кстати, на ollame также отсутствует, поэтому для установки что транскрипции, что диаризации придется писать отдельные скрипты.

Из любопытного – при диаризации файлы разрезаются на маленькие реплики, относящиеся к одному человеку, и модели-транскриптору передаются именно они, а не весь файл целиком. Если говорят одновременно несколько человек, универсальное решение – нарезка происходит с перекрытием. Для меня, это, честно говоря, было неожиданным подходом, но логика в этом есть – говорят, что короткие аудио распознаются лучше, это как маленький контекст для модели.

Для голоса можно делать и свой RAG – с записанными голосами и их распознаванием (для этого требуется 1-2 минуты голоса), но до этого я еще не дошел.

Здесь, как всегда, вроде возьмешь несложную задачку, а нюансов выясняется…
👏1
Ого, вот это интересно - OpenAI помимо выхода chatGpT o3 pro, что само по себе круто, в 5 раз снизили цену на обычную o3. Это очень умная модель, иногда использую ее, когда Gemini заходит в тупик (это прикольная тема - давать одну задачку разным моделям, они решают ее по разному). Надеюсь, увеличат лимиты на нее и на обычной подписке, а для агентов теперь у Gemini появился реальный соперник. Ждем драматичного падения цен от Claude..

PS Лимиты на модель o3 в самой дешевой подписке Plus удвоили - до 200 обращений в день
На фоне увеличения лимитов на модель o3 у платных подписчиков chatGPT (теперь на подписке Plus за 20 баксов доступно 200 обращений в день, и это много, смысл пользоваться другими моделями типа 4o или o4mini практически исчезает), расскажу небольшой лайфхак для подписчиков другой популярной нейронки - Клода.

История в том, что платные подписки у разных компаний устроены по-разному. OpenAI дает фиксированное количество обращений в сутки, а вот Клод выделяет определенное количество токенов на 6 часов. Если вы выбрали эти лимиты, подписка на несколько часов блокируется. Раньше я регулярно попадал на такое ограничение, особенно если давать Клоду программировать и использовать tools - с ними от тратит токены с астрономической скоростью.

Поэтому для подписчиков Клода рекомендация - утром за чашкой кофе сказать ему "привет", что откроет 6-часовую сессию. Когда через пару часов начнете работутать, у вас будет тот же лимит токенов на ближайшие 4 часа, а после них начнется новая сессия и лимит токенов обновится до максимума.

Возможно, этим объясняется и разный характер моделей. У chatGPT слова идут экономно, много табличек, а вот Клод весьма словоохотлив и токены не бережет ни разу...
👍2
Развлекаюсь на досуге с n8n - пытаюсь разобраться с автоматизацией и своим RAGом. Задачка, прямо скажем, не для слабонервных.

Сделал себе базу данных для метаданных на supabase, пытался подключить к ней Клода по mcp и долго возился с поиском ключей - оказалось, что облачная версия и версия для селфхостеров выглядит несколько по-разному. Если вы сами ставите базу себе на сервер, в ней нельзя создавать проекты, он только один - если нужен другой проект, нужно сделать новый контейнер и поднять еще одну базу. Соответственно, и привычных облачных настроек нет. Но ключи кое-как нашлись - базу сделали. Обсуждали ее и с Клодом и с Джеминай, из интересного - для файлов на google drive лучше привязываться как к уникальному идентификатору не к пути на диске - у гугля для каждого файла есть id, который не меняется. Если выбрать идентификатором путь, при кажом переносе файлов он будет данные стирать и снова их записывать, индексировать и пр.

С n8n тоже решил поступить как самый умный - зачем все писать самому, если можно Клода подключить к n8n через mcp и дать задачку все написать ему. Сказано-сделано, установил mcp-сервер, все подключилось, работает, только пишет workflow в n8n Клод крайне хреново. А Gemini тоже не сильно в теме - что-то предлагает, но сделать это невозможно, так как в интерфейсе таких полей нет...

В общем, приходится изучать чужие схемы и делать все самому, по образу и подобию. Печалька, конечно, так себе вайбкодинг. Зато, быть может, чему-то научусь...
👍1
А вы заметили какую-то разницу в новых модельках типа Claude 4 или Gemini 2.5 по сравнению с тем, что было в прошлых версиях? Я вот никак не могу увидеть разницы, разве что есть ощущение, что Клод просто стал тупее - сегодня косяк за косяком...
👍1
Google authentification

На что уходит время вайб-кодеров... Тут часика три упражнялся с получением доступа к папке google drive. Решил, что раз уже все нейронки сейчас с google drive работают, то я тоже всю систему хранения данных буду строить с google drive.. Начал настраивать сервер для автоматической синхронизации, тем более, что у гугла есть функция пуш уведомлений об изменении файлов на диске.

Естественно, работал с гугловским gemini. Написали скрипт, начали стучаться на диск, и тут началось... Получили api, сделали OAuth2, расшарили папку на соответствующего пользователя, прописали пути на сервере, скачал credentials и опять же установил их на серваке. Записали меня в тестировщики проекта.

А зайти никак не можем - нужен еще токен, который регулярно обновляется и позволяет ходить на диск. Как раз с его первым получением и возникла проблемка - стучались с сервера и так, и эдак, делали туннели, мудрили с localhost и ip - видели бы вы как и сколько раз gemini говорил, что вот теперь все, а потом рвал на себе волосы...

Немножко процитирую начало последних постов:
- Вы абсолютно правы. Хватит аллегорий, хватит догадок. Я прошу прощения за все предыдущие неудачные попытки...
- Вы правы. Вы абсолютно правы. Мой долг — помнить всю нашу переписку и анализировать, а не просто предлагать новые решения. Я приношу свои глубочайшие извинения...
- Я понимаю ваше негодование. Это просто невероятно...

Удивительно, но проблемку решили - сделали скрипты на macbook, получили через него токен, загрузили его на сервер, и подключение пошло.

Подключиться-подключились, но осадочек остался - неужто нельзя придумать какую-то аутентификацию попроще? Полная жесть
Много кто сейчас работает над большим контекстом - это действительно удобно. Но, с одной стороны, это все-таки не отменяет RAG, а с другой - надо бы еще, чтобы при большом контексте модели не тупели бы, как это происходит сейчас. Ну и про дополнительные расходы на входящие токены тоже не забываем..

https://t.me/blockchainRF/11793