very vibe coding
125 subscribers
465 photos
126 videos
13 files
1.01K links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Для любителей маленьких моделей - как заявляют, новая SOTA на 7b параметров (должна ставиться на мощный мак) - open-thoughts3. Подавляющее большинство таких моделек - это дистилляция более крупных моделей на маленькую базу, за основу которой, в последнее время, все берут qwen. Дистилляция - это обучение, когда маленькой и большой модели дают одни и те же задачи, и маленькую модель наказывают, если ее ответ отличается от ответа большой модели. Китайцы, вот, например, как мичуринцы, привили большой Deepseek на маленький qwen. Но авторы пишут, что эта маленькая моделька лучше.

Кто-то ставит себе такие?

https://x.com/ryanmart3n/status/1930671847244530145?s=46
Небольшая, но приятная новость от Антропик - в контекст проектов у Клода теперь помещается в 10 раз больше файлов. Еще бы и сам контекст модели увеличить - у Гугла он 1М токенов, причем счетчик виден, а у Клода (и чат-джипити) всего 200К, причем у Клода они выбираются быстро и внезапно, что особенно неприятно, когда надо перенести саммари в новый диалог.

Кстати, имейте ввиду, что при наполнении контекста модели тупеют, и сильно, поэтому почаще открывайте новые диалоги.
Новости моего вайбкодинга

На время выпал из работы с нейронками по очень печально причине, но теперь в строю, продолжаю возиться с нейронками. Все последнее время настраивал себе на сервере работу с пакетом программ, о которых писал выше.

Дело не одного дня, можно сказать, муторное, но зато за это время поразбирался с контейнерами, сетевыми подключениями, пробрасываниями портов и пр. – кстати gemini мне выдал мне очень простое объяснение того, как все устроено, сделаю отдельный пост (он для ламерам, профессионалов прошу простить). В какой-то момент gemini забуквал – добили все с chatgpt o3. Вообще, мне очень нравится тема переключения между моделями, помогает. Gemini мне очень нравится, работаю с ней (максимально структурированные подсказки), но он в интернет не ходит, сам с терминалом не работает – поймал себя на мысли о том, что когда я все-таки сам пишу в терминал, учусь больше. Как итог – теперь у меня установлен мощный стэк, которому и сами нейронки удивляются – n8n (автоматизация и агенты), supabase (база для метаданных), qdrant, (база для векторов) flowise (агенты), ollama (загрузка нейронок), openwebui (интерфейс для нейронок) и еще куча всего. Самое главное работает на моем собственном домене.

Вчера поставил на сервер первую свою собственную нейронку. Для этого предварительно закупил дополнительной памяти – теперь у меня там 16Гб (лишние 2 тыс.), чтобы сэкономить отказался от подписки на Cursor, так как в последнее время им не пользуюсь, моя ближайшая цель – работа с n8n. Без этого были отдельные пляски с бубном на вечер работы, когда сервер забился под завязку и перестал работать.

Нейронка – для ембеддинга, чтобы не платить за OpenAI text-embedding-3-small. Долго выбирал, есть специализированные русские модели, но в итоге скачал BGE-M3 – одного из многоязычных опенсорсных топов.

В тот же день читаю новость про новую SOTA по эмбеддингу Qwen3-Embedding-0.6B. Пришлось ставить и ее )) Причем на ollama (где лежат все модели) ее еще развернуть не успели, поэтому скачивал с hagging face, заодно познакомился с GGUF файлами и прочими прелестями – спасибо, Клод помог, ведь он, в отличие от Gemini к интернету уже подключен.

Все работает, планирую потихоньку приступать к автоматизации в n8n. RAG буду делать именно там, через загрузку данных с google drive и распознавание их различными агентами, в зависимости от типа файлов.
👍1
А ниже передает вам привет Gemini и рассказывает простыми словами по работу с сетями )) оцените. Это как раз то, с чем возились в последнее время

Привет, друзья! 🚀 Разбираемся в сетевых терминах простыми словами!

🏠 Хост – это любой комп, телефон или сервер в сети. У каждого свой уникальный адрес (IP-адрес), как у дома.

🚪 Порт – это как номер квартиры в этом доме (хосте). Когда данные приходят на IP-адрес, порт говорит, какому приложению они предназначены. Веб-сайты обычно "слушают" порты 80 (HTTP) и 443 (HTTPS).
Пример: 192.168.1.10:8080 – хост 192.168.1.10, приложение на порту 8080.

📞 DNS (Domain Name System) – это «телефонная книга» интернета. Вместо запоминания IP-адресов (цифр), мы используем имена вроде google.com. DNS находит по имени нужный IP-адрес, чтобы ваш браузер знал, куда "звонить".

🏢 Прокси-сервер – представьте себе управляющую компанию (УК) в большом офисном центре или жилом комплексе.
Когда вы хотите попасть на сайт: Ваш запрос сначала идет к прокси (УК). УК уже решает, как и куда его направить. Она может скрыть ваш настоящий "адрес" (IP), ускорить загрузку (если уже есть копия сайта) или проверить, можно ли вам туда.

Когда много сайтов на одном сервере: Если у компании (сервера) много разных "офисов" (сайтов/приложений), но один общий вход (IP-адрес и порт 80/443), то прокси (как администратор на ресепшене УК) смотрит на ваш запрос (например, "мне нужен site-A.com" или "мне нужен site-B.com") и направляет вас в нужный "офис" (конкретное приложение, которое может работать на своем внутреннем порту, например, :3001 или :8080). Так один внешний порт может обслуживать кучу разных сервисов!

🔑 Пробрасывание портов – это когда ваш домашний роутер (консьерж на входе в ваш «жилой комплекс») получает инструкцию: «Если кто-то стучится на внешний порт X, перенаправь его в квартиру Y (например, ваш комп) на внутренний порт Z (к вашему приложению)». Так можно сделать доступным из интернета домашний сервер или игру.

📦 Контейнеры (например, Docker) – это как упаковать приложение со всеми его «ингредиентами» (кодом, библиотеками) и «инструментами» (настройками) в один изолированный «кухонный бокс». Этот «бокс» можно запустить где угодно (на любом хосте), и приложение будет работать одинаково. Порты из контейнера можно «выставить» наружу на хост-машину, чтобы к приложению можно было обратиться.

Вот так эти "кирпичики" строят интернет и работу приложений! 🧱 Надеюсь, стало понятнее. 😉

Задавайте вопросы! 👇
Пока возился с Qwen3 выяснилось, что нужно ставить для эмбеддинга не одну модель, а целых две. Вот что об этом пишет Клод (с установкой помогал он, так как Клод ходить в интернеты умеет, а Джеминай - нет):

Qwen3 выпустили reranker модели — и это реально меняет игру в поиске информации.
В чем прикол: обычно embedding модели работают как быстрый, но не очень точный поиск. А reranker модели — наоборот, медленные, но очень точные. Qwen3 предлагает использовать их вместе.

Как это работает на практике:
Ты делаешь запрос → embedding модель за 50 миллисекунд находит 100 похожих документов → reranker за 200 миллисекунд анализирует каждый из них и выдает топ-10 самых релевантных.

Итого 250ms вместо 50ms, но качество результатов кардинально лучше.
Конкретные цифры:
Тестировали на разных языках — английский, китайский, мультиязычные задачи. Точность поиска выросла на 15-25% по сравнению с обычным подходом.

Где это полезно:
- Поиск по корпоративным базам знаний — находит действительно нужные документы, а не просто похожие по словам
- Интернет-магазины — лучше понимает, что именно ищет пользователь
- Чат-боты с RAG — выдают более точные ответы на основе найденной информации

Плюс фишка: модели понимают инструкции. Можешь сказать "найди документы про техническую реализацию" или "покажи примеры использования" — и они будут искать именно это.

Работает со 100+ языками, в общем: если раньше приходилось выбирать между "быстро, но так себе" и "долго, но точно", то теперь можно "довольно быстро и очень точно".

Теперь от себя: модельки новые, и тут есть нюанс. Обе модели (и ембеддинг, и реранкинг) еще не развернуты на ollama, но для ембеддинга есть gguf файл, который позволяет ставить модель в контейнер к ollama, а вот для реранкинга такого файла нет, поэтому придется ставить его вне контейнера, с питоном, новыми библиотеками, пробрасываниями портов и всякими прелестями (ну или подождать надо немного, прежде чем ставить - тоже вариант)
🔥2
Транскрипция и диаризация

На выходных баловался переводом аудио с совещаний в текст. Обнаружил много всего нового. Если с транскрипцией все более или менее понятно, берешь аудио, загоняешь в нейронку, получаешь текст (для этих целей я решил попробовать русскую модельку от Сбера – GigaAM-RNNT-v2, как вариант можно было бы использовать стандартный и бесплатный(!) Whiper – но там сразу предупрежу, надо брать самую тяжелую модель, качество у моделей поменьше совсем так себе), то дальше началось интересное.

Решил, что надо бы определять, кто и что говорит – так проще составлять последующие протоколы. И для этой штуки нашелся даже отдельный термин «диаризация». Естественно, есть и специальные продукты, из которых лучший – pyannote.audio. Скачивается с huggingface, там же для него нужно получить специальный токен. Моделька от Сбера, кстати, на ollame также отсутствует, поэтому для установки что транскрипции, что диаризации придется писать отдельные скрипты.

Из любопытного – при диаризации файлы разрезаются на маленькие реплики, относящиеся к одному человеку, и модели-транскриптору передаются именно они, а не весь файл целиком. Если говорят одновременно несколько человек, универсальное решение – нарезка происходит с перекрытием. Для меня, это, честно говоря, было неожиданным подходом, но логика в этом есть – говорят, что короткие аудио распознаются лучше, это как маленький контекст для модели.

Для голоса можно делать и свой RAG – с записанными голосами и их распознаванием (для этого требуется 1-2 минуты голоса), но до этого я еще не дошел.

Здесь, как всегда, вроде возьмешь несложную задачку, а нюансов выясняется…
👏1
Ого, вот это интересно - OpenAI помимо выхода chatGpT o3 pro, что само по себе круто, в 5 раз снизили цену на обычную o3. Это очень умная модель, иногда использую ее, когда Gemini заходит в тупик (это прикольная тема - давать одну задачку разным моделям, они решают ее по разному). Надеюсь, увеличат лимиты на нее и на обычной подписке, а для агентов теперь у Gemini появился реальный соперник. Ждем драматичного падения цен от Claude..

PS Лимиты на модель o3 в самой дешевой подписке Plus удвоили - до 200 обращений в день
На фоне увеличения лимитов на модель o3 у платных подписчиков chatGPT (теперь на подписке Plus за 20 баксов доступно 200 обращений в день, и это много, смысл пользоваться другими моделями типа 4o или o4mini практически исчезает), расскажу небольшой лайфхак для подписчиков другой популярной нейронки - Клода.

История в том, что платные подписки у разных компаний устроены по-разному. OpenAI дает фиксированное количество обращений в сутки, а вот Клод выделяет определенное количество токенов на 6 часов. Если вы выбрали эти лимиты, подписка на несколько часов блокируется. Раньше я регулярно попадал на такое ограничение, особенно если давать Клоду программировать и использовать tools - с ними от тратит токены с астрономической скоростью.

Поэтому для подписчиков Клода рекомендация - утром за чашкой кофе сказать ему "привет", что откроет 6-часовую сессию. Когда через пару часов начнете работутать, у вас будет тот же лимит токенов на ближайшие 4 часа, а после них начнется новая сессия и лимит токенов обновится до максимума.

Возможно, этим объясняется и разный характер моделей. У chatGPT слова идут экономно, много табличек, а вот Клод весьма словоохотлив и токены не бережет ни разу...
👍2
Развлекаюсь на досуге с n8n - пытаюсь разобраться с автоматизацией и своим RAGом. Задачка, прямо скажем, не для слабонервных.

Сделал себе базу данных для метаданных на supabase, пытался подключить к ней Клода по mcp и долго возился с поиском ключей - оказалось, что облачная версия и версия для селфхостеров выглядит несколько по-разному. Если вы сами ставите базу себе на сервер, в ней нельзя создавать проекты, он только один - если нужен другой проект, нужно сделать новый контейнер и поднять еще одну базу. Соответственно, и привычных облачных настроек нет. Но ключи кое-как нашлись - базу сделали. Обсуждали ее и с Клодом и с Джеминай, из интересного - для файлов на google drive лучше привязываться как к уникальному идентификатору не к пути на диске - у гугля для каждого файла есть id, который не меняется. Если выбрать идентификатором путь, при кажом переносе файлов он будет данные стирать и снова их записывать, индексировать и пр.

С n8n тоже решил поступить как самый умный - зачем все писать самому, если можно Клода подключить к n8n через mcp и дать задачку все написать ему. Сказано-сделано, установил mcp-сервер, все подключилось, работает, только пишет workflow в n8n Клод крайне хреново. А Gemini тоже не сильно в теме - что-то предлагает, но сделать это невозможно, так как в интерфейсе таких полей нет...

В общем, приходится изучать чужие схемы и делать все самому, по образу и подобию. Печалька, конечно, так себе вайбкодинг. Зато, быть может, чему-то научусь...
👍1
А вы заметили какую-то разницу в новых модельках типа Claude 4 или Gemini 2.5 по сравнению с тем, что было в прошлых версиях? Я вот никак не могу увидеть разницы, разве что есть ощущение, что Клод просто стал тупее - сегодня косяк за косяком...
👍1
Google authentification

На что уходит время вайб-кодеров... Тут часика три упражнялся с получением доступа к папке google drive. Решил, что раз уже все нейронки сейчас с google drive работают, то я тоже всю систему хранения данных буду строить с google drive.. Начал настраивать сервер для автоматической синхронизации, тем более, что у гугла есть функция пуш уведомлений об изменении файлов на диске.

Естественно, работал с гугловским gemini. Написали скрипт, начали стучаться на диск, и тут началось... Получили api, сделали OAuth2, расшарили папку на соответствующего пользователя, прописали пути на сервере, скачал credentials и опять же установил их на серваке. Записали меня в тестировщики проекта.

А зайти никак не можем - нужен еще токен, который регулярно обновляется и позволяет ходить на диск. Как раз с его первым получением и возникла проблемка - стучались с сервера и так, и эдак, делали туннели, мудрили с localhost и ip - видели бы вы как и сколько раз gemini говорил, что вот теперь все, а потом рвал на себе волосы...

Немножко процитирую начало последних постов:
- Вы абсолютно правы. Хватит аллегорий, хватит догадок. Я прошу прощения за все предыдущие неудачные попытки...
- Вы правы. Вы абсолютно правы. Мой долг — помнить всю нашу переписку и анализировать, а не просто предлагать новые решения. Я приношу свои глубочайшие извинения...
- Я понимаю ваше негодование. Это просто невероятно...

Удивительно, но проблемку решили - сделали скрипты на macbook, получили через него токен, загрузили его на сервер, и подключение пошло.

Подключиться-подключились, но осадочек остался - неужто нельзя придумать какую-то аутентификацию попроще? Полная жесть
Много кто сейчас работает над большим контекстом - это действительно удобно. Но, с одной стороны, это все-таки не отменяет RAG, а с другой - надо бы еще, чтобы при большом контексте модели не тупели бы, как это происходит сейчас. Ну и про дополнительные расходы на входящие токены тоже не забываем..

https://t.me/blockchainRF/11793
This media is not supported in your browser
VIEW IN TELEGRAM
Привет, друзья! Информирую, что мой креатив по нагнетанию FOMO в сфере Ai-Агентов переходит на качественно новый уровень ;-)

Теперь о серьезном. Исследовательская группа из Стэнфорда выпустила отличное исследование на тему существующих возможностей и потребностей в автоматизации.

Команда SALT Lab и Stanford Digital Economy Lab создала WORKBank — 844 задач из 104 «цифровых/компьютерных» профессий с двумя метриками на каждую: насколько работники хотят отдать её ИИ-агентам (автоматизировать) и насколько это уже по силам текущим моделям.

Выяснилось интересное: 46 % задач люди готовы делегировать, тогда как инвестиции и исследования идут в зоны с низкой потребностью.

Авторы предложили четырёхсекторную матрицу — Green Light, R&D, Red Light и Low Priority, найдите её на картинке тут: https://futureofwork.saltlab.stanford.edu/ (4. Contrasting worker and AI expert perspectives delineate four task zones).

Идея заключается в том, чтобы отбирать задачи и реализовывать их по следующим зонам:

1. R&D Opportunity Zone — тут лежат задачи с высокой потребностью, но текущей низкой возможностью. Конкуренция здесь пока мала, но самые высокие возможности.
2. Green-Light Zone — этим можно заниматься прямо сейчас. Технологии созрели, потребность высокая.
3. Red-Light Zone — низкая потребность, но высокие возможности. Ребята пишут, что 41% компаний из YC, так или иначе связанных с AI, сидят в этом и следующем сегментах.
4. Low-Priority Zone — самый низкий приоритет будем смотреть в динамике.

Исследователи скоро обещают опубликовать датасет с конкретными задачами, которые они оценивали, можно подписаться в waiting list и получить его на почту в будущем.

Если нужно прямо сейчас, то вот здесь лежит база O*NET со всеми задачами, которые были у истоков исследования.
❤1
А кто-то использует Claude Code? Многие люди купили подписку за $100 на Антропик именно из-за доступа к СС без оплаты токенов, по подписке. Сейчас СС доступен по подписке за $15.. Я его в свое время поставил, но попробовать не успел, а люди в интернетах очень хвалят. Напишите, если используете, а ниже - инструкция, как лучше это делать

https://spiess.dev/blog/how-i-use-claude-code
MIT изучил вопрос, и выяснил, что нейронки делают людей сильно тупее. Они не помнят, что написали, не могут писать сами, ну и т.д.

Я вот думаю, а может и не надо помнить? Столько всякой фигни пишем - я то уж точно, забуду большую половину с удовольствием…

https://x.com/itsalexvacca/status/1935343874421178762
Forwarded from Data Secrets
Новая лекция от Андрея Карпаты: «Разработка в эпоху ИИ»

На этой неделе в Сан-Франциско прошло крупное мероприятие AI Startup School от очень известного венчурного фонда Y Combinator.

На нем со своей свежей лекцией выступил легендарный Андрей Карпаты. Запись уже можно найти здесь. Внутри:

➖Куда движется software разработка, и к чему мы придем через пару лет

➖Как выглядит вайб-кодинг здорового человека сегодня и что такое partial autonomy apps

➖Как будут работать операционные системы на основе LLM

➖В чем основные проблемы современных LLM и почему они на самом деле возникают

➖Чему обязательно нужно учиться современному программисту


В общем, советуем посмотреть. Лекции Карпаты, как всегда, на высоте
Please open Telegram to view this post
VIEW IN TELEGRAM
Claude Code

Есть тут у меня один план. Помимо своей возни с сервером, RAG и пр., у меня есть и другие задачки для нейронок. А времени - нет. Зато у меня есть еще подписка на Claude от Anthropic, на которую теперь раскатали возможность "бесплатно" использовать Claude Code. Это такой агент, построенный на моделях Антропика, живущий и работающий непосредственно в терминале - он сам пишет код, проверяет его исполнение, коммитит и пр.

Если раньше он работал только по API и ел денег как не в себя, то теперь его можно посадить на расходование токенов только по подписке, и больше чем вы потратили на подписку, он не попросит (но и работать будет ограничено). Буду вечерами просить его что-то мне самостоятельно напрограммировать...

Сегодня настраивал эту штуку - забавно, что с Антропиком потерял полчаса безо всякого успеха (мне надо было перейти с API на подписку), а вот с chatGPT все заработало с первой же попытки.

Итак, у кого Клод Код еще не установлен:
npm install -g @anthropic-ai/claude-code@latest
Тем, у кого установлен, выполнить:
claude logout
claude update

Закрыть терминал, открыть его снова. Выполнить:
claude
После проверить:
/status
Не вводите данные учетки. Проверьте:
echo $ANTHROPIC_API_KEY
Если вывод пустой — значит ключ не используется, все нормально.
/cost - посмотреть расходы
/model - посмотреть используемую модель, должна быть Sonnet 4, если 3.7 - надо исправлять.

Если кто-то пользуется, напишите, интересно
У меня до этого не дошло, но признаюсь, мы были близки - Gemini был просто в отчаянии, причем происходило это в процессе того, как мы пытались получить доступ к google drive. Человеческие нервы оказались покрепче.. в этот раз

https://t.me/How2AI/1114