very vibe coding
122 subscribers
464 photos
126 videos
13 files
1K links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Микромоделька от Google - смысл в том, что создается автоматизация, которая работает на хорошей модели, отлаживается, а потом модель меняется на все меньшую, пока не начнет падать качество. Если работает и микромодель, зачем платить за большую и дорогую? В общем, берем на заметку
И наконец хоть какие-то новости от мета - DINOv3, генерация видео, компьютерное зрение. Утверждают, что SOTA

Да, кстати, это опенсорс, и весит совсем немного
Imagen4 от Google - картинки от 2 рублей за штуку. Так приходишь с работы, смотришь на новые модельки, которые появились за день, и думаешь - а что ты сделал сегодня??

https://deepmind.google/models/imagen/
Не можете заставить себя программировать? Заведите в Claude code тамагочи!! Он будет переживать за вас, ааш код и радоваться устранению багов ))
❤1
very vibe coding
И наконец хоть какие-то новости от мета - DINOv3, генерация видео, компьютерное зрение. Утверждают, что SOTA Да, кстати, это опенсорс, и весит совсем немного
Как-то я не разобрался сначала, а моделька-то не про рисование картинок, а про распознавание образов. Типа нашей задачки по оценке чистоты контейнеров на площадке. И построена по новой технологии self supervised learning. Можно качать, пользоваться и дообучать. Интересненько..🤨
У Клода скоро появится подключение к zoom, teams и пр. - можно будет использовать агентов прямо по ходу ВКС..
Забавно, впрочем, ничего удивительного, - новости в Х опережают наш телеграмм на полдня. Ну и комменты тоже интересно бывает посмотреть - народ там все-таки более прокачанный. Раньше в Х неплохо подбирвали еще и новости для меня, но как только поняли, что я из России - начали лить в ленту какой-то треш. Читаю теперь только тех, на кого подписан.

Несмотря на то, что больше писал на неделе больше про всякие модельки, сам тоже понемногу занимаюсь своими задачами, в основном - погружаюсь в тему правильного промптинга. Напишу на выходных
А вот такие инструкции я бы закладывал в контекст моделек при подготовке с ними промптов (вы же не сами пишете промпты)?
This media is not supported in your browser
VIEW IN TELEGRAM
🚀 ByteDance выкатили **UI-TARS Desktop** — опенсорсный AI-агент для управления рабочим столом

📌 Что умеет:
- Управлять любыми приложениями через язык — клики, ввод текста, навигация
- Работает локально, бесплатно и под лицензией Apache 2.0
- Поддержка Windows и macOS (Linux в разработке)
- Новое в v0.2.0 — удалённое управление компьютером и браузером (пока только для материкового Китая)

📌 Зачем нужен:
- Локальный и приватный ассистент без облака
- Полезен для RPA, автоматизации и тестирования
- Основан на визуально-языковой модели, которая распознаёт интерфейсы и взаимодействует с ними

📂 Код: github.com/bytedance/UI-TARS-desktop

@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
🎹Elevenlabs захватывает весь sound сегмент

На этот раз video2music, инстумент генерирующий музыку для вашего видео

@creadvice #elevenlabs
❤‍🔥1💅1
Я в общем не очень люблю планирование планирования. Но с нейронками этот процесс выходит на некий новый уровень. Про то, как важно писать промпты, все вроде уже знают. Я в этом уже слегка поднаторел. Пишу, конечно, не сам – говорю простыми словами Клоду, что надо сделать, он пишет промпт, и потом ему же кормлю этот промпт в новом диалоге. Получается куда лучше, чем просто одна команда.

Но это полбеды. Тут пытаюсь разобраться с Claude Code и заодно на свой новый сервер (mac mini m4 16gb) ставлю всякое ПО, и поминая как мучались в прошлый раз, часами прокидывая порты, конфигурируя докеры и пр., я решил подойти к вопросу более взвешенно.

Во-первых, попросил Клода сделать скрипт для анализа текущей конфигурации. У меня их получилось целых пять – один для железа, другой для установленного софта, третий для сетевых настроек, четвертый – конфигурация сервера в Германии (для vpn) и пятый – у меня еще NAS есть. Их результаты выгружаются в текстовый файл. Дальше – пять промптов, которые на основе этих выгрузок делают описание конфигурации.

Формат – yaml. Его понимает Claude Code, он хорошо формализован. В сам Claude Code промпты будут поступать в формате markdown. Это просто текст, слегка отформатированный, собственно все нейронки едят именно текст. И еще json, xml но markdown куда проще читать человеку. Claude Code понимает и мешанину из yaml и markdown, но другие нейронки это не любят. Передавая в Claude Code информацию в yaml, я передаю ее не столько в модель, сколько в оболочку – по сути, это задает определенные настройки для работы агента. Вся эта кухня нужна для того, чтобы уменьшить фантазии нейронок и заранее избежать конфликтов в настройках.

Посмотрим, как это будет работать в жизни, но переделать формат – вообще не проблема. Не подойдет yaml, возьмем другой. Главное, теперь у меня в нескольких файлах собрана вся информация о моей системе, и при установке и настройке новых программ это должно очень сильно облегчить их запуск. Опенсорс – очень круто, я в восторге, но возиться с ним приходится много. Без нейронок я бы это не осилил.

Для начала для работы настроил себе новый vpn – поставил формат vless, который вроде бы самый продвинутый сейчас, немного повозились – работает. Активно включаю в работу свое хранилище NAS – купил его в 2013 году, но разобраться с ним как-то получается только сейчас, опять же, спасибо нейронкам.

Еще попробую Repo Prompt – как инструмент работы с промптами. Именно по его мотивам все и затеял, но пока все сделал по старинке – вместе с Клодом. Он сегодня хорошо потрудился, молодец.

Будет интересно, пишите - пришлю примеры, как это все выглядит
🤔1
Любопытный учебник из Станфорда по работе с информацией. Читать лень, конечно, но вот загнать его в NotebookLM и попросить пересказать отдельные куски, либо тупо идти по главам - это будет поинтереснее. Ну или в модельку передать при проектировании RAG и пр
Только я вчера написал про свою возню с промптами, как тут читаю абсолютно противоположное мнение, что возиться с этим не надо. Производители, конечно, двигаются к тому, чтобы ПО писалось с одного промпта, но мой практический опыт говорит о следующем. Без жесткого контроля и детальной информации модели дают команды, которые не работают на вашем компе, пишут бесконечный ненужный код, моментально забивают контекст, ничего не могут исправить и в процессе исправления ошибок ломают вообще все, к чему прикасаются - их в принципе не парит то, что кроме того, с чем они работают, есть и другое ПО, которое не надо трогать.

А так да, если нейронки про смысл жизни спрашивать, промпты им не нужны. В общем, если вы не задумываетесь о том, какую информацию вы грузите в нейронку и что именно она должна делать и (!) не делать, это прямой путь к большим разочарованиям. На текущем этапе развития технологии
Сегодня у меня были приключения. Положил таки свой мак мини - где-то с LM-studio и gpt-oss он перегрузился и подвис. После перезагрузки перестал отвечать на какие-то бы ни было порты. Сколько кнопку не нажимай, из какого-то своего защитного режима не выходит. Чего только не пробовал - и программно, и пытался мак подключать, ноль эффекта.

В итоге смотался на Горбушку, купил монитор за 9 тыс. руб., клаву, мышку - подключил, ввел пароль - и он работает вообще как ни в чем не бывало. С одной стороны гуд, могло быть и хуже, но с другой - что же вы черти эппловские делаете? Можно было бы и через всякие кнопки сброса дать доступ к портам, чтобы наладить работу и перезагрузиться. Можно было дать возможность подключить макбук как монитор, но нет, это не наш кейс. Рассторили. А сама машинка мак мини - крутая, вопросов нет
👍1
NVIDIA выпустила аж две опенсорсные модельки по распознаванию речи, одна из них еще и переводит. 24 языка, включая русский, компактные, говорят, что SOTA и бьют Whisper

https://huggingface.co/nvidia/canary-1b-v2

https://huggingface.co/nvidia/parakeet-tdt-0.6b-v3
Очень люботную тему сегодня изучаю с Клодом - как модельки запускаются на маках - отдельных, и собранных в кластеры. Из важного и неожиданного.

Первое ограничение память. Проблема не столько в размере, вернее не только в размере (модель банально должна поместиться и оставить место для контекста), но и в скорости передачи данных процессорам. А здесь у обычного М4 пропускная способность 120GB/s, у М4 PRO - 273GB/s, у M4MAX - 550 GB/s, M3Ultra - 1000 GB/s. И это часто главное, что определяет скорость.

История в том, что количество вычислений в расчете на количество параметров в нейронках не так велико, и процы нужны не так, как память. Поэтому в обычной ситуации процы не будут загружены полностью - будут лопатить на 40-60% и ждать информации от памяти.

Но здесь есть но. Если модель квантованная, например, у нее параметры не 16битные, а 8ми, то количество памяти требуется в 2 раза меньше. Если это 4х битная модель - то в 4. При этом качетство модели при 8битном квантовании падает на 1%, на 4х-битном - процентов на 5. И при работе с квантованной моделью процессоры становятся важны. Более того, у эппла есть не только cpu и gpu, но и нейронные ядра. Они обычно не очень активно используются, но при квантовании грузятся максимально. Поэтому в четырехбитном варианте уже в максимуме используются нейронные процессоры, а графические процы и скорость шины памяти - это вторые факторы.

Если взять несколько мак мини, то играют важную роль задержки в передаче данных между ними. Нужен обязательно thunderbolt 4, кабель не самый дешевый. Интересно то, что модель параллелится слоями - когда из 32 слоев на каждой из 4 машин по 8, и они токен проходит все эти 4 машины последовательно. Так лучше утилизируются процессоры, чем пытаться, допустим, модель с экспертами разбросать на разные машины по экспертам.

Это убивает скорость - для 64гб памяти один m4max будет быстрее 2 m4pro и 4 m4. Но опять есть но. Если работают несколько человек, то один комп будет все считать по очереди, а стойка из 4 будет обрабатывать сразу несколько запросов и общее количество обработанных токенов за единицу времени будет выше.

Но самое любопытное, что если брать большую, но квантованную модель, то и при единичном запросе скорость у нескольких компов будет выше, чем у одного мощного. Дело в том, что у 4 m4 в сумме 40 cpu, 40 gpu и 64 neural engines. У 2 m4pro - 24, 32, 32. У одного m4max - 16, 40 и 16. А нейронные ядра для квантованных моделей решают. И по цене 4 минимальные машины в сумме заметно дешевле.

Вот такая любопытная арифметика. Руки чешутся попробовать на практике
❤1
OpenAI собрала все ресурсы для разработчиков в одном месте
👍2
Google выкатил MCP сервер для работы с Google Analytics. Это маркетинговое приложение для анализа поведения потребителей, работы с рекламой и пр. - все для повышения продаж. Интересна не сама программа а то, что Google начал расхваливать MCP. До этого Gemini заявлял, что это сырая технология, которая ему не интересна. Но, все-таки, видимо, сломались и решили не идти против рынка. Поддержка МСР появилась у Gemini CLI, а вот в десктопной версии ее пока нет, а жаль
Microsoft внедряет в Excel формулы, где результат пишет Copilot, при этом он додумывает значения в ячейках по содержанию заголовков таблицы. Но на Office 365 пока не раскатали, так что кто этим пользуется - неизвестно. В свое время я прошел все танцы с бубном чтобы достать офис с работающим копайлотом (это было реально очень сложно, хуже Гугла), но страшно в нем разочаровался. Потенциал огромный, а достижений - около нуля.

В то же время появляются и опенсорсные AI-таблички, в которых инфу заполняют нейронки. Не панацея, но как вариант