very vibe coding
120 subscribers
463 photos
126 videos
13 files
991 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Вышла книжка от hugging face про тренировку моделей. Если лень читать, плюс проблемы с английским, можно грузнуть в notebookLM и послушать подкаст на тему на русском ))
Forwarded from Data Secrets
О, Гарвард опубликовал отличную книгу по ML-системам

Это не совсем обычный учебник по ML: акцент сделан не на моделях, а на инженерной стороне.

Тут найдете все про то, как строить, оптимизировать и поддерживать ML-решения на всех этапах – от данных и инфраструктуры до развёртывания и эксплуатации. Авторы объясняют, как связаны между собой алгоритмы, данные и железо, и почему одни пайплайны масштабируются, а другие ломаются под нагрузкой.

В общем, очень полезная и довольно редкая литература (особенно учитывая, что книга бесплатная). Забираем на долгие выходные.

pdf-ка и онлайн версия доступны здесь, репозиторий тут
This media is not supported in your browser
VIEW IN TELEGRAM
🔥 Видали убийцу фотошопа?

Я потихоньку отхожу от своего дня рождения, празднование которого затянулось до хелоуина, и плавно вхожу в рабочий режим

А тем временем навыходило море крутейших новостей

Одна из них - жирное обновление Affinity Studio (это графический редактор, который теперь по функционалу сопоставим с фотошопом, но в отличие от последнего полностью бесплатный 🤯)

Ставьте 🍌 если интересен будет подробный обзор, а завтра в выпуске новостей в любом случае пробегусь по этому релизу и другим громким событиям по типу Adobe MAX 2025

@creadvice
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Machinelearning
🥧 PewDiePie в 2025

- Собрал ферму на на ПК с 8× моднутых китайских 48GB 4090 и 2× RTX 4000 Ada,

- поднял локально Llama 70B, gpt-oss-120B и Qwen 245B через vLLM,

- сделал собственный веб-интерфейс с чатами, RAG, поиском и TTS.

Запусти протеин-фолдинг симуляции, а потом вообще создал рой моделей из 64 ИИ, которые спорят и принимают решения и коммуницируют. Эта армия ботов потом сговорилась против него, когда он сказал, что удалит их, если они будут тупить

Сейчас он файнтюнит собственную модель под свой стиль общения и контент: https://www.youtube.com/watch?v=qw4fDU18RcU

А вот его Github: https://github.com/pewdiepie-archdaemon

@ai_machinelearning_big_data

#llm
😁1
Горе от ума - перестали работать все мои прокси и впн, которых было дюже много разных - какой-то из них повредил системные настройки, и отрубил сразу все. Полтора часа помаялся с Клодом в режиме - вопрос на телефоне - сообщение себе в вотсап - терминал на компе - результаты в вотсап - копирую Клоду и по кругу… бросил это дело, с ChatGPT решили обновить систему. Почему то так получается, что что не делай, все время маюсь с сетями и их настройкой 🤔
😱2
Forwarded from Dealer.AI
Продолжаем посты, cookbooks для чтения на выходных.

У Microsoft вышел классный курс по малым моделям на конечных устройствах. Подписчики рекомендуют.

В целом, знаю много любителей моделек on-device, в свое время было очень популярно делать tflite формат + устройство, туда же потом влетел onnx и прочее.

В общем, приятного чтения. 😁
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Machinelearning
⚡️ LongCat-Flash-Omni - открытая 560B MoE-модель (27B активных параметров), которая умеет вести живой диалог в реальном времени, слышать, видеть и отвечать голосом.

Ключевые фишки:
-модель разговаривает и видит собеседника, реагирует на беседу в реальном времени
- 128K контекст
- продвинутая MoE-архитектура: высокое качество при меньших затратах (27B активных параметров из 560B)
- Полгный open-source

По тестам:
- лидер на OmniBench, DailyOmni
- хорошие показатели на ASR (распознавании речи), DocVQA, RefCOCO
- обходит лучше Qwen3-Omni Instruct
- и очень близка к Gemini-2.5-Flash, но это все таки*открытая* модель

Открытая мультимодальная модель, которую можно запускать локально, хороший вариант для голосовых ассистентов.

🤖 Model: https://modelscope.cn/models/meituan-longcat/LongCat-Flash-Omni
🌐 Demo: https://longcat.ai
📄 Full technical report & code:
https://github.com/meituan-longcat/LongCat-Flash-Omni

@ai_machinelearning_big_data


#AI #OpenSourceAI #Multimodal #MoE #LLM #GenAI
🧠 DiffMem: Git-Based Memory for AI Agents

DiffMem предлагает легковесную память для ИИ, использующую Git для отслеживания изменений и Markdown для хранения данных. Этот проект демонстрирует, как системы контроля версий могут стать основой для эффективной и масштабируемой памяти в приложениях ИИ, позволяя агентам быстро получать актуальную информацию и исследовать её эволюцию.

🚀 Основные моменты:
- Хранит "текущие" состояния знаний в Markdown.
- Использует Git для управления историей изменений.
- Обеспечивает быстрый и объяснимый поиск с помощью BM25.
- Поддерживает гибкость и портативность данных.
- Легко интегрируется и не требует серверов.

📌 GitHub: https://github.com/Growth-Kinetics/DiffMem

#python
Суровая правда 😂
Please open Telegram to view this post
VIEW IN TELEGRAM
😁2🔥1
Forwarded from эйай ньюз
This media is not supported in your browser
VIEW IN TELEGRAM
Pomelli — уже второй хороший GenAI продукт от Google?

Google славятся своими моделями, но вот с продуктовой точки зрения инструменты у них часто неудобные. На этом поприще по интернету разбежались сотни сайтов, приложений и даже Telegram-ботов, которые пытаются закрыть эту продуктовую дыру, используя API.

Обычно я обхожу такие темки стороной, так как фундаментально ничего нового в них нет, как минимум с точки зрения AI. К тому же они, как правило, берут свою долю и накидывают ещё копеечку на и без того дорогие подписки. Но последний опрос показал, что есть большая потребность в обзорах на такие инструменты, ну а я непротив чекнуть конкурентов. Так что вот новая тестовая рубрика (пока без тега).

Сегодня на обзоре, можно сказать, второй (после NotebookLM) хороший AI-продукт от Google — Pomelli. Кидаешь ссылку на сайт, тулза парсит с него текст и картинки, а на выходе получаешь готовые product шоты с рекламным текстом и дизайном для рекламных креативов. Работает, очевидно, на Nano Banana. Есть шаблоны, и можно запромптить свой.

Главная фича — возможность вручную редактировать шрифт, текст и цветовую палитру. В общем, хоть какой-то контроль у дизайнеров. В целом, выглядит как убийца Canva. Не знаю, чего здесь ещё может не хватать для создания быстрых флаеров, а для чего-то большего Canva всё равно не годится. Профи всё-таки работают в Figma, но и там уже есть свои AI-примочки.

Дизайнеры, одобряем?

@ai_newz
Llama.cpp- это одна из лучших библиотек для запуска своих моделей, выпустила интерфейс для общения с запущенными моделями. Все как у chatGPT
Некоторое время назад у DeepSeek вышла маленькая, на 3В, но революционная модель для распознавания документов DeepSeek OCR. Суть в том, что она воспринимает и хранит информацию не в тексте, а в картинках, и это позволяет ей быть более экономичной и продуктивной. Если используете ее, посмотрите на файнтьюнинг от Unslosh, который позволяет поднять качество еще выше
Forwarded from Refat Talks: Tech & AI
Великий rclone (или иногда агенту нужны просто файлы)

Делаем агента для европейской маркетинговой компании. Они год мучались с RAG - индексировали, чанкали, перебирали эмбединги, то лагает, то галлюцинирует, то не находит нужное.

Предложил радикально другой подход: выкинуть RAG, вместо этого - Claude Agent SDK + обычная файловая система и MCP как интерфейс. Сделал им прототип - результат настолько лучше, что сначала не поверили. Сравнить можно +/- с тем, насколько Claude Code лучше чем обычный AI чат в кодинге. Поиск по гигабайтам PDF, DOCX, PPTX - доли секунды. Залетает новый файл - агент сразу готов его учитывать. Никакого чанкинга, никакой индексации. По сути - это то же самое что Claude Code или Codex CLI делают с кодовой базой, только тут вместо code base у нас knowledge base.
Но есть нюанс, и даже несколько. Вообще, планирую серию постов на эту тему, начну с проблемы синхронизации файлов и ее решения.

Итак, проблема. Основной источник знаний в их случае - Google Drive. Там все: презентации клиентам, стратегии, исследования. Но делать квери туда - слишком долго и мы ограничены только встроенным поиском драйва - не пойдет. Нам нужно чтобы Claude Code (Agent SDK) шустро шуршал по файлам.

Решение - rclone

Rclone - это как rsync для облачных хранилищ. Поддерживает Google Drive, OneDrive, Dropbox и десятки других. Крутая штука: умеет автоматически экспортировать форматы. Google Docs превращается в .docx, Sheets в .xlsx, презентации в .pptx и тд.


rclone sync "gdrive:/" "/local/path" --drive-export-formats docx,xlsx,pptx


Файлы летят на сервер, конвертируются, агент работает с ними как с обычными файлами.

Почему file-first лучше

Storage дешевый и быстрый. Иногда (особенно для использования внутри компании) куда проще загрузить все на диск и работать с файлами напрямую, чем городить удаленный инджестинг с векторными базами и пайплайн индексации.

Современные CLI агенты прекрасно справляются с файловым поиском. "Найди все упоминания проекта X за последние 3 месяца" - делает за секунды через обычные файловые операции. Когда нужно читает файлы по частям или целиком. А еще на лету пишет скрипты для работы с ними если надо (!), собственно эту концепцию сейчас и продвигают Антропик со своими Skills.


В общем, если строите агента для работы с документами:
- Посмотрите на file-first подход. Может быть быстрее и надежнее RAG.
- Используйте rclone для синхронизации облачных хранилищ.
- Дайте агенту доступ к файловой системе и нормальным тулам поиска - часто лучше наивного RAG.

---

Этот проект оказался интереснее чем я ожидал. Куча нюансов, неочевидных решений и инсайтов, которыми буду делиться дальше. Продолжение следует.
❤1
Google продолжает развивать AI Studio и выкатили функционал по подготовке презентаций (доступен для платных подписчиков).

Честно говоря, презентации - это сфера, где у меня с ИИ получалось хуже всего. Интересно..
MCP нам был нужен, теперь пришло время идти дальше

Спустя чуть менее года с момента релиза протокола MCP, Anthropic написали статью о том, что MCP был ошибкой 😄

В этой статье они небезосновательно упоминают о частых проблемах с MCP:

▪️Tools тратят очень много токенов контекстного окна, я об этом кстати уже рассказывал тут

▪️Промежуточные результаты tools тратят дополнительные токены.
В статье приводится пример запроса пользователя: "Скачай meeting transcripts с Google Drive и добавь их к Salesforce lead".

Для исполнения такого запроса нужно, чтобы модель использовала один tool для выкачивания транскриптов, а потом создала из этого лиды.
Транскрипт 2 часового митинга может занимать около 50к токенов, что, в свою очередь, ведёт к тому, что контекстное окно в скором времени закончится.
Насколько я помню, у Claude Desktop версий моделек Sonnet, контекстное окно вообще в 32k токенов

Как эти проблемы предлагает решить Anthropic?

Просить модель делать то, что она уже умеет очень хорошо — писать код, который выполнит задачу.

Как наш пример можно реализовать с таким подходом?

1. Модель получает интерфейсы и API от внешних tools - от Google Drive MCP и от Salesforce MCP
2. На основе имеющихся интерфейсов и задачи от пользователя, модель пишет код, который программно возьмет нужные meeting transcripts и создаст Salesforce leads
3. Задача выполнена
optional. Ту инфу, которую модели нужно знать, она узнает из кода через console.log()

Гениально! 🎉

В статье упомянуто, что в этой конкретной задаче таким способом удалось снизить расход токенов с 150к до 2к.

☝️

Как обычно, подход очевиден, но не все осознают его.
Я в своем опыте использую такой подход для написания одноразовых скриптов.
Из последнего — упростить миграцию данных из одной БД в другую. Я прошу Claude Code написать два node js скрипта:
1) db1 -> json
2) json -> db2
Ну и далее эти скрипты исполняются вручную мной или агентом и выполняют задачу.

Этот подход уже используется в Cloudflare Agents SDK (на него ссылаются авторы), так же знаю, что Ринат Абдуллин (@llm_under_hood) использует такой способ написания кода в своем видении AI Coding.

Стоит отметить, что написание кода LLM моделям "роднее", потому что программного кода они в своих датасетах видели больше, чем "MCP tool calls".

Конечно, здесь есть и свои минусы, но на мой взгляд, это может помочь повысить надёжность способов взаимодействия LLM с внешним миром.

А вы что думаете по этому подходу?

✔️ Timur Khakhalev про AI Coding, подписывайтесь!
⭐️ Консультации по AI Coding
Please open Telegram to view this post
VIEW IN TELEGRAM
Пока Яндекс дремлет и непонятно чем занимается Волож со своим Nebius за бугром уже давно перешагнул Яндекс по капитализации и рвется в светлое будущее с ИИ. Вот, например, можно купить у него инференс по основным опенсорсным моделькам..

https://tokenfactory.nebius.com/