very vibe coding
119 subscribers
460 photos
126 videos
13 files
980 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Forwarded from Denis Sexy IT 🤖
В выходные потестировал еще один популярный скилл, который называется ponytail –
он пытается сделать из кодинг агента, такого душного чувака с хвостиком, который с самым большим ЧСВ на свете программирует бекенд какой-то корпорации за 300кк в секунду

И на удивление, оказалось, что если этот скилл подключить через хук (ну то есть, чтобы он вызывался всегда а не по настроению агента) – скилл правда экономит ~10% токенов, и даже больше иногда

Тут все детали:
https://blog.jetbrains.com/ai/2026/07/ponytail-skill-claude-tested/

(последний час теста, я анимировал хвостик на аватарке)

💎
🌝
Please open Telegram to view this post
VIEW IN TELEGRAM
Очень впечатляющая история - своего рода первая ласточка. В Америке сейчас в связи с этим проходят конкурсы открытых писем и большой срач между конторами.

Ну и на этом фоне интересно, что проект Ильи Суцкевера по безопасным моделям не умер, а получил еще 5 ярдов от NVIDIA. Видимо, тема актуальна как никогда.

Да, есть ощущение, что и на рынке крипты как никогда много успешных атак. Очевидные жертвы
Forwarded from эйай ньюз
OpenAI сбросили цены на GPT 5.6

Luna теперь дешевле в пять раз, всего $0.2/$1.2 за миллион токенов, против $1/$6 на релизе. Цену Terra сбросили на 20%, до $2/$12 за миллион токенов. Понижение цен касается не только API, но и квоты в Codex/ChatGPT Work. Sol не получил понижения цены, но для него выпустили Fast режим, который в 2.5x быстрее по 2x цене, но про дату релиза Sol запущенного на железе Cerebras OpenAI всё ещё молчат.

@ai_newz
Forwarded from Вайб-кодинг
This media is not supported in your browser
VIEW IN TELEGRAM
WTF: Этот CLI вытаскивает дизайн-систему из любого сайта

Просто передаёте URL, а он достаёт цвета, типографику, отступы, границы, тени, компоненты, брейкпоинты, моушен-токены и даже генерирует DESIGN.md.

Фронтендеры, вайбкодеры и дизайнеры теперь могут закрыть DevTools. И открыть терминал. ✋

https://dembrandt.com
Please open Telegram to view this post
VIEW IN TELEGRAM
River AI: как обучить собственную GLM-5.2 без GPU

River AI — новый сервис для дообучения open-source моделей через LoRA и reinforcement learning. Можно взять базовую Qwen, Kimi или GLM-5.2 и получить специализированный checkpoint под конкретную задачу.

Создатель и CEO River — Игорь Бабушкин. Ранее он работал над ИИ в DeepMind, OpenAI и xAI; River позиционирует себя как инфраструктуру для персонального, контролируемого пользователем ИИ.

Что даёт сервис:
— дообучение модели на своих примерах;
— RL с собственной функцией награды;
— хранение checkpoint;
— инференс через OpenAI-совместимый API без своих GPU.

Цены для GLM-5.2 с контекстом 32k:
— обучение: $4,40 за 1 млн токенов;
— вход при инференсе: $1,46 / 1M;
— выход: $3,67 / 1M;
— хранение: $0,10/ГБ в месяц.

Пример: запрос с 5 тыс. токенов входа и ответом на 1 тыс. токенов будет стоить примерно $0,011.

Но актуальные знания и документы лучше оставлять в RAG. Дообучение полезнее для устойчивых вещей — формата ответа, стиля, классификации, последовательности действий и проверки результата.

За стиль простите, лень переписывать за кло..
Я эту модель в прошлом исполнении использовал для отдельных задач - это было выгодное предложение. А текущая модель по бенчам так и вообще сильнее старшей версии. Если нужна модель по апи - однозначно, один из лучших вариантов

https://t.me/data_analysis_ml/5531
Forwarded from AbstractDL
Ouroboros теперь SOTA на Terminal Bench, OSWorld и CL-bench

Мой любимый агентный луп на чистом питоне доэволюционорал до состояния лучшего харнесса для кодинга! На главных бенчмарках он теперь обходит Codex, Claude code, Cursor и Hermes.

Выходит, что в рисёрче, в computer use, в работе через терминал и в задачах на кодинг — уроборос сейчас является лучшим агентом. Так что с этого момента всю разработку и исследования я веду только через уробороса.

Для полной воспроизводимости результатов. Весь код, скрипты, трейсы я выложил в открытый доступ.

Напоминаю: лицензия MIT. Так что спокойно ломайте, форкайте, проверяйте трейсы, пишите что я где наврал. И кидайте issues и PR-ы! Все постараемся с уроборосом принять😋

P.S. Кошмар какие дорогие агентные бенчи. Прогнать весь набор стоит как квартиру купить (это не шутка!!)

GitHub, Хабр, установочники
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1👏1🎉1
В таких харнесах, правда, есть проблема - их надо подключать по апи. Но можно использовать с GLM или DeepSeek, например.
У chatGPT в настройках для Luna есть уровень Max, который по умолчанию недоступен. Говорят, что моделька на этом уровне выступает очень даже сильно, при том, что стоит в разы дешевле Terra и Sol. Попробуйте
На просторах интернета нашел программку, которая переводит экран браузера в темную тему - после того, как начал пользоваться терминалом, постепенно перешел на черный цвет везде..
Вышел Qwen-3.8 Max на 2.4Т параметров. Теперь это - не опенсорс. Но, может, хотя бы маленькие модели откроют.

PS. Алибаба написала, что все-таки веса откроют. Заодно и метрики подоспели
⚡️ DeepSeek V4 Flash теперь можно запустить локально на одном Mac

На Hugging Face появилась специальная GGUF-сборка DeepSeek-V4-Flash-0731 для компьютеров Apple Silicon со 128 ГБ объединённой памяти.

Официальная модель содержит 304 млрд параметров и поддерживает контекст до 1 млн токенов. После смешанной 2- и 4-битной квантизации файл занимает 97,6 ГБ.

Чувствительные слои, attention и общие эксперты сохранены в повышенной точности, а основная часть MoE-экспертов сжата агрессивнее.

Для запуска используется специализированный движок ds4 / DwarfStar:


git clone https://github.com/antirez/ds4
cd ds4
make

./ds4 -m gguf/DeepSeek-V4-Flash-0731-....gguf \
-p "Напиши распределённый кеш на Go"


Это нестандартный GGUF. Он не загрузится в Ollama, LM Studio или llama.cpp из-за особой структуры тензоров и схемы квантизации.

Модель уровня крупного серверного кластера удалось целиком уместить в память одного мощного Mac. Медленно и требовательно к железу, зато полностью локально .

Модель:
https://huggingface.co/ox-ox/DeepSeek-V4-Flash-0731-gguf-ds4
Forwarded from Machinelearning
This media is not supported in your browser
VIEW IN TELEGRAM
🌟 OpenWorker: опенсорсный ИИ-коллега от Andrew Ng

Andrew Ng собрал открытый проект альтернативы Cowork, который берёт рабочую задачу и возвращает готовый результат - документ, разобранный почтовый ящик, обновлённый календарь, ответ в Slack с нужными цифрами.

Пользователь формулирует, что хочет получить, агент сам делит работу на шаги и обращается к файлам, терминалу и подключённым сервисам.

В описании проекта их больше 25, включая GitHub, Jira, Notion, Gmail, Google Calendar, Outlook и HubSpot.

Andrew Ng - одна из самых узнаваемых фигур в ML.

Он основал и возглавил команду Google Brain, затем работал главным научным сотрудником Baidu, где руководил ИИ-подразделением на 1300 человек. До этого он был директором лаборатории ИИ Стэнфорда, сейчас преподаёт там как профессор.

В 2012 году его курс по машинному обучению вырос в платформу Coursera, а позже он запустил образовательный проект DeepLearningAI. Курсы Andrew Ng прослушали больше 8 млн человек.


Проект не привязан к конкретному поставщику модели. Можно подать ключ OpenAI, Anthropic, Google, DeepSeek, Qwen, Mistral, GLM, Kimi, Grok и других, либо подключиться локально через Ollama.

OpenWorker в открытой бете. Сборка для macOS подписана и обновляется сама, а вот версия для Windows пока не подписана, поэтому фильтр SmartScreen выдаёт предупреждение при запуске (подпись оформляется и будет позже).

Объявляя о запуске в X, Andrew написал, что его цель - дать рынку открытый вариант ИИ-коллеги, не зависящий от вендора.


📌Лицензирование: MIT License


🖥Github


@ai_machinelearning_big_data

#AI #ML #Agent #OpenWorker #AndrewNg
Please open Telegram to view this post
VIEW IN TELEGRAM
DeepSeek начался не с архитектуры модели. Возможно, он начался с поездки в Тибет.

В 2011 году 26-летний Лян Вэньфэн отправился на старом Fiat в одиночное путешествие. Спутник улетел домой из Лхасы, а Лян продолжил путь на запад - к Гималаям и в безлюдные районы Али.

Он проехал сотни километров вглубь плато, фотографируя пейзажи на Nikon D50. Ради одного удачного кадра мог ждать света половину дня.

Затем он пропал почти на неделю.

Позже в его предположительном аккаунте появилось сообщение: Лян выбрался, но Fiat остался на бескрайнем высокогорном плато.

That's the END.

Через 12 лет он основал DeepSeek.

И в этой истории легко увидеть будущий стиль компании.

Пока другие спешили к быстрой коммерциализации, DeepSeek сосредоточилась на фундаментальных моделях. Пока конкуренты компенсировали проблемы вычислительными бюджетами, команда пыталась выжать максимум эффективности. А вместо громкой публичности и закрытых релизов выбрала низкие цены и открытые модели.

Конечно, путешествие не объясняет технический успех DeepSeek. Но оно хорошо показывает характер человека, стоящего за компанией:

• ехать дальше остальных, терпеливо ждать результата, рисковать ресурсами и спокойно оставлять потерянное позади.

Иногда стратегия бизнеса рождается не в презентации для инвесторов.

Иногда она становится продолжением личности основателя.
Forwarded from Вайб-кодинг
Совет по вайбкодингу: попросите Codex создать интерактивную карту вашего репозитория, а затем отмечать, какие модули изменились с момента её генерации.

Нажав на любой модуль, можно увидеть его вызывающие компоненты, зависимости, основные потоки выполнения, связанные тесты и подтверждающие данные из исходного кода.

Он создаёт:
→ docs/codemap/codemap.html
→ docs/codemap/codemap.json
→ docs/codemap/codemap.lock

Полный промпт ↓

Analyze the current codebase. Do not modify product code. Only create or update files under docs/codemap/.

Ignore vendor, build, dist, cache, and other generated directories.

If docs/codemap/ already exists, first compare the existing codemap.lock with the current repo and list the modules that changed. Then regenerate these three files together:

1. docs/codemap/codemap.html

Build a fully self-contained interactive code map that opens directly in a browser. Include:

- major modules, services, databases, queues, and external dependencies
- no more than 20 primary nodes; group low-level files under their parent module
- calls and data flows between modules
- the 3-5 most important end-to-end flows
- a clear dark theme by default
- system boundaries and the most important data flows visible on the first screen
- color-coded module types with a simple legend
- automatic layout that minimizes crossing edges
- clicking any module highlights its upstream callers, downstream dependencies, related tests, and the flows it belongs to
- selecting a flow highlights its complete path
- search, filtering, zoom, and drag controls

At the top, show the repo name, generation time, and the commit it was generated from.

2. docs/codemap/codemap.json

Use this structure:

{
"generated_at": "",
"generated_from_commit": "",
"scope": [],
"nodes": [],
"edges": [],
"flows": []
}

Each node must include:

- id
- path
- role
- entrypoints
- tests
- constraints
- evidence

Each edge must include:

- from
- to
- type
- evidence

type may only be:

- imports
- calls
- reads
- writes
- publishes
- subscribes

Each flow must include:

- trigger
- steps
- outcome

Every step must reference an existing node id.

Attach the matching source path and symbol to every node and edge. Mark any relationship without source evidence as unknown. Do not guess.

3. docs/codemap/codemap.lock

Use parseable JSON to record:

- the current commit
- whether the working tree has uncommitted changes
- generation time
- scanned scope
- excluded directories
- the fingerprint algorithm
- a deterministic fingerprint for each top-level module, calculated from its tracked file paths and current file contents

If no existing codemap.lock is found, treat every module as new and generate the full map.

When finished, verify that:

- codemap.json parses successfully
- every node path exists and every evidence symbol can be found in the source
- every edge and flow step references an existing node
- codemap.html and codemap.json use the same nodes, edges, and flows
- codemap.lock matches the current commit, working tree state, and module fingerprints
- every relationship without source evidence is marked unknown

These three files must always be generated together from the current repo. Never edit only one of them manually.

Finally, show:

- files created or modified
- stale modules
- remaining unknowns
- validation results
- the complete diff


Ещё один момент. Добавьте правило в AGENTS.md, чтобы карта кода всегда оставалась синхронизированной с репозиторием:

At the start of every code-changing task, compare the current repo with docs/codemap/codemap.lock.

Before modifying a module, use docs/codemap/codemap.json to answer three questions:

1. What calls it?
2. What does it affect?
3. Which tests cover it?

If the map is stale or cannot answer those questions, regenerate codemap.html, codemap.json, and codemap.lock before changing the code.

Whenever module boundaries, dependencies, routes, databases, queues, or major data flows change, update the code map in the same commit as the code.
DeepSeek с моделью flash стала не просто лидером - ее отрыв по использованию через апи просто подавляющий - более 9 из 10 вызовов относятся к ней.

Мало того, что она дешевая, так еще она и маленькая - это значит, что и обучение лучше делать на ней, внутренние ИИ - тоже.

Так что, несмотря на восторги вокруг Kimi, GLM и Qwen, пока реальный лидер - DeepSeek.

Ничего удивительного, что и цены на модель подрастут.. был бы в продаже Mac Studio 256gb - брал бы, чтобы гонять модель локально

https://t.me/data_analysis_ml/5558
Forwarded from Федор
Cloudflare сделала браузер, который изначально рассчитан на агентов, а не на людей.

Kitesurf — новый движок для Browser Run: он работает в V8-isolates поверх Workers и ориентирован на задачи вроде извлечения HTML, скриншотов и автоматизации веба. Идея практичная: агенту не нужны вкладки, расширения и идеальная отрисовка; ему важнее дешёвая изоляция, быстрый старт и возможность масштабировать множество одноразовых сессий.

Под капотом — CDP, поэтому существующие клиенты Puppeteer, Playwright и chrome-remote-interface можно направить на Kitesurf без смены протокола. Сетевая часть вынесена в отдельный изолированный компонент, сессионные cookies разделены, а остальные части по возможности stateless.

Но это пока beta и не замена Chromium: нет обещания pixel-perfect совместимости; для WebGL, видео, сложных bot-challenge, реальных TLS fingerprints и долгих авторизованных сессий Cloudflare советует обычный Chromium. В beta Kitesurf бесплатен в Browser Run.

Анонс: https://blog.cloudflare.com/kitesurf/
Документация Browser Run: https://developers.cloudflare.com/browser-run/