very vibe coding
120 subscribers
463 photos
126 videos
13 files
994 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Forwarded from Data Secrets
О, новый релиз от Андрея Карпаты

Это один из самых безумных репозиториев, которые я когда-либо писал


Сразу ссылка: github.com/karpathy/nanochat

nanochat – это что-то типа продолжения легендарного nanoGPT. Но если nanoGPT – это, по сути, только предобучение, то здесь у нас полностью готовый конвейер для обучения и инференса целого мини-клона ChatGPT.

В лучших традициях кода Карпаты – совсем немного строк (всего 8к) и минимальное количество зависимостей. Вы просто открываете проект на любом облачном GPU-сервере, запускаете один скрипт, и уже через 4 часа можете общаться с LLM-кой в собственном ChatGPT.

В пересчете на аренду GPU это будет стоить примерно 100 долларов. Если готовы потратить больше, то можно масштабировать и получать лучшие результаты.

Моя цель – собрать весь «сильный базовый» стек в один связный, минималистичный, читаемый и максимально форкаемый репозиторий. nanochat станет итоговым проектом LLM101n <мы об этом курсе писали тут>. Думаю, у него также есть потенциал стать исследовательским инструментом или бенчмарком, подобным ранее существовавшему nanoGPT.


Технические детали о том, что просходит внутри проекта, можно почитать здесь.

Огонь же?
Media is too big
VIEW IN TELEGRAM
🍏Ничего сверхъестественного - просто Gemini 3 Pro за один (!) промпт разворачивает полноценную симуляцию macOS или Windows прямо в браузере.

Всего 900 строк кода - и у вас уже есть рабочий интерфейс с анимациями, меню, браузером и даже терминалом.

Модель справляется с этим за 172 секунды.

Код и демо уже доступны - а инсайдеры шепчут, что официальный релиз выйдет на этой неделе.
Первые тестеры называют Gemini 3 Pro «лучшим ИИ для кодинга на сегодня».

https://codepen.io/ChetasLua/pen/EaPvqVo
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Data Secrets
Новая неделя – новые модели от Qwen

На этот раз у нас Qwen3 VL в размерах 4B и 8B. Две просто отличные модельки для локального запуска и дообучения.

Каждая идет в вариантах Instruct и Thinking. Несмотря на размер, по качеству малышки даже кое-где обгоняют Gemini 2.5 Flash Lite и GPT-5 Nano.

По бенчмаркам видно, что модели почти дотянули до уровня Qwen2.5-VL-72B. А ведь эту модель выпустили всего пол года назад, и она считалась флагманом Qwen.

Кроме того, оптимизировали потребление VRAM и выпустили версии FP8.

Hugging Face
Cookbook
Мало пишу, потому что много работаю (увы) и много программирую.

Пересел на агентов - Claude code и Codex, и знаете, на удивление - использую последнего. Claude code требует слишком много внимания, пишет много, а Codex работает автономнее, и не менее успешен. Плюс, в отличие от Антропика OpenAI выставила лимиты так, что я в них не упираюсь. А есть еще Gemini CLI, который буду тестить после выхода Gemini 3.0.

Зато Sonnet 4.5 чудо как хорош в Deep Research. Подумываю о том, чтобы создать себе план исследований, чтобы запускать их на ночь в ежедневном режиме
Сейчас происходит маленькая, незаметная революция. Если раньше можно было выбирать между закрытой, платной и умной моделью и опенсорсной моделью поменьше и похуже, то сейчас появилась новая опция - Андрей Карпаты (человек, который придумал термин вайбкодинг) выложил в сеть код, который позволяет учить свои модели от начала и до конца, дома или в облачном дата-центре.

https://github.com/karpathy/nanochat

Модели, конечно, маленькие, но это первый шаг.

Карпаты, я тебя уважаю ✊
🧠 Учёные из Penn State обнаружили нечто **дикое**: грубость делает ChatGPT умнее.

Они протестировали ChatGPT-4o на 250 вопросах с 5 уровнями вежливости:

• Очень вежливо → 80.8% точности
• Вежливо → 81.4%
• Нейтрально → 82.2%
• Грубо → 82.8%
• Очень грубо → 84.8%

Статистический анализ подтвердил: это не случайность — жёсткие запросы стабильно дают лучший результат.

Ещё интереснее: старые модели вроде GPT-3.5 реагировали *наоборот*.
А вот GPT-4 и новее становятся точнее, когда с ними разговаривают резче.

Источник: https://arxiv.org/abs/2510.04950
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Machinelearning
📄 PaddleOCR-VL (0.9B) — компактная Vision-Language модель нового поколения

Команда Baidu AI представила PaddleOCR-VL (0.9B) — сверхлёгкую VLM-модель, которая достигает SOTA-точности в задачах распознавания:

- текстов,
- таблиц,
- формул,
- графиков

💡 Под капотом:
- NaViT - динамический vision-энкодер
- ERNIE - облегчённая языковая модель от Baidu

⚡️ Поддержка 109 языков.


🟠GitHub: https://github.com/PaddlePaddle/PaddleOCR)
🟠HuggingFace: https://huggingface.co/PaddlePaddle/PaddleOCR-VL
🟠Docs https://paddleocr.ai/latest/en/index.html

@ai_machinelearning_big_data


#BaiduAI #PaddlePaddle #Ernie #PaddleOCR #VisionLanguage #AI #OCR
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Machinelearning
🤗 Кто реально двигает open-source ИИ: анализ топ-50 самых скачиваемых моделей на Hugging Face

Исследование показывает, какие организации и типы моделей определяют экосистему открытых моделей.


🔥 Главное:
📦 Топ-50 - это всего 3.4% всех моделей на Hugging Face, но именно они собирают более 80% из 45 миллиардов скачиваний.

Подавляющее большинство активности сосредоточено вокруг небольшой группы лидеров -
именно эти модели формируют лицо всего open-source ИИ.

📉 Размер имеет значение (и чем меньше — тем лучше):
- 92.5% загрузок — модели < 1B параметров
- 86.3% — < 500M
- 70% — < 200M
- 40% — < 100M

Очевидны выводы: в open-source побеждают малые и лёгкие модели, пригодные для локального развёртывания и edge-инференса.

🧠 Популярные направления:
- NLP — 58.1%
- Computer Vision — 21.2%
- Audio — 15.1%
- Multimodal — 3.3%
- Time Series — 1.7%

Кто создаёт самые скачиваемые модели:
- Компании - 63.2% (Google лидер)
- Университеты - 20.7%
- Индивидуальные авторы - 12.1%
- НКО - 3.8%
- Прочие лаборатории - 0.3%

Какие типы моделей побеждают:
- Текстовые энкодеры - 45% всех загрузок
- Декодеры - всего 9.5%
- Энкодер-декодеры - 3%

📌 Несмотря на хайп вокруг LLM, массово скачиваются не гиганты, а утилитарные модельки для интеграции в собственные продукты.

🇺🇸 Лидеры по странам:
США доминируют по всем категориям:
- встречаются 18 раз среди топ-50 скачиваний
- на США приходится 56.4% всех загрузок

Open-source ИИ живёт не за счёт гигантских LLM, а благодаря компактным, быстрым и практичным моделям, мкоторые реально работают в продуктах и проектах.

🟠 Почитать полностью: https://huggingface.co/blog/lbourdois/huggingface-models-stats

@ai_machinelearning_big_data


#AI #HuggingFace #OpenSource #ML #Research #LLM #AITrends
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Я не пропал - был в отпуске, и как-то было не до ИИ. Хватало впечатлений оффлайн. Потихонечку возвращаюсь к работе и вайбкодингу..
Новая китайская модель - лидер опенсорса. Честно скажу, я с сомнением отношусь ко всем подобным бенчмаркам - очевидно, модели под них затачивают, и в реальном использовании они смотрятся несколько иначе. Но в любом случае - новый топ опенсорса всего с 230В параметров - это классно. Если есть $6К, должна летать в домашних условиях на М3 ультре с 256 памяти…
🧠 Ming-Flash-Omni-Preview - новый ориентир для omni-modal моделей с архитектурой 103B-A9B Sparse MoE, сочетающей мощь и эффективность.

📸 1. Контролируемая генерация изображений
Модель вводит концепт Generative Segmentation-as-Editing - можно править изображение на уровне пикселей. На бенчмарке GenEval — впечатляющий результат 0.90.

🎬 2. Понимание потокового видео
Расширенные возможности для детального анализа аудио-видео потоков в реальном времени — понимание контекста, сцен и звука синхронно.

🏹GitHub: https://github.com/inclusionAI/Ming
🤗Hugging Face: https://huggingface.co/inclusionAI/Ming-flash-omni-Preview
🤖ModelScope: https://modelscope.cn/models/inclusionAI/Ming-flash-omni-Preview

#OpenSourceModels #AI #OmniModal #MingFlash
Google обновил Gemini CLI - аналог Claude code и Codex. Пока этот агент все еще проигрывает лидерам, но посмотрим, что будет с выходом Gemini 3, которую все ждали еще на прошлой неделе
Microsoft пока работает в роли догоняющего - сделали подкасты, как в Notebook LM, пытаются запустить разработчика приложений в Copilot. Выглядит все пока вторично, тем более, что наверняка попросят за это платить. Так что я пока на стороне Google, у которого много бесплатных сервисов. Но попробовать надо будет

И с платной подпиской на Copilot теперь можно запускать в VS Code платный Codex - не в терминале, а так, как это сделано в Cursor. Было бы интересно, если бы это работало с бесплатным копайлотом..
Вот что надо будет изучить после отпуска в первую очередь, это - Claude skills. Система пришла на смену tools, и позволяет использовать инструменты на основе текстового промпта. Звучит революционно.

Умельцы разработали библиотеку, которая позволяет использовать skills и с другими агентами, работающими в терминале..
Forwarded from Data Secrets
Дуров анонсировал децентрализованную ИИ-сеть

Cocoon (Confidential Compute Open Network) это два в одном: майнинг и конфиденциальность ваших ИИ-запросов. То есть:

– Владельцы GPU подключают свои видеокарты к сети и получают за это TON.

– Разработчики получают доступ к компьюту, а пользователи могут безопасно общаться с моделями.

Если у вас есть GPU и вы готовы ее предоставить, пост с информацией вот