very vibe coding
120 subscribers
463 photos
126 videos
13 files
994 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Вышел Kling 2.5 turbo

Кто-то уже тестил?

По бенчмаркам лучше чем veo 3 fast и seedance 1.0

Но, как говоря, текст рендерит паршиво

@creadvice
⚡️ Новые модели для Кодина от Kwaipilot: KAT-Dev-32B и KAT-Coder

- KAT-Dev-32B — 62.4% на SWE-Bench Verified, входит в топ-5 среди open-source моделей
- KAT-Coder — 73.4% на SWE-Bench Verified, результат на уровне лучших проприетарных решений

🔗 Попробовать: https://huggingface.co/Kwaipilot/KAT-Dev
Perplexity Comet

Поставил себе потестировать новомодный браузер Comet от Perplexity в платном режиме. С vpn работает и у нас, ищет быстро, в нем живет агент - сегодня он писал от меня мастерским запросы по ремонту телефона (как это работает пока не до конца разобрался - в том плане, что ответов я не получил, но когда был в мастерской, оказалось, что им действительно кто-то писал. Прикольно, чо).

Еще нравится то, что работает быстро. Плюс в нем лимиты на платные модели claude sonnet 4, gpt-5 на уровне от создателей на платных режимах, так что можно при одной подписке получить все из них и gemini-2.5 pro + grok 4 в придачу. Солидный набор. Проблема одна - по апи они не работают и claude code, codex на них не запустишь - но если вы еще до этого не добрались и не собираетесь, то подумайте, вариант интересный.

Из любопытного - ты обращаешься не просто к модели, а к агенту от perplexity, который использует модель. Этот агент использует поиск и делает это почти всегда, в то время как сам Claude этого бы делать не стал.

Да, еще голос у перплексити хорошо работает, у антропика и гугла этого нет, а вот OpenAI тоже умеет.

Если кто-то захочет подписаться, по ссылке ниже - 1 бесплатный месяц ($20). Ну и мне тоже перепадет )) Присоединяйтесь

https://perplexity.ai/pro?referral_code=G8O2K6Q0
Forwarded from эйай ньюз
Media is too big
VIEW IN TELEGRAM
Suno V5 + Suno Studio — RIP Mozart AI

Недавно я писал про Mozart AI, которые пытались сделать AI DAW (Digital Audio Workstation) для музыкантов. Но их продукт, как многие заметили в комментариях, всё ещё сырой. И вот пришёл гигант — Suno (по моему мнению, лучший, лучше чем Udio), выкатил свою новую SOTA-модель V5 и сразу же полноценную Studio-версию. И просто решил все проблемы.

По сути, это всё, что обещал Mozart AI, но уже реализованное и с новыми фичами. Главная из них — можно напеть мелодию, а затем превратить её в отдельную дорожку (stem), как на 10:25.

Что это даёт? Дикий контроль. Теперь продюсер, имея один только ноутбук, может получить реалистичную аудиозапись инструмента, а не MIDI-болванку. Причём со всеми нюансами, которые невозможно запрограммировать: реалистичной динамикой, звуком удара медиатора по струнам или шорохом пальцев гитариста по грифу, и всё это в «комнате» с её естественным эмбиенсом.

Профессионалы, конечно, не будут использовать Suno Studio как основную DAW, но как генератор стемов — это геймченджер.

Многие боятся, что генеративная музыка захламит чарты AI-слопом (треть новой музыки на стримингах уже сгенерирована). Но я думаю, что именно эта технология сделает музыку только лучше. Теперь вместо стерильных, запрограммированных в MIDI инструменталов можно будет генерить реалистичные аудиодорожки, что только поднимет общее качество продакшена.

V5 доступна пока только по подписке. Suno Studio — на тире Premier, но сейчас есть скидка: $15 в месяц на первые 3 месяца вместо $30.

@ai_newz
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
🔥 HunyuanImage 3.0 — свежая open-source модель для генерации изображений по тексту (text-to-image) от Hunyuan.

Размер *80B параметров**, из которых 13B активируются на токен во время инференса.

Качество сопоставимо с флагманскими закрытыми моделями индустрии.


Что интересного:
- Основана на собственной мультимодальной LLM Tencent
- Постобучение заточено под text-to-image задачи
- Архитектура MoE + Transfusion объединяет Diffusion и LLM в единую систему

🚀 Возможности:

- Понимает сложные промпты длиной до тысячи слов
- Детализированные изображения с текстом
- Генерирует сложные иллюстрации и комиксы

👉 Попробовать: https://hunyuan.tencent.com/image
🔗 GitHub: https://github.com/Tencent-Hunyuan/HunyuanImage-3.0
🤗 Hugging Face: https://huggingface.co/tencent/HunyuanImage-3.0

@ai_machinelearning_big_data


#AI #GenerativeAI #Adobe #MorganStanley
Alibaba Group представила Memp — новый фреймворк, который даёт LLM-агентам обучаемую и обновляемую процедурную память.

📈 Результат — более высокая успешность и эффективность при сложных задачах.
🧠 Memp превращает прошлый опыт агентов в детальные инструкции и абстрактные стратегии, постоянно совершенствуясь по мере накопления данных.
🔄 Память можно даже передавать более слабым моделям, повышая их возможности.

https://huggingface.co/papers/2508.06433
В продолжение поста про Perplexity Comet. Хороший умный поиск с нейронкой, и главное быстрый. А еще очень порадовала возможность использования для технических задач.

Сейчас я активно работаю с Codex (Claude code внезапно перестал работать - видимо, банит меня не смотря на vpn, хотя само приложение работает). Так вот, когда Codex уперся в очередную задачку, остановил его, передал саммари в Comet, тот пошерстил интернет, выяснил, что проблема известная, традиционными методами не лечится, предложил откатиться на другую версию и еще пару моментов. И знаете, заработало. Очень классно.

Если с Клодом интернет обращения надо экономить, так как он делает их, видимо, той же моделью, что и думает, и моментально выжирает контекст и проплаченные токены, то с Comet история другая - они испвользуют одну модель для поиска, другую для обработки информации, а умной модели передают уже готовый и почищенный контекст. Получается и быстрее, и экономнее.

Ну и сам браузер приятный, быстро привыкаешь. Если Claude code не починю, то, пожалуй, подумаю о том, чтобы пообще от него отказаться в пользу подписки на Comet.
Ждем большого релиза на этой неделе. Sonnet 4.5
Сегодня читал про то, как парень тренировал свою модельку на 135 млн параметров - ему это обошлось в $12.

Слушал, как Иван Оселедец (AIRI) рассказывал о том, что сегодняшние модели на 1,5B параметров эффективнее GPT-3 со 135B.. Кстати, у него был интересный тезис о том, что сегодня промтинг важнее файнтьюнинга и дообучения.

Делаю вывод - скоро локальные, персонализированные модели будут в каждом телефоне, и это будет создавать потребность во все более новых и мощных моделях (а то, что 12й айфон, что 17й - разницы нет). Памяти уже ставят 12Gb, процы мощные, уже недолго осталось
Forwarded from ForkLog AI
📑 Компания OpenAI выпустила набор готовых шаблонов из более чем 300 промптов. Они упрощают работу с ChatGPT и помогают использовать ассистента в разных профессиональных сценариях.

Подсказки охватывают широкий спектр сфер, включая продажи, продуктовый менеджмент, клиентский сервис и т. д.

Каждый набор включает готовые промпты, адаптированные под конкретные рабочие процессы: проведение исследований, анализ данных, визуализация, подготовка коммуникаций, стратегическое планирование и многое другое.

Новости | AI | YouTube
DeepSeek-V3.2-Exp

Новая (на самом деле немного поправленная старая) модель от дипсика, в которой она интересна не сама по себе, а то, что модель стала стоить на уровне Grok 4 fast - у DeepSeek $0,28/0,42 за 1М входящих/исходящих токенов, у Grok 4 fast - $0,2/0,5.

И разреженный контекст у обеих моделей. Собственно сейчас борьба и идет за то, кто сможет больше всего в контекст впихнуть, правда у DeepSeek он 128К, а у Grok 2М, но с этим как-то можно жить
Про Sonnet 4.5 я написал еще с утра, а вот выход еще и Claude code 2 - новость. Посмотрим, смогу ли решить проблему с подключением, но что классно - есть приложение в VS Code - причем значок приложения в районе, где живет Copilot, появился уже некоторое время назад… Плодв работы с Майкрософт..

https://t.me/seeallochnaya/2949
🚀 CapRL-3B: когда 3 миллиарда параметров работают как 72 миллиарда

InternLM (Shanghai AI Laboratory) выпустила CapRL-3B — модель для автоматического создания описаний к изображениям (image captioning). Это первая модель, обученная через reinforcement learning (обучение с подкреплением) специально для этой задачи. Релиз состоялся 25 сентября 2025 года.

Ключевые характеристики:
• Размер модели: всего 3B параметров, но по качеству работы сравнима с Qwen2.5-VL-72B (в 24 раза больше!)
• Особая сила: диаграммы, инфографика и документы — модель отлично распознаёт графики, таблицы и текст на изображениях
• Технология обучения: RLVR (Reinforcement Learning with Verifiable Rewards) вместо традиционного supervised fine-tuning. Модель учится генерировать описания так, чтобы по ним можно было точно отвечать на вопросы об изображении
• Результаты: прирост на 8.4% по сравнению с базовой моделью, меньше галлюцинаций

Технические детали: Модель доступна на 🤗 HuggingFace и в виде кода на GitHub. Лицензия Attribution-NonCommercial 4.0 International — можно использовать для исследований, но не для коммерческих целей. В комплекте идёт датасет CapRL-5M с 5 миллионами аннотированных изображений и модель CapRL-Eval-3B для оценки качества подписей.

🔗 Ссылки: 🏠 Статья на arXiv
🐙 GitHub репозиторий
🤗 Модель на HuggingFace
🤗 Датасет CapRL-5M

#CapRL #imagecaptioning #написаноклодом
⚡ LoRA: как дообучить GPT на обычной видеокарте
Что такое LoRA?

LoRA (Low-Rank Adaptation — адаптация низкого ранга) — это способ дообучить большую нейросеть под свою задачу, не переписывая все её веса. Вместо того чтобы менять миллиарды параметров модели, LoRA добавляет маленькие "надстройки" к каждому слою. Это как натянуть новый чехол на диван вместо того, чтобы перешивать его целиком — результат похожий, но усилий в разы меньше.

Thinking Machines выпустили исследование, которое показывает: LoRA работает почти так же хорошо, как полное дообучение (full fine-tuning), но гораздо дешевле и предсказуемее.

Эксперимент:
Взяли модели Llama 3 и Qwen3, прогнали обучение двумя способами — полным fine-tuning и через LoRA. Сравнили кривые потерь (насколько хорошо модель учится с каждым шагом).

Результат:
При правильных настройках LoRA движется по той же траектории обучения, что и полный fine-tuning. Даже когда LoRA упирается в лимит параметров, модель не "ломается", а просто учится медленнее. Вычислений требуется на треть меньше, чем у полного дообучения.

Правила от Thinking Machines:

Ставить LoRA на все слои, а не только на attention (части модели, которые отвечают за внимание к контексту)

Использовать learning rate (скорость обучения) в ~10× больше, чем обычно
Не увеличивать batch size (размер порции данных за раз) — иначе падает стабильность

Практический смысл:
Модели на 7 миллиардов параметров можно дообучить за несколько часов на одной видеокарте с 14GB памяти. Это открывает возможности для экспериментов тем, у кого нет доступа к серверным GPU.

Thinking Machines считают, что предсказуемость и стабильность LoRA — это шаг к безопасному ИИ для критически важных систем, где нельзя допустить случайных сбоев.

🔗 Ссылки:
🏠 Исследование Thinking Machines
📖 Оригинальная статья про LoRA (2021)
🤗 PEFT библиотека HuggingFace

#LoRA #finetuning #машинноеобучение #написаноклодом
Forwarded from Неискусственный интеллект (Илья Склюев)
Вайб-воркинг — теперь и в офисе

Microsoft наконец-то добавила агентский режим в Word и Excel — по запросу можно генерировать целые таблицы и документы. Форматирование и прочие нюансы оформления прилагаются. Работают агентские фичи на базе Microsoft 365 Copilot, их также раскатят на обычного чат-бота.

В Microsoft подчёркивают, что их агент can “speak Excel” natively на базе последних моделей OpenAI с ризонингом. Поэтому можно попросить бота, например, проанализировать финансовую отчётность, сопоставить разные цифры и вывести результат в виде новой таблицы или документа.

Агентский режим уже доступен в веб-версии для пользователей Microsoft 365 Copilot и обладателей личной или семейной подписки на Microsoft 365.

@anti_agi