very vibe coding
117 subscribers
460 photos
126 videos
13 files
973 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Forwarded from Machinelearning
🎨 Qwen открыла веса Qwen-Image-2.1: новой модели для генерации и редактирования изображений

Модель построена на 7B-архитектуре и объединяет генерацию и редактирование в одном пайплайне.

Что умеет:
• работает сразу с несколькими референсами - до 10 изображений
• поддерживает точечное редактирование с сохранением лица, объекта или продукта
• нативно генерирует и редактирует RGBA с прозрачностью
• подходит для инфографики, панорам, virtual try-on и продуктовых изображений
• улучшена работа с текстом и типографикой
• ускорен inference, особенно для задач с несколькими входными изображениями

Qwen Image 2.1 обходит Nano Banana 2.0, но пока уступает GPT Image 2.5.

И это впечатляющий результат для модели всего на 7 млрд параметров.

https://huggingface.co/Qwen/Qwen-Image-2.1
Кстати, если работаете с чем-то кроме Claude и ChatGPT посмотрите внимательнее на OpenRouter - там DeepSeek Flash отдают со скидками и без пиковых часов (от 20 до 60% экономия), GLM-5.3 Flash, кстати, стоит еще дешевле DeepSeek, а Qwen 3.8 27 раздают сейчас вообще бесплатно (также, как и модели Gemma, например, но это еще не самые популярные бесплатные локальные модели - там есть и экземпляры побольше и поумнее).
Forwarded from Data Secrets
Яндекс открыл веса новой языковой модели AliceAI-Foundation-80B-A3B-Base

Модель обучена полностью с нуля, без использования весов сторонних опенсорс-моделей. По метрикам она обходит куда более крупные DeepSeek-V4-Flash-Base и Nemotron-3-Super почти по всем направлениям, а среди открытых претрейнов лидирует на IMO AnswerBench и LiveCodeBench. Свою же предыдущую закрытую версию на 235B она обгоняет по фактам, математике, коду и длинному контексту при почти втрое меньшем числе параметров и в семь раз меньшем количестве активных.

Про то, как команда добилась таких результатов, нам удалось послушать на выступлении Екатерины Рединой в субботу на Practical ML Conf. Екатерина работает руководителем группы исследования знаний в службе качества претрейна Alice AI, и вот несколько интересных деталей, которые она раскрыла про процесс претрейна:

1. У команды был собственный scaling law: формула, которая по размеру модели и объему данных предсказывает, какие гиперпараметры (например, batch size) дадут лучший результат. Эта штука максимально важна, потому что перебирать варианты руками слишком дорого.

Чтобы проверить закон, команда обучила модель с вдвое меньшим batch size. Должно было выйти хуже. Но вышло – лучше.

Проблему искали довольно долго, а в итоге она оказалась на поверхности: сам scaling law строился на том, что модели сравнивали по лоссу, но оказалось, что лосс почти не коррелирует с бенчмарками. Все починилось после того, как инженеры пересобрали датасет для эвала.

2. Для обучения использовали оптимизатор Muon – он экономит FLOPs по сравнению с привычным AdamW, но платит за это дорогой операцией: матрицу весов нужно ортогонализовать целиком, а она у них разбита шардами по разным GPU. Значит, перед каждым шагом надо гонять данные по сети: собрать матрицу, обработать, раздать обратно.

Чтобы GPU не простаивали в ожидании, разработчики написали свой конвейер: пока одна группа карт считает ортогонализацию для одной порции весов, другая уже тащит по сети следующую – вычисления и пересылка идут параллельно. Благодаря этой схеме шаг оптимизатора ускорился почти вдвое.

3. Данные были отдельной больной темой: синтетика то и дело подкидывала забавные побочные эффекты – модель могла выучить неправильную ассоциацию всего по одному обучающему примеру. Например, в QA про возраст был скрытый шаблон: живым к ответу приписывали год рождения, а умершим сразу годы жизни. Модель выучила не факт, а сам шаблон, и на вопрос «сколько лет Тарковскому?» вместо возраста выдавала «1932–1986». Фиксили аугментацией.

4. Вместе с моделью в опенсорс выложили два фактологических бенчмарка - WikiWebFacts и HardMultiQAс акцентом на русскоязычный контекст - и протоколы их оценки.

5. AliceAI-Foundation-80B-A3B-Base – это шаг к единой рассуждающей модели (ЕРМ), на которой будут строиться агентские возможности Алисы. За дальнейшими обновлениями и другими новостями от ML-команды Яндекса можно следить в канале @MLunderhood.

Это только часть того, что рассказала Екатерина. Яндекс выпустил большой технический отчет – там подробно расписан весь путь обучения, с абляциями и разборами подводных камней.

Прочитать его полностью можно здесь: https://habr.com/ru/companies/yandex/articles/1083300/
Forwarded from эйай ньюз
Вышел Grok 4.7

Заметный прирост при той же цене и скорости. Маск ранее заявлял что Grok 4.7 должен быть новый претрейн на 2.1 триллиона параметров, но похоже планы поменялись. А тем временм Grok 4.8 с 2.5T параметров должен был закончить тренировку на прошлой неделе и, скорее всего, сейчас уже на стадии RL.

@ai_newz
Наверное, подпишусь, попробую. Тем более что Meta Muse и Kimi K3 поставили меня на холл и к своим моделям не подпускают.

В целом задача на ближайшее время - перенести рабочую рутину по презентациям, справкам и пр. на DeepSeek или другую дешевую модель в опенсорсном исполнении. А токены дорогих моделей - оставить только для новых кодинговых задач
Forwarded from How2AI (дядя_д)
GPT-6 Sol и Luna – чтож за день сегодня 😊

Sol стоит $2 за миллион входных токенов и $10 за миллион выходных. Luna - всего $0,10 и $0,50. Это вдвое дешевле предыдущего поколения, а чтение уже закэшированного контекста получило скидку 90%.

При этом Sol почти дотянулась до Claude Fable 5 в кодинге: 68,8% против 69,9% на DeepSWE, но, по подсчётам OpenAI, выполнила задачи примерно на 80% дешевле. Luna набрала 66,6% и оказалась дешевле сравниваемых Claude на 93-96%.

Обе модели уже доступны в Codex, ChatGPT Work и через API.

@how2ai | Записаться на ИИ Разраб 5
Please open Telegram to view this post
VIEW IN TELEGRAM