https://x.com/Alibaba_Qwen/status/2101659302792679789
Надо попробовать.
Представляем Qwen-Image-2.1 — самую сбалансированную и экономичную модель генерации изображений в серии Qwen-Image! Теперь доступны открытые веса! 🎨
Надо попробовать.
🇨🇳 То, что кажется американским компаниям китайской стратегией борьбы с ИИ, является просто нормальной внутренней конкуренцией. А то, что американским компаниям от нее так больно, — это просто побочный эффект. На самом деле китайцы об американских компаниях вообще не думают как о конкурентах. И это понимание гораздо более унизительно для американских компаний, чем все остальное.
👲 Это, конечно, не мешает Си подливать масла в огонь, используя результаты своих компаний в политических целях. Но это далеко не секрет, что в Китае внутренняя конкуренция гораздо сильнее, чем с компаниями из США.
https://x.com/Chengdavid923/status/2100950217722118544?s=20
👲 Это, конечно, не мешает Си подливать масла в огонь, используя результаты своих компаний в политических целях. Но это далеко не секрет, что в Китае внутренняя конкуренция гораздо сильнее, чем с компаниями из США.
«Если бы я мог убрать из американского дискурса одну-единственную вещь, это было бы выражение „китайская стратегия в области ИИ“.
На каждой встрече — будь то с представителями лабораторий, инвесторами или СМИ — люди совершенно независимо друг от друга и без каких-либо наводящих вопросов с моей стороны говорили, что внутренняя конкуренция в Китае куда жестче, чем конкуренция с американскими лабораториями.
Когда я рассказывал, что в США китайский ИИ воспринимают как скоординированный блок, действующий по указанию государства, люди смеялись. Не из защитной реакции. Им это просто казалось смешным. Меня не раз называли тупым ABC (American-born Chinese — китайцем, родившимся в США) именно за это.
На самом деле эти лаборатории координируют свои действия между собой гораздо меньше, чем американские лаборатории. И это должно было быть очевидно любому, кто следил за предыдущими циклами развития китайской технологической отрасли.
Я обещал не проводить аналогий, но одну всё-таки позволю себе, потому что это их собственная аналогия. У предыдущего цикла было название: 百团大战 — „Война ста Groupon’ов“ (на самом деле их было около 5000). Сотни сервисов групповых покупок привлекали инвестиции, сбивали цены друг у друга до полного уничтожения конкурентов, и в итоге победителем вышла Meituan.
У нынешнего цикла уже тоже есть своё название: 百模大战 — „Война ста моделей“.
То, что существует в действительности, — это экосистема лабораторий, которые безжалостно сбивают цены друг другу, переманивают исследователей, конкурируют между собой за инвестиции и пытаются победить в локальной гонке вооружений. Сотни лабораторий и новых ИИ-компаний привлекали финансирование, умирали, а на их месте непрерывно появлялись новые.
То, что в США воспринимается как враждебные действия, по большей части является просто побочным продуктом этой внутренней борьбы.
Атаки с использованием дистилляции и обрушение цен на токены — это не стратегия, направленная против ведущих американских игроков. Это просто то, что сотня компаний делает друг с другом, когда ни одна из них не может победить и ни одна не может остановиться».
https://x.com/Chengdavid923/status/2100950217722118544?s=20
X (formerly Twitter)
David Cheng (@Chengdavid923) on X
Everyone has a take on China and AI right now. Very few have actually been to China.
I spent last week in Beijing and Shanghai meeting most of the major model labs, researchers, VCs, and founders…
I spent last week in Beijing and Shanghai meeting most of the major model labs, researchers, VCs, and founders…
🔥4👏1
По поводу агентской памяти не на искусственном тесте, а на моей личной истории сообщений в Тимс.
После того как я убрал OSS 20B, заменив её на полноценную модель Qwen3.8-27B, я, интереса ради, проверил, как обе модели извлекают из одного и того же текста факты. Выяснилось, что OSS 20B пиздит, как дышит, переворачивая факты до наоборот, и делает это практически в половине сообщений. gpt-oss-20b быстрая, но преврала в общем примерно все.
Из-за этого вся память состояла практически целиком из галлюцинаций.
Так что мы пока не будем делать поспешных выводов. Я просто запустил перегенерацию фактов заново на нормальной модели. И мы посмотрим еще раз, как это на самом деле работает.
Вот так, короче, тестам верить-то. Все надо глазами смотреть.
Надо сказать, что плохое качество gpt-oss-20Б никак не отменяет других проблем, о которых мы уже писали. Память не решена даже близко, и плохие модели со сложными архитектурными наворотами ей не помогают. Требуется что-то очень простое поверх нормального RAG, которое не пиздит. Я бы рекомендовал пробовать mem0 с качественной моделью.
После того как я убрал OSS 20B, заменив её на полноценную модель Qwen3.8-27B, я, интереса ради, проверил, как обе модели извлекают из одного и того же текста факты. Выяснилось, что OSS 20B пиздит, как дышит, переворачивая факты до наоборот, и делает это практически в половине сообщений. gpt-oss-20b быстрая, но преврала в общем примерно все.
Из-за этого вся память состояла практически целиком из галлюцинаций.
Так что мы пока не будем делать поспешных выводов. Я просто запустил перегенерацию фактов заново на нормальной модели. И мы посмотрим еще раз, как это на самом деле работает.
Вот так, короче, тестам верить-то. Все надо глазами смотреть.
Надо сказать, что плохое качество gpt-oss-20Б никак не отменяет других проблем, о которых мы уже писали. Память не решена даже близко, и плохие модели со сложными архитектурными наворотами ей не помогают. Требуется что-то очень простое поверх нормального RAG, которое не пиздит. Я бы рекомендовал пробовать mem0 с качественной моделью.
✍5❤2
Пришло время испытать vLLM. Я понял что хочу нормальную Qwen-27B на своих 2xR9700. C быстрым prefill.
Для экспериментов заказал RTX 3090.
—
Так. Как говорил Обама, когда исламские террористы взрывали себя с криками "аллах акбар" — let's not jump to conclusions.
В смысле что мне конечно нравится префил, но. Пробуем комьюнити форки. Я ради этой модели готов на многое.
—
Here we fuckin go.
Fuck yeah.
Сукаблять. Шат ап энд тейк май мани.
MTP пробуем
Для экспериментов заказал RTX 3090.
—
Так. Как говорил Обама, когда исламские террористы взрывали себя с криками "аллах акбар" — let's not jump to conclusions.
В смысле что мне конечно нравится префил, но. Пробуем комьюнити форки. Я ради этой модели готов на многое.
Radiance. Hand-written RDNA4 kernels, including its own two-GPU all-reduce. Yes, that's its main point. Its published speeds without speculative decoding are about 54 tok/s single and 304 at 8, but those were measured on the MXFP4 checkpoint and on PCIe 5.0.
—
Radiance without speculative decoding does 34.8 tok/s for a single request, twice official vLLM's 17.0. That's close to the fork's own FP8 figure of about 38 on PCIe 5.0 hardware. Eight concurrent requests total 216 tok/s, against 142 on official vLLM without MTP and 185 with MTP 3. Prefill, mixed-load and tool-call results are still running.
Here we fuckin go.
Radiance prefill is 2,869 tok/s on a ~14K-token prompt and 3,072 on ~52K, about 20–45% faster than official vLLM. The ~4K-token result (1,371 tok/s) looks like a one-off, probably first-use kernel compilation; I'll re-check it. Mixed-load and tool-call results are next.
Fuck yeah.
All 15 tool calls passed, and the ~4K-token prefill re-check confirms 4,138 tok/s (0.94s to first token), showing the earlier 1,371 result was just first-use kernel compilation overhead.
Сукаблять. Шат ап энд тейк май мани.
MTP пробуем
👀3
Gaperton's Tech Corner
Пришло время испытать vLLM. Я понял что хочу нормальную Qwen-27B на своих 2xR9700. C быстрым prefill. Для экспериментов заказал RTX 3090. — Так. Как говорил Обама, когда исламские террористы взрывали себя с криками "аллах акбар" — let's not jump to conclusions.…
Короче пускать Qwen3.8-27B на моих R9700 надо вот так. Форк vLLM Radiance.
В жопу llama.cpp. Параметры этой штуки таковы, что и бэкап-подписки в жопу.
В жопу llama.cpp. Параметры этой штуки таковы, что и бэкап-подписки в жопу.
🔥3👨💻1
Gaperton's Tech Corner
Короче пускать Qwen3.8-27B на моих R9700 надо вот так. Форк vLLM Radiance. В жопу llama.cpp. Параметры этой штуки таковы, что и бэкап-подписки в жопу.
Сделал новый сервер для Qwen3.8-27B на базе vLLM, форк Radiance.
ТТХ на моем 2xR9700 совершенно адовые. Особенно prefill и многопоточная скорость — это близко к gpt-oss-20b на llama.cpp.
И это FP8 (почти нет потери точности).
В общем, софт у AMD наконец подтянулся до нормального уровня.
Вот саммари как он устроен — сделано Опусом 5.5. Я прочитал, и это на удивление неплохо. Оно в целом описывает всё, что я сделал за последние два дня.
ТТХ на моем 2xR9700 совершенно адовые. Особенно prefill и многопоточная скорость — это близко к gpt-oss-20b на llama.cpp.
И это FP8 (почти нет потери точности).
В общем, софт у AMD наконец подтянулся до нормального уровня.
Вот саммари как он устроен — сделано Опусом 5.5. Я прочитал, и это на удивление неплохо. Оно в целом описывает всё, что я сделал за последние два дня.
🔥7
Получается какая-то вот такая ситуация с моделями. Это мой личный парето фронтир.
Для работы с Hermes вместо Опуса будет Astra, и это достигается двумя подписками — OpenCode Go + Codex.
Ну и, конечно, домашний Qwen 27B, как фоллбек.
Если что-то из этого списка надо убрать, то это будет MiMo. Она в общем лишняя. Хотя на OpenRouter и OpenCode — неплохая замена ChatGPT Sol. Просто она медленная, и tool calling у неё плохой в сравнении с DeepSeek — для Hindsight, например, не подходит.
UPD: Нет, смотрим следующий пост.
Для работы с Hermes вместо Опуса будет Astra, и это достигается двумя подписками — OpenCode Go + Codex.
Ну и, конечно, домашний Qwen 27B, как фоллбек.
Если что-то из этого списка надо убрать, то это будет MiMo. Она в общем лишняя. Хотя на OpenRouter и OpenCode — неплохая замена ChatGPT Sol. Просто она медленная, и tool calling у неё плохой в сравнении с DeepSeek — для Hindsight, например, не подходит.
UPD: Нет, смотрим следующий пост.
✍3🔥1
Gaperton's Tech Corner
Получается какая-то вот такая ситуация с моделями. Это мой личный парето фронтир. Для работы с Hermes вместо Опуса будет Astra, и это достигается двумя подписками — OpenCode Go + Codex. Ну и, конечно, домашний Qwen 27B, как фоллбек. Если что-то из этого…
ℹ️ Сел и пересчитал это по-нормальному.
Взял OpenRouter и посмотрел, какие цены из Price коррелируют со ценой среднего размера сессии Hermes. Выяснилось, что цена входных токенов.
Затем прикинул, какое из сравнений лучше всего коррелирует с нагрузкой Гермеса. GDPVal.
А затем вытащил данные из OpenRouter и Artificial Intelligence и сделал парето-фронтир.
Получается, что для Гермес вы должны брать модель GLM 5.3 Flash. Или сидеть на бесплатном Qwen. Mimo того не стоит. Как и Grok.
Астра стоит того, но только из подписки Codex. Иначе дорого.
Итого — Qwen 27B ➡️ DeepSeek 4.1 Flash / GLM-5 Flash ➡️ Codex GPT-6 Astra
Первое бесплатно, второе дает вполне рабочее качество уровня примерно ChatGPT Sol по адекватной цене, а последнее — фронтир.
👆Это, в общем, отражает суть моей гибридной стратегии.
1. Данные должны быть локальными (Hermes).
2. Мы не должны зависеть от поставщика модели (Hermes + Codex + OpenRouter/Nous/OpenCode Go/...).
3. И должна быть возможность делать простые вещи локально (Qwen3.8 27B)
Взял OpenRouter и посмотрел, какие цены из Price коррелируют со ценой среднего размера сессии Hermes. Выяснилось, что цена входных токенов.
Затем прикинул, какое из сравнений лучше всего коррелирует с нагрузкой Гермеса. GDPVal.
А затем вытащил данные из OpenRouter и Artificial Intelligence и сделал парето-фронтир.
Получается, что для Гермес вы должны брать модель GLM 5.3 Flash. Или сидеть на бесплатном Qwen. Mimo того не стоит. Как и Grok.
Астра стоит того, но только из подписки Codex. Иначе дорого.
Итого — Qwen 27B ➡️ DeepSeek 4.1 Flash / GLM-5 Flash ➡️ Codex GPT-6 Astra
Первое бесплатно, второе дает вполне рабочее качество уровня примерно ChatGPT Sol по адекватной цене, а последнее — фронтир.
👆Это, в общем, отражает суть моей гибридной стратегии.
1. Данные должны быть локальными (Hermes).
2. Мы не должны зависеть от поставщика модели (Hermes + Codex + OpenRouter/Nous/OpenCode Go/...).
3. И должна быть возможность делать простые вещи локально (Qwen3.8 27B)
🔥5
Gaperton's Tech Corner
ℹ️ Сел и пересчитал это по-нормальному. Взял OpenRouter и посмотрел, какие цены из Price коррелируют со ценой среднего размера сессии Hermes. Выяснилось, что цена входных токенов. Затем прикинул, какое из сравнений лучше всего коррелирует с нагрузкой Гермеса.…
В общем, расчет показывает, что в этой подписке пользоваться чем-либо, кроме GLM 5.3 Flash, не имеет смысла.
Если пересчитать это в цены OpenRouter, OpenCode Go для данной модели обходится примерно в два раза дешевле. Но дешевле это будет только в случае, если вы тратите хотя бы половину месячного лимита. В противном случае дешевле брать это Open Router платя за токены. В общем, вы пять долларов экономите в лучшем случае.
❗️ Если дома будет работать Qwen 3.8 Flash, не будет никакого смысла платить Open Code и Open Router.
Qwen3.8 Flash это 1612 Elo. И все. До свидания. В облаке нужен только фронтир и только для сложных задач.
А он будет работать. Экспериментальные ветки vLLM уже показывают примерно сто токенов в секунду на моем железе. Это означает, что к концу года, когда выйдет Qwen 4, всё будет работать. И мы еще посмотрим на Qwen 4 27B.
Я, честно говоря, не понимаю, как амодеи собираются отбивать эти конские инвестиции в дата-центры.
Please open Telegram to view this post
VIEW IN TELEGRAM
Как раз сегодня думал о какой-то подобной клавиатуре. А вернее, маленьким микрофоном с кнопкой, чтобы говорить с моим ИИ. Что-то вроде радио.
То, как сейчас отвечают агенты, совершенно не подходит для голосового общения. Однако я не думаю, что нельзя ничего сделать. Мне кажется, нужна пара моделей. Одна из них будет поддерживать разговор, а вторая — думать.
Поддерживать разговор — это всё-таки очень непросто. Разговор — это обмен короткими фразами, и надо очень хорошо понимать, что и зачем ты говоришь.
То, как сейчас отвечают агенты, совершенно не подходит для голосового общения. Однако я не думаю, что нельзя ничего сделать. Мне кажется, нужна пара моделей. Одна из них будет поддерживать разговор, а вторая — думать.
Поддерживать разговор — это всё-таки очень непросто. Разговор — это обмен короткими фразами, и надо очень хорошо понимать, что и зачем ты говоришь.
Gaperton's Tech Corner
ℹ️ Сел и пересчитал это по-нормальному. Взял OpenRouter и посмотрел, какие цены из Price коррелируют со ценой среднего размера сессии Hermes. Выяснилось, что цена входных токенов. Затем прикинул, какое из сравнений лучше всего коррелирует с нагрузкой Гермеса.…
И еще раз об агентской памяти
1. Я испытал Mem0. Она оказалась еще хуже, чем Хинсайд.
Первая и, пожалуй, главная практическая проблема состоит в том, что её авторы в основном делают платный cloud-продукт, а open source-версии для них не настолько важен. В целом в open source-версии недостаточно функций, чтобы нормально ей пользоваться, не говоря уже о том, что нужно приложить чрезмерные усилия, просто чтобы её завести.
Вторая проблема – это память все-таки слишком глупа в сравнении с Hindsight. В Hindsight целых три уровня памяти. Первый уровень — это факты, которые система извлекает из текста. Второй уровень — это выводы из этих фактов, полученные автоматически. И третий уровень — это анализ выводов, который делается прицельно по вашим вопросам.
В Mem0 есть всего лишь первый уровень: факты, извлеченные из текста. Как выяснилось, этого явно недостаточно для того, чтобы память давала вам то, что вы от нее ждете. Ожидаете вы все-таки не просто буквального воспоминания беседы в прошлом, а скорее все-таки общих выводов из нее.
2. Как я уже писал, я испытал Hindsight еще раз, используя Qwen 3.8 27B вместо OSS 20B.
Когда я посмотрел на извлеченные системой факты и выводы, разница была огромной. Qwen не путал время и гораздо реже путал факты. С oss 20b проблема была в том, что система не могла даже нормально извлечь фактов, и в итоге память превращалась в источник галлюцинаций.
После этого я направил рефлект, а это третий уровень рассуждений о воспоминаниях, на облачную модель GLM 5.3 Flash и выяснил, что в итоге с этими моделями система уже дает вполне осмысленный анализ.
Поэтому Hindsight рано сбрасывать со счетов. Самым главным фактором в оценке системы памяти является ваше знакомство с теми данными, которые вы в них закачиваете. В моем случае я просто сделал экспорт рабочего чата за год, загрузил в память и начал задавать вопросы, проверяя адекватность выводов в памяти о том, что было. Так как я это уже сам знаю, мне было легко понять, насколько память адекватна.
Они пишут вам. Hindsight Doesn't Need a Smart Model.
Bullshit. Ей нужны хорошие агентские модели со способностью рассуждать. Qwen3.8-27B и GLM 5.3 Flash подходят.
1. Я испытал Mem0. Она оказалась еще хуже, чем Хинсайд.
Первая и, пожалуй, главная практическая проблема состоит в том, что её авторы в основном делают платный cloud-продукт, а open source-версии для них не настолько важен. В целом в open source-версии недостаточно функций, чтобы нормально ей пользоваться, не говоря уже о том, что нужно приложить чрезмерные усилия, просто чтобы её завести.
Вторая проблема – это память все-таки слишком глупа в сравнении с Hindsight. В Hindsight целых три уровня памяти. Первый уровень — это факты, которые система извлекает из текста. Второй уровень — это выводы из этих фактов, полученные автоматически. И третий уровень — это анализ выводов, который делается прицельно по вашим вопросам.
В Mem0 есть всего лишь первый уровень: факты, извлеченные из текста. Как выяснилось, этого явно недостаточно для того, чтобы память давала вам то, что вы от нее ждете. Ожидаете вы все-таки не просто буквального воспоминания беседы в прошлом, а скорее все-таки общих выводов из нее.
2. Как я уже писал, я испытал Hindsight еще раз, используя Qwen 3.8 27B вместо OSS 20B.
Когда я посмотрел на извлеченные системой факты и выводы, разница была огромной. Qwen не путал время и гораздо реже путал факты. С oss 20b проблема была в том, что система не могла даже нормально извлечь фактов, и в итоге память превращалась в источник галлюцинаций.
После этого я направил рефлект, а это третий уровень рассуждений о воспоминаниях, на облачную модель GLM 5.3 Flash и выяснил, что в итоге с этими моделями система уже дает вполне осмысленный анализ.
Поэтому Hindsight рано сбрасывать со счетов. Самым главным фактором в оценке системы памяти является ваше знакомство с теми данными, которые вы в них закачиваете. В моем случае я просто сделал экспорт рабочего чата за год, загрузил в память и начал задавать вопросы, проверяя адекватность выводов в памяти о том, что было. Так как я это уже сам знаю, мне было легко понять, насколько память адекватна.
Они пишут вам. Hindsight Doesn't Need a Smart Model.
Bullshit. Ей нужны хорошие агентские модели со способностью рассуждать. Qwen3.8-27B и GLM 5.3 Flash подходят.
hindsight.vectorize.io
Retain: How Hindsight Stores Memories | Hindsight
When you call retain(), Hindsight transforms conversations and documents into structured, searchable memories that preserve meaning and context.
Gaperton's Tech Corner
И еще раз об агентской памяти 1. Я испытал Mem0. Она оказалась еще хуже, чем Хинсайд. Первая и, пожалуй, главная практическая проблема состоит в том, что её авторы в основном делают платный cloud-продукт, а open source-версии для них не настолько важен.…
https://hindsight.vectorize.io/developer/models#openai-codex-setup-chatgpt-pluspro
В качестве модели берете GPT-6 Luna.
С OpenRouter тоже можно, само собой. Но надо брать что-то реально дешевое. Там можно хорошо попасть на бабки. DeepSeek V4 Flash в принципе, пойдет.
В качестве локальной бесплатной модели пойдет Qwen3.6 35B-A3B. Но я теперь отношусь скептически к глупым моделям. Толку от памяти, которая галлюцинирует и не втыкает о чем и кто говорит, нет никакого, только вред.
Please open Telegram to view this post
VIEW IN TELEGRAM
hindsight.vectorize.io
Models | Hindsight
Hindsight uses several machine learning models for different tasks.
В основном я работаю с...
Anonymous Poll
46%
Windows
45%
macOS
53%
Linux
14%
iOS
18%
Android
2%
Другое
❤1
Пришел MacBook Pro M5 Max, 128 ГБ.
Ну чё, скоро будем запускать на нем ВЕЩИ.
Это у нас лучшее железо от Apple для запуска моделей еще на полтора года вперед. Не считая Maс Studio Ultra, конечно, которая уже стоит как автомобиль.
P.S.: Он получил имя Aurelius. В честь Марка Аврелия, "последнего хорошего императора Рима". А шел он почтой Америки два месяца.
Ну чё, скоро будем запускать на нем ВЕЩИ.
Это у нас лучшее железо от Apple для запуска моделей еще на полтора года вперед. Не считая Maс Studio Ultra, конечно, которая уже стоит как автомобиль.
P.S.: Он получил имя Aurelius. В честь Марка Аврелия, "последнего хорошего императора Рима". А шел он почтой Америки два месяца.
👍10🔥2
И опять об OpenCode Go
После примерной недельной практики использования выяснилось следующее.
1. GLM-5.3 Flash — крайне годная модель, которая отлично подходит в качестве основной для Гермес.
2. В OpenCode Go за 10 USD вы её покупаете в таком же объёме, как у Zai за 60 долларов.
А больше, в общем, ничего там и не нужно. Она лучше чем GPT-6 Luna в Codex (на которую всегда можно переключиться). Так что я оставляю подписку. И Codex GPT-6 Sol/Astra для тяжелых случаев. Grok отменил.
После примерной недельной практики использования выяснилось следующее.
1. GLM-5.3 Flash — крайне годная модель, которая отлично подходит в качестве основной для Гермес.
2. В OpenCode Go за 10 USD вы её покупаете в таком же объёме, как у Zai за 60 долларов.
А больше, в общем, ничего там и не нужно. Она лучше чем GPT-6 Luna в Codex (на которую всегда можно переключиться). Так что я оставляю подписку. И Codex GPT-6 Sol/Astra для тяжелых случаев. Grok отменил.
👍5