Gaperton's Tech Corner
373 subscribers
644 photos
47 videos
1 file
442 links
Технология, жизнь, и немного классической философии

https://gaperton.substack.com
Download Telegram
https://x.com/Alibaba_Qwen/status/2101659302792679789

Представляем Qwen-Image-2.1 — самую сбалансированную и экономичную модель генерации изображений в серии Qwen-Image! Теперь доступны открытые веса! 🎨


Надо попробовать.
🇨🇳 То, что кажется американским компаниям китайской стратегией борьбы с ИИ, является просто нормальной внутренней конкуренцией. А то, что американским компаниям от нее так больно, — это просто побочный эффект. На самом деле китайцы об американских компаниях вообще не думают как о конкурентах. И это понимание гораздо более унизительно для американских компаний, чем все остальное.

👲 Это, конечно, не мешает Си подливать масла в огонь, используя результаты своих компаний в политических целях. Но это далеко не секрет, что в Китае внутренняя конкуренция гораздо сильнее, чем с компаниями из США.
«Если бы я мог убрать из американского дискурса одну-единственную вещь, это было бы выражение „китайская стратегия в области ИИ“.

На каждой встрече — будь то с представителями лабораторий, инвесторами или СМИ — люди совершенно независимо друг от друга и без каких-либо наводящих вопросов с моей стороны говорили, что внутренняя конкуренция в Китае куда жестче, чем конкуренция с американскими лабораториями.

Когда я рассказывал, что в США китайский ИИ воспринимают как скоординированный блок, действующий по указанию государства, люди смеялись. Не из защитной реакции. Им это просто казалось смешным. Меня не раз называли тупым ABC (American-born Chinese — китайцем, родившимся в США) именно за это.

На самом деле эти лаборатории координируют свои действия между собой гораздо меньше, чем американские лаборатории. И это должно было быть очевидно любому, кто следил за предыдущими циклами развития китайской технологической отрасли.

Я обещал не проводить аналогий, но одну всё-таки позволю себе, потому что это их собственная аналогия. У предыдущего цикла было название: 百团大战 — „Война ста Groupon’ов“ (на самом деле их было около 5000). Сотни сервисов групповых покупок привлекали инвестиции, сбивали цены друг у друга до полного уничтожения конкурентов, и в итоге победителем вышла Meituan.

У нынешнего цикла уже тоже есть своё название: 百模大战 — „Война ста моделей“.

То, что существует в действительности, — это экосистема лабораторий, которые безжалостно сбивают цены друг другу, переманивают исследователей, конкурируют между собой за инвестиции и пытаются победить в локальной гонке вооружений. Сотни лабораторий и новых ИИ-компаний привлекали финансирование, умирали, а на их месте непрерывно появлялись новые.

То, что в США воспринимается как враждебные действия, по большей части является просто побочным продуктом этой внутренней борьбы.

Атаки с использованием дистилляции и обрушение цен на токены — это не стратегия, направленная против ведущих американских игроков. Это просто то, что сотня компаний делает друг с другом, когда ни одна из них не может победить и ни одна не может остановиться».

https://x.com/Chengdavid923/status/2100950217722118544?s=20
🔥4👏1
Да, но только это они reckless, а не их софт. Софт посадить в тюрьму невозможно, правильно?
💯2
Американские инновации. Мир теперь не будет прежним.

Самое интересное, эти долбоебы даже не осознают, насколько комично они выглядят.
👏4
По поводу агентской памяти не на искусственном тесте, а на моей личной истории сообщений в Тимс.

После того как я убрал OSS 20B, заменив её на полноценную модель Qwen3.8-27B, я, интереса ради, проверил, как обе модели извлекают из одного и того же текста факты. Выяснилось, что OSS 20B пиздит, как дышит, переворачивая факты до наоборот, и делает это практически в половине сообщений. gpt-oss-20b быстрая, но преврала в общем примерно все.

Из-за этого вся память состояла практически целиком из галлюцинаций.

Так что мы пока не будем делать поспешных выводов. Я просто запустил перегенерацию фактов заново на нормальной модели. И мы посмотрим еще раз, как это на самом деле работает.

Вот так, короче, тестам верить-то. Все надо глазами смотреть.

Надо сказать, что плохое качество gpt-oss-20Б никак не отменяет других проблем, о которых мы уже писали. Память не решена даже близко, и плохие модели со сложными архитектурными наворотами ей не помогают. Требуется что-то очень простое поверх нормального RAG, которое не пиздит. Я бы рекомендовал пробовать mem0 с качественной моделью.
✍5❤2
Пришло время испытать vLLM. Я понял что хочу нормальную Qwen-27B на своих 2xR9700. C быстрым prefill.

Для экспериментов заказал RTX 3090.

—
Так. Как говорил Обама, когда исламские террористы взрывали себя с криками "аллах акбар" — let's not jump to conclusions.

В смысле что мне конечно нравится префил, но. Пробуем комьюнити форки. Я ради этой модели готов на многое.

Radiance. Hand-written RDNA4 kernels, including its own two-GPU all-reduce. Yes, that's its main point. Its published speeds without speculative decoding are about 54 tok/s single and 304 at 8, but those were measured on the MXFP4 checkpoint and on PCIe 5.0.

—

Radiance without speculative decoding does 34.8 tok/s for a single request, twice official vLLM's 17.0. That's close to the fork's own FP8 figure of about 38 on PCIe 5.0 hardware. Eight concurrent requests total 216 tok/s, against 142 on official vLLM without MTP and 185 with MTP 3. Prefill, mixed-load and tool-call results are still running.

Here we fuckin go.

Radiance prefill is 2,869 tok/s on a ~14K-token prompt and 3,072 on ~52K, about 20–45% faster than official vLLM. The ~4K-token result (1,371 tok/s) looks like a one-off, probably first-use kernel compilation; I'll re-check it. Mixed-load and tool-call results are next.

Fuck yeah.

All 15 tool calls passed, and the ~4K-token prefill re-check confirms 4,138 tok/s (0.94s to first token), showing the earlier 1,371 result was just first-use kernel compilation overhead.

Сукаблять. Шат ап энд тейк май мани.

MTP пробуем
👀3
Наука говорит, тикток это зло.

https://x.com/BrandonLuuMD/status/2103476844292956186?s=20
💯7🤷‍♂1👏1
Gaperton's Tech Corner
Короче пускать Qwen3.8-27B на моих R9700 надо вот так. Форк vLLM Radiance. В жопу llama.cpp. Параметры этой штуки таковы, что и бэкап-подписки в жопу.
Сделал новый сервер для Qwen3.8-27B на базе vLLM, форк Radiance.

ТТХ на моем 2xR9700 совершенно адовые. Особенно prefill и многопоточная скорость — это близко к gpt-oss-20b на llama.cpp.

И это FP8 (почти нет потери точности).

В общем, софт у AMD наконец подтянулся до нормального уровня.

Вот саммари как он устроен — сделано Опусом 5.5. Я прочитал, и это на удивление неплохо. Оно в целом описывает всё, что я сделал за последние два дня.
🔥7
Я что-то не понимаю, почему их не расследуют в ФБР и почему их не закрывают. Альтмана пора сажать в клетку.
🤔1
Получается какая-то вот такая ситуация с моделями. Это мой личный парето фронтир.

Для работы с Hermes вместо Опуса будет Astra, и это достигается двумя подписками — OpenCode Go + Codex.

Ну и, конечно, домашний Qwen 27B, как фоллбек.

Если что-то из этого списка надо убрать, то это будет MiMo. Она в общем лишняя. Хотя на OpenRouter и OpenCode — неплохая замена ChatGPT Sol. Просто она медленная, и tool calling у неё плохой в сравнении с DeepSeek — для Hindsight, например, не подходит.

UPD: Нет, смотрим следующий пост.
✍3🔥1
Gaperton's Tech Corner
Получается какая-то вот такая ситуация с моделями. Это мой личный парето фронтир. Для работы с Hermes вместо Опуса будет Astra, и это достигается двумя подписками — OpenCode Go + Codex. Ну и, конечно, домашний Qwen 27B, как фоллбек. Если что-то из этого…
ℹ️ Сел и пересчитал это по-нормальному.

Взял OpenRouter и посмотрел, какие цены из Price коррелируют со ценой среднего размера сессии Hermes. Выяснилось, что цена входных токенов.

Затем прикинул, какое из сравнений лучше всего коррелирует с нагрузкой Гермеса. GDPVal.

А затем вытащил данные из OpenRouter и Artificial Intelligence и сделал парето-фронтир.

Получается, что для Гермес вы должны брать модель GLM 5.3 Flash. Или сидеть на бесплатном Qwen. Mimo того не стоит. Как и Grok.

Астра стоит того, но только из подписки Codex. Иначе дорого.

Итого — Qwen 27B ➡️ DeepSeek 4.1 Flash / GLM-5 Flash ➡️ Codex GPT-6 Astra

Первое бесплатно, второе дает вполне рабочее качество уровня примерно ChatGPT Sol по адекватной цене, а последнее — фронтир.

👆Это, в общем, отражает суть моей гибридной стратегии.

1. Данные должны быть локальными (Hermes).
2. Мы не должны зависеть от поставщика модели (Hermes + Codex + OpenRouter/Nous/OpenCode Go/...).
3. И должна быть возможность делать простые вещи локально (Qwen3.8 27B)
🔥5
Gaperton's Tech Corner
ℹ️ Сел и пересчитал это по-нормальному. Взял OpenRouter и посмотрел, какие цены из Price коррелируют со ценой среднего размера сессии Hermes. Выяснилось, что цена входных токенов. Затем прикинул, какое из сравнений лучше всего коррелирует с нагрузкой Гермеса.…
🤔 Для OpenCode Go математика немного другая. Вместо цены мы должны посчитать, сколько у нас входных токенов входит в месячный лимит. И строить фронтир наоборот — начиная с самого большого лимита.

В общем, расчет показывает, что в этой подписке пользоваться чем-либо, кроме GLM 5.3 Flash, не имеет смысла.

Если пересчитать это в цены OpenRouter, OpenCode Go для данной модели обходится примерно в два раза дешевле. Но дешевле это будет только в случае, если вы тратите хотя бы половину месячного лимита. В противном случае дешевле брать это Open Router платя за токены. В общем, вы пять долларов экономите в лучшем случае.

❗️ Если дома будет работать Qwen 3.8 Flash, не будет никакого смысла платить Open Code и Open Router.

Qwen3.8 Flash это 1612 Elo. И все. До свидания. В облаке нужен только фронтир и только для сложных задач.

А он будет работать. Экспериментальные ветки vLLM уже показывают примерно сто токенов в секунду на моем железе. Это означает, что к концу года, когда выйдет Qwen 4, всё будет работать. И мы еще посмотрим на Qwen 4 27B.

Я, честно говоря, не понимаю, как амодеи собираются отбивать эти конские инвестиции в дата-центры.
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
Злые языки скажут, что это AI.
😁5
Как раз сегодня думал о какой-то подобной клавиатуре. А вернее, маленьким микрофоном с кнопкой, чтобы говорить с моим ИИ. Что-то вроде радио.

То, как сейчас отвечают агенты, совершенно не подходит для голосового общения. Однако я не думаю, что нельзя ничего сделать. Мне кажется, нужна пара моделей. Одна из них будет поддерживать разговор, а вторая — думать.

Поддерживать разговор — это всё-таки очень непросто. Разговор — это обмен короткими фразами, и надо очень хорошо понимать, что и зачем ты говоришь.
Gaperton's Tech Corner
ℹ️ Сел и пересчитал это по-нормальному. Взял OpenRouter и посмотрел, какие цены из Price коррелируют со ценой среднего размера сессии Hermes. Выяснилось, что цена входных токенов. Затем прикинул, какое из сравнений лучше всего коррелирует с нагрузкой Гермеса.…
И еще раз об агентской памяти

1. Я испытал Mem0. Она оказалась еще хуже, чем Хинсайд.

Первая и, пожалуй, главная практическая проблема состоит в том, что её авторы в основном делают платный cloud-продукт, а open source-версии для них не настолько важен. В целом в open source-версии недостаточно функций, чтобы нормально ей пользоваться, не говоря уже о том, что нужно приложить чрезмерные усилия, просто чтобы её завести.

Вторая проблема – это память все-таки слишком глупа в сравнении с Hindsight. В Hindsight целых три уровня памяти. Первый уровень — это факты, которые система извлекает из текста. Второй уровень — это выводы из этих фактов, полученные автоматически. И третий уровень — это анализ выводов, который делается прицельно по вашим вопросам.

В Mem0 есть всего лишь первый уровень: факты, извлеченные из текста. Как выяснилось, этого явно недостаточно для того, чтобы память давала вам то, что вы от нее ждете. Ожидаете вы все-таки не просто буквального воспоминания беседы в прошлом, а скорее все-таки общих выводов из нее.

2. Как я уже писал, я испытал Hindsight еще раз, используя Qwen 3.8 27B вместо OSS 20B.

Когда я посмотрел на извлеченные системой факты и выводы, разница была огромной. Qwen не путал время и гораздо реже путал факты. С oss 20b проблема была в том, что система не могла даже нормально извлечь фактов, и в итоге память превращалась в источник галлюцинаций.

После этого я направил рефлект, а это третий уровень рассуждений о воспоминаниях, на облачную модель GLM 5.3 Flash и выяснил, что в итоге с этими моделями система уже дает вполне осмысленный анализ.

Поэтому Hindsight рано сбрасывать со счетов. Самым главным фактором в оценке системы памяти является ваше знакомство с теми данными, которые вы в них закачиваете. В моем случае я просто сделал экспорт рабочего чата за год, загрузил в память и начал задавать вопросы, проверяя адекватность выводов в памяти о том, что было. Так как я это уже сам знаю, мне было легко понять, насколько память адекватна.

Они пишут вам. Hindsight Doesn't Need a Smart Model.

Bullshit. Ей нужны хорошие агентские модели со способностью рассуждать. Qwen3.8-27B и GLM 5.3 Flash подходят.
Gaperton's Tech Corner
И еще раз об агентской памяти 1. Я испытал Mem0. Она оказалась еще хуже, чем Хинсайд. Первая и, пожалуй, главная практическая проблема состоит в том, что её авторы в основном делают платный cloud-продукт, а open source-версии для них не настолько важен.…
🤔 Кстати, я только что выяснил, что для запуска Hindsight можно использовать подписку Codex. Так что на самом деле вы можете ее попробовать не имея дорогого оборудования.

https://hindsight.vectorize.io/developer/models#openai-codex-setup-chatgpt-pluspro

В качестве модели берете GPT-6 Luna.

С OpenRouter тоже можно, само собой. Но надо брать что-то реально дешевое. Там можно хорошо попасть на бабки. DeepSeek V4 Flash в принципе, пойдет.

В качестве локальной бесплатной модели пойдет Qwen3.6 35B-A3B. Но я теперь отношусь скептически к глупым моделям. Толку от памяти, которая галлюцинирует и не втыкает о чем и кто говорит, нет никакого, только вред.
Please open Telegram to view this post
VIEW IN TELEGRAM
В основном я работаю с...
Anonymous Poll
46%
Windows
45%
macOS
53%
Linux
14%
iOS
18%
Android
2%
Другое
❤1
Пришел MacBook Pro M5 Max, 128 ГБ.

Ну чё, скоро будем запускать на нем ВЕЩИ.

Это у нас лучшее железо от Apple для запуска моделей еще на полтора года вперед. Не считая Maс Studio Ultra, конечно, которая уже стоит как автомобиль.

P.S.: Он получил имя Aurelius. В честь Марка Аврелия, "последнего хорошего императора Рима". А шел он почтой Америки два месяца.
👍10🔥2
И опять об OpenCode Go

После примерной недельной практики использования выяснилось следующее.

1. GLM-5.3 Flash — крайне годная модель, которая отлично подходит в качестве основной для Гермес.
2. В OpenCode Go за 10 USD вы её покупаете в таком же объёме, как у Zai за 60 долларов.

А больше, в общем, ничего там и не нужно. Она лучше чем GPT-6 Luna в Codex (на которую всегда можно переключиться). Так что я оставляю подписку. И Codex GPT-6 Sol/Astra для тяжелых случаев. Grok отменил.
👍5
Сегодняшний релиз OpenAI

Это очень хороший релиз. Теперь модель GPT-6.1 Sol конкурентоспособна по цене. Не хуже китайских. Возникает, конечно, вопрос: не субсидированная ли эта цена?