Gaperton's Tech Corner
373 subscribers
644 photos
47 videos
1 file
442 links
Технология, жизнь, и немного классической философии

https://gaperton.substack.com
Download Telegram
Gaperton's Tech Corner
Тем временем Xiaomi выпустила новую модель. Карпатым Амадеям пиздец.
Вот их анонс.

Интересно не только полноценная модель, но и флэш. Потому что в Opencode Go она получается почти бесплатной. А на Pro лимит выше чем на Luna (10K/mo).

Не знаю, может быть, Open Code Go и не такая плохая идея. Модель уровня Sol, с лимитом в полтора раза выше чем у Luna, по цене 10 USD в месяц... Это целиком меняет экономику. В этом случае подписка на кодекс нужна только ради Astra. Да и то.

В общем, я перевел Hermes на MiMo-V2.6-Pro как основную модель.

MiMo-V2.6-Flash 30,100 75,200 150,400
GLM-5.3-Flash 6,320 15,790 31,580
MiMo-V2.6-Pro 3,250 8,150 16,300
GPT 5.6 Luna 2,050 5,100 10,250

Что там Амадей, говорите, делать собирался? Войти в картельный сговор, чтобы сдержать прогресс в области ИИ? :) Ну-ну.
Gaperton's Tech Corner
Вот их анонс. Интересно не только полноценная модель, но и флэш. Потому что в Opencode Go она получается почти бесплатной. А на Pro лимит выше чем на Luna (10K/mo). Не знаю, может быть, Open Code Go и не такая плохая идея. Модель уровня Sol, с лимитом в…
Вот еще раз внимательно посмотрите, что именно сделала Xiaomi с новой MiMo. Если это не промо цена, а настоящая цена, то это прям напалм.

И учтите, что Qwen Flash next на самом деле может быть бесплатным. А 27B просто обязан.

Если вы посмотрите на это, то вы увидите, что китайцы уже сожрали все, кроме топового фронтира.

И я гоняю мимо 2.6 pro уже четвертый час в Hermes, она очень хороша. Прям очень. Это то, ради чего стоит иметь подписку на OpenCode Go как основной движок Hermes, а не как backup.
🔥1
Forwarded from IF News
🇷🇺 Яндекс выложил в опенсорс суверенную ИИ-модель, обученную с нуля на данных компании

Alice AI Foundation LLM обучена без использования сторонних разработок и заточена под русский язык. В ней 80 млрд параметров, из которых одновременно активны только 3 млрд. По данным Яндекса, ИИ-модель обходит более крупные модели — DeepSeek на запросах на знание фактов, а решение от NVIDIA в написании кода. 

Alice AI Foundation LLM используют для тестирования архитектуры будущей единой рассуждающей модели Яндекса. Вместе с ней компания открыла два бенчмарка для оценки знаний, актуальных для русскоязычных пользователей. Модель доступна по лицензии для коммерческого и исследовательского использования.

При этом Яндекс параллелит два подхода к развитию ИИ: продолжает самостоятельно обучать модели с нуля, на собственной инфраструктуре и данных, и использует лучшие открытые решения с рынка там, где это помогает быстрее развивать продукты. Такой подход позволяет одновременно наращивать собственную экспертизу и проверять технологии на реальных продуктах.

#Технологии 
Telegram | Max | Дзен | VK
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔3
Тем временем Квен объявил о скором выходе моделей Квен четыре, среди которых будет флэш и 27B.

Я думаю, Компартия Китая поставила промышленности задачу убить американские AI лабы к концу этого года.

Китаю, собственно, все равно — пока Уолл-стрит лелеет мечту уволить этих умников, заменив их языковыми моделями, Китай работает над моделями для роботики, которые он вовсе не спешит делать открытыми.

Да, администрация Трампа может закрыть доступ к онлайн-сервисам в Китае, но и на это Китаю плевать. Им не нужен американский рынок. Им нужен мировой рынок. И они готовы отдать модель бесплатно американским хостерам.

Кстати, этот пост я надиктовал при помощи распознавания речи Квен с минимальными правками. OpenWhispr, и модель Qwen3-ASR-1.7B Q8. 4GB VRAM, работает на полном хламе, включая RTX 2070. Завести ее, правда, не так просто. Надо допиливать по месту.
🔥4❤1
Cледующая штука, с которой я еще не разбирался, — это Visual Reasoning Model.

У того же Квен есть набор моделей, предназначенных для visual reasoning. Они берут видео или фото и в сочетании с текстом, делают выводы, или анализируют это в паре.

Нужны эти модели, конечно же, в первую очередь для робототехники. Робот смотрит на мир камерой, и в эту же модель поступает инструкция, например, "где находится красный кубик" или "сгенеруй последовательность шагов, чтобы прийти на кухню".

Квен предлагает двухступенчатую архитектуру управления роботом. Модель Visual Reasoning используется для выполнения плана, в то время как большая языковая модель используется для генерации плана и рассуждений.

Я тем временем думаю, как можно это интегрировать в десктоп-агента Гермес, например. Может ли агент Гермес смотреть на вас камерой, и извлекать из этого что-то полезное? Может ли он подобным образом анализировать картинки в сумме с текстом? Со всем этим надо будет разобраться.
🔥4
OpenAI выпустила GPT-6 и понизила цены.

Антропик выпустил Opus 5.5, который тоже вполне имеет смысл.

Из китайских моделей, которые доступны на OpenCode Go, я бы выделил новую MiMo 2.6 Pro, GLM 5.3 Flash и DeepSeek 4.1 Flash.

DeepSeek самая быстрая, GPT-6 Luna лучше всего подходит для Гермес.

А квен 27B вообще бесплатен. И мы ждем Qwen4 27B.
Gaperton's Tech Corner
OpenAI выпустила GPT-6 и понизила цены. Антропик выпустил Opus 5.5, который тоже вполне имеет смысл. Из китайских моделей, которые доступны на OpenCode Go, я бы выделил новую MiMo 2.6 Pro, GLM 5.3 Flash и DeepSeek 4.1 Flash. DeepSeek самая быстрая, GPT…
Но есть нюанс: пользователи замечают деградацию качества на реальных задачах.

С другой стороны, модели GPT все равно опережают открытые модели в этом тесте.
https://x.com/Alibaba_Qwen/status/2101659302792679789

Представляем Qwen-Image-2.1 — самую сбалансированную и экономичную модель генерации изображений в серии Qwen-Image! Теперь доступны открытые веса! 🎨


Надо попробовать.
🇨🇳 То, что кажется американским компаниям китайской стратегией борьбы с ИИ, является просто нормальной внутренней конкуренцией. А то, что американским компаниям от нее так больно, — это просто побочный эффект. На самом деле китайцы об американских компаниях вообще не думают как о конкурентах. И это понимание гораздо более унизительно для американских компаний, чем все остальное.

👲 Это, конечно, не мешает Си подливать масла в огонь, используя результаты своих компаний в политических целях. Но это далеко не секрет, что в Китае внутренняя конкуренция гораздо сильнее, чем с компаниями из США.
«Если бы я мог убрать из американского дискурса одну-единственную вещь, это было бы выражение „китайская стратегия в области ИИ“.

На каждой встрече — будь то с представителями лабораторий, инвесторами или СМИ — люди совершенно независимо друг от друга и без каких-либо наводящих вопросов с моей стороны говорили, что внутренняя конкуренция в Китае куда жестче, чем конкуренция с американскими лабораториями.

Когда я рассказывал, что в США китайский ИИ воспринимают как скоординированный блок, действующий по указанию государства, люди смеялись. Не из защитной реакции. Им это просто казалось смешным. Меня не раз называли тупым ABC (American-born Chinese — китайцем, родившимся в США) именно за это.

На самом деле эти лаборатории координируют свои действия между собой гораздо меньше, чем американские лаборатории. И это должно было быть очевидно любому, кто следил за предыдущими циклами развития китайской технологической отрасли.

Я обещал не проводить аналогий, но одну всё-таки позволю себе, потому что это их собственная аналогия. У предыдущего цикла было название: 百团大战 — „Война ста Groupon’ов“ (на самом деле их было около 5000). Сотни сервисов групповых покупок привлекали инвестиции, сбивали цены друг у друга до полного уничтожения конкурентов, и в итоге победителем вышла Meituan.

У нынешнего цикла уже тоже есть своё название: 百模大战 — „Война ста моделей“.

То, что существует в действительности, — это экосистема лабораторий, которые безжалостно сбивают цены друг другу, переманивают исследователей, конкурируют между собой за инвестиции и пытаются победить в локальной гонке вооружений. Сотни лабораторий и новых ИИ-компаний привлекали финансирование, умирали, а на их месте непрерывно появлялись новые.

То, что в США воспринимается как враждебные действия, по большей части является просто побочным продуктом этой внутренней борьбы.

Атаки с использованием дистилляции и обрушение цен на токены — это не стратегия, направленная против ведущих американских игроков. Это просто то, что сотня компаний делает друг с другом, когда ни одна из них не может победить и ни одна не может остановиться».

https://x.com/Chengdavid923/status/2100950217722118544?s=20
🔥4👏1
Да, но только это они reckless, а не их софт. Софт посадить в тюрьму невозможно, правильно?
💯2
Американские инновации. Мир теперь не будет прежним.

Самое интересное, эти долбоебы даже не осознают, насколько комично они выглядят.
👏4
По поводу агентской памяти не на искусственном тесте, а на моей личной истории сообщений в Тимс.

После того как я убрал OSS 20B, заменив её на полноценную модель Qwen3.8-27B, я, интереса ради, проверил, как обе модели извлекают из одного и того же текста факты. Выяснилось, что OSS 20B пиздит, как дышит, переворачивая факты до наоборот, и делает это практически в половине сообщений. gpt-oss-20b быстрая, но преврала в общем примерно все.

Из-за этого вся память состояла практически целиком из галлюцинаций.

Так что мы пока не будем делать поспешных выводов. Я просто запустил перегенерацию фактов заново на нормальной модели. И мы посмотрим еще раз, как это на самом деле работает.

Вот так, короче, тестам верить-то. Все надо глазами смотреть.

Надо сказать, что плохое качество gpt-oss-20Б никак не отменяет других проблем, о которых мы уже писали. Память не решена даже близко, и плохие модели со сложными архитектурными наворотами ей не помогают. Требуется что-то очень простое поверх нормального RAG, которое не пиздит. Я бы рекомендовал пробовать mem0 с качественной моделью.
✍5❤2
Пришло время испытать vLLM. Я понял что хочу нормальную Qwen-27B на своих 2xR9700. C быстрым prefill.

Для экспериментов заказал RTX 3090.

—
Так. Как говорил Обама, когда исламские террористы взрывали себя с криками "аллах акбар" — let's not jump to conclusions.

В смысле что мне конечно нравится префил, но. Пробуем комьюнити форки. Я ради этой модели готов на многое.

Radiance. Hand-written RDNA4 kernels, including its own two-GPU all-reduce. Yes, that's its main point. Its published speeds without speculative decoding are about 54 tok/s single and 304 at 8, but those were measured on the MXFP4 checkpoint and on PCIe 5.0.

—

Radiance without speculative decoding does 34.8 tok/s for a single request, twice official vLLM's 17.0. That's close to the fork's own FP8 figure of about 38 on PCIe 5.0 hardware. Eight concurrent requests total 216 tok/s, against 142 on official vLLM without MTP and 185 with MTP 3. Prefill, mixed-load and tool-call results are still running.

Here we fuckin go.

Radiance prefill is 2,869 tok/s on a ~14K-token prompt and 3,072 on ~52K, about 20–45% faster than official vLLM. The ~4K-token result (1,371 tok/s) looks like a one-off, probably first-use kernel compilation; I'll re-check it. Mixed-load and tool-call results are next.

Fuck yeah.

All 15 tool calls passed, and the ~4K-token prefill re-check confirms 4,138 tok/s (0.94s to first token), showing the earlier 1,371 result was just first-use kernel compilation overhead.

Сукаблять. Шат ап энд тейк май мани.

MTP пробуем
👀3
Наука говорит, тикток это зло.

https://x.com/BrandonLuuMD/status/2103476844292956186?s=20
💯7🤷‍♂1👏1
Gaperton's Tech Corner
Короче пускать Qwen3.8-27B на моих R9700 надо вот так. Форк vLLM Radiance. В жопу llama.cpp. Параметры этой штуки таковы, что и бэкап-подписки в жопу.
Сделал новый сервер для Qwen3.8-27B на базе vLLM, форк Radiance.

ТТХ на моем 2xR9700 совершенно адовые. Особенно prefill и многопоточная скорость — это близко к gpt-oss-20b на llama.cpp.

И это FP8 (почти нет потери точности).

В общем, софт у AMD наконец подтянулся до нормального уровня.

Вот саммари как он устроен — сделано Опусом 5.5. Я прочитал, и это на удивление неплохо. Оно в целом описывает всё, что я сделал за последние два дня.
🔥7
Я что-то не понимаю, почему их не расследуют в ФБР и почему их не закрывают. Альтмана пора сажать в клетку.
🤔1
Получается какая-то вот такая ситуация с моделями. Это мой личный парето фронтир.

Для работы с Hermes вместо Опуса будет Astra, и это достигается двумя подписками — OpenCode Go + Codex.

Ну и, конечно, домашний Qwen 27B, как фоллбек.

Если что-то из этого списка надо убрать, то это будет MiMo. Она в общем лишняя. Хотя на OpenRouter и OpenCode — неплохая замена ChatGPT Sol. Просто она медленная, и tool calling у неё плохой в сравнении с DeepSeek — для Hindsight, например, не подходит.

UPD: Нет, смотрим следующий пост.
✍3🔥1
Gaperton's Tech Corner
Получается какая-то вот такая ситуация с моделями. Это мой личный парето фронтир. Для работы с Hermes вместо Опуса будет Astra, и это достигается двумя подписками — OpenCode Go + Codex. Ну и, конечно, домашний Qwen 27B, как фоллбек. Если что-то из этого…
ℹ️ Сел и пересчитал это по-нормальному.

Взял OpenRouter и посмотрел, какие цены из Price коррелируют со ценой среднего размера сессии Hermes. Выяснилось, что цена входных токенов.

Затем прикинул, какое из сравнений лучше всего коррелирует с нагрузкой Гермеса. GDPVal.

А затем вытащил данные из OpenRouter и Artificial Intelligence и сделал парето-фронтир.

Получается, что для Гермес вы должны брать модель GLM 5.3 Flash. Или сидеть на бесплатном Qwen. Mimo того не стоит. Как и Grok.

Астра стоит того, но только из подписки Codex. Иначе дорого.

Итого — Qwen 27B ➡️ DeepSeek 4.1 Flash / GLM-5 Flash ➡️ Codex GPT-6 Astra

Первое бесплатно, второе дает вполне рабочее качество уровня примерно ChatGPT Sol по адекватной цене, а последнее — фронтир.

👆Это, в общем, отражает суть моей гибридной стратегии.

1. Данные должны быть локальными (Hermes).
2. Мы не должны зависеть от поставщика модели (Hermes + Codex + OpenRouter/Nous/OpenCode Go/...).
3. И должна быть возможность делать простые вещи локально (Qwen3.8 27B)
🔥5
Gaperton's Tech Corner
ℹ️ Сел и пересчитал это по-нормальному. Взял OpenRouter и посмотрел, какие цены из Price коррелируют со ценой среднего размера сессии Hermes. Выяснилось, что цена входных токенов. Затем прикинул, какое из сравнений лучше всего коррелирует с нагрузкой Гермеса.…
🤔 Для OpenCode Go математика немного другая. Вместо цены мы должны посчитать, сколько у нас входных токенов входит в месячный лимит. И строить фронтир наоборот — начиная с самого большого лимита.

В общем, расчет показывает, что в этой подписке пользоваться чем-либо, кроме GLM 5.3 Flash, не имеет смысла.

Если пересчитать это в цены OpenRouter, OpenCode Go для данной модели обходится примерно в два раза дешевле. Но дешевле это будет только в случае, если вы тратите хотя бы половину месячного лимита. В противном случае дешевле брать это Open Router платя за токены. В общем, вы пять долларов экономите в лучшем случае.

❗️ Если дома будет работать Qwen 3.8 Flash, не будет никакого смысла платить Open Code и Open Router.

Qwen3.8 Flash это 1612 Elo. И все. До свидания. В облаке нужен только фронтир и только для сложных задач.

А он будет работать. Экспериментальные ветки vLLM уже показывают примерно сто токенов в секунду на моем железе. Это означает, что к концу года, когда выйдет Qwen 4, всё будет работать. И мы еще посмотрим на Qwen 4 27B.

Я, честно говоря, не понимаю, как амодеи собираются отбивать эти конские инвестиции в дата-центры.
Please open Telegram to view this post
VIEW IN TELEGRAM