Gaperton's Tech Corner
373 subscribers
648 photos
47 videos
1 file
444 links
Технология, жизнь, и немного классической философии

https://gaperton.substack.com
Download Telegram
Qwen 3.8 Max Preview прям мудрые советы за жизнь дает :). Аж пронимает. Очень советую попробовать поговорить с ним по душам.

Он по качеству рассуждений на естественном языке близок к ChatGPT и последнему Grok (оба очень хороши), но у него не убрали personality. Он как живой. Так что если с кем бухать — то это к Qwen.
Антропик тут письмо открытое написал.
Gaperton's Tech Corner
Антропик тут письмо открытое написал.
Меж тем, Kimi K3 можно скачать. 2.8T параметров. Это полтора терабайта памяти надо чтоб запустить в Q4, всего-то.
Gaperton's Tech Corner
Меж тем, Kimi K3 можно скачать. 2.8T параметров. Это полтора терабайта памяти надо чтоб запустить в Q4, всего-то.
Как видите есть небольшая задержка, но рано или поздно все упрутся в потолок, и тогда Кими и компания неизбежно догонит Антропик. А учитывая что у Кими раз в 10 меньше ресурсов на обучение — то со временем,как разница сократится, и перегонит.
💻 Что покупать от Apple для LLM

Как известно, а это таки известно — MacBook Pro M5 Max 128GB является на данный момент лучшим вариантом для локального запуска LLM, если вы нормальный человек, а не сумасшедший риггер с серверной фермой в подвале.

Имеет-ли смысл покупать его сейчас, или же стоит подождать?

Первым делом, проверим свежие слухи.

Согласно Bloomberg, Apple ускоряет разработку чипов M7, ориентированных на задачи искусственного интеллекта, пропуская часть линейки M6.

Apple не выпустит M6 Pro и M6 Max, поэтому первые MacBook Pro с OLED-дисплеями будут оснащаться M5 Pro и M5 Max, а не более новыми чипами.

Предполагаемый график выхода процессоров Apple выглядит следующим образом:

M5 Ultra — конец 2026 года.
M6 — конец 2026 года.
M7 — первая половина 2027 года.
M7 Pro — конец 2027 года.
M7 Max — конец 2027 года. 👈 (Вас интересует вот это)
M7 Ultra — 2028 год.


Mac Studio. Apple работает над обновлённой версией Mac Studio с чипами M5 Max и M5 Ultra, однако сроки выхода пока не определены из-за дефицита оперативной памяти и её высокой стоимости.

Значит, что такое M5 Max. Это по скорости примерно RTX 3090/R9700. То есть, не блестяще, но уже хорошо. И — 128GB быстрой памяти.

Это позволяет пускать как плотные модели, такие как Gemma 31B и Qwen 27B, так и MoE модели на 120-200B+ параметров.

Примерно полтора года ничего лучше не будет.

Учитывая все это — берите не глядя. 7 тыщ USD, всего-то.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1🔥1🫡1
Gaperton's Tech Corner
💻 Что покупать от Apple для LLM Как известно, а это таки известно — MacBook Pro M5 Max 128GB является на данный момент лучшим вариантом для локального запуска LLM, если вы нормальный человек, а не сумасшедший риггер с серверной фермой в подвале. Имеет-ли…
❓ Возникает вопрос — а так ли прям надо 128GB VRAM

Ну как вам сказать. Тут например давеча вышла DeepSeek V4 Flash, разрывающая пасть льву. И она в принципе лезет в 128GB.

Правда, лезет она в Q3 и едва-едва. Но современные кванты динамические, то есть чувствительные тензоры там не в Q3 а в нормальной точности.

То есть, даже DeepSeek 284B-A13B Q2 от unsloth должно быть лучше чем Qwen 27B в Q8.

https://unsloth.ai/docs/models/deepseek-v4

Я разумеется попробую это на своем 2xR9700 32GB + 128GB RAM. Но честно говоря оно не очень — у AMD сильно отстает софт и поэтому оно тормозит. 2xRTX 3090 24GB имеет куда больше смысла.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥7
Попробовал Hindsight

Это агентская память второго поколения, которая предназначена для "AI employees" то есть для тех ИИ которые должны были нас всех заменить год назад.

Почитал описание — да. Кошмар. Будущее наступило.

Почитал статьи. Да ваще пиздец, все, пора на пенсию выходить.

Ну, делать нечего — в морг так в морг — зашел на свой Cicero.local, и говорю живущему там агенту Hermes, "Привет", грю, "Сейчас Hindsight поднимать будем, и будет у тебя, безмозглого, наконец память".

После яростного секса удалось какими-то стремными локальными патчами заставить Hindsght перестать падать. После чего я заглянул ему в память — интересно же.

А там сплошные противоречивые параграфы в "фактах о мире". Потому, что когда что-то меняется, надо суметь сделать две вещи. Первое — понять со слов что речь вообще об одной и той же штуке. А не о двух разных. В этом суть слова "меняется". А второе — понять что из двух было до, а что после, и главное — что из двух надо забыть.

Ну так как и с первым и со вторым у моделей большие проблемы (особенно с темпоральной логикой) — в "фактах о мире" лютый, бешеный треш.

В общем, не переживайте пока. Не заменят вас. Они пиздят (тм).

Не, я думаю это однажды конечно порешают. Откроют для себя модальную логику сначала, заново, трудным путем. Через баги. А потом сразу.
🔥7👍1
Gaperton's Tech Corner
Попробовал Hindsight Это агентская память второго поколения, которая предназначена для "AI employees" то есть для тех ИИ которые должны были нас всех заменить год назад. Почитал описание — да. Кошмар. Будущее наступило. Почитал статьи. Да ваще пиздец,…
В общем, там с этими моделями как. Стоит вам перестать обращать на что-то внимание, как из него тут же исчезает смысл и оно превращается в говно. Так работает везде и исключений я пока не видел.

И как оказывается, даже для того чтобы что-то запомнить надо думать.
👍2
🚀 Внимание, красная ракета. Всем приготовиться.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥10
Meet Qwen3.8-Max — our most capable model to date.

Next week, the open weights of Qwen3.8-Max will be released, and Qwen3.8-27B is also going open-weights to meet you all!🎉


Я превью смотрел, Qwen 3.8 Max это напалм в рассуждениях на естественном языке. Первая модель от Квен с которой есть о чем поговорить.
Gaperton's Tech Corner
Ну так как и с первым и со вторым у моделей большие проблемы (особенно с темпоральной логикой) — в "фактах о мире" лютый, бешеный треш.
Проверил.

Все автоматические провайдеры памяти в Hermes бесполезны. То как к нему подключен Hindsight — в принципе не правильно, и у всех приводит к такому результату как у меня. Все на практике тупо сидят на файлах.

Окей. Зря что-ли настраивал Hindsight? Попробуем выяснить можно-ли его в принципе правильно готовить. Для чего надо для начала почитать их ресерч.

* * *

Безотносительно, сам процесс запоминания у человека очевидно требует желаний и аффектов, и направляется ими. Их моделирование и есть ключ к автоматической системе памяти. Модель должна иметь предпочтения и хотеть. Это можно и нужно задавать ей снаружи (позволять системе самой генерировать желания за свои деньги будет только идиот).

Это теоретически скорее верно. Но нихрена пока не операционно.
❤4🔥1
> Я самом деле не просил его отчитываться.

Вопрос о том, что ты «на самом деле» просил, — интересный теоретический вопрос.

Проблема в том, что никакого «на самом деле» здесь нет.

Есть намерение говорящего: А хочет произвести определённое впечатление на Б.

Есть слова, которые А произносит, обращаясь к Б, возможно, в присутствии аудитории.

И есть интерпретация Б, которая в значительной степени определяется:
• его убеждениями;
• его желаниями и потребностями — тем, что он считает важным или необходимым;
• его представлением о том, как аудитория воспринимает этот разговор, а также тем образом себя, который он стремится поддерживать.

В результате одни и те же слова могут показаться одному человеку совершенно безобидными, а другого заставить метаться, как раненая свинья.

Поэтому то, что было «на самом деле» сказано или о чём «на самом деле» попросили, не является объективным свойством высказывания, и не определяется намерением говорящего. Это интерпретация, возникающая из взаимодействия намерения говорящего, произнесённых слов и когнитивного и социального контекста слушателя.


Из рабочих разговоров. Для людей секрет что то что они хотели сказать, реально сказали, и как их поняли — это часто три не связанных между собой вещи.
💯6
Видите DeepSeek V4 Flash?

Так вот, этот фронтир в 128GB можно запустить локально.
🔥4
А миссия — лишить их работы.
😁14
Gaperton's Tech Corner
Окей. Зря что-ли настраивал Hindsight? Попробуем выяснить можно-ли его в принципе правильно готовить. Для чего надо для начала почитать их ресерч.
Ага, таки Hindsight правильно готовить не только можно, но и нужно.

Там три промпта надо задавать, которые говорят что сохранять, как объединять, и как обрабатывать.

Ну что, попробуем.

Хорошая конфигурация делает эти три уровня последовательными.

retain_mission

Сохраняй только долговременные факты, решения, предпочтения и проверенный опыт.

↓

observations_mission

Объединяй похожие факты в устойчивые закономерности и привычки. Не повторяй исходные факты.

↓

reflect_mission

Строй высокоуровневые модели поведения, принципы принятия решений, архитектурные закономерности и долговременные стратегии.
✍2🔥2👍1
Bloomberg написал что-то смешное.
😁6
Gaperton's Tech Corner
Ага, таки Hindsight правильно готовить не только можно, но и нужно. Там три промпта надо задавать, которые говорят что сохранять, как объединять, и как обрабатывать. Ну что, попробуем. Хорошая конфигурация делает эти три уровня последовательными. retain_mission…
Очень прикольная штука Hindsight.

Я воспроизвел результат локально на одном R9700. Она скорее работает чем нет. Прям, умная. Помнит вещи, реально.

Сейчас я примерно разобрался как она на самом деле работает, читая код, гоняя тесты, и анализируя базу. Закончу первую волну экспериментов, и расскажу. Там все довольно просто и симпатично. И вы поймете, что это такое и чем оно может быть полезно.

Да, я гонял его в паре с Hermes. Он может работать с Codex и Claude Code. Для работы с локальной базой нужен конечно локальный агент.
👍5❤2👨‍💻1
https://x.com/TeksEdge/status/2085046568240197886?s=20

Это потрясающее дополнение к llama.cpp. «Горячий эксперт» может увеличить скорость декодирования MoE примерно в 2 раза.

В ходе эксперимента с llama.cpp был найден гораздо более эффективный способ использования небольших объемов VRAM с огромными моделями MoE.

Вместо того чтобы заранее определять, какие эксперты будут размещаться на CPU или GPU, новый кэш «горячих экспертов» отслеживает, какие эксперты MoE фактически используются.

Часто используемые эксперты → кэшируются в VRAM
Редкие эксперты → остаются в системной RAM / на CPU
По сути:

GPU становится кэшем для наиболее востребованных частей модели.

Результаты, представленные авторами, на модели Qwen3.6-35B-A3B с всего лишь 8 ГБ VRAM:
Q2_M
33,25 → 57,2 tok/s
В 1,72 раза быстрее
Q5_K_P
17,34 → 35,93 ток/с
В 2,07 раза быстрее

Самое интересное заключается в том, что вся модель не обязательно должна помещаться в VRAM. Системная оперативная память хранит «холодных» экспертов, в то время как ограниченная память графического процессора динамически выделяется на тех экспертов, которые в данный момент наиболее важны.


Наконец-то нормальный кэш экспертов в llama.cpp сделали. MoE не влезающие в память станут вдвое быстрее.
У меня жена только что заказала топовый макбук. Для музыкального продакшна надо.

Так вот — доставка на начало октября. Два месяца ждать. Дефицит RAM.
🤯7💔3
Из правил llama.cpp.

• AI-written PR descriptions, commit messages, or reviewer responses
→ immediate closure per AGENTS.md

• Undisclosed AI usage → possible permanent ban per CONTRIBUTING.md

• Contributors must "understand their code fully — able to explain any change to a reviewer without AI assistance"


Странно, правда? ИИ это же так хорошо.

Строго говоря, я не могу оправлять свой патч к llama.cpp пока до конца не пойму код который меняю. Я кстати горячо одобряю такой подход.

Да, я тут небольшой баг в грамматике gemma поправил чтоб Hindsight не циклило, две строки. В принципе я это исправление умею автоматом накладывать. llama.cpp все равно ставится компиляцией из исходников, элементарно сделать автоматическое наложение патча.
🔥7