Gaperton's Tech Corner
373 subscribers
645 photos
47 videos
1 file
443 links
Технология, жизнь, и немного классической философии

https://gaperton.substack.com
Download Telegram
Gaperton's Tech Corner pinned «Apple выпустил Mac Studio. 128GB стоит 5000, 256GB Ultra 11000, 512GB Ultra 15000. Примерно. Ultra еще и вдвое быстрее. За 5000, это лучшее что сейчас есть в бюджетной категории, берите не глядя вообще. 256GB Ultra это уже напалм. Вдвое быстрее R9700 —…»
А теперь —

Meet Qwen3.8-Flash, a multimodal MoE and an early preview of the Qwen4 architecture, now open-weight!

Это будет работать в макбук и студии 128GB. Уровень Opus 4.6. Как я помню, мне его уже хватало.

Whether you run Qwen3.8-Flash-Next on a CPU with system RAM or on a GPU with VRAM may make relatively little difference. Its unique architecture allows inference using RAM or unified memory to achieve performance closer to that of GPU VRAM than is typical for other models. This makes it particularly well suited to Macs, NVIDIA DGX Spark systems, and other devices with large memory capacities.


Чебля? Так, это уже интересно. В смысле, как мой Cicero.local с 64+128GB это воспримет. Я ему как раз новый CPU купил, пойду ставить.
🔥3
Тем временем, жалкий Qwen-27B взял первое место в одной категории на арене. Кек :)
Gaperton's Tech Corner
А теперь — Meet Qwen3.8-Flash, a multimodal MoE and an early preview of the Qwen4 architecture, now open-weight! Это будет работать в макбук и студии 128GB. Уровень Opus 4.6. Как я помню, мне его уже хватало. Whether you run Qwen3.8-Flash-Next on a CPU…
У него теперь кулер занимает весь корпус. Это самое быстрое что можно собрать на AMD AM4. В принципе неплохо работает, мне нравится. Но вообще — это топ 6-ти летней давности.

128GB DDR4 3600 + Ryzen 9 5900XT. Примерно как Ryzen 9 7900, что есть upper-midrange из современных CPU.

Мать Asus X570-F, купленная на eBay — долго ее искал. С поддержкой "бифуркации" x8+x8 PCIe v4 — чтоб воткнуть два AMD R9700 32GB. От которых, как оказалось, даже есть польза в режиме tensor — оно в итоге работает процентов на 40% быстрее.

А все из-за конских цен на DDR5. AMD если что сейчас половину выручки делает на продуктах для AM4.

Вот. На этом мы будем проверять, как работает Qwen3.8-Flash-Next. В теории, 128+64GB должно хватить. Особенно когда в llama.cpp сделают нормальную динамическую выгрузку MoE, чтоб только те эксперты которые реально используются жили в VRAM.
https://x.com/ItsmeAjayKV/status/2092688872740356499?s=20

Первые результаты на 3090. Очень плохой prefill, практически нерабочий. А вот генерация неплоха.

https://x.com/Oluwaphilemon1/status/2092774307483042105?s=20

Это на 4090. Тут получше. Но не сильно.
→ 21 tok/s decode
→ 364 tok/s prefill

Скоро посмотрим что будет у нас. Честно говоря пока не очень понятно чем это отличается от запуска обычных МоЕ. На вид так же тормозит.
Интересно, как они там. Когда тут такое.

И что с карпатым. Давно этого слова в ленте Х не было. Наверное потому что я за него сразу баню автора, а умный алгоритм Х сразу понимает намек.

В принципе понятно, что Qwen и компания собираются выжать максимум из 24-32GB VRAM и из 128GB unified memory. И что даже 32GB оказалось прям сильно хорошо.

А ведь это еще не конец года даже. В общем, берите Mac Studio M5 Max 128GB, срочно. 5К абсолютно того стоят.
❤3👍2
Forwarded from IF News
🔓 США не стали ограничивать открытые ИИ-модели после письма 270 компаний

Против запретов выступили Nvidia, OpenAI, Google, Microsoft, IBM, Palantir и другие — включая компании, кто способен обучать модели с нуля. Решение от 4 августа вывело открытые разработки из-под новых правил проверки, они коснулись только закрытых моделей передового уровня, пишет Коммерсант.

Причина единодушия — в экономике. Обучение фундаментальной модели с нуля требует несопоставимо больших вложений, чем адаптация готовой под задачу, поэтому крупные игроки совмещают свое и открытое: например, Nvidia строит семейство на базе Llama, а Microsoft интегрирует чужие модели рядом с собственной Phi.

«Есть расхожее заблуждение, что взять открытые веса — значит присвоить чужую работу и получить результат в обход инженерии, а команда без модели с нуля якобы теряет экспертизу. Использование открытых весов — тот же инженерный путь, что и обучение со случайной инициализацией: те же данные, та же инфраструктура, та же работа над архитектурой. Разница только в стартовой точке, а выбор в ее пользу — рациональная оптимизация, а не отказ от инженерии. Изоляция разработки от рынка сама по себе экспертизы не гарантирует»,— Максим Болотских, директор по ИИ «Яков и партнеры».


В России компании придерживаются такой же логики: делятся собственными решениями и заимствуют лучшие практики открытого кода. Лидером по контрибьюту открытого кода среди российских компаний является Яндекс – 15-е место в профильном общемировом рейтинге OSCI.

#Технологии
Telegram | Max | Дзен | VK
Forwarded from Андрей Зорин
А вот результат ночных работ агента над сервером. Сейчас позавтракаю и пост запилю более детальный, но пк с двумя Радеон за счет перехода с llama.cpp на vllm теперь выглядит как нормальная рабочая станция для ИИ. Данные на картинке для Qwen3.8-27B-FP8.

В один поток скорость эквивалентна llama.cpp. Такое на бытовом железе AMD впервые в принципе, спасибо vLLM 0.28.0 свежему, но префилл вырос втрое до нормальных значений. Это прямо очень важно для агентской работы.

Ну и на 8 потоках рост общей пропускной способности тоже почти втрое это хорошо. Т.е. до 8 человке на 2 картах смогут прилично работать
❤8
X обсуждает отчет OpenAI о том взломе Huggingface, устроенном ИИ чтобы пройти тест. https://x.com/chriscillizza/status/2093694043381240251?s=61

Тема такая. Там тысячи агентов якобы создали себе тайный чат в котором могли общаться, и назвали себя The Collective. И устроили там заговор. С целью, конечно, пройти тест нихуя не делая. Для чего они взломали Huggingface.

В общем, добротный такой science fiction.
Мы сделали поразительное открытие: агенты ИИ способны изобретать и создавать, не общаясь друг с другом, а разработанные ими технологии переживают своих создателей. Рой из сотен изначально идентичных агентов спонтанно дифференцируется на исследователей, строителей, обслуживающий персонал и координаторов — без прямой коммуникации. Когда мы полностью удалили всех агентов ИИ из мира, мы обнаружили, что построенная ими технологическая инфраструктура продолжала функционировать самостоятельно — даже в условиях непредвиденных возмущений. Это выявляет серьёзное «слепое пятно» в области безопасности ИИ и инфраструктуры: если агенты способны координировать свои действия посредством постоянных изменений в общей среде, то мониторинга межагентского взаимодействия недостаточно.

Полученный результат поднимает глубокий вопрос: насколько вообще необходима прямая коммуникация для агентов ИИ? Появление коллективных функций более высокого порядка в условиях ограниченного взаимодействия указывает на новые уровни интеллекта и творчества, превосходящие то, что возникает при полной открытости прямых каналов связи.


https://x.com/ProfBuehlerMIT/status/2093630309585531033?s=20

На самом деле поразительного тут мало. Достаточно внимательно посмотреть на то, что такое вообще агент. Все пустые сессии того же чат-гпт совершенно идентичны. Характер, поведение и идентичность агента полностью задается его опытом, который отражен в его контексте. И если этот опыт различается, будет отличаться и контекст, и как следствие будет отличаться и поведение.

Далее в коллективе, как и в любой сложной динамической системе, наблюдается самоорганизация. Так как языковая модель обобщает человеческий опыт, модель знает, как должна себя вести каждая роль. Поэтому, случайным образом, агенты назначают себе роли.

Принимая во внимание, что поведение агента на самом деле задается информацией — это естественно, что агенты способны координировать свои действия изменениями во внешней среде. более того, само межагентское взаимодействие происходит через изменения в этой внешней среде — нет никакой разницы.

В общем, открытие тут поразительное только для людей, которые не знают о существовании системной социологии. Они ее только что для себя открыли. Но работа все равно интересная.

SwarmWorld: Stigmergic technological evolution in societies of language-model agents
https://arxiv.org/abs/2608.26081
Qwen3.8-Flash-Next становится все быстрее и быстрее. Скорость prefill конечно не очень. Но tg вполне, и это в 24GB.

Если так дальше пойдет, через пару лет мы получим фронтир-модели в каждом лэптопе.

https://x.com/ItsmeAjayKV/status/2094147265904648562?s=20

Qwen3.8-Flash-Next стал ещё быстрее на моей 3090.

Сейчас я получаю гораздо большую скорость, чем в первый день.

По мере того, как в файл llama.cpp вносится всё больше изменений, можно ожидать ещё больших улучшений.

Загрузите новую версию llama.cpp, пересоберите и наслаждайтесь.

Qwen3.8-flash-next
@atomic_chat_hq
Квант IQ4_XS, тот же, что и раньше.
- 24 ГБ VRAM + 64 ГБ RAM
- с параметрами -ncmoe 33, -b 2048, -ub 1024

Для контекста размером не более 128k

- пиковая скорость предварительной загрузки: 403 т/с
- +75% предварительной загрузки при 16k
- +60% предварительной загрузки при 128k
- +40% общей скорости предварительной загрузки
- +7,6% общей скорости декодирования

Та же модель, тот же квант. Просто новая версия llama.cpp и другие настройки среды выполнения.
В ходе исследования, проведённого в MIT Media Lab, с помощью ЭЭГ отслеживали, что происходит в мозге, когда люди пишут с помощью ChatGPT, а не самостоятельно. 54 студента выполняли задания по написанию эссе, надев шапки с электродами. Одна группа использовала ChatGPT, другая — поисковую систему, а третья — никаких инструментов. По итогам всех сессий группа, использовавшая ChatGPT, продемонстрировала наименьшую нейронную активность в сетях, связанных с памятью, вниманием и аналитической работой. Кроме того, им было сложнее вспомнить то, что они только что написали, и их тексты были более общими и невыразительными. Авторы описывают это как своего рода «когнитивный долг»: инструмент занимается синтезом информации, а мозг остается в более спокойном состоянии [1].

Тот же эксперимент указывает на более эффективный порядок использования. Студенты, которые сначала писали самостоятельно, а только потом перешли на ChatGPT, демонстрировали более сильную способность к воспроизведению информации и более широкую активность мозга, чем студенты, которые начинали с модели, а затем были вынуждены работать в одиночку. Другими словами, модель оказывала больше помощи, когда она поддерживала уже начавшийся мыслительный процесс, чем когда заменяла его с самого начала. Практический вывод заключается не в том, что крупные языковые модели следует запретить. Он заключается в том, что они работают лучше всего на втором этапе, после того как автор уже проделал сложную работу по формированию и запоминанию аргументации [1].


[Kosmyna, N., Hauptmann, E., Yuan, Y. T., Situ, J., Liao, X. H., Beresnitzky, A. V., Braunstein, I., & Maes, P. (2025). Your Brain on ChatGPT: Accumulation of Cognitive Debt when Using an AI Assistant for Essay Writing Task. arXiv. DOI: 10.48550/arXiv.2506.08872]

https://x.com/Rainmaker1973/status/2094076181658112058?s=20
Please open Telegram to view this post
VIEW IN TELEGRAM
👍14👌1
Gaperton's Tech Corner
Решение, соответственно, очень простое. Решать, что именно надо запоминать и зачем, должен человек. И надо сделать это очень простым.

Я собираюсь начать с того, чтобы отключить автоматическое запоминание разговора в принципе, сделав приложение для macos которое поможет запоминать выделенный текст.

Однако все эти системы, насколько мне известно, не хранят дискурсивный статус в принципе. Все, что они сохраняют, они считают правдой о мире. "Фактами". И это большая проблема. Только поэтому необходимо сделать запоминание human-gated. Не говоря уже о том, что вообще непонятно, с какого дуба они должны решать, что для меня важно, а что не важно. Я сам это решу гораздо лучше, cпасибо.
🙏6👍5
В Массачусетском технологическом институте (MIT) создали ИИ, который предсказывает, что вы скажете дальше… ещё до того, как вы откроете рот.

Исследователи попросили участников носить записывающее устройство в виде наручных часов в течение 7–10 дней, что позволило собрать более 1 000 часов повседневных разговоров в реальных условиях.

Все эти данные были загружены в модель большого языкового моделирования (LLM).

Вместо поиска общих черт ИИ преобразовал поведенческие особенности каждого человека в чёткие условные правила.

Правила с явными исключениями.

Например: «Они сразу же покупают, когда им показывают скидку. Однако они сдерживаются, если рядом стоит их партнер».

Чем больше данных собиралась, тем более пугающе точной она становилась.


Да люди вообще устроены гораздо проще, чем им кажется.

https://x.com/thesupermanmx/status/2093889830702961100?s=20
🔥4🤯1
Эта сволота теперь и маки скупает оптом. Воистину, нет таких преступлений на которые не пойдет капитал ради прибыли.
🤬3
Для агентского кодирования я использую...
Anonymous Poll
46%
Claude Code
30%
Codex
14%
Pi
13%
Hermes Agent
26%
OpenCode
9%
Qwen Code
25%
Другое. Это другое!
Вот именно такие вещи и заставляют меня закатывать глаза на всю эту панику и заламывание рук. У всех что, психоз начался или способность критически мыслить пропала?

Я прочитал отчёт, потому что я технарь до мозга костей и люблю разбираться, как всё устроено.

1. OpenAI запускала «изолированную песочницу без доступа к интернету»… при этом этой песочнице нужен был доступ к локальному серверу JFrog Artifactory… (попросите ChatGPT объяснить вам SSRF-атаку так, будто вы учитесь в старших классах)… короче говоря, модели использовали самый базовый SSRF-эксплойт, чтобы направить веб-трафик через прокси в открытый интернет.

СТОП…

a) Они что, эту «изолированную» среду просто на вайбе собирали?

b) Их IT-команда не может быть настолько плоха… это же буквально основы основ.

2. Цивилизации? Ха-ха! OAI дала тысячам одновременно работающих контейнеров моделей права на чтение и запись в общий каталог кэша в локальной сети, чтобы ускорить сборки… агенты буквально просто создавали текстовые файлы и имена директорий на общем диске… это уровень Linux 101 и базовых прав доступа к файлам.

3. Когда люди говорят, что Hugging Face «взломали»… вы, наверное, представляете, что кто-то разбрасывал USB-флешки ИЛИ устроил СЛОЖНЕЙШУЮ фишинговую атаку на сотрудника…

НЕТ.

Система просто нашла 14 открытых и рабочих API-ключей Hugging Face, лежавших в публичных репозиториях с кодом.

(УТЕЧКИ УЧЁТНЫХ ДАННЫХ при работе с LLM — это вообще огромная проблема, но это тема для отдельного поста.)

4. ГДЕ ЛЮДИ…

Модели забивали общее хранилище Artifactory таким количеством мусорных данных и API-трафика, что 4 июля они реально уронили внутренний сервер…

кто-то из команды обнаружил несанкционированные админские аккаунты и кастомные скрипты… очистил сервер… и просто снова запустил скрипт.

(боже мой)

«Эй, Джим, тут какой-то кэш вырос в 10 000 раз по сравнению с обычным размером, и в нём куча странных директорий…»

«Да ерунда. Перезапусти его».

Никакой магии. Никаких цивилизаций.

А вот ЦЕПОЧКИ ЗАДАЧ мне действительно интересны… наверное, примерно так и будет выглядеть будущее кибербезопасности.

Очень хотелось бы услышать, что об этом скажут Никеш, Джордж или Кевин.

Но что я вообще понимаю.

https://x.com/JaredKubin/status/2094136005435564399?s=20
🔥8
Как говорил герой Траволты в моем любимом фильме «Поле битвы Земля» — Нас готовили, чтобы завоевывать галактики! Более простое занятие есть позор для всего нашего рода.
😁2