Технозаметки Малышева
12.4K subscribers
5.24K photos
1.98K videos
43 files
5.22K links
Новости инноваций из мира Искусственного Интеллекта. 🤖 [РКН: 7021469833 ]

Всё об ИИ, ИТ трендах и Технологической Сингулярности.

🤖: @ai_gptfreebot [бесплатный бот]
✍️: @tsingular_bot [каталог ботов и курсов]

💸: https://pay.cloudtips.ru/p/c8960bbb
Download Telegram
Mac Studio на M5 Ultra: 512 ГБ единой памяти для локальных LLM

Apple обновила старшую линейку: вышел новый Mac Studio на чипах M5 Max и M5 Ultra, позиционируется как лучший десктоп для локального ИИ.

🔧 Что внутри:
M5 Max: 18-ядерный CPU, до 40 ядер GPU с нейроускорителями в каждом, до 128 ГБ памяти и 3,9х прирост AI-производительности.
M5 Ultra: 36-ядерный CPU, 80 ядер GPU, 512 ГБ единой памяти и пропускная способность 1,2 ТБ/с, в 4,3x быстрее под AI-инференс по сравнению с M3 Ultra!
SSD нового поколения на PCIe Gen 6: хранилище вдвое быстрее, большие модели грузятся заметно шустрее.

💡 Главная фишка для локального ИИ: кластеризация.
Thunderbolt 5 вместе с RDMA позволяет объединить несколько Mac Studio в единый пул.
Кластер из четырёх машин даст трёхкратный прирост скорости инференса против одной.
Это значит, что фронтирные open-weight модели целиком живут у тебя на столе.

Приятно что не стали снижать максимальный объем памяти, - были слухи что 256 гигов будет потолок, но теперь с 4х512 можно даже Kimi K3 локально запустить будет, не говоря уже о DeepSeek Pro

💼 Цены:
M5 Max от $2,499
M5 Ultra от $5,499 (конфигурация на 512 ГБ, только с конца октября)

Начинаем откладывать заначку. топовая конфигурация Ультры скорее всего в районе $10К будет стоить.

📎 Пресс-релиз Apple и цены: 9to5Mac

#Apple #MacStudio #локальныеLLM
———
@tsingular
🔥8👍2🏆22
Цены на топовую доступную на данный момент конфигурацию

$18 300 за 256 гигов. но с 16Тб диском

Год аренды квартиры в неплохом районе

судя по тому, что установка 256 оперативы за место 96ти стоит $4К, допустим до 512 гигов будет еще 3500 сверху, - то полная цена топовой ультры улетает за $20К

#цены #MacStudio #Ultra
———
@tsingular
216🤯4😁3👀3😢1
Media is too big
VIEW IN TELEGRAM
SpaceX вложит $100 млрд в новый космодром Starbase в Луизиане

📋 SpaceX,- компания, которая уже выводит на орбиту большую часть полезной массы в мире, объявила во вторник 25 августа о строительстве второго космодрома Starship.
Анонсировали губернатор Луизианы Джефф Лэндри и президент SpaceX Гвинн Шотвелл на встрече в Аббевилле, куда пришли больше двухсот человек.

Проект на 100 млрд долларов, крупнейшая капитальная инвестиция в истории штата. Больше трёх тысяч прямых рабочих мест, в сумме, по словам Маска, может дойти до десяти тысяч.
Свыше 500 квадратных километров земли, десять стартовых площадок на первом этапе и больше дюжины стартовых башен в перспективе.

Цель: сделать запуски Starship рутиной. По формулировке Шотвелла, - запуск шаттлов должен стать как коммерческая авиация.
Тысячи запусков в год, дальше больше тридцати в день!!!

💡 Космодром задуман самодостаточным: собственное производство топлива, генерация энергии, глубоководный порт, цеха обработки кораблей и аэропорт.
Всё на месте, чтобы разгонять частоту запусков.

Место под космопорт выбрано в округе Вермилион,- редкая малонаселённая болотистая зона с прямым выходом в Мексиканский залив, примерно в 200 милях восточнее Бока-Чики на той же широте.
Траектории запусков сохраняются, а модель первого космопорта Starbase можно в будущем скопировать и масштабировать на другие локации.

💼 Дальше по цепочке орбитальные дата-центры: спутники на чипах NVIDIA, первая миссия на конец 2027 года.
Ради такого темпа запусков всё и строится.

Интересный нюанс: космодром строят на побережье, которое исчезает быстрее всего в стране.
Береговая линия в округе Вермилион отступает от одного до семи метров в год. После штрафов и исков за нарушения экологии на первом Starbase в Техасе компания заранее обещает «историческое восстановление побережья»: вернуть болота и защитить их от штормов.
Бонусом жителям округа обещают скидку 50% на Starlink.

Космос превращается из отдельной программы в отрасль: с космопортом и космороботами. 🚀
Еще раз,- 30 пусков в день!

📎 Starbase, LA

#SpaceX #Starship
———
@tsingular
18🤯54👍3😁2👀2🆒2
Jalapeño: инференс-чип OpenAI обошёл NVIDIA по токенам на ватт

OpenAI показала первые замеры своего инференс-чипа Jalapeño, анонсированного ранее.
Чип прогнали на публичном бенчмарке InferenceX от SemiAnalysis и сравнили с серийным железом NVIDIA: GB200 и GB300.

📊 Итог на трёх открытых моделях: GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T:
В 1,5–1,9 раза больше работы на ватт на пиковой пропускной способности.
В 1,7–3,6 раза ниже задержка.

На DeepSeek R1 ответ приходит за 1,65 секунды против 5,99 у GB300.

На самой большой Kimi 1T: 1,5x на ватт и 3,4x ниже задержка, при том что Jalapeño ест 700 Вт против 1400 Вт у конкурента.

🔧 Почему выигрывает: чип спроектирован под агентные нагрузки, где prefill упирается в вычисления, а decode в пропускную способность памяти.
Ключевое решение: минимизация перемещения данных. KV-кэш держат локально, вся модель живёт в одном связном домене, и акселератор одинаково силён в обеих фазах без простоя на пересылках.

💡 Самое занятное, впрочем, в другом: чип проектировал ИИ и спроектирован так, чтобы ИИ его программировал.
От идеи до tapeout за девять месяцев, ИИ-сгенерённые ядра на отдельных блоках работали в 1,5–1,8 раза быстрее написанных людьми, а три чужие модели довели до высокой производительности за два месяца через Codex с GPT-Astra.

💼 Развёртывание в инфраструктуре OpenAI планируется до конца года.
NVIDIA при этом остаётся для обучения, но инференс будет постепенно переводиться на собственный кремний, что приведёт к более быстрым ответам, ускорению работы агентов и снижению себестоимости по мере роста спроса.

Интересно, удастся ли им обогнать Cerebras CS-4.

📎 Источник: OpenAI

#OpenAI #Jalapeno #инференс
———
@tsingular
🔥14411
NVIDIA качает инференс для агентов: Groq 3 LPX ускоряет генерацию

NVIDIA продолжает развивать платформу Vera Rubin и выпустила Groq 3 LPX: специализированный ускоритель, который снимает задержку генерации токенов, главную боль агентных систем.

🔧 Проблема в том, что агентный инференс разбивается на две фазы, - каждая со своим узким местом.
Обработка контекста упирается в вычисления, а генерация ответа идёт по одному токену и упирается в задержку.
У агента, который делает десятки шагов подряд и постоянно вызывает инструменты, эти задержки множатся и превращаются в минуты ожидания.

Решение: codesign GPU и LPU.
Графические ядра Rubin считают большой контекст, а Groq 3 LPX отвечает непосредственно за саму генерацию.

В стойке помещаются до 256 ускорителей LP30, связанных напрямую чип-к-чипу и работающих как один детерминированный движок инференса.

📊 На бенчмарке Artificial Analysis модель Gemma 4 31B при контексте в 100 тысяч токенов выдала 3 400 токенов в секунду, что вчетверо быстрее ближайших аналогов.

💼 Партнёры уже подключились: Nebius первым среди облачников взял Groq 3 LPX, CoreWeave разворачивает в проде сеть Spectrum-X Multiplane до 512 тысяч GPU, а SpaceXAI ставит Vera CPU в основу своего агентного AI, от наземных дата-центров до орбитальных спутников.

Скоро ИИ агенты будут реагировать быстрее, чем ты успеешь сформулировать задачу.

📎 Источник: NVIDIA

#NVIDIA #VeraRubin #агенты
———
@tsingular
6🔥4🆒21
Claude объединил память чата и Cowork: теперь вы сами решаете, что в ней

Anthropic сделала память Claude сквозной: то, что ассистент помнит из чата, теперь доступно и агенту Cowork, и наоборот.
Накопленный за месяцы контекст: приоритеты, статусы проектов, твои договорённости, всё это доступно для решения ваших задач в момент запуска, без повторных объяснений.

🔧 Изменение механики работы: память пополняется по ходу разговора, а не резюмируется постфактум.
Сказал, что дедлайн сдвинулся на сентябрь, и следующий разговор уже в курсе без «запомни это».
Всё, что Claude помнит, лежит файлами по темам в настройках: можно читать, править и удалять каждый пункт.

🛡 Приватность заложена на этапе проектирования.
Чувствительные темы (здоровье, вера, политика, идентичность) по умолчанию не сохраняются, хотя это можно включить отдельной настройкой.
И есть перечень данных, которые не пишутся никогда:
паспортные и налоговые номера, судимости, иммиграционный статус или что-то, что нарушает политику допустимого использования (AUP) от Антропика.

Память включена по умолчанию на бесплатных и Pro/Max тарифах, в командных планах ей управляет админ.

🧠 Агентская память хранящаяся у вендора привязывает пользователя сильнее, чем скидки на подписку.
Чем больше данных копится в Claude, тем дороже уйти к конкуренту.

Фича удобная для тех, кто не разворачивает личных ИИ агентов, у которых память остается на железе пользователя и не контролируется провайдерами.

📎 Источник: блог Claude

#Claude #Anthropic #память
———
@tsingular
🔥62👍1
This media is not supported in your browser
VIEW IN TELEGRAM
Новый мировой рекорд на Олимпиаде роботов:

8.86 секунд на 100 метровке 🤯

Предыдущий рекорд сначала поставили на открытии - 9.39 потом улучшили до 9.32 и вот теперь Tiangong разогнался до 8.86.

Ну и это еще не финал!

#роботы #олимпиада
------
@tsingular
😁11🔥8👾331
Эндрю Нг выпустил OpenWorker: ИИ-коллега, который доводит работу до конца

Вы не поверите, но у нас новый харнесс. :)

Эндрю Нг, известный преподаватель в мире машинного обучения, и владелец платформы https://www.deeplearning.ai/, зашёл на поляну локальных агентов: его OpenWorker (не путать с OpenWork - https://t.me/tsingular/6209) живёт на десктопе и добивается выполнения задачи, доводя её до результата.

Ровно та поляна, где уже пасутся Крабы и Гермесы: всё локально, свои ключи, MCP, и открытый код под MIT.

⚡️ За недели с момента открытия: 14,9 тысячи звёзд, 2,1 тысячи форков, ставится на macOS и Windows, обновляется сам.
Модель приносишь свою: OpenAI, Anthropic, Google, DeepSeek, Qwen, Mistral, Grok и ещё десяток, либо совсем локально через Ollama.

💼 Под капотом его собственная библиотека aisuite: единый API поверх всех провайдеров, а OpenWorker как агентская обёртка.

Вырисовывается такая общая бизнесмодель, - харнесс как витрина продажи агрегатора провайдеров моделей :)

Посмотрите:
LM Studio → Bionic - каталог моделей свой
OpenCode → OpenCode Go
Hermes Agent → Nous Portal
Kilo Code → Kilo Gateway
Cline → Cline Provider
Cursor → Cursor Models
Windsurf → Windsurf Models
Warp → Warp AI Models
JetBrains Junie → JetBrains AI Service
GitHub Copilot → Copilot Models
Perplexity → Perplexity Models
Roo Code → Roo Code Router
ну и т.д.


📎 Репозиторий: OpenWorker

#OpenWorker #агенты #opensource
———
@tsingular
👍10😁31
ИИзбранное, - канал с учебными материалами и прямыми эфирами

Раз уж пошли вопросы по базе и добавились новенькие, - напомню, что есть канал, где я разъясняю основы и помогаю разобраться, отвечая на вопросы вживую.

- 🛠 Рабочие сценарии использования ИИ, - в быту, в бизнесе, в разработке.

- 🎓 Мастер-классы, - записи лекций по настройке агентов и автоматизации рутины. С пошаговыми инструкциями.

- 📚 Презентации с лекций, - те материалы с которыми я провожу обучения в МГИМО и РАНХиГС и выступаю на конференциях

- 🎬 Прямые эфиры с подписчиками для обсуждения проблем по внедрению ИИ. Такой режим онлайн-консультаций в свободной форме.

Вход тут:
https://paywall.pw/tsingular_favorites

Там уже материалов за 3 месяца накопилось прилично и по моделям и по инференсу и по RAGу и по агентам и агентским циклам и даже по железу добили разбор.

Заходите, смотрите, учитесь, качайте :)

ВАЖНО: как зайдёте, - листайте в самое начало, - там реально много полезного.

#ИИзбранное
———
@tsingular
8🔥64👍43
This media is not supported in your browser
VIEW IN TELEGRAM
Вспоминается фильм Screamers (Кричащие)

#юмор #роботы #олимпиада
------
@tsingular
🔥14👾6🤣51
McKinsey: ИИ поднял продуктивность людей, но не прибыль компаний

Свежий State of AI от McKinsey зафиксировал интересное расхождение: восемь из десяти опрошенных говорят, что ИИ поднял их личную продуктивность, а доля компаний, увидевших влияние на прибыль, второй год не сдвинулась с места.

📊 Ключевые цифры:
80% замечают рост собственной продуктивности, половина говорит, что ИИ помогает принимать решения лучше.
37% компаний относят хотя бы часть EBIT на счёт ИИ, ровно как год назад.
Доля хайперформеров, у которых ИИ даёт от 5% EBIT и «значительный эффект», застыла на 6%.
44% масштабируют ИИ на всю компанию (было 38%), а агентов уже масштабируют 40% крупных компаний против 27% годом ранее.

💡 Два объективных сдвига:
Бюджетный: Треть опрошенных (32%) уже отказались от покупки софта, который теперь строят сами с помощью кодовых агентов. Получается, что ИИ влияет не только на саму работу, но и на закупки.
Расходный: Около 20% говорят, что операционные расходы на ИИ, собственно токены, уже ограничивают потребление, т.е. ИИ сам становится серьёзной статьёй затрат.

💼 Главный вывод отчёта: индивидуальная продуктивность не превращается в корпоративную прибыль сама по себе.
Те, кто реально получают эффект от внедрения ИИ, перестраивают процессы под него, а не просто вставляют в старые.

Купить и не внедрить это наша старая забава.
Это как продукты покупаешь и не готовишь и холодильник выступет перевалочным пунктом из магазина в мусорку, - знакомо? :)

📎 Отчёт: The state of AI in 2026
#McKinsey #AI #ROI
———
@tsingular
🔥9💯62👍21
DeepSeek доросла до реальных денег: $70 млн выручки в июле, десятикратный рост

Лаборатория, которая прославилась тем, что тренировала модель за $6 млн «на копейки», вышла на серьёзные цифры.
The Information пишет: выручка DeepSeek к июлю достигла $70 млн, это десятикратный рост к 2025 году.
И это было ещё ДО того, как они повысили цены на прошлой неделе!

📊 Цифры не из официальных отчетов: источники цифр, - люди, знакомые с ситуацией, официальной отчётности у DeepSeek нет.
В июльском отчёте того же The Information фигурировала оценка ближе к $500 млн в годовом выражении, свежая цифра скромнее, но вектор тот же: за год выручка подскочила на порядок.
При этом они закрыли раунд на $7,4 млрд при оценке около $50 млрд и на полной скорости идет подготовка к IPO в Шанхае в 2027.

💰 Токеномика: выручка у DS в основном от продажи доступа к моделям через API.
Цена изначально была в разы ниже, чем у западных флагманов, доллар за миллион токенов против десятков у конкурентов, а маржа при этом 70–80%.
С новыми ценами, которые в среднем выросли в 3 раза, - маржа подскочи до 200%

💸 С такими цифрами можно и на IPO :)

📎 Источник: The Information

#DeepSeek #ИИ #бизнес
———
@tsingular
54🔥32
🔥 OX Alpha - это новая GLM

Bloomberg подтвердил: OX Alpha действительно относится к новой линейке GLM.

Ещё интереснее - веса модели обещают выложить уже сегодня.

Получается, все «инсайды» о том, что OX Alpha якобы не имеет отношения к новой GLM, оказались мимо.

Ждём релиз весов - после этого модель можно будет нормально разобрать уже без догадок.

https://x.com/Machinelearrn/status/2092567811562307615
🔥72🏆1
Forwarded from Machinelearning
Qwen показала Qwen3.8-Flash - мультимодальную MoE-модель и ранний превью архитектуры Qwen4.

- 125B параметров + 51B N-gram embeddings
- активируется всего 6B параметров на токен
- нативный контекст 262K, расширение до 1M через YaRN
- новая архитектура: GDN + QSA hybrid attention, Gated Residual, N-gram Embedding и Muon optimizer
- обучение обошлось примерно в 9 раз дешевле Qwen3.7-Plus

Бенчмарки:
- DeepSWE 1.1 - 58.7
- SWE-bench Pro - 62.5
- CoWorkBench - 73.9
- AndroidWorld - 84.5
- MathVision - 95.7

Продакшен-версия появится в QwenCloud:
$0.16 / 1M входных токенов
$0.47 / 1M выходных токенов

Также Qwen открывает веса Qwen3.8-Flash-Next - ранней версии архитектуры, которую команда исследует для Qwen4.

https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf

https://huggingface.co/Qwen/Qwen3.8-Flash-Next?spm=a2ty_o06.30285417.0.0.1d73c921FsyOPe&file=Qwen3.8-Flash-Next
🔥133👍2🤣2🆒1
Media is too big
VIEW IN TELEGRAM
Удивительно насколько обыденно смотрятся кадры, которые еще лет 10 назад звучали как абсолютная фантастика.

#Unitree #олимпиада #роботы
------
@tsingular
💯27🔥114👾3
GLM-5.3-Flash: мультимодальный кодинг уровня Opus 4.8 за десятую часть цены

Z.ai выпустила GLM-5.3-Flash, первую нативно мультимодальную модель серии GLM-5.
320 млрд параметров всего из них активных 18 млрд: она обходит GLM-5.2 на бенчмарках при цене в десять раз ниже.

⚡️ Что за модель:
Первая в GLM-5 с нативной мультимодальностью: видит интерфейсы, документы и картинки, а не только код.
320B/18B активных
На кодинге и агентных задачах вплотную подходит к Opus 4.8.

🔧 Архитектура под дешёвого инференса:
Гибридное внимание: линейное держит локальный контекст через состояние, разреженное вытаскивает нужный глобальный контекст через лёгкий индексатор.
IndexPool сжимает четыре ключа индексатора в один.
Итог в сравнеии с базовой GLM-5.3: вычислительная стоимость внимания и KV-кэш меньше в 3 и 4,4 раза.

📊 Цифры:
DeepSWE v1.1: 63,4 против 46,2 у GLM-5.2.
AutomationBench: 48,8 против 26,2.
На закрытом Code Bench при максимальном усилии: 29,0 против 29,5 у Opus 4.8.
Artificial Analysis Intelligence Index: 57 баллов за $0,045 за задачу, раньше такой уровень стоил вдесятеро дороже.

💼 Железо и раздача:
Неделю модель анонимно ходила как ox-alpha на OpenCode и OpenRouter и стала самой популярной за неделю, а весь трафик обслуживали китайские чипы.
Собственный движок поверх SGLang дал 3х к базовому варианту, цена токена вышла на уровень NVIDIA.

Вишенка на торте: оптимизировать движок помогал инфраструктурный агент на самой GLM-5.3, петля, где модель ускоряла систему, которая её обслуживает.
Веса открыты, запускается на SGLang, vLLM и TokenSpeed.

📎 Анонс: Z.ai · веса на HuggingFace

#GLM #кодинг #opensource #oxalpha
———
@tsingular
9🔥7👍511
Qwen38-Flash-Next уже нарезали на размеры поменьше для всех у кого есть 128Gb VRAM

https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF

#Qwen #Unsloth
------
@tsingular
🔥853😢2
держите сравнение.
GLM в целом побеждает, но у Qwen очень сильный "запас прочности"

полный html в комметарии

#qwen #glm #deepseek #flash
———
@tsingular
🔥18🆒2👍1