В США теперь тратят на строительство дата-центров больше денег, чем на транспортную инфраструктуру.
Согласно новым данным, расходы на возведение дата-центров достигли $50,7 миллиардов в годовом выражении, а на железные дороги, аэропорты и автобусы — около $49,3.
Согласно новым данным, расходы на возведение дата-центров достигли $50,7 миллиардов в годовом выражении, а на железные дороги, аэропорты и автобусы — около $49,3.
🔥3
Нейросети впервые судились друг с другом: в США адвокаты обеих сторон использовали ChatGPT при подготовке документов и ссылались на несуществующие дела. Судья заметил ошибку и наказал сразу обоих юристов. Если ранее на выдуманных прецедентах ловили лишь одну сторону, то на этот раз состоялась полноценная битва между ИИ.
😁2👀2
Продакшен больших моделей — штука дорогая и в таких масштабах реально бьются за каждый процент скорости.
Tencent Hunyuan AI Infra выложила в открытый доступ HPC-Ops - рабочую библиотеку, на которой, в том числе, крутится их собственная инфраструктура.
Разработчики решили не латать старое, а переписали все с нуля на чистой CUDA и CuTe специально под архитектуру Hopper.
И это логично: популярные решения вроде vLLM или дефолтного FlashAttention часто не до конца утилизируют возможности железа. В HPC-Ops же целью была максимальная загрузка GPU.
Внутри есть все, что нужно для сборки серьезного инференса: оптимизированные ядра внимания с paged attention, квантованный Grouped GEMM с поддержкой FP8 и блочным скейлингом, Fused MoE и инструменты связи нод для распределенных систем.
На своих моделях с HPC-Ops у Tencent пропускная способность выросла на 30%, а для DeepSeek на 17%. Но интереснее всего дела обстоят с H20: там библиотека бустит ускорение до 2.22x по сравнению с тем, что было раньше.
Если закопаться в цифры, то самый большой прирост на декодинге. Механизм внимания в BF16 на декоде работает в 2.2 раза быстрее, чем связка из FlashInfer, FlashAttention и TensorRT-LLM.
На префилле профит поменьше — около 1.33x, но это тоже очень ощутимо.
С FP8 история похожая: ускорение в 2 раза на декодинге и небольшие, но приятные 12% на префилле. Тот же FusedMoE в FP8 прибавляет почти 50% скорости в режиме префилла.
HPC-Ops дружелюбен к vLLM и SGLang, но имейте в виду, что старое железо тут не поддерживается, это инструмент для карт SM90.
В планах на будущее:
Если вы сейчас оптимизируете инференс на Хопперах и боретесь за каждый токен в секунду эту штуку стоит как минимум потестить.
#AI #ML #LLM #HPCOps #Tencent
Please open Telegram to view this post
VIEW IN TELEGRAM
GitHub
GitHub - Tencent/hpc-ops: High Performance LLM Inference Operator Library
High Performance LLM Inference Operator Library. Contribute to Tencent/hpc-ops development by creating an account on GitHub.
Please open Telegram to view this post
VIEW IN TELEGRAM
🫡6
Команда агентов Claude за две недели и 20к долларов (почти) автономно с нуля написала C‑компилятор на Rust
Таким заданием в Anthropic решили протестировать новую модель Claude Opus 4.6. Пишут, что это первая модель линейки Opus (и, возможно, вообще первая модель в мире), способная собирать настолько большие системы.
Всего над задачей работали 16 параллельных агентов. Их запускают в бесконечном цикле: как только одна сессия заканчивается, тут же стартует новая, без участия человека. При этом интересно, что у них даже не было никакого единого оркестратора или босса-агента.
То есть агенты сами решают, что делать дальше. Разделение задач реализуется через файловые локи в current_tasks/: файл с именем задачи сигнализирует, что агент её занял, а git‑конфликты вынуждают агентов выбирать разные задачи.
Всего получилось около 100к строк кода, а сожрано было ~2 млрд входных и 140 млн выходных токенов (это примерно 20 000 $). Много это или мало, судите сами, но как минимум это бесспорно дешевле, чем нанимать команду.
При этом код получился, конечно, неидеальный, хотя и рабочий. Компилятор может собрать Linux‑ядро 6.9 под x86, ARM и RISC‑V, а также крупные проекты вроде QEMU, SQLite и Doom, проходит около 99 % тестов из стандартных тест‑сьютов. Но часть проектов все равно на нем собрать невозможно, а ассемблер и линкер слишком сырые. Производительность даже с включенными оптимизациями хуже, чем у GCC без оптимизаций.
И тем не менее, это, конечно, что-то. Мог ли кто-то в 2020 подумать, что в начале 2026 ИИ будет писать полноценные компиляторы?
https://www.anthropic.com/engineering/building-c-compiler
Таким заданием в Anthropic решили протестировать новую модель Claude Opus 4.6. Пишут, что это первая модель линейки Opus (и, возможно, вообще первая модель в мире), способная собирать настолько большие системы.
Всего над задачей работали 16 параллельных агентов. Их запускают в бесконечном цикле: как только одна сессия заканчивается, тут же стартует новая, без участия человека. При этом интересно, что у них даже не было никакого единого оркестратора или босса-агента.
То есть агенты сами решают, что делать дальше. Разделение задач реализуется через файловые локи в current_tasks/: файл с именем задачи сигнализирует, что агент её занял, а git‑конфликты вынуждают агентов выбирать разные задачи.
Всего получилось около 100к строк кода, а сожрано было ~2 млрд входных и 140 млн выходных токенов (это примерно 20 000 $). Много это или мало, судите сами, но как минимум это бесспорно дешевле, чем нанимать команду.
При этом код получился, конечно, неидеальный, хотя и рабочий. Компилятор может собрать Linux‑ядро 6.9 под x86, ARM и RISC‑V, а также крупные проекты вроде QEMU, SQLite и Doom, проходит около 99 % тестов из стандартных тест‑сьютов. Но часть проектов все равно на нем собрать невозможно, а ассемблер и линкер слишком сырые. Производительность даже с включенными оптимизациями хуже, чем у GCC без оптимизаций.
И тем не менее, это, конечно, что-то. Мог ли кто-то в 2020 подумать, что в начале 2026 ИИ будет писать полноценные компиляторы?
https://www.anthropic.com/engineering/building-c-compiler
Anthropic
Building a C compiler with a team of parallel Claudes
Anthropic is an AI safety and research company that's working to build reliable, interpretable, and steerable AI systems.
🔥3
This media is not supported in your browser
VIEW IN TELEGRAM
Теперь ваш бэкенд может рассказать, что ему не нравится — нашли для вас open-source платформу под названием Maple.
Работает всё очень просто: ИИ-агент подключается через MCP, находит ошибку и предлагает исправление.
Всё крайне удобно структурировано, поэтому разобраться будет просто — забираем тут😛
Эпоха вайб-кодинга кончилась. Начался Вайб-analysing
Работает всё очень просто: ИИ-агент подключается через MCP, находит ошибку и предлагает исправление.
Всё крайне удобно структурировано, поэтому разобраться будет просто — забираем тут
Эпоха вайб-кодинга кончилась. Начался Вайб-analysing
Please open Telegram to view this post
VIEW IN TELEGRAM
Дальше будет так, что код будем собирать из агентов, и снова ручной кодинг. Сделали виток, нарастили уровень абстракции и пришли к тому от чего ушли, с одним НО - код стал сложнее и он перестал быть статичным, он стал динамическим.
❗️Правительство США обязало американскую компанию Anthropic закрыть доступ к своим самым передовым ИИ-моделям Fable 5 и Mythos 5 для всех иностранных пользователей, не являющихся американцами. Компания отключила от ИИ-моделей всех пользователей, об этом говорится в заявлении компании.
Из него следует, что доступ к Fable 5 и Mythos 5 должен быть закрыт по соображениям безопасности для всех иностранцев — как за рубежом, так и на территории США, включая зарубежных работников самой Anthropic.
Из него следует, что доступ к Fable 5 и Mythos 5 должен быть закрыт по соображениям безопасности для всех иностранцев — как за рубежом, так и на территории США, включая зарубежных работников самой Anthropic.
«Фактически это означает, что мы вынуждены незамедлительно отключить Fable 5 и Mythos 5 для всех наших клиентов, чтобы обеспечить соблюдение директивы. Доступ ко всем остальным моделям Anthropic затронут не будет», — говорится в заявлении.
Нашел мега крутой магаз, оборудование для лонгов, скейтов, вейк-бордов, сноубордов и так далее. Ценник разный, но выбрать можно. Лето !!!)))
🔥2