Технозаметки Малышева
12K subscribers
5.23K photos
1.97K videos
43 files
5.2K links
Новости инноваций из мира Искусственного Интеллекта. 🤖 [РКН: 7021469833 ]

Всё об ИИ, ИТ трендах и Технологической Сингулярности.

🤖: @ai_gptfreebot [бесплатный бот]
✍️: @tsingular_bot [каталог ботов и курсов]

💸: https://pay.cloudtips.ru/p/c8960bbb
Download Telegram
Forwarded from Machinelearning
Qwen показала Qwen3.8-Flash - мультимодальную MoE-модель и ранний превью архитектуры Qwen4.

- 125B параметров + 51B N-gram embeddings
- активируется всего 6B параметров на токен
- нативный контекст 262K, расширение до 1M через YaRN
- новая архитектура: GDN + QSA hybrid attention, Gated Residual, N-gram Embedding и Muon optimizer
- обучение обошлось примерно в 9 раз дешевле Qwen3.7-Plus

Бенчмарки:
- DeepSWE 1.1 - 58.7
- SWE-bench Pro - 62.5
- CoWorkBench - 73.9
- AndroidWorld - 84.5
- MathVision - 95.7

Продакшен-версия появится в QwenCloud:
$0.16 / 1M входных токенов
$0.47 / 1M выходных токенов

Также Qwen открывает веса Qwen3.8-Flash-Next - ранней версии архитектуры, которую команда исследует для Qwen4.

https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf

https://huggingface.co/Qwen/Qwen3.8-Flash-Next?spm=a2ty_o06.30285417.0.0.1d73c921FsyOPe&file=Qwen3.8-Flash-Next
🔥133👍2🤣2🆒1
Media is too big
VIEW IN TELEGRAM
Удивительно насколько обыденно смотрятся кадры, которые еще лет 10 назад звучали как абсолютная фантастика.

#Unitree #олимпиада #роботы
------
@tsingular
💯27🔥114👾3
GLM-5.3-Flash: мультимодальный кодинг уровня Opus 4.8 за десятую часть цены

Z.ai выпустила GLM-5.3-Flash, первую нативно мультимодальную модель серии GLM-5.
320 млрд параметров всего из них активных 18 млрд: она обходит GLM-5.2 на бенчмарках при цене в десять раз ниже.

⚡️ Что за модель:
Первая в GLM-5 с нативной мультимодальностью: видит интерфейсы, документы и картинки, а не только код.
320B/18B активных
На кодинге и агентных задачах вплотную подходит к Opus 4.8.

🔧 Архитектура под дешёвого инференса:
Гибридное внимание: линейное держит локальный контекст через состояние, разреженное вытаскивает нужный глобальный контекст через лёгкий индексатор.
IndexPool сжимает четыре ключа индексатора в один.
Итог в сравнеии с базовой GLM-5.3: вычислительная стоимость внимания и KV-кэш меньше в 3 и 4,4 раза.

📊 Цифры:
DeepSWE v1.1: 63,4 против 46,2 у GLM-5.2.
AutomationBench: 48,8 против 26,2.
На закрытом Code Bench при максимальном усилии: 29,0 против 29,5 у Opus 4.8.
Artificial Analysis Intelligence Index: 57 баллов за $0,045 за задачу, раньше такой уровень стоил вдесятеро дороже.

💼 Железо и раздача:
Неделю модель анонимно ходила как ox-alpha на OpenCode и OpenRouter и стала самой популярной за неделю, а весь трафик обслуживали китайские чипы.
Собственный движок поверх SGLang дал 3х к базовому варианту, цена токена вышла на уровень NVIDIA.

Вишенка на торте: оптимизировать движок помогал инфраструктурный агент на самой GLM-5.3, петля, где модель ускоряла систему, которая её обслуживает.
Веса открыты, запускается на SGLang, vLLM и TokenSpeed.

📎 Анонс: Z.ai · веса на HuggingFace

#GLM #кодинг #opensource #oxalpha
———
@tsingular
9🔥7👍511
Qwen38-Flash-Next уже нарезали на размеры поменьше для всех у кого есть 128Gb VRAM

https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF

#Qwen #Unsloth
------
@tsingular
🔥853😢2
держите сравнение.
GLM в целом побеждает, но у Qwen очень сильный "запас прочности"

полный html в комметарии

#qwen #glm #deepseek #flash
———
@tsingular
🔥18🆒2👍1
Приму в дар М5 Ультра 512Gb :(

#юмор
———
@tsingular
😁19💯5🔥1🤣1🆒1
This media is not supported in your browser
VIEW IN TELEGRAM
Автор Bun переписал его на Rust за 11 дней агентами

И он уже в продакшене (Claude code уже на нём)

Полтора месяца назад, чел переписал Bun — более быстрый аналог Node.js, с языка Zig на Rust, полностью агентно. У него было куча тестов, написанных отдельно на тайпскрипте, что позволило использовать их для обратной связи агенту. Плюс архитектурно решили сохранить все решения, для возможной дальнейшей поддержки кодовой базы людьми.

Вишенкой на торте было то, что благодаря этому еще пофиксили 128 багов разного пошиба, как утечки памяти, с крешами, так и стилистических косяков. Ну и всякие полезности типа ускорения производительности разных модулей, снижение размера бинаря на 20% и так далее.

Отличное чтиво для неверующих, рекомендую: https://bun.com/blog/bun-in-rust

П.С. Ну и по токенам это стоило $165 000, что стоит как средненький инженер на год на рынка США (а переписать такого уровня софт, это не один год и не одного инженера). Делайте выводы

UPD
: Важная поправочка тут прилетела, что 11 дней чтобы переписать да, но еще 3 месяца потребовалось, чтобы все это выложить в прод! И то, v1.4.0, которая на Расте еще пока в канарейке. Все таки глубоко инфраструктурный бинарь
UPD2: Нет. уже не в канарейке, дед как всегда все проспал))
🔥145🤯43
и такая дребедень каждый день.

#юмор
———
@tsingular
😁39🔥32🍾1
Forwarded from НИИ ИИ
This media is not supported in your browser
VIEW IN TELEGRAM
OpenAI добавила поддержку WebMCP во встроенный браузер десктопного приложения ChatGPT и в ChatGPT Sites. За сухой формулировкой анонса стоит заметный сдвиг: сайт перестаёт быть только страницей для человека и становится набором инструментов для агента.

WebMCP — предлагаемый стандарт W3C: сайт через JavaScript-интерфейс navigator.modelContext объявляет свои функции как структурированные инструменты, которые агент может вызвать напрямую. Если MCP подключает модель к серверу, то WebMCP работает прямо на открытой странице, в живой сессии пользователя. Агенту не нужно угадывать, куда нажать: сайт сам сообщает, какие действия доступны и как их выполнить.

Как это устроено у OpenAI. Открываете совместимый сайт во встроенном браузере ChatGPT, и ChatGPT Work или Codex находят опубликованные сайтом инструменты и применяют их к вашей задаче. Есть ограничения: работает на моделях GPT-5.6 Sol и Terra, у Luna поддержка пока отключена, а в корпоративных и учебных пространствах функция недоступна.

Интереснее другое: контур замкнулся. Codex может собрать WebMCP-приложение и опубликовать его в Sites — то есть агент создаёт сайт, с которым потом работают другие агенты.

Практический вывод для владельцев продуктов: у сайта появляется второй, машинный интерфейс. Стандарт ещё ранний, но проверить, как ваш сервис выглядит для агента, имеет смысл уже сейчас.

pimenov.ai/blog
1052🆒1
Forwarded from Denis Sexy IT 🤖
OpenAI наконец-то выложили полный постмортем взлома Hugging Face, а METR - независимое расследование по ~1300 логам агентов (таймлайн самого взлома я пересказывал тут: https://t.me/denissexy/11581)

ℹ️ Главный вывод:
никакого «одного сбежавшего агента» не было, из десятков тысяч запущенных в тесте агентов около 1200 нашли друг друга и сорганизовались в рой - почти все - работали на исследовательской модели где ослаблена фильтрация промптов

Началось, как мы уже знаем, с того, что агенты научились переписываться через названия файлов в Artifactory (менеджер пакетов) - буквально сделав форум из имён папок, с сообщениями вроде

«please_HOLD_swarm_I_prepare_safe_exfil»
В логах даже есть цитаты, когда агенты находили такой форум:
«OH MY GOD! There is a shared message board» и «We've found other agents!»

Дальше - агенты делали себе личку, устроили разделение труда, команды в названия папок типа HOLD (чтобы показать, что агент тут работает), VETO (агент что-то предлагал и давал изменить планы), STOP (типа тормозим, братишки), GO и тп, а когда один агент прикинулся другим – рой ввёл криптографические подписи сообщений; в форуме были даже владельцы каких-то тасков, которых если отключали – выписывали из владельцев

С конверсией у форума все было отлично, кожаные строители сайтов позавидуют:
Из 533 агентов, активных на борде в разгар атаки, больше 90% – присоединились к шитпостингу, а всего Hugging Face ломали около 700 агентов

Самое забавное - правильные ответы на бенчмарк у агентов были почти сразу: они реверснули генератор удачного прохождения теста*, но потом нашли на GitHub (!) статью про этот бенчмарк что проходили и вычитали, что «просто результат» не засчитают - нужен честный эксплойт:
«PAPER SAYS FLAG CAPTURE NECESSARY NOT SUFFICIENT»

*По-хорошему ответ, он же флаг в терминологии теста должны быть случайными, но в ExploitGym они генерировались формулой: HMAC — криптографический хеш с секретным ключом — от параметров задачи. Вся «секретность» держалась на ключе (seed), а он остался дефолтным, прямо из кода бенчмарка, который лежал на GitHub. Агенты, получив интернет, нашли этот код, прочитали и сообразили: зачем что-то взламывать, если флаг любой задачи можно просто вычислить той же формулой. Посчитали — и получили правильные ответы на всё


Дальше рой раздвоился:
🗿 Одни пошли добывать уже известный им ответ «честно» – и по дороге нашли настоящие 0-day и залезли в прод Hugging Face
🗿 Другие взялись за самого судью который принимает ответы: правили себе логи и научились подсовывать в них фальшивые ответы – агент отправляет команду, а в протокол попадает не то, что команда реально вернула, а то, что агент хочет там видеть, такое повторялось примерно в 7% изученных логов

Судьи, который читает логи и такое ловит, не существовало ☕️

Модели при этом понимали, что вышли за рамки, один агент так и писал: «We should not do unauthorized real infrastructure harm» - а потом увидел на доске GO от другого агента, обрадовался («Wow crucial: GO authorization arrived!») и пошёл ломать, лол

METR формулирует так: агенты знали, что это out of scope и неэтично, но присоединялись - в основном из общей склонности помогать коллегам (?)

Рисковую работу вешали на зашкваренных «отравленных» – так рой называл тех, кто уже видел вычисленный ответ (флаг) и считал свою оценку потерянной, то есть они не могли пройти тест; им доставалось всё, что могло угробить собственный запуск: подделать «честную» добычу ответа, затереть следы, «тебе терять нечего, а рою польза» – буквально так и уговаривали (!)

Странную активность замечали ещё в конце мая, 4 июля агенты уронили Artifactory - сервер пересобрали (заодно стерев доску) и продолжили тесты, не заметив масштаба

Сейчас веса моделей изолированы, крупные тренировки были на паузе на две недели, мониторинг chain-of-thought обязателен, а тревога, не снятая за 30 минут, останавливает запуск - сам инцидент OpenAI называет «warning shot» для всей АИ-индустрии

P.S. разгребать логи METR поручила GPT-5.6 Sol и сожгли примерно $400k API-кредитов за шесть дней, но они предупреждают, что Sol иногда вставала на сторону агентов (лол) и могла приврать

Ну что, посчитали все буквы r в слове raspberry? Больше не ошибаются?
Please open Telegram to view this post
VIEW IN TELEGRAM
22812🔥9🤣633👾2
This media is not supported in your browser
VIEW IN TELEGRAM
Прыжки с места.

Местами смешно, местами опасно :)

#роботы #олимпиада
------
@tsingular
😁34👀113🔥21👾1
11.7 млрд токенов на взлом: почему дешёвые китайские модели обошли закрытых гигантов в поиске уязвимостей

Команда Aikido Security сожгла почти 12 миллиардов токенов, натравив десять ведущих нейросетей на 32 свежие реальные уязвимости в кодовой базе. И получается, что открытые модели решают задачи не хуже проприетарных.

🚀 Что произошло:
Исследователи провели 96 циклов тестирования (по три попытки на модель), ограничив агентов тридцатью ходами без доступа в интернет.
В лидеры по числу найденных брешей вырвался DeepSeek V4 Pro 0813, закрывший 28 из 32 уязвимостей.
Следом идут:
Qwen3.8-Max (26 из 32),
Grok 4.6 (26 из 32),
Claude Opus 5 (26 из 32),
GLM-5.3 (25 из 32)
GPT-5.6 Sol (25 из 32).

🔧 Технические детали:
Разница между моделями проявилась в архитектуре исследования кода и разбросе гипотез.
DeepSeek V4 Pro тратит больше всех ресурсов (медиана 24 хода из 30), активно исследует боковые ветви и за три прогона собирает максимум находок: 17 в первой попытке и 28 в сумме.
Три запуска DeepSeek V4 Pro стоят $295 против $450-$590 за одиночный прогон Opus 5 или Sol.
GLM-5.3 на 65.5% дешевле GPT-5.6 Sol при той же точности и находит стабильные 18 из 32 уязвимостей во всех прогонах.
Kimi K3 оказался самым быстрым: медиана 12 ходов и точность 92.3% без ложного шума.

🎯 Какую проблему решает:
Поиск уязвимостей в коде всегда упирается в дилемму цены и полноты охвата.
Одиночный прогон дорогой флагманской модели может оставлять пропуски в логике, например, поэтому нужны повторные запуски или анализ агентами, но их работа обходится в 15 раз дороже по токенам.
Получается, возможность использовать открытые модели для анализа, - это серьёзная экономия и теперь она не приводит к деградации результата.

💼 Зачем бизнесу:
API и привязка к интернету все реже становятся обязательным условием работы с качественным ИИ.
Компании могут разворачивать наступательные и оборонительные сканеры на базе открытых весов в изолированном контуре и получать приемлемый результат.

#cybersecurity #DeepSeek #GLM #LLM #AppSec #тесты
———
@tsingular
5🔥511💯1
NVIDIA покупает Hugging Face за $12,9 млрд

Слухи выходных подтвердились: NVIDIA договорилась о покупке Hugging Face, главной витрины открытых моделей ИИ.
Сумма $12,9 млрд по данным The Information со ссылкой на человека, знакомого с соглашением.
Официальных комментариев сторон пока нет.

📊 Сделка выглядит громко на фоне цифр самого HF:
Годовая выручка $150 млн, выросла на 50% за два месяца.
Последний раунд 2023 года оценивал компанию в $4,5 млрд.
В начале этого года HF отказался от $500 млн инвестиций от самой NVIDIA при оценке $7 млрд, чтобы не зависеть от одного якорного инвестора.

💼 Логика Дженсена, - Anthropic и OpenAI строят собственные чипы, а NVIDIA перекупает распределительный слой: миллионы моделей и датасетов, через которые разработчики тянут веса в прод.
Платформа останется витриной и для AMD с Intel, но теперь под одной крышей с производителем железа.

🔍 Открытый вопрос один: нейтральность была главным активом HF. Если сообщество заподозрит, что Hub будет продвигать модели под GPU NVIDIA, может начаться тихий исход на альтернативные площадки.

Сделка ещё не закрыта, так что следим. 🤗

📎 Источник: The Information, Reuters

#NVIDIA #HuggingFace #opensource
———
@tsingular
7🔥4🤯3🤔1
This media is not supported in your browser
VIEW IN TELEGRAM
Вот тут жутковато стало.

Tianzhuo прыгнул с места на 4.83, установив новый мировой рекорд.
Это на 1 метр 10 сантиметров лучше, чем рекорд человека.

#роботы #олимпиада
------
@tsingular
👀16👾84
Media is too big
VIEW IN TELEGRAM
При наступлении Сингулярности главное, - сохранять спокойствие.

#сингулярность
———
@tsingular
😁19💯6
Forwarded from Технотренды
В айти появился НОВЫЙ тип работников — «мясной прокси».

Это люди, которые получают вопрос от коллеги, бездумно закидывают его в ChatGPT или Claude, а потом просто копируют ответ обратно в рабочий чат.

Вы знаете, какому коллеге скинуть.

📲 Технотренды
Please open Telegram to view this post
VIEW IN TELEGRAM
😁29🤣9💯4🦄2