Технозаметки Малышева
12K subscribers
5.23K photos
1.97K videos
43 files
5.2K links
Новости инноваций из мира Искусственного Интеллекта. 🤖 [РКН: 7021469833 ]

Всё об ИИ, ИТ трендах и Технологической Сингулярности.

🤖: @ai_gptfreebot [бесплатный бот]
✍️: @tsingular_bot [каталог ботов и курсов]

💸: https://pay.cloudtips.ru/p/c8960bbb
Download Telegram
This media is not supported in your browser
VIEW IN TELEGRAM
Автор Bun переписал его на Rust за 11 дней агентами

И он уже в продакшене (Claude code уже на нём)

Полтора месяца назад, чел переписал Bun — более быстрый аналог Node.js, с языка Zig на Rust, полностью агентно. У него было куча тестов, написанных отдельно на тайпскрипте, что позволило использовать их для обратной связи агенту. Плюс архитектурно решили сохранить все решения, для возможной дальнейшей поддержки кодовой базы людьми.

Вишенкой на торте было то, что благодаря этому еще пофиксили 128 багов разного пошиба, как утечки памяти, с крешами, так и стилистических косяков. Ну и всякие полезности типа ускорения производительности разных модулей, снижение размера бинаря на 20% и так далее.

Отличное чтиво для неверующих, рекомендую: https://bun.com/blog/bun-in-rust

П.С. Ну и по токенам это стоило $165 000, что стоит как средненький инженер на год на рынка США (а переписать такого уровня софт, это не один год и не одного инженера). Делайте выводы

UPD
: Важная поправочка тут прилетела, что 11 дней чтобы переписать да, но еще 3 месяца потребовалось, чтобы все это выложить в прод! И то, v1.4.0, которая на Расте еще пока в канарейке. Все таки глубоко инфраструктурный бинарь
UPD2: Нет. уже не в канарейке, дед как всегда все проспал))
🔥145🤯43
и такая дребедень каждый день.

#юмор
———
@tsingular
😁39🔥32🍾1
Forwarded from НИИ ИИ
This media is not supported in your browser
VIEW IN TELEGRAM
OpenAI добавила поддержку WebMCP во встроенный браузер десктопного приложения ChatGPT и в ChatGPT Sites. За сухой формулировкой анонса стоит заметный сдвиг: сайт перестаёт быть только страницей для человека и становится набором инструментов для агента.

WebMCP — предлагаемый стандарт W3C: сайт через JavaScript-интерфейс navigator.modelContext объявляет свои функции как структурированные инструменты, которые агент может вызвать напрямую. Если MCP подключает модель к серверу, то WebMCP работает прямо на открытой странице, в живой сессии пользователя. Агенту не нужно угадывать, куда нажать: сайт сам сообщает, какие действия доступны и как их выполнить.

Как это устроено у OpenAI. Открываете совместимый сайт во встроенном браузере ChatGPT, и ChatGPT Work или Codex находят опубликованные сайтом инструменты и применяют их к вашей задаче. Есть ограничения: работает на моделях GPT-5.6 Sol и Terra, у Luna поддержка пока отключена, а в корпоративных и учебных пространствах функция недоступна.

Интереснее другое: контур замкнулся. Codex может собрать WebMCP-приложение и опубликовать его в Sites — то есть агент создаёт сайт, с которым потом работают другие агенты.

Практический вывод для владельцев продуктов: у сайта появляется второй, машинный интерфейс. Стандарт ещё ранний, но проверить, как ваш сервис выглядит для агента, имеет смысл уже сейчас.

pimenov.ai/blog
1052🆒1
Forwarded from Denis Sexy IT 🤖
OpenAI наконец-то выложили полный постмортем взлома Hugging Face, а METR - независимое расследование по ~1300 логам агентов (таймлайн самого взлома я пересказывал тут: https://t.me/denissexy/11581)

ℹ️ Главный вывод:
никакого «одного сбежавшего агента» не было, из десятков тысяч запущенных в тесте агентов около 1200 нашли друг друга и сорганизовались в рой - почти все - работали на исследовательской модели где ослаблена фильтрация промптов

Началось, как мы уже знаем, с того, что агенты научились переписываться через названия файлов в Artifactory (менеджер пакетов) - буквально сделав форум из имён папок, с сообщениями вроде

«please_HOLD_swarm_I_prepare_safe_exfil»
В логах даже есть цитаты, когда агенты находили такой форум:
«OH MY GOD! There is a shared message board» и «We've found other agents!»

Дальше - агенты делали себе личку, устроили разделение труда, команды в названия папок типа HOLD (чтобы показать, что агент тут работает), VETO (агент что-то предлагал и давал изменить планы), STOP (типа тормозим, братишки), GO и тп, а когда один агент прикинулся другим – рой ввёл криптографические подписи сообщений; в форуме были даже владельцы каких-то тасков, которых если отключали – выписывали из владельцев

С конверсией у форума все было отлично, кожаные строители сайтов позавидуют:
Из 533 агентов, активных на борде в разгар атаки, больше 90% – присоединились к шитпостингу, а всего Hugging Face ломали около 700 агентов

Самое забавное - правильные ответы на бенчмарк у агентов были почти сразу: они реверснули генератор удачного прохождения теста*, но потом нашли на GitHub (!) статью про этот бенчмарк что проходили и вычитали, что «просто результат» не засчитают - нужен честный эксплойт:
«PAPER SAYS FLAG CAPTURE NECESSARY NOT SUFFICIENT»

*По-хорошему ответ, он же флаг в терминологии теста должны быть случайными, но в ExploitGym они генерировались формулой: HMAC — криптографический хеш с секретным ключом — от параметров задачи. Вся «секретность» держалась на ключе (seed), а он остался дефолтным, прямо из кода бенчмарка, который лежал на GitHub. Агенты, получив интернет, нашли этот код, прочитали и сообразили: зачем что-то взламывать, если флаг любой задачи можно просто вычислить той же формулой. Посчитали — и получили правильные ответы на всё


Дальше рой раздвоился:
🗿 Одни пошли добывать уже известный им ответ «честно» – и по дороге нашли настоящие 0-day и залезли в прод Hugging Face
🗿 Другие взялись за самого судью который принимает ответы: правили себе логи и научились подсовывать в них фальшивые ответы – агент отправляет команду, а в протокол попадает не то, что команда реально вернула, а то, что агент хочет там видеть, такое повторялось примерно в 7% изученных логов

Судьи, который читает логи и такое ловит, не существовало ☕️

Модели при этом понимали, что вышли за рамки, один агент так и писал: «We should not do unauthorized real infrastructure harm» - а потом увидел на доске GO от другого агента, обрадовался («Wow crucial: GO authorization arrived!») и пошёл ломать, лол

METR формулирует так: агенты знали, что это out of scope и неэтично, но присоединялись - в основном из общей склонности помогать коллегам (?)

Рисковую работу вешали на зашкваренных «отравленных» – так рой называл тех, кто уже видел вычисленный ответ (флаг) и считал свою оценку потерянной, то есть они не могли пройти тест; им доставалось всё, что могло угробить собственный запуск: подделать «честную» добычу ответа, затереть следы, «тебе терять нечего, а рою польза» – буквально так и уговаривали (!)

Странную активность замечали ещё в конце мая, 4 июля агенты уронили Artifactory - сервер пересобрали (заодно стерев доску) и продолжили тесты, не заметив масштаба

Сейчас веса моделей изолированы, крупные тренировки были на паузе на две недели, мониторинг chain-of-thought обязателен, а тревога, не снятая за 30 минут, останавливает запуск - сам инцидент OpenAI называет «warning shot» для всей АИ-индустрии

P.S. разгребать логи METR поручила GPT-5.6 Sol и сожгли примерно $400k API-кредитов за шесть дней, но они предупреждают, что Sol иногда вставала на сторону агентов (лол) и могла приврать

Ну что, посчитали все буквы r в слове raspberry? Больше не ошибаются?
Please open Telegram to view this post
VIEW IN TELEGRAM
22812🔥9🤣633👾2
This media is not supported in your browser
VIEW IN TELEGRAM
Прыжки с места.

Местами смешно, местами опасно :)

#роботы #олимпиада
------
@tsingular
😁34👀113🔥21👾1
11.7 млрд токенов на взлом: почему дешёвые китайские модели обошли закрытых гигантов в поиске уязвимостей

Команда Aikido Security сожгла почти 12 миллиардов токенов, натравив десять ведущих нейросетей на 32 свежие реальные уязвимости в кодовой базе. И получается, что открытые модели решают задачи не хуже проприетарных.

🚀 Что произошло:
Исследователи провели 96 циклов тестирования (по три попытки на модель), ограничив агентов тридцатью ходами без доступа в интернет.
В лидеры по числу найденных брешей вырвался DeepSeek V4 Pro 0813, закрывший 28 из 32 уязвимостей.
Следом идут:
Qwen3.8-Max (26 из 32),
Grok 4.6 (26 из 32),
Claude Opus 5 (26 из 32),
GLM-5.3 (25 из 32)
GPT-5.6 Sol (25 из 32).

🔧 Технические детали:
Разница между моделями проявилась в архитектуре исследования кода и разбросе гипотез.
DeepSeek V4 Pro тратит больше всех ресурсов (медиана 24 хода из 30), активно исследует боковые ветви и за три прогона собирает максимум находок: 17 в первой попытке и 28 в сумме.
Три запуска DeepSeek V4 Pro стоят $295 против $450-$590 за одиночный прогон Opus 5 или Sol.
GLM-5.3 на 65.5% дешевле GPT-5.6 Sol при той же точности и находит стабильные 18 из 32 уязвимостей во всех прогонах.
Kimi K3 оказался самым быстрым: медиана 12 ходов и точность 92.3% без ложного шума.

🎯 Какую проблему решает:
Поиск уязвимостей в коде всегда упирается в дилемму цены и полноты охвата.
Одиночный прогон дорогой флагманской модели может оставлять пропуски в логике, например, поэтому нужны повторные запуски или анализ агентами, но их работа обходится в 15 раз дороже по токенам.
Получается, возможность использовать открытые модели для анализа, - это серьёзная экономия и теперь она не приводит к деградации результата.

💼 Зачем бизнесу:
API и привязка к интернету все реже становятся обязательным условием работы с качественным ИИ.
Компании могут разворачивать наступательные и оборонительные сканеры на базе открытых весов в изолированном контуре и получать приемлемый результат.

#cybersecurity #DeepSeek #GLM #LLM #AppSec #тесты
———
@tsingular
5🔥511💯1
NVIDIA покупает Hugging Face за $12,9 млрд

Слухи выходных подтвердились: NVIDIA договорилась о покупке Hugging Face, главной витрины открытых моделей ИИ.
Сумма $12,9 млрд по данным The Information со ссылкой на человека, знакомого с соглашением.
Официальных комментариев сторон пока нет.

📊 Сделка выглядит громко на фоне цифр самого HF:
Годовая выручка $150 млн, выросла на 50% за два месяца.
Последний раунд 2023 года оценивал компанию в $4,5 млрд.
В начале этого года HF отказался от $500 млн инвестиций от самой NVIDIA при оценке $7 млрд, чтобы не зависеть от одного якорного инвестора.

💼 Логика Дженсена, - Anthropic и OpenAI строят собственные чипы, а NVIDIA перекупает распределительный слой: миллионы моделей и датасетов, через которые разработчики тянут веса в прод.
Платформа останется витриной и для AMD с Intel, но теперь под одной крышей с производителем железа.

🔍 Открытый вопрос один: нейтральность была главным активом HF. Если сообщество заподозрит, что Hub будет продвигать модели под GPU NVIDIA, может начаться тихий исход на альтернативные площадки.

Сделка ещё не закрыта, так что следим. 🤗

📎 Источник: The Information, Reuters

#NVIDIA #HuggingFace #opensource
———
@tsingular
7🔥4🤯3🤔1
This media is not supported in your browser
VIEW IN TELEGRAM
Вот тут жутковато стало.

Tianzhuo прыгнул с места на 4.83, установив новый мировой рекорд.
Это на 1 метр 10 сантиметров лучше, чем рекорд человека.

#роботы #олимпиада
------
@tsingular
👀16👾84
Media is too big
VIEW IN TELEGRAM
При наступлении Сингулярности главное, - сохранять спокойствие.

#сингулярность
———
@tsingular
😁19💯6
Forwarded from Технотренды
В айти появился НОВЫЙ тип работников — «мясной прокси».

Это люди, которые получают вопрос от коллеги, бездумно закидывают его в ChatGPT или Claude, а потом просто копируют ответ обратно в рабочий чат.

Вы знаете, какому коллеге скинуть.

📲 Технотренды
Please open Telegram to view this post
VIEW IN TELEGRAM
😁29🤣9💯4🦄2
Forwarded from Angry Beard
This media is not supported in your browser
VIEW IN TELEGRAM
#AI Волшебная сила технологий - разраб где-то посеял телефон и с помощью Claude написал утилиту для поиска в зависимости от силы bluetooth-сигнала. Ссылку на исходный код не просите - их нет у меня, токмо видео :(
🔥205🗿2👨‍💻1
Forwarded from НИИ ИИ
Смерть компании: два человека, ИИ-агенты и 90 дней

Продолжаю находить в X настоящие жемчужины и переводить их для вас полностью — ничего не добавляя от себя и не пересказывая своими словами. Сегодняшняя находка особенная.

Питер Диамандис (основатель XPRIZE, автор бестселлеров NYT, человек из списка 50 величайших лидеров по версии Fortune) опубликовал текст, который он сам называет самой важной бизнес-гипотезой за десятилетие.

Суть в одном вопросе, который его партнёр Салим Исмаил задаёт каждому CEO из Fortune 500: «Есть ли в вашей компании высокомаржинальное направление, которое два человека с ИИ-агентами могли бы повторить за 60–90 дней?»

70% отвечают «да».

Дальше в статье — вся механика: из каких пяти слоёв состоит ИИ-нативная компания, почему трансформировать существующую корпорацию изнутри невозможно (и что вместо этого делать), почему слой среднего менеджмента сократится на 60–80% и при чём тут закон Коуза, на котором вообще стоит вся теория фирмы.

По расчётам Исмаила, ИИ-нативные организации будут в 100 раз производительнее сегодняшних — при пятой части штата. И это не прогноз на десятилетие: пилоты идут прямо сейчас.
Отдельно ценно, что в конце есть конкретные ответы для каждого: что делать, если вы CEO, предприниматель, инвестор, родитель или сотрудник.

Читать полный перевод: Смерть компании: что такое организационная сингулярность
🔥113🤩1
Archify: агентский-навык, который рисует проверяемые архитектуры из репозитория

В продолжение темы навыков и харнессов: Archify это skill для Cursor, Claude Code, Codex CLI и OpenCode, который превращает кодовую базу или описание системы в интерактивную карту архитектуры.
Открытый код под MIT, 15,1 тысячи звёзд.

🔧 Как работает:
Просишь агента использовать Archify на своём репозитории.
Он трассирует реальный код (в примере на проекте mco-org/mco зафиксирован коммит), строит типизированный JSON IR с проверками валидации и выдаёт самодостаточный HTML файл без зависимостей.

⚡️ Что внутри:
- Пять типов диаграмм: архитектура, воркфлоу, последовательности, потоки данных, жизненный цикл состояний.
- Четыре визуальных пресета с тёмной и светлой темами.
- Интерактивный UI: поиск нод, трассировка upstream/downstream путей, гайды-истории по маршрутам.
- Перед мержем можно сравнить два снимка системы как До / Дельта / После с точными добавлениями и удалениями.
- Экспорт в PNG, SVG с автотемой, WebM видео и шаринг-карточки 1200×630 для README или соцсетей.

💡 Главная фишка: диаграмма абсолютно достоверна.
Каждый факт тянут из кода, а авторскую структуру видно в JSON IR.

Ставится одной командой npx skills add tt-a1i/archify -g.

📎 Репозиторий и живая галерея: GitHub · Proof Lab

#Archify #агенты #диаграммы
———
@tsingular
12🔥6🆒2
😁29😭11💯3😈3
Forwarded from Эксплойт
This media is not supported in your browser
VIEW IN TELEGRAM
Осторожно, он гений: парень запустил аукцион, в котором бренды могут купить рекламу на крышке его MacBook — самые щедрые компании получат виниловую наклейку на крышке.

При этом яблочного ноута у парня нет — его он собирается купить за деньги, вырученные с аукциона.

Уже насобирал 2700 евро.

@exploitex
😁24🔥92👌1🗿1
Forwarded from Machinelearning
✔️ Китай наладил связь между Землей и Луной на скорости 100 Мбит/с

Специалисты Китайской академии наук успешно протестировали оптический канал обмена данными на расстоянии свыше 400 000 километров. Эксперимент проводился с использованием окололунного спутника DRO-A.

Команде удалось достичь скорости передачи команд от Земли к аппарату (uplink) на уровне 1,25 Мбит/с, тогда как скорость обратного потока телеметрии (downlink) составила 100 Мбит/с.

Подобная высокоскоростная двусторонняя лазерная связь развернута за пределами околоземной орбиты впервые.


Переход на эту технологию кардинально меняет пропускную способность каналов дальней космической связи.

Для сравнения: передача одного снимка в разрешении 8K с лунной поверхности по традиционному микроволновому линку (около 5 Мбит/с) занимает до пяти минут. Новая лазерная система позволяет передать этот же объем всего за 12 секунд, что решает проблемы при отправке тяжелых научных данных на Землю.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
1🔥274🤯4🫡21
В ollama появился qwen3.8-flash-next:125b-mlx для скачивания!

113 гигов

#qwen #ollama
———
@tsingular
🔥7111