Технозаметки Малышева
11.9K subscribers
5.2K photos
1.95K videos
43 files
5.18K links
Новости инноваций из мира Искусственного Интеллекта. 🤖 [РКН: 7021469833 ]

Всё об ИИ, ИТ трендах и Технологической Сингулярности.

🤖: @ai_gptfreebot [бесплатный бот]
✍️: @tsingular_bot [каталог ботов и курсов]

💸: https://pay.cloudtips.ru/p/c8960bbb
Download Telegram
HiveTraceGuard-Pro: маленький охранник для больших моделей

Российская команда HiveTrace выложила в open source компактную guardrail-модель на 0,6B параметров, которой можно закрыть и вход, и выход LLM.
Главное: она понимает русский и английский, отдаёт ровно один токен, safe или unsafe, и при этом в топе мирового лидерборда именно на русских данных.

🔧 Что она делает:
Работает в двух режимах: input guard проверяет запрос пользователя до ухода в модель, output guard проверяет ответ ассистента в контексте запроса.
Политика фиксированная, а навык широкий: находит вредоносный контент по 15 категориям, джейлбрейки, prompt injection, обфускацию, извлечение секретов и угон инструментов агента.

Благодаря фиксированной политике префикс истории один для всех запросов, поэтому KV-кэш работает по максимуму: p95-задержка отклика всего 28,8 мс.

📊 Позиции на GuardRate Leaderboard:
Интегральный результат 0.743, топ-3 при размере 0,6B, тогда как соседи сверху намного тяжелее: Sing-Guard-2B втрое, YuFeng-XGuard-Reason-8B в 13 раз больше.
На внутренних русских наборах модель почти безупречна: 0.952 и 0.999 на Aya RU и RU-тестах, а вот ложные срабатывания всего 1.6%, то есть не блокирует безобидные русские запросы.

На англоязычных сценах она скромнее: 0.778 на XSTest против 0.922 у Shieldstral. Выбор для русскоязычного прода явно в её пользу.

💼 Где взять:
Модель доступна в трёх вариантах: открытые веса на Hugging Face, интерактивная Colab-демка и API в Cloud.ru Evolution Foundation Models по цене 42,7₽ за миллион входных токенов, при этом генерируемые токены бесплатны.

А 3 сентября в 17:00 команда расскажет подробнее: как создавали и оценивали модель, что такое GuardRateTools и как теперь жить с guardrails. Регистрация открыта: https://aisecuritylab.timepad.ru/event/4144904/

📎 Hugging Face · GuardRate Leaderboard · Cloud.ru API

#guardrails #русскийLLM #HiveTrace #cybersecurity
———
@tsingular
🔥1341🆒1
Forwarded from Data Secrets
Fable 5.1 это конечно хорошо, но вы видели, что выпустил стартап Фей-Фей Ли?

Встречаете Atlas – первую в истории мультимодальную world model. Она генерирует изображения и видео с контролем камеры на уровне пикселей и (!!!) может реконструировать их в 3D сцены в явном формате point cloud и 3D Gaussian splats. Также обучена Space-time симуляции (четвертый пример).

Длительность видео – до 1 минуты в 1440p, и можно прикреплять до 6 референсных изображений.

Архитектура – мультимодальный диффузионный трансформер. По сути это гибрид LLM-архитектуры (от нее тут авторегрессия+кэширование) и диффузионных видеомоделей (от них денойзинг), дополнительно объединенный с идеей пространственного контекста. Это значит, что каждый элемент контекста имеет явную 3D-привязку через позицию камеры.

По бенчмаркам заявляют превосходство над специализированными моделями и в генерациях с контролем камеры (MiniMax, Gemini Omni Flash, FLUX и др.), и в 3D-реконструкции (Pi3X, VGGT, Depth Anything 3 и др.).

Движок настолько точный, что на нем можно обучать роботов. Atlas может по видео построить явную 3D-сцену, в которой можно симулировать движение робота и обучать его (это называется Real-to-Sim-to-Real подход). Модель генерирует RGB и depth именно с точки зрения бортовых камер робота, и может даже построить симуляцию, в которой возможна манипуляция объектами.

Потрясающий релиз

https://www.worldlabs.ai/blog/atlas
🔥147🤯641
PT Dephaze: LLM в дистрибутиве ищет пароли в сетевых папках

Positive Technologies встроила локальную LLM в автопентестер PT Dephaze: теперь продукт сам ищет логины и пароли в корпоративных файлах и строит на них атаки. Именно похищенные учётные записи используются в четырех из пяти кибератак 2026 года.

🔧 Что под капотом:
Модель едет в коробке, вместе с дистрибутивом, и не отправляет данные в интернет или третьим лицам.
Она читает конфигурационные и текстовые файлы в сетевых папках, извлекает потенциальные логины и пароли и валидирует их в тестируемой инфраструктуре.
Неактуальные комбинации отсеиваются, а рабочие используются для дальнейшего развития атаки.
Найденные файлы можно удалить, снизив шанс взлома.

📊 Почему сейчас:
За последний год злоумышленники в два раза чаще применяют ИИ: быстрее создают вредоносы, находят уязвимости и автоматизируют рутину.
Интеграция LLM для предупреждения атак с использованием учетных данных это первый этап долгосрочного развития PT Dephaze в области использования искусственного интеллекта.

🛡 Куда метит релиз:
Релиз нацелен на: органы власти, госучреждения, госкорпорации и компании на отечественном ПО.
Продукт научился работать со службами каталогов на FreeIPA: распознаёт домены, подбирает учётные данные, анонимно выгружает список пользователей.
А если сотрудник использует одну пару логин-пароль в разных системах, Dephaze проверяет её во всех сервисах.

💼 Планы развития:
ИИ в атаках и ИИ в защите растут в одном темпе.
Пентестер противника ускорить можно только собственным автотулом, поэтому вендоры встраивают LLM в симуляторы атак.
В планах расширить продукт техниками атак на российские ОС.

📎 Пресс-релиз · Обзор CISOCLUB

#PositiveTechnologies #cybersecurity #ИБ #LLM #пентест
———
@tsingular
🔥6221
bb: агентная IDE, которая строит сама себя

На рынке мультиагентных сред свежий игрок: bb, 2,9 тысячи звёзд и 5 344 коммита под лицензией MIT.
Идея в том, что тут агенты сами достраивают свою рабочую среду: сервер держит всё состояние в SQLite, демон на каждой машине готовит workspace и запускает процессы агентов, а вход в систему один и тот же из десктопа, веба, CLI и HTTP API.

🔧 Как устроено:
Провайдеры подключаются уже авторизованные: Claude Code, Codex, Pi и любые агенты по протоколу ACP, ту же идею развили OpenClaw и Hermes.
Сервер хранит состояние в SQLite и ничего не знает про устройства workspace, этим занимается демон на конкретной машине.
Единица работы это поток: manager-поток координирует дочерние, которые выполняют делегированные задачи.
За работой следишь вживую и рулишь на лету, а поток можно передать другому агенту.

Расширяется плагинами, которые он сам для себя может дописать: задачи и воркфлоу, автоматизации по расписанию, общая память, ограничение параллельности и отложенная отправка.

📊 Чем отличается от аналогов:
Paperclip строит «компанию из агентов» с оргструктурой, бюджетами и целями. Multica раздаёт агентам задачи как коллегам по доске. Omnigent монтирует meta-harness поверх CLI с политиками и песочницами.
Все три управляют работой, а bb даёт среду, в которой агенты строят и расширяют собственную фабрику.
Мультиагентность тут встроена в саму модель работы: несколько исполнителей одновременно, у каждого свой поток и общий журнал событий.
Можно работать через приложение на телефоне, это по сути оболочка вокруг того же веб-интерфейса.

💼 Кому это может быть интересно:
Командам, у которых агены уже в проде и которые устали от двадцати терминалов без общего контекста.
Одна команда npx bb-app@latest, и вся инфраструктура в едином саморазвивающемся окне. На Windows запуск тоже возможен через WSL.

Среда, которую агенты достраивают под себя, эволюционирует вместе с командой.
Можно навайбкодить личный метахарнесс.

📎 GitHub · Систем-обзор · Vision · Changelog 0.41.0

#bb #метахарнесс #агенты #мультиагентность #opensource
———
@tsingular
4🤯42🔥2
Forwarded from XOR
This media is not supported in your browser
VIEW IN TELEGRAM
Google выпустила Gemini 3.8 Flash — новая быстрая модель уже обходит гигантов в кодинге.

По данным WSJ, во внутренних тестах сотрудники Google предпочитали её ответы Claude Opus. Сама модель обещает быть дешевой и заточенной под кодинг и агентные задачи.

Gemini 3.8 Flash уже начала появляться у пользователей, так что ждем официального релиза.

Сентябрь жаркий на модели 😻

@xor_journal
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥12🤣5
Keenable SELECT: веб как таблица, к которой пишешь SQL

Стартап Keenable, который в августе вышел из стелса с $26 млн от Accel, показал вторую большую идею: SELECT, отдельный MCP-сервер, где агент запрашивает данные из открытого веба одним SQL-запросом и получает таблицу вместо стены ссылок.

Да, по сути каждый сайт становится строкой таблицы: сервер сам гоняет поиски, скачивает страницы, вытаскивает запрошенные поля и собирает строки с источниками.

🔧 Как это работает:
Ты спрашиваешь агента по-человечески, а агент, по гайду внутри самого тула, пишет read-only SELECT на диалекте DuckDB.
В запросе живут табличные функции WEB_SEARCH и WEB_FETCH, а семантические функции SEM_EXTRACT и SEM_NORM достают и нормализуют поля силами LLM.
Реальный пример из документации: один вызов прогнал 7 поисков, слил 1 400 результатов в 1 125 страниц, вытащил три поля с каждой и сгруппировал в таблицу «модель, источники, запас хода, цена».

Ответ приезжает компактным табличным кодированием вместо JSON, поэтому таблица почти не ест контекст.

📊 Фишка для дальних сессий:
Каждый вызов возвращает id набора данных, и повторный вопрос читает сохранённое, без нового обхода веба.
«А теперь только до €30 000, отсортируй по убыванию» выполняется по сохранённой таблице за секунды, наборы данных живут до 30 дней.

💼 Зачем это агентам:
Фаундеры Андрей Стыскин и Матиас Петри по 20 лет строили поиск в Яндексе и Amazon Alexa, в Keenable уже проиндексировано 100+ млрд страниц, поиск для агентов в разы дешевле.
Схема «агент читает ссылки по одной и собирает ответ руками» становится одним tool call'ом: сервер отдаёт готовые строки с источниками.

Подключается за минуту к Claude Code, Cursor, VS Code, ChatGPT в developer mode, по одному API-ключу на всё.

Честные оговорки из документации: запрос занимает секунды-минуты, извлечение не проверяет факты, точные цифры сверяй по независимым страницам.

📎 SELECT · Документация · TechCrunch о раунде

#Keenable #агенты #SQL
———
@tsingular | Max | YouTube | RuTube
🔥641👍1
Gemini 3.8 Flash и отдельная версия для кибербеза

Google выкатил Gemini 3.8 Flash: лучшую свою модель для кодинга и рассуждений при цене и скорости 3.7, плюс отдельный вариант 3.8 Flash Cyber для ИБ.

Оба варианта построены на общем ядре, прокачанном в том числе тренировкой на задачах кибербезопасности.

🔧 Что умеет базовая 3.8 Flash:
На DeepSWE v1.1 обходит большинство больших фронттир-моделей в автономном решении инженерных задач, при этом стоит дешевле.
В профессиональных областях обходит 3.7 и конкурентов: Vals Finance Agent V2 для финансов, Harvey Legal Agent для юристов, 54,9% на HLE-Verified.
На сложных задачах модель работает усерднее, делает больше шагов и чаще использует инструменты, даже если тратит больше токенов.
Для экономных режимов есть параметр effort и по-прежнему поддерживаемая 3.7 Flash.

🛡 А теперь про Cyber-вариант:
Отдельная модель для доверенных защитников по программе Fairwind (Palo Alto Networks, Snowflake, Wiz среди партнёров).
На CyberGym, бенчмарке поиска уязвимостей, показывает фронттир-уровень, обходит 3.5 Flash Cyber и модели крупнее.
На внутреннем бенчмарке по 20 языкам находит уязвимости с успехом выше 70%.
Приоритет отдан патчингу, а не эксплойтам: на CWE-Bench 47,2% pass@1 против 47,8% у лидирующей фронттир-модели, но дешевле.
Google уже использует 3.8 Flash Cyber для защиты собственного кода.

Цены до конца года: $0,75 за миллион входных токенов и $3,75 за выходные, с 1 января дороже. ($1.5 вход/ $7.5 выход)

Получается реальный конкурент DeepSeek Pro и GLM 5.3 вышел.

📎 Анонс в блоге Google

#Gemini #cybersecurity #агенты
———
@tsingular | Max | YouTube | RuTube
🔥911
This media is not supported in your browser
VIEW IN TELEGRAM
Nousportal запустили реффералку.

теперь при покупке подписки вы получите $15 скидки.
Т.е. план будет стоить не $20 для вас, а всего $5

Регаться по ссылке

#NousResearch #скидки
———
@tsingular
❤‍🔥421
Higgsfield выпустили плагин для смартфона, который превращает его в контроллер камеры в сцене.
В итоге нейрорендер получил еще больше реализма в кадре.

Осталось подключить модели, которые видео рендерят быстрее реального времени и можно прикручивать к играм.

#higgsfield #нейрорендер
------
@tsingular
🔥9432
This media is not supported in your browser
VIEW IN TELEGRAM
Utopia: база знаний, которая помнит, когда каждый факт был правдой

На GitHub появилась Utopia: self-hosted платформа знаний, где RAG по своим документам работает поверх графа, в котором у каждого факта есть метка времени и срок жизни.
585 звёзд за первые недели, лицензия Apache-2.0, весь стек это один бинарник на Rust и база на Postgres.

Память с датой:
Большинство баз знаний отвечает на вопрос «что», Utopia построена вокруг «когда».
У каждого факта в графе поля valid_from и valid_to, вопрос «кто вёл проект X в третьем квартале 2024» решается чтением графа на нужный момент.
Факты дописываются, а не перезаписываются: исправление закрывает прошлую версию, история можно проследить по изменеиям во времени.
На странице графа таймлайн таскаешь мышью, и связи перерисовываются на выбранную дату.
Каждое ребро ссылается на предложение-первоисточник, без доказательства в граф ничего не попадает.

⚖️ Чем отличается от аналогов:
У Zep с движком Graphiti та же идея временных фактов, но это отдельная библиотека поверх Neo4j или FalkorDB, у Utopia только Postgres.
Mem0 отдаёт граф знаний лишь в платном тарифе за $249 в месяц, а тут открыт весь код.
RAGFlow и AnythingLLM хорошо ищут по документам, но время факта они не моделируют.
Отдельно стоит выделить полезную фишку, - "очередь ревью" она позволяет оценить сомнительные выводы и кандидаты на слияние сущностей через подтверждения человеком.

💼 Зачем бизнесу:
Классическая дыра RAG: инструкция изменилась в марте, а чат отвечает по февральской версии. Здесь это лечится на уровне модели данных.
Тот же граф по дороге станет памятью агентов: схема под memory-пространства уже есть, MCP-сервер в планах.
Но надо учитывать, что это v0.1 от одного мантейнера и фреймворк ещё сырой: API-ключи в базе лежат без шифрования, пути обновлений не гарантированы.

Для пилота в доверенной сети годится, в прод ставить рано.
Смотрим, изучаем, сравниваем с аналогами.

📎 GitHub · Zep/Graphiti для сравнения

#utopia #RAG #темпоральный #граф #opensource

———
@tsingular | Max | YouTube | RuTube
🔥8422
This media is not supported in your browser
VIEW IN TELEGRAM
Hermes Desktop подключился к нескольким gateway сразу

В Hermes 0.21.0 настольное приложение научилось держать реестр подключений: локальный рантайм, удалённые gateway в локалке или на VPS, SSH-хосты и инстансы Hermes Cloud в одном окне.
Раньше Desktop цеплялся к одному бэкенду за раз, теперь это панель управления флотом агентов.

🔌 Как устроен реестр:
Четыре типа подключений: локальный, Remote gateway по HTTP(S), SSH и Hermes Cloud, у каждого своё имя-метка вроде «Homelab».
SSH заботится о вас: приложение само открывает туннель и запускает дашборд, для остальных hermes serve поднимается руками.
Кнопка Test проверяет оба плеча, HTTP и WebSocket: «Reachable» значит, что чат заработает.
Профили с одинаковыми именами на разных машинах различаются хэндлами @имя-устройство.

⚙️ Как это работает внутри:
Каждая пара подключение-профиль получает свой бэкенд и сокет, фоновые агенты продолжают стримить, пока смотришь на другой gateway.
Перечисление агентов идёт по REST без дозвона к каждому WebSocket, недоступный gateway не роняет ростер, а помечается янтарной точкой.
Сессии, файлы, cron, каналы и память всегда живут на машине, которой принадлежит профиль.
Обновление всех инстансов одной кнопкой: hermes update уезжает параллельно на каждую машину.

💼 Зачем бизнесу:
Типовой сценарий: Hermes на домашнем сервере, на рабочей машине и на VPS, всё в одном окне вместо терминалов и вкладок.
Плагинам открыли SDK: host.connections() и host.agents() дают реестр и объединённый ростер, Bot Mode уже работает как референсный потребитель.
Токены лежат в файлах 0600 в основном процессе Electron, опционально шифруются через OS keychain.
Оговорка: Sessions всегда показывает один активный gateway, чтобы был понятен контекст работы.

📎 Документация · Releases

#hermes #nousresearch #агенты #desktop
———
@tsingular | Max | YouTube | RuTube
🔥5🏆21
В Лондоне можно вызвать первое в Европе роботакси в Uber

Британская Wayve и Uber запустили в Лондоне первое такси с автопилотом по запросу: 15 машин Ford Mustang Mach-E поехали по городу, где работает свыше 100 тысяч частных извозчиков.
Вызов через обычный Uber, за рулём пока лицензированный водитель: молчит всю поездку, но перехватит управление по просьбе пассажира.

🚗 Почему это важно:
TfL в августе выдал Mustang лицензию private hire, полный отказ от водителя ждёт одобрения DVSA, но, похоже, не в этом году.
На автономные поездки записались 100 тысяч пользователей Uber, а машин всего 15, поймать роботакси шансы не большие.
Лондон ключевой рынок Европы: Waymo и Baidu тоже тестируются здесь, Uber получается первым начал реальную работу.

🧠 Чем Wayve отличается от Waymo:
Стек Wayve это end-to-end AI Driver: обучаемая модель вместо HD-карт с правилами.
Модель натренирована на данных из 70+ стран и переносится между городами и типами машин, в феврале Wayve подняла $1,2 млрд при оценке $8,6 млрд (Microsoft, NVIDIA, Uber, Mercedes).
На тест-драйве Guardian машина сама перепарковалась, освободив ворота.
Дальше планируется наладить производство и выпустить на дороги серийные Nissan Leaf вместо ретрофиттинга с соблюдением требований безопасности и регуляторки.

💼 Зачем бизнесу:
Загреб летом стал первой точкой Uber в Европе, Лондон второй, впереди 10+ городов и пилот в Токио.
Uber говорит, что пока никто не умеет делать AV-поездку дешевле, чем когда водитель человек, но со временем экономика подтянется.

Профсоюз GMB предупреждает о возможных потрясениях, но Uber обещает, что водители без работы не останутся. (как? :) )

📎 The Guardian · Wayve × Uber × Nissan

#wayve #uber #роботакси #роботы
———
@tsingular | Max | YouTube | RuTube
2🆒2👍1
Нью-Йорк запретил ученикам использовать AI до старшей школы

Мэр Нью-Йорка Зохран Мамдани объявил годовой мораторий на генеративный AI в городских школах: без него остаются около 600 тысяч учеников от начальной школы по восьмой класс.
Мораторий стартует в 2026-2027 учебном году вместе с лимитами экранного времени и пилотом AI-инструментов в старших классах.

🚫 Что именно запрещено:
Ученикам до старшей школы полностью запрещено использовать AI в классе, включая софт со встроенным генеративным AI, это один из самых жёстких запретов в США.
Учителям нельзя проверять работы AI-инструментами, но можно планировать уроки с AI.
Компаньон-чатботы для дружбы и психологической поддержки запрещены во всех классах.
До третьего класса запрещены персональные экраны, средним классам разрешено максимум 45 минут экранного времени в день.
Старшеклассникам AI разрешены только в отдельных случаях, плюс уроки AI-грамотности дважды в год.

🔬 Зохран Мамдани против «неизбежности»:
«Детям нужны учителя и человеческая связь, чтобы учиться и расти», индустрия же уверяет, что AI-образование неизбежно, «мы так не считаем».
Вместе с запретом запущен пилот для пяти классов с проверенными инструментами: Quill для английского, Edia для математики, Brisk Teaching, Playlab, в которых соблюдается принцип «ученик главный мыслитель».
Коалиция из педагогов, родителей и экспертов весь год оценивает эффект и опубликует выводы.

💼 Зачем бизнесу:
Крупнейший школьный округ США закрыл рынку EdTech рынок размером в 600 тысяч пользователей: вендорам нужно доказывать безопасность и эффективность до, не после.
Исключения остаются: инструменты для детей с инвалидностью, мультиязычных учеников и информатика.
Тренд международный: Норвегия, Швеция и Нидерланды тоже ограничивают ИИ технологии в школах.

📎 The Verge · Пресс-релиз мэрии

#образование #ньюйорк #регулирование #AI
———
@tsingular | Max | YouTube | RuTube
🔥6🤔311
This media is not supported in your browser
VIEW IN TELEGRAM
Китайцы, конечно, крутые. без вопросов!

В городах Китая на общественных цифровых дисплеях вместо изображений знаменитостей и рекламных объявлений теперь демонстрируются портреты ученых, исследователей и изобретателей

По сообщениям, жители довольны этими переменами и называют их настоящими звездами – людьми, чьи достижения заслуживают восхищения и уважения.

#Китай #новости
———
@tsingular
🔥59👍13🏆1222