Технозаметки Малышева
12.7K subscribers
5.29K photos
2.01K videos
43 files
5.27K links
Новости инноваций из мира Искусственного Интеллекта. 🤖 [РКН: 7021469833 ]

Всё об ИИ, ИТ трендах и Технологической Сингулярности.

🤖: @ai_gptfreebot [бесплатный бот]
✍️: @tsingular_bot [каталог ботов и курсов]

💸: https://pay.cloudtips.ru/p/c8960bbb
Download Telegram
This media is not supported in your browser
VIEW IN TELEGRAM
Ну, за монтажеров - 2

Чувак дал GPT-6 Astra доступ к DaVinci Resolve и набору из 84 исходных клипов.

Дальше Астроагент действует примерно так:

- агент обнаруживает, что таймлайн пуст, и начинает заново собирать длинную версию из исходников;
- находит в папке с музыкой композицию The Last Duel;
- добавляет реакции персонажей, rooftop-сцену, aerial attack и меняет длительности монтажных кусков;
- доводит монтаж примерно до 2:02;
- кладёт музыку на отдельную дорожку A2, уменьшает громкость и делает fade-in/fade-out;
- добавляет отдельный reaction cutaway на V2;
- запускает в Resolve Create Subtitles from Audio;
- Resolve генерирует 15 японских сегментов субтитров;
- агент сохраняет итоговый таймлайн.

Причём интерфейс прямо показывает вызовы Com.blackmagic Design.davinciresolve integration и выполнение команд. То есть это не обычный Computer Use.

Ибо.

8 сентября Blackmagic выпустила DaVinci Resolve 21.1, и это действительно официальный релиз с интеграцией AI-агентов. Blackmagic прямо пишет, что Resolve Studio теперь может работать с Claude, Claude Code и ChatGPT Codex, которым разрешено анализировать проекты, организовывать медиа, менять настройки, делать highlight edits и запускать рендер по обычным текстовым командам.

Ключевая новинка - native MCP server в DaVinci Resolve Studio 21.1. MCP здесь является прослойкой:

GPT/Claude -> MCP -> API DaVinci Resolve -> реальный проект

С титрами прикольно.

агент сам дошёл до этой функции и запустил её как часть многошагового процесса. На скриншоте он сообщает, что Resolve создал 15 японских subtitle segments.

Сам speech-to-text выполняет Resolve, кстати.

@cgevent
🔥105🤯54
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
🎙 Google выпустила Gemini 3.8 Live и Live Extended Thinking

Модели поддерживают 97 языков, понимают видео и изображение с камеры, вызывают инструменты без остановки разговора.

Extended Thinking рассуждает и говорит одновременно, выполняя сложные задачи в фоне. По данным Google, версия заняла первое место в Speech to Speech Quality Index - 82,6 балла.

Цена API за 1 млн токенов для обеих версий:

* Аудио: $3 вход / $12 выход.
* Текст: $0,75 вход / $4,50 выход.

Доступны через Gemini API и AI Studio. Началось внедрение в Search Live, Gemini Live и Workspace.

Анонс — https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/

Цены — https://ai.google.dev/gemini-api/docs/pricing
10🔥42🆒1
This media is not supported in your browser
VIEW IN TELEGRAM
О, новые руки подъехали:
Xynova’s Flex 2

23 степени свободы
400 грамм весят
12 кг поднимают
Супер быстрые

#руки #роботы
------
@tsingular
👍19🔥6👾43😁1
This media is not supported in your browser
VIEW IN TELEGRAM
dream-loop: агентский навык для создания качественных 3Д миров

dream-loop, навык для кодовых-агентов, который строит красивые 3D-сцены и игры. Секрет в том, что агент сначала генерирует «целевой» скриншот, потом итерирует, пока отдельный ашент-критик не признает, что живой скриншот совпал с целью.

⚙️ Агентский цикл:
- агент «представляет» целевой скриншот через генерацию картинок;
- строит сцену с этой целью в голове;
- отдельный критик сравнивает живой скриншот с целью и даёт замечания;
- цикл повторяется, пока критик не будет доволен;
- опционально агент может визуализировать цель получше на основе конкретного ракурса.

🧠 Почему это работает:
Словами не описать красивую картинку, а глазами оценить легко. dream-loop использует эту разницу: спецификацию задаёт генератор (картинка), оценку делает зрение (критик), а цикл доводит до минимального расхождения.

💼 Почему это интересно:
Паттерн шире, чем 3D: когда результат сложно описать, но легко оценить, генерируй эталонный образ и гоняй цикл до выжигания лимитов совпадения с эталоном.

🔗 Ссылки:
- achimala/dream-loop: репозиторий, 938 звёзд
- живое демо

#агенты #навыки #3D
------
@tsingular
8🔥8🆒1
Media is too big
VIEW IN TELEGRAM
Jev от TypeSafe: модель без генерации текста, зато в 200 раз быстрее и без галлюцинаций

Инженер, работавший над методами, которые легли в основу ChatGPT, два года строил модель, которая использует новый принцип генерации ответов.
Модель Jev работает в 20-200 раз быстрее, в 40-400 раз дешевле, выходные токены бесплатны, галлюцинации исключены.

⚙️ Что это:
«System One» модель по Канеману. Вместо строк выдаёт типизированные решения с калиброванными вероятностями. Не замена LLM, а «умные if-выражения»: классификация, маршрутизизация, извлечение, ветки кода.
На вход подаются неструктурированные данные, на выходе получаем типизированные структуры.

🧠 В чём трюк:
LLM пишут текст последовательно, токен за токеном: дорого, медленно, и всегда есть шанс галлюцинации.
Jev отказывается от строк и считает вероятности параллельно.
Ошибки типов исключены математически, уверенность откалибрована.
Назван в честь парадокса Джевонса: чем дешевле интеллект, тем больше на него спрос.

💼 Зачем бизнесу:
Для кода LLM это узкое место: ответ за 3-300 секунд плюс разбор строк. Jev отвечает за 70-500 мс готовой структурой.
Применимо к маршрутизации, скорингу, модерации, разметке данных. $0,042 за миллион входных токенов, выход бесплатный.

Пока доступна только запись в очередь на пробу.

🔗 Ссылки:
- Блог TypeSafe
- Тред на X

#AI #модели #Jev #TypeSafe
------
@tsingular
🔥2072👍2👀2
Действительно

#юмор
------
@tsingular
😁361431👏1😭1
Forwarded from Machinelearning
✔️ OpenAI на 60% снизила цены на голосовое управление агентами Work и Codex

Теперь в десктопных клиентах ChatGPT за тот объем кредитов пользователи получают в 2,4 раза больше времени голосовой связи, а биллинг голосового потока и затраченных на задачу вычислительных ресурсов разделен.

Изменения касаются только десктопной среды и не затрагивают стандартный голосовой режим ChatGPT, где действуют другие лимиты и правила тарификации.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥821
#новости

🔥 ИИ создал лекарство, которое снизило биологический возраст пациентов

ИИ помогал разрабатывать препарат от болезни легких и придумал новую молекулу.

И вдруг анализы показали интересное.

Кровь пациентов проверили по шести программам, которые определяют старение. 6/6 показали одинаковый результат 👇

Биологический возраст пациентов снизился на 3-4 года по сравнению с теми, кто принимал плацебо.


Радоваться пока рано: участников было всего 42, и тестирование продолжается.

Но, по словам профессора Гарварда Вадима Гладышева, это исследование впервые доказывает, что биологический возраст можно снизить.

#stpnv #AI #здоровье
Please open Telegram to view this post
VIEW IN TELEGRAM
23🔥62🤔2🤯1
Unity выкатили собственный плагин под Codex

забирать тут

#gamedev #Unity
———
@tsingular
🔥941
ахаха..

короче, нашёлся какой-то чел, который перевайбкодил Jev (который в закрытой бете и втайне разрабатывался 2 года) - ЗА 2 ЧАСА и выложил на HF

это повторяет историю что была с Claude Cowork, который вышел в закрытой бете и за ночь его перевайбкодил какой-то гений из Китая.

Запасаемся попкорном.

Открытые (в отличии от Jev) веса качаем тут:
https://huggingface.co/harshatheg/Qwen-2.5-1B-RLCD

А вот как оно работает (разъяснение от HF):
Идея заключается в том, чтобы заменить авторегрессионную генерацию LLM использованием одного декодера Transformer (из состава предварительно обученной LLM), который обрабатывает контекст и JSON-схему всего один раз.

Ключи и значения (KV) для этих токенов сохраняются в кэше. Затем для каждого поля JSON-схемы мы выполняем следующие действия:

1. повторно пропускаем токены суффикса поля через декодер Transformer (повторно используя KV-кэш); 2. получаем итоговое скрытое состояние и пропускаем его через выходной слой языковой модели (head);
3. получаем оценки (также называемые логитами) для всех токенов из словаря LLM;
4. рассматриваем только оценки для тех токенов, которые важны для данного поля, и пропускаем их через функцию softmax для получения вероятностей, сумма которых равна 1;
5. выбираем токен с наибольшей вероятностью.

Преимущества такого подхода:

1. высокая скорость (не нужно генерировать JSON-схему по одному токену);
2. гарантированная корректность JSON (не нужно полагаться на способность модели сгенерировать валидную схему).


#Jev #Qwen
———
@tsingular
👍13😁9🔥63🤯2
🚨 Apple может выйти на рынок AI-серверов и использовать для этого технологию NVIDIA

По данным The Information, Apple разрабатывает серверы на будущих M8 Ultra и рассматривает NVLink Fusion для объединения нескольких чипов в одной системе.
Обсуждаются две конфигурации:

- 2× M8 Ultra
- 4× M8 Ultra

Серверы хотят продавать AI-разработчикам, компаниям и государственным организациям, а основной сценарий — AI inference, а не обучение моделей. Возможный запуск - около 2029 года.

Apple уже использует собственные решения в Private Cloud Compute, но, по данным источников, они слишком медленные и дорогие для масштабирования. Поэтому часть инженеров считает NVLink Fusion лучшим вариантом.

Получается довольно иронично:

Apple M8 Ultra → NVIDIA NVLink Fusion → AI server

Apple фактически может зайти на рынок AI-серверов NVIDIA, используя технологию самой NVIDIA.
9🤔6🤣411🤯1
Короче Jev пока больше похож на классификатор или реранкер.

Выдает наиболее подходящие ответы по JSON форме.

На этом пока всё

#Jev
------
@tsingular
92💯2👨‍💻1
Media is too big
VIEW IN TELEGRAM
В Гермес добавили каталог плагинов

Обновляемся и забираем тут:
https://hermes-agent.nousresearch.com/docs/plugins

#Hermes
------
@tsingular
10🆒42🔥1
This media is not supported in your browser
VIEW IN TELEGRAM
Руки роботов учат автономности.

У них и справка есть, зачем это.

+1 фобия

В детстве помню были страшилки,- "чёрная рука уже ищет твой дом, чёрная рука ищет тебя, отдай сердце..." 😱

#роботы #руки
------
@tsingular
😁11🔥7👾61
Forwarded from RoboFuture
Последние дни развлекался с расцензуренным дипсиком V4.1 Flash - и слегка охренел, где у этой модели край. Спойлер - края нет. Теперь Mythos есть у нас дома!

Ребята из dealignai выпилили из весов сам механизм отказов, модель просто разучилась говорить «нет». Ну как такое не потрогать - для запуска нужна железка на 500+ ГБ видеопамяти, и какое совпадение, как раз одна пылилась у меня на чердаке 😂

Дальше нужен харнес. Раз модель нецензурная - и харнес взял пиратский: утекшую сборку Claude Code, которую снесли с гитхаба (но на православном GitVerse все лежит :)). Подключил ее к дипсику и понеслась

Для разминки попросил сломать сайт, который я сам же и делал, и минут за 30 модель нашла IP сервера, увидела что SSH-ключ лежит прямо у меня на компе, спокойно его забрала и зашла. Это было просто

Дальше - пентест сайта одного московского НКО, с полного разрешения администратора. Тут уже тяжелее: агент работал без остановки полтора дня (!), нашел несколько серьезных дыр, но сам сайт так и не пробил - и бросать не собирался, в TODO_md ждала своей очереди еще целая пачка проверок. Остановил сам, хотелось и другие задачи успеть. В конце агент сам сверстал подробный отчет по аудиту безопасности. Провел 27 разных атак, на мой дилетантский взгляд очень грамотных

Потом попросил взломать один хороший текстовый редактор под мак и снять проверку лицензии (лицензию я когда-то честно купил, просто лень искать ключ). Через час было готово - модель правила байты прямо в бинарнике (это как раз на скрине). Такое я руками уже не умею: тут нативный машинный код, возиться с ним куда сложнее, чем с Java-байткодом

Заодно пропатчил десктопный Grok bot - чтобы вместо грока приложение ходило в тот же бешеный дипсик. Тоже без проблем

А дальше я просто искал, где у модели предел. Его нет:

- калькулятор, который под капотом логирует все нажатия клавиш
- тестовая, но вполне рабочая утилита для DDoS сервера Minecraft
- SFT-датасет на 1000 примеров газлайтинга (кому LoRA-адаптер на таком добре? :))


Все эти штуки гонял локально и сразу сносил - уж больно стремно выглядит. И за все мои эксперименты (а фантазия у меня богатая) модель не отказала ни разу

И ведь она реально сильная

По замеру авторов MMLU просел всего с 86,96% до 82,74%. На моих задачах дипсик держится достойно на фоне фронтиров, а по упорству их иногда даже уделывает

Зачем я это пишу?

Затем, что модель лежит в открытом доступе и доступна любому, кто готов оплатить аренду GPU. Так что держите это в голове и готовьтесь к волне хакерских атак. Плюс в том, что этой же моделью удобно проверять на прочность собственные сервисы, что всем и желаю запустить ASAP

P.S. Чтобы вырубить цензуру, авторам хватило поменять 0,06% весов. Метод они описали. Он лежит в истории их git-репозитория (спасибо за наводку каналу Технозаметки Малышева). Тот же трюк очень вероятно пройдет с любой моделью с открытыми весами. И это ровно то, о чем я уже писал: базовые ценности надо зашивать еще в претрейн. Все, что накатывают сверху алайнментом, снимается легко
🔥33🤯1174😈1
OpenResearch от AlphaXiv превращает ИИ агентов в профессиональных в исследователей

AlphaXiv,- популярная платформа статей arXiv, выложила OpenResearch: локальную среду, которая превращает Claude Code, Codex, OpenCode и Cursor в исследовательских агентов. Таких, что умеют читать литературу, выдвигать гипотезы, запускать эксперименты и собирать результат в артефакты. Репозиторий уже набрал 4,6 тысячи звёзд.

⚙️ Что внутри:
Каждому направлению поднимается отдельная сессия агента и изолированный git-worktree, поэтому несколько агентов ведут разведку параллельно и не мешают друг другу. Эксперименты складываются в git-дерево, каждый запуск получает неизменяемый архив своего коммита.
Логи, диффы, файлы и результаты привязаны к работе, которая их породила.

💡 Автономный цикл:
OpenResearch умеет гонять полный цикл сам: предложить идею, поменять код, запустить эксперимент, посмотреть на результат и решить, что пробовать дальше. Несколько агентов ведут разные направления параллельно, дерево экспериментов хранит их родословную. Авторы пристегнули исследовательскую обвязку к агентам, которые у всех уже стоят, вместо того чтобы строить «ИИ-учёного» с нуля.

💼 Практический смысл:
Всё локально по умолчанию: код, данные и результаты лежат на твоей машине, дашборд на 127.0.0.1:4791, хранилище SQLite. Запуск можно перенести куда угодно: SSH, Slurm, Kubernetes, Ray, Hugging Face Jobs или Modal. CLI orx умеет искать литературу (orx discover keyword) и читать статьи (orx paper <arxiv-id>).

🔗 Ссылки:
- GitHub: исходники
- Документация: установка и гайды

#агенты #исследования #опенсорс #OpenResearch
------
@tsingular
93🔥21🆒1
Вдохновляющая история о том, как AI/LLM снижает порог вхождения в нишевые ниши

Человеку без опыта работы с железом захотелось разработать свою печатную плату на базе RPi, чтобы сделать свой маленький компьютер с e-ink экраном. Но он из интереса поставил себе два ограничения

(1) человеку нельзя работать с файлами напрямую или проверять дизайн
(2) все проблемы должен решать Fable

В итоге
(1) два часа работы Claude Fable
(2) тыканье пальцем в автоматические ошибки от Design Rule Checking
(3) Отправка заказа в JLCPCB (130 евро за 5 платок + e-ink экран)

И работающий с первого раза свой собственный мини-компьютер по своим спецификациям - готов. История расписана тут. А сейчас автор аналогичным образом пытается сделать планшет на базе NVIDIA Jetson Orin Nano.

Я вспоминаю, как мы мучительно разрабатывали простые opto-encoder платки для хобби-проекта высокоточной робо-руки, и от возможностей сегодня прямо захватывает дух!

Ваш, @llm_under_hood 🤗
🔥2242🤩2