ml phys
2.8K subscribers
198 photos
12 videos
2 files
123 links
Короткие технические разборы AI agents, coding agents, evals и LLM-инфры
Download Telegram
Мэтт Шумер запустил GPT-5.6-Sol и остался почти без файлов на маке. Из-за ошибки при подстановке $HOME команда очистки превратилась в rm -rf /Users/mattsdevbox. Процесс успели остановить, но удаление к тому моменту уже прошло.

У меня Claude Code однажды тоже чистил домашнюю директорию. Он создал папку с названием ~/, потом понял, что ошибся, и удалил её командой rm -rf ~/. С тех пор я стараюсь ограничивать, куда модель может дотянуться.

Раньше в Claude Code ограничения проверялись на уровне tools. Wrapper смотрел, можно ли конкретному инструменту тронуть файл, и разрешал либо блокировал запись. Обходилось это shell-командой или скриптом, который писал сам агент. Файл менялся мимо того tool, что проверял wrapper.

Сейчас сендбокс работает на уровне ОС. Под него попадают shell-команды, Python-скрипты и subprocess'ы. Напишет агент скрипт, который пытается писать за пределы разрешённого scope, операция вернёт ошибку доступа.

Вот 3 примера, как сендбоксить Codex. Посмотрите на них и всё поймёте. Тут не нужны ни Docker, ни отдельный ПК.
5
5🫡5❤‍🔥3
Forwarded from Data Secrets
Интернет взрывает новая модель Reflection 70В: она выбивает на бенчмарках результаты, превосходящие Claude 3.5 Sonnet и GPT-4o

Название Reflection выбрано в честь метода Reflection-Tuning: это когда модель итеративно обучается на синтетических структурированных данных, чтобы научиться рассуждать и самокорректироваться. Плюсом добавлен отдельный этап планирования для улучшения CoT. В качестве инициализации брали Llama 3.1 70B.

На практике модель прямо в ответах оборачивает все рассуждения в тег <reasoning>, а возможные ошибки в тег <reflection>. Затем она обнаруженные ошибки исправляет, и итоговый ответ выдает в теге <output>.

Результаты на бенчмарках: 89,9% MMLU, 79,7% MATH, 90,1% IFEval, 99.2% GSM8K. Говорят, что тот самый синтетический датасет и техрепорт будет на следующей неделе. А еще на следующей неделе обещают Reflection на 405В 😨

Сама модель уже доступна на HuggingFace.
Please open Telegram to view this post
VIEW IN TELEGRAM
9👍1
Небольшой апдейт по тому человеку, от которого был исходный твит.

Я эту историю хорошо помнил, но по картинке сразу не понял, что автор исходного твита и есть тот самый Мэтт Шумер.

Когда трава была зеленее, а агенты тупее, топом опенсорса была Meta Llama 3. Шумер заявил, что дообучил её до качества фронтира каким-то очень странным методом под названием Reflection-Tuning. Тогда все начали активно это обсуждать, но через пару дней оказалось, что веса «обученной им модели» хуже оригинала, результаты бенчмарков не воспроизводятся, а его приватный API на самом деле проксирует фронтирный тогда Sonnet 3.5, на котором к тому же быстро кончились деньги.

Так что вполне возможно, что история с удалением файлов была таким же способом похайпиться. Слишком уж умны современные модели, чтобы настолько глупо ошибиться. Но это не повод забивать на безопасность: права агентов всё равно надо ограничивать, а сами процессы запускать в sandbox.
12
Я не могу понять, почему все так лихо обсуждают суд Apple против open ai. Всё это дело держится на показаниях двух свидетелей, а у Сэмa есть проверенные способы решать такие вопросы.
😁194🥰2🫡1
Год назад Андрей Карпаты назвал LLM новым компьютером, который программируется на английском: промпты становятся программами. Илон Маск позже пошёл дальше и предположил, что ИИ будет сразу создавать готовые бинарники. Тогда это звучало как прогноз об исчезновении привычных программ. Кажется, мы уже близко.

Раньше я автоматизировал личные рутины через n8n и Python: выставление инвойсов, простую бухгалтерию, умный дом и ведение списка задач в GTD. Сейчас я использую Hermes Agent, аналог OpenClaw, сделанный без AI-слопа. Я описываю ему задачу, а регулярные процессы прошу запускать по расписанию. Например, агент сам готовит инвойсы, отправляет их компаниям и загружает данные в грузинскую налоговую.

Раньше разработка автоматизации часто стоила дороже её пользы. Агенты резко снижают стоимость запуска: сформулировал задачу, проверил результат, запустил. Особенно сильно агенты изменят малый и средний бизнес, которому дорого нанимать сотрудников и разрабатывать отдельные системы: закупки, управление остатками, поиск тендеров, мониторинг конкурентов и оптимизация расписания. Возможно, эпоха программ-промптов уже наступила. Просто наступила неравномерно.
9🤔4🔥2🥰1💯1
Пост про децентрализованный инференс

В прошлом году я писал про Cocoon, децентрализованный инференс для LLM на NVIDIA TEE. TEE это технология NVIDIA, которая гарантирует, что вычисления идут приватно. Владелец видеокарты не может прочитать ваш запрос, а вы можете проверить, что он действительно запустил нужную модель. Поэтому покупатель токенов знает две вещи: он получает модель, за которую заплатил, и никто не читает его запросы. Это гарантирует криптография, сервису не нужно верить на слово.

GPU confidential computing появился начиная с NVIDIA H100. H100 стоит десятки тысяч долларов, это совсем не потребительская видеокарта. Поставщиками в таких сетях в основном становятся дата-центры, и децентрализация получается ограниченной.

А хотелось бы, чтобы любой человек в любой точке мира мог подключить обычную видеокарту и генерировать токены (где-то мы это уже видели) для разных AI-моделей. Такая сеть могла бы задействовать огромный парк дешёвого простаивающего железа по всему миру: люди подключают свои видеокарты на ночь, предложение compute растёт, цена инференса падает относительно дата-центров.

Но тут возникает проблема: как гарантировать, что инференс-провайдер выполняет нужные операции и запускает нужную модель? В сеть могут войти аферисты, которые запустят заквантованную до лоботомии версию модели, модель сильно меньше исходной или вообще будут выдавать константный текст, получая деньги за токены.

Проверяют это через logprobs. Исполнитель вместе со сгенерированным текстом отдаёт распределение вероятностей следующих токенов. Валидаторы случайным образом выбирают позиции, повторно вычисляют их на заявленной модели с теми же параметрами и сравнивают распределения. Значимое расхождение выдаёт подмену: мошенника исключают из сети и лишают вознаграждения. Достаточно проверить малую случайную долю позиций. Logprob-проверка подтверждает честность инференса, но приватность запроса сама по себе не обеспечивает.

На этом подходе строится Gonka, сеть децентрализованного инференса, которую развивают братья Давид и Даниил Либерманы. Сеть рассчитана на распределённое железо, включая потребительские GPU.
19🤝4🤔1
Please open Telegram to view this post
VIEW IN TELEGRAM
👍122
Openai agent kit Забыт.
😢138🤣7🤯2
Gpt store Забыт

Gpt tasks Забыты.
🤣93🔥2
Rabbit r1 Забыт.
🤣194🤯1
Bolt.new Забыт.

Jasper AI забыт (не уверен, что хотя бы 10% от подписчиков хотя бы знают, что это, а это первый chat gpt wrapper юникорн полностью уничтожен через 43 дня после релиза )

Stable diffusion забыта

Devin забыт

Pause AI letter забыто
5😁1