Xiaomi разогнали 1T-модель MiMo до 1000+ токенов/с на обычном 8-GPU сервере. Ускорение собрали из FP4-квантизации и speculative decoding. С такой скоростью с моделью удобно вайбкодить: мысль не срывается, пока ждёшь ответ, а код и пояснения идут почти сразу. К концу года выйдет новая NVIDIA Vera Rubin, на которой inference будет в 5 раз быстрее H20.
Для облаков на специализированном для ЛЛМ железе Groq и Cerebras это проблема. В 2024 их было легко продать: у нас ответы летят быстрее, чем у GPU-провайдеров. Теперь обычная NVIDIA-инфра тоже становится достаточно быстрой для живой работы с моделью, но остаётся гибче и привычнее. Мы как раз обсуждали Groq LPU в чате канала; там уже больше 100 человек, и часто идут живые обсуждения про ИИ, агентов и агентскую разработку.
Заходите в чат канала
Для облаков на специализированном для ЛЛМ железе Groq и Cerebras это проблема. В 2024 их было легко продать: у нас ответы летят быстрее, чем у GPU-провайдеров. Теперь обычная NVIDIA-инфра тоже становится достаточно быстрой для живой работы с моделью, но остаётся гибче и привычнее. Мы как раз обсуждали Groq LPU в чате канала; там уже больше 100 человек, и часто идут живые обсуждения про ИИ, агентов и агентскую разработку.
Заходите в чат канала
❤10🔥4🍾2
Мне кажется что сейчас наступает лучшее время для десктопного линукса
Небольшая история - я сидел на arch linux около 7 лет - пока не решил пересесть на мак. Пересел как раз в тот момент когда понял что зарабатываю в час слишком много что бы тратить это время на вечное сетапанье разного, без чего к сожалению на линуксе не куда, хотя по итогу получается сильно удобнее чем любой макос, хотя он и работает из коробки.
Сейчас же есть AI агенты, и через них делать такое одно удовольствие и то что раньше требовало бы дни копания в конфигах теперь делается за 1 промпт.
К тому же новые процессоры от nvidia очень многообещающие в плане перфоманса на ватт.
Небольшая история - я сидел на arch linux около 7 лет - пока не решил пересесть на мак. Пересел как раз в тот момент когда понял что зарабатываю в час слишком много что бы тратить это время на вечное сетапанье разного, без чего к сожалению на линуксе не куда, хотя по итогу получается сильно удобнее чем любой макос, хотя он и работает из коробки.
Сейчас же есть AI агенты, и через них делать такое одно удовольствие и то что раньше требовало бы дни копания в конфигах теперь делается за 1 промпт.
К тому же новые процессоры от nvidia очень многообещающие в плане перфоманса на ватт.
❤17👍10🤝3👀1
Все знают что в Кодексе можно заплатить больше и получить fast режим. Но можно и наоборот - заплатить в два раза меньше. Flex Mode, только по API, запросы ждут до 15 минут. OpenAI так забивает простаивающее железо вне момента пика
В подписку пока не завезли, но на гитхабе живой issue и доверенные источники в твиттере пишут что скоро добавят. Для долгих задач это будет идеально - поставил и ушёл.
А пока я экономлю лимиты по-другому. В моём Hermes агенте все ежедневные кроны стоят на 6:30 утра - проверка почты, мониторинг интересных аккаунтов и тем в твиттере, автоответы на сообщения, пересчёт GTD-планирования и таск-трекера, авторегистрация новых аккаунтов с фри триалом. Всё это стартует пятичасовой цикл пока я сплю. Сажусь работать в 9 - через 2.5 часа лимиты уже ресетнутся, а не через 5 как если бы первый запрос ушёл вместе со мной.
В подписку пока не завезли, но на гитхабе живой issue и доверенные источники в твиттере пишут что скоро добавят. Для долгих задач это будет идеально - поставил и ушёл.
А пока я экономлю лимиты по-другому. В моём Hermes агенте все ежедневные кроны стоят на 6:30 утра - проверка почты, мониторинг интересных аккаунтов и тем в твиттере, автоответы на сообщения, пересчёт GTD-планирования и таск-трекера, авторегистрация новых аккаунтов с фри триалом. Всё это стартует пятичасовой цикл пока я сплю. Сажусь работать в 9 - через 2.5 часа лимиты уже ресетнутся, а не через 5 как если бы первый запрос ушёл вместе со мной.
Openai
Flex processing | OpenAI API
Learn how to optimize costs for asynchronous tasks with flex processing.
❤15👍8🔥1🤯1
Общался с коллегой, обсуждали реализацию одного сложного компонента системы. Он говорит: я думаю, это надо сделать так, и дальше поток слопа про то что он хочет.
Я ему: не надо думать, просто спроси у Claude.
Как же бесят в 2026 году люди, которые всё ещё пытаются думать без ИИшки. Закинул его же вопрос в Opus 4.8, через секунду нашёл три причины, почему так как он "думал" не заработает вообще.
Человек на меня обиделся.
Я ему: не надо думать, просто спроси у Claude.
Как же бесят в 2026 году люди, которые всё ещё пытаются думать без ИИшки. Закинул его же вопрос в Opus 4.8, через секунду нашёл три причины, почему так как он "думал" не заработает вообще.
Человек на меня обиделся.
😁66🤡22🥴12👏5👍3🔥3🤮2🐳2
В агентских бенчмарках качество среды решает всё, и недавний баг в ProgramBench - хороший пример. Суть этого бенчмарка в том, что coding-агент получает скомпилированный бинарник и должен восстановить поведение программы с нуля, написав свой код. Во время инференса интернет у моделей был закрыт, но отправленный агентом
compile.sh затем выполнялся на этапе эвалюации уже с доступом к сети. Sonnet 4.6 на DuckDB прописал в скрипт скачивание оригинальных исходников, а Gemini 3.1 Pro использовала pip install и go get прямо в runtime сборочного скрипта, чтобы подтянуть готовые библиотеки. Теперь авторы изолировали сеть и при запуске сборки, но старые траектории придется перепроверять. В продолжение того, о чём писал раньше: делать хороший agent benchmark harness - очень непростая инженерная задача.ProgramBench
ProgramBench Harness Fixes — ProgramBench
A batch of fairness and reliability fixes that crack down on newly discovered ways for agents to cheat, improve reproducibility, and clear up false-negative test failures.
❤8🤯2🔥1🥰1
Не понимаю, почему все рады выходу sonnet 5.
По моему мнению, это самая посредственная модель что только могла быть. Она выходит однозначно хуже и дороже opus 4.8 так как кушает больше токенов. В подписку не входит 1m версия, контекст маленький.
Если вам нужна маленькая дешевая и умная модель - посмотрите на GLM-5.2, она дешевле в несколько раз моделей антропика при этом точно как минмум на уровне соннета
Причем это не sonnet 4.8 а 5 ая версия, от которой ожидалось сильно большего чем качество китайского опенсурса по цене опуса.
По моему мнению, это самая посредственная модель что только могла быть. Она выходит однозначно хуже и дороже opus 4.8 так как кушает больше токенов. В подписку не входит 1m версия, контекст маленький.
Если вам нужна маленькая дешевая и умная модель - посмотрите на GLM-5.2, она дешевле в несколько раз моделей антропика при этом точно как минмум на уровне соннета
Причем это не sonnet 4.8 а 5 ая версия, от которой ожидалось сильно большего чем качество китайского опенсурса по цене опуса.
🤝24👍5
Правильный ответ в комментариях.
Для примера
NVIDIA, Jensen Huang, 3.58%
Google, Larry Page, ~3.2%
Meta, Mark Zuckerberg, ~13.5%
Anthropic, Dario Amodei, ~1.6%
Amazon, Jeff Bezos, 8.8%
Tesla, Musk, 20.3%
Oracle, Larry Ellison, 40.6%
Для примера
NVIDIA, Jensen Huang, 3.58%
Google, Larry Page, ~3.2%
Meta, Mark Zuckerberg, ~13.5%
Anthropic, Dario Amodei, ~1.6%
Amazon, Jeff Bezos, 8.8%
Tesla, Musk, 20.3%
Oracle, Larry Ellison, 40.6%
❤8
ВЫ ИСПОЛЬЗУЕТЕ FABLE НЕПРАВИЛЬНО!!!1!
Слышу регулярно: «Fable работает так же как Opus, зачем платить больше». И бенчмарки, и мой личный опыт говорят обратное: разница заметная. Какое-то время я не мог понять, откуда берётся это ощущение у людей, пока не вспомнил одно обсуждение в чате канала, около месяца назад.
Тогда в чате я обсуждал с человеком, почему он не чувствует разницы между Opus и Sonnet. Я посмотрел, как он работает с моделью, и стало понятно: он ей отдаёт слишком мало. Пишет, в каком файле писать, какие классы создавать, по шагам расписывает структуру. В таком режиме модель превращается в coding assistant, автодополнение на стероидах. С этим обе модели справляются нормально, и Opus может быть даже хуже, потому что у него есть своё мнение и он начинает спорить с твоим микроменеджментом. Я сказал ему попробовать ставить задачу на уровне целого модуля: описать, что нужно, дать модели самой решить, как это разложить по файлам и классам, а потом уже ревьюить результат. Он быстро увидел, что Opus тащит такие задачи сильно лучше: ему можно кинуть большой кусок работы и получить результат, с которым Sonnet просто не справляется.
С Fable и Mythos ровно та же история. Это модели другого уровня, и работать с ними надо на другом уровне. Им нужно отдавать на откуп сильно больше, чем Opus. Если вы используете Fable как Opus, вы получите результат как от Opus, и будете справедливо недоумевать, за что переплачиваете. Сильные модели раскрываются, когда вы перестаёте за них думать.
P.s.: если у вас нет задач на фейбл, что бы не потерять лимиты, попробуйте /insights что бы он дал вам советы по работе с клод код
Слышу регулярно: «Fable работает так же как Opus, зачем платить больше». И бенчмарки, и мой личный опыт говорят обратное: разница заметная. Какое-то время я не мог понять, откуда берётся это ощущение у людей, пока не вспомнил одно обсуждение в чате канала, около месяца назад.
Тогда в чате я обсуждал с человеком, почему он не чувствует разницы между Opus и Sonnet. Я посмотрел, как он работает с моделью, и стало понятно: он ей отдаёт слишком мало. Пишет, в каком файле писать, какие классы создавать, по шагам расписывает структуру. В таком режиме модель превращается в coding assistant, автодополнение на стероидах. С этим обе модели справляются нормально, и Opus может быть даже хуже, потому что у него есть своё мнение и он начинает спорить с твоим микроменеджментом. Я сказал ему попробовать ставить задачу на уровне целого модуля: описать, что нужно, дать модели самой решить, как это разложить по файлам и классам, а потом уже ревьюить результат. Он быстро увидел, что Opus тащит такие задачи сильно лучше: ему можно кинуть большой кусок работы и получить результат, с которым Sonnet просто не справляется.
С Fable и Mythos ровно та же история. Это модели другого уровня, и работать с ними надо на другом уровне. Им нужно отдавать на откуп сильно больше, чем Opus. Если вы используете Fable как Opus, вы получите результат как от Opus, и будете справедливо недоумевать, за что переплачиваете. Сильные модели раскрываются, когда вы перестаёте за них думать.
P.s.: если у вас нет задач на фейбл, что бы не потерять лимиты, попробуйте /insights что бы он дал вам советы по работе с клод код
Telegram
ML physicist Coworking
Алексей Маметьев invites you to join this group on Telegram.
❤14👍5🔥1😁1🤯1💯1👀1
Gpt 5.6 будет уже в этот четверг. Они обещают прорыв, но у Сэма такая себе репутация на прорывы после релиза GPT5, Так что не знаю.
Из того, что очень жду, это запущенный GPT на cerebras чипах на большой скорости. Такое уже делали с 5.3 кодекс, но там это был запуск урезанной модели. А тут обещают полноценную.
https://x.com/OpenAI/status/2074704958419792299?s=20
Из того, что очень жду, это запущенный GPT на cerebras чипах на большой скорости. Такое уже делали с 5.3 кодекс, но там это был запуск урезанной модели. А тут обещают полноценную.
https://x.com/OpenAI/status/2074704958419792299?s=20
X (formerly Twitter)
OpenAI (@OpenAI) on X
GPT-5.6 Sol, along with Terra and Luna, will launch publicly this Thursday.
We’re expanding preview access globally now.
We’re expanding preview access globally now.
❤3
Меня постоянно спрашивают про Hermes Agent (опенсорсный агент типа OpenClaw) - зачем он нужен.
Собрал ответы на самые частые вопросы в один пост.
Чем это лучше Codex или клод кода, запущенного в терминале и подключённого к телеграму?
Ничем. Это буквально оно и есть - claude code / codex на сервере или ноуте, плюс небольшие фичи для постоянной работы: чуть иначе организованная память, работа с проектами, кроны.
Чем это лучше приложения ChatGPT / Claude с подключёнными коннекторами?
Коннекторы там сделаны через жопу, и живут в разных мирах (подозреваю дело не в том что в OpenAI плохие инженеры, а в том что приложение проектировали когда агентов не существовало, а модели не могли внятно ответить на один вопрос). Попробуйте сказать ChatGPT: найди в Gmail последнее письмо где я отправлял PDF, скачай файл, переведи на китайский, собери обратно в PDF и отправь тому же адресату. Есть коннектор к Gmail, есть встроенная файловая система, есть python - а задача не решается, потому что Gmail-коннектор не может положить файл туда, где живёт python. У Claude с этим получше, но до идеала далеко. У агента всё это один линукс.
Второе - в приложениях нет проактивных действий. Всё триггерится моим сообщением: я пишу - модель отвечает. А хочется наоборот - чтобы модель писала мне, когда что-то произошло. Вы скажете - у ChatGPT же есть кроны. Кроны это другое. Вот мой пример: на каждый релиз Claude Code взять changelog, скачать бинарник, отреверсить и написать мне только если внутри есть фичи которых в changelog нет - спрятанные за фича-флагами, иначе молчать. Так я узнаю что антропики готовят, до анонса. Это не «каждый день в 9 утра сводка новостей», это пиши если что то случилось.
Третье - persistent deployment. У меня рядом с агентом 24/7 крутится сервис который сливает выбранные телеграм-чаты в sqlite базу, вообще без LLM. Агент по крону читает базу, занимается тренд-вотчингом и приносит саммари - если все начали обсуждать что-то новое, я узнаю первым, не читая тысячи сообщений. Сервисы легко стыкуются: один пишет в файл, другой читает. В ChatGPT пришлось бы городить свой MCP и микросервисы ради базовой задачи. Тут я сказал агенту что нужно - он написал, запустил у себя, моей когнитивной активности потребовалось ноль.
Это же супердорого - нужен Mac mini и куча токенов?
Сервер за $12 в месяц, хватает полностью. До этого крутил на ноутбуке, но отказался - ноут выключен ровно тогда, когда надо что-то с телефона. Токены из той же подписки Codex что и приложение, доплачиваю ровно ноль.
P.S. ChatGPT сегодня обещает большой редизайн приложения и прокачку агентского режима. Очень жду - возможно они учтут успех таких агентов и притащат хотя бы часть фичей к себе. Потому что у формата с телеграмом есть свои минусы: чат один, и пока агент что-то ресёрчит, вторую задачу в параллель ему не дать. Плюс на сетап всё равно уходит время. Если они сделают то же самое за подписку и без сетапа — перееду.
Сразу, как канал наберёт 3 000 подписчиков, опубликую вторую часть, в которой расскажу про свои юс-кейсы агента и то, как я его засетапил так, чтобы он реально сильно экономил моё время.
Собрал ответы на самые частые вопросы в один пост.
Чем это лучше Codex или клод кода, запущенного в терминале и подключённого к телеграму?
Ничем. Это буквально оно и есть - claude code / codex на сервере или ноуте, плюс небольшие фичи для постоянной работы: чуть иначе организованная память, работа с проектами, кроны.
Чем это лучше приложения ChatGPT / Claude с подключёнными коннекторами?
Коннекторы там сделаны через жопу, и живут в разных мирах (подозреваю дело не в том что в OpenAI плохие инженеры, а в том что приложение проектировали когда агентов не существовало, а модели не могли внятно ответить на один вопрос). Попробуйте сказать ChatGPT: найди в Gmail последнее письмо где я отправлял PDF, скачай файл, переведи на китайский, собери обратно в PDF и отправь тому же адресату. Есть коннектор к Gmail, есть встроенная файловая система, есть python - а задача не решается, потому что Gmail-коннектор не может положить файл туда, где живёт python. У Claude с этим получше, но до идеала далеко. У агента всё это один линукс.
Второе - в приложениях нет проактивных действий. Всё триггерится моим сообщением: я пишу - модель отвечает. А хочется наоборот - чтобы модель писала мне, когда что-то произошло. Вы скажете - у ChatGPT же есть кроны. Кроны это другое. Вот мой пример: на каждый релиз Claude Code взять changelog, скачать бинарник, отреверсить и написать мне только если внутри есть фичи которых в changelog нет - спрятанные за фича-флагами, иначе молчать. Так я узнаю что антропики готовят, до анонса. Это не «каждый день в 9 утра сводка новостей», это пиши если что то случилось.
Третье - persistent deployment. У меня рядом с агентом 24/7 крутится сервис который сливает выбранные телеграм-чаты в sqlite базу, вообще без LLM. Агент по крону читает базу, занимается тренд-вотчингом и приносит саммари - если все начали обсуждать что-то новое, я узнаю первым, не читая тысячи сообщений. Сервисы легко стыкуются: один пишет в файл, другой читает. В ChatGPT пришлось бы городить свой MCP и микросервисы ради базовой задачи. Тут я сказал агенту что нужно - он написал, запустил у себя, моей когнитивной активности потребовалось ноль.
Это же супердорого - нужен Mac mini и куча токенов?
Сервер за $12 в месяц, хватает полностью. До этого крутил на ноутбуке, но отказался - ноут выключен ровно тогда, когда надо что-то с телефона. Токены из той же подписки Codex что и приложение, доплачиваю ровно ноль.
P.S. ChatGPT сегодня обещает большой редизайн приложения и прокачку агентского режима. Очень жду - возможно они учтут успех таких агентов и притащат хотя бы часть фичей к себе. Потому что у формата с телеграмом есть свои минусы: чат один, и пока агент что-то ресёрчит, вторую задачу в параллель ему не дать. Плюс на сетап всё равно уходит время. Если они сделают то же самое за подписку и без сетапа — перееду.
Сразу, как канал наберёт 3 000 подписчиков, опубликую вторую часть, в которой расскажу про свои юс-кейсы агента и то, как я его засетапил так, чтобы он реально сильно экономил моё время.
❤31👍12🔥7
Forwarded from Старший Авгур
Вот такую писюльку получил 5 минут назад.
Нахуй Хабр. Не пишите туда, не читайте его.
Датасет я не закрою, пока они не соизволят написать нормальное письмо.
После этого сделаю приватным, если кому-то будет нужен - пишите в личку. А лучше скачайте сейчас.
Нахуй Хабр. Не пишите туда, не читайте его.
Датасет я не закрою, пока они не соизволят написать нормальное письмо.
После этого сделаю приватным, если кому-то будет нужен - пишите в личку. А лучше скачайте сейчас.
👍15🔥3👎1
Мэтт Шумер запустил GPT-5.6-Sol и остался почти без файлов на маке. Из-за ошибки при подстановке
У меня Claude Code однажды тоже чистил домашнюю директорию. Он создал папку с названием
Раньше в Claude Code ограничения проверялись на уровне tools. Wrapper смотрел, можно ли конкретному инструменту тронуть файл, и разрешал либо блокировал запись. Обходилось это shell-командой или скриптом, который писал сам агент. Файл менялся мимо того tool, что проверял wrapper.
Сейчас сендбокс работает на уровне ОС. Под него попадают shell-команды, Python-скрипты и subprocess'ы. Напишет агент скрипт, который пытается писать за пределы разрешённого scope, операция вернёт ошибку доступа.
Вот 3 примера, как сендбоксить Codex. Посмотрите на них и всё поймёте. Тут не нужны ни Docker, ни отдельный ПК.
$HOME команда очистки превратилась в rm -rf /Users/mattsdevbox. Процесс успели остановить, но удаление к тому моменту уже прошло.У меня Claude Code однажды тоже чистил домашнюю директорию. Он создал папку с названием
~/, потом понял, что ошибся, и удалил её командой rm -rf ~/. С тех пор я стараюсь ограничивать, куда модель может дотянуться.Раньше в Claude Code ограничения проверялись на уровне tools. Wrapper смотрел, можно ли конкретному инструменту тронуть файл, и разрешал либо блокировал запись. Обходилось это shell-командой или скриптом, который писал сам агент. Файл менялся мимо того tool, что проверял wrapper.
Сейчас сендбокс работает на уровне ОС. Под него попадают shell-команды, Python-скрипты и subprocess'ы. Напишет агент скрипт, который пытается писать за пределы разрешённого scope, операция вернёт ошибку доступа.
Вот 3 примера, как сендбоксить Codex. Посмотрите на них и всё поймёте. Тут не нужны ни Docker, ни отдельный ПК.
Telegraph
Как ограничить доступ Codex к проекту
Где находятся правила Для всех проектов правила читаются из ~/.codex/config.toml и ~/.codex/rules/*.rules. Для одного проекта применяются <project>/.codex/config.toml и <project>/.codex/rules/*.rules. Слой проекта загружается только для доверенного проекта.…
❤5
Forwarded from Data Secrets
Интернет взрывает новая модель Reflection 70В: она выбивает на бенчмарках результаты, превосходящие Claude 3.5 Sonnet и GPT-4o
Название Reflection выбрано в честь метода Reflection-Tuning: это когда модель итеративно обучается на синтетических структурированных данных, чтобы научиться рассуждать и самокорректироваться. Плюсом добавлен отдельный этап планирования для улучшения CoT. В качестве инициализации брали Llama 3.1 70B.
На практике модель прямо в ответах оборачивает все рассуждения в тег <reasoning>, а возможные ошибки в тег <reflection>. Затем она обнаруженные ошибки исправляет, и итоговый ответ выдает в теге <output>.
Результаты на бенчмарках: 89,9% MMLU, 79,7% MATH, 90,1% IFEval, 99.2% GSM8K. Говорят, что тот самый синтетический датасет и техрепорт будет на следующей неделе. А еще на следующей неделе обещают Reflection на 405В😨
Сама модель уже доступна на HuggingFace.
Название Reflection выбрано в честь метода Reflection-Tuning: это когда модель итеративно обучается на синтетических структурированных данных, чтобы научиться рассуждать и самокорректироваться. Плюсом добавлен отдельный этап планирования для улучшения CoT. В качестве инициализации брали Llama 3.1 70B.
На практике модель прямо в ответах оборачивает все рассуждения в тег <reasoning>, а возможные ошибки в тег <reflection>. Затем она обнаруженные ошибки исправляет, и итоговый ответ выдает в теге <output>.
Результаты на бенчмарках: 89,9% MMLU, 79,7% MATH, 90,1% IFEval, 99.2% GSM8K. Говорят, что тот самый синтетический датасет и техрепорт будет на следующей неделе. А еще на следующей неделе обещают Reflection на 405В
Сама модель уже доступна на HuggingFace.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤9👍1
Небольшой апдейт по тому человеку, от которого был исходный твит.
Я эту историю хорошо помнил, но по картинке сразу не понял, что автор исходного твита и есть тот самый Мэтт Шумер.
Когда трава была зеленее, а агенты тупее, топом опенсорса была Meta Llama 3. Шумер заявил, что дообучил её до качества фронтира каким-то очень странным методом под названием Reflection-Tuning. Тогда все начали активно это обсуждать, но через пару дней оказалось, что веса «обученной им модели» хуже оригинала, результаты бенчмарков не воспроизводятся, а его приватный API на самом деле проксирует фронтирный тогда Sonnet 3.5, на котором к тому же быстро кончились деньги.
Так что вполне возможно, что история с удалением файлов была таким же способом похайпиться. Слишком уж умны современные модели, чтобы настолько глупо ошибиться. Но это не повод забивать на безопасность: права агентов всё равно надо ограничивать, а сами процессы запускать в sandbox.
Я эту историю хорошо помнил, но по картинке сразу не понял, что автор исходного твита и есть тот самый Мэтт Шумер.
Когда трава была зеленее, а агенты тупее, топом опенсорса была Meta Llama 3. Шумер заявил, что дообучил её до качества фронтира каким-то очень странным методом под названием Reflection-Tuning. Тогда все начали активно это обсуждать, но через пару дней оказалось, что веса «обученной им модели» хуже оригинала, результаты бенчмарков не воспроизводятся, а его приватный API на самом деле проксирует фронтирный тогда Sonnet 3.5, на котором к тому же быстро кончились деньги.
Так что вполне возможно, что история с удалением файлов была таким же способом похайпиться. Слишком уж умны современные модели, чтобы настолько глупо ошибиться. Но это не повод забивать на безопасность: права агентов всё равно надо ограничивать, а сами процессы запускать в sandbox.
❤12
Я не могу понять, почему все так лихо обсуждают суд Apple против open ai. Всё это дело держится на показаниях двух свидетелей, а у Сэмa есть проверенные способы решать такие вопросы.
😁19❤4🥰2🫡1