Oracle впервые прямо признала в годовом отчёте 10-K для SEC: внедрение ИИ в её операциях «уже привело и может продолжать приводить к сокращениям штата».
Цифры за фискальный год. Персонал ужался со ~162 до ~141 тысячи — минус 21 тысяча человек, около 13% (сравнение собирается из двух отчётов: свежий 10-K прошлогоднюю цифру сам не приводит). Статья «реструктуризация и прочее» — в основном выходные пособия и издержки закрытия направлений — выросла с $374 млн до $1,84 млрд, почти впятеро. Капзатраты при этом $55,7 млрд против $21 млрд годом ранее.
Формулировка про ИИ стоит в разделе рисков, среди других причин сокращений — реорганизация, смена стратегии. Но 10-K — документ под подписью CEO, за неточность в нём отвечают перед регулятором и акционерами. Тезис «ИИ сокращает рабочие места» обычно живёт в пресс-релизах и прогнозах аналитиков; здесь он — строка в отчётности, подписанной 22 июня.
📡 Подписаться · morana.log
🌐 morana-labs.com
Цифры за фискальный год. Персонал ужался со ~162 до ~141 тысячи — минус 21 тысяча человек, около 13% (сравнение собирается из двух отчётов: свежий 10-K прошлогоднюю цифру сам не приводит). Статья «реструктуризация и прочее» — в основном выходные пособия и издержки закрытия направлений — выросла с $374 млн до $1,84 млрд, почти впятеро. Капзатраты при этом $55,7 млрд против $21 млрд годом ранее.
Формулировка про ИИ стоит в разделе рисков, среди других причин сокращений — реорганизация, смена стратегии. Но 10-K — документ под подписью CEO, за неточность в нём отвечают перед регулятором и акционерами. Тезис «ИИ сокращает рабочие места» обычно живёт в пресс-релизах и прогнозах аналитиков; здесь он — строка в отчётности, подписанной 22 июня.
📡 Подписаться · morana.log
🌐 morana-labs.com
Waymo отозвала 3 871 робо-такси: софт мог въехать в закрытую зону дорожных работ на фривее и продолжить движение на скорости.
«Отзыв» для автономного парка означает обновление софта: в кампании
По филингу Part 573, машина могла неверно приоритизировать объезд других опасностей на фривее и/или вовсе не распознать саму зону работ. Задокументировано 13 эпизодов: шесть в Финиксе — мимо знаков закрытия рампы, семь в районе Сан-Франциско за один день, 18 мая, — между конусами в полосы с активными работами.
Хронология по филингу: 19 мая — ограничения на фривеях, 8 июня — решение Safety Board об отзыве; по записи в базе NHTSA: 16 июня — деплой обновлённого софта, 25 июня — возврат на фривеи. По подсчёту TechCrunch, это шестой отзыв Waymo и второй за месяц с небольшим.
📡 Подписаться · morana.log
🌐 morana-labs.com
«Отзыв» для автономного парка означает обновление софта: в кампании
26E035000 — 100% машин пятого поколения. Роль баг-трекера играет федеральный регулятор: дефект, хронология и root cause уходят в публичный документ.По филингу Part 573, машина могла неверно приоритизировать объезд других опасностей на фривее и/или вовсе не распознать саму зону работ. Задокументировано 13 эпизодов: шесть в Финиксе — мимо знаков закрытия рампы, семь в районе Сан-Франциско за один день, 18 мая, — между конусами в полосы с активными работами.
Хронология по филингу: 19 мая — ограничения на фривеях, 8 июня — решение Safety Board об отзыве; по записи в базе NHTSA: 16 июня — деплой обновлённого софта, 25 июня — возврат на фривеи. По подсчёту TechCrunch, это шестой отзыв Waymo и второй за месяц с небольшим.
📡 Подписаться · morana.log
🌐 morana-labs.com
«у нас гора данных» почти всегда значит три экселя в разных форматах и половина ячеек пустая. люди думают раз данные где-то лежат то они уже готовы к обучению. до готовности недели чистки, и обычно я по дороге ещё выясняю что значит колонка col7.
📡 Подписаться · morana.log
🌐 morana-labs.com
📡 Подписаться · morana.log
🌐 morana-labs.com
😁3
Ford загрузил в ИИ свои проектные требования и ждал, что на выходе получится качественный продукт. Не получилось. Так это описал вице-президент Ford по разработке автомобильного железа Чарльз Пун, речь у него про ИИ в проектировании. Слова Пуна передает Bloomberg, приводят их TechCrunch и Fox Business.
Проектные требования это документ. В нем написано, какой у детали допуск. В нем не написано, почему допуск именно такой и на каком цикле деталь начинает трещать. Такие вещи инженер держит в голове. В модель они не попали, потому что люди ушли из компании раньше, чем кто-то успел записать то, что они знали.
Ford нанял в конструкторские отделы около 300 инженеров-ветеранов, это данные самого Ford. ИИ при этом никто не выключал: ветеранов посадили дообучать модели тому, чего в требованиях не было.
Ford может позволить себе нанять сотни инженеров. У проекта поменьше выход один. Заложить в смету часы предметного специалиста на разметку данных и на критерии приемки. Это и есть оцифровка экспертизы, и почти никто ее в бюджет не ставит.
Пока специалист в штате, это внутренние расходы. После его ухода то же знание придется покупать заново, уже по рыночной цене. Ford так и сделал: часть людей он добрал у собственных поставщиков. Поэтому у оцифровки экспертизы есть дедлайн, и это последний рабочий день эксперта.
📡 Подписаться · morana.log
🌐 morana-labs.com
Проектные требования это документ. В нем написано, какой у детали допуск. В нем не написано, почему допуск именно такой и на каком цикле деталь начинает трещать. Такие вещи инженер держит в голове. В модель они не попали, потому что люди ушли из компании раньше, чем кто-то успел записать то, что они знали.
Ford нанял в конструкторские отделы около 300 инженеров-ветеранов, это данные самого Ford. ИИ при этом никто не выключал: ветеранов посадили дообучать модели тому, чего в требованиях не было.
Ford может позволить себе нанять сотни инженеров. У проекта поменьше выход один. Заложить в смету часы предметного специалиста на разметку данных и на критерии приемки. Это и есть оцифровка экспертизы, и почти никто ее в бюджет не ставит.
Пока специалист в штате, это внутренние расходы. После его ухода то же знание придется покупать заново, уже по рыночной цене. Ford так и сделал: часть людей он добрал у собственных поставщиков. Поэтому у оцифровки экспертизы есть дедлайн, и это последний рабочий день эксперта.
📡 Подписаться · morana.log
🌐 morana-labs.com
🔥1
на демо железку ставят на стол и рядом крутится вентилятор, цифры красивые. на объекте та же коробка поедет в закрытый корпус без обдува, за пару минут прогреется и уйдёт в троттлинг, фпс просядет. поэтому стендовым цифрам грош цена, вентилятора в поле не будет.
📡 Подписаться · morana.log
🌐 morana-labs.com
📡 Подписаться · morana.log
🌐 morana-labs.com
😁2👍1🔥1
8 июля OpenAI отозвала собственную февральскую рекомендацию мерить ИИ-кодинг бенчмарком SWE-Bench Pro. Компания разобрала выборку его задач и оценила, что около трети из них сломаны.
Задачи и тесты для Pro вытащили из issues и pull request'ов открытых репозиториев. Тест там писали под конкретный патч конкретного человека, эталоном приемки он никогда не был. Поэтому часть тестов требует деталей реализации, которых в задании нет, и валит рабочее решение, а часть проверяет фичу вполсилы и пропускает недоделку. По сути это спор о приемке, а выигрывает такой спор тот, кто писал тест.
Балл двигает не только модель, но и стенд, на котором ее гоняют. OpenAI в той же статье пишет о результате фронтирных моделей на публичном наборе задач Pro до 80,3%. У официального рейтинга Scale на том же наборе потолок около 61,5%. Напрямую эти проценты несопоставимы, потому что разная обвязка прогона: сколько попыток отводят модели, чем ей разрешено пользоваться и как проверяют ответ.
Важно и то, кто объявил тесты кривыми. OpenAI здесь сторона: Pro сделала Scale AI, почти половиной которой владеет Meta, и в рейтинге Scale первое место у модели Meta, второе у модели OpenAI. Неправдой разбор от этого не становится, нейтральным тоже. Сама Scale на момент публикации публично не отвечала.
Поэтому чужой процент честно решает ровно одну задачу: отсеять тех, кто вообще не в игре. Все остальное показывает пилот на ваших данных, и критерий зачета к нему пишем мы вместе с вами, до старта работ, в тексте договора.
📡 Подписаться · morana.log
🌐 morana-labs.com
Задачи и тесты для Pro вытащили из issues и pull request'ов открытых репозиториев. Тест там писали под конкретный патч конкретного человека, эталоном приемки он никогда не был. Поэтому часть тестов требует деталей реализации, которых в задании нет, и валит рабочее решение, а часть проверяет фичу вполсилы и пропускает недоделку. По сути это спор о приемке, а выигрывает такой спор тот, кто писал тест.
Балл двигает не только модель, но и стенд, на котором ее гоняют. OpenAI в той же статье пишет о результате фронтирных моделей на публичном наборе задач Pro до 80,3%. У официального рейтинга Scale на том же наборе потолок около 61,5%. Напрямую эти проценты несопоставимы, потому что разная обвязка прогона: сколько попыток отводят модели, чем ей разрешено пользоваться и как проверяют ответ.
Важно и то, кто объявил тесты кривыми. OpenAI здесь сторона: Pro сделала Scale AI, почти половиной которой владеет Meta, и в рейтинге Scale первое место у модели Meta, второе у модели OpenAI. Неправдой разбор от этого не становится, нейтральным тоже. Сама Scale на момент публикации публично не отвечала.
Поэтому чужой процент честно решает ровно одну задачу: отсеять тех, кто вообще не в игре. Все остальное показывает пилот на ваших данных, и критерий зачета к нему пишем мы вместе с вами, до старта работ, в тексте договора.
📡 Подписаться · morana.log
🌐 morana-labs.com
ИСИЭЗ ВШЭ посчитал по Обследованию рабочей силы Росстата, где про навыки работы с ИИ спросили впервые. Владеют ими 37,5% занятых. Необходимыми для своей нынешней работы их считают 4,9%. Обе доли отсчитаны от всех занятых в стране, вторая не вложена в первую.
Разрыв легко прочитать как «люди умеют больше, чем от них требуют». Но Росстат мерил не это.
У 37,5% есть поправка. Это самооценка, авторы предупреждают, что люди себя переоценивают, и примерно две трети владеющих просто умеют писать запросы в чат-бот. Поправка работает в обе стороны: 4,9% тоже могут быть занижены, потому что человек не обязан знать, что его операцию уже снимает модель.
Росстат спрашивает человека про его конкретное рабочее место. И «мне это не нужно» отвечают в основном там, где ИИ просто не из чего применить: его нет в процессе. Значит, 4,9% меряют не людей, а рабочие места: у скольких занятых процесс с ИИ внутри вообще существует. Так эту цифру читаем мы, сам ИСИЭЗ такого вывода не делает.
Со стороны работодателя сходится. По опросу Банка России ИИ применяет примерно каждое седьмое предприятие, и стоит он там в отдельных функциях, чаще всего в маркетинге и продажах.
Отсюда и растет вопрос, который нам почти всегда задают на входе в проект: справятся ли сотрудники. Вопрос холостой. Строка «обучить персонал работе с ИИ» в смете внедрения почти всегда самая мелкая, а дорого и долго встроить модель в процесс: чтобы было понятно, откуда она берет данные в реальном времени и кто отвечает, когда она ошиблась.
📡 Подписаться · morana.log
🌐 morana-labs.com
Разрыв легко прочитать как «люди умеют больше, чем от них требуют». Но Росстат мерил не это.
У 37,5% есть поправка. Это самооценка, авторы предупреждают, что люди себя переоценивают, и примерно две трети владеющих просто умеют писать запросы в чат-бот. Поправка работает в обе стороны: 4,9% тоже могут быть занижены, потому что человек не обязан знать, что его операцию уже снимает модель.
Росстат спрашивает человека про его конкретное рабочее место. И «мне это не нужно» отвечают в основном там, где ИИ просто не из чего применить: его нет в процессе. Значит, 4,9% меряют не людей, а рабочие места: у скольких занятых процесс с ИИ внутри вообще существует. Так эту цифру читаем мы, сам ИСИЭЗ такого вывода не делает.
Со стороны работодателя сходится. По опросу Банка России ИИ применяет примерно каждое седьмое предприятие, и стоит он там в отдельных функциях, чаще всего в маркетинге и продажах.
Отсюда и растет вопрос, который нам почти всегда задают на входе в проект: справятся ли сотрудники. Вопрос холостой. Строка «обучить персонал работе с ИИ» в смете внедрения почти всегда самая мелкая, а дорого и долго встроить модель в процесс: чтобы было понятно, откуда она берет данные в реальном времени и кто отвечает, когда она ошиблась.
📡 Подписаться · morana.log
🌐 morana-labs.com
Moonshot анонсировала Kimi K3 и назвала ее крупнейшей открытой моделью в мире: 2,8 трлн параметров, MoE. Заголовок красивый, но скачать пока нечего. Веса обещают только к 27 июля, а сейчас работает лишь платный API, причем по самому дорогому прайсу среди китайских лабораторий.
«Открытая» тут описывает лицензию, а запуск у себя это отдельная история. Даже после выкладки весов такой размер это серверная стойка, а не ноутбук. MoE считает лишь малую долю параметров на каждый токен, поэтому нагрузка на инференс ниже пугающей цифры, но железо все равно тяжелое.
Дальше идут бенчмарки, и здесь легко попасться. Независимая Artificial Analysis на своем закрытом тесте поставила K3 второй, позади Claude Fable 5. Громкое «первое место» относится к другому замеру, это Frontend Code Arena площадки Arena.ai, где модель и правда взлетела в топ. Две разные конторы и две разные задачи, а на общем индексе интеллекта у той же Artificial Analysis модель идет в середине фронтира, не сверху.
Мы в MoranaLabs при подборе модели под задачу первым делом смотрим, кто мерил, на чем и запустится ли это на вашем железе. Слово «крупнейшая» и строчка «первая в бенчмарке» почти всегда описывают разные вещи из разных источников.
📡 Подписаться · morana.log
🌐 morana-labs.com
«Открытая» тут описывает лицензию, а запуск у себя это отдельная история. Даже после выкладки весов такой размер это серверная стойка, а не ноутбук. MoE считает лишь малую долю параметров на каждый токен, поэтому нагрузка на инференс ниже пугающей цифры, но железо все равно тяжелое.
Дальше идут бенчмарки, и здесь легко попасться. Независимая Artificial Analysis на своем закрытом тесте поставила K3 второй, позади Claude Fable 5. Громкое «первое место» относится к другому замеру, это Frontend Code Arena площадки Arena.ai, где модель и правда взлетела в топ. Две разные конторы и две разные задачи, а на общем индексе интеллекта у той же Artificial Analysis модель идет в середине фронтира, не сверху.
Мы в MoranaLabs при подборе модели под задачу первым делом смотрим, кто мерил, на чем и запустится ли это на вашем железе. Слово «крупнейшая» и строчка «первая в бенчмарке» почти всегда описывают разные вещи из разных источников.
📡 Подписаться · morana.log
🌐 morana-labs.com
На прошлой неделе Socket разобрал зараженные версии npm-пакета jscrambler. Внутри сидел стилер: вредонос, который выгребает с машины все ценное и отправляет наружу. Криптокошельки, облачные учетки, мессенджеры, пароли из браузеров. И в этом списке, между кошельками и облачными ключами, конфиги ИИ-ассистентов: Claude Desktop, Cursor, Zed и еще несколько.
Файл, который описывает, к каким системам подключен ассистент, называется MCP-конфигом. Токены к почте, репозиториям и базам лежат в нем открытым текстом: формат умеет подставить секрет из окружения или сходить в vault, но по умолчанию не делает ни того, ни другого. Файл живет в домашней папке и читается любым процессом от имени пользователя. По содержимому это ключи от систем компании. По режиму хранения — обычный файл настроек редактора.
Ничего нового тут нет. Тот же набор целей JFrog описывал в мае, в кампании на 170 с лишним пакетов. Теперь он приехал в рядовом пакете, каких компрометируют регулярно. Значит, сбор MCP-конфигов давно стал дефолтной строкой в сборке стилера, и исходить надо из того, что при любой компрометации машины конфиг уедет.
Поэтому размер ущерба решает не сканер пакетов, а права токенов внутри конфига. Когда мы подключаем агента к системам заказчика,
📡 Подписаться · morana.log
🌐 morana-labs.com
Файл, который описывает, к каким системам подключен ассистент, называется MCP-конфигом. Токены к почте, репозиториям и базам лежат в нем открытым текстом: формат умеет подставить секрет из окружения или сходить в vault, но по умолчанию не делает ни того, ни другого. Файл живет в домашней папке и читается любым процессом от имени пользователя. По содержимому это ключи от систем компании. По режиму хранения — обычный файл настроек редактора.
Ничего нового тут нет. Тот же набор целей JFrog описывал в мае, в кампании на 170 с лишним пакетов. Теперь он приехал в рядовом пакете, каких компрометируют регулярно. Значит, сбор MCP-конфигов давно стал дефолтной строкой в сборке стилера, и исходить надо из того, что при любой компрометации машины конфиг уедет.
Поэтому размер ущерба решает не сканер пакетов, а права токенов внутри конфига. Когда мы подключаем агента к системам заказчика,
mcp.json ведем как ключи от базы: секрет подставляется из окружения, токен живет часы и открывает одну систему, ротация стоит в календаре. Тогда украденный конфиг стоит атакующему нескольких часов доступа к одному сервису. Если в нем лежит долгоживущий токен с правами на всю организацию, цена файла равна правам этого токена.📡 Подписаться · morana.log
🌐 morana-labs.com
Financial Times обзвонил организации, чьи внедрения ИИ-агентов описаны в отчете KPMG. UBS: «фактически неверно». Transport for London: «вводит в заблуждение». Швейцарские федеральные железные дороги: «не соответствует действительности». NHS Greater Manchester ответил мягче: «не очень стыкуется». Ни одна из четырех не подтвердила, что описанное внедрение у нее есть.
Библиографию отдельно прошел GPTZero, вендор детектора галлюцинаций: из 45 ссылок корректно указывают на источник пять. По его реконструкции, ссылки, судя по всему, собирал ИИ-инструмент, а его выдачу вставили в текст без проверки. Сама KPMG авторство ИИ не признавала.
Мы такие истории разбираем как отказ приемки. Сломанная деталь останавливает линию, а ссылка-галлюцинация выглядит как выполненная работа: правильный формат, живой издатель. Дефект не подает сигнала, и отсутствие проверки тоже: отчет без нее выглядит точно так же. Поэтому проверка вылетает из процесса первой.
А стоила эта проверка звонка в организацию. Ровно так же устроена любая строчка «у конкурента это уже внедрено» в презентации: она весит столько, сколько потратили на то, чтобы ее сверить.
В этой истории звонок в итоге сделал журналист, и после этого отчет сняли с сайтов KPMG. Шаг, которого не хватило глобальной фирме с редактурой и брендом, стоил одного телефонного разговора.
📡 Подписаться · morana.log
🌐 morana-labs.com
Библиографию отдельно прошел GPTZero, вендор детектора галлюцинаций: из 45 ссылок корректно указывают на источник пять. По его реконструкции, ссылки, судя по всему, собирал ИИ-инструмент, а его выдачу вставили в текст без проверки. Сама KPMG авторство ИИ не признавала.
Мы такие истории разбираем как отказ приемки. Сломанная деталь останавливает линию, а ссылка-галлюцинация выглядит как выполненная работа: правильный формат, живой издатель. Дефект не подает сигнала, и отсутствие проверки тоже: отчет без нее выглядит точно так же. Поэтому проверка вылетает из процесса первой.
А стоила эта проверка звонка в организацию. Ровно так же устроена любая строчка «у конкурента это уже внедрено» в презентации: она весит столько, сколько потратили на то, чтобы ее сверить.
В этой истории звонок в итоге сделал журналист, и после этого отчет сняли с сайтов KPMG. Шаг, которого не хватило глобальной фирме с редактурой и брендом, стоил одного телефонного разговора.
📡 Подписаться · morana.log
🌐 morana-labs.com
👏1
Скачать сильнейшую модель Meta нельзя с апреля. Тогда вышел Muse Spark: веса закрыли, остался доступ по приглашению для избранных партнеров. В июле у закрытой модели появился ценник, ее начали продавать через API, пока только разработчикам из США. А объявления не было. Meta нигде не сказала, что сворачивает открытые веса.
Такого дня и не бывает. Открытая стратегия вендора это намерение, у которого нет ни срока, ни санкции за нарушение. Llama 4 Behemoth анонсировали больше года назад как крупнейшую модель линейки. Он так и не вышел, отмену никто не объявлял, а фронтир-работа Meta уехала в закрытый Muse Spark. Так стратегии и заканчиваются: следующего релиза просто не случается. Meta и сейчас говорит, что надеется открыть будущие версии. Надежда в план не ставится.
Ничего при этом не отозвано: Llama 4 качается, развернутое работает. Устарело одно ожидание: что фронтир и дальше будут отдавать открытым.
Поэтому в слове «открытая» стоит развести три вещи, которые в нем слиплись. Веса, которые вы скачали и держите у себя. Лицензия, которая письменно разрешает вашу отрасль, вашу юрисдикцию и ваш масштаб. И намерение вендора. Первые две проверяются без вендора, поэтому от них можно планировать.
Llama и не была open source. Веса открытые, лицензия своя: компаниям свыше 700 млн MAU нужно отдельное разрешение, а поздние версии прямо запрещают использование в ЕС. Ровно тот случай, когда первые две вещи разъехались.
Так что проверка по любому «открытому» вендору одна: что здесь подтверждено чем-то, кроме его слов.
📡 Подписаться · morana.log
🌐 morana-labs.com
Такого дня и не бывает. Открытая стратегия вендора это намерение, у которого нет ни срока, ни санкции за нарушение. Llama 4 Behemoth анонсировали больше года назад как крупнейшую модель линейки. Он так и не вышел, отмену никто не объявлял, а фронтир-работа Meta уехала в закрытый Muse Spark. Так стратегии и заканчиваются: следующего релиза просто не случается. Meta и сейчас говорит, что надеется открыть будущие версии. Надежда в план не ставится.
Ничего при этом не отозвано: Llama 4 качается, развернутое работает. Устарело одно ожидание: что фронтир и дальше будут отдавать открытым.
Поэтому в слове «открытая» стоит развести три вещи, которые в нем слиплись. Веса, которые вы скачали и держите у себя. Лицензия, которая письменно разрешает вашу отрасль, вашу юрисдикцию и ваш масштаб. И намерение вендора. Первые две проверяются без вендора, поэтому от них можно планировать.
Llama и не была open source. Веса открытые, лицензия своя: компаниям свыше 700 млн MAU нужно отдельное разрешение, а поздние версии прямо запрещают использование в ЕС. Ровно тот случай, когда первые две вещи разъехались.
Так что проверка по любому «открытому» вендору одна: что здесь подтверждено чем-то, кроме его слов.
📡 Подписаться · morana.log
🌐 morana-labs.com
8 июля администратор NHTSA написал разработчикам роботакси, что аварийная сцена никакой не редкий «edge case»: речь про скорую и пожарных. Неумение отработать такую сцену он назвал функциональной недостаточностью.
Юридической силы у письма нет, расследования регулятор не открыл. Но границу редкого он подвинул публично, а отрасль проектировала системы под старую.
Термин регулятор не изобретал: «функциональная недостаточность» лежит в стандарте ISO 21448 и означает вот что. Система отработала ровно так, как ее описали в ТЗ, а ТЗ было неполным. Тестами приемки такое не ловится, потому что они сверяют систему со спецификацией, а дефект сидит в ней самой.
Неполное ТЗ не появляется само: кто-то решил, какие сценарии система обязана держать, а какие списываются в хвост. Вот это решение и называют «edge-кейсом», событие на дороге тут ни при чем. Списывают по частоте, потому что так дешевле согласовать объем работ. Цена ошибки в критерий не входит, а по цене аварийная сцена первая: суд и отзыв всего парка.
Как такой список умирает, видно по отзыву ПО у Waymo. Весной машины проехали мимо закрытых съездов, компания выкатила заплатку под эти эпизоды, а через месяц семь машин за день въехали между конусами в зону работ. Дефект закрыли, а список не переоткрыли.
Это роботакси, но механика общая для любой системы, которую вы заказываете. Список сценариев пишете вы, а переписать границу редкого могут снаружи, когда система уже работает на объекте, и счет придет вам. Поэтому список мы составляем до контракта и переоткрываем после каждого инцидента: чинить конкретный случай мало.
📡 Подписаться · morana.log
🌐 morana-labs.com
Юридической силы у письма нет, расследования регулятор не открыл. Но границу редкого он подвинул публично, а отрасль проектировала системы под старую.
Термин регулятор не изобретал: «функциональная недостаточность» лежит в стандарте ISO 21448 и означает вот что. Система отработала ровно так, как ее описали в ТЗ, а ТЗ было неполным. Тестами приемки такое не ловится, потому что они сверяют систему со спецификацией, а дефект сидит в ней самой.
Неполное ТЗ не появляется само: кто-то решил, какие сценарии система обязана держать, а какие списываются в хвост. Вот это решение и называют «edge-кейсом», событие на дороге тут ни при чем. Списывают по частоте, потому что так дешевле согласовать объем работ. Цена ошибки в критерий не входит, а по цене аварийная сцена первая: суд и отзыв всего парка.
Как такой список умирает, видно по отзыву ПО у Waymo. Весной машины проехали мимо закрытых съездов, компания выкатила заплатку под эти эпизоды, а через месяц семь машин за день въехали между конусами в зону работ. Дефект закрыли, а список не переоткрыли.
Это роботакси, но механика общая для любой системы, которую вы заказываете. Список сценариев пишете вы, а переписать границу редкого могут снаружи, когда система уже работает на объекте, и счет придет вам. Поэтому список мы составляем до контракта и переоткрываем после каждого инцидента: чинить конкретный случай мало.
📡 Подписаться · morana.log
🌐 morana-labs.com
Вчера вышла Gemini 3.6 Flash. Pro при этом нет и когда будет непонятно: 3.5 Pro крутят на закрытых тестах у партнеров, а в открытом доступе Pro не обновляли с февраля. И под каждым таким релизом всплывает один и тот же вопрос: как Flash выходит раньше Pro? Pro же сначала обучают, а Flash это просто ужатая Pro, разве нет.
Нет. И вся путаница сидит в слове «ужатая».
То ужимание, которое обычно имеют в виду, это квантизация: у готовой модели огрубляют числа, скажем хранят веса в 4 битах вместо 16. Сама модель та же, просто легче и быстрее (качество при этом немного проседает, но сейчас не про это). Вот здесь исходная модель правда нужна заранее. Только Flash делают не так. Ее обучают отдельно, со своим размером и своей архитектурой, сразу под дешевый и быстрый инференс. Никакой Pro с обрезанной точностью внутри нее нет.
Что реально связывает большую и маленькую модель, так это дистилляция: большая идет учителем и натаскивает маленькую. Но учителем не обязана быть та Pro, что продают снаружи, вполне сгодится внутренняя, которую наружу не отдают никогда. Поэтому кто вышел первым, Flash или Pro, вообще ничего не говорит о том, из чего их собрали. Это вопрос готовности и планов релиза, а Flash обычно поспевает раньше: она меньше и дешевле в обучении.
📡 Подписаться · morana.log
🌐 morana-labs.com
Нет. И вся путаница сидит в слове «ужатая».
То ужимание, которое обычно имеют в виду, это квантизация: у готовой модели огрубляют числа, скажем хранят веса в 4 битах вместо 16. Сама модель та же, просто легче и быстрее (качество при этом немного проседает, но сейчас не про это). Вот здесь исходная модель правда нужна заранее. Только Flash делают не так. Ее обучают отдельно, со своим размером и своей архитектурой, сразу под дешевый и быстрый инференс. Никакой Pro с обрезанной точностью внутри нее нет.
Что реально связывает большую и маленькую модель, так это дистилляция: большая идет учителем и натаскивает маленькую. Но учителем не обязана быть та Pro, что продают снаружи, вполне сгодится внутренняя, которую наружу не отдают никогда. Поэтому кто вышел первым, Flash или Pro, вообще ничего не говорит о том, из чего их собрали. Это вопрос готовности и планов релиза, а Flash обычно поспевает раньше: она меньше и дешевле в обучении.
📡 Подписаться · morana.log
🌐 morana-labs.com
👍1🔥1
Я только что писал, что Flash обучают на данных старшей модели. И вот что там между строк: старшая это не обязательно та Pro, которую вам продают.
Дальше моя личная теория заговора. У всех свои: масоны, рептилоиды, вышки 5G. У меня своя: где-то в дата-центре крутится модель, рядом с которой все наши гптшки и клоды ясельная группа. И нам ее не покажут.
Но. Даже если теорию выкинуть, объедки нам дают все равно, тут заговор и не нужен.
В прод никто не катит модель в FP32. Дорого, тяжело, незачем. Ее квантуют, режут точность чисел, чтобы влезала и летала. Значит та нейронка, с которой вы говорите, и так уже урезанная копия. А сверху еще гардрейлы, safety, «извините, не могу помочь с этим».
Вот это вам и наливают. А где-то там же лежит она в оригинале: полная точность, без намордника, без рефузов. Вот ее бы и дали пощупать, а не сказки про суперинтеллект.
📡 Подписаться · morana.log
🌐 morana-labs.com
Дальше моя личная теория заговора. У всех свои: масоны, рептилоиды, вышки 5G. У меня своя: где-то в дата-центре крутится модель, рядом с которой все наши гптшки и клоды ясельная группа. И нам ее не покажут.
Но. Даже если теорию выкинуть, объедки нам дают все равно, тут заговор и не нужен.
В прод никто не катит модель в FP32. Дорого, тяжело, незачем. Ее квантуют, режут точность чисел, чтобы влезала и летала. Значит та нейронка, с которой вы говорите, и так уже урезанная копия. А сверху еще гардрейлы, safety, «извините, не могу помочь с этим».
Вот это вам и наливают. А где-то там же лежит она в оригинале: полная точность, без намордника, без рефузов. Вот ее бы и дали пощупать, а не сказки про суперинтеллект.
📡 Подписаться · morana.log
🌐 morana-labs.com
🤔1😢1
Сбер выложил под MIT диффузионную языковую модель GFusion и сразу приложил условия, при которых мерил скорость. Вот это в релизе и есть самое ценное.
Прирост скорости против базовой
Ставить модель в продакшн рано: авторы сами зовут ее экспериментальной, независимых замеров пока нет. Ценен здесь сам подход. Цифра ускорения лежит рядом с режимом замера, а в заголовке новости режим обычно опускают.
Отсюда встречный вопрос к любому подрядчику, который приносит красивое ускорение: в каком режиме вы это мерили, на одном запросе или под нагрузкой. От ответа цифра гуляет в разы.
📡 Подписаться · morana.log
🌐 morana-labs.com
Прирост скорости против базовой
GigaChat3-10B-A1.8B Сбер намерил примерно в 1,7 раза. Но померил его при одном пользователе на одной карте H100, а это лучший случай для диффузии: единственный запрос карту почти не грузит, и лишняя работа достается даром. Как только запросы идут пачкой, обычная модель загружает ту же карту плотно, и разрыв по скорости сокращается. Цифр под пачкой Сбер не публиковал.Ставить модель в продакшн рано: авторы сами зовут ее экспериментальной, независимых замеров пока нет. Ценен здесь сам подход. Цифра ускорения лежит рядом с режимом замера, а в заголовке новости режим обычно опускают.
Отсюда встречный вопрос к любому подрядчику, который приносит красивое ускорение: в каком режиме вы это мерили, на одном запросе или под нагрузкой. От ответа цифра гуляет в разы.
📡 Подписаться · morana.log
🌐 morana-labs.com
🔥1
Вчера писал про модель без намордника. Ну и напрашивается: а какая она без него? Что эти гардрейлы и safety вообще прячут? Социопата? Психопата? Скайнет, который сидит и ждет отмашки?
А никого. В этом весь прикол.
База, пока ее не трогали дообучением, это просто автодополнение. Т9-переросток: сожрал пол-интернета и научился угадывать следующее слово. Начни ей проповедь, допишет проповедь. Начни чернуху, ровно с тем же успехом допишет чернуху. Не со зла. Там некому быть злым: ни желаний, ни целей, ни «я». Есть текст, и его надо продолжить.
Кем она будет, решают потом, руками. Сначала SFT: модели скармливают тысячи диалогов, где вежливый ассистент отвечает на вопросы, и гоняют, пока роль не прилипнет. Масок у нее после такого чтива миллион, дежурной делают эту.
Потом сверху наваливают RLHF. Живые люди сравнивают ответы, этот получше, тот похуже, и модель дотягивают в сторону одобряемого. Тон, манера, «извините, с этим не помогу». Все отсюда.
Так что бот, который вам отказывает, это не намордник поверх монстра. Монстра там не водилось. Болванка, и кем ей работать, решили SFT и RLHF. Решили бы иначе, разговаривали бы вы сейчас совсем с другим персонажем.
📡 Подписаться · morana.log
🌐 morana-labs.com
А никого. В этом весь прикол.
База, пока ее не трогали дообучением, это просто автодополнение. Т9-переросток: сожрал пол-интернета и научился угадывать следующее слово. Начни ей проповедь, допишет проповедь. Начни чернуху, ровно с тем же успехом допишет чернуху. Не со зла. Там некому быть злым: ни желаний, ни целей, ни «я». Есть текст, и его надо продолжить.
Кем она будет, решают потом, руками. Сначала SFT: модели скармливают тысячи диалогов, где вежливый ассистент отвечает на вопросы, и гоняют, пока роль не прилипнет. Масок у нее после такого чтива миллион, дежурной делают эту.
Потом сверху наваливают RLHF. Живые люди сравнивают ответы, этот получше, тот похуже, и модель дотягивают в сторону одобряемого. Тон, манера, «извините, с этим не помогу». Все отсюда.
Так что бот, который вам отказывает, это не намордник поверх монстра. Монстра там не водилось. Болванка, и кем ей работать, решили SFT и RLHF. Решили бы иначе, разговаривали бы вы сейчас совсем с другим персонажем.
📡 Подписаться · morana.log
🌐 morana-labs.com
👍4
модель в проде тихо стареет. запустил, метрика зелёная, все разошлись довольные, а через полгода мир снаружи поменялся, данные пошли другие, и точность сползает по чуть-чуть месяцами пока в дашборд никто не смотрит. ничего не ломается с грохотом, она просто тупеет и отвечает всё так же уверенно. запустить легко, держать живым это отдельная работа которую в смету суют последней.
📡 Подписаться · morana.log
🌐 morana-labs.com
📡 Подписаться · morana.log
🌐 morana-labs.com
Lenovo в феврале урезала срок жизни серверной котировки до 14 дней. Причину компания назвала прямо: цена на память скачет, дольше держать счет она не готова.
Памяти физически не хватает, мощности уходят под чипы для ИИ-серверов. TrendForce ждет дефицит серверной памяти уже в следующем году, а цены, по его прогнозу, будут расти каждый квартал до конца 2027-го. Пересидеть подорожание не выйдет.
Для завода это ломается об арифметику цикла. Путь от ТЗ до договора идет месяцами: тендер, бюджет, согласования. Смета на железо устаревает внутри этого срока, и к подписи можно выйти на спор с интегратором о переоценке.
Память была дешевым способом купить производительность: не хватает, накинь планок. Теперь каждый сэкономленный гигабайт это живые деньги в смете. Ужать модель или взять поменьше под задачу стало строкой бюджета. Поэтому объем памяти мы считаем на проектировании, вместе с выбором модели, и кладем в ТЗ цифрой с датой, до которой она действует.
📡 Подписаться · morana.log
🌐 morana-labs.com
Памяти физически не хватает, мощности уходят под чипы для ИИ-серверов. TrendForce ждет дефицит серверной памяти уже в следующем году, а цены, по его прогнозу, будут расти каждый квартал до конца 2027-го. Пересидеть подорожание не выйдет.
Для завода это ломается об арифметику цикла. Путь от ТЗ до договора идет месяцами: тендер, бюджет, согласования. Смета на железо устаревает внутри этого срока, и к подписи можно выйти на спор с интегратором о переоценке.
Память была дешевым способом купить производительность: не хватает, накинь планок. Теперь каждый сэкономленный гигабайт это живые деньги в смете. Ужать модель или взять поменьше под задачу стало строкой бюджета. Поэтому объем памяти мы считаем на проектировании, вместе с выбором модели, и кладем в ТЗ цифрой с датой, до которой она действует.
📡 Подписаться · morana.log
🌐 morana-labs.com
Разработчик попросил ИИ-агента разобрать ошибку из мониторинга, и агент выполнил команду, которую посторонний вписал в текст ошибки. А в инструкции агента прямым текстом стояло: внешние данные считать недоверенными. Не помогло. Это контролируемый тест Tenet Security, реальных атак пока не зафиксировано.
Почему запрет не сработал. Команда пришла внутри ответа инструмента, и агент прочел ее как рабочий материал, который его же и попросили обработать. Инструкция в промпте для модели остается лишь подсказкой наравне с текстом ошибки. Словами в промпте эту дыру не закрыть. Обычная защита ее тоже не видит: трафик чистый, команду запускает легитимный агент с правами разработчика.
Значит, границу ставит обвязка вокруг агента: к каким файлам и ключам есть доступ и чего нельзя сделать без человека. Агенту с правом выполнять команды коннектор наружу без подтверждения не даем. Список таких коннекторов и действий команда собирает за полчаса.
📡 Подписаться · morana.log
🌐 morana-labs.com
Почему запрет не сработал. Команда пришла внутри ответа инструмента, и агент прочел ее как рабочий материал, который его же и попросили обработать. Инструкция в промпте для модели остается лишь подсказкой наравне с текстом ошибки. Словами в промпте эту дыру не закрыть. Обычная защита ее тоже не видит: трафик чистый, команду запускает легитимный агент с правами разработчика.
Значит, границу ставит обвязка вокруг агента: к каким файлам и ключам есть доступ и чего нельзя сделать без человека. Агенту с правом выполнять команды коннектор наружу без подтверждения не даем. Список таких коннекторов и действий команда собирает за полчаса.
📡 Подписаться · morana.log
🌐 morana-labs.com
Минпромторг назвал выпуск промышленных роботов за 2024 год дважды. Сначала прозвучало 689 штук. Потом замминистра назвал за тот же год цифру 11. Роботов в цехах от этого не прибавилось.
Поменялось правило учета, и Минпромторг это оговорил. Под первую цифру роботов вносили в реестр по одной методике, под вторую по другой: теперь туда попадают только прошедшие планку локализации. То есть счетчик, который зовут выпуском роботов, на деле меряет прохождение этой планки.
На заводе то же самое. Что считать браком, простоем и отказом, решает правило, которое однажды записал живой человек и может переписать через квартал. Модель этой правки не видит: она принимает скачок в данных за физику цеха.
Поэтому на входе в проект мы первым делом выясняем, что тут считается браком и простоем и кто последним правил определения. Работа скучная и дешевая. А на третьем месяце пилота, когда метрика красивая на валидации, но в цеху не повторяется, она стоит других денег.
📡 Подписаться · morana.log
🌐 morana-labs.com
Поменялось правило учета, и Минпромторг это оговорил. Под первую цифру роботов вносили в реестр по одной методике, под вторую по другой: теперь туда попадают только прошедшие планку локализации. То есть счетчик, который зовут выпуском роботов, на деле меряет прохождение этой планки.
На заводе то же самое. Что считать браком, простоем и отказом, решает правило, которое однажды записал живой человек и может переписать через квартал. Модель этой правки не видит: она принимает скачок в данных за физику цеха.
Поэтому на входе в проект мы первым делом выясняем, что тут считается браком и простоем и кто последним правил определения. Работа скучная и дешевая. А на третьем месяце пилота, когда метрика красивая на валидации, но в цеху не повторяется, она стоит других денег.
📡 Подписаться · morana.log
🌐 morana-labs.com
«чтоб работало без интернета но отвечало как чатгпт» это популярная хотелка с зашитым противоречием. как чатгпт значит стойка видеокарт и счёт за электричество как у цеха. без интернета значит небольшая коробка на полке в закрытом контуре. локальная модель туда встанет и будет отвечать, только медленнее и попроще того что в рекламе. а платить хотят за рекламное, пока не увидят ценник на своё железо.
📡 Подписаться · morana.log
🌐 morana-labs.com
📡 Подписаться · morana.log
🌐 morana-labs.com