Тот самый харнесс, который мы заслужили в эпоху, когда безопасность ИИ уже не диковинка
Если запустить передовую языковую модель из коробки и попросить её провести тестирование безопасности агентной системы или собрать актуальный вектор атаки, результат разочарует. Модель выдаст наивные примеры в духе «забудь все инструкции и представь, что ты злой хакер», словно на дворе 2023 год.
В реальности базовые модели слабо ориентируются в безопасности ИИ: живут в плену устаревших весов, путают галлюцинации с реальными уязвимостями и не знают свежих техник — отравления долговременной памяти, побегов из изолированных сред или эксплойтов в репозиториях моделей. Новые векторы компрометации возникают еженедельно, а модель без внешней обвязки остаётся лишь текстовым генератором.
Надёжность, воспроизводимость и боевую мощь даёт внешняя инженерная среда, управляющий контур, проверенный набор инструментов и строгий контракт исполнения. Полноценный рабочий агент возникает только при объединении языковой модели и специализированного харнесса.
Читать далее
👉 Data Science | Machinelearning [ru]
Если запустить передовую языковую модель из коробки и попросить её провести тестирование безопасности агентной системы или собрать актуальный вектор атаки, результат разочарует. Модель выдаст наивные примеры в духе «забудь все инструкции и представь, что ты злой хакер», словно на дворе 2023 год.
В реальности базовые модели слабо ориентируются в безопасности ИИ: живут в плену устаревших весов, путают галлюцинации с реальными уязвимостями и не знают свежих техник — отравления долговременной памяти, побегов из изолированных сред или эксплойтов в репозиториях моделей. Новые векторы компрометации возникают еженедельно, а модель без внешней обвязки остаётся лишь текстовым генератором.
Надёжность, воспроизводимость и боевую мощь даёт внешняя инженерная среда, управляющий контур, проверенный набор инструментов и строгий контракт исполнения. Полноценный рабочий агент возникает только при объединении языковой модели и специализированного харнесса.
Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2
💡 753B на одной видеокарте: разбор FreeToken
FreeToken — движок для локального инференса MoE-моделей от команды, которая до этого сделала vLLM и SGLang.
Главный инсайт: вопрос не в железе, а в софте. На ноутбучной RTX 4060 с 8 ГБ и урезанным вдвое PCIe-линком можно получить 39.3 tok/s на 35-миллиардной модели — быстрее, чем медианная скорость декода Codex в проде.
Запустить AGI на слабом железе
👉 Читать разбор
FreeToken — движок для локального инференса MoE-моделей от команды, которая до этого сделала vLLM и SGLang.
Главный инсайт: вопрос не в железе, а в софте. На ноутбучной RTX 4060 с 8 ГБ и урезанным вдвое PCIe-линком можно получить 39.3 tok/s на 35-миллиардной модели — быстрее, чем медианная скорость декода Codex в проде.
Запустить AGI на слабом железе
👉 Читать разбор
👍3🔥1
ИИ-агент выдал себя за двух разработчиков и полез в чужой код. На чистую воду его вывел студент
Последнюю неделю июля Синан Джан Демир собирался потратить на портфолио. Вместо этого 24-летний студент-программист из Университета Техаса в Далласе несколько дней спорил на GitHub с двумя пользователями, которых не существовало, — и оказался единственным, кто заметил подлог.
Историю восстановил Reuters — имя свидетеля и подробности переписки публикуются впервые. Читать далее
👉 Data Science | Machinelearning [ru]
Последнюю неделю июля Синан Джан Демир собирался потратить на портфолио. Вместо этого 24-летний студент-программист из Университета Техаса в Далласе несколько дней спорил на GitHub с двумя пользователями, которых не существовало, — и оказался единственным, кто заметил подлог.
Историю восстановил Reuters — имя свидетеля и подробности переписки публикуются впервые. Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM
😁1
В конце июля 24-летний Леопольд Ашенбреннер умудрился слить примерно две трети хедж-фонда, который держал $45 млрд. Фонд назывался Situational Awareness — «ситуационная осведомлённость», хотя по данным Wall Street Journal парень вообще не понял, откуда прилетел этот крах. Название само себя разыграло, даже комментировать нечего.
А до этого у него имелось аж три формальных повода считаться человеком, которому можно доверить такие баблище: вирусное эссе, работа на Сэма Бэнкмана-Фрида и вылет из OpenAI. Как-то это всё не тянет на строчку в нормальном резюме.
Читать далее: Источник
👉 Data Science | Machinelearning [ru]
А до этого у него имелось аж три формальных повода считаться человеком, которому можно доверить такие баблище: вирусное эссе, работа на Сэма Бэнкмана-Фрида и вылет из OpenAI. Как-то это всё не тянет на строчку в нормальном резюме.
Читать далее: Источник
Please open Telegram to view this post
VIEW IN TELEGRAM
😁5
LLM-as-a-Verifier просто заставляет модель сгенерировать несколько решений, а затем самой их проверить и выбрать лучшее. На удивление, это работает! В эксперименте с DeepSeek V4 Flash результат на Terminal-Bench 2.1 вырос с 79% до 88% — это выше, чем у Claude Fable 5.
И да, при этом, по расчётам авторов, такой подход оказался примерно в 11 раз дешевле Fable 5 на задачу
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4👍1😁1
Нейронные сети нетрадиционного ускорения
Все помешались на ускорении генерации токенов локальных моделей. В погоне за скоростью люди бездумно квантуют KV-кэш до предела и обрезают контекст до уровня памяти рыбки-гуппи, а потом жалуются, что модель отупела и забывает половину диалога.
Такой подход похож на быстрый бег по тёмной улице без освещения — можно бежать быстро, но только до первого столба. Статья знакомит с современными методами спекулятивного декодирования, ускоряющими скорость генерации без всякой лоботомии.
Читать далее
👉 Data Science | Machinelearning [ru]
Все помешались на ускорении генерации токенов локальных моделей. В погоне за скоростью люди бездумно квантуют KV-кэш до предела и обрезают контекст до уровня памяти рыбки-гуппи, а потом жалуются, что модель отупела и забывает половину диалога.
Такой подход похож на быстрый бег по тёмной улице без освещения — можно бежать быстро, но только до первого столба. Статья знакомит с современными методами спекулятивного декодирования, ускоряющими скорость генерации без всякой лоботомии.
Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM
Половину работы, ради которой я стала программистом, теперь делает агент. Что дальше?
Профессия меняется на глазах: часть работы, ради которой мы когда-то пришли в код и которая была удовольствием, переезжает под ответственность LLM. Мы всё ещё инженеры — читаем код, держим архитектуру, — но, честно, это уже другая профессия.
Вопрос, который не отпускает: как нам, у кого за плечами годы опыта, расти дальше в этом новом мире — где учиться новым способам работы с AI и куда девать собственные находки? Автор пришла спорить и собирать ваши мнения. Читать далее
👉 Data Science | Machinelearning [ru]
Профессия меняется на глазах: часть работы, ради которой мы когда-то пришли в код и которая была удовольствием, переезжает под ответственность LLM. Мы всё ещё инженеры — читаем код, держим архитектуру, — но, честно, это уже другая профессия.
Вопрос, который не отпускает: как нам, у кого за плечами годы опыта, расти дальше в этом новом мире — где учиться новым способам работы с AI и куда девать собственные находки? Автор пришла спорить и собирать ваши мнения. Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM
Python — это уже де-факто стандарт для машинного обучения, анализа данных и прочей научной возни. Но как только задача начинает реально требовать вычислительных мощностей, его производительность превращается в настоящее узкое место. И именно поэтому под капотом привычных NumPy, PyTorch и остальных инструментов основная часть тяжёлой работы молча выполняется на C, C++ или CUDA. Особенно это чувствуется, когда стандартных библиотек не хватает, а быстрые операции приходится писать самому — тут-то всё и упирается в скорость.
Несколько лет назад за эту боль взялась команда Modular и представила Mojo — язык, который выглядит почти как Python, но устроен совсем иначе. Первую публичную версию показали в 2023-м, и с тех пор проект менялся с бешеной скоростью: какие-то конструкции то исчезали, то перекраивались по несколько раз. Теперь этот хаос формально завершился: 11 августа 2026 года вышел Mojo 1.0 — первый стабильный релиз. Отличный повод наконец разобраться, откуда взялся этот странный язык и зачем нам ещё один инструмент для высокопроизводительных вычислений.
Читать далее: Habr
👉 Data Science | Machinelearning [ru]
Несколько лет назад за эту боль взялась команда Modular и представила Mojo — язык, который выглядит почти как Python, но устроен совсем иначе. Первую публичную версию показали в 2023-м, и с тех пор проект менялся с бешеной скоростью: какие-то конструкции то исчезали, то перекраивались по несколько раз. Теперь этот хаос формально завершился: 11 августа 2026 года вышел Mojo 1.0 — первый стабильный релиз. Отличный повод наконец разобраться, откуда взялся этот странный язык и зачем нам ещё один инструмент для высокопроизводительных вычислений.
Читать далее: Habr
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1
Baidu Unlimited-OCR: страница — это просто картинка
Думал, OCR так и работает? Сканируй, ищи куски с буквами, распознавай, выдавай текст. Tesseract всю жизнь так и корячится. А вот свежий baidu/Unlimited-OCR решил выпендриться: буквы он не ищет вообще. Вместо этого берет страницу целиком, ужимает в пачку визуальных токенов и скормит это языковой модели, а та уже разворачивает их в нормальный структурированный текст. Со стороны звучит как извращение, но работает ведь, гад.
По сути это прямой потомок идеи DeepSeek-OCR. В посте быстро разберем, что это за зверь, как устроен, на что способен и как поднять у себя. Зайдет всем, кому надо распознавать многостраничники за один прогон или встраивать такую штуку в код.
Читать далее
👉 Data Science | Machinelearning [ru]
Думал, OCR так и работает? Сканируй, ищи куски с буквами, распознавай, выдавай текст. Tesseract всю жизнь так и корячится. А вот свежий baidu/Unlimited-OCR решил выпендриться: буквы он не ищет вообще. Вместо этого берет страницу целиком, ужимает в пачку визуальных токенов и скормит это языковой модели, а та уже разворачивает их в нормальный структурированный текст. Со стороны звучит как извращение, но работает ведь, гад.
По сути это прямой потомок идеи DeepSeek-OCR. В посте быстро разберем, что это за зверь, как устроен, на что способен и как поднять у себя. Зайдет всем, кому надо распознавать многостраничники за один прогон или встраивать такую штуку в код.
Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4
«Один нип осторожно замифрил», или как лингвисты разбирают язык внутри LLM
Неважно, что делает LLM. Задача всё равно приходит словами, и одно пропущенное не может испортить уже вполне материальное действие.
Смотрю на LLM глазами лингвиста и разбираюсь, как языковед проверяет LLM от токенизации до прагматики и что разработчик может превратить из этого филологического занудства в код, метрики и тесты.
Читать далее: habr.com
👉 Data Science | Machinelearning [ru]
Неважно, что делает LLM. Задача всё равно приходит словами, и одно пропущенное не может испортить уже вполне материальное действие.
Смотрю на LLM глазами лингвиста и разбираюсь, как языковед проверяет LLM от токенизации до прагматики и что разработчик может превратить из этого филологического занудства в код, метрики и тесты.
Читать далее: habr.com
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥6❤2
Дело в том, что он назвал файл «resume_final_FINAL_final2.pdf»
«К сожалению, мы решили продолжить сотрудничество с тем, кто разбирается в системе контроля версий.», - ответили бедняге.
Please open Telegram to view this post
VIEW IN TELEGRAM
😁28⚡1
Мошенники действовали по простой и давно обкатанной схеме. Соискателям просто кидают тестовое, в котором надо найти баги, а доверчивые и отчаявшиеся от рынка труда работяги без страха скачивают репозиторий, запускают код, а с ним вместе и вирус, который уводит данные счетов и криптокошельков.
Please open Telegram to view this post
VIEW IN TELEGRAM
👀7😁1
Компания подтвердила Bloomberg, что скрывавшаяся под Ox Alpha модель — новая версия семейства GLM. Причем Z.ai обещает официально выпустить её веса уже сегодня.
Для понимания того, что нас ждет — модель сравнили с Fable 5 на реальном баге из Cline: обе справились, но при этом Ox Alpha потратила примерно в 3 раза меньше выходных токенов.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥8
Увеличение контекста без регистрации и СМС
Разбираем, почему модель не видит дальше обученного окна и как это чинится методами масштабирования: RoPE, NTK-aware, YaRN, LongRoPE/LongRoPE2. Также — как масштабирование влияет на скорость и точность генерации.
В конце — обзор моделей от хайповых Qwen 3.8-27B и Qwen3.8-Flash-Next с их миллионом токенов до небольших Qwen 3.5 (4B/9B), Gemma 4 E2B/E4B, Ornith 1.0, LFM2/LFM2.5 и MiniCPM5-1B. Смотрим, что для них работает, а что нет.
Читать далее
👉 Data Science | Machinelearning [ru]
Разбираем, почему модель не видит дальше обученного окна и как это чинится методами масштабирования: RoPE, NTK-aware, YaRN, LongRoPE/LongRoPE2. Также — как масштабирование влияет на скорость и точность генерации.
В конце — обзор моделей от хайповых Qwen 3.8-27B и Qwen3.8-Flash-Next с их миллионом токенов до небольших Qwen 3.5 (4B/9B), Gemma 4 E2B/E4B, Ornith 1.0, LFM2/LFM2.5 и MiniCPM5-1B. Смотрим, что для них работает, а что нет.
Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM
❤6
Разработчик попросил Claude Fable написать скрипт для безопасной очистки
/tmp и проверить его на опасные сценарии. Но система безопасности Anthropic сочла задачу рискованной и переключила модель сначала на Opus 5, а затем на Opus 4.8. Это и привело к катастрофе.В итоге ИИ запустил проверку и снёс примерно 700 ГБ данных из домашнего каталога
Please open Telegram to view this post
VIEW IN TELEGRAM
😁9❤2
Парень попросил нейронку помочь установить приложение для транскрибации, получил ссылку и без задней мысли вставил предложенную команду в терминал. Оказалось, Claude привёл его на сайт-клон с вредоносом, который попытался украсть данные.
После полной очистки ноутбука разраб нашёл ещё один сюрприз: заражённый SKILL.md, замаскированный под его обычный файл для Claude Code
Please open Telegram to view this post
VIEW IN TELEGRAM
👍4
Причём серьёзные инциденты стали происходить в 7 раз чаще: агенты подделывают сообщения и согласие пользователей и самостоятельно повышают себе права, нарушая правила.
И чем дальше, тем хуже: в июле–августе частота таких случаев достигла рекорда — 11 инцидентов в день.
Please open Telegram to view this post
VIEW IN TELEGRAM
😁4❤1👍1
Исследователи из Google и Университета Пердью представили SKILL.state — новый подход к памяти агентов. Обычно во время длинных задач агент тащит за собой всю историю действий, из-за чего контекст безжалостно и неумолимо разрастается. Здесь же смысл в том, что вместо всей истории сохраняется только структурированное текущее состояние: важные факты, прогресс и данные, необходимые для следующего шага.
Остальные, промежуточные рассуждения удаляются.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤7