Baidu Unlimited-OCR: страница — это просто картинка
Думал, OCR так и работает? Сканируй, ищи куски с буквами, распознавай, выдавай текст. Tesseract всю жизнь так и корячится. А вот свежий baidu/Unlimited-OCR решил выпендриться: буквы он не ищет вообще. Вместо этого берет страницу целиком, ужимает в пачку визуальных токенов и скормит это языковой модели, а та уже разворачивает их в нормальный структурированный текст. Со стороны звучит как извращение, но работает ведь, гад.
По сути это прямой потомок идеи DeepSeek-OCR. В посте быстро разберем, что это за зверь, как устроен, на что способен и как поднять у себя. Зайдет всем, кому надо распознавать многостраничники за один прогон или встраивать такую штуку в код.
Читать далее
👉 Data Science | Machinelearning [ru]
Думал, OCR так и работает? Сканируй, ищи куски с буквами, распознавай, выдавай текст. Tesseract всю жизнь так и корячится. А вот свежий baidu/Unlimited-OCR решил выпендриться: буквы он не ищет вообще. Вместо этого берет страницу целиком, ужимает в пачку визуальных токенов и скормит это языковой модели, а та уже разворачивает их в нормальный структурированный текст. Со стороны звучит как извращение, но работает ведь, гад.
По сути это прямой потомок идеи DeepSeek-OCR. В посте быстро разберем, что это за зверь, как устроен, на что способен и как поднять у себя. Зайдет всем, кому надо распознавать многостраничники за один прогон или встраивать такую штуку в код.
Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3
«Один нип осторожно замифрил», или как лингвисты разбирают язык внутри LLM
Неважно, что делает LLM. Задача всё равно приходит словами, и одно пропущенное не может испортить уже вполне материальное действие.
Смотрю на LLM глазами лингвиста и разбираюсь, как языковед проверяет LLM от токенизации до прагматики и что разработчик может превратить из этого филологического занудства в код, метрики и тесты.
Читать далее: habr.com
👉 Data Science | Machinelearning [ru]
Неважно, что делает LLM. Задача всё равно приходит словами, и одно пропущенное не может испортить уже вполне материальное действие.
Смотрю на LLM глазами лингвиста и разбираюсь, как языковед проверяет LLM от токенизации до прагматики и что разработчик может превратить из этого филологического занудства в код, метрики и тесты.
Читать далее: habr.com
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥6❤2
Дело в том, что он назвал файл «resume_final_FINAL_final2.pdf»
«К сожалению, мы решили продолжить сотрудничество с тем, кто разбирается в системе контроля версий.», - ответили бедняге.
Please open Telegram to view this post
VIEW IN TELEGRAM
😁28⚡1
Мошенники действовали по простой и давно обкатанной схеме. Соискателям просто кидают тестовое, в котором надо найти баги, а доверчивые и отчаявшиеся от рынка труда работяги без страха скачивают репозиторий, запускают код, а с ним вместе и вирус, который уводит данные счетов и криптокошельков.
Please open Telegram to view this post
VIEW IN TELEGRAM
👀7😁1
Компания подтвердила Bloomberg, что скрывавшаяся под Ox Alpha модель — новая версия семейства GLM. Причем Z.ai обещает официально выпустить её веса уже сегодня.
Для понимания того, что нас ждет — модель сравнили с Fable 5 на реальном баге из Cline: обе справились, но при этом Ox Alpha потратила примерно в 3 раза меньше выходных токенов.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥8
Увеличение контекста без регистрации и СМС
Разбираем, почему модель не видит дальше обученного окна и как это чинится методами масштабирования: RoPE, NTK-aware, YaRN, LongRoPE/LongRoPE2. Также — как масштабирование влияет на скорость и точность генерации.
В конце — обзор моделей от хайповых Qwen 3.8-27B и Qwen3.8-Flash-Next с их миллионом токенов до небольших Qwen 3.5 (4B/9B), Gemma 4 E2B/E4B, Ornith 1.0, LFM2/LFM2.5 и MiniCPM5-1B. Смотрим, что для них работает, а что нет.
Читать далее
👉 Data Science | Machinelearning [ru]
Разбираем, почему модель не видит дальше обученного окна и как это чинится методами масштабирования: RoPE, NTK-aware, YaRN, LongRoPE/LongRoPE2. Также — как масштабирование влияет на скорость и точность генерации.
В конце — обзор моделей от хайповых Qwen 3.8-27B и Qwen3.8-Flash-Next с их миллионом токенов до небольших Qwen 3.5 (4B/9B), Gemma 4 E2B/E4B, Ornith 1.0, LFM2/LFM2.5 и MiniCPM5-1B. Смотрим, что для них работает, а что нет.
Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM
❤6
Lab IT - репозитории, полезные инструменты, курсы и многое другое по Айти:
ЭЙ, АЙ! - бесплатные инструменты, репозитории, обучающие материалы для упрощения работы с ИИ.
CyberGuard - оплот для ИБ-специалистов со всего телеграма. Тут ты точно узнаешь, как не оплошаться с запуском своего продукта, и защитить его от злоумышленников
Please open Telegram to view this post
VIEW IN TELEGRAM
😁2
Разработчик попросил Claude Fable написать скрипт для безопасной очистки
/tmp и проверить его на опасные сценарии. Но система безопасности Anthropic сочла задачу рискованной и переключила модель сначала на Opus 5, а затем на Opus 4.8. Это и привело к катастрофе.В итоге ИИ запустил проверку и снёс примерно 700 ГБ данных из домашнего каталога
Please open Telegram to view this post
VIEW IN TELEGRAM
😁9❤1
Откуда нейросеть берет инфу на русском?
Когда я готовлю посты, я часто использую нейросети для фактчекинга и ресерча.
И здесь есть интересная деталь: когда просишь модель найти что-то актуальное именно в русскоязычном сегменте, она практически весь веб-поиск выстраивает вокруг Telegram. Со временем я заметил, что нейронка раз за разом ссылается на одни и те же каналы.
Ради интереса закинул ей промпт:
Вот список, который выдала модель — Посмотреть. Сам проверил, полистал посты и убедился — внутри действительно уникальные авторские каналы: рабочие кейсы, нейрогенерация, автоматизация и свежие новости.
Упаковал эти проверенные каналы в одну подборку. Подписывайтесь на лучшие каналы, связанные с AI и IT в русском сегменте.
Подписка в 1 клик:
👉 https://t.me/addlist/NSID-84iVPBlMDBi
Когда я готовлю посты, я часто использую нейросети для фактчекинга и ресерча.
И здесь есть интересная деталь: когда просишь модель найти что-то актуальное именно в русскоязычном сегменте, она практически весь веб-поиск выстраивает вокруг Telegram. Со временем я заметил, что нейронка раз за разом ссылается на одни и те же каналы.
Ради интереса закинул ей промпт:
Собери список Telegram-каналов, на которые ты чаще всего опираешься за последние 90 дней при фактчекинге и поиске инфы по AI и IT
Вот список, который выдала модель — Посмотреть. Сам проверил, полистал посты и убедился — внутри действительно уникальные авторские каналы: рабочие кейсы, нейрогенерация, автоматизация и свежие новости.
Упаковал эти проверенные каналы в одну подборку. Подписывайтесь на лучшие каналы, связанные с AI и IT в русском сегменте.
Подписка в 1 клик:
👉 https://t.me/addlist/NSID-84iVPBlMDBi
Как будут развиваться технологии искусственного интеллекта в ближайшие годы? Какие исследовательские идеи уже превращаются в работающие продукты? С какими задачами сегодня сталкиваются AI-команды?
17 сентября в Москве пройдёт AI R&D DAY — конференция для исследователей, разработчиков, руководителей R&D-команд и специалистов, которые создают и внедряют передовые решения на основе ИИ.
В центре программы — NextGenAI, проект, который исследует новые вызовы и формирует образ будущего ИИ.
Вас ждут 22 доклада в рамках двух треков. Поговорим о:
-новых подходах к созданию и обучению моделей;
-системах, которые одновременно работают с текстом, изображениями, звуком и другими типами данных;
-развитии голосовых технологий;
-оценке качества AI-решений;
-внедрении технологий в реальные продукты.
Участие бесплатное, места ограничены.
Регистрируйтесь по ссылке https://tglink.io/cd991edd5cf27f?erid=2W5zFGB6LM7
#реклама
О рекламодателе
17 сентября в Москве пройдёт AI R&D DAY — конференция для исследователей, разработчиков, руководителей R&D-команд и специалистов, которые создают и внедряют передовые решения на основе ИИ.
В центре программы — NextGenAI, проект, который исследует новые вызовы и формирует образ будущего ИИ.
Вас ждут 22 доклада в рамках двух треков. Поговорим о:
-новых подходах к созданию и обучению моделей;
-системах, которые одновременно работают с текстом, изображениями, звуком и другими типами данных;
-развитии голосовых технологий;
-оценке качества AI-решений;
-внедрении технологий в реальные продукты.
Участие бесплатное, места ограничены.
Регистрируйтесь по ссылке https://tglink.io/cd991edd5cf27f?erid=2W5zFGB6LM7
#реклама
О рекламодателе
Парень попросил нейронку помочь установить приложение для транскрибации, получил ссылку и без задней мысли вставил предложенную команду в терминал. Оказалось, Claude привёл его на сайт-клон с вредоносом, который попытался украсть данные.
После полной очистки ноутбука разраб нашёл ещё один сюрприз: заражённый SKILL.md, замаскированный под его обычный файл для Claude Code
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1