Forwarded from Machinelearning
🔍 Mistral представила OCR 3 - новую версию своей AI-системы распознавания документов.
Ключевое:
- Существенный рост качества по сравнению с OCR 2, особенно на формах, таблицах и сложных PDF
- Уверенно работает со сканами, рукописным текстом и нестандартной версткой
- Возвращает структурированный результат, а не просто сырой текст
- Подходит для автоматизации Document AI и downstream-аналитики
- Доступен через API и готов к продакшен-использованию
Главное
- На 74% лучше Mistral OCR 2 при работе с формами, сканированными документами, сложными таблицами и рукописным текстом.
- Точность уровня state-of-the-art: Обходит как корпоративные системы обработки документов, так и современные AI-OCR решения.
- Используется в Document AI Playground:
В Mistral AI Studio появился простой drag-and-drop интерфейс для разбора PDF и изображений в чистый текст или структурированный JSON.
https://mistral.ai/news/mistral-ocr-3
@ai_machinelearning_big_data
#ocr #mistal #llm
Ключевое:
- Существенный рост качества по сравнению с OCR 2, особенно на формах, таблицах и сложных PDF
- Уверенно работает со сканами, рукописным текстом и нестандартной версткой
- Возвращает структурированный результат, а не просто сырой текст
- Подходит для автоматизации Document AI и downstream-аналитики
- Доступен через API и готов к продакшен-использованию
Главное
- На 74% лучше Mistral OCR 2 при работе с формами, сканированными документами, сложными таблицами и рукописным текстом.
- Точность уровня state-of-the-art: Обходит как корпоративные системы обработки документов, так и современные AI-OCR решения.
- Используется в Document AI Playground:
В Mistral AI Studio появился простой drag-and-drop интерфейс для разбора PDF и изображений в чистый текст или структурированный JSON.
https://mistral.ai/news/mistral-ocr-3
@ai_machinelearning_big_data
#ocr #mistal #llm
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
OpenAI представила GPT-5.2-Codex, которую называет самым продвинутым инструментом для реальной программной инженерии на сегодняшний день. Модель получила нативную поддержку сжатия контекста, улучшенную интеграцию с терминалом Windows и способность проводить глубокий рефакторинг крупных репозиториев без потери логической нити.
Ключевой апдейт коснулся сферы безопасности - Codex резко прибавил способностей в анализе защищенности кода. Модель уже доступна платным пользователям ChatGPT, а API будет открыт в ближайшие недели.
openai.com
Компания Илона Маска открыла публичный доступ к Grok Voice Agent API — нативному интерфейсу speech-to-speech для создания голосовых ассистентов. Решение построено на полностью собственной архитектуре, что позволило достичь задержки ответа менее 1 секунды.
API поддерживает вызов внешних инструментов, веб-поиск, прямую интеграцию с телефонией через SIP и понимает более 100 языков. В бенчмарке Big Bench Audio модель заняла 1 место с точностью 92,3%, опередив Gemini 2.5 Flash и GPT Realtime.
Главной фишкой стала ценовая политика: единый тариф составляет $0.05 за минуту. Это значительно дешевле, чем у OpenAI и ElevenLabs.
x.ai
В VS Code Insiders появилась поддержка Agent Skills - открытого протокола, разработанного Anthropic. Технология позволяет упаковывать инструкции, скрипты и вспомогательные ресурсы в модули, которыми можно пользоваться в разных ИИ-инструментах.
Главное отличие Agent Skills от привычных кастомных инструкций в функциональности: это не текстовые гайдлайны по стилю кода, а полноценные наборы инструментов для автоматизации задач, которые подгружаются в контекст модели динамически и только при необходимости.
Стандарт дает кросс-платформенность: созданный один раз скилл будет работать одинаково как в интерфейсе редактора, так и в CLI-агентах.
code.visualstudio.com
T5Gemma 2 получила серьезные архитектурные изменения по сравнению с первой версией. Чтобы снизить потребление памяти, инженеры внедрили
tied word embeddings для энкодера и декодера, а также объединили механизмы self-attention и cross-attention в единый слой. Модели доступны в компактных конфигурациях на 270M, 1B и 4B параметров.Новинка поддерживает контекстное окно до 128 тыс. токенов и умеет обрабатывать не только текст на 140 языках, но и изображения. В бенчмарках T5Gemma 2 обошла базовую Gemma 3 в задачах на длинный контекст, кодинг и мультимодальное понимание. Модели доступны на Hugging Face и Kaggle для исследовательских целей.
blog.google
Perception Encoder Audiovisual (PE-AV) - техническое ядро, лежащее в основе SAM Audio. Это мультимодальная модель, которая объединяет аудио, видео и текст в единое пространство эмбеддингов.
PE-AV умеет извлекать векторы признаков из аудио или видеокадров и формировать совместные аудиовизуальные представления. Это повышает точность в задачах кросс-модального поиска, детекции звуков и глубокого понимания сцен, где важен синхронный контекст изображения и звука.
В открытом доступе - 6 чекпоинтов модели разного размера (от Small до Large) с вариациями по количеству обрабатываемых кадров. Код опубликован на GitHub, а веса - на Hugging Face.
huggingface.co
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Не лишним будет проверять свой код с использованием таких инструментов...
https://t.me/data_analysis_ml/4531
https://t.me/data_analysis_ml/4531
Telegram
Анализ данных (Data analysis)
⚡️ Shannon - полностью автономный AI-хакер для поиска реальных уязвимостей в веб-приложениях
Shannon - это автономная система для offensive security, которая сама ищет, воспроизводит и документирует реальные эксплойты в веб-приложениях без подсказок и ручного…
Shannon - это автономная система для offensive security, которая сама ищет, воспроизводит и документирует реальные эксплойты в веб-приложениях без подсказок и ручного…
Forwarded from эйай ньюз
Kandinsky 5.0 Video на text-to-video арене
На арене появились результаты моделей Kandinsky 5.0 Video Lite и Pro.
Pro-версия — ТОП-1 открытая модель в мире.
На общем фоне Pro-версия уступает SOTA-моделям от Google, OpenAI, Alibaba и KlingAI. Но можно говорить о паритете с Luma Ray 3 и Minimax Hailuo 2.3 (отрыв по ELO максимум 3 балла, при 95% доверительном интервале оценивания +-21 балла). Lite-версия (2B параметров) оказалась лучше первой версии Sora.
Стоит отметить, что сам факт выхода российской генеративной модели на международную арену и её конкуренция с другими игроками — событие довольно редкое, я бы сказал, неожиданное.
По архитектуре это довольно немаленький (19B) DiT с кросс атеншеном на текст. При этом VAE на базе HunyuanVideo. Генерит в 24fps видео длиной 5 или 10 секунд В HD (1280x768)
Арена
Веса
GitHub
Техрепорт
@ai_newz
На арене появились результаты моделей Kandinsky 5.0 Video Lite и Pro.
Pro-версия — ТОП-1 открытая модель в мире.
На общем фоне Pro-версия уступает SOTA-моделям от Google, OpenAI, Alibaba и KlingAI. Но можно говорить о паритете с Luma Ray 3 и Minimax Hailuo 2.3 (отрыв по ELO максимум 3 балла, при 95% доверительном интервале оценивания +-21 балла). Lite-версия (2B параметров) оказалась лучше первой версии Sora.
Стоит отметить, что сам факт выхода российской генеративной модели на международную арену и её конкуренция с другими игроками — событие довольно редкое, я бы сказал, неожиданное.
По архитектуре это довольно немаленький (19B) DiT с кросс атеншеном на текст. При этом VAE на базе HunyuanVideo. Генерит в 24fps видео длиной 5 или 10 секунд В HD (1280x768)
Арена
Веса
GitHub
Техрепорт
@ai_newz
Вот это реально правильная штука, скачал себе, установил, но как работает не успел проверить. Тема в том, что теперь Клод поможет с тем, чтобы настроить какие-то вещи в интерфейсах программ. Раньше надо было кидать ему скрины того, что не работает, а теперь он сможет посмотреть сам. Ну круто же!
Telegram
How2AI
🫡 Расширение хром для Claude и Claude Code!
Отличная новость, как мне кажется. Юзеры про подписки тепепрь могут раздавать контекст браузера нейронке – расширение позволяет Claude видеть, что происходит в браузере, кликать кнопки и заполнять формы от имени…
Отличная новость, как мне кажется. Юзеры про подписки тепепрь могут раздавать контекст браузера нейронке – расширение позволяет Claude видеть, что происходит в браузере, кликать кнопки и заполнять формы от имени…
Любопытная история, для тех, у кого есть автоматизация. Текущая проблема в том, что вызов tools у больших моделей жрет много токенов. Вместо этого берем микро-модель, зафайнтьюненную на конкретные tools. Звучит интересно, хотя танцев с бубном для такой реализации надо будет выше крыши..
https://t.me/mishin_learning/1869
https://t.me/mishin_learning/1869
Telegram
Мишин Лернинг
📲 Google выкатили FunctionGemma — function calling для edge
Google не перестает радовать. Пока все меряются “reasoning” сантиметрами, в Google сделали вещь, которая действительно важна: FunctionGemma — это Gemma 3 270M, но специально заточенная под генерацию…
Google не перестает радовать. Пока все меряются “reasoning” сантиметрами, в Google сделали вещь, которая действительно важна: FunctionGemma — это Gemma 3 270M, но специально заточенная под генерацию…
Давно не было новостей от Qwen, а тут такая любопытная моделька - разбивает картинку на отдельные слои. Прикольно, и может быть полезно, когда работаешь с генераторами изображений
GitHub
GitHub - QwenLM/Qwen-Image-Layered: Qwen-Image-Layered: Layered Decomposition for Inherent Editablity
Qwen-Image-Layered: Layered Decomposition for Inherent Editablity - QwenLM/Qwen-Image-Layered
Есть такая штука Exo Labs, под которую я купил 3 мак мини и сделал кластер. Все работало, но мое главное разочарование было в том, что можно установить только ограниченный набор не самых новых моделей. И второй момент - из 16 гигабайт памяти операционка съедала 6. Это к тому, что 2 машины по 24 дадут больше памяти, чем 3 по 16.
Так вот, сейчас ребята запустили новый механизм распараллеливания вычислений, который не только объединяет память машин, но и ускоряет вычисления. 2 машины - скорость растет в 1,8 раз (не для каждой модели, но все же).
Моделей все еще мало, но это наживное. Вижу как у народа растет интерес - на 4 мак студио по 1 млн каждый можно с нормальной скоростью запустить ЛЮБОЙ опенсорс.
Да, важное дополнение - для коннекта машин нужно использовать thunderbolt 5, который на MacOS Tahoe 26.2 стал в РАЗЫ быстрее. Я, кстати, использую такие провода для внешних дисков, и это удивительно, как сотни гигабайт копируются за считанные минуты.
Так вот, сейчас ребята запустили новый механизм распараллеливания вычислений, который не только объединяет память машин, но и ускоряет вычисления. 2 машины - скорость растет в 1,8 раз (не для каждой модели, но все же).
Моделей все еще мало, но это наживное. Вижу как у народа растет интерес - на 4 мак студио по 1 млн каждый можно с нормальной скоростью запустить ЛЮБОЙ опенсорс.
Да, важное дополнение - для коннекта машин нужно использовать thunderbolt 5, который на MacOS Tahoe 26.2 стал в РАЗЫ быстрее. Я, кстати, использую такие провода для внешних дисков, и это удивительно, как сотни гигабайт копируются за считанные минуты.
❤1
Установил себе такую штуковину, должна сильно экономить память Claude-code при использовании tools, гибко управлять контекстом, в том числе, подгружая результаты работы прошлых сессий. Что-то подобное пытался делать своими руками, посмотрим как работает более промышленное решение. Естественно, opensource
GitHub
GitHub - thedotmack/claude-mem: Persistent Context Across Sessions for Every Agent – Captures everything your agent does during…
Persistent Context Across Sessions for Every Agent – Captures everything your agent does during sessions, compresses it with AI, and injects relevant context back into future sessions. Works with ...
Forwarded from Data Secrets
Ученые из Google обнаружили, что если повторять промпт два раза, качество ответов моделей существенно возрастает
На архиве опубликовали коротенькую статью, в которой исследователи делятся занятным хаком:
Важно: это работает только для Non-Reasoning. С ризонингом эффект нейтральный или слегка положительный, так что применять смысла особо нет.
Но вот для Non-Reasoning лайфхак должен быть рабочий, и к тому же очень простой и (почти) бесплатный. Авторы показывают, что количество генерируемых токенов от повтора промпта не растет, как и задержка ответа.
Почему вообще это работает?
Все мы уже выучили, что порядок токенов в промте важен. И это потому, что большинство моделей обучаются каузально, то есть предыдущие токены не получают доступа к следующим. Тут в основе та же логика. Грубо говоря, получается, что какие-то токены в промпте никогда не видят другие, а повторяя запрос, мы эту ассиметрию устраняем -> качество растет.
Почему тогда для ризонеров не канает?
Тут тоже есть объяснение. Просто ризонеры уже самостоятельно научились повторять промпт сами себе (вы точно это замечали). То есть здесь еще одно повторение уже не дает такого импакта, а в случае с не-ризонерами этот эффект мы просто выносим в prefill.
Пользуйтесь: arxiv.org/pdf/2512.14982
На архиве опубликовали коротенькую статью, в которой исследователи делятся занятным хаком:
если повторять запрос, то есть отправлять промпт в LLM не в виде «<QUERY>», а в виде «<QUERY><QUERY>», качество ответов модели в ~67% случаев статистически значимо улучшается
Важно: это работает только для Non-Reasoning. С ризонингом эффект нейтральный или слегка положительный, так что применять смысла особо нет.
Но вот для Non-Reasoning лайфхак должен быть рабочий, и к тому же очень простой и (почти) бесплатный. Авторы показывают, что количество генерируемых токенов от повтора промпта не растет, как и задержка ответа.
Почему вообще это работает?
Все мы уже выучили, что порядок токенов в промте важен. И это потому, что большинство моделей обучаются каузально, то есть предыдущие токены не получают доступа к следующим. Тут в основе та же логика. Грубо говоря, получается, что какие-то токены в промпте никогда не видят другие, а повторяя запрос, мы эту ассиметрию устраняем -> качество растет.
Почему тогда для ризонеров не канает?
Тут тоже есть объяснение. Просто ризонеры уже самостоятельно научились повторять промпт сами себе (вы точно это замечали). То есть здесь еще одно повторение уже не дает такого импакта, а в случае с не-ризонерами этот эффект мы просто выносим в prefill.
Пользуйтесь: arxiv.org/pdf/2512.14982
❤1
40 способов наиболее эффективно использовать ИИ с Google
Google
40 of our most helpful AI tips from 2025
Learn more about the AI tips and tools Google shared in 2025.
Вышла опенсорсная модель GLM-4.7. Она большая, для кодинга, лучше, чем 4.6 (очевидно), обещают, что лучше Sonnet 4.5 и GPT 5.2.
Что интересно, тарифы начинаются от $3 в месяц, и ее можно встраивать в Claude code как субагента и в кучу других подобных агентов.
Скажем так, вайбкодинг для экономных
Что интересно, тарифы начинаются от $3 в месяц, и ее можно встраивать в Claude code как субагента и в кучу других подобных агентов.
Скажем так, вайбкодинг для экономных
Overview - Z.AI DEVELOPER DOCUMENT
GLM-4.7 - Overview - Z.AI DEVELOPER DOCUMENT
А между тем опенсорсным лидером в больших текстовых моделях становится Ernie 5.0 от Baidu.
Бонусом - модель омнимодальная, работает и с аудио, и с видео.
Бонусом - модель омнимодальная, работает и с аудио, и с видео.
Ну и еще один релиз от китайцев, выбирай на вкус
Telegram
Анализ данных (Data analysis)
MiniMax M2.1 официальный релиз 🚀
MiniMax M2.1 - это модель, созданная под реальные задачи разработки и AI-native команды. Подходит как для vibe-билдов и быстрых прототипов, так и для серьезных продакшен-воркфлоу.
Что важно
- SOTA open-source coding и agent…
MiniMax M2.1 - это модель, созданная под реальные задачи разработки и AI-native команды. Подходит как для vibe-билдов и быстрых прототипов, так и для серьезных продакшен-воркфлоу.
Что важно
- SOTA open-source coding и agent…
Как минимум, клонирование голоса работает на русском, и Qwen утверждает, что модель получше конкурентов будет
Telegram
Machinelearning
🗣 Новая линейка Qwen3-TTS: VoiceDesign и VoiceClone
Qwen представили новое поколение TTS-моделей, которые выводят управление голосом и voice cloning на новый уровень. Быстрее, выразительнее и гибче, чем раньше.
VoiceDesign-VD-Flash
Модель для полного…
Qwen представили новое поколение TTS-моделей, которые выводят управление голосом и voice cloning на новый уровень. Быстрее, выразительнее и гибче, чем раньше.
VoiceDesign-VD-Flash
Модель для полного…
🔥1
Обновилась моделька редактирования картинок Qwen Image Edit (доступна на сайте Qwen) и Qwen Coder - конкурент GLM-4.7. Вот его можно скачать, но это 480B…
А, вру, первая модель тоже доступна, причем есть много квантованных вариантов, но надо иметь 24-32 гб памяти на маках..
А, вру, первая модель тоже доступна, причем есть много квантованных вариантов, но надо иметь 24-32 гб памяти на маках..
huggingface.co
Qwen/Qwen3-Coder-480B-A35B-Instruct · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Google предлагает новым подписчикам на pro версию Gemini скидку 50% по годовой подписке
http://one.google.com/ai-nye
http://one.google.com/ai-nye