very vibe coding
122 subscribers
463 photos
126 videos
13 files
997 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Forwarded from Machinelearning
🐋 DeepSeek выпустили DeepSeek-OCR 2 - новое поколение OCR с SOTA качеством

DeepSeek представили DeepSeek-OCR 2 - 3B модель для продвинутого понимания изображений, документов и OCR, которая выходит на уровень SOTA.

Ключевая новинка - DeepEncoder V2.

В отличие от классических vision LLM, которые «читают» картинку как сетку (слева-направо, сверху-вниз), DeepEncoder V2 работает ближе к тому, как читает человек:

- Сначала формируется глобальное понимание изображения
- Затем модель определяет логический порядок чтения — что важно первым, что дальше

Что это даёт на практике

📄 Лучше работает со сложными макетами документов
📊 Корректно читает таблицы
🧾 Связывает подписи и значения
📰 Понимает колонки и структурированный текст
🔀 Надёжнее обрабатывает смесь текста и визуальной структуры

По качеству

- Обходит Gemini 3 Pro на ряде бенчмарков
- Даёт >4% прироста по сравнению с прошлой версией DeepSeek-OCR

И это при размере модели всего 3B параметров.

Можно запускать и дообучать

Теперь DeepSeek-OCR 2 можно удобно запускать и fine-tune через Unsloth по готовому гайду.

🔗 Guide: https://unsloth.ai/docs/models/deepseek-ocr-2
🔗 Model: https://huggingface.co/deepseek-ai/DeepSeek-OCR-2
🔗 Github: https://github.com/deepseek-ai/DeepSeek-OCR-2/tree/main
🔗 Paper: https://github.com/deepseek-ai/DeepSeek-OCR-2/blob/main/DeepSeek_OCR2_paper.pdf

@ai_machinelearning_big_data

#DeepSeek #ocr #opensource
Даже в арабов есть свои ллмки)) и неплохие.

Кстати, пишут, что новая ктийская моделька Kimi K2.5 в кодинге очень даже хороша
Forwarded from Неискусственный интеллект (Илья Склюев)
Нейросети осваивают законотворчество

Пока наши депутаты отрицают факт работы с ChatGPT, ссылаясь на вердикт «рекомендованного» GigaChat, за океаном всё смелее говорят о постановке законопроектов "на поток". СМИ выяснили, что в администрации Трампа начали использовать ИИ для подготовки нормативных актов на федеральном уровне.

Первыми освоить технологию решили в американском Минтрансе. Там начали использовать Gemini для помощи в разработке новых правил, касающихся безопасности в авиации, автомобилестроении, на железных дорогах и на море.

Юрист ведомства Дэниел Коэн написал коллегам, что ИИ «способен кардинально изменить процесс разработки нормативных актов». Грегори Зерзан, главный юрисконсульт, сообщил, что президент Дональд Трамп «очень воодушевлён этой инициативой».

Шесть сотрудников Минтранса США, которые анонимно пообщались с ProPublica, рассказали, что на составление типичного нормативного акта могут уйти месяцы, а иногда и годы из-за сопутствующих сложностей. Но на демонстрации в декабре ведущий сказал им, что Gemini от Google может сократить этот срок до «минут или даже секунд».


Аргументацию, при этом, привели прекрасную. «Нам не нужно идеальное правило для XYZ. Нам даже не нужно очень хорошее правило для XYZ». Достаточно черновика, с которым разработать новое постановление всего за 30 дней или меньше.

В России на государственном уровне ИИ для работы с документами внедряют как в рамках общей платформы для чиновников (Минцифры), так и в отдельных ведомствах (Минфин). Ну и в системе электронного документооборота ИИ-ассистенты уже есть (про это говорил вице-премьер Дмитрий Григоренко).

@anti_agi
Google посмотрел на конкурентов и тоже сделал автобраузинг - отдельную панель в хроме, в которой живет Джемини, нано-банана и агенты, и в которой можно давать им задачки для самостоятельной работы с браузером. Работает на платных подписках в Америке, но скоро будет везде.

И скоро ждем Gemini 3.5, про которую обещают, что будет точно круче GPT 5.2 и Opus 4.5.
А xAI Илона Маска неожиданно выдал Grok imagine - сейчас это лучшая модель по генерации видео из текста или картинок.
Forwarded from Machinelearning
🌟 Step3-VL-10B: VLM от stepfun.ai.

Пока индустрия одержима гигантоманией и соревнуется, у кого больше параметров, Stepfun решили пойти против течения.

Встречайте, Step3-VL-10B - компактная VL-модель, которая по заявлениям разработчиков не просто конкурирует, а буквально уделывает модели в 10–20 раз тяжелее, включая таких титанов, как Gemini 2.5 Pro и GLM-4.6V.

Звучит как маркетинговый хайп, но под капотом есть интересные инженерные решения, хоть и с хитринкой.

🟡Архитектура

Конструкция из кастомного визуального PE-lang энкодера на 1.8B параметров и Qwen3-8B (что уже половина успеха, учитывая мощь Qwen) в качестве декодера.

В отличие от многих, кто замораживает визуальную часть, Stepfun разморозили все и тренировали модель в один прогон на 1,2 трлн. токенов. Это позволило визуальной и языковой частям модели не просто сосуществовать, а реально срастись и притереться друг к другу.

После этого модель прогнали через адский RL-цикл (RLVR+RLHF) на 1400+ итераций, чтобы модель научилась жестко ризонить.

🟡Тесты

В бенчмарках цифры действительно страшные (в хорошем смысле) для такого размера:

🟢MMMU: 78.11 (SeRe) / 80.11 (PaCoRe).
🟢MathVista: 83.97
🟢AIME 2025: 87.66 (SeRe) / 94.43 (PaCoRe)
🟢OCRBench: 86.75 (отлично читает документы).

Для сравнения: GLM-4.6V на 106B выдает на MMMU только 75.20.

Инженерная хитринка кроется в методологии тестирования. Видите в результатах тестов пометку PaCoRe?

PaCoRe (Parallel Coordinated Reasoning):
Чтобы получить топовые цифры, модель использует test-time compute. Она запускает 16 параллельных роллаутов, собирает доказательства из разных веток и синтезирует ответ.

На инференсе это будет стоить вам в 16 раз "дороже" по ресурсам, чем обычный прогон. В стандартном режиме (SeRe) модель все еще хороша, но уже не выглядит как "убийца всех топов".


Кстати, Stepfun честно признались, что в отчетах накосячили с бенчмарками конкурента Qwen3VL-8B из-за неверного max_tokens. Извинились, обещают пересчитать. Это добавляет доверия, но напоминает, что бенчмарки - дело тонкое.

В общем, модель - отличный кандидат для локального использования: есть OpenAI-compatible API и vLLM поддерживается (PR вмержили).

⚠️ Если модель зацикливается при генерации - обновите конфиг, там был баг с eos_token_id, который уже пофиксили.


📌Лицензирование:  Apache 2.0 License.


🟡Модель
🟡Arxiv
🟡Demo


@ai_machinelearning_big_data

#AI #ML #VLM #STEP3 #StepFunAI
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🎙️🚀 Qwen3-ASR и Qwen3-ForcedAligner- open source ASR модели

Мощный, стриминговый speech AI продакшн-уровня для 52 языков и диалектов.

ASR-1.7B - флагманская open-source модель распознавания речи. По качеству конкурирует с очень сильными решениями и обходит многие популярные open-модели прошлого поколения.

ASR-0.6B - компактная и очень быстрая версия.Cтавка на эффективность и низкую задержку, подходит для real-time сценариев.

ForcedAligner-0.6B - модель для точного сопоставления текста и аудио. Дает аккуратные таймкоды на уровне слов и фраз для 11 языков.

Целый открытый стек для разработчиков. Все это можно встраивать в свои системы без закрытых зависимостей.

Лицензия Apache 2.0 - можно использовать в коммерческих продуктах.

GitHub: https://github.com/QwenLM/Qwen3-ASR
Hugging Face: https://huggingface.co/collections/Qwen/qwen3-asr
ModelScope: https://modelscope.cn/collections/Qwen/Qwen3-ASR
Hugging Face Demo: https://huggingface.co/spaces/Qwen/Qwen3-ASR
ModelScope Demo: https://modelscope.cn/studios/Qwen/Qwen3-ASR
Blog: https://qwen.ai/blog?id=qwen3asr
Paper: https://github.com/QwenLM/Qwen3-ASR/blob/main/assets/Qwen3_ASR.pdf
Очень любопытная библиотека для маков по работе с голосовыми моделями - тоже в моем списке того, что надо ставить и использовать. Все-таки говорящая нейронка - это, как минимум, прикольно
Встретил сегодня прикольный подход. Запуск агентов в ночную смену - это то, что делают уже многие, и то, к чему я только подхожу.

Но тут один товарищ рассказывает, как его агенты собирают информацию за день, смотрят на изменения, актуализируют документацию, промпты. Накапливают знания.

Это очень логично, постоянно сталкиваюсь с тем, что мои репозитории не самые свежие, а системные промпты устарели. Особенно, когда используешь несколько разных компьютеров
Tencent YouTu Research открыли Youtu-VL-4B-Instruct*- компактную VLM, которая серьёзно прокачивает визуальное понимание через подход VLUAS 👁️⚡

Это не просто “ещё одна vision-модель”, а попытка объединить кучу задач в одной архитектуре без зоопарка отдельных голов.

🌟 Что здесь особенно выделяется

✅ All-in-One Vision
SOTA-уровень в детекции объектов, сегментации, оценке глубины и поз — без task-specific голов под каждую задачу.

✅ OCR и мультимодальное рассуждение
Сильная в сложном разборе документов и задачах, где нужно одновременно видеть и “думать” (например, математика по изображениям).

✅ Готовность к GUI-агентам
Оптимизирована под понимание окружающей среды и навигацию по интерфейсам — важная часть будущих AI-агентов.

✅ Эффективность
Всего 4B параметров — хорошо подходит для edge-деплоя и быстрого инференса.

🔧 По результатам
Модель обгоняет многие более крупные системы на OmniDocBench и vision-centric задачах, оставаясь при этом компактной.

Это интересный шаг к универсальным vision-моделям, которые могут стать базой для агентов, работающих с экранами, документами и реальным миром.

🔗 Модель
https://modelscope.cn/models/Tencent-YouTu-Research/Youtu-VL-4B-Instruct
https://modelscope.cn/models/Tencent-YouTu-Research/Youtu-VL-4B-Instruct-GGUF

📄 Статья
https://modelscope.cn/papers/2601.19798
😳 Новая лучшая модель для анимации?

Выходит Vidu Q3, модель, которая гордо занимает второе место на арене txt2vid

До 16 секунд видео+аудио генерации в 1080, шикарная консистентность и рендеринг текста

Помимо q3 компания так же обновила агента, добавила Q2 Reference-to-Video Pro и создала библиотеку референсов Reference Hub 2.0

@creadvice | Наш курс по ИИ Видео
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM