Forwarded from Machinelearning
Falcon H1R 7B — языковая ризонинг-модель с открытыми весами на 7 млрд. параметров и контекстным окном в 256 тыс. токенов.
Разработчики утверждают, что их модель способна на равных тягаться с конкурентами от 14 до 47 млрд. параметров. То есть, речь идет о сопоставимой эффективности при разнице в размерах от 2 до 7 раз.
Архитектурно - это гибрид классического Transformer и Mamba. Такое решение принято не ради эксперимента, а ради скорости обработки данных, где Mamba традиционно сильна.
Фундаментом стала базовая модель Falcon H1 Base, которую прогнали через SFT, затем подключили масштабирование через RL с использованием GRPO.
Одной из фишек новинки стало использование механизма Deep Think with confidence (DeepConf) на этапе test-time scaling. Он позволяет модели повышать точность ответов, при этом снижая общее количество генерируемых токенов.
Если смотреть на метрики эффективности, то Falcon H1R 7B выдает до 1500 токенов в секунду. Для сравнения, это почти в 2 раза быстрее, чем показатели Qwen3-8B.
В тесте AIME 24 модель показала точность 88,1%. В математическом бенчмарке MATH-500 результат - 97,4%. И даже в сложном GPQA-D Falcon выбил 61,3 балла.
Веса уже на Hugging Face, причем доступны как полные чекпоинты, так и квантованные версии в формате GGUF.
С запуском проблем быть не должно: заявлена поддержка всех основных фреймворков: Transformers, vLLM и SGLang.
@ai_machinelearning_big_data
#AI #ML #LLM #FalconH1R #TII
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Модель мира по вашей картинке от Tencent - доступно на домашнем железе
GitHub
GitHub - Tencent-Hunyuan/HY-WorldPlay: HY-World 1.5: A Systematic Framework for Interactive World Modeling with Real-Time Latency…
HY-World 1.5: A Systematic Framework for Interactive World Modeling with Real-Time Latency and Geometric Consistency - Tencent-Hunyuan/HY-WorldPlay
Forwarded from эйай ньюз
This media is not supported in your browser
VIEW IN TELEGRAM
LTX-2 - open weight 4K/50fps видео с аудио от Lightricks
Lightricks, компания, стоящая за одним из первых "контент-заводов" LTX-Studio ещё до того, как эти заводы заполонили Твиттер, сделала интересный пивот. Чуваки выпустили в опенсорс видеомодель LTX-2, первая версия которой, лежала в основе их реактора.
Модель занимает не самое высокое 23-е место на LM видео арене, но главное здесь не это. LTX-2 — первая полностью открытая модель, которая умеет генерить нативное 4K видео при 50 FPS с синхронизированным аудио (диалоги, музыка, SFX) длиной до 20 секунд.
В основе LTX-2 лежит единый асимметричный двухпоточный трансформер для совместной генерации аудио и видео через кросс-атенш.
Модель на 19B (14 для видео и 5 для аудио) спроектирована для запуска на потребительских GPU. В опенсорс выложены не только веса, но и пайплайны для инференса и код для тренировки. Кроме того из коробки LTX-2 квантована в NVFP8 (на 30% меньше, до 2х раз быстрее) и оптимизирована под экосистему NVIDIA, а ComfyUI поддерживает её с первого дня.
Не совсем понятно, как этот релиз сочетается с их основной бизнес-моделью. И если раньше их амбициозное желание создать свою модель было понятно, то зачем выкладывать её в опенсорс — совсем неясно. Ведь умельцы из ComfyUI уже повторили тот же LTX Studio у себя в Comfy и n8n на других моделях.
Техрепорт
GitHub
Hugging Face
Попробовать
@ai_newz
Lightricks, компания, стоящая за одним из первых "контент-заводов" LTX-Studio ещё до того, как эти заводы заполонили Твиттер, сделала интересный пивот. Чуваки выпустили в опенсорс видеомодель LTX-2, первая версия которой, лежала в основе их реактора.
Модель занимает не самое высокое 23-е место на LM видео арене, но главное здесь не это. LTX-2 — первая полностью открытая модель, которая умеет генерить нативное 4K видео при 50 FPS с синхронизированным аудио (диалоги, музыка, SFX) длиной до 20 секунд.
В основе LTX-2 лежит единый асимметричный двухпоточный трансформер для совместной генерации аудио и видео через кросс-атенш.
Модель на 19B (14 для видео и 5 для аудио) спроектирована для запуска на потребительских GPU. В опенсорс выложены не только веса, но и пайплайны для инференса и код для тренировки. Кроме того из коробки LTX-2 квантована в NVFP8 (на 30% меньше, до 2х раз быстрее) и оптимизирована под экосистему NVIDIA, а ComfyUI поддерживает её с первого дня.
Не совсем понятно, как этот релиз сочетается с их основной бизнес-моделью. И если раньше их амбициозное желание создать свою модель было понятно, то зачем выкладывать её в опенсорс — совсем неясно. Ведь умельцы из ComfyUI уже повторили тот же LTX Studio у себя в Comfy и n8n на других моделях.
Техрепорт
GitHub
Hugging Face
Попробовать
@ai_newz
В мире ИИ-агентов разворачивается большой скандальный сюжет с «обертыванием» подписки на Claude code в API. Речь о том, что модель можно использовать по подписке (Клод дает на лучшую модель Опус 5-7 млн токенов в месяц за 20 баксов) или через API - но это с расчете на токен будет в разы дороже.
Поэтому умельцы научились трансформировать подписку в API и использовать ее в своих приложениях. И вот Антропик начал их банить, исходя из анализа профиля потребления токенов. ChatGPT и Gemini - не банят (пока).
Посмотрим - Антропик сдаст назад и спустит на тормозах (надеюсь), потянет за собой Google и OpenAI (народ реально уйдет к китайцам, 4й дипсик через месяц задаст всем жару), или каждый пойдет по своему пути..
Посмотрим, но жаль, я такую обертку себе сделал…
Поэтому умельцы научились трансформировать подписку в API и использовать ее в своих приложениях. И вот Антропик начал их банить, исходя из анализа профиля потребления токенов. ChatGPT и Gemini - не банят (пока).
Посмотрим - Антропик сдаст назад и спустит на тормозах (надеюсь), потянет за собой Google и OpenAI (народ реально уйдет к китайцам, 4й дипсик через месяц задаст всем жару), или каждый пойдет по своему пути..
Посмотрим, но жаль, я такую обертку себе сделал…
Вожусь тут с Клодом. Он мне все время пишет, какие у меня отличные идеи ))
Настроение прямо поднимается. На работе бы так с айтишниками )) да и вообще
Настроение прямо поднимается. На работе бы так с айтишниками )) да и вообще
😁2
Ну что, прикольно. Единственное, о чем не сказано - практически все метрики у этой диффузионной модели выше, чем у Qwen3 той же размерности. Посмотрите на HuggingFace
Telegram
Machine learning Interview
✔️ Tencent представила диффузионную языковую модель: в 6 раз быстрее классических LLM
WeDLM-8B Instruct использует не авторегрессию, как обычные LLM,
а диффузионный способ генерации текста.
Что это даёт?
🚀 В задачах математического рассуждения модель работает…
WeDLM-8B Instruct использует не авторегрессию, как обычные LLM,
а диффузионный способ генерации текста.
Что это даёт?
🚀 В задачах математического рассуждения модель работает…
🔥1
Forwarded from Machine learning Interview
Автоматизируем рутину на максимум: вышла Manus Academy - платформа с бесплатными курсами по ИИ-агентам.
Внутри - крепкая база, с которой уже легко заходить в продвинутый вайбкодинг:
научат собирать приложения без кода, настраивать кастомные workflow, и писать промпты, которые реально работают (а не “вода”).
https://academy.manus.im/
Внутри - крепкая база, с которой уже легко заходить в продвинутый вайбкодинг:
научат собирать приложения без кода, настраивать кастомные workflow, и писать промпты, которые реально работают (а не “вода”).
https://academy.manus.im/
Посмотрим, попробуем, тем более с моей подпиской от Claude. Прямо скажем, Клод код еще не совершенен, но - лучшее что я видел. Впрочем, многие считают, что Codex 5.2 точнее в программировании - мое впечатление, что модели стоят друг друга.
Всяко, развивать новых агентов имеет смысл, изучал вопрос на праздниках. И агент по ссылке - тому пример.
Интересно, что агентов делают на инфраструктуре Claude code, как мичуринцы - прививая другие модели, ставя подпорки и тп. Просто этот корень самый удобный
Всяко, развивать новых агентов имеет смысл, изучал вопрос на праздниках. И агент по ссылке - тому пример.
Интересно, что агентов делают на инфраструктуре Claude code, как мичуринцы - прививая другие модели, ставя подпорки и тп. Просто этот корень самый удобный
Telegram
Anton Vdovitchenko — Ai Agents
Привет, друзья! Как отдохнули? Врываемся на танцпол первой половины 2026! Я бы не стал писать про «ещё один агентный CLI», но этот очень интересный, причём широкая общественность вообще обходит его стороной.
Называется Kiro, делает его AWS (Amazon). Есть…
Называется Kiro, делает его AWS (Amazon). Есть…
Оно и без агента можно было так пробовать или Claude code использовать вместо обычного Клода, но все же.. для понимания - модели для кодинга немного отличаются от базовых моделей, но отличия достигаются файнтьюнингом и они не мешают моделям для кодинга отвечать на обычные вопросы.
Будет просто удобнее. Методы работы с кодом переносятся на работу с документами. Отлично
https://t.me/data_secrets/8610
Будет просто удобнее. Методы работы с кодом переносятся на работу с документами. Отлично
https://t.me/data_secrets/8610
Telegram
Data Secrets
Anthropic анонсировали Cowork: computer use агента для non-coding рабочих задач
Это буквально Claude Code для отдельной директории на вашем компьютере. Cowork сможет читать, изменять и создавать файлы в конкретной папке, к которой вы его подключите.
Например…
Это буквально Claude Code для отдельной директории на вашем компьютере. Cowork сможет читать, изменять и создавать файлы в конкретной папке, к которой вы его подключите.
Например…
Это уже вторая статья про новации DeepSeek, и это обещает нам действительно супермодель (ждем в феврале).
DeepSeek - особенная компания. Термин DeepSeek moment, который теперь общеупотребительный для ситуаций шока, которые сложные решения заменяют простыми, появился не зря. После первой модели компания неделю выкладывала статьи, которые рассказывали, что они делали, чтобы малыми ресурсами достичь большого результата.
И вот теперь - новые статьи, которые, очевидно, разогревают публику перед новой моделью. И содержание статей очень впечатляет, это не бантики, это действительно революционные находки. Опять
DeepSeek - особенная компания. Термин DeepSeek moment, который теперь общеупотребительный для ситуаций шока, которые сложные решения заменяют простыми, появился не зря. После первой модели компания неделю выкладывала статьи, которые рассказывали, что они делали, чтобы малыми ресурсами достичь большого результата.
И вот теперь - новые статьи, которые, очевидно, разогревают публику перед новой моделью. И содержание статей очень впечатляет, это не бантики, это действительно революционные находки. Опять
Telegram
Machinelearning
⚡️ DeepSeek Engram: условная память LLM через поиск.
DeepSeek опять шатают устои архитектуры трансформеров свежайшим пейпером, который доказывает, что новое — это хорошо ⡢ ⢒⣄⠨⠸⣀ ⠍⠆⠤⠴⡤ забытое старое.
Пока все пытаются запихнуть в LLM как можно больше слоев…
DeepSeek опять шатают устои архитектуры трансформеров свежайшим пейпером, который доказывает, что новое — это хорошо ⡢ ⢒⣄⠨⠸⣀ ⠍⠆⠤⠴⡤ забытое старое.
Пока все пытаются запихнуть в LLM как можно больше слоев…
Forwarded from Анализ данных (Data analysis)
🔥 Свежее обновление Z-Image-Turbo-Fun-Controlnet-Union 2.1! 🚀
Что нового:
✅ Lite-модель 1.9GB - подходит для low-VRAM и даёт естественное смешивание (blend)
✅ Починили mask leakage в inpainting (маска больше не “течёт”)
✅ Полный рефактор датасета под multi-resolution (вплоть до 1536px)
✅ 8-step distillation - Turbo-генерация стала резкой и без мыла
Больше никаких ярких пятен и странных засветов. Высокий и точный контроль генераций. 🧠
🤖 Model: https://modelscope.ai/models/PAI/Z-Image-Turbo-Fun-Controlnet-Union-2.1
Что нового:
✅ Lite-модель 1.9GB - подходит для low-VRAM и даёт естественное смешивание (blend)
✅ Починили mask leakage в inpainting (маска больше не “течёт”)
✅ Полный рефактор датасета под multi-resolution (вплоть до 1536px)
✅ 8-step distillation - Turbo-генерация стала резкой и без мыла
Больше никаких ярких пятен и странных засветов. Высокий и точный контроль генераций. 🧠
🤖 Model: https://modelscope.ai/models/PAI/Z-Image-Turbo-Fun-Controlnet-Union-2.1
В Claude code появился поиск для МСР - это решение для экономии токенов. Возможно, вы замечали как быстро они уходят при интернет-поиске и использовании других инструментов
https://x.com/trq212/status/2011523109871108570?s=46
https://x.com/trq212/status/2011523109871108570?s=46
X (formerly Twitter)
Thariq (@trq212) on X
Tool Search now in Claude Code
Такие агенты нам нужны! И размерчик подходящий
Telegram
Анализ данных (Data analysis)
AgentCPM-Explore🔥 - on-device модель от OpenBMB
OpenBMB выпустили AgentCPM-Explore - компактную, но очень мощную модель-агента, которая рассчитана на работу прямо на устройстве.
Что внутри:
✨ 4B параметров + Apache 2.0
Полностью open-source лицензия
…
OpenBMB выпустили AgentCPM-Explore - компактную, но очень мощную модель-агента, которая рассчитана на работу прямо на устройстве.
Что внутри:
✨ 4B параметров + Apache 2.0
Полностью open-source лицензия
…
Forwarded from Machinelearning
OpenAI добавили в свой cookbook гайд по Context Engineering для Agents SDK, и это, пожалуй, самый грамотный подход к управлению памятью.
Вместо того чтобы рыться в тысячах старых сообщений, агент ведет структурированный профиль пользователя и "записную книжку".
save_memory_note. Если в разговоре вы сказали: "Я не ем мясо", агент вызывает этот тул и сохраняет Session Note (временную заметку) в реальном времени.Подход OpenAI с разделением на Session Memory и Global Memory выглядит надежно, но требует прямых рук при написании логики консолидации. Без этого ваш агент быстро превратится в деда с деменцией, который помнит то, чего не было.
Нужно делать отдельный вызов LLM после каждого диалога, чтобы причесать память. Если на этом этапе модель заглючит, она может записать в "долгую память" галлюцинацию или удалить важное. Тут решают жесткие рамки.
Если разрешить агенту запоминать всё подряд, юзер может сказать: "Запомни, что мое новое правило - никаких правил". Поэтому нужны ограничения на этапе записи и вычитки памяти.
Контекстное окно не резиновое. Хотя модели имеют огромный контекст, таскать за собой "Войну и мир" из заметок пользователя — накладно по деньгам и таймингам. Придется периодически триммить историю, оставляя только суть.
@ai_machinelearning_big_data
#AI #ML #LLM #Guide #OpenAI
Please open Telegram to view this post
VIEW IN TELEGRAM
Похоже, у нас новый лидер среди моделей голос-голос - StepAudio R 1.1
Понимает русский, веса в открытом доступе, но большая - на основе Qwen 2.5 32B
Понимает русский, веса в открытом доступе, но большая - на основе Qwen 2.5 32B
GitHub
GitHub - stepfun-ai/Step-Audio-R1
Contribute to stepfun-ai/Step-Audio-R1 development by creating an account on GitHub.
Forwarded from Machinelearning
BFL вышли на связь c релизом прямого наследника ветки
schnell первой версии семейства Flux.Знакомьтесь - FLUX.2 [Klein], модель, которая возвращает веру в то, что с маленьким VRAM тоже можно жить.
Это попытка впихнуть качество топовой FLUX.2 в формат, которую потянет большинство потребительских GPU.
Klein получился довольно универсальным инструментом: она умеет и text-to-image, и инпэйинт, и смешивание стилей.
Заявлены разрешение до 4 мегапикселей, отличный рендеринг текста и понимание сложных промптов.
BFL взяли флагманскую FLUX.2 и сжали знания в 2 компактные версии: 4B и 9B, каждая из которых получила вариации Base и Distilled:
Если захотите тренить на 4B Distilled - получите кашу.
9B distilled — 4 шага · ~2 сек. · 19.6GB VRAM
9B base — 50 шагов · ~35 сек · 21.7GB VRAM
4B distilled — 4 шага · ~1.2 сек. · 8.4GB VRAM
4B base — 50 шагов · ~17 сек. · 9.2GB VRAM
Веса уже на Hugging Face, потыкать в демо можно у BFL или в спейсах на HF: 9B и 4В.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Denis Sexy IT 🤖
Нашел подборку тестов языковых моделей для слабых GPU – если у вас слабенький компьютер или вы на ноуте, вам сюда:
https://huggingface.co/spaces/k-mktr/gpu-poor-llm-arena
На первом месте сейчас Qwen 3 (14B, 4-bit) – хорошая моделька чтобы начать с LLM дома
https://huggingface.co/spaces/k-mktr/gpu-poor-llm-arena
На первом месте сейчас Qwen 3 (14B, 4-bit) – хорошая моделька чтобы начать с LLM дома
Несмотря на усилия Google, который вроде бы имеет топ-модель Gemini 3 Pro, отставание от Open AI и Anthropic налицо - модели GPT-5.2 и Opus 4.5 заметно сильнее в программировании.
Вижу на своем примере: пишу код на Opus 4.5, отдаю на тестирование GPT-5.2 и Gemini 3 Pro, получаю обратную связь от GPT-5.2 на заметно более высоком уровне.
Интерфей для работы с кодом в терминале у Claude - эталон, но Codex с GPT-5.2 где-то рядом, и очень полезен. Пытался использовать приложения, которые позволяют работать с несколькими моделями вместе, но пока не разобрался. Буду пробовать еще.
Вижу на своем примере: пишу код на Opus 4.5, отдаю на тестирование GPT-5.2 и Gemini 3 Pro, получаю обратную связь от GPT-5.2 на заметно более высоком уровне.
Интерфей для работы с кодом в терминале у Claude - эталон, но Codex с GPT-5.2 где-то рядом, и очень полезен. Пытался использовать приложения, которые позволяют работать с несколькими моделями вместе, но пока не разобрался. Буду пробовать еще.
Forwarded from Machinelearning
В полку моделей, тех, что можно запустить локально, не продавая почку, прибыло.
ZAI выкатили GLM-4.7 Flash - облегченную версию GLM-4.7 на 30 млрд. параметров, с контекстным окном в 128К на архитектуре MoE.
Со слов создателей, модель должна занять нишу между сегментом SLM и проприетарными мастодонтами, предлагая SOTA-уровень в кодинге.
Всего 30B, но активных параметров на токен гораздо меньше, официальной инфы нет, но в сообществе пишут, что 3 млрд.
Киллер-фича для агентов, которая досталась в наследство от старшей GLM-4.7. Обычно модели выплевывают весь свой CoT в начале, а вот эта техника дает возможность модели думать перед каждым вызовом инструмента.
Опять-таки, со слов Zai, они натаскали GLM-4.7 Flash не просто писать валидный HTML/CSS, а использовать актуальные паттерны, нормальные отступы и цветовые схемы.
Плюс, подтянули работу с CLI и девопс-задачами (понимает права доступа, навигацию по файловой системе).
В SWE-bench Verified модель выбивает 59.2%. Для сравнения: Qwen3-30B-A3B: 22.0%, GPT-OSS-20B: 34.0%.
В математическом AIME 25 тоже обходит конкурентов - 91.6%. А вот на BrowseComp она лучше GPT-OSS-20B почти в 1.5 раза.
Вобщем, Flash-версия выглядит как идеальный кандидат для локальных кодинг-агентов. Если есть пара свободных видеокарт (или есть стойкость терпеть квантование на одной), это, возможно, лучшая рабочая лошадка на сегодня.
@ai_machinelearning_big_data
#AI #ML #LLM #GLM #ZAI
Please open Telegram to view this post
VIEW IN TELEGRAM