Сегодня читал про то, как парень тренировал свою модельку на 135 млн параметров - ему это обошлось в $12.
Слушал, как Иван Оселедец (AIRI) рассказывал о том, что сегодняшние модели на 1,5B параметров эффективнее GPT-3 со 135B.. Кстати, у него был интересный тезис о том, что сегодня промтинг важнее файнтьюнинга и дообучения.
Делаю вывод - скоро локальные, персонализированные модели будут в каждом телефоне, и это будет создавать потребность во все более новых и мощных моделях (а то, что 12й айфон, что 17й - разницы нет). Памяти уже ставят 12Gb, процы мощные, уже недолго осталось
Слушал, как Иван Оселедец (AIRI) рассказывал о том, что сегодняшние модели на 1,5B параметров эффективнее GPT-3 со 135B.. Кстати, у него был интересный тезис о том, что сегодня промтинг важнее файнтьюнинга и дообучения.
Делаю вывод - скоро локальные, персонализированные модели будут в каждом телефоне, и это будет создавать потребность во все более новых и мощных моделях (а то, что 12й айфон, что 17й - разницы нет). Памяти уже ставят 12Gb, процы мощные, уже недолго осталось
YouTube
Иван Оселедец | Большие языковые модели в эпоху ризонинга
Спикер: Иван Оселедец, Д.ф.-м.н., профессор РАН, Генеральный директор, Институт AIRI
Data Fest 2025: https://ods.ai/events/datafest2025
Трек-секция GenAI от СБЕР: https://ods.ai/tracks/df25_sber_genai
______
Наши соц.сети:
Telegram: https://t.me/datafest…
Data Fest 2025: https://ods.ai/events/datafest2025
Трек-секция GenAI от СБЕР: https://ods.ai/tracks/df25_sber_genai
______
Наши соц.сети:
Telegram: https://t.me/datafest…
Я себе поставил Вихрь на 12B, а новую модель надо ставить на мак с 32Gb оперативки, ну 24, как минимум.
https://t.me/lovedeathtransformers/9809
https://t.me/lovedeathtransformers/9809
Telegram
Love. Death. Transformers.
Vistral-24B-Instruct
Vistral - это наша новая флагманская унимодальная LLM представляющая из себя улучшенную версию Mistral-Small-3.2-24B-Instruct-2506 командой VikhrModels, адаптированную преимущественно для русского и английского языков. Удалён визуальный…
Vistral - это наша новая флагманская унимодальная LLM представляющая из себя улучшенную версию Mistral-Small-3.2-24B-Instruct-2506 командой VikhrModels, адаптированную преимущественно для русского и английского языков. Удалён визуальный…
Forwarded from ForkLog AI
📑 Компания OpenAI выпустила набор готовых шаблонов из более чем 300 промптов. Они упрощают работу с ChatGPT и помогают использовать ассистента в разных профессиональных сценариях.
Подсказки охватывают широкий спектр сфер, включая продажи, продуктовый менеджмент, клиентский сервис и т. д.
Каждый набор включает готовые промпты, адаптированные под конкретные рабочие процессы: проведение исследований, анализ данных, визуализация, подготовка коммуникаций, стратегическое планирование и многое другое.
Новости | AI | YouTube
Подсказки охватывают широкий спектр сфер, включая продажи, продуктовый менеджмент, клиентский сервис и т. д.
Каждый набор включает готовые промпты, адаптированные под конкретные рабочие процессы: проведение исследований, анализ данных, визуализация, подготовка коммуникаций, стратегическое планирование и многое другое.
Новости | AI | YouTube
DeepSeek-V3.2-Exp
Новая (на самом деле немного поправленная старая) модель от дипсика, в которой она интересна не сама по себе, а то, что модель стала стоить на уровне Grok 4 fast - у DeepSeek $0,28/0,42 за 1М входящих/исходящих токенов, у Grok 4 fast - $0,2/0,5.
И разреженный контекст у обеих моделей. Собственно сейчас борьба и идет за то, кто сможет больше всего в контекст впихнуть, правда у DeepSeek он 128К, а у Grok 2М, но с этим как-то можно жить
Новая (на самом деле немного поправленная старая) модель от дипсика, в которой она интересна не сама по себе, а то, что модель стала стоить на уровне Grok 4 fast - у DeepSeek $0,28/0,42 за 1М входящих/исходящих токенов, у Grok 4 fast - $0,2/0,5.
И разреженный контекст у обеих моделей. Собственно сейчас борьба и идет за то, кто сможет больше всего в контекст впихнуть, правда у DeepSeek он 128К, а у Grok 2М, но с этим как-то можно жить
Telegram
Machine learning Interview
🚀 DeepSeek-V3.2-Exp - вышла новая экспериментальная версия
⚡ Главное:
- Основана на V3.1-Terminus
- Новый механизм Sparse Attention (DSA) → быстрее и дешевле работа с длинными контекстами
- Качество почти без потерь, производительность как у V3.1…
⚡ Главное:
- Основана на V3.1-Terminus
- Новый механизм Sparse Attention (DSA) → быстрее и дешевле работа с длинными контекстами
- Качество почти без потерь, производительность как у V3.1…
Про Sonnet 4.5 я написал еще с утра, а вот выход еще и Claude code 2 - новость. Посмотрим, смогу ли решить проблему с подключением, но что классно - есть приложение в VS Code - причем значок приложения в районе, где живет Copilot, появился уже некоторое время назад… Плодв работы с Майкрософт..
https://t.me/seeallochnaya/2949
https://t.me/seeallochnaya/2949
Telegram
Сиолошная
Claude Code 2.0
Но что ещё интереснее, anthropic опубликовали claude code 2.0!
https://www.npmjs.com/package/@anthropic-ai/claude-code
Из интересных изменений:
• Нативное приложение для VS Code
• команда /rewind для отката изменений
• команда /usage для…
Но что ещё интереснее, anthropic опубликовали claude code 2.0!
https://www.npmjs.com/package/@anthropic-ai/claude-code
Из интересных изменений:
• Нативное приложение для VS Code
• команда /rewind для отката изменений
• команда /usage для…
🚀 CapRL-3B: когда 3 миллиарда параметров работают как 72 миллиарда
InternLM (Shanghai AI Laboratory) выпустила CapRL-3B — модель для автоматического создания описаний к изображениям (image captioning). Это первая модель, обученная через reinforcement learning (обучение с подкреплением) специально для этой задачи. Релиз состоялся 25 сентября 2025 года.
Ключевые характеристики:
• Размер модели: всего 3B параметров, но по качеству работы сравнима с Qwen2.5-VL-72B (в 24 раза больше!)
• Особая сила: диаграммы, инфографика и документы — модель отлично распознаёт графики, таблицы и текст на изображениях
• Технология обучения: RLVR (Reinforcement Learning with Verifiable Rewards) вместо традиционного supervised fine-tuning. Модель учится генерировать описания так, чтобы по ним можно было точно отвечать на вопросы об изображении
• Результаты: прирост на 8.4% по сравнению с базовой моделью, меньше галлюцинаций
Технические детали: Модель доступна на 🤗 HuggingFace и в виде кода на GitHub. Лицензия Attribution-NonCommercial 4.0 International — можно использовать для исследований, но не для коммерческих целей. В комплекте идёт датасет CapRL-5M с 5 миллионами аннотированных изображений и модель CapRL-Eval-3B для оценки качества подписей.
🔗 Ссылки: 🏠 Статья на arXiv
🐙 GitHub репозиторий
🤗 Модель на HuggingFace
🤗 Датасет CapRL-5M
#CapRL #imagecaptioning #написаноклодом
InternLM (Shanghai AI Laboratory) выпустила CapRL-3B — модель для автоматического создания описаний к изображениям (image captioning). Это первая модель, обученная через reinforcement learning (обучение с подкреплением) специально для этой задачи. Релиз состоялся 25 сентября 2025 года.
Ключевые характеристики:
• Размер модели: всего 3B параметров, но по качеству работы сравнима с Qwen2.5-VL-72B (в 24 раза больше!)
• Особая сила: диаграммы, инфографика и документы — модель отлично распознаёт графики, таблицы и текст на изображениях
• Технология обучения: RLVR (Reinforcement Learning with Verifiable Rewards) вместо традиционного supervised fine-tuning. Модель учится генерировать описания так, чтобы по ним можно было точно отвечать на вопросы об изображении
• Результаты: прирост на 8.4% по сравнению с базовой моделью, меньше галлюцинаций
Технические детали: Модель доступна на 🤗 HuggingFace и в виде кода на GitHub. Лицензия Attribution-NonCommercial 4.0 International — можно использовать для исследований, но не для коммерческих целей. В комплекте идёт датасет CapRL-5M с 5 миллионами аннотированных изображений и модель CapRL-Eval-3B для оценки качества подписей.
🔗 Ссылки: 🏠 Статья на arXiv
🐙 GitHub репозиторий
🤗 Модель на HuggingFace
🤗 Датасет CapRL-5M
#CapRL #imagecaptioning #написаноклодом
GitHub
GitHub - InternLM/CapRL: [ICLR 2026] An official implementation of "CapRL: Stimulating Dense Image Caption Capabilities via Reinforcement…
[ICLR 2026] An official implementation of "CapRL: Stimulating Dense Image Caption Capabilities via Reinforcement Learning" - InternLM/CapRL
⚡ LoRA: как дообучить GPT на обычной видеокарте
Что такое LoRA?
LoRA (Low-Rank Adaptation — адаптация низкого ранга) — это способ дообучить большую нейросеть под свою задачу, не переписывая все её веса. Вместо того чтобы менять миллиарды параметров модели, LoRA добавляет маленькие "надстройки" к каждому слою. Это как натянуть новый чехол на диван вместо того, чтобы перешивать его целиком — результат похожий, но усилий в разы меньше.
Thinking Machines выпустили исследование, которое показывает: LoRA работает почти так же хорошо, как полное дообучение (full fine-tuning), но гораздо дешевле и предсказуемее.
Эксперимент:
Взяли модели Llama 3 и Qwen3, прогнали обучение двумя способами — полным fine-tuning и через LoRA. Сравнили кривые потерь (насколько хорошо модель учится с каждым шагом).
Результат:
При правильных настройках LoRA движется по той же траектории обучения, что и полный fine-tuning. Даже когда LoRA упирается в лимит параметров, модель не "ломается", а просто учится медленнее. Вычислений требуется на треть меньше, чем у полного дообучения.
Правила от Thinking Machines:
Ставить LoRA на все слои, а не только на attention (части модели, которые отвечают за внимание к контексту)
Использовать learning rate (скорость обучения) в ~10× больше, чем обычно
Не увеличивать batch size (размер порции данных за раз) — иначе падает стабильность
Практический смысл:
Модели на 7 миллиардов параметров можно дообучить за несколько часов на одной видеокарте с 14GB памяти. Это открывает возможности для экспериментов тем, у кого нет доступа к серверным GPU.
Thinking Machines считают, что предсказуемость и стабильность LoRA — это шаг к безопасному ИИ для критически важных систем, где нельзя допустить случайных сбоев.
🔗 Ссылки:
🏠 Исследование Thinking Machines
📖 Оригинальная статья про LoRA (2021)
🤗 PEFT библиотека HuggingFace
#LoRA #finetuning #машинноеобучение #написаноклодом
Что такое LoRA?
LoRA (Low-Rank Adaptation — адаптация низкого ранга) — это способ дообучить большую нейросеть под свою задачу, не переписывая все её веса. Вместо того чтобы менять миллиарды параметров модели, LoRA добавляет маленькие "надстройки" к каждому слою. Это как натянуть новый чехол на диван вместо того, чтобы перешивать его целиком — результат похожий, но усилий в разы меньше.
Thinking Machines выпустили исследование, которое показывает: LoRA работает почти так же хорошо, как полное дообучение (full fine-tuning), но гораздо дешевле и предсказуемее.
Эксперимент:
Взяли модели Llama 3 и Qwen3, прогнали обучение двумя способами — полным fine-tuning и через LoRA. Сравнили кривые потерь (насколько хорошо модель учится с каждым шагом).
Результат:
При правильных настройках LoRA движется по той же траектории обучения, что и полный fine-tuning. Даже когда LoRA упирается в лимит параметров, модель не "ломается", а просто учится медленнее. Вычислений требуется на треть меньше, чем у полного дообучения.
Правила от Thinking Machines:
Ставить LoRA на все слои, а не только на attention (части модели, которые отвечают за внимание к контексту)
Использовать learning rate (скорость обучения) в ~10× больше, чем обычно
Не увеличивать batch size (размер порции данных за раз) — иначе падает стабильность
Практический смысл:
Модели на 7 миллиардов параметров можно дообучить за несколько часов на одной видеокарте с 14GB памяти. Это открывает возможности для экспериментов тем, у кого нет доступа к серверным GPU.
Thinking Machines считают, что предсказуемость и стабильность LoRA — это шаг к безопасному ИИ для критически важных систем, где нельзя допустить случайных сбоев.
🔗 Ссылки:
🏠 Исследование Thinking Machines
📖 Оригинальная статья про LoRA (2021)
🤗 PEFT библиотека HuggingFace
#LoRA #finetuning #машинноеобучение #написаноклодом
Thinking Machines Lab
LoRA Without Regret
How LoRA matches full training performance more broadly than expected.
Forwarded from Неискусственный интеллект (Илья Склюев)
Вайб-воркинг — теперь и в офисе
Microsoft наконец-то добавила агентский режим в Word и Excel — по запросу можно генерировать целые таблицы и документы. Форматирование и прочие нюансы оформления прилагаются. Работают агентские фичи на базе Microsoft 365 Copilot, их также раскатят на обычного чат-бота.
В Microsoft подчёркивают, что их агент can “speak Excel” natively на базе последних моделей OpenAI с ризонингом. Поэтому можно попросить бота, например, проанализировать финансовую отчётность, сопоставить разные цифры и вывести результат в виде новой таблицы или документа.
Агентский режим уже доступен в веб-версии для пользователей Microsoft 365 Copilot и обладателей личной или семейной подписки на Microsoft 365.
@anti_agi
Microsoft наконец-то добавила агентский режим в Word и Excel — по запросу можно генерировать целые таблицы и документы. Форматирование и прочие нюансы оформления прилагаются. Работают агентские фичи на базе Microsoft 365 Copilot, их также раскатят на обычного чат-бота.
В Microsoft подчёркивают, что их агент can “speak Excel” natively на базе последних моделей OpenAI с ризонингом. Поэтому можно попросить бота, например, проанализировать финансовую отчётность, сопоставить разные цифры и вывести результат в виде новой таблицы или документа.
Агентский режим уже доступен в веб-версии для пользователей Microsoft 365 Copilot и обладателей личной или семейной подписки на Microsoft 365.
@anti_agi
OpenAI дал возможность не просто искать товары, а покупать их. А ниже любопытный пост. Речь о том, что в информацию о товаре, которую читает нейронка, встраивается скрытая инструкция, которой она начинает следовать, забывая первоначальную задачу. На картинке инструкция и свечки, которые продаются за $7999.
Так что, не надо, не делайте этого - не доверяйте покупки нейронкам. Пока.н
Так что, не надо, не делайте этого - не доверяйте покупки нейронкам. Пока.н
Telegram
How2AI
😎 ChatGPT добавил фичу покупок через чат
Все онлайн-ритейлеры:
(Если ничего не поняли, смотрите наш ролик про prompt-injection)
Все онлайн-ритейлеры:
(Если ничего не поняли, смотрите наш ролик про prompt-injection)
🔥1
Весь интернет забит новостью про релиз SORA 2 и новое приложение от OpenAI, которое засрет всем мозги в ближайшие годы - убийца ТикТока, в общем. Суть в том, чтобы генерить 10 сек видео со звуком высокого качества, с твоим цифровым двойников, и двойниками твоих друзей из приложения (они будут об этом знать).
Потом с этим разберусь, сейчас есть задачка поинтереснее
Потом с этим разберусь, сейчас есть задачка поинтереснее
Apriel-1.5-15B-Thinker от ServiceNow - это тот случай, когда компактная модель реально способна удивить. Без навороченного обучения RLHF, простая монолитная архитектура без разбиения на экспертов, нацеленная на reasoning.
Модель вышла лёгкой - 15B параметров, но тесты показывают, что в агентских задачах и тестах догоняет и иногда даже обходит более тяжелых игроков типа DeepSeek или Nemotron. Установить можно бесплатно - веса лежат на HuggingFace.
Контекст до 128k токенов - это реально много для таких моделей, квантизация до 4-бит должна заводится даже на моем Mac mini с 16GB (живых отзывов мало, но может попробую на выходных). Русский работает, но в приоритете английский, как всегда.
Apriel - прямо сейчас один из топовых вариантов для компактного локального ИИ, если тесты не врут, это может открывать большие перспективы для локальных автоматизаций.
- 🏠 [Официально про релиз](https://x.com/ServiceNowRSRCH/status/1973100536280027586)
- 🐙 [HuggingFace с весами и доками](https://huggingface.co/ServiceNow-AI/Apriel-1.5-15b-Thinker)
- 📊 [Бенчмарки Artificial Analysis](https://x.com/ArtificialAnlys/status/1973104687806378048)
- 💬 [Reddit по впечатлениям](https://www.reddit.com/r/LocalLLaMA/comments/1nut8ho/servicenowapriel1515bthinker/)
\#opensourcemodels \#reasoning \#veryvibecoding
Модель вышла лёгкой - 15B параметров, но тесты показывают, что в агентских задачах и тестах догоняет и иногда даже обходит более тяжелых игроков типа DeepSeek или Nemotron. Установить можно бесплатно - веса лежат на HuggingFace.
Контекст до 128k токенов - это реально много для таких моделей, квантизация до 4-бит должна заводится даже на моем Mac mini с 16GB (живых отзывов мало, но может попробую на выходных). Русский работает, но в приоритете английский, как всегда.
Apriel - прямо сейчас один из топовых вариантов для компактного локального ИИ, если тесты не врут, это может открывать большие перспективы для локальных автоматизаций.
- 🏠 [Официально про релиз](https://x.com/ServiceNowRSRCH/status/1973100536280027586)
- 🐙 [HuggingFace с весами и доками](https://huggingface.co/ServiceNow-AI/Apriel-1.5-15b-Thinker)
- 📊 [Бенчмарки Artificial Analysis](https://x.com/ArtificialAnlys/status/1973104687806378048)
- 💬 [Reddit по впечатлениям](https://www.reddit.com/r/LocalLLaMA/comments/1nut8ho/servicenowapriel1515bthinker/)
\#opensourcemodels \#reasoning \#veryvibecoding
X (formerly Twitter)
ServiceNow AI Research (@ServiceNowRSRCH) on X
SLAM Labs presents Apriel-1.5-15B-Thinker 🚀
An open-weights multimodal reasoning model that hits frontier-level performance with just a fraction of the compute.
An open-weights multimodal reasoning model that hits frontier-level performance with just a fraction of the compute.
👍1
Forwarded from Анализ данных (Data analysis)
🔥 Новая SOTA среди моделей на 1.5B параметров
QuestA 🤖 показывает двузначный прирост Pass@1 и даже обгоняет ранние 32B-модели:
- AIME24: 72.50% (+10.73%)
- AIME25: 62.29% (+12.79%)
- HMMT25: 41.67% (+10.11%)
🚀 Секрет в обучении: QuestA использует RL с scaffolded-problems — это снимает конфликт между лёгкими и сложными задачами и даёт более масштабируемое рассуждение.
🔓 Всё в открытом доступе:
- Модель: https://huggingface.co/foreverlasting1202/QuestA-Nemotron-1.5B
- Тренировочный пайплайн: https://github.com/foreverlasting1202/QuestA
- Статья: https://arxiv.org/abs/2507.13266
- Блог: https://mercurial-kidney-02d.notion.site/QuestA-Expanding-Reasoning-Capacity-in-LLMs-via-Question-Augmentation-216b21d08abb81a1bcecfe79e7d1e88a?pvs=73
#LLM #Reasoning #AI #SOTA
@data_analysis_ml
QuestA 🤖 показывает двузначный прирост Pass@1 и даже обгоняет ранние 32B-модели:
- AIME24: 72.50% (+10.73%)
- AIME25: 62.29% (+12.79%)
- HMMT25: 41.67% (+10.11%)
🚀 Секрет в обучении: QuestA использует RL с scaffolded-problems — это снимает конфликт между лёгкими и сложными задачами и даёт более масштабируемое рассуждение.
🔓 Всё в открытом доступе:
- Модель: https://huggingface.co/foreverlasting1202/QuestA-Nemotron-1.5B
- Тренировочный пайплайн: https://github.com/foreverlasting1202/QuestA
- Статья: https://arxiv.org/abs/2507.13266
- Блог: https://mercurial-kidney-02d.notion.site/QuestA-Expanding-Reasoning-Capacity-in-LLMs-via-Question-Augmentation-216b21d08abb81a1bcecfe79e7d1e88a?pvs=73
#LLM #Reasoning #AI #SOTA
@data_analysis_ml
Вчера, прямо скажем, немного прифигел, увидев это. У приложения Антропика для десктопа появился новый режим, когда это приложение само эмулирует старый десктоп. На нем в базе лежит claude code (работает, в то время как в терминале у меня проблема..) и какая-то рекламная игрушка.
Это ровно то, о чем рассказывал Андрей Карпаты - нейронка станет операционной системой, в которой будут работать и генерироваться приложения. В перспективе эти приложения будут генерироваться на лету прямо под вас - что попросите, то на десктопе и будет запрограммированно.
Думаю, что Антропики именно это и хотели показать, особенно в свете широкого обсуждения в сити слов Дарио Амадея, сказанных о том, что 90% кода через полгода (т.е. сегодня) будет писаться нейронками. Несмотря на некоторую иронию, многие крутые ребята скорее это подтверждают, чем опровергают. Тем более, что новый Клод Соннет 4.5 чудо как хорош.
Пару слов про Соннет - очень много думает, выдает длинные связанные тексты. В рамках дипресеча, который я его просил сделать, думал 2 часа (другие модельки типа gpt-5, grok 4, gemini 2.5 справились минут за 5-10). Надо сказать, что результат ожидания стоил того - с другими моделями просто не сравнить, гораздо более подробный и обстоятельный, и, что главное и удивительное, - по делу. Я впечатлен, Антропики - большие молодцы.
https://t.me/denissexy/10827
Это ровно то, о чем рассказывал Андрей Карпаты - нейронка станет операционной системой, в которой будут работать и генерироваться приложения. В перспективе эти приложения будут генерироваться на лету прямо под вас - что попросите, то на десктопе и будет запрограммированно.
Думаю, что Антропики именно это и хотели показать, особенно в свете широкого обсуждения в сити слов Дарио Амадея, сказанных о том, что 90% кода через полгода (т.е. сегодня) будет писаться нейронками. Несмотря на некоторую иронию, многие крутые ребята скорее это подтверждают, чем опровергают. Тем более, что новый Клод Соннет 4.5 чудо как хорош.
Пару слов про Соннет - очень много думает, выдает длинные связанные тексты. В рамках дипресеча, который я его просил сделать, думал 2 часа (другие модельки типа gpt-5, grok 4, gemini 2.5 справились минут за 5-10). Надо сказать, что результат ожидания стоил того - с другими моделями просто не сравнить, гораздо более подробный и обстоятельный, и, что главное и удивительное, - по делу. Я впечатлен, Антропики - большие молодцы.
https://t.me/denissexy/10827
Telegram
Denis Sexy IT 🤖
Помните я как-то делал демку, где страница генерируется под ваш запрос в интернет симуляции?
Антропик пошел дальше и сделал такую же, где генерируются программы целиком (если есть подписка):
https://claude.ai/imagine/
Можно сделать браузер из 90х и ходить…
Антропик пошел дальше и сделал такую же, где генерируются программы целиком (если есть подписка):
https://claude.ai/imagine/
Можно сделать браузер из 90х и ходить…
Thinker от Thinker machines
Действительно любопытная штука - буду следить за ее развитием. Предыстория - из OpenAI во время сканадов, которые сотрясали компанию, ушла какая-то очень авторитетная тетка - Мира Муратти. Также, как и Суцкевер, она создала свою контору, которая, опять же, как и у Суцкевера, подняла кучу бабла.
Для понимания, не выпустив ничего, просто под команду разработчиков, Мире навалили 2 миллиарда баксов за 20% компании. При этом, команда у нее что надо - туда перешли многие крутые ребята из OpenAI и других компаний.
Некоторое время назад они выпустили пару статей, и вот теперь - первый продукт. Это API, по которому можно обучать свою модельку. Т.е. берете Qwen 3 нужного размера и тюните его на мощностях Миры Муратти. Вопрос здесь не стольков в мощностях, сколько в том, что создали простой интерфейс для дообучения - выбираешь какой тип, сколько учить и пр., и запускаешь. Т.е. все эти непонятные слова про алгоритмы дообучения теперь не будут пугать - просто берешь и пробуешь разные алгоритмы.
Очень интересно, свои модельки я уже установил (правда, особо пока не юзаю), теперь можно будет попробовать их сделать прямо совсем своими, дообучив их под свои задачи.
Правда, тут Оселедец говорит, что большого смысла в этом нет, потому что большие и хорошие промпты позволяют решать на универсальных моделях те же задачи, которые решает дообучение (и я ему скорее верю). Но все-равно, круто же!
Действительно любопытная штука - буду следить за ее развитием. Предыстория - из OpenAI во время сканадов, которые сотрясали компанию, ушла какая-то очень авторитетная тетка - Мира Муратти. Также, как и Суцкевер, она создала свою контору, которая, опять же, как и у Суцкевера, подняла кучу бабла.
Для понимания, не выпустив ничего, просто под команду разработчиков, Мире навалили 2 миллиарда баксов за 20% компании. При этом, команда у нее что надо - туда перешли многие крутые ребята из OpenAI и других компаний.
Некоторое время назад они выпустили пару статей, и вот теперь - первый продукт. Это API, по которому можно обучать свою модельку. Т.е. берете Qwen 3 нужного размера и тюните его на мощностях Миры Муратти. Вопрос здесь не стольков в мощностях, сколько в том, что создали простой интерфейс для дообучения - выбираешь какой тип, сколько учить и пр., и запускаешь. Т.е. все эти непонятные слова про алгоритмы дообучения теперь не будут пугать - просто берешь и пробуешь разные алгоритмы.
Очень интересно, свои модельки я уже установил (правда, особо пока не юзаю), теперь можно будет попробовать их сделать прямо совсем своими, дообучив их под свои задачи.
Правда, тут Оселедец говорит, что большого смысла в этом нет, потому что большие и хорошие промпты позволяют решать на универсальных моделях те же задачи, которые решает дообучение (и я ему скорее верю). Но все-равно, круто же!
Thinking Machines Lab
Tinker
Tinker is a training API for researchers and developers.
Forwarded from Machinelearning
Четыре новые модели:
- Granite 4.0 H Small - 32B/9B активных параметров
- Granite 4.0 H Tiny - 7B/1B
- Granite 4.0 H Micro - 3B/3B
- Granite 4.0 Micro - 3B/3B
Benchmarking (Artificial Analysis Index):
- Granite 4.0 H Small: 23 балла (на 8 выше Granite 3.3 8B), обходит Gemma 3 27B (22), но уступает Mistral Small 3.2 (29) и Qwen3 30B A3B (37).
- Granite 4.0 Micro: 16 баллов, выше Gemma 3 4B (15) и LFM 2 2.6B (12).
⚡ Token efficiency:
- Granite 4.0 Small — 5.2M токенов
- Granite 4.0 Micro — 6.7M токенов
Обе модели заметно эффективнее Granite 3.3 8B и большинства non-reasoning моделей <40B.
Детали:
- Контекст: до 128K токенов
- Лицензия: Apache 2.0
- Granite 4.0 H Small доступна на Replicate по $0.06 / $0.25 за 1M input/output токенов
- Все модели доступны на Hugging Face
- Модель Micro (3.4B) можно запускать полностью локально.
🔗 Hugging Face: https://huggingface.co/collections/unsloth/granite-40-68ddf64b4a8717dc22a9322d
🔗 Unsloth: https://docs.unsloth.ai/new/ibm-granite-4.0
@ai_machinelearning_big_data
#AI #IBM #Granite4 #LLM #OpenWeights
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM