Сегодня моделек и новостей не так много.
Конечно, хит недели - Qwen 3 Next 80b. О ней, кажется, написали уже все. Очень быстрая и эффективная, но живых отзывов пока мало. Для того, чтобы развернуть дома, желательно иметь Mac Studio M3 Ultra в базовой комплектации, за 400К руб. Маков с 64Гб памяти, видимо, будет маловато для этой модели.
Seedreams 4 от ByteDance (создатель ТикТока) обгоняет по популярности гугловскую nanobanana (модели рисуют картинки), и это интересно. Битва монстров.
Китайцы разместили в открытом доступе Ernie-4.5-21b, модель - лидер по скачиваниям и это уже имеет практический интерес - на 32Гб памяти можно уверенно пробовать. Вот здесь ссылка на модель, оптимизированную под маки, с 4-битной квантизаций.
У Клода появился режим инкогнито (для тех, кто разрешил записывать диалоги в память - я пока нет). И, говорят, на 3 месяца снизили стоимость подписки на Pro для новых пользователей до 9 баксов в месяц. Это стоит того
Конечно, хит недели - Qwen 3 Next 80b. О ней, кажется, написали уже все. Очень быстрая и эффективная, но живых отзывов пока мало. Для того, чтобы развернуть дома, желательно иметь Mac Studio M3 Ultra в базовой комплектации, за 400К руб. Маков с 64Гб памяти, видимо, будет маловато для этой модели.
Seedreams 4 от ByteDance (создатель ТикТока) обгоняет по популярности гугловскую nanobanana (модели рисуют картинки), и это интересно. Битва монстров.
Китайцы разместили в открытом доступе Ernie-4.5-21b, модель - лидер по скачиваниям и это уже имеет практический интерес - на 32Гб памяти можно уверенно пробовать. Вот здесь ссылка на модель, оптимизированную под маки, с 4-битной квантизаций.
У Клода появился режим инкогнито (для тех, кто разрешил записывать диалоги в память - я пока нет). И, говорят, на 3 месяца снизили стоимость подписки на Pro для новых пользователей до 9 баксов в месяц. Это стоит того
huggingface.co
baidu/ERNIE-4.5-21B-A3B-Thinking · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Для того, что бы модель с открытыми весами работала на обычных устройствах без больших плясок с бубнами, ее надо переупаковать в GGUF файл (или в другой формат - например, в MLX, оптимизированный для маков). Как правило, это делается сообществом, на одну модельку может быть много вариаций таких файлов с различными квантизациями, файн-тьюнингом и пр.
Напомню, квантизация, позволяет "огрублять" параметры модели, жертвуя точностью, но экономя память, которая является узким местом для запуска моделей. Так, стандартная модель - это параметры с 16 бит, квантизация до 8 бит уменьшает требования к памяти в 2 раза, но делает точность модели 99% от начальной. Квантизация до 4 бит снижает требования в 4 раза при точности 95-97%.
Команда Unsloth знаменита своими "упаковками" и поэтому новость от нее заслуживает внимания. Ребята научились делать динамическую квантизацию до 3 бит, и даже до 1 бита, которая вполне достойно работает. Идея в том, что важные параметры модели огрубляются мало - до 8 бит, а менее важные - сильно, в том числе, и до 1 бита. Как итог, снижение качества незначительное, а требования к памяти падают сильно.
В целом, при прочих равных, лучше большая квантованная модель будет на том же компьютере давать лучшие результаты, чем маленькая неквантованная, если квантование не слишком сильное. Поэтому такая оптимизация - штука очень интересная и перспективная. Буду следить за новыми моделями от unsloth
Напомню, квантизация, позволяет "огрублять" параметры модели, жертвуя точностью, но экономя память, которая является узким местом для запуска моделей. Так, стандартная модель - это параметры с 16 бит, квантизация до 8 бит уменьшает требования к памяти в 2 раза, но делает точность модели 99% от начальной. Квантизация до 4 бит снижает требования в 4 раза при точности 95-97%.
Команда Unsloth знаменита своими "упаковками" и поэтому новость от нее заслуживает внимания. Ребята научились делать динамическую квантизацию до 3 бит, и даже до 1 бита, которая вполне достойно работает. Идея в том, что важные параметры модели огрубляются мало - до 8 бит, а менее важные - сильно, в том числе, и до 1 бита. Как итог, снижение качества незначительное, а требования к памяти падают сильно.
В целом, при прочих равных, лучше большая квантованная модель будет на том же компьютере давать лучшие результаты, чем маленькая неквантованная, если квантование не слишком сильное. Поэтому такая оптимизация - штука очень интересная и перспективная. Буду следить за новыми моделями от unsloth
unsloth.ai
Unsloth Dynamic GGUFs on Aider Polyglot | Unsloth Documentation
Performance of Unsloth Dynamic GGUFs on Aider Polyglot Benchmarks
Forwarded from Все о блокчейн/мозге/space/WEB 3.0 в России и мире
Все-таки школа ByteDance крутая: Genspark выпустили 1-й в мире ИИ-браузер, который работает без интернета и бесплатно
Genspark AI Browser — это браузер от компании Genspark, основатели экс-ByteDance, который работает полностью локально на устройстве без необходимости подключения к интернету. Предыдущие релизы команды здесь.
Это значит, что можно скачать и запускать открытые модели ИИ, такие как GPT-OSS, Gemma3 и другие. Всё это бесплатно для всех пользователей навсегда.
Основные фичи этого релиза:
1. Локальный ИИ без интернета. Модели загружаются на твой компьютер или устройство, так что браузер работает автономно.
2. Genspark Super Agent встроен в каждую страницу, которую ты посещаешь. Например, на сайтах шопинга просто нажми "Найти лучшую сделку", и ИИ мгновенно просканирует цены по всему вебу, сравнит продукты и отзывы, чтобы помочь выбрать оптимальный вариант.
3. Режим автопилота, где ИИ самостоятельно "гуляет" по интернету, собирает информацию, выполняет задачи (например, исследует тему или автоматизирует рутину) без твоего участия.
4. Без рекламы. По умолчанию блокирует всю рекламу, попапы и баннеры, чтобы просмотр был чистым и без отвлекающих факторов.
5. Импорт всех данных: закладки, пароли, история из старого браузера одним кликом.
Genspark AI Browser — это браузер от компании Genspark, основатели экс-ByteDance, который работает полностью локально на устройстве без необходимости подключения к интернету. Предыдущие релизы команды здесь.
Это значит, что можно скачать и запускать открытые модели ИИ, такие как GPT-OSS, Gemma3 и другие. Всё это бесплатно для всех пользователей навсегда.
Основные фичи этого релиза:
1. Локальный ИИ без интернета. Модели загружаются на твой компьютер или устройство, так что браузер работает автономно.
2. Genspark Super Agent встроен в каждую страницу, которую ты посещаешь. Например, на сайтах шопинга просто нажми "Найти лучшую сделку", и ИИ мгновенно просканирует цены по всему вебу, сравнит продукты и отзывы, чтобы помочь выбрать оптимальный вариант.
3. Режим автопилота, где ИИ самостоятельно "гуляет" по интернету, собирает информацию, выполняет задачи (например, исследует тему или автоматизирует рутину) без твоего участия.
4. Без рекламы. По умолчанию блокирует всю рекламу, попапы и баннеры, чтобы просмотр был чистым и без отвлекающих факторов.
5. Импорт всех данных: закладки, пароли, история из старого браузера одним кликом.
Genspark
Genspark - Your All-in-One AI Workspace
Genspark is your all-in-one AI workspace. Slides, docs, images, video, code, and design — all in one place. Try free today.
Не перевелись умельцы и в родном отечестве - вашему вниманию представляется агент от Сбера.
По сегодняшним временам мысль использовать для агента не самый дешевый и не самый открытый Gigachat диковата, но можно подключить и другие модельки. Посмотрим, во что это разовьется, а то как-то мы на фоне китайцев совсем потерялись.
Для интереса можно посмотреть и на иностранные новинки по части агентов, например - на Agent 3 от Replit
По сегодняшним временам мысль использовать для агента не самый дешевый и не самый открытый Gigachat диковата, но можно подключить и другие модельки. Посмотрим, во что это разовьется, а то как-то мы на фоне китайцев совсем потерялись.
Для интереса можно посмотреть и на иностранные новинки по части агентов, например - на Agent 3 от Replit
GitHub
GitHub - ai-forever/giga_agent: GigaAgent — это универсальный агент-оркестратор для решения широкого круга задач (ReAct + REPL)
GigaAgent — это универсальный агент-оркестратор для решения широкого круга задач (ReAct + REPL) - ai-forever/giga_agent
Сейчас первая по популярности модель для скачивания на hugging face (не угадаете) - Ernie 4.5 21b. Но тут уже новая моделька, с которая дает тесты, не хуже, а местами и на уровне got-oss 20b.
Встречайте Ling-mini-2.0 16b- A1B-MoE. Сразу даю ссылку на оптимизированную под мак квантизацию на 4 бита - должна летать на маках с 16гб памяти
Встречайте Ling-mini-2.0 16b- A1B-MoE. Сразу даю ссылку на оптимизированную под мак квантизацию на 4 бита - должна летать на маках с 16гб памяти
huggingface.co
mlx-community/Ling-mini-2.0-4bit · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Браузер Brave выпустил SOTA поиск с использованием AI. Утверждается, что лучше, чем у Perplexity.
Я, кстати, неделю назад перешел с Google Chrome на Brave. История в том, что это браузер хоть и коммерческий, но с открытым кодом и акцентом на приватность. Его разрабатывают на деньги Питера Тиля. Основатель Брендон Айк - создатель JavaScript и бывший директор Mozilla.
Это не первая моя попытка перехода, но судя по всему, первая успешная - сейчас мне все нравится. Ну а заморочился я этим, так как решил посвятить немного сил безопасности и приватности - об этом подробнее в следующем посту
Я, кстати, неделю назад перешел с Google Chrome на Brave. История в том, что это браузер хоть и коммерческий, но с открытым кодом и акцентом на приватность. Его разрабатывают на деньги Питера Тиля. Основатель Брендон Айк - создатель JavaScript и бывший директор Mozilla.
Это не первая моя попытка перехода, но судя по всему, первая успешная - сейчас мне все нравится. Ну а заморочился я этим, так как решил посвятить немного сил безопасности и приватности - об этом подробнее в следующем посту
Brave
Introducing AI Grounding with Brave Search API, providing enhanced search performance in AI applications | Brave
With AI Grounding, responses are anchored in high-quality, factual information from verifiable Web sources, thus reducing hallucinations and responding more appropriately to nuanced inputs.
Важный пост про безопасность
Уже некоторое время назад я перестал использовать пароли, которые придумываю и запоминаю сам. Так как мысль доверять генерацию и хранение паролей Apple и Google мне претила, использую стороннее приложение - Bitwarden. Бесплатное, нравится, есть плагин для браузеров. Паради хранятся на сервере и доступны со всех устройств.
Все было бы хорошо, но работая с нейронками, особенно с моделями типа Claude Code, столкнулся с тем, что они читают .env файлы с паролями не задумываясь, как ты не ограничивай их промптами. Перебирая различные способы скрыть пароли и ключи от нейронок я пришел к следующему.
В дополнение к своему Bitwarden установил опен-сорс серверное приложение Vaultwarden - хранилище для моих паролей и ключей. Bitwarden переключил с облака на мой сервер. Сделал автоматическое формирование бэкапов и дублирующий сервер, если вдруг основной отрубится. В итоге все ключи и пароли - только на моих собственных серверах.
А в скриптах, с которыми работает ИИ, используются не ключи, а ссылки на мое хранилище, чтение которых не позволяет ничего лишнего раскрыть. Ну и браузер заодно поменял на Brave, чтобы сбор информации обо мне был на минимуме.
Все относительно несложно, но выходные на это можно и, пожалуй, стоит потратить.
Да, для двухфакторной аутентификации также попробуйте такую штуку как Google Authentificator. Удобно и надежно, проще, чем использование email и пр., возможно есть и опенсорсные аналоги, но здесь мне это показалось лишним.
Пока возился со всем этим, попутно выяснил, что мой немецкий сервер атакуется не то чтобы нон-стоп, но регулярно. Поэтому к другим серверам, которыми пользуюсь только я, отрубил доступ по паролю и оставил только ключи - то есть на сервер можно зайти только с того компьютера, у которое есть этот ключ (уже наловчился их генерить). Это еще и удобнее для работы в терминале - быстрее подключаешься. Тоже рекомендую
И в довесок - опенсорсное приложение для анализа утекших секретов. Не пробовал, но это один из топов GirHub на сегодняшний день
https://github.com/trufflesecurity/trufflehog
Уже некоторое время назад я перестал использовать пароли, которые придумываю и запоминаю сам. Так как мысль доверять генерацию и хранение паролей Apple и Google мне претила, использую стороннее приложение - Bitwarden. Бесплатное, нравится, есть плагин для браузеров. Паради хранятся на сервере и доступны со всех устройств.
Все было бы хорошо, но работая с нейронками, особенно с моделями типа Claude Code, столкнулся с тем, что они читают .env файлы с паролями не задумываясь, как ты не ограничивай их промптами. Перебирая различные способы скрыть пароли и ключи от нейронок я пришел к следующему.
В дополнение к своему Bitwarden установил опен-сорс серверное приложение Vaultwarden - хранилище для моих паролей и ключей. Bitwarden переключил с облака на мой сервер. Сделал автоматическое формирование бэкапов и дублирующий сервер, если вдруг основной отрубится. В итоге все ключи и пароли - только на моих собственных серверах.
А в скриптах, с которыми работает ИИ, используются не ключи, а ссылки на мое хранилище, чтение которых не позволяет ничего лишнего раскрыть. Ну и браузер заодно поменял на Brave, чтобы сбор информации обо мне был на минимуме.
Все относительно несложно, но выходные на это можно и, пожалуй, стоит потратить.
Да, для двухфакторной аутентификации также попробуйте такую штуку как Google Authentificator. Удобно и надежно, проще, чем использование email и пр., возможно есть и опенсорсные аналоги, но здесь мне это показалось лишним.
Пока возился со всем этим, попутно выяснил, что мой немецкий сервер атакуется не то чтобы нон-стоп, но регулярно. Поэтому к другим серверам, которыми пользуюсь только я, отрубил доступ по паролю и оставил только ключи - то есть на сервер можно зайти только с того компьютера, у которое есть этот ключ (уже наловчился их генерить). Это еще и удобнее для работы в терминале - быстрее подключаешься. Тоже рекомендую
И в довесок - опенсорсное приложение для анализа утекших секретов. Не пробовал, но это один из топов GirHub на сегодняшний день
https://github.com/trufflesecurity/trufflehog
GitHub
GitHub - trufflesecurity/trufflehog: Find, verify, and analyze leaked credentials
Find, verify, and analyze leaked credentials. Contribute to trufflesecurity/trufflehog development by creating an account on GitHub.
Forwarded from Machinelearning
Лёгкая LLM-модель, которая умеет хранить знания в человеко-читаемой памяти (Markdown-файлы) и использовать их для ответов. Агент не просто отвечает на запросы, а действительно «помнит» факты и обновляет их по ходу работы.
Это агент на 4B с локальной, совместимой памятью для Claude, ChatGPT и LM Studio.
Как работает память:
- Вся информация лежит в Markdown:
memory/user.md и отдельные файлы для сущностей. - Связи между файлами сделаны как в Obsidian:
[[entity]]. - Агент может извлекать факты, обновлять их или задавать уточняющие вопросы, если запрос неполный.
Вместо огромных контекстов и упора в лимиты, Mem-Agent извлекает нужные фрагменты из локальных документов, сжимает их и передаёт агенту.
Как обучали:
- Базовая модель: Qwen3-4B-Thinking-2507.
- Использовали метод онлайн-RL (GSPO).
- Тестировали на md-memory-bench.
Результаты:
- mem-agent уверенно решает задачи памяти, близко к уровню больших моделей.
- Даже в сжатых версиях (4-bit и 8-bit) сохраняет почти то же качество.
Чем хорош:
- Память можно читать и редактировать вручную.
- Агент работает быстро и эффективно, даже в маленьком размере.
- Удобен как компонент в более крупных системах (например, через MCP).
@ai_machinelearning_big_data
#LLM #AI #Agents #MemAgent #Dria #MCP #LocalAI
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Новая SOTA в размере 32b - K2-Think. Создатели утверждают, что модель превосходит не только конкурентов в своем размере, но и более крупные модели типа gpt-oss 120b и даже DeepSeek V3.1. По идее, на маке с 32гб памяти можно пробовать..
Забавно, что делали в эмиратах, но создатели - сплошные китайцы. Кстати, основой послужила Qwen 2.5
Забавно, что делали в эмиратах, но создатели - сплошные китайцы. Кстати, основой послужила Qwen 2.5
huggingface.co
LLM360/K2-Think · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Forwarded from Vikhr models
Vikhr Borealis - первая русскоязычная открытая audio llm
Мы долго и не очень успешно развивали свой tts - Salt, от него исторически осталось довольно много данных и наработок, мы решили - чо бы не сварить asr + llm как модно?
Ну и сварили. Архитектурно - whisper + qwen, учили на 7к часов аудио только адаптер+llm, сейчас работает только в ASR режиме, позже возможно довезем инструктивный режим. Так же выйдет бенчмарк для русского asr, он пока в доработке.
Блог так же выйдет, там будут небольшие аблейшены по данным
Модель в данный момент бьет whisperы на русском и на части бенчей лучше чем gigam.
Модель
Сolab поиграться
Мы долго и не очень успешно развивали свой tts - Salt, от него исторически осталось довольно много данных и наработок, мы решили - чо бы не сварить asr + llm как модно?
Ну и сварили. Архитектурно - whisper + qwen, учили на 7к часов аудио только адаптер+llm, сейчас работает только в ASR режиме, позже возможно довезем инструктивный режим. Так же выйдет бенчмарк для русского asr, он пока в доработке.
Блог так же выйдет, там будут небольшие аблейшены по данным
Модель в данный момент бьет whisperы на русском и на части бенчей лучше чем gigam.
Модель
Сolab поиграться
Forwarded from Креативный совет
This media is not supported in your browser
VIEW IN TELEGRAM
Вашему вниманию -
Просто смотрите видео как дизайнеры становятся все менее и менее нужными…
(В особенности со всеми новым функциями фотошоп который будто бы специально для MCP делают интерфейс максимально нативно кнопочным)
@creadvice
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Сиолошная
OpenAI выпустили новую GPT-5 😑
...заточенную на программистов, GPT-5 Codex. Эта модель заменит o3 в Codex в веб-клиенте (наконец-то) и уже доступна в локальном Codex CLI / плагине для вашей IDE. Если вы ещё не пробовали — обязательно попробуйте! Это бесплатно, если вы подписаны на любой тир ChatGPT. В комментариях многие отмечали, что им нравится больше, чем Claude Code, и модель работает лучше.
GPT-5 Codex дотренировали на новых сложных реальных задач, создании проектов с нуля, добавлении функций и тестов, отладке, проведении масштабных рефакторингов и ревью кода.
По стандартному бенчмарку SWE-bench Verified разница не особо заметна, 74.5% против старых 72.8%. Однако на внутреннем бенчмарке OpenAI на задачах рефакторинга модель стала гораздо лучше: прыжок с 33.9% до 51.3%!
Но и это не всё: модель стала писать меньше бесполезных или ошибочных комментариев, лучше ловить баги в коде, и... думать меньше, когда это не надо. OpenAI взяли запросы от сотрудников внутри компании и сравнили количество токенов в ответах двух моделей.
Там, где ответы были короткими, они стали ещё короче, а там, где цепочки рассуждений и сгенерированный код были длиннее — стало больше. Со слов OpenAI, во время они наблюдали, как GPT‑5-Codex работал автономно более 7 часов подряд над большими и сложными задачами, выполняя итерации по внедрению, исправляя ошибки тестирования и в конечном итоге обеспечивая успешное решение задачи.
Codex CLI и Codex Web получили кучу обновлений за последний месяц, но про них писать не буду.
В API модель появится скоро, очень ждём, пока замеряют качество и на других бенчмарках. В системной карточке модели указали лишь один — по решению многоступенчатых задачек по кибер-взлому (с соревнований CTF). Модель наконец-то статистически значимо обгоняет o3! Жаль, не замерили другие бенчмарки (вроде PaperBench).
...заточенную на программистов, GPT-5 Codex. Эта модель заменит o3 в Codex в веб-клиенте (наконец-то) и уже доступна в локальном Codex CLI / плагине для вашей IDE. Если вы ещё не пробовали — обязательно попробуйте! Это бесплатно, если вы подписаны на любой тир ChatGPT. В комментариях многие отмечали, что им нравится больше, чем Claude Code, и модель работает лучше.
GPT-5 Codex дотренировали на новых сложных реальных задач, создании проектов с нуля, добавлении функций и тестов, отладке, проведении масштабных рефакторингов и ревью кода.
По стандартному бенчмарку SWE-bench Verified разница не особо заметна, 74.5% против старых 72.8%. Однако на внутреннем бенчмарке OpenAI на задачах рефакторинга модель стала гораздо лучше: прыжок с 33.9% до 51.3%!
Но и это не всё: модель стала писать меньше бесполезных или ошибочных комментариев, лучше ловить баги в коде, и... думать меньше, когда это не надо. OpenAI взяли запросы от сотрудников внутри компании и сравнили количество токенов в ответах двух моделей.
Там, где ответы были короткими, они стали ещё короче, а там, где цепочки рассуждений и сгенерированный код были длиннее — стало больше. Со слов OpenAI, во время они наблюдали, как GPT‑5-Codex работал автономно более 7 часов подряд над большими и сложными задачами, выполняя итерации по внедрению, исправляя ошибки тестирования и в конечном итоге обеспечивая успешное решение задачи.
Codex CLI и Codex Web получили кучу обновлений за последний месяц, но про них писать не буду.
В API модель появится скоро, очень ждём, пока замеряют качество и на других бенчмарках. В системной карточке модели указали лишь один — по решению многоступенчатых задачек по кибер-взлому (с соревнований CTF). Модель наконец-то статистически значимо обгоняет o3! Жаль, не замерили другие бенчмарки (вроде PaperBench).
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Кстати, Claude code также выпустил обновление, но там больше всяких мелких улучшизмов. Зато некоторое время назад Claude code научился писать функции и сам их вызывать. Пока не знаю, как это будет на практике, но звучит интересно.
А для программирования с Codex на маках вышло приложение (IDE) от OpenAI, которое называется Xcode 26.
Кстати, как сказал Альтман, на Codex приходится уже 40% использования ChatGPT. В целом народ очень хвалит то, как модель программирует. Подробнее о последних новинках кодекса - по ссылке
А для программирования с Codex на маках вышло приложение (IDE) от OpenAI, которое называется Xcode 26.
Кстати, как сказал Альтман, на Codex приходится уже 40% использования ChatGPT. В целом народ очень хвалит то, как модель программирует. Подробнее о последних новинках кодекса - по ссылке
OpenAI
Introducing upgrades to Codex
Codex just got faster, more reliable, and better at real-time collaboration and tackling tasks independently anywhere you develop—whether via the terminal, IDE, web, or even your phone.
Кстати, на днях попробовал Grok 4 от Илона нашего Маска. И знаете, хорошая модель. И раньше модель была неплохой, и сейчас очень даже на уровне Клода, ЧатГПТ и Джемини. Понравилось
Приехали еще 2 машинки - минимальные мак мини м4 с 16гб памяти. Последние два вечера настраивал их (ранее купил за 9 тыс. простейший монитор - без него никак). Теперь колдую над организацией машин в кластер. Новости есть и плохие, и хорошие. Начну с плохих.
Кластер я начинал создавать исходя из того, что базовые машины очень дешевые. Цена одной - 45 тыс., при увеличении памяти до 32 цена вырастает до 100 тыс. при всех тех же самых характеристиках. Мой эпик фейл заключается в том, что я очень сильно недооценил потребление памяти самой операционкой. В обычном режиме она жрет около 12гб (!) памяти. Убрав все, я сократил потребление примерно до 8, экстремальные варианты обрезания функционала дают около 5-6гб - это то, что использовать никак нельзя. Собственно, это причина, почему Apple поднял минималку с 8 до 16гб. Поэтому выигрыш от машины с большой памятью больше, чем может показаться.
Рассмотрел вариант установки Linux на мак - проблемы с памятью решаются (занимает 1-2 гб), но тут пропадает одна важная фишка. На маках есть библиотека MLX, которая сильно оптимизирует работу с нейронками и дает очень большой прирост и по скорости, и по использованию памяти. При использовании линукса все теряется. Сейчас идет разработка Asahi Linux под эти задачки, но как пишут нейронки, продукт еще сырой.
Ну а хорошая новость - купил кабели thunderbolt 5 (тоже недешевое удовольствие), объединил машины в кластер, они видят друг друга и скорость обмена данными по тандерболту максимальная - 37Гбит/сек, что для моих задачек очень важно, так как одна нейронка будет раскатываться на нескольких машинках.
Устанавливаю exo - пакет для распределенной работы с моделями и, пожалуй, еще поколдую с обрезанием потребителей памяти.
Кластер я начинал создавать исходя из того, что базовые машины очень дешевые. Цена одной - 45 тыс., при увеличении памяти до 32 цена вырастает до 100 тыс. при всех тех же самых характеристиках. Мой эпик фейл заключается в том, что я очень сильно недооценил потребление памяти самой операционкой. В обычном режиме она жрет около 12гб (!) памяти. Убрав все, я сократил потребление примерно до 8, экстремальные варианты обрезания функционала дают около 5-6гб - это то, что использовать никак нельзя. Собственно, это причина, почему Apple поднял минималку с 8 до 16гб. Поэтому выигрыш от машины с большой памятью больше, чем может показаться.
Рассмотрел вариант установки Linux на мак - проблемы с памятью решаются (занимает 1-2 гб), но тут пропадает одна важная фишка. На маках есть библиотека MLX, которая сильно оптимизирует работу с нейронками и дает очень большой прирост и по скорости, и по использованию памяти. При использовании линукса все теряется. Сейчас идет разработка Asahi Linux под эти задачки, но как пишут нейронки, продукт еще сырой.
Ну а хорошая новость - купил кабели thunderbolt 5 (тоже недешевое удовольствие), объединил машины в кластер, они видят друг друга и скорость обмена данными по тандерболту максимальная - 37Гбит/сек, что для моих задачек очень важно, так как одна нейронка будет раскатываться на нескольких машинках.
Устанавливаю exo - пакет для распределенной работы с моделями и, пожалуй, еще поколдую с обрезанием потребителей памяти.
👍1