Dev Meme / devmeme
It was always there Just waiting for you
Весной тоже так попробуем. Ждите анонса курса
🤯7🔥4
БАКАЛАВРЫ! Всем привет! я проверил все лабы и дифф зачет, что мне прислали. У всех кого смог утвердил в барз. Если у вас не отображается значит что-то недосдано и я не могу аттестовать. Сегодня и завтра есть возможность досдать. Если что-то не понятно - пишите в личку или письма или комменты сюда. Завтра вечером заполню остальных неявками если что.
❤4
ubuntu24_qwen25_llamacpp_webui_hf_ru.md
7.2 KB
🚀 Локальная LLM на слабом железе: первый опыт
Всем привет!
Последние несколько дней я решил поэкспериментировать с запуском локальной LLM. Дорогого железа у меня пока нет, поэтому всё тестировалось на Ubuntu 24.04 на моём старом ноутбуке:
🖥 GTX 1060 (6 GB VRAM)
🧠 16 GB RAM
⚙️ старенький Intel i7
По нынешним меркам — железо, мягко говоря, не космос 🚀
Но, внезапно, оно вполне уверенно потянуло Qwen 2.5 3B. Возможно, пойдёт и что-то ещё — я только пару дней как ковыряюсь в этой теме, так что это первая публикация из серии, продолжение будет в ближайшие дни.
🎯 Цель
Для начала я решил с нуля подготовить Ubuntu для запуска Qwen.
Первая цель — получить CLI-интерфейс для работы с моделью.
В итоге схема оказалась довольно простой.
🛠 Как я это настраивал
1️⃣ Драйверы NVIDIA
Ставим последние драйверы для видеокарты:
apt-get update
ubuntu-drivers devices
⚠️ Важно: для нормальной работы мне понадобились драйверы версии 570+, не те, что ставятся по умолчанию.
2️⃣ NVIDIA CUDA SDK
Нужно установить cuda-toolkit-12-8, именно через скачивание .deb файла и подключение репозитория.
3️⃣ Инструменты сборки
Я хотел собирать всё из исходников, чтобы при желании можно было твикать под себя, поэтому понадобятся:
gcc, g++
cmake
ninja
и прочая базовая dev-обвязка
4️⃣ Качаем llama.cpp
Просто клонируем репозиторий с GitHub.
5️⃣ Компиляция
Собираем через cmake, обязательно:
явно указать путь к nvcc
добавить флаг -DGGML_CUDA=ON
6️⃣ Hugging Face (hf)
Ставим hf — тулзу для скачивания моделей.
Нюансы:
нужно авторизоваться (у меня даже временная почта прокатила)
получаете токен → тулза начинает работать
сам портал, если честно, довольно странный:
интерфейс а-ля GitHub, но хуже
целиком модель не скачать
git lfs не работает без особой авторизации
иногда перед скачиванием надо зайти на сайт и кликнуть «я согласен» (непонятно с чем 😅)
hf периодически ловит 403, хотя с сайта всё качается нормально
👉 Для Qwen всё упрощается — нужен всего один .gguf файл, так что терпимо.
В целом: хотели как лучше, а получилось как всегда (как говорил классик).
7️⃣ Готово
В итоге у вас есть:
llama-cli
llama-server
файл модели qwen.gguf
Больше ничего не нужно. Можно запускать, скриптовать и экспериментировать.
🤖 Немного про процесс
Делал я всё это вместе с GPT-5.2 — с ним Linux и open source внезапно становятся вполне юзабельными 😄
Всю нашу переписку я попросил оформить в полноценный гайд.
Он лежит в прикреплённых файлах, там:
все команды
пошаговая инструкция
без воды
📊 Результаты на моём железе
⏳ Загрузка модели в память: 10–15 секунд
💬 Простые ответы: 5–10 секунд
🧠 Контекстное окно: примерно 8000 байт
📝 Только текст
🧮 Можно запускать на CPU
→ примерно в 5 раз медленнее, но работает
💬 Вопрос к вам
Если у кого-то есть полезные советы
(кроме «купи 5090 за 500к» 😄) — буду рад увидеть их в комментариях.
Надеюсь, материал окажется полезным.
Жду фидбэк, идеи и опыт из первых рук 🙌
Всем удачи и отличного дня! ☀️
Всем привет!
Последние несколько дней я решил поэкспериментировать с запуском локальной LLM. Дорогого железа у меня пока нет, поэтому всё тестировалось на Ubuntu 24.04 на моём старом ноутбуке:
🖥 GTX 1060 (6 GB VRAM)
🧠 16 GB RAM
⚙️ старенький Intel i7
По нынешним меркам — железо, мягко говоря, не космос 🚀
Но, внезапно, оно вполне уверенно потянуло Qwen 2.5 3B. Возможно, пойдёт и что-то ещё — я только пару дней как ковыряюсь в этой теме, так что это первая публикация из серии, продолжение будет в ближайшие дни.
🎯 Цель
Для начала я решил с нуля подготовить Ubuntu для запуска Qwen.
Первая цель — получить CLI-интерфейс для работы с моделью.
В итоге схема оказалась довольно простой.
🛠 Как я это настраивал
1️⃣ Драйверы NVIDIA
Ставим последние драйверы для видеокарты:
apt-get update
ubuntu-drivers devices
⚠️ Важно: для нормальной работы мне понадобились драйверы версии 570+, не те, что ставятся по умолчанию.
2️⃣ NVIDIA CUDA SDK
Нужно установить cuda-toolkit-12-8, именно через скачивание .deb файла и подключение репозитория.
3️⃣ Инструменты сборки
Я хотел собирать всё из исходников, чтобы при желании можно было твикать под себя, поэтому понадобятся:
gcc, g++
cmake
ninja
и прочая базовая dev-обвязка
4️⃣ Качаем llama.cpp
Просто клонируем репозиторий с GitHub.
5️⃣ Компиляция
Собираем через cmake, обязательно:
явно указать путь к nvcc
добавить флаг -DGGML_CUDA=ON
6️⃣ Hugging Face (hf)
Ставим hf — тулзу для скачивания моделей.
Нюансы:
нужно авторизоваться (у меня даже временная почта прокатила)
получаете токен → тулза начинает работать
сам портал, если честно, довольно странный:
интерфейс а-ля GitHub, но хуже
целиком модель не скачать
git lfs не работает без особой авторизации
иногда перед скачиванием надо зайти на сайт и кликнуть «я согласен» (непонятно с чем 😅)
hf периодически ловит 403, хотя с сайта всё качается нормально
👉 Для Qwen всё упрощается — нужен всего один .gguf файл, так что терпимо.
В целом: хотели как лучше, а получилось как всегда (как говорил классик).
7️⃣ Готово
В итоге у вас есть:
llama-cli
llama-server
файл модели qwen.gguf
Больше ничего не нужно. Можно запускать, скриптовать и экспериментировать.
🤖 Немного про процесс
Делал я всё это вместе с GPT-5.2 — с ним Linux и open source внезапно становятся вполне юзабельными 😄
Всю нашу переписку я попросил оформить в полноценный гайд.
Он лежит в прикреплённых файлах, там:
все команды
пошаговая инструкция
без воды
📊 Результаты на моём железе
⏳ Загрузка модели в память: 10–15 секунд
💬 Простые ответы: 5–10 секунд
🧠 Контекстное окно: примерно 8000 байт
📝 Только текст
🧮 Можно запускать на CPU
→ примерно в 5 раз медленнее, но работает
💬 Вопрос к вам
Если у кого-то есть полезные советы
(кроме «купи 5090 за 500к» 😄) — буду рад увидеть их в комментариях.
Надеюсь, материал окажется полезным.
Жду фидбэк, идеи и опыт из первых рук 🙌
Всем удачи и отличного дня! ☀️
❤7👍2🔥2👾1
shakespeare_from_scratch_gpu_pytorch_llamacpp_ru.md
13.5 KB
Всем привет!
Я продолжаю изучать механики вокруг LLM. На этом этапе я решил попробовать сделать новую модель с нуля и запустить ее с помощью llama.cpp. Для примера я решил сделать генеративную модель которая умеет генерировать тексты Шекспира. Это по сути классика от Андрея Корпатого. В общем то на пару с GPT это вополне получилось. Я кратко опишу как это работает и полную инструкцию которую сгенерировал GPT приложу как обычно.
1. Вам понадобитса примерно полтора гига и можно обучать как на проце так и на GPU.
2. Вам понадобится настроить llama.cpp как и раньше - плюс настроить pytorch.
3. Скачиваем все тексты шекспира в виде одного файла. https://www.gutenberg.org/cache/epub/100/pg100.txt
4. Убираем из файла лишний текст (заголовки всякие)
5. Преобразуем текст в токены (токенизатор в инструкции)
6. Обучаем модель на токенах. Это у меня на GTX 1060 заняло 4 часа.
7. Конвертируем из текущего формата модели (HF называется - папка с бинарем и парой json) в GGUF (это делает тулза из llama.cpp)
8. Квантование модели - смысл в оптимизации. Если по простому, то для обучения нужны float коэффициенты, а для быстрой работы удобнее хранить вместо float пару целых чисел (числитель, знаминатель) - это и есть квантование.
9. Можно запускать llama-cli в неинтерактивном режиме - в режиме генерации - и все работает:
Это прям модель с нуля. Да простая, да 4 часа. Но все таки прикольно - можно во всем хорошо разобраться.
Попробуйте сами.
Удачи и хорошего вам дня!
Я продолжаю изучать механики вокруг LLM. На этом этапе я решил попробовать сделать новую модель с нуля и запустить ее с помощью llama.cpp. Для примера я решил сделать генеративную модель которая умеет генерировать тексты Шекспира. Это по сути классика от Андрея Корпатого. В общем то на пару с GPT это вополне получилось. Я кратко опишу как это работает и полную инструкцию которую сгенерировал GPT приложу как обычно.
1. Вам понадобитса примерно полтора гига и можно обучать как на проце так и на GPU.
2. Вам понадобится настроить llama.cpp как и раньше - плюс настроить pytorch.
sudo apt update && sudo apt upgrade -y
sudo apt install -y build-essential cmake git wget curl python3 python3-venv python3-pip htop
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118
pip install transformers accelerate sentencepiece numpy tqdm safetensors
3. Скачиваем все тексты шекспира в виде одного файла. https://www.gutenberg.org/cache/epub/100/pg100.txt
4. Убираем из файла лишний текст (заголовки всякие)
5. Преобразуем текст в токены (токенизатор в инструкции)
6. Обучаем модель на токенах. Это у меня на GTX 1060 заняло 4 часа.
7. Конвертируем из текущего формата модели (HF называется - папка с бинарем и парой json) в GGUF (это делает тулза из llama.cpp)
8. Квантование модели - смысл в оптимизации. Если по простому, то для обучения нужны float коэффициенты, а для быстрой работы удобнее хранить вместо float пару целых чисел (числитель, знаминатель) - это и есть квантование.
9. Можно запускать llama-cli в неинтерактивном режиме - в режиме генерации - и все работает:
.\build\bin\Release\llama-completion.exe -m C:\models\shk_q4_k_m.gguf -p "To be..." -n 200 -c 256
Это прям модель с нуля. Да простая, да 4 часа. Но все таки прикольно - можно во всем хорошо разобраться.
Попробуйте сами.
Удачи и хорошего вам дня!
👍6
Forwarded from GitHub Community
MalwareSourceCode — коллекция исходного кода вредоносных программ для различных платформ на множестве разных языков программирования.
4️⃣ GitHub
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3