EBFE: software internals
389 subscribers
346 photos
60 videos
45 files
120 links
Авторский канал Алексея Никольского.
Пишу код операционок и гипервизоров больше 20 лет и читаю лекции студентам.
Делюсь своими мыслями, интересными материалами, мемасиками и всегда рад общению!

Моя мастерская: https://t.me/itmosysint
Download Telegram
ubuntu24_qwen25_llamacpp_webui_hf_ru.md
7.2 KB
🚀 Локальная LLM на слабом железе: первый опыт

Всем привет!

Последние несколько дней я решил поэкспериментировать с запуском локальной LLM. Дорогого железа у меня пока нет, поэтому всё тестировалось на Ubuntu 24.04 на моём старом ноутбуке:

🖥 GTX 1060 (6 GB VRAM)

🧠 16 GB RAM

⚙️ старенький Intel i7

По нынешним меркам — железо, мягко говоря, не космос 🚀
Но, внезапно, оно вполне уверенно потянуло Qwen 2.5 3B. Возможно, пойдёт и что-то ещё — я только пару дней как ковыряюсь в этой теме, так что это первая публикация из серии, продолжение будет в ближайшие дни.

🎯 Цель

Для начала я решил с нуля подготовить Ubuntu для запуска Qwen.
Первая цель — получить CLI-интерфейс для работы с моделью.
В итоге схема оказалась довольно простой.

🛠 Как я это настраивал

1️⃣ Драйверы NVIDIA
Ставим последние драйверы для видеокарты:

apt-get update

ubuntu-drivers devices

⚠️ Важно: для нормальной работы мне понадобились драйверы версии 570+, не те, что ставятся по умолчанию.

2️⃣ NVIDIA CUDA SDK
Нужно установить cuda-toolkit-12-8, именно через скачивание .deb файла и подключение репозитория.

3️⃣ Инструменты сборки
Я хотел собирать всё из исходников, чтобы при желании можно было твикать под себя, поэтому понадобятся:

gcc, g++

cmake

ninja

и прочая базовая dev-обвязка

4️⃣ Качаем llama.cpp
Просто клонируем репозиторий с GitHub.

5️⃣ Компиляция
Со
бираем через cmake, обязательно:

явно указать путь к nvcc

добавить флаг -DGGML_CUDA=ON

6️⃣ Hugging Face (hf)
Ставим hf — тулзу для скачивания моделей.

Нюансы:

нужно авторизоваться (у меня даже временная почта прокатила)

получаете токен → тулза начинает работать

сам портал, если честно, довольно странный:

интерфейс а-ля GitHub, но хуже

целиком модель не скачать

git lfs не работает без особой авторизации

иногда перед скачиванием надо зайти на сайт и кликнуть «я согласен» (непонятно с чем 😅)

hf периодически ловит 403, хотя с сайта всё качается нормально

👉 Для Qwen всё упрощается — нужен всего один .gguf файл, так что терпимо.
В целом: хотели как лучше, а получилось как всегда (как говорил классик).

7️⃣ Готово
В итоге
у вас есть:

llama-cli

llama-server

файл модели qwen.gguf

Больше ничего не нужно. Можно запускать, скриптовать и экспериментировать.

🤖 Немного про процесс

Делал я всё это вместе с GPT-5.2 — с ним Linux и open source внезапно становятся вполне юзабельными 😄

Всю нашу переписку я попросил оформить в полноценный гайд.
Он лежи
т в прикреплённых файлах, там:

вс
е команды

пошаговая инструкция

без воды

📊 Результаты на моём железе

⏳ За
грузка модели в память: 10–15 секунд

💬 Про
стые ответы: 5–10 секунд

🧠 Ко
нтекстное окно: примерно 8000 байт

📝 Толь
ко текст

🧮 Можно запускать на CPU
→ при
мерно в 5 раз медленнее, но работает

💬
Вопрос к вам

Есл
и у кого-то есть полезные советы
(кр
оме «купи 5090 за 500к» 😄) — буду рад увидеть их в комментариях.

Надеюсь, материал окажется полезным.
Жду фидбэк, идеи и опыт из первых рук 🙌

Всем удачи и отличного дня! ☀️
❤7👍2🔥2👾1
shakespeare_from_scratch_gpu_pytorch_llamacpp_ru.md
13.5 KB
Всем привет!
Я продолжаю изучать механики вокруг LLM. На этом этапе я решил попробовать сделать новую модель с нуля и запустить ее с помощью llama.cpp. Для примера я решил сделать генеративную модель которая умеет генерировать тексты Шекспира. Это по сути классика от Андрея Корпатого. В общем то на пару с GPT это вополне получилось. Я кратко опишу как это работает и полную инструкцию которую сгенерировал GPT приложу как обычно.
 
1. Вам понадобитса примерно полтора гига и можно обучать как на проце так и на GPU.
2. Вам понадобится настроить llama.cpp как и раньше - плюс настроить pytorch.
 
sudo apt update && sudo apt upgrade -y
sudo apt install -y build-essential cmake git wget curl python3 python3-venv python3-pip htop
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118
pip install transformers accelerate sentencepiece numpy tqdm safetensors

 
3. Скачиваем все тексты шекспира в виде одного файла. https://www.gutenberg.org/cache/epub/100/pg100.txt
4. Убираем из файла лишний текст (заголовки всякие)
5. Преобразуем текст в токены (токенизатор в инструкции)
6. Обучаем модель на токенах. Это у меня на GTX 1060 заняло 4 часа.
7. Конвертируем из текущего формата модели (HF называется - папка с бинарем и парой json) в GGUF (это делает тулза из llama.cpp)
8. Квантование модели - смысл в оптимизации. Если по простому, то для обучения нужны float коэффициенты, а для быстрой работы удобнее хранить вместо float пару целых чисел (числитель, знаминатель) - это и есть квантование.
9. Можно запускать llama-cli в неинтерактивном режиме - в режиме генерации - и все работает:
.\build\bin\Release\llama-completion.exe -m C:\models\shk_q4_k_m.gguf -p "To be..." -n 200 -c 256

 
Это прям модель с нуля. Да простая, да 4 часа. Но все таки прикольно - можно во всем хорошо разобраться.
 
Попробуйте сами.
 
Удачи и хорошего вам дня!
👍6
Forwarded from Dev Meme / devmeme
😢2
Forwarded from Dev Meme / devmeme
They are getting too smart 🌚
Наконец-то действительно полезное приложение
Forwarded from GitHub Community
SkufUp — программа, которая слушает микрофон и ждёт звук открытия банки пива.

Когда слышит характерный «пшик» — запускает игру или открывает сайт.

🐱 GitHub
Please open Telegram to view this post
VIEW IN TELEGRAM
😁13🔥2
Forwarded from Dev Meme / devmeme
😁7
Forwarded from Dev Meme / devmeme
😁9
Forwarded from Dev Meme / devmeme
❤8
Forwarded from Derp Learning
Son of Amazon!
❤4
Forwarded from Dev Meme / devmeme
❤3😁2
Forwarded from GitHub Community
В сети доступна библиотека с 200+ PDF по кибербезопасности и хакингу.

Внутри — книги, гайды и практические материалы для изучения основ и углубления знаний в сфере информационной безопасности.

Забрать здесь

🐱 GitHub
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3
Forwarded from GitHub Community
MalwareSourceCode — коллекция исходного кода вредоносных программ для различных платформ на множестве разных языков программирования.

4️⃣ GitHub
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3
Forwarded from Dev Meme / devmeme
😁7
Forwarded from Коза кричала
This media is not supported in your browser
VIEW IN TELEGRAM
Кусочек человеческого мозга, высаженный в чашку Петри, научился играть в Doom. Это примерно 200 тысяч живых нейронов, подключенных электродами к компьютеру, на котором запущена игра. Изобретение австралийской компании Cortical Labs.

Коза в MAX
❤3🤯1
Forwarded from Dev Meme / devmeme
😁5
Forwarded from Dev Meme / devmeme
😁10
Когда-то давно, мы с моим научным руководителем обсуждали, что самое безопасное, это распечатать документ на бумаге, потом его отсканировать на другом компе)
🔥3😁1
Forwarded from GitHub Community
Dangerzone работает следующим образом: вы предоставляете ей документ, в надежности которого не уверены (например, вложение в электронное письмо).

В изолированной среде Dangerzone преобразует документ в PDF (если он еще не в формате PDF), а затем в необработанные пиксельные данные: огромный список значений цвета RGB для каждой страницы.

Затем, за пределами изолированной среды, Dangerzone преобразует эти пиксельные данные обратно в PDF.

🐱 GitHub
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥2