EBFE: software internals
391 subscribers
349 photos
60 videos
45 files
120 links
Авторский канал Алексея Никольского.
Пишу код операционок и гипервизоров больше 20 лет и читаю лекции студентам.
Делюсь своими мыслями, интересными материалами, мемасиками и всегда рад общению!

Моя мастерская: https://t.me/itmosysint
Download Telegram
БАКАЛАВРЫ! Я все проверил. И вот результаты:
1. У котого я принял все 4 лабы и 5ю доп - автоматически 5.
2. У кого я принял все 4 лабы и написал дифф-зачет - оценка та что за дифф зачет.
3. Если Дифф зачет написан, но не сданы лабы - жду сдачи лаб, иначе ставлю неявку.
Если есть вопросы - пишите в личку или сюда в комменты.
🔥5
Forwarded from Dev Meme / devmeme
Happy vibing 🌚
😁12🤣2
Forwarded from Dev Meme / devmeme
It was always there

Just waiting for you
😁10
Dev Meme / devmeme
It was always there Just waiting for you
Весной тоже так попробуем. Ждите анонса курса
🤯7🔥4
БАКАЛАВРЫ! Всем привет! я проверил все лабы и дифф зачет, что мне прислали. У всех кого смог утвердил в барз. Если у вас не отображается значит что-то недосдано и я не могу аттестовать. Сегодня и завтра есть возможность досдать. Если что-то не понятно - пишите в личку или письма или комменты сюда. Завтра вечером заполню остальных неявками если что.
❤4
Forwarded from Dev Meme / devmeme
👍10😁1
Forwarded from Dev Meme / devmeme
❤9🤣1
Forwarded from Dev Meme / devmeme
🤩3🤣1
Forwarded from Dev Meme / devmeme
🥰6
ubuntu24_qwen25_llamacpp_webui_hf_ru.md
7.2 KB
🚀 Локальная LLM на слабом железе: первый опыт

Всем привет!

Последние несколько дней я решил поэкспериментировать с запуском локальной LLM. Дорогого железа у меня пока нет, поэтому всё тестировалось на Ubuntu 24.04 на моём старом ноутбуке:

🖥 GTX 1060 (6 GB VRAM)

🧠 16 GB RAM

⚙️ старенький Intel i7

По нынешним меркам — железо, мягко говоря, не космос 🚀
Но, внезапно, оно вполне уверенно потянуло Qwen 2.5 3B. Возможно, пойдёт и что-то ещё — я только пару дней как ковыряюсь в этой теме, так что это первая публикация из серии, продолжение будет в ближайшие дни.

🎯 Цель

Для начала я решил с нуля подготовить Ubuntu для запуска Qwen.
Первая цель — получить CLI-интерфейс для работы с моделью.
В итоге схема оказалась довольно простой.

🛠 Как я это настраивал

1️⃣ Драйверы NVIDIA
Ставим последние драйверы для видеокарты:

apt-get update

ubuntu-drivers devices

⚠️ Важно: для нормальной работы мне понадобились драйверы версии 570+, не те, что ставятся по умолчанию.

2️⃣ NVIDIA CUDA SDK
Нужно установить cuda-toolkit-12-8, именно через скачивание .deb файла и подключение репозитория.

3️⃣ Инструменты сборки
Я хотел собирать всё из исходников, чтобы при желании можно было твикать под себя, поэтому понадобятся:

gcc, g++

cmake

ninja

и прочая базовая dev-обвязка

4️⃣ Качаем llama.cpp
Просто клонируем репозиторий с GitHub.

5️⃣ Компиляция
Со
бираем через cmake, обязательно:

явно указать путь к nvcc

добавить флаг -DGGML_CUDA=ON

6️⃣ Hugging Face (hf)
Ставим hf — тулзу для скачивания моделей.

Нюансы:

нужно авторизоваться (у меня даже временная почта прокатила)

получаете токен → тулза начинает работать

сам портал, если честно, довольно странный:

интерфейс а-ля GitHub, но хуже

целиком модель не скачать

git lfs не работает без особой авторизации

иногда перед скачиванием надо зайти на сайт и кликнуть «я согласен» (непонятно с чем 😅)

hf периодически ловит 403, хотя с сайта всё качается нормально

👉 Для Qwen всё упрощается — нужен всего один .gguf файл, так что терпимо.
В целом: хотели как лучше, а получилось как всегда (как говорил классик).

7️⃣ Готово
В итоге
у вас есть:

llama-cli

llama-server

файл модели qwen.gguf

Больше ничего не нужно. Можно запускать, скриптовать и экспериментировать.

🤖 Немного про процесс

Делал я всё это вместе с GPT-5.2 — с ним Linux и open source внезапно становятся вполне юзабельными 😄

Всю нашу переписку я попросил оформить в полноценный гайд.
Он лежи
т в прикреплённых файлах, там:

вс
е команды

пошаговая инструкция

без воды

📊 Результаты на моём железе

⏳ За
грузка модели в память: 10–15 секунд

💬 Про
стые ответы: 5–10 секунд

🧠 Ко
нтекстное окно: примерно 8000 байт

📝 Толь
ко текст

🧮 Можно запускать на CPU
→ при
мерно в 5 раз медленнее, но работает

💬
Вопрос к вам

Есл
и у кого-то есть полезные советы
(кр
оме «купи 5090 за 500к» 😄) — буду рад увидеть их в комментариях.

Надеюсь, материал окажется полезным.
Жду фидбэк, идеи и опыт из первых рук 🙌

Всем удачи и отличного дня! ☀️
❤7👍2🔥2👾1
shakespeare_from_scratch_gpu_pytorch_llamacpp_ru.md
13.5 KB
Всем привет!
Я продолжаю изучать механики вокруг LLM. На этом этапе я решил попробовать сделать новую модель с нуля и запустить ее с помощью llama.cpp. Для примера я решил сделать генеративную модель которая умеет генерировать тексты Шекспира. Это по сути классика от Андрея Корпатого. В общем то на пару с GPT это вополне получилось. Я кратко опишу как это работает и полную инструкцию которую сгенерировал GPT приложу как обычно.
 
1. Вам понадобитса примерно полтора гига и можно обучать как на проце так и на GPU.
2. Вам понадобится настроить llama.cpp как и раньше - плюс настроить pytorch.
 
sudo apt update && sudo apt upgrade -y
sudo apt install -y build-essential cmake git wget curl python3 python3-venv python3-pip htop
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118
pip install transformers accelerate sentencepiece numpy tqdm safetensors

 
3. Скачиваем все тексты шекспира в виде одного файла. https://www.gutenberg.org/cache/epub/100/pg100.txt
4. Убираем из файла лишний текст (заголовки всякие)
5. Преобразуем текст в токены (токенизатор в инструкции)
6. Обучаем модель на токенах. Это у меня на GTX 1060 заняло 4 часа.
7. Конвертируем из текущего формата модели (HF называется - папка с бинарем и парой json) в GGUF (это делает тулза из llama.cpp)
8. Квантование модели - смысл в оптимизации. Если по простому, то для обучения нужны float коэффициенты, а для быстрой работы удобнее хранить вместо float пару целых чисел (числитель, знаминатель) - это и есть квантование.
9. Можно запускать llama-cli в неинтерактивном режиме - в режиме генерации - и все работает:
.\build\bin\Release\llama-completion.exe -m C:\models\shk_q4_k_m.gguf -p "To be..." -n 200 -c 256

 
Это прям модель с нуля. Да простая, да 4 часа. Но все таки прикольно - можно во всем хорошо разобраться.
 
Попробуйте сами.
 
Удачи и хорошего вам дня!
👍6
Forwarded from Dev Meme / devmeme
😢2
Forwarded from Dev Meme / devmeme
They are getting too smart 🌚
Наконец-то действительно полезное приложение
Forwarded from GitHub Community
SkufUp — программа, которая слушает микрофон и ждёт звук открытия банки пива.

Когда слышит характерный «пшик» — запускает игру или открывает сайт.

🐱 GitHub
Please open Telegram to view this post
VIEW IN TELEGRAM
😁13🔥2
Forwarded from Dev Meme / devmeme
😁7
Forwarded from Dev Meme / devmeme
😁9
Forwarded from Dev Meme / devmeme
❤8
Forwarded from Derp Learning
Son of Amazon!
❤4