journalctl -u micro
103 subscribers
2.39K photos
235 videos
294 files
1.63K links
Esperienze e consigli di uno sviluppatore tech−unenthusiast

creation — 2021-04-29
owner — @Microeinstein

networks
@sigma_hub Σ
@ageiroumena
Download Telegram
journalctl -u micro
noMiddleMousePaste.service
Hack decisamente migliore che cancella la clipboard primaria solo all'unfocus / blur della finestra attiva (gtk merda)
while read < <(xprop -spy -id $(xdotool getactivewindow) _NET_WM_STATE | stdbuf -oL tail -n+2); do xsel -in </dev/null; sleep .1; done
Sto abilitando la compressione btrfs su tutto il filesystem della zimaboard perché ho troppe immagini docker (nextcloud è gigantesco) e 64GB di disco interno sono pochi. Già nei primi 50 secondi ho ricavato il 5% di spazio
A volte è meglio che i dev di discord si mettano le mani nel culo
👍1
Anche netgear
La release di bun musl richiede comunque glibc...
😁2😭1
BREAKING: Google is planning to release 32 million mosquitoes across Florida and California.
︀︀
︀︀The company has asked the EPA for permission to proceed, with the public given until June 5 to respond.
︀︀
︀︀The mosquitoes are infected with Wolbachia bacteria, which stops them from reproducing and slowly collapses the wild population from within.
︀︀
︀︀Google's previous Debug Project trial in California's Central Valley nearly eliminated mosquitoes from three test sites entirely. A separate trial in Singapore cut dengue cases by 70% within 12 months.
︀︀
︀︀Google has now released over 1 billion mosquitoes across four continents. This new proposal is the largest deployment in US history.


https://fixupx.com/chakravartiiin/status/2060916048564723717
Forwarded from 🌱 Activacy
Metto a scaricare un gioco da Steam e dopo pochi minuti il traffico va a zero. Hmm...
Investigo... non mi carica più alcuna pagina web. Hmm... DNS?
Apro il pannello di controllo di PiHole, uguale.
Guardo via ssh il container di PiHole:
INFO: Rate-limiting 192.168.1.2 for at least 14 seconds
INFO: Still rate-limiting 192.168.1.2 as it made additional 31335 queries
INFO: Still rate-limiting 192.168.1.2 as it made additional 17110 queries

come scusa?

Riavvio il container, tutto ok.
Investigo perché il mio pc non mette in cache i record dns... NetworkManager si affida di base a systemd-resolved oppure dnsmasq gestito con config interni e nessuno dei due è attivo. Ok.

Provo a riattivare systemd-resolved con tutti i config giusti, symlink a resolv.conf... tutti cache miss. A che cazzo servi?

Butta via systemd-resolved, dì a NM di usare dnsmasq, ripulisci i config interni... ALL GOOD
Dato che lo faccio per lavoro non vedo perché non condividere info di AI

Guida completa per ottimizzare i parametri di utilizzo hardware su Ollama
https://github.com/jameschrisa/Ollama_Tuning_Guide

È possibile anche allocare parti di modelli sia su VRAM, che RAM, che disco (via memory-map). Velocizzare la generazione di token (batch) e tanto altro. Ci sono anche degli script che dovrebbero calcolare l'allineamento di astri per il proprio setup.

Poi in parallelo qualcuno mi disse che Ollama è essenzialmente la versione marketing e più lenta [?] di llama.cpp, anche lui con parametri equivalenti di distribuzione e generazione
https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md

(altro pro di llama.cpp: scarica direttamente i modelli da HuggingFace) Lo può fare anche Ollama
3
Appunti real-time AI
Da non prendere come oro colato, non esaustivi
Si ringrazia @Valentimarco

llama.cpp
• fighissimo, veloce, FOSS
• da pochi mesi ha anche un'interfaccia web
• ora è anche OpenAI-API compatibile
• pensato per tutto
• distribuiscono delle release ma consigliano di ricompilarlo perché spesso le librerie dinamiche si rompono

vllm
• heavy-fork di llama.cpp
• principalmente python
• variante TGI (Text Generation Inference): distribuisce su più GPU ma non supporta modelli quantizzati
(copia stronza di ray)
• pensato per enterprise

ollama
• usano un loro fork di llama.cpp ma non lo dichiarano
• hanno problemi con la community FOSS
• meme corporate
• piani cloud
• nasce per consumer

LM studio
• closed source, utilizza llama.cpp upstream
• nasce per consumer

FastFlowLM
• programma FOSS, kernel closed
• richiede modelli appositi
• pensato per la generazione su NPU AMD

CUDA / vulkan / ROCm / MLX / ...
• varie API hardware di GPGPU
• generalmente è meglio / più veloce CUDA, anche se NVIDIA ha peggiorato le performance su schede vecchie

Training
• generalmente i modelli sono allenati su qualsiasi tipo di testo, da qualsiasi fonte
• copiano tutti i bias contenuti in essi
• da questo emerge che suonano molto convincenti
• modelli piccoli sono perfetti per essere specializzati
• modelli grandi sono più generalisti ma tendono a essere inutilmente verbosi (pensano troppo)
• verbosità mitigabile con fine-tuning + reinforcement learning

———————

LLM
• tensori + kv-cache
• auto-regressivi — ad ogni token generato rileggono tutto il contenuto per prevedere il prossimo
• la regressione si ferma alla generazione di un token speciale di fine
• temperatura — verranno scelti token meno probabili in modo proporzionale
• ci sono altri parametri di controllo dei token
• one-shot — nessun esempio nel prompt
• few-shots — qualche esempio nel prompt

quantizzazione
• ogni neurone ha un numero di partenza float a 16bit
• più si tolgono bit dopo il training, meno accuratezza si avrà (si perdono informazioni)
• risparmio notevole di memoria
• trivia: quando escono nuovi modelli proprietari, riquantizzano quelli vecchi

contesto
• finestra di lettura/scrittura dei modelli
• richiede memoria extra fissa
• non può superare il limite di dimensione del training
• superata una certa soglia inizia a fare fatica

tensori (rete neurale)
• tensori, solo calcoli vettoriali
• velocissima anche su CPU con estensioni AVX
• anche su ARM se quantizzato a 8bit (ed estensioni equivalenti)

kv-cache (attenzione)
• vero nucleo di attenzione degli LLM
• utilizzato per distinguere più significati sulle medesime parole (estrema semplificazione)
• dizionario che si espande man mano che il modello gira
• può espandersi a dismisura
• richiede tantissima banda e per questo va sempre caricato tutto in GPU

flash-attention
• ottimizza via i neuroni mai utilizzati
• risparmia memoria
• c'è ormai in tutti i modelli
• di solito da attivare esplicitamente

multi-token prediction (mtp)
• il modello permette di generare più token allo stesso momento
• supportato solo da qwen ≥3.5 e nemotron
• velocizza la generazione e riduce ulteriormente la memoria (li raggruppa)

turboquant
• compressione della kv-cache fino a 4bit tramite rotazione polare dei vettori
• nessuna perdita di informazioni

mixture of experts (moe)
• uno stesso modello gigantesco ha al suo interno tanti vari modelli più piccoli specializzati
• rete neurale di partenza per routing
3🙏1
Mappe e algoritmi per visualizzare dibattiti, supposizioni, argomenti a favore e obbiezioni — per non continuare a ripeterli ad infinitum

https://en.wikipedia.org/wiki/Argument_map

https://en.wikiversity.org/wiki/Debate_algorithm

https://www.kialo.com — piattaforma collaborativa

https://argdown.org — tipo mermaidjs, sintassi strana
source
Grazie a @humoristick che certi giorni le ha tutte e sedici.