Forwarded from Gianmarco Gargiulo Mastodon Bridge
APKPure is distributing a malicious copy of Telegram Article URL: https://xcancel.com/EricParker/status/2058411298195661221 Comments URL: https://news.ycombinator.com/item?id=48255605 Points: 1 # C...
Origin | Interest | Match
Origin | Interest | Match
Tentando disperatamente di far andare l'LSP Intelephense via ssh, puntualmente continua a crashare.
Ho provato di nuovo
Però dopo tanto tempo ho notato che crasha con troppa precisione, sempre 3 secondi sia senza che con
Guardo... c'è un timer DI 3 SECONDI che controlla se il processo padre passato via messaggi esiste ancora (internamente esegue
Trucco: passare pid 0, così la syscall avrà sempre successo — l'LSP non muore più.
Ore spese nette: >16
Ho provato di nuovo
strace, a loggare stdin/stdout dei messaggi jsonrpc, niente.Però dopo tanto tempo ho notato che crasha con troppa precisione, sempre 3 secondi sia senza che con
strace (che normalmente rallenta di molto i processi).Guardo... c'è un timer DI 3 SECONDI che controlla se il processo padre passato via messaggi esiste ancora (internamente esegue
kill) altrimenti muore. Peccato che in un ambiente remoto i pid siano completamente diversi.Trucco: passare pid 0, così la syscall avrà sempre successo — l'LSP non muore più.
Ore spese nette: >16
🤯2👍1
Lazygit >0.58 su Konsole è rotto
https://github.com/jesseduffield/lazygit/issues/5531
https://github.com/jesseduffield/lazygit/issues/5531
GitHub
Navigation (arrow keys, tab, enter) broken in Konsole since 0.58.0 · Issue #5531 · jesseduffield/lazygit
Describe the bug Recent versions of Konsole and lazygit seem to not work together. I'm not sure if this is a bug in lazygit or konsole, but given that I noticed no issues with other application...
journalctl -u micro
noMiddleMousePaste.service
Hack decisamente migliore che cancella la clipboard primaria solo all'unfocus / blur della finestra attiva (gtk merda)
while read < <(xprop -spy -id $(xdotool getactivewindow) _NET_WM_STATE | stdbuf -oL tail -n+2); do xsel -in </dev/null; sleep .1; done
Sto abilitando la compressione btrfs su tutto il filesystem della zimaboard perché ho troppe immagini docker (nextcloud è gigantesco) e 64GB di disco interno sono pochi. Già nei primi 50 secondi ho ricavato il 5% di spazio
BREAKING: Google is planning to release 32 million mosquitoes across Florida and California.
︀︀
︀︀The company has asked the EPA for permission to proceed, with the public given until June 5 to respond.
︀︀
︀︀The mosquitoes are infected with Wolbachia bacteria, which stops them from reproducing and slowly collapses the wild population from within.
︀︀
︀︀Google's previous Debug Project trial in California's Central Valley nearly eliminated mosquitoes from three test sites entirely. A separate trial in Singapore cut dengue cases by 70% within 12 months.
︀︀
︀︀Google has now released over 1 billion mosquitoes across four continents. This new proposal is the largest deployment in US history.
https://fixupx.com/chakravartiiin/status/2060916048564723717
FixupX
Mr Melancholy (@chakravartiiin)
Browser, phone, AI, Mosquitoes ???
Quoting Bull Theory (@BullTheoryio)
BREAKING: Google is planning to release 32 million mosquitoes across Florida and California.
The company has asked the EPA for permission to proceed, with the public given until June…
Quoting Bull Theory (@BullTheoryio)
BREAKING: Google is planning to release 32 million mosquitoes across Florida and California.
The company has asked the EPA for permission to proceed, with the public given until June…
Forwarded from Gianmarco Gargiulo Mastodon Bridge
Well, well, well... look who comes crawling back. 😂 The data is in, and the AI hype cycle is hitting a massive reality check. 55% of executives now admit they regret replacing human workers with AI. Even worse? 29% of companies have already had to rehire for the exact roles they cut. https://emeraldbook.org/news/may-3126-2/
Emerald Book – Growing the Black Economy
Companies Are Quietly Rehiring Workers They Fired for AI – Emerald Book
◆ Emerald Pages ◆ feature / economy The Great AI Boomerang: Google, Meta, Klarna & More Are Quietly Rehiring the Workers They Fired Emerald Book Publication May 31, 2026 8 min read 29% of firms have already rehired for AI-cut roles, while 55% of executives…
Metto a scaricare un gioco da Steam e dopo pochi minuti il traffico va a zero. Hmm...
Investigo... non mi carica più alcuna pagina web. Hmm... DNS?
Apro il pannello di controllo di PiHole, uguale.
Guardo via ssh il container di PiHole:
come scusa?
Riavvio il container, tutto ok.
Investigo perché il mio pc non mette in cache i record dns... NetworkManager si affida di base a systemd-resolved oppure dnsmasq gestito con config interni e nessuno dei due è attivo. Ok.
Provo a riattivare systemd-resolved con tutti i config giusti, symlink a resolv.conf... tutti cache miss. A che cazzo servi?
Butta via systemd-resolved, dì a NM di usare dnsmasq, ripulisci i config interni... ALL GOOD
Investigo... non mi carica più alcuna pagina web. Hmm... DNS?
Apro il pannello di controllo di PiHole, uguale.
Guardo via ssh il container di PiHole:
INFO: Rate-limiting 192.168.1.2 for at least 14 seconds
INFO: Still rate-limiting 192.168.1.2 as it made additional 31335 queries
INFO: Still rate-limiting 192.168.1.2 as it made additional 17110 queries
come scusa?
Riavvio il container, tutto ok.
Investigo perché il mio pc non mette in cache i record dns... NetworkManager si affida di base a systemd-resolved oppure dnsmasq gestito con config interni e nessuno dei due è attivo. Ok.
Provo a riattivare systemd-resolved con tutti i config giusti, symlink a resolv.conf... tutti cache miss. A che cazzo servi?
Butta via systemd-resolved, dì a NM di usare dnsmasq, ripulisci i config interni... ALL GOOD
Dato che lo faccio per lavoro non vedo perché non condividere info di AI
Guida completa per ottimizzare i parametri di utilizzo hardware su Ollama
https://github.com/jameschrisa/Ollama_Tuning_Guide
È possibile anche allocare parti di modelli sia su VRAM, che RAM, che disco (via memory-map). Velocizzare la generazione di token (batch) e tanto altro. Ci sono anche degli script che dovrebbero calcolare l'allineamento di astri per il proprio setup.
Poi in parallelo qualcuno mi disse che Ollama è essenzialmente la versione marketing e più lenta [?] di llama.cpp, anche lui con parametri equivalenti di distribuzione e generazione
https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md
(altro pro di llama.cpp: scarica direttamente i modelli da HuggingFace) Lo può fare anche Ollama
Guida completa per ottimizzare i parametri di utilizzo hardware su Ollama
https://github.com/jameschrisa/Ollama_Tuning_Guide
È possibile anche allocare parti di modelli sia su VRAM, che RAM, che disco (via memory-map). Velocizzare la generazione di token (batch) e tanto altro. Ci sono anche degli script che dovrebbero calcolare l'allineamento di astri per il proprio setup.
Poi in parallelo qualcuno mi disse che Ollama è essenzialmente la versione marketing e più lenta [?] di llama.cpp, anche lui con parametri equivalenti di distribuzione e generazione
https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md
GitHub
GitHub - jameschrisa/Ollama_Tuning_Guide: For those interested in wanting to tune quantized LMs
For those interested in wanting to tune quantized LMs - jameschrisa/Ollama_Tuning_Guide
❤3
Appunti real-time AI
Da non prendere come oro colato, non esaustivi
Si ringrazia @Valentimarco
llama.cpp
• fighissimo, veloce, FOSS
• da pochi mesi ha anche un'interfaccia web
• ora è anche OpenAI-API compatibile
• pensato per tutto
• distribuiscono delle release ma consigliano di ricompilarlo perché spesso le librerie dinamiche si rompono
vllm
• heavy-fork di llama.cpp
• principalmente python
• variante TGI (Text Generation Inference): distribuisce su più GPU ma non supporta modelli quantizzati
(copia stronza di ray)
• pensato per enterprise
ollama
• usano un loro fork di llama.cpp ma non lo dichiarano
• hanno problemi con la community FOSS
• meme corporate
• piani cloud
• nasce per consumer
LM studio
• closed source, utilizza llama.cpp upstream
• nasce per consumer
FastFlowLM
• programma FOSS, kernel closed
• richiede modelli appositi
• pensato per la generazione su NPU AMD
CUDA / vulkan / ROCm / MLX / ...
• varie API hardware di GPGPU
• generalmente è meglio / più veloce CUDA, anche se NVIDIA ha peggiorato le performance su schede vecchie
Training
• generalmente i modelli sono allenati su qualsiasi tipo di testo, da qualsiasi fonte
• copiano tutti i bias contenuti in essi
• da questo emerge che suonano molto convincenti
• modelli piccoli sono perfetti per essere specializzati
• modelli grandi sono più generalisti ma tendono a essere inutilmente verbosi (pensano troppo)
• verbosità mitigabile con fine-tuning + reinforcement learning
———————
LLM
• tensori + kv-cache
• auto-regressivi — ad ogni token generato rileggono tutto il contenuto per prevedere il prossimo
• la regressione si ferma alla generazione di un token speciale di fine
• temperatura — verranno scelti token meno probabili in modo proporzionale
• ci sono altri parametri di controllo dei token
• one-shot — nessun esempio nel prompt
• few-shots — qualche esempio nel prompt
quantizzazione
• ogni neurone ha un numero di partenza float a 16bit
• più si tolgono bit dopo il training, meno accuratezza si avrà (si perdono informazioni)
• risparmio notevole di memoria
• trivia: quando escono nuovi modelli proprietari, riquantizzano quelli vecchi
contesto
• finestra di lettura/scrittura dei modelli
• richiede memoria extra fissa
• non può superare il limite di dimensione del training
• superata una certa soglia inizia a fare fatica
tensori (rete neurale)
• tensori, solo calcoli vettoriali
• velocissima anche su CPU con estensioni AVX
• anche su ARM se quantizzato a 8bit (ed estensioni equivalenti)
kv-cache (attenzione)
• vero nucleo di attenzione degli LLM
• utilizzato per distinguere più significati sulle medesime parole (estrema semplificazione)
• dizionario che si espande man mano che il modello gira
• può espandersi a dismisura
• richiede tantissima banda e per questo va sempre caricato tutto in GPU
flash-attention
• ottimizza via i neuroni mai utilizzati
• risparmia memoria
• c'è ormai in tutti i modelli
• di solito da attivare esplicitamente
multi-token prediction (mtp)
• il modello permette di generare più token allo stesso momento
• supportato solo da qwen ≥3.5 e nemotron
• velocizza la generazione e riduce ulteriormente la memoria (li raggruppa)
turboquant
• compressione della kv-cache fino a 4bit tramite rotazione polare dei vettori
• nessuna perdita di informazioni
mixture of experts (moe)
• uno stesso modello gigantesco ha al suo interno tanti vari modelli più piccoli specializzati
• rete neurale di partenza per routing
Da non prendere come oro colato, non esaustivi
Si ringrazia @Valentimarco
llama.cpp
• fighissimo, veloce, FOSS
• da pochi mesi ha anche un'interfaccia web
• ora è anche OpenAI-API compatibile
• pensato per tutto
• distribuiscono delle release ma consigliano di ricompilarlo perché spesso le librerie dinamiche si rompono
vllm
• heavy-fork di llama.cpp
• principalmente python
• variante TGI (Text Generation Inference): distribuisce su più GPU ma non supporta modelli quantizzati
(copia stronza di ray)
• pensato per enterprise
ollama
• usano un loro fork di llama.cpp ma non lo dichiarano
• hanno problemi con la community FOSS
• meme corporate
• piani cloud
• nasce per consumer
LM studio
• closed source, utilizza llama.cpp upstream
• nasce per consumer
FastFlowLM
• programma FOSS, kernel closed
• richiede modelli appositi
• pensato per la generazione su NPU AMD
CUDA / vulkan / ROCm / MLX / ...
• varie API hardware di GPGPU
• generalmente è meglio / più veloce CUDA, anche se NVIDIA ha peggiorato le performance su schede vecchie
Training
• generalmente i modelli sono allenati su qualsiasi tipo di testo, da qualsiasi fonte
• copiano tutti i bias contenuti in essi
• da questo emerge che suonano molto convincenti
• modelli piccoli sono perfetti per essere specializzati
• modelli grandi sono più generalisti ma tendono a essere inutilmente verbosi (pensano troppo)
• verbosità mitigabile con fine-tuning + reinforcement learning
———————
LLM
• tensori + kv-cache
• auto-regressivi — ad ogni token generato rileggono tutto il contenuto per prevedere il prossimo
• la regressione si ferma alla generazione di un token speciale di fine
• temperatura — verranno scelti token meno probabili in modo proporzionale
• ci sono altri parametri di controllo dei token
• one-shot — nessun esempio nel prompt
• few-shots — qualche esempio nel prompt
quantizzazione
• ogni neurone ha un numero di partenza float a 16bit
• più si tolgono bit dopo il training, meno accuratezza si avrà (si perdono informazioni)
• risparmio notevole di memoria
• trivia: quando escono nuovi modelli proprietari, riquantizzano quelli vecchi
contesto
• finestra di lettura/scrittura dei modelli
• richiede memoria extra fissa
• non può superare il limite di dimensione del training
• superata una certa soglia inizia a fare fatica
tensori (rete neurale)
• tensori, solo calcoli vettoriali
• velocissima anche su CPU con estensioni AVX
• anche su ARM se quantizzato a 8bit (ed estensioni equivalenti)
kv-cache (attenzione)
• vero nucleo di attenzione degli LLM
• utilizzato per distinguere più significati sulle medesime parole (estrema semplificazione)
• dizionario che si espande man mano che il modello gira
• può espandersi a dismisura
• richiede tantissima banda e per questo va sempre caricato tutto in GPU
flash-attention
• ottimizza via i neuroni mai utilizzati
• risparmia memoria
• c'è ormai in tutti i modelli
• di solito da attivare esplicitamente
multi-token prediction (mtp)
• il modello permette di generare più token allo stesso momento
• supportato solo da qwen ≥3.5 e nemotron
• velocizza la generazione e riduce ulteriormente la memoria (li raggruppa)
turboquant
• compressione della kv-cache fino a 4bit tramite rotazione polare dei vettori
• nessuna perdita di informazioni
mixture of experts (moe)
• uno stesso modello gigantesco ha al suo interno tanti vari modelli più piccoli specializzati
• rete neurale di partenza per routing
❤3🙏1
Mappe e algoritmi per visualizzare dibattiti, supposizioni, argomenti a favore e obbiezioni — per non continuare a ripeterli ad infinitum
https://en.wikipedia.org/wiki/Argument_map
https://en.wikiversity.org/wiki/Debate_algorithm
https://www.kialo.com — piattaforma collaborativa
https://argdown.org — tipo mermaidjs, sintassi strana
https://en.wikipedia.org/wiki/Argument_map
https://en.wikiversity.org/wiki/Debate_algorithm
https://www.kialo.com — piattaforma collaborativa
https://argdown.org — tipo mermaidjs, sintassi strana
Wikipedia
Argument map
visual diagram of structured arguments