journalctl -u micro
104 subscribers
2.39K photos
234 videos
293 files
1.63K links
Esperienze e consigli di uno sviluppatore tech−unenthusiast

creation — 2021-04-29
owner — @Microeinstein

networks
@sigma_hub Σ
@ageiroumena
Download Telegram
Non ha funzionato, con tutta probabilità Cineca filtra tutto ciò che non arriva dall'italia o da IP non-consumer
Shodan collects the favicon images for all devices it finds on the Internet. The image you see on the side is a breakdown of the top 5000 favicons on the Internet. The larger the image the more popular it is on the Internet and the smaller it is the fewer services on the Internet use that favicon.

https://faviconmap.shodan.io/
Ennesimo caso android: perché il telefono non va più in deep sleep, ciucciando tutta la batteria?
@informapirata@mastodon.uno @privacypride Vedere da fightchatcontrol.eu che l'intero blocco del Partito Democratico sostiene l'iniziativa. Mentre tra coloro che si oppongono c'è Vannacci; mi fa seriamente venire dubbi sulla mia sanità mentale.
2
Se penso che per ottenere pieno controllo sul proprio dispositivo basti una singola chiave privata del vendor di turno...
🗿3
Dominus Funeral — Full metalhead icons theme
Devo dire che si sono impegnati
https://store.kde.org/p/1273980
1
journalctl -u micro
Ennesimo caso android: perché il telefono non va più in deep sleep, ciucciando tutta la batteria?
Niente, ha deciso di non entrare più in deep sleep, allora stanotte l'ho forzato io: spegnendolo
🔥1
Se volete fare trascrizioni audio multilingua, in locale, velocemente, con GPU non obbligatoria, consiglio tantissimo
https://github.com/SYSTRAN/faster-whisper

Il modello small impiega ~2min su CPU per trascrivere 13min di audio, con una qualità eccezionale.
👍1
journalctl -u micro
Ennesimo caso android: perché il telefono non va più in deep sleep, ciucciando tutta la batteria?
Forse posso trarre una conclusione: prima di spegnerlo vedevo zero Wake Locks MA degli "Alarms" generati continuamente da Google Play Services.

Una volta riavviato, questi sono scomparsi, e la batteria è tornata a durare come prima, forse di più.
Nell'ultimo anno ho avuto parecchio a che fare con i RAG — Retrieval Augmented Generation: trasformi dei documenti che il modello non conosce in markdown e poi in vettori, su cui verrà eseguita una ricerca semantica per similarità con la richiesta dell'utente.

• documenti: usage.pdf sdk.pdf
• spezzetta ogni tot parole
• vettorizza con modello di embedding
• salva in Chroma
utente: cos'è X e cosa posso sviluppare?
• cerca i pezzi inerenti
• trova pezzi da entrambi i documenti
bot: (riassunto)

Suona figo? Non lo è, perché per casi reali non funziona una sega.

• per vettorizzare 20 pezzi su CPU ci vogliono anche 40min

• i documenti sono una merda (garbage in, garbage out)

• l'utente scrive male

• non puoi far generare elenchi

• stessa query utente, ogni volta dà dei risultati diversi

• paradosso pre-conoscenza: devi sapere in anticipo quali sono i documenti nel RAG per poter ottenere risultati marginalmente accettabili

• devi fare decomposizione della query, cercando per parole chiave che l'utente non ha specificato

• devi spezzettare i documenti, altrimenti esplode il contesto del modello

• ci sono tanti match ridondanti e il pezzo che ti interessa viene filtrato via? non puoi farci nulla

• se ti inventi di importare pytorch (serve ad Unstructured) ti porti dietro le librerie di CUDA anche se non le userai mai (+2GB)

Ciò che invece ho notato funzionare 1000x meglio è stato un tool agentico scritto in mezz'ora netta, che si interfaccia con le api di Bookstack ed esporta le pagine in markdown, con spezzettamento e rerank
👍3