Il capex delle Big Tech sta per superare il cash flow ๐
Epoch AI ha pubblicato un nuovo data insight sulla spesa in infrastrutture AI degli hyperscaler: stima che entro il Q3 2026 gli investimenti in capex supereranno il flusso di cassa operativo.
Dentro troverete:
๐ Il sorpasso: capex aggregato oltre il cash flow entro Q3 2026
๐ NVIDIA: oltre il 60% del compute totale installato
๐ Il resto: Google e Amazon a coprire gran parte del compute rimanente
๐ Il trend: capex cresciuto molto piรน velocemente dei ricavi
๐ I dati: parte del database Epoch AI su oltre 3.500 modelli ML
Lo trovate qui ๐ https://epoch.ai/data-insights/hyperscaler-capex-vs-cash-flow
Epoch AI ha pubblicato un nuovo data insight sulla spesa in infrastrutture AI degli hyperscaler: stima che entro il Q3 2026 gli investimenti in capex supereranno il flusso di cassa operativo.
Dentro troverete:
๐ Il sorpasso: capex aggregato oltre il cash flow entro Q3 2026
๐ NVIDIA: oltre il 60% del compute totale installato
๐ Il resto: Google e Amazon a coprire gran parte del compute rimanente
๐ Il trend: capex cresciuto molto piรน velocemente dei ricavi
๐ I dati: parte del database Epoch AI su oltre 3.500 modelli ML
Lo trovate qui ๐ https://epoch.ai/data-insights/hyperscaler-capex-vs-cash-flow
โค3๐คฃ3โคโ๐ฅ1
Aggiornare un package una volta รจ facile, farlo per 12 release di fila molto meno โ๏ธ
SWE-Chain valuta i coding agent su catene di upgrade reali, dove ogni versione si costruisce sulla precedente proprio come succede nella manutenzione vera di un progetto.
Dentro troverete:
๐ Dataset: 12 catene di upgrade su 9 package Python reali
๐ Scala: 155 transizioni di versione, 1.660 requisiti verificati
๐ Risultato: i migliori agenti risolvono in media meno del 50% dei task
๐ Top performer: Claude Opus 4.7 su Claude Code al 60,8% di resolving
Lo trovate qui ๐ https://arxiv.org/abs/2605.14415
SWE-Chain valuta i coding agent su catene di upgrade reali, dove ogni versione si costruisce sulla precedente proprio come succede nella manutenzione vera di un progetto.
Dentro troverete:
๐ Dataset: 12 catene di upgrade su 9 package Python reali
๐ Scala: 155 transizioni di versione, 1.660 requisiti verificati
๐ Risultato: i migliori agenti risolvono in media meno del 50% dei task
๐ Top performer: Claude Opus 4.7 su Claude Code al 60,8% di resolving
Lo trovate qui ๐ https://arxiv.org/abs/2605.14415
โค2
Se in questo periodo state cercando nuove opportunitร , su Datapizza Jobs abbiamo due posizioni che potrebbero interessarvi! ๐
1๏ธโฃ Sales Industry Leader - Pubblica Amministrazione e Difesa in Datapizza
๐ธ RAL: 70k-80k
๐ก Esperienza: 6+ anni
๐ Ibrido su Milano
๐ Tecnologie: Sales Strategy, Account Management, Capacitร di negoziazione, Data & AI, Business Development, Result driven, Pubblica Amministrazione e Difesa
๐ https://bit.ly/4qBVybO
2๏ธโฃ AI Transformation Leader in Azzurrodigitale
๐ธ RAL: 60k-80k
๐ก Esperienza: 5+ anni
๐ Ibrido su Padova
๐ Tecnologie: AI Expert, Evaluation di soluzioni GenAI, RAG e Agenti, Sistemi multi-agente, AI Tools, People Management, Project management
๐ https://bit.ly/4zvVf6b
E se avete domande sulle posizioni, noi siamo qui! ๐
1๏ธโฃ Sales Industry Leader - Pubblica Amministrazione e Difesa in Datapizza
๐ธ RAL: 70k-80k
๐ก Esperienza: 6+ anni
๐ Ibrido su Milano
๐ Tecnologie: Sales Strategy, Account Management, Capacitร di negoziazione, Data & AI, Business Development, Result driven, Pubblica Amministrazione e Difesa
๐ https://bit.ly/4qBVybO
2๏ธโฃ AI Transformation Leader in Azzurrodigitale
๐ธ RAL: 60k-80k
๐ก Esperienza: 5+ anni
๐ Ibrido su Padova
๐ Tecnologie: AI Expert, Evaluation di soluzioni GenAI, RAG e Agenti, Sistemi multi-agente, AI Tools, People Management, Project management
๐ https://bit.ly/4zvVf6b
E se avete domande sulle posizioni, noi siamo qui! ๐
โค2๐1๐ฏ1
Un agente AI puo' davvero comportarsi come un ricercatore, dall'idea alla pubblicazione? ๐ฌ
Questa suite di benchmark valuta LLM frontier e harness agentici su tutto il ciclo di vita della ricerca scientifica, non solo su un singolo task isolato.
Dentro troverete:
๐ Copertura: ideazione, letteratura, esperimenti, scrittura del paper
๐ Target: modelli frontier e harness agentici a confronto diretto
๐ Metodo: task pensati per simulare il lavoro reale di un ricercatore
๐ Risultato: gap ancora ampio tra agenti e ricercatori umani sul ciclo completo
Lo trovate qui ๐ https://arxiv.org/abs/2606.07462
Questa suite di benchmark valuta LLM frontier e harness agentici su tutto il ciclo di vita della ricerca scientifica, non solo su un singolo task isolato.
Dentro troverete:
๐ Copertura: ideazione, letteratura, esperimenti, scrittura del paper
๐ Target: modelli frontier e harness agentici a confronto diretto
๐ Metodo: task pensati per simulare il lavoro reale di un ricercatore
๐ Risultato: gap ancora ampio tra agenti e ricercatori umani sul ciclo completo
Lo trovate qui ๐ https://arxiv.org/abs/2606.07462
โค2๐1๐ฅด1
Creare dataset con l'AI, senza scrivere una riga di codice ๐งฎ
Hugging Face ha lanciato AI Sheets, un tool open source che vi permette di costruire, arricchire e trasformare dataset usando modelli AI direttamente da un'interfaccia a foglio di calcolo. Potete usare migliaia di modelli open del Hub tramite Inference Providers, oppure far girare tutto in locale.
Dentro troverete:
๐ Zero codice: interfaccia a celle, come un foglio di calcolo
๐ Migliaia di modelli: accesso diretto ai modelli open del Hub
๐ Locale o cloud: scegliete tra Inference Providers e modelli locali
๐ Arricchimento dati: generate, pulite e trasformate colonne con un prompt
Lo trovate qui ๐ https://huggingface.co/blog/aisheets
Hugging Face ha lanciato AI Sheets, un tool open source che vi permette di costruire, arricchire e trasformare dataset usando modelli AI direttamente da un'interfaccia a foglio di calcolo. Potete usare migliaia di modelli open del Hub tramite Inference Providers, oppure far girare tutto in locale.
Dentro troverete:
๐ Zero codice: interfaccia a celle, come un foglio di calcolo
๐ Migliaia di modelli: accesso diretto ai modelli open del Hub
๐ Locale o cloud: scegliete tra Inference Providers e modelli locali
๐ Arricchimento dati: generate, pulite e trasformate colonne con un prompt
Lo trovate qui ๐ https://huggingface.co/blog/aisheets
๐ฅ7โค4๐3
Le skill dei vostri agenti possono allenarsi da sole ๐ ๏ธ
SkillOpt di Microsoft รจ un optimizer open source che allena skill testuali riutilizzabili per agenti LLM "congelati", senza toccare i pesi del modello. Basta un documento di skill che si aggiorna da solo, con edit validati e nessuna chiamata extra a inferenza.
Dentro troverete:
๐ Come funziona: un optimizer trasforma i rollout in edit su un unico file di skill
๐ Validazione: ogni modifica รจ accettata solo se migliora lo score
๐ Risultati: fino a +24,8 punti nel loop agentico di Codex
๐ Portabilitร : le skill si trasferiscono tra modelli e harness diversi
Lo trovate qui ๐ https://github.com/microsoft/SkillOpt
SkillOpt di Microsoft รจ un optimizer open source che allena skill testuali riutilizzabili per agenti LLM "congelati", senza toccare i pesi del modello. Basta un documento di skill che si aggiorna da solo, con edit validati e nessuna chiamata extra a inferenza.
Dentro troverete:
๐ Come funziona: un optimizer trasforma i rollout in edit su un unico file di skill
๐ Validazione: ogni modifica รจ accettata solo se migliora lo score
๐ Risultati: fino a +24,8 punti nel loop agentico di Codex
๐ Portabilitร : le skill si trasferiscono tra modelli e harness diversi
Lo trovate qui ๐ https://github.com/microsoft/SkillOpt
๐ฅ1๐ฏ1
Se in questo periodo state cercando nuove opportunitร , su Datapizza Jobs abbiamo due posizioni che potrebbero interessarvi! ๐
1๏ธโฃ AI Transformation Leader in Azzurro Digitale
๐ธ RAL: 60k-80k + MBO ๐ก Esperienza: 5+ anni ๐ Ibrido a Padova ๐ Tecnologie: AI Expert, Evaluation di soluzioni GenAI, RAG e Agenti, Sistemi multi-agente, AI Tools, People Management, Project management
๐ https://bit.ly/4qHWmfl
2๏ธโฃ AI Transformation Lead - Datapizza
๐ธ RAL: 45-55k ๐ก Esperienza: 6-8 anni ๐ Ibrido su Milano (3-4 giorni a settimana in sede) ๐ Tecnologie: AI ExpertEvaluation di soluzioni GenAIAI TransformationAI ToolsChange Management
๐ https://bit.ly/3SVoxe8
E se avete domande sulle posizioni, noi siamo qui! ๐
1๏ธโฃ AI Transformation Leader in Azzurro Digitale
๐ธ RAL: 60k-80k + MBO ๐ก Esperienza: 5+ anni ๐ Ibrido a Padova ๐ Tecnologie: AI Expert, Evaluation di soluzioni GenAI, RAG e Agenti, Sistemi multi-agente, AI Tools, People Management, Project management
๐ https://bit.ly/4qHWmfl
2๏ธโฃ AI Transformation Lead - Datapizza
๐ธ RAL: 45-55k ๐ก Esperienza: 6-8 anni ๐ Ibrido su Milano (3-4 giorni a settimana in sede) ๐ Tecnologie: AI ExpertEvaluation di soluzioni GenAIAI TransformationAI ToolsChange Management
๐ https://bit.ly/3SVoxe8
E se avete domande sulle posizioni, noi siamo qui! ๐
โค1๐ญ1
Il toolkit robotics open source di Hugging Face si aggiorna ๐ค
LeRobot v0.6.0 รจ il rilascio piรน grande di sempre per la libreria open source di robotica di Hugging Face: chiude il loop imagine-evaluate-improve per l'AI embodied, con nuovi modelli, benchmark e strumenti di training.
Dentro troverete:
๐ World model policies: VLA-JEPA, FastWAM, LingBot-VA per "immaginare" il futuro
๐ Nuovi VLA: GR00T N1.7, MolmoAct2, EO-1, EVO1 e altri
๐ Valutazione: 6 benchmark di simulazione unificati in lerobot-eval
๐ Training: FSDP e cloud training su HF Jobs
๐ Dataset: supporto depth, annotazione automatica e caricamento 2x piรน veloce
Lo trovate qui ๐ https://huggingface.co/blog/lerobot-release-v060
LeRobot v0.6.0 รจ il rilascio piรน grande di sempre per la libreria open source di robotica di Hugging Face: chiude il loop imagine-evaluate-improve per l'AI embodied, con nuovi modelli, benchmark e strumenti di training.
Dentro troverete:
๐ World model policies: VLA-JEPA, FastWAM, LingBot-VA per "immaginare" il futuro
๐ Nuovi VLA: GR00T N1.7, MolmoAct2, EO-1, EVO1 e altri
๐ Valutazione: 6 benchmark di simulazione unificati in lerobot-eval
๐ Training: FSDP e cloud training su HF Jobs
๐ Dataset: supporto depth, annotazione automatica e caricamento 2x piรน veloce
Lo trovate qui ๐ https://huggingface.co/blog/lerobot-release-v060
๐ฅ5โค1
Gli agenti AI messi alla prova su task lunghi da terminale ๐ป
I benchmark da terminale esistenti misurano solo task brevi, risolvibili in pochi minuti. Long-Horizon-Terminal-Bench cambia approccio: valuta gli agenti su compiti lunghi, con un sistema di reward denso che premia anche i progressi parziali.
Dentro troverete:
๐ Il problema: i benchmark classici ignorano il progresso intermedio
๐ La soluzione: reward grading denso per misurare anche i risultati parziali
๐ L'obiettivo: capire quanto un agente regge in task complessi e prolungati
Lo trovate qui ๐ https://arxiv.org/abs/2607.08964
I benchmark da terminale esistenti misurano solo task brevi, risolvibili in pochi minuti. Long-Horizon-Terminal-Bench cambia approccio: valuta gli agenti su compiti lunghi, con un sistema di reward denso che premia anche i progressi parziali.
Dentro troverete:
๐ Il problema: i benchmark classici ignorano il progresso intermedio
๐ La soluzione: reward grading denso per misurare anche i risultati parziali
๐ L'obiettivo: capire quanto un agente regge in task complessi e prolungati
Lo trovate qui ๐ https://arxiv.org/abs/2607.08964
โค6
Tutti i numeri sull'AI del primo trimestre 2026 ๐
CB Insights ha pubblicato il suo report trimestrale sullo stato dell'AI, con dati su funding, startup, settori piรน caldi e le mosse delle Big Tech nel primo trimestre dell'anno.
Dentro troverete:
๐ Funding: dove sono finiti davvero i miliardi investiti in AI
๐ Settori: quali verticali stanno crescendo piรน velocemente
๐ Startup: le aziende emergenti da tenere d'occhio
๐ Big Tech: le strategie delle grandi aziende sull'AI
Lo trovate qui ๐ https://www.cbinsights.com/research/report/ai-trends-q1-2026/
CB Insights ha pubblicato il suo report trimestrale sullo stato dell'AI, con dati su funding, startup, settori piรน caldi e le mosse delle Big Tech nel primo trimestre dell'anno.
Dentro troverete:
๐ Funding: dove sono finiti davvero i miliardi investiti in AI
๐ Settori: quali verticali stanno crescendo piรน velocemente
๐ Startup: le aziende emergenti da tenere d'occhio
๐ Big Tech: le strategie delle grandi aziende sull'AI
Lo trovate qui ๐ https://www.cbinsights.com/research/report/ai-trends-q1-2026/
โค3โคโ๐ฅ2
Gli agenti LLM messi alla prova in ambienti reali, non ideali ๐
La maggior parte dei benchmark valuta gli agenti in scenari semplificati, con tool puliti e input perfetti. AgentGym2 fa il contrario: testa gli agenti in ambienti "de-idealizzati" che assomigliano molto piรน al mondo reale.
Dentro troverete:
๐ Ambienti realistici: niente tool interface pre-impacchettate
๐ Input imperfetti: gli agenti devono gestire dati incompleti o sporchi
๐ Copertura ampia: piรน scenari e piรน tipologie di task rispetto ai benchmark classici
Lo trovate qui ๐ https://arxiv.org/abs/2607.05174
La maggior parte dei benchmark valuta gli agenti in scenari semplificati, con tool puliti e input perfetti. AgentGym2 fa il contrario: testa gli agenti in ambienti "de-idealizzati" che assomigliano molto piรน al mondo reale.
Dentro troverete:
๐ Ambienti realistici: niente tool interface pre-impacchettate
๐ Input imperfetti: gli agenti devono gestire dati incompleti o sporchi
๐ Copertura ampia: piรน scenari e piรน tipologie di task rispetto ai benchmark classici
Lo trovate qui ๐ https://arxiv.org/abs/2607.05174
โค3๐ฅ1๐1
Se in questo periodo state cercando nuove opportunitร , su Datapizza Jobs abbiamo due posizioni che potrebbero interessarvi! ๐
1๏ธโฃ Software Engineer (.NET) - Imatra
๐ธ RAL: 45k - 55k
๐ก Esperienza: 4+ anni
๐ Full Remote, con la disponibilitร di recarsi in sede a Rimini quando richiesto
๐ Tecnologie: C#, .NET, SQL, PostgreSQL, ReactGCP
๐ https://bit.ly/4y957Bi
2๏ธโฃ Senior Software Engineer - Datapizza
๐ธ RAL: 40k - 55k
๐ก Esperienza: 4+ anni
๐ Full Remote
๐ Tecnologie: Effect, Docker, Typescript, TanStack, AWS, Next.JS, Bun
๐ https://bit.ly/4h5NeOa
E se avete domande sulle posizioni, noi siamo qui! ๐
1๏ธโฃ Software Engineer (.NET) - Imatra
๐ธ RAL: 45k - 55k
๐ก Esperienza: 4+ anni
๐ Full Remote, con la disponibilitร di recarsi in sede a Rimini quando richiesto
๐ Tecnologie: C#, .NET, SQL, PostgreSQL, ReactGCP
๐ https://bit.ly/4y957Bi
2๏ธโฃ Senior Software Engineer - Datapizza
๐ธ RAL: 40k - 55k
๐ก Esperienza: 4+ anni
๐ Full Remote
๐ Tecnologie: Effect, Docker, Typescript, TanStack, AWS, Next.JS, Bun
๐ https://bit.ly/4h5NeOa
E se avete domande sulle posizioni, noi siamo qui! ๐
โค3
Un benchmark per capire se gli agenti sono davvero proattivi ๐ฏ
UniClawBench valuta gli agenti su task reali con un sistema a tre agenti: un executor, un supervisor nascosto e uno user agent che simula feedback multi-turno senza svelare i criteri di valutazione.
Dentro troverete:
๐ Executor agent: esegue il task richiesto
๐ Supervisor nascosto: valuta la qualitร senza essere visibile all'agente
๐ User agent: simula un utente reale con feedback multi-turno
๐ L'obiettivo: misurare la proattivitร , non solo l'esecuzione
Lo trovate qui ๐ https://arxiv.org/abs/2607.08768
UniClawBench valuta gli agenti su task reali con un sistema a tre agenti: un executor, un supervisor nascosto e uno user agent che simula feedback multi-turno senza svelare i criteri di valutazione.
Dentro troverete:
๐ Executor agent: esegue il task richiesto
๐ Supervisor nascosto: valuta la qualitร senza essere visibile all'agente
๐ User agent: simula un utente reale con feedback multi-turno
๐ L'obiettivo: misurare la proattivitร , non solo l'esecuzione
Lo trovate qui ๐ https://arxiv.org/abs/2607.08768
๐ฅ2
Inferenza LLM in tempo reale: il corso con Cerebras โก
DeepLearning.AI, in collaborazione con Cerebras, ha lanciato Fast LLM Inference with Cerebras: un corso per costruire applicazioni LLM che rispondono in tempo reale sfruttando il Wafer-Scale Engine (WSE-3).
Dentro troverete:
๐ L'hardware: come funziona l'inferenza sul chip Wafer-Scale di Cerebras
๐ I casi d'uso: applicazioni latency-sensitive come la personalizzazione live
๐ I workflow multi-tool: gestire piรน chiamate in tempo reale senza colli di bottiglia
๐ Gli insegnanti: un team di ingegneri Cerebras che condivide esempi pratici
๐ Il formato: corso breve, gratuito e diretto sui casi d'uso reali
Ecco a voi il link! ๐ https://www.deeplearning.ai/courses/fast-llm-inference-with-cerebras
DeepLearning.AI, in collaborazione con Cerebras, ha lanciato Fast LLM Inference with Cerebras: un corso per costruire applicazioni LLM che rispondono in tempo reale sfruttando il Wafer-Scale Engine (WSE-3).
Dentro troverete:
๐ L'hardware: come funziona l'inferenza sul chip Wafer-Scale di Cerebras
๐ I casi d'uso: applicazioni latency-sensitive come la personalizzazione live
๐ I workflow multi-tool: gestire piรน chiamate in tempo reale senza colli di bottiglia
๐ Gli insegnanti: un team di ingegneri Cerebras che condivide esempi pratici
๐ Il formato: corso breve, gratuito e diretto sui casi d'uso reali
Ecco a voi il link! ๐ https://www.deeplearning.ai/courses/fast-llm-inference-with-cerebras
โค4
Un nuovo paradigma per il ragionamento degli agenti ๐บ๏ธ
Il paper MAP (Map-then-Act) propone un approccio in due fasi per il ragionamento interattivo degli agenti su orizzonti lunghi: prima si costruisce una mappa dell'ambiente, poi si agisce sulla base di quella mappa.
Dentro troverete:
๐ Il problema: gli agenti perdono coerenza sui task che durano molti step
๐ La fase di mapping: costruzione esplicita di una rappresentazione dell'ambiente
๐ La fase di azione: decisioni prese sulla mappa invece che step-by-step alla cieca
๐ I test: valutazioni su scenari interattivi a orizzonte lungo
๐ I risultati: miglioramenti misurabili rispetto agli approcci reattivi classici
Lo trovate qui ๐ https://arxiv.org/abs/2605.13037
Il paper MAP (Map-then-Act) propone un approccio in due fasi per il ragionamento interattivo degli agenti su orizzonti lunghi: prima si costruisce una mappa dell'ambiente, poi si agisce sulla base di quella mappa.
Dentro troverete:
๐ Il problema: gli agenti perdono coerenza sui task che durano molti step
๐ La fase di mapping: costruzione esplicita di una rappresentazione dell'ambiente
๐ La fase di azione: decisioni prese sulla mappa invece che step-by-step alla cieca
๐ I test: valutazioni su scenari interattivi a orizzonte lungo
๐ I risultati: miglioramenti misurabili rispetto agli approcci reattivi classici
Lo trovate qui ๐ https://arxiv.org/abs/2605.13037
โค3
La guida IBM al prompt engineering, aggiornata al 2026 โ๏ธ
IBM ha aggiornato la sua guida al prompt engineering con tecniche pratiche per ottenere risposte piรน accurate dai modelli, incluso l'uso di RAG, summarization e input strutturati come il JSON.
Dentro troverete:
๐ RAG: come combinare prompt e retrieval per risposte piรน precise
๐ Structured input: usare JSON e schemi per guidare il modello
๐ Tecniche pratiche: esempi concreti applicabili da subito
๐ Risorse extra: repository GitHub con casi d'uso reali
La trovate qui ๐ https://www.ibm.com/think/prompt-engineering
IBM ha aggiornato la sua guida al prompt engineering con tecniche pratiche per ottenere risposte piรน accurate dai modelli, incluso l'uso di RAG, summarization e input strutturati come il JSON.
Dentro troverete:
๐ RAG: come combinare prompt e retrieval per risposte piรน precise
๐ Structured input: usare JSON e schemi per guidare il modello
๐ Tecniche pratiche: esempi concreti applicabili da subito
๐ Risorse extra: repository GitHub con casi d'uso reali
La trovate qui ๐ https://www.ibm.com/think/prompt-engineering
๐5โคโ๐ฅ3โค1๐ฏ1
Se in questo periodo state cercando nuove opportunitร , su Datapizza Jobs abbiamo due posizioni che potrebbero interessarvi! ๐
1๏ธโฃ AI Engineer (Team AI & GenAI Development) in Generali
๐ธ RAL: 47k-53k
๐ก Esperienza: 3-5 anni
๐ Ibrido su Milano
๐ Tecnologie: Computer Vision, Python, Inglese, PyTorch, LangChain, GenAI, Agenti, AWS, MLOps
๐ https://bit.ly/4cBTTNy
2๏ธโฃ Process Analyst in Easynet Group
๐ธ RAL: 30k-35k
๐ก Esperienza: 1-2 anni
๐ Ibrido a Lecco
๐ Tecnologie: Data Analysis, Databases, Strumenti BI, SQL, SAP, AI
๐ https://bit.ly/4y5LuLb
E se avete domande sulle posizioni, noi siamo qui! ๐
1๏ธโฃ AI Engineer (Team AI & GenAI Development) in Generali
๐ธ RAL: 47k-53k
๐ก Esperienza: 3-5 anni
๐ Ibrido su Milano
๐ Tecnologie: Computer Vision, Python, Inglese, PyTorch, LangChain, GenAI, Agenti, AWS, MLOps
๐ https://bit.ly/4cBTTNy
2๏ธโฃ Process Analyst in Easynet Group
๐ธ RAL: 30k-35k
๐ก Esperienza: 1-2 anni
๐ Ibrido a Lecco
๐ Tecnologie: Data Analysis, Databases, Strumenti BI, SQL, SAP, AI
๐ https://bit.ly/4y5LuLb
E se avete domande sulle posizioni, noi siamo qui! ๐
Quanto reggono gli agenti AI in piรน lingue? ๐ฌ
PolyWorkBench รจ un nuovo benchmark che mette alla prova gli agenti LLM su task lunghi e complessi in contesti multilingue, un'area ancora poco esplorata rispetto alle valutazioni solo in inglese.
Dentro troverete:
๐ Il gap: la maggior parte dei benchmark per agenti valuta solo in inglese
๐ Il formato: task realistici a orizzonte lungo in piรน lingue
๐ I modelli testati: confronto tra i principali agenti LLM frontier
๐ I risultati: cali di performance significativi fuori dall'inglese
๐ L'utilitร : un punto di riferimento per chi sviluppa agenti globali
La trovate qui ๐ https://arxiv.org/abs/2607.06008
PolyWorkBench รจ un nuovo benchmark che mette alla prova gli agenti LLM su task lunghi e complessi in contesti multilingue, un'area ancora poco esplorata rispetto alle valutazioni solo in inglese.
Dentro troverete:
๐ Il gap: la maggior parte dei benchmark per agenti valuta solo in inglese
๐ Il formato: task realistici a orizzonte lungo in piรน lingue
๐ I modelli testati: confronto tra i principali agenti LLM frontier
๐ I risultati: cali di performance significativi fuori dall'inglese
๐ L'utilitร : un punto di riferimento per chi sviluppa agenti globali
La trovate qui ๐ https://arxiv.org/abs/2607.06008
โคโ๐ฅ1