Webinar: Language modeling per lingue a risorse limitate

Il 11 giugno dalle 10:00 alle 11:00 si terrà un webinar esclusivo con il relatore Marek Dobeš dedicato al tema del language modeling per lingue a risorse limitate, organizzato dai Centri Nazionali di Competenza per l’HPC in Slovacchia e Italia.

L’emergere dei grandi modelli linguistici (LLM), come GPT e LLaMA, ha evidenziato una sfida importante: la scarsità di dati per lingue meno diffuse, tra cui lo slovacco. Questo limita la qualità dei modelli di intelligenza artificiale per queste lingue. Il nostro progetto punta a superare questo limite grazie a strategie innovative e avanzate, con il supporto del supercomputer Leonardo, uno dei più potenti in Europa.

Le strategie chiave del progetto includono:

  • Generazione di dataset bilingue slovacco-inglese: traduzione automatica assistita da LLaMA 3.3 70B Instruct per creare dataset di alta qualità per l’addestramento di modelli linguistici.

  • Sintesi automatica di testi scientifici in slovacco: usando Gemini Flash Experimental e il database PLOS, vengono prodotti riassunti di articoli scientifici, potenziando la terminologia specialistica nei modelli.

  • Arricchimento del contesto culturale slovacco: sviluppo di dataset specifici per migliorare la comprensione di temi culturali e contestuali della Slovacchia, ancora poco trattati dai modelli esistenti come ChatGPT.

Il progetto sfrutta la potenza computazionale del supercomputer slovacco Devana e del supercomputer Leonardo in Italia per addestrare modelli linguistici di nuova generazione, migliorando così l’accuratezza e la rilevanza culturale degli LLM in slovacco.

Anche se il focus è sullo slovacco, i metodi sviluppati sono applicabili a molte altre lingue a risorse limitate nel mondo. Il progetto invita collaboratori internazionali a unirsi per promuovere la cooperazione europea nel calcolo ad alte prestazioni e favorire un’intelligenza artificiale più inclusiva e multilingue.

Partecipa al webinar per scoprire come la combinazione di supercalcolo e innovazione linguistica può aprire nuove frontiere per lo sviluppo di modelli linguistici per lingue poco rappresentate!

Link per partecipare