DeepSeek: panoramica e novità introdotte da DeepSeekV3 e R1

Locandina dell'evento

Iscriviti al corso di formazione gratuito promosso da EuroCC Italy e approfondisci DeepSeekV3 e R1.

EuroCC Italy propone un nuovo appuntamento di approfondimento tecnico rivolto a ricercatori, sviluppatori e professionisti dell’innovazione digitale: il webinar “DeepSeek: panoramica e novità introdotte da DeepSeekV3 e R1”, in programma venerdì 23 maggio dalle 15:00 alle 16:00, con la partecipazione di Laura Cavalli, HPC Technology Specialist presso Cineca.

L’incontro offrirà una panoramica tecnica ed evolutiva di uno dei progetti più ambiziosi del panorama attuale dell’Intelligenza Artificiale: DeepSeek, piattaforma che combina sofisticati modelli di language understanding, reasoning e generative AI, con una particolare attenzione all’efficienza computazionale e alla scalabilità.

DeepSeek: panoramica e novità introdotte da DeepSeekV3 e R1

Venerdì 23 maggio 2025, ore 15:00 – 16:00
Speaker: Laura Cavalli, HPC Researcher – CINECA
Modalità: Online – su iscrizione gratuita
Iscrizioni aperte sul form dedicato.

Cos’è DeepSeek e perché è rilevante

DeepSeek è una suite di modelli AI sviluppata con l’obiettivo di raggiungere elevate capacità di comprensione e generazione linguistica, mantenendo al contempo prestazioni competitive sul piano computazionale. L’iniziativa si inserisce nel crescente filone di ricerca sui modelli LLM (Large Language Models) e MoE (Mixture of Experts), contribuendo in modo significativo all’evoluzione dei sistemi di intelligenza artificiale conversazionale e cognitiva.

Le soluzioni proposte da DeepSeek non solo puntano a migliorare le prestazioni dei modelli linguistici in scenari complessi di ragionamento multi-turno, ma introducono importanti innovazioni architetturali che rendono l’addestramento e l’esecuzione più accessibili, in particolare su larga scala.

DeepSeek V3: le principali innovazioni introdotte

Durante il webinar sarà analizzato nel dettaglio il modello base DeepSeek V3, che introduce quattro componenti tecniche di grande rilievo:

  • Addestramento in FP8 mixed precision. L’uso della mixed precision a 8 bit (FP8) rappresenta un’innovazione significativa nel campo dell’AI training. Questa tecnica consente di ottimizzare le risorse computazionali e di ridurre i tempi di addestramento, mantenendo una buona stabilità numerica. DeepSeekV3 è tra i primi modelli open source a dimostrare risultati robusti con questo approccio.
  • Architettura DeualPipe. L’architettura DualPipe introduce una gestione parallela dell’elaborazione sequenziale e contestuale, separando il flusso informativo in due pipeline indipendenti ma comunicanti. Questo design permette una migliore interpretazione delle dipendenze logiche e semantiche, migliorando la qualità delle risposte generate.
  • Approccio DeepSeekMoE. DeepSeekMoE si basa sull’ormai consolidato paradigma Mixture of Experts, ma lo reinterpreta con una logica più flessibile e dinamica. Grazie all’attivazione selettiva dei “blocchi esperti”, è possibile ridurre il carico computazionale mantenendo elevate capacità predittive. Questo approccio risponde alla crescente esigenza di modelli più leggeri, modulari e personalizzabili.
  • Multi Layer Latent Attention. Il meccanismo di Multi Layer Latent Attention rappresenta una novità assoluta nell’ambito delle reti transformer. Si tratta di un sistema che consente ai livelli più profondi della rete di modulare l’attenzione non solo su base sequenziale, ma anche latente, agendo quindi su rappresentazioni semantiche più astratte. Il risultato è una maggiore coerenza nei testi generati, soprattutto nei contesti di ragionamento complesso.

DeepSeek R1: verso una nuova generazione di modelli di Reasoning

A completare la panoramica, il webinar introdurrà anche DeepSeek R1, modello progettato specificamente per task di reasoning avanzato. A differenza degli LLM tradizionali, R1 si focalizza sulla capacità di eseguire deduzioni, inferenze logiche e multi-hop question answering, avvicinandosi a una forma di “intelligenza argomentativa” sempre più sofisticata.

Questo modello si colloca in una tendenza più ampia che punta alla combinazione tra apprendimento linguistico e strutture logiche, e costituisce un importante passo in avanti verso agenti AI più affidabili in ambiti critici, dalla medicina alla giustizia, passando per la ricerca scientifica.

Perché partecipare

Il webinar rappresenta un’occasione unica per:

  • Approfondire le novità di uno dei modelli più avanzati attualmente disponibili
  • Capire come l’efficienza computazionale si integri con l’evoluzione architetturale
  • Esplorare i trend emergenti nei modelli di reasoning e LLM open source
  •  Interagire con esperti di AI applicata e infrastrutture HPC

Iscrizioni aperte

La partecipazione è gratuita previa iscrizione via form dedicato.