Vai al contenuto
AI.info

Ricerca

La competizione PNPL del 2026: classificazione delle parole e generalizzazione efficiente tra soggetti in LibriBrain100

L’obiettivo della competizione PNPL del 2025 (Landau et al., 2025) era avviare un percorso pluriennale per la decodifica non invasiva del parlato. Concepita per passare dai compiti fondamentali alla c

La competizione PNPL del 2026: classificazione delle parole e generalizzazione efficiente tra soggetti in LibriBrain100
arXiv
2609.03231
Pubblicato
2026-09-03
Autori
Francesco Mantegna, Gereon Elvers, Dulhan Jayalath, Gilad Landau, Tasha Kim, Miran Özdogan, Luisa Kurth, Teyun Kwon, SungJun Cho, Benjamin Ballyk, Alex Fung, Anna Greer, Pratik Somaiya, Christian Herff, Yorguin Mantilla Ramos, Hamza Abdelhedi, Karim Jerbi, Greg Farquhar, Brendan Shillingford, Mark Woolrich, Oiwi Parker Jones

Abstract degli autori

L’obiettivo della competizione PNPL del 2025 (Landau et al., 2025) era avviare un percorso pluriennale per la decodifica non invasiva del parlato. Concepita per passare dai compiti fondamentali alla complessità linguistica necessaria per un’interfaccia cervello-computer (BCI) utilizzabile nella pratica, la competizione ha preso avvio con compiti di rilevamento del parlato e classificazione dei fonemi. Le proposte vincitrici hanno raggiunto punteggi F1-macro rispettivamente del 95,6% e del 73,6% nei due compiti (Elvers et al., 2026), segnando progressi molto significativi. Questo successo si è basato sul dataset LibriBrain (Özdogan et al., 2025), all’epoca il più grande dataset MEG raccolto su un singolo soggetto, con ${\sim}50$ ore di dati. Tuttavia, se una grande quantità di dati raccolti su un singolo soggetto consente prestazioni elevate nella decodifica, una BCI utilizzabile nella pratica deve generalizzare a nuovi utenti con minuti di dati, non ore. La competizione PNPL del 2026 affronta questa sfida con LibriBrain100 (Mantegna et al., 2026), una versione ampliata del dataset LibriBrain che comprende 32 soggetti aggiuntivi (${\sim}40$ minuti ciascuno) e una quantità ancora maggiore di dati raccolti su un singolo soggetto (${\sim}80$ ore). Facendo avanzare il percorso dei compiti verso la classificazione delle parole, la competizione presenta due categorie complementari: la categoria Deep punta alla classificazione delle parole su larga scala all’interno di un singolo soggetto, con l’obiettivo di ottenere le migliori prestazioni possibili; la categoria Broad punta alla generalizzazione tra soggetti, riducendo progressivamente la quantità di dati di fine-tuning specifici per ciascun soggetto da ${\sim}40$ a ${\sim}20$ e poi a ${\sim}10$ minuti. Quest’ultima durata rientra in un intervallo clinicamente praticabile e ci avvicina di un passo a una BCI non invasiva capace di restituire la capacità di comunicare alle persone che vivono con una paralisi profonda.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv