Ricerca
sk-bench: un benchmark che privilegia i dati nativi per valutare i modelli linguistici di grandi dimensioni in slovacco
I benchmark multilingue per gli LLM omettono lo slovacco, una lingua slava occidentale dalla morfologia ricca, parlata da cinque milioni di persone, oppure lo includono soltanto tramite traduzione aut

- arXiv
- 2610.09152
- Pubblicato
- 2026-10-06
- Autori
- Marek Šuppa, Ivan Vykopal, Andrej Ridzik, Kristián Sopkovič, Natália Kňažeková, Jaroslav Kopčan, Miroslav Blšták, Viktória Ondrejová, Daniel Hládek, Michal Gregor, Martin Tamajka, Marián Šimko
Abstract degli autori
I benchmark multilingue per gli LLM omettono lo slovacco, una lingua slava occidentale dalla morfologia ricca, parlata da cinque milioni di persone, oppure lo includono soltanto tramite traduzione automatica. Presentiamo sk-bench, un benchmark per lo slovacco che privilegia i dati nativi e comprende 30 dataset (33 varianti di attività con punteggio) in dieci categorie di competenze. Introduciamo undici risorse nuove o raccolte per la prima volta per valutare gli LLM generativi, tra cui IFEval-SK, con strumenti di verifica delle istruzioni adattati allo slovacco, e le risorse native Chiby/SKJ1 per la grammatica e la morfologia slovacche. Valutiamo 55 modelli con pesi aperti e chiusi usando un’unica infrastruttura di valutazione. Il miglior modello con pesi aperti è indietro di 12,6 punti rispetto alle API proprietarie. Le classifiche dei modelli sono simili sui dati a risposta chiusa nativi e tradotti ($ρ\geq0.98$), anche se la traduzione distingue meno bene i modelli più forti. Le domande di tipo domanda-risposta scritte da persone e quelle generate da LLM, invece, producono classifiche diverse ($ρ=0.72$). Per Qwen3-14B, l’ulteriore preaddestramento in slovacco riduce il punteggio complessivo di 13,9 punti. Un piccolo insieme di istruzioni recupera tre quarti di questa perdita. Il ragionamento durante il test migliora i punteggi di 8,5–12,5 punti per i modelli da 9B in su. Nel complesso, questi risultati suggeriscono quattro indicazioni per la progettazione in altre lingue con poche risorse: usare dati nativi dove la traduzione non funziona, pianificare il recupero della capacità di seguire le istruzioni dopo l’adattamento linguistico, abilitare il ragionamento durante il test prima di aumentare la scala dei modelli ed evitare di investire troppo nei prompt nella lingua di destinazione. Rendiamo disponibili i dati e il codice all’indirizzo https://github.com/slovak-nlp/sk-bench
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv