Ricerca
Verso un risolutore matematico deterministico per i modelli linguistici clinici
I modelli linguistici di grandi dimensioni non sono affidabili nei calcoli aritmetici, un problema per i calcolatori clinici, nei quali un solo errore numerico cambia la raccomandazione. La risposta a

- arXiv
- 2609.10728
- Pubblicato
- 2026-09-09
- Autori
- Felipe Ocampo Osorio, Sebastián Andrés Cajas Ordoñez, Maximin Lange, Rafi Al Attrach, Sahil Kapadia, Zakaria Laouabdia Sellami, Angelo Antonio Talio, Leo Anthony Celi
Abstract degli autori
I modelli linguistici di grandi dimensioni non sono affidabili nei calcoli aritmetici, un problema per i calcolatori clinici, nei quali un solo errore numerico cambia la raccomandazione. La risposta abituale è codificare ogni calcolatore come funzione validata, uno alla volta. Mettiamo alla prova un’alternativa: il modello non esegue i calcoli. Scrive invece codice Python specifico per ciascun caso, che un esecutore locale con restrizioni esegue come risolutore deterministico; il compito del modello si riduce a decidere come usarlo. Valutiamo questa interfaccia Program-Solve su MedCalc-Bench Verified (1.100 casi, 55 calcolatori), confrontandola con i calcoli aritmetici eseguiti direttamente dal modello e con una libreria di 22 calcolatori scritta manualmente. Usiamo Qwen2.5-7B e Qwen2.5-32B-AWQ, dopo aver verificato le formule del benchmark rispetto alle linee guida cliniche attuali e aver segnalato criticità relative alla versione, all’uso o ai coefficienti per 16 dei 55 calcolatori. Quando vengono fornite le formule e le variabili di riferimento ed entrambi gli approcci leggono l’intera nota, affidare i calcoli al risolutore non offre un vantaggio affidabile a 7B (75,31% contro 72,02%, una differenza appaiata di +3,29 punti con un intervallo al 95% per cluster di calcolatori di [-3,49, 10,38]), ma lo offre a 32B (90,53% contro 83,47%, +7,05 [0,47, 14,60], con un intervallo che non comprende lo zero). La libreria scritta manualmente è esatta nei 440 casi che supporta, ma si astiene negli altri (40,0% complessivo). Aggiungere un esecutore aiuta dunque alcuni modelli a pesi aperti più di altri, anche a parità di accesso alle formule, alle variabili e alla nota; in ogni caso, non sostituisce né formule verificate né un’estrazione affidabile delle variabili.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv