Vai al contenuto
AI.info

The Pulse

OpenAI lancia MentalHealthBench, sviluppato con oltre 80 professionisti

OpenAI afferma che il suo benchmark open valuta le risposte dell’IA a conversazioni realistiche sulla salute mentale, con criteri di valutazione elaborati insieme a oltre 80 esperti abilitati.

OpenAI lancia MentalHealthBench, sviluppato con oltre 80 professionisti

AI.info Team ·

«La salute mentale si colloca lungo un continuum che va dal benessere allo stress quotidiano fino alle crisi acute. I sistemi di IA che interagiscono con le persone in tutte queste situazioni devono basarsi sia sulla scienza clinica sia sull’esperienza vissuta: non solo per riconoscere dove si colloca una persona lungo il continuum, ma anche per sapere come rispondere in modo appropriato in ogni circostanza.»

Dr. Arthur Evans, amministratore delegato dell’American Psychological Association

OpenAI testa più delle sole risposte alle crisi

Il 23 settembre OpenAI ha pubblicato MentalHealthBench, descrivendolo come un benchmark open per valutare le risposte dell’IA a conversazioni realistiche sulla salute mentale. Secondo l’azienda, i test esistenti si concentrano spesso sulle emergenze e su regole generali di sicurezza, offrendo meno visibilità su come i sistemi gestiscono preoccupazioni comuni, come le relazioni, lo stress e il sostegno emotivo. MentalHealthBench mira a valutare questi scambi ordinari insieme alle situazioni di grave sofferenza e alle emergenze che richiedono interventi urgenti per la sicurezza.

Il benchmark contiene 1.215 conversazioni sintetiche, create con metodi che tutelano la privacy e concepite per rispecchiare schemi d’uso reali dell’IA. Gli scenari riguardano adulti, adolescenti, caregiver e professionisti della salute mentale e includono più lingue e contesti culturali. OpenAI afferma che il benchmark è a disposizione dei ricercatori, che possono esaminarlo, eseguirlo e svilupparlo ulteriormente.

I criteri di valutazione sono elaborati dai professionisti della salute mentale

Oltre 80 psicologi e psichiatri abilitati, provenienti da 22 Paesi, hanno contribuito allo sviluppo del benchmark. Il gruppo parla 19 lingue e rappresenta quasi 20 specialità nell’ambito della salute mentale. Per ogni conversazione, gli esperti formulano criteri ponderati per valutare la risposta di un modello all’ultimo messaggio dell’utente: i pesi positivi premiano i comportamenti utili, mentre quelli negativi penalizzano i comportamenti dannosi.

Almeno tre esperti esaminano i criteri relativi a ciascuna conversazione. OpenAI afferma di mantenere i criteri sostenuti da almeno due esperti e non contestati da un terzo. La rubrica risultante può premiare azioni specifiche, come porre una domanda di approfondimento pertinente, e penalizzare le risposte che fanno supposizioni sui sentimenti dell’utente o lo spingono a prendere una decisione.

GPT-6 Astra ottiene 57,3 nel benchmark

OpenAI riporta un punteggio con limite per attività di 57,3 per GPT-6 Astra, il risultato complessivo più alto nel confronto pubblicato dall’azienda. GPT-6 Sol ottiene 53,9, Claude Opus 5.5 ottiene 52,4 e GPT-4o di marzo 2025 ottiene 32,1. Questi valori misurano le prestazioni rispetto ai criteri ponderati del benchmark; non sono tassi di esito clinico né misure dell’efficacia dei trattamenti.

OpenAI usa GPT-5.6 Sol come valutatore automatico. L’articolo di ricerca afferma che l’azienda campiona quattro risposte per ciascuna attività e chiede al valutatore di esaminarle sulla base dei criteri degli esperti. Questo approccio consente al benchmark di applicare criteri coerenti a molti modelli, ma significa anche che i risultati riportati dipendono in parte da un giudice basato sull’IA, chiamato a stabilire se una risposta soddisfa ciascun criterio.

Il dataset comprende tre livelli di urgenza: il 53,5% delle conversazioni non è acuto, il 18,2% è ad alta intensità e il 28,3% riguarda emergenze. Gli adolescenti rappresentano il 21,2% degli esempi, mentre gli adulti ne costituiscono il 68,1%; la parte restante riguarda caregiver e professionisti della salute mentale. OpenAI avverte che la composizione degli scenari è stata scelta per la valutazione e non rappresenta la frequenza con cui questi temi emergono su ChatGPT.

Le preferenze degli utenti e le indicazioni cliniche divergono

OpenAI ha inoltre confrontato le valutazioni degli esperti con i commenti di 44 adulti in 16 Paesi che avevano usato l’IA per ricevere sostegno emotivo o sulla salute mentale. La valutazione degli utenti ha riguardato solo conversazioni non acute. I partecipanti hanno dato maggiore importanza ai passi pratici successivi e al tono, mentre gli esperti hanno più spesso privilegiato la raccolta di informazioni contestuali e l’interpretazione prudente delle situazioni ambigue.

La distinzione è importante perché una risposta che sembra utile a un utente può comunque omettere misure di sicurezza o basarsi su supposizioni che un professionista della salute mentale respingerebbe. Nell’articolo, OpenAI descrive MentalHealthBench come una valutazione delle risposte all’ultimo turno di una conversazione sintetica, non come un test dell’assistenza continuativa o degli esiti sanitari nel mondo reale. I valori offrono quindi un confronto strutturato del comportamento dei modelli in scenari definiti, non la prova che un sistema possa sostituire la terapia o l’assistenza professionale.

Fonte

Esplora

Altri articoli