The Pulse
Vals raccoglie 40 milioni di dollari per creare un nuovo standard di valutazione comparativa dell’IA
Vals ha raccolto 40 milioni di dollari in un round di serie A guidato da Andreessen Horowitz per ampliare le valutazioni private e specifiche per settore dei modelli di IA. La startup di San Francisco testa i sistemi su compiti legali, fina

AI.info Team ·
«Quello che stiamo facendo è guardare a quali sono gli impatti reali dei modelli.»
Rayan Krishnan, cofondatore, Vals
Vals ha raccolto 40 milioni di dollari in un round di serie A guidato da Andreessen Horowitz, portando una giovane società di valutazione dell’IA al centro di un dibattito sempre più acceso su come misurare le prestazioni dei modelli. La startup di San Francisco sostiene che i test accademici pubblici non siano più una guida affidabile per stabilire se un sistema di IA è in grado di svolgere il lavoro professionale che le aziende vogliono automatizzare.
Fondata nel 2024, Vals mantiene privati i materiali dei test e valuta i modelli su compiti tratti da settori come il diritto, la finanza e lo sviluppo software. L’annuncio del finanziamento è arrivato il 13 agosto 2026, mentre la strategia più ampia di valutazione comparativa dell’azienda è stata illustrata in un’intervista pubblicata da TechCrunch il 19 settembre.
I test pubblici sono sempre più facili da ottimizzare
Rayan Krishnan, cofondatore di Vals di 25 anni, ha raccontato a TechCrunch che l’azienda è nata dalla sua convinzione che i benchmark accademici non tenessero il passo con lo sviluppo dei modelli. «Vedevamo arrivare sul mercato rapidamente molti nuovi modelli molto capaci, e i benchmark accademici [non] tenevano il passo con i progressi di frontiera», ha detto Krishnan.
Secondo Vals, gli insiemi di test disponibili pubblicamente creano un problema di misurazione di fondo. Quando le domande di un benchmark finiscono nei dati di addestramento o diventano obiettivi di ottimizzazione dei modelli, un punteggio elevato può dire meno sulle capacità generali e più sulla familiarità con l’esame. Per questo l’azienda non divulga i materiali specifici usati nelle valutazioni che pubblica, pur fornendo descrizioni dei compiti e dei settori coperti.
Andreessen Horowitz ha sostenuto una tesi simile nel suo annuncio dell’investimento, affermando che gli insiemi di dati pubblici possono diventare saturi, finire nei corpora di addestramento o diventare obiettivi di ottimizzazione esplicita. La società ha dichiarato che Vals verifica se un modello giuridico è in grado di svolgere ricerche legali, se un modello finanziario può analizzare documenti complessi e se un modello di programmazione può realizzare un’applicazione funzionante.
Dai punteggi all’esame di abilitazione ai prodotti del lavoro
L’approccio di Vals si concentra sul risultato di un compito, anziché sulle prestazioni di un modello in un esame di cultura generale. «Storicamente, penso che le valutazioni siano state fatte per misurare l’intelligenza in modo molto astratto», ha detto Krishnan a TechCrunch. «Per esempio, i modelli dispongono di informazioni sufficienti per affrontare un esame come quello di abilitazione alla professione forense?»
L’azienda si chiede invece se un sistema sia in grado di produrre un lavoro paragonabile a quello di un professionista umano. Il catalogo pubblico dei benchmark include valutazioni per la ricerca giuridica, l’analisi finanziaria, il lavoro fiscale, l’amministrazione sanitaria, l’ingegneria del software e la matematica formale. Il sito elenca anche test per la cybersicurezza, i giochi, i sussidi pubblici, la trascrizione vocale e la ricerca scientifica.
Le voci più recenti mostrano quanto Vals stia ampliando la propria attività oltre i tradizionali test di domande e risposte. La pagina dei benchmark elenca il Vals RSI Index, aggiornato il 18 settembre, per valutare se un modello è in grado di condurre ricerche che contribuiscano alla creazione del modello successivo. Altre valutazioni recenti esaminano il reverse engineering di binari, le indagini agentiche in biologia, l’individuazione di vulnerabilità di sicurezza, lo sviluppo di applicazioni web e il lavoro autonomo all’interno di un programma spaziale simulato.
Un esaminatore privato con conseguenze pubbliche
Le aziende pagano Vals per valutare i propri modelli; Krishnan paragona questo modello di business al pagamento del College Board da parte degli studenti per sostenere il SAT. Il valore, sostiene, consiste nell’individuare le debolezze che gli sviluppatori possono correggere prima che un sistema arrivi ai clienti o venga usato in un contesto ad alto rischio.
Vals afferma che la propria infrastruttura di valutazione può raccogliere criteri da esperti del settore e sottoporre a test un gran numero di modelli. La metodologia indica anche l’incertezza: i benchmark eseguiti una sola volta usano l’errore standard sui punteggi dei singoli casi, mentre alcuni test selezionati eseguiti più volte calcolano l’incertezza tra esecuzioni indipendenti. L’azienda dichiara che queste stime dell’errore non tengono conto di tutte le fonti di variazione, comprese le modifiche ai prompt, alle condizioni di distribuzione o alla generazione dei modelli.
Questo accordo comporta un compromesso. I test privati riducono il rischio che i modelli siano stati addestrati sulle domande, ma gli esterni non possono esaminare l’intero insieme di test né riprodurre in modo indipendente ogni risultato. La credibilità di Vals dipenderà quindi non solo dalla difficoltà dei suoi compiti, ma anche dalla fiducia che sviluppatori di modelli, acquirenti e ricercatori riporranno nei suoi metodi e nei suoi resoconti.
Ricavi moltiplicati per otto e un programma federale
TechCrunch ha riferito che i ricavi di Vals sono ora otto volte superiori a quelli dello scorso anno. L’azienda ha iniziato il 2026 con otto dipendenti e a settembre era arrivata a 25, con l’intenzione di trasferirsi in un ufficio più grande e assumere altre 10-15 persone.
Vals ha anche avviato un programma per fornire valutazioni dei modelli alle agenzie federali. L’ambito dichiarato va oltre la misurazione dei risultati utili: Krishnan ha detto che l’azienda sta lavorando a valutazioni che riguardano la salute mentale, la cybersicurezza, la biosicurezza e il diritto dei conflitti armati, oltre a un benchmark che esamina l’auto-miglioramento ricorsivo.
Questi progetti riflettono la tesi più ampia dell’azienda: la valutazione dovrebbe misurare sia ciò che un sistema di IA è in grado di fare, sia il modo in cui potrebbe fallire se impiegato in contesti dalle conseguenze rilevanti. «Sono in grado di svolgere un lavoro che produca un risultato della stessa qualità di quello di un essere umano in ogni settore?», ha detto Krishnan.
La prova che Vals deve superare in prima persona
L’investimento di Andreessen Horowitz fornisce a Vals i fondi per ampliare il catalogo di valutazioni e vendere più test agli sviluppatori di modelli e agli acquirenti istituzionali. I dati di crescita dell’azienda suggeriscono che la domanda è in aumento, mentre le imprese confrontano i sistemi in vista degli acquisti, anziché considerare i punteggi dei benchmark un esercizio puramente tecnico.
La sfida più difficile è affermarsi come autorità. Un benchmark che resta privato può evitare la contaminazione, ma la sua credibilità dipende dal processo dell’esaminatore, dalla qualità degli esperti che lo valutano e dalla chiarezza delle prove pubblicate. Vals chiede ora al mercato di accettare che i suoi test riservati siano una guida migliore alle prestazioni dell’IA rispetto agli esami pubblici che intendono sostituire.