The Pulse
AllSpark presenta gli agenti di ricerca Iris con pesi aperti
La scheda del modello Iris-mini di AllSpark Research descrive un agente di ricerca con pesi aperti da 35B parametri, mentre il paper di accompagnamento su arXiv illustra i metodi di addestramento e valutazione.

AI.info Team ·
AllSpark Research ha rilasciato Iris-mini, un agente di ricerca open-weight progettato per ricerche sul web lunghe e articolate in più passaggi. La scheda del modello su Hugging Face indica un modello fratello maggiore, Iris-pro, e rimanda a un sistema di valutazione e al repository del progetto. Un articolo inviato ad arXiv il 3 settembre 2026, «Iris: scalare le vette della ricerca», descrive la costruzione dei dati, la procedura di addestramento e la configurazione di valutazione dei modelli.
Iris-mini è stato sottoposto a post-addestramento a partire da Qwen3.6-35B-A3B. La scheda del modello indica 35 miliardi di parametri totali e 3 miliardi di parametri attivi, con 256 esperti e otto esperti attivi. Ha una finestra di contesto di 256.000 token, usa la precisione bfloat16 ed è disponibile con licenza Apache 2.0. Iris-pro è indicato come un modello 397B-A17B.
Due modelli Iris puntano a ricerche web lunghe
La scheda del modello descrive la ricerca come un ciclo in cui un agente decide cosa cercare, legge i risultati, stabilisce se proseguire e si ferma quando dispone di prove sufficienti. Afferma che Iris viene addestrato attraverso cicli alternati di fine-tuning supervisionato e reinforcement learning.
L’articolo fornisce ulteriori dettagli su questa descrizione. Gli autori affermano di costruire domande multi-hop a partire dalla struttura dei collegamenti ipertestuali di un corpus web, riscrivere le entità che non costituiscono la risposta trasformandole in riferimenti descrittivi e ammettere le domande a cui un modello di riferimento non riesce a rispondere senza prove a supporto. Creano e filtrano quindi traiettorie di ricerca prima del fine-tuning supervisionato, e ottimizzano la policy con il reinforcement learning basato sulla ricerca in tempo reale.
L’articolo definisce la procedura alternata SFT-RL climbing. In questo processo, le traiettorie difficili risolte e i rollout efficienti di un ciclo di reinforcement learning confluiscono in un successivo passaggio di addestramento supervisionato.
Ziyuan Liu, primo autore indicato dell’articolo, e gli otto coautori descrivono così la configurazione di valutazione:
«Tutti i risultati provengono da un singolo agente ReAct, senza sottoagenti e senza verifiche in fase di test.»
Questa configurazione è importante perché, nei compiti di ricerca lunghi, i risultati possono variare sensibilmente a seconda di come vengono gestiti il contesto accumulato e i tentativi non riusciti.
Iris-mini raggiunge 82,2 su BrowseComp
Con l’impostazione predefinita di gestione del contesto discard-all, Iris-mini ottiene 82,2 su BrowseComp, 84,8 su BrowseComp-ZH, un punteggio F1 di 86,9 su DeepSearchQA e 52,3 sul sottoinsieme di Humanity’s Last Exam composto da 2.158 domande di solo testo, secondo la scheda del modello. BrowseComp, BrowseComp-ZH e Humanity’s Last Exam sono riportati come misure di accuratezza.
La scheda confronta Iris-mini con sistemi open-weight nella fascia da 30 a 35 miliardi di parametri. Indica Iris-mini davanti agli altri sistemi citati su BrowseComp, BrowseComp-ZH e Humanity’s Last Exam. XYZ-Aquila-mini ha il punteggio riportato più alto su DeepSearchQA: 89,5, contro l’86,9 di Iris-mini. La scheda afferma che i punteggi dei sistemi di confronto provengono dai loro report pubblici e possono basarsi sui rispettivi metodi di gestione del contesto.
L’articolo riporta punteggi più alti per Iris-pro: 88,6 su BrowseComp, 85,1 su BrowseComp-ZH, 92,9 su DeepSearchQA e 56,4 su Humanity’s Last Exam. Definisce entrambi i modelli Iris i più forti agenti di ricerca open source nelle rispettive fasce di parametri, considerando questi quattro benchmark.
Il ripristino del contesto spiega una parte consistente dei miglioramenti
AllSpark riporta i risultati di Iris-mini con diverse impostazioni di gestione del contesto. Senza gestione del contesto, la scheda del modello indica punteggi di 64,7 su BrowseComp, 72,3 su BrowseComp-ZH, 81,0 su DeepSearchQA e 43,2 su Humanity’s Last Exam.
Con discard-all, la conversazione viene ripristinata alla domanda iniziale quando il prompt supera una soglia. Questa impostazione porta il punteggio riportato su BrowseComp a 82,2. Un metodo distinto, retry, riavvia un episodio che termina senza una risposta analizzabile, mantenendo un breve riepilogo di ciò che è già stato escluso. L’uso combinato dei due metodi produce un punteggio di 85,9 su BrowseComp, anche se AllSpark indica discard-all come impostazione principale anche quando retry dà un risultato più alto.
Il rilascio include una procedura di valutazione locale
La scheda del modello Iris-mini fornisce istruzioni per eseguire il modello con SGLang e valutarlo con Iris-Harness. L’esempio specifica il parallelismo tensoriale a quattro vie, una lunghezza del contesto di 262.144 token, i parser di Qwen per il ragionamento e le chiamate agli strumenti, e un endpoint locale compatibile con OpenAI.
La scheda afferma che il modello è addestrato a chiamare strumenti tramite l’interfaccia di function calling di OpenAI e a racchiudere le risposte finali in \boxed{}. Aggiunge che il ragionamento precedente viene riportato nella conversazione a ogni turno e che la configurazione del sistema di valutazione supporta la soglia di scarto del contesto pubblicata.
Pesi aperti, ma non un servizio di ricerca pronto all’uso
I pesi di Iris-mini sono disponibili con licenza Apache 2.0, insieme alle istruzioni per l’esecuzione locale. La pagina su Hugging Face dichiara che il modello non è distribuito da un Inference Provider, lasciando agli utenti il compito di gestire autonomamente un’infrastruttura compatibile. Il rilascio offre quindi ai ricercatori sia il modello sia una procedura documentata per verificare in che modo il ciclo di ricerca e le impostazioni di gestione del contesto influiscano sulle prestazioni riportate.