Vai al contenuto
AI.info

The Pulse

AWS pubblica 38 competenze open source per agenti di IA in ambito sanitario

AWS ha pubblicato 38 competenze open source per agenti, che coprono 11 ambiti della sanità e delle scienze della vita. L’azienda afferma che, nelle valutazioni comparative dirette, gli agenti dotati di competenze hanno prevalso fino all’85,

AWS pubblica 38 competenze open source per agenti di IA in ambito sanitario

AI.info Team ·

AWS afferma che il suo nuovo pacchetto di IA per la sanità ha migliorato le prestazioni degli agenti in fino all’85,9% dei confronti diretti, dopo aver aggiunto 38 competenze open source ad agenti testati su 410 prompt specifici per dominio. La raccolta punta a una debolezza specifica dei sistemi basati su modelli fondazionali: produrre risposte che citano il quadro medico o scientifico corretto, ma ne applicano le regole in modo errato.

Michael Hsieh, principal GenAI specialist solutions architect di AWS, ha presentato la raccolta in un post sul blog AWS Machine Learning pubblicato il 16 settembre 2026. Le competenze coprono 11 ambiti della sanità e delle scienze della vita, tra cui genomica, scoperta di farmaci, gestione delle richieste di rimborso e imaging medico. AWS le pubblica con licenza MIT-0 tramite il repository HCLS Agent Skills.

38 file Markdown per le decisioni di dominio

Ogni competenza è un file strutturato SKILL.md che gli agenti caricano progressivamente quando una richiesta corrisponde ai suoi criteri di attivazione. I file includono framework decisionali, tabelle di parametri, schemi di codice e criteri di convalida, con metadati e dipendenze definiti in YAML front matter.

AWS divide la raccolta in competenze di ragionamento e competenze per pipeline. Le prime codificano procedure per decisioni come l’interpretazione delle varianti genomiche; le seconde forniscono comandi convalidati e modelli per il lavoro tecnico. La competenza per l’interpretazione delle varianti genomiche, per esempio, copre le categorie di evidenza, le soglie di frequenza nella popolazione e i valori limite dei predittori computazionali usati nel framework di classificazione ACMG/AMP. Una competenza separata per il variant calling fornisce configurazioni per GATK4 HaplotypeCaller, VQSR e i workflow tumor-normal di Mutect2.

AWS descrive i file come prompt strutturati, anziché come fine-tuning. La distinzione è importante perché i team possono esaminare e modificare direttamente i criteri decisionali, invece di cambiare i pesi del modello. L’azienda afferma inoltre che le competenze possono essere usate con oltre 20 servizi e strumenti, tra cui Amazon Bedrock AgentCore, AWS Strands Agents SDK, Kiro, Amazon Quick Desktop, Claude Code e OpenAI Codex.

Dove falliscono gli agenti senza guida

Il pacchetto è progettato per affrontare errori che a una persona non esperta possono sembrare credibili. AWS cita come esempio la classificazione della variante TP53: un agente può citare correttamente ACMG/AMP, ma applicare male le categorie di evidenza, ignorare le soglie di frequenza nella popolazione o inventare punteggi dei predittori computazionali.

Lo stesso problema si presenta nell’elaborazione delle richieste di rimborso. Nell’esempio di AWS, un agente che crea una pipeline di aggiustamento del rischio per Medicare Advantage può usare coefficienti non aggiornati, omettere la risoluzione delle gerarchie delle malattie o sommare le condizioni nella fase sbagliata. Le competenze per l’aggiustamento del rischio indicano all’agente di applicare la tabella di corrispondenza ICD-10-HCC, rimuovere le diagnosi duplicate e risolvere le gerarchie prima di calcolare i punteggi a livello di assistito.

Un esempio di imaging medico riguarda il pretrattamento di risonanze magnetiche pesate in T1 per la morfometria basata sui voxel. AWS afferma che le competenze pertinenti richiedono di eseguire, nell’ordine corretto, il riorientamento, la correzione del campo di bias, la rimozione del cranio e la registrazione nello spazio MNI152, documentando anche le modalità di errore e i risultati dei controlli di qualità.

Un test su 410 prompt con due configurazioni di agenti

AWS ha valutato la raccolta con 410 prompt: 380 basati su una singola competenza e 30 che ne coinvolgevano più di una. Il confronto ha usato due configurazioni: Kiro CLI e un agente creato con AWS Strands Agents SDK. Nella configurazione Strands, il modello era fissato su Claude Sonnet 4.6, tutte le 38 competenze erano caricate progressivamente e sia la condizione con competenze sia quella di riferimento avevano accesso a uno strumento di ragionamento.

AWS ha usato Claude Opus 4.7 tramite Amazon Bedrock come giudice. Ha assegnato punteggi da 0 a 100 per accuratezza scientifica, coerenza, pertinenza, pensiero critico e concretezza, quindi ha riportato i tassi di vittoria e le dimensioni dell’effetto di Cohen d per tenere conto della compressione dei punteggi nelle valutazioni dei modelli linguistici.

L’agente dotato di competenze ha registrato un tasso di vittoria complessivo del 69,5% in Kiro CLI e dell’85,9% nella configurazione Strands. I tassi di vittoria per il pensiero critico hanno raggiunto rispettivamente il 78% e l’85,1%. L’accuratezza scientifica ha raggiunto il 69,3% in Kiro e l’86,2% in Strands, mentre la concretezza ha raggiunto il 68% e il 77,3%.

AWS afferma che i risultati indicano un vantaggio metodologico, non un semplice aumento della capacità di richiamare fatti. Le competenze indicano all’agente quale framework applicare, quali presupposti mettere in discussione e quali limiti dichiarare. L’effetto riportato è stato più marcato sui prompt in cui un agente senza guida poteva fornire una risposta plausibile, saltando però un passaggio decisionale necessario.

Le dimensioni del contesto influenzano la progettazione della distribuzione

Caricare tutte le 38 competenze in un unico agente consuma circa 80.000 token, secondo AWS. Questo approccio funziona con modelli che offrono finestre di contesto ampie, ma costringe anche l’agente a selezionare il materiale pertinente mentre istruzioni non correlate competono per la sua attenzione.

La configurazione di Kiro CLI di AWS usa un coordinatore leggero e otto specialisti di dominio. Ogni specialista carica solo le competenze assegnate, usando circa 15.000 token, mentre il coordinatore gestisce la classificazione dell’intento e l’instradamento. La stessa raccolta può essere caricata direttamente nel codice Strands o aggiunta ad agenti ospitati tramite Amazon Bedrock AgentCore.

Per gli sviluppatori che vogliono provare i file senza le configurazioni degli agenti che li accompagnano, AWS documenta il comando npx skills add awslabs/hcls-agent-skills. Il repository include anche guide per personalizzare le soglie, aggiungere policy specifiche dell’organizzazione e testare le competenze modificate con prompt di valutazione generati.

File aperti, non un nuovo modello medico

La pubblicazione di AWS non introduce un nuovo modello fondazionale né afferma che le competenze possano sostituire la revisione clinica o scientifica. Fornisce file di testo verificabili che orientano il ragionamento di un agente esistente nelle attività specialistiche e nella produzione di comandi o analisi.

Questo rende la manutenzione una parte importante dell’utilità pratica della pubblicazione. Un piano sanitario potrebbe modificare le regole per le procedure interne di codifica, mentre un gruppo di ricerca potrebbe aggiungere soglie specifiche per gli esperimenti o impostazioni degli strumenti dipendenti dalla versione, senza riaddestrare un modello. I risultati della valutazione restano il benchmark di AWS, ma i file, i prompt e il framework di test sono disponibili per essere esaminati nel repository open source.

Il risultato immediato è quindi concreto: 38 file di competenze con licenza MIT-0, modalità di installazione per Kiro, Quick Desktop e Strands e indicazioni per la distribuzione con Bedrock AgentCore. Il test pubblicato da AWS riporta un tasso di vittoria complessivo dal 69,5% all’85,9% per gli agenti che le usano, su 410 prompt.

Fonte

Esplora

Altri articoli