Vai al contenuto
AI.info

The Pulse

Amazon Bedrock aggiunge Kimi K3 di Moonshot AI

Amazon Bedrock offre ora Kimi K3 di Moonshot AI, un modello multimodale a pesi aperti con una finestra di contesto da un milione di token. AWS elenca l’accesso tramite Chat Completions e Responses, l’inferenza cross-Region US Geo e Global e

Amazon Bedrock aggiunge Kimi K3 di Moonshot AI

AI.info Team ·

Un modello da un milione di token arriva su Bedrock

Amazon Web Services indica Kimi K3 di Moonshot AI come disponibile tramite Amazon Bedrock, offrendo agli sviluppatori un accesso gestito a un modello a pesi aperti pensato per flussi di lavoro di programmazione e gestione della conoscenza di lunga durata. La scheda del modello di AWS indica il 18 settembre 2026 come data di lancio di Kimi K3 e lo descrive come il modello a pesi aperti più capace di Moonshot AI.

Kimi K3 combina la visione nativa con una finestra di contesto da un milione di token. Questa capacità consente a un singolo flusso di lavoro di mantenere al suo interno grandi repository, documenti lunghi e immagini senza dover suddividere ripetutamente il materiale in prompt più piccoli. AWS presenta il modello come adatto alle applicazioni che devono elaborare grandi quantità di testo e contenuti visivi.

La scheda di Bedrock supporta l’endpoint bedrock-runtime e raccomanda l’API Chat Completions per Kimi K3. Il modello supporta anche Responses, Invoke e Converse, sebbene AWS documenti alcune limitazioni che rendono le API compatibili con OpenAI la scelta preferibile per le nuove integrazioni.

US Geo e Global definiscono le opzioni di accesso

I clienti possono richiamare Kimi K3 tramite il servizio runtime di Bedrock usando l’identificatore del modello moonshotai.kimi-k3. AWS offre due profili di inferenza cross-Region: us.moonshotai.kimi-k3 per l’instradamento US Geo e global.moonshotai.kimi-k3 per le richieste che possono essere instradate attraverso le regioni AWS commerciali supportate in tutto il mondo.

L’opzione US Geo è pensata per i carichi di lavoro che richiedono che le richieste restino all’interno del territorio statunitense. Il profilo Global consente un instradamento più ampio attraverso le regioni commerciali supportate da AWS. Kimi K3 non offre inferenza nella stessa regione in quelle elencate nella scheda del modello, quindi i clienti devono scegliere tra queste opzioni cross-Region.

AWS elenca il supporto nelle regioni del Nord America, dell’Europa, dell’Asia-Pacifico, del Medio Oriente, dell’Africa e del Sud America tramite il profilo Global. La disponibilità precisa varia da regione a regione: per pianificare la distribuzione, la scheda del modello è quindi il riferimento più pertinente, anziché il catalogo generale dei modelli Bedrock.

Tariffe a partire da 3 dollari per milione di token in ingresso

Le tariffe del livello Standard tramite Global Cross-Region Inference sono di 3 dollari per milione di token in ingresso e 15 dollari per milione di token in uscita. L’opzione US Geo costa 3,30 dollari per milione di token in ingresso e 16,50 dollari per milione di token in uscita.

Bedrock elenca anche le tariffe per la cache dei prompt di Kimi K3. Le letture della cache Global costano 0,30 dollari per milione di token, mentre le scritture nella cache con un periodo di conservazione di 30 minuti costano 3,75 dollari. Le letture della cache US Geo costano 0,33 dollari per milione di token, mentre le scritture costano 4,125 dollari per milione di token.

Il servizio Priority viene fatturato a 1,75 volte la tariffa Standard, mentre il servizio Flex costa la metà della tariffa Standard. AWS afferma che questi livelli di servizio sono disponibili tramite le API Responses e Chat Completions; Converse e Invoke restano limitati all’inferenza on demand Standard.

I limiti delle API sono importanti per le applicazioni multi-turno

La documentazione di Bedrock avverte che Converse presenta limitazioni note con Kimi K3. Una richiesta multi-turno può non riuscire con un errore InternalServerException quando include contenuti di ragionamento dei turni precedenti; AWS afferma che il problema può riguardare framework come LangChain e Strands Agents nelle loro configurazioni predefinite.

Converse rifiuta anche i documenti PDF e HTML allegati per questo modello. AWS afferma che gli sviluppatori che hanno bisogno di richieste Converse multi-turno dovrebbero rimuovere i blocchi di ragionamento dei turni precedenti oppure usare le API Responses o Chat Completions.

Gli input video non sono supportati. Per i prompt che combinano immagini e testo, AWS raccomanda di provare a inserire i blocchi di immagini prima di quelli di testo, perché quest’ordine può produrre risposte di qualità superiore; il controllo del livello di dettaglio delle immagini è invece rispettato solo tramite Chat Completions.

Kimi K3 si aggiunge a un catalogo di modelli a pesi aperti in espansione

L’aggiunta segue l’espansione di Bedrock di febbraio con sei modelli a pesi aperti, tra cui Kimi K2.5 di Moonshot AI. AWS ha anche pubblicato indicazioni per distribuire Kimi K3 su SageMaker HyperPod e Amazon EKS, descrivendo il modello come un sistema mixture-of-experts da 2,8 bilioni di parametri, con 896 esperti specializzati e 104 miliardi di parametri attivi per token.

Questi requisiti per l’hosting autonomo differiscono nettamente dall’approccio di Bedrock. La guida alla distribuzione di AWS richiede un’istanza con otto GPU NVIDIA B300, mentre la scheda del modello Bedrock presenta Kimi K3 come un’API gestita, con tariffe basate sull’utilizzo e capacità di inferenza controllata da AWS.

Per gli sviluppatori, la differenza immediata è operativa: Bedrock fornisce un ID del modello, profili di instradamento regionali, API e livelli di servizio, senza richiedere di assemblare l’infrastruttura descritta nella guida di AWS per l’hosting autonomo. Il compromesso è che i team applicativi devono tenere conto delle limitazioni documentate delle API, delle opzioni di instradamento cross-Region e delle tariffe più elevate di US Geo prima di trasferire i carichi di lavoro di produzione a Kimi K3.

Fonte

Esplora

Altri articoli