AI.info
Guide pratiche
Sfoglia Guide pratiche su AI.info.
In inglese
- L’economia dell’inferenza: quantizzazione, decodifica speculativa e l’arte di servire gli LLM a basso costo
PagedAttention, batching continuo, costi della cache KV, quantizzazione, decodifica speculativa, instradamento MoE e fasce batch: perché il costo minimo per token continua a scendere, mentre sopra di esso si è riaperta una fascia premium da 10 dollari in input e 50 dollari in output.
- Mettere in sicurezza le applicazioni LLM in produzione: prompt injection, jailbreak e la nuova superficie d’attacco
Una guida difensiva alla OWASP LLM Top 10: dagli incidenti reali, come la fuga di informazioni di Bing Sydney, EchoLeak e il worm che sfrutta la prompt injection in Word nel 2026, ai motivi per cui è difficile correggere la prompt injection con una patch, fino ai controlli di guardrail, red-teaming e conformità che reggono ora che l’AI Act è in vigore.