Vai al contenuto
AI.info

The Pulse

Google porta la generazione musicale di Lyria 3.5 nell’API Gemini

Google ha rilasciato Lyria 3.5 nell’API Gemini, aggiungendo la generazione di brani completi con voce, testi e arrangiamenti strutturati. Il modello è disponibile anche nell’app Gemini, in Google AI Studio, Flow Music e Google Vids.

Google porta la generazione musicale di Lyria 3.5 nell’API Gemini

AI.info Team ·

Lyria 3.5 passa dagli strumenti musicali di Google all’API Gemini

Google rende Lyria 3.5 disponibile tramite l’API Gemini, offrendo agli sviluppatori l’accesso a un modello di generazione musicale pensato per creare brani completi anziché brevi frammenti audio. L’uscita, annunciata il 4 settembre, porta il modello anche nell’app Gemini, in Google AI Studio, Flow Music e Google Vids.

Google descrive Lyria 3.5 come il suo modello musicale dal suono migliore, con voci più espressive e arrangiamenti più ricchi. L’azienda afferma che il modello può produrre tracce a maggiore fedeltà, preservando la struttura musicale tra strofe, ritornelli e ponti.

«Abbiamo sviluppato i nostri strumenti di generazione musicale in stretta collaborazione con esperti del settore, per garantire che l’IA sia una forza che potenzia la creatività umana», hanno scritto Alisa Fortin, product manager di Google DeepMind, e Guillaume Vernade, sostenitore degli sviluppatori Gemini presso Google DeepMind, nell’annuncio di marzo di Google relativo alla piattaforma per sviluppatori Lyria 3.

L’API Gemini ora genera brani completi, non solo clip di 30 secondi

La documentazione dell’API Gemini identifica lyria-3.5 come un modello in anteprima per brani completi della durata di un paio di minuti. Gli sviluppatori possono influenzarne la durata tramite un prompt, richiedere una sequenza definita, come introduzione, strofa, ritornello e ponte, e specificare dettagli quali genere, tempo, tonalità, strumenti e stile vocale.

Lyria 3.5 accetta input testuali o immagini e restituisce audio MP3 per impostazione predefinita; tramite l’impostazione del formato di risposta dell’API è disponibile anche il WAV. Secondo la documentazione di Google, l’output può includere testi generati e una descrizione della struttura del brano insieme all’audio, consentendo a un’applicazione di gestire congiuntamente il risultato musicale e i suoi componenti testuali.

Google offre il modello tramite la sua Interactions API. Uno sviluppatore può inviare un prompt, per esempio chiedendo una traccia orchestrale cinematografica o un brano pop di due minuti, quindi leggere i blocchi audio e testuali restituiti nella risposta dell’interazione.

Google mantiene Lyria 3 Clip per le anteprime rapide

L’API ora distingue la sperimentazione in formato breve dalla generazione di brani completi. Il modello Lyria 3 Clip, identificato come lyria-3-clip-preview, produce clip MP3 fisse di 30 secondi, da usare per anteprime, loop e altri contenuti brevi.

Entrambi i modelli supportano input testuali e immagini e producono audio stereo a 44,1 kHz. Google consiglia di iniziare con il modello Clip per provare i prompt, per poi passare a Lyria 3.5 quando un progetto richiede una composizione più lunga, con sezioni distinte.

La distinzione è importante per gli sviluppatori che realizzano prodotti basati sulla generazione musicale. Una clip breve può accompagnare un post sui social, un prototipo o un loop di sottofondo, mentre il modello più lungo può fornire un arrangiamento completo, con testi, voci e variazioni strumentali che si sviluppano nel tempo.

Gemini aggiunge modelli predefiniti e controlli sulla durata per chi non sviluppa

Google sta cambiando anche il funzionamento di Lyria nell’app Gemini. Gli utenti possono selezionare o descrivere un genere, scegliere tra stili vocali e strumentali, partire da modelli predefiniti e scegliere tracce più brevi o più lunghe. Google presenta la funzione come uno strumento per creare musica di sottofondo, jingle per marchi, canzoni di compleanno e suonerie.

Secondo Google, Lyria 3.5 è disponibile a livello globale sul web e nell’app mobile Gemini. Lo stesso modello è a disposizione degli sviluppatori tramite Google AI Studio e degli utenti di Google Vids, mentre artisti e altri creativi possono accedervi in Flow Music.

L’azienda ha presentato per la prima volta Lyria 3.5 in Flow Music il 29 luglio, descrivendo i miglioramenti apportati a melodia, testi, voci e controllo di tempo e durata. Google ha affermato che il modello aggiornato produce strutture melodiche più naturali, interpretazioni vocali più espressive e una pronuncia migliore.

Il controllo tramite prompt diventa parte del prodotto

La documentazione per sviluppatori di Google considera il prompting una forma di arrangiamento. Gli utenti possono specificare etichette per le sezioni, come [Verse], [Chorus] e [Bridge], richiedere un evento specifico in un determinato momento oppure chiedere testi nella lingua usata nel prompt. Per impostazione predefinita vengono generati voci e testi, ma i prompt possono richiedere musica strumentale o fornire testi originali.

Secondo la documentazione, al momento il modello non supporta modifiche iterative all’interno di un singolo flusso di generazione. Gli sviluppatori non possono generare una traccia e poi perfezionarla con più prompt successivi nello stesso processo di Lyria 3.5. Inoltre, i risultati possono variare tra chiamate effettuate con lo stesso prompt.

Il rilascio del 4 settembre di Google amplia quindi l’accesso più di quanto modifichi il modello di interazione di base: gli sviluppatori descrivono una traccia, ricevono un file audio e il testo che lo accompagna, quindi costruiscono attorno a quell’output un proprio flusso di modifica o selezione. L’identificativo del modello nell’API è lyria-3.5 e Google lo indica come versione in anteprima.

Fonte

Esplora

Altri articoli