The Pulse
Perceptron presenta Mk1.5 per gli agenti incarnati multimodali
Perceptron ha presentato Mk1.5 il 25 settembre, aggiungendo audio nativo, tracciamento video, uso di strumenti e chiamate a sottoagenti al suo modello per agenti incarnati. Secondo l’azienda, il modello funziona su droni, quadrupedi, occhia

AI.info Team ·
Un modello, diversi tipi di input
Perceptron ha presentato Mk1.5 il 25 settembre, descrivendolo come un modello progettato per controllare agenti incarnati. Il sistema accetta testo, immagini, video e audio e può restituire testo insieme a output strutturati come punti, riquadri, poligoni, clip video e traiettorie degli oggetti. La nuova versione aggiunge audio nativo, tracciamento video, ricerca sul web, chiamate a sottoagenti e capacità di ragionamento visivo più complesse alla famiglia di modelli dell’azienda.
Perceptron afferma di aver impiegato Mk1.5 su droni, cani robotici, occhiali intelligenti e smartphone e che il modello può funzionare su queste piattaforme senza riaddestramento specifico. Il suo approccio presenta al modello i comandi di una piattaforma come un insieme di strumenti; Mk1.5 seleziona quindi una sequenza di chiamate per portare a termine un compito. Questa struttura inserisce il modello in un ciclo operativo da agente, anziché limitarlo a descrivere un’immagine o un video.
Tracciare gli oggetti nei video
Per i video, Mk1.5 può produrre traiettorie degli oggetti con indicazioni temporali, anziché restituire soltanto rilevamenti separati per i singoli fotogrammi. Perceptron afferma che il modello è risultato primo in tre dei quattro benchmark di segmentazione degli oggetti nei video che ha misurato: Molmo2-Track, Ref-DAVIS17 e ReasonVOS. Su MeViS valid_u, il confronto dell’azienda indica MolmoPoint-8B come primo.
La nuova versione pone inoltre l’accento sui video in prima persona, nei quali le riprese possono mostrare ciò che vede una persona che indossa la videocamera o un robot. Secondo Perceptron, Mk1.5 ha localizzato le mani in un fotogramma egocentrico con risultati migliori del 50 per cento rispetto al modello Gemini più efficace nel suo confronto. L’azienda collega questa capacità a impieghi come l’annotazione delle riprese usate per addestrare i robot e il supporto agli occhiali intelligenti nell’interpretare l’ambiente circostante di chi li indossa.
Audio, strumenti e prestazioni dichiarate
Mk1.5 aggiunge l’input audio per compiti tra cui la trascrizione allineata temporalmente e il rilevamento di eventi attraverso i suoni. Può anche chiamare funzioni definite con JSON Schema e, secondo Perceptron, il suo ambiente dimostrativo comprende ricerca sul web, lettura delle pagine, zoom e ricerca inversa per immagini. Sul benchmark MMSearch, l’azienda riferisce un miglioramento di 36,1 punti quando le chiamate agli strumenti sono abilitate, rispetto all’esecuzione senza tali chiamate.
Perceptron riferisce inoltre che Mk1.5 completa le richieste dall’inizio alla fine circa da due a cinque volte più velocemente di Mk1; il suo confronto dei tempi di risposta mostra risultati fino a 4,7 volte più veloci. Secondo l’azienda, questi valori mediani derivano da tre esecuzioni su una GPU H100, con carichi di lavoro che comprendono chat, domande su immagini e video. I dati sono misurazioni della stessa Perceptron; il post non li presenta come una valutazione indipendente.
Disponibile attraverso la piattaforma di Perceptron
Al lancio, il modello era disponibile attraverso la Perceptron Platform e un SDK aggiornato. L’azienda indica una finestra di contesto multimodale di 32.000 token e prezzi di 0,15 dollari per milione di token in input e 1,50 dollari per milione di token in output. L’ID del modello per l’API è perceptron-mk1.5.
La nuova versione presenta Mk1.5 come un componente per la percezione e il controllo capace di combinare input visivi e audio con gli strumenti messi a disposizione da un dispositivo o un’applicazione. I risultati dichiarati per i benchmark descrivono progressi in test specifici su video, prospettiva egocentrica e uso degli strumenti, mentre gli esempi di impiego spaziano tra droni, quadrupedi, occhiali e telefoni. Per gli sviluppatori, l’offerta concreta è un modello ospitato e un SDK che accettano input multimodali e possono effettuare chiamate agli strumenti di controllo messi a loro disposizione.