Vai al contenuto
AI.info

Ricerca

TAPe+ML: una rappresentazione strutturata compatta per la visione artificiale multi-task

Presentiamo TAPe+ML v3, un sistema compatto di visione artificiale basato su TAPe (Theory of Active Perception), una rappresentazione strutturata che codifica le relazioni tra gli elementi percettivi

TAPe+ML: una rappresentazione strutturata compatta per la visione artificiale multi-task
arXiv
2609.20869
Pubblicato
2026-09-15
Autori
Sergey Kurinov, Alexey Upatov

Abstract degli autori

Presentiamo TAPe+ML v3, un sistema compatto di visione artificiale basato su TAPe (Theory of Active Perception), una rappresentazione strutturata che codifica le relazioni tra gli elementi percettivi prima del riconoscimento. Anziché operare direttamente su tensori di pixel, il sistema usa una rappresentazione TAPe condivisa e un’architettura di riconoscimento modulare per la classificazione delle immagini, il rilevamento degli oggetti e la segmentazione delle istanze. TAPe+ML v3 combina l’elaborazione dello sfondo e dei contorni, la localizzazione locale degli oggetti, la classificazione basata su prototipi e un coordinatore per sottomodelli specializzati. Negli esperimenti riportati, utilizza meno di 100.000 parametri. Nel rilevamento degli oggetti su COCO ottiene 84,7 mAP50 e 65,3 mAP50-95. Nella segmentazione delle istanze su COCO ottiene 80,7 mask mAP50 e 58,4 mask mAP50-95. Negli esperimenti di classificazione raggiunge un’accuratezza di validazione del 92% su Imagenette, in un confronto con un modello di riferimento basato sui pixel grezzi a parità di addestramento, e un’accuratezza Top-1 dell’89,9% su ImageNet-Real. Valutiamo inoltre la compattezza nel rilevamento delle scene nei video e l’adattamento in presenza di uno spostamento della distribuzione in un progetto pilota industriale. I risultati suggeriscono che spostare parte del carico della modellazione dai parametri della rete a una rappresentazione strutturata dell’input può consentire sistemi compatti di visione artificiale multi-task con minori esigenze di dati, memoria e capacità di calcolo.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv