Ricerca
Accoppiamento geometrico e semantico per la comprensione delle interazioni nelle scene 3D
La comprensione delle interazioni nelle scene 3D richiede una descrizione congiunta delle parti mobili, del loro movimento e delle regioni attraverso cui possono essere azionate. Presentiamo Segment-S

- arXiv
- 2609.25247
- Pubblicato
- 2026-09-21
- Autori
- Hanyang Kong, Xingyi Yang
Abstract degli autori
La comprensione delle interazioni nelle scene 3D richiede una descrizione congiunta delle parti mobili, del loro movimento e delle regioni attraverso cui possono essere azionate. Presentiamo Segment-Snap, che collega questi risultati attraverso la relazione fisica tra le parti e le maniglie. I predittori appresi individuano le superfici ampie delle parti e le maniglie più piccole. Un decoder geometrico usa priori di planarità e verticalità per vincolare il movimento, quindi seleziona le linee di cerniera usando le posizioni delle maniglie previste, senza addestrare un regressore del movimento. Viceversa, un predittore congiunto di parti e maniglie fornisce ulteriori possibili maniglie, le cui classi di movimento vengono perfezionate usando le parti che le contengono. Ogni trasferimento di informazioni viene applicato una sola volta, senza retroazione iterativa. Nella validazione di Articulate3D, la guida fornita dalle maniglie porta l’AP con vincolo sul movimento dal 13,74% al 40,98%, a maschere e assi fissi. Le maniglie aggiuntive portano l’AP delle maniglie dal 24,63% al 29,65%; la correzione delle classi basata sulle parti aggiunge 0,98 punti e il contesto completo raggiunge il 30,99%. L’addestramento ripetuto, i controlli con decoder appreso e le visualizzazioni appaiate mostrano i vantaggi e i limiti della combinazione di evidenze geometriche e semantiche per comprendere le interazioni.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv