AI.info
Latest Research — Page 7
Sfoglia Ricerca recente su AI.info.
In inglese
- Agenti di programmazione per problemi generalizzati di pianificazione di attività e movimento
- Addestramento consapevole della verifica per la decodifica speculativa
- EmbodiedSWE: agenti di programmazione per la robotica a elevata destrezza su orizzonti temporali lunghi
- Il passato inquadra il futuro: la memoria per la generazione autoregressiva di video
- HarnessVLN: unificare la navigazione embodied senza addestramento tramite un Agent Harness
- Non rinunciare al dropout: ottimizzare la sparsità degli strati per addestrare gli LLM ed eseguire l’inferenza in modo efficiente
- RAG-Safety-Bench: valutazione affidabile della sicurezza dei modelli linguistici aumentati con il recupero
- Un sintomo, tre leve: una rassegna critica dell’autodistillazione on-policy
- ShieldVLA: allineamento alla sicurezza consapevole della fattibilità per i modelli visione-linguaggio-azione
- Dita come gambe: apprendere la locomozione e la manipolazione con una mano antropomorfa che si sostiene da sola
- EvolveTrade: perfezionamento delle policy guidato dall’esperienza per agenti di trading basati su LLM capaci di evolvere autonomamente
- VidaForge: un’infrastruttura aperta per la ricerca sulle ricette di preparazione dei dati per il preaddestramento su video
- SkillSpec: ragionamento sulle specifiche con mascheramento dell’intento per la correttezza delle skill degli agenti
- RiskChainBench: un benchmark per ricostruire messaggi offuscati sulle piattaforme e indagare sul web sulla base di prove
- OmniFabric: sintesi di texture coerenti nello spazio UV per la ricostruzione di capi 3D
- UniH$^3$: unificare omogeneità ed eterogeneità gerarchiche per il restauro delle immagini mediche con un unico modello
- Il numero di campioni non basta: la strategia di generazione dei candidati determina il consumo energetico e le prestazioni dello scaling in fase di test dei modelli linguistici di grandi dimensioni
- StableVQ: Linee guida pratiche per addestrare tokenizer a quantizzazione vettoriale in modo stabile
- Dalla generazione di contenuti al supporto all’apprendimento: tutor video generativi guidati dalla pedagogia per l’apprendimento STEM
- RetireOPD: distillazione on-policy a ritiro autonomo per l’apprendimento per rinforzo degli agenti
- Esplorare la collaborazione tra un agente linguistico e uno non linguistico
- Inversione temporale dei gradienti per la ricostruzione di traiettorie private nell’apprendimento per rinforzo incarnato
- Riflettere, rivedere, riutilizzare: l’evoluzione delle competenze senza addestramento per gli agenti GUI
- Harness-of-Harness: sviluppo autonomo di software nell’arco di più giorni con miglioramento continuo
- SnapBench: un benchmark per la ricerca multimodale «scatta e chiedi» nelle interazioni da dispositivo mobile
- Agire con intenzione: distillare l’intento del comportamento per i modelli visione-linguaggio-azione
- I modelli generativi video come strumenti per apprendere la geometria
- HARMONY: Ragionamento agentico gerarchico per la sintesi da immagine monoculare a scena
- Dipingi ciò che vedi: valutare la destrezza nell’uso di strumenti visivi da parte degli agenti multimodali
- MintAct: un agente visivo unificato per gli ambienti digitali
- Addestrare la permanenza degli oggetti nei modelli del mondo
- SenseNova-U1.5: verso un’intelligenza visiva unificata nativa
- BackTrend: valutare la previsione dei segnali deboli nella ricerca scientifica mediante ricostruzione a ritroso
- Matrix-Game 3.5: modelli interattivi del mondo con streaming in tempo reale migliorati grazie alla memoria a patch
- Luce: gaussiane riilluminabili per la generazione di asset 3D
- Flash-dLLM: caching KV consapevole dell’I/O e decodifica parallela per modelli linguistici di grandi dimensioni a diffusione veloci ed efficienti in termini di memoria
- Marigold V2: una nuova analisi dei transformer a diffusione per la stima della profondità monoculare
- L’IA per i videogiochi nell’era dei modelli fondazionali
- ShallowStream: indicizzare superficialmente, poi rispondere in profondità per comprendere i video in streaming
- PhysBrain 1.5: dai modelli visivo-linguistici ai modelli fondazionali per il mondo fisico