AI.info
Latest Research — Page 11
Sfoglia Ricerca recente su AI.info.
In inglese
- Show-Harness: basta un agente VLM per «giocare» con i robot
- CAST: supervisione basata sulla valutazione critica per addestrare agenti affidabili nell’uso di strumenti su orizzonti lunghi
- StudyBench: l’autoevoluzione può trarre dai libri di testo le capacità necessarie per affrontare le olimpiadi?
- Collusione emergente nelle interazioni a lungo orizzonte tra agenti LLM
- Sulla diffusibilità dei latenti ad alta dimensionalità
- APort Vault: benchmark sull’autorizzazione dei pagamenti degli agenti di IA che usano strumenti con l’Open Agent Passport
- Disallineamento tra riconoscimento e rifiuto negli LLM: perché i modelli rispondono a domande strutturalmente prive di risposta
- GE-Act 2.0: preaddestramento e aumento di scala di un modello mondo-azione per la manipolazione robotica
- ModularRSI: auto-miglioramento ricorsivo degli harness, modulare e generalizzabile
- Grounded Action Model: il grounding 3D come fondamento per la robotica
- Dai riconoscitori di pattern ai compagni personalizzati: una rassegna sui modelli linguistici di grandi dimensioni nella salute mentale
- Agenti per il ragionamento sui dati efficienti nell’uso dei token grazie alla strutturazione adattiva dei dati non strutturati
- Direct Message Approximation (DMA): un framework basato sulla consistenza per un’inferenza approssimata trattabile sui grafi fattoriali
- Aphanta: diagnosi delle immagini intermedie modificate e allineate al compito per il ragionamento multimodale
- PaperGym: evoluzione incentrata sulle rubriche per la generazione di piani di ricerca
- CADWorld: benchmark per l’uso del computer nella progettazione assistita da computer a lungo orizzonte
- ZipTok3D: tokenizzazione 3D ad alta fedeltà con prefissi compatti di token
- E-Commerce Bench: valutare gli agenti basati su LLM nella gestione autonoma di un’impresa nel lungo periodo
- TeleAntiFraud 2.0: un benchmark aggiornabile, basato sui profili e sull’audio per rilevare le frodi telefoniche
- Aspire: i modelli possono evolvere autonomamente a partire da obiettivi vaghi?
- ExplorationBench: misurare l’esplorazione dei sistemi di IA in mondi alieni verificabili
- Compilare addestrando: trasformare specifiche in linguaggio naturale in funzioni neurali locali
- Riconoscimento multilingue unificato del testo nelle scene con Mixture-of-Experts che tiene conto del sistema di scrittura
- Studiare i tokenizer di immagini come linguaggi visivi nei modelli multimodali unificati
- Diff e file interi: un confronto empirico tra generazione iterativa basata su modifiche e generazione diretta per modelli di codice Flutter/Dart
- PILOT nel ciclo: auto-miglioramento in tempo reale per agenti su orizzonti lunghi
- FreeFlow: un transformer gerarchico senza bias per la stima del flusso ottico
- GTA: Graph Theory Agent e benchmark per il ragionamento algoritmico sui grafi con gli LLM
- AgenticGen: generazione agentica di video pubblicitari guidata da ricompense
- La confidenza nasce dall’esperienza: stima esperienziale della confidenza, dal ragionamento agli agenti
- Non tutti i prompt sono uguali: strutturazione dei prompt guidata dall’esplorazione per il post-addestramento multimodale con apprendimento per rinforzo
- I modelli linguistici possono controllare la propria attenzione
- EarlyEval: valutare gli agenti a costi inferiori prevedendo in anticipo l’esito
- Editing video in streaming con un adattamento semplice
- Persi nella compressione: una verifica interlinguistica controllata dei compressori estrattivi di prompt
- StarHarness: evoluzione degli harness con ricerca stratificata per ambienti aziendali
- Puppeteer: generazione di gesti che accompagnano il parlato, ancorati agli oggetti e sensibili alla postura
- Spezzare la scorciatoia visione-azione: addestramento dell’interfaccia latente per modelli fondazionali di robotica capaci di generalizzare
- Geometria dello steering: verificare la geometria dei valori umani nello spazio di steering degli LLM
- Vidu S2: generazione di video interattiva, modificabile e spaziale in tempo reale