Salta il menu

Newsletter Feed RSS Facebook Forum Contatti Accadde oggi Cerca

Le prestazioni della IA? Si testano con Super Mario

Non tutti gli esperti però pensano che un videogioco sia il mezzo migliore per valutare la bontà dei modelli.

[ZEUS News - www.zeusnews.it - 10-03-2025]

Foto di Raymond Chiu.

Qualche tempo fa Anthropic aveva rivelato che, per valutare le capacità di ragionamento della propria IA Claude 3.7, aveva utilizzato il videogioco Pokémon: in questo modo l'azienda poteva valutare la capacità del modello di trovare le soluzioni migliori.

Ora però i ricercatori dell'Hao AI Lab (parte dell'Università della California a San Driego) sostengono che la scelta del gioco da usare per valutare la IA non sia stata vincente: sarebbe infatti stato meglio usare Super Mario Bros.

Per dimostrarlo hanno costretto quattro diversi modelli a giocare allo storico gioco o, meglio, a una sua incarnazione recente: tramite il framework GamingAgent hanno garantito alle quattro IA in questione il controllo di un clone di Super Mario.

Le IA messe alla prova sono state il già citato Claude 3.7, Claude 3.5, Gemini 1.5 Pro (Google) e GPT-4o (OpenAI).

Non perderti anche:

SuperMario

Per poco il Game Boy non divenne il primo smartphone

Studio rivela: i videogiochi fanno bene alla salute mentale

Vivaldi si aggiorna e guadagna un videogioco in stile anni '80

I ricercatori hanno fornito le indicazioni di base - che cosa fare quando si incontra un ostacolo o un nemico - ma sostengono che ogni modello ha poi dovuto imparare da sé come gestire il gioco, sviluppando strategie complesse e adattandosi di volta in volta alle diverse sfide proposte dall'avanzamento di Super Mario nel livello.

Ed è qui che si dimostrerebbe la superiorità di Super Mario Bros su Pokémon come strumento per valutare le capacità della IA: un platform, infatti, richiede - sempre secondo i ricercatori lo sviluppo di manovre complicate e di diverse strategie di gioco, ma anche di reagire rapidamente alle situazioni.

Proprio quest'ultima caratteristica avrebbe causato la caduta dei modelli che "ragionano", come GPT-4o e Claude 3.7, rispetto a quelli standard: per arrivare al miglior risultato, il "ragionamento" richiede alcuni secondi per essere sviluppato; ma in un gioco come Super Mario anche un solo secondo può fare la differenza tra il completamento del livello e la perdita di una vita.

Spunti di approfondimento:

Copia sigillata di Super Mario Bros. va all'asta per una cifra da record

Cartuccia di Super Mario Bros venduta all'asta per 100.000 dollari

L'emulatore che converte i vecchi giochi per NES in widescreen

Pokémon Go, il videogioco che uccide nella vita reale

Ecco perché i modelli tradizionali nel test di Super Mario si sono comportati meglio: anche se più imprecisi rispetto ai loro colleghi più evoluti, hanno saputo avere tempi di reazione inferiori.

Non tutti gli esperti di IA sono però d'accordo con le conclusioni dei ricercatori californiani né, se è per quello, con quelle di Anthropic: ritengono infatti che la capacità di gestire un videogioco non sia poi così importante per definire la bontà di un modello di IA.

Richard Socher, ex responsabile della IA per Salesforce e fondatore di You.com, ha di recente commentato: «Penso proprio che i giochi tendano a entusiasmare parecchio le persone, che è qualcosa in cui si possono immedesimare. Hanno giocato a quei giochi e si ricordano quant'erano difficili. Ma è un po' come entusiasmarsi perché un computer sa moltiplicare numeri molto grandi: alla fine quei sistemi non sono poi così intelligenti. Non si crea un vero valore, al di là del gioco».

Articoli raccomandati:

La donna resa cieca da un videogioco

Nintendo ci riprova con lo Snes Classic Mini

Nintendo contro i retrogamer di Super Mario e Final Fantasy

Il forno a microonde per videogiocare

Anche Andrej Karpathy, di OpenAI, ha dubbi in proposito: «La mia reazione è che ci sia una crisi di valutazione» ha scritto su X. «Non so proprio quali metriche considerare in questo momento».

Se anche gli esperti non sono d'accordo su ciò che consente di definire "efficace" una IA diventa particolarmente difficile credere agli annunci del marketing e alle promesse che tutti gli attori del settore fanno quasi quotidianamente.

Commenti all'articolo (1)

Homer S.

:twisted: Leggi tutto
10-3-2025 09:23

Inserisci un commento - anche se NON sei registrato

La liberta' di parola e' un diritto inviolabile, ma nei forum di Zeus News vige un regolamento che impone delle restrizioni e che l'utente e' tenuto a rispettare. I moderatori si riservano il diritto di cancellare o modificare i commenti inseriti dagli utenti, senza dover fornire giustificazione alcuna. Gli utenti non registrati al forum inoltre sono sottoposti a moderazione preventiva. La responsabilita' dei commenti ricade esclusivamente sui rispettivi autori. I principali consigli: rimani sempre in argomento; evita commenti offensivi, volgari, violenti o che inneggiano all'illegalita'; non inserire dati personali, link inutili o spam in generale.


News(20 commenti) Facebook: Linux è un malware	News(11 commenti) Windows, gli aggiornamenti di gennaio causano un'infinità di problemi

News(19 commenti)

DeepSeek, la IA cinese che fa tremare le aziende occidentali

News(19 commenti)

Apre a febbraio il primo datacenter lunare

Sicurezza(7 commenti)

Novità negli account Microsoft, privacy un po' più a rischio

News(6 commenti)

Windows 11, arriva la ricerca semantica

E' VIETATA la riproduzione dei testi e delle immagini senza l'espressa autorizzazione scritta di Zeus News. Tutti i marchi e i marchi registrati citati sono di proprietà delle rispettive società. Informativa sulla privacy. I tuoi suggerimenti sono di vitale importanza per Zeus News. Contatta la redazione e contribuisci anche tu a migliorare il sito: pubblicheremo sui forum le lettere piu' interessanti.

Sondaggio

Ora che la musica è soprattutto digitale, che cosa farai dei vecchi CD audio che non ascolti più?