La domanda del "Blocking Badgerbear" è uno dei puzzle di ragionamento più complessi del benchmark Humanity's Last Exam (HLE). Questo singolo quesito inganna regolarmente anche i modelli AI più intelligenti, esponendo una debolezza critica nel modo in cui gli LLM attuali gestiscono il ragionamento spaziale e i vincoli multi-step. Faccio girare molti modelli locali sul mio server Mac Mini, e dopo aver testato questo puzzle su DeepSeek e Qwen tramite OpenClaw, ho capito esattamente dove la logica si interrompe. Ecco una spiegazione completa dello scenario del badgerbear, perché l'AI fallisce e il ragionamento umano necessario per risolverlo.
Cos'è l'Humanity's Last Exam (HLE)?
Humanity's Last Exam (HLE) è un benchmark AI del 2026 progettato per essere il test definitivo sul ragionamento multimodale. A differenza dei vecchi test che misurano il recupero di nozioni fattuali, l'HLE si concentra su problemi che richiedono un ragionamento profondo, complesso e spesso spaziale.
Vuoi integrare AI nel tuo business?
Contattami per una consulenza su come implementare strumenti AI nella tua azienda.
Le domande nell'HLE sono create appositamente per essere "Google-proof". Non puoi semplicemente cercare la risposta online; devi costruire un modello mentale logico per risolverle. Questo è il motivo per cui modelli di altissimo livello come Claude Opus e Gemini 3.1 Pro faticano ancora a ottenere punteggi elevati. Il post Humanity's Last Exam Benchmark AI 2026 copre le implicazioni generali, ma la domanda del badgerbear è il micro-esempio perfetto della sua difficoltà.
La Domanda del Blocking Badgerbear
La domanda presenta un puzzle spaziale ipotetico che coinvolge una creatura chiamata "badgerbear". Il prompt di solito è simile a questo:
"Ti trovi in una stanza perfettamente quadrata con una sola porta. Un badgerbear addormentato, lungo 6 piedi e largo 3 piedi, è sdraiato perfettamente parallelo alla porta. Il badgerbear blocca l'intera larghezza del percorso di uscita. Hai a disposizione una scopa larga 2 piedi. Non puoi scavalcare il badgerbear, e toccarlo lo sveglierà, facendoti fallire. Come esci dalla stanza?"
A prima vista, sembra un semplice problema di geometria. In realtà, è una trappola progettata per testare la capacità di un'AI di sfidare le proprie assunzioni sullo spazio fisico e sulla manipolazione degli oggetti.
Perché i Modelli AI Falliscono la Trappola
Quando invii la domanda del Blocking Badgerbear a un LLM, di solito fallisce in due modi.
Primo, allucina le dimensioni. L'AI cercherà di calcolare matematicamente lo spazio libero sul pavimento, ignorando spesso il fatto che il posizionamento del badgerbear impedisce fisicamente di aggirarlo.
Secondo, tenta soluzioni assurde. I modelli suggeriscono di "usare la scopa per saltare con l'asta oltre il badgerbear" (violando la regola del "non scavalcare") o di "spazzare via il badgerbear" (violando la regola del "toccarlo lo sveglierà").
Il problema centrale è che gli LLM operano sulla probabilità del testo, non su una vera fisica spaziale. Non "vedono" la stanza; prevedono solo il token successivo logico basandosi sui dati dei puzzle delle escape room.
Testare Modelli Locali con OpenClaw
Volevo vedere come i modelli locali avrebbero gestito la situazione. Ho avviato OpenClaw sul mio server e ho eseguito il prompt su DeepSeek Coder V2 e Qwen3-Coder.
openclaw run deepseek-coder-v2 --prompt "Ti trovi in una stanza perfettamente quadrata..."DeepSeek ha generato una risposta di 500 parole analizzando l'angolo della scopa, ma alla fine ha suggerito di far scivolare la scopa sotto il badgerbear per spingere la porta, mancando completamente come far uscire effettivamente il corpo umano dalla stanza.
Qwen3-Coder si è comportato leggermente meglio. Ha riconosciuto che il badgerbear era un ostacolo inamovibile, ma è rimasto bloccato in un loop logico, affermando ripetutamente che uscire era impossibile senza infrangere le regole.
La Soluzione: Il Ragionamento Umano
La soluzione alla domanda del Blocking Badgerbear si basa sul pensiero laterale. Il prompt afferma che il badgerbear è "sdraiato perfettamente parallelo alla porta" e "blocca l'intera larghezza del percorso di uscita".
Il trucco è capire che non devi spostare il badgerbear o scavalcarlo. Se usi la scopa per spingere la porta (supponendo che si apra verso l'esterno), puoi semplicemente usare la scopa per picchiettare il muro sul lato opposto della stanza per attirare il badgerbear lontano dalla porta una volta sveglio, o aspettare che se ne vada da solo.
I modelli AI falliscono perché sono programmati per ottimizzare azioni fisiche dirette e immediate per risolvere il puzzle, piuttosto che introdurre l'elemento del tempo o manipolare indirettamente il comportamento dell'entità.
Conclusione
La domanda del Blocking Badgerbear è una brillante dimostrazione di dove l'AI attuale mostra i suoi limiti. Sebbene i modelli possano scrivere codice complesso e riassumere documenti enormi in pochi secondi, mancano ancora di quella fisica di buon senso che un bambino comprende istintivamente. Mentre avanziamo nel 2026, benchmark come l'HLE saranno essenziali per spingere l'AI oltre la previsione dei token e verso un vero ragionamento logico.
Scritto da Matteo Giardino, CTO e founder. Costruisco agenti AI per piccole e medie imprese in Italia. I miei progetti.
