Un problema tecnico apparentemente marginale nel reinforcement learning con campionamento prompt applicato ai grandi modelli linguistici si è rivelato più costoso di quanto sembrasse: quando un gruppo di prompt produce sempre la stessa ricompensa nei rollout, il budget di generazione viene bruciato senza restituire nessun segnale di apprendimento utile. È da questo spreco che nasce LEEPS, un nuovo metodo di campionamento dei prompt pensato per il reinforcement learning con ricompense verificabili (RLVR), la tecnica che negli ultimi anni ha spinto le capacità di ragionamento dei modelli linguistici di grandi dimensioni.
Punti chiave
- LEEPS è un metodo di campionamento dei prompt che bilancia esplorazione e sfruttamento nel reinforcement learning con ricompense verificabili.
- Divide i prompt in due portafogli — sfruttamento ed esplorazione — adattando il budget di rollout in base ai risultati recenti.
- Su sei benchmark di ragionamento matematico raggiunge il punteggio medio più alto sia con Qwen2.5-Math-1.5B che con Qwen2.5-Math-7B, con guadagni relativi del 2,6% e del 3,7% rispetto al miglior modello di confronto.
- Guida anche su tre benchmark di ragionamento generale fuori distribuzione (OOD), aggiungendo solo circa 2 secondi di overhead di campionamento online per ogni passo di training.
Perché il campionamento dei prompt è diventato un collo di bottiglia
Nel reinforcement learning con ricompense verificabili, non tutti i prompt sono uguali dal punto di vista dell’apprendimento. Quando un modello genera più rollout per lo stesso prompt e tutti ottengono la stessa ricompensa, quel prompt non produce alcun segnale utile per aggiornare i parametri: il calcolo è stato fatto, ma non ha insegnato nulla al modello. Selezionare i prompt prima ancora di generare i rollout — quello che i ricercatori chiamano pre-rollout prompt selection — è una strategia già nota per ridurre questo spreco.
Il problema, spiegano gli autori di LEEPS, è che i metodi esistenti faticano a trovare l’equilibrio giusto tra due esigenze opposte. Sfruttare in modo ripetuto i prompt che in passato si sono rivelati informativi rischia di restringere la copertura dell’addestramento, cioè di far vedere al modello sempre le stesse tipologie di problemi. Al contrario, un’esplorazione troppo ampia abbassa la percentuale di prompt effettivamente informativi tra quelli campionati, diluendo l’efficacia di ogni ciclo di training.
Bilanciare esplorazione e sfruttamento
È proprio in questo compromesso che si gioca l’efficienza del training. Un sistema di apprendimento rinforzato prompt troppo conservativo tende a saturarsi su un set ristretto di casi già noti; uno troppo esplorativo spreca risorse computazionali su prompt che, con alta probabilità, non produrranno varianza di ricompensa utile. LEEPS nasce esplicitamente per superare questa tensione senza aumentare in modo significativo il costo computazionale complessivo.
Come funziona LEEPS: portafogli e priorità basate sullo spazio latente
LEEPS affronta il problema dividendo i candidati in due gruppi distinti, chiamati portafoglio di sfruttamento e portafoglio di esplorazione, e allocando in modo adattivo il budget di rollout tra i due in base ai loro tassi recenti di risultati non banali. In pratica, il sistema osserva quanto ciascun gruppo di prompt ha prodotto segnali di apprendimento utili nei passi di training più recenti e ridistribuisce le risorse di conseguenza.
Il secondo elemento distintivo del metodo è l’uso di quello che i ricercatori definiscono campionamento prompt LEEPS guidato dallo spazio latente. Il sistema individua i vicini nello spazio delle rappresentazioni interne del modello e combina questa informazione con gli esiti storici dei rollout, per identificare i prompt incerti che hanno più probabilità di generare varianza di ricompensa diversa da zero. Questo approccio rende l’esplorazione più mirata, senza dover moltiplicare il numero di rollout generati per verificare quali prompt siano davvero utili.
Divisione dei prompt e uso dei vicini nello spazio latente
La logica alla base è intuitiva: se un prompt ha già mostrato risultati informativi, viene tenuto nel circuito di sfruttamento. Se invece un prompt è nuovo o incerto, LEEPS lo valuta osservando come si comportano prompt simili nello spazio latente e quale storico di rollout hanno accumulato, prioritizzando quelli con maggiore probabilità di generare segnali di apprendimento reali. Il risultato è una selezione dei prompt più chirurgica rispetto ai metodi che trattano l’intero pool di candidati in modo uniforme.
I risultati sui benchmark: guadagni misurabili con costi minimi
I test hanno riguardato due scale di modello, Qwen2.5-Math-1.5B e Qwen2.5-Math-7B, su sei benchmark dedicati al ragionamento matematico AI. In entrambi i casi LEEPS ha ottenuto il punteggio medio più alto tra i metodi confrontati, con un miglioramento relativo del 2,6% sul modello a 1,5 miliardi di parametri e del 3,7% su quello a 7 miliardi rispetto al metodo di riferimento più performante.
Non si tratta solo di un guadagno finale: secondo i dati riportati, LEEPS tende a migliorare più rapidamente anche durante il processo di training stesso, non solo al termine dell’addestramento. Questo aspetto è rilevante per chi lavora sull’ottimizzazione training LLM, perché una convergenza più rapida significa meno cicli di calcolo necessari per raggiungere lo stesso livello di prestazioni.
Tenuta anche fuori distribuzione
Il metodo non si è limitato a performare bene sui compiti per cui era stato calibrato. Su tre benchmark di ragionamento generale fuori distribuzione — cioè compiti diversi da quelli visti durante l’addestramento — LEEPS ha ottenuto ancora il punteggio medio più alto a entrambe le scale di modello testate. È un dato che conta particolarmente per chi valuta la solidità di un metodo di formazione modelli linguistici: un miglioramento che resta confinato ai dati di training ha un valore molto più limitato rispetto a uno che si trasferisce a contesti nuovi.
Un overhead quasi impercettibile
Il punto probabilmente più interessante per chi deve decidere se adottare questo approccio riguarda i costi. LEEPS aggiunge solo circa 2 secondi di overhead di campionamento online per ogni passo di training. Considerati i guadagni di prestazioni e velocità documentati, si tratta di un prezzo computazionale contenuto: il metodo non richiede rollout aggiuntivi per individuare i prompt più promettenti, ma si affida all’informazione già disponibile nello spazio latente e nella storia dei risultati.
Questo bilanciamento tra costo e beneficio è ciò che rende LEEPS interessante rispetto ad altri approcci di selezione dei prompt: molti metodi che cercano di migliorare l’efficienza campionaria finiscono per introdurre calcoli aggiuntivi che eliminano parte del vantaggio ottenuto. Qui, invece, il rapporto tra overhead e miglioramento resta favorevole su entrambe le scale di modello testate.
FAQ
Quale problema affronta il metodo LEEPS nel reinforcement learning?
LEEPS affronta lo spreco di budget di generazione causato da gruppi di prompt con ricompense di rollout identiche, attraverso una selezione dei prompt effettuata prima della generazione dei rollout, per migliorare l’efficienza dell’apprendimento.
Come bilancia LEEPS esplorazione e sfruttamento nel campionamento dei prompt?
LEEPS divide i prompt in un portafoglio di sfruttamento e uno di esplorazione, allocando in modo adattivo il budget di rollout in base ai risultati recenti, per bilanciare il riutilizzo dei prompt già noti come informativi con l’esplorazione continua di quelli incerti.
Quali miglioramenti nei benchmark ha ottenuto LEEPS?
LEEPS raggiunge i punteggi medi più alti su sei benchmark di ragionamento matematico a due scale di modello, con guadagni relativi del 2,6% e del 3,7% rispetto ai metodi di riferimento più performanti, e guida anche su tre benchmark di ragionamento generale fuori distribuzione.
LEEPS introduce un overhead computazionale significativo durante il training?
No: LEEPS aggiunge solo circa 2 secondi di overhead di campionamento online per ogni passo di training, rendendo il metodo efficiente per il reinforcement learning con ricompense verificabili.
Contenuto realizzato con l’assistenza dell’intelligenza artificiale e con revisione editoriale umana.