Questa pagina è stata tradotta da un’IA e può contenere imprecisioni. Fa fede la versione inglese. Vedi la versione inglese

Research / Lexa 3.0

Lexa

Il modello di ripetizione dilazionata (SRS) sviluppato da Mibuki. Su tre benchmark pubblici batte con ampio margine le impostazioni predefinite dello standard di settore FSRS-7 — con un'accuratezza personalizzata elevata già prima di qualsiasi ottimizzazione per singolo utente.

← Torna a LangDict
3
public benchmarks
+0.095
Duolingo
0
per-user fitting
01

In-context cross-card

Le tue abitudini di memoria sono condivise tra le carte — quindi le tue altre carte sono l'indizio migliore.

Il cuore di uno scheduler a ripetizione dilazionata è prevedere quanto bene ricorderai una carta, e da lì decidere quando riproporla. Lo standard di settore, FSRS, personalizza adattando i parametri per ogni utente (per-user fitting) — potente, ma richiede una calibrazione per ciascun utente.

Lexa prende la strada opposta. Tratti come la velocità con cui dimentichi, il modo in cui valuti e il tuo ritmo di ripasso sono condivisi tra le tue carte. Lexa legge non solo la carta bersaglio, ma lo storico dei ripassi delle tue altre carte come input in-context, così un unico modello condiviso si personalizza senza alcuna calibrazione per singolo utente.

In altre parole — invece di imparare «le tendenze degli altri utenti», legge come dimentichi tu direttamente dal resto delle tue carte. È questo che c'è di nuovo in Lexa.

02

Come funziona

Legge lo storico delle tue altre carte, stima quanto bene ogni carta è trattenuta e fissa la data del prossimo ripasso.

  1. 01

    Lo storico dei ripassi delle tue altre carte (in ordine cronologico)

    banana · cat · apple ?

  2. 02

    Lexa Transformer

    Un unico modello globale · ~19K parametri

  3. 03

    Stima della forza del ricordo

    quanto è difficile dimenticare ogni carta

  4. 04

    Prossimo ripasso

    mostrata appena prima che tu dimentichi

03

Accuratezza

Lexa batte FSRS-7 pronto all'uso (impostazioni predefinite) su tutti e tre i benchmark pubblici — prima di qualsiasi ottimizzazione per singolo utente.

Anki

0.646
0.682

Duolingo

0.577
0.672

maimemo

0.488
0.538
Punteggio di previsione della memoria (1 − Log Loss, più alto è meglio)

Lexa non richiede alcuna calibrazione o addestramento per singolo utente ed è accurata senza una fase di fitting personale. Appena presa — prima che uno qualsiasi dei due modelli venga adattato a te — batte già le impostazioni predefinite di FSRS-7 su tutti e tre i dataset. Il margine non è uniforme: +0.095 su Duolingo, +0.050 su maimemo, +0.036 su Anki.

FSRS si muove in fretta. Quello che pubblichiamo qui è il confronto alle date indicate sopra; una versione più recente di FSRS potrebbe ottenere punteggi diversi. La baseline è la configurazione predefinita di FSRS-7, e i valori di baseline qui sotto sono stati ricalcolati a partire dall'esecuzione archiviata nel repository di LangDict (research/srs-benchmark/result) e coincidono.

Punteggio di previsione della memoria (1 − Log Loss, più alto è meglio). Log Loss grezzo tra parentesi (più basso è meglio). Confrontato con le impostazioni predefinite di FSRS-7.
DatasetFSRS-7 (default)Lexa 3.0
Anki0.646 (.3543)0.682 (.3184)
Duolingo0.577 (.4231)0.672 (.3280)
maimemo0.488 (.5121)0.538 (.4621)
04

Come valutiamo

Valutato su tre dataset del mondo reale.

01Anki
~727M ripassi / 10.000 utentiFlashcard standard
02maimemo
~226M ripassi / lessicoApp cinese di vocabolario
03Duolingo
~13M ripassi / a sessioniDataset HLR

Metrica: per-user weighted Log Loss (più basso è meglio).

05

Che cosa significa per chi usa LangDict

L'accuratezza non è solo un numero da benchmark — dà forma direttamente al tuo studio.

  1. 01

    Meno ripassi in programma

    Lexa individua con precisione il momento in cui stai per dimenticare. Troppo presto e i ripassi sono noiosi; troppo tardi e devi riimparare. Lexa restringe quella finestra. Nell'app, il report mostra di quanto ha ridotto i ripassi programmati negli ultimi 7 giorni. Quel numero viene dal rieseguire lo stesso storico di studio attraverso SM-2 e confrontare — è una stima del carico di scheduling, non una misurazione dei risultati di apprendimento.

  2. 02

    Zero configurazione, funziona dal primo giorno

    Nessun parametro da regolare e nessuna attesa per l'apprendimento sul singolo utente. Apri l'app e studia — programma su di te fin dall'inizio.

  3. 03

    Sul dispositivo e privata

    La personalizzazione gira interamente sul tuo dispositivo. Privacy e accuratezza insieme.

  4. 04

    In continuo miglioramento

    Continuiamo a sperimentare sulla nostra pipeline di benchmark e a migliorare senza sosta il modello che distribuiamo.

06

References

  1. 01

    open-spaced-repetition. FSRS: Free Spaced Repetition Scheduler. GitHub ↗

  2. 02

    open-spaced-repetition. srs-benchmark: Benchmark of Spaced Repetition Algorithms. GitHub ↗

  3. 03

    open-spaced-repetition. anki-revlogs-10k: Anki review logs from 10,000 users. Hugging Face ↗

  4. 04

    Settles, B., & Meeder, B. (2016). A Trainable Spaced Repetition Model for Language Learning. Proceedings of the 54th Annual Meeting of the ACL.

  5. 05

    Ebbinghaus, H. (1885). Über das Gedächtnis: Untersuchungen zur experimentellen Psychologie. Leipzig: Duncker & Humblot.

← Torna a LangDict