Salta ai contenuti

Configurare lo Smart Token Engine

Apri Impostazioni → Smart Token Engine per cambiare il modo in cui Kora prepara il contesto e i parametri di generazione dei messaggi successivi.

Modalità Comportamento dell’app
Auto Seleziona Eco, Balanced o Quality dalla finestra di contesto del modello attivo
Eco Usa una variabilità di generazione più bassa
Balanced Usa le impostazioni di generazione predefinite
Quality Usa una variabilità più alta e disattiva Output Optimization

La modalità non ha effetto quando tutti i livelli di ottimizzazione sono disattivati. Usa il controllo di ottimizzazione nella chat per sostituire la modalità globale nella sessione corrente.

Seleziona Auto come prima opzione in Impostazioni → Smart Token Engine quando il default deve seguire il modello scelto per un turno:

Finestra di contesto del modello Modalità effettiva
Fino a 128k Eco
Oltre 128k e fino a 512k Balanced
Oltre 512k Quality

Il controllo della chat mostra il risultato come Auto · Eco, Auto · Balanced oppure Auto · Quality. Cambiare modello tra un turno e l’altro ricalcola il risultato prima della richiesta successiva. L’override di temperatura per modello mantiene la precedenza sulla temperatura della modalità selezionata.

Il controllo della chat è una preferenza di sessione. Nella stessa sessione puoi passare tra Auto e una modalità manuale quante volte vuoi; ogni modifica vale dal messaggio successivo. Le nuove sessioni partono dalla selezione globale nelle Impostazioni.

Controllo Effetto nell’app
Adaptive Parameters Applica i parametri di generazione della modalità selezionata
Output Optimization Chiede al modello di mantenere concisa la risposta; non è disponibile in modalità Quality
Predictive Compaction Compatta la conversazione prima che raggiunga il limite di contesto del modello
Adaptive Context Seleziona i messaggi meno recenti per rilevanza e conserva quelli recenti

Usa Global temperature override per sostituire la temperatura della modalità per tutti i modelli. L’intervallo è 0.02.0. Clicca Reset per tornare alla modalità selezionata. La temperatura per modello ha la precedenza su questo valore.

Quando Predictive Compaction è attivo, imposta Autocompaction ceiling tra 50% e 95%. Kora avvia la compattazione preventiva cinque punti percentuali prima della soglia scelta. Clicca Reset per ripristinare 90%.

Quando Adaptive Context è attivo:

  • Top-K Messages imposta il numero massimo di messaggi selezionati per rilevanza.
  • Always Keep Recent imposta quanti messaggi recenti restano nel contesto indipendentemente dalla rilevanza.

Attiva Local model bare prompt per rimuovere il contesto di sistema generato da Kora per i provider personalizzati su localhost. Lascia vuoto il prompt facoltativo per non inviare il campo system oppure inserisci il prompt minimo da inviare. I provider remoti ignorano questa impostazione.

  1. Apri Impostazioni → Smart Token Engine.
  2. Seleziona Auto, Eco, Balanced o Quality.
  3. Attiva i livelli che vuoi applicare.
  4. Regola i controlli mostrati per quei livelli.
  5. Chiudi le Impostazioni. Le modifiche si applicano al messaggio successivo.
  • La modalità selezionata non ha effetto → attiva almeno un livello di ottimizzazione.
  • Le risposte sono troppo concise → disattiva Output Optimization o seleziona Quality.
  • La cronologia viene compattata troppo presto → aumenta Autocompaction ceiling.
  • Un modello locale riceve ancora il contesto di Kora → verifica che la base URL usi localhost e che Local model bare prompt sia attivo.