Configurare lo Smart Token Engine
Apri Impostazioni → Smart Token Engine per cambiare il modo in cui Kora prepara il contesto e i parametri di generazione dei messaggi successivi.
Scegliere una modalità di ottimizzazione
Sezione intitolata “Scegliere una modalità di ottimizzazione”| Modalità | Comportamento dell’app |
|---|---|
| Auto | Seleziona Eco, Balanced o Quality dalla finestra di contesto del modello attivo |
| Eco | Usa una variabilità di generazione più bassa |
| Balanced | Usa le impostazioni di generazione predefinite |
| Quality | Usa una variabilità più alta e disattiva Output Optimization |
La modalità non ha effetto quando tutti i livelli di ottimizzazione sono disattivati. Usa il controllo di ottimizzazione nella chat per sostituire la modalità globale nella sessione corrente.
Usare Auto con il modello attivo
Sezione intitolata “Usare Auto con il modello attivo”Seleziona Auto come prima opzione in Impostazioni → Smart Token Engine quando il default deve seguire il modello scelto per un turno:
| Finestra di contesto del modello | Modalità effettiva |
|---|---|
Fino a 128k |
Eco |
Oltre 128k e fino a 512k |
Balanced |
Oltre 512k |
Quality |
Il controllo della chat mostra il risultato come Auto · Eco, Auto · Balanced oppure Auto · Quality. Cambiare modello tra un turno e l’altro ricalcola il risultato prima della richiesta successiva. L’override di temperatura per modello mantiene la precedenza sulla temperatura della modalità selezionata.
Il controllo della chat è una preferenza di sessione. Nella stessa sessione puoi passare tra Auto e una modalità manuale quante volte vuoi; ogni modifica vale dal messaggio successivo. Le nuove sessioni partono dalla selezione globale nelle Impostazioni.
Attivare i livelli di ottimizzazione
Sezione intitolata “Attivare i livelli di ottimizzazione”| Controllo | Effetto nell’app |
|---|---|
| Adaptive Parameters | Applica i parametri di generazione della modalità selezionata |
| Output Optimization | Chiede al modello di mantenere concisa la risposta; non è disponibile in modalità Quality |
| Predictive Compaction | Compatta la conversazione prima che raggiunga il limite di contesto del modello |
| Adaptive Context | Seleziona i messaggi meno recenti per rilevanza e conserva quelli recenti |
Impostare la temperatura globale
Sezione intitolata “Impostare la temperatura globale”Usa Global temperature override per sostituire la temperatura della modalità per tutti i modelli. L’intervallo è 0.0–2.0. Clicca Reset per tornare alla modalità selezionata. La temperatura per modello ha la precedenza su questo valore.
Impostare la soglia di compattazione
Sezione intitolata “Impostare la soglia di compattazione”Quando Predictive Compaction è attivo, imposta Autocompaction ceiling tra 50% e 95%. Kora avvia la compattazione preventiva cinque punti percentuali prima della soglia scelta. Clicca Reset per ripristinare 90%.
Configurare Adaptive Context
Sezione intitolata “Configurare Adaptive Context”Quando Adaptive Context è attivo:
- Top-K Messages imposta il numero massimo di messaggi selezionati per rilevanza.
- Always Keep Recent imposta quanti messaggi recenti restano nel contesto indipendentemente dalla rilevanza.
Usare un prompt minimo con i modelli locali
Sezione intitolata “Usare un prompt minimo con i modelli locali”Attiva Local model bare prompt per rimuovere il contesto di sistema generato da Kora per i provider personalizzati su localhost. Lascia vuoto il prompt facoltativo per non inviare il campo system oppure inserisci il prompt minimo da inviare. I provider remoti ignorano questa impostazione.
Applicare una configurazione
Sezione intitolata “Applicare una configurazione”- Apri Impostazioni → Smart Token Engine.
- Seleziona Auto, Eco, Balanced o Quality.
- Attiva i livelli che vuoi applicare.
- Regola i controlli mostrati per quei livelli.
- Chiudi le Impostazioni. Le modifiche si applicano al messaggio successivo.
Risoluzione problemi
Sezione intitolata “Risoluzione problemi”- La modalità selezionata non ha effetto → attiva almeno un livello di ottimizzazione.
- Le risposte sono troppo concise → disattiva Output Optimization o seleziona Quality.
- La cronologia viene compattata troppo presto → aumenta Autocompaction ceiling.
- Un modello locale riceve ancora il contesto di Kora → verifica che la base URL usi localhost e che Local model bare prompt sia attivo.