Vai al contenuto principale

Funzionalità

Lettura ad alta voce: ascolta le risposte AI in ClawAI

Come ClawAI legge ad alta voce una risposta con una voce generata dal server: riproduzione che parte presto, comandi di pausa e stop, gestione delle risposte lunghe e nessun addebito per le parti non riuscite.

Tutte le funzionalità · Ultima revisione:

Come funziona la riproduzione

Ogni messaggio dell’assistente ha un pulsante Leggi ad alta voce con riproduci, pausa e stop. La risposta viene convertita a parti, e la riproduzione parte non appena la prima breve parte è pronta, così non devi aspettare che una risposta lunga sia elaborata per intero prima di sentire qualcosa.

Risposte lunghe e altre lingue

Vengono letti fino a 12.000 caratteri di una risposta, e ti viene segnalato quando una risposta era più lunga e la riproduzione è stata interrotta. Le frasi vengono suddivise correttamente per testi in alfabeto latino, arabo, hindi, cinese, giapponese e coreano, così una risposta multilingue non inciampa a ogni punto fermo.

Voci, disponibilità e fatturazione

Le voci provengono da modelli di sintesi vocale di Gemini o OpenAI, scelti dall’operatore. La lettura ad alta voce è una funzionalità di piano; se non è stata assegnata alcuna voce, il pulsante te lo dice invece di fallire in silenzio. Le parti che non vengono generate non sono addebitate.

Domande frequenti

La lettura ad alta voce usa la voce del mio browser?
No. La voce viene generata sul server da un modello di sintesi vocale di Gemini o OpenAI, quindi suona allo stesso modo su ogni dispositivo e browser.
Può leggere una risposta molto lunga?
Legge fino a 12.000 caratteri di una risposta e ti avvisa quando la risposta era più lunga, così sai che la riproduzione si è fermata prima.
Mi viene addebitato qualcosa se la lettura ad alta voce non riesce?
Solo le parti effettivamente generate. Una parte che non riesce non viene addebitata, e puoi riprodurre di nuovo la risposta.

Provalo invece di fidarti della nostra parola

La lettura ad alta voce è una funzionalità di piano che usa un modello di sintesi vocale lato server assegnato dall’operatore; non è il motore vocale del browser.