Saltar para o conteúdo principal

Recurso

Leitura em voz alta: ouça as respostas de IA na ClawAI

Como a ClawAI lê uma resposta em voz alta com fala gerada no servidor: reprodução que começa cedo, controles de pausar e parar, tratamento de respostas longas e nenhuma cobrança por trechos que falham.

Todos os recursos · Última revisão:

Como funciona a reprodução

Cada mensagem do assistente tem um botão Ler em voz alta com reproduzir, pausar e parar. A resposta é convertida em trechos, e a reprodução começa assim que o primeiro trecho curto fica pronto, para que você não precise esperar uma resposta longa ser processada por inteiro antes de ouvir algo.

Respostas longas e outros idiomas

São lidos até 12.000 caracteres de uma resposta, e você é avisado quando a resposta era mais longa do que isso e a reprodução foi interrompida. As frases são divididas corretamente em textos latinos, árabes, em hindi e em chinês, japonês e coreano, para que uma resposta multilíngue não tropece a cada ponto final.

Vozes, disponibilidade e cobrança

As vozes vêm de modelos de conversão de texto em fala do Gemini ou da OpenAI, escolhidos pelo operador. A leitura em voz alta é um recurso de plano; se nenhuma voz tiver sido atribuída, o botão avisa isso em vez de falhar em silêncio. Os trechos que falham na geração não são cobrados.

Perguntas frequentes

A leitura em voz alta usa a voz do meu navegador?
Não. A fala é gerada no servidor por um modelo de conversão de texto em fala do Gemini ou da OpenAI, então soa igual em qualquer dispositivo e navegador.
Ela consegue ler uma resposta muito longa?
Ela lê até 12.000 caracteres de uma resposta e avisa quando a resposta era mais longa do que isso, para que você saiba que a reprodução parou antes do fim.
Sou cobrado se a leitura em voz alta falhar?
Só pelos trechos que foram realmente gerados. Um trecho que falha não é cobrado, e você pode reproduzir a resposta novamente.

Experimente em vez de confiar na nossa palavra

A leitura em voz alta é um recurso de plano que usa um modelo de conversão de texto em fala no servidor, atribuído pelo operador; não é o mecanismo de fala do navegador.