Roteamento
O que é fallback entre modelos?
Fallback é o que acontece quando o primeiro modelo falha — fora do ar, limitado ou recusando. Como funcionam as cadeias e por que o fallback silencioso é perigoso.
Todos os guias · Última revisão:
Por que não é opcional
Um fluxo com um único provedor herda exatamente a disponibilidade dele. Limites de uso, em especial, não são eventos raros: são a consequência normal de uma hora movimentada, e um fluxo sem fallback simplesmente para.
O fallback transforma uma falha dura em resposta degradada. Se isso é uma melhoria depende inteiramente de você ser avisado.
Escolher a ordem
A ordem intuitiva é «o próximo melhor modelo», mas em geral está errada. Se a primeira escolha falhou porque a requisição era longa demais, um modelo menor também falhará. Se recusou por conteúdo, um parecido recusará do mesmo jeito.
Uma ordem mais útil muda algo estrutural: outro provedor por completo, ou um modelo local com outras regras, em vez de um irmão que vai falhar igual.
A variante perigosa
Fallback silencioso é um sistema que responde discretamente com outro modelo e não diz nada. Você recebe uma resposta pior, atribui mentalmente ao modelo que escolheu e tira uma conclusão errada sobre ele.
Quando o fallback cruza uma fronteira de privacidade é pior do que uma conclusão errada. Sair de um modelo local para um provedor em nuvem manda dados exatamente para onde a pessoa escolheu não mandar. Uma cadeia que pode deixar a execução local deveria ser uma cadeia aceita explicitamente.
Como o ClawAI faz
Os modos de roteamento definem cadeias próprias, e o modo somente local mantém a sua em provedores locais em vez de buscar um modelo em nuvem quando o local está ocupado. Cada mensagem registra o modelo que de fato respondeu, então um fallback fica visível depois em vez de ser deduzido por uma mudança de tom.
Perguntas frequentes
- Fallback é o mesmo que uma nova tentativa?
- Uma nova tentativa manda a mesma requisição ao mesmo modelo, o que ajuda num erro passageiro. O fallback troca de modelo, o que ajuda quando o primeiro não consegue atender de jeito nenhum. Sistemas robustos fazem os dois, nessa ordem.
- O fallback deveria alguma vez ir de local para nuvem?
- Só se a pessoa pediu. A execução local costuma ser escolhida por um motivo que um fallback não consegue honrar, então o seguro é falhar e dizer em vez de ter sucesso em outro lugar.
- Quantos modelos uma cadeia deve ter?
- Dois ou três costumam bastar. Cadeias longas somam principalmente latência, porque cada tentativa fracassada é paga em tempo antes de a próxima começar.
Experimente em vez de ler sobre isso
Os modos de roteamento do ClawAI carregam cadeias de fallback próprias, e o somente local mantém a sua no local em vez de alcançar em silêncio um provedor em nuvem.