Visão geral
Cada Robô já escolhe um modelo padrão e uma cadeia de fallbacks. As Configurações avançadas do modelo são um degrau abaixo disso: quatro ajustes que mudam como o modelo escolhido responde, sem mudar qual modelo é.
São quatro campos, todos opcionais:
| Campo | Faixa | O que muda |
|---|---|---|
| Esforço de raciocínio | Herdar / Nenhum / Baixo / Médio / Alto | quanto o modelo "pensa" antes de responder, em famílias que têm raciocínio |
| Temperatura | 0 a 2 | valores mais altos deixam as respostas mais variadas; mais baixos, mais previsíveis |
| Top P | acima de 0 até 1 | amostragem por núcleo de probabilidade — geralmente ajustado no lugar da temperatura |
| Máximo de tokens de saída | 1 ou mais | teto de tokens gerados por resposta |
Em branco (ou "Herdar") mantém o comportamento atual. Um Robô que nunca abrir esta seção continua exatamente como está: a plataforma só envia um ajuste ao provedor quando você escolheu um. Deixar em branco não é "zero" — é "não mande nada, use o padrão do provedor".
Pré-requisitos
- Maestro habilitado e um Robô configurado.
- Permissão de administrador para editar a configuração do Robô.
- Saber qual modelo o Robô usa: os ajustes só valem onde o provedor daquele modelo os aceita (veja a tabela de compatibilidade adiante).
Passo a passo
- Abra a configuração do Robô.
- Vá até Configurações avançadas do modelo.
- Preencha apenas os campos que você quer mudar. Deixe os demais em branco.
- Salve.
- Faça uma conversa de teste com esse Robô e compare o resultado antes de aplicar o mesmo ajuste em outros.
Configurações & opções
Temperatura e Top P — ajuste um, não os dois
Os dois controlam a mesma coisa por caminhos diferentes: quanta variação a resposta pode ter. A prática recomendada pelos próprios provedores é mexer em um e deixar o outro em branco. Ajustar os dois ao mesmo tempo torna o resultado difícil de prever e mais difícil ainda de comparar entre duas versões do mesmo Robô.
Como referência prática:
- Temperatura baixa (0 a 0.3): procedimento, resposta técnica, extração de dados, qualquer coisa que deva sair igual todas as vezes.
- Temperatura média (0.4 a 0.6): atendimento comum, conversa natural sem virar imprevisível.
- Temperatura alta (0.7 ou mais): redação criativa, variação proposital de mensagem. Raramente é o que se quer num atendimento.
Máximo de tokens de saída
É um teto por resposta, não um alvo. Serve para conter respostas longas demais para o canal (WhatsApp, principalmente) e para limitar custo por turno. Um teto muito baixo corta a resposta em vez de resumi-la — se as mensagens começarem a terminar no meio da frase, o teto está apertado demais.
Esforço de raciocínio
Vale para modelos com raciocínio (as famílias o-series/gpt-5.x da OpenAI, o DeepSeek e afins). Mais esforço costuma significar resposta melhor em tarefas difíceis, mais tempo de espera e mais custo.
Este campo tem um segundo efeito, que é o motivo pelo qual ele existe no formulário: escolher um valor aqui também evita que o roteador force a troca automática de endpoint quando o modelo é de raciocínio e tem ferramentas vinculadas. Se você já decidiu como o modelo deve raciocinar, a plataforma respeita a sua decisão em vez de decidir por você.
Onde cada ajuste vale — e onde é descartado
Cada provedor escreve esses parâmetros com nomes diferentes, e alguns simplesmente não têm o parâmetro. A plataforma traduz o valor para o nome correto do provedor e, quando aquele provedor não tem o parâmetro, descarta o ajuste em vez de inventar um nome que a chamada recusaria.
| Ajuste | Onde é descartado |
|---|---|
| Temperatura | em modelos de raciocínio da OpenAI (a família não aceita) |
| Top P | em modelos de raciocínio da OpenAI; no Groq e na Cohere, que não expõem o parâmetro |
| Máximo de tokens de saída | na Cohere |
| Esforço de raciocínio | em Anthropic, Google, Cohere, Ollama, xAI e OpenRouter |
Sobre a primeira linha: nos modelos de raciocínio da OpenAI, temperatura e Top P são descartados juntos, de propósito. Antes a temperatura sumia em silêncio enquanto o Top P seguia adiante e derrubava a chamada — o mesmo valor no painel se comportava de duas formas diferentes dependendo de qual campo você preencheu.
Descartado é silencioso. Não vira erro no atendimento nem aviso nesta tela. Se um ajuste parece não ter efeito, confira a tabela acima antes de procurar defeito.
Valor inválido: quem recusa é o provedor
A plataforma valida as faixas no formulário (temperatura 0 a 2, Top P acima de 0 até 1, teto de saída 1 ou mais). Fora isso, quem decide se um valor é aceitável é o provedor do modelo — e a mensagem de erro que aparecer vem de lá, não da plataforma. Na dúvida, deixe em branco.
Casos de uso
- Robô de suporte com procedimento fixo: temperatura 0.1, para a mesma pergunta receber sempre a mesma resposta.
- Robô de vendas: temperatura 0.5 a 0.6 — conversa natural sem inventar variações a cada turno.
- Robô que só extrai dados (registrar pedido, preencher cadastro): temperatura 0.1 e teto de saída baixo; a resposta é curta por natureza.
- Robô num canal com limite de tamanho: teto de saída para as mensagens não saírem enormes.
- Tarefa difícil e sem pressa (análise, diagnóstico): esforço de raciocínio Alto, aceitando mais tempo e mais custo.
- Modelo de raciocínio com ferramentas em que você quer controlar o comportamento: defina o esforço explicitamente em vez de deixar a plataforma decidir.
Dicas, limites e boas práticas
- Mude um campo por vez e teste. Dois ajustes ao mesmo tempo tornam impossível saber qual deles causou a diferença.
- Temperatura OU Top P. Não os dois.
- Em branco não é zero. Apagar o campo devolve a decisão ao provedor; escrever
0é uma escolha sua, com efeito real (temperatura 0 = o mais previsível possível). - Esforço de raciocínio custa tempo e dinheiro. Em atendimento por WhatsApp, um esforço alto pode deixar a resposta lenta o suficiente para o contato desistir.
- Estes ajustes não trocam o modelo. Se a qualidade não melhora mexendo aqui, o próximo passo é trocar o modelo padrão, não subir a temperatura.
- A cadeia de fallback continua valendo. Os ajustes são aplicados por cima do modelo que efetivamente atender o turno — inclusive um fallback, quando o principal falha.
- Um Robô sem estes campos preenchidos não é um Robô mal configurado. Os padrões dos provedores são bons para a maioria dos atendimentos.
Solução de problemas
- "Mudei a temperatura e nada mudou": o modelo do Robô é de raciocínio da OpenAI — nessa família temperatura e Top P são descartados. Troque o modelo ou use o esforço de raciocínio.
- "Coloquei Top P e continua igual": além do caso acima, Groq e Cohere não expõem esse parâmetro.
- "As respostas estão sendo cortadas no meio": o Máximo de tokens de saída está baixo demais. Aumente ou deixe em branco.
- "O provedor recusou a chamada": o valor está fora do que aquele modelo aceita. A mensagem vem do provedor; limpe o campo e teste de novo.
- "O Robô ficou lento": esforço de raciocínio alto, ou um modelo de raciocínio onde bastaria um modelo comum.
- "Escolhi o esforço de raciocínio e o modelo não é de raciocínio": o ajuste é descartado. Não quebra nada, só não faz efeito.