Configurações avançadas do modelo por Robô: temperatura, Top P, teto de saída e esforço de raciocínio

Conversa Labs

Conversa Labs

Última atualização em Aug 12, 2026

Visão geral

Cada Robô já escolhe um modelo padrão e uma cadeia de fallbacks. As Configurações avançadas do modelo são um degrau abaixo disso: quatro ajustes que mudam como o modelo escolhido responde, sem mudar qual modelo é.

São quatro campos, todos opcionais:

Campo Faixa O que muda
Esforço de raciocínio Herdar / Nenhum / Baixo / Médio / Alto quanto o modelo "pensa" antes de responder, em famílias que têm raciocínio
Temperatura 0 a 2 valores mais altos deixam as respostas mais variadas; mais baixos, mais previsíveis
Top P acima de 0 até 1 amostragem por núcleo de probabilidade — geralmente ajustado no lugar da temperatura
Máximo de tokens de saída 1 ou mais teto de tokens gerados por resposta

Em branco (ou "Herdar") mantém o comportamento atual. Um Robô que nunca abrir esta seção continua exatamente como está: a plataforma só envia um ajuste ao provedor quando você escolheu um. Deixar em branco não é "zero" — é "não mande nada, use o padrão do provedor".

Pré-requisitos

  • Maestro habilitado e um Robô configurado.
  • Permissão de administrador para editar a configuração do Robô.
  • Saber qual modelo o Robô usa: os ajustes só valem onde o provedor daquele modelo os aceita (veja a tabela de compatibilidade adiante).

Passo a passo

  1. Abra a configuração do Robô.
  2. Vá até Configurações avançadas do modelo.
  3. Preencha apenas os campos que você quer mudar. Deixe os demais em branco.
  4. Salve.
  5. Faça uma conversa de teste com esse Robô e compare o resultado antes de aplicar o mesmo ajuste em outros.

Configurações & opções

Temperatura e Top P — ajuste um, não os dois

Os dois controlam a mesma coisa por caminhos diferentes: quanta variação a resposta pode ter. A prática recomendada pelos próprios provedores é mexer em um e deixar o outro em branco. Ajustar os dois ao mesmo tempo torna o resultado difícil de prever e mais difícil ainda de comparar entre duas versões do mesmo Robô.

Como referência prática:

  • Temperatura baixa (0 a 0.3): procedimento, resposta técnica, extração de dados, qualquer coisa que deva sair igual todas as vezes.
  • Temperatura média (0.4 a 0.6): atendimento comum, conversa natural sem virar imprevisível.
  • Temperatura alta (0.7 ou mais): redação criativa, variação proposital de mensagem. Raramente é o que se quer num atendimento.

Máximo de tokens de saída

É um teto por resposta, não um alvo. Serve para conter respostas longas demais para o canal (WhatsApp, principalmente) e para limitar custo por turno. Um teto muito baixo corta a resposta em vez de resumi-la — se as mensagens começarem a terminar no meio da frase, o teto está apertado demais.

Esforço de raciocínio

Vale para modelos com raciocínio (as famílias o-series/gpt-5.x da OpenAI, o DeepSeek e afins). Mais esforço costuma significar resposta melhor em tarefas difíceis, mais tempo de espera e mais custo.

Este campo tem um segundo efeito, que é o motivo pelo qual ele existe no formulário: escolher um valor aqui também evita que o roteador force a troca automática de endpoint quando o modelo é de raciocínio e tem ferramentas vinculadas. Se você já decidiu como o modelo deve raciocinar, a plataforma respeita a sua decisão em vez de decidir por você.

Onde cada ajuste vale — e onde é descartado

Cada provedor escreve esses parâmetros com nomes diferentes, e alguns simplesmente não têm o parâmetro. A plataforma traduz o valor para o nome correto do provedor e, quando aquele provedor não tem o parâmetro, descarta o ajuste em vez de inventar um nome que a chamada recusaria.

Ajuste Onde é descartado
Temperatura em modelos de raciocínio da OpenAI (a família não aceita)
Top P em modelos de raciocínio da OpenAI; no Groq e na Cohere, que não expõem o parâmetro
Máximo de tokens de saída na Cohere
Esforço de raciocínio em Anthropic, Google, Cohere, Ollama, xAI e OpenRouter

Sobre a primeira linha: nos modelos de raciocínio da OpenAI, temperatura e Top P são descartados juntos, de propósito. Antes a temperatura sumia em silêncio enquanto o Top P seguia adiante e derrubava a chamada — o mesmo valor no painel se comportava de duas formas diferentes dependendo de qual campo você preencheu.

Descartado é silencioso. Não vira erro no atendimento nem aviso nesta tela. Se um ajuste parece não ter efeito, confira a tabela acima antes de procurar defeito.

Valor inválido: quem recusa é o provedor

A plataforma valida as faixas no formulário (temperatura 0 a 2, Top P acima de 0 até 1, teto de saída 1 ou mais). Fora isso, quem decide se um valor é aceitável é o provedor do modelo — e a mensagem de erro que aparecer vem de lá, não da plataforma. Na dúvida, deixe em branco.

Casos de uso

  • Robô de suporte com procedimento fixo: temperatura 0.1, para a mesma pergunta receber sempre a mesma resposta.
  • Robô de vendas: temperatura 0.5 a 0.6 — conversa natural sem inventar variações a cada turno.
  • Robô que só extrai dados (registrar pedido, preencher cadastro): temperatura 0.1 e teto de saída baixo; a resposta é curta por natureza.
  • Robô num canal com limite de tamanho: teto de saída para as mensagens não saírem enormes.
  • Tarefa difícil e sem pressa (análise, diagnóstico): esforço de raciocínio Alto, aceitando mais tempo e mais custo.
  • Modelo de raciocínio com ferramentas em que você quer controlar o comportamento: defina o esforço explicitamente em vez de deixar a plataforma decidir.

Dicas, limites e boas práticas

  • Mude um campo por vez e teste. Dois ajustes ao mesmo tempo tornam impossível saber qual deles causou a diferença.
  • Temperatura OU Top P. Não os dois.
  • Em branco não é zero. Apagar o campo devolve a decisão ao provedor; escrever 0 é uma escolha sua, com efeito real (temperatura 0 = o mais previsível possível).
  • Esforço de raciocínio custa tempo e dinheiro. Em atendimento por WhatsApp, um esforço alto pode deixar a resposta lenta o suficiente para o contato desistir.
  • Estes ajustes não trocam o modelo. Se a qualidade não melhora mexendo aqui, o próximo passo é trocar o modelo padrão, não subir a temperatura.
  • A cadeia de fallback continua valendo. Os ajustes são aplicados por cima do modelo que efetivamente atender o turno — inclusive um fallback, quando o principal falha.
  • Um Robô sem estes campos preenchidos não é um Robô mal configurado. Os padrões dos provedores são bons para a maioria dos atendimentos.

Solução de problemas

  • "Mudei a temperatura e nada mudou": o modelo do Robô é de raciocínio da OpenAI — nessa família temperatura e Top P são descartados. Troque o modelo ou use o esforço de raciocínio.
  • "Coloquei Top P e continua igual": além do caso acima, Groq e Cohere não expõem esse parâmetro.
  • "As respostas estão sendo cortadas no meio": o Máximo de tokens de saída está baixo demais. Aumente ou deixe em branco.
  • "O provedor recusou a chamada": o valor está fora do que aquele modelo aceita. A mensagem vem do provedor; limpe o campo e teste de novo.
  • "O Robô ficou lento": esforço de raciocínio alto, ou um modelo de raciocínio onde bastaria um modelo comum.
  • "Escolhi o esforço de raciocínio e o modelo não é de raciocínio": o ajuste é descartado. Não quebra nada, só não faz efeito.

Veja também