## Visão geral

Cada Robô já escolhe um **modelo padrão** e uma **cadeia de fallbacks**. As **Configurações avançadas
do modelo** são um degrau abaixo disso: quatro ajustes que mudam **como** o modelo escolhido responde,
sem mudar **qual** modelo é.

São quatro campos, todos opcionais:

| Campo | Faixa | O que muda |
|---|---|---|
| **Esforço de raciocínio** | Herdar / Nenhum / Baixo / Médio / Alto | quanto o modelo "pensa" antes de responder, em famílias que têm raciocínio |
| **Temperatura** | 0 a 2 | valores mais altos deixam as respostas mais variadas; mais baixos, mais previsíveis |
| **Top P** | acima de 0 até 1 | amostragem por núcleo de probabilidade — geralmente ajustado **no lugar** da temperatura |
| **Máximo de tokens de saída** | 1 ou mais | teto de tokens gerados por resposta |

> **Em branco (ou "Herdar") mantém o comportamento atual.** Um Robô que nunca abrir esta seção
> continua exatamente como está: a plataforma só envia um ajuste ao provedor quando você escolheu um.
> Deixar em branco **não** é "zero" — é "não mande nada, use o padrão do provedor".

## Pré-requisitos

- **Maestro habilitado** e um Robô configurado.
- Permissão de **administrador** para editar a configuração do Robô.
- Saber qual **modelo** o Robô usa: os ajustes só valem onde o provedor daquele modelo os aceita
  (veja a tabela de compatibilidade adiante).

## Passo a passo

1. Abra a configuração do Robô.
2. Vá até **Configurações avançadas do modelo**.
3. Preencha **apenas** os campos que você quer mudar. Deixe os demais em branco.
4. Salve.
5. Faça uma conversa de teste com esse Robô e compare o resultado antes de aplicar o mesmo ajuste em
   outros.

## Configurações & opções

### Temperatura e Top P — ajuste um, não os dois

Os dois controlam a mesma coisa por caminhos diferentes: quanta variação a resposta pode ter. A
prática recomendada pelos próprios provedores é **mexer em um e deixar o outro em branco**. Ajustar
os dois ao mesmo tempo torna o resultado difícil de prever e mais difícil ainda de comparar entre
duas versões do mesmo Robô.

Como referência prática:

- **Temperatura baixa (0 a 0.3)**: procedimento, resposta técnica, extração de dados, qualquer coisa
  que deva sair igual todas as vezes.
- **Temperatura média (0.4 a 0.6)**: atendimento comum, conversa natural sem virar imprevisível.
- **Temperatura alta (0.7 ou mais)**: redação criativa, variação proposital de mensagem. Raramente é
  o que se quer num atendimento.

### Máximo de tokens de saída

É um **teto por resposta**, não um alvo. Serve para conter respostas longas demais para o canal
(WhatsApp, principalmente) e para limitar custo por turno. Um teto muito baixo **corta** a resposta em
vez de resumi-la — se as mensagens começarem a terminar no meio da frase, o teto está apertado
demais.

### Esforço de raciocínio

Vale para modelos com raciocínio (as famílias o-series/gpt-5.x da OpenAI, o DeepSeek e afins). Mais
esforço costuma significar resposta melhor em tarefas difíceis, mais tempo de espera e mais custo.

Este campo tem um segundo efeito, que é o motivo pelo qual ele existe no formulário: escolher um valor
aqui também **evita que o roteador force a troca automática de endpoint** quando o modelo é de
raciocínio **e** tem ferramentas vinculadas. Se você já decidiu como o modelo deve raciocinar, a
plataforma respeita a sua decisão em vez de decidir por você.

### Onde cada ajuste vale — e onde é descartado

Cada provedor escreve esses parâmetros com nomes diferentes, e alguns simplesmente não têm o
parâmetro. A plataforma traduz o valor para o nome correto do provedor e, quando aquele provedor
**não tem** o parâmetro, **descarta o ajuste** em vez de inventar um nome que a chamada recusaria.

| Ajuste | Onde é descartado |
|---|---|
| **Temperatura** | em modelos de raciocínio da OpenAI (a família não aceita) |
| **Top P** | em modelos de raciocínio da OpenAI; no Groq e na Cohere, que não expõem o parâmetro |
| **Máximo de tokens de saída** | na Cohere |
| **Esforço de raciocínio** | em Anthropic, Google, Cohere, Ollama, xAI e OpenRouter |

Sobre a primeira linha: nos modelos de raciocínio da OpenAI, **temperatura e Top P são descartados
juntos, de propósito**. Antes a temperatura sumia em silêncio enquanto o Top P seguia adiante e
derrubava a chamada — o mesmo valor no painel se comportava de duas formas diferentes dependendo de
qual campo você preencheu.

**Descartado é silencioso.** Não vira erro no atendimento nem aviso nesta tela. Se um ajuste parece
não ter efeito, confira a tabela acima antes de procurar defeito.

### Valor inválido: quem recusa é o provedor

A plataforma valida as faixas no formulário (temperatura 0 a 2, Top P acima de 0 até 1, teto de saída
1 ou mais). Fora isso, quem decide se um valor é aceitável é **o provedor do modelo** — e a mensagem
de erro que aparecer vem de lá, não da plataforma. Na dúvida, deixe em branco.

## Casos de uso

- **Robô de suporte com procedimento fixo**: temperatura 0.1, para a mesma pergunta receber sempre a
  mesma resposta.
- **Robô de vendas**: temperatura 0.5 a 0.6 — conversa natural sem inventar variações a cada turno.
- **Robô que só extrai dados** (registrar pedido, preencher cadastro): temperatura 0.1 e teto de
  saída baixo; a resposta é curta por natureza.
- **Robô num canal com limite de tamanho**: teto de saída para as mensagens não saírem enormes.
- **Tarefa difícil e sem pressa** (análise, diagnóstico): esforço de raciocínio **Alto**, aceitando
  mais tempo e mais custo.
- **Modelo de raciocínio com ferramentas** em que você quer controlar o comportamento: defina o
  esforço explicitamente em vez de deixar a plataforma decidir.

## Dicas, limites e boas práticas

- **Mude um campo por vez** e teste. Dois ajustes ao mesmo tempo tornam impossível saber qual deles
  causou a diferença.
- **Temperatura OU Top P.** Não os dois.
- **Em branco não é zero.** Apagar o campo devolve a decisão ao provedor; escrever `0` é uma escolha
  sua, com efeito real (temperatura 0 = o mais previsível possível).
- **Esforço de raciocínio custa tempo e dinheiro.** Em atendimento por WhatsApp, um esforço alto pode
  deixar a resposta lenta o suficiente para o contato desistir.
- **Estes ajustes não trocam o modelo.** Se a qualidade não melhora mexendo aqui, o próximo passo é
  trocar o modelo padrão, não subir a temperatura.
- **A cadeia de fallback continua valendo.** Os ajustes são aplicados por cima do modelo que
  efetivamente atender o turno — inclusive um fallback, quando o principal falha.
- **Um Robô sem estes campos preenchidos não é um Robô mal configurado.** Os padrões dos provedores
  são bons para a maioria dos atendimentos.

## Solução de problemas

- **"Mudei a temperatura e nada mudou"**: o modelo do Robô é de raciocínio da OpenAI — nessa família
  temperatura e Top P são descartados. Troque o modelo ou use o esforço de raciocínio.
- **"Coloquei Top P e continua igual"**: além do caso acima, Groq e Cohere não expõem esse parâmetro.
- **"As respostas estão sendo cortadas no meio"**: o **Máximo de tokens de saída** está baixo demais.
  Aumente ou deixe em branco.
- **"O provedor recusou a chamada"**: o valor está fora do que aquele modelo aceita. A mensagem vem do
  provedor; limpe o campo e teste de novo.
- **"O Robô ficou lento"**: esforço de raciocínio alto, ou um modelo de raciocínio onde bastaria um
  modelo comum.
- **"Escolhi o esforço de raciocínio e o modelo não é de raciocínio"**: o ajuste é descartado. Não
  quebra nada, só não faz efeito.

## Veja também

- [Modelos portáteis: um Robô, vários provedores](/hc/ajuda/articles/maestro-brain-modelos-portateis-pt-br)
- [Provedor DeepSeek](/hc/ajuda/articles/maestro-brain-provedor-deepseek-pt-br)
- [Sequência de atendimento](/hc/ajuda/articles/maestro-brain-sequencia-de-atendimento-pt-br)
- [Verificação de turno e retenção da resposta](/hc/ajuda/articles/maestro-brain-verificacao-de-turno-pt-br)
- [O que é o Maestro IA e o Cérebro da Conta](/hc/ajuda/articles/maestro-brain-overview-pt-br)