Como encaixar seus Agentes na camada de uso correta do OpenAI.

Depois de configurar um Agente de IA, uma de suas tarefas habituais é compreender a intenção de quem está ligando e transferir a chamada para o ramal apropriado. As ressalvas: seu Agente de IA deve ter acesso ao serviço da OpenAI e não deve estar sujeito a limites de taxa. Se o seu Agente de IA atingir um limite de taxa, o chamador não receberá resposta e o fluxo da chamada será interrompido. A chamada não será transferida e o chamador desligará. Para evitar atingir limites de taxa, estamos estabelecendo algumas diretrizes para você seguir.

Este blog é uma longa leitura! Em resumo, aqui está o que estamos abordando:

  • Mensagens de log típicas quando os limites de taxa são atingidos
  • Algumas considerações matemáticas sobre como estimar o consumo de tokens
    • A complexidade técnica de uma chamada e como ela afeta o consumo de tokens
    • Como as fontes de conhecimento afetam o consumo de tokens
  • Traduzindo limites de taxa para chamadas simultâneas de Agentes de IA
  • Como navegar pelo OpenAI para entender e ajustar seus limites de taxa
    • As contas da OpenAI que pagam no mínimo US$ 100 são normalmente promovidas diretamente para o Nível 3.

Mensagens de Log Quando os Limites de Taxa São Atingidos

Quando você atingir o limite de taxa do OpenAI, você pode ver isso no arquivo 3CXAI.log; aqui está um exemplo:

2026-03-09 10:17:26.674|DEBUG|{'call': 110, 'dir': 'ai', 'detail': True} [OpenAI] response.done content> :
{'type': 'response.done', 'event_id': 'event_DHYWMxZ4ipQABCDEFGHIJ', 'response':
{'object': 'realtime.response', 'id': 'resp_DHYWMnVTGk1234567890', 'status': 'failed', 'status_details':
{'type': 'failed', 'error':
{'type': 'tokens', 'code': 'rate_limit_exceeded',
'message': 'Rate limit reached for gpt-4o-realtime in organization org-LwDoeGAu4fbAABBCCDDEEFF on tokens per min (TPM): Limit 40000, Used 31222, Requested 14701. Please try again in 8.805s.
Visit https://platform.openai.com/account/rate-limits to learn more.'}},
'output': [], 'conversation_id': 'conv_DHYW8SqVAABBCCDDEEFFG', 'output_modalities': ['audio'], 'max_output_tokens': 'inf', 'audio': {'output': {'format': {'type': 'audio/pcm', 'rate': 24000}, 'voice': 'marin'}},
'usage': {'total_tokens': 0, 'input_tokens': 0, 'output_tokens': 0, 'input_token_details': {'text_tokens': 0, 'audio_tokens': 0, 'image_tokens': 0, 'cached_tokens': 0, 'cached_tokens_details':
{'text_tokens': 0, 'audio_tokens': 0, 'image_tokens': 0}}, 'output_token_details': {'text_tokens': 0, 'audio_tokens': 0}}, 'metadata': None}}

…que mostra claramente que

  • o limite de taxa de tokens por minuto (TPM) foi atingido
  • nenhuma solicitação pode ser tratada nos próximos 8.805 segundos

Também podemos ver o problema matematicamente:

  • o limite de taxa atual para esta conta é de 40.000 tokens por minuto
  • dentro do último minuto, 31.222 foram consumidos
  • isso deixa 8.778 disponíveis para uso
  • a solicitação feita teria exigido 14.701, o que excedeu o número de tokens disponíveis dentro da janela de tempo de um minuto

Consumo de Tokens – Cálculos Aproximados

Referência de Conversação Natural

  • O uso de tokens depende de vários fatores, incluindo:
    • idioma
    • modelo usado
    • estilo de conversa
    • número de palavras faladas
  • Aqui estão algumas suposições/médias do mundo real:
    • Uma conversa natural é normalmente conduzida em torno de 150 palavras por minuto
    • Cada chamada tem uma duração máxima de 7 minutos
    • Isso significa que uma conversa de 7 minutos seria de cerca de 1.050 palavras
  • A relação de conversão de tokens amplamente aceita do OpenAI (para inglês) é de 1 palavra consumindo 1,3 tokens
    • Uma conversa de 7 minutos consumiria 1.365 tokens

Podemos estimar que uma Conversação Natural atinja um máximo típico de 1.500 tokens.

Ajustes Baseados na Natureza e Complexidade da Chamada

  • Se quem está ligando estiver simplesmente verificando ou agendando uma reunião, o Agente de IA tem muito pouco a pensar.
    • Uma estimativa conservadora seria de cerca de 1.000 tokens máximos para a chamada
  • Se a ligação for uma conversa equilibrada sobre trabalho, a revisão de um documento ou uma conversa informal
    • Isso se encaixa na estimativa de ‘Conversação Natural’ de cerca de 1.500 tokens máximos para a chamada
  • Se a chamada for densa e técnica, podemos inferir que o Agente de IA precisa fazer mais “pensamento”:
    • Você pode estimar cerca de 2.500 tokens máximos para a chamada

Agentes de IA Usando Fontes de Conhecimento

Se você estiver usando fontes de conhecimento com seus Agentes de IA, você também deve considerar uma Sobrecarga de Token para a recuperação de fontes de conhecimento; estime até 2.000 tokens adicionais para o custo de recuperação.

Estimativa Total de Uso de Tokens

Com base nas suposições e estimativas acima, você pode concluir que uma chamada técnica de IA com fontes de conhecimento consumiria:

  • 2.500 tokens para a chamada
  • 2.000 tokens para a recuperação de fontes de conhecimento

Se você incluir uma reserva de segurança de 500 tokens, sua chamada consumiria 5.000 tokens, ou 714 tokens por minuto. Você pode arredondar isso para 1.000 tokens por minuto.

Quantas Chamadas de Agentes de IA Podem Ser Tratadas?

Você precisa se encaixar em 2 restrições:

  • Tokens por minuto
  • Solicitações por minuto

Tokens Por Minuto

Se você tiver configurado o limite de taxa do seu modelo de IA para 20.000 tokens por minuto, então a 1.000 TPM por chamada, o Agente de IA pode tratar 20 chamadas simultâneas.

Solicitações Por Minuto

Não vamos entrar em detalhes aqui, mas lembre-se de que cada chamada de IA pode gerar várias solicitações por minuto. Se você estiver configurando seu sistema para tratar, por exemplo, 50 chamadas simultâneas de IA, e os tipos de chamadas que você recebe normalmente geram 3 solicitações por minuto, então você também precisaria definir seu RPM para pelo menos 150.

Como Entender Os Níveis de Uso e Os Limites de Taxa da OpenAI

A maioria dos usuários começa, por padrão, no plano gratuito — por isso, é compreensível que você possa atingir os limites de taxa. As contas da OpenAI que pagam no mínimo US$ 100 são normalmente promovidas diretamente para o Nível 3.

Níveis de Uso e Os Limites de Taxa da OpenAI

Na Plataforma OpenAI, acesse o painel do seu projeto e vá até a página Projeto -> Limites; sob o título “Limites de taxa”, clique no botão “Selecionar modelos”.

Página de Limites do Projeto

 

Role até a seção “Limites de taxa em tempo real”, onde você pode ajustar seus limites de taxa, onde:

  • TPM é o seu máximo de Tokens Por Minuto
  • RPM é o seu máximo de Solicitações Por Minuto

A captura de tela acima é para uma conta que está no nível Free e você pode ver que o máximo permitido é 40.000 TPM e 3 RPM. Navegue até a página Organização -> Limites e edite seu orçamento para alterar para um nível mais alto.

Página de Limites do Orçamento

 

Você pode clicar no link do guia de limites de taxa para obter mais detalhes; segue a tabela principal de Níveis de Uso:

Guia de limites de taxa

Assim que você atingir os limites necessários, seu nível de camada será ajustado automaticamente. Navegue novamente até sua página Projeto -> Limites para aumentar seus limites conforme necessário.

Fórum

Continue a conversa em nosso fórum dedicado de IA. Siga-nos no X e LinkedIn para se manter atualizado sobre as últimas notícias e lançamentos de recursos.