AIVAX

Esta página foi traduzida automaticamente do inglês e pode estar desatualizada. Leia o original

Planos e Limites

AIVAX tem três planos de conta: Free, Pro e Max. O plano atual é armazenado na conta e controla o acesso ao modelo, comissões, limites de taxa, cotas de RAG, limites de ferramentas, cota de armazenamento, retenção de conversas e permissões diárias incluídas.

Para preços de assinatura comercial e empacotamento de planos, use a AIVAX pricing page. Esta página documenta os limites técnicos da API.

Como os limites são aplicados #

Os limites são aplicados em diferentes camadas:

  • A autenticação rejeita chaves de API ausentes, expiradas ou desconhecidas.
  • Chaves de API públicas são restritas a rotas públicas e têm limites de requisição e token por chave e por IP.
  • O middleware de saldo rejeita requisições pagas quando o saldo da conta está abaixo do mínimo exigido.
  • O middleware de armazenamento rejeita requisições quando o armazenamento da conta excede a cota do plano.
  • As verificações de inferência avaliam acesso ao modelo, taxa de requisição, taxa de tokens de entrada, taxa BYOK e tamanho de contexto do plano Free.
  • As verificações de RAG avaliam contagem de coleções, taxa de busca, taxa de inserção e tamanho de importação JSONL.
  • Ferramentas integradas verificam limites de serviço diário.
  • O processamento em lote verifica quantos itens de fluxo de trabalho podem ser processados por dia.

Referência:

Limites do plano #

Um travessão longo (—) indica que o plano não impõe limite. Limites específicos de modelo, gateway, provedor ou endpoint ainda podem ser aplicados.

RecursoFreeProMax
Inferência
Acesso ao modeloModelos de baixo preço/básicosModelos avançadosTodos os modelos
Multiplicador de comissão de inferência1.25x1.05x1.00x
Solicitações de modelo integrado20/min e 500/dia200/min—
Tokens de entrada de modelo integrado1.000.000/min20.000.000/min—
Solicitações BYOK30/min200/min—
Contexto máximo65.536 tokens de entrada——
Cobertura de assinatura LLMAtualmente desativadaAtualmente desativadaAtualmente desativada
Solicitações autônomas de texto para fala3/min e 40/hora30/min300/min
Solicitações autônomas de transcrição de áudio3/min e 40/hora30/min300/min
Solicitações de decisão semântica10/min50/min—
RAG e coleções
Coleções5——
Pesquisas semânticas20/min500/min3.000/min
Documentos de classificação de texto30/min e 300/dia1.000/min10.000/min
Documentos de segmentação de texto10/min e 100/dia300/min2.500/min
Reordenação de buscas30/min1.000/min—
Tempo de processamento Reflex30 minutos/dia6 horas/dia—
Inserções de documentos500/dia10.000/dia—
Documentos JSONL por solicitação de importação1.00010.0001.000.000
Injetor de mídia2 arquivos/dia30 arquivos/dia1.000 arquivos/dia
Ferramentas integradas
Pesquisa na web15/dia1.000/dia10.000/dia
Pesquisa X/TwitterNão disponível1.000/dia10.000/dia
Pesquisa avançada na webNão disponível100/dia1.000/dia
Geração de documentos e páginas da web5/dia1.000/dia50.000/dia
Geração e edição de imagens5/dia500/dia5.000/dia
Ações gerais de serviço30/dia5.000/dia100.000/dia
Comandos Bash300/hora30.000/hora—
Testes agentes
Novas execuções por conta5/min30/min—
Execuções simultâneas por conta148
Processamento em lote
Itens de fluxo de trabalho processados500/dia100.000/dia—
Arquivos por solicitação de importação1.0001.0001.000
Tamanho total de importação100 MiB/solicitação100 MiB/solicitação100 MiB/solicitação
Tamanho de arquivo importado único10 MiB10 MiB10 MiB
Conta e suporte
Cota de armazenamento30 MB2 GB20 GB
Custo por GB excedente—$0.50/GB/mês$0.20/GB/mês
Retenção de conversas2 horas2 dias30 dias
Nível de suporteEmailPrioridadeDedicado

Limites de taxa de decisão semântica e teste agente #

Esses limites por minuto são compartilhados entre chaves de API pertencentes à mesma conta. Eles são independentes das permissões de assinatura e faturamento: o uso incluído ainda consome a cota de requisição ou execução aplicável.

  • Decisões semânticas: cada requisição consome uma unidade, independentemente de quantas perguntas contém ou qual modelo de decisão é selecionado. Uma requisição que excede o limite da conta retorna 429 Too Many Requests antes da avaliação. Veja Decisões semânticas.
  • Testes agentes: execuções manuais, agendadas e avaliações diretas compartilham uma cota de novas execuções. Uma execução persistente consome sua unidade quando é enfileirada, não novamente quando a execução começa; turnos individuais de conversa não consomem unidades adicionais. Requisições manuais excedentes e avaliações diretas retornam 429 Too Many Requests. Um teste agendado sem cota disponível aguarda a próxima verificação de agendamento em vez de criar uma execução extra. Execuções existentes permanecem sujeitas aos seus limites de simultaneidade e inferência separados. Veja Testes agentes.

Distribua as requisições pela conta e use tentativas limitadas com backoff após um 429. Uma tentativa imediata ainda encontra a janela de limite de taxa ativa. Max não tem limite imposto pelo plano para essas duas cotas, mas outros limites aplicáveis permanecem em vigor.

Cotas diárias incluídas na assinatura #

Free, Pro e Max incluem cotas diárias separadas para os serviços abaixo. Cada comparação refere‑se ao mesmo serviço no plano nomeado, não a um saldo de crédito compartilhado ou a um número garantido de requisições. Cota não utilizada de um serviço não pode cobrir outro. Contas revendedoras não recebem cotas de assinatura.

Serviço incluídoFreeProMax
Incorporação de busca e inserção RAGCota base25× Free4× Pro
Reordenação com ReflexCota base5× Free10× Pro
Decisões semânticas com Julia-1Cota base2.5× Free2× Pro
Busca e extração OCRCota base10× Free5× Pro

Pesquisas RAG e inserções de documentos compartilham a cota de incorporação. Ela não cobre geração de respostas, processamento de mídia, classificação ou segmentação de texto. Uma incorporação de consulta atendida a partir do cache não a consome. Reflex usa uma cota de reordenação separada que inclui entradas em cache e sem cache. Julia-1 é atualmente o único modelo de decisão coberto pela cota de decisão semântica; outros modelos de decisão são cobrados normalmente. A conversão opcional de JSON Fetch é separada da cota de extração.

A cobertura é avaliada para cada item de serviço medido: a incorporação de um documento, a incorporação de um termo de consulta individual, uma chamada de reordenação, o uso de entrada de uma chamada de decisão ou uma operação de extração. Cada item é totalmente incluído ou cobrado integralmente nas tarifas normais. Itens incluídos são rastreados no consumo da assinatura, não como entradas de custo zero no histórico de faturamento. As cotas atuais permitem uma margem de 10 % acima da capacidade base. Um item que excederia essa margem deixa a cota inalterada e é cobrado normalmente. Uma requisição pode conter vários itens, de modo que alguns podem ser incluídos enquanto outros são cobrados.

As cotas diárias são redefinidas à meia‑noite no horário local do servidor. Verifique os indicadores de uso da assinatura da conta para consumo e status de redefinição; o uso pode exceder 100 % dentro da margem. A cobertura de assinatura LLM está atualmente desativada, portanto a inferência de texto‑modelo e a geração de respostas RAG permanecem medidas separadamente. As cotas não contornam requisitos de saldo, limites de taxa ou o teto de tempo de processamento separado de Reflex. Consulte Pricing para cobranças quando um item não está coberto.

Contas revendedoras suportam 8 execuções de teste agente simultâneas por conta.

Solicitações de modelo integrado são limitadas tanto por contagem de requisições quanto por tokens de entrada. Grupos de limite de taxa de modelo ajustam os limites de contagem de requisições:

Grupo de limite de taxaMultiplicador de limite
Comum1.0x
Descontado0.5x
Baixo0.3x
Free0.1x

Por exemplo, uma conta Pro normalmente tem 200 solicitações de modelo integrado por minuto. Com um grupo de modelo Discounted, o limite ajustado é 100 solicitações por minuto.

BYOK usa uma chave de provedor configurada no gateway em vez de um modelo AIVAX integrado, mas as requisições ainda passam pela infraestrutura AIVAX e utilizam o limite BYOK do plano.

As cotas de classificação de texto e segmentação de texto contam cada item no array documents da requisição, não cada requisição HTTP. Uma requisição que excederia qualquer janela ativa retorna 429 Too Many Requests. A classificação de texto usa o modelo de incorporação padrão e é cobrada pelo trabalho de incorporação realizado.

Solicitações autônomas de texto para fala e transcrição de áudio usam suas próprias cotas de requisição do plano. Sessões de voz utilizam o modelo em tempo real selecionado e estão sujeitas aos limites de acesso ao modelo, saldo e inferência aplicáveis, em vez dessas cotas de requisição autônomas. A transcrição de entrada não é suportada atualmente dentro de Sessões de voz.

O endpoint de importação JSONL rejeita uma requisição quando atinge o limite de documentos por requisição do plano. O limite de reordenação aplica‑se ao endpoint autônomo de reordenação e às buscas RAG que utilizam um reordenador, incluindo buscas realizadas através de AI Gateways e ferramentas MCP.

O limite de Reflex conta o tempo gasto processando requisições Reflex. Ele aplica‑se ao endpoint autônomo de reordenação e às buscas RAG que utilizam Reflex; entrada em cache não consome a cota separadamente. Requisições que excedem o limite do plano retornam 429 Too Many Requests. Veja Reflex para limites de requisição, comportamento de cache e preços.

Ações gerais de serviço compartilham a cota de ação de serviço mostrada acima. O processamento em lote é assíncrono; se o processamento for pausado ou falhar por causa de cota, tente novamente após a janela de cota ser redefinida ou faça upgrade da conta.

Chaves de API públicas #

Chaves públicas têm limites adicionais independentes do plano da conta.

EscopoLimites de requisição
Por endereço remoto3/5s, 20/min, 300/hora, 1.000/dia
Global por chave10/5s, 60/min, 1.500/hora, 10.000/dia
EscopoLimites de token
Por endereço remoto100.000/5min, 500.000/30min, 2.000.000/6h, 5.000.000/dia
Global por chave500.000/5min, 2.000.000/30min, 10.000.000/6h, 25.000.000/dia

Chaves públicas podem ser usadas para busca semântica RAG, geração de respostas RAG, geração de fala, descrições de mídia, geração de imagens e complementos de chat. Para complementos de chat, chaves públicas também exigem um UUID completo de AI Gateway, restringem parâmetros de requisição e omitam superfícies de ferramentas no lado do servidor. Consulte Authentication.

Digite para pesquisar na documentação.