Dopasuj Agentów AI do poziomów użytkowania OpenAI (Usage Tier).
Gdy skonfigurujesz Agenta AI, jednym z jego typowych zadań jest zrozumienie intencji dzwoniącego i przekierowanie połączenia na odpowiedni numer wewnętrzny. Haczyk tkwi w tym, że Twój Agent AI musi mieć dostęp do usługi OpenAI i nie może być ograniczony limitami zapytań (rate limits). Jeśli Twój Agent AI osiągnie limit zapytań, dzwoniący nie otrzyma odpowiedzi, a przepływ połączenia zostanie przerwany. Połączenie nie zostanie przekierowane, a dzwoniący się rozłączy. Aby uniknąć osiągania limitów zapytań, przedstawiamy kilka wytycznych, którymi należy się kierować.
Ten wpis na blogu jest długi! Oto, co w skrócie omawiamy:
- Typowe komunikaty w logach, gdy limity zapytań są osiągane.
- Trochę matematyki na temat szacowania zużycia tokenów.
- Techniczna złożoność połączenia i jej wpływ na zużycie tokenów.
- Jak źródła wiedzy wpływają na zużycie tokenów.
- Przeliczanie limitów zapytań na jednoczesne połączenia Agentów AI.
- Jak poruszać się po platformie OpenAI, aby zrozumieć i dostosować limity zapytań.
- Konta OpenAI, na których dokonano wpłat w wysokości co najmniej 100 USD, są zazwyczaj bezpośrednio przenoszone do poziomu Tier 3.
Komunikaty w logach w przypadku osiągnięcia limitów zapytań
Gdy wyczerpiesz limit zapytań OpenAI, możesz to zobaczyć w pliku 3CXAI.log; oto przykład:
2026-03-09 10:17:26.674|DEBUG|{'call': 110, 'dir': 'ai', 'detail': True} [OpenAI] response.done content> :
{'type': 'response.done', 'event_id': 'event_DHYWMxZ4ipQABCDEFGHIJ', 'response':
{'object': 'realtime.response', 'id': 'resp_DHYWMnVTGk1234567890', 'status': 'failed', 'status_details':
{'type': 'failed', 'error':
{'type': 'tokens', 'code': 'rate_limit_exceeded',
'message': 'Rate limit reached for gpt-4o-realtime in organization org-LwDoeGAu4fbAABBCCDDEEFF on tokens per min (TPM): Limit 40000, Used 31222, Requested 14701. Please try again in 8.805s.
Visit https://platform.openai.com/account/rate-limits to learn more.'}},
'output': [], 'conversation_id': 'conv_DHYW8SqVAABBCCDDEEFFG', 'output_modalities': ['audio'], 'max_output_tokens': 'inf', 'audio': {'output': {'format': {'type': 'audio/pcm', 'rate': 24000}, 'voice': 'marin'}},
'usage': {'total_tokens': 0, 'input_tokens': 0, 'output_tokens': 0, 'input_token_details': {'text_tokens': 0, 'audio_tokens': 0, 'image_tokens': 0, 'cached_tokens': 0, 'cached_tokens_details':
{'text_tokens': 0, 'audio_tokens': 0, 'image_tokens': 0}}, 'output_token_details': {'text_tokens': 0, 'audio_tokens': 0}}, 'metadata': None}} …co jasno pokazuje, że:
- osiągnięto limit tokenów na minutę (TPM),
- żadne żądania nie mogą być obsłużone w ciągu najbliższych 8,805 sekundy.
Możemy również zobaczyć ten problem matematycznie:
- obecny limit dla tego konta wynosi 40 000 tokenów na minutę,
- w ciągu ostatniej minuty zużyto 31 222 tokeny,
- pozostawia to 8 778 dostępnych do użycia,
- złożone żądanie wymagałoby 14 701 tokenów, co przekroczyło dostępną liczbę tokenów w ciągu jednej minuty.
Szacowanie zużycia tokenów
Podstawa: naturalna rozmowa
- Zużycie tokenów zależy od wielu czynników, w tym:
- języka,
- używanego modelu,
- stylu konwersacji,
- liczby wypowiedzianych słów.
- Oto kilka rzeczywistych założeń/średnich:
- Naturalna rozmowa odbywa się z prędkością około 150 słów na minutę.
- Każde połączenie ma maksymalny czas trwania 7 minut.
- Oznacza to, że 7-minutowa rozmowa to około 1050 słów.
- Powszechnie przyjęty współczynnik konwersji tokenów OpenAI (dla języka angielskiego) wynosi 1 słowo = 1,3 tokena.
- 7-minutowa rozmowa zużyłaby 1365 tokenów.
Możemy oszacować, że naturalna rozmowa zużyje maksymalnie 1500 tokenów.
Korekty w zależności od charakteru i złożoności połączenia
- Jeśli dzwoniący po prostu dzwoni w krótkiej sprawie lub umawia spotkanie, Agent AI ma bardzo mało „myślenia” do wykonania.
- Ostrożne szacunki to maksymalnie około 1000 tokenów na połączenie.
- Jeśli połączenie jest zrównoważoną rozmową o pracy, przeglądaniem dokumentu lub ogólną wymianą zdań.
- Wpada to w szacunki „naturalnej rozmowy”, czyli maksymalnie około 1500 tokenów na połączenie.
- Jeśli rozmowa jest złożona i techniczna, możemy założyć, że Agent AI musi więcej „myśleć”.
- Można oszacować maksymalnie około 2500 tokenów na połączenie.
Agenci AI używający Źródeł Wiedzy
Jeśli używasz źródeł wiedzy ze swoimi Agentami AI, powinieneś również uwzględnić dodatkowy narzut tokenów na ich pobranie; oszacuj do dodatkowych 2000 tokenów na koszt pobrania.
Szacunkowe całkowite zużycie tokenów
Na podstawie powyższych założeń i szacunków można stwierdzić, że techniczne połączenie AI ze źródłami wiedzy zużyje:
- 2500 tokenów na połączenie,
- 2000 tokenów na pobranie źródeł wiedzy.
Jeśli dodasz bufor bezpieczeństwa 500 tokenów, Twoje połączenie zużyje 5000 tokenów, czyli 714 tokenów na minutę. Możesz to zaokrąglić do 1000 tokenów na minutę.
Ile jednoczesnych połączeń mogą obsłużyć Agenci AI?
Musisz zmieścić się w 2 ograniczeniach:
- Tokeny na minutę (TPM)
- Żądania na minutę (RPM)
Tokeny na minutę (TPM)
Jeśli skonfigurowałeś limit zapytań dla swojego modelu AI na 20 000 tokenów na minutę, to przy 1000 TPM na połączenie Agent AI może obsłużyć 20 jednoczesnych połączeń.
Żądania na minutę (RPM)
Nie będziemy tu wchodzić w szczegóły, ale pamiętaj, że każde połączenie AI może generować wiele żądań na minutę. Jeśli konfigurujesz swój system do obsługi, na przykład, 50 jednoczesnych połączeń AI, a typy połączeń, które otrzymujesz, generują średnio 3 żądania na minutę, logicznie rzecz biorąc, musisz ustawić swoje RPM na co najmniej 150.
Przewodnik po poziomach użytkowania i limitach zapytań OpenAI
Większość użytkowników domyślnie zaczyna na darmowym poziomie – dlatego zrozumiałe jest, że możesz osiągać limity zapytań. Konta OpenAI, na których dokonano wpłat w wysokości co najmniej 100 USD, są zazwyczaj bezpośrednio przenoszone do poziomu Tier 3.

Na platformie OpenAI przejdź do pulpitu nawigacyjnego swojego projektu i wejdź na stronę „Project -> Limits” (Projekt -> Limity); pod nagłówkiem „Rate limits” (Limity zapytań) kliknij przycisk „Select models” (Wybierz modele).

Przewiń w dół do limitów zapytań „Realtime”, gdzie możesz dostosować swoje limity, gdzie:
- TPM to maksymalna liczba tokenów na minutę.
- RPM to maksymalna liczba żądań na minutę.
Powyższy zrzut ekranu przedstawia konto na darmowym poziomie, gdzie widać, że maksymalny dozwolony limit to 40 000 TPM i 3 RPM. Przejdź na stronę „Organization -> Limits” (Organizacja -> Limity) i edytuj swój budżet, aby przejść na wyższy poziom.

Możesz kliknąć link do przewodnika po limitach zapytań, aby uzyskać więcej szczegółów; oto główna tabela poziomów użytkowania:

Gdy osiągniesz wymagane progi, Twój poziom zostanie automatycznie dostosowany. Przejdź ponownie na stronę „Project -> Limits” (Projekt -> Limity), aby w razie potrzeby podnieść swoje limity.
Forum
Zapraszamy do dyskusji na naszym dedykowanym Forum AI. Obserwuj nas na X i LinkedIn, aby być na bieżąco z najnowszymi wiadomościami i nowymi funkcjami.



