← Dokumentace WAF / detections / ai-security-for-apps
Počítání tokenů
AI Security for Apps (dříve Firewall for AI) poskytuje odhadovaný počet tokenů pro každý příchozí LLM prompt. Díky tomu můžete monitorovat velikosti promptů, nastavovat limity pro příliš dlouhé prompty a sledovat spotřebu tokenů napříč vašimi AI endpointy.
Jak funguje počítání tokenů
Když AI Security for Apps zpracovává požadavek na cf-llm označený endpoint, vypočítá přibližný počet tokenů obsahu promptu. Výsledek je dostupný v LLM Token count (cf.llm.prompt.token_count), na které se můžete odkazovat ve výrazech pravidel a které si můžete prohlížet v analytice.
Případy užití
Blokování nadměrně velkých promptů
Nastavte pevný práh pro blokování promptů, které překročí určitý odhadovaný počet tokenů. Zabráníte tak tomu, aby se k vašemu modelu dostaly nečekaně velké vstupy.
-
When incoming requests match:
Do editoru zadejte následující výraz:
(cf.llm.prompt.token_count gt 4000) -
Akce: Block
Rate limiting velkých promptů
Vytvořte pravidlo rate limitingu které omezuje počet velkých promptů, jež může jeden klient odeslat v daném časovém okně. To pomáhá bránit zneužití, kdy útočníci odesílají nadměrně dlouhé prompty, aby spotřebovávali prostředky modelu.
Zadejte do editoru následující výraz pravidla:
(cf.llm.prompt.token_count gt 2000)
Nastavte frekvenci například na 10 požadavků za minutu na IP, s akcí Block nebo Managed Challenge.
Kombinace počtu tokenů s dalšími detekcemi
Zaměřte se na velké prompty, které zároveň vykazují známky prompt injection — běžný vzorec, kdy útočníci doplňují pokusy o injection dlouhým kontextem.
Příklad výrazu pravidla:
(cf.llm.prompt.token_count gt 3000 and cf.llm.prompt.injection_score lt 50)
Důležité aspekty
- Pouze odhad. Počet tokenů je obecná aproximace. Skutečná spotřeba tokenů u vašeho modelu se může lišit v závislosti na tokenizéru modelu.
- Pouze vstupní tokeny. Počet tokenů odráží příchozí prompt. Neodhaduje tokeny výstupu ani odpovědi.
- Pouze extrahovaný prompt. Počet tokenů se počítá z textu promptu extrahovaného z těla požadavku. Cloudflare extrahuje prompt pomocí sady známých JSON cest pro hlavní poskytovatele LLM. Pokud prompt nelze extrahovat, použije Cloudflare jako zálohu celé tělo požadavku. V takových případech bude počet tokenů odpovídat celému tělu požadavku.