INTEGRITY Dokumentace

Počítání tokenů

AI Security for Apps (dříve Firewall for AI) poskytuje odhadovaný počet tokenů pro každý příchozí LLM prompt. Díky tomu můžete monitorovat velikosti promptů, nastavovat limity pro příliš dlouhé prompty a sledovat spotřebu tokenů napříč vašimi AI endpointy.

Jak funguje počítání tokenů

Když AI Security for Apps zpracovává požadavek na cf-llm označený endpoint, vypočítá přibližný počet tokenů obsahu promptu. Výsledek je dostupný v LLM Token count (cf.llm.prompt.token_count), na které se můžete odkazovat ve výrazech pravidel a které si můžete prohlížet v analytice.

Případy užití

Blokování nadměrně velkých promptů

Nastavte pevný práh pro blokování promptů, které překročí určitý odhadovaný počet tokenů. Zabráníte tak tomu, aby se k vašemu modelu dostaly nečekaně velké vstupy.

Rate limiting velkých promptů

Vytvořte pravidlo rate limitingu které omezuje počet velkých promptů, jež může jeden klient odeslat v daném časovém okně. To pomáhá bránit zneužití, kdy útočníci odesílají nadměrně dlouhé prompty, aby spotřebovávali prostředky modelu.

Zadejte do editoru následující výraz pravidla:
(cf.llm.prompt.token_count gt 2000)

Nastavte frekvenci například na 10 požadavků za minutu na IP, s akcí Block nebo Managed Challenge.

Kombinace počtu tokenů s dalšími detekcemi

Zaměřte se na velké prompty, které zároveň vykazují známky prompt injection — běžný vzorec, kdy útočníci doplňují pokusy o injection dlouhým kontextem.

Příklad výrazu pravidla:
(cf.llm.prompt.token_count gt 3000 and cf.llm.prompt.injection_score lt 50)

Důležité aspekty