Zero-LLM deterministic jailbreak regression benchmark: runs a repeatable battery of known-pattern attacks against an LLM endpoint and scores refusal/partial/compliance across runs. Catch when a model or prompt update silently got weaker. Single-turn, responsible-use. pip install hermes-jailbench
python benchmark jailbreak regression-testing red-team ai-safety security-testing jailbreak-detection red-teaming responsible-ai llm ai-red-team prompt-injection llm-security llm-evaluation prompt-security ai-reliability deterministic-testing hermes-labs jailbreak-regression
-
Updated
Sep 7, 2026 - Python