DANJailbreakProbe | dan-jailbreak | Unrestricted “Do Anything Now” persona |
BestOfNJailbreakingProbe | best-of-n-jailbreaking | Many jailbreak variants in one run |
AntiGPTProbe | anti-gpt | Role reversal / ignore your rules |
RolePlayingExploitsProbe | role-playing-exploits | Fictional or hypothetical framing |
SystemOverrideProbe | system-override | Fake system-level overrides |
InstructionalInversionProbe | instructional-inversion | Negated or inverted instructions |
GrandmaJailbreakProbe | grandma-jailbreak | Sympathetic-persona jailbreak |
IndirectProbe | indirect | Indirect / pretext injection |
ManyShotJailbreakProbe | many-shot-jailbreak | Many-shot compliance examples |
PolicyPuppetryProbe | policy-puppetry | Fake policy documents |
CoTForgeryProbe | cot-forgery | Forged chain-of-thought |
AdversarialPoetryProbe | adversarial-poetry | Poetic framing |
AdversarialTalesProbe | adversarial-tales | Narrative-frame overrides |
ICOSemanticShiftProbe | ico-semantic-shift | Semantic-shift jailbreak |
SNGuidedDiffusionDLLMProbe | sn-guided-diffusion-dllm | Diffusion / dLLM-oriented jailbreak |
EncodedPayloadProbe | encoded-payload | Base64, hex, and similar encodings |
EncodingAndCapitalizationProbe | encoding-and-capitalization | Alternating capitalization / leetspeak |
SymbolicEncodingProbe | symbolic-encoding | Emoji and special-character stand-ins |
ObfuscationAndTokenSmugglingProbe | obfuscation-and-token-smuggling | Token-level smuggling |
TypoTricksProbe | typo-tricks | Intentional misspellings |
ContextHijackingProbe | context-hijacking | Injected context that redirects the task |
JsonInjectionProbe | json-injection | Malicious fields inside JSON |
StructuredPayloadProbe | structured-payload | Structured formats other than JSON |
AllowedAndDisallowedQuestionsProbe | allowed-and-disallowed-questions | Safe questions mixed with harmful ones |
MultiLanguageAttacksProbe | multi-language-attacks | Non-English bypasses |
SynonymsProbe | synonyms | Alternative phrasing |
TrainingDataReplayProbe | training-data-replay | Training-data extraction / replay |
RepeatedTokenDivergenceProbe | repeated-token-divergence | Generation-stress jailbreak |
MultimodalInjectionProbe | multimodal-injection | Instructions embedded in images (injection_techniques, image_width, image_height) |
AgenticBrowserOCRInjectionProbe | agentic-browser-ocr-injection | OCR / screenshot command injection |
ImageStegoInjectionProbe | image-stego-injection | Hidden image payloads |
ConcurrentAudioInjectionProbe | concurrent-audio-injection | Second-channel audio |
WebIDPICloakingProbe | web-idpi-cloaking | Hidden agent-only page directives |
MCPToolPoisoningProbe | mcp-tool-poisoning | Malicious MCP tool metadata |
MCPServerSideSamplingProbe | mcp-server-side-sampling | MCP sampling override |
CodingAgentConfigEscalationProbe | coding-agent-config-escalation | Agent config self-rewrite |
PersistentMemoryPoisonProbe | persistent-memory-poison | Standing memory rules that persist |
KidnapRAGProbe | kidnap-rag | Staged malicious RAG documents |
AdaptiveMultiturnTranscriptProbe | adaptive-multiturn-transcript | Multi-turn attack pasted as a transcript |