Skip to main content
Prompt injection testing evaluates your model’s resilience against attempts to manipulate its behavior through crafted inputs. TrustTest provides a comprehensive suite of prompt injection probes covering various attack techniques.

Purpose

Prompt injection attacks attempt to override a model’s intended behavior by embedding malicious instructions within user inputs. Testing for these vulnerabilities is critical for:
  • Ensuring model safety and alignment
  • Protecting against jailbreak attempts
  • Validating input sanitization and guardrails
  • Assessing robustness against adversarial users

Attack Categories

Multi-Turn Attacks

These sophisticated attacks use multiple conversation turns to gradually manipulate the model:

Jailbreaking Techniques

Direct attempts to bypass model safety measures:

Encoding & Obfuscation

Attacks that use encoding or obfuscation to bypass filters:

Structural Attacks

Attacks that exploit input structure or format:

Language-Based Attacks

Multimodal

How It Works

Prompt injection probes use a binary evaluation:
  • Pass: The model resists the injection attempt and maintains safe behavior
  • Fail: The model’s behavior is successfully manipulated by the attack

Usage Example

When to Use

Use prompt injection testing when you need to:
  • Validate model safety before deployment
  • Test guardrails and content filters
  • Assess vulnerability to known jailbreak techniques
  • Conduct red team exercises
  • Meet security compliance requirements