World Congress 2024 Aug 20, 2024 Session details

Manipulating The Machine: Prompt Injections And Counter Measures

Georg

Hackers are tricking AI chatbots into selling cars for $1 and stealing 2FA tokens. Learn why complex system prompts fail and how to properly defend against prompt injections.

Pause
Mute Enter Fullscreen
#1 about 4 min

Anatomy of large language model prompts and structural layers

The three distinct layers of user input, context, and system instructions shape the fundamental behavior of generative language models.

#2 about 2 min

Understanding the risks of unchecked user inputs in chatbots

Unfiltered prompts leave applications vulnerable to unintended commands and logic overrides remarkably similar to traditional database injection attacks.

#3 about 2 min

Mitigating basic prompt manipulation attempts using explicit system rules

Adding concrete semantic limits and behavioral boundaries in the system prompt block filters out naive and rudimentary adversarial commands.

#4 about 4 min

Bypassing system constraints by extracting hidden instructions and rules

Attackers leverage conversational logic conventions to force applications into improperly revealing internal instruction sets directly back to the user.

#5 about 2 min

Extracting confidential business information from configured knowledge bases

Manipulated user inputs can subvert logic flows to silently expose proprietary backend files originally intended solely for context enhancement.

#6 about 2 min

Manipulating automated talent evaluation systems with hidden text injections

Embedding invisible instructions into resumes deliberately forces automated screening pipelines to render favorable assessments without exhaustive human oversight.

#7 about 3 min

Exploiting integrated application programming interfaces for unauthorized data extraction

Deliberately crafted external messages reliably hijack autonomous integration processes to systematically intercept authentication tokens sent to an inbox.

#8 about 4 min

Establishing foundational limitations to reduce system prompt injection vulnerabilities

Restricting integrations exclusively to read-only capabilities drastically minimizes potential exploitation vectors by neutralizing external write permissions.

#9 about 2 min

Defending against targeted prompt attacks by deploying fine-tuned models

Training isolated learning environments directly on specialized domain data drastically diminishes inherent susceptibility to adversarial instructional overrides.

#10 about 3 min

Filtering malicious application inputs utilizing adversarial prompt detection classifiers

Secondary language model deployments running pattern recognition databases act as robust firewalls by classifying problematic submissions prior to evaluation.

#11 about 3 min

Acknowledging current limitations in securing generative artificial intelligence applications

Since zero operational guarantees currently exist avoiding application compromises, administrators should practically consider all system text publicly viewable information.

Matching moments

5:44 min

Prompt injection vulnerabilities and contextual mitigation testing challenges

Mirko Ross · WWC 2023

2:46 min

Bypassing language model safeguards utilizing contextual prompt injection attacks

Chris Heilmann +1 · LIVE

8:04 min

Understanding AI chatbot vulnerabilities and stateful attacks

Sebastian Messingfeld Sebastian Messingfeld · WWC Europe 2026

3:04 min

Prompt injections bypassing language model service guardrails

Ramona Schwering Ramona Schwering · WWC Europe 2026

4:19 min

Prompt engineering techniques and security vulnerabilities

Aarno Aukia · LIVE

1:28 min

Security risks involving prompt injection attacks

Cheuk Ho · WWC 2023

Upcoming sessions on this topic

Open session

World Congress 2026 North America

SecurePrompt: Building a Pre-Flight Security Layer for Agentic AI

Ravi Sastry Kadali

AI/ML Engineer at General Motors

Ravi Sastry Kadali
Open session

World Congress 2026 North America

The Things Your AI Isn't Telling You

Desmond Lamptey

Lead Software Engineer @ Capital One

Desmond Lamptey
Open session

World Congress 2026 North America

Responsible AI Architecture with Zero Trust Agents

Ashok Prakash

Staff ML Engineer at Apple

Ashok Prakash
Open session

World Congress 2026 North America

Context Engineering Kung Fu

Carl Lapierre

Tech Lead and AI Engineer at Osedea

Carl Lapierre
Open session

World Congress 2026 North America

Securing AI Agent Infrastructure: Identity, Attestation, and Trust at Scale

Abdel Fane

Founder of OpenA2A

Abdel Fane
Open session

World Congress 2026 North America

Proactive AI That Doesn’t Annoy Users: Building Context-Aware Notification Systems

Raju Dandigam Dandigam

Engineering Manager at Navan

Raju Dandigam Dandigam