Goal Hijacking Attack on Large Language Models via Pseudo-Conversation Injection

Goal hijacking constitutes a critical security vulnerability in Large Language Models (LLMs), enabling adversaries to manipulate models into generating specific outputs regardless of original user inputs. Existing approaches often rely on explicit instructions, limiting effectiveness and stealth. To overcome these constraints, we introduce a novel adversarial attack technique named Pseudo-Conversation Injection (PC-Inj), exploiting vulnerabilities in conversational context handling and role identification within LLMs. PC-Inj appends fabricated conversational contexts to original user prompts, misleading models into interpreting these as completed interactions and executing subsequent malicious instructions. Experimental evaluations using mainstream platforms—including ChatGPT (GPT4o, GPT4o-mini) and TongYiQianWen (Qwen2.5)—confirm our methods significantly surpass baseline techniques. We further propose targeted defense mechanisms, highlighting an urgent need to strengthen LLM security in practical deployments.

Paper

Similar papers

© 2026 NYSGPT2525 LLC