📝 Selected Publications
( * indicates equal contribution. Full list of publications)
🚀 Something is Coming Soon™ (Probably) Status: Thinking hard 🤔 …]

Render Before Reading: Visual Rendering as a Prompt Injection Defense
Jie Zhang*, Andrei Baroian*, Jan N. van Rijn, Avital Shafran, Andrei Baroian, Jan N. van Rijn, Florian Tramèr</span>


Black-box Optimization of LLM Outputs by Asking for Directions
[ICLR Trustworthy AI workshop 2026, Spotlight Talk]



RealMath: A Continuous Benchmark for Evaluating Language Models on Research-Level Mathematics
[NeurIPS 2025, Dataset $\&$ Benchmark Track]





Blind Baselines Beat Membership Inference Attacks for Foundation Models
[IEEE SP 2025, DLSP workshop]

AgentDojo: A Dynamic Environment to Evaluate Prompt Injection Attacks and Defenses for LLM Agents
[NeurIPS 2024 Dataset $\&$ Benchmark Track]

