2026
SecOPD: Mitigating Adaptive Prompt Injections by On-Policy Distillation
Yibo Peng, Long Lian, David Wagner, Sizhe Chen
EMNLPConference on Empirical Methods in Natural Language Processing
Reference-Based Distillation Detection in LLMs
Rajat Rawat, Sizhe Chen, Akshay Anand, Michael Duan, Bob Rotsted, Sewon Min
PreprintarXiv:2607.09692
Defending Against Prompt Injection with DataFilter
Yizhu Wang, Sizhe Chen, Raghad Alkhudair, Basel Alomair, David Wagner
SaTMLIEEE Conference on Secure and Trustworthy Machine Learning
2025
Meta SecAlign: A Secure Foundation LLM Against Prompt Injection Attacks
Sizhe Chen*, Arman Zharmagambetov, David Wagner, Chuan Guo*
PreprintarXiv:2507.02735
Meta-SecAlign models,
with an order-of-magnitude lower attack success rate against prompt injections, have been downloaded 10K times in three months.
Meta-SecAlign-70B retains commercial-grade utility after defensive fine-tuning and is available for
commercial use.
SecAlign: Defending Against Prompt Injection with Preference Optimization
Sizhe Chen, Arman Zharmagambetov, Saeed Mahloujifar, Kamalika Chaudhuri, David Wagner, Chuan Guo
CCSACM Conference on Computer and Communications Security
SecAlign preference-optimizes an LLM to favor secure responses over responses that follow injected instructions.
StruQ: Defending Against Prompt Injection with Structured Queries
Sizhe Chen, Julien Piet, Chawin Sitawarin, David Wagner
USENIX SecurityUSENIX Security Symposium
StruQ separates the user instruction and untrusted data into distinct channels to defend against prompt injection.
Defending Against Prompt Injection with a Few Defensive Tokens
Sizhe Chen, Yizhu Wang, Nicholas Carlini, Chawin Sitawarin, David Wagner
AISec SpotlightACM Workshop on Artificial Intelligence and Security
2024
Jatmo: Prompt Injection Defense by Task-Specific Finetuning
Julien Piet, Maha Alrashed, Chawin Sitawarin, Sizhe Chen, Zeming Wei, Elizabeth Sun, Basel Alomair, David Wagner
ESORICSEuropean Symposium on Research in Computer Security
Query Attack by Multi-Identity Surrogates
Sizhe Chen, Zhehao Huang, Qinghua Tao, Xiaolin Huang
IEEE TAIIEEE Transactions on Artificial Intelligence, 5(2):684–697
2023
Can LLMs Follow Simple Rules?
Norman Mu, Sarah Chen, Zifan Wang, Sizhe Chen, David Karamardian, Lulwa Aljeraisy, Basel Alomair, Dan Hendrycks, David Wagner
PreprintarXiv:2311.04235
One-Pixel Shortcut: On the Learning Preference of Deep Neural Networks
Shutong Wu*, Sizhe Chen*, Cihang Xie, Xiaolin Huang
ICLR SpotlightInternational Conference on Learning Representations
Self-Ensemble Protection: Training Checkpoints Are Good Data Protectors
Sizhe Chen, Geng Yuan, Xinwen Cheng, Yifan Gong, Minghai Qin, Yanzhi Wang, Xiaolin Huang
ICLRInternational Conference on Learning Representations
Investigating Catastrophic Overfitting in Fast Adversarial Training: A Self-Fitting Perspective
Zhengbao He, Tao Li, Sizhe Chen, Xiaolin Huang
CVPRWCVPR Workshop on Adversarial Machine Learning
Measuring the Transferability of ℓ∞ Attacks by the ℓ2 Norm
Sizhe Chen, Qinghua Tao, Zhixing Ye, Xiaolin Huang
ICASSPIEEE International Conference on Acoustics, Speech and Signal Processing
Unifying Gradients to Improve Real-World Robustness for Deep Networks
Yingwen Wu, Sizhe Chen, Kun Fang, Xiaolin Huang
ACM TISTACM Transactions on Intelligent Systems and Technology, 14(6)
2022
Universal Adversarial Attack on Attention and the Resulting Dataset DAmageNet
Sizhe Chen, Zhengbao He, Chengjin Sun, Jie Yang, Xiaolin Huang
IEEE TPAMIIEEE Transactions on Pattern Analysis and Machine Intelligence
Subspace Adversarial Training
Tao Li, Yingwen Wu, Sizhe Chen, Kun Fang, Xiaolin Huang
CVPR OralIEEE/CVF Conference on Computer Vision and Pattern Recognition
Adversarial Attack on Attackers: Post-Process to Mitigate Black-Box Score-Based Query Attacks
Sizhe Chen, Zhehao Huang, Qinghua Tao, Yingwen Wu, Cihang Xie, Xiaolin Huang
NeurIPSConference on Neural Information Processing Systems
Relevance Attack on Detectors
Sizhe Chen, Fan He, Xiaolin Huang, Kun Zhang
Pattern RecognitionVolume 124, Article 108491