🥳 About Me

I am a Ph.D. student at the School of Artificial Intelligence (SAI), Shanghai Jiao Tong University, supervised by Qiaosheng Zhang and Ying Wen. My research interests lie in Reinforcement Learning (RL) and Large Language Model (LLM) safety alignment.

🔥 News

  • [May. 2026]: 🎉 Two papers (MAGIC, PIA) have been accepted by ICML 2026.

  • [Feb. 2026]: 🎉 Our paper (VAST) has been accepted by CVPR 2026.

  • [Sep. 2025]: 🎉 Our paper (ReMA) has been accepted by NeurIPS 2025.

  • [Aug. 2024]: 🎉 Our paper (RO2O) has been accepted by JAIR.

  • [May. 2024]: 🎉 Our paper (IGDF) has been accepted by ICML 2024.

📖 Selected Publications

arxiv preprint
JailbreakSkill

JailbreakSkill: Scaling Automated Red-Teaming with Reusable and Ever-Evolving Skills

Xiaoyu Wen*, Jiajia Li*, Zhida He, Peng Yu, Chenxu Wang, Han Qi, Ziyuan Zhou, Cheng Jin, Ying Wen, Xingcheng Xu, Shuyue Hu, Tianhang Zheng, Chaochao Lu, Qiaosheng Zhang†

arxiv preprint, 2026

arxiv preprint
TRACE

Not All Turns Matter: Credit Assignment for Multi-Turn Jailbreaking

Zhida He*, Xiaoyu Wen*, Han Qi, Ziyuan Zhou, Peng Yu, Xingcheng Xu, Dongrui Liu, Xia Hu, Chaochao Lu, Qiaosheng Zhang†

arxiv preprint, 2026

ICML 2026
MAGIC

MAGIC: A Co-Evolving Attacker-Defender Adversarial Game for Robust LLM Safety

Xiaoyu Wen*, Zhida He*, Han Qi, Ziyu Wan, Zhongtian Ma, Ying Wen, Tianhang Zheng, Xingcheng Xu, Chaochao Lu and Qiaosheng Zhang†

International Conference on Machine Learning (ICML), 2026

ICML 2026
PIA

Disentangling Intent from Role: Adversarial Self-Play for Persona-Invariant Safety Alignment

Jiajia Li*, Xiaoyu Wen*, Shuyue Hu, Qiaosheng Zhang† and Zhen Wang†;

International Conference on Machine Learning (ICML), 2026

CVPR 2026
VAST

VAST: Video Ability-Stratified Taxonomy for Data-Efficient Video Reasoning

Zhongan Wang*, Xiaoyu Wen*, Lingxiao Du, Kun Li, zhiliang wu, Xingcheng Xu, Qiaosheng Zhang†, Chaochao Lu, Hehe Fan†

IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

NeurIPS 2025
ReMA

ReMA: Learning to Meta-think for LLMs with Multi-Agent Reinforcement Learning

Ziyu Wan*; Yunxiang Li*; Xiaoyu Wen*; Yan Song; Hanjing Wang; Linyi Yang; Mark Schmidt; Jun Wang; Weinan Zhang; Shuyue Hu†; Ying Wen†

Neural Information Processing Systems (NeurIPS), 2025

ICML 2024
IGDF

Contrastive Representation for Data Filtering in Cross-Domain Offline Reinforcement Learning

Xiaoyu Wen, Chenjia Bai†, Kang Xu, Xudong Yu, Yang Zhang, Xuelong Li, Zhen Wang†

International Conference on Machine Learning (ICML), 2024

JAIR
RO2O

Towards Robust Offline-to-Online Reinforcement Learning via Uncertainty and Smoothness

Xiaoyu Wen*, Xudong Yu*, Rui Yang, Chenjia Bai†, Zhen Wang†

AAAI-24 Journal Track; Journal of Artificial Intelligence Research (JAIR) 81, 481-509, 2024

🚀 Selected Project

Technical Report
SafeWork-R1

SafeWork-R1: Co-evolving Safety and Intelligence under the AI-45◦ Law

Shanghai Artificial Intelligence Laboratory

arxiv preprint, 2025

Technical Report
Intern-BioBreaker

An Early Warning of Emerging Biosecurity Risks in Frontier LLMs

Shanghai Artificial Intelligence Laboratory

arxiv preprint, 2026

[Paper]

📄 Other Papers

PR
TMVP

Temporal Consistent Multi-View Perception for Robust Embodied Manipulation

Haoyuan Chen, Rushuai Yang, Junjie Zhang, Xiaoyu Wen, Yi Chen, Dengxiu Yu, Chenjia Bai†, Zhen Wang†

Pattern Recognition (PR), 112177, 2025

arxiv preprint
Fair-ASR

Fair ASR: Re-Evaluating Black-Box Jailbreaks under Shared Target-Call Budgets

Zhida He, Xiaoyu Wen, Han Qi, Ziyuan Zhou, Peng Yu, Jiajia Li, Chaochao Lu, Qiaosheng Zhang†

arxiv preprint, 2026

🎓 Educations

  • [Sep. 2025 - Present]: Ph.D. in Artificial Intelligence, Shanghai Jiao Tong University, supervised by Prof. Qiaosheng Zhang.
  • [Sep. 2022 - Mar. 2025]: M.S. in Artificial Intelligence, Northwestern Polytechnical University, supervised by Prof. Zhen Wang.
  • [Sep. 2018 - Jun. 2022]: B.E. in Computer Science, Harbin Engineering University, supervised by Prof. Dongmei Yang.

🏢 Internships

  • [Feb. 2025 - Present]: Shanghai AI Lab, worked closely with Dr. Qiaosheng Zhang and Dr. Chaochao Lu on LLM\Agent safety alignment.
  • [May. 2024 - Sep. 2024]: Tencent AI Platform Department, focused on anthropomorphic game AI bots via reinforcement learning.
  • [Nov. 2023 - Apr. 2024]: Shanghai AI Lab, worked closely with Dr. Chenjia Bai on reinforcement learning research.

🤝 Academic Services

  • Conference reviewer: NeurIPS, ICLR, ICML, TMLR, AAAI, AAMAS.
  • ICML2026 gold reviewer

🏅 Honors & Awards

  • 2025.03: 🎉 Outstanding Master’s Graduate & thesis
  • 2024.12: 🎉 National Scholarship