JailBreak for LLM-based Agent
选定这个研究目标的初衷,是鉴于现有体系逐渐完善:https://arxiv.org/pdf/2602.24009提出了跨攻击方法的统一评估框架,并在https://jbf.sqz.ac.cn/leaderboard提供了多种主流攻击的实际数据,便于跨方法的比对。对于作者,还可以主动使用该网站进行横向对比。
打算从攻击方法入手, 现有攻击方法,有单轮攻击、多论攻击(有点类似后门攻击,1,2,3没事正常,4一出现立即实现攻击)、小语种与对齐安全方式的攻击(llm使用大量英文数据进行安全对齐,而小语种则覆盖不多,由此导致小语种的提问安全对齐失效),著名的有https://arxiv.org/abs/2602.22983
目前计划快速看完主流的方法(5-20篇左右),结果不用看,因为https://jbf.sqz.ac.cn/leaderboard提供了主流的对齐dataset与 victim model的 攻击结果。
