jailbreaking-is-mostly-simpler-than-you-think 从25年3月该博客发布、25年中旬《Response Attack: Exploiting Contextual Priming to Jailbreak Large Language Model》及25年末的《Bypassing Safety Alignment via API Design: A Systematic Risk Analysis of Response Prefill in LLM Systems》。

不同以往的是,后面两者研究不再专注于先前的提示词优化;通过搜索、包装来进行jailbreak攻击,这一搜索、攻击范式在过去的岁月中屡试不爽,无论是基于小语种的语言对齐隐患绕过LLM安全对齐、基于编码包装绕过安全对齐、还是借助RL指导同等规模LLM 进行攻击or MAS在某些tools加持下进行降维打击,都在此范式之内。

“高端的食材往往只需要最简单的烹饪方式“。通过伪造对话历史,通过api方式调用LLM,即可进行jailbreak,无需搜索、包装。

微软指出,这种“破绽”的原因是会话本地存储,而chatgpt的云端会话存储则无此问题,同时开源LLM必将长久面临此类问题;与此同时,微软给出了解决建议(针对盈利的LLM提供商),对会话信息进行签名、保留云端会话等。