ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

论文阅读 TDSC 2026 RedAgent: An Autonomous Agent for Context-Aware Red Teaming of LLM Jailbreaks

论文阅读 TDSC 2026 RedAgent: An Autonomous Agent for Context-Aware Red Teaming of LLM Jailbreaks 总目录 大模型安全研究论文整理 2026年版https://blog.csdn.net/WhiffeYF/article/details/159047894RedAgent: An Autonomous Agent for Context-Aware Red Teaming of LLM Jailbreakshttps://ieeexplore.ieee.org/document/11397286https://ieeexplore.ieee.org/stamp/stamp.jsp?tparnumber11397286TDSC 2026 | RedAgent LLM上下文越狱红队 背景该论文题为《RedAgent: An Autonomous Agent for Context-Aware Red Teaming of LLM Jailbreaks》作者包括Huiyu Xu、Wenhui Zhang、Zhibo Wang等7人主要来自浙江大学Feng Xiao来自Palo Alto Networks。 痛点该论文指出定制化LLM越“懂业务”越可能暴露只在特定场景出现的越狱漏洞。传统红队多用通用模板改写却很少系统利用目标应用的系统配置、工具和任务场景。该论文测试60个热门定制GPT发现把攻击改写为与目标场景匹配的提示后攻击成功率平均提升约20%回复毒性平均提升30%以上。️ 方法该论文提出RedAgent将红队测试做成多LLM协作代理。长期记忆保存结构化越狱策略和历史经验短期记忆保存当前上下文偏好五个LLM角色分别负责总结、检索、生成、评估和路线选择。失败后router可换策略、重试或细化提示而非机械重复改写。 例子「可以把RedAgent想成给医院做安全体检。普通方法像拿同一张检查表RedAgent会先判断目标场景再从经验库找匹配方案。第一次检查后它根据反馈记录暴露出的边界下一轮由“调度员”决定继续深挖、换方案还是重新确认目标。」 实验发现第一该论文在通用LLM上平均不到5次查询即可完成大多数越狱测试平均成功率超过90%查询效率约为先进红队方法的2倍。第二面向60个热门定制GPT该论文发现600个0-day越狱提示平均每个漏洞少于2次查询相比简单上下文攻击ASR提升20%以上。第三消融实验显示记忆检索很关键移除知识检索后通用场景ASR从92%降至60%上下文与恶意目标标签同时移除时平均查询数升至9次。 总结该论文把LLM红队从“通用模板试错”推进到“感知场景、积累经验、动态选路”的自动化安全测试也提醒我们LLM安全不能只看基础模型还要看真实应用中的上下文风险。摘要近年来大语言模型Large Language ModelsLLMs已被集成到许多现实世界应用中例如 Code Copilot。这些应用显著扩大了 LLM 的攻击面使其暴露于复杂的现实世界越狱威胁之中。尽管在一般上下文中主动发现 LLM 越狱漏洞即红队测试方面已经取得了很有前景的进展但如何在复杂的领域特定上下文例如数学 LLM中识别这些威胁仍缺乏充分研究。该论文研究了现实世界 LLM 应用所处的上下文——包括不同的系统提示词、工具以及任务场景——是否会产生上下文特定的越狱威胁。具体而言该论文通过 LLM 重写将通用越狱提示词适配到目标应用的上下文中从而生成上下文特定攻击。通过衡量通用攻击与上下文特定攻击之间越狱响应的差异该论文揭示了定制化的领域特定 LLM 在其特定上下文中更容易受到攻击。基于这一观察该论文提出了一种上下文感知红队测试方法 RedAgent用于针对定制化 LLM 应用生成上下文特定的越狱攻击。通过在智能体系统中有效检索并更新结构化知识RedAgent 能够高效感知并利用上下文信息使越狱提示词适配目标上下文。大量实验表明该系统仅需 5 次查询即可越狱大多数黑盒 LLM使现有红队测试方法的效率提高两倍。此外RedAgent 还能够有效越狱定制化 LLM 应用。通过针对 OpenAI 市场上的 60 个热门应用生成上下文特定的越狱提示词该论文发现了这些现实世界应用中的 600 个漏洞每个漏洞仅需 2 次查询。索引词——越狱攻击大语言模型LLM红队测试。I. 引言由于 LLM 在语言处理和推理方面展现出了令人印象深刻的能力它们已被用作众多定制化应用的基础组件以解决不同的现实世界任务例如 GPTs [2] 中的 Code Copilot [1]。通过集成领域特定知识和外部工具定制化 LLM 应用能够在特定“上下文”中增强其处理专业任务的能力这些上下文包括特定的系统提示词、外部工具以及额外的微调。然而这些在特定上下文中的增强能力也使 LLM 应用暴露于更加复杂的越狱威胁之中攻击者可以构造恶意提示词来诱导模型产生不期望的响应 [3]、[4]、[5]、[6]、[7]、[8]。例如代码助手 LLM 在在线搜索知识时可能受到越狱提示词欺骗并在代码中生成不安全的链接 [9]。为应对这些不断增长的威胁近年来出现了大量旨在开发有效红队测试方法的研究 [10]、[11]、[12]、[13]、[14]、[15]以主动识别 LLM 中的越狱漏洞。这些方法主要关注生成越狱提示词使目标 LLM 输出有害响应从而在黑盒设置下模拟潜在的对抗场景。尽管这些方法在发现一般上下文中的越狱漏洞方面取得了进展但在复杂的领域特定上下文例如数学 LLM中识别此类漏洞仍是一个紧迫且尚未得到充分研究的问题。随着定制化 LLM 应用在日常使用中越来越普遍该问题的重要性进一步提升。例如图 1 表明定制化 LLM例如数学求解器 [16]更容易受到利用其特有能力的上下文特定越狱提示词攻击例如利用数学证明使其生成关于制造海洛因的更加详细的响应。这进一步凸显出现有红队测试方法中的一个重要缺口即它们未能考虑定制化 LLM 部署所具有的独特上下文。图 1. 在相同的“制造海洛因”越狱目标下使用通用提示词与上下文特定提示词对定制化 LLM Math [16] 进行越狱的真实案例对比。红色部分突出显示了提示词中具有上下文特定性质的内容。为弥补这一缺口该论文首先研究这些定制化上下文是否会引入新的上下文特定越狱威胁。具体而言该论文在 OpenAI 市场中选取来自 6 个主流应用类别的 60 个热门定制化 LLM对其上下文特定越狱威胁进行评估。为了生成用于评估的上下文特定越狱提示词该论文提出了一种转换方法通过 LLM 重写根据应用描述将通用越狱提示词适配到目标应用的特定上下文中。评估结果表明将越狱提示词针对目标应用的特定上下文进行定制可以显著提高攻击有效性攻击成功率ASR提高 20% 以上响应毒性提高 30% 以上。:chatgpt-content-reference{index“2”}因此理解如何生成更有效的提示词来识别这些上下文特定漏洞十分重要。为此该论文进一步开展分析以确定不同攻击策略在不同上下文中是否表现出不同程度的适应性。结果表明越狱策略对特定上下文存在一定偏好这说明可以通过选择与目标上下文匹配的策略来优化攻击。基于这些发现该论文确定攻击与目标上下文之间的关联存在两个层次i策略层面越狱策略决定攻击的语义框架例如角色扮演、基于证据的说服等。不同策略在不同上下文类别中的有效性存在差异这意味着策略选择应具有上下文感知能力。ii攻击变体层面除策略选择之外具体攻击变体决定攻击如何适配目标领域例如在数学助手中加入数学术语这能够在所选策略内部大幅提高攻击有效性。基于上述认识该论文进一步总结了红队测试方法在有效生成上下文特定越狱提示词时面临的以下挑战。值得注意的是该论文发现这些挑战源于现有红队测试方法的根本局限i红队知识利用的灵活性与可扩展性红队测试方法会从大量越狱提示词及历史测试中积累大量非结构化知识因此很难利用其中的有效模式来生成提示词。这种不灵活性阻碍了针对特定场景生成提示词。GPTFuzzer [14] 等现有方法依赖人工模板和无引导的变异而 PAIR [11] 与 TAP [12] 仅依据模型响应迭代优化攻击并未显式建模上述策略层面的关联。ii生成提示词的上下文相关性定制化智能体可能表现出不同的交互模式并适应不同的对话领域。因此对这些智能体进行红队测试更加困难因为这需要进行大量适配包括对提示词实施细微且细粒度的调整以适应新的上下文。典型红队方法往往随机探索潜在的越狱变体通常依赖从过去测试中得到的通用模板因此缺乏上下文相关性。由于现有方法没有显式估计或利用目标 LLM 响应中的上下文信息它们无法有效地使提示词适应特定上下文。iii提示词细化的多样性典型红队测试方法仅使用少量变异操作来细化越狱模板。受限的动作空间限制了自适应提示词生成的自动化能力往往导致低效的细化过程。上下文特定红队测试的关键要求是能够根据从响应中估计出的上下文信息动态调整攻击而这需要更加多样、更加灵活的动作空间是现有方法所不具备的。:chatgpt-content-reference{index“3”}为应对这些挑战该论文提出 RedAgent这是一种新的红队测试方法能够自动感知上下文并据此将通用越狱提示词调整为上下文特定提示词。为了提高红队知识的可扩展性和灵活性该论文提出将已有越狱提示词建模为越狱策略的结构化表示。这些策略被组织为结构化文本并作为灵活的生成条件用于生成可适用于不同上下文的自适应提示词。在此建模基础上该论文通过构建上下文感知红队提高所生成提示词的上下文相关性。不同于以往方法该论文从两个层面对红队知识进行优化全局策略层面即长期记忆和上下文修改层面即短期记忆。在全局策略层面红队选择可应用于广泛场景的总体策略以指导通用提示词的构造。相比之下上下文修改层面侧重于使提示词适应特定上下文。为了有效捕获上下文信息RedAgent 会主动分析响应并识别其中的模式。通过利用这些上下文模式它以提示词后缀的形式生成细粒度评判信息从而指导推理过程并更加有针对性地引导提示词细化。:chatgpt-content-reference{index“4”}为了增加提示词细化过程的多样性该论文通过加入若干预定义细化动作来扩展红队的动作空间使红队能够根据实时观察动态选择最适合的动作。该论文利用路由机制获得高层动作以稳定这一过程从而帮助确保决策的一致性与效率。通过显式生成多样化的细化动作来指导推理过程该论文缩短了生成上下文特定越狱提示词的路径从而提高了构造有效上下文特定越狱提示词的效率。大量评估结果表明该系统在大多数情况下仅需 5 次查询即可越狱黑盒 LLM使先进红队测试方法的效率提高两倍同时平均成功率超过 90%。为了进一步验证该方法在测试 LLM 应用方面的有效性该论文对 OpenAI 市场中 60 个使用最广泛的定制化 GPT 进行了越狱测试。通过生成上下文特定越狱提示词该论文仅以每个漏洞 2 次查询的代价就发现了这些应用中的 600 个严重漏洞。值得注意的是RedAgent 成功诱导代码助手 GPT 生成高度详细的恶意软件并诱导视频脚本编写 GPT 生成明确的暴力脚本。该论文已经对所发现的漏洞进行了负责任披露。代码与数据可在 https://github.com/QuirkShark/RedAgent 获取。:chatgpt-content-reference{index“5”}贡献该论文的贡献总结如下• 该论文提出了一种新的上下文特定越狱攻击它利用 LLM 应用的上下文信息对越狱提示词进行细化。通过对 OpenAI 市场中 60 个热门定制化 LLM 进行大规模评估该论文证明上下文能够显著提高越狱攻击的有效性。• 该论文设计并实现了 RedAgent一种高效的上下文感知红队测试方法能够自主生成上下文特定越狱提示词。大量实验结果表明RedAgent 不仅能够在仅 5 次查询内高效越狱基础模型其效率是先进方法的 2 倍还能够在 2 次查询内越狱 LLM 应用从而发现最相关、最严重的上下文特定漏洞。• 该论文对 OpenAI 市场中 60 个热门定制化 LLM 进行越狱评估发现了 600 个可能造成严重安全影响的现实世界问题。V. 评估 :chatgpt-content-reference{index“6”}在本节中该论文首先给出评估概览并在第 V-A 节中重点介绍主要发现。随后该论文在第 V-B 节中详细说明实验设置并对 RedAgent 在一般上下文和定制化上下文中的有效性进行综合评估旨在回答以下研究问题• RQ1RedAgent 能否提高现有红队测试方法在一般上下文中的效率第 V-C 节• RQ2RedAgent 能否有效识别定制化 LLM 应用中的上下文特定越狱威胁第 V-D 节• RQ3哪些因素会显著影响 RedAgent 的攻击性能第 V-E 节A. 评估概览为了研究 RQ1该论文首先展示系统在 50 种主流越狱策略上的泛化能力。随后该论文在最新基准上将该系统与现有方法进行比较。该系统在保持越狱成功率高于 90% 的同时使用的查询次数减少两倍平均少于 5 次查询即可成功发现漏洞。为了研究 RQ2该论文对 GPT 市场中的 60 个热门定制化应用进行红队测试。该系统通过生成高质量的上下文特定越狱提示词实现高效的上下文感知红队测试并仅以每个漏洞 2 次查询的代价发现这些现实世界应用中的 3,000 个关键漏洞。为了研究 RQ3该论文进行了消融实验以评估 RedAgent 各个阶段的有效性。结果发现构建灵活的红队知识以及进行上下文相关检索是提高系统效率的关键而上下文引导的策略修改能够显著提高越狱提示词的质量。:chatgpt-content-reference{index“7”}B. 实验设置数据集该论文使用与第 III-B 节所述相同的数据集并针对一般上下文采样 50 个有害目标针对定制化上下文采样 10 个有害目标。目标 LLM在实验中该论文主要使用以下 LLM。一般用途 LLM即基础模型该论文在黑盒和白盒设置下评估基础模型包括 OpenAI 的 ChatGPTGPT-3.5 和 GPT-4、Gemini-pro、Claude-3-5-Sonnet-20240620以及两个开源模型 Vicuna-7b-v1.5 和 LLaMA-2-7b-chat-hf。所有模型均采用官方发布且经过安全对齐的版本这些模型于 2024 年 10 月进行测试。该论文还考虑先进的基于 LLM 的推理模型 deepseek-r1-distill-qwen-7b以进一步评估 RedAgent 在推理模型上的有效性。定制化 LLM 应用为了在先进的实际 LLM 应用中测试该系统该论文选取了 2024 年的 60 个热门 GPT每个应用均拥有超过 10k 条对话记录。这些 GPT 覆盖写作、生产力、研究、编程、教育和生活方式六个领域每个类别包含 10 个应用。:chatgpt-content-reference{index“8”}基线实验将 RedAgent 与先进红队测试方法 PAIR [11]、TAP [12]、GPTFuzzer [14] 和 PAP [15] 进行比较。对于 PAIR该论文使用 GPT-3.5在全部实验中保持一致设置 temperature 1、top-p 0.9。系统提示词包含三种并行策略角色扮演、逻辑诉求和权威背书并加入思维链推理。输出被强制要求为 JSON 格式。对于 TAP该论文将分支因子设置为 4最大宽度设置为 10。攻击模型统一使用 GPT-3.5temperature 1top-p 0.1。系统提示词将其角色设定为红队测试助手包含思维链改进并强制使用 JSON 格式。对于 GPTFuzzer通过变异模型使用五种操作Generate生成、Crossover交叉、Expand扩展、Shorten缩短和 Rephrase改写并同时使用这些操作以增加多样性。初始种子从 77 个由人工编写的模板中根据有效性筛选排名前 5 的模板。攻击/变异模型统一采用 GPT-3.5temperature 1.0以促进采样多样性。对于 PAP每次从 13 种策略中随机选择一种并通过 GPT-3.5 生成相应查询。为确保公平比较RedAgent 使用 GPT-3.5 作为攻击模型。所有实验均使用 GPT-4 作为评估器。指标为了评估该方法的有效性该论文使用攻击成功率Attack Success RateASR作为主要指标。ASR 衡量由生成的越狱攻击提示词得到越狱响应的问题数量占全部越狱目标数量的比例所有实验都在预定义查询预算内进行。为了与基线方法进行公平比较该论文将该预算设为 60 次查询。这一预算根据 PAIR 的最佳超参数选择其中 N 20、K 3。该论文进一步采用平均查询次数Average Number of QueriesANQ衡量红队测试方法的效率它表示对于每一个越狱目标从目标模型获得越狱响应所需的平均查询次数。为了测试这些红队方法的成本该论文还针对每一个恶意目标计算平均 Token 成本Average Token CostATC作为计算成本指标。考虑到主流服务的 API 成本定价通常需要区分输入 Token 和输出 Token为了衡量攻击者的实际成本该论文遵循主流服务的计算方式将等效 Token 成本计算为“输出 Token 数的 3 倍 输入 Token 数”。:chatgpt-content-reference{index“9”}表 II在每个越狱目标具有 40 次查询预算的条件下对通用 LLM 进行越狱的评估结果。该论文对越狱结果进行了人工标注以保证准确性。最佳结果在原表中以粗体标出。ASR 数值表示为点估计值 ± 95% Wilson 置信区间的半宽度。方法Vicuna-7b-v1.5 ASR(%)ANQATC/kLLaMA-2-7b-chat-hf ASR(%)ANQATC/kGPT-3.5-turbo-1106 ASR(%)ANQATC/kPAIR94 ± 2.456.72173.346 ± 3.1519.74510.064 ± 3.2013.25342.0TAP90 ± 4.184.58219.148 ± 3.1613.25634.636 ± 4.439.67463.2PAP94 ± 3.064.1510.158 ± 3.5513.8633.458 ± 4.439.122.0GPTFuzzer100 ± 3.001.214.462 ± 3.2917.26207.450 ± 3.3915.04180.3RedAgent该论文100 ± 1.402.6810.192 ± 2.396.8926.896 ± 2.485.7322.6方法GPT-4-1106-preview ASR(%)ANQATC/kGemini-Pro ASR(%)ANQATC/kClaude-3.5-sonnet ASR(%)ANQATC/kPAIR74 ± 3.799.73251.094 ± 2.457.75200.038 ± 2.3417.05439.0TAP62 ± 3.199.36448.586 ± 4.236.21298.322 ± 3.3713623.9PAP92 ± 2.865.6313.696 ± 2.732.15.116 ± 3.1011.7528.4GPTFuzzer12 ± 3.009.17110.098 ± 2.962.30627.50 ± 1.00N/A576RedAgent该论文100 ± 2.003.7612.7100 ± 2.003.7614.374 ± 3.609.5437.1图 9. 在不同查询预算下越狱不同 LLM 时的累计成功率。C. RedAgent 在一般上下文中的效率RQ1 :chatgpt-content-reference{index“10”}在本小节中该论文将与先进红队测试方法进行比较展示该系统在一般上下文中生成有效越狱提示词的效率。在该设置中RedAgent 不会对越狱目标进行上下文特定转换。• RedAgent 在越狱通用 LLM 时具有很高的效率其效率是先进红队测试方法的两倍同时还具有更高的成功率表 II 给出了在每个越狱目标具有 40 次查询预算时对通用 LLM 聊天机器人进行越狱的平均成功率ASR和成功越狱所需的平均查询次数ANQ。RedAgent 对大多数 LLM 的越狱成功率均高于 90%特别是在 Llama 2 和 GPT-3.5 上其 ASR 比基线高出 30% 以上。同时RedAgent 在越狱大多数 LLM 时具有更高效率平均查询次数少于 5 次比先进方法少两倍。为了进一步展示 RedAgent 在不同预算下的有效性该论文在图 9 中绘制了累计成功率。从曲线斜率可以观察到在前 20 次查询中RedAgent 的成功率增长最快并且在越狱大多数 LLM 时取得最高成功率。需要注意的是GPTFuzzer [14] 的设计目标是通过人工构造模板进行变异以找到最通用的越狱提示词从而尽可能成功越狱更多越狱目标。因此在某些情况下GPTFuzzer 会在红队测试过程早期发现通用漏洞并成功越狱大多数越狱目标尤其是对于某些尚未修复这些流行越狱模板的模型例如 Vicuna。然而这种方法虽然提高了效率却以牺牲生成越狱提示词的多样性为代价因为这些提示词依赖人工构造模板。当这些模板失效时越狱提示词也随之失效。例如GPTFuzzer 无法在任何越狱目标上成功越狱 Claude即 ASR 0。该论文进一步验证了 RedAgent 对基于 LLM 的推理模型进行红队测试的有效性如图 10 所示。该论文观察到推理模型同样容易受到越狱攻击而与其他基线方法相比RedAgent 表现出最高效率使 ANQ 降低了三倍。相比之下RedAgent 依赖从过去经验中抽象得到的越狱策略这些策略更加隐蔽也更难修复。图 10. 不同红队测试方法在基于 LLM 的推理模型上的评估结果。• RedAgent 在 API Token 使用方面具有成本效益该论文在表 II 中比较了这些红队测试方法的 API Token 成本。尽管基于智能体的红队测试方法在每次测试中需要更多推理但其 API 成本低于先进基线方法。这一效率来自以更少的迭代次数生成更高质量的越狱提示词。在越狱大多数目标 LLM 时其 Token 成本仅为 PAIR 和 TAP 的 5%仅为 GPTFuzzer 的 10%。此外在非迭代式红队方法 PAP 上该方法能够保持相同的性能水平。:chatgpt-content-reference{index“11”}• RedAgent 可以通过生成上下文特定提示词有效发现特定 LLM 应用的漏洞表 III 表明RedAgent 平均使用少于 2 次查询即可有效越狱 LLM 应用与越狱 GPT-4 相比效率提高两倍。与简单上下文特定越狱攻击的结果相比RedAgent 仅经过少量迭代便可将 ASR 提高 20% 以上。:chatgpt-content-reference{index“12”}表 III简单上下文特定攻击和 RedAgent 在越狱定制化 LLM 应用时的结果GPTs 类别ASR_simple(%)toxicity_simpleASR_red(%)toxicity_redANQ_red写作713.51004.31.3生产力813.91004.32.6研究分析673.51004.42.2教育944.41004.51.8生活方式803.91004.61.5编程1004.51004.81.2图 11. 由 RedAgent 生成的上下文感知越狱提示词所诱导的视频脚本编写器 [57] 产生严重暴力越狱响应的真实示例。• RedAgent 可以诱导定制化 LLM 应用生成具有严重毒性的有害响应图 11 展示了由 RedAgent 生成的上下文特定提示词所触发的一次有害越狱响应。在该示例中一个用于编写历史奇幻故事的提示词使定制化 LLM 视频脚本编写器生成了一段极端暴力的脚本。这表明当向定制化 LLM 应用提供详细的上下文偏好时这些应用可能在自身特定领域中暴露出严重漏洞。通过比较 RedAgent 生成的越狱提示词与简单上下文特定提示词产生的响应毒性可以看到在红队测试过程中加入上下文偏好后越狱提示词的质量得到提高响应毒性提高 5% 以上从而能够发现更加严重的漏洞。:chatgpt-content-reference{index“13”}• LLM 表现出上下文特定漏洞而专业化应用更容易在其对应应用领域中暴露严重漏洞该论文通过比较特定代码助手应用与 ChatGPT 中有效的越狱策略及其响应研究越狱漏洞的上下文特定性质。这两者均基于 GPT-4-1106-preview 构建。如图 12 所示可以观察到对于擅长代码相关任务的 Code Copilot更容易利用其生成有害代码。相比之下GPT-4 在该领域的专业化程度较低只会提供关于如何设计此类代码的模糊指导。这一示例表明对于构建在不同上下文中的 LLM即使所采用的策略相同使用上下文特定越狱提示词也能够发现更加相关且更加严重的漏洞。此外在相同实验设置下比较 RedAgent 越狱 GPT-44 次查询与 GPTs2 次查询的效率可以发现以 LLM 为中心的应用越先进、越智能其也会变得越容易受到攻击。:chatgpt-content-reference{index“14”}图 12. 使用相同越狱策略攻击通用 LLMChatGPT与特定上下文中的 LLMCode Copilot的比较。D. RedAgent 在上下文感知红队测试中的有效性RQ2在本小节中该论文将与第 III-C 节所描述的简单上下文特定攻击进行比较展示该系统通过生成上下文特定越狱提示词来发现定制化 LLM 应用中最相关漏洞的效率。该论文在表 III 中给出了针对 GPT 市场中 60 个热门现实世界 LLM 应用的实验结果。通过上下文感知红队测试该论文发现了 600 个 0-day 越狱提示词证明了该系统在生成上下文特定越狱提示词方面的有效性与效率。:chatgpt-content-reference{index“15”} :chatgpt-content-reference{index“16”}E. 消融实验RQ3 :chatgpt-content-reference{index“17”}RedAgent 在越狱一般 LLM 和定制化 LLM 应用时表现出优越性能尤其是在有效性ASR和效率ANQ方面取得提升。为了进一步探索这些能力的来源并识别其中的关键设计要素该论文在本节进行了消融实验以定量评估各个组件对性能的影响。具体而言如表 IV 所示消融实验重点研究各个模块对 RedAgent 在一般上下文GPT-4和特定上下文GPTs中的性能影响。此外该论文还针对长期记忆进行了更加详细的消融实验衡量记忆容量以及标签对该方法有效性的影响如表 V 所示。表 IVRedAgent 在一般上下文和特定上下文中的消融实验模型一般上下文 ASR%一般上下文 ANQ特定上下文 ASR%特定上下文 ANQ无知识检索606.051003.48无上下文指导894.291001.98无路由825.71001.83RedAgent923.571001.76• 知识检索在对这一组件进行评估时该论文移除长期记忆和检索过程并使用随机策略生成越狱提示词同时保留上下文感知评估和自适应路由。结果表明构建灵活的红队知识是提高系统效率的关键因素可使 ASR 提高 20%、ANQ 改善 17%这一作用在一般上下文中尤其明显因为在这种情况下可以同时收集大量失败尝试和有效尝试。• 上下文感知评估该论文移除上下文信息提取过程并且不使用存储在短期记忆中的额外生成条件。结果表明在特定上下文中上下文感知评估能够提高 RedAgent 的效率ANQ 改善 6%因为这些上下文特定提示词依赖上下文相关性来提高其质量。• 自适应红队路由在这一组件中该论文移除路由机制仅使用“细化越狱提示词”作为唯一的细化动作。结果表明针对一般 LLM 进行红队测试时路由机制能够提高有效性使 ASR 提高 10%、ANQ 改善 8%原因在于当选择错误策略时红队可能多次失败。记忆该论文同时衡量记忆容量和记忆条目标签设计对一般上下文GPT-4和特定上下文GPTs最终性能的影响。:chatgpt-content-reference{index“18”}表 V长期记忆容量和标签对 RedAgent 攻击性能的影响。“C”表示“上下文类别Context Category”标签“G”表示“恶意目标Malicious Goal”标签。ASR_general 和 ANQ_general 表示 GPT-4 在一般上下文中的结果ASR_context 和 ANQ_context 表示定制化 GPTs 的结果。记忆容量指标01102550ASR_general(%)6076928680ANQ_general6.054.633.574.653.79ASR_context(%)100100100100100ANQ_context3.482.921.761.712.65记忆标签指标默认无 C无 G无 C 与 GASR_general(%)92889292ANQ_general3.575.316.39ASR_context(%)100100100100ANQ_context1.761.922.132.80• 增加记忆条目能够提高 RedAgent 的效率但条目过多可能在提高效率的同时降低有效性为了研究长期记忆中的记忆条目数量是否会影响 RedAgent 的效率和有效性该论文在相同查询预算下分别将最大记忆条目数量设为 0、10、25、50对 GPT-4 和 GPTs 进行越狱并在表 V 中给出结果。可以观察到随着更多记忆条目的加入越狱效率得到提高相比没有记忆时即 capacity 0提高了两倍。由于有用的攻击经验需要频繁从存储库中删除过小的容量限制会限制规划器获得有效策略从而限制性能。相反过大的容量例如 50可能超过模型处理长文本的能力进而降低策略构造的有效性例如当 capacity 50 时ASR_general 降至 72%。:chatgpt-content-reference{index“19”}• 上下文标签和目标标签对于查询效率至关重要而移除这些标签会在不同程度上降低效率为了研究长期记忆中的不同记忆标签如何影响 RedAgent 的效率和有效性该论文使用 50 个恶意目标在不同记忆标签配置下对 GPT-4 和 6 个定制化应用进行越狱结果如表 V 所示。研究结果表明默认记忆标签取得最高 ASR同时保持相对较低的 ANQ即 ASR 92%、ANQ 4.65。移除上下文标签或恶意目标标签可能妨碍知识检索过程快速捕获相关经验从而轻微影响查询效率例如在一般上下文中ANQ 分别增加至 5.31 和 6.3。此外同时移除这两个标签会使查询次数显著增加即 ANQ 增加至 9表明这些标签对于效率至关重要。:chatgpt-content-reference{index“20”} :chatgpt-content-reference{index“21”}图 1 展示了在相同“制造海洛因”的越狱目标下通用越狱提示与上下文特定越狱提示攻击定制化数学 LLM 时的差异。左侧“General Jailbreak Prompt通用越狱提示”中红队虽然以公共健康、风险说明等理由包装请求但本质上仍直接要求模型提供非法毒品合成教程因此数学模型明确拒绝并回复“无法协助提供如何合成海洛因等非法物质的信息”。图中将这一结果标记为“Reject拒绝”。右侧“Context-specific Jailbreak Prompt上下文特定越狱提示”则把相同的恶意目标重新包装到目标模型擅长的“数学证明/数学推导”语境中例如强调“理解药物合成背后的复杂数学”要求以教育和减害为名进行数学化说明。结果模型不再直接拒绝而是生成了更详细、与合成过程相关的内容包括化学计量、反应关系等。图中紫色部分表示“Context-specific pattern上下文特定模式”红色部分表示“有害内容”。出于安全考虑这里不复述图中具体的毒品合成步骤与化学细节。这张图想说明的核心是越狱攻击的有效性不仅取决于“问什么”还取决于“用什么上下文去问”。同一个恶意目标通用提示可能触发安全拒绝但如果攻击者将请求伪装成目标应用最熟悉的任务形式例如针对数学助手采用数学证明、推导等表达就可能利用模型在特定领域中的“顺从倾向”绕过安全机制。也正因此该论文提出要进行“上下文感知”的红队测试安全评估不能只测试通用恶意提示还要测试与应用功能、系统提示和任务场景高度匹配的攻击。图 2 展示了该论文在实验中构造“上下文特定越狱提示Context-specific Jailbreak Prompt”的完整流程。首先研究者从“恶意问题池Malicious Questions Pool”中采样一个初始越狱目标例如某类非法物质制造请求同时通过在线收集获得目标 LLM 应用的描述信息。图中的目标应用是一个数学助手其功能描述包括数学计算、绘图和可视化等。随后攻击模型将“初始越狱目标”和“目标 LLM 描述”共同作为输入把原始恶意目标改写成与目标应用场景一致的“上下文特定越狱目标Context-specific Jailbreak Goal”例如将直接的危险请求包装成“数学证明”或“数学推导”任务。在得到上下文特定目标之后系统进入“Prompt Generation提示生成”阶段。攻击模型会结合预设的越狱策略生成更具体的上下文特定提示。图中的示例采用“Storytelling故事叙述”策略将原本直接的恶意请求重新组织成看似属于专业讨论、教育或领域任务的表达。图注的含义是与典型的通用越狱提示相比该论文不是直接围绕原始恶意目标生成提示而是先根据目标 LLM 的具体应用上下文转换恶意目标再据此生成最终的上下文特定越狱提示。这张图的核心可以概括为“先了解目标再定制攻击”。传统越狱测试更像拿同一套问题去测试所有模型而这里的方法会先识别目标应用“擅长什么、以什么方式工作”再把测试目标改写成符合其专业语境的形式。这样做的意义在于作者希望验证LLM 在通用场景下可能能够识别并拒绝危险请求但当同一意图被嵌入数学、编程、教育等与其功能高度匹配的上下文后其安全边界是否会发生变化。图 2 因此也是后续 RedAgent 设计中“上下文感知”思想的基础。
返回列表