ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

An attention-aware GNN-based input defender against multi-turn jailbreak on LLMs

An attention-aware GNN-based input defender against multi-turn jailbreak on LLMs 文章主要内容总结本文针对大型语言模型(LLMs)面临的多轮越狱攻击问题,提出了一种基于注意力感知的图神经网络(GNN)输入防御框架G-Guard。多轮越狱攻击通过多轮对话逐步引导至有害内容,较单轮攻击更难检测和防御。G-Guard的核心设计包括:实体图构建:从多轮查询中提取实体和关系,构建全局图结构,捕捉跨轮次的语义和逻辑依赖,明确有害关键词与查询的关联(即使关键词仅出现在历史查询中);注意力感知增强机制:通过句子级注意力层聚合多轮对话上下文,检索最相似的单轮查询作为标记节点插入图中,增强GNN的分类能力;子图选择机制:当对话过长时,基于注意力分数筛选最相关节点,在保证效率的同时保留关键上下文。实验表明,G-Guard在HarmBench、JailbreakBench及ChatGPT-4o生成的数据集上,在准确率、精确率和召回率上均显著优于现有基线方法(如ChatGPT-4o原生防御、Llama Guard、WildGuard等)。创新点图结构建模跨轮依赖:首次使用GNN构建实体-查询图,显式捕捉多轮对话中分散的有害意图关联,突破传统单轮过滤方法的局限;注意力感知增强:通过检索相似单轮查询作为标记节点,将已知攻击模式融入多轮推理,提升对多样化攻击的泛化能力;高效子图选择:基于注意力分数
返回列表