ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Persona-Based Synthetic Data Generation Using Multi-Stage Conditioning with Large Language Models...

Persona-Based Synthetic Data Generation Using Multi-Stage Conditioning with Large Language Models... 文章主要内容总结本文针对情感识别领域高质量、多样化情感数据集稀缺的问题提出了一种基于大语言模型LLM的新型框架PersonaGen。该框架通过多阶段角色条件控制生成情感丰富的文本具体流程包括基础角色构建采样年龄、性别、职业、人格类型如MBTI等人口统计学属性确保组合的合理性社会文化背景整合加入教育背景、居住地、家庭结构、宗教信仰、收入水平等维度增强角色的真实性情境与风格设置定义具体场景如地点、活动、交流对象和语言风格如礼貌用语、网络俚语情感文本生成基于上述角色和情境引导LLM生成符合目标情感类别的文本。为验证框架有效性研究从四个维度进行评估语义多样性聚类和分布指标、类人性LLM质量评分、与真实语料的相似度以及在下游情感分类任务中的实用性。结果表明PersonaGen生成的文本在多样性、连贯性和判别性上显著优于基线方法可作为真实情感数据集的补充或替代。创新点总结提出多阶段角色构建的条件控制框架PersonaGen通过分层整合人口统计学属性、社会文化背景和情境信息生成多样化、真实的情感表达从语义聚类、分类准确性、分布相似度等多维度定量评估生成数据验证了其有效性和多样性通过与真实数据的对比分析证明该方法在情感识别和数据增强中具有实用价值尤其适用于真实数据难以获取的场景。翻译部分1. 摘要在情感识别领域由于高质量、多样化的情感数据集稀缺高性能模型的开发仍面临挑战。情感表达本质上具有主观性受个体人格特质、社会文化背景和情境因素影响这使得大规模、可泛化的数据收集在伦理和实践层面均存在困难。为解决这一问题我们提出了PersonaGen——一种通过基于多阶段角色的条件控制利用大语言模型LLM生成情感丰富文本的新型框架。PersonaGen通过整合人口统计学属性、社会文化背景和详细情境信息构建分层虚拟角色进而引导情感表达的生成。我们对生成的合成数据进行了全面评估包括通过聚类和分布指标评估语义多样性、通过LLM质量评分评估类人性、通过与真实情感语料对比评估真实性以及在下游情感分类任务中评估其实用性。实验结果表明PersonaGen在生成多样化、连贯且具有判别性的情感表达方面显著优于基线方法证明其有潜力作为增强或替代真实情感数据集的可靠方案。2. 引言在现代社会人类的各类活动如行为、语言表达、购买记录等不断被记录为数字痕迹。利用这些数据源的人工智能AI技术应用取得了快速发展。特别是自然语言处理NLP领域在大规模文本语料库的机器学习驱动下多项任务已取得显著成功[1]。近年来大语言模型LLM的出现进一步提升了上下文理解和自然生成能力为各类NLP应用带来了变革性进展[2]。然而在涉及人类深层内在状态的情感识别领域性能提升仍较为有限。一个主要障碍是高质量情感数据的严重稀缺——这类数据通常包含情感标签及对应的文本或图像。由于情感表达本质上具有主观性且高度多样化构建可泛化的数据集极具挑战。此外此类数据的收集还常受伦理和法律限制。例如在工作场所或医疗环境中个体的心理负担和隐私问题阻碍了实际数据获取对于儿童、老年人等弱势群体在现有伦理框架下收集其情感反应往往被认为不可行。为应对这些挑战利用生成模型合成情感数据的研究日益受到关注。其中在大规模文本语料上预训练的LLM在给定条件输入时能够生成流畅且符合上下文的情感表达[3][4]。例如通过提供特定的角色属性或情境设置作为输入提示LLM可生成与这些条件匹配的情感丰富的语言。这使其成为一种极具潜力的合成数据生成方案不受传统数据收集的伦理和后勤限制。本研究提出了一种新型框架PersonaGen它利用LLM的能力通过多阶段条件控制生成多样化且符合上下文的情感数据。我们的方法首先构建基础角色档案包含年龄、性别、职业和人格特质等属性随后通过整合社会文化维度如教育背景、居住地区、家庭结构、宗教信仰、价值体系和收入水平对角色进行分阶段丰富最后将详细的情境信息如地点、活动、交流对象、传播媒介和语言风格与目标情感类别一同作为条件提示引导LLM生成连贯自然的情感表达。该框架能够生成高质量数据集捕捉情感语言的多样性和主观性同时避免真实数据获取的负担。为评估所提方法的有效性我们聚焦以下三个研究问题RQRQ1. 生成的情感文本能否准确且语义多样地表达指定的情感类别RQ2. 生成文本的自然度和类人性达到何种程度RQ3. 生成的合成数据与真实数据的相似度如何其在下游情感分类任务中的应用效果如何通过对这些问题的系统评估本研究旨在验证PersonaGen在情感理解和数据增强场景中的实用性。本研究的主要贡献如下i) 提出新型框架PersonaGen它基于分层角色构建进行多阶段条件控制能够在丰富的情境下生成多样化、真实的情感表达。ii) 从聚类可视化、分类准确率、语义相似度和分布指标等多维度对生成的合成数据进行定量评估验证了生成内容的有效性和多样性。iii) 通过与真实数据的对比分析证明所提方法在情感识别和数据增强中具有实用价值尤其适用于真实情感数据集难以获取的场景。3. 结论本研究提出了PersonaGen一种基于多阶段角色条件控制的情感文本生成新型框架能够合成多样化、富含上下文的情感表达。全面评估表明所提方法在语义对齐、情感可分性和类人性方面优于基线方法验证了其作为合成数据集的质量。未来工作将聚焦于缩小与真实数据的差距提高合成情感数据集在下游任务中的实际适用性。
返回列表