
文章主要内容总结本文聚焦于人类撰写文本(HWT)与大型语言模型(LLMs)生成文本(MGT)的语言特征差异,通过多维度语言分析(形态学、句法、语义等)揭示两者的区别,并探讨模型输出的变异性与同质化趋势。研究使用RAID数据集(涵盖8个领域、11种LLMs的467,985条文本),提取了文本长度、句子长度、形态复杂度、依存深度、情感性等10项语言特征,结合统计分析、逻辑分类器和风格嵌入模型进行分析。主要发现包括:人类文本倾向于句法结构更简单、语义内容更多样;人类与机器文本在不同领域均表现出风格多样性,但人类的特征变异性更大;新模型的输出变异性更接近,存在同质化风险;聊天模型的风格变异性与人类更接近,而非聊天模型变异性更低。创新点多维度语言特征分析:跨形态学、句法、语义等层面系统对比HWT与MGT,揭示两者在结构复杂度、内容多样性等方面的核心差异。变异性与同质化研究:分析不同模型、领域的特征变异性,发现新模型输出趋同(可能与“模型坍塌”相关),且聊天模型风格变异性更接近人类。特征重要性与风格嵌入结合:通过逻辑分类器识别区分HWT与MGT的关键特征(如句法复杂度、语义多样性),并结合风格嵌入模型验证变异性差异。翻译部分摘要大型语言模型(LLMs)的快速发