
文章主要内容和创新点主要内容本文是乔治亚理工学院DS@GT团队为参与2025年CLEF Touché竞赛中的“检索增强辩论(RAD)”任务所做的研究。研究聚焦于大型语言模型(LLMs)在辩论中的两类应用:一是结合论据数据集生成结构化辩论回应,二是对辩论过程中的表述进行评估。方法:团队选取了来自OpenAI、Anthropic、Google的6个主流LLM(如GPT-4.1、Claude Opus 4、Gemini 2.5等),通过检索增强生成(RAG)技术,利用Elasticsearch和Stella嵌入从ClaimRev语料库中检索top10相关文档作为上下文,辅助模型生成辩论回应;同时设计自动评估管道,从“质量(Quality)、数量(Quantity)、方式(Manner)、相关性(Relation)”四个维度对回应进行评估。结果:LLMs在给定相关论据时辩论表现较好,但回应普遍冗长(如Claude Opus 4平均每句56.5词);评估时模型一致性较高,但严格程度差异显著(Anthropic模型评分最低,Gemini 2.5 Flash评分最高)。在官方排行榜中,GPT-4.1和Gemini-2.5的表现位居前列。其他发现:分析了不同模型的成本差异(如Gemini 2.5 Flash评估成本最低,Claude Opus 4最高),并讨论了系统实现中的挑战(如API集成、评估迭代难度)及未来优化方向。创新点