ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

DB-GPT 0.7.4 版本更新|开源蚂蚁集团Text2SQL数据集:Falcon、支持GLM-4.5大模型

DB-GPT 0.7.4 版本更新|开源蚂蚁集团Text2SQL数据集:Falcon、支持GLM-4.5大模型 1. 为什么 Text2SQL 评测总在“看起来能跑”和“真的准”之间翻车Text2SQL 这件事做过的人都懂模型能写出一条 SQL 不难难的是这条 SQL 在真实业务库上跑得对、跑得准、跑得稳。DB-GPT 0.7.4 这次更新里最值得本地部署开发者关注的两块一个是蚂蚁集团开源的 Falcon Text2SQL 数据集另一个是对 GLM-4.5 大模型的接入支持。前者解决“拿什么标准衡量模型好不好”后者解决“用哪个推理后端跑评测”。Falcon 是什么简单说它是蚂蚁集团开源的一套高质量中文 Text2SQL 评测数据集专门用来压测复杂、跨域分析场景下的模型能力。它包含 28 个数据集、90 张表当前已正式发布 500 道不同难度的中文题目其中 easy 151 道、medium 130 道、hard 219 道。题目难点集中在两块SQL 计算难题多表连接、嵌套 CTE、窗口函数、排名、类型转换、正则过滤和语言难题中文模糊时间表达、口语化商业术语、省略号、多意图疑问句。适合谁适合所有在本地部署 DB-GPT、想客观评估自家模型或 Agent 在 Text2SQL 任务上表现的开发者。DB-GPT 0.7.4 把 Falcon 评测集做成了内置能力启动服务后评测集自动加载平台里可以直接创建评测任务、跑完看报告、下载 Excel 明细。同时新增 GLM-4.5 支持意味着你可以把 GLM-4.5 作为推理后端接进来用它跑 Falcon 评测看它在可执行率、正确率上的真实表现。这篇就按“升级 → 接模型 → 加载数据集 → 跑评测 → 排错”的顺序把可复制的配置和脚本给你铺开。2. 前置准备TaoToken 统一 Key 通道与 DB-GPT 0.7.4 环境在动手之前先把两件事理清楚模型服务从哪来DB-GPT 环境怎么升。模型服务这块我建议用 TaoToken 做统一入口。它的价值在于你不需要为每个模型单独维护一套 Key 和 Base URLGLM-4.5 也好、其他模型也好都走同一个 API 通道配置项收敛成 Base URL API Key Model ID 三件套。官网入口是 https://taotoken.net/?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewriteutm_content API 地址是 https://taotoken.net/api 这个不加 UTM。API Key 在控制台生成地址是 https://taotoken.net/console/api-keys?utm_sourcetaotoken_aicg_blog_endutm_contentapi_keysutm_campaignrewrite 。DB-GPT 环境升级分两种安装方式。源码安装的话建议用 uv sync 更新依赖Docker 部署的话拉取 0.7.4 对应镜像即可。元数据库升级要特别注意SQLite 默认自动升级表结构MySQL 需要手动执行 DDL。完整 DDL 在 assets/schema/dbgpt.sql版本变更 DDL 在 assets/schema/upgrade 下。比如你从 v0.7.1 升到 v0.7.4执行这条命令mysql -h127.0.0.1 -uroot -p{your_password} assets/schema/upgrade/v0_7_4/upgrade_to_v0.7.4.sql这一步别跳过。我见过有人直接起服务结果评测任务创建时报元数据表字段缺失排查半天才发现是 DDL 没跑。升级完启动 DB-GPT 服务等评测集自动加载完成日志里会出现加载完成的提示大约 1 到 3 分钟。看到那行日志说明 Falcon 数据集已经就位。环境准备好之后接下来就是本篇的核心把 GLM-4.5 通过 TaoToken 接进 DB-GPT然后跑 Falcon 评测。3. 可复制配置GLM-4.5 接入 DB-GPT 与 Falcon 数据集加载这一节给你能直接抄的配置片段。DB-GPT 的模型配置走的是 TOML 文件通常在configs/dbgpt-proxy-glm.toml这类路径下。下面是一个 GLM-4.5 通过 TaoToken 接入的最小配置路径和字段名按 DB-GPT 0.7.4 的约定来# configs/dbgpt-proxy-glm45.toml [system] language zh [models] [[models.llms]] name glm-4.5 provider proxy/openai api_base https://taotoken.net/api api_key sk-你的TaoTokenKey model_name glm-4.5 [[models.embeddings]] name text-embedding-3-small provider proxy/openai api_base https://taotoken.net/api api_key sk-你的TaoTokenKey model_name text-embedding-3-small这里三件套要写全Base URL 是https://taotoken.net/apiAPI Key 是你在控制台生成的那串Model ID 是glm-4.5。provider 用proxy/openai是因为 TaoToken 走的是 OpenAI 兼容协议DB-GPT 里这个 provider 能直接对接。如果你用的是其他模型只改model_name就行Base URL 和 Key 不用动这就是统一通道的好处。配置写好后启动服务时指定这个配置文件python dbgpt/app/dbgpt_server.py --config configs/dbgpt-proxy-glm45.tomlFalcon 数据集的加载0.7.4 版本是自动的。服务启动后评测模块会去拉取并安装评测数据集同时把数据映射到数据库中。你不需要手动写加载脚本但如果你想确认数据集是否加载成功可以查一下元数据库里的评测相关表或者直接在平台界面上看“查看数据集详情”按钮是否可点。点进去能看到 Falcon 的数据表、字段、样例数据说明加载没问题。如果你要做更细的控制比如只加载部分数据集可以看assets/schema下的评测集安装配置。不过大多数场景下默认自动加载就够了。这里提醒一句评测集加载依赖数据库连接正常如果你的 MySQL 连接配置有问题加载会静默失败所以启动后务必确认那行加载完成日志。配置和数据集都就位后下一步就是创建评测任务、跑起来看结果。4. 验证请求创建 Falcon 评测任务并读取可执行率与正确率评测任务在 DB-GPT 平台界面上创建步骤不复杂但有几个点容易踩。第一步点“创建评测”按钮。第二步输入任务名称选择评测模型列表——这里选你刚接入的glm-4.5。第三步提交任务。提交后任务进入执行队列评测耗时较长因为 500 道题要逐条跑 Text2SQL 再比对。你可以先去干别的回来再看状态。等状态变成“已完成”点“查看详情”看评测报告。报告里几个关键指标要盯住指标名称计算公式说明可执行率语法正确样本数 / 总样本数生成的 SQL 语法正确且能在数据库中执行的比例正确率语义正确样本数 / 总样本数生成的 SQL 语法正确且语义正确的比例报告还会按轮次、按模型展示执行题目数、正确题目数、错误题目数、失败题目数以及可执行率、正确率的可视化柱状图。这里要区分三个概念正确题目是模型回答对了错误题目是 SQL 语法正确但语义不对失败题目一般是语法和语义都不对。这三个数加起来应该等于总题目数如果对不上说明有题目执行异常要去 Excel 明细里查。点“下载评测结果”能拿到 Excel 详细报告里面用不同 Sheet 展示 LLM 执行详情和评测对比结果。我习惯先看汇总 Sheet 的可执行率和正确率再切到明细 Sheet 看具体哪些题错了。错误题目的 SQL 和标准 SQL 并排看能快速定位是模型理解偏了还是 Schema 标注没吃透。如果你想用 API 方式创建评测任务DB-GPT 提供了 Text2SQL 评测 API。调用方式和普通接口一致走你配置的模型服务。验证请求是否通可以先发一条最简单的对话请求确认 GLM-4.5 能正常返回再跑评测。模型对话入口在 https://taotoken.net/chat?utm_sourcetaotoken_aicg_blog_endutm_contentchatutm_campaignrewrite 可以先用它确认 Key 和模型 ID 没问题。跑完一轮评测你手里就有了一份 GLM-4.5 在 Falcon 上的真实成绩单。接下来如果结果不理想或者过程中报错看下一节的排查清单。5. 常见报错排查401、local proxy failed、reading choices、OAuth评测跑不起来八成是下面这几类错。我按真实报错信息给你对照。401 UnauthorizedKey 不对或没带上。检查 TOML 里api_key是不是sk-开头那串有没有多余空格。TaoToken 的 Key 在控制台生成地址是 https://taotoken.net/console/api-keys?utm_sourcetaotoken_aicg_blog_endutm_contentapi_keysutm_campaignrewrite 。如果 Key 刚生成确认没有复制漏字符。另外确认api_base写的是https://taotoken.net/api不是首页地址。local proxy failed / connection refusedDB-GPT 连不上模型服务。先确认网络能通https://taotoken.net/api再确认服务启动时加载的配置文件路径对不对。如果你改了 TOML 但启动命令没指定--configDB-GPT 会用默认配置你的 GLM-4.5 根本没生效。这种情况日志里通常能看到模型列表里没有glm-4.5。reading choices 相关报错一般是响应体解析失败。常见原因是provider写错了比如写成了proxy/glm而不是proxy/openai。TaoToken 走 OpenAI 兼容协议provider 必须是proxy/openai。另外确认model_name和实际请求的 Model ID 一致写错模型名有时不会报 404而是返回一个空 choices解析时就炸了。OAuth / 认证流程报错如果你用的是 Codex 或 Claude Code 这类带 OAuth 的工具链注意它们和 DB-GPT 的模型配置是两套东西。DB-GPT 评测用的是 TOML 里的 API Key不走 OAuth。如果你在 DB-GPT 里看到 OAuth 相关报错检查是不是误配了某个需要 OAuth 的 provider。正确做法是统一用proxy/openai TaoToken Key。评测任务一直排队 / 不执行检查元数据库 DDL 是否升级到位。MySQL 用户如果没跑upgrade_to_v0.7.4.sql评测任务表可能缺字段任务创建了但调度不起来。另外确认评测集加载完成日志已出现没加载完就创建任务会找不到数据集。可执行率正常但正确率极低这不是报错是模型能力问题。先看错误题目里是不是集中在 hard 难度。Falcon 的 hard 题有 219 道涉及嵌套 CTE、窗口函数、多意图疑问句对模型要求高。可以先用 easy 题跑一轮确认链路没问题再上全量。排查完这些链路基本就通了。最后说下长期跑评测和 Agent 场景的接入方式。6. 长期评测与 Agent 接入用 Coding Plan 把 GLM-4.5 通道固定下来如果你只是偶尔跑一次 Falcon 评测按上面的配置就够了。但如果你要把 Text2SQL 评测做成常态化或者基于 DB-GPT 搭 Agent 做数据问答那模型通道的稳定性就很关键。频繁换 Key、换 Base URL配置容易散落各处排查成本高。我的做法是把 TaoToken 作为固定通道GLM-4.5 作为固定推理后端配置收敛到一份 TOML 里。这样无论你跑 Falcon 评测、还是接 DB-GPT 的 ChatExcel、或者做自定义 Agent都复用同一套 Base URL Key Model ID。长期编码和 Agent 场景可以看 Coding Plan地址是 https://taotoken.net/coding-plan?utm_sourcetaotoken_aicg_blog_endutm_contentcoding_planutm_campaignrewrite 它适合需要持续调用模型服务的开发场景。接入文档在 https://taotoken.net/doc?utm_sourcetaotoken_aicg_blog_endutm_contentdocutm_campaignrewrite 里面有各语言、各框架的接入示例。Claude Code 和 Anthropic 相关接入看 https://taotoken.net/claudecode-anthropic?utm_sourcetaotoken_aicg_blog_endutm_contentclaudecodeutm_campaignrewrite 。API Keys 管理还是那个地址https://taotoken.net/console/api-keys?utm_sourcetaotoken_aicg_blog_endutm_contentapi_keysutm_campaignrewrite 。回到 DB-GPT 0.7.4 本身这次更新里 Falcon 数据集和 GLM-4.5 支持是两条主线。Falcon 给了你一把尺子GLM-4.5 给了你一个可选的推理后端TaoToken 把后端接入的配置成本压到最低。三者串起来就是一套可复现的 Text2SQL 评测流水线升级环境 → 配 TOML → 起服务 → 等数据集加载 → 创建评测 → 看报告 → 按错误明细调优。跑通一轮之后你会对“模型到底行不行”有个数而不是靠感觉。
返回列表