ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

AI Agent_10 Token 到底是什么、怎么来的、为什么这么重要

AI Agent_10 Token 到底是什么、怎么来的、为什么这么重要 一、什么是 Token先建立直觉Token词元 大模型处理语言时的最小单位。它既不是 字也不完全是 词而是分词器Tokenizer从文本里切出来的 小块。示例我喜欢 AI 可能被切成 3 个 token[我][喜欢][AI]。也可能切得更碎[我][喜][欢][A][I]—— 取决于分词器和词表。单位例子说明字符猫 是 1 个字符人眼的最小单元词喜欢 是 1 个词语言的最小语义单元字节汉字 UTF-8 占 3 字节计算机的存储单元Token喜欢 可能是 1 个 token模型的处理单元关键认知模型看不懂字、词、句子 —— 它只看得懂一串 token ID。你输入的每一句话都会被先切成 token、转成 ID才进入模型。所以Token 是 AI 世界的 字数 单位聊天、计费、限长、提速全部围着它转。二、为什么要分词为什么不能直接用 词 或 字模型只认数字神经网络的计算对象是向量而向量是从 词表vocabulary查出来的。所以第一步必须把文本映射成词表里的编号。那直接按 整词 分不行吗有三个致命问题词表爆炸英语有几百万个词形walk、walks、walking、walked……词表塞不下生僻词和新词Qwen2.5、ChatGPT 这种词表里没有直接整词切分就只能 不认识跨语言中文、英文、日文的 词 长得完全不一样一个词表很难统一。按 字符 分呢也不行 —— 英文单个字母几乎没有语义c-a-t 三个字母拆开谁也看不懂 猫而且序列太长、效率低。折中方案子词Subword—— 把词拆成 比词小、比字符大 的块高频词整体保留the、喜欢生僻词拆成已知子词unbelievable→unbelievable。这个 切块规则 就是分词器最主流的算法叫 BPE。三、BPE 到底怎么工作BPEByte Pair Encoding字节对编码分两步先 学 词表再用词表 切 文本。下面看完整机理图BPE 的机理分两个阶段训练阶段学词表把语料先拆到单字符然后反复统计 哪两个相邻单元出现次数最多把最高频的一对合并成一个新 token加入词表。重复成千上万次比如合并到词表有 5 万20 万个 token。编码阶段切文本用学到的词表对新文本做贪心最长匹配—— 从左到右尽量匹配最长的已知 token匹配不了就拆小。为什么这个设计很妙高频词the、喜欢、AI整体保留 → 序列短、效率高生僻词 / 新词拆成已知子词 → 永远不会 不认识这是模型能理解ChatGPT、豆包这类新词的底层原因词表大小可控 → 模型输出层的计算量可控输出层要给每个 token 打分。四、Token 的完整生命周期一个 token 从 字 到 向量 再到 生成的字要走完全程生命周期要点输入侧文字 → 分词 → token ID → 查表得向量 → 进 Transformer输出侧模型对词表里每个 token几万到几十万个打分 → Softmax 概率 → 采样选一个 → 反分词变成可读的字 → 拼回输入继续循环循环一次回答 成千上万次 选 token所以 token 越多回答越慢、越贵。五、中文用户特别关心的中英文 token 差异从上面的图能看到右侧面板英文一个词常拆成 1~3 个子词Hello World≈ 2~4 token中文一个汉字常占 1~2 token视分词器而定你好世界≈ 2~4 token同样语义的内容中文往往比英文消耗更多 token示意100 词英文 ≈ 130 token100 字中文 ≈ 160~220 token。为什么会这样英文单词由字母组成子词系统天然 兼容 拼写而汉字表意密度极高词表要容纳上万个常用字分词器要么 一字一 token占得多要么把常用双字词你好、喜欢合成一个 token省一些。不同模型的中文分词效率差异很大 —— 有的 1 字 1 token有的 1 字≈1.5~2 token。实际影响计费同样的对话中文版可能比英文版贵按 token 计费时窗口中文内容更快占满上下文窗口提示词设计中文提示词要更精简 —— 这也是提示词工程里 边界、精简 要求对中文用户更重要的原因。六、为什么 Token 对你这么重要三个实际价值计费几乎所有大模型 API 都按 token 计费输入 输出都算。示例一次 提问 200 token 回答 800 token 的调用 1000 token。省 token 就是省钱 ——把提示词写精简、把输出长度约束住都能直接省钱。窗口上下文窗口是 能装多少 token。128K token 大约能装 9 万多个英文单词、约 8~15 万汉字示意视分词器。超出就被截断 —— 所以长文档要 分块 RAG而不是硬塞。速度模型每秒只能生成有限个 token示意 20~100。长回答 等更久打字机效果 的每一 蹦就是一个 token。七、常见误区与细节新手必看1 token 1 个汉字 / 1 个英文单词—— 错。可能是 0.5 个字也可能是 2 个字空格、标点、大小写也占 token。示例英文 dont 常被拆成dont两个 token。数字常被拆123456可能被拆成123456视分词器这就是模型大数运算容易出错的原因之一。特殊 token 真实存在BOS开始、EOS结束、PAD补齐、UNK未知等是词表里的 系统角色不出现在人看的文本里。代码非常耗 token编程语言的符号密集{、;、-同样行数代码的 token 数远多于自然语言。多模态也讲 token图像被切成 patch 后每个 patch 是 视觉 token一张 1024×1024 图可能折算成上千 token音频用码本量化成 音频 token。多模态模型的计费和窗口同样按 token 算——图比字贵 就是这么来的。推理模型的 思考 也耗 token模型先输出一长串内部推理思维链再给答案 —— 这些思考内容同样计费、同样占时间。动手实验建议用在线 tokenizer 工具如 OpenAI 的 Tokenizer 页面、各模型官方工具实测同一句话的中英文 token 数立刻能体会 为什么中文更贵。一句话总结Token 是大模型处理语言的最小单位由分词器主要是 BPE从 字符 高频合并 中生成它贯穿输入编码、输出生成、计费、窗口、速度的全过程对中文用户而言中文更耗 token 直接关系到成本和体验 ——理解 token你就掌握了 AI 世界的 度量衡。
返回列表