Token 词元查看器

使用 GPT 系列分词器(OpenAI tiktoken:cl100k_base、o200k_base 等)把文本切分成词元。 可查看 Token 数量与每个词元的 ID / 字节,也支持按 Token ID 反查词元和区间浏览词表。 词表在浏览器本地加载,文本不上传服务器。

分词器(词元编码表)

正在加载 cl100k_base 词表(≈2 MB)…

加载词表后显示结果…

说明

  • 采用 OpenAI tiktoken 的字节级 BPE 分词器,与 GPT 系列模型实际计费的 Token 数一致。
  • 许多词元是「不完整的字节序列」(一个汉字常被切成多个词元),单独解码会显示为 �,此时可看「字节」列的原始字节。
  • 不同模型用不同词表:GPT-4o/o 系列/GPT-4.1/GPT-5 用 o200k_base,GPT-4/3.5 用 cl100k_base。
  • 词表首次加载需下载 1–4 MB,之后缓存;全部在浏览器本地完成,文本不上传。