Skip to content

Token

Token 是 AI 处理文字的最小单位

AI 分词

ChatGPT 使用的分词方法叫 BPE(Byte Pair Encoding,字节对编码)。

原理:想象你有一本厚厚的英文书。你从所有单个字母开始,然后统计哪两个字母最经常连在一起出现——假设是 “t” 和 “h”。于是你把它们合并成一个新的符号 “th”。然后继续找下一个最频繁的组合,比如 “th” 和 “e” 合并成 “the”。如此反复,常见的组合不断合并成更长的”碎片”。

最终的结果是:常见的词会保持完整(比如 “the””is””Hello”),而不常见的词会被拆成几个常见的碎片——就像 “unhappiness” 被拆成 “un”(一个常见的前缀)和 “happiness”(一个常见的词)。

词向量

词向量(Word Vector,也叫 Word Embedding,”词嵌入”)。

词向量,就是用一串数字来代表一个词的含义。

余弦相似度

测量两个向量方向接近程度的方法叫余弦相似度(Cosine Similarity)。它衡量的是两个向量之间的夹角——夹角越小,方向越接近,余弦值越大。

参考

AI是怎么回事:AI怎么读懂文字——国王减去男人等于什么 - 我没有三颗心脏的博客

亲手创建自己所需的软件,是程序员的幸运。