Token
Token 是 AI 处理文字的最小单位
AI 分词
ChatGPT 使用的分词方法叫 BPE(Byte Pair Encoding,字节对编码)。
原理:想象你有一本厚厚的英文书。你从所有单个字母开始,然后统计哪两个字母最经常连在一起出现——假设是 “t” 和 “h”。于是你把它们合并成一个新的符号 “th”。然后继续找下一个最频繁的组合,比如 “th” 和 “e” 合并成 “the”。如此反复,常见的组合不断合并成更长的”碎片”。
最终的结果是:常见的词会保持完整(比如 “the””is””Hello”),而不常见的词会被拆成几个常见的碎片——就像 “unhappiness” 被拆成 “un”(一个常见的前缀)和 “happiness”(一个常见的词)。
词向量
词向量(Word Vector,也叫 Word Embedding,”词嵌入”)。
词向量,就是用一串数字来代表一个词的含义。
余弦相似度
测量两个向量方向接近程度的方法叫余弦相似度(Cosine Similarity)。它衡量的是两个向量之间的夹角——夹角越小,方向越接近,余弦值越大。