Standard Tokenizer
Milvus 中的标准 Tokenizer 根据空格和标点符号分割文本,因此适用于大多数语言。
Whitespace
只要单词之间有空格,空白 Tokenizer(分词器)就会将文本划分为术语。
Jieba
Jieba Tokenizer(分词器)通过将中文文本分解为单词来进行处理。
Lindera
lindera Tokenizer(分词器)执行基于字典的形态分析。对于日语、韩语和汉语等单词不以空格分隔的语言,它是一个不错的选择。
ICU
icu tokenizer 基于 Unicode 国际化组件(ICU)开源项目开发,该项目为软件国际化提供了关键工具。通过使用 ICU 的分词算法,令牌生成器可以准确地将世界上大多数语言的文本分割成单词。