Standard Tokenizer
Milvus 中的标准 Tokenizer 根据空格和标点符号分割文本,因此适用于大多数语言。
Whitespace
只要单词之间有空格,空白 Tokenizer(分词器)就会将文本划分为术语。
Jieba
Jieba Tokenizer(分词器)通过将中文文本分解为单词来进行处理。
Lindera
lindera tokenizer 可进行基于词典的词形分析。它专为日语和韩语设计,在这两种语言中,单词之间没有空格分隔,语法标记(微粒)直接附着在单词上。
ICU
icu tokenizer 基于 Unicode 国际化组件(ICU)开源项目开发,该项目为软件国际化提供了关键工具。通过使用 ICU 的分词算法,令牌生成器可以准确地将世界上大多数语言的文本分割成单词。
Language Identifier
语言识别器(language_identifier)是一个专门的 Tokenizer(分词器),旨在通过自动语言分析过程来增强 Milvus 的文本搜索功能。它的主要功能是检测文本字段的语言,然后动态应用最适合该语言的预配置分析器。这对于处理多种语言的应用程序来说尤为重要,因为它消除了按输入手动分配语言的需要。