Lowercase
小写过滤器将 Tokenizer(分词器)生成的 Token(词元)转换为小写,使搜索不区分大小写。例如,它可以将["高"、"性能"、"向量"、"数据库"]转换为["高"、"性能"、"向量"、"数据库"]。
ASCII Folding
asciifolding 过滤器可将基本拉丁统一码块(前 127 个 ASCII 字符)以外的字符转换为其 ASCII 对应字符。例如,它能将 í 等字符转换为 i,使文本处理更简单、更一致,特别是对于多语言内容。
Arabic Normalization
arabic_normalization filter 会规范化阿拉伯字母变体,并移除阿拉伯语变音符和 Tatweel。
Decimal Digit
decimaldigit filter 会将 Unicode 十进制数字转换为 ASCII 数字。
Alphanumonly
alphanumonly 过滤器会删除包含非 ASCII 字符的标记,只保留字母数字术语。该过滤器适用于处理只有基本字母和数字的文本,不包括任何特殊字符或符号。
Cnalphanumonly
cnalphanumonly 过滤器会删除包含除汉字、英文字母或数字以外的任何字符的标记。
Cncharonly
cncharonly 过滤器会删除包含任何非中文字符的标记。当您只想关注中文文本,过滤掉任何包含其他文字、数字或符号的标记时,这个过滤器就非常有用了。
Pinyin
pinyin filter 会在文本分析期间将中文字符 token 转换为 Pinyin token,从而支持基于 Pinyin 匹配中文文本。
Length
长度过滤器可移除不符合指定长度要求的标记,从而控制文本处理过程中保留的标记长度。
Stop
在分析过程中,使用停顿过滤器从标记化文本中删除配置的停用词。
Decompounder
使用反编译筛选器,用内联字典或注册文件资源拆分复合词。
Stemmer
词干过滤器将单词还原为其基本形式或词根形式(称为词干化),从而更容易匹配不同词性中含义相似的单词。词干过滤器支持多种语言,可在各种语言环境中进行有效搜索和索引。
Remove Punct
removepunct 过滤器会去掉一些 Tokenizer(分词器)(如 jieba、Lindera 和 icu)通常会保留的标点符号、空格和换行符。当你想要一个更干净的标记流,只包含有意义的文本标记,不含逗号、句号和其他标点符号时,就可以使用它。
Regex
regex 过滤器是一种正则表达式过滤器:令牌生成器生成的任何令牌只有在与您提供的表达式相匹配时才会被保留,否则都会被丢弃。
Synonym
在文本分析过程中,使用同义词过滤器用同义词词典重写标记。