跳到主要内容
版本:v2.6.x

Lowercase

lowercase 过滤器将 Tokenizer(分词器)生成的 Token(词元)转换为小写,使搜索不区分大小写。例如,它可以将 ["High", "Performance", "Vector", "Database"] 转换为 ["high", "performance", "vector", "database"]

配置

lowercase 过滤器内置于 Milvus。要使用它,只需在 analyzer_params 中的 filter 部分指定其名称即可。

Python
analyzer_params = {
"tokenizer": "standard",
"filter": ["lowercase"],
}

lowercase 过滤器对 Tokenizer(分词器)生成的 Token(词元)进行操作,因此必须与 Tokenizer 结合使用。

定义 analyzer_params 后,您可以在定义 Collection Schema 时将其应用到 VARCHAR 字段。这样,Milvus 就可以使用指定的分析器对该字段中的文本进行处理,从而实现高效的标记化和过滤。有关详情,请参阅 示例使用

示例

在将分析器配置应用到 Collection Schema 之前,请使用 run_analyzer 方法验证其行为。

Analyzer 配置

Python
analyzer_params = {
"tokenizer": "standard",
"filter": ["lowercase"],
}

验证使用 run_analyzer

Python
from pymilvus import (
MilvusClient,
)

client = MilvusClient(uri="http://localhost:19530")

# Sample text to analyze
sample_text = "The Lowercase Filter Ensures Uniformity In Text Processing."

# Run the standard analyzer with the defined configuration
result = client.run_analyzer(sample_text, analyzer_params)
print("Standard analyzer output:", result)

预期输出

Python
['the', 'lowercase', 'filter', 'ensures', 'uniformity', 'in', 'text', 'processing']