Skip to content
NLP

nltk & transformers API Reference

结合 NLTK 的经典文本处理能力与 Hugging Face Transformers 的预训练模型能力。

By EZ4Code Team

NLP Toolkit

分词、词性标注、命名实体识别与预训练模型推理的核心 API。

nltk.word_tokenize(text)

将文本切分为单词级别的 token 列表。

Returns: list[str] — 词法单元列表

nltk.pos_tag(tokens)

对词法单元进行词性标注。

Returns: list[tuple[str, str]] — (词, 词性) 列表

nltk.ne_chunk(tagged)

对已标注词性的文本进行命名实体识别。

Returns: Tree — 命名实体语法树

nltk.sent_tokenize(text)

将文本切分为句子列表。

Returns: list[str] — 句子列表

nltk.corpus.stopwords.words(lang)

返回指定语言的停用词列表。

Returns: list[str] — 停用词列表

AutoTokenizer.from_pretrained(name)

按模型名加载 Hugging Face 预训练分词器。

Returns: PreTrainedTokenizer — 分词器实例

AutoModel.from_pretrained(name)

按模型名加载 Hugging Face 预训练模型。

Returns: PreTrainedModel — 预训练模型实例

pipeline(task)

创建端到端推理流水线,封装分词、模型与后处理。

Returns: Pipeline — 推理流水线对象

More NLP API References