NLP
nltk & transformers API Reference
结合 NLTK 的经典文本处理能力与 Hugging Face Transformers 的预训练模型能力。
By EZ4Code Team
NLP Toolkit
分词、词性标注、命名实体识别与预训练模型推理的核心 API。
nltk.word_tokenize(text)将文本切分为单词级别的 token 列表。
Returns: list[str] — 词法单元列表
nltk.pos_tag(tokens)对词法单元进行词性标注。
Returns: list[tuple[str, str]] — (词, 词性) 列表
nltk.ne_chunk(tagged)对已标注词性的文本进行命名实体识别。
Returns: Tree — 命名实体语法树
nltk.sent_tokenize(text)将文本切分为句子列表。
Returns: list[str] — 句子列表
nltk.corpus.stopwords.words(lang)返回指定语言的停用词列表。
Returns: list[str] — 停用词列表
AutoTokenizer.from_pretrained(name)按模型名加载 Hugging Face 预训练分词器。
Returns: PreTrainedTokenizer — 分词器实例
AutoModel.from_pretrained(name)按模型名加载 Hugging Face 预训练模型。
Returns: PreTrainedModel — 预训练模型实例
pipeline(task)创建端到端推理流水线,封装分词、模型与后处理。
Returns: Pipeline — 推理流水线对象