30

我刚开始使用词性标注器,我面临很多问题。

我开始使用以下内容进行 POS 标记:

import nltk
text=nltk.word_tokenize("We are going out.Just you and me.")

当我想打印'text'时,会发生以下情况:

print nltk.pos_tag(text)
Traceback (most recent call last):
File "<stdin>", line 1, in <module>
File "F:\Python26\lib\site-packages\nltk\tag\__init__.py", line 63, in pos_tag
tagger = nltk.data.load(_POS_TAGGER)
File "F:\Python26\lib\site-packages\nltk\data.py", line 594, in load
resource_val = pickle.load(_open(resource_url))
File "F:\Python26\lib\site-packages\nltk\data.py", line 673, in _open
 return find(path).open()
 File "F:\Python26\lib\site-packages\nltk\data.py", line 455, in find
   raise LookupError(resource_not_found)`  
LookupError:
 Resource 'taggers/maxent_treebank_pos_tagger/english.pickle' not
 found.  Please use the NLTK Downloader to obtain the resource:

>>> nltk.download().

 Searched in:
    - 'C:\\Documents and Settings\\Administrator/nltk_data'
    - 'C:\\nltk_data'
    - 'D:\\nltk_data'
    - 'E:\\nltk_data'
    - 'F:\\Python26\\nltk_data'
    - 'F:\\Python26\\lib\\nltk_data'
    - 'C:\\Documents and Settings\\Administrator\\Application Data\\nltk_data'

我用过nltk.download(),但没有用。

4

7 回答 7

36

NLTK高于 v3.2 的版本,请使用:

>>> import nltk
>>> nltk.__version__
'3.2.1'
>>> nltk.download('averaged_perceptron_tagger')
[nltk_data] Downloading package averaged_perceptron_tagger to
[nltk_data]     /home/alvas/nltk_data...
[nltk_data]   Package averaged_perceptron_tagger is already up-to-date!
True

对于NLTK使用旧 MaxEnt 模型的版本,即 v3.1 及以下版本,请使用:

>>> import nltk
>>> nltk.download('maxent_treebank_pos_tagger')
[nltk_data] Downloading package maxent_treebank_pos_tagger to
[nltk_data]     /home/alvas/nltk_data...
[nltk_data]   Package maxent_treebank_pos_tagger is already up-to-date!
True

有关默认更改的更多详细信息pos_tag,请参阅https://github.com/nltk/nltk/pull/1143

于 2016-06-06T07:01:47.337 回答
31

当您输入nltk.download()Python 时,会自动显示 NLTK 下载器界面。
单击模型并选择 maxent_treebank_pos_。它会自动安装。

import nltk 
text=nltk.word_tokenize("We are going out.Just you and me.")
print nltk.pos_tag(text)
[('We', 'PRP'), ('are', 'VBP'), ('going', 'VBG'), ('out.Just', 'JJ'),
 ('you', 'PRP'), ('and', 'CC'), ('me', 'PRP'), ('.', '.')]
于 2011-12-22T04:43:48.170 回答
5

从外壳/终端,您可以使用:

python -m nltk.downloader maxent_treebank_pos_tagger

(在 Linux 上可能需要 sudo)

它将安装maxent_treebank_pos_tagger(即 NLTK 中的标准树库 POS 标记器)并解决您的问题。

于 2015-09-16T05:47:41.087 回答
1
import nltk
text = "Obama delivers his first speech."

sent  =  nltk.sent_tokenize(text)


loftags = []
for s in sent:
    d = nltk.word_tokenize(s)   

    print nltk.pos_tag(d)

结果 :

akshayy@ubuntu:~/summ$ python nn1.py [('Obama', 'NNP'), ('delivers', 'NNS'), ('his', 'PRP$'), ('first', ' JJ'), ('speech', 'NN'), ('.', '.')]

(我刚刚问了另一个问题,该代码在哪里使用)

于 2013-04-04T19:18:27.657 回答
1
nltk.download()

单击模型并选择 maxent_treebank_pos_。它会自动安装。

import nltk 
text=nltk.word_tokenize("We are going out.Just you and me.")
print nltk.pos_tag(text)
[('We', 'PRP'), ('are', 'VBP'), ('going', 'VBG'), ('out.Just', 'JJ'),
 ('you', 'PRP'), ('and', 'CC'), ('me', 'PRP'), ('.', '.')]
于 2013-08-13T13:40:55.253 回答
0

如果 nltk 版本是 3.4.5,请执行以下操作:

import nltk
nltk.download('averaged_perceptron_tagger')

要检查您的 nltk 版本,请执行以下操作:

print (nltk.__version__)
于 2019-10-29T12:00:34.650 回答
0

我正在使用 Google Colab,并且当前版本的 NLTK 是3.2.5截至今天的。

这对我有用。

import nltk
nltk.download('punkt')
nltk.download('averaged_perceptron_tagger')
from nltk.tokenize import word_tokenize

text = word_tokenize("Hello welcome to the world of to learn Categorizing and POS Tagging with NLTK and Python")
nltk.pos_tag(text)
于 2021-09-30T14:39:43.713 回答