python - TypeError：将 xml 格式的维基百科处理为文本格式

翻译自：https://stackoverflow.com/questions/37663942 2016-06-06T17:58:29.163

73 次

我正在学习 Python，主要用于文本挖掘，遵循 ( http://textminingonline.com/training-word2vec-model-on-english-wikipedia-by-gensim ) 的指导。我想从 api 返回的 xml 中提取维基百科英文文本。但是，会出现错误：

print(globals()['__doc__'] %locals())
TypeError: unsupported operand type(s) for %: 'NoneType' and 'dict'".

任何人都可以就如何解决这个问题提供任何提示吗？我需要用文件的地址替换outpand吗？inp

提前致谢。我附上了代码：

import os
import logging
import sys

from gensim.corpora import WikiCorpus

if __name__=='__main__':

    program = os.path.basename(sys.argv[0])
    logger = logging.getLogger(program)

    logging.basicConfig(format='%(asctime)s: %(levelname)s: %(message)s')
    logging.root.setLevel(level=logging.INFO)


    if len(sys.argv) < 3:
        print(globals()['__doc__'] %locals())
        sys.exit(1)

    inp, outp = sys.argv[1:3]
    space = ' '
    i = 0

    output = open(outp, 'w')
    wiki = WikiCorpus(inp, lemmatize=False, dictionary={})
    for text in wiki.get_texts():
        output.write(space.join(text) + '\n')
        i = i + 1
        if i % 10000 == 0:
            logger.info('Saved ' + str(i) + ' articles')

    output.close()
    logger.info('Finished ' + str(i) + ' articles')

python - TypeError：将 xml 格式的维基百科处理为文本格式

0 回答 0

Related

Reference